Zmienne zakłócające potrafią stworzyć przekonującą zależność tam, gdzie porównywane grupy różnią się jeszcze czymś istotnym. Nie wystarczy jednak wrzucić do regresji wszystkich kolumn z arkusza. Najpierw trzeba opisać założony mechanizm, ustalić kolejność zdarzeń i odróżnić czynnik zakłócający od mediatora, kolidera oraz zwykłego predyktora.
Czym jest zmienna zakłócająca
Zakłócenie występuje wtedy, gdy część obserwowanej relacji między ekspozycją lub predyktorem X a wynikiem Y wynika z trzeciego czynnika C. Typowy kandydat na confounder poprzedza X, wiąże się z X i wpływa na Y, ale nie jest skutkiem X. Przykładowo wiek może różnić grupy korzystające z dwóch sposobów pracy i jednocześnie wpływać na tempo wykonania zadania.
↘
→
↘
Strzałki opisują założenia o kierunku wpływu, nie dowody uzyskane z samej korelacji.
Zobacz, jak wynik surowy może wprowadzać w błąd
Poniższy przykład porównuje skuteczność metod A i B. Trudność zadań jest nierówno rozłożona między metodami, a jednocześnie silnie wpływa na wynik. Kliknij oba widoki i porównaj odpowiedź zbiorczą z odpowiedziami w warstwach.
Ten sam zbiór, dwa różne wnioski
Metoda A częściej trafiała na trudne zadania. Metoda B — na łatwe.
Uruchom widok, aby porównać metody.
Potem sprawdź warstwy trudności i zobacz, skąd bierze się różnica.
W agregacie metoda B wygląda lepiej: 82,6% wobec 78,0%. Po rozdzieleniu zadań okazuje się jednak, że A ma wyższą skuteczność zarówno w łatwych, jak i trudnych przypadkach. To demonstracja paradoksu Simpsona, a nie automatyczny test na zakłócenie. W realnym badaniu warstwy trzeba uzasadnić wiedzą dziedzinową i planem analizy.
Nie każda trzecia zmienna jest confounderem
Może być wspólną przyczyną X i Y. Wymaga rozważenia przed analizą.
Leży na drodze od X do Y. Kontrola zmienia pytanie i może usunąć część efektu.
Jest następstwem X i innego czynnika. Warunkowanie może dopiero wytworzyć błąd.
Dlatego lista zmiennych powinna wynikać z operacjonalizacji zmiennych i diagramu założeń, a nie z automatycznej selekcji według wartości p. Pomocny będzie też osobny poradnik o modelu badawczym i strzałkach na schemacie.
Jak rozpoznać kandydatów przed zebraniem danych
- Zdefiniuj X i Y.Jednoznacznie zapisz, jaki efekt lub związek próbujesz oszacować.
- Narysuj poprzedniki.Wypisz czynniki, które mogły powstać wcześniej i wpływać na obie strony relacji.
- Sprawdź czas.Jeśli zmienna jest skutkiem X, nie jest zwykłym confounderem dla efektu X na Y.
- Uzasadnij literaturą.Każda strzałka potrzebuje podstawy merytorycznej, nie tylko korelacji w Twoim pliku.
- Ustal pomiar.Zmienna źle zmierzona może pozostawić zakłócenie resztkowe mimo korekty.
Jak kontrolować zakłócenie w projekcie i analizie
Randomizacja, ograniczenie populacji, dopasowanie i staranny dobór próby mogą zmniejszyć nierównowagę, lecz każdy wybór zmienia zakres wniosków.
Rozwarstwienie, standaryzacja i model wielozmiennowy pozwalają porównać wyniki po uwzględnieniu wskazanych czynników.
Pokaż, które czynniki kontrolowano, dlaczego je wybrano, jak je zmierzono oraz czym różnią się wyniki surowe i skorygowane.
Jeżeli używasz modelu wielozmiennowego, zobacz również instrukcję regresji liniowej w pracy dyplomowej. Samo dodanie zmiennej do modelu nie naprawia błędu pomiaru, selekcji ani złej kolejności przyczynowej. W badaniu z przydziałem do warunków część problemów ogranicza poprawnie zaplanowany eksperyment z grupą kontrolną.
Wzór opisu do metodologii
Przed analizą wskazano potencjalne czynniki zakłócające na podstawie literatury i diagramu zakładanych relacji. Dla związku między [X] i [Y] uwzględniono [C1, C2], ponieważ czynniki te poprzedzały ekspozycję, mogły wpływać na wynik i różniły się między porównywanymi grupami. Przedstawiono oszacowanie surowe oraz model skorygowany. Zmiennych [M] nie traktowano jako confounderów, ponieważ uznano je za możliwe mediatory. Wyniki interpretowano jako związki warunkowe, bez utożsamiania korekty statystycznej z dowodem przyczynowości.
W dyskusji nazwij także czynniki niezmierzone lub zmierzone niedokładnie. Możesz połączyć ten fragment z poradnikiem o ograniczeniach badania, ale nie przenoś tam całej logiki doboru zmiennych.
Najczęstsze błędy
- Nazywanie confounderem każdej zmiennej skorelowanej z wynikiem.
- Dobór korekt wyłącznie na podstawie istotności statystycznej w tej samej próbie.
- Kontrolowanie mediatora i interpretowanie wyniku jako całkowitego efektu X.
- Kontrolowanie kolidera, co może otworzyć nową nieprzyczynową ścieżkę.
- Pomijanie kolejności czasowej i jakości pomiaru.
- Raportowanie tylko modelu skorygowanego bez pokazania, co zmieniła korekta.










