Regresja logistyczna jest właściwa wtedy, gdy wynik ma dwa stany, na przykład ukończył–nie ukończył, kupił–nie kupił albo wystąpiło–nie wystąpiło. Model nie przewiduje wartości na zwykłej prostej. Szacuje, jak predyktory zmieniają szanse zdarzenia, a następnie przelicza je na prawdopodobieństwo od 0 do 1.
W tym poradniku wykonasz binarną regresję logistyczną w Jamovi, odczytasz iloraz szans, przedział ufności i jakość modelu oraz przygotujesz zapis do pracy. Jeśli wynik jest ciągły, właściwy będzie poradnik o regresji liniowej w Jamovi.
→
→
Kiedy wybrać regresję logistyczną
Zmienna zależna musi mieć dwa rozłączne poziomy. Może to być odpowiedź tak–nie, status zaliczenia, rezygnacja z usługi albo obecność zjawiska. Predyktory mogą być ilościowe lub kategorialne. Jeśli wynik ma trzy uporządkowane poziomy, potrzebujesz regresji porządkowej; jeżeli ma więcej nieuporządkowanych kategorii, regresji wielomianowej.
Każdy przypadek należy do dokładnie jednego z dwóch stanów.
Wiesz, który poziom jest modelowany jako 1 i względem czego interpretujesz OR.
Ten sam uczestnik nie pojawia się wielokrotnie bez modelu uwzględniającego zależność.
Masz wystarczająco dużo zdarzeń i niezdarzeń dla liczby parametrów.
Sam fakt, że dane są zapisane jako 0 i 1, nie wystarcza. Kod musi oznaczać rzeczywiste kategorie, a nie sztuczny podział zmiennej ciągłej. W wyborze rodziny analizy pomaga schemat doboru testu statystycznego.
Co naprawdę oznacza iloraz szans
Jamovi może pokazać współczynnik B w jednostkach logitu oraz jego wykładnik, czyli iloraz szans OR = exp(B). Wartość OR równa 1 oznacza brak zmiany szans. OR większe od 1 oznacza wzrost, a mniejsze od 1 spadek szans modelowanego zdarzenia przy wzroście predyktora o jednostkę, przy pozostałych zmiennych stałych.
Szanse nie są prawdopodobieństwem. OR = 2 nie znaczy automatycznie „prawdopodobieństwo jest dwa razy większe”. Ta sama zmiana szans daje inny przyrost punktów procentowych przy prawdopodobieństwie wyjściowym 10% niż przy 60%.
Jak przygotować dane
Jeden wiersz powinien odpowiadać jednej niezależnej obserwacji. Ustal kod zdarzenia, poziomy referencyjne predyktorów kategorialnych i znaczenie jednej jednostki predyktora ilościowego. Wiek liczony w latach interpretuje się inaczej niż wiek podzielony przez 10.
- Sprawdź braki, liczebność obu kategorii wyniku i puste kombinacje poziomów.
- Nie dziel zmiennej ciągłej na „niski–wysoki” bez mocnego uzasadnienia.
- Rozpoznaj predyktory niemal identyczne i kategorie z bardzo małą liczebnością.
- Zapisz poziom referencyjny przed interpretacją współczynników.
Kontrolę kodów, braków i nietypowych wartości przeprowadź zgodnie z poradnikiem o przygotowaniu danych w Jamovi.
Jak wykonać analizę w Jamovi
- Wybierz Analyses → Regression → 2 Outcomes lub odpowiadającą tej analizie pozycję w polskiej wersji interfejsu.
- Przenieś zmienną binarną do pola Dependent Variable.
- Predyktory ciągłe umieść w Covariates, a kategorialne w Factors.
- Sprawdź poziom referencyjny wyniku i czynników. To on wyznacza kierunek OR.
- Włącz ilorazy szans, 95-procentowe przedziały ufności, test całego modelu i miary dopasowania.
- Jeśli potrzebujesz oceny klasyfikacji, dodaj tabelę klasyfikacji i zapisane prawdopodobieństwa.
Nazwy opcji mogą się różnić Zapisz wersję Jamovi i dokładną ścieżkę analizy. W aktualnej dokumentacji binarna regresja logistyczna znajduje się w grupie Regression jako analiza dla dwóch wyników.
Jak czytać krzywą i wynik modelu
Krzywa logistyczna pokazuje, dlaczego współczynnik ma stały wpływ na logarytm szans, ale nie na liczbę punktów procentowych. Największa zmiana prawdopodobieństwa często pojawia się w środkowej części krzywej. Na krańcach nawet duża zmiana predyktora może niewiele przesunąć prawdopodobieństwo.
Przesuń przypadek po krzywej
Wybierz model, a następnie zmień wartość predyktora. Pulpit obliczy OR i przewidywane prawdopodobieństwo zdarzenia.
B
OR = exp(B)
p dla X
Wynik pojedynczego predyktora czytaj razem z przedziałem ufności. Jeśli przedział dla OR obejmuje 1, dane nie wykluczają braku związku na przyjętym poziomie ufności. Zasady interpretacji przedziałów i wartości p opisuje poradnik o istotności i wielkości efektu.
Jak ocenić dopasowanie i problemy
Najpierw sprawdź, czy model z predyktorami poprawia dopasowanie względem modelu bazowego. Następnie oceń przedziały OR, obserwacje wpływowe, współliniowość i jakość przewidywań. Pseudo-R² nie jest zwykłym odsetkiem wyjaśnionej wariancji i nie należy interpretować go tak jak R² w regresji liniowej.
Możliwa rzadka kategoria, mała próba albo separacja.
Przy niezrównoważonych klasach sam procent klasyfikacji może mylić.
Sprawdź współliniowość, kodowanie i rolę zmiennej kontrolnej.
Próg klasyfikacji nie zastępuje oceny prawdopodobieństw.
W raporcie pokaż również, ile osób weszło do analizy i jak rozkładały się dwa poziomy wyniku. Pomaga w tym poradnik o charakterystyce badanej próby.
Jak opisać wynik w pracy
Podaj modelowane zdarzenie, predyktory, liczebność analizy, test całego modelu, wybrane miary dopasowania oraz OR z przedziałami. Poniższe liczby pokazują formę zapisu, a nie wynik do skopiowania.
Przeprowadzono binarną regresję logistyczną, w której modelowanym zdarzeniem było ukończenie kursu (1 = ukończył). Model zawierający liczbę godzin nauki i wcześniejsze doświadczenie był lepiej dopasowany niż model wyłącznie ze stałą, χ²(2) = 18,42, p < 0,001, Nagelkerke R² = 0,24. Każda dodatkowa godzina nauki wiązała się z 1,38 razy większymi szansami ukończenia kursu, OR = 1,38, 95% CI [1,16; 1,65], przy stałym poziomie doświadczenia. Wynik opisuje związek, nie dowodzi wpływu przyczynowego.
Nie pisz „szansa wynosiła 138%” ani „prawdopodobieństwo wzrosło o 38%”. Poprawne zdanie dotyczy mnożnika szans, a zmianę prawdopodobieństwa pokazuje się dla konkretnych wartości predyktorów.
Najczęstsze błędy
Program modeluje przeciwną kategorię niż ta opisana w hipotezie.
Iloraz szans nazwano wzrostem prawdopodobieństwa o ten sam procent.
Model ma wiele parametrów, ale niewiele przypadków w rzadszej klasie.
Zmienną ciągłą podzielono arbitralnie, tracąc informację i moc.
Miara została opisana jako procent wyjaśnionej wariancji.
Wysoki wynik wynika tylko z dominacji jednej kategorii.
Co wolno wywnioskować
Regresja logistyczna pokazuje związek predyktorów z szansami określonego zdarzenia po uwzględnieniu pozostałych zmiennych w modelu. Nie zamienia danych obserwacyjnych w eksperyment i nie usuwa błędów pomiaru ani pominiętych zmiennych. Najmocniejszy raport łączy OR z przedziałem, konkretnym prawdopodobieństwem i ograniczeniami projektu.










