Bliżej studentów

Regresja logistyczna w pracy dyplomowej – jak wykonać ją w Jamovi

Dłoń ustawia próg na przezroczystym zakrzywionym torze prowadzącym dane do dwóch wyników

Regresja logistyczna jest właściwa wtedy, gdy wynik ma dwa stany, na przykład ukończył–nie ukończył, kupił–nie kupił albo wystąpiło–nie wystąpiło. Model nie przewiduje wartości na zwykłej prostej. Szacuje, jak predyktory zmieniają szanse zdarzenia, a następnie przelicza je na prawdopodobieństwo od 0 do 1.

W tym poradniku wykonasz binarną regresję logistyczną w Jamovi, odczytasz iloraz szans, przedział ufności i jakość modelu oraz przygotujesz zapis do pracy. Jeśli wynik jest ciągły, właściwy będzie poradnik o regresji liniowej w Jamovi.

01Prawdopodobieństwop = 0,8080 zdarzeń na 100 podobnych przypadków

02Szansep ÷ (1 − p) = 4cztery do jednego na korzyść zdarzenia

03Logitln(4) = 1,39skala, na której model jest liniowy

Kiedy wybrać regresję logistyczną

Zmienna zależna musi mieć dwa rozłączne poziomy. Może to być odpowiedź tak–nie, status zaliczenia, rezygnacja z usługi albo obecność zjawiska. Predyktory mogą być ilościowe lub kategorialne. Jeśli wynik ma trzy uporządkowane poziomy, potrzebujesz regresji porządkowej; jeżeli ma więcej nieuporządkowanych kategorii, regresji wielomianowej.

Wynik binarny

Każdy przypadek należy do dokładnie jednego z dwóch stanów.

Zdarzenie wskazane jawnie

Wiesz, który poziom jest modelowany jako 1 i względem czego interpretujesz OR.

Obserwacje niezależne

Ten sam uczestnik nie pojawia się wielokrotnie bez modelu uwzględniającego zależność.

Dane w obu klasach

Masz wystarczająco dużo zdarzeń i niezdarzeń dla liczby parametrów.

Sam fakt, że dane są zapisane jako 0 i 1, nie wystarcza. Kod musi oznaczać rzeczywiste kategorie, a nie sztuczny podział zmiennej ciągłej. W wyborze rodziny analizy pomaga schemat doboru testu statystycznego.

Co naprawdę oznacza iloraz szans

Jamovi może pokazać współczynnik B w jednostkach logitu oraz jego wykładnik, czyli iloraz szans OR = exp(B). Wartość OR równa 1 oznacza brak zmiany szans. OR większe od 1 oznacza wzrost, a mniejsze od 1 spadek szans modelowanego zdarzenia przy wzroście predyktora o jednostkę, przy pozostałych zmiennych stałych.

OR = 0,60szanse niższe o 40%OR = 1brak zmiany szansOR = 1,60szanse wyższe o 60%

Szanse nie są prawdopodobieństwem. OR = 2 nie znaczy automatycznie „prawdopodobieństwo jest dwa razy większe”. Ta sama zmiana szans daje inny przyrost punktów procentowych przy prawdopodobieństwie wyjściowym 10% niż przy 60%.

Jak przygotować dane

Jeden wiersz powinien odpowiadać jednej niezależnej obserwacji. Ustal kod zdarzenia, poziomy referencyjne predyktorów kategorialnych i znaczenie jednej jednostki predyktora ilościowego. Wiek liczony w latach interpretuje się inaczej niż wiek podzielony przez 10.

  • Sprawdź braki, liczebność obu kategorii wyniku i puste kombinacje poziomów.
  • Nie dziel zmiennej ciągłej na „niski–wysoki” bez mocnego uzasadnienia.
  • Rozpoznaj predyktory niemal identyczne i kategorie z bardzo małą liczebnością.
  • Zapisz poziom referencyjny przed interpretacją współczynników.

Kontrolę kodów, braków i nietypowych wartości przeprowadź zgodnie z poradnikiem o przygotowaniu danych w Jamovi.

Jak wykonać analizę w Jamovi

  1. Wybierz Analyses → Regression → 2 Outcomes lub odpowiadającą tej analizie pozycję w polskiej wersji interfejsu.
  2. Przenieś zmienną binarną do pola Dependent Variable.
  3. Predyktory ciągłe umieść w Covariates, a kategorialne w Factors.
  4. Sprawdź poziom referencyjny wyniku i czynników. To on wyznacza kierunek OR.
  5. Włącz ilorazy szans, 95-procentowe przedziały ufności, test całego modelu i miary dopasowania.
  6. Jeśli potrzebujesz oceny klasyfikacji, dodaj tabelę klasyfikacji i zapisane prawdopodobieństwa.

Nazwy opcji mogą się różnić Zapisz wersję Jamovi i dokładną ścieżkę analizy. W aktualnej dokumentacji binarna regresja logistyczna znajduje się w grupie Regression jako analiza dla dwóch wyników.

Jak czytać krzywą i wynik modelu

Krzywa logistyczna pokazuje, dlaczego współczynnik ma stały wpływ na logarytm szans, ale nie na liczbę punktów procentowych. Największa zmiana prawdopodobieństwa często pojawia się w środkowej części krzywej. Na krańcach nawet duża zmiana predyktora może niewiele przesunąć prawdopodobieństwo.

Pulpit modelu

Przesuń przypadek po krzywej

Wybierz model, a następnie zmień wartość predyktora. Pulpit obliczy OR i przewidywane prawdopodobieństwo zdarzenia.

1,00,50wartość predyktora

B

OR = exp(B)

p dla X

Wynik pojedynczego predyktora czytaj razem z przedziałem ufności. Jeśli przedział dla OR obejmuje 1, dane nie wykluczają braku związku na przyjętym poziomie ufności. Zasady interpretacji przedziałów i wartości p opisuje poradnik o istotności i wielkości efektu.

Jak ocenić dopasowanie i problemy

Najpierw sprawdź, czy model z predyktorami poprawia dopasowanie względem modelu bazowego. Następnie oceń przedziały OR, obserwacje wpływowe, współliniowość i jakość przewidywań. Pseudo-R² nie jest zwykłym odsetkiem wyjaśnionej wariancji i nie należy interpretować go tak jak R² w regresji liniowej.

SygnałOgromne OR i szeroki CI

Możliwa rzadka kategoria, mała próba albo separacja.

SygnałWysoka trafność bez modelu

Przy niezrównoważonych klasach sam procent klasyfikacji może mylić.

SygnałZmiana znaku po dodaniu zmiennej

Sprawdź współliniowość, kodowanie i rolę zmiennej kontrolnej.

SygnałDobra tabela, słaba kalibracja

Próg klasyfikacji nie zastępuje oceny prawdopodobieństw.

W raporcie pokaż również, ile osób weszło do analizy i jak rozkładały się dwa poziomy wyniku. Pomaga w tym poradnik o charakterystyce badanej próby.

Jak opisać wynik w pracy

Podaj modelowane zdarzenie, predyktory, liczebność analizy, test całego modelu, wybrane miary dopasowania oraz OR z przedziałami. Poniższe liczby pokazują formę zapisu, a nie wynik do skopiowania.

Przeprowadzono binarną regresję logistyczną, w której modelowanym zdarzeniem było ukończenie kursu (1 = ukończył). Model zawierający liczbę godzin nauki i wcześniejsze doświadczenie był lepiej dopasowany niż model wyłącznie ze stałą, χ²(2) = 18,42, p < 0,001, Nagelkerke R² = 0,24. Każda dodatkowa godzina nauki wiązała się z 1,38 razy większymi szansami ukończenia kursu, OR = 1,38, 95% CI [1,16; 1,65], przy stałym poziomie doświadczenia. Wynik opisuje związek, nie dowodzi wpływu przyczynowego.

Nie pisz „szansa wynosiła 138%” ani „prawdopodobieństwo wzrosło o 38%”. Poprawne zdanie dotyczy mnożnika szans, a zmianę prawdopodobieństwa pokazuje się dla konkretnych wartości predyktorów.

Najczęstsze błędy

Złe zdarzenie

Program modeluje przeciwną kategorię niż ta opisana w hipotezie.

OR jako ryzyko

Iloraz szans nazwano wzrostem prawdopodobieństwa o ten sam procent.

Za mało zdarzeń

Model ma wiele parametrów, ale niewiele przypadków w rzadszej klasie.

Cięcie skali

Zmienną ciągłą podzielono arbitralnie, tracąc informację i moc.

Pseudo-R² jak R²

Miara została opisana jako procent wyjaśnionej wariancji.

Klasyfikacja bez kontekstu

Wysoki wynik wynika tylko z dominacji jednej kategorii.

Co wolno wywnioskować

Regresja logistyczna pokazuje związek predyktorów z szansami określonego zdarzenia po uwzględnieniu pozostałych zmiennych w modelu. Nie zamienia danych obserwacyjnych w eksperyment i nie usuwa błędów pomiaru ani pominiętych zmiennych. Najmocniejszy raport łączy OR z przedziałem, konkretnym prawdopodobieństwem i ograniczeniami projektu.

Źródła i dalsza lektura
WhatsApp Zadzwoń