Dane wtórne pozwalają odpowiedzieć na pytanie badawcze bez prowadzenia własnej ankiety lub wywiadów. Możesz wykorzystać statystyki GUS, tablice Eurostatu, zbiory administracyjne, archiwalne badania społeczne albo dane opublikowane przez instytucję. Oszczędność czasu jest jednak tylko pozorna, jeśli najpierw pobierzesz plik, a dopiero później zaczniesz ustalać, co właściwie oznaczają jego kolumny.
Dobry projekt wtórny zaczyna się od zgodności pytania z populacją, jednostką obserwacji, okresem i definicją zmiennych. Dopiero potem przychodzą format pliku, analiza i wykresy. Poniżej znajdziesz procedurę kwalifikacji zbioru, anotowany paszport danych oraz gotowy wzór opisu do metodologii.
Czym są dane wtórne i czym nie są
Dane wtórne to materiał zebrany wcześniej, zwykle w innym celu niż Twoje aktualne pytanie. Mogą mieć formę tabel statystycznych, mikrodanych z badania, rejestru administracyjnego, dokumentacji organizacyjnej, transkrypcji, zdjęć lub archiwalnych pomiarów. Analiza wtórna polega na ponownym użyciu takiego materiału do nowej analizy, porównania albo reinterpretacji.
Nie każda informacja znaleziona w internecie jest zbiorem danych. Wykres w raporcie może być jedynie prezentacją rezultatu, bez dostępu do jednostek, definicji i sposobu obliczeń. Artykuł naukowy omawiający wyniki jest źródłem literatury, ale nie staje się automatycznie materiałem empirycznym. To odróżnia analizę danych wtórnych od pracy przeglądowej opartej na publikacjach.
- 1
Zjawisko
To, co wydarzyło się w populacji lub instytucji.
- 2
Rejestracja
Ankieta, rejestr, pomiar albo procedura sprawozdawcza.
- 3
Przetwarzanie
Czyszczenie, ważenie, agregacja, anonimizacja i klasyfikacja.
- 4
Publikacja
Konkretna tabela, plik, wersja i zestaw metadanych.
- 5
Twój wniosek
Interpretacja ograniczona zakresem wcześniejszych decyzji.
Dane nie zaczynają się w arkuszu. Każdy etap może zmienić zakres tego, co wolno z nich wywnioskować.
Pytanie badawcze musi pojawić się przed plikiem
Najbardziej kuszące zbiory są duże, aktualne i łatwe do pobrania. To nie znaczy, że odpowiadają na Twoje pytanie. Zanim otworzysz arkusz, zapisz pięć elementów projektu: badaną populację, jednostkę obserwacji, obszar, okres oraz wynik, który chcesz porównać lub wyjaśnić.
Jak zmieniała się dostępność opieki żłobkowej w miastach na prawach powiatu w latach 2018–2025?
- Zjawisko
- Dostępność, a nie sama liczba placówek.
- Jednostka
- Miasto na prawach powiatu, nie pojedynczy żłobek ani gospodarstwo domowe.
- Mianownik
- Liczba dzieci w odpowiednim wieku lub inna jawnie uzasadniona podstawa.
- Czas
- Porównywalne lata i informacja o zmianach definicji.
Jeżeli zbiór zawiera liczbę miejsc w żłobkach, ale nie obejmuje dzieci uprawnionych do korzystania z opieki, nie mierzy jeszcze dostępności. Potrzebujesz mianownika lub musisz zawęzić pytanie do rozwoju infrastruktury. Właśnie na tym etapie decydujesz, czy zmienna zastępcza jest uzasadniona. Pomocne będzie wcześniejsze uporządkowanie zmiennych i wskaźników w operacjonalizacji.
Paszport zbioru ujawnia ukryte założenia
Paszport zbioru jest kartą kwalifikacyjną przygotowaną przed analizą. Nie zastępuje dokumentacji producenta. Zmusza jednak do wydobycia z niej informacji, które później trafią do metodologii i ograniczeń. Poniższy przykład jest fikcyjny i pokazuje strukturę, a nie gotowe dane do wykorzystania.
Nazwa zbioruOpieka nad dziećmi do lat 3
ProducentInstytucja statystyki publicznej
Identyfikator tabeliKod lub trwały adres z dokumentacji
Data pobrania16 sierpnia 2026
Jakie obiekty obejmuje zbiór i czym jest jeden rekord lub jedna komórka?
Czy dane dotyczą okresu sprawozdawczego, stanu w dniu czy średniej? Jaka klasyfikacja terytorialna obowiązuje?
Jak producent definiuje wskaźnik, jednostkę miary, braki i wartości oznaczone symbolami?
Czy źródłem jest spis, badanie reprezentacyjne, rejestr czy agregacja wielu systemów?
Jak zastosowano ważenie, korekty, imputację, anonimizację i kontrolę spójności?
Czy wartości mogą być aktualizowane? Czy zachowano pobrany plik i datę dostępu?
Jaka licencja, wymóg atrybucji, ograniczenie publikacji lub poufność dotyczą zbioru?
Na jakie pytanie zbiór odpowiada, a czego nie pozwala ustalić?
Najważniejsze pole znajduje się na końcu. Zbiór może być wiarygodny i świetnie opisany, a mimo to nie pasować do Twojego problemu. Ocena jakości producenta i ocena dopasowania badawczego to dwa oddzielne zadania.
Gdzie szukać danych wtórnych
Zacznij od instytucji, która odpowiada za powstawanie danych, a nie od losowego pliku udostępnionego w serwisie społecznościowym. W Polsce podstawowym punktem dla statystyki terytorialnej jest Bank Danych Lokalnych GUS. Jego część metadanych obejmuje między innymi pojęcia, jednostki miary, atrybuty, klasyfikacje oraz zmiany podziału terytorialnego. Eurostat udostępnia dane porównawcze wraz z metadanymi strukturalnymi i referencyjnymi.
GUS BDL, Eurostat i bazy organizacji międzynarodowych. Dobre do szeregów czasowych, porównań terytorialnych i wskaźników opartych na jawnej metodologii.
Dane.gov.pl oraz portale samorządowe. Zawsze sprawdzaj dostawcę, datę aktualizacji, format, historię zasobu i warunki wykorzystywania.
Archiwa badań społecznych i repozytoria uczelni. Szukaj kwestionariusza, doboru próby, książki kodowej, wag, warunków dostępu i zalecanego cytowania.
Rejestry, raporty systemowe i dokumentacja instytucji. Wymagają oceny podstawy dostępu, zakresu danych osobowych oraz celu, dla którego pierwotnie je gromadzono.
Adres strony z tabelą nie wystarcza do oceny. Przejdź do dokumentacji metodologicznej, definicji cechy i informacji o wersji. Jeżeli producent udostępnia API, zachowaj również kod zapytania lub pełny zestaw parametrów. Dzięki temu inna osoba może odtworzyć nie tylko bazę, lecz także dokładny wycinek użyty w pracy.
Zamrożenie wersji chroni odtwarzalność
Bazy publiczne są aktualizowane, korygowane i rozszerzane. Eurostat wprost informuje, że jego baza zawiera najnowszą wersję danych i nie przechowuje w interfejsie historii wersji każdego pobranego zestawu. Sam link może więc za kilka miesięcy prowadzić do wartości innych niż te użyte w obliczeniach.
bdl_opieka_2018_2025_raw_2026-08-16.csv
Nie nadpisuj go po czyszczeniu.
bdl_opieka_metadata_2026-08-16.pdf
Zachowaj definicje i uwagi producenta.
bdl_opieka_query.json
Zapisz parametry API lub filtry eksportu.
README_analysis.txt
Opisz usunięcia, przeliczenia i nowe zmienne.
W notatce projektu zapisz datę i godzinę pobrania, adres, identyfikator zbioru, format, zakres lat, wybrane jednostki oraz sumę kontrolną pliku, jeśli potrafisz ją wygenerować. Do pracy nie musisz wpisywać wszystkich technicznych szczegółów. Powinny jednak pozostać w Twoim archiwum roboczym.
Jakość i dopasowanie trzeba ocenić oddzielnie
Profesjonalny producent może publikować dane, które są zbyt zagregowane dla Twojego pytania. Z kolei mniejszy zbiór badawczy może być idealnie dopasowany, lecz wymagać ostrożności z powodu braków lub doboru próby. Ocena powinna objąć oba wymiary.
RelewancjaCzy zmienne rzeczywiście reprezentują pojęcia z pytania?Nie zastępuj dostępności liczbą placówek bez uzasadnienia.
PokrycieKogo i czego brakuje w populacji, czasie albo obszarze?Sprawdź wyłączenia, progi publikacji i zmiany klasyfikacji.
PorównywalnośćCzy definicja oraz sposób zbierania pozostają stabilne?Przerwanie szeregu może być zmianą metodologii, a nie zjawiska.
DokładnośćJak producent kontrolował błędy i niepewność?Odczytaj flagi, wagi, rewizje i zasady zaokrąglania.
AktualnośćCzy opóźnienie publikacji pasuje do celu pracy?Najnowszy dostępny rok nie zawsze opisuje stan obecny.
DostępCzy wolno analizować, cytować i udostępniać pochodne?Otwarta strona nie oznacza automatycznie braku warunków użycia.
Jeśli łączysz dwa zbiory, dodaj zgodność kluczy, definicji i okresów. Identycznie nazwana zmienna może mieć inną populację lub jednostkę. Nie łącz automatycznie wartości rocznych ze stanem w ostatnim dniu roku ani podziału administracyjnego sprzed reformy z aktualnymi granicami.
Analiza zaczyna się od dokumentacji przekształceń
Po kwalifikacji pracuj na kopii pliku. Zachowaj nazwy oryginalnych zmiennych, a nowe kolumny opisuj w słowniku. Każde filtrowanie, przeliczenie mianownika, połączenie tabel, usunięcie rekordu i zmianę kodowania zapisz w dzienniku analizy. Jeżeli używasz Jamovi, najpierw sprawdź typy zmiennych, kody braków i wartości odstające według procedury przygotowania danych do analizy.
Nie zakładaj, że duży zbiór pozwala wnioskować przyczynowo. Dane administracyjne powstają dla obsługi procesu, a nie dla eksperymentu. Zależność między dwoma wskaźnikami może wynikać ze wspólnego trendu, różnic struktury ludności lub sposobu raportowania. Zakres wniosku ma wynikać z projektu, nie z liczby rekordów.
Dane wtórne mogą stanowić jeden z niezależnych strumieni w triangulacji danych i metod. Wtedy najpierw formułujesz wynik dla zbioru wtórnego, a dopiero później zestawiasz go z ankietą, wywiadem lub obserwacją. Nie używaj pojedynczej statystyki jako dekoracyjnego „potwierdzenia” materiału jakościowego.
Opis danych wtórnych w metodologii
W metodologii podaj producenta, nazwę i identyfikator zbioru, cel pierwotny, sposób powstania danych, populację, jednostkę, okres, datę pobrania, wykorzystane zmienne, wykonane przekształcenia i ograniczenia. Jeżeli dokumentacja nie pozwala ustalić któregoś elementu, napisz to wprost i oceń wpływ braku na wynik.
W analizie wykorzystano [nazwa i identyfikator zbioru] opublikowany przez [producent]. Zbiór powstał na podstawie [badania, rejestru lub procedury] i obejmuje [populacja oraz jednostka obserwacji] w okresie [lata lub daty]. Dane pobrano [data] w wersji dostępnej pod adresem [trwały adres lub DOI]. Do odpowiedzi na pytanie badawcze wykorzystano zmienne [nazwy i definicje]. Przed analizą [opis filtrowania, łączenia, kodowania i przeliczeń]. Interpretację ogranicza [brak pokrycia, zmiana definicji, agregacja lub opóźnienie].
Zbiór z identyfikatorem DOI cytuj jak samodzielny materiał badawczy, a nie jak zwykłą stronę internetową. W opisie zwykle potrzebne są: twórca lub instytucja, rok wersji, tytuł zbioru, oznaczenie typu materiału, wersja, repozytorium i DOI lub trwały adres. Zastosuj styl wymagany przez uczelnię i zalecane cytowanie podane przez repozytorium.
Na końcu upewnij się, że opis pasuje do całej metodologii pracy dyplomowej. Czytelnik powinien wiedzieć nie tylko, skąd pochodzą liczby, ale także dlaczego właśnie ten zbiór może odpowiedzieć na pytanie i gdzie kończy się jego pole widzenia.
Źródła wykorzystane w artykule
- UK Data Service – New to using data – definicja i zastosowania wtórnej analizy danych jakościowych oraz ilościowych.
- UK Data Service – Study-level documentation – zakres dokumentacji badania, zbioru, przetwarzania, jakości i dostępu.
- UK Data Service – Data documentation for secondary sources – pochodzenie zmiennych i ograniczenia dalszego wykorzystania.
- Eurostat – Metadata overview – metadane strukturalne i referencyjne potrzebne do interpretacji statystyk.
- Eurostat – API introduction – aktualizacje bazy, dostęp przez API i brak wersjonowania wcześniejszych pobrań w bazie.
- GUS – metadane Banku Danych Lokalnych – definicje pojęć, jednostki, atrybuty i klasyfikacje towarzyszące danym.
- Otwarte Dane – standard prawny – warunki licencyjne, atrybucja i ponowne wykorzystywanie danych publicznych.










