Jak analizować sparowane dane jakościowe? Test McNemara

Jak sprawdzić, czy częstość występowania objawu zmieniła się po leczeniu, jeśli oceniamy tych samych pacjentów przed interwencją i po niej? W przypadku dwóch powiązanych pomiarów zmiennej dychotomicznej właściwą metodą jest najczęściej test McNemara, który uwzględnia kierunek zmian u poszczególnych pacjentów.

Wyjaśniamy, czym są pary zgodne i niezgodne, dlaczego zwykły test chi-kwadrat nie jest odpowiedni oraz jak prawidłowo przedstawić wyniki analizy.

Czym są sparowane dane jakościowe?

Dane jakościowe opisują przynależność obserwacji do określonych kategorii. Mogą to być na przykład:

  • obecność lub brak objawu,
  • dodatni lub ujemny wynik badania,
  • wystąpienie lub niewystąpienie powikłania,
  • odpowiedź na leczenie albo jej brak,
  • odpowiedź „tak” lub „nie”.

Dane mają charakter sparowany, jeśli dwa wyniki można jednoznacznie połączyć w parę. Najczęściej są to dwie oceny tej samej osoby, wykonane w różnych momentach lub za pomocą dwóch metod.

Przykładem może być ocena obecności bólu przed zastosowaniem leczenia i po jego zakończeniu. Każdy pacjent wnosi do analizy dwie powiązane odpowiedzi: „ból obecny” albo „ból nieobecny”.

Sparowane dane jakościowe otrzymamy również wtedy, gdy u każdego pacjenta zastosujemy dwie metody diagnostyczne i porównamy uzyskane wyniki dodatnie i ujemne. Nie są to dwie niezależne grupy, ponieważ obie metody oceniono u tych samych osób.

Jeżeli natomiast wynik metody A uzyskano w jednej grupie pacjentów, a wynik metody B w innej grupie, obserwacje są niezależne i test McNemara nie jest właściwy.

Jak wygląda tabela dla dwóch sparowanych pomiarów?

Dwa pomiary zmiennej dychotomicznej można przedstawić w tabeli 2 × 2. Załóżmy, że oceniamy obecność określonego objawu przed leczeniem i po leczeniu.

Objaw po leczeniu: obecnyObjaw po leczeniu: nieobecny
Objaw przed leczeniem: obecny3518
Objaw przed leczeniem: nieobecny641

Każdy pacjent trafia do jednej z czterech grup:

  1. Objaw był obecny przed leczeniem i pozostał obecny po leczeniu.
  2. Objaw był obecny przed leczeniem, ale zniknął po leczeniu.
  3. Objawu nie było przed leczeniem, ale pojawił się po leczeniu.
  4. Objawu nie było ani przed leczeniem, ani po leczeniu.

W tym przykładzie 35 pacjentów miało objaw w obu momentach, a u 41 objaw nie występował ani przed leczeniem, ani po nim. Są to pary zgodne, ponieważ kategoria wyniku nie uległa zmianie.

U 18 pacjentów objaw zniknął, natomiast u 6 pojawił się w drugim pomiarze. Są to pary niezgodne, ponieważ wynik zmienił się między ocenami.

Pary zgodne i niezgodne – które są najważniejsze?

W analizie zmiany największe znaczenie mają pary niezgodne:

– osoby przechodzące z kategorii „tak” do kategorii „nie”
– osoby przechodzące z kategorii „nie” do kategorii „tak”.

Pary zgodne potwierdzają, że wynik pozostał bez zmian, ale nie informują o kierunku zmiany. Test McNemara ocenia przede wszystkim, czy liczba zmian w jednym kierunku różni się od liczby zmian w kierunku przeciwnym.

W przedstawionym przykładzie porównujemy 18 pacjentów, u których objaw zniknął, z 6 pacjentami, u których objaw się pojawił. To właśnie te 24 pary niezgodne dostarczają najważniejszych informacji o kierunku zmiany.

Jeśli liczba zmian w obu kierunkach jest podobna, ogólny odsetek może pozostać zbliżony. Jeśli jeden kierunek wyraźnie przeważa, wskazuje to na systematyczną zmianę wyników pomiędzy pomiarami.

Test McNemara – na jakie pytanie odpowiada?

Test McNemara służy do porównania dwóch powiązanych pomiarów zmiennej mającej dwie kategorie. Ocenia, czy zmiany w jednym kierunku występują równie często jak zmiany w kierunku przeciwnym. [1,2]

W praktyce może odpowiadać na pytania:

  • Czy odsetek pacjentów zgłaszających objaw zmienił się po leczeniu?
  • Czy dwie metody diagnostyczne dają różne odsetki wyników dodatnich?
  • Czy częstość odpowiedzi na pytanie „tak/nie” zmieniła się po interwencji?
  • Czy ekspozycja dychotomiczna występuje inaczej u indywidualnie dopasowanych przypadków i osób kontrolnych?

Dla lekarza najważniejsze jest zrozumienie, że test wykorzystuje kierunek zmian u tych samych osób, a nie tylko dwa końcowe odsetki.

Test McNemara a porównanie dwóch odsetków

Przed leczeniem objaw może występować u 53% pacjentów, a po leczeniu u 41%. Sama różnica odsetków wynosi wtedy 12 punktów procentowych.

Takie porównanie opisowe jest potrzebne, ale nie uwzględnia jeszcze tego, że oba odsetki dotyczą tych samych osób. Nie pokazuje również, u ilu pacjentów nastąpiła poprawa, a u ilu zmiana w kierunku przeciwnym.

Ta sama różnica odsetków może powstać przy różnych strukturach zmian wewnątrzosobniczych. Dlatego analiza powinna uwzględniać pełną tabelę sparowanych wyników, a nie tylko odsetek przed leczeniem i odsetek po leczeniu.

Test McNemara nie porównuje dwóch odsetków tak, jakby pochodziły z niezależnych grup. Porównuje zmiany zachodzące w dwóch przeciwnych kierunkach.

Dlaczego zwykły test chi-kwadrat nie jest właściwy?

Klasyczny test chi-kwadrat dla dwóch grup zakłada niezależność obserwacji. Założenie to nie jest spełnione, jeśli ten sam pacjent został oceniony dwukrotnie.

Zastosowanie zwykłego testu chi-kwadrat do dwóch pomiarów tych samych osób powoduje utratę informacji o tym, które wyniki tworzą pary. Analiza uwzględnia wyłącznie liczebności lub odsetki w obu momentach, tak jakby pochodziły od różnych pacjentów.

Dla dwóch powiązanych pomiarów dychotomicznych odpowiednią metodą jest test McNemara. Sam fakt przedstawienia danych w tabeli 2 × 2 nie oznacza więc jeszcze, że należy zastosować klasyczny test chi-kwadrat. O wyborze metody decyduje również zależność pomiędzy obserwacjami.

Kiedy można zastosować test McNemara?

Test McNemara jest właściwy, gdy:

  • zmienna wynikowa ma dwie kategorie, np. „tak/nie” lub „dodatni/ujemny”,
  • analizowane są dwa powiązane pomiary lub dwie dopasowane obserwacje,
  • każda para jest niezależna od pozostałych par,
  • dla każdej analizowanej osoby dostępne są oba wyniki,
  • kategorie mają takie samo znaczenie w obu pomiarach.

Założenie niezależności dotyczy par, a nie wyników w obrębie pary. Dwa wyniki tego samego pacjenta są zależne, natomiast para utworzona przez jednego pacjenta powinna być niezależna od pary innego pacjenta.

Test McNemara może być stosowany nie tylko w badaniach przed–po. Znajduje również zastosowanie przy porównywaniu dwóch metod diagnostycznych u tych samych pacjentów oraz w indywidualnie dopasowanych badaniach kliniczno-kontrolnych.

Klasyczny czy dokładny test McNemara?

Klasyczna wersja testu McNemara wykorzystuje przybliżenie, które działa najlepiej przy odpowiednio dużej liczbie par niezgodnych. Znaczenie ma zatem nie tylko całkowita liczebność badania, ale przede wszystkim liczba pacjentów, u których wynik faktycznie zmienił się pomiędzy pomiarami.

Może się zdarzyć, że badanie obejmuje wielu uczestników, ale prawie wszyscy uzyskali ten sam wynik w obu momentach. Liczba par niezgodnych będzie wtedy mała, a klasyczna wersja testu może nie być najlepszym rozwiązaniem.

W takiej sytuacji można zastosować dokładny test McNemara lub inną metodę przeznaczoną dla małej liczby par niezgodnych. [3] W publikacji należy podać, którą wersję testu zastosowano i dlaczego.

Nie warto wprowadzać mechanicznej zasady opartej na jednej wartości granicznej. Wybór wersji testu powinien uwzględniać rozkład danych, liczbę par niezgodnych i możliwości wykorzystanego oprogramowania statystycznego.

Czy test McNemara ocenia zgodność dwóch metod?

Nie. Jest to ważne rozróżnienie.

Test McNemara sprawdza, czy dwie powiązane oceny mają takie same odsetki wyników dodatnich. Nie informuje bezpośrednio, czy obie metody zgadzają się u poszczególnych pacjentów.

Dwie metody mogą dawać podobny ogólny odsetek wyników dodatnich, ale często nie zgadzać się co do tego, którzy pacjenci mają wynik dodatni. Test McNemara może wtedy nie wykazać różnicy, ponieważ liczby zmian w obu kierunkach są podobne, mimo że zgodność metod jest niewielka.

Test McNemara i miary zgodności odpowiadają więc na inne pytania:

– test McNemara: czy odsetki wyników dodatnich różnią się pomiędzy metodami?
– miara zgodności: jak często obie metody przypisują temu samemu pacjentowi tę samą kategorię?

Jeżeli celem badania jest ocena zgodności klasyfikacji, należy przedstawić odsetek zgodnych wyników i rozważyć odpowiednią miarę, np. współczynnik kappa Cohena. Sam test McNemara nie powinien być interpretowany jako test zgodności.

Test McNemara w porównaniu metod diagnostycznych

Test McNemara jest często stosowany do porównania dwóch testów diagnostycznych wykonanych u tych samych osób. Interpretacja zależy jednak od dostępności wiarygodnego standardu referencyjnego.

Jeśli chcemy porównać czułość dwóch metod, analizę przeprowadzamy wśród osób, u których choroba została potwierdzona za pomocą standardu referencyjnego. Jeśli porównujemy swoistość, analizujemy osoby bez choroby. W obu przypadkach wyniki testów są sparowane, ponieważ obie metody zastosowano u tych samych pacjentów.[4]

Jeżeli standard referencyjny nie jest dostępny, test McNemara może porównać częstość wyników dodatnich obu metod, ale nie pozwala samodzielnie stwierdzić, która metoda jest bardziej trafna diagnostycznie.

Jak przedstawić wielkość efektu w teście McNemara?

Wartość p nie pokazuje, jak duża była zmiana ani czy ma ona znaczenie kliniczne. Dlatego wynik testu McNemara należy uzupełnić informacjami opisującymi wielkość i kierunek efektu.

Warto przedstawić:

  1. Odsetek wyniku dodatniego w pierwszym pomiarze.
  2. Odsetek wyniku dodatniego w drugim pomiarze.
  3. Bezwzględną różnicę odsetków w punktach procentowych.
  4. Liczebności zmian w obu kierunkach.
  5. Miarę względną, np. sparowany iloraz szans, jeśli odpowiada pytaniu badawczemu.
  6. Przedział ufności i wartość p.

Sparowany iloraz szans opiera się na porównaniu liczby zmian w obu kierunkach. Kierunek jego obliczenia trzeba zawsze jednoznacznie zdefiniować, ponieważ odwrotne kodowanie prowadzi do odwrotnej wartości.

Bezwzględna różnica odsetków jest często łatwiejsza do interpretacji klinicznej. Warto uzupełnić ją przedziałem ufności, pokazującym precyzję oszacowania.

Brakujące dane i niekompletne pary

Prosty test McNemara wymaga dwóch wyników dla każdej analizowanej osoby. Pacjent z oceną początkową, ale bez oceny końcowej, nie tworzy kompletnej pary i nie zostanie uwzględniony w standardowej analizie.

W publikacji należy odróżnić:

  • liczbę osób włączonych do badania,
  • liczbę osób ocenionych w każdym punkcie,
  • liczbę kompletnych par wykorzystanych w teście McNemara.

Brakujące dane mogą prowadzić nie tylko do zmniejszenia mocy statystycznej. Jeśli brak drugiego pomiaru wiąże się z nasileniem choroby, skutecznością leczenia albo działaniami niepożądanymi, analiza kompletnych par może dawać obciążone wyniki.

Nie należy zastępować brakującej odpowiedzi najczęstszą kategorią ani automatycznie przyjmować, że stan pacjenta się nie zmienił. W bardziej złożonych badaniach konieczne może być zastosowanie modeli dla powtarzanych danych binarnych lub odpowiednio zaplanowanej metody postępowania z brakami danych.

Czy warto przekształcać zmienną ilościową w jakościową?

Czasami zmienna ilościowa jest dzielona na dwie kategorie, np. „wynik prawidłowy” i „wynik nieprawidłowy”. Takie podejście może być uzasadnione, jeśli punkt odcięcia ma ustalone znaczenie kliniczne i pytanie badawcze dotyczy właśnie przekroczenia tego progu.

Nie należy jednak kategoryzować zmiennej wyłącznie po to, aby zastosować test McNemara. Podział zmiennej ilościowej prowadzi do utraty informacji, zmniejszenia mocy analizy i uzależnienia wyniku od wybranego punktu odcięcia.

Jeśli dostępne są dokładne wartości parametru, główna analiza powinna zwykle wykorzystywać dane ilościowe. Analizę kategorii można przedstawić dodatkowo, jeżeli ma ona wyraźne uzasadnienie kliniczne.

Co zrobić przy więcej niż dwóch kategoriach?

Klasyczny test McNemara dotyczy zmiennej mającej dwie kategorie. Jeśli odpowiedź może przyjmować trzy lub więcej wartości, potrzebna jest inna metoda.

W zależności od pytania badawczego można zastosować między innymi:

  • test Stuarta–Maxwella, który ocenia, czy rozkład kategorii zmienił się pomiędzy dwoma pomiarami;
  • test Bowkera, który służy do oceny symetrii zmian pomiędzy kategoriami. [5,6]

Metody te nie sprawdzają dokładnie tej samej hipotezy. Dlatego nie należy używać ogólnego określenia „rozszerzony test McNemara” bez wskazania, jaki test został rzeczywiście zastosowany.

Co zrobić przy więcej niż dwóch pomiarach?

Jeśli tę samą zmienną dychotomiczną oceniono u pacjentów w trzech lub większej liczbie momentów, pojedynczy test McNemara nie obejmuje całej struktury badania.

Prostym rozszerzeniem jest test Q Cochrana, który ocenia, czy odsetek wyniku dodatniego jest taki sam we wszystkich powiązanych pomiarach. [7] Jeśli test ogólny wskazuje na różnice, można przeprowadzić odpowiednio zaplanowane porównania parami z uwzględnieniem problemu wielokrotnego testowania.

W bardziej złożonych projektach, szczególnie przy brakujących danych, różnych terminach obserwacji lub potrzebie uwzględnienia dodatkowych zmiennych, odpowiedniejsze mogą być modele dla powtarzanych wyników binarnych.

Najczęstsze błędy w analizie sparowanych danych jakościowych

Najczęstsze problemy to:

  1. Zastosowanie klasycznego testu chi-kwadrat do dwóch ocen tych samych pacjentów.
  2. Przedstawienie jedynie odsetków przed i po interwencji bez pokazania kierunków zmian.
  3. Nieuwzględnienie liczby par niezgodnych przy wyborze wersji testu.
  4. Podanie wartości p bez wielkości i kierunku efektu.
  5. Interpretowanie testu McNemara jako testu zgodności dwóch metod.
  6. Zastosowanie testu McNemara do zmiennej mającej więcej niż dwie kategorie.
  7. Nieuwzględnienie niekompletnych par.
  8. Przekształcenie zmiennej ilościowej w dychotomiczną bez klinicznego uzasadnienia.

Jak opisać test McNemara w publikacji?

Opis metody powinien wskazywać, że obserwacje były sparowane, jaka zmienna została przeanalizowana oraz którą wersję testu zastosowano.

Przykład zapisu w Methods:

„Zmianę częstości występowania objawu pomiędzy oceną początkową i końcową analizowano za pomocą testu McNemara dla sparowanych danych dychotomicznych. Ze względu na małą liczbę par niezgodnych zastosowano dokładną wersję testu.”

Przykład zapisu w Results:

„Odsetek pacjentów zgłaszających objaw zmniejszył się z 53% przed leczeniem do 41% po leczeniu, co odpowiada bezwzględnej zmianie o 12 punktów procentowych. Objaw ustąpił u 18 pacjentów, natomiast pojawił się u 6 pacjentów. Różnica kierunków zmian była statystycznie istotna w teście McNemara (p = 0,034; n = 100 kompletnych par).”

Jeżeli raportowany jest sparowany iloraz szans lub przedział ufności dla różnicy odsetków, wartości te należy dodać do opisu. Wynik powinien umożliwiać ocenę zarówno istotności statystycznej, jak i klinicznego znaczenia zmiany.

Kluczowe wnioski dla statystyki medycznej

– Test McNemara stosujemy do dwóch powiązanych pomiarów zmiennej dychotomicznej, np. obecności objawu przed leczeniem i po leczeniu.

– Najważniejszą informację dostarczają pary niezgodne, czyli pacjenci, u których wynik zmienił się w jednym lub drugim kierunku.

– Zwykły test chi-kwadrat nie jest właściwy dla dwóch ocen tych samych osób, ponieważ zakłada niezależność obserwacji.

– Wynik powinien obejmować odsetki w obu momentach, liczebności zmian w obu kierunkach, wielkość efektu, przedział ufności oraz wartość p.

– Test McNemara porównuje sparowane odsetki, ale nie jest testem zgodności metod diagnostycznych.

– Przy większej liczbie kategorii lub pomiarów oraz przy brakujących danych konieczne są inne metody, np. test Stuarta–Maxwella, test Q Cochrana lub modele dla powtarzanych wyników binarnych.

Bibliografia:

  1. Agresti A. Categorical Data Analysis. 3rd ed. Hoboken: John Wiley & Sons; 2013.
  2. McNemar Q. Note on the sampling error of the difference between correlated proportions or percentages. Psychometrika. 1947;12:153–157. doi:10.1007/BF02295996.
  3. Sundjaja JH, Shrestha R, Krishan K. McNemar and Mann-Whitney U Tests. StatPearls. Treasure Island: StatPearls Publishing; 2023.
  4. Fagerland MW, Lydersen S, Laake P. The McNemar test for binary matched-pairs data: mid-p and asymptotic are better than exact conditional. BMC Med Res Methodol. 2013;13:91.
  5. Kim S, Lee W. Does McNemar’s test compare the sensitivities and specificities of two diagnostic tests? Stat Methods Med Res. 2017;26:142–154.
  6. Stuart A. A test for homogeneity of the marginal distributions in a two-way classification. Biometrika. 1955;42:412–416.
  7. Bowker AH. A test for symmetry in contingency tables. J Am Stat Assoc. 1948;43:572–574.
  8. Cochran WG. The comparison of percentages in matched samples. Biometrika. 1950;37:256–266.

Skontaktuj się z nami

Jeśli masz jakiekolwiek pytania,
skontaktuj się z nami.
Odpowiadamy najpóźniej po 24h.

+48 601 40 77 71

Pokaż e-mail