R MANN WHITNEY U TESTİ

Veri Akademi7 dk okuma
R mavi logosu yanında iki grubun sıralama karşılaştırmasını gösteren medyan çizgili şema

Hemşirelik yüksek lisans öğrencisi 28 hastalık bir çalışmada iki pansuman yönteminin ağrı skorlarını karşılaştırıyor. Plan t testiydi; ama normallik kontrolünde klasik yöntem grubu p=0.015 verdi — normal değil. Grup başına 14 kişiyle merkezi limit teoremine sığınmak da mümkün değil. Üstelik ölçüm 0-10 arası ağrı skalası: eşit aralıklı sürekli bir ölçüm bile sayılmaz. Tam bu üçlü kıskaçta — küçük örneklem, normal olmayan dağılım, sıralı ölçek — devreye Mann-Whitney U testi girer.

Mann-Whitney (R'daki adıyla Wilcoxon rank sum) puanların kendisini değil sıralarını karşılaştırır: tüm gözlemler karışık sıralanır, sıra numaralarının gruplara dağılımı incelenir. Dağılım varsayımı istemez, aykırı değerlere dirençlidir. Aşağıdaki bütün sayılar gerçek çalıştırmadan.

R scriptini indir (.R) — veri: r-mann-whitney-u-testi-veri.csv

1. Ne Zaman t Testi Yerine Mann-Whitney

Karar üç soruya bakar; herhangi biri "evet" ise Mann-Whitney güvenli tercihtir:

  • Normallik ihlali + küçük grup: Shapiro p<0.05 ve grup başına n 30'un altındaysa t testinin dayanıklılığına güvenilemez. Bu örnekte klasik grup p=0.015 ile ihlalde.
  • Sıralı (ordinal) ölçek: ağrı skoru, Likert tek maddesi, memnuniyet derecesi gibi ölçümlerde "7 ile 8 arasındaki mesafe, 2 ile 3 arasındakine eşit" varsayımı savunulamaz; sıra temelli test ölçeğin doğasına uyar.
  • Aşırı aykırı değerler: tek bir uç gözlem ortalamayı sürükler ama sıralamada yalnızca bir sıra oynatır — Mann-Whitney bu yüzden dirençlidir.

Ters yönde uyarı da gerekli: veri normal ve ölçüm sürekli ise t testi daha güçlüdür — aynı farkı daha küçük örneklemle yakalar. Mann-Whitney'i "her koşulda güvenli" diye varsayılan yapmak, gereksiz güç kaybıdır. Karar zinciri normallik kontrolünden geçer.

2. Betimleyiciler: Ortalama Değil Medyan

tapply(veri$agri_skoru, veri$yontem, median)
# Klasik   Yeni
#    6.0    3.5
tapply(veri$agri_skoru, veri$yontem, IQR)
#   1.75   2.00

Nonparametrik test seçildiğinde betimleyici tablo da onunla hizalanır: ortalama-standart sapma yerine medyan ve çeyrekler arası açıklık (IQR) raporlanır. Klasik pansuman grubunun medyan ağrısı 6, yeni yöntemde 3.5 — skalada 2.5 puanlık düşüş, klinik olarak da dikkat çekici. Mann-Whitney raporunda ortalama sunmak iç tutarsızlıktır: test sıralara bakarken tablonun ortalamayla konuşması jüriye açık verir.

Yirmi sekiz hastanın tek tek ağrı skorları iki yöntem sütununda, medyan çizgileri belirgin ayrık

3. wilcox.test ve Çıktının Okunması

wilcox.test(agri_skoru ~ yontem, data = veri)

#   Wilcoxon rank sum test with continuity correction
# W = 190, p-value = 2.089e-05

R'da fonksiyonun adının wilcox.test olması ilk aramada kafa karıştırır — Mann-Whitney U ile Wilcoxon rank sum aynı testin iki adıdır; R ikinci geleneği izler. W=190 test istatistiğidir (bir grubun sıra toplamından türetilir); yorum yükünü p taşır: 2.089e-05, yani 0.00002 — iki yöntemin ağrı düzeyleri arasındaki fark anlamlıdır.

Konsolda "cannot compute exact p-value with ties" uyarısı görürseniz panik gerekmez: aynı skoru alan hastalar (bağlar/ties) olduğunda R tam yerine yaklaşık p hesaplar — ağrı skalası gibi tekrarlı değerlerin kaçınılmaz olduğu verilerde bu normaldir ve raporlamayı değiştirmez.

4. Etki Büyüklüğü: Rank-Biserial

library(effectsize)
rank_biserial(agri_skoru ~ yontem, data = veri)
# r (rank biserial) = 0.94, 95% CI [0.86, 0.97]

Mann-Whitney'in etki büyüklüğü rank-biserial korelasyondur; −1 ile +1 arasında çalışır ve sezgisel bir anlamı vardır: rastgele seçilen çiftlerde bir grubun diğerini "yenme" oranının dengesini gösterir. 0.94, neredeyse tüm ikili kıyaslarda klasik grubun daha yüksek ağrı bildirdiği anlamına gelir — çok büyük bir etki. Cohen d buraya taşınmaz; nonparametrik testin kendi etki ölçüsü kullanılır.

5. Raporlama, Grafik ve Dosyalar

Tez kalıbı: "Yeni pansuman yöntemi uygulanan hastaların ağrı skorları (Medyan=3.5, IQR=2.0), klasik yöntem grubundan (Medyan=6.0, IQR=1.75) anlamlı düzeyde düşük bulunmuştur; U testi, W=190, p<.001, rank-biserial r=.94."

İki pansuman yönteminin ağrı skoru dağılımlarını kıyaslayan kutu grafiği, yeni yöntem belirgin düşük

Kutu grafiği medyan farkını görünür kılıyor: yeni yöntemin kutusu bütünüyle aşağıda. Grafik üretiminin adım adım anlatımı ggplot2 yazısında.

Örnek veriyi indir (.csv) — 28 hasta, iki yöntem

Script ile veriyi aynı klasörde çalıştırıp aynı çıktıları üretebilirsiniz; ek alıştırma olarak aynı veriye t.test uygulayın ve iki testin p değerlerini karşılaştırın — sonuç bu veri setinde aynı yöne çıkar ama gerekçesi artık savunulabilir olmaz. Parametrik-nonparametrik seçimini kendi verinizde tereddütsüz yapabilmek için R veri analizi eğitimi karar akışını gerçek tez senaryolarıyla çalıştırıyor; veri tabanından veri çekme tarafı için SQL eğitimi ayrı bir başlangıç noktası.

Sıkça Sorulan Sorular

Mann-Whitney U ile Wilcoxon testi aynı şey mi?

İki bağımsız grup söz konusuysa evet — Mann-Whitney U ve Wilcoxon rank sum aynı testin iki adıdır; R wilcox.test fonksiyonunda ikinci adı kullanır. Karışıklık yaratan nokta, aynı fonksiyonun paired=TRUE ile bambaşka bir testi (Wilcoxon signed rank, eşleştirilmiş ölçümler için) de çalıştırmasıdır. Grup yapınıza göre parametreyi doğru seçmek gerekir.

Mann-Whitney raporunda neden ortalama değil medyan verilir?

Test sıralar üzerinden çalıştığı için betimleyici istatistiğin de sıra temelli olması tutarlılık gereğidir: medyan ve IQR raporlanır. Ayrıca bu testin seçilme sebebi genellikle çarpık dağılım veya aykırı değerdir — tam da ortalamanın yanıltıcı olduğu durumlar. Ortalama sunmak, testi seçme gerekçenizle çelişir.

'cannot compute exact p-value with ties' uyarısı sorun mu?

Hayır. Aynı değeri paylaşan gözlemler (bağlar) olduğunda R tam p yerine normal yaklaşımlı p hesaplar ve süreklilik düzeltmesi uygular. Ağrı skoru, Likert gibi sınırlı değer kümesi olan ölçümlerde bağlar kaçınılmazdır. Uyarı bilgilendirmedir; sonuç geçerlidir ve raporlamada ayrıca belirtilmesi gerekmez.

Kaç kişiyle Mann-Whitney yapılabilir, 14+14 yeterli mi?

Test çok küçük örneklemlerde bile matematiksel olarak çalışır — klasik tablolar grup başına 3-4 gözleme kadar iner. Ancak küçük örneklem yalnızca büyük etkileri yakalar: bu çalışmada 14+14 kişiyle p<.001 çıkmasının sebebi etkinin dev olmasıdır (r=.94). Orta düzey etkiler bekleniyorsa grup başına en az 20-30 gözlem planlamak gerçekçidir.

Mann-Whitney medyanları mı karşılaştırır?

Tam olarak değil — sık tekrarlanan bir basitleştirmedir. Test, bir gruptan rastgele seçilen değerin diğerinden büyük olma olasılığını sınar; grupların dağılım biçimleri benzerse bu pratikte medyan karşılaştırmasına denk düşer. Dağılım biçimleri çok farklıysa yorum 'dağılımlar arasında kayma' olarak yapılmalıdır. Raporda medyanları vermek yine de standarttır.

Üç ve daha fazla grup için nonparametrik test hangisi?

Kruskal-Wallis testi — Mann-Whitney'in çok gruplu genellemesidir, R'da kruskal.test ile çalışır. Anlamlı çıkarsa ikili farklar Dunn testi (FSA veya dunn.test paketi) ile, p düzeltmesi uygulanarak incelenir. İkiden fazla grubu art arda Mann-Whitney ile kıyaslamak, ANOVA yerine çoklu t testi yapmakla aynı hata birikimi sorununu taşır.