R Kİ KARE TESTİ

Veri Akademi7 dk okuma
R mavi logosu yanında iki kategorik değişkenin ilişkisini gösteren çapraz tablo ızgarası şeması

240 üniversite öğrencisine "en çok hangi sosyal medya platformunu kullanıyorsunuz?" diye soruldu. Kadınların %45'i Instagram dedi, erkeklerin yalnızca %33'ü. On iki puanlık fark — anket verisinde göze batacak kadar büyük. Sonra ki-kare testi çalıştırıldı ve p=0.085 çıktı: anlamlı değil. Yüzdeler bu kadar farklıyken test nasıl "ilişki gösterilemedi" der? Bu yazının asıl dersi tam olarak bu gerilimde saklı.

Ki-kare bağımsızlık testi, iki kategorik değişkenin (cinsiyet × platform gibi) ilişkili olup olmadığını sınar — sayısal ortalamaların olmadığı, verinin tamamen frekanslardan oluştuğu anket sorularının temel testidir. Bütün sayılar gerçek çalıştırmadan geliyor.

R scriptini indir (.R) — veri: r-ki-kare-testi-veri.csv

1. Çapraz Tablo Kurma

tablo <- table(veri$cinsiyet, veri$platform)
tablo
#         Instagram  X YouTube
#   Erkek        39 34      46
#   Kadin        55 23      43

prop.table(tablo, 1)   # satır yüzdeleri
#         Instagram    X  YouTube
#   Erkek     0.328 0.286    0.387
#   Kadin     0.455 0.190    0.355

Ki-kare analizi çapraz tabloyla başlar; prop.table(tablo, 1) ile satır yüzdeleri alınır — her cinsiyetin kendi içindeki dağılımı. Desen görünür: kadınlarda Instagram önde (%45.5'e karşı %32.8), erkeklerde X daha yaygın (%28.6'ya karşı %19.0). Soru şu: bu desen 240 kişilik örneklemin şansı mı, evrende gerçekten var olan bir ilişki mi?

Cinsiyet içinde platform tercih oranlarını gösteren yüzde yığılmış çubuk grafiği

2. chisq.test ve p=0.085'in Anlamı

sonuc <- chisq.test(tablo)
sonuc
#   Pearson's Chi-squared test
# X-squared = 4.931, df = 2, p-value = 0.08497

Test, gözlenen frekansları "ilişki hiç olmasaydı beklenecek" frekanslarla karşılaştırır; X²=4.93 bu sapmaların toplam ölçüsüdür. p=0.085, eşiğin (0.05) üzerinde — H0 reddedilemez: cinsiyet ile platform tercihi arasında anlamlı ilişki gösterilememiştir.

Buradaki dil inceliği tezinizi kurtarır: "ilişki yoktur" yazılmaz, "ilişki gösterilememiştir" yazılır. Anlamsız p, yokluğun kanıtı değildir — örneklem bu büyüklükteki bir deseni doğrulamaya yetmemiş de olabilir. Nitekim p=0.085, eşiğe yakın bir değerdir; daha büyük örneklemle aynı yüzde farkları pekâlâ anlamlı çıkabilirdi. Ama eldeki veriyle hüküm nettir ve p'yi "eğilim var" diye esnetmek (ör. "marjinal anlamlılık") çoğu jüride itiraz alır.

3. Beklenen Frekans Kuralı

sonuc$expected
#         Instagram      X  YouTube
#   Erkek     46.61  28.26    44.13
#   Kadin     47.39  28.74    44.87

Ki-karenin geçerlilik şartı beklenen frekanslardadır: hücrelerin en az %80'inde beklenen değer 5'in üzerinde olmalı, hiçbir hücrede 1'in altına düşmemelidir. Burada en küçük beklenen değer 28.26 — kural rahatça sağlanıyor. Küçük örneklemli 2×2 tablolarda bu şart bozulduğunda Fisher'ın kesin testi (fisher.test) devreye girer. Beklenen tabloyu kontrol etmeden ki-kare raporlamak, varsayım kontrolü yapmadan t testi koşturmakla aynı eksikliktir.

4. Etki Büyüklüğü: Cramer V

library(effectsize)
cramers_v(tablo)
# Cramer's V (adj.) = 0.11

Cramer V, kategorik ilişkinin gücünü 0-1 arasında ölçer; kabaca .1 küçük, .3 orta, .5 büyük okunur. Buradaki 0.11, anlamlı çıksaydı bile ilişkinin zayıf olacağını söylüyor — yüzde farkları göze büyük görünse de tablo geneline yayılan tutarlı bir desen yok. p ve V'yi birlikte okumak dengeyi kurar: p "var mı", V "ne kadar güçlü" sorusuna bakar.

5. Anlamsız Sonucu Raporlamak

Tez kalıbı: "Cinsiyet ile tercih edilen sosyal medya platformu arasında anlamlı bir ilişki bulunmamıştır; χ²(2, N=240)=4.93, p=.085, Cramer V=.11."

Anlamsız sonuç tezin zayıf noktası değildir; dürüst raporlanan bulgudur ve tartışma bölümüne malzeme verir: örneklem yapısı, ölçümün tek soruya dayanması, platform kategorilerinin genişliği tartışılabilir. Öğrencilerin en riskli refleksi burada ortaya çıkar — kategorileri birleştirip testi tekrar denemek, alt gruplara bölüp "anlamlı çıkan" parçayı raporlamak. Analiz kararları veri toplanmadan önce verilir; sonuca bakarak test değiştirmek (p-hacking) etik ihlaldir ve deneyimli jüri bunu desenin tutarsızlığından fark eder.

6. Grafik ve Dosyalar

Cinsiyete göre platform tercih yüzdelerini kıyaslayan gruplu sütun grafiği

Gruplu sütun grafiği çapraz tablonun görsel hâlidir; Instagram sütunlarındaki fark göze çarpar ama test bu farkın şans sınırları içinde kaldığını gösterdi — grafik ile testin birlikte sunulması okuyucuya tam resmi verir.

Örnek veriyi indir (.csv) — 240 katılımcı, cinsiyet ve platform

Script ile veriyi aynı klasörde çalıştırıp çapraz tablodan Cramer V'ye tüm çıktıyı üretebilirsiniz. Kategorik değil sayısal iki değişkenin ilişkisi söz konusuysa doğru araç korelasyon analizi; hangi veri tipine hangi testin geldiğini tek tabloda görmek için test seçimi rehberi hazır. Anket verisi analizini baştan sona — ölçek hazırlama, veri temizliği, test seçimi, raporlama — uygulamalı öğrenmek isteyenler için R veri analizi eğitimi bu akışın tamamını kapsıyor.

Sıkça Sorulan Sorular

Yüzdeler farklı görünürken ki-kare neden anlamsız çıktı?

Test yalnızca yüzde farkına değil, farkın örneklem büyüklüğüne göre şansla oluşma olasılığına bakar. 240 kişide %45'e karşı %33'lük fark, üç kategorili tabloda p=0.085 üretir — eşiğe yakın ama üstünde. Aynı yüzdeler 500 kişilik örneklemde büyük olasılıkla anlamlı çıkardı. Göz kararı fark ile istatistiksel kanıt ayrımının en öğretici örneklerinden biridir.

p=0.085 için 'marjinal anlamlılık' veya 'eğilim' yazabilir miyim?

Önerilmez. Eşik 0.05 olarak belirlendiyse sonuç ikilidir: anlamlı ya da değil. 'Anlamlılığa yaklaşan eğilim' ifadeleri metodolojik eleştiri alır çünkü eşiği sonuca göre esnetme izlenimi verir. Doğru yol, sonucu 'anlamlı bulunmamıştır' diye raporlayıp tartışmada örneklem gücüne değinmektir.

Beklenen frekans 5'in altında kalırsa ne yapılır?

2×2 tablolarda Fisher'ın kesin testi (fisher.test) kullanılır — küçük frekanslarda tam olasılık hesaplar. Daha büyük tablolarda seyrek kategorileri anlamlı biçimde birleştirmek (analiz öncesinde ve gerekçesiyle) veya chisq.test'in simulate.p.value=TRUE seçeneğiyle simülasyon tabanlı p almak çözümdür. R zaten bu durumda uyarı mesajı vererek sizi bilgilendirir.

Ki-kare hangi yönde ilişki olduğunu söyler mi?

Hayır — test yalnızca genel bağımsızlığı sınar. Hangi hücrelerin sapma yarattığını görmek için standartlaştırılmış artıklara bakılır: sonuc$stdres komutu her hücrenin beklenen değerden kaç standart birim saptığını verir; ±1.96'yı aşan hücreler deseni sürükleyen yerlerdir. Anlamlı çıkan testlerde bu artık analizi yorumun ana malzemesidir.

Ki-kare ile McNemar testi arasındaki fark nedir?

Ki-kare bağımsızlık testi, birbirinden bağımsız kişilerin oluşturduğu grupları karşılaştırır. McNemar ise aynı kişilerin iki zamandaki kategorik cevabını inceler — kampanya öncesi/sonrası tercih değişimi gibi. Tekrarlı ölçüm verisine sıradan ki-kare uygulamak, bağımsızlık varsayımını ihlal eder ve p değerini geçersiz kılar.

Likert ölçeği toplam puanına ki-kare uygulanır mı?

Uygulanmaz — toplam puan sayısal bir değişkendir; grup karşılaştırması için t testi, ANOVA veya nonparametrik karşılıkları kullanılır. Ki-kare yalnızca kategorik × kategorik ilişkiler içindir. Tek bir Likert maddesini kategori olarak ele almak teknik olarak mümkündür ama bilgi kaybettirir; ölçek verisinde sayısal analiz her zaman önceliklidir.