R İLE T TESTİ

Veri Akademi8 dk okuma
R mavi logosu yanında iki grubun ortalamalarını kıyaslayan çift kutu grafiği şeması

Eğitim bilimleri yüksek lisans öğrencisi iki sınıfta iki farklı yöntem denedi: bir şube geleneksel anlatımla, diğeri etkileşimli etkinliklerle işledi. Dönem sonu puanları ortada — etkileşimli grubun ortalaması görünür biçimde yüksek. Ama danışmanın sorusu da ortada: "Bu fark gerçek mi, yoksa 24'er kişilik örneklemin şansı mı?" İşte o soruya cevap veren araç bağımsız örneklem t testidir ve R'da tek satırdır.

Tek satır olan komuttur; öğrencilerin asıl zorlandığı kısım öncesi ve sonrasıdır — varsayımların kontrolü, çıktının doğru okunması ve tezde nasıl raporlanacağı. Bu yazı üçünü de gerçek bir veri seti üzerinden yürütüyor; bütün sayılar aşağıdaki scriptin çalıştırılmış çıktısından.

R scriptini indir (.R) — veri: r-t-testi-veri.csv

1. Hipotez ve Veri Düzeni

Sıfır hipotezi H0 "iki yöntemin puan ortalamaları eşittir", alternatif H1 "eşit değildir" der. Veri uzun formatta düzenlenir — her satır bir öğrenci, bir sütun grubu, bir sütun puanı taşır:

veri <- read.csv("r-t-testi-veri.csv", fileEncoding = "UTF-8")
table(veri$yontem)
# Etkilesimli  Geleneksel
#          24          24

tapply(veri$puan, veri$yontem, mean)
#    77.00       65.29
tapply(veri$puan, veri$yontem, sd)
#     7.35        7.84

Betimleyici tablo hikayeyi kurar: etkileşimli grup 77.00, geleneksel grup 65.29 ortalamaya sahip; standart sapmalar birbirine yakın. Excel'den gelen verilerde grupların iki ayrı sütuna yazılması sık görülür — t.test'in formül arayüzü uzun format ister, geniş formattaki veriyi önce dönüştürmek gerekir.

2. Varsayım Kontrolü: Normallik ve Varyans

Bağımsız örneklem t testinin iki varsayımı sırayla kontrol edilir — her grup için ayrı normallik, gruplar arasında varyans eşitliği:

shapiro.test(veri$puan[veri$yontem == "Geleneksel"])   # W=0.958, p=0.398
shapiro.test(veri$puan[veri$yontem == "Etkilesimli"])  # W=0.961, p=0.457

library(car)
leveneTest(puan ~ as.factor(yontem), data = veri)
# F = 0.023, p = 0.88

İki Shapiro da p>0.05 — her iki grup normal dağılıyor. Levene testi de p=0.88 ile varyansların eşit olduğunu söylüyor (bu testte de p>0.05 istenen sonuçtur). İkisi birden sağlandığı için klasik Student t testine geçilebilir. Normallik sağlanmasaydı yol Mann-Whitney U testine dönerdi; sadece varyans eşitliği bozulsaydı Welch düzeltmesi (R'ın zaten varsayılanı) yeterdi.

3. t.test Komutu ve Çıktının Okunması

t.test(puan ~ yontem, data = veri, var.equal = TRUE)

#   Two Sample t-test
# t = 5.3367, df = 46, p-value = 2.817e-06
# 95 percent confidence interval:
#   7.292181 16.124486
# mean in group Etkilesimli: 77.00
# mean in group Geleneksel: 65.29

Çıktının dört kritik parçası var:

  • t = 5.34: gruplar arası farkın, fark ölçüsünün standart hatasına oranı — büyüdükçe fark güçlenir.
  • df = 46: serbestlik derecesi (24+24−2); raporlama cümlesinde t'nin yanına yazılır.
  • p = 2.817e-06: bilimsel gösterim tuzağına dikkat — bu sayı 0.0000028'dir, 2.8 değil. "e-06" ifadesini büyük sayı sanmak, yeni başlayanların gerçek ve utandırıcı bir hatasıdır. 0.05'ten çok küçük olduğu için fark anlamlıdır.
  • Güven aralığı [7.29, 16.12]: gerçek fark %95 güvenle bu aralıktadır; aralığın sıfırı içermemesi anlamlılığın bir başka ifadesidir.

4. Etki Büyüklüğü: Cohen d

library(effectsize)
cohens_d(puan ~ yontem, data = veri)
# Cohen's d = 1.54, 95% CI [0.89, 2.18]
İki yöntemin puan yoğunluk eğrileri, etkileşimli grup sağda ve örtüşme alanı dar

p değeri farkın var olduğunu söyler, ne kadar büyük olduğunu söylemez — büyük örneklemde önemsiz farklar bile anlamlı çıkabilir. Bu yüzden modern dergiler ve pek çok enstitü etki büyüklüğünü zorunlu tutar. Klasik eşikler d=0.2 küçük, 0.5 orta, 0.8 büyük; buradaki 1.54 çok büyük bir etkidir — yöntem farkı yalnızca istatistiksel değil, pratik olarak da güçlü.

5. Tez Raporlama Cümlesi

Bütün parçalar tek cümlede birleşir; APA düzenine uygun kalıp şudur:

"Etkileşimli yöntemle öğrenen grubun başarı puanları (Ort=77.00, SS=7.35), geleneksel yöntemle öğrenen gruptan (Ort=65.29, SS=7.84) anlamlı düzeyde yüksek bulunmuştur; t(46)=5.34, p<.001, d=1.54."

Cümlenin iskeletindeki sıra sabittir: iki grubun betimleyicileri → yön (hangisi yüksek) → t(df), p, etki büyüklüğü. p değerini "p=0.0000028" diye yazmak yerine p<.001 kullanmak yaygın kuraldır. Bu kalıbı bir kez oturtan öğrenci, ANOVA ve korelasyon raporlarını da aynı mantıkla kurar.

6. Grafik ve Dosyalar

İki öğretim yönteminin puan dağılımlarını kıyaslayan kutu grafiği, etkileşimli grup belirgin yüksek

Kutu grafiği t testinin görsel özetidir: kutuların örtüşme miktarı azaldıkça fark güçlenir. Buradaki iki kutunun medyanları arasındaki açıklık, d=1.54'ün görsel karşılığı.

Örnek veriyi indir (.csv) — 48 öğrenci, iki yöntem

Script ile veriyi aynı klasörde çalıştırın; varsayım testlerinden raporlama değerlerine kadar bu yazıdaki her sayıyı konsolunuzda göreceksiniz. Üç ve daha fazla grup kıyaslamak gerektiğinde t testi yerine ANOVA devreye girer — ikiden fazla grupta arka arkaya t testleri yapmak hata oranını şişirir. Bu testleri kendi tez verinizde danışman eşliğinde kurmak isterseniz R veri analizi eğitimi varsayım kontrolünden rapor yazımına aynı akışı uygulamalı işliyor; veri görselleştirmeyi ayrıca derinleştirmek isteyenler Power BI eğitimini inceleyebilir.

Sıkça Sorulan Sorular

t testinin p değeri 2.817e-06 ne demek, bu sayı nasıl okunur?

Bilimsel gösterimdir: 2.817 × 10⁻⁶, yani 0.000002817. Virgülü altı basamak sola kaydırın. 0.05'ten çok küçük olduğu için fark anlamlıdır. 'e-06' ifadesini 2.8 gibi büyük bir sayı sanıp 'p anlamsız çıktı' demek sık yapılan bir okuma hatasıdır — e'den sonraki eksi işareti sayının çok küçük olduğunu gösterir.

var.equal = TRUE ne zaman yazılır, Welch testi nedir?

Levene testi varyansların eşit olduğunu gösteriyorsa (p>0.05) var.equal=TRUE ile klasik Student t testi kullanılır. Yazılmazsa R varsayılan olarak Welch düzeltmesi uygular — varyanslar eşit olmadığında da güvenilir sonuç veren versiyondur. Emin değilseniz Welch'i (varsayılanı) kullanmak güvenli taraftır; çoğu istatistikçi bunu önerir.

Bağımsız örneklem ile eşleştirilmiş t testi arasındaki fark nedir?

Bağımsız örneklem, iki ayrı grubu karşılaştırır (deney-kontrol sınıfları gibi). Eşleştirilmiş (paired) test, aynı kişilerin iki ölçümünü karşılaştırır — ön test/son test tasarımı. R'da paired=TRUE parametresiyle çalışır. Yanlış tür seçmek sonucu tamamen değiştirir: ön test/son test verisine bağımsız test uygulamak, kişiler arası farkı gruplar arası fark sanmaktır.

Grup başına kaç kişi olmalı, 24 kişi yeterli mi?

Kesin bir alt sınır yoktur; belirleyici olan beklenen etki büyüklüğüdür. Büyük etkiler (d≈0.8 ve üzeri) küçük örneklemle yakalanır — bu örnekte 24+24 kişiyle d=1.54 rahatça anlamlı çıktı. Küçük etkiler yüzlerce katılımcı ister. Tez planlarken pwr paketiyle güç analizi yapmak, 'kaç kişi toplamalıyım' sorusunun bilimsel cevabıdır.

p anlamlı ama Cohen d küçük çıkarsa ne yazmalıyım?

İkisini birlikte raporlayıp dürüst yorumlayın: 'fark istatistiksel olarak anlamlı ancak etki büyüklüğü küçüktür (d=0.15), pratik önemi sınırlıdır' gibi. Bu durum genellikle çok büyük örneklemlerde ortaya çıkar. p'yi gizlemek de d'yi gizlemek de eksik raporlamadır — jüri iki değeri birlikte görmek ister.

Normallik sağlanmazsa t testi tamamen yasak mı?

Değil — grup başına 30'a yaklaşan örneklemlerde t testi hafif sapmalara dayanıklıdır (merkezi limit teoremi). Ciddi çarpıklık veya çok küçük gruplar söz konusuysa Mann-Whitney U testi doğru tercihtir; medyanlar üzerinden karşılaştırır ve dağılım varsayımı istemez. Karar tek p değerine değil, çarpıklık ve grafiklerle birlikte verilir.