R İLE T TESTİ

Eğitim bilimleri yüksek lisans öğrencisi iki sınıfta iki farklı yöntem denedi: bir şube geleneksel anlatımla, diğeri etkileşimli etkinliklerle işledi. Dönem sonu puanları ortada — etkileşimli grubun ortalaması görünür biçimde yüksek. Ama danışmanın sorusu da ortada: "Bu fark gerçek mi, yoksa 24'er kişilik örneklemin şansı mı?" İşte o soruya cevap veren araç bağımsız örneklem t testidir ve R'da tek satırdır.
Tek satır olan komuttur; öğrencilerin asıl zorlandığı kısım öncesi ve sonrasıdır — varsayımların kontrolü, çıktının doğru okunması ve tezde nasıl raporlanacağı. Bu yazı üçünü de gerçek bir veri seti üzerinden yürütüyor; bütün sayılar aşağıdaki scriptin çalıştırılmış çıktısından.
R scriptini indir (.R) — veri: r-t-testi-veri.csv1. Hipotez ve Veri Düzeni
Sıfır hipotezi H0 "iki yöntemin puan ortalamaları eşittir", alternatif H1 "eşit değildir" der. Veri uzun formatta düzenlenir — her satır bir öğrenci, bir sütun grubu, bir sütun puanı taşır:
veri <- read.csv("r-t-testi-veri.csv", fileEncoding = "UTF-8")
table(veri$yontem)
# Etkilesimli Geleneksel
# 24 24
tapply(veri$puan, veri$yontem, mean)
# 77.00 65.29
tapply(veri$puan, veri$yontem, sd)
# 7.35 7.84Betimleyici tablo hikayeyi kurar: etkileşimli grup 77.00, geleneksel grup 65.29 ortalamaya sahip; standart sapmalar birbirine yakın. Excel'den gelen verilerde grupların iki ayrı sütuna yazılması sık görülür — t.test'in formül arayüzü uzun format ister, geniş formattaki veriyi önce dönüştürmek gerekir.
2. Varsayım Kontrolü: Normallik ve Varyans
Bağımsız örneklem t testinin iki varsayımı sırayla kontrol edilir — her grup için ayrı normallik, gruplar arasında varyans eşitliği:
shapiro.test(veri$puan[veri$yontem == "Geleneksel"]) # W=0.958, p=0.398
shapiro.test(veri$puan[veri$yontem == "Etkilesimli"]) # W=0.961, p=0.457
library(car)
leveneTest(puan ~ as.factor(yontem), data = veri)
# F = 0.023, p = 0.88İki Shapiro da p>0.05 — her iki grup normal dağılıyor. Levene testi de p=0.88 ile varyansların eşit olduğunu söylüyor (bu testte de p>0.05 istenen sonuçtur). İkisi birden sağlandığı için klasik Student t testine geçilebilir. Normallik sağlanmasaydı yol Mann-Whitney U testine dönerdi; sadece varyans eşitliği bozulsaydı Welch düzeltmesi (R'ın zaten varsayılanı) yeterdi.
3. t.test Komutu ve Çıktının Okunması
t.test(puan ~ yontem, data = veri, var.equal = TRUE)
# Two Sample t-test
# t = 5.3367, df = 46, p-value = 2.817e-06
# 95 percent confidence interval:
# 7.292181 16.124486
# mean in group Etkilesimli: 77.00
# mean in group Geleneksel: 65.29Çıktının dört kritik parçası var:
- t = 5.34: gruplar arası farkın, fark ölçüsünün standart hatasına oranı — büyüdükçe fark güçlenir.
- df = 46: serbestlik derecesi (24+24−2); raporlama cümlesinde t'nin yanına yazılır.
- p = 2.817e-06: bilimsel gösterim tuzağına dikkat — bu sayı 0.0000028'dir, 2.8 değil. "e-06" ifadesini büyük sayı sanmak, yeni başlayanların gerçek ve utandırıcı bir hatasıdır. 0.05'ten çok küçük olduğu için fark anlamlıdır.
- Güven aralığı [7.29, 16.12]: gerçek fark %95 güvenle bu aralıktadır; aralığın sıfırı içermemesi anlamlılığın bir başka ifadesidir.
4. Etki Büyüklüğü: Cohen d
library(effectsize)
cohens_d(puan ~ yontem, data = veri)
# Cohen's d = 1.54, 95% CI [0.89, 2.18]
p değeri farkın var olduğunu söyler, ne kadar büyük olduğunu söylemez — büyük örneklemde önemsiz farklar bile anlamlı çıkabilir. Bu yüzden modern dergiler ve pek çok enstitü etki büyüklüğünü zorunlu tutar. Klasik eşikler d=0.2 küçük, 0.5 orta, 0.8 büyük; buradaki 1.54 çok büyük bir etkidir — yöntem farkı yalnızca istatistiksel değil, pratik olarak da güçlü.
5. Tez Raporlama Cümlesi
Bütün parçalar tek cümlede birleşir; APA düzenine uygun kalıp şudur:
"Etkileşimli yöntemle öğrenen grubun başarı puanları (Ort=77.00, SS=7.35), geleneksel yöntemle öğrenen gruptan (Ort=65.29, SS=7.84) anlamlı düzeyde yüksek bulunmuştur; t(46)=5.34, p<.001, d=1.54."
Cümlenin iskeletindeki sıra sabittir: iki grubun betimleyicileri → yön (hangisi yüksek) → t(df), p, etki büyüklüğü. p değerini "p=0.0000028" diye yazmak yerine p<.001 kullanmak yaygın kuraldır. Bu kalıbı bir kez oturtan öğrenci, ANOVA ve korelasyon raporlarını da aynı mantıkla kurar.
6. Grafik ve Dosyalar

Kutu grafiği t testinin görsel özetidir: kutuların örtüşme miktarı azaldıkça fark güçlenir. Buradaki iki kutunun medyanları arasındaki açıklık, d=1.54'ün görsel karşılığı.
Örnek veriyi indir (.csv) — 48 öğrenci, iki yöntemScript ile veriyi aynı klasörde çalıştırın; varsayım testlerinden raporlama değerlerine kadar bu yazıdaki her sayıyı konsolunuzda göreceksiniz. Üç ve daha fazla grup kıyaslamak gerektiğinde t testi yerine ANOVA devreye girer — ikiden fazla grupta arka arkaya t testleri yapmak hata oranını şişirir. Bu testleri kendi tez verinizde danışman eşliğinde kurmak isterseniz R veri analizi eğitimi varsayım kontrolünden rapor yazımına aynı akışı uygulamalı işliyor; veri görselleştirmeyi ayrıca derinleştirmek isteyenler Power BI eğitimini inceleyebilir.
Sıkça Sorulan Sorular
t testinin p değeri 2.817e-06 ne demek, bu sayı nasıl okunur?
Bilimsel gösterimdir: 2.817 × 10⁻⁶, yani 0.000002817. Virgülü altı basamak sola kaydırın. 0.05'ten çok küçük olduğu için fark anlamlıdır. 'e-06' ifadesini 2.8 gibi büyük bir sayı sanıp 'p anlamsız çıktı' demek sık yapılan bir okuma hatasıdır — e'den sonraki eksi işareti sayının çok küçük olduğunu gösterir.
var.equal = TRUE ne zaman yazılır, Welch testi nedir?
Levene testi varyansların eşit olduğunu gösteriyorsa (p>0.05) var.equal=TRUE ile klasik Student t testi kullanılır. Yazılmazsa R varsayılan olarak Welch düzeltmesi uygular — varyanslar eşit olmadığında da güvenilir sonuç veren versiyondur. Emin değilseniz Welch'i (varsayılanı) kullanmak güvenli taraftır; çoğu istatistikçi bunu önerir.
Bağımsız örneklem ile eşleştirilmiş t testi arasındaki fark nedir?
Bağımsız örneklem, iki ayrı grubu karşılaştırır (deney-kontrol sınıfları gibi). Eşleştirilmiş (paired) test, aynı kişilerin iki ölçümünü karşılaştırır — ön test/son test tasarımı. R'da paired=TRUE parametresiyle çalışır. Yanlış tür seçmek sonucu tamamen değiştirir: ön test/son test verisine bağımsız test uygulamak, kişiler arası farkı gruplar arası fark sanmaktır.
Grup başına kaç kişi olmalı, 24 kişi yeterli mi?
Kesin bir alt sınır yoktur; belirleyici olan beklenen etki büyüklüğüdür. Büyük etkiler (d≈0.8 ve üzeri) küçük örneklemle yakalanır — bu örnekte 24+24 kişiyle d=1.54 rahatça anlamlı çıktı. Küçük etkiler yüzlerce katılımcı ister. Tez planlarken pwr paketiyle güç analizi yapmak, 'kaç kişi toplamalıyım' sorusunun bilimsel cevabıdır.
p anlamlı ama Cohen d küçük çıkarsa ne yazmalıyım?
İkisini birlikte raporlayıp dürüst yorumlayın: 'fark istatistiksel olarak anlamlı ancak etki büyüklüğü küçüktür (d=0.15), pratik önemi sınırlıdır' gibi. Bu durum genellikle çok büyük örneklemlerde ortaya çıkar. p'yi gizlemek de d'yi gizlemek de eksik raporlamadır — jüri iki değeri birlikte görmek ister.
Normallik sağlanmazsa t testi tamamen yasak mı?
Değil — grup başına 30'a yaklaşan örneklemlerde t testi hafif sapmalara dayanıklıdır (merkezi limit teoremi). Ciddi çarpıklık veya çok küçük gruplar söz konusuysa Mann-Whitney U testi doğru tercihtir; medyanlar üzerinden karşılaştırır ve dağılım varsayımı istemez. Karar tek p değerine değil, çarpıklık ve grafiklerle birlikte verilir.


