R KORELASYON ANALİZİ

Korelasyon, hakkında en çok yanlış cümle kurulan istatistik kavramı olabilir: "r=-0.78 çıktı, demek ki antrenman koşu süresini düşürüyor." Bu cümledeki hata gizli değil ama gözden kaçıyor — korelasyon iki değişkenin birlikte hareket ettiğini gösterir, birinin diğerine yol açtığını değil. Belki genetik kapasitesi yüksek sporcular hem daha çok antrenman yapıyor hem daha hızlı koşuyor; ilişkiyi üçüncü bir değişken üretiyor olabilir. Tez jürisinin en sık çizdiği cümle türü, korelasyonu nedensellik gibi yazan cümledir.
Örneğimiz spor bilimlerinden: 40 sporcunun haftalık antrenman saati ile 3000 metre koşu süresi. Veri, bir de ders barındırıyor — değişkenlerden biri normal dağılmıyor ve bu, hangi korelasyon katsayısını raporlayacağımızı değiştiriyor. Tüm sayılar gerçek çalıştırmadan.
R scriptini indir (.R) — veri: r-korelasyon-analizi-veri.csv1. Önce Saçılım Grafiği

Korelasyonda ilk adım katsayı değil grafiktir. Saçılım grafiği üç şeyi tek bakışta gösterir: ilişkinin yönü (burada aşağı eğim — antrenman arttıkça süre kısalıyor), biçimi (doğrusal mı, kavisli mi) ve aykırı değerler. Pearson katsayısı yalnızca doğrusal ilişkiyi ölçer; U biçimli kusursuz bir ilişkide bile r sıfıra yakın çıkar. Grafiğe bakmadan katsayı raporlamak, haritasız yola çıkmaktır — Anscombe'un ünlü dörtlüsü, aynı r değerini üreten dört bambaşka deseni tam bu yüzden ders kitaplarına girmiştir.
2. Pearson mı Spearman mı: Normallik Kararı
shapiro.test(veri$antrenman_saat) # W = 0.937, p = 0.028 → normal DEĞİL
shapiro.test(veri$kosu_suresi_dk) # W = 0.977, p = 0.569 → normalPearson katsayısının anlamlılık testi normallik varsayımına yaslanır; Spearman ise sıralar üzerinden çalışır ve varsayım istemez. Burada antrenman saati p=0.028 ile normallikten sapıyor — 40 kişilik örneklemde bu ihlal görmezden gelinemez. Karar: Spearman raporlanır. Pearson'ı da hesaplayıp ikisini karşılaştırmak öğreticidir; sonuçlar yakınsa (burada olacağı gibi) bulgunun sağlamlığına dair ek güven verir. Normallik kararının ayrıntılı akışı normallik testi yazısında.

3. cor.test Çıktısının Okunması
cor.test(veri$antrenman_saat, veri$kosu_suresi_dk) # Pearson
# r = -0.778, t = -7.64, df = 38, p = 3.441e-09
# 95% CI: [-0.877, -0.616]
cor.test(veri$antrenman_saat, veri$kosu_suresi_dk,
method = "spearman") # Spearman
# rho = -0.776, p = 3.941e-09İki katsayı neredeyse çakışıyor: Pearson r=−0.778, Spearman rho=−0.776. Her ikisinde de p değeri 0.05'in çok altında — ilişki anlamlı. Pearson çıktısındaki güven aralığı [−0.877, −0.616] ayrıca değerli: evrendeki gerçek korelasyonun %95 güvenle bu bantta olduğunu söyler ve bandın sıfırdan uzaklığı ilişkinin sağlamlığını gösterir. Spearman'da R güven aralığı vermez; gerekiyorsa bootstrap ile hesaplanır.
4. Katsayının Gücü ve Yönü
Katsayı iki bilgiyi tek sayıda taşır:
- İşaret = yön. Negatif değer ters ilişki demektir: antrenman saati arttıkça koşu süresi düşüyor. Spor bağlamında bu "kötü" değil tam tersine beklenen sonuçtur — süre düşmek hızlanmak demek. Negatif katsayıyı otomatik olumsuz okumak sık görülen yorum kazasıdır.
- Mutlak değer = güç. Yaygın eşikler: .10 zayıf, .30 orta, .50 üzeri güçlü. 0.78 güçlü bir ilişkidir. Karesi de konuşur: r²=0.61 — koşu süresindeki değişkenliğin %61'i antrenman saatiyle paylaşılıyor.
Anlamlılık ile gücü ayırmak burada da kritiktir: 1000 kişilik örneklemde r=0.07 bile anlamlı çıkar ama pratikte önemsizdir. Katsayının kendisi etki büyüklüğüdür; p yalnızca "sıfırdan farklı mı" sorusuna cevaptır.
5. Nedensellik Tuzağı ve Raporlama
Tez kalıbı: "Haftalık antrenman saati ile 3000 m koşu süresi arasında güçlü ve negatif yönlü anlamlı bir ilişki bulunmuştur; Spearman rho=−.78, p<.001. Antrenman saati yüksek sporcuların koşu süreleri daha kısadır."
Cümlede fiil seçimine dikkat: "ilişki bulunmuştur", "birlikte değişmektedir" — evet; "düşürmektedir", "etkilemektedir", "yol açmaktadır" — hayır. Nedensellik iddiası deneysel tasarım (rastgele atama, kontrol grubu) ister; korelasyonel veriden nedensellik çıkarmak, gözlemsel çalışmanın sınırını aşmaktır. İlişkiden tahmine geçmek — "60 bin TL gelirli hane ne kadar gıda harcar" tipi sorulara cevap — bir sonraki adımın, regresyon analizinin işidir.
Örnek veriyi indir (.csv) — 40 sporcu, antrenman ve koşu süresiScript ile veriyi aynı klasörde çalıştırıp saçılım grafiğinden iki katsayıya bütün çıktıyı üretebilirsiniz. Korelasyon matrisleri, kısmi korelasyon ve çok değişkenli ilişki desenlerini kendi verinizde kurmayı öğrenmek için R veri analizi eğitimi uygulamalı bir yol sunuyor; makine öğrenmesi yönüne uzanmak isteyenler Python veri analizi eğitimine bakabilir.
Sıkça Sorulan Sorular
Pearson yerine Spearman'ı ne zaman seçmeliyim?
Üç durumda Spearman öne geçer: değişkenlerden en az biri normal dağılmıyorsa (bu örnekte antrenman saati p=0.028), veri sıralı ölçekteyse (Likert, derecelendirme) veya belirgin aykırı değerler varsa. İlişki doğrusal değil ama tekdüze artan/azalan biçimdeyse de Spearman daha doğru ölçer. Veri normal ve sürekli ise Pearson standart tercihtir.
Negatif korelasyon kötü sonuç mu demektir?
Hayır — işaret yalnızca ilişkinin yönünü gösterir, değerini değil. Antrenman-koşu süresi örneğinde negatif katsayı istenen tabloyu anlatır: çalışan sporcu hızlanır. Yorum her zaman değişkenlerin bağlamıyla yapılır; 'devamsızlık ile not' negatif çıkması da, 'çalışma saati ile not' pozitif çıkması da aynı olumlu hikayeyi anlatabilir.
r kaç olursa 'güçlü ilişki' denir?
Yaygın kabul .10 zayıf, .30 orta, .50 ve üzeri güçlü şeklindedir; bu örnekteki .78 açıkça güçlüdür. Ancak eşikler alana göre esner — davranış bilimlerinde .40 kayda değerken, fiziksel ölçümlerde .90 beklenebilir. Katsayıyı alanınızın literatüründeki tipik değerlerle birlikte yorumlamak en sağlıklısıdır.
Korelasyon anlamlı çıktı; artık X, Y'ye neden oluyor diyebilir miyim?
Diyemezsiniz. Korelasyon üç açıklamayla uyumludur: X→Y, Y→X veya her ikisini etkileyen üçüncü değişken. Dondurma satışı ile boğulma vakaları güçlü korelasyon gösterir — ikisini de yaz sıcağı üretir. Nedensellik ancak deneysel tasarımla (rastgele atama) veya güçlü nedensel çıkarım yöntemleriyle savunulur; korelasyonel tezde fiiller 'ilişkilidir' düzeyinde kalmalıdır.
İkiden fazla değişkenin korelasyonunu tek seferde nasıl alırım?
cor(veri[ , sayisal_sutunlar]) korelasyon matrisini üretir; psych paketinin corr.test fonksiyonu her hücre için p değerlerini de ekler. Görselleştirme için corrplot paketi matris ısı haritası çizer. Çok sayıda test yapıldığı için p düzeltmesi (Bonferroni veya Holm) uygulamak — corr.test bunu varsayılan yapar — raporun güvenilirliği açısından önemlidir.
Aykırı değer korelasyonu ne kadar bozar?
Pearson'da tek bir uç gözlem katsayıyı ciddi biçimde şişirebilir veya söndürebilir — katsayı ortalamalara dayalı olduğu için kaldıraç etkisi büyüktür. Saçılım grafiğinde köşede duran yalnız noktalar bu yüzden mutlaka incelenir: veri girişi hatasıysa düzeltilir, gerçekse Spearman ile sağlamlık kontrolü yapılıp iki sonuç birlikte raporlanabilir.


