R KORELASYON ANALİZİ

Veri Akademi7 dk okuma
R mavi logosu yanında aşağı eğimli saçılım noktaları ve ilişki doğrusunu gösteren şema

Korelasyon, hakkında en çok yanlış cümle kurulan istatistik kavramı olabilir: "r=-0.78 çıktı, demek ki antrenman koşu süresini düşürüyor." Bu cümledeki hata gizli değil ama gözden kaçıyor — korelasyon iki değişkenin birlikte hareket ettiğini gösterir, birinin diğerine yol açtığını değil. Belki genetik kapasitesi yüksek sporcular hem daha çok antrenman yapıyor hem daha hızlı koşuyor; ilişkiyi üçüncü bir değişken üretiyor olabilir. Tez jürisinin en sık çizdiği cümle türü, korelasyonu nedensellik gibi yazan cümledir.

Örneğimiz spor bilimlerinden: 40 sporcunun haftalık antrenman saati ile 3000 metre koşu süresi. Veri, bir de ders barındırıyor — değişkenlerden biri normal dağılmıyor ve bu, hangi korelasyon katsayısını raporlayacağımızı değiştiriyor. Tüm sayılar gerçek çalıştırmadan.

R scriptini indir (.R) — veri: r-korelasyon-analizi-veri.csv

1. Önce Saçılım Grafiği

Antrenman saati ile koşu süresi arasındaki aşağı eğimli saçılım grafiği ve uyum doğrusu

Korelasyonda ilk adım katsayı değil grafiktir. Saçılım grafiği üç şeyi tek bakışta gösterir: ilişkinin yönü (burada aşağı eğim — antrenman arttıkça süre kısalıyor), biçimi (doğrusal mı, kavisli mi) ve aykırı değerler. Pearson katsayısı yalnızca doğrusal ilişkiyi ölçer; U biçimli kusursuz bir ilişkide bile r sıfıra yakın çıkar. Grafiğe bakmadan katsayı raporlamak, haritasız yola çıkmaktır — Anscombe'un ünlü dörtlüsü, aynı r değerini üreten dört bambaşka deseni tam bu yüzden ders kitaplarına girmiştir.

2. Pearson mı Spearman mı: Normallik Kararı

shapiro.test(veri$antrenman_saat)   # W = 0.937, p = 0.028  → normal DEĞİL
shapiro.test(veri$kosu_suresi_dk)   # W = 0.977, p = 0.569  → normal

Pearson katsayısının anlamlılık testi normallik varsayımına yaslanır; Spearman ise sıralar üzerinden çalışır ve varsayım istemez. Burada antrenman saati p=0.028 ile normallikten sapıyor — 40 kişilik örneklemde bu ihlal görmezden gelinemez. Karar: Spearman raporlanır. Pearson'ı da hesaplayıp ikisini karşılaştırmak öğreticidir; sonuçlar yakınsa (burada olacağı gibi) bulgunun sağlamlığına dair ek güven verir. Normallik kararının ayrıntılı akışı normallik testi yazısında.

Antrenman saati ve koşu süresi değişkenlerinin histogram panelleri, antrenman dağılımı çarpık

3. cor.test Çıktısının Okunması

cor.test(veri$antrenman_saat, veri$kosu_suresi_dk)           # Pearson
# r = -0.778, t = -7.64, df = 38, p = 3.441e-09
# 95% CI: [-0.877, -0.616]

cor.test(veri$antrenman_saat, veri$kosu_suresi_dk,
         method = "spearman")                                 # Spearman
# rho = -0.776, p = 3.941e-09

İki katsayı neredeyse çakışıyor: Pearson r=−0.778, Spearman rho=−0.776. Her ikisinde de p değeri 0.05'in çok altında — ilişki anlamlı. Pearson çıktısındaki güven aralığı [−0.877, −0.616] ayrıca değerli: evrendeki gerçek korelasyonun %95 güvenle bu bantta olduğunu söyler ve bandın sıfırdan uzaklığı ilişkinin sağlamlığını gösterir. Spearman'da R güven aralığı vermez; gerekiyorsa bootstrap ile hesaplanır.

4. Katsayının Gücü ve Yönü

Katsayı iki bilgiyi tek sayıda taşır:

  • İşaret = yön. Negatif değer ters ilişki demektir: antrenman saati arttıkça koşu süresi düşüyor. Spor bağlamında bu "kötü" değil tam tersine beklenen sonuçtur — süre düşmek hızlanmak demek. Negatif katsayıyı otomatik olumsuz okumak sık görülen yorum kazasıdır.
  • Mutlak değer = güç. Yaygın eşikler: .10 zayıf, .30 orta, .50 üzeri güçlü. 0.78 güçlü bir ilişkidir. Karesi de konuşur: r²=0.61 — koşu süresindeki değişkenliğin %61'i antrenman saatiyle paylaşılıyor.

Anlamlılık ile gücü ayırmak burada da kritiktir: 1000 kişilik örneklemde r=0.07 bile anlamlı çıkar ama pratikte önemsizdir. Katsayının kendisi etki büyüklüğüdür; p yalnızca "sıfırdan farklı mı" sorusuna cevaptır.

5. Nedensellik Tuzağı ve Raporlama

Tez kalıbı: "Haftalık antrenman saati ile 3000 m koşu süresi arasında güçlü ve negatif yönlü anlamlı bir ilişki bulunmuştur; Spearman rho=−.78, p<.001. Antrenman saati yüksek sporcuların koşu süreleri daha kısadır."

Cümlede fiil seçimine dikkat: "ilişki bulunmuştur", "birlikte değişmektedir" — evet; "düşürmektedir", "etkilemektedir", "yol açmaktadır" — hayır. Nedensellik iddiası deneysel tasarım (rastgele atama, kontrol grubu) ister; korelasyonel veriden nedensellik çıkarmak, gözlemsel çalışmanın sınırını aşmaktır. İlişkiden tahmine geçmek — "60 bin TL gelirli hane ne kadar gıda harcar" tipi sorulara cevap — bir sonraki adımın, regresyon analizinin işidir.

Örnek veriyi indir (.csv) — 40 sporcu, antrenman ve koşu süresi

Script ile veriyi aynı klasörde çalıştırıp saçılım grafiğinden iki katsayıya bütün çıktıyı üretebilirsiniz. Korelasyon matrisleri, kısmi korelasyon ve çok değişkenli ilişki desenlerini kendi verinizde kurmayı öğrenmek için R veri analizi eğitimi uygulamalı bir yol sunuyor; makine öğrenmesi yönüne uzanmak isteyenler Python veri analizi eğitimine bakabilir.

Sıkça Sorulan Sorular

Pearson yerine Spearman'ı ne zaman seçmeliyim?

Üç durumda Spearman öne geçer: değişkenlerden en az biri normal dağılmıyorsa (bu örnekte antrenman saati p=0.028), veri sıralı ölçekteyse (Likert, derecelendirme) veya belirgin aykırı değerler varsa. İlişki doğrusal değil ama tekdüze artan/azalan biçimdeyse de Spearman daha doğru ölçer. Veri normal ve sürekli ise Pearson standart tercihtir.

Negatif korelasyon kötü sonuç mu demektir?

Hayır — işaret yalnızca ilişkinin yönünü gösterir, değerini değil. Antrenman-koşu süresi örneğinde negatif katsayı istenen tabloyu anlatır: çalışan sporcu hızlanır. Yorum her zaman değişkenlerin bağlamıyla yapılır; 'devamsızlık ile not' negatif çıkması da, 'çalışma saati ile not' pozitif çıkması da aynı olumlu hikayeyi anlatabilir.

r kaç olursa 'güçlü ilişki' denir?

Yaygın kabul .10 zayıf, .30 orta, .50 ve üzeri güçlü şeklindedir; bu örnekteki .78 açıkça güçlüdür. Ancak eşikler alana göre esner — davranış bilimlerinde .40 kayda değerken, fiziksel ölçümlerde .90 beklenebilir. Katsayıyı alanınızın literatüründeki tipik değerlerle birlikte yorumlamak en sağlıklısıdır.

Korelasyon anlamlı çıktı; artık X, Y'ye neden oluyor diyebilir miyim?

Diyemezsiniz. Korelasyon üç açıklamayla uyumludur: X→Y, Y→X veya her ikisini etkileyen üçüncü değişken. Dondurma satışı ile boğulma vakaları güçlü korelasyon gösterir — ikisini de yaz sıcağı üretir. Nedensellik ancak deneysel tasarımla (rastgele atama) veya güçlü nedensel çıkarım yöntemleriyle savunulur; korelasyonel tezde fiiller 'ilişkilidir' düzeyinde kalmalıdır.

İkiden fazla değişkenin korelasyonunu tek seferde nasıl alırım?

cor(veri[ , sayisal_sutunlar]) korelasyon matrisini üretir; psych paketinin corr.test fonksiyonu her hücre için p değerlerini de ekler. Görselleştirme için corrplot paketi matris ısı haritası çizer. Çok sayıda test yapıldığı için p düzeltmesi (Bonferroni veya Holm) uygulamak — corr.test bunu varsayılan yapar — raporun güvenilirliği açısından önemlidir.

Aykırı değer korelasyonu ne kadar bozar?

Pearson'da tek bir uç gözlem katsayıyı ciddi biçimde şişirebilir veya söndürebilir — katsayı ortalamalara dayalı olduğu için kaldıraç etkisi büyüktür. Saçılım grafiğinde köşede duran yalnız noktalar bu yüzden mutlaka incelenir: veri girişi hatasıysa düzeltilir, gerçekse Spearman ile sağlamlık kontrolü yapılıp iki sonuç birlikte raporlanabilir.