Kümelenmiş Veri
Clustered Data
Tanım
Belirli nitelikler bakımından birbirine benzer alt gruplar oluşturan ve bu alt gruplar arasındaki ayrımların genel varyasyonu açıklamaya yardımcı olduğu gözlem veya puanlar seti.
Örnek Vaka / Uygulama
Bir eğitim psikoloğu araştırmasında, 20 farklı okuldan rastgele seçilen 1000 öğrencinin akademik başarısını incelemektedir. Aynı okul içindeki öğrencilerin öğretmen kalitesi, sosyoekonomik çevre ve okul kültürü gibi paylaşılan etkenlerden dolayı puanları birbirinden tamamen bağımsız değildir; yani veriler okullara göre 'kümelenmiştir'.
Derin Analiz
Kümelenmiş veri yapısı, istatistiksel modellemede klasik bağımsızlık varsayımının ihlal edildiği durumları ifade eder. Gözlemlerin tamamen rastgele ve birbirinden bağımsız olmadığı, aksine hiyerarşik veya ortak bağlamlar (örneğin okullardaki öğrenciler, hastanelerdeki hastalar veya coğrafi bölgelerdeki bireyler) paylaştığı durumlarda ortaya çıkar. Bu veri yapısında, küme içindeki gözlemler arası korelasyon (intraclass correlation) yüksektir. Geleneksel regresyon analizleri bu bağımlılığı göz ardı ederse standart hatalar sapmalı hesaplanır ve tip-1 hata oranı artar. Bu nedenle çok düzeyli modelleme (multilevel modeling), genelleştirilmiş tahmin denklemleri (GEE) veya küme-sağlam standart hatalar (cluster-robust standard errors) gibi gelişmiş analitik yaklaşımlar zorunludur.
Etimoloji
İngilizce 'cluster' (küme, salkım; kökeni Eski İngilizce 'clyster') ve 'data' (veriler, Latince 'datum' [verilen şey] sözcüğünün çoğulu) terimlerinin birleşiminden oluşur.
Karıştırmayın
Yığın veri (pooled data) veya panel veri ile karıştırılabilir; temel fark, kümelenmiş verinin hiyerarşik veya doğal gruplama yapısına odaklanması, panel verinin ise genellikle zaman serisi dinamiklerini barındırmasıdır.