Ana içeriğe atla
Psikoloji Sözlüğüm LogoPsikoloji Sözlüğüm

Kümelenmiş Veri

Clustered Data

Tanım

Belirli nitelikler bakımından birbirine benzer alt gruplar oluşturan ve bu alt gruplar arasındaki ayrımların genel varyasyonu açıklamaya yardımcı olduğu gözlem veya puanlar seti.

Örnek Vaka / Uygulama

Bir eğitim psikoloğu araştırmasında, 20 farklı okuldan rastgele seçilen 1000 öğrencinin akademik başarısını incelemektedir. Aynı okul içindeki öğrencilerin öğretmen kalitesi, sosyoekonomik çevre ve okul kültürü gibi paylaşılan etkenlerden dolayı puanları birbirinden tamamen bağımsız değildir; yani veriler okullara göre 'kümelenmiştir'.

Derin Analiz

Kümelenmiş veri yapısı, istatistiksel modellemede klasik bağımsızlık varsayımının ihlal edildiği durumları ifade eder. Gözlemlerin tamamen rastgele ve birbirinden bağımsız olmadığı, aksine hiyerarşik veya ortak bağlamlar (örneğin okullardaki öğrenciler, hastanelerdeki hastalar veya coğrafi bölgelerdeki bireyler) paylaştığı durumlarda ortaya çıkar. Bu veri yapısında, küme içindeki gözlemler arası korelasyon (intraclass correlation) yüksektir. Geleneksel regresyon analizleri bu bağımlılığı göz ardı ederse standart hatalar sapmalı hesaplanır ve tip-1 hata oranı artar. Bu nedenle çok düzeyli modelleme (multilevel modeling), genelleştirilmiş tahmin denklemleri (GEE) veya küme-sağlam standart hatalar (cluster-robust standard errors) gibi gelişmiş analitik yaklaşımlar zorunludur.

Etimoloji

İngilizce 'cluster' (küme, salkım; kökeni Eski İngilizce 'clyster') ve 'data' (veriler, Latince 'datum' [verilen şey] sözcüğünün çoğulu) terimlerinin birleşiminden oluşur.

Karıştırmayın

Yığın veri (pooled data) veya panel veri ile karıştırılabilir; temel fark, kümelenmiş verinin hiyerarşik veya doğal gruplama yapısına odaklanması, panel verinin ise genellikle zaman serisi dinamiklerini barındırmasıdır.