Veri Ayıklama
Data Dredging
Tanım
Araştırmacının önceden tasarlanmış bir hipotezi doğrulamak amacıyla devasa veri setleri içinde rastgele ilişkiler aradığı ve karıştırıcı değişkenleri kontrol etmediği kusurlu analitik uygulamadır.
Örnek Vaka / Uygulama
Bir klinik araştırmacı, uyguladığı yeni terapötik yöntemin etkinliğini kanıtlayabilmek için 50 farklı psikolojik alt testten oluşan devasa bir veri seti toplar. İlk analizde genel anlamlılık bulamaz; ancak veriyi yaş, cinsiyet, medeni durum ve alt ölçek kombinasyonlarına göre elli kez yeniden dilimleyerek sadece '35 yaş üstü, evli erkeklerde' istatistiksel olarak anlamlı bir iyileşme bulur ve araştırmayı sadece bu küçük alt grup üzerinden raporlar.
Derin Analiz
Veri ayıklama, istatistiksel çıkarım sürecinde Tip I hata (alfa hatası) olasılığını katlanarak artıran metodolojik bir sapmadır. Yeterli bir deneysel tasarım veya önceden kayıtlı (pre-registered) analiz planı olmaksızın, p-hacking (p-değeri manipülasyonu) teknikleriyle verinin hırpalanarak anlamlı görünmesi sağlanan sonuçlar üretilir. Çoklu karşılaştırma problemini (multiple comparisons problem) göz ardı ederek binlerce korelasyon arasından sadece rastgele anlamlı çıkanları öne çıkarmak, ampirik bulguların replike edilebilirliğini (yeniden üretilebilirliğini) sıfırlayan ve bilimsel literatürü kirleten sistematik bir metodolojik zaaftır.
Etimoloji
İngilizce 'data' (veriler, Latince datum'dan çoğul) ve 'dredging' (dip tarama, çamur temizleme makinesiyle su altını tarama fiili) kelimelerinin birleşiminden türetilmiştir; ham ve yığılmış veri havuzlarından seçici ve manipülatif bir şekilde işe yarar parça çekme metaforunu ifade eder.
Karıştırmayın
Keşifsel veri analizi (Exploratory data analysis - EDA), verideki gizli örüntüleri yasal ve şeffaf bir şekilde hipotez üretmek için incelerken; veri ayıklama, önceden var olan yanlı bir inancı kanıtlamak adına veriyi kötü niyetli veya metodolojik cehaletle manipüle etmeyi hedefler.