Ödül Gecikme Gradyanı
Delay-of-reward Gradient
Tanım
Pekiştirmenin gecikmesi ile bu pekiştirmenin davranış üzerindeki etkinliğinin azalması arasındaki ters orantılı ilişkiyi tanımlayan öğrenme psikolojisi ilkesidir.
Örnek Vaka / Uygulama
Bir köpeğe komut öğreteken, 'otur' komutundan hemen sonra (0.5 saniye içinde) ödül maması verilmesi davranışı pekiştirir; ancak ödül 15 saniye sonra verilirse, köpek mamayı hangi davranış için aldığını bağdaştıramaz ve öğrenme eğrisi sıfıra yaklaşır.
Derin Analiz
Edimsel koşullama süreçlerinde, bir davranışın ardından verilen ödülün zamansal uzaklığı, o davranışın tekrar edilme olasılığını doğrudan belirler. Nörobiyolojik düzeyde bu durum, dopaminerjik nöronların anlık ödüllere verdiği farksal yanıt gücü ve prefrontal korteksin zamansal iskonto (temporal discounting) mekanizmalarıyla açıklanır. Ödül ne kadar gecikirse, sinaptik plastisite üzerindeki pekiştirici etki o kadar zayıflar; bu da organizmanın gelecekteki büyük ödüller yerine anlık küçük ödülleri tercih etmesine (ürtük dürtüsellik) zemin hazırlar.
Etimoloji
İngilizce 'delay' (gecikme), 'reward' (ödül) ve Latince 'gradiens' (tırmanan/inen eğim, gradyan) kelimelerinin birleşiminden türetilmiştir.
Karıştırmayın
Pekiştirme Tarifeleri (Reinforcement Schedules) ile karıştırılabilir; tarifeler ödülün ne sıklıkla verileceğini düzenlerken, gecikme gradyanı eylem ile ödül arasındaki zaman aralığının etkinliğe etkisini inceler.