Pekiştirmeli Öğrenme
- İngilizcesi
- Reinforcement Learning
- Türkçe karşılığı
- takviyeli öğrenme
- Okunuşu
- riinforsmınt lörning
Kısaca
Pekiştirmeli öğrenme, bir ajanın iyi eylemler için ödül kazanarak deneme yanılmayla karar vermeyi öğrendiği bir makine öğrenmesi türüdür.
Pekiştirmeli öğrenme nedir?
Pekiştirmeli öğrenme (RL), yazılımı bir dizi karar verecek şekilde eğitme yöntemidir. Sabit bir doğru cevaplar kümesinden öğrenmek yerine bir ajan bir ortamla etkileşime girer, eylemler yapar ve ödül ya da ceza alır. Birçok denemeden sonra bir politika (policy) öğrenir; bu, her durumda hangi eylemi yapacağını söyleyen ve zaman içinde en çok ödülü kazandıran stratejidir.
Her adım aynı döngüyü izler: ajan mevcut durumu gözlemler, bir eylem seçer ve ortam yeni bir durum ile bir ödül döndürür. Temel zorluk, daha iyi seçenekleri keşfetmek için yeni eylemler denemek olan keşif (exploration) ile zaten işe yaradığı bilinen eylemleri tekrarlamak olan sömürü (exploitation) arasında denge kurmaktır. Q-learning gibi klasik algoritmalar her durumda her eylemin ne kadar değerli olduğunu tahmin eder; derin pekiştirmeli öğrenme ise bir video oyunu ekranının pikselleri gibi devasa durum uzaylarını ele almak için sinir ağları kullanır.
Klasik benzetme, köpeği mamayla eğitmektir: kimse kuralları açıklamaz, ama iyi davranış mama kazandırır ve köpek onu giderek tekrarlar. RL; masa oyunlarında ve video oyunlarında ustalaşmak, robotları kontrol etmek ve RLHF (insan geri bildiriminden pekiştirmeli öğrenme) ile büyük dil modellerine ince ayar yapmak için kullanılmıştır; RLHF'de insanların yanıtlara verdiği puanlar ödül işlevi görür.
Pekiştirmeli öğrenme çoğu zaman denetimli öğrenmeyle karıştırılır. Denetimli öğrenmede modele her örnek için 'kedi' etiketli bir görüntü gibi doğru cevap gösterilir; RL'de ise ajana yalnızca bir sonucun ne kadar iyi olduğu söylenir ve bu çoğu zaman sonucu doğuran eylemden çok sonra olur. Bu, RL'yi karar verme problemleri için güçlü kılar ama eğitmesi daha zordur, çünkü kötü tasarlanmış bir ödül, ajana gerçek görevi çözmek yerine kaçak yolları sömürmeyi öğretebilir.
Önemli noktalar
- Bir RL ajanı, ödül ve cezalardan deneme yanılmayla öğrenir.
- Temel döngü durum, eylem, ödül ve sonraki durumdur.
- Ajanlar yeni eylemleri keşfetmekle bilinen iyi eylemleri sömürmek arasında denge kurmalıdır.
- Denetimli öğrenmenin aksine RL'de etiketli doğru cevaplar yoktur; yalnızca sonuçlara dair geri bildirim vardır.
- RLHF, dil modellerine ince ayar yapmak için ödül olarak insan geri bildirimini kullanır.
Örnek
import random
# Two buttons with hidden payout rates; the agent must discover the better one
payout_rates = [0.3, 0.7]
value = [0.0, 0.0] # the agent's estimate of each button's reward
count = [0, 0]
for step in range(1000):
# Explore 10% of the time, otherwise exploit the best-known button
action = random.randrange(2) if random.random() < 0.1 else value.index(max(value))
reward = 1 if random.random() < payout_rates[action] else 0
count[action] += 1
value[action] += (reward - value[action]) / count[action] # running average
print(value) # roughly [0.3, 0.7]Sık sorulan sorular
Pekiştirmeli öğrenme ile denetimli öğrenme arasındaki fark nedir?
Denetimli öğrenme doğru cevabı içeren örneklerle eğitilir; pekiştirmeli öğrenme ise ajana doğru hamleyi söylemeden eylemleri için ödüller vererek onu eğitir. RL, en iyi eylemin önceden bilinmediği karar verme görevlerine uygundur.
RLHF nedir?
RLHF, insan geri bildiriminden pekiştirmeli öğrenme anlamına gelir. İnsanlar bir modelin yanıtlarını puanlar ya da sıralar, bu tercihler bir ödül modelini eğitir ve dil modeli daha yüksek puan alan yanıtlar üretmesi için pekiştirmeli öğrenmeyle ince ayardan geçirilir.
Ödül fonksiyonu (reward function) nedir?
Ödül fonksiyonu, ajana her eylemden ya da bölümden sonra bir puan veren ve başarının ne demek olduğunu tanımlayan kuraldır. Özenle tasarlanması çok önemlidir, çünkü ajanlar tam olarak ödüllendirileni, istenmeyen yollarla bile olsa, optimize eder.
İlgili sayfalar
- Makine ÖğrenmesiYapay Zekâ ve Makine Öğrenmesi, s. 30Makine öğrenmesi, bilgisayarların elle yazılmış kurallar yerine verilerdeki örüntüleri öğrenerek tahmin yaptığı bir yapay zekâ dalıdır.
- Yapay Sinir AğıYapay Zekâ ve Makine Öğrenmesi, s. 49Yapay sinir ağı, bağlantılı yapay nöron katmanlarından oluşan ve sayısal ağırlıkları ayarlayarak verilerden örüntü öğrenen bir makine öğrenmesi modelidir.
- Derin ÖğrenmeYapay Zekâ ve Makine Öğrenmesi, s. 14Derin öğrenme, görüntü ve metin gibi ham verilerden karmaşık örüntüleri öğrenmek için çok katmanlı sinir ağları kullanan bir makine öğrenmesi alt kümesidir.
- Fine-tuningYapay Zekâ ve Makine Öğrenmesi, s. 21Fine-tuning, önceden eğitilmiş bir makine öğrenmesi modelini tek bir göreve uyarlamak için daha küçük ve özel bir veri kümesiyle ek olarak eğitme sürecidir.
- Yapay Zekâ AjanıYapay Zekâ ve Makine Öğrenmesi, s. 51Yapay zekâ ajanı, hangi araçları çağıracağına karar verip sonuçları gözlemleyerek çok adımlı görevleri planlayan ve yürüten, LLM kullanan bir sistemdir.
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- RLHFYapay Zekâ ve Makine Öğrenmesi, s. 40RLHF (insan geri bildirimiyle pekiştirmeli öğrenme), dil modelini insanların yanıtlara dair yargılarıyla daha yardımcı ve güvenli kılan eğitim yöntemidir.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin