RLHF
İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme
- Okunuşu
- ar el eyç ef
Kısaca
RLHF (insan geri bildirimiyle pekiştirmeli öğrenme), dil modelini insanların yanıtlara dair yargılarıyla daha yardımcı ve güvenli kılan eğitim yöntemidir.
RLHF nedir?
Ön eğitimli bir dil modeli metni sürdürmekte iyidir, ama talimatları izlemekte, kibar kalmakta ya da zararlı istekleri reddetmekte iyi olmayabilir. RLHF bu açığı kapatır. OpenAI'ın 2022'deki InstructGPT çalışmasıyla geniş çapta tanındı, bu çalışma ChatGPT'yi de şekillendirdi; temeli de insan tercihlerinden öğrenme üzerine 2017'den gelen araştırmalara dayanır.
Klasik tarif üç adımlıdır. Önce model, insanların yazdığı örnek sohbetlerle ince ayardan geçirilir. Sonra birçok prompt'a birkaç yanıt üretir, insanlar bu yanıtları sıralar ve ikinci bir model, yani ödül modeli (reward model), bu sıralamaları tahmin etmeyi öğrenir. Son olarak dil modeli, ödül modelinin yüksek puan verdiği yanıtları üretmesi için pekiştirmeli öğrenmeyle, çoğu zaman PPO adlı bir algoritmayla eğitilir.
Daha yeni türler tarifin bazı kısımlarını basitleştirir ya da değiştirir. Doğrudan tercih optimizasyonu (DPO), ayrı bir ödül modeli ya da pekiştirmeli öğrenme döngüsü olmadan sıralanmış çiftlerden öğrenir; RLAIF ise insan değerlendiricilerin yerine ya da yanında, yazılı ilkelerle yönlendirilen bir yapay zekâ modelinin geri bildirimini kullanır. Bu teknikler çoğu zaman tercih eğitimi (preference tuning) ya da son eğitim (post-training) başlığı altında toplanır.
Sık yapılan bir yanlış, RLHF'nin modele yeni bilgiler öğrettiğini düşünmektir. Esas olarak davranışı şekillendirir: üslubu, yardımseverliği, biçimi ve neyin reddedileceğini. Değerlendiriciler ödüllendirirse kullanıcıya yaranmak ya da kendinden emin görünmek gibi istenmeyen alışkanlıklar da öğretebilir; geri bildirimin kalitesinin bu kadar önemli olmasının nedeni budur.
Önemli noktalar
- RLHF, modeli hangi yanıtların daha iyi olduğuna dair insan yargılarıyla eğitir.
- Adımlar: örneklerle ince ayar, sıralamalarla ödül modeli eğitimi, ardından RL ile optimizasyon.
- ChatGPT gibi asistanların talimat izlemesini ve zararlı istekleri reddetmesini sağladı.
- DPO ve RLAIF, tercih eğitiminin daha yeni türleridir.
- Bilgiden çok davranışı şekillendirir; değerlendiriciler ödüllendirirse yaranmayı da öğretebilir.
Sık sorulan sorular
Ödül modeli (reward model) nedir?
İnsanların bir yanıta ne kadar yüksek puan vereceğini tahmin etmek için eğitilmiş bir modeldir. RLHF sırasında insan değerlendiricilerin yerini tutar ve dil modelinin hangilerini tercih edeceğini öğrenebilmesi için üretilen milyonlarca yanıtı puanlar.
RLHF ile fine-tuning arasındaki fark nedir?
Sıradan ince ayar, modeli kopyalanacak örnek çıktılarla eğitir. RLHF ise onu çıktılar arasındaki karşılaştırmalarla eğitip daha iyi olanı ödüllendirir; bu, örnek olarak yazılması zor olan tercihleri yakalar.
DPO nedir?
Doğrudan tercih optimizasyonu (direct preference optimization), ayrı bir ödül modeli ya da pekiştirmeli öğrenme döngüsü olmadan, modeli tercih edilen ve reddedilen yanıt çiftleriyle doğrudan eğiten, RLHF'ye göre daha basit bir alternatiftir.
İlgili sayfalar
- Pekiştirmeli ÖğrenmeYapay Zekâ ve Makine Öğrenmesi, s. 34Pekiştirmeli öğrenme, bir ajanın iyi eylemler için ödül kazanarak deneme yanılmayla karar vermeyi öğrendiği bir makine öğrenmesi türüdür.
- Fine-tuningYapay Zekâ ve Makine Öğrenmesi, s. 21Fine-tuning, önceden eğitilmiş bir makine öğrenmesi modelini tek bir göreve uyarlamak için daha küçük ve özel bir veri kümesiyle ek olarak eğitme sürecidir.
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- Yapay Zekâ HizalamasıYapay Zekâ ve Makine Öğrenmesi, s. 52Yapay zekâ hizalaması, yapay zekânın tasarımcılarının amaçladığı hedef ve değerlere uyup yardımsever, dürüst ve güvenli davranmasını sağlama alanıdır.
- ChatbotYapay Zekâ ve Makine Öğrenmesi, s. 8Chatbot, insanlarla yazılı ya da sesli sohbet edip soruları yanıtlayan veya işlere yardım eden, senaryolu kurallarla ya da dil modeliyle çalışan programdır.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin