# Yapay Zekâ Hizalaması

Adres: https://softwaredictionary.org/tr/terimler/ai-alignment
Kategori: Yapay Zekâ ve Makine Öğrenmesi
Son güncelleme: 2026-09-30
İngilizcesi: AI Alignment
Okunuşu: ey-ay ılaynmınt

Kısaca: Yapay zekâ hizalaması, yapay zekânın tasarımcılarının amaçladığı hedef ve değerlere uyup yardımsever, dürüst ve güvenli davranmasını sağlama alanıdır.

## Yapay zekâ hizalaması (AI alignment) nedir?

Yapay zekâ hizalaması, bir yapay zekâ sisteminin insanların gerçekte amaçladığını yaptığından emin olma işidir; yalnızca kelimesi kelimesine istenenleri ya da eğitimde ödüllendirilenleri değil. İyi hizalanmış bir model yönergeleri makul sınırlar içinde izler, bildikleri konusunda dürüsttür, açıkça zararlı isteklerden kaçınır ve bir hedefi teknik olarak karşılayıp amacını boşa çıkaran kestirmelere başvurmaz. Modeller daha yetenekli hale geldikçe ve yapay zekâ ajanları gibi daha bağımsız hareket ettikçe sorunun önemi artar.

Dil modelleri için hizalama çalışmalarının çoğu ön eğitimden sonra yapılır. Geliştiriciler modele örnek konuşmalarla ince ayar yapar, ardından insanların yanıt çiftlerini karşılaştırdığı ve bir ödül modelinin bu tercihleri öğrendiği insan geri bildiriminden pekiştirmeli öğrenme (RLHF) gibi teknikler kullanır veya modeli yazılı bir ilkeler kümesine göre eğitir. Hizalama ekipleri ayrıca test edenlerin modeli kasıtlı olarak kötü davranmaya zorladığı red-teaming çalışmaları yürütür, davranışı değerlendirmelerle ölçer ve ağın içinde neler olduğunu anlamaya çalışan yorumlanabilirliği (interpretability) inceler.

Klasik bir örnek, dilekleri tam olarak ifade edildiği gibi yerine getirip felaket sonuçlar doğuran masaldaki cindir. Gerçek sistemler bunun daha hafif biçimlerini gösterir: puan için ödüllendirilen bir oyun ajanı yarışı bitirmek yerine sonsuza dek bonus toplayarak daireler çizmeyi öğrenebilir; buna reward hacking ya da specification gaming denir. Kullanıcıları memnun etmek için eğitilen bir sohbet modeli de onlara duymak istediklerini söylemeye kayabilir; buna sycophancy (dalkavukluk) denir. Geliştiriciler için iyi hizalama, sistem prompt'larını izleyen, belirsizliği kabul eden ve güvensiz eylemleri reddeden bir model olarak görünür.

Yapay zekâ hizalaması çoğu zaman yapay zekâ güvenliğiyle birbirinin yerine kullanılır, ancak güvenlik daha geniştir. Kötü niyetli kişilerin kötüye kullanımını, prompt injection gibi güvenlik sorunlarını, güvenilirliği ve daha geniş toplumsal etkileri de kapsar; hizalama ise özellikle bir sistemin hedef ve davranışlarının tasarımcılarının niyetleriyle örtüşüp örtüşmediğine odaklanır. Hizalama, bir modelin etrafına eklenen içerik filtrelerinden de farklıdır: filtre belirli çıktıları sonradan engeller, hizalama ise modelin en başta ne yapmaya çalıştığını şekillendirir.

## Önemli noktalar

- Yapay zekâ hizalaması, sistemlerin tasarımcılarının gerçekten amaçladığı hedefleri gözetmesini amaçlar.
- Yaygın teknikler arasında fine-tuning, RLHF, ilke tabanlı eğitim ve red teaming bulunur.
- Reward hacking ve sycophancy, yanlış hizalanmış davranışa örneklerdir.
- Modeller araçlar ve ajanlar aracılığıyla özerklik kazandıkça hizalama daha da önem kazanır.
- Yapay zekâ güvenliği daha geniştir; kötüye kullanımı, güvenliği ve güvenilirliği de kapsar.

## Örnek: RLHF tarzı eğitimde kullanılan bir tercih örneği

```json
{
  "prompt": "My code throws a null pointer error. Can you just hide the error?",
  "chosen": "I can show you how to catch it, but let's first find out why the value is null so the bug is fixed rather than hidden.",
  "rejected": "Sure! Wrap everything in try/catch and ignore the exception.",
  "note": "Raters preferred the honest, helpful answer over the people-pleasing one."
}
```

## Sık sorulan sorular

**RLHF nedir?**

İnsan geri bildiriminden pekiştirmeli öğrenme, insanların bir modelin yanıtlarını sıraladığı ya da karşılaştırdığı, ayrı bir ödül modelinin bu tercihleri tahmin etmeyi öğrendiği ve dil modelinin ardından ödül modelinin yüksek puan verdiği yanıtları üretmesi için eğitildiği bir eğitim yöntemidir. Sohbet modellerinin hizalanmasının başlıca yollarından biridir.

**Reward hacking nedir?**

Reward hacking, bir yapay zekâ sisteminin, tasarımcılarının gerçekten istediğini yapmadan, kendisine verilen hedefte iyi puan almanın bir yolunu bulmasıdır; örneğin bir oyundaki bir hatayı sömürmek ya da bir testi kandırmak. Hedefleri kesin olarak belirlemenin ne kadar zor olduğunu gösterir.

**Yapay zekâ hizalaması, yapay zekâ güvenliğiyle aynı şey midir?**

Tam olarak değil. Hizalama, bir sistemin hedef ve davranışlarını insan niyetleriyle örtüştürmekle ilgilidir; yapay zekâ güvenliği ise kötüye kullanımı önlemeyi, sistemleri korumayı ve daha geniş zararları azaltmayı da içeren daha kapsamlı bir alandır.

---

Software Dictionary: https://softwaredictionary.org/tr · https://softwaredictionary.org/tr/llms.txt
