# Evals (Evaluations (değerlendirmeler))

Adres: https://softwaredictionary.org/tr/terimler/evals
Kategori: Yapay Zekâ ve Makine Öğrenmesi
Son güncelleme: 2026-10-05
Okunuşu: ivals

Kısaca: Evals, yapay zekâ testleridir: beklenen sonucu ya da puanlama kuralı olan girdilerle her değişiklikten sonra bir modelin ya da prompt'un başarısını ölçer.

## Evals nedir?

Bir eval, bir yapay zekâ sistemini sabit bir örnek kümesi üzerinde çalıştırır ve sonuçları puanlar. Her örnek, bir soru ya da destek talebi gibi bir girdiyi iyi bir cevabın nasıl olması gerektiğiyle eşleştirir: kesin bir beklenen değer, içermesi gereken bir olgu listesi ya da cevabı değerlendirmek için bir ölçüt. Puan, sistemin ne sıklıkla doğruyu bulduğunu gösterir.

Dil modellerinin cevapları değişkendir ve çoğu zaman serbest metindir; bu yüzden eval'ler birkaç tür denetimi bir araya getirir. Kod; geçerli bir JSON, doğru bir sayı ya da gerekli bir anahtar kelime gibi yapıyı denetleyebilir. İkinci bir model, bir cevabı bir ölçüte göre puanlayabilir; buna LLM-as-a-judge denir. İnsanlar da hem otomatik denetimlerin kaçırdığını yakalamak hem de otomatik yargıçların kendileriyle aynı fikirde olduğundan emin olmak için bir örneklemi inceler.

Eval'ler, sıradan yazılımda birim testlerinin oynadığı rolü oynar. Ekipler yeni bir modele geçmeden, bir prompt'u düzenlemeden ya da belgelerin nasıl getirildiğini değiştirmeden önce bunları koşar ve gerilemeleri yakalamak için puanları karşılaştırır. Canlı trafikten de örnekler alınıp puanlanır, çünkü gerçek kullanıcılar hiçbir test kümesinin öngörmediği şeyler sorar.

## Önemli noktalar

- Bir eval, bir yapay zekâ sistemini bilinen iyi cevapları ya da kuralları olan sabit bir örnek kümesiyle puanlar.
- Denetimler kesin eşleşmelerden ve kod denetimlerinden LLM-as-a-judge ve insan incelemesine kadar uzanır.
- Gerilemeleri yakalamak için her model, prompt ya da getirme değişikliğinden sonra koşulur.
- Yargıç modelin kendisi de insan puanlarıyla karşılaştırılarak denetlenmelidir.

## Örnek: Küçük bir eval döngüsü

```typescript
const cases = [
  { input: "What is 12 + 30?", expected: "42" },
  { input: "Capital of Türkiye?", expected: "Ankara" },
];

let passed = 0;
for (const { input, expected } of cases) {
  const answer = await model.generate(input);
  if (answer.includes(expected)) passed++;
  else console.log("FAIL", input, "->", answer);
}
console.log(`${passed}/${cases.length} passed`);
```

## Sık sorulan sorular

**LLM-as-a-judge nedir?**

Bir modelin cevaplarını puanlamak için, genellikle "doğru, eksiksiz ve kibar mı?" gibi yazılı bir ölçüte göre, başka bir dil modeli kullanmaktır. İnsan incelemesinden çok daha iyi ölçeklenir; ama yargıç taraflı ya da yanlış olabilir, bu yüzden puanları bir örneklem üzerinde insan puanlarıyla karşılaştırılmalıdır.

**Eval'lerin benchmark'lardan farkı nedir?**

Benchmark'lar, modelleri birbiriyle karşılaştırmak için kullanılan herkese açık, genel test kümeleridir. Eval'ler ise genellikle ürününüzün gerçek görevlerinden oluşturulmuş kendi örneklerinizdir ve bir değişikliğin uygulamanızı iyileştirip iyileştirmediğini söyler.

---

Software Dictionary: https://softwaredictionary.org/tr · https://softwaredictionary.org/tr/llms.txt
