# Attention Mekanizması (Dikkat Mekanizması)

Adres: https://softwaredictionary.org/tr/terimler/attention-mechanism
Kategori: Yapay Zekâ ve Makine Öğrenmesi
Son güncelleme: 2026-09-30
İngilizcesi: Attention Mechanism
Okunuşu: ıtenşın mekınizım

Kısaca: Attention mekanizması, modelin her token için girdinin hangi bölümlerinin en önemli olduğuna karar verip onlara odaklanmasını sağlayan sinir ağı tekniğidir.

## Yapay zekâda attention mekanizması nedir?

Attention, bir sinir ağının girdisinin tüm bölümlerine bakmasını ve her bölümün şu anda işlediği parçayı ne kadar etkilemesi gerektiğine karar vermesini sağlayan bir tekniktir. İlk olarak 2014 civarında makine çevirisini iyileştirmek için ortaya atıldı; böylece bir cümleyi çeviren model ürettiği her sözcük için ilgili kaynak sözcüklere odaklanabiliyordu. Bugün, modern dil modellerinin arkasındaki transformer mimarisinin temel yapı taşıdır.

Self-attention'da her token'ın embedding'i üç vektöre dönüştürülür: token'ın ne aradığını tarif eden bir query (sorgu), neyi sunduğunu tarif eden bir key (anahtar) ve içeriğini taşıyan bir value (değer). Model her query'yi nokta çarpımı kullanarak her key ile karşılaştırır, skorları softmax fonksiyonuyla toplamı 1 olan ağırlıklara dönüştürür ve value'ların ağırlıklı ortalamasını alır. Transformer'lar bu hesaplamalardan birkaçını paralel çalıştırır; bunlara attention head (başlık) denir, böylece farklı başlıklar dil bilgisi, gönderimler ya da konu gibi farklı ilişkileri izleyebilir.

Yardımcı bir benzetme kütüphane aramasıdır: sorunuz query, kitap sırtlarındaki etiketler key, kitapların içeriği ise value'dur. Etiketleri sorunuza en iyi uyan kitapları çeker ve söylediklerini yanıtınıza harmanlarsınız. 'The trophy didn't fit in the suitcase because it was too big' gibi bir cümlede modelin 'it' ile 'trophy'yi ilişkilendirmesini sağlayan şey attention'dır.

Attention çoğu zaman transformer'ın kendisiyle karıştırılır. Attention tek bir mekanizmadır; transformer ise attention katmanlarını ileri beslemeli (feed-forward) katmanlar, normalizasyon ve diğer parçalarla üst üste koyan tam bir mimaridir. İsim de bir metafordur; insana benzer bir odaklanma ya da anlayışın işareti değildir. Başlıca maliyeti ise her token'ı diğer her token'la karşılaştırmanın girdi uzunluğunun karesiyle artmasıdır; uzun bağlam pencerelerinin pahalı olmasının nedeni budur.

## Önemli noktalar

- Attention, her token'ın diğer her token'ın kendisi için ne kadar ilgili olduğunu tartmasını sağlar.
- Query, key ve value'larla çalışır; bunlar nokta çarpımı ve softmax ile birleştirilir.
- Multi-head attention, birkaç attention hesaplamasını paralel çalıştırır.
- Attention, bir transformer'ın tek bir bileşenidir; mimarinin tamamı değildir.
- Maliyeti girdi uzunluğunun karesiyle artar.

## Örnek: NumPy'da ölçeklenmiş nokta çarpımı attention

```python
import numpy as np

def attention(Q, K, V):
    # Score every query against every key, scaled by the vector size
    scores = Q @ K.T / np.sqrt(K.shape[1])
    # Softmax turns each row of scores into weights that add up to 1
    weights = np.exp(scores) / np.exp(scores).sum(axis=1, keepdims=True)
    return weights @ V  # weighted average of the values

rng = np.random.default_rng(0)
tokens = rng.random((4, 8))  # 4 tokens, each an 8-number embedding
Wq, Wk, Wv = (rng.random((8, 8)) for _ in range(3))  # learned in training

output = attention(tokens @ Wq, tokens @ Wk, tokens @ Wv)
print(output.shape)  # (4, 8): one context-aware vector per token
```

## Sık sorulan sorular

**Attention'daki query, key ve value nedir?**

Her token'dan hesaplanan üç vektördür. Query bir token'ın ne aradığını, key bir token'ın ne içerdiğini, value ise aktarılan bilgiyi tarif eder; query'lerin key'lerle eşleştirilmesi, her value'nun ne kadarının kullanılacağını belirler.

**Multi-head attention nedir?**

Multi-head attention, her biri kendi öğrenilmiş ağırlıklarına sahip birkaç bağımsız attention hesaplamasını (head) yan yana çalıştırır. Sonuçları birleştirilir; bu da modelin token'lar arasındaki birkaç tür ilişkiyi aynı anda izlemesini sağlar.

**Attention uzun girdiler için neden pahalıdır?**

Standart self-attention her token'ı diğer her token'la karşılaştırır; bu yüzden girdi uzunluğunu iki katına çıkarmak işi kabaca dört katına çıkarır. Modeller bu maliyeti azaltmak için optimize edilmiş uygulamalar, önbellekleme ve attention'ın yaklaşık biçimlerini kullanır.

---

Software Dictionary: https://softwaredictionary.org/tr · https://softwaredictionary.org/tr/llms.txt
