Ana içeriğe geç

Temperature

Sıcaklık Parametresi

Okunuşu
temprıçır
Güncellendi 2 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/llm-temperature

Kısaca

Temperature, bir LLM'nin çıktısının ne kadar rastgele olacağını belirleyen ayardır: düşükken odaklı ve öngörülebilir, yüksekken daha çeşitli ve yaratıcıdır.

Bir LLM'de temperature nedir?

Büyük bir dil modeli metin üretirken sözcükleri kesinlikle seçmez. Her adımda olası her sonraki token için bir skor hesaplar, bu skorları olasılıklara dönüştürür ve ardından birini örnekler. Temperature, çoğu API'de genellikle 0 ile 2 arasında bir sayıdır ve örnekleme öncesinde bu olasılıkları yeniden şekillendirir.

Teknik olarak, modelin logit adı verilen ham skorları, softmax fonksiyonu onları olasılıklara çevirmeden önce temperature değerine bölünür. 0,2 gibi düşük bir temperature dağılımı keskinleştirir; böylece en olası token neredeyse her seferinde kazanır ve odaklı, tutarlı yanıtlar elde edilir. 1,2 gibi yüksek bir temperature ise dağılımı düzleştirir; böylece daha az olası token'lar daha sık seçilir ve daha çeşitli ve sürpriz metinler ortaya çıkar, ama hatalar ve dağınıklık da artar. 0 ya da ona yakın değerlerde model neredeyse her zaman en olası tek token'ı seçer; buna greedy decoding denir.

Bunu bir tarif üretecindeki baharat düğmesi gibi düşünün: düşük ayarda her seferinde klasik yemeği alırsınız; yüksek ayarda deneysel kombinasyonlar alırsınız, bazıları harika, bazıları yenmez. Uygulamada geliştiriciler veri çıkarma, sınıflandırma ya da kod üretme gibi tek doğru yanıtı olan görevler için düşük temperature, beyin fırtınası, yaratıcı yazarlık veya birkaç alternatif taslak üretmek için daha yüksek temperature kullanır.

Temperature çoğu zaman nucleus sampling olarak da bilinen top-p ile karıştırılır. Temperature olasılıkların ne kadar yayılacağını değiştirir; top-p ise seçimi, birleşik olasılığı 0,9 gibi bir eşiğe ulaşan en küçük token kümesiyle sınırlar ve genellikle ikisini birden değil, birini ayarlamak en iyisidir. Ayrıca düşük temperature çıktıyı daha doğru değil, daha öngörülebilir kılar; temperature 0 bile her zaman aynı sonucu garanti etmez.

Önemli noktalar

  • Temperature, bir token örneklenmeden önce modelin token olasılıklarını ölçekler.
  • Düşük değerler (yaklaşık 0 ile 0,3) odaklı ve tutarlı çıktı verir.
  • Yüksek değerler (yaklaşık 0,8 ve üstü) daha çeşitli, yaratıcı ve hataya yatkın çıktı verir.
  • Temperature rastgeleliği etkiler; doğruluğu ya da bilgiyi değil.
  • Top-p ilgili bir örnekleme ayarıdır; genellikle ikisinden yalnızca biri ayarlanır.

Örnek

Temperature sonraki token olasılıklarını nasıl yeniden şekillendirirpython
import math

def softmax_with_temperature(logits, temperature):
    scaled = [x / temperature for x in logits]
    total = sum(math.exp(x) for x in scaled)
    return [round(math.exp(x) / total, 3) for x in scaled]

# Raw scores for three candidate next tokens: "blue", "clear", "purple"
logits = [2.0, 1.0, 0.1]

print(softmax_with_temperature(logits, 0.2))  # [0.993, 0.007, 0.0] almost always "blue"
print(softmax_with_temperature(logits, 1.0))  # [0.659, 0.242, 0.099]
print(softmax_with_temperature(logits, 2.0))  # [0.502, 0.304, 0.194] more variety

Sık sorulan sorular

Hangi temperature değerini kullanmalıyım?

Veri çıkarma, sınıflandırma ya da kod gibi tek doğru yanıtı olan görevler için 0 ile 0,3 civarında düşük bir temperature kullanın. Beyin fırtınası ve yaratıcı yazarlık için kabaca 0,7 ile 1,0 arasında orta ya da yüksek bir değer kullanın; en iyi değer modele ve göreve bağlı olduğu için kendi prompt'larınızla test edin.

Temperature 0 bir LLM'yi deterministik yapar mı?

Çoğunlukla, ama her zaman değil. Modelin her adımda en olası token'ı seçmesini sağlar; ancak donanım ve istek gruplamadan kaynaklanan küçük sayısal farklar çıktıyı yine de ara sıra değiştirebilir.

Temperature ile top-p arasındaki fark nedir?

Temperature tüm olasılık dağılımını yeniden şekillendirerek daha keskin ya da daha düz hale getirir. Top-p (nucleus sampling) ise olasılığı düşük kuyruğu keser ve yalnızca olasılıkları toplamı 0,9 gibi bir eşiğe ulaşan en küçük token kümesinden örnekleme yapar.

İlgili sayfalar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar