Ana içeriğe geç

Küçük Dil Modeli

İngilizcesi
Small Language Model
Okunuşu
smol lengviç modıl

Günlük kullanımda iki ad da yaygın.

Güncellendi 3 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/small-language-model

Kısaca

Küçük dil modeli (SLM), en büyük LLM'lerden çok daha az parametreli, tek bir GPU'da, dizüstünde ya da telefonda çalışacak kadar ucuz ve hızlı dil modelidir.

Küçük dil modeli (SLM) nedir?

Küçük dil modeli (SLM), büyük bir dil modeliyle tamamen aynı şekilde çalışır: bir sonraki token'ı tahmin etmek üzere eğitilmiş bir transformer'dır. Fark boyuttadır. Resmî bir sınır yoktur, ama bugün bu ad genellikle birkaç yüz milyondan kabaca 10 ya da 15 milyar parametreye kadar olan modelleri kapsar; en büyük LLM'lerde ise yüz milyarlarca, hatta daha fazla parametre bulunur. Microsoft'un Phi'si, Google'ın Gemma'sı, Meta'nın küçük Llama modelleri ve küçük Qwen modelleri bunlara örnektir.

Küçük modeller; daha fazla ve daha iyi süzülmüş eğitim verisi (çoğu zaman daha büyük modellerin yazdığı sentetik metinler de dahil) ve küçük bir öğrenci modelin büyük bir öğretmen modeli taklit etmeyi öğrendiği bilgi damıtma (knowledge distillation) sayesinde hızla gelişti. Microsoft'un 3,8 milyar parametreli Phi-3-mini modeli, 2024'te yaygın benchmark'larda GPT-3.5'e yakın puanlar alırken bir telefonda çalışacak kadar küçüktü. Quantization bu modelleri daha da küçültür; böylece birkaç milyar parametreli bir model birkaç gigabaytlık belleğe sığar.

Ekipler SLM'leri maliyet, hız ve kontrol için seçer. Küçük bir model daha hızlı yanıt verir, istek başına maliyeti çok daha düşüktür ve kullanıcının kendi cihazında çalışabilir; böylece veri cihazdan hiç çıkmaz ve özellik çevrimdışıyken de çalışmaya devam eder. Destek taleplerini ayırmak, faturalardan alan çekmek ya da bir yapay zekâ ajanının içinde istekleri yönlendirmek gibi dar bir iş için ona ince ayar yapmak ucuzdur ve o tek işte çoğu zaman çok daha büyük, genel bir modelle boy ölçüşür. Bir ansiklopedinin yanındaki cep sözlüğü gibidir: daha az şey kapsar ama her yere gider ve daha çabuk açılır.

SLM ile LLM arasındaki fark farklı bir teknoloji değil, ölçek ve ödünleşim meselesidir. Büyük bir model daha çok şey bilir, karmaşık talimatları daha iyi izler ve uzun, çok adımlı akıl yürütmeyi daha güvenilir biçimde yürütür; küçük olan ise daha dardır ve ayarlandığı görevlerin dışında daha çok hata yapar. Pek çok ürün ikisini birlikte kullanır: sık gelen, basit istekleri küçük bir model karşılar, zor olanları büyük bir modele devreder. "Küçük" kavramı da sürekli kayar: 2019'da manşetlere çıkan GPT-2'nin 1,5 milyar parametresi vardı; bu, bugünkü pek çok SLM'den daha azdır.

Önemli noktalar

  • Küçük dil modeli bir LLM gibi çalışır ama çok daha az parametreye sahiptir: kabaca 10 ya da 15 milyara kadar.
  • Resmî bir boyut sınırı yoktur; neyin küçük sayıldığı da sürekli değişir.
  • Ekipler SLM'leri daha düşük maliyet, daha düşük gecikme, gizlilik ve cihaz üzerinde çevrimdışı kullanım için seçer.
  • Dar bir göreve ince ayar yapılmış küçük bir model, çok daha büyük genel bir modelle boy ölçüşebilir.
  • Geniş bilgi ve karmaşık, çok adımlı akıl yürütmede büyük modeller hâlâ öndedir.

Örnek

Hugging Face Transformers ile küçük bir modeli yerelde çalıştırmakpython
from transformers import pipeline

# About 0.5 billion parameters: small enough for an ordinary laptop CPU
generator = pipeline("text-generation", model="Qwen/Qwen2.5-0.5B-Instruct")

messages = [{
    "role": "user",
    "content": "Label this ticket as billing, bug or other: 'I was charged twice.'",
}]
result = generator(messages, max_new_tokens=10)
print(result[0]["generated_text"][-1]["content"])  # e.g. billing

Sık sorulan sorular

Küçük dil modeli ne kadar küçüktür?

Resmî bir eşik yoktur. Bugün terim genellikle birkaç yüz milyondan yaklaşık 10 ya da 15 milyar parametreye kadar olan, tek bir GPU'da, bir dizüstü bilgisayarda ya da alt uçta bir telefonda çalışabilecek kadar küçük modelleri anlatır. Bazı araştırmacılar onu parametre sayısıyla değil, nerede çalışabildiğiyle tanımlar.

Küçük bir dil modeli telefonda çalışabilir mi?

Evet. Genellikle 4 bite quantize edilmiş 1 ila 4 milyar parametreli modeller yeni telefonlarda çalışır; hem Android hem Apple platformları, uygulamaların çağırabileceği yerleşik cihaz üstü modellerle gelir. Metni özetleme, yeniden yazma ve sınıflandırmada iyidirler ama açık uçlu sorularda daha az güvenilirdirler.

SLM mi kullanmalıyım, LLM mi?

Görevden başlayın. Sınıflandırma ya da veri çıkarma gibi dar ve tekrar eden bir işse küçük bir modeli, mümkünse ince ayar yapılmış hâlini deneyin ve kendi eval'lerinizde büyük bir modelle karşılaştırın. Geniş bilgi ya da uzun akıl yürütme gerekiyorsa büyük bir model genellikle ek maliyetine değer.

İlgili sayfalar

Kaynaklar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar