Yan yana
LLMvsKüçük Dil Modeli
LLM ile SLM arasındaki fark nedir?
Güncellendi 3 dk okuma8 fark
Kısaca
SLM, çok daha az parametreli bir LLM gibidir: ucuz ve hızlıdır, dizüstünde ya da telefonda çalışır; büyük modeller ise daha çok bilir, daha iyi akıl yürütür.
LLM
Büyük Dil Modeli
LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
LLM sayfasını okuKüçük Dil Modeli
Küçük dil modeli (SLM), en büyük LLM'lerden çok daha az parametreli, tek bir GPU'da, dizüstünde ya da telefonda çalışacak kadar ucuz ve hızlı dil modelidir.
Küçük Dil Modeli sayfasını okuLLM ve Küçük Dil Modeli karşılaştırması
| Özellik | LLM | Küçük Dil Modeli |
|---|---|---|
| Parametreler | En büyük modellerde yüz milyarlarca ya da daha fazla | Birkaç yüz milyondan kabaca 10 ya da 15 milyara kadar |
| Çalıştığı yer | Veri merkezlerindeki GPU ya da TPU kümeleri | Tek bir GPU, bir dizüstü bilgisayar ya da bir telefon |
| Tipik erişim | Bir sağlayıcının API'si | Kendi sunucunuzda ya da kullanıcının cihazında |
| İstek başına maliyet | Daha yüksek; yüksek hacimde hızla birikir | Büyük bir modelin maliyetinin küçük bir kısmı |
| Hız | Daha yavaş yanıtlar, üstüne ağ gidiş-dönüşü | Hızlı yanıtlar; cihaz üzerinde ağ gerekmez |
| Bilgi ve akıl yürütme | Geniş bilgi ve karmaşık, çok adımlı akıl yürütme | Daha dar; ayarlandığı görevlerin dışında daha çok hata |
| Gizlilik | İstekler genellikle sağlayıcının sunucularına gider | Veri kullanıcının cihazında kalabilir |
| En uygun olduğu yer | Açık uçlu sorular, karmaşık görevler ve genel asistanlar | Sınıflandırma, veri çıkarma ve yönlendirme gibi dar, tekrarlanan görevler |
Fark, açıklamalı
Büyük dil modeli (LLM), genellikle bir transformer olan, devasa miktarda metinle eğitilmiş ve dili token'ları birbiri ardına tahmin ederek üreten bir sinir ağıdır. Küçük dil modeli (SLM) ise aynı teknolojinin daha küçük ölçekli hâlidir. Resmî bir sınır yoktur, ama bugün SLM genellikle birkaç yüz milyondan kabaca 10 ya da 15 milyar parametreye kadar olan modelleri anlatır; en büyük LLM'lerde ise yüz milyarlarca, hatta daha fazla parametre bulunur.
Fark, yetenek ile maliyet arasındaki bir ödünleşimdir. Büyük bir model daha çok şey bilir, karmaşık talimatları daha iyi izler ve uzun, çok adımlı akıl yürütmeyi daha güvenilir biçimde yürütür; ama veri merkezi donanımı gerektirir ve genellikle bir sağlayıcının API'si üzerinden kullanılır. Küçük bir model daha hızlı yanıt verir, istek başına maliyeti çok daha düşüktür ve tek bir GPU'ya, bir dizüstü bilgisayara ya da bir telefona sığar; böylece veri cihazda kalabilir ve özellikler çevrimdışı da çalışabilir.
Küçük modeller; daha iyi süzülmüş eğitim verisi, daha büyük modellerden bilgi damıtma (knowledge distillation) ve birkaç milyar parametreli bir modeli birkaç gigabayta küçülten quantization sayesinde aradaki farkın büyük kısmını kapattı. Destek taleplerini ayırmak ya da faturalardan alan çekmek gibi dar bir iş için ince ayar yapılmış bir SLM, o işte çoğu zaman çok daha büyük, genel bir modelle boy ölçüşür. Pek çok ürün ikisini birlikte kullanır: sık gelen, basit istekleri küçük bir model karşılar, zor olanları büyük bir modele devreder.
Sık yapılan bir yanlış, SLM'lerin farklı bir yapay zekâ türü olduğunu düşünmektir. Aynı şekilde kurulmuş, yalnızca daha küçük dil modelleridir ve neyin küçük sayıldığı da sürekli kayar: 2019'da manşetlere çıkan GPT-2'nin 1,5 milyar parametresi vardı; bu, bugünkü pek çok SLM'den daha azdır. Bir diğeri, büyüğün her zaman daha iyi olduğu düşüncesidir: dar ve yüksek hacimli bir görevde iyi ayarlanmış küçük bir model aynı ölçüde isabetli, çok daha hızlı ve çok daha ucuz olabilir.
Hangisini kullanmalısınız?
LLM şu durumlarda doğru seçim:
- Görev geniş bilgi ya da uzun, çok adımlı akıl yürütme gerektiriyor.
- İstekler açık uçlu ve öngörülmesi zor.
- Yanıt kalitesi, istek başına maliyetten ya da hızdan daha önemli.
- Daha küçük bir modele ince ayar yapacak etiketli örnekleriniz ya da zamanınız yok.
Küçük Dil Modeli şu durumlarda doğru seçim:
- Görev; sınıflandırma, veri çıkarma ya da yönlendirme gibi dar ve tekrarlanan bir iş.
- Yüksek hacimde istek başına maliyet ya da yanıt süresi düşük kalmalı.
- Veri cihazda kalmalı ya da özellik çevrimdışı çalışmalı.
- Modele kendi örneklerinizle ince ayar yapıp onu değerlendirebilirsiniz.
Sık sorulan sorular
Küçük bir dil modelinde kaç parametre olur?
Resmî bir eşik yoktur. Bugün terim genellikle birkaç yüz milyondan yaklaşık 10 ya da 15 milyar parametreye kadar olan, tek bir GPU'da, bir dizüstü bilgisayarda ya da alt uçta bir telefonda çalışabilecek kadar küçük modelleri kapsar.
SLM, LLM'den daha mı ucuz?
İstek başına genellikle çok daha ucuzdur, çünkü çok daha az hesaplama gücü gerektirir ve zaten sahip olduğunuz donanımda çalışabilir. Tasarruf en çok yüksek hacimli görevlerde önem taşır; orada büyük bir modelin istek başına maliyeti hızla birikir.
Küçük bir dil modeli LLM'in yerini alabilir mi?
Dar görevlerde, özellikle ince ayardan sonra, çoğu zaman evet. Geniş bilgi, açık uçlu sorular ve karmaşık akıl yürütmede ise büyük modeller daha güçlü kalır; pek çok ürünün her isteği ona uyan modele göndermesinin nedeni de budur.