Ana içeriğe geç

Yan yana

LLMvsKüçük Dil Modeli

LLM ile SLM arasındaki fark nedir?

Güncellendi 3 dk okuma8 fark

Kısaca

SLM, çok daha az parametreli bir LLM gibidir: ucuz ve hızlıdır, dizüstünde ya da telefonda çalışır; büyük modeller ise daha çok bilir, daha iyi akıl yürütür.

LLM

Büyük Dil Modeli

LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.

LLM sayfasını oku

Küçük Dil Modeli

Küçük dil modeli (SLM), en büyük LLM'lerden çok daha az parametreli, tek bir GPU'da, dizüstünde ya da telefonda çalışacak kadar ucuz ve hızlı dil modelidir.

Küçük Dil Modeli sayfasını oku

LLM ve Küçük Dil Modeli karşılaştırması

ÖzellikLLMKüçük Dil Modeli
ParametrelerEn büyük modellerde yüz milyarlarca ya da daha fazlaBirkaç yüz milyondan kabaca 10 ya da 15 milyara kadar
Çalıştığı yerVeri merkezlerindeki GPU ya da TPU kümeleriTek bir GPU, bir dizüstü bilgisayar ya da bir telefon
Tipik erişimBir sağlayıcının API'siKendi sunucunuzda ya da kullanıcının cihazında
İstek başına maliyetDaha yüksek; yüksek hacimde hızla birikirBüyük bir modelin maliyetinin küçük bir kısmı
HızDaha yavaş yanıtlar, üstüne ağ gidiş-dönüşüHızlı yanıtlar; cihaz üzerinde ağ gerekmez
Bilgi ve akıl yürütmeGeniş bilgi ve karmaşık, çok adımlı akıl yürütmeDaha dar; ayarlandığı görevlerin dışında daha çok hata
Gizlilikİstekler genellikle sağlayıcının sunucularına giderVeri kullanıcının cihazında kalabilir
En uygun olduğu yerAçık uçlu sorular, karmaşık görevler ve genel asistanlarSınıflandırma, veri çıkarma ve yönlendirme gibi dar, tekrarlanan görevler

Fark, açıklamalı

Büyük dil modeli (LLM), genellikle bir transformer olan, devasa miktarda metinle eğitilmiş ve dili token'ları birbiri ardına tahmin ederek üreten bir sinir ağıdır. Küçük dil modeli (SLM) ise aynı teknolojinin daha küçük ölçekli hâlidir. Resmî bir sınır yoktur, ama bugün SLM genellikle birkaç yüz milyondan kabaca 10 ya da 15 milyar parametreye kadar olan modelleri anlatır; en büyük LLM'lerde ise yüz milyarlarca, hatta daha fazla parametre bulunur.

Fark, yetenek ile maliyet arasındaki bir ödünleşimdir. Büyük bir model daha çok şey bilir, karmaşık talimatları daha iyi izler ve uzun, çok adımlı akıl yürütmeyi daha güvenilir biçimde yürütür; ama veri merkezi donanımı gerektirir ve genellikle bir sağlayıcının API'si üzerinden kullanılır. Küçük bir model daha hızlı yanıt verir, istek başına maliyeti çok daha düşüktür ve tek bir GPU'ya, bir dizüstü bilgisayara ya da bir telefona sığar; böylece veri cihazda kalabilir ve özellikler çevrimdışı da çalışabilir.

Küçük modeller; daha iyi süzülmüş eğitim verisi, daha büyük modellerden bilgi damıtma (knowledge distillation) ve birkaç milyar parametreli bir modeli birkaç gigabayta küçülten quantization sayesinde aradaki farkın büyük kısmını kapattı. Destek taleplerini ayırmak ya da faturalardan alan çekmek gibi dar bir iş için ince ayar yapılmış bir SLM, o işte çoğu zaman çok daha büyük, genel bir modelle boy ölçüşür. Pek çok ürün ikisini birlikte kullanır: sık gelen, basit istekleri küçük bir model karşılar, zor olanları büyük bir modele devreder.

Sık yapılan bir yanlış, SLM'lerin farklı bir yapay zekâ türü olduğunu düşünmektir. Aynı şekilde kurulmuş, yalnızca daha küçük dil modelleridir ve neyin küçük sayıldığı da sürekli kayar: 2019'da manşetlere çıkan GPT-2'nin 1,5 milyar parametresi vardı; bu, bugünkü pek çok SLM'den daha azdır. Bir diğeri, büyüğün her zaman daha iyi olduğu düşüncesidir: dar ve yüksek hacimli bir görevde iyi ayarlanmış küçük bir model aynı ölçüde isabetli, çok daha hızlı ve çok daha ucuz olabilir.

Hangisini kullanmalısınız?

LLM şu durumlarda doğru seçim:

  • Görev geniş bilgi ya da uzun, çok adımlı akıl yürütme gerektiriyor.
  • İstekler açık uçlu ve öngörülmesi zor.
  • Yanıt kalitesi, istek başına maliyetten ya da hızdan daha önemli.
  • Daha küçük bir modele ince ayar yapacak etiketli örnekleriniz ya da zamanınız yok.

Küçük Dil Modeli şu durumlarda doğru seçim:

  • Görev; sınıflandırma, veri çıkarma ya da yönlendirme gibi dar ve tekrarlanan bir iş.
  • Yüksek hacimde istek başına maliyet ya da yanıt süresi düşük kalmalı.
  • Veri cihazda kalmalı ya da özellik çevrimdışı çalışmalı.
  • Modele kendi örneklerinizle ince ayar yapıp onu değerlendirebilirsiniz.

Sık sorulan sorular

Küçük bir dil modelinde kaç parametre olur?

Resmî bir eşik yoktur. Bugün terim genellikle birkaç yüz milyondan yaklaşık 10 ya da 15 milyar parametreye kadar olan, tek bir GPU'da, bir dizüstü bilgisayarda ya da alt uçta bir telefonda çalışabilecek kadar küçük modelleri kapsar.

SLM, LLM'den daha mı ucuz?

İstek başına genellikle çok daha ucuzdur, çünkü çok daha az hesaplama gücü gerektirir ve zaten sahip olduğunuz donanımda çalışabilir. Tasarruf en çok yüksek hacimli görevlerde önem taşır; orada büyük bir modelin istek başına maliyeti hızla birikir.

Küçük bir dil modeli LLM'in yerini alabilir mi?

Dar görevlerde, özellikle ince ayardan sonra, çoğu zaman evet. Geniş bilgi, açık uçlu sorular ve karmaşık akıl yürütmede ise büyük modeller daha güçlü kalır; pek çok ürünün her isteği ona uyan modele göndermesinin nedeni de budur.

Daha fazla

Ayarlar