Ana içeriğe geç

Mixture of Experts

MoE

Türkçe karşılığı
uzmanlar karışımı
Okunuşu
mikscır ov ekspörts

Günlük kullanımda çoğunlukla İngilizcesi tercih edilir.

Güncellendi 2 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/mixture-of-experts

Kısaca

Mixture of experts (MoE), her girdiyi çok sayıda küçük uzman ağdan yalnızca birkaçına gönderen sinir ağı tasarımıdır; devasa bir model çok daha ucuza çalışır.

Mixture of Experts nedir?

Sıradan, yoğun (dense) bir modelde her parametre her token'ın işlenmesine katılır. Mixture of experts modelinde ise bazı katmanlarda tek bir ağ yerine çok sayıda paralel uzman ağ bulunur. Küçük bir yönlendirici (router) ağ her token'a bakar ve ona en uygun birkaç uzmanı seçer; yalnızca onlar çalışır, diğer uzmanlar o token için boşta kalır.

Bu, modelin toplam boyutunu token başına yapılan işten ayırır. Bir model yüz milyarlarca parametrelik bilgi tutarken her token bunların yalnızca bir kısmından geçer. Mistral'in 2023'te yayımlanan Mixtral 8x7B modelinde bu tür her katmanda sekiz uzman vardır ve her token için ikisi kullanılır; bugünün en büyük dil modellerinin birçoğu da aynı fikri kullanır.

Fikir, 1991'de yerel uzmanların uyarlanabilir karışımları üzerine yazılmış bir makaleye dayanır; büyük ağlar için seyrek (sparse) türleri de 2017'de gösterildi. MoE modelleri aynı toplam boyuttaki yoğun modellerden daha hızlı eğitilir ve yanıt verir; ama bütün uzmanlar için bellek gerekir, eğitim sırasında da yönlendiricinin her şeyi birkaç gözde uzmana göndermesi engellenmelidir.

Sık yapılan bir yanlış, her uzmanın insanların anladığı bir konuda uzmanlaştığını düşünmektir; örneğin biri hukuk, biri kod için. Pratikte yönlendirici kendi kalıplarını öğrenir; bunlar çoğu zaman token türlerine ya da sözdizimine dayanır ve uzmanlaşma nadiren bu kadar düzenli ya da adlandırması kolaydır.

Önemli noktalar

  • MoE katmanları çok sayıda uzman ağ ve her token için birkaçını seçen bir yönlendirici içerir.
  • Yalnızca seçilen uzmanlar çalışır; böylece token başına hesaplama küçük kalır.
  • Toplam parametre sayısı çok büyük olabilirken aktif parametreler mütevazı kalır.
  • Yine de bütün uzmanların belleğe sığması ve yönlendirmenin dengeli kalması gerekir.
  • Uzmanlar düzenli insan konularını değil, kendi kalıplarını öğrenir.

Sık sorulan sorular

Aktif parametreler nedir?

Bir token için gerçekten kullanılan parametrelerdir. MoE modelinde toplamdan çok daha azdır, çünkü yalnızca seçilen uzmanlar çalışır. Hız ve maliyet aktif sayıya, bellek ise toplama bağlıdır.

Mixture of experts birkaç ayrı model mi?

Hayır. Bazı katmanları birkaç uzman alt ağ içeren tek bir modeldir. Uzmanlar, yönlendirici ve ortak katmanlarla birlikte eğitilir.

Mixture of experts neden kullanılır?

Çok büyük bir modelin bilgisini çok daha küçük bir modelin çalışma maliyetiyle elde etmek için. Laboratuvarların, her token için gereken hesaplamayı aynı hızda büyütmeden model kapasitesini büyütmesini sağlar.

İlgili sayfalar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar