Ana içeriğe geç

Çok Modlu Yapay Zekâ

İngilizcesi
Multimodal AI
Türkçe karşılığı
çok kipli yapay zekâ
Okunuşu
maltimodıl ey-ay

Günlük kullanımda iki ad da yaygın.

Güncellendi 2 dk okuma

Bu sayfayı paylaşın

Bağlantıyı gönderin, tanımı bağlantısıyla birlikte alıntılayın ya da kendi sitenizde bir kart olarak gösterin.

https://softwaredictionary.org/tr/terimler/multimodal-ai

Kısaca

Çok modlu yapay zekâ, metin, görüntü, ses ve video gibi birden çok veri türünü tek bir modelde anlayabilen veya üretebilen yapay zekâdır.

Çok modlu yapay zekâ (multimodal AI) nedir?

Modalite, metin, görüntü, ses ya da video gibi bir veri türüdür. İlk yapay zekâ sistemleri genellikle yalnızca birini ele alırdı: bir dil modeli metin okur, bir bilgisayarlı görü modeli resimlere bakardı. Çok modlu yapay zekâ birden çok modaliteyi birleştirir; böylece tek bir model örneğin bir fotoğraf hakkındaki soruyu yanıtlayabilir, bir grafiği tarif edebilir, bir toplantı kaydını özetleyebilir ya da yazılı bir açıklamadan görüntü üretebilir.

Çoğu çok modlu model her girdi türünü, modelin üzerinde akıl yürütebileceği ortak bir uzayda embedding'lere, yani anlamı yakalayan sayı listelerine dönüştürür. Görüntü küçük parçalara, ses klibi kısa karelere bölünür ve her parça bir cümledeki sözcük gibi bir token haline gelir. Ardından bir transformer tüm bu token'ları birlikte işler; bu da modelin sorudaki 'köpek' sözcüğünü resimdeki köpekle ilişkilendirmesini sağlar.

Bir görüntülü görüşmenin transkriptini okumakla onu gerçekten izlemek arasındaki farkı düşünün: yüzleri ve slaytları görmek ve ses tonunu duymak çok daha fazla bağlam verir. Çok modlu yapay zekâ; taranmış formları ve tabloları okuyan belge işlemede, görme engelli kullanıcılar için görüntüleri tarif eden erişilebilirlik araçlarında, sesli asistanlarda, fabrikalarda görsel kalite denetiminde ve bir tasarımın ekran görüntüsünü koda çeviren kodlama asistanlarında kullanılır.

Çok modlu yapay zekâ çoğu zaman, örneğin konuşmayı metne çeviren, çıktıyı yalnızca metin çalışan bir chatbot'a besleyen ve ardından bir metinden sese motoruna aktaran ayrı tek amaçlı modellerden oluşan bir hat ile karıştırılır. Bu zincirleme çalışır, ancak ses tonu ya da görüntü düzeni gibi bilgiler adımlar arasında kaybolur; doğuştan çok modlu bir model ise modaliteleri birlikte işler. Çok modlu girdi ile çok modlu çıktı da farklıdır: birçok model görüntü kabul eder ama yalnızca metinle yanıt verebilir.

Önemli noktalar

  • Modalite, metin, görüntü, ses veya video gibi bir veri türüdür.
  • Çok modlu modeller farklı veri türlerini ortak bir embedding uzayına eşler.
  • Görüntüler hakkındaki soruları yanıtlayabilir, belgeleri okuyabilir ve konuşmayı işleyebilirler.
  • Birden çok girdi türünü kabul etmek, modelin hepsini üretebildiği anlamına gelmez.
  • Doğuştan çok modlu modeller, zincirlenmiş tek modlu modellerin kaybettiği bağlamı korur.

Örnek

Tek bir istekte görüntü ve soru göndermekjavascript
// Ask a multimodal model about an image (endpoint and fields are illustrative)
const response = await fetch("https://api.example.com/v1/chat", {
  method: "POST",
  headers: { "Content-Type": "application/json" },
  body: JSON.stringify({
    messages: [{
      role: "user",
      content: [
        { type: "image", url: "https://example.com/receipt.jpg" },
        { type: "text", text: "What is the total amount on this receipt?" },
      ],
    }],
  }),
});
console.log((await response.json()).text);

Sık sorulan sorular

Çok modlu yapay zekâ ile bilgisayarlı görü arasındaki fark nedir?

Bilgisayarlı görü, çoğu zaman nesne algılama gibi tek bir göreve göre geliştirilmiş modellerle görüntü ve videoyu anlamaya odaklanır. Çok modlu yapay zekâ ise görüyü dil gibi başka modalitelerle birleştirir; böylece tek bir model bir görüntüye bakıp onu doğal dille tartışabilir.

Büyük dil modelleri çok modlu mudur?

Birçok modern model öyledir. Yalnızca metinli LLM'ler sadece metni işler, ancak giderek artan sayıda model girdi olarak görüntü, ses ya da video da kabul eder ve bazıları çıktı olarak görüntü veya konuşma üretebilir.

Vision-language model (görüntü-dil modeli) nedir?

Vision-language model (VLM), girdi olarak görüntü ve metin alan, genellikle metin üreten çok modlu bir modeldir. Görüntü altyazısı oluşturma, görsel soru yanıtlama ve belge okuma gibi görevlerde kullanılır.

İlgili sayfalar

Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin

Daha fazla

Ayarlar