Çok Modlu Yapay Zekâ
- İngilizcesi
- Multimodal AI
- Türkçe karşılığı
- çok kipli yapay zekâ
- Okunuşu
- maltimodıl ey-ay
Günlük kullanımda iki ad da yaygın.
Kısaca
Çok modlu yapay zekâ, metin, görüntü, ses ve video gibi birden çok veri türünü tek bir modelde anlayabilen veya üretebilen yapay zekâdır.
Çok modlu yapay zekâ (multimodal AI) nedir?
Modalite, metin, görüntü, ses ya da video gibi bir veri türüdür. İlk yapay zekâ sistemleri genellikle yalnızca birini ele alırdı: bir dil modeli metin okur, bir bilgisayarlı görü modeli resimlere bakardı. Çok modlu yapay zekâ birden çok modaliteyi birleştirir; böylece tek bir model örneğin bir fotoğraf hakkındaki soruyu yanıtlayabilir, bir grafiği tarif edebilir, bir toplantı kaydını özetleyebilir ya da yazılı bir açıklamadan görüntü üretebilir.
Çoğu çok modlu model her girdi türünü, modelin üzerinde akıl yürütebileceği ortak bir uzayda embedding'lere, yani anlamı yakalayan sayı listelerine dönüştürür. Görüntü küçük parçalara, ses klibi kısa karelere bölünür ve her parça bir cümledeki sözcük gibi bir token haline gelir. Ardından bir transformer tüm bu token'ları birlikte işler; bu da modelin sorudaki 'köpek' sözcüğünü resimdeki köpekle ilişkilendirmesini sağlar.
Bir görüntülü görüşmenin transkriptini okumakla onu gerçekten izlemek arasındaki farkı düşünün: yüzleri ve slaytları görmek ve ses tonunu duymak çok daha fazla bağlam verir. Çok modlu yapay zekâ; taranmış formları ve tabloları okuyan belge işlemede, görme engelli kullanıcılar için görüntüleri tarif eden erişilebilirlik araçlarında, sesli asistanlarda, fabrikalarda görsel kalite denetiminde ve bir tasarımın ekran görüntüsünü koda çeviren kodlama asistanlarında kullanılır.
Çok modlu yapay zekâ çoğu zaman, örneğin konuşmayı metne çeviren, çıktıyı yalnızca metin çalışan bir chatbot'a besleyen ve ardından bir metinden sese motoruna aktaran ayrı tek amaçlı modellerden oluşan bir hat ile karıştırılır. Bu zincirleme çalışır, ancak ses tonu ya da görüntü düzeni gibi bilgiler adımlar arasında kaybolur; doğuştan çok modlu bir model ise modaliteleri birlikte işler. Çok modlu girdi ile çok modlu çıktı da farklıdır: birçok model görüntü kabul eder ama yalnızca metinle yanıt verebilir.
Önemli noktalar
- Modalite, metin, görüntü, ses veya video gibi bir veri türüdür.
- Çok modlu modeller farklı veri türlerini ortak bir embedding uzayına eşler.
- Görüntüler hakkındaki soruları yanıtlayabilir, belgeleri okuyabilir ve konuşmayı işleyebilirler.
- Birden çok girdi türünü kabul etmek, modelin hepsini üretebildiği anlamına gelmez.
- Doğuştan çok modlu modeller, zincirlenmiş tek modlu modellerin kaybettiği bağlamı korur.
Örnek
// Ask a multimodal model about an image (endpoint and fields are illustrative)
const response = await fetch("https://api.example.com/v1/chat", {
method: "POST",
headers: { "Content-Type": "application/json" },
body: JSON.stringify({
messages: [{
role: "user",
content: [
{ type: "image", url: "https://example.com/receipt.jpg" },
{ type: "text", text: "What is the total amount on this receipt?" },
],
}],
}),
});
console.log((await response.json()).text);Sık sorulan sorular
Çok modlu yapay zekâ ile bilgisayarlı görü arasındaki fark nedir?
Bilgisayarlı görü, çoğu zaman nesne algılama gibi tek bir göreve göre geliştirilmiş modellerle görüntü ve videoyu anlamaya odaklanır. Çok modlu yapay zekâ ise görüyü dil gibi başka modalitelerle birleştirir; böylece tek bir model bir görüntüye bakıp onu doğal dille tartışabilir.
Büyük dil modelleri çok modlu mudur?
Birçok modern model öyledir. Yalnızca metinli LLM'ler sadece metni işler, ancak giderek artan sayıda model girdi olarak görüntü, ses ya da video da kabul eder ve bazıları çıktı olarak görüntü veya konuşma üretebilir.
Vision-language model (görüntü-dil modeli) nedir?
Vision-language model (VLM), girdi olarak görüntü ve metin alan, genellikle metin üreten çok modlu bir modeldir. Görüntü altyazısı oluşturma, görsel soru yanıtlama ve belge okuma gibi görevlerde kullanılır.
İlgili sayfalar
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- Bilgisayarlı GörüYapay Zekâ ve Makine Öğrenmesi, s. 6Bilgisayarlı görü, bilgisayarların nesneleri tanıma, metin okuma ya da yüz algılama gibi işlerle görüntü ve videoyu yorumlamasını sağlayan yapay zekâ alanıdır.
- EmbeddingYapay Zekâ ve Makine Öğrenmesi, s. 18Embedding, metin, görüntü ya da başka verilerin anlamını vektör denen bir sayı listesiyle temsil eden ve benzer öğeleri birbirine yakın konumlandıran yapıdır.
- TransformerYapay Zekâ ve Makine Öğrenmesi, s. 45Transformer, bir dizideki her token'ın diğerleriyle ilişkisini attention ile tartan ve çoğu modern LLM'e güç veren bir sinir ağı mimarisidir.
- Üretken Yapay ZekâYapay Zekâ ve Makine Öğrenmesi, s. 46Üretken yapay zekâ, mevcut verilerden öğrenilen örüntülere dayanarak metin, görüntü, kod ya da ses gibi yeni içerik oluşturan yapay zekâdır.
- Doğal Dil İşlemeYapay Zekâ ve Makine Öğrenmesi, s. 16Doğal dil işleme, bilgisayarlara insan dilini metin ya da konuşma biçiminde okumayı, anlamayı ve üretmeyi öğreten yapay zekâ alanıdır.
- Difüzyon ModeliYapay Zekâ ve Makine Öğrenmesi, s. 15Difüzyon modeli, rastgele gürültüden başlayıp onu adım adım temizleyerek görüntü, ses ya da video üreten bir üretken yapay zekâ modelidir.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin