Model Parametreleri
- İngilizcesi
- Model Parameters
- Okunuşu
- modıl pıremitırz
Kısaca
Model parametreleri, bir makine öğrenmesi modelinin eğitimde öğrendiği ve girdileri çıktılara dönüştürmek için kullandığı ağırlık ve sapma gibi iç sayılardır.
Model parametreleri nelerdir?
Parametreler, bir makine öğrenmesi modelinin içindeki ayarlanabilir sayılardır. Bir sinir ağında bunlar ağırlıklar (bir nöronun bir sonrakini ne kadar güçlü etkilediğini belirler) ve sapmalar (bir nöronun çıktısını yukarı ya da aşağı kaydırır) olarak ifade edilir. Birlikte modelin öğrendiği her şeyi kodlar: eğitilmiş bir model temelde mimarisi artı çok büyük bir parametre değerleri dosyasıdır.
Parametreler rastgele başlar ve eğitim sırasında gradyan inişi gibi bir algoritmayla ayarlanır; algoritma modelin eğitim verisindeki hatasını azaltmak için her birini hafifçe iter. Eğitim bittiğinde inference sırasında sabit kalırlar. Sayıları bir modelin boyutunun kaba bir ölçüsüdür: 7B'lik bir modelin yaklaşık 7 milyar parametresi vardır ve her biri 16 bit (2 bayt) ise yalnızca bunları saklamak yaklaşık 14 GB bellek gerektirir; quantization gibi tekniklerin önemli olmasının nedeni budur.
Bir benzetme, milyarlarca düğmesi olan devasa bir stüdyo mikserdir. Eğitim, çıktı doğru duyulana kadar her düğmeyi yavaşça çevirir ve düğmelerin son konumları modeli oluşturur. Daha fazla düğme, modelin daha karmaşık örüntüleri yakalamasını sağlar, ama daha fazla veri, bellek ve işlem gücü de gerektirir; iyi eğitilmiş küçük bir model, kötü eğitilmiş büyük bir modeli geçebilir.
Parametreler çoğu zaman hiperparametrelerle karıştırılır. Hiperparametreler, öğrenme oranı, katman sayısı ya da batch boyutu gibi insanların eğitimden önce seçtiği ayarlardır ve model bunları öğrenmez. İkisi de, bir yapay zekâ API'sine inference anında ilettiğiniz ve modeli hiçbir şekilde değiştirmeyen temperature ya da en fazla çıktı uzunluğu gibi istek ayarlarından farklıdır.
Önemli noktalar
- Parametreler, bir modelin içindeki öğrenilmiş sayılardır; başlıca ağırlıklar ve sapmalar.
- Eğitim onları ayarlar; inference onları değiştirmeden kullanır.
- 7B ya da 70B gibi parametre sayısı, model boyutunun kaba bir ölçüsüdür.
- Gereken bellek kabaca parametre sayısı çarpı parametre başına bayttır.
- Hiperparametreleri insanlar seçer; verilerden öğrenilmezler.
Örnek
# Count the parameters of a small fully connected neural network
layer_sizes = [784, 128, 64, 10] # input, two hidden layers, output
total = 0
for inputs, outputs in zip(layer_sizes, layer_sizes[1:]):
weights = inputs * outputs # one weight per connection
biases = outputs # one bias per neuron
total += weights + biases
print(total) # 109386
# Memory for a 7-billion-parameter model at 2 bytes per parameter
print(7e9 * 2 / 1e9, "GB") # 14.0 GBSık sorulan sorular
Parametreler ile hiperparametreler arasındaki fark nedir?
Parametreler eğitim verisinden otomatik olarak öğrenilir; hiperparametreler ise öğrenme oranı ya da katman sayısı gibi eğitimden önce veya eğitim sırasında insanlar tarafından seçilir. Hiperparametreler, parametrelerin nasıl öğrenileceğini kontrol eder.
Bir model için 7B veya 70B ne anlama gelir?
Yaklaşık parametre sayısıdır: 7B yaklaşık 7 milyar, 70B yaklaşık 70 milyar demektir. Daha büyük modeller genellikle daha yeteneklidir ancak daha fazla bellek gerektirir ve çalıştırılması daha yavaş ve pahalıdır.
Daha fazla parametre bir modeli her zaman daha iyi yapar mı?
Hayır. Daha fazla parametre modele daha fazla kapasite verir, ancak sonuçlar eğitim verisinin miktarına ve kalitesine, eğitim yöntemine ve göreve de bağlıdır. Küçük ama iyi eğitilmiş modeller belirli işlerde çoğu zaman daha büyük olanlardan daha iyi performans gösterir.
İlgili sayfalar
- Yapay Sinir AğıYapay Zekâ ve Makine Öğrenmesi, s. 49Yapay sinir ağı, bağlantılı yapay nöron katmanlarından oluşan ve sayısal ağırlıkları ayarlayarak verilerden örüntü öğrenen bir makine öğrenmesi modelidir.
- Gradyan İnişiYapay Zekâ ve Makine Öğrenmesi, s. 24Gradyan inişi, makine öğrenmesi modellerinin parametrelerini hatayı azaltan yönde tekrar tekrar hafifçe iterek modelleri eğiten bir optimizasyon algoritmasıdır.
- LLMYapay Zekâ ve Makine Öğrenmesi, s. 28LLM, çok büyük metin yığınlarıyla eğitilmiş ve bir sonraki en olası metin parçasını tekrar tekrar tahmin ederek dil üreten bir makine öğrenmesi modelidir.
- QuantizationYapay Zekâ ve Makine Öğrenmesi, s. 37Quantization, parametreleri 16 yerine 8 ya da 4 gibi daha az bitle saklayarak bir yapay zekâ modelini küçülten, inference'ı hızlandırıp ucuzlatan tekniktir.
- Fine-tuningYapay Zekâ ve Makine Öğrenmesi, s. 21Fine-tuning, önceden eğitilmiş bir makine öğrenmesi modelini tek bir göreve uyarlamak için daha küçük ve özel bir veri kümesiyle ek olarak eğitme sürecidir.
- TemperatureYapay Zekâ ve Makine Öğrenmesi, s. 42Temperature, bir LLM'nin çıktısının ne kadar rastgele olacağını belirleyen ayardır: düşükken odaklı ve öngörülebilir, yüksekken daha çeşitli ve yaratıcıdır.
- LoRAYapay Zekâ ve Makine Öğrenmesi, s. 29LoRA, büyük modellere ucuzca ince ayar yapma yöntemidir: ağırlıklar dondurulur, yalnızca eklenen küçük matrisler eğitilir; yeni beceri birkaç megabayta sığar.
Bu sayfada bir hata ya da eksik mi gördünüz?Düzeltme önerin