KarşılaştırmaBu oyuncak bölme kuralında Türkçe/İngilizce parça sayısı oranı 0.77×. Bu oran gerçek tokenizer verimliliğini veya çıkarım maliyetini ölçmez.
V02
VRAM Bütçesi Görselleştirici
Model, adaptör, iyileştirici, gradyan ve aktivasyon paylarını görsel olarak ayırır. Rakamlar yaklaşıktır; gerçek ölçüm nvidia-smi ile yapılmalıdır.
Varsayım: 32 katman; katman başına 7 kare LoRA matrisi; KV boyutu gizli boyutun dörtte biri; FP16 KV, FP32 adaptör ve Adam durumları. Gerçek mimari, niceleme ek yükü, çalışma alanları ve bellek ayırıcısı dahil değildir. Bu bir eğitim modeli; sığma garantisi vermez.
Model ağırlıkları1.86 GiB69%
Adaptör0.03 GiB1%
İyileştirici0.07 GiB3%
Gradyanlar0.03 GiB1%
Aktivasyonlar0.69 GiB26%
Basitleştirilmiş tahmin bütçe altındaKV önbelleği (çıkarım) tahmini: 0.16 GiB. KV önbelleği çıkarım sırasında ek bellek gerektirir; eğitim sırasında sayılmaz.
V03
Eğitim Kaybı Simülatörü
Öğrenme oranını, etkin toplu işi, dönem sayısını ve aşırı öğrenme riskini değiştir; eğitim/doğrulama kaybı eğrilerini canlı izle. Bu öğretici model gerçek bir koşunun yerine geçmez.
0.816Son eğitim kaybı
1.994Son doğrulama kaybı
420En iyi doğrulama adımı
421Aşırı öğrenme başlangıcı
V04
Dikkat Isı Haritası
Bir cümlede her tokenın diğerlerine ne kadar dikkat ettiğini ısı haritası olarak gösterir. Renk yoğunluğu dikkat ağırlığını temsil eder. Bu görsel bir simülasyondur; gerçek modelin dikkat değerlerini yansıtmaz.
Bu
öğretici
örnek
kelimeler
arasındaki
temsili
dikkat
ilişkilerini
gösterir
Bu
öğretici
örnek
kelimeler
arasındaki
temsili
dikkat
ilişkilerini
gösterir
·
10
10
5
5
5
5
4
1
12
·
10
8
6
8
6
6
4
10
10
·
10
8
10
7
7
3
8
8
10
·
10
10
10
8
4
6
6
10
10
·
10
10
12
6
6
8
10
10
10
·
10
10
11
5
6
8
10
10
10
·
14
12
4
4
5
5
5
10
10
·
17
2
2
2
2
2
2
3
3
·
En yüksek dikkat“gösterir” → “gösterir” (%84). Bu örnekte diyagonal (kendine dikkat) baskındır; gerçek örüntü katmana, başlığa ve girdiye bağlıdır.