KarşılaştırmaTürkçe metin, İngilizce karşılığına göre yaklaşık 0.83× daha fazla token üretiyor. Bu, context penceresini ve inference maliyetini doğrudan etkiler.
V02
VRAM Bütçesi Görselleştirici
Model, adapter, optimizer, gradyan ve aktivasyon paylarını görsel olarak ayırır. Rakamlar yaklaşıktır; gerçek ölçüm nvidia-smi ile yapılmalıdır.
Model ağırlıkları1.86 GiB97%
Adapter0.00 GiB0%
Optimizer0.00 GiB0%
Gradyanlar0.00 GiB0%
Aktivasyonlar0.06 GiB3%
Bütçeye sığıyorKV cache (inference) tahmini: 0.00 GiB. KV cache inference zamanı ek bellek gerektirir; eğitim sırasında sayılmaz.
V03
Eğitim Loss Simülatörü
Learning rate, batch, epoch ve overfit riskini değiştir; train/val loss eğrilerini canlı izle. Üstel bozunma + overfit yükselişi modellemesidir; gerçek koşu yerine geçmez.
0.860Son train loss
2.183Son val loss
420En iyi val step
421Overfit başlangıcı
V04
Attention Heatmap
Bir cümlede her token'ın diğerlerine ne kadar 'dikkat' ettiğini ısı haritası olarak gösterir. Renk yoğunluğu = attention ağırlığı. Bu görsel bir simülasyondur; gerçek modelin attention'ını yansıtmaz.
Model
Türkçe
metni
daha
fazla
token
olarak
böler
.
Model
Türkçe
metni
daha
fazla
token
olarak
böler
.
·
10
10
5
5
5
5
4
1
12
·
10
8
6
8
6
6
4
10
10
·
10
8
10
7
7
3
8
8
10
·
10
10
10
8
4
6
6
10
10
·
10
10
12
6
6
8
10
10
10
·
10
10
11
5
6
8
10
10
10
·
14
12
4
4
5
5
5
10
10
·
17
2
2
2
2
2
2
3
3
·
En yüksek dikkat“.” → “.” (%84). Diyagonal (kendine dikkat) genellikle baskındır.