QWEN3 4B · FINE-TUNING
Kanıt kaydı
2026-08-08 tarihli kaynak kaydı, işlem hattı başarısını model kalitesinden ayırır. Bu site eğitim çalıştırmaz veya GPU’ya bağlanmaz.
KARAR
İşlem hattı geçti. Kalite kazanımı kanıtlanmadı.
Değerlendirme ayrımı yoktu ve üç sabit kalite karşılaştırmasının tamamında temel model daha güçlüydü. Bu koşu bir hızlı sınama kanıtıdır; model iyileşmesi kanıtı değildir.
Bilinmeyenler
- Gerçek en yüksek VRAM kullanımı ölçülmedi.
- Bağımsız doğrulama/test ayrımı yoktu.
- Sabit rastgelelik tohumu ve tekrar koşusu yoktu.
- Kalite farkının istatistiksel güveni bilinmiyor.
OKUMA LİSTESİ
Klasik makaleler
Her kavramın matematiksel temeli. Kısa özet; orijinal makaleyi okumadan önce başlangıç noktası olarak kullan.
Attention Is All You Need (Transformer)
RNN/CNN olmadan, yalnızca multi-head self-attention ile sıralı modelleme mümkün. Q/K/V lineer projeksiyon, scaled dot-product attention, paralel eğitim.
Modern LLM'lerin temel yapı taşı. Token/attention/context kavramlarının matematiksel temeli.
Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS.
LoRA: Low-Rank Adaptation of Large Language Models
ΔW'yi düşük-rank bir güncellemeyle ifade ederek, makaledeki GPT-3 örneklerinde eğitilebilir parametre sayısını 10.000 kata kadar azaltır. Adaptör temel modele geri dönüşlü olarak eklenir.
LoRA kavramının orijinal kaynağı. r × (d_in + d_out) formülü, alpha/r ölçeği burada gelir.
Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
QLoRA: Efficient Finetuning of Quantized LLMs
NF4 (4 bit normal kayan nokta), çift niceleme ve sayfalı iyileştirici durumlarıyla 65B modeli tek bir 48 GB GPU'da ince ayarlar. Bu sonuç bellek tasarrufunu gösterir; belirli bir modelin 16 GB'a sığacağını garanti etmez.
QLoRA, NF4, double-quantization, page optimizer kavramlarının orijinal kaynağı.
Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS.
DeepSeekMath: GRPO
Group Relative Policy Optimization: PPO'dan daha basit, value model olmadan, grup içi avantaj normalizasyonu. Reasoning modellerinde yaygınlaştı.
Week 11'deki GRPO deneyinin arkasındaki yöntem. Otomatik doğrulanabilir reward'lar için temel.
Shao, Z. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300.
ALINTI KİTİ
Tez ve rapor için cümleler
Kanıt seviyesi etiketli taslak cümleler. Kullanmadan önce özgün kaynağı doğrula ve doğrudan o kaynağa atıf yap.
LoRA, eğitilebilir parametreleri r × (d_in + d_out) ile sınırlayarak orijinal W matrisini donuk tutar; bu, full fine-tuning'a kıyasla VRAM ve depolama gereksinimini dramatik biçimde düşürür.
Bağımsız test seti olmadan fine-tuning kalite iddiası üretilemez; train split loss'u genelleme kanıtı değildir (Bishop, 2006; Goodfellow et al., 2016).
Türkçe token maliyeti tokenizer'a göre değişir; bağlam ve çıkarım maliyeti hedef modelin gerçek tokenizer'ıyla ölçülmelidir.
Effective batch size = micro batch × gradient accumulation × GPU sayısı; OOM'da ilk düşürülecek değişken micro batch veya sequence length'tir, accumulation korunarak effective batch telafi edilir.
Aynı role/content kaydı, farklı modellerin chat template'lerinde farklı token dizilerine dönüşür; bu nedenle semantic kayıtlar modelden bağımsız saklanmalı, render her modelin kendi template'i ile yapılmalıdır.