QWEN3 4B · FINE-TUNING

Kanıt kaydı

2026-08-08 tarihli kaynak kaydı, işlem hattı başarısını model kalitesinden ayırır. Bu site eğitim çalıştırmaz veya GPU’ya bağlanmaz.

Doğrulandı30 / 30eğitim adımı tamamlandı
Doğrulandı0.8245son eğitim kaybı
Doğrulandı✓adaptörü kaydetme ve yeniden yükleme
Gözlendi9.62 / 15.99 GiBgözlenen anlık kullanım; en yüksek kullanım değil

KARAR

İşlem hattı geçti. Kalite kazanımı kanıtlanmadı.

Değerlendirme ayrımı yoktu ve üç sabit kalite karşılaştırmasının tamamında temel model daha güçlüydü. Bu koşu bir hızlı sınama kanıtıdır; model iyileşmesi kanıtı değildir.

Türkçe açıklamaBase daha düzenliFine-tuned tekrar/İngilizce karışımı
Koşullu JSONBase daha geçerliFine-tuned eksik/gevşek
Eksik bilgiBase daha temkinliFine-tuned daha çok varsayım

Bilinmeyenler

  • Gerçek en yüksek VRAM kullanımı ölçülmedi.
  • Bağımsız doğrulama/test ayrımı yoktu.
  • Sabit rastgelelik tohumu ve tekrar koşusu yoktu.
  • Kalite farkının istatistiksel güveni bilinmiyor.

OKUMA LİSTESİ

Klasik makaleler

Her kavramın matematiksel temeli. Kısa özet; orijinal makaleyi okumadan önce başlangıç noktası olarak kullan.

Gözlendi
2017 · Vaswani et al.

Attention Is All You Need (Transformer)

ANA FİKİR

RNN/CNN olmadan, yalnızca multi-head self-attention ile sıralı modelleme mümkün. Q/K/V lineer projeksiyon, scaled dot-product attention, paralel eğitim.

NEDEN ÖNEMLİ

Modern LLM'lerin temel yapı taşı. Token/attention/context kavramlarının matematiksel temeli.

ALINTI

Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS.

2021 · Hu et al.

LoRA: Low-Rank Adaptation of Large Language Models

ANA FİKİR

ΔW'yi düşük-rank bir güncellemeyle ifade ederek, makaledeki GPT-3 örneklerinde eğitilebilir parametre sayısını 10.000 kata kadar azaltır. Adaptör temel modele geri dönüşlü olarak eklenir.

NEDEN ÖNEMLİ

LoRA kavramının orijinal kaynağı. r × (d_in + d_out) formülü, alpha/r ölçeği burada gelir.

ALINTI

Hu, E.J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.

2023 · Dettmers et al.

QLoRA: Efficient Finetuning of Quantized LLMs

ANA FİKİR

NF4 (4 bit normal kayan nokta), çift niceleme ve sayfalı iyileştirici durumlarıyla 65B modeli tek bir 48 GB GPU'da ince ayarlar. Bu sonuç bellek tasarrufunu gösterir; belirli bir modelin 16 GB'a sığacağını garanti etmez.

NEDEN ÖNEMLİ

QLoRA, NF4, double-quantization, page optimizer kavramlarının orijinal kaynağı.

ALINTI

Dettmers, T. et al. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS.

2024 · Shao et al. (DeepSeek)

DeepSeekMath: GRPO

ANA FİKİR

Group Relative Policy Optimization: PPO'dan daha basit, value model olmadan, grup içi avantaj normalizasyonu. Reasoning modellerinde yaygınlaştı.

NEDEN ÖNEMLİ

Week 11'deki GRPO deneyinin arkasındaki yöntem. Otomatik doğrulanabilir reward'lar için temel.

ALINTI

Shao, Z. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300.

ALINTI KİTİ

Tez ve rapor için cümleler

Kanıt seviyesi etiketli taslak cümleler. Kullanmadan önce özgün kaynağı doğrula ve doğrudan o kaynağa atıf yap.

DoğrulandıLoRAkullanım: LoRA'nın temel formülü için.
LoRA, eğitilebilir parametreleri r × (d_in + d_out) ile sınırlayarak orijinal W matrisini donuk tutar; bu, full fine-tuning'a kıyasla VRAM ve depolama gereksinimini dramatik biçimde düşürür.
Doğrulandıdeğerlendirmekullanım: Eval split zorunluluğunu savunmak için.
Bağımsız test seti olmadan fine-tuning kalite iddiası üretilemez; train split loss'u genelleme kanıtı değildir (Bishop, 2006; Goodfellow et al., 2016).
Gözlenditokenlarkullanım: Türkçe tokenlaştırma maliyetini açıklamak için.
Türkçe token maliyeti tokenizer'a göre değişir; bağlam ve çıkarım maliyeti hedef modelin gerçek tokenizer'ıyla ölçülmelidir.
Doğrulandıadımlarkullanım: Eğitim mekaniğini açıklamak için.
Effective batch size = micro batch × gradient accumulation × GPU sayısı; OOM'da ilk düşürülecek değişken micro batch veya sequence length'tir, accumulation korunarak effective batch telafi edilir.
Doğrulandışablonlarkullanım: Chat template neden kritik için.
Aynı role/content kaydı, farklı modellerin chat template'lerinde farklı token dizilerine dönüşür; bu nedenle semantic kayıtlar modelden bağımsız saklanmalı, render her modelin kendi template'i ile yapılmalıdır.