02 · BAĞLAM
DoğrulandıToken, Context ve Attention
Token bütçesi, sabit ağırlıklar ve geçici attention durumunu aynı zihinsel modelde birleştir.
- Token = metin parçası
- Context = toplam token bütçesi
- Attention = odak seçimi
- KV cache = geçici bellek
ÖNCE BUNLARI BİL
bütçesi, penceresi ve mekanizması…Context; sistem mesajı, template, kullanıcı, RAG içeriği ve cevap rezervinin toplam token bütçesidir. Token ID ve parçalanma modele özgüdür; Türkçe maliyet tahmin edilmez, hedef tokenizer ile ölçülür.
Inference sırasında WQ/WK/WV sabittir. Q/K/V vektörleri ve attention skorları girdiye göre değişir; KV cache geçmiş K/V aktivasyonlarını geçici tutar.
İlk düşünce
Context iki katına çıkınca toplam VRAM kesin dört katına çıkar.
Düzeltme
Klasik attention işi yaklaşık dört kat artar; sabit ağırlıklar ve çalışma zamanı nedeniyle toplam VRAM aynı oranda artmak zorunda değildir.
Karar kuralı
Gerçek uzunluk dağılımını ölç; önce 1024–2048 ile güvenli baseline kur.
KAVRAM DERİNLİĞİ
Aynı kavramı üç derinlikte anlat. Seviyeni seç, anında geç. Üniversite öğrencisi için önerilen başlangıç: LİSANS.
BPE bir alt-sözcük algoritmasıdır; SentencePiece farklı algoritmaları destekleyen bir araçtır. Token sayısı sözlük, normalleştirme ve metne bağlıdır. Türkçe için sabit bir maliyet çarpanı kullanma; eş anlamlı metinleri aynı tokenizer ve şablonla ölç.