02 · BAĞLAM

Doğrulandı

Token, Context ve Attention

Token bütçesi, sabit ağırlıklar ve geçici attention durumunu aynı zihinsel modelde birleştir.

HIZLI BAKIŞ
  • Token = metin parçası
  • Context = toplam token bütçesi
  • Attention = odak seçimi
  • KV cache = geçici bellek

ÖNCE BUNLARI BİL

Türkçetokensayısıattention(Q, K, V)KV önbelleği: önceki K/V belleğiKAVRAM ŞEMASI

bütçesi, penceresi ve mekanizması…Context; sistem mesajı, template, kullanıcı, RAG içeriği ve cevap rezervinin toplam token bütçesidir. Token ID ve parçalanma modele özgüdür; Türkçe maliyet tahmin edilmez, hedef tokenizer ile ölçülür.

Inference sırasında WQ/WK/WV sabittir. Q/K/V vektörleri ve attention skorları girdiye göre değişir; KV cache geçmiş K/V aktivasyonlarını geçici tutar.

01

İlk düşünce

Context iki katına çıkınca toplam VRAM kesin dört katına çıkar.

02

Düzeltme

Klasik attention işi yaklaşık dört kat artar; sabit ağırlıklar ve çalışma zamanı nedeniyle toplam VRAM aynı oranda artmak zorunda değildir.

03

Karar kuralı

Gerçek uzunluk dağılımını ölç; önce 1024–2048 ile güvenli baseline kur.

KAVRAM DERİNLİĞİ

Aynı kavramı üç derinlikte anlat. Seviyeni seç, anında geç. Üniversite öğrencisi için önerilen başlangıç: LİSANS.

LİSANS

BPE bir alt-sözcük algoritmasıdır; SentencePiece farklı algoritmaları destekleyen bir araçtır. Token sayısı sözlük, normalleştirme ve metne bağlıdır. Türkçe için sabit bir maliyet çarpanı kullanma; eş anlamlı metinleri aynı tokenizer ve şablonla ölç.