Der Kontext umfasst die aktuellen Prompt-Tokens, systemischen Hinweise und – bei Retrieval – eingeblendete Dokumente, die einem Modell während einer Anfrage zur Verfügung stehen. Je größer das Kontextfenster, desto mehr Gesprächsverlauf, Tabellen oder Code kann ein LLM berücksichtigen. Gleichzeitig steigt mit jedem Token der Rechen- und Kostenaufwand.
Strategien für besseren Kontext
- Chunking + RAG: Lange Quellen werden in relevante Abschnitte zerlegt.
- Memory-Effizienz: Sliding-Window- oder Attention-Sparseness reduzieren Kosten.
- Guardrails: System-Prompts legen Tonalität, Stil und Sicherheitsvorgaben fest.
