Co je kontextové okno a proč na něm záleží
Kontextové okno (context window) je horní hranice množství tokenů, které může model velkého jazyka (LLM) zpracovat v jednom volání. Obvykle zahrnuje vstupní instrukce, historii konverzace, systémová pravidla, vyhledané dokumenty a vygenerovanou odpověď. Při optimalizaci webů pro AIO/AEO (AI/Answer Engine Optimization) limit kontextu určuje, kolik důkazů se vejde do promptu, jak je model udrží v pracovní paměti a kterou část obsahu může citovat bez oříznutí.
Tokeny vs. znaky: praktické přepočty
- Token není znak ani slovo; je to fragment textu. V evropských jazycích platí hrubé vodítko: 1 token ≈ 0,75 slova nebo ≈ 4 znaky.
- Při plánování promptů a dávkování dokumentů počítejte s rezervou 10–20 % na systémové a skryté tokeny.
- U dlouhých HTML stránek odhadněte kapacitu jednoduchým skriptem: odstranit HTML, normalizovat mezery, tokenizovat, porovnat s limitem modelu.
Struktura obsahu v kontextu: vrstvy a priority
- Vrstvy: systémová pravidla → instrukce úlohy → metadata (identifikátory, zdroje) → důkazní úryvky → otázka.
- Priorita: nejdůležitější důkaz umístit výše, redundantní pasáže níže nebo mimo kontext (s odkazem).
- Ekonomika tokenů: šetřit na narativních částech, investovat do tabulek, čísel, citací a negativních tvrzení.
Truncation (ořezávání) a jeho rizika
- Příliš dlouhý vstup bývá potichu oříznut od začátku nebo od konce. Ztráta systémových pravidel vede k porušení stylu; ztráta důkazů k halucinacím.
- Obrana: značky sentinel (BEGIN/END), počítadla tokenů, rozdělení do sekcí a průběžná shrnutí s citacemi.
- U pipeline RAG používejte krátké, sémanticky husté chunkování (např. 300–800 tokenů) s překryvem sliding window 10–20 %.
Chunking a propojování: jak dělit dlouhé stránky
- Přirozené hranice: H2/H3, tabulky, seznamy, definice; vyhnout se dělení odstavce uprostřed věty.
- Lokální shrnutí: na konci sekce 2–3 věty „Key takeaways“ + odkazy na zdroje s kotvami.
- Anchor ID: každý blok má stabilní
idpro přesné citování v odpovědích AI.
Retrieval-Augmented Generation (RAG) a kontextové okno
RAG snižuje nároky na kontext tím, že vybírá jen nejrelevantnější úryvky.
- Vícefázové vyhledávání: rychlý vektorový recall → nové seřazení pomocí cross-encoderu → výběr top-k (obvykle 3–8 chunků).
- Filtrování šumu: penalizovat dlouhé, nestrukturované úryvky; upřednostňovat tabulky a definice.
- Citace: ke každému úryvku přidávat URL, datum a verzi; LLM pak méně tíhne k domýšlení.
Kontextové strategie: krátký vs. dlouhý kontext
- Krátký kontext (≤ 8–32k tokenů): vyšší přesnost pozornosti; vyžaduje disciplinovanou práci s prompty a výběr úryvků.
- Dlouhý kontext (≥ 100k tokenů): vejde se do něj více zdrojů, ale může trpět distance bias (nižší váhou vzdálenějších tokenů) a vyšší latencí.
- V praxi kombinujte condensed brief (200–500 tokenů) + evidence appendix (náhledy tabulek) místo vkládání celých článků.
Řízení latence a nákladů
- Komplexita: hustota pozornosti roste s délkou kontextu; delší prompt znamená vyšší cenu a pomalejší odezvu.
- KV cache: u interaktivních chatů omezte opakované odesílání stejných systémových částí pomocí zachování stavu (pokud to rozhraní podporuje).
- Response budget: ponechte 10–30 % okna pro odpověď; pokud ho vyčerpáte kontextem, model výstup nedokončí.
Architektura promptu pro maximální informační hustotu
- Hlavička instrukcí: role, styl, požadavky na citace a omezení (např. „necituji mimo uvedené zdroje“).
- Plán dotazu: stručný seznam dílčích úloh, které má model splnit (extrakce → validace → odpověď).
- Balíček důkazů: 3–8 nejrelevantnějších chunků (tabulky/seznamy), každý s řádkem metadat: origin, date, version.
- Schéma výstupu: krátká specifikace formátu (např. tabulka JSON/HTML), aby se předešlo příliš rozvláčnému výstupu.
Negativní a omezující signály proti halucinacím
- „Pokud chybí důkaz, uveď ‚neznámé‘“: výslovně povolit odpověď „nevím“.
- Seznam zakázaných sekcí: v promptu zakázat použití částí s nízkou důvěryhodností nebo zastaralých verzí.
- Konflikty: pokud se důkazy liší, vyžadovat „conflict report“ s uvedením obou verzí a dat.
Shrnování dlouhých dokumentů: kaskády a map-reduce
- Map: lokální shrnutí na úrovni sekcí (≤ 200 tokenů každé) s citacemi.
- Reduce: syntéza shrnutí do vyšší úrovně (≤ 400 tokenů), zachovat metadata.
- Refine: doplnit chybějící fakta na základě zpětné vazby nebo dalších chunků.
Evaluace „context utilization“
- Hit-rate: podíl odpovědí, které citují poskytnuté úryvky (cílová hodnota ≥ 85 %).
- Exact match u klíčových polí: čísla a výčtové hodnoty v odpovědi vs. „zlatý“ dataset.
- Test pozičního zkreslení: měňte pořadí úryvků a sledujte změny (model by neměl ignorovat pozdější úryvky, pokud jsou relevantní).
Kontext ve vícetahových dialozích
- Prořezávání relace: zachovávejte pouze poslední kroky + „shrnutí paměti“ se zdroji.
- Vláknění: oddělujte různá témata do samostatných vláken, abyste neplýtvali kontextem.
- Odkazy se stavem: místo opakovaného vkládání tabulek odesílejte ID a požadujte opětovné vyhledání.
Praktiky HTML/SEO pro AEO a kontext
- Krátké, strukturované bloky: sekce H2, tabulky a definice; omezit dlouhé nestrukturované texty.
- Exporty: nabídnout CSV/JSON; při použití RAG lze odeslat jen výřez s přesnými poli.
- Verzování: datum poslední revize a číslo verze u tabulek (LLM upřednostní nejnovější).
Pokročilé techniky pro rozsáhlé kontexty
- Nové řazení s ohledem na kontextové okno: zvyšte top-k recall a po novém seřazení zmenšete kontext top-m.
- Hierarchické embeddingy: dokument → sekce → odstavec; vyhledávání nejprve v hrubých, poté v jemných vektorech.
- Hybridní BM25 + vektory: zlepší přesnost u číselných údajů a přesných frází (GTIN, MPN, kódy).
Bezpečnost a compliance v kontextu
- Filtrování PII/PHI: před vložením do kontextu citlivá data pseudonymizovat nebo redigovat.
- Licenční omezení: citovat pouze zdroje s povolením; ukládat doklad o licencích do metadat.
- Auditní stopa: zaznamenávat, které úryvky byly odeslány a jakou odpověď vyvolaly.
Nejčastější chyby při práci s kontextovým oknem
- Vkládání celých článků bez výběru – zbytečné náklady a nižší přesnost.
- Nedostatečná rezerva pro odpověď – model výstup nedokončí nebo ho zkrátí.
- Míchání témat v jednom promptu – snížení relevance a vyšší riziko halucinací.
- Chybějící citace a verze – nelze zpětně ověřit, zda odpověď vycházela z aktuálních dat.
Checklist pro operativní práci s kontextem
- Definovat cíl odpovědi a output schema před výběrem důkazů.
- Vybrat 3–8 nejrelevantnějších chunků (300–800 tokenů) s metadaty.
- Zajistit 10–30 % volného prostoru pro generování.
- Označit sekce značkami sentinel a přidat krátký „brief“ (≤ 300 tokenů).
- Pro audit a replikaci zaznamenávat použité úryvky, verze a URL.
Kontextové okno je praktickou hranicí „pracovní paměti“ LLM. Právě rozumný výběr úryvků, struktura promptu a důslednost při citování zajišťují přesnost, nižší latenci a reprodukovatelnost odpovědí. Namísto snahy neomezeně zvětšovat kontext se vyplatí zvyšovat jeho informační hustotu – a tím získat konzistentní, ověřitelné a rychlé odpovědi v prostředích AIO/AEO i v moderním SEO.
