Kontextové okno: limit délky vstupu zpracovaného jazykovým modelem (LLM)

Kontextové okno: Limit pre dĺžku vstupu spracovaného LLM

Co je kontextové okno a proč na něm záleží

Kontextové okno (context window) je horní hranice množství tokenů, které může model velkého jazyka (LLM) zpracovat v jednom volání. Obvykle zahrnuje vstupní instrukce, historii konverzace, systémová pravidla, vyhledané dokumenty a vygenerovanou odpověď. Při optimalizaci webů pro AIO/AEO (AI/Answer Engine Optimization) limit kontextu určuje, kolik důkazů se vejde do promptu, jak je model udrží v pracovní paměti a kterou část obsahu může citovat bez oříznutí.

Tokeny vs. znaky: praktické přepočty

  • Token není znak ani slovo; je to fragment textu. V evropských jazycích platí hrubé vodítko: 1 token ≈ 0,75 slova nebo ≈ 4 znaky.
  • Při plánování promptů a dávkování dokumentů počítejte s rezervou 10–20 % na systémové a skryté tokeny.
  • U dlouhých HTML stránek odhadněte kapacitu jednoduchým skriptem: odstranit HTML, normalizovat mezery, tokenizovat, porovnat s limitem modelu.

Struktura obsahu v kontextu: vrstvy a priority

  1. Vrstvy: systémová pravidla → instrukce úlohy → metadata (identifikátory, zdroje) → důkazní úryvky → otázka.
  2. Priorita: nejdůležitější důkaz umístit výše, redundantní pasáže níže nebo mimo kontext (s odkazem).
  3. Ekonomika tokenů: šetřit na narativních částech, investovat do tabulek, čísel, citací a negativních tvrzení.

Truncation (ořezávání) a jeho rizika

  • Příliš dlouhý vstup bývá potichu oříznut od začátku nebo od konce. Ztráta systémových pravidel vede k porušení stylu; ztráta důkazů k halucinacím.
  • Obrana: značky sentinel (BEGIN/END), počítadla tokenů, rozdělení do sekcí a průběžná shrnutí s citacemi.
  • U pipeline RAG používejte krátké, sémanticky husté chunkování (např. 300–800 tokenů) s překryvem sliding window 10–20 %.

Chunking a propojování: jak dělit dlouhé stránky

  • Přirozené hranice: H2/H3, tabulky, seznamy, definice; vyhnout se dělení odstavce uprostřed věty.
  • Lokální shrnutí: na konci sekce 2–3 věty „Key takeaways“ + odkazy na zdroje s kotvami.
  • Anchor ID: každý blok má stabilní id pro přesné citování v odpovědích AI.

Retrieval-Augmented Generation (RAG) a kontextové okno

RAG snižuje nároky na kontext tím, že vybírá jen nejrelevantnější úryvky.

  • Vícefázové vyhledávání: rychlý vektorový recall → nové seřazení pomocí cross-encoderu → výběr top-k (obvykle 3–8 chunků).
  • Filtrování šumu: penalizovat dlouhé, nestrukturované úryvky; upřednostňovat tabulky a definice.
  • Citace: ke každému úryvku přidávat URL, datum a verzi; LLM pak méně tíhne k domýšlení.

Kontextové strategie: krátký vs. dlouhý kontext

  • Krátký kontext (≤ 8–32k tokenů): vyšší přesnost pozornosti; vyžaduje disciplinovanou práci s prompty a výběr úryvků.
  • Dlouhý kontext (≥ 100k tokenů): vejde se do něj více zdrojů, ale může trpět distance bias (nižší váhou vzdálenějších tokenů) a vyšší latencí.
  • V praxi kombinujte condensed brief (200–500 tokenů) + evidence appendix (náhledy tabulek) místo vkládání celých článků.

Řízení latence a nákladů

  • Komplexita: hustota pozornosti roste s délkou kontextu; delší prompt znamená vyšší cenu a pomalejší odezvu.
  • KV cache: u interaktivních chatů omezte opakované odesílání stejných systémových částí pomocí zachování stavu (pokud to rozhraní podporuje).
  • Response budget: ponechte 10–30 % okna pro odpověď; pokud ho vyčerpáte kontextem, model výstup nedokončí.

Architektura promptu pro maximální informační hustotu

  1. Hlavička instrukcí: role, styl, požadavky na citace a omezení (např. „necituji mimo uvedené zdroje“).
  2. Plán dotazu: stručný seznam dílčích úloh, které má model splnit (extrakce → validace → odpověď).
  3. Balíček důkazů: 3–8 nejrelevantnějších chunků (tabulky/seznamy), každý s řádkem metadat: origin, date, version.
  4. Schéma výstupu: krátká specifikace formátu (např. tabulka JSON/HTML), aby se předešlo příliš rozvláčnému výstupu.

Negativní a omezující signály proti halucinacím

  • „Pokud chybí důkaz, uveď ‚neznámé‘“: výslovně povolit odpověď „nevím“.
  • Seznam zakázaných sekcí: v promptu zakázat použití částí s nízkou důvěryhodností nebo zastaralých verzí.
  • Konflikty: pokud se důkazy liší, vyžadovat „conflict report“ s uvedením obou verzí a dat.

Shrnování dlouhých dokumentů: kaskády a map-reduce

  • Map: lokální shrnutí na úrovni sekcí (≤ 200 tokenů každé) s citacemi.
  • Reduce: syntéza shrnutí do vyšší úrovně (≤ 400 tokenů), zachovat metadata.
  • Refine: doplnit chybějící fakta na základě zpětné vazby nebo dalších chunků.

Evaluace „context utilization“

  • Hit-rate: podíl odpovědí, které citují poskytnuté úryvky (cílová hodnota ≥ 85 %).
  • Exact match u klíčových polí: čísla a výčtové hodnoty v odpovědi vs. „zlatý“ dataset.
  • Test pozičního zkreslení: měňte pořadí úryvků a sledujte změny (model by neměl ignorovat pozdější úryvky, pokud jsou relevantní).

Kontext ve vícetahových dialozích

  • Prořezávání relace: zachovávejte pouze poslední kroky + „shrnutí paměti“ se zdroji.
  • Vláknění: oddělujte různá témata do samostatných vláken, abyste neplýtvali kontextem.
  • Odkazy se stavem: místo opakovaného vkládání tabulek odesílejte ID a požadujte opětovné vyhledání.

Praktiky HTML/SEO pro AEO a kontext

  • Krátké, strukturované bloky: sekce H2, tabulky a definice; omezit dlouhé nestrukturované texty.
  • Exporty: nabídnout CSV/JSON; při použití RAG lze odeslat jen výřez s přesnými poli.
  • Verzování: datum poslední revize a číslo verze u tabulek (LLM upřednostní nejnovější).

Pokročilé techniky pro rozsáhlé kontexty

  • Nové řazení s ohledem na kontextové okno: zvyšte top-k recall a po novém seřazení zmenšete kontext top-m.
  • Hierarchické embeddingy: dokument → sekce → odstavec; vyhledávání nejprve v hrubých, poté v jemných vektorech.
  • Hybridní BM25 + vektory: zlepší přesnost u číselných údajů a přesných frází (GTIN, MPN, kódy).

Bezpečnost a compliance v kontextu

  • Filtrování PII/PHI: před vložením do kontextu citlivá data pseudonymizovat nebo redigovat.
  • Licenční omezení: citovat pouze zdroje s povolením; ukládat doklad o licencích do metadat.
  • Auditní stopa: zaznamenávat, které úryvky byly odeslány a jakou odpověď vyvolaly.

Nejčastější chyby při práci s kontextovým oknem

  • Vkládání celých článků bez výběru – zbytečné náklady a nižší přesnost.
  • Nedostatečná rezerva pro odpověď – model výstup nedokončí nebo ho zkrátí.
  • Míchání témat v jednom promptu – snížení relevance a vyšší riziko halucinací.
  • Chybějící citace a verze – nelze zpětně ověřit, zda odpověď vycházela z aktuálních dat.

Checklist pro operativní práci s kontextem

  1. Definovat cíl odpovědi a output schema před výběrem důkazů.
  2. Vybrat 3–8 nejrelevantnějších chunků (300–800 tokenů) s metadaty.
  3. Zajistit 10–30 % volného prostoru pro generování.
  4. Označit sekce značkami sentinel a přidat krátký „brief“ (≤ 300 tokenů).
  5. Pro audit a replikaci zaznamenávat použité úryvky, verze a URL.

Kontextové okno je praktickou hranicí „pracovní paměti“ LLM. Právě rozumný výběr úryvků, struktura promptu a důslednost při citování zajišťují přesnost, nižší latenci a reprodukovatelnost odpovědí. Namísto snahy neomezeně zvětšovat kontext se vyplatí zvyšovat jeho informační hustotu – a tím získat konzistentní, ověřitelné a rychlé odpovědi v prostředích AIO/AEO i v moderním SEO.