Přehled: co je vektorová databáze a proč je klíčová pro LLM/SEO
Vektorová databáze je specializované úložiště pro ukládání a dotazování embeddingů – vysokodimenzionálních reprezentací textu, obrázků či multimodálních objektů. Umožňuje vyhledávání podobnosti (k-NN) podle sémantiky namísto přesné shody řetězců. V praxi je základem pro RAG (Retrieval-Augmented Generation), interní vyhledávání, deduplikaci obsahu, doporučování a moderní SEO/AEO (Answer/AI Engine Optimization), kde je nutné odpovídat na dotazy „podle významu“.
Embeddingy: význam, typy a vlastnosti
- Definice: vektor reálných čísel (např. d=384–4096), který zachycuje význam jednotky obsahu (slova, věty, odstavce, dokumentu, obrázku).
- Typy: sentence a passage embeddingy pro text; multimodal (text↔obraz); domain-specific (kód, právo, medicína).
- Normalizace: L2 norma na jednotkovou délku je běžná při kosinové podobnosti a usnadňuje metrické porovnávání.
- Stabilita v čase: změny modelů vytvářejí odlišné embeddingy; vyžadují versioning a migrační strategie.
Metriky podobnosti: kosinus, dot-product a euklidovská vzdálenost
- Kosinová podobnost: míra úhlu mezi vektory; je robustní vůči škálování a upřednostňuje se u L2 normalizovaných embeddingů.
- Dot-product (inner product): citlivý na délku vektoru; používá se při učení, které optimalizuje skóre přímo.
- Vzdálenost L2: vhodná pro některé knihovny a kvantizační indexy; při normalizaci konverguje ke kosinové podobnosti.
Indexování: přesné vs. aproximované vyhledávání k-NN
- Přesné (brute-force): 100 % recall, ale nákladné (O(N·d)). Vhodné pro malé kolekce, re-ranking nebo offline dávkové zpracování.
- ANN indexy (Approximate Nearest Neighbors): HNSW (graf), IVF (seznamy clusterů k-means), PQ/OPQ (kvantizace), ScaNN (anizotropní vyhledávání). Umožňují kompromis mezi recall, latencí a pamětí.
- Parametry ladění: efSearch/efConstruction pro HNSW, nlist/nprobe pro IVF, bitová hloubka PQ; všechny ovlivňují přesnost a rychlost.
Struktura záznamu: vektor + metadata + obsah
- Primární klíč: stabilní
id(URI/UUID) pro mapování zpět ke zdroji (URL, dokumentu, entitě). - Vektor: pole
float32/float16/int8(podle komprese); případně více vektorů pro různé pohledy (title/body/anchor). - Metadata: vlastnosti umožňující filtrování (filterable) (jazyk, datum, autor, téma, region, přístupová práva).
- Payload: zkrácený text/HTML snippet, odkaz, checksum, verze embeddingu a zdroje.
Komprese a náklady: PQ, SQ a smíšená přesnost
- Product Quantization (PQ/OPQ): snižuje nároky na RAM/SSD a latenci za cenu mírné ztráty přesnosti.
- Scalar Quantization (SQ/int8): jednodušší a levná komprese; pozor na citlivost u slabších modelů.
- Float16/BF16: kompromis mezi přesností a náklady při akceleraci pomocí GPU.
Filtry a hybridní vyhledávání: BM25 + vektor + re-ranking
- Vektor + filtry metadat: omezení prostoru (jazyk, časové okno, region) zvyšuje relevanci a rychlost.
- Hybridní vyhledávání: kombinace lexikálního skóre (BM25) a vektorového skóre (např. vážený součet nebo fúzní model natrénovaný učitelem).
- Re-ranking: cross-encoder (nákladnější, přesnější) znovu seřadí top-k kandidátů; často přináší největší zvýšení kvality.
- MMR/Diversity: penalizuje redundanci a vrací rozmanitou sadu pasáží pro RAG.
Chunkování a granularita: jak obsah „krájet“
- Pasáže o délce 200–400 tokenů: dobrý kompromis pro QA a RAG; pro zachování souvislostí udržujte 10–20% překryv.
- Víceúrovňové embeddingy: nadpis (title), shrnutí (summary), pasáž (passage) – dotaz může jednotlivým jednotkám přiřazovat různé váhy.
- Tabulky a kód: používejte specializované tokenizéry a zachovávejte strukturu (ukotvení CSV/JSON v metadatech).
RAG pipeline: kde se zapojuje vektorová DB
- Indexace: extrakce → chunk → embed → upsert do vektorové DB (s metadaty, verzí, checksumem).
- Retrieval: dotaz → embed → vektorové + hybridní vyhledávání → filtry → top-k.
- Orchestrace: re-ranking, MMR, sloučení s pravidly (compliance), sestavení kontextu.
- Generování: prompt s kontextem, citace/zdroje, post-processing (ověření, redakce).
Správa verzí a migrace embeddingů
- Verze modelu:
embed_model=v3.2v metadatech; umožní souběžnou existenci více generací. - Dvojitý index: paralelní budování nového indexu; přepnutí read-path po validaci.
- Tombstones a TTL: označte zastaralé pasáže; plánované čištění šetří náklady a zlepšuje kvalitu.
Škálování, latence a SLO
- Horizontální škálování: shardování podle
idnebo tématu; repliky pro čtení. - Teplé cache: ukládání nejčastějších query embeddings a výsledků top-k do cache; omezí výkyvy latence způsobené přístupem do mezilehlé paměti.
- SLO: cílová latence P95 (např. < 150 ms pro top-k=20) a chybovost; při špičkách použijte backoff.
Evaluace kvality: jak měřit relevanci
- Recall@k / Precision@k: základní metriky pro návrat relevantních pasáží.
- nDCG@k, MRR: zohledňují pořadí; vhodné při re-rankingu.
- Answerability: procento dotazů, na které RAG dokáže spolehlivě odpovědět s poskytnutým kontextem.
- Human-in-the-loop: kurátorské hodnocení, porota, záznamy případů (judgements) pro kalibraci.
Bezpečnost, práva a compliance
- Autorizace na úrovni záznamu: Attribute-Based Access Control v metadatech (tenant, třída dokumentu, region).
- PII a GDPR: maskování/šifrování payloadu, právo na výmaz (kaskádové tombstones) a audit přístupů.
- Izolace tenantů: indexy nebo namespace pro jednotlivé tenanty; minimalizace „úniku“ kontextu při RAG.
Nejčastější antipatterny a chyby
- Míchání verzí embeddingů: snižuje relevanci a konzistenci výsledků.
- Příliš velké chunky: rozostření signálu → horší přesnost a zbytečné náklady.
- Nefiltrované zdroje: zastaralé nebo duplicitní pasáže vedou k halucinacím v RAG.
- Ignorování re-rankingu: samotné ANN často nestačí k dosažení špičkové kvality.
- Chybějící metadata: nemožnost používat „privacy“ filtry, regionální pravidla a časovou relevanci.
Výběr platformy: open source, cloud a spravované služby
- Open-source core: FAISS/HNSW (knihovny) zabudované do databází (např. Postgres+pgvector) – dobrá volba pro kontrolu a integraci.
- Vektorové DB: systémy navržené pro vektory (např. s grafovým/ANN jádrem) a nativním filtrem metadat, shardováním a replikací.
- Spravované služby: rychlý start, SLA, automatické škálování, ale také vendor lock-in a nákladová omezení.
Provoz a observabilita
- Telemetrie: latence, hit rate cache, paměť, stav indexů, drift query embeddings.
- Detekce driftu: změny distribuce dotazů/obsahu vyžadují nové vytvoření embeddingů nebo úpravu chunkování.
- Runbook pro incidenty: zhoršení recallu, rozpad indexu, selhání shardu – definujte postupy a kontakty na SRE.
Multimodální a vícejazyčné scénáře
- Cross-lingual: jednotný embeddingový prostor pro více jazyků; filtry metadat brání míchání nesouvisejících jazyků v odpovědích.
- Multimodální: vyhledávání obrázek→text, text→obrázek; záznamy obsahují typ modality a odkaz na původní asset.
Integrace s moderním SEO/AIO/AEO
- Sémantické klastry: skupiny URL/odpovědí reprezentované centrálním vektorem; umožňují analýzu topical authority.
- FAQ a bloky s odpovědí na prvním místě: embeddingy otázek a odpovědí zvyšují šanci na přesné odpovědi v rozhraních Chat/AI.
- Deduplikace a kanibalizace: prahy podobnosti odhalují interní duplicity, které snižují CTR a pozici ve výsledcích vyhledávání.
- Personalizace: re-ranking podle profilu/segmentu při respektování metadat ochrany soukromí.
Praktický kontrolní seznam před nasazením
- Definovaná granularita (title/summary/passage) a pravidla chunkování s překryvem.
- Vybraný ANN index (HNSW/IVF+PQ) a metrika (cosine/dot/L2) s odůvodněním.
- Filtry metadat (jazyk, region, čas, access) a hybridní vyhledávání s BM25.
- Implementovaný re-ranking a MMR pro zajištění rozmanitosti.
- Versioning embeddingů, plán migrace a tombstones.
- SLO pro latenci/recall, observabilita a upozornění.
- Bezpečnostní vrstva: ABAC, ochrana PII, audit.
- Benchmark: Recall@k, nDCG@k, answerability s kurátorským hodnocením.
Vektorová databáze jako infrastruktura sémantické relevance
Vektorová databáze je páteří sémantického vyhledávání a základním stavebním prvkem RAG a moderního SEO/AEO. Její hodnota se naplno projeví teprve tehdy, když se zkombinuje správný embeddingový model, dobře navržené chunkování, vhodný ANN index, filtry metadat, hybridní skórování a re-ranking. Díky jasné správě verzí, bezpečnostním zásadám a kvalitní observabilitě poskytuje konzistentní relevanci při udržitelných nákladech a škálování.
