Zní to lákavě jednoduše: nahrajete pár firemních dokumentů do ChatGPT, položíte otázku a dostanete přesnou odpověď postavenou na vašich datech. Realita je ale mnohem krutější. Tato naivní představa je jedním z nejrozšířenějších omylů okolo technologie zvané RAG (Retrieval-Augmented Generation) – a firmy, které jí naletí, se pak diví, proč jim „AI chatbot“ po pár týdnech začne halucinovat, ignorovat polovinu dokumentů nebo odpovídat úplně mimo kontext.
Pravda je taková, že funkční RAG systém není jednorázová integrace, ale promyšlená architektura s několika pohyblivými částmi, z nichž každá může celý systém buď posunout k excelenci, nebo ho potichu pokazit.
Pochopení skutečné architektury RAG rozhoduje o tom, jestli váš AI projekt bude důvěryhodný, nebo se stane firemní ostudou. Přímo ovlivňuje:
Pojďme se tedy podívat, co se skutečně skrývá pod povrchem „jednoduchého“ RAG systému.
Než se dokument vůbec dostane do systému, musí se rozdělit na menší části – tzv. chunky. Pokud jsou příliš velké, model dostane zbytečný „šum“ a plýtvá kapacitou context window na nepodstatné informace. Pokud jsou příliš malé, ztratí se důležitý kontext a věta vytržená z kontextu může úplně změnit význam. Tato na první pohled triviální úprava je jedním z nejčastějších zdrojů selhání celého systému.
Každý chunk se přemění na embedding – číselnou reprezentaci jeho významu – a uloží se do vektorové databáze. Když uživatel položí otázku, systém hledá chunky s nejpodobnějším významem. Problém je, že „podobný“ neznamená vždy „správný“ – model může najít text, který zní relevantně, ale ve skutečnosti odpovídá na úplně jinou otázku.
Vyspělé RAG systémy proto přidávají další krok – reranking, kde se nalezené kandidátské úseky textu ještě jednou přehodnotí přesnějším, ale výpočetně náročnějším modelem, který vybere skutečně nejrelevantnější části. Bez tohoto kroku se do finální odpovědi snadno dostane text, který se sice podobá, ale věcně nesouvisí.
Dokumenty se mění, mažou, nahrazují novějšími verzemi. Bez procesu pravidelné aktualizace vektorové databáze systém časem začne pracovat se zastaralými nebo protichůdnými informacemi – a nikdo si toho nemusí všimnout, dokud nedojde k vážné chybě.
I ta nejlepší nalezená data jsou zbytečná, pokud model nedostane jasnou instrukci, jak s nimi naložit – kdy se má striktně držet dokumentů, kdy smí odpověď doplnit vlastní znalostí a jak má reagovat, když odpověď v dokumentech jednoduše nenajde.
Pokud chcete pochopit, jak AI nástroje skutečně fungují a jak je prakticky nasadit bez potřeby programátorských znalostí, nabízíme jednodenní kurz „Praktický úvod do umělé inteligence (AI) bez předchozích znalostí“. Během kurzu se naučíte pracovat s OpenAI a Deepseek, vyzkoušíte si prompt engineering na reálných příkladech, natrénujete si vlastní AI model bez psaní kódu pomocí DataRobot a Google Colab a jako bonus nahlédnete i do AI nástrojů na AWS.
Obvykle proto, že vyhledávání nedodalo skutečně relevantní kontext, nebo model dostal nejasnou instrukci, jak s nalezenými daty naložit.
U malého množství krátkých dokumentů to může krátkodobě fungovat, ale u většího objemu dat nebo vyšších nároků na přesnost to rychle naráží na limity.
Nejlépe funguje u textových dokumentů. U tabulkových či vysoce strukturovaných dat je často efektivnější kombinovat RAG s jinými přístupy.