Znie to lákavo jednoducho: nahráte pár firemných dokumentov do ChatGPT, položíte otázku a dostanete presnú odpoveď postavenú na vašich dátach. Realita je však oveľa krutejšia. Táto naivná predstava je jedným z najrozšírenejších omylov okolo technológie zvanej RAG (Retrieval-Augmented Generation) – a firmy, ktoré na ňu naletia, sa čudujú, prečo im „AI chatbot“ po pár týždňoch začne halucinovať, ignorovať polovicu dokumentov alebo odpovedať úplne mimo kontext.
Pravda je taká, že funkčný RAG systém nie je jednorazová integrácia, ale premyslená architektúra s viacerými pohyblivými časťami, z ktorých každá môže celý systém buď posunúť k excelentnosti, alebo ho potichu pokaziť.
Pochopenie skutočnej architektúry RAG rozhoduje o tom, či váš AI projekt bude dôveryhodný, alebo sa stane firemnou hanbou. Priamo ovplyvňuje:
Poďme sa teda pozrieť, čo sa naozaj skrýva pod povrchom „jednoduchého“ RAG systému.
Predtým, než sa dokument vôbec dostane do systému, musí sa rozdeliť na menšie časti – tzv. chunky. Ak sú príliš veľké, model dostane zbytočný „šum“ a míňa kapacitu context window na nepodstatné informácie. Ak sú príliš malé, stratí sa dôležitý kontext a veta vytrhnutá z kontextu môže úplne zmeniť význam. Táto na prvý pohľad triviálna úprava je jedným z najčastejších zdrojov zlyhaní celého systému.
Každý chunk sa premení na embedding – číselnú reprezentáciu jeho významu – a uloží sa do vektorovej databázy. Keď používateľ položí otázku, systém hľadá chunky s najpodobnejším významom. Problém je, že „podobný“ neznamená vždy „správny“ – model môže nájsť text, ktorý znie relevantne, no v skutočnosti odpovedá na úplne inú otázku.
Vyspelé RAG systémy preto pridávajú ďalší krok – reranking, kde sa nájdené kandidátske úseky textu ešte raz prehodnotia presnejším, no výpočtovo náročnejším modelom, ktorý vyberie skutočne najrelevantnejšie časti. Bez tohto kroku sa do finálnej odpovede ľahko dostane text, ktorý sa síce podobá, ale vecne nesúvisí.
Dokumenty sa menia, mažú, nahrádzajú novšími verziami. Bez procesu pravidelnej aktualizácie vektorovej databázy systém časom začne pracovať so zastaranými alebo protirečivými informáciami – a nikto si to nemusí všimnúť, kým sa nestane vážna chyba.
Aj tie najlepšie nájdené dáta sú zbytočné, ak model nedostane jasnú inštrukciu, ako s nimi naložiť – kedy sa má striktne držať dokumentov, kedy smie odpoveď doplniť vlastnou znalosťou a ako má reagovať, keď odpoveď v dokumentoch jednoducho nenájde.
Ak chcete pochopiť, ako AI nástroje naozaj fungujú a ako ich prakticky nasadiť bez potreby programátorských znalostí, ponúkame jednodňový kurz „Praktický úvod do umelej inteligencie (AI) bez predchádzajúcich znalostí“. Počas kurzu sa naučíte pracovať s OpenAI a Deepseek, vyskúšate si prompt engineering na reálnych príkladoch, natrénujete si vlastný AI model bez písania kódu pomocou DataRobot a Google Colab a ako bonus nahliadnete aj do AI nástrojov na AWS.
Zvyčajne preto, že vyhľadávanie nedodalo skutočne relevantný kontext, alebo model dostal nejasnú inštrukciu, ako s nájdenými dátami naložiť.
Pri malom množstve krátkych dokumentov to môže krátkodobo fungovať, no pri väčšom objeme dát alebo vyšších nárokoch na presnosť to rýchlo naráža na limity.
Najlepšie funguje pri textových dokumentoch. Pri tabuľkových či vysoko štruktúrovaných dátach je často efektívnejšie kombinovať RAG s inými prístupmi.