Jak připravit firemní data pro AI: Datové pipeline, CDC a kvalita dat v praxi
Firma spustí nový AI systém a očekává rychlejší práci, nižší náklady a přesnější odpovědi. Po několika dnech však AI začne používat staré ceníky, zaměňovat zákazníky a pracovat s duplicitními smlouvami. Problém přitom nemusí být v modelu, ale v datech, která dostává.
Ani nejvýkonnější umělá inteligence nedokáže spolehlivě pracovat s informacemi, které jsou neaktuální, neúplné nebo rozptýlené v desítkách systémů. Příprava dat pro AI proto nezačíná výběrem modelu, ale pochopením toho, odkud data pocházejí, jak se mění a zda jim lze důvěřovat.
Proč kvalita AI závisí na kvalitě dat
Představte si AI asistenta, který odpovídá zákazníkům na otázky o produktech. Aktuální ceny má v databázi, ale v dokumentovém úložišti zůstal starý ceník. Pokud systém neví, který zdroj je platný, může použít nesprávnou verzi.
Takový problém nevyřeší pouze lepší prompt. Firma musí vědět:
- odkud konkrétní údaj pochází,
- kdy byl naposledy aktualizován,
- kdo za něj odpovídá,
- který systém je hlavním zdrojem pravdy,
- která verze dokumentu je platná,
- kdo má oprávnění údaj používat.
Pokud tyto informace chybějí, může AI odpovídat rychle, ale ne nutně správně nebo bezpečně.
Datová pipeline: cesta údajů firmou
Datová pipeline je proces, který přenáší a zpracovává data od zdroje až do místa jejich použití. Zdrojem může být databáze, API, CRM, ekonomický systém, Excel nebo dokumentové úložiště.
Pipeline by data neměla pouze přesunout. Měla by je zkontrolovat, vyčistit a doplnit o potřebný kontext.
Typické kroky datové pipeline
- Získání dat ze zdrojových systémů.
- Validace povinných polí, typů a formátů.
- Čištění duplicit a neplatných hodnot.
- Transformace do jednotné struktury.
- Doplnění metadat, například vlastníka nebo času aktualizace.
- Uložení do databáze, skladu nebo vyhledávacího indexu.
- Monitoring chyb, zpoždění a kvality.
Pokud se zpracování přeruší, kvalitní pipeline musí pokračovat bez ztráty dat a bez vytváření duplicit.
Batch zpracování, CDC a data v reálném čase
Ne všechna data musí být aktualizována okamžitě. Měsíční report může vzniknout během noci. U stavu objednávky nebo bezpečnostního incidentu však může být několika hodinové zpoždění nepřijatelné.
Při dávkovém zpracování se data přenášejí v pravidelných intervalech. Implementace bývá jednodušší, ale informace jsou dostupné se zpožděním.
Change Data Capture, zkráceně CDC, sleduje změny v databázi a přenáší pouze nové, upravené nebo odstraněné záznamy. Pokud se změní adresa zákazníka, není nutné kopírovat celou tabulku.
CDC přináší:
- rychlejší aktualizaci dat,
- menší objem přenášených informací,
- nižší zatížení zdrojové databáze,
- možnost reagovat téměř okamžitě.
Současně je nutné řešit opakované zpracování, pořadí událostí, idempotenci a zotavení po chybě.
Event-driven integrace
Event-driven architektura pracuje s událostmi, které popisují, že se něco stalo. Může jít o vytvoření objednávky, nahrání smlouvy, zaplacení faktury nebo změnu údajů zákazníka.
Po nahrání smlouvy může systém automaticky:
- spustit OCR,
- extrahovat důležité údaje,
- aktualizovat vyhledávací index,
- upozornit odpovědného pracovníka.
Výhodou je rychlost a menší přímé propojení mezi aplikacemi. Jedna služba publikuje událost a ostatní na ni reagují podle potřeby.
Kvalita dat: co musí firma sledovat
Kvalita dat není pouze kontrola, zda pole není prázdné. Hodnota může mít správný formát, ale být věcně nesprávná.
- Úplnost – nechybějí povinné údaje.
- Správnost – informace odpovídá realitě.
- Konzistence – stejný údaj se mezi systémy neliší.
- Aktuálnost – data nejsou zastaralá.
- Jedinečnost – nevznikají nežádoucí duplicity.
- Platnost – údaj splňuje definovaná pravidla.
Kvalita musí být sledována průběžně, protože zdroje, formáty a procesy se časem mění.
Data lineage: odkud přišla chybná odpověď?
Data lineage zachycuje cestu údaje od zdroje až po jeho konečné použití. Pokud AI zobrazí nesprávnou cenu, tým musí zjistit, zda chyba vznikla v databázi, během transformace nebo ve vyhledávacím indexu.
Dobrá lineage umožňuje sledovat:
- původ údajů,
- provedené transformace,
- čas aktualizace,
- cílové systémy,
- reporty a procesy, které údaj používají.
Praktický příklad: AI asistent zákaznické podpory
Firma chce vytvořit asistenta, který odpovídá na otázky o objednávkách, produktech a reklamacích. Data se nacházejí v CRM, objednávkovém systému, dokumentaci a databázi reklamací.
- CDC zachytí změnu stavu objednávky.
- Událost se odešle integrační platformě.
- Pipeline ověří identifikátory a povinná pole.
- Aktualizovaný údaj se uloží do vyhledávacího systému.
- Dokumentace se označí verzí a datem platnosti.
- AI získá pouze aktuální údaje, ke kterým má uživatel přístup.
- Odpověď může obsahovat odkaz na konkrétní zdroj.
Pokud pipeline selže nebo kvalita dat klesne, monitoring odešle upozornění.
Nejčastější chyby při přípravě dat pro AI
- Nahrání všech dat bez kontroly – AI pracuje i se starými a duplicitními záznamy.
- Chybějící hlavní zdroj pravdy – stejný údaj má v různých systémech jinou hodnotu.
- Chybějící metadata – není známá platnost, vlastník ani důvěrnost.
- Pipeline bez monitoringu – chyby zůstávají nepovšimnuté.
- Pozdní řešení oprávnění – AI může získat údaje, které uživatel nemá vidět.
- Chybějící idempotence – při opakování procesu vznikají duplicity.
Jak začít bez příliš velkého projektu
- Vyberte konkrétní AI scénář.
- Zmapujte potřebné datové zdroje.
- Určete vlastníky a hlavní zdroj pravdy.
- Nastavte pravidla kvality.
- Navrhněte pipeline a způsob aktualizace.
- Zaveďte monitoring a lineage.
- Řešení nejprve otestujte na malé skupině uživatelů.
Naučte se využívat AI prakticky
Na jednodenním kurzu Praktický úvod do umělé inteligence se naučíte pracovat s OpenAI a DeepSeek, formulovat kvalitní prompty, vyhledávat a analyzovat informace a vyzkoušíte si trénování jednoduchého modelu pomocí DataRobot a Google Colab. Kurz je vhodný i bez předchozích znalostí programování a přináší základní přehled nástrojů AI v AWS.
Kromě kurzů umělé inteligence nabízíme také další IT školení včetně programování v PHP, Javě a dalších technologiích.
Časté otázky
Musí firma používat CDC u každého AI projektu?
Ne. Pokud se data mění zřídka, může stačit pravidelný dávkový import.
Stačí data vyčistit před spuštěním AI?
Ne. Kvalita se musí sledovat průběžně, protože zdroje a procesy se mění.
Může AI používat všechna firemní data?
Ne automaticky. Systém musí respektovat oprávnění, důvěrnost a pravidla používání dat.