Tokeny, Embeddings a Context Window: Ako AI naozaj „vidí“ text

Čo sú tokeny, embeddings a context window?

Keď napíšete AI modelu otázku, nevidí ju tak, ako ju vidíte vy. Nečíta slová, nerozpoznáva vety – v skutočnosti nemá ani poňatia o „písmenách“ v ľudskom zmysle. Namiesto toho pracuje s troma kľúčovými konceptmi, ktoré rozhodujú o tom, čomu vôbec dokáže „rozumieť“: tokeny, embeddings a context window.

Zoberte si to takto: predstavte si, že by ste sa museli naučiť čítať úplne nový jazyk, ktorý nemá abecedu, ale skladá sa z tisícok malých symbolov. Presne takto AI „vidí“ váš text – a práve tento neviditeľný proces v pozadí rozhoduje o tom, či vám dokáže odpovedať inteligentne, alebo sa „stratí“ uprostred rozhovoru.

Prečo je toto praktické pochopenie dôležité?

Pochopenie tokenov, embeddings a context window nie je len technická zaujímavosť – priamo ovplyvňuje, ako efektívne s AI pracujete:

Poďme sa teda pozrieť na každý z týchto troch konceptov podrobnejšie – sľubujeme, že to bude prekvapivo fascinujúce.

Tokeny, embeddings a context window do hĺbky

1. Tokeny: atómy jazyka pre AI

Token je najmenšia jednotka textu, s ktorou model pracuje. Nemusí ísť o celé slovo – často je to len časť slova, slabika alebo dokonca jediný znak. Slovo „nepredvídateľnosť“ sa tak môže rozdeliť na niekoľko menších tokenov, zatiaľ čo krátke bežné slovo ako „a“ zostane jedným tokenom. Model teda nečíta vety, ale dlhé sekvencie týchto očíslovaných „kúskov“ jazyka.

Prečo je to dôležité: Presne tieto tokeny sa počítajú pri spracovaní každej vašej správy – a práve preto dlhší alebo zložitejší text „zaberie“ viac výpočtového priestoru aj peňazí.

2. Embeddings: keď sa slová stanú súradnicami vo vesmíre významov

Embedding je spôsob, akým model premieňa každý token na dlhý zoznam čísel – vektor – ktorý reprezentuje jeho význam v mnohorozmernom priestore. Znie to abstraktne, ale predstavte si obrovskú mapu, kde slová s podobným významom ležia blízko seba. „Kráľ“ a „kráľovná“ budú na tejto mape susedia, zatiaľ čo „kráľ“ a „banán“ budú vzdialené na míle ďaleko.

Prečo je to fascinujúce: Vďaka embeddings model nechápe slová izolovane, ale v kontexte ich vzájomných vzťahov – práve preto dokáže rozpoznať metafory, synonymá aj jemné nuansy jazyka.

3. Context window: krátkodobá pamäť modelu

Context window je maximálne množstvo tokenov, ktoré model dokáže naraz „vidieť“ a spracovať – zahŕňa vašu otázku, celú predchádzajúcu konverzáciu aj generovanú odpoveď. Ak sa rozhovor natiahne nad tento limit, najstaršie časti textu jednoducho „vypadnú“ z pamäte modelu, akoby nikdy neexistovali.

Prečo na tom záleží: Moderné modely majú context window siahajúci od desiatok tisíc až po státisíce tokenov, čo umožňuje analyzovať celé knihy naraz – no stále ide o konečný priestor, ktorý treba mať na pamäti pri dlhých konverzáciách.

4. Ako tieto tri koncepty spolupracujú

Predstavte si to ako reťaz: text sa najprv rozseká na tokeny, každý token sa premení na embedding nesúci jeho význam, a celá táto sekvencia embeddingov sa zmestí do context window, v rámci ktorého model „premýšľa“ a generuje odpoveď.

Prečo sa učiť o AI s nami?

Ak vás zaujíma, čo sa skrýva pod kapotou moderných AI nástrojov, a chcete tomu naozaj rozumieť namiesto slepého „skúšania a experimentovania“, ponúkame vám prezenčné aj online školenia zamerané na princípy umelej inteligencie a prácu s jazykovými modelmi.

Okrem AI témy ponúkame aj klasické programátorské kurzy, napríklad v jazykoch PHP alebo Java. S nami pochopíte technológiu, ktorá dnes stojí za väčšinou moderných digitálnych nástrojov.

Časté otázky o tokenoch, embeddings a context window

1. Je jeden token rovný jednému slovu?

Nie, jedno slovo môže tvoriť viacero tokenov, najmä ak je dlhé, neobvyklé alebo v inom jazyku, než na aký bol model primárne trénovaný.

2. Čo sa stane, keď prekročím context window?

Model stratí prístup k najstaršej časti konverzácie – prakticky „zabudne“ na to, čo ste povedali na začiatku rozhovoru.

3. Sú embeddings jedinečné pre každý model?

Áno, každý model si vytvára vlastný „priestor významov“ počas trénovania, takže embeddings z rôznych modelov nie sú medzi sebou priamo porovnateľné.

Top 5 zaujímavých informácií o tokenoch a context window

  1. Anglický text má v priemere menej tokenov ako slovenský: Modely sú často trénované prevažne na angličtine, takže iné jazyky sa niekedy delia na viac tokenov.
  2. Emoji a špeciálne znaky spotrebujú prekvapivo veľa tokenov: Niektoré symboly sa rozpadnú na viacero menších jednotiek.
  3. Najväčšie context windows dnes zvládnu státisíce tokenov: To zodpovedá celým knihám naraz vloženým do jedného rozhovoru.
  4. Embeddings sa dajú matematicky „sčítavať“: Slávny príklad je vektor „kráľ“ mínus „muž“ plus „žena“, ktorý sa priblíži k vektoru „kráľovná“.
  5. Cena za používanie AI sa počíta v tokenoch, nie v znakoch: Preto krátke, ale „exotické“ texty môžu byť drahšie, než by ste čakali.

Ako začať programovať?

Úvod do programovania pre každého bez prechádzajúcich znalostí.

Stiahnite si náš ebook teraz výnimočne zdarma!!!

Marián Knězek

 

Súvisiace články: