Kontextové okno
Každý model má pevne stanovený počet tokenov, ktoré dokáže spracovať naraz. Prekročenie tejto kapacity vedie k strate informácií z úvodu konverzácie.
Technické obmedzenia veľkých jazykových modelov definujú presnosť a rozsah ich výstupov. Pochopenie týchto mantinelov je kritické pre efektívny prompt engineering.
Každý model má pevne stanovený počet tokenov, ktoré dokáže spracovať naraz. Prekročenie tejto kapacity vedie k strate informácií z úvodu konverzácie.
Modely sú statické a nevedia o udalostiach, ktoré nastali po ukončení ich tréningového cyklu. Bez RAG systémov sú ich vedomosti časovo obmedzené.
Latencia odpovede priamo koreluje s komplexnosťou promptu a hĺbkou uvažovania modelu. Dlhé logické reťazce zvyšujú nároky na GPU čas.
Kontextové okno predstavuje operačnú pamäť modelu. Ak do promptu vložíte príliš veľa dát, model začne "zabúdať" inštrukcie definované v konfigurácii systémových inštrukcií. Tento jav sa nazýva degradácia pozornosti.
Pri práci s rozsiahlymi dokumentmi je nevyhnutné používať delimitery a štruktúru textu, aby model dokázal prioritizovať kľúčové segmenty v rámci dostupnej kapacity tokenov.
LLM pracujú s fixnou databázou vedomostí získanou počas tréningu. Ak model narazí na otázku o novom softvéri alebo aktuálnych správach, často si začne vymýšľať fakty, čo označujeme ako halucinácie.
Pre elimináciu týchto chýb sa odporúča zero-shot prompting doplniť o externé dáta v reálnom čase, čím sa obíde statická povaha natívnych váh modelu.
Každý vygenerovaný token má svoju cenu v podobe výpočtového výkonu. Komplexné techniky ako chain-of-thought predlžujú čas generovania, pretože model musí prejsť viacerými krokmi uvažovania.
Efektívny vývojár musí vyvažovať presnosť odpovede a rýchlosť odozvy. Prílišné vetvenie logiky môže viesť k zbytočnému plytvaniu zdrojmi bez výrazného zvýšenia kvality výsledku.
Naučte sa pracovať s limitmi architektúry a dosahujte konzistentné výsledky pri každom dopyte.
Späť na dokumentáciu