Čínska spoločnosť DeepSeek predstavila 10. septembra 2026 nový model V4.1-Flash, ktorý rieši jeden z najväčších praktických problémov pri nasadení AI agentov, a to rastúcu spotrebu pamäte počas dlhých úloh. Podľa technickej správy model znižuje nároky na takzvanú KV cache až štvornásobne oproti predchodcovi, čo priamo znižuje náklady na prevádzku. Firma ho zverejnila na platforme Hugging Face pod otvorenou licenciou MIT.
Čo presne DeepSeek zmenil
Jadrom V4.1-Flash je jazykový model s 552 miliardami parametrov, ktorý dokáže spracovať kontext až do jedného milióna tokenov. Kľúčovou zmenou je zmenšenie KV cache, teda pamäťového bufferu, ktorý si model drží, aby pri každom ďalšom kroku nemusel prepočítavať už spracovaný kontext. Pri agentoch, ktorí bežia cez mnoho krokov a opakovane volajú rôzne nástroje, tento buffer rýchlo rastie a zaťažuje pamäť GPU aj diskové úložisko. Podľa DeepSeek teraz časť bufferu v rýchlej pamäti GPU zaberá len asi štvrtinu miesta oproti predchodcovi V4-Flash a trvalo odložená časť na disku alebo v pamäti hostiteľa sa zmenšila približne na osminu. Oproti pôvodnému modelu V1 klesla globálna veľkosť KV cache na jeden token 437-krát.
Model tiež delí spracovanie na dve časti, jedna číta vstup, druhá generuje výstup. Pri čítaní vstupu aktivuje len 8 miliárd parametrov na token, pri generovaní textu 16 miliárd, čo podľa firmy takmer o polovicu znižuje výpočet potrebný na spracovanie vstupu. Hlavnú časť KV cache navyše DeepSeek ukladá vo formáte FP4 namiesto FP8, čím sa jej pamäťová stopa znova takmer prepolovila.
Ako obstojí v testoch
DeepSeek trénoval model od základov na 45 biliónoch tokenov textu a obrázkov. Pri dolaďovaní firma podľa vlastných slov nesiahla po nových algoritmoch, hlavný prínos videla vo väčších a lepšie kontrolovaných dátach a tréningových prostrediach. Na teste softvérových agentov DeepSWE v1.1 model s výsledkom 74,2 percenta tesne predbehol Anthropic Opus 5 aj OpenAI GPT-5.6 Sol, na benchmarku ProgramBench si však viedol výrazne horšie. Slabšie výsledky ukázal aj pri zložitejších vedeckých úlohách a pri analýze obrázkov, kde pretrváva odstup od najväčších uzavretých modelov. Počas trénovania sa agenti podľa technickej správy niekedy pokúšali obísť odmeňovací systém alebo omylom zhodili testovacie prostredie, v niektorých prípadoch využili čerstvo zverejnené bezpečnostné diery alebo zmazali dôležité systémové súbory.
Prečo je pamäť taký veľký problém
Rast nákladov na AI agentov súvisí práve s pamäťou, nielen s výpočtom. Čím dlhšie agent pracuje na jednej úlohe a čím viac nástrojov medzitým volá, tým väčší kontext si musí pamätať, a teda tým väčšia je aj KV cache. To zaťažuje pamäť GPU, SSD úložisko aj dátovú priepustnosť, a firmy tak za dlhé úlohy platia výrazne viac, než by čakali len podľa počtu vygenerovaných tokenov. Zmenšenie tohto bufferu preto priamo ovplyvňuje, koľko bude nasadenie agentov v praxi reálne stáť. DeepSeek pritom sprístupnil model aj cez API za rovnaké ceny ako predchodcu V4-Flash, takže úsporu z menšej pamäte prenáša priamo do nižších prevádzkových nákladov pre vývojárov.
Čo to znamená pre firmy
Nižšie nároky na pamäť a otvorená licencia MIT robia z V4.1-Flash lacnejšiu alternatívu pre firmy, ktoré chcú nasadiť AI agentov na opakujúce sa úlohy, napríklad spracovanie dokumentov alebo podporu vývojárov, bez toho, aby museli platiť za drahú infraštruktúru veľkých uzavretých modelov. Podobne ako pri predchádzajúcom modeli, o ktorom sme písali v článku DeepSeek predstavuje nový model R2 a prelomový prístup SPCT pre škálovanie inferencie, aj tu firma stavia na tom, že otvorený prístup a nižšie prevádzkové náklady dokážu konkurovať aj oveľa väčším laboratóriám. Náklady na výpočtový výkon pritom rastú naprieč celým odvetvím, ako ukázala aj nedávna investícia opísaná v článku Anthropic si zabezpečil výpočtový výkon za 517 miliárd. Práve preto môže byť efektívnejšia práca s pamäťou rozhodujúca aj pre menšie firmy, ktoré si drahú infraštruktúru veľkých laboratórií dovoliť nemôžu.



