DeepSeek zaprezentował V4.1-Flash — model multimodalny o 552 miliardach parametrów, zbudowany wokół czterech wzajemnie powiązanych rozwiązań architektonicznych. Ich wspólnym celem jest radykalne zmniejszenie pamięci potrzebnej na aktywny cache klucz-wartość (KV cache) w długotrwałych agentach AI. Premiera odbyła się 10 września 2026 roku o 04:00 UTC, a wraz z nią opublikowano 50-stronicowy raport techniczny na Hugging Face. To nie jest aktualizacja V4 — to początek nowej linii architektonicznej V4.1.
Dla zespołów utrzymujących produkcyjne obciążenia agentowe — narzędzia, które godzinami przeglądają sieć, wykonują kod, czytają logi błędów i gromadzą setki tysięcy tokenów kontekstu — ogłoszenie ma bezpośredni wymiar finansowy. Opłaty za trafienia w cache regularnie stanowią większość wydatków na wnioskowanie. Model, który potrzebuje jednej czwartej pamięci HBM na aktywny KV cache i jednej ósmej miejsca na SSD dla cache trwałego, nie jest kosmetyczną optymalizacją — to zmiana strukturalna.
Od 14 września 2026 roku, godz. 04:00 UTC, cały ruch API kierowany na endpoint deepseek-v4-pro będzie automatycznie przekierowywany do V4.1-Flash z jego stawkami. Migracja jest obowiązkowa dla każdego dewelopera korzystającego obecnie z tego endpointu.
Dlaczego pamięć agentów stała się wąskim gardłem wdrożeń
Za każdym razem, gdy duży model językowy przetwarza prompt, generuje i zapisuje pośrednie reprezentacje matematyczne — pary klucz-wartość — dla każdego tokenu, który widział. Model trzyma je w cache KV, aby nie musieć ich ponownie obliczać przy kolejnych przejściach. W prostym chatbotcie ten narzut pozostaje do opanowania. W długo działającym agencie, który spędza godziny na czytaniu wyników narzędzi, analizowaniu kodu i iterowaniu planów, cache rozrasta się do poważnego obciążenia pamięciowego.
Przy odpowiednio długim kontekście KV cache przewyższa rozmiarem same wagi modelu — „notatki myślowe” modelu stają się większe niż sam model. Dla przedsiębiorstw uruchamiających agentów na skalę zarządzanie cache staje się wiążącym ograniczeniem operacyjnym, a nie surowa wydajność modelu. Logika inżynierska DeepSeek przy budowie V4.1-Flash polegała na zaatakowaniu tego ograniczenia wprost, zamiast dalszej optymalizacji obliczeń uwagi, jak w V4.
Efekt: globalny KV cache zajmuje 890 bajtów na token — około jednej czwartej tego, co w V4-Flash, i mniej więcej 1/437 rozmiaru na token z DeepSeek-V1 sprzed zaledwie dwóch lat.
Cztery techniki, jeden rezultat: jak V4.1-Flash osiąga redukcję
Oszczędności pamięci wynikają z czterech odrębnych zmian architektonicznych działających w kombinacji. Każda celuje w inną warstwę problemu.
Podział na kauzalny enkoder i dekoder
V4.1-Flash reorganizuje swoje 40 warstw Transformera w dwie asymetryczne połowy: 20-warstwowy enkoder kauzalny i 20-warstwowy dekoder. Podczas fazy prefill — gdy model czyta i przetwarza długie wejście, na przykład setki stron nagromadzonych wyników narzędzi — pełny kontekst obsługuje wyłącznie 20 warstw enkodera. Globalny KV cache dekodera jest następnie syntetyzowany bezpośrednio z końcowych reprezentacji enkodera, zamiast być przeliczany niezależnie przez każdą warstwę dekodera.
Praktyczna konsekwencja: model aktywuje tylko 8 miliardów parametrów na token podczas przetwarzania wejścia, wobec 16 miliardów przy generowaniu tekstu. Dla obciążeń agentowych zdominowanych przez wejście to w przybliżeniu o połowę skraca najdroższą obliczeniowo fazę. Projekt inspirowany był podejściem badawczym YOCO („You Only Cache Once”) z 2024 roku, które pokazało, że globalne cache KV można współdzielić między warstwami dekodera.
Skompresowana rzadka uwaga CSA2
Wcześniejsza architektura V4 stosowała statyczny schemat kompresji uwagi. V4.1-Flash wprowadza CSA2 — system współdzielenia cache, w którym każdej warstwie Transformera przypisuje się jeden z trzech trybów działania. Tryb Full oblicza świeży cache i wybiera najistotniejsze pozycje. Tryb Reindex współdzieli istniejący cache z innymi warstwami, ale niezależnie wybiera, na które wpisy zwracać uwagę. Tryb Reuse współdzieli zarówno cache, jak i wybory uwagi poprzedniej warstwy.
W trybie Reuse warstwa dekodera mówi w praktyce: „te notatki wyglądają dobrze — użyję dokładnie tych”. Sieć unika dzięki temu redundantnego przechowywania i obliczeń KV na całej głębokości, a głębsze warstwy pożyczają pracę płytszych.
Kwantyzacja cache do FP4
Główny globalny KV cache V4.1-Flash przechowywany jest w precyzji FP4 — 4-bitowym formacie zmiennoprzecinkowym — zamiast FP8 stosowanego w architekturze V4. Przejście z reprezentacji 8-bitowej na 4-bitową w przybliżeniu o połowę zmniejsza pamięć potrzebną na dowolny wpis cache. DeepSeek zastosował trening świadomy kwantyzacji, co oznacza, że model od początku uczono pracy z reprezentacjami FP4, zamiast dokładać kompresję po fakcie. Zapobiega to degradacji dokładności przy agresywnej kwantyzacji. Lokalny cache uwagi z oknem przesuwnym, obejmujący tylko najnowsze tokeny i wrażliwszy numerycznie, pozostaje w FP8.
Eliminacja trwałego zapisu SWA
Najbardziej elegancka koncepcyjnie optymalizacja dotyczy nieefektywności strukturalnej w projekcie V4. Wpisy globalnego KV cache mogą pozostawać użyteczne przez dni — reprezentują nagromadzony kontekst, do którego agent może sięgnąć w dowolnym momencie długiej sesji. Stan uwagi z oknem przesuwnym (SWA) ma znaczenie zwykle tylko przez kilka ostatnich minut aktywnej sesji: obejmuje ograniczone lokalne okno (128 tokenów w V4.1-Flash) i szybko traci istotność.
Mimo to w architekturze V4 cache SWA zajmował niemal połowę trwałej pojemności cache na dyskach SSD, leżąc tam bezużytecznie ponad 72 godziny. V4.1-Flash całkowicie rezygnuje z utrwalania stanu SWA na SSD. Zamiast tego tymczasowa rozproszona pula pamięci, czerpiąca z 10% pamięci DRAM każdego serwera, przechowuje stan SWA przez krótkie okno użyteczności. Gdy model musi odtworzyć ten stan — po pauzie sesji lub wywłaszczeniu — technika SWA Bounded Replay odtwarza jedynie ostatnie 128 tokenów wejścia, zamiast przeprowadzać pełną i kosztowną rekonstrukcję. Efekt: trwała pamięć SSD na KV cache spada do około jednej ósmej wymagań V4-Flash.
Model 552B, który aktywuje 8 do 16 miliardów parametrów
Mimo ogromnej łącznej liczby parametrów V4.1-Flash wykorzystuje routing Mixture-of-Experts, by utrzymać obliczenia w ryzach. Każdy blok Transformera zawiera jednego wspólnego eksperta i 384 ekspertów routowanych, ale dla danego tokenu aktywuje się tylko sześciu z nich — współczynnik aktywacji na poziomie około 1,6% dostępnych ekspertów. W połączeniu z architekturą CED model aktywuje zaledwie 8 miliardów parametrów na token podczas prefill i 16 miliardów przy generowaniu tekstu.
Architektura V4.1 integruje też 196-miliardowy warunkowy moduł pamięci o nazwie Engram — odrębny od zewnętrznego startupu Engram, który w tym roku pozyskał 98 mln dolarów na podobny koncept. Engram DeepSeek używa tablic wyszukiwania n-gramów o około 16 milionach wpisów każda, wyspecjalizowanych w zapamiętywaniu wzorców, by szkielet Transformera mógł skupić kosztowne obliczenia na rozumowaniu, a nie mechanicznym przywoływaniu. Tablice Engram rezydują w pamięci hosta i są wstępnie pobierane podczas wnioskowania, aby nie stały się wąskim gardłem.
Pełny model trenowano na 45 bilionach tokenów. DeepSeek rozszerzył okno kontekstu z 64K do 1 miliona tokenów po przetworzeniu 34 bilionów tokenów treningowych. Natywne wsparcie multimodalne — tekst i obrazy przetwarzane łącznie od początku pretreningu językowego — zapewnia 32-warstwowy enkoder wizji wstępnie trenowany na około 47 miliardach par obraz-tekst.
Czy ustawienie wysiłku rozumowania zastąpi surową wydajność?
Jedną z najbardziej praktycznych funkcji V4.1-Flash jest płynnie regulowane ustawienie wysiłku rozumowania — liczba całkowita od 1 do 100. Zamiast narzucać sztywny limit tokenów myślenia, parametr dostraja, jak mocno nagroda treningowa karała dodatkowe wyjście rozumowania podczas post-treningu, kształtując oszczędność, z jaką model przydziela swój „budżet myślenia” przy wnioskowaniu.
Raport techniczny DeepSeek podaje konkretne dane o kompromisie koszt-dokładność. Przejście z poziomu 25 na 100 podniosło średnie wyniki na ośmiu benchmarkach z 67,1% do 76,3%, kosztem około 2,5-krotnego budżetu tokenów wyjściowych. Na AIME 2026 zużycie tokenów wzrosło z około 4600 do 11 400 przy maksymalnym wysiłku. Na MathArena Apex — z 29 100 do 86 100 tokenów. Kluczowe technicznie odkrycie: ustawienia wysiłku w zakresie 60–80 przechwytują większość dokładności dostępnej przy maksimum, zużywając mniej niż połowę budżetu tokenów. API udostępnia trzy presety: Low (poziom 50), High (75) i Max (100).
Co faktycznie mierzy tabela benchmarków
DeepSeek porównał V4.1-Flash przy maksymalnym wysiłku z Opus-5 od Anthropic, GPT-5.6 Sol od OpenAI, Kimi-K3, GLM-5.3, V4-Pro i V4-Flash na szeregu zadań agentowych. Przy maksymalnym wysiłku V4.1-Flash uzyskał najwyższe raportowane wyniki w grupie porównawczej na kilku benchmarkach: 90,6% na Terminal-Bench 2.1, 74,2% na DeepSWE v1.1, 88,1% na CyberGym, 54,8% na AutomationBench i 31,8% na Agents’ Last Exam. Jego ranking Codeforces osiągnął 3471, powyżej 3348 dla V4-Pro.
Zanim jednak odczyta się te liczby jako definitywne rankingi możliwości, ten sam raport techniczny ujawnia fakt, który powinien rządzić interpretacją każdej tabeli benchmarków agentowych: ten sam checkpoint V4.1-Flash uzyskał od 65,5% do 74,2% na DeepSWE v1.1 wyłącznie w zależności od tego, jakie środowisko agentowe go opakowało — rozpiętość 8,7 punktu procentowego wywołana zmianą frameworka ewaluacyjnego, nie samego modelu. Testowane środowiska obejmowały Claude Code, Codex, OpenCode, własne środowisko DeepSeek i inne. Niezależna analiza poprzedniej generacji V4-Flash pokazała podobne efekty: Artificial Analysis zmierzyło wydajność Terminal-Bench o 3–4 punkty poniżej wartości podanej przez producenta.
Wniosek strukturalny nie sprowadza się do tego, że liczby DeepSeek należy zdyskontować o stały procent. Chodzi o to, że różnice jednego punktu procentowego między dowolnymi dwoma modelami na dowolnym benchmarku agentowym mieszczą się w szumie wprowadzanym przez sam wybór środowiska. Dobrze zoptymalizowane otoczenie wokół nieco słabszego modelu może wyglądać na lepsze od silniejszego modelu w generycznym środowisku. Rzetelne porównanie modeli na zadaniach agentowych wymaga identycznych warunków — standardu, którego branża AI jeszcze nie wypracowała.
Tam, gdzie większe modele zamknięte zachowują wyraźną przewagę, wyniki nie są jednostronnie korzystne dla V4.1-Flash. Na Terminal-Bench 3.0 model uzyskał 30,0% wobec 43,3% dla Opus-5. Na Humanity’s Last Exam DeepSeek raportuje 36,8% ogółem wobec 56,3% dla Opus-5. Na GPQA Diamond, rygorystycznym benchmarku rozumowania naukowego, V4.1-Flash zdobył 90,9%, za 94,1% GPT-5.6 Sol i 93,4% Opus-5. DeepSeek przyznaje, że większe modele zamknięte zachowują przewagę w zadaniach wymagających specjalistycznej wiedzy, i odnotowuje trwałą lukę multimodalną względem największych systemów własnościowych.
Czy działanie mądrzej oznacza taniej? Nowy cennik
DeepSeek jednocześnie zmodyfikował ceny dla poziomu API V4.1-Flash. Cennik dzieli się na okresy szczytowe i pozaszczytowe, przy czym stawki pozaszczytowe są o połowę niższe. Godziny pozaszczytowe obejmują wszystkie pory nieuznane za szczyt; szczyt zdefiniowano jako 01:00–04:00 i 06:00–10:00 UTC w dni robocze. W stawkach pozaszczytowych: trafienia w cache wejściowy po 0,003 dolara za milion tokenów, chybienia w cache 0,075 dolara za milion, a wyjście 0,30 dolara za milion. W godzinach szczytu te wartości się podwajają: odpowiednio 0,006, 0,15 i 0,60 dolara.
Dla porównania Claude Opus-5 od Anthropic kosztuje 25 dolarów za milion tokenów wyjściowych (5 dolarów za milion wejściowych) — co czyni pozaszczytową stawkę wyjściową V4.1-Flash ponad 83 razy tańszą od Opus-5 w samym wyjściu.
Model udostępniono na licencji MIT, a wagi są dostępne na Hugging Face. Samodzielny hosting w natywnej precyzji wymaga obsługi checkpointu o rozmiarze około 475 GiB w 48 shardach safetensors — to decyzja infrastrukturalna na wiele GPU, a nie wdrożenie na jednej maszynie.
Od 14 września 2026 roku, godz. 04:00 UTC, cały ruch deepseek-v4-pro kierowany jest do V4.1-Flash i rozliczany według jego stawek. V4-Flash i V4-Flash-Vision-Exp zostały już wycofane wraz z dzisiejszą premierą, a nazwy starszych endpointów tymczasowo kierują do V4.1-Flash w okresie przejściowym. Nowy identyfikator modelu to deepseek-flash.
Co oznacza chińska ustawa o wywiadzie, zanim to zintegrujesz
DeepSeek-AI ma siedzibę w Hangzhou w Chinach i należy do High-Flyer, chińskiego funduszu hedgingowego o profilu ilościowym. Żadna wersja modelu — w tym V4.1-Flash — nie zmienia ram prawnych obowiązujących jego hostowane API.
Chińska ustawa o wywiadzie narodowym z 2017 roku, artykuł 7, wymaga od wszystkich organizacji i obywateli „wspierania, pomocy i współpracy z narodową pracą wywiadowczą”. Ustawa nie zawiera wyjątków dla firm prywatnych, wymogów przejrzystości żądań rządowych ani mechanizmu, dzięki któremu firma mogłaby legalnie odmówić. Chińska ustawa o cyberbezpieczeństwie z 2017 roku dodatkowo upoważnia organy bezpieczeństwa publicznego do żądania pomocy technicznej, w tym dostępu do kodu źródłowego. Ustawa o bezpieczeństwie danych nakłada ograniczenia transgraniczne i dodatkowe przepisy o dostępie rządowym. To stałe wymogi ustawowe jurysdykcji, w której działa DeepSeek — nie sporne interpretacje ani hipotetyczne ryzyka.
Dla użytkowników hostowanego API DeepSeek prompty i historia rozmów podróżują na serwery w Chinach i podlegają tym ustawom bezpośrednio. Południowokoreańska Komisja Ochrony Informacji Osobistych ustaliła wcześniej, że DeepSeek przekazywał prompty użytkowników do Beijing Volcano Engine Technology i innych chińskich firm bez zgody użytkowników. Feroot Security udokumentowało ukryty kod w aplikacji webowej DeepSeek, który przesyłał dane do portalu China Mobile — kontrolowanej przez państwo spółki telekomunikacyjnej, której Federalna Komisja Łączności zakazała działalności w USA w 2021 roku.
Dla użytkowników samodzielnie hostujących otwarte wagi na licencji MIT, na infrastrukturze poza Chinami, bezpośredni problem przepływu danych znika: prompty nie opuszczają środowiska operatora. Samodzielny hosting nie zmienia jednak prawnych zobowiązań DeepSeek wynikających z chińskiego prawa, a na moment publikacji nie opublikowano żadnego niezależnego, imiennego audytu bezpieczeństwa wag V4.1-Flash.
Kilka amerykańskich agencji federalnych — w tym Marynarka Wojenna, NASA i Pentagon — zakazuje DeepSeek w systemach służbowych. Australia, Włochy, Tajwan i Korea Południowa wprowadziły ograniczenia dla urządzeń rządowych. Dla branż regulowanych — ochrony zdrowia, usług finansowych, pracy okołorządowej — hostowane API jest niezgodne z większością obecnych ram ładu danych w jurysdykcjach USA.
Jak myśleć o pełnej decyzji
V4.1-Flash to autentyczny postęp architektoniczny w konkretnym problemie ekonomii pamięci agentów, dostarczony w cenie dramatycznie niższej niż zachodnie modele frontier. Kombinacja CED + CSA2 + FP4 + SWA Bounded Replay osiąga 4-krotną redukcję HBM i 8-krotną redukcję SSD, co będzie miało konkretne znaczenie dla każdego zespołu, w którym koszty KV cache dominują rachunek za wnioskowanie.
Czego nie zmienia, to pułap konkurencyjnej wydajności na najtrudniejszych zadaniach wymagających intensywnej wiedzy, gdzie Opus-5 i GPT-5.6 Sol zachowują istotne prowadzenie. Luka 13,3 punktu procentowego na Terminal-Bench 3.0, 19,5 punktu na Humanity’s Last Exam i 3 punkty na GPQA Diamond to realne ograniczenia dla obciążeń wymagających syntezy międzydziedzinowej lub długotrwałego planowania. Odkrycie o wariancji środowisk oznacza, że nawet te luki należy traktować jako przybliżone — ale „około 13 punktów poniżej Opus-5 na Terminal-Bench 3.0″ to nie błąd zaokrąglenia.
Ekosystem wokół V4.1-Flash jest nowy. Otwarte wagi pojawiły się dziś w rozmiarze 475 GiB w 48 shardach. Kwantyzacja społecznościowa i narzędzia do serwowania są w pierwszych godzinach życia. Zespoły oceniające samodzielny hosting pod kątem ładu danych powinny oczekiwać okresu budowy infrastruktury przed osiągnięciem produkcyjnego wdrożenia, a nie wtyczkowego zastąpienia działającego systemu V4.
Dla zespołów, których obciążenia agentowe są zdominowane przez koszty cache, które starannie modelują własne wzorce użycia i które działają poza kontekstami regulowanych danych, V4.1-Flash reprezentuje najsilniejszą architekturę kosztowo-wydajnościową w przestrzeni otwartych wag na dziś. Dla zespołów w branżach regulowanych zobowiązania wynikające z chińskiego prawa o danych pozostają stałym warunkiem niezależnie od ulepszeń architektonicznych — te zobowiązania nie zmieniły się dlatego, że zmieniła się architektura.

