Alibaba Qwen3.8-Flash-Next: tania AI o dużej mocy

Zespół Qwen z Alibaba zaprezentował właśnie model Qwen3.8-Flash-Next, który może znacząco namieszać na rynku sztucznej inteligencji. To multimodalny model typu mixture-of-experts (MoE), który stanowi zapowiedź architektoniczną nadchodzącego Qwen4. Największą uwagę przyciąga jednak nie tylko jego wydajność, ale przede wszystkim koszt trenowania i utrzymania, który jest ułamkiem wydatków konkurencji. Czy to początek nowej ery w projektowaniu wydajnych systemów AI?

Architektura, która zmienia zasady gry

Qwen3.8-Flash-Next dysponuje imponującą liczbą 125 miliardów parametrów, ale w praktyce podczas przetwarzania każdego tokena aktywuje jedynie 6 miliardów z nich. To właśnie ta selektywność sprawia, że model osiąga wyniki porównywalne z dużo większymi systemami, ponosząc przy tym znacznie niższe koszty obliczeniowe.

Sercem innowacji jest jednak nowatorska warstwa N-gram embeddingu, która zawiera 51 miliardów parametrów. Działa ona jak swoisty słownik fraz, przechowując popularne grupy słów jako osobne wpisy. Co istotne, warstwa ta może działać w zwykłej pamięci RAM systemu, a nie na karcie graficznej, co według twórców wiąże się ze „stosunkowo niskim dodatkowym kosztem”. To rozwiązanie ma być jedną z kluczowych nowości architektonicznych, które zobaczymy w Qwen4.

Model natywnie obsługuje kontekst o długości 262 144 tokenów, a przy użyciu techniki YaRN można go skalować nawet do miliona tokenów. To otwiera drzwi do analizy bardzo długich dokumentów czy całych repozytoriów kodu. Dla zainteresowanych technicznymi szczegółami, raport jest dostępny na GitHubie, a wagi modelu można pobrać z Hugging Face i ModelScope.

Wyniki, które zaskakują większych rywali

Twórcy podkreślają, że Qwen3.8-Flash-Next osiąga lepsze rezultaty niż Qwen3.7-Plus, dysponując przy tym kosztem trenowania na poziomie zaledwie jednej dziewiątej. Największe różnice widać w zadaniach związanych z kodowaniem i pracą biurową. Dla porównania, Qwen3.7-Plus ma 397 miliardów parametrów, z czego aktywuje 17 miliardów na token – to niemal trzykrotnie więcej niż w przypadku nowego modelu.

W opublikowanych benchmarkach model Alibaba mierzy się z takimi konkurentami jak DeepSeek-V4-Flash (284 mld parametrów, 13 mld aktywnych) czy Claude Opus 4.6 (Max). Mimo że obaj rywale są znacznie więksi lub drożsi, Flash-Next wygrywa w większości testowanych zadań. Szczególnie dobrze radzi sobie w testach agentowego kodowania, gdzie system AI musi samodzielnie znajdować i naprawiać błędy w prawdziwych projektach programistycznych.

Kodowanie i praca biurowa bez konkurencji

Wyniki w zadaniach programistycznych robią wrażenie. Flash-Next zdobył 58,7 punktów w teście DeepSWE i 62,5 w SWE-bench Pro, pokonując zarówno DeepSeek-V4-Flash, jak i Claude Opus 4.6. Jeszcze większa przepaść dzieli go od rywali w zadaniach biurowych i produktywnościowych. W teście CoWorkBench model osiągnął 73,9 punktów, podczas gdy DeepSeek-V4-Flash zdołał uzyskać jedynie 45,1.

W JobBench, sprawdzającym profesjonalne przepływy pracy, Flash-Next uzyskał 55,7 punktów, co jest wynikiem niemal dwukrotnie lepszym niż Qwen3.7-Plus (27,6). W zadaniach wymagających naukowego rozumowania (GPQA Diamond: 91,7) oraz programowania konkursowego (LiveCodeBench v6: 91,9) modele osiągają bardzo zbliżone rezultaty. Claude Opus 4.6 wygrywa tylko w teście Humanity’s Last Exam, który zawiera wyjątkowo trudne interdyscyplinarne problemy – warto jednak pamiętać, że to model Anthropic z lutego 2026 roku.

Ceny, które wywierają presję na rynek

Alibaba wprowadziła Qwen3.8-Max jako swój flagowy model na początku sierpnia, konkurując z takimi systemami jak Claude Opus 4.8, Gemini 3.1 Pro czy GPT5.6 Sol. Flash-Next plasuje się tuż poniżej flagowca pod względem wydajności, ale kosztuje około dwunastokrotnie mniej. Cena za milion tokenów wejściowych to zaledwie 0,16 dolara, a za tokeny wyjściowe – 0,47 dolara.

Dla porównania, Qwen3.8-Max kosztuje 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych. Taka polityka cenowa nieustannie zwiększa presję na OpenAI i Anthropic. Wcześniej popularnością cieszył się również Qwen3.8-27B, który można uruchomić lokalnie i który oferuje solidną wydajność za niemal zerowy koszt – pod warunkiem posiadania odpowiedniego sprzętu.

OpenAI odpowiedziało już na tę sytuację znacznymi obniżkami cen w nowej linii modeli GPT-5.6. To dobra wiadomość dla użytkowników, ale jednocześnie wyzwanie dla dostawców AI, którzy muszą utrzymać szybki wzrost przychodów, aby podtrzymać narrację inwestycyjną. Jak zawsze, warto pamiętać, że wyniki benchmarków nie zawsze przekładają się wprost na rzeczywiste zastosowania.

Qwen3.8-Flash-Next pokazuje, że efektywność kosztowa i wysoka wydajność mogą iść w parze. Produkcyjna wersja modelu trafi na rynek jako Qwen3.8-Flash przez QwenCloud, a API powinno być dostępne już wkrótce. To zapowiedź tego, co zobaczymy w Qwen4 – i sygnał, że rynek modeli językowych wchodzi w fazę, w której liczy się nie tylko moc, ale przede wszystkim ekonomia działania.

Źródło