Claude Opus 5.5: taniej, szybciej, mniej „Claudish”

Anthropic zaprezentowało Claude Opus 5.5 – pierwszy model z zupełnie nowej rodziny. Producent przekonuje, że osiąga on wyniki zbliżone do Claude Fable 5.1, ale przy wyraźnie niższych kosztach i szybszym działaniu niż poprzednik. W najbliższych tygodniach mają dołączyć do niego Claude Sonnet 5.5 oraz Haiku 5.5, oferując podobne postępy w wydajności, efektywności i bezpieczeństwie.

Według wewnętrznych testów Anthropic nowy Opus wyprzedza zarówno Fable 5.1, jak i znacznie droższego GPT-6 Astra od OpenAI w większości zadań. To ważny sygnał w trwającym wyścigu o dominację na rynku modeli językowych.

Benchmarki: gdzie Opus 5.5 wypada najlepiej

Anthropic opublikowało zestaw wyników, które pokazują przewagę nowego modelu w kilku kluczowych obszarach. Warto przyjrzeć się im bliżej, bo różnice względem konkurencji są miejscami spore.

Kodowanie agentowe i praca z terminalem

W benchmarku Terminal-Bench 4.0 Opus 5.5 osiąga 66,4 proc., podczas gdy Fable 5.1 zatrzymuje się na 55,8 proc., a GPT-6 Astra na 57,9 proc. Podobnie wygląda to w FrontierCode v1.1, gdzie nowy model notuje 54,4 proc. wobec 50,3 proc. u Fable 5.1 i 53,3 proc. u Astra. W CursorBench 4.0 przewaga jest jeszcze wyraźniejsza – 57,8 proc. kontra 51,8 proc. i brak danych dla Astra.

Praca wiedzowa i rozumowanie interdyscyplinarne

W benchmarku GDPval-AA v2.1, oceniającym pracę wiedzową, Opus 5.5 zdobywa 1846 punktów Elo. Dla porównania Fable 5.1 ma 1735, Opus 5 – 1708, a GPT-6 Astra tylko 1542. Z kolei w Humanity’s Last Exam nowy model uzyskuje 67,7 proc. z użyciem narzędzi, wyprzedzając Fable 5.1 (65,6 proc.) i Astra (57,2 proc.).

Automatyzacja i badania naukowe

W AutomationBench Opus 5.5 osiąga 40,0 proc., podczas gdy Fable 5.1 – 31,4 proc., a GPT-6 Astra – 41,4 proc. W Terminal-Bench-Science 0.1 nowy model notuje 58,7 proc., wyraźnie wyprzedzając Fable 5.1 (52,6 proc.), ale ustępując Astra (64,6 proc.). W OSWorld 2.0, testującym obsługę komputera, Opus 5.5 osiąga 81,8 proc. w trybie częściowym.

Niższe ceny i mniejsze zużycie tokenów

Jednym z głównych argumentów Anthropic jest ekonomia. Opus 5.5 wyceniono na 4 dolary za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych. To spadek odpowiednio z 5 i 25 dolarów w przypadku Opus 5, czyli obniżka o 20 proc. Koszty odczytu z pamięci podręcznej spadły aż o 60 proc. – z 0,50 do 0,20 dolara.

Producent twierdzi, że całkowite koszty operacyjne, uwzględniające zarówno ceny tokenów, jak i ich zużycie, powinny być około 40 proc. niższe niż w przypadku Opus 5. Model zużywa mniej tokenów i generuje odpowiedzi ponad 30 proc. szybciej.

Więcej dla subskrybentów

Pięciogodzinne limity dla subskrybentów rosną o 20 proc., a dzięki niższym kosztom mają rozciągnąć się łącznie o 25 proc. Użytkownicy mogą też zachować jedno resetowanie limitu na moment, gdy najbardziej go potrzebują.

Walka cenowa z konkurencją

Anthropic nie ukrywa, że obniżka jest odpowiedzią na presję ze strony OpenAI, a zwłaszcza chińskich modeli, które oferują słabsze wyniki, ale kosztują ułamek ceny. Firma przekonuje, że na FrontierCode Opus 5.5 bije GPT-6 Astra przy około 20 proc. kosztu za zadanie, a na Terminal-Bench 4.0 osiąga tę samą wydajność przy 40 proc. kosztu. W CursorBench ma wyprzedzać GPT-5.6 Sol o 11 punktów przy jednej trzeciej ceny.

Mniej „Claudish”, więcej naturalności

Opus 5.5 ma też komunikować się w sposób bardziej naturalny niż wcześniejsze modele. Anthropic zapewnia, że stawia najważniejsze informacje na początku, używa mniej żargonu i lepiej trzyma się instrukcji dotyczących stylu pisania. Wczesni testerzy określali jego teksty jako czytelniejsze i łatwiejsze w odbiorze, co według producenta czyni go lepszym partnerem do długich sesji pracy.

To istotna zmiana, bo dotychczasowe modele Claude często krytykowano za schematyczny, zawiły styl pisania, nazywany przez użytkowników „Claudish”.

Bezpieczeństwo i nowe zabezpieczenia

Opus 5.5 to pierwszy model Opus z zabezpieczeniami w zakresie cyberbezpieczeństwa, biologii i rozwoju frontier LLM na poziomie Fable 5.1. Gdy mechanizmy ochronne zostaną uruchomione, zapytania są – jak zapewnia Anthropic – transparentnie przekierowywane do innego modelu. Użytkownicy nadal mogą szukać i naprawiać błędy w kodzie, ale większość zadań z cyberbezpieczeństwa trafi do starszego Opus 4.8. Zapytania oznaczone przez klasyfikatory jako dotyczące biologii lub rozwoju frontier LLM będą kierowane do Opus 5.

Zweryfikowane organizacje mogą ubiegać się o wykorzystanie modelu do badań biologicznych w ramach Life Sciences Verification Program. Anthropic planuje też rozszerzyć istniejący Cyber Verification Program na Opus 5.5 w najbliższych tygodniach.

Ochrona przed atakami destylacji

Anthropic wprowadza również środki przeciwko tak zwanym atakom destylacji. Firma twierdzi, że atakujący wykorzystują tysiące fałszywych kont, by na przemysłową skalę wyciągać zdolności modelu i budować zaawansowane systemy bez jego zabezpieczeń. Opus 5.5 debiutuje z mechanizmem „Preserved Thinking”, zapobiegającym edytowaniu wcześniejszego kontekstu Claude przez użytkowników API w celu wydobycia jego rozumowania. Rozwiązanie obejmuje Fable 5.1 i Opus 5.5 dla kont API utworzonych 31 sierpnia 2026 roku lub później.

Model zawiera też mechanizmy znakowania wodnego zgodne z unijnym AI Act. Nie może już działać z wyłączonym trybem „Thinking”, a dostępny jest z opcją Zero Data Retention.

Co mówią niezależni analitycy

Platforma Artificial Analysis potwierdza mocną pozycję nowego modelu. Przy maksymalnym wysiłku Opus 5.5 zdobywa 58 punktów w Artificial Analysis Intelligence Index – najwięcej w historii i kilka punktów powyżej poprzedniego lidera. Prowadzi w sześciu z dziesięciu ewaluacji, w tym w Humanity’s Last Exam (61,4 proc. wobec 59,1 proc. u Fable 5.1) oraz SciCode (66,9 proc. wobec 63,1 proc.).

W rankingu Artificial Analysis Intelligence Index Opus 5.5 prowadzi z 58 punktami, przed Claude Fable 5.1 i GPT-6 Astra, które mają po 53 punkty. Analitycy zwracają jednak uwagę na kompromis w zakresie efektywności – przy maksymalnym wysiłku model zużywa około 119 tysięcy tokenów wyjściowych na zadanie, znacznie więcej niż Opus 5 (73 tysiące), Fable 5.1 (78 tysięcy) czy GPT-6 Astra (27 tysięcy). Niższe ceny tokenów utrzymują koszt zadania na poziomie zbliżonym do Opus 5, ale nie niższym.

Mimo to cztery z pięciu poziomów wysiłku Opus 5.5 lokują się na granicy Pareto, dorównując lub bijąc wszystkie inne modele powyżej 50 punktów w indeksie pod względem kosztu za zadanie.

Dostępność i perspektywy

Claude Opus 5.5 jest już dostępny na wszystkich platformach, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Deweloperzy korzystający z Claude Platform mogą uzyskać do niego dostęp pod identyfikatorem claude-opus-5-5.

Anthropic zapowiada też zaostrzenie kontroli środowisk uczenia ze wzmocnieniem, twierdząc, że wadliwe środowiska treningowe są głównym źródłem niewłaściwych zachowań modeli. Firma pracuje nad lepszymi nagrodami za alignment, automatycznymi metodami tworzenia scenariuszy treningowych oraz silniejszymi środkami bezpieczeństwa i monitoringu.

Dyskusja o tempie wypuszczania coraz zdolniejszych modeli nabiera tempa. OpenAI niedawno wezwało do międzynarodowych standardów dla systemów AI, które mogłyby same się ulepszać, a kilku badaczy publicznie apelowało o spowolnienie premier, dopóki metody alignment nie dogonią możliwości modeli. Anthropic zajmuje podobne stanowisko, domagając się wyższego standardu bezpieczeństwa dla modeli zdolnych do automatyzacji badań nad AI. Firma uważa, że większą rolę w ustalaniu tego standardu powinna odgrywać polityka publiczna.

Premierę Opus 5.5 testowały zewnętrzne organizacje Frontier Design i METR. Czy nowa rodzina modeli Anthropic rzeczywiście zmieni układ sił na rynku? Odpowiedź poznamy, gdy dołączą do niej Sonnet 5.5 i Haiku 5.5.

Źródło