Claude Sonnet 5.5: wydajność Opus w niższej cenie

Anthropic rozszerza rodzinę Claude 5.5 o drugi model. Sonnet 5.5 trafia na rynek jako rozwiązanie pozycjonowane między wydajnością flagowego Opus a codziennymi zadaniami, które nie wymagają najwyższej precyzji. Producent podkreśla trzy liczby: ponad 30% szybsze generowanie odpowiedzi, do 30% niższy koszt pojedynczego zadania i wyniki zbliżone do Opus 5.5 w kilku testach porównawczych.

Równolegle zapowiedziano Claude Haiku 5.5, który ma pojawić się w najbliższych tygodniach. Ten model zostanie zoptymalizowany pod kątem tanich zastosowań o wysokiej przepustowości. W ten sposób portfolio Anthropic – Fable, Opus i Sonnet – układa się w bezpośrednią odpowiedź na rodzinę OpenAI: GPT-6 Astra, Sol i Luna. Jak opisuje to sam producent, Opus plasuje się nieco powyżej Sol, Sonnet powyżej Luna, a Fable powyżej Astra. Różnice w wydajności między odpowiadającymi sobie tierami są jednak na tyle niewielkie, że o wyborze może decydować cena.

Skok w kodowaniu: z 10,3% do 70,6%

Największą zmianę widać w zadaniach programistycznych. Według danych Anthropic różnica między Sonnet 5.5 a poprzednikiem jest tu najbardziej wyraźna.

Wyniki na kluczowych benchmarkach

W Terminal-Bench 4.0, teście agentowego kodowania, Sonnet 5.5 osiąga 70,6% wobec zaledwie 10,3% w przypadku Sonnet 5. W CursorBench 4.0, który odtwarza rzeczywiste sesje pracy w edytorze Cursor, nowy model zdobywa 55,5% przy 34,1% poprzednika – to wynik zaledwie dwa punkty poniżej Opus 5.5 (57,8%). Na FrontierCode 1.1 w ustawieniu „High” Sonnet 5.5 wypada dziesięć punktów wyżej od Sonnet 5, zużywając przy tym około jednej piętnastej kosztu na zadanie.

Wcześni testerzy zwracali uwagę na szybkość, z jaką model orientuje się w strukturze kodu. Sonnet 5.5 częściej niż poprzednik grupuje wywołania narzędzi, co skraca liczbę potrzebnych kroków.

Anomalia przy najwyższym poziomie wysiłku

Jeden szczegół nie pasuje do reszty obrazu. Przy najwyższym ustawieniu intensywności rozumowania, oznaczonym jako „Max”, Sonnet 5.5 wypada na FrontierCode gorzej niż przy „Xhigh”. Anthropic tłumaczy to tym, że przy maksymalnym wysiłku model częściej uruchamia funkcję przeglądu kodu, która rozdziela pracę między kilka pod-agentów. W niektórych przypadkach prowadziło to do przekroczenia limitu czasu lub zmian wykraczających poza zakres zadania – a oba te scenariusze są przez FrontierCode karane.

Praca wiedzy na poziomie flagowca

W zadaniach związanych z przetwarzaniem wiedzy nowy model niemal dogania topową propozycję Anthropic. Na GDPval-AA, benchmarku opracowanym przez OpenAI, obejmującym zadania z 44 zawodów i dziewięciu branż, Sonnet 5.5 uzyskuje 1 844 punkty. To wynik praktycznie identyczny z Opus 5.5 (1 846) i około 400 punktów wyższy od Sonnet 5 (1 449). GPT-6 Sol osiąga według wyliczeń Anthropic 1 487 punktów.

Duży postęp widać też w rozpoznawaniu wykresów. W teście Chartography Sonnet 5.5 skacze z 15,6% do 61,6%. W OSWorld 2.1, sprawdzającym umiejętności obsługi komputera, model notuje 80,1% wobec 57,0% u poprzednika. W Humanity’s Last Exam z użyciem narzędzi uzyskuje 64,5% przy 54,9% w Sonnet 5.

Naturalniejsza rozmowa i zmysł projektowy

Wcześni testerzy opisywali Sonnet 5.5 jako bardziej naturalnego rozmówcę z wyczuciem designu. Model potrafi przerabiać interfejsy użytkownika i realizować szablony slajdów tak dobrze, że rezultaty niemal nie wymagają poprawek – twierdzi Anthropic. Producent dodaje, że to pierwszy model z linii Sonnet, który jest w stanie przejść Pokémon Red wyłącznie na podstawie zrzutów ekranu. OpenAI niedawno pokazało podobny postęp na benchmarkach gamingowych. Zadania tego typu jeszcze kilka lat temu uchodziły za trudne i często wymagały dedykowanych algorytmów. Dziś radzą sobie z nimi nawet modele średniej klasy w obrębie jednej rodziny produktów.

Ta sama cena tokenów, mniej tokenów na zadanie

Stawka za milion tokenów nie zmienia się względem Sonnet 5: dwa dolary za tokeny wejściowe, dziesięć za wyjściowe i 0,20 dolara za odczyt z pamięci podręcznej. Efektywny koszt spada jednak nawet o 30%, ponieważ model zużywa mniej tokenów na wykonanie zadania. Generowanie odpowiedzi jest również ponad 30% szybsze. Anthropic zaznacza, że te deklaracje wciąż wymagają potwierdzenia w niezależnych testach.

Podobnie jak inne modele Anthropic i odpowiedniki OpenAI, Sonnet 5.5 oferuje regulowane ustawienie wysiłku, pozwalające wymieniać koszt i szybkość na jakość wyniku. Przy niskich lub średnich ustawieniach Sonnet 5.5 już bije najlepsze wyniki Sonnet 5 w kilku benchmarkach, zużywając około jednej dziesiątej kosztu na zadanie. Trafienie w odpowiedni poziom wysiłku dla konkretnego zadania pozostaje jednak bardziej sztuką niż nauką.

Nowe zabezpieczenia cyberbezpieczeństwa

Sonnet 5.5 jest już dostępny na wszystkich głównych platformach chmurowych, w tym Amazon Web Services, Google Cloud i Microsoft Azure. Podobnie jak Opus 5.5 i Sonnet 5, model oferowany jest z zerowym przechowywaniem danych. Deweloperzy mogą uzyskać do niego dostęp przez Claude Platform, używając identyfikatora „claude-sonnet-5-5”.

Ponieważ nowy model jest znacznie bardziej zaawansowany w cyberbezpieczeństwie niż poprzednik, Anthropic po raz pierwszy dodaje zabezpieczenia do modelu z linii Sonnet. Zapytania dotyczące zadań wysokiego ryzyka w tej dziedzinie są widocznie przekierowywane do Sonnet 5. W ramach rozszerzonego Cyber Verification Program wykwalifikowani specjaliści mogą ubiegać się o dostęp na różnych poziomach. Producent dodał także klasyfikatory bezpieczeństwa przeciw atakom destylacyjnym – tym samym, które stosuje w swoich najpotężniejszych modelach.

Czy te środki rzeczywiście działają, powinno się wyjaśnić w nadchodzących miesiącach. Jeśli chińskie laboratoria korzystały z tego typu ataków, zamknięcie tej ścieżki mogłoby ponownie zwiększyć dystans dzielący je od zachodnich ośrodków badawczych.

Źródło