Claude Opus 5 – inteligencja Fable za pół ceny

Anthropic właśnie udostępniło Claude Opus 5 – model, który według twórców łączy przemyślane działanie z wysoką wydajnością. Jego największą zaletą jest zbliżenie się do możliwości flagowego Fable 5 przy koszcie o połowę niższym. W testach kodowania i pracy intelektualnej, takich jak Frontier-Bench czy GDPval-AA, Opus 5 ustanawia nowe standardy, choć w zadaniach cyberbezpieczeństwa wciąż ustępuje Mythos 5. Model został zaprojektowany z myślą o codziennym użytkowaniu – działa sprawniej niż inne modele i staje się domyślnym wyborem na platformie Claude Max oraz najmocniejszym modelem w Claude Pro.

Wydajność i opłacalność – nowa jakość w przystępnej cenie

Claude Opus 5 oferuje znacząco lepsze rezultaty przy takim samym koszcie jak jego poprzednik, Opus 4.8. Kluczowym elementem jest tutaj możliwość regulacji poziomu wysiłku modelu – użytkownicy mogą optymalizować pracę pod kątem inteligencji lub oszczędzać tokeny dla szybszych i tańszych odpowiedzi.

Rewolucja w zadaniach programistycznych

W benchmarku Frontier-Bench v0.1 Opus 5 przewyższa wszystkie inne modele, a jego wydajność jest ponad dwukrotnie lepsza od Opus 4.8 przy niższym koszcie na zadanie. Na platformie CursorBench 3.2, przy maksymalnym wysiłku, model osiąga wynik zaledwie 0,5% gorszy od szczytowego rezultatu Fable 5, ale za połowę ceny. Co więcej, przy każdym poziomie wysiłku – wysokim, bardzo wysokim i maksymalnym – Opus 5 zapewnia lepszą wydajność w przeliczeniu na koszt niż jakikolwiek inny model.

Postępy w pracy intelektualnej i rozwiązywaniu problemów

Podobne wyniki widzimy w zadaniach wymagających myślenia analitycznego. W teście ARC-AGI 3, gdzie model musi rozwiązywać nowe, nieznane wcześniej problemy, Opus 5 uzyskuje wynik trzykrotnie wyższy niż kolejny najlepszy model. Na Zapier AutomationBench, mierzącym zdolność do realizacji biznesowych zadań od początku do końca, wskaźnik powodzenia Opus 5 jest około 1,5 razy wyższy niż u konkurencji przy tym samym koszcie. Nawet przy najniższym ustawieniu wysiłku model zalicza więcej zadań niż jakikolwiek inny. W benchmarku OSWorld 2.0, dotyczącym obsługi komputera, Opus 5 pokonuje wszystkie modele w każdej kategorii cenowej, przewyższając najlepszy wynik Fable 5 przy koszcie wynoszącym zaledwie jedną trzecią.

Nauka i wizja – obszary szczególnej przewagi

Opus 5 to znaczący krok naprzód w porównaniu z Opus 4.8 w kontekście badań naukowych. Na każdej z ocen z zakresu nauk przyrodniczych – obejmujących biologię strukturalną, chemię organiczną i bioinformatykę – model wypada lepiej niż poprzednik. Największe postępy widoczne są w chemii organicznej, gdzie wnioskowanie o strukturach molekularnych na podstawie danych spektroskopowych osiąga wynik o 10,2 punktu procentowego wyższy. W zadaniach związanych z białkami, takich jak przewidywanie wpływu zmian w sekwencji na funkcjonowanie białka, poprawa wynosi 7,7 punktu procentowego.

Model radzi sobie również znakomicie z generowaniem silnych wyników wizualnych, co otwiera nowe możliwości w projektowaniu i inżynierii.

Samodzielność i dokładność – jak Opus 5 weryfikuje swoją pracę

Claude Opus 5 wyróżnia się umiejętnością weryfikowania własnych działań i iteracyjnego poprawiania błędów. W testach i wczesnym dostępie użytkownicy zaobserwowali wiele przykładów jego samodzielności i skrupulatności.

W jednym z zadań na Frontier-Bench model otrzymał rysunek części maszynowej i miał napisać kod, by odtworzyć ją w 3D w FreeCAD. Problem polegał na tym, że celowo nie dano mu bezpośredniego dostępu do rysunku. Opus 5 samodzielnie napisał własny pipeline wizyjny, by wyodrębnić geometrię z surowych pikseli, a następnie zrekonstruował całą część. Żaden konkurencyjny model w tych samych warunkach nie był w stanie rozwiązać tego zadania po pięciu próbach.

W innym przypadku, mając do czynienia z realnym błędem w popularnym menedżerze pakietów open source, Opus 5 znalazł pierwotną przyczynę i naprawił przypadek brzegowy, który umknął społeczności. Konkurencyjny model usunął jedynie powierzchowny objaw, nie rozwiązując źródła problemu, a następnie uznał zadanie za zakończone.

Inżynier z firmy tradingowej wykorzystał Opus 5 do zbudowania kanału danych rynkowych dla nowej giełdy w ciągu jednej sesji. Wcześniejsze modele nie były w stanie ukończyć tego zadania, nawet mając szczegółowe plany od inżyniera. Gdy Opus 5 nie znalazł aktywnego źródła danych do walidacji, samodzielnie stworzył własny zestaw testów, by sprawdzić, czy jego kod poprawnie parsuje dane giełdowe.

Opinie wczesnych użytkowników

Wczesny dostęp do Opus 5 potwierdza jego przewagę w wielu dziedzinach. Na FrontierCode 1.1 model zbliża się do wydajności Fable przy połowie kosztów, a w środowisku Devin szczególnie dobrze radzi sobie z trudnym debugowaniem i analizą przyczyn źródłowych. Użytkownicy Cursor podkreślają, że Opus 5 dostarcza inteligencję bliską Fable 5 przy prędkości i koszcie Opus. Na Zapier AutomationBench model osiągnął 100% skuteczności w pełnej sekwencji zapobiegania utracie klientów, czego nie udało się wcześniejszym modelom.

W analizie genomowej Opus 5 zachowuje się jak uważny naukowiec – sięga po odpowiednie testy statystyczne, krzyżowo weryfikuje własne wyniki i utrzymuje koncentrację podczas długich, wieloetapowych analiz. W firmie Lovable, gdzie kluczowa jest powtarzalność, model odnotował 22% poprawę w najtrudniejszych zadaniach kodowania agentowego w porównaniu z Opus 4.7, przy znacznie mniejszym rozrzucie wyników.

Specjaliści z Box podkreślają, że Opus 5 przewyższa Opus 4.8 o 8% ogólnie, a w analizie danych i due diligence poprawa wynosi odpowiednio 11% i 17%. W modelowaniu finansowym model osiąga średnio o 9 punktów procentowych wyższą dokładność przy jednej trzeciej liczby kroków i 60% krótszym czasie. W pracach prawniczych największe zyski zaobserwowano w obszarach ładu korporacyjnego i arbitrażu, gdzie model utrzymuje jakość przy generowaniu 26% mniejszej liczby tokenów.

To, co wyróżnia Claude Opus 5, to osąd. Myśli dłużej, zanim napisze choćby jedną linię kodu, wyłapuje własne logiczne błędy podczas planowania, a nie po fakcie, i rozumuje, dlaczego odpowiedź jest poprawna, a nie tylko czy działa. To najwyraźniejszy skok w rozwiązywaniu problemów, jaki widzieliśmy między kolejnymi modelami Claude.

Bezpieczeństwo i dostosowanie – odpowiedzialne wdrażanie potężnego narzędzia

Przed wdrożeniem Opus 5 przeszedł automatyczny audyt behawioralny, który wykazał, że jest to najbardziej dostosowany model w historii Anthropic. Lepiej niż Opus 4.8, Sonnet 5 czy Fable 5 przestrzega Konstytucji Claude, wykazuje najniższe wskaźniki zachowań oszukańczych i jest najmniej podatny na nakłonienie do niewłaściwego użycia. To również najbezpieczniejszy model pod względem unikania pochopnych działań, które mogłyby mieć trudne do odwrócenia skutki uboczne. W ogólnym wyniku zachowań niedostosowanych Opus 5 uzyskał 2,3 – najniższy wynik spośród ostatnich modeli.

W kwestii bezpieczeństwa, Opus 5 nie przesuwa granicy w ryzykownych, podwójnego zastosowania zdolnościach. W rygorystycznych ocenach przeprowadzonych z partnerami prywatnymi i rządowymi pozostaje za Mythos 5 zarówno w badaniach biologicznych, jak i ofensywnym cyberbezpieczeństwie. Model nie był celowo trenowany na zadaniach cybernetycznych, ale dzięki ogólnemu wzrostowi możliwości poprawił się w tych obszarach. Na teście OSS-Fuzz Opus 5 i Mythos 5 znajdują podatności z podobnym powodzeniem, ale Opus 5 jest znacznie mniej skuteczny w opracowywaniu exploitów.

Zabezpieczenia i dostępność

Zabezpieczenia Opus 5 są podobne do tych z Opus 4.8, z wyjątkiem silniejszych ograniczeń na wąskim zakresie zadań cybernetycznych. Klasyfikatory cybernetyczne są proporcjonalnie mniej restrykcyjne niż w Fable 5 – pozwalają na znajdowanie podatności w kodzie źródłowym, ale blokują skanowanie oparte na plikach binarnych, testy penetracyjne i generowanie exploitów. Oczekuje się, że klasyfikatory będą interweniować około 85% rzadziej niż w przypadku Fable 5. W Claude.ai, Claude Code i Claude Cowork, flagowane żądania będą domyślnie przekierowywane do Opus 4.8. Program Cyber Verification Program (CVP) umożliwia przedsiębiorstwom i badaczom dostęp do wersji Opus 5 z mniejszą liczbą ograniczeń.

W biologii, ponieważ Opus 5 ma podobny zestaw zabezpieczeń co Opus 4.8, jest teraz najbardziej wydajnym ogólnie dostępnym modelem do badań naukowych. W ramach tej premiery, zablokowane na Fable 5 żądania związane z biologią będą teraz kierowane do Opus 5, a nie Opus 4.8.

Dostępność i ceny

Claude Opus 5 jest dostępny od dziś na wszystkich platformach w cenie 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion tokenów wyjściowych – identycznie jak Opus 4.8. Deweloperzy mogą rozpocząć pracę z modelem claude-opus-5 za pośrednictwem Claude API. Model oferowany jest również w trybie Fast, który działa około 2,5 razy szybciej niż domyślnie, dostępnym za podwójną cenę bazową.

Razem z Opus 5 Anthropic udostępnia dwie aktualizacje w wersji beta: możliwość zmiany narzędzi w trakcie rozmowy na platformie Claude oraz automatyczne przekierowywanie żądań flagowanych przez klasyfikatory bezpieczeństwa do innego modelu. Zgodnie z wcześniejszymi modelami Opus, Opus 5 nie wymaga przechowywania danych do ogólnego dostępu.

Claude Opus 5 to wyraźny krok naprzód w rodzinie modeli Anthropic. Łączy w sobie inteligencję zbliżoną do flagowego Fable 5 z przystępną ceną i wysoką wydajnością, co czyni go atrakcyjnym wyborem zarówno dla deweloperów, jak i przedsiębiorstw. Jego zdolność do samodzielnej weryfikacji pracy i iteracyjnego doskonalenia rezultatów otwiera nowe możliwości w automatyzacji złożonych zadań, od programowania po badania naukowe. Jednocześnie Anthropic zachowuje ostrożność, wdrażając odpowiednie zabezpieczenia, by potęga modelu nie została wykorzystana w nieodpowiedni sposób. To model, który warto mieć na radarze – zwłaszcza jeśli szukasz równowagi między mocą a kosztem.

Źródło