Nowości
Anthropic wypuszcza Claude Opus 5: poziom modelu Fable 5 za połowę ceny

Spis treści
Anthropic udostępnił w czwartek Claude Opus 5, nowy model językowy, który firma opisuje jako 'przemyślany i proaktywny' oraz zbliżający się do możliwości najmocniejszego modelu w jej ofercie, Fable 5, przy o połowę niższej cenie. Model jest dostępny od razu w API, w aplikacji Claude, w narzędziu Claude Code oraz w Claude Cowork.
Co pokazują testy
Anthropic opublikował wyniki z kilkunastu zestawów testowych. Na Frontier-Bench w wersji 0.1 model osiąga dwukrotnie lepszy wynik niż Opus 4.8. Na teście CursorBench 3.2 w trybie maksymalnego namysłu mieści się w granicy pół procenta od Fable 5, kosztując przy tym o połowę mniej. Na ARC-AGI 3, teście sprawdzającym radzenie sobie z zupełnie nowymi zadaniami, wynik jest trzykrotnie wyższy niż u kolejnego modelu w zestawieniu.
W zadaniach z nauk przyrodniczych Opus 5 poprawia rezultaty poprzednika o 10,2 punktu procentowego w chemii organicznej i o 7,7 punktu procentowego w przewidywaniu sekwencji białkowych. W testach modelowania finansowego firma podaje średnio 9 punktów procentowych wyższą dokładność, 60 procent krótszy czas pracy i o jedną trzecią mniej wywołań narzędzi. W pierwszym podejściu do nanoszenia poprawek w umowach model osiąga niemal dwukrotnie lepszy wynik niż Opus 4.8.
Na FrontierCode 1.1 Claude Opus 5 zbliża się do poziomu Fable 5 przy połowie kosztu - Scott Wu, prezes Devin
Tańsza droga do czołówki
Kluczowa zmiana nie dotyczy samego szczytu możliwości, lecz relacji jakości do ceny. Anthropic pozycjonuje Opus 5 jako model do codziennej pracy, a nie do okazjonalnych, najtrudniejszych zadań. Na teście OSWorld 2.0, sprawdzającym obsługę komputera, model wypada lepiej niż wszystkie pozostałe przy jednej trzeciej kosztu Fable 5.
Podobny wniosek płynie z wypowiedzi partnerów. Sualeh Asif, współzałożyciel firmy Cursor, mówi o inteligencji zbliżonej do Fable 5 przy szybkości i cenie Opusa. Wade Foster, prezes Zapiera, wskazuje, że model wygrał wewnętrzny ranking AutomationBench, nie zużywając przy tym więcej tokenów niż konkurenci.
Bezpieczeństwo i zabezpieczenia
Anthropic podkreśla, że Opus 5 nie przesuwa granicy w niebezpiecznych zastosowaniach podwójnego przeznaczenia. W wewnętrznym audycie zachowań model uzyskał wynik 2,3, najniższy, czyli najlepszy, spośród ostatnich modeli firmy, z najniższym odsetkiem zachowań wprowadzających w błąd. W testach OSS-Fuzz wykrywa podatności niemal na poziomie Mythos 5, ale w tworzeniu działających exploitów wypada wyraźnie słabiej.
Zmieniły się też filtry dotyczące cyberbezpieczeństwa: są około 85 procent mniej restrykcyjne niż przy Fable 5. Model może szukać podatności w kodzie źródłowym, ale nadal blokowane jest skanowanie plików binarnych, testy penetracyjne i generowanie exploitów. Zapytania oznaczone przez klasyfikatory mogą zostać automatycznie przekierowane do Opusa 4.8.
Nowości dla programistów
Razem z modelem Anthropic udostępnił w wersji beta dwie zmiany w API. Pierwsza pozwala zmieniać w trakcie rozmowy zestaw narzędzi dostępnych dla modelu bez unieważniania pamięci podręcznej promptu, co obniża koszt długich sesji agentowych. Druga umożliwia automatyczne przekierowanie zapytań oznaczonych przez klasyfikatory bezpieczeństwa do innego modelu, zamiast zwracania odmowy.
Znaczenie dla polskich firm
Dla polskich zespołów, które rozliczają się z dostawcami AI za zużyte tokeny, najważniejsza jest arytmetyka. Utrzymanie ceny 5 i 25 dolarów za milion tokenów przy jednoczesnym zbliżeniu się do możliwości droższego modelu oznacza, że część zadań dotychczas kierowanych do najdroższej półki można przenieść na tańszą bez utraty jakości. Przy dużych wolumenach, typowych dla firm wdrażających agentów w obsłudze klienta czy analizie dokumentów, różnica w rachunku jest znacząca.
Istotna jest też informacja o mniejszej liczbie wywołań narzędzi i krótszym czasie pracy. W praktyce koszt agenta AI nie wynika z ceny pojedynczego zapytania, lecz z liczby kroków potrzebnych do zakończenia zadania. Model, który weryfikuje własną pracę i rzadziej sięga po narzędzia, obniża rachunek bardziej niż wynikałoby to z samego cennika.
Warto natomiast pamiętać o ograniczeniach. Anthropic sam przyznaje, że Opus 5 pozostaje słabszy od Mythos 5 w zadaniach ofensywnego cyberbezpieczeństwa, a wyniki testów pochodzą od producenta i nie zostały jeszcze niezależnie zweryfikowane. Firmy, które planują wdrożenie, powinny sprawdzić model na własnych zadaniach, zanim przełączą procesy produkcyjne.


