Claude Opus 5 trafił do użytkowników 24 lipca 2026 roku, dzień po terminie, który zdążył się już utrwalić w spekulacjach na X. Anthropic opisuje go jako model zbliżony inteligencją do Fable 5, ale kosztujący o połowę mniej. Sprawdzam, co z tej zapowiedzi wynika w liczbach i co realnie zmienia się dla osób pracujących z Claude na co dzień.

5 / 25 USD
za 1M tokenów (wejście / wyjście), tyle co Opus 4.8
1 mln
tokenów kontekstu, domyślnie i maksymalnie
30,2%
na ARC-AGI-3, trzykrotnie więcej niż kolejny model
1. miejsce
w rankingu Artificial Analysis (61 pkt przy wysiłku max)

Co dostajesz w pakiecie

Najważniejsza zmiana techniczna to okno kontekstu: milion tokenów jest tu jednocześnie ustawieniem domyślnym i maksymalnym, bez wariantu mniejszego. Do tego 128 tysięcy tokenów wyjścia i myślenie włączone domyślnie, czyli odwrotnie niż w Opusie 4.8, gdzie trzeba je było włączać osobno.

Nazwa w APIclaude-opus-5, dostępny też w Amazon Bedrock, Google Cloud i Microsoft Foundry
Poziomy wysiłkulow, medium, high, xhigh, max (domyślnie high)
Tryb szybkiokoło 2,5 raza szybciej za podwójną stawkę: 10 / 50 USD za milion tokenów
Pamięć podręcznaminimalna długość promptu do zapisania w cache spada z 1024 do 512 tokenów

W abonamentach Opus 5 jest już domyślnym modelem na planie Max i najmocniejszym dostępnym na Pro. W Claude Code alias opus prowadzi do nowego modelu na planach Max, Team Premium i przy rozliczeniu z API, natomiast na Pro i Team Standard domyślnym modelem pozostaje Sonnet 5.

Benchmarki: gdzie wygrywa

Anthropic postawił w komunikacie na testy agentowe, czyli takie, w których model nie odpowiada na pytanie, tylko doprowadza zadanie do końca.

Benchmark Opus 5 Fable 5 Opus 4.8 GPT-5.6 Sol
Frontier-Bench v0.1 (kodowanie w terminalu)43,3%33,7%21,1%34,4%
ARC-AGI-3 (nowe problemy)30,2%b.d.1,5%7,8%
OSWorld 2.0 (obsługa komputera)70,6%66,1%55,7%62,6%
AutomationBench (procesy biznesowe)26,0%17,4%17,0%18,1%
GDPval-AA v2 (praca umysłowa, punkty)1861174715931736

Największe wrażenie robi ARC-AGI. Na trzeciej edycji tego testu Opus 5 uzyskał 30,2 procent i został liderem rankingu ARC Prize w dniu premiery. Poprzednik, Opus 4.8, miał tam 1,5 procent. Na starszych wersjach testu wyniki sięgają 97,5 procent (ARC-AGI-1) i 90,4 procent (ARC-AGI-2 przy maksymalnym wysiłku).

W niezależnym rankingu Artificial Analysis Intelligence Index Opus 5 przy maksymalnym wysiłku uzyskał 61 punktów i objął prowadzenie, choć przewagą minimalną: Fable 5 ma tam 60 punktów, GPT-5.6 Sol 59, a chiński Kimi K3 57. Zespół Artificial Analysis dorzuca liczbę, która w praktyce znaczy więcej niż samo miejsce w tabeli: koszt wykonania zadania jest o 26 procent niższy niż w przypadku Fable 5 przy porównywalnej inteligencji.

Benchmarki: gdzie przegrywa

Warto pamiętać, że powyższe wyniki pochodzą od producenta. Sam Anthropic pokazuje też testy, w których Opus 5 nie jest pierwszy. Na DeepSWE v1.1 wygrywa GPT-5.6 Sol (72,7 procent wobec 69,7 u Fable 5 i 68,8 u Opusa 5). Na FrontierCode v1.1 nowy model i Fable 5 dzieli dziesiąta część punktu procentowego. Na Humanity's Last Exam Fable 5 prowadzi różnicą, której nie da się traktować poważnie (56,5 do 56,3 procent), za to w zadaniach prawniczych jego przewaga jest już wyraźna. W benchmarku medycznym HealthBench Professional najlepszy pozostaje niedostępny publicznie Mythos 5.

Zmiany, które popsują istniejące integracje

Dwie rzeczy wymagają uwagi przy migracji z Opusa 4.8. Po pierwsze, myślenie jest domyślnie włączone, a limit max_tokens obejmuje łącznie myślenie i odpowiedź, więc stare ustawienia mogą się okazać za ciasne. Po drugie, wyłączenie myślenia przy wysiłku xhigh lub max kończy się błędem 400. To zmiana łamiąca zgodność wsteczną, wcześniej te ustawienia były niezależne.

Jest jeszcze subtelniejsza pułapka. Opus 5 sam weryfikuje swoją pracę, więc instrukcje przenoszone ze starszych modeli w rodzaju „dodaj końcowy krok weryfikacji" powodują nadmiarowe sprawdzanie i niepotrzebnie zużywają tokeny. Anthropic wprost zaleca ich usunięcie. Model pisze też dłuższe odpowiedzi i częściej relacjonuje postęp pracy.

Czy warto przesiadać się od razu

Jeśli korzystasz z Claude w abonamencie, wybór już się dokonał za Ciebie i nowy model po prostu zastąpił poprzedni. Jeśli płacisz za API, przesiadka jest opłacalna z prostego powodu: cena została ta sama co w Opusie 4.8, a wyniki poszły w górę skokowo. Przed migracją zajrzyj jednak do dwóch zmian opisanych wyżej i przetestuj niższe poziomy wysiłku, bo tam kryje się realna oszczędność.

W drugim wpisie zebrałem pierwsze wrażenia po kilku dniach pracy z Opusem 5, wraz z testem, w którym nowy model wypadł gorzej od poprzednika. Jeśli chcesz porównać modele na własnych zadaniach, skorzystaj z bezpłatnej porównywarki modeli AI.