Grok 4.5 zadebiutował publicznie 8 lipca 2026 roku i jest to pierwszy model xAI budowany z myślą przede wszystkim o kodowaniu i pracy agentowej. Firma, po połączeniu ze SpaceX występująca jako SpaceXAI, opisuje go jako swój najinteligentniejszy i najszybszy model. Elon Musk poszedł o krok dalej i porównał go wprost do topowej półki Anthropic. Sprawdzam, co z tych zapowiedzi potwierdzają liczby.

2 / 6 USD
za 1M tokenów (wejście / wyjście)
500 tys.
tokenów okna kontekstu
4,2×
mniej tokenów na zadanie niż Opus 4.8
4. miejsce
w rankingu Artificial Analysis

Premierę Musk zapowiedział dzień wcześniej na X, od razu ustawiając poprzeczkę wysoko:

Wpis Elona Muska na X zapowiadający Grok 4.5 jako model klasy Opus, szybszy i tańszy
„To model klasy Opus, ale szybszy, bardziej oszczędny w tokenach i tańszy." Wpis zebrał ponad 7 mln wyświetleń. Źródło: @elonmusk na X

Co nowego w Grok 4.5

Pod maską pracuje fundament V9 o 1,5 biliona parametrów, trenowany na dziesiątkach tysięcy układów NVIDIA GB300. Ciekawostką jest źródło danych do zadań programistycznych: zamiast publicznych repozytoriów xAI wykorzystał rzeczywiste sesje pracy deweloperów w edytorze Cursor. Najważniejsze parametry:

Kontekst500 tys. tokenów (mniej niż 1 mln w Grok 4.3, wciąż ok. 750 stron A4)
Rozumowaniejeden model z regulowanym wysiłkiem: low, medium lub high (domyślnie high)
Narzędziawbudowane wyszukiwanie w sieci i na X oraz wykonywanie kodu po stronie serwera
Szybkośćokoło 80 tokenów na sekundę, wejście tekstowe i obrazkowe

Benchmarki: mocna druga liga w kodowaniu

xAI opublikował wyniki czterech testów programistycznych. W oficjalnym wątku premierowym firma chwali się wykresem z DeepSWE 1.0, na którym Grok 4.5 wyprzedza oba modele Opus:

Oficjalny wykres SpaceXAI z benchmarkiem DeepSWE 1.0: Fable max 66,1%, GPT 5.5 xhigh 64,3%, Grok 4.5 62%, Opus 4.8 max 55,8%, Opus 4.7 max 54%
Oficjalny wykres z wątku premierowego @SpaceXAI na X. Pełne ogłoszenie: x.ai/news/grok-4-5

Pełniejsze zestawienie pokazuje uczciwie: Grok 4.5 gra o podium, ale liderem nie jest.

Benchmark Grok 4.5 Fable 5 GPT-5.5 Opus 4.8
Terminal Bench 2.183,3%84,3%83,4%78,9%
SWE Bench Pro64,7%80,4%b.d.69,2%
DeepSWE 1.062,0%66,1%64,3%55,8%
DeepSWE 1.153%70%67%59%

Prawdziwy atut kryje się gdzie indziej. Na SWE Bench Pro Grok 4.5 rozwiązuje zadanie, zużywając średnio niecałe 16 tys. tokenów wyjściowych. Opus 4.8 potrzebuje na tym samym teście około 67 tys., czyli ponad cztery razy więcej. W pracy agentowej, gdzie model wykonuje setki kroków, taka oszczędność przekłada się bezpośrednio na rachunek.

Cennik: najtańszy w całej stawce

Model Wejście / 1M tokenów Wyjście / 1M tokenów
Grok 4.52 USD6 USD
Claude Opus 4.85 USD25 USD
GPT-5.55 USD30 USD
Claude Fable 510 USD50 USD

Po zsumowaniu niskiej stawki i oszczędnego zużycia tokenów wychodzi około 2,5 USD za zadanie agenta kodującego, mniej więcej jedna piąta kosztu porównywalnych systemów. To główny argument sprzedażowy tego wydania.

Niezależne testy: czwarte miejsce i jeden poważny zgrzyt

W rankingu Artificial Analysis Intelligence Index Grok 4.5 uzyskał 54 punkty i zajął czwarte miejsce, za Claude Fable 5, GPT-5.5 i Opus 4.8, ale przed wszystkimi modelami Gemini i każdym modelem otwartym. W testach agentowych bywa nawet liderem: τ³-Banking (obsługa narzędzi) i SWE Marathon (długie, wielogodzinne zadania) wygrał z całą stawką.

Ciekawie wypadła ocena zespołu Browser Use, który sprawdził model w sterowaniu przeglądarką. Wynik plasuje się nad GPT-5.6 i tuż za Opusem, ale badacz dorzucił istotne zastrzeżenie o kosztach: drogie tokeny z pamięci podręcznej sprawiają, że całość wychodzi tylko o 10 procent taniej niż Opus.

Elon Musk cytuje na X ocenę badacza Browser Use: Grok 4.5 powyżej GPT-5.6 i tuż za Opusem w sterowaniu przeglądarką
Musk cytuje ewaluację Alexandra Yue z projektu Browser Use. Źródło: @elonmusk na X

Jest jednak łyżka dziegciu. W benchmarku AA-Omniscience wskaźnik halucynacji, czyli odsetek odpowiedzi pewnych, lecz błędnych, wzrósł do 54 procent. To ponad dwa razy więcej niż 25 procent u poprzednika, Grok 4.3. Model odpowiada trafniej niż kiedyś, ale gdy się myli, robi to z pełnym przekonaniem. Przy pracy z faktami warto więc trzymać włączone wyszukiwanie i weryfikować źródła.

Gdzie skorzystasz z Grok 4.5

Model jest dostępny w API xAI pod nazwą grok-4.5, w narzędziu Grok Build oraz w Cursorze na wszystkich planach. Znalazł się też u zewnętrznych dostawców, między innymi OpenRouter, Vercel i Cloudflare. Dostępność w Unii Europejskiej firma zapowiedziała na połowę lipca, więc w chwili publikacji tego wpisu powinna już obowiązywać.

Czy warto się nim zainteresować

Grok 4.5 nie odbiera korony najlepszym modelom do kodowania, ale zmienia rachunek opłacalności: wyniki blisko czołówki przy koszcie kilkukrotnie niższym. Jeśli budujesz agentów lub płacisz za API z własnej kieszeni, warto go przetestować w pierwszej kolejności. Jeśli zaś liczy się dla Ciebie maksymalna jakość i wiarygodność odpowiedzi, czołówka rankingu pozostaje bez zmian. Zanim zdecydujesz, porównaj modele na własnych zadaniach w bezpłatnej porównywarce modeli AI.