Grok 4.5 zadebiutował publicznie 8 lipca 2026 roku i jest to pierwszy model xAI budowany z myślą przede wszystkim o kodowaniu i pracy agentowej. Firma, po połączeniu ze SpaceX występująca jako SpaceXAI, opisuje go jako swój najinteligentniejszy i najszybszy model. Elon Musk poszedł o krok dalej i porównał go wprost do topowej półki Anthropic. Sprawdzam, co z tych zapowiedzi potwierdzają liczby.
Premierę Musk zapowiedział dzień wcześniej na X, od razu ustawiając poprzeczkę wysoko:
Co nowego w Grok 4.5
Pod maską pracuje fundament V9 o 1,5 biliona parametrów, trenowany na dziesiątkach tysięcy układów NVIDIA GB300. Ciekawostką jest źródło danych do zadań programistycznych: zamiast publicznych repozytoriów xAI wykorzystał rzeczywiste sesje pracy deweloperów w edytorze Cursor. Najważniejsze parametry:
Benchmarki: mocna druga liga w kodowaniu
xAI opublikował wyniki czterech testów programistycznych. W oficjalnym wątku premierowym firma chwali się wykresem z DeepSWE 1.0, na którym Grok 4.5 wyprzedza oba modele Opus:
Pełniejsze zestawienie pokazuje uczciwie: Grok 4.5 gra o podium, ale liderem nie jest.
Prawdziwy atut kryje się gdzie indziej. Na SWE Bench Pro Grok 4.5 rozwiązuje zadanie, zużywając średnio niecałe 16 tys. tokenów wyjściowych. Opus 4.8 potrzebuje na tym samym teście około 67 tys., czyli ponad cztery razy więcej. W pracy agentowej, gdzie model wykonuje setki kroków, taka oszczędność przekłada się bezpośrednio na rachunek.
Cennik: najtańszy w całej stawce
Po zsumowaniu niskiej stawki i oszczędnego zużycia tokenów wychodzi około 2,5 USD za zadanie agenta kodującego, mniej więcej jedna piąta kosztu porównywalnych systemów. To główny argument sprzedażowy tego wydania.
Niezależne testy: czwarte miejsce i jeden poważny zgrzyt
W rankingu Artificial Analysis Intelligence Index Grok 4.5 uzyskał 54 punkty i zajął czwarte miejsce, za Claude Fable 5, GPT-5.5 i Opus 4.8, ale przed wszystkimi modelami Gemini i każdym modelem otwartym. W testach agentowych bywa nawet liderem: τ³-Banking (obsługa narzędzi) i SWE Marathon (długie, wielogodzinne zadania) wygrał z całą stawką.
Ciekawie wypadła ocena zespołu Browser Use, który sprawdził model w sterowaniu przeglądarką. Wynik plasuje się nad GPT-5.6 i tuż za Opusem, ale badacz dorzucił istotne zastrzeżenie o kosztach: drogie tokeny z pamięci podręcznej sprawiają, że całość wychodzi tylko o 10 procent taniej niż Opus.
Jest jednak łyżka dziegciu. W benchmarku AA-Omniscience wskaźnik halucynacji, czyli odsetek odpowiedzi pewnych, lecz błędnych, wzrósł do 54 procent. To ponad dwa razy więcej niż 25 procent u poprzednika, Grok 4.3. Model odpowiada trafniej niż kiedyś, ale gdy się myli, robi to z pełnym przekonaniem. Przy pracy z faktami warto więc trzymać włączone wyszukiwanie i weryfikować źródła.
Gdzie skorzystasz z Grok 4.5
Model jest dostępny w API xAI pod nazwą grok-4.5, w narzędziu Grok Build oraz w Cursorze na wszystkich planach. Znalazł się też u zewnętrznych dostawców, między innymi OpenRouter, Vercel i Cloudflare. Dostępność w Unii Europejskiej firma zapowiedziała na połowę lipca, więc w chwili publikacji tego wpisu powinna już obowiązywać.
Czy warto się nim zainteresować
Grok 4.5 nie odbiera korony najlepszym modelom do kodowania, ale zmienia rachunek opłacalności: wyniki blisko czołówki przy koszcie kilkukrotnie niższym. Jeśli budujesz agentów lub płacisz za API z własnej kieszeni, warto go przetestować w pierwszej kolejności. Jeśli zaś liczy się dla Ciebie maksymalna jakość i wiarygodność odpowiedzi, czołówka rankingu pozostaje bez zmian. Zanim zdecydujesz, porównaj modele na własnych zadaniach w bezpłatnej porównywarce modeli AI.