Codziennie pracuje z AI: koduje strone, pisze skrypty na social media, analizuje dokumenty i tworze grafiki. Ponizej moj zestaw, a pod nim aktualne rankingi z Areny.
> subiektywny wybor od KrupińskiAI_
Cztery modele, ktore mam otwarte przez wiekszosc dnia. Kazdy do czego innego.
Cala ta strona powstala w Claude Code. Rozumie kontekst projektu, nie psuje istniejacego kodu i pisze najbardziej naturalnym jezykiem ze wszystkich. Do najciezszych zadan siegam po drozszy Fable 5.
Mocny w kodowaniu i debugowaniu. Siegam po niego, gdy chce spojrzec na problem z innej strony albo gdy pierwsze podejscie nie wypalilo.
Dlugie PDF-y i raporty, do tego Nano Banana 2 do obrazkow i Veo 3.1 do wideo. Najlepszy stosunek mozliwosci do ceny, a w pakiecie wieksza przestrzen na Dysku.
Najlepsze wyszukiwanie na X w czasie rzeczywistym, czego nie ma nikt inny. Do sledzenia biezacych wydarzen i nastrojow.
Wyzej moj wybor. Tutaj twarde dane: rankingi z Arena Leaderboard, gdzie modele rywalizuja w slepych testach ocenianych przez miliony uzytkownikow.
Zmiana na szczycie: Kimi K3 oddal prowadzenie, pierwsze miejsce wzial Claude Opus 5 Max. W mojej pracy i tak liczy sie co innego, niz mierzy Arena: nie pojedyncze zadania, tylko kilkugodzinna sesja w istniejacym projekcie, gdzie model nie moze psuc kodu obok.
Ta kategoria jest najblizsza temu, jak faktycznie pracuje: model dostaje narzedzia i ma doprowadzic zadanie do konca. Tu ranking pokrywa sie z moim doswiadczeniem.
Dobry przyklad na to, jak czytac ten ranking. Starsze Opusy 4.6 i 4.7 wciaz stoja nad nowszym Opus 5, bo zdazyly zebrac wielokrotnie wiecej glosow. Nowosc: do piatki wszedl Muse Spark od Mety, na razie z najwiekszym marginesem bledu w stawce (10 punktow wobec 3-5 u starszych modeli). Swieze modele wchodza do rankingu z dolu i pna sie w gore tygodniami.
Nano Banana 2 wypadl poza pierwsza piatke (jest siodmy), a i tak uzywam go najczesciej. Powod jest prozaiczny: mam go w Gemini, ktore i tak oplacam, wiec nie musze kupowac osobnego narzedzia.
Uzytkownik dostaje dwie odpowiedzi bez nazw modeli i wybiera lepsza. Z milionow takich pojedynkow powstaje ranking punktowy. To najuczciwszy dostepny pomiar preferencji, ale mierzy pierwsze wrazenie z jednego zapytania.
Nie sprawdza, jak model radzi sobie w trzygodzinnej sesji w duzym projekcie, czy pamieta ustalenia sprzed pol godziny i czy nie psuje rzeczy, ktorych nie mial dotykac. Dlatego moj wybor wyzej rozni sie od tych tabel.
Dane pochodza z Arena Leaderboard i sa przepisywane recznie, zwykle co dwa tygodnie. Data pobrania jest zawsze widoczna na gorze sekcji. Rynek AI rusza sie szybko, wiec jesli szukasz stanu na teraz, kliknij w link do pelnego rankingu przy kazdej kategorii.
Naucz sie pisac skuteczne prompty do ChatGPT, Claude i innych narzedzi AI. 21 lekcji wideo i gotowe prompty do użycia.
21 lekcji wideo i gotowe prompty do skopiowania. Dołącz do 100 000+ osób, które uczą się ze mną AI.
Sprawdź kurs Skuteczne Prompty →