Od 2023 roku koszt osiągnięcia określonego poziomu wydajności w wybranych benchmarkach AI gwałtownie spadł. Organizacja badawcza Epoch AI, która śledzi trendy w sztucznej inteligencji, szacuje, że ceny maleją średnio o około 47 procent na kwartał, co daje mniej więcej trzynastokrotny spadek w skali roku. Żadna inna przełomowa technologia nie taniała w takim tempie. Trzeba jednak uważnie czytać te liczby, bo dotyczą one rynkowych cen za stały wynik w benchmarku, a nie czystego postępu algorytmicznego ani realnych kosztów produktywności.
Dwa różne pomiary, dwa różne wnioski
Badacze z MIT, analizujący porównywalne dane, widzą spadki na poziomie od pięciu do dziesięciu razy w ciągu roku. Kiedy jednak odfiltrują tańszy sprzęt oraz presję konkurencyjną na ceny, rzeczywisty zysk z samej efektywności algorytmicznej wynosi około trzykrotności rocznie. Obie grupy badawcze zadają więc inne pytania i dochodzą do innych liczb.
Odpowiedź zależy od tego, co dokładnie porównujemy. Dopasowanie zeszłorocznej czołowej możliwości jest dziś dramatycznie tańsze. Uruchomienie aktualnie najlepszego modelu bywa natomiast znacznie droższe za pojedyncze zapytanie, ponieważ nowsze modele rozumujące zużywają o wiele więcej mocy obliczeniowej na jedno zadanie.
Przykład o3 pokazuje skalę zjawiska
Epoch AI ilustruje to na modelu OpenAI o3. Na początku 2025 roku o3 uzyskał 75 procent w GPQA Diamond, teście naukowym na poziomie doktoranckim, przy szacowanym koszcie trzydziestu centów za pytanie. Półtora roku później model z rodziny GPT-5.6 osiągnął identyczny wynik za cztery setne centa. Według Epoch AI to jedna siedemset dwudziesta piąta pierwotnej ceny. Gdyby samochody taniały w takim tempie, pojazd wart pięćdziesiąt tysięcy euro kosztowałby mniej niż siedemdziesiąt euro. OpenAI wypuściło jeszcze tańsze modele GPT-6 Sol i Luna zaledwie kilka dni temu, więc różnica prawdopodobnie się powiększyła.
Skąd bierze się spadek cen
Epoch AI opiera swoją analizę na pięciu benchmarkach obejmujących matematykę, nauki ścisłe i łamigłówki logiczne. Ponieważ próba jest wąska, sama organizacja nazywa swoje ustalenia rozsądnymi, ale przybliżonymi pomiarami opartymi na najlepszych dostępnych danych.
Hans Gundlach wraz z kolegami z MIT wykorzystują dane cenowe z platformy porównawczej Artificial Analysis, obejmujące okres od kwietnia 2024 do listopada 2025 roku, i oceniają znacznie więcej modeli na test niż wcześniejsze badania. Ich wyniki są niższe niż u Epoch AI częściowo dlatego, że nowsze modele rozumujące potrafią przeznaczyć dodatkową moc obliczeniową na trudne problemy, podnosząc koszt poprawnej odpowiedzi, nawet gdy cena za token stale maleje. Tokeny to jednostki tekstu, za które dostawcy wystawiają rachunki, a porównywanie ich samych pomija pełny obraz sytuacji.
Algorytmika to tylko część równania
Kiedy badacze z MIT rozkładają spadek cen na czynniki, tańszy sprzęt odpowiada za część zjawiska, a konkurencja za kolejną. Aby oddzielić wpływ rywalizacji, naukowcy analizują modele otwarte osobno. To, co pozostaje, to czysty zysk z efektywności algorytmicznej, wynoszący około trzykrotności rocznie. Trzynastokrotny wskaźnik Epoch AI jest wyższy, ponieważ nie odejmuje efektów sprzętowych ani konkurencyjnych.
Lepsze wyniki nie zawsze oznaczają większą efektywność
MIT odkryło również, że część poprawy wydajności wynika po prostu z większego zużycia mocy obliczeniowej. Nowy model, który bije poprzednika w GPQA Diamond, z zewnątrz wygląda na postęp, ale autorzy szacują, że duża część tej poprawy pochodzi z wykorzystania większej mocy przetwarzania na pytanie. Model osiąga wyższy wynik i kosztuje więcej w uruchomieniu. Benchmarki kodowania i matematyki pokazują mniejszą wersję tego samego wzorca.
Nie każdy postęp w benchmarkach jest postępem w efektywności. Nowe modele łączą lepsze trenowanie, lepsze dane, lepszą architekturę i większą moc obliczeniową w czasie testu. Pojedynczy wynik miesza to wszystko razem. Dochodzi też problem tak zwanego benchmaxxingu: firmy AI mogą optymalizować modele pod znane testy, zawyżając wyniki bez realnej wartości w praktyce. Epoch AI stara się temu przeciwdziałać, włączając test Mystery Game Puzzles oparty na grze, której zasady pozostają tajne. Koszty spadają najwolniej właśnie na tym teście, co pasuje do teorii benchmaxxingu, choć równie dobrze może odzwierciedlać format zadania albo szum w danych.
Cena nie wystarczy, by wybrać model
Uśrednione koszty niewiele pomagają, gdy wybieramy model do konkretnego zadania. Platformy takie jak Artificial Analysis szeregują modele według jakości, ceny, opóźnienia, okna kontekstowego i szybkości generowania odpowiedzi, a najtańsza opcja rzadko wygrywa w każdej kategorii jednocześnie.
- Tani model z dużym opóźnieniem nie sprawdzi się w chatbotcie działającym w czasie rzeczywistym.
- Potężny model rozumujący może być zbyt wolny do zautomatyzowanych procesów.
- Droższy model frontier może nadal oszczędzać pieniądze, jeśli częściej udziela poprawnych odpowiedzi i ogranicza liczbę powtórzeń.
Żaden z tych czynników nie pojawia się w prostym porównaniu ceny za token. Podsumowując, tanieje przede wszystkim dopasowanie do zeszłorocznych możliwości, a niekoniecznie korzystanie z aktualnie najlepszych modeli. Rozróżnienie między spadkiem cen a rzeczywistym postępem algorytmicznym pozostaje kluczowe dla każdego, kto planuje budżet na wdrożenia AI.

