Chip OpenAI Jalapeño bije Nvidię w testach wydajności

OpenAI po raz pierwszy zaprezentowało publiczne wyniki testów swojego autorskiego chipa do inferencji o nazwie „Jalapeño”. Układ, który powstał we współpracy z Broadcomem, ma przewyższać najnowsze akceleratory Nvidii zarówno pod względem wydajności na wat, jak i opóźnień w generowaniu tokenów. To sygnał, że era monopolu Nvidii w obszarze sprzętu dla sztucznej inteligencji może powoli dobiegać końca.

Wyniki ogłoszono podczas konferencji Hot Chips, a dane pochodzą z publicznego benchmarku InferenceX przygotowanego przez firmę analityczną SemiAnalysis. Co istotne, liczby przedstawiło samo OpenAI, a SemiAnalysis zweryfikowało część testów bezpośrednio w laboratorium. To pierwszy tak szczegółowy wgląd w możliwości sprzętu, który ma zasilać kolejne generacje modeli językowych.

Czym jest chip Jalapeño i jakie osiąga wyniki

Jalapeño to akcelerator zaprojektowany wyłącznie do inferencji, czyli uruchamiania już wytrenowanych modeli AI. Nie obsługuje procesu uczenia, co pozwoliło inżynierom skupić się na maksymalizacji szybkości odpowiedzi i efektywności energetycznej. Co ciekawe, układ nie jest zoptymalizowany pod kątem modeli OpenAI – to uniwersalny akcelerator dla dużych modeli językowych (LLM).

W testach porównawczych z użyciem trzech różnych modeli – GPT-OSS 120B, Deepseek R1 670B oraz Kimi K2.5 1T – chip osiągnął od 1,5 do 1,9 razy większą wydajność na wat przy szczytowym obciążeniu. Opóźnienia end-to-end były niższe od najlepszych komercyjnych systemów o współczynnik od 1,7 do 3,6. W przypadku obciążeń interaktywnych przewaga wzrasta do 2,1–4,1 razy.

Konkretne liczby robią wrażenie:

  • Na modelu GPT-OSS 120B chip generuje około 1400 tokenów na sekundę na jednego użytkownika
  • Na Deepseek R1 670B osiąga ponad 700 tokenów na sekundę przy pojedynczym żądaniu
  • Przy wyrównanej prędkości dekodowania, wydajność tokenów na kilowat jest od 54 do 104 razy wyższa niż w najlepszych dostępnych akceleratorach

Warto podkreślić, że Jalapeño osiąga te wyniki bez stosowania technik takich jak multi-token prediction czy spekulatywne dekodowanie. Część porównywanych systemów korzystała z tych optymalizacji, co oznacza, że OpenAI ma jeszcze spory zapas możliwości do wykorzystania w przyszłości.

Porównanie z platformą Vera Rubin i analiza SemiAnalysis

Przedstawiciele SemiAnalysis zwracają uwagę, że bardziej uczciwe porównanie niż z Blackwell to zestawienie z nowszą platformą Vera Rubin od Nvidii. Oba układy korzystają bowiem z pamięci HBM4. Nawet w tym zestawieniu Jalapeño generuje więcej tokenów na megawat niż Rubin, choć akcelerator Nvidii wykorzystuje optymalizację multi-token prediction, której OpenAI jeszcze nie wdrożyło.

Pod względem całkowitego kosztu posiadania (total cost of ownership) w przeliczeniu na token obie platformy wypadają niemal identycznie. Analitycy z SemiAnalysis nie szczędzą jednak pochwał: „Jalapeño dymi wszystkie inne chipy” w porównaniu wydajności na wat, a CEO firmy Dylan Patel zauważa, że „pierwsze generacje chipów zwykle nie są konkurencyjne, ale OpenAI bije Nvidię Blackwell i nawet Rubin”.

Należy jednak pamiętać o kilku zastrzeżeniach. Nvidia i AMD opublikowały już wyniki testów na większych modelach, takich jak Deepseek V4 Pro czy Kimi K3, których na Jalapeño jeszcze nie uruchamiano. Co więcej, systemy Rubin trafiły już do klientów, podczas gdy chip OpenAI wciąż pozostaje na etapie próbek inżynieryjnych.

Jak OpenAI zaprojektowało chip w dziewięć miesięcy

Proces powstawania Jalapeño był nietypowy nie tylko ze względu na tempo. Prace projektowe ruszyły w połowie 2024 roku, a finalny projekt trafił do produkcji w listopadzie 2025. Pełny cykl zajął około 16 miesięcy, ale samo projektowanie chipa od pierwszych szkiców do gotowego blueprintu zamknęło się w dziewięciu miesiącach.

Kluczową rolę w tym procesie odegrały własne modele OpenAI. Starsze generacje modeli wspierały projektowanie układów scalonych, a nowsze przyspieszały programowanie i optymalizację. To właśnie ta symbioza sprzętu i oprogramowania skłania analityków SemiAnalysis do odważnej tezy: słynna „fosa CUDA” Nvidii może wkrótce przestać istnieć. „Fosa CUDA jest potencjalnie martwa, biorąc pod uwagę, jak szybko OpenAI potrafi uruchamiać nowe modele na swoim krzemie” – czytamy w raporcie.

Dyrektor finansowa OpenAI, Sarah Friar, podkreśla, że chip wpisuje się w szerszą strategię obliczeniową firmy, w której centra danych, układy, modele, platforma deweloperska, produkty i urządzenia działają jako jeden zintegrowany system. Zapewnia też, że Jalapeño uzupełnia istniejące partnerstwa z Nvidią, AMD, AWS, Cerebras, CoreWeave i innymi, zamiast je zastępować.

Relacje te mają jednak złożony charakter. Nvidia, AMD i AWS są zarówno inwestorami, jak i partnerami obliczeniowymi OpenAI, a każda z tych firm rozwija własne chipy AI. To sprawia, że współpraca przeplata się z konkurencją. Wszystkie te przedsiębiorstwa powtarzają zresztą, że świat nigdy nie będzie miał dość mocy obliczeniowej – teza wygodnie wspierająca ich własne modele biznesowe.

Pierwsze benchmarki Jalapeño pokazują, że OpenAI poważnie myśli o uniezależnieniu się od dostawców sprzętu. Jeśli kolejne generacje chipów utrzymają to tempo rozwoju, rynek akceleratorów AI może czekać prawdziwa rewolucja. Pytanie brzmi nie czy, ale kiedy Nvidia straci pozycję niekwestionowanego lidera.

Źródło