Nemotron 3.5 Lightning: szybkość zamiast rozmiaru

Nvidia zaprezentowała Nemotron 3.5 Lightning – pierwszy model z nowej rodziny Nemotron 3.5. To kompaktowa architektura typu open-weights (z publicznie dostępnymi wagami), która w testach porównawczych dorównuje znacznie większemu modelowi OpenAI, jednocześnie oferując najwyższą prędkość wnioskowania w swojej klasie. Producent celowo stawia na efektywność kosztem maksymalnej inteligencji, co może wyznaczyć nowy kierunek w projektowaniu systemów AI.

Architektura i pozycja w rankingach inteligencji

Lightning jest bezpośrednim następcą modelu Nemotron 3 Nano 30B A3B. Podobnie jak poprzednik, wykorzystuje hybrydową architekturę Mamba-Transformer. Łącznie ma 31,6 miliarda parametrów, ale w danym momencie aktywuje jedynie 3,6 miliarda z nich. To rozwiązanie pozwala łączyć zalety obu podejść – wydajność transformatorów z szybkością modeli stanowych.

Niezależna platforma benchmarkingowa Artificial Analysis przyznała modelowi wynik 24 punkty w Indeksie Inteligencji. To skok o dziewięć punktów względem poprzednika (15). Co istotne, wynik ten plasuje Lightning na równi z modelem gpt-oss-120b od OpenAI (również 24) i tuż za własnym, większym rodzeństwem – Nemotronem 3 Super (26), który jest około czterokrotnie obszerniejszy. Wciąż jednak mniejsze modele z tej samej półki cenowej, takie jak Qwen3.6 35B A3B (32) czy Meta Muse Glimmer (35), pozostają poza zasięgiem.

Nvidia świadomie wybiera inną ścieżkę rozwoju niż konkurencja. Zamiast ścigać się w wyścigu o najwyższe wyniki, koncentruje się na tzw. krzywej efektywności. W testach przedpremierowych z końcowymi wagami NVFP4 model osiąga niemal 670 tokenów na sekundę. To najwyższa zmierzona przepustowość wśród porównywanych modeli i prawie dwukrotnie lepszy wynik niż w przypadku Google Gemini 3.5 Flash-Lite (386 tokenów/s). Zadanie z Indeksu Inteligencji Lightning wykonuje średnio w pół minuty, podczas gdy Qwen3.6 35B A3B potrzebuje około 3,5 minuty, a Gemma 4 31B – blisko 5,8 minuty.

Największy postęp w zadaniach agentowych

Najbardziej spektakularne poprawy widać w benchmarkach agentowych, czyli testach sprawdzających zdolność modelu do samodzielnego wykonywania złożonych, wieloetapowych zadań. W teście GDPval-AA v2 Lightning uzyskał ocenę Elo 824 – to wzrost o 334 punkty względem Nemotron 3 Nano. Wynik ten bije zarówno gpt-oss-120b (800), jak i większego Nemotron 3 Super (698).

Jeszcze wyraźniejszy postęp widać w benchmarku Terminal-Bench v2.1, który mierzy umiejętność pracy w środowisku terminala. Model skoczył z 7 do 24,3 procent skuteczności, niemal dorównując gpt-oss-120b (26,2 procent). Te wyniki sugerują, że Lightning sprawdza się szczególnie dobrze w roli „pracownika” w zautomatyzowanych pipeline’ach opartych na agentach AI.

Nvidia udostępnia model na licencji OpenMDW-1.1, co daje szerokie możliwości wykorzystania komercyjnego. Producent pozycjonuje Lightning jako wydajnego „konia roboczego” do systemów agentowych. W komunikacie prasowym firma informuje, że współpracowała z partnerami takimi jak CodeRabbit i Harvey nad post-trainingiem, aby zwiększyć skuteczność modelu w konkretnych domenach.

Dostępność i praktyczne zastosowania

Model jest dostępny w dwóch wariantach wag: BF16 oraz NVFP4. Co istotne, wersja skompresowana zachowuje pełną jakość – również osiąga 24 punkty w Indeksie Inteligencji, przy minimalnych stratach względem wersji o wyższej precyzji. Lightning obsługuje wyłącznie tekst i dysponuje kontekstem o długości miliona tokenów, co pozwala na przetwarzanie bardzo długich dokumentów.

Wagi można pobrać już teraz. Wnioskowanie serwerowe oferują między innymi DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius i Crusoe. Taka dostępność sprawia, że wdrożenie modelu we własnej infrastrukturze nie wymaga negocjacji z jednym dostawcą chmury.

Strategia Nvidii nie jest nowa. W szeroko komentowanej publikacji naukowej z zeszłego roku badacze firmy argumentowali, że modele o parametrach poniżej 10 miliardów mogą obsłużyć większość zadań agentowych równie dobrze, jak modele z 70–175 miliardami parametrów, przy ułamku kosztów. Nemotron 3.5 Lightning ma 31,6 miliarda parametrów, ale aktywuje tylko 3,6 miliarda na krok, co plasuje go w tej samej lekkiej klasie. Przy prędkości blisko 670 tokenów na sekundę i wynikach agentowych lepszych niż u większych rywali, stanowi najbardziej namacalny dowód tej tezy w praktyce.

Premiera Lightning pokazuje, że rynek modeli językowych nie musi polegać wyłącznie na powiększaniu architektur. Dla firm, które wdrażają agentów AI do realnych procesów, liczy się nie tylko jakość odpowiedzi, ale też koszt i czas ich uzyskania. Nvidia zdaje się celować właśnie w ten segment, oferując narzędzie, które łączy przyzwoitą inteligencję z rekordową szybkością. To może być zapowiedź szerszego trendu, w którym optymalizacja pod konkretne zadania staje się ważniejsza niż wyścig o pierwsze miejsce w rankingach.

Źródło