Koszty działania agentów kodujących rosną w zawrotnym tempie, a większość prac nad ich redukcją koncentrowała się dotąd na samych modelach – szybszych jądrach uwagi, kwantyzacji czy podmianie na tańsze LLM-y. Zespół badaczy z Nvidii proponuje inne spojrzenie: zamiast optymalizować model, warto przyjrzeć się warstwie sterującej, czyli harnessowi. To właśnie ten komponent decyduje, w jaki sposób agent odbiera stan środowiska, wykonuje akcje i przetwarza informację zwrotną.
Opracowany przez nich system SoL-Pi automatyzuje to, co dotąd robili ludzie – ręczne przeglądanie długich śladów wykonania i przekładanie powtarzalnych wzorców błędów na kod. Efektem jest redukcja zużycia tokenów o blisko połowę w porównaniu z popularnymi rozwiązaniami, przy zachowaniu porównywalnej skuteczności.
Dlaczego optymalizacja harnessu to trudny orzech
Harness pełni rolę pośrednika między modelem a środowiskiem, w którym działa agent – takim jak Codex, Claude Code czy OpenClaw. To on odpowiada za zarządzanie kontekstem, wywoływanie narzędzi, weryfikację wyników i logikę przerywania pracy. Problem w tym, że wszystkie te elementy są ze sobą ściśle powiązane.
Zmiana, która oszczędza tokeny w jednym miejscu, może wywołać błędy gdzie indziej albo po prostu przesunąć koszty na późniejszy etap. Dlatego dotychczas optymalizacja harnessu wymagała żmudnej pracy analityków, którzy przeglądali tysiące linii logów i ręcznie przekładali zauważone problemy na poprawki w kodzie.
Automatyzacja zamiast ręcznej analizy
SoL-Pi odwraca ten proces. Jeden agent badawczy obserwuje ślady działania drugiego, proponuje modyfikacje i testuje je w przygotowanych środowiskach. Kandydaci przechodzą weryfikację pod kątem zarówno możliwości, jak i efektywności – przetrwają tylko te zmiany, które nie pogarszają wyników przy jednoczesnym obniżeniu kosztów.
Autorzy określają to podejście mianem rekurencyjnego samodoskonalenia. Kluczowe jest jednak ścisłe oddzielenie fazy poszukiwań od fazy oceny – harness zostaje zamrożony, zanim rozpocznie się właściwy test, a wyniki ewaluacji nie wracają do procesu wyszukiwania.
Skala eksperymentu i cztery mechanizmy oszczędności
Badacze przetestowali system na 535 wykonywalnych środowiskach, w tym 495 zadaniach pochodzących z par issue-pull request na GitHubie oraz 40 syntetycznych przypadkach testowych. Łącznie wygenerowano ponad 3000 przebiegów i ponad 60 tysięcy interakcji agent-środowisko. Sam proces przeszukał 152 kierunki optymalizacji.
Większa liczba prób nie gwarantuje jednak lepszych rezultatów – wcześniejsze prace pokazały, że automatycznie optymalizowane harnessy mają skłonność do przetrenowania na zadaniach treningowych i słabo radzą sobie z nowymi wyzwaniami. Dlatego zespół Nvidii odizolował benchmark EdgeBench od procesu poszukiwań, przeznaczając 11 z 51 publicznych zadań na jednorazową walidację, a pozostałe 40 na finalną ocenę.
W wyniku poszukiwań powstały cztery mechanizmy redukujące zbędną pracę:
- Action Fusion – łączy dwa kolejne kroki w jeden, na przykład edycję kodu i uruchomienie testu, eliminując w ten sposób całe wywołanie modelu językowego.
- Online Context Compact – uruchamia się po każdym kroku planowania i przycina nagromadzony kontekst, o ile nie prowadzi to do utraty istotnych informacji.
- ObservationPack – archiwizuje długie wyniki narzędzi i wstawia w ich miejsce krótkie streszczenie zamiast ponownie przesyłać pełną treść.
- Evidence-Preserving Reducer – kieruje obszerne logi błędów i testów do tańszego modelu, który wyciąga z nich kluczowe wnioski, z automatyczną weryfikacją wychwytującą przeoczone istotne przesłanki.
Wyniki: ile realnie można zaoszczędzić
Na 51 publicznych zadaniach EdgeBench SoL-Pi osiąga wyniki zbliżone do oryginalnego harnessu Pi. Skala oszczędności zależy od konfiguracji. Wariant maksymalnie efektywny łączy wszystkie cztery mechanizmy, zużywa o 49 procent mniej tokenów i osiąga 93,7 procent wyniku Pi. Z kolei użytkownicy stawiający na skuteczność mogą wybrać pojedynczy najsilniejszy mechanizm – taki wariant przewyższa wynik Pi o 5,3 procent, wciąż oszczędzając tokeny.
W obu przypadkach zużycie tokenów spada o 44,7 do 49 procent. Wariant efektywnościowy obniża koszt z 1339 do 894 dolarów, przy nieznacznie niższym wyniku punktowym.
W ujęciu godzinowym autorzy szacują oszczędności na 8,75 do 13,50 dolara w porównaniu z natywnymi harnessami Codex i Claude Code oraz 4,36 do 5,71 dolara względem Pi, przy obecnych cenach API.
Przenoszenie między modelami i inne benchmarki
System zbudowano wyłącznie z użyciem GPT-5.6 Sol, a następnie zastosowano bez zmian do Opus 5. W tym drugim przypadku zachował 94,3 procent skuteczności Pi przy podobnych oszczędnościach, choć mechanizmy uruchamiały się rzadziej i mniej agresywnie – co badacze wiążą z faktem, że harness optymalizowano wyłącznie na śladach GPT-5.6 Sol.
Poza EdgeBench obraz jest bardziej zróżnicowany. Na 63 zadaniach CPU z Terminal-Bench 4 SoL-Pi rozwiązuje tylko 15 zadań, podczas gdy Codex i Pi po 18 – koszty całkowite są jednak o około jedną czwartą niższe niż w przypadku Pi. Na formalnie zweryfikowanych zadaniach Lean 4 z IMO 2026 system rozwiązał trzy z sześciu problemów przy najniższym koszcie na rozwiązane zadanie. W eksperymencie optymalizacji jądra rój 20 pracowników SoL-Pi obniżył koszty o 26,8 procent względem porównywalnego roju Pi.
Oszczędności wiążą się jednak z kompromisami – krótszy kontekst może ograniczać ponowne wykorzystanie pamięci podręcznej promptów. W jednym z przebiegów koszty całkowite i tak spadły z 1339 do 894 dolarów.
Szerszy kontekst: rosnąca presja na koszty agentów
Jak duży wpływ na wydatki ma sam harness, pokazał sierpniowy test firmy Composio, która uruchomiła Deepseek V4 Flash w czterech różnych frameworkach agentowych, w tym Claude Code i opartym na Pi Oh My Pi. Koszt rozwiązania pojedynczego zadania różnił się niemal trzykrotnie, mimo że pracę wykonywał ten sam model.
Presja na optymalizację rośnie, bo agenci pochłaniają coraz więcej tokenów. Analityk OpenRouter Peter Walker wskazuje, że zużycie tokenów w zastosowaniach agentowych wzrosło 14-krotnie od lutego 2026 roku, a blisko 70 procent tej liczby pochodzi z promptów w pamięci podręcznej.
Kompresja kontekstu, z jakiej korzysta SoL-Pi, ma jednak skutki uboczne. Jedno z badań wykazało, że zachowuje ona średnio jedynie 17 procent instrukcji użytkownika. Dodatkowe koszty generują też agenci działający równolegle – Eric Provencher, deweloper Codex, ostrzega, że więcej niż dwa pod-agenty niemal zawsze spalają tokeny bez poprawy jakości, ponieważ większość czasu poświęcają na wzajemne sprawdzanie swojej pracy.
Autorzy badania z Nvidii sugerują, że w przyszłości harnessy będzie można wstępnie trenować na wielu zadaniach – podobnie jak robi się to z modelami – oraz wykorzystywać już odchudzony harness do tańszego poszukiwania jego następcy. Sami zastrzegają jednak, że to wizja, a nie wniosek płynący z obecnych eksperymentów.
SoL-Pi pokazuje, że warstwa sterująca agentem to przestrzeń, w której wciąż drzemią pokaźne oszczędności – i że można je wydobywać automatycznie, bez ręcznego przekopywania się przez logi. Pytanie brzmi, jak szybko takie podejście trafi do produkcyjnych narzędzi, z których korzystają zespoły programistyczne na całym świecie.

