Google: jak powstrzymać agenty AI przed zapamiętywaniem testów

W świecie agentów AI wiele mówi się o coraz potężniejszych modelach. Tymczasem badacze z Google zwracają uwagę na coś, co często umyka uwadze: o jakości działania agenta w praktyce decyduje nie tylko sam model, lecz także harness — warstwa oprogramowania, która określa, jak agent czyta pliki, reaguje na błędy i prezentuje wyniki. To właśnie tutaj, zdaniem naukowców, kryje się duża część ostatnich postępów.

Problem w tym, że ręczne dopracowywanie tej warstwy jest żmudne, a automatyczne metody samodoskonalenia mają poważną wadę. Nowa praca badawcza opisuje mechanizm, który pozwala agentom rozwijać się bez popadania w pułapkę zapamiętywania zadań testowych.

Na czym polega samodoskonalenie agentów AI

Jeszcze do niedawna poprawianie harnessu odbywało się ręcznie. Inżynierowie analizowali nieudane przebiegi agenta i łatali kod, aby uniknąć tych samych błędów w przyszłości. Nowsze podejścia automatyzują ten cykl: model językowy sam przepisuje własną warstwę sterującą, wielokrotnie, korzystając z informacji zwrotnej płynącej z zadań testowych.

Badacze nazywają to praktyczną formą rekurencyjnego samodoskonalenia. System generuje sygnały zwrotne, na ich podstawie optymalizuje harness, a ten z kolei kształtuje zachowanie samego systemu. Brzmi efektywnie — i rzeczywiście podnosi wyniki. Ale wiąże się z pewnym haczykiem.

Dlaczego samodoskonalenie prowadzi do zapamiętywania testów

Gdy agent nieustannie pracuje nad tym samym, ograniczonym zestawem zadań, z czasem po prostu się ich uczy na pamięć. Wyniki na zadaniach treningowych rosną, natomiast korzyści na nowych, niewidzianych wcześniej problemach maleją lub znikają zupełnie.

Autorzy pracy wskazują kilka przyczyn tego zjawiska:

  • wyszukiwanie utrwala wzorce dopasowane wyłącznie do jednego konkretnego benchmarku,
  • preferowane są rozwiązania, które wypadają dobrze przypadkiem, a nie dzięki realnej poprawie,
  • narasta zbędna złożoność, która podnosi wynik testu, nie czyniąc agenta lepszym.

W efekcie inne metody optymalizacji poprawiają głównie rezultaty na danych treningowych, a tylko niewielka część tego zysku przenosi się na nowe wyzwania. To klasyczny problem przeuczenia, tyle że na poziomie całego harnessu, a nie samego modelu.

Jak RRSI ogranicza samodoskonalenie w dwóch punktach

Rozwiązaniem proponowanym przez zespół Google jest RRSI, czyli Regularized Recursive Self-Improvement of Agent Harnesses. Metoda działa na obu końcach pętli optymalizacyjnej, pozostawiając harness w pełni edytowalnym.

Malejący budżet na zmiany

Gdy system proponuje modyfikacje, budżet ogranicza liczbę niezależnych edycji, jakie można połączyć w jednym kandydacie. Co istotne, ten limit z czasem się kurczy. Wczesne rundy dopuszczają większe przepisania, późniejsze pozwalają już tylko na drobne zmiany, które można jednoznacznie powiązać z konkretnym wynikiem.

Krytyk odrzucający triki pod benchmarki

Drugi mechanizm to krytyk, który ocenia każdą propozycję i odrzuca te zakodowane na sztywno pod nazwy zadań, gotowe rozwiązania czy inne sztuczki dopasowane do konkretnego testu. Osobna reguła dopuszcza wyższe koszty obliczeniowe tylko wtedy, gdy wiążą się z mierzalnym wzrostem skuteczności. Komponenty, które przestały pomagać, są usuwane.

System pamięta też wcześniejsze próby, żeby nie gonić w kółko za tymi samymi nieudanymi pomysłami. A gdy postęp się zatrzymuje, celowo eksperymentuje z częściami harnessu, których jeszcze nie ruszał.

Mniejszy zysk na treningu, większy na nowych zadaniach

Badacze przetestowali RRSI na ośmiu benchmarkach obejmujących kodowanie, biurową pracę agentową oraz projektowanie inżynierskie. Model bazowy, Claude Opus 4.8, przez cały czas pozostawał zamrożony. Zespół porównał RRSI z niezmodyfikowanym harnessem wyjściowym oraz czterema nowszymi metodami optymalizacji.

Wyniki są wymowne. RRSI zyskuje do 14,1 punktu na zadaniach treningowych i do 4,7 punktu na pięciu benchmarkach, których wcześniej nie widział. Zużywa też około 30 procent mniej tokenów w czasie działania niż wersja bez regularyzacji. Co ważne, skuteczność nigdy nie spadła poniżej poziomu wyjściowego na żadnym z niewidzianych benchmarków — a właśnie tak dzieje się zwykle z harnessem, który nauczył się zadań na pamięć.

Największą poprawę, 4,7 punktu, RRSI osiągnął na JobBench. Wszystkie metody radziły sobie dobrze na zadaniach treningowych, ale na nowych wyniki się odwracały — dwie z nich spadły nawet poniżej poziomu wyjściowego. RRSI odnotował najmniejszy przyrost na treningu spośród wszystkich wariantów i jako jedyny wyraźnie wyprzedził baseline na niewidzianych zadaniach. To dokładnie ten kompromis, do którego zmierzają zastosowane ograniczenia.

Spośród zoptymalizowanych harnessów RRSI potrzebuje najmniej tokenów i kroków, choć sam niezmodyfikowany harness wyjściowy jest jeszcze oszczędniejszy.

Harness wytrenowany na jednym modelu pomaga słabszym

Osobnym, ciekawym wnioskiem jest to, że harness zoptymalizowany z myślą o jednym modelu potrafi wspierać inne. Harness do kodowania, wytrenowany z użyciem Gemini 3.5 Flash, podniósł dokładność znacznie słabszego Gemini 3.1 Flash Lite z 11,2 do 14,6 punktu — bez żadnych modyfikacji. Odkryte mechanizmy nie zależą więc od możliwości modelu, który je znalazł.

Autorzy zaznaczają jednak ograniczenie swojej pracy: badanie obejmuje wyłącznie harnesse zbudowane wokół zamrożonych modeli i nie rozstrzyga przypadków, w których zmieniają się wagi modelu. Ich główny wniosek jest jasny — samodoskonalenie czyni agentów AI trwale skuteczniejszymi tylko wtedy, gdy powtarzalna informacja zwrotna zamienia się w trwałe zmiany. Kod udostępniono na GitHubie.

Szeroki kontekst: ręczne harnessy też zawodzą

Warto spojrzeć na ten problem szerzej. Ręcznie projektowane harnessy często nie uogólniają się na nowe zadania — pokazały to testy na ARC-AGI-3. Z dedykowanym harnessem Opus 4.6 osiągnął 97,1 procent w znanym środowisku i 0 procent w nieznanym.

Równolegle powstają pokrewne rozwiązania. Nvidia zaprezentowała niedawno SoL-Pi, w którym agent badawczy automatycznie przebudowuje harness agentów kodujących, obniżając zużycie tokenów nawet o 49 procent bez zauważalnego spadku skuteczności. Nieco wcześniej Google kazało agentom „śnić” o wcześniejszych przebiegach wyszukiwania, by ulepszyć ich strategię — i to podejście również pozostawia sam model bez zmian.

Wspólny mianownik tych prac jest wyraźny: zamiast sięgać po coraz większe modele, badacze uczą agentów lepiej korzystać z tego, co już mają. RRSI pokazuje, że samodoskonalenie da się okiełznać — tak, by nie kończyło się na zapamiętywaniu testów, lecz przekładało się na realne umiejętności.

Źródło