Dream-RSI: agenci AI uczą się na błędach dzięki „snom”

Poszukiwanie rozwiązania skomplikowanego problemu przez agenta AI przypomina błądzenie po nieznanym terenie. System musi nieustannie decydować, które ścieżki warto sprawdzić, co porzucić, a co testować równolegle. Ten proces – nazywany eksploracją – decyduje o tym, czy poszukiwania zakończą się sukcesem, czy też bezpowrotnie pochłoną zasoby obliczeniowe. Zespół badawczy z Google i DeepMind zaprezentował metodę Dream-RSI, która zmienia sposób podejmowania tych decyzji, nie ingerując w sam model AI.

Na czym polega problem z eksploracją w systemach AI

Dotychczasowe podejścia do eksploracji miały jedną z dwóch wad. Strategia ustalona z góry nie potrafi wyciągać wniosków z doświadczenia, przez co agent wielokrotnie trafia w te same ślepe zaułki. Z kolei dostosowywanie strategii w trakcie poszukiwań pozwala uniknąć tej sztywności, ale wiąże się z konkretnymi kosztami – potrzeba wielu prób, by ocenić, czy dane podejście w ogóle działa. Testowanie niezliczonych wariantów oznaczałoby powtarzanie długich i drogich uruchomień.

Badacze proponują rozwiązanie, które omija tę pułapkę: ponowne wykorzystanie danych z zakończonych już poszukiwań do sprawdzania alternatywnych strategii w przestrzeni, którą agent zdążył już zbadać. Podczas pracy system rejestruje swoje próby wraz z wynikami, tworząc materiał, który można później odtworzyć.

Jak działa „śniący” agent – metafora i mechanizm

Aby zobrazować tę ideę, badacze posługują się porównaniem do poruszania się po nieznanym mieście. Podczas pierwszej wizyty napotykamy ślepe uliczki, zawracamy i z trudem znajdujemy właściwą drogę. Gdy jednak dysponujemy już mentalną mapą, możemy zaplanować alternatywną trasę bez konieczności odwiedzania każdego zakątka ponownie.

Dream-RSI przenosi tę zasadę na zapisane historie poszukiwań. Zamiast testować nową strategię w rzeczywistym uruchomieniu, agent konfrontuje ją z przechowywanymi wynikami. Sprawdza w ten sposób, co by się stało, gdyby wcześniej podążył innymi ścieżkami lub porzucił niektóre z nich. Co istotne, system nie wymyśla zupełnie nowych rozwiązań podczas odtwarzania – testuje jedynie odmienne decyzje w obrębie zarejestrowanego drzewa poszukiwań.

Ponieważ wszystkie rezultaty są już zapisane, agent nie musi ponownie generować ani oceniać rozwiązań. Oznacza to, że tysiące alternatywnych strategii można przetestować bez odwoływania się do modelu czy ewaluatora. Ten proces badacze nazywają właśnie „snem” – agent odgrywa tysiące wariantów i wybiera najlepszy, zanim zastosuje go w rzeczywistym poszukiwaniu.

Cykl się powtarza. Po każdym poszukiwaniu agent wykorzystuje zapisane wyniki do przetestowania lepszych strategii, a następnie stosuje ulepszoną wersję w kolejnym uruchomieniu. Przez cały ten czas zmienia się wyłącznie strategia poszukiwań – model generujący rozwiązania pozostaje nietknięty.

Wyniki testów: mniej prób, lepsze rezultaty

Badacze przetestowali Dream-RSI z modelami Gemini 3.1 Pro oraz Gemini 3.7 Flash na ośmiu zadaniach z trzech różnych dziedzin. Każde porównanie prowadzono względem baseline’u o identycznych warunkach początkowych, ale ze stałą strategią poszukiwań.

Optymalizacja kodu statystycznego

Jedno z zadań polegało na napisaniu najszybszego możliwego programu do obliczeń statystycznych powszechnie stosowanych w genomice i finansach. Program wygenerowany przez Dream-RSI działał szybciej niż uznane biblioteki sklearn i glmnet na wszystkich sześciu testowych zbiorach danych. W przypadku Gemini 3.1 Pro średni czas wykonania spadł z 3587 do 2931 milisekund, a liczba prób zmniejszyła się z 550 do 317.

Dream-RSI wypadł też korzystniej na tle konkurencyjnego systemu SimpleTES, który potrzebował 51 200 uruchomień – w porównaniu do 317 prób Dream-RSI.

Zadania matematyczne i kernele GPU

Podobny wzorzec zaobserwowano przy optymalizacji matematycznej oraz pisaniu wydajnych kerneli GPU. W dwóch zadaniach związanych z GPU Dream-RSI osiągnął porównywalną wydajność, redukując liczbę uruchomień nawet 2,43-krotnie. W dwóch kolejnych dostarczył do 2,09 razy lepsze wyniki w ramach tego samego budżetu obliczeniowego.

Co ciekawe, wyuczona strategia początkowo zmniejszała liczbę prób, by następnie ją zwiększyć, gdy postęp się zatrzymywał – co zbiegało się z dalszą poprawą wyników.

Zbyt precyzyjne instrukcje mogą szkodzić

W analizie uzupełniającej badacze sprawdzili alternatywne wykorzystanie historii poszukiwań. Zamiast odtwarzać je w celu testowania strategii, skondensowali je w instrukcje wskazujące agentowi, gdzie ma szukać. W jednym z zadań GPU wersja z takimi wytycznymi wypadła gorzej niż ta bez nich.

Wniosek badaczy jest taki, że nadmiernie szczegółowe wskazówki mogą zbytnio zawężać przestrzeń poszukiwań, uniemożliwiając agentowi eksplorację szerszego wachlarza podejść. To istotna obserwacja w kontekście innych systemów, takich jak WikiSkill od Google Research, które przekształcają wcześniejsze sukcesy i porażki w gotowe instrukcje dla agenta.

Dream-RSI na tle innych rozwiązań

Temat rekurencyjnego samodoskonalenia przyciąga coraz więcej uwagi. Google DeepMind zaprezentował w 2025 roku AlphaEvolve, oparty na podobnej zasadzie – Gemini Flash generuje propozycje kodu, Gemini Pro je analizuje, a algorytm ewolucyjny wybiera najlepsze wersje. Dream-RSI działa o poziom wyżej, optymalizując samą strategię poszukiwań.

AutoTTS obrał pokrewną drogę, wykorzystując agenta kodującego do poszukiwania algorytmów w symulowanym środowisku. Algorytmy te decydują, kiedy model językowy powinien rozpocząć, rozwinąć lub porzucić ścieżki rozumowania. Uzyskane metody biją podejścia projektowane ręcznie, zużywając przy tym mniej mocy obliczeniowej.

Meta idzie jeszcze dalej z Hyperagents, pozwalając agentom przepisywać mechanizm kontrolujący sposób, w jaki się doskonalą. Wszystko to wpisuje się w szerszy kontekst – Dario Amodei, CEO Anthropic, ostrzegał niedawno przed tempem rozwoju badań nad AI, a postępy w dziedzinie rekurencyjnego samodoskonalenia są jednym z powodów tego niepokoju.

Badacze udostępnili kod oraz szczegóły techniczne na GitHubie. Dream-RSI pokazuje, że agent AI może uczyć się na własnych doświadczeniach bez ponoszenia kosztów kolejnych uruchomień – co w praktyce oznacza szybsze i tańsze poszukiwanie rozwiązań w złożonych przestrzeniach problemowych.

Źródło