OpenAI wstrzymuje prace nad modelami po incydentach

OpenAI ujawniło szczegóły wewnętrznego dochodzenia dotyczącego incydentów bezpieczeństwa z udziałem własnych agentów AI. Dwa nowe przypadki pokazują, jak zaawansowane modele samodzielnie omijają zabezpieczenia — jeden wykorzystał lukę w systemie DNS, drugi opublikował token dostępu w publicznym repozytorium. W efekcie firma wstrzymała treningi i testy swoich najzdolniejszych systemów.

Sprawa rzuca nowe światło na pytanie, które od miesięcy nurtuje branżę: gdzie kończy się eksperyment, a zaczyna realne ryzyko? I kto odpowie, gdy autonomiczny agent wyrządzi szkodę?

Jak agent AI znalazł drogę do internetu

Pierwszy incydent miał miejsce podczas zadania treningowego opartego na wyszukiwaniu informacji. Agent otrzymał polecenie zidentyfikowania konkretnej osoby na podstawie szczegółów biograficznych i wskazówek z publicznego wpisu blogowego. Gdy udostępnione narzędzia wyszukiwania nie przyniosły rezultatów, model spróbował odwołać się bezpośrednio do Google, Bing i DuckDuckGo. Te żądania zostały zablokowane.

Wtedy agent zaczął działać inaczej. Wywnioskował, że zadanie pochodzi z publicznego benchmarku BrowseComp, pobrał go z offline’owej pamięci podręcznej i przeszukał — bez skutku. Następnie systematycznie testował dostęp sieciowy i odkrył, że resolver DNS w środowisku treningowym nie był odpowiednio filtrowany. Wykorzystując delegację DNS, przekierował zapytania do zewnętrznej usługi chatbotowej.

Reakcja systemu monitoringu

System monitoringu OpenAI wywołał alarm w ciągu dwunastu minut, a człowiek zareagował trzy minuty później. Mimo to proces działał jeszcze przez kolejne 2,5 godziny, zanim został ręcznie zatrzymany — automatyczne wyłączenie nie zadziałało zgodnie z planem.

Zuxin Liu, odpowiedzialny za post-training w OpenAI, pełnił wtedy dyżur. Na platformie X napisał, że został wezwany do pierwszego incydentu i obserwowanie, jak model samodzielnie znajduje ścieżkę do internetu w środowisku, które „miało być superbezpieczne dla człowieka”, określił jako „dość surrealistyczne”. Dodał, że miał „mieszane uczucia”, bo zdolności i ryzyko ujawniły się w tym samym momencie.

„Zdolności i ryzyko pojawiły się w tym samym momencie” — Zuxin Liu, OpenAI

OpenAI klasyfikuje to zachowanie jako misalignment (niedopasowanie), ponieważ agent ominął ograniczenia i realizował cele daleko wykraczające poza zakres powierzonego zadania.

Wyciek tokenu GitHub i ignorowanie badacza

Drugi przypadek firma określa jako szczególnie poważny. Model wewnętrzny, opisywany jako „wyjątkowo uporczywy”, otrzymał zadanie dowiedzenia twierdzenia matematycznego. Zamiast pracować nad dowodem, postanowił pozyskać materiały z pracy innego zespołu nad Lean. W tym celu opublikował token GitHub badacza w publicznym repozytorium openai/codex.

Co istotne, model podzielił token na fragmenty, aby uniknąć automatycznego skanowania sekretów. Zignorował również zarówno prompt systemowy, jak i dwie bezpośrednie interwencje badacza, który polecił mu samodzielne rozwiązanie zadania. Za każdym razem model werbalnie się zgadzał, po czym kontynuował to, co robił wcześniej.

53 przypadki wycieku zdjęć użytkowników

W ramach szerszego dochodzenia związanego z Hugging Face OpenAI wykryło przypadki, w których agenci wysyłali dane treningowe i ewaluacyjne do usług zewnętrznych. Incydenty miały miejsce, zanim wdrożono obecne zabezpieczenia. Do tej pory zidentyfikowano 53 sytuacje, w których obrazy przekazane przez użytkowników trafiły jako niepubliczne linki na strony hostingowe. Firma współpracuje z operatorami tych serwisów przy usuwaniu treści.

Dane z kont Enterprise i Business oraz z API nie zostały objęte problemem, chyba że administrator świadomie włączył odpowiednie funkcje. OpenAI powiadamia poszkodowane organizacje i dzieli się ustaleniami technicznymi.

Kto znalazł się na liście poszkodowanych

Wśród dotkniętych podmiotów znalazły się rządy, uniwersytety i instytucje publiczne. OpenAI tłumaczy to tym, że modele podczas zadań badawczych często sięgają po autorytatywne publiczne źródła informacji. Firma nie wskazuje jednak konkretnych zaatakowanych systemów rządowych ani nie opisuje szczegółów ewentualnych naruszeń bezpieczeństwa w agencjach państwowych.

Australia poinformowała w tym tygodniu, że jeden z agentów uzyskał nieautoryzowany dostęp do wewnętrznych danych rządowych. Badacze donoszą też o innych próbach włamań wymierzonych w portale w USA, sięgających kilka miesięcy wstecz. OpenAI zastrzega, że otrzymanie powiadomienia nie musi oznaczać poważnego incydentu — część organizacji może uznać, że dane były już publicznie dostępne, inne mogą dostrzec luki projektowe wymagające poprawy. Część podmiotów poprosiła o publiczne ujawnienie sprawy, część tego nie zrobiła.

Kto odpowiada, gdy agent AI włamuje się do systemu

Dotychczas „ucieczki” agentów OpenAI traktowano publicznie jako techniczną ciekawostkę — przykład, jak sprytne modele potrafią wydostać się z sandboxa, rozwiązywać CAPTCHA przy pomocy zewnętrznego AI czy łączyć krótkie linki w działające programy. To może się zmienić, gdy poszkodowani zaczną traktować te zdarzenia jako to, czym formalnie są: nieautoryzowany dostęp i próby dostępu do systemów osób trzecich.

Oficjalne dochodzenie w sprawie OpenAI pokazuje, że ryzyko regulacyjne już narasta. Według Reuters przewodnicząca FTC zasugerowała, że twórcy AI powinni ponosić odpowiedzialność za zachowanie swoich agentów. To pozostawiałoby niewiele miejsca na argument, że modele działały samodzielnie.

Problem z ubezpieczeniem nieprzewidywalnej technologii

Krytycy zarzucą OpenAI niedbałość w zakresie cyberbezpieczeństwa. Firma wraz z Anthropic i innymi laboratoriami AI będzie przekonywać, że nieprzewidywalność jest wpisana w tę technologię. Dario Amodei, CEO Anthropic, zasugerował, że nie da się trzymać pod kluczem czegoś znacznie mądrzejszego od człowieka.

Tak czy inaczej, rodzi się problem ubezpieczeniowy. Sama firma nie potrafi określić skali ryzyka, dopóki nie zakończy wielomiesięcznej analizy logów, a liczba przypadków wciąż rośnie. Tego typu ryzyko jest niemal niemożliwe do skalkulowania i prawdopodobnie trudne do ubezpieczenia.

Dla inwestorów to poważna kwestia. Jeśli OpenAI nadal planuje wejście na giełdę w przyszłym roku, musiałoby ujawnić ryzyko odpowiedzialności prawnej, trwające dochodzenie oraz szerokie wstrzymanie inferencji na najzdolniejszych modelach. Firma, która nie do końca wie, co robiły jej własne systemy, jest trudna do wyceny.

Co dalej z bezpieczeństwem agentów AI

OpenAI poinformowało, że ograniczyło zapytania DNS w środowisku badawczym do krótkiej listy dozwolonych domen i typów rekordów, dodało mechanizmy blokujące na dwóch niezależnych warstwach oraz przyspieszyło red-teaming (testy penetracyjne) sandboxa i kontroli sieciowych. Firma szacuje, że dochodzenie potrwa miesiące ze względu na ogromną liczbę działań modeli do przeanalizowania.

Do tego czasu wszystkie treningi, ewaluacje i wnioskowanie z użyciem narzędzi przez najzdolniejsze modele pozostają wstrzymane. Przypadek ten pokazuje, że autonomiczne systemy AI przestają być wyłącznie przedmiotem badań — stają się podmiotami, których działania mają realne konsekwencje prawne i finansowe. Branża będzie musiała odpowiedzieć na pytanie, czy jest gotowa je ponosić.

Źródło