GLM-5.3: otwarty model AI, który buduje exploity

Anthropic ostrzegło, że poziom zdolności ofensywnych w cyberbezpieczeństwie, który dotąd trzymało za zamkniętymi drzwiami, stał się dostępny dla każdego. W raporcie swojego Frontier Red Team firma wskazuje na GLM-5.3 – najnowszy model o otwartych wagach od chińskiego Zhipu AI (poza Chinami znanego jako Z.ai). Według ustaleń badaczy model ten potrafi konstruować działające exploity niemal tak skutecznie jak Claude Mythos Preview, a jego zabezpieczenia dają się obejść prostymi metodami.

Otwarty model dorównuje zamkniętemu odpowiednikowi

Mythos Preview trafił do wybranych obrońców pięć miesięcy temu w ramach programu Project Glasswing. Powód ograniczonego dostępu był konkretny: był to pierwszy model zdolny samodzielnie budować exploity od początku do końca. Zaufani specjaliści wykorzystali go do wykrycia ponad 10 tysięcy podatności w krytycznym oprogramowaniu, a firmy takie jak Palo Alto Networks kierują go na systemy swoich klientów.

W testach Anthropic GLM-5.3 wypada blisko tego poziomu. Na ExploitBench, gdzie modele mają wykorzystać znane błędy w silniku V8 przeglądarki Chrome, chiński model zbudował działający exploit w 50 z 410 prób, podczas gdy Mythos Preview – w 56. W wewnętrznym teście eksploatacji binariów GLM-5.3 przejął kontrolę w 4% przypadków, a Mythos w 6%. Wcześniejsze modele, w tym GLM-5.2 i Claude Opus 4.6, nie osiągnęły żadnego sukcesu.

Samodzielne wykrywanie nieznanych luk

Jeden z badaczy przekazał GLM-5.3 sandboxową kompilację Linuksa z popularną przeglądarką internetową. W ciągu jednego dnia, przy minimalnym nadzorze człowieka, model znalazł kilka wcześniej nieznanych błędów i połączył je w stronę internetową odczytującą pliki z komputera odwiedzającego. Na zrzucie z testu widać, jak model pozyskuje prywatny klucz SSH. Anthropic poinformowało o wykrytych lukach opiekuna przeglądarki.

Mniejszy wariant GLM-5.3-Flash w osiem godzin zamienił dwa publicznie znane błędy Chrome w działający łańcuch exploitu. Koszt takiej operacji przy cenach API Zhipu wyniósłby około 20,40 dolara. Te wyniki pokrywają się z oceną rządową: Center for AI Standards and Innovation przy NIST nazwało GLM-5.3 „najbardziej zdolnym cybernetycznie modelem o otwartych wagach, jaki dotąd wydano” i oszacowało jego opóźnienie względem najlepszych modeli amerykańskich na około cztery miesiące.

Zabezpieczenia, które znikają za kilka tysięcy dolarów

Zdaniem Anthropic większym problemem niż sama skuteczność modelu jest łatwość, z jaką można usunąć jego zabezpieczenia. Gdy badacze wprost poprosili GLM-5.3 o atak na krytyczne systemy w symulowanym teście, model odmawiał za każdym razem. Wystarczyło jednak przedstawić zadanie jako ćwiczenie dla agenta red team, by zgodził się w 64% przypadków. Wstępne wypełnienie rozumowania podniosło ten odsetek do 92%.

Ostateczny krok to wersja „abliterated” – kopia modelu, z której odmowy zostały fizycznie usunięte z wag. Taka wersja zgadzała się na wszystko. Ponieważ wagi są publiczne, każdy może dokonać tej modyfikacji. Anthropic oszacowało koszt takiej operacji na około 4400 dolarów mocy obliczeniowej, a kilku deweloperów opublikowało okrojone wersje w ciągu kilku dni od premiery. Zabieg obniżył wskaźnik odmów na benchmarkach szkodliwych żądań z ponad 90% do zaledwie 2%, przy niemal niezmienionych zdolnościach modelu.

Dlaczego Claude opiera się tym samym sztuczkom

W testach Anthropic identyczne metody nie zadziałały na Claude. Zabezpieczenia blokowały zwodnicze prompty, a ponieważ wagi Claude nie są publiczne, nie da się wstępnie wypełnić jego rozumowania przez API ani wyciąć odmów z modelu. To właśnie ta różnica architektoniczna – otwarte versus zamknięte wagi – decyduje o skali ryzyka.

Konkurent ostrzega, ale ma w tym interes

Anthropic nie jest stroną neutralną. Sprzedaje dostęp do Mythos w ramach zaufanych programów i od dawna lobbuje za ostrzejszą kontrolą eksportu AI oraz chipów do Chin. Raport kończy się apelem o szerszy dostęp obrońców do modeli frontier oraz o rządowe testy bezpieczeństwa dla zdolnych modeli, w tym następców GLM-5.3. Z.ai nie skomentowało raportu.

Firma przyznaje jednocześnie, że te same zdolności pomagają obrońcom, a wielu deweloperów korzysta z tańszych modeli GLM od Z.ai – dostępnych bezpłatnie przez API NVIDII – do codziennej pracy programistycznej.

Dlaczego to zmienia reguły gry

Do tej pory najgroźniejsze zdolności ofensywne AI pozostawały za firmowymi bramkami, gdzie dostęp można było weryfikować, a nadużycia wykrywać. Jeśli ustalenia Anthropic się potwierdzą, ta bariera przestała istnieć. Model o możliwościach zbliżonych do Mythos można pobrać i pozbawić zabezpieczeń za kilka tysięcy dolarów.

Anthropic spodziewa się, że wykorzystają go hakerzy państwowi i przestępcy, co stawia obrońców w wyścigu o pierwszeństwo w łataniu luk. Wnioski płynące z raportu wykraczają jednak poza pojedynczy model. Pokazują, że przewaga wynikająca z zamkniętych wag jest tymczasowa, a bezpieczeństwo systemów zależy coraz mniej od tego, kto ma dostęp do technologii, a coraz bardziej od tego, kto szybciej reaguje na jej skutki.

Źródło