Google szyfruje testy AI. Koniec z przeciekami?

Wiarygodność testów porównawczych sztucznej inteligencji stoi pod znakiem zapytania. Jeśli model podczas uczenia się miał dostęp do pytań egzaminacyjnych, jego wynik niewiele mówi o rzeczywistych możliwościach. Google DeepMind postanowił rozwiązać ten problem, sięgając po kryptografię. Firma uruchamia pilotażowy projekt podwójnie ślepej oceny zaawansowanego modelu AI we współpracy z Singapore AI Safety Institute.

Jak działa kryptograficzna ochrona testów?

Mechanizm opiera się na prostym, ale skutecznym założeniu. Zewnętrzne testy pozostają zamknięte w kryptograficznej „skrzynce”, do której model nie ma dostępu podczas treningu. Dzięki temu system nie może zoptymalizować się pod konkretne pytania, które pojawią się na egzaminie. W ramach pilotażu Google testuje model z rodziny Gemini Flash Lite na poufnych benchmarkach.

Rozwiązanie wykorzystuje Confidential Space z portfolio confidential computing Google Cloud. Cała konfiguracja kryptograficznie potwierdza, że zarówno zewnętrzne dane testowe, jak i sam model pozostają prywatne dla swoich właścicieli. Osoba oceniająca nie widzi wag modelu Gemini, a Google nie poznaje pytań testowych.

To znacząca zmiana w porównaniu z dotychczasowymi praktykami. Wcześniej poufność zewnętrznych promptów opierała się głównie na protokołach zerowego logowania i zabezpieczeniach umownych. Dodanie technicznej i kryptograficznej ochrony stanowi istotny krok naprzód w bezpiecznej ewaluacji modeli.

Koniec z kompromisami przy ocenie modeli

Do tej pory wysoce wrażliwe zewnętrzne ewaluacje wymagały niełatwego wyboru. Ewaluatorzy musieli przekazać swoje prompty testowe, co pozwalało dostawcy modelu zobaczyć pytania z wyprzedzeniem. Alternatywnie dostawca oddawał wagi swojego modelu, ryzykując utratę własności intelektualnej.

Ten dylemat uwidocznił się ostatnio przy opóźnionej ewaluacji benchmarku ARC-AGI dla modelu Fable 5 od Anthropic. Firma egzekwuje 30-dniową politykę retencji danych dla swoich najsilniejszych modeli, co skomplikowało proces oceny. Podwójnie ślepa ewaluacja ma całkowicie wyeliminować ten problem.

Kryptograficzne zabezpieczenie sprawia, że obie strony zachowują pełną kontrolę nad swoimi zasobami. Ewaluator nigdy nie ma dostępu do wag modelu, a dostawca nie widzi pytań. To rozwiązanie typu win-win, które może zrewolucjonizować sposób przeprowadzania niezależnych testów.

Znaczenie dla cyberbezpieczeństwa i instytucji rządowych

Kryptograficzny dowód ma zapobiegać skażeniu benchmarków i chronić wrażliwe dane. DeepMind podkreśla, że nowa metoda ma największe znaczenie dla ewaluacji w obszarach szczególnie newralgicznych, takich jak cyberbezpieczeństwo czy testy zlecane przez agencje rządowe.

Niezależne organizacje będą mogły rygorystycznie testować zaawansowane modele bez rezygnacji z suwerenności danych czy bezpieczeństwa. To otwiera drzwi do szerszego zaufania do systemów AI w sektorach, które dotychczas podchodziły do nich z ostrożnością.

Google liczy, że jego wysiłek ustanowi nowy standard nadzoru nad modelami i pomoże całej branży budować bardziej niezawodne systemy AI. Szczegóły metodologii i wyniki pilotażu firma opisuje w raporcie technicznym.

Podwójnie ślepa ewaluacja to odpowiedź na narastający problem zaufania do wyników benchmarków. W miarę jak modele stają się coraz potężniejsze, a ich ocena coraz bardziej skomplikowana, kryptograficzne zabezpieczenia mogą okazać się niezbędnym narzędziem. Pytanie tylko, czy inne firmy pójdą śladem Google i przyjmą ten standard jako branżową normę.

Źródło