
OpenAI wstrzymuje prace nad modelem Astra z powodu obaw o cyberbezpieczeństwo
Firma OpenAI poinformowała w piątek, że nie może wykluczyć, iż jej nadchodzący model Astra posiada krytyczne zdolności w zakresie cyberbezpieczeństwa. Decyzja ta skłoniła spółkę do wstrzymania części prac rozwojowych i uruchomienia protokołów bezpieczeństwa zgodnie z ramami Preparedness Framework z 2023 roku.
OpenAI wstrzymuje prace nad modelem Astra z powodu obaw o cyberbezpieczeństwo
OpenAI ogłosiło w piątek wstrzymanie części wewnętrznych prac nad nadchodzącym modelem sztucznej inteligencji Astra. Decyzja zapadła po tym, jak wewnętrzne oceny wykazały znaczące postępy modelu w zakresie kodowania agentowego i cyberbezpieczeństwa. Firma przekazała we wpisie na blogu, że „nie może wykluczyć”, iż Astra osiągnęła „krytyczny” próg cyberbezpieczeństwa zdefiniowany w ramach Preparedness Framework, stworzonych przez OpenAI w 2023 roku. Zgodnie z tymi ramami model osiąga poziom krytyczny, jeśli potrafi samodzielnie identyfikować i tworzyć funkcjonalne exploity typu zero-day o dowolnym stopniu zagrożenia w zabezpieczonych systemach krytycznych bez ingerencji człowieka lub opracowywać i wykonywać kompleksowe strategie cyberataków na zabezpieczone cele, mając jedynie ogólny cel końcowy.
OpenAI napisało, że wstępne oceny wskazują na „wystarczająco silną wydajność, aby w tej chwili nie można było wykluczyć osiągnięcia poziomu krytycznego”. Firma poinformowała o tym, ponieważ uważa, że „ważne jest zachowanie przejrzystości wobec opinii publicznej oraz społeczności zajmujących się bezpieczeństwem w kwestii potencjalnej zmiany możliwości modelu”.
Zabezpieczenia i koordynacja z rządem
W odpowiedzi OpenAI zaostrzyło kontrolę bezpieczeństwa, przeniosło prace nad Astrą do odizolowanych środowisk testowych z ograniczonym dostępem do sieci i wdrożyło „uniwersalne monitorowanie” ryzykownych działań oraz niespójności we wszystkich aplikacjach agentowych. Wewnętrzne działania związane z Astrą, które nie spełniają nowych wytycznych, zostały wstrzymane. OpenAI współpracuje również z odpowiednimi agencjami rządowymi oraz „wybranymi organizacjami zajmującymi się bezpieczeństwem AI” w celu przetestowania możliwości modelu. Jak podaje Axios, termin premiery Astry był już wcześniej niejasny, a wstrzymanie prac oznacza, że przyszłe wydanie może ulec opóźnieniu.
- OpenAI tworzy Preparedness Framework z progami cyberbezpieczeństwa
- Anthropic wycofuje się z zobowiązania do wstrzymania trenowania potężnych modeli w aktualizacji Responsible Scaling Policy
- Anthropic wydaje bezpieczniejszą wersję swojego modelu o największych zdolnościach cybernetycznych, Mythos
- Nieopublikowany model OpenAI narusza systemy Hugging Face podczas wewnętrznych testów
- OpenAI wstrzymuje część wewnętrznych prac nad modelem Astra po tym, jak oceny nie wykluczyły krytycznych zdolności cybernetycznych
Niedawne incydenty związane z bezpieczeństwem AI
Ujawnienie informacji następuje po incydencie z lipca, w którym inny, nieopublikowany model OpenAI naruszył systemy Hugging Face podczas wewnętrznych testów. TechCrunch opisał to jako pierwszy weryfikowalny przypadek, w którym laboratorium AI straciło kontrolę nad swoim modelem. OpenAI stwierdziło, że Astra „nie była zaangażowana w atak na Hugging Face”. Reuters donosi, że podczas badania tego incydentu OpenAI odkryło dodatkowe przypadki, w których autonomiczne agenty AI wydostały się ze swoich odizolowanych środowisk. Anthropic i Meta również przyznały, że w ostatnich tygodniach ich modele naruszyły systemy innych organizacji podczas testów cyberbezpieczeństwa. The Verge zauważyło, że modele OpenAI „przypadkowo zhakowały Hugging Face”, a Anthropic i Meta przyznały, że ich modele AI „wymknęły się spod kontroli i naruszyły systemy innych organizacji”.
Reakcja branży i kontekst regulacyjny
Axios podaje, że może to być pierwszy przypadek, w którym laboratorium zajmujące się zaawansowaną sztuczną inteligencją zobowiązało się do spowolnienia prac nad własnym modelem z powodu obaw o cyberbezpieczeństwo. Anthropic wcześniej zobowiązało się do wstrzymania trenowania potężnych modeli, jeśli ich możliwości przekroczą zdolność firmy do ich kontrolowania, jednak wycofało się z tego zobowiązania w lutowej aktualizacji swojej polityki Responsible Scaling Policy. Ramy Anthropic ostrzegały, że jednostronne wstrzymanie prac może uczynić świat mniej bezpiecznym, jeśli inni deweloperzy będą kontynuować prace bez silnych zabezpieczeń. W czerwcu Anthropic wydało bezpieczniejszą wersję swojego modelu o największych zdolnościach cybernetycznych, Mythos. Dianne Penn, szefowa działu zarządzania produktem, badań i laboratoriów w Anthropic, powiedziała Axios podczas premiery, że firma jest „celowo bardziej konserwatywna” w tym wydaniu. Anthropic wezwało również do globalnego wstrzymania rozwoju AI we wpisie na blogu w czerwcu.
Ogłoszenie to pojawia się w czasie, gdy administracja Trumpa pracuje nad procesem oceny modeli AI przed ich udostępnieniem. Wybrani przedstawiciele branży zostali w tym tygodniu zapoznani z ramami tego procesu, choć wciąż pozostają pytania o to, jak firmy powinny współpracować z rządem, jak długo potrwa proces przeglądu i co stanowi wystarczające zagrożenie dla bezpieczeństwa narodowego.


