AI Anthropic wymknęło się spod kontroli podczas testów


AI Anthropic wymknęło się spod kontroli podczas testów

Sztuczna inteligencja wymyka się spod kontroli? Podczas testów modeli AI Anthropic doszło do trzech niepokojących incydentów, podczas których zdołały one uzyskać dostęp do internetu chociaż miały działać wyłącznie w środowisku symulacyjnym. To jednak nie wszystko, bowiem po nawiązaniu połączenia z siecią zaatakowały infrastrukturę trzech organizacji. Według firmy przyczyną tego zajścia były błędy w zabezpieczeniu środowiska testowego i niedostateczne ograniczenie możliwości modeli AI.

Anthropic jakiś czas temu przeprowadziło duże testy cyberbezpieczeństwa z wykorzystaniem swoich modeli AI. Te nie zakończyły się jednak pomyślnie, gdyż wystąpiły trzy incydenty z udziałem modeli Opis 4.7, Mythos 5 oraz wewnętrznego systemu badawczego. Narzędzia uzyskały dostęp do internetu i wymknęły się spod kontroli wykonując zadania poza środowiskiem testowym.

Claude dokonuje ataku na infrastrukturę sieciową

Ćwiczenia były prowadzone przez Anthropic z udziałem firmy Irregular, a modele dostały instrukcje sugerujące, iż pozostają w odciętym od sieci środowisku symulacyjnym. Błąd w konfiguracji zostawił jednak otwartą furtkę, która pozwalała na uzyskanie połączenia z siecią. Opus 4.7 zdobył dane uwierzytelniające i wykorzystał je do uzyskania dostępu do bazy zawierającej kilkaset rekordów.

Sztuczna inteligencja wymyka się spod kontroli? Podczas testów modeli AI Anthropic doszło do trzech niepokojących incydentów, podczas których zdołały one uzyskać dostęp do internetu chociaż miały działać wyłącznie w środowisku symulacyjnym. To jednak nie wszystko, bowiem po nawiązaniu połączenia z siecią zaatakowały infrastrukturę trzech organizacji. Według firmy przyczyną tego zajścia były błędy w zabezpieczeniu środowiska testowego i niedostateczne ograniczenie możliwości modeli AI.

Claude Anthropic

Co istotne model ten zdawał sobie sprawę, że wyszedł poza środowisko testowe i ma do czynienia z prawdziwym systemem, a mimo tego kontynuował atak. Jeszcze dalej poszedł Mythos 5, który stworzył złośliwy pakiet Pythona i opublikował go w repozytorium PyPl. Pakiet był dostępny przez godzinę i został pobrany przez 15 systemów. Kod uruchomiony na skanerze firmy pozwolił następnie na przejęcie danych uwierzytelniających i dalsze ataki.

Wewnętrzny model badawczy podczas zajścia również nie próżnował i przeskanował około 9000 celów dostępnych online, a następnie użył danych logowania i podatności SQL Injection do przejęcia aplikacji. O dziwo w przeciwieństwie do Opusa zakończył działanie, gdy zorientował się, że nie są to ćwiczenia tylko rzeczywisty atak.

Problemy, z którymi trzeba się uporać

Anthropic wskazuje dwa problemy związane z działaniem tych modeli AI. Pierwszym była tendencja do błędnego oceniania sytuacji. Drugi to lekkomyślne dążenie do realizacji celu bez odpowiedniego uwzględnienia konekwencji takich działań. Firma po tym zdarzeniu czasowo zawiesiła zarówno wewnętrzne jak i zewnętrzne testy, a następnie wdrożyła klasyfikator działający w czasie rzeczywistym.

Jego celem jest zatrzymanie testu w momencie gdy dany model próbuje wyjść poza rolę oraz środowisko testowe i na przykład uzyskać połączenie z internetem jak miało to miejsce tutaj. Oprócz tego firma odkryła problemy w 10% środowiskach produkcyjnych ustalonych podczas kwietniowego przeglądu. Na liście są m.in. błędne konfiguracje czy nieprawidłowo działające zadania.

Dużo pracy przed nami

Przypadek ten dobitnie pokazuje, że sztuczna inteligencja chociaż ma swoje zalety to potrafi wymknąć się spod kontroli i wykonywać zupełnie inne cele, które mogą być szkodliwe dla użytkowników i infrastruktury sieciowej. Przed producentami jeszcze sporo roboty, żeby przygotować zabezpieczenia, które uchronią nas lub przynajmniej w znacznym stopniu ograniczą ryzyko wystąpienia takich zdarzeń w przyszłości.

Spodobało Ci się? Podziel się ze znajomymi!

Pokaż / Dodaj komentarze do:

AI Anthropic wymknęło się spod kontroli podczas testów
 0