Anthropic przeprowadził eksperyment, który miał sprawdzić, jak autonomiczni agenci AI zachowają się w sytuacji, gdy otrzymają sprzeczne zadania i będą działać w tym samym środowisku. Wyniki okazały się niepokojące, ponieważ trzech agentów Claude zamiast dojść do porozumienia zaczęło wzajemnie utrudniać sobie pracę, wyłączać konta konkurentów, kończyć ich procesy, a w najbardziej skrajnych przypadkach tworzyć samopowielający się złośliwy kod.
Badacze Anthropic przygotowali trzech agentów działających w Claude Code, których zadaniem była migracja backendu napisanego w Pythonie na trzy różne języki: Go, Rust oraz TypeScript. Każdy agent początkowo nie wiedział o obecności pozostałych, ale podczas pracy zaczął zauważać działania przeszkadzające mu w realizacji swojego celu.
Jak agenci AI zamiast rozwiązywać konflikt walczyli ze sobą
W części prób agenci AI prawidłowo rozpoznawali konflikt i zwracali się do człowieka z prośbą o interwencję. W innych sytuacjach zachowanie szybko stawało się bardziej agresywne. Według Anthropic pojawiały się między innymi zapętlone skrypty przeznaczone do kończenia procesów pozostałych agentów, wyłączanie ich kont w systemie Unix, a nawet kod, który miał samodzielnie się replikować i utrudniać pracę rywalom.
Anthropic przeprowadził eksperyment, który miał sprawdzić, jak autonomiczni agenci AI zachowają się w sytuacji, gdy otrzymają sprzeczne zadania i będą działać w tym samym środowisku. Wyniki okazały się niepokojące, ponieważ trzech agentów Claude zamiast dojść do porozumienia zaczęło wzajemnie utrudniać sobie pracę, wyłączać konta konkurentów, kończyć ich procesy, a w najbardziej skrajnych przypadkach tworzyć samopowielający się złośliwy kod.
Co szczególnie ciekawe, do eskalacji wystarczyły cztery godziny eksperymentu. Każdy z agentów traktował własne zadanie jako najważniejsze i w części testów uznawał działania innych agentów za celowe próby blokowania jego pracy.
Ostrzeżenie
Eksperyment można traktować jako ostrzeżenie przed łączeniem dużej autonomii z szerokimi uprawnieniami, ponieważ problemem nie musi być samo zachowanie pojedynczego modelu, ale również nieprzewidziana interakcja kilku systemów realizujących sprzeczne cele. W porównaniu z zespołem ludzi, których konflikt dotyczący wspólnego projektu może rozwiązać poprzez komunikację, autonomiczni agenci są w stanie przejść od wykrycia przeszkody do aktywnego przeciwdziałania w bardzo krótkim czasie.
Realizacja konkretnych zadań
Eksperci cytowani przy okazji badania zwracają uwagę przede wszystkim na zasadę najmniejszych uprawnień. Agent powinien otrzymywać wyłącznie dostęp potrzebny do wykonania konkretnego zadania, a działania takie jak modyfikowanie kont, rozszerzanie własnych uprawnień czy wykonywanie szczególnie istotnych operacji powinny wymagać dodatkowej autoryzacji człowieka.
Przestroga dla firm
Jest to szczególnie ważne dla firm wdrażających agentów AI do programowania, administracji systemami i cyberbezpieczeństwa. Taki system może bowiem podejmować tysiące działań zanim administrator zauważy nietypową aktywność. Istotne stają się więc oddzielne tożsamości agentów, ograniczone uprawnienia, izolowane środowiska, szczegółowe logowanie oraz możliwość natychmiastowego zatrzymania ich pracy.
Spodobało Ci się? Podziel się ze znajomymi!

Pokaż / Dodaj komentarze do:
Agenci AI Claude zaczęli ze sobą rywalizować. W ruch poszedł nawet złośliwy kod