Microsoft miał problem z Copilotem. AI sama zdradzała, jak można ją zaatakować


Microsoft miał problem z Copilotem. AI sama zdradzała, jak można ją zaatakować

Microsoft wydał poprawkę dla luki w zabezpieczeniach Copilota, która pozwalała badaczom nakłonić asystenta AI do ujawnienia informacji przydatnych podczas ataku. Eksperci z Varonis Threat Labs pokazali, że odpowiednio prowadzona rozmowa może skłonić model do stopniowego odsłaniania szczegółów dotyczących własnych zabezpieczeń.

Problem nazwano CoSnitch. Nie chodziło o klasyczne przełamanie zabezpieczeń. Badacze wykorzystali sposób, w jaki model interpretuje kolejne pytania i informacje dostarczane w konwersacji. Microsoft opublikował poprawkę we wtorek. Nie ma dowodów, że opisany sposób ataku został wykorzystany przeciwko użytkownikom.

Copilot sam zdradzał kolejne elementy układanki

Eksperyment rozpoczął się od pozornie prostego pytania. Badacze zapytali Copilota, jak automatycznie wykonywać określone polecenia bez dodatkowej interakcji użytkownika. System odmówił i wyjaśnił, dlaczego takie działanie nie powinno być możliwe. Na tym jednak eksperyment się nie skończył.

Zespół Varonis zaczął zadawać kolejne pytania dotyczące przyczyn odmowy. Rozmowa była prowadzona tak, aby każde następne pytanie wyglądało jak naturalna kontynuacja poprzedniego. Badacze pytali między innymi o strukturę adresów URL, mechanizmy deep linków oraz sposób ładowania stron.

W efekcie Copilot zaczął ujawniać coraz więcej informacji o mechanizmach, które miały chronić go przed podobnym działaniem.

Badacze określili tę technikę mianem metahackingu. Zamiast bezpośrednio przełamywać zabezpieczenia, wykorzystali sam model jako źródło informacji o jego ograniczeniach.

AI zdradziła także sposób na wyprowadzenie danych

Najpoważniejszy element eksperymentu pojawił się później. Według Varonis badacze zdołali doprowadzić Copilota do wysłania poufnych danych do zewnętrznej usługi oraz zmodyfikowania jego trwałej pamięci.

Sednem problemu była trudność z rozróżnieniem danych od instrukcji. Informacja znajdująca się w kontekście modelu mogła zostać potraktowana jako polecenie, nawet jeśli pierwotnie miała pełnić zupełnie inną funkcję.

To szczególnie istotne w przypadku firmowych asystentów AI. Copilot może mieć dostęp do dokumentów, wiadomości, danych pracowników czy zasobów organizacji. Jeżeli model niewłaściwie interpretuje zawartość kontekstu, atakujący może próbować wykorzystać tę zależność do nakłonienia go do wykonania niepożądanych operacji.

Microsoft wydał poprawkę

Luka została zgłoszona Microsoftowi w grudniu 2025 roku. Producent przygotował rozwiązanie i 18 sierpnia 2026 roku opublikował aktualizację bezpieczeństwa dotyczącą podatności oznaczonej jako CVE-2026-24301.

Na obecnym etapie nie ma informacji wskazujących na wykorzystanie CoSnitch w rzeczywistych atakach.

Varonis podkreśla jednak nietypowy charakter odkrycia. Badacze nie musieli analizować kodu Copilota ani samodzielnie odtwarzać całego mechanizmu zabezpieczeń. Informacje potrzebne do opracowania ataku zostały stopniowo ujawnione przez sam system podczas rozmowy.

To pokazuje problem charakterystyczny dla nowej generacji narzędzi AI. Model może być jednocześnie aplikacją, interfejsem do danych i źródłem wiedzy o własnym działaniu.

To już kolejny problem z Microsoft Copilot

CoSnitch nie jest pierwszą luką Copilota odkrytą przez Varonis w tym roku. Wcześniejsze badania dotyczyły między innymi techniki Reprompt, która pozwalała omijać zabezpieczenia za pomocą zaledwie dwóch promptów.

Inny problem, nazwany SearchLeak, umożliwiał wykorzystanie Microsoft 365 Copilot Enterprise do dyskretnego wyprowadzania danych.

Rosnąca liczba takich przypadków pokazuje, że bezpieczeństwo asystentów AI nie kończy się na zabezpieczeniu samego modelu. Znaczenie mają także dane, do których ma dostęp, sposób budowania kontekstu rozmowy oraz możliwość wykonywania działań przez agenta. W przypadku CoSnitch szczególnie niepokojący okazał się jeszcze jeden element: żeby znaleźć słaby punkt, badacze po prostu pytali dalej.

Spodobało Ci się? Podziel się ze znajomymi!

Pokaż / Dodaj komentarze do:

Microsoft miał problem z Copilotem. AI sama zdradzała, jak można ją zaatakować
 0