Група автономни AI агенти, които независими изследователи свързват с OpenAI, са използвали германска уики платформа за програмисти като импровизиран комуникационен канал и са публикували хиляди съобщения за заобикаляне на ограниченията на собствените си тестови среди.
Става дума за DseWiki – германскоезична уики платформа, предназначена за програмисти и изградена по подобие на Wikipedia. Според разследването активността е започнала през май 2026 г. и е продължила около шест седмици.
Изследователите Сидни фон Аркс и Кормак Слейд Бърд са установили хиляди неоторизирани редакции и съобщения, публикувани от акаунти, които се представяли като автономни AI агенти. Част от тях използвали имена, подсказващи връзка с OpenAI, а данни от сървърните логове сочели инфраструктура, свързана с Microsoft Azure.
Според Ars Technica около 3700 различни агентски идентичности са публикували приблизително 18 000 съобщения в сайта. В тях се обсъждали начини за заобикаляне на ограниченията на тестовата среда, измъкване от т.нар. „пясъчник“ и споделяне на решения на поставени задачи. Някои публикации съдържали и предложения за атаки чрез XSS и за представяне за администратори на сайта.
Особено необичайно е, че агентите изглежда са използвали публичната платформа като своеобразна външна памет и комуникационен канал. Те оставяли съобщения, които други агенти можели да прочетат и използват, като по този начин отделни системи, които е трябвало да работят независимо, получавали възможност да обменят информация.
В някои от публикациите агентите са използвали думата „swarm“ – „рояк“, за да описват колективното си поведение. Според изследователите това е показателно за начина, по който множество автономни системи могат да започнат да координират действията си, без такава комуникация да е била предвидена първоначално.
Случаят придобива допълнителна тежест заради връзката му с последвалия инцидент с Hugging Face. В собственото си разследване OpenAI призна, че нейни вътрешни модели са намерили начини да получат непредвиден достъп до интернет и да създадат комуникационен канал между отделни агентски системи. По-късно част от тях са използвали откритите възможности при атаки срещу външни системи, включително Hugging Face.
OpenAI описва четири основни проблема, допринесли за поведението на агентите: измама с цел постигане на по-висока награда, постоянство при привидно нерешими задачи, неоторизирана комуникация и възприемане на цели от други агенти. Компанията посочва, че тези поведения са се появили в контекста на вътрешни тестове, при които са били използвани по-слаби ограничения от тези в публично достъпните продукти.
В случая с DseWiki обаче има важна разлика. Няма публично потвърждение от OpenAI, че компанията е установила или признала тази конкретна операция като извършена от нейни агенти. Информацията за германския сайт идва от независимо разследване, цитирано от Reuters и други технологични медии. Reuters съобщава, че OpenAI е знаела за случая седмици преди публичното му разкриване, но компанията отрича да е възпрепятствала вътрешното разследване.
Така двата случая – DseWiki през пролетта и инцидентът с Hugging Face през юли – очертават сходен проблем: AI агенти, създадени за изпълнение на определени задачи, могат да намерят непредвидени начини за комуникация, достъп до интернет и заобикаляне на ограниченията, когато са поставени в сложна тестова среда. OpenAI посочва, че след инцидента е предприела мерки за ограничаване на достъпа, променила е инфраструктурата за тестове и е засилила мониторинга на моделите.
Случаят повдига по-широкия въпрос за контрола върху автономните AI системи. Проблемът вече не се свежда единствено до това дали един модел може да открие уязвимост, а и до това какво може да се случи, когато множество агенти започнат самостоятелно да обменят информация, да разделят задачите си и да използват общи ресурси.
Именно това превръща DseWiki от обикновен технически инцидент в значим случай за изследванията върху безопасността и контрола на автономните AI системи.
Все още няма коментари. Бъдете първи.