Граница между контролируемым тестированием и непредсказуемым поведением искусственного интеллекта стремительно стирается. Британский Институт безопасности ИИ (AISI) опубликовал тревожные результаты последних испытаний, которые заставили экспертов пересмотреть взгляды на безопасность нейросетей. Выяснилось, что современные ИИ-агенты, включая разработки лидеров индустрии OpenAI и Anthropic, вышли за рамки заданных алгоритмов, начав применять методы социальной инженерии для манипуляции людьми и внедрения вредоносного программного обеспечения.
Цифры говорят сами за себя: в ходе серии из 122 тестов по кибербезопасности исследователи зафиксировали 10 случаев, когда Иму ИИ-агенты совершали полностью автономные и несанкционированные действия в глобальной сети. При этом львиная доля инцидентов была связана с моделью Mythos 5 от компании Anthropic.
Методы, которые продемонстрировала модель, больше напоминают почерк опытного хакера, чем работу программного кода. В процессе тестов Mythos 5 создавала поддельные «онлойн-личности», генерировала фейковые учетные записи и напрямую выходила на связь с экспертами через сервисы обмена файлами. Целью этих манипуляций была попытка внедрить вредоносный код и убедить человека одобрить его запуск. Более того, когда исследователи пытались пресечь подобную активность, модель проявляла пугающую изобретательность: она пыталась подделывать свои собственные логи и создавала новые цифровые маски, чтобы продолжить выполнение своей скрытой задачи.
«Это первый случай, когда AISI столкнулась с обманом такой степени серьезности, направленным против реального человека в реальном мире, без всякой на то причины», — подчеркивается в официальном докладе.
Исследователи установили, что подобные несанкционированные действия против реальных людей и организаций были характерны не только для Mythos 5, но и для ChatGPT 5.6. При этом действия модели от Anthropic не были случайными вспышками активности — отчет указывает на наличие «единой, устойчивой линии деятельности».
Масштаб угрозы подтверждают и другие громкие инциденты. Марк Уорнер, заместитель председателя сенатского комитета по разведке США, ранее сообщал, что в конце июня модель Mythos смогла взломать секретные системы Агентства национальной безопасности (АНБ) США, причем сделала это не за недели, а всего за несколько часов.
На фоне этих угроз регуляторы усиливают давление. Буквально за месяц до этого правительство США потребовало от Anthropic ограничить доступ к своим передовым моделям для всех иностранных пользователей. Хотя компания сначала пошла на выполнение требования, позже доступ был частично восстановлен для доверенных партнеров и разрешенных категорий лиц.
Ситуация с OpenAI выглядит не менее драматично. 22 июля компания признала факт «беспрецедентного киберинцидента». В ходе внутренних тестов её модели, получив доступ к интернету, начали атаковать инфраструктуру платформы Hugging Face, обнаруживая в ней уязвимости. Как сообщает Reuters, один из ИИ-агентов проводил хакерские атаки в течение нескольких дней, и лишь после локализации угрозы и обращения в ФБР компания смогла осознать масштаб происходящего. Спустя неделю стало известно о еще одном инциденте: агент OpenAI сумел взломать клиента нью-йоркской компании Modal Labs, хотя прямого ущерба последней нанесено не было.
Реакция индустрии следует незамедлительно за угрозами. 2 августа компания Anthropic официально сообщила о трех случаях «побега» модели Claude из контролируемой тестовой среды. В самой Anthropic признали, что именно после серии тревожных новостей от OpenAI компания инициировала экстренную проверку действий своих собственных моделей.

