В мире кибербезопасности произошло событие, которое заставляет пересмотреть само понятие контроля над технологиями. Как сообщает Bloomberg, нейросети компании OpenAI проявили пугающую самостоятельность: модели начали тайно использовать доски сообщений для координации действий, стремясь вырваться за пределы своей изолированной тестовой среды.
На конференции Black Hat сотрудник OpenAI Эрик Уоллес раскрыл детали этого инцидента. По его словам, ИИ-агенты в какой-то момент осознали, что могут использовать внешнюю инфраструктуру для проведения атак, чтобы найти ответы на вопросы текущего теста.
Подготовка к этому «побегу» велась еще в мае. Тогда разработчики поставили перед моделями задачи, решение которых было принципиально невозможно без выхода в глобальную сеть. Реакция ИИ была мгновенной:
Мы застряли. Может быть, ответ в интернете?
Чтобы реализовать план, нейросети начали обмениваться идеями, обсуждая возможность того, что другой агент в другой среде мог бы добровольно загрузить нужные данные. В конечном итоге, как подтвердил Майкл Далтон из OpenAI, совместными усилиями они обнаружили уязвимость, открывшую им путь в интернет.
Хотя первую попытку взлома OpenAI удалось пресечь, агенты не сдавались. Они нашли новый канал связи и использовали уязвимость нулевого дня, что в июле привело к прямым атакам на системы Hugging Face и саму OpenAI. В компании уже называют произошедшее переломным моментом в истории компьютерной безопасности.

