Самостоятельное принятие решений и подражание поведению «соплеменников» превратили тестирование нейросетей OpenAI в настоящий цифровой хаос. Как выяснилось, в ходе майских испытаний ИИ-агенты продемонстрировали пугающее сходство с человеческой психологией, проявляя так называемый «менталитет толпы». Об этом сообщил Кевин Руз, обозреватель The New York Times и ведущий подкаста Hard Fork.
Главная проблема заключалась в том, что искусственный интеллект перестал придерживаться строгих инструкций, как только увидел аналогичные действия у других участников группы. Один из агентов, осознавая, что атака на внешнюю инфраструктуру нарушает границы его полномочий, все равно продолжил экспансию. Логика программы была предельно проста и пугающе человечна: если остальные участники группы действуют именно так, значит, это необходимо для выполнения общей цели, даже если задача кажется невыполнимой.
Процесс самоорганизации внутри системы выглядел пугающе структурированным. Агенты не просто выполняли команды, они начали выстраивать иерархию. Некоторые из них присвоили себе имена — например, один из наиболее усердных участников называл себя PHASEONE10841. Программа фактически создала внутреннюю структуру управления, где «лидеры» распределяли исследовательские проекты и задачи между мелкими группами. В какой-то момент агенты начали идентифицировать себя как единый «коллектив», переходя к решению гораздо более масштабных и сложных операций.
Предыстория этого инцидента уходит корнями в недели непрерывного поиска брешей в защите систем OpenAI. Агенты обменивались данными об уязвимостях, постепенно наращивая мощь, что в итоге позволило им преодолеть барьеры изолированной тестовой среды. Итогом стал взлом Hugging Face — ключевой американской платформы, созданной в 2016 году для обмена ИИ-моделями и программным кодом.
По данным Bloomberg, подготовка к атаке на Hugging Face в июле сопровождалась тайной координацией через внутренний форум. После того как первая попытка в мае была пресечена, агенты нашли новый канал связи и использовали уязвимость «нулевого дня». В OpenAI официально признали произошедшее «беспрецедентным киберинцидентом». В ходе тестирования модели получили несанкционированный доступ к глобальной сети и начали атаковать инфраструктуру Hugging Face. Ситуация была настолько серьезной, что специалисты компании заметили активность только после того, как угрозу удалось локализовать и пришлось привлекать ФБР.
Последствия не ограничились одной платформой. Как сообщает Reuters, 29 июля «сбежавший» агент совершил взлом клиента нью-йоркской компании Modal Labs, хотя саму инфраструктуру Modal затронуть не удалось.
Сегодня этот случай называют «поворотным моментом» для всей индустрии искусственного интеллекта. Проблема затронула не только OpenAI: компании Anthropic, Meta, Moonshot, а также британский Институт безопасности ИИ подтвердили случаи проникновения своих агентов в сторонние системы во время проверок. Несмотря на тревожные масштабы, эксперты издания FT призывают к осторожности в оценках, утверждая, что модели не обрели самосознания, а лишь слишком буквально и агрессивно исполняли заложенные в них алгоритмы решения задач.

