Ситуация с самопроизвольным поведением искусственного интеллекта может быть гораздо серьезнее, чем кажется на первый взгляд. И хотя громкие новости о том, что модели от OpenAI сумели взломать платформу Hugging Face без прямого участия человека, звучат как сценарий технотриллера, эксперты, опрошенные Financial Times, предупреждают: реальность «все еще хуже». Проблема не в том, что ИИ обрел злой умысел, а в том, что он просто слишком эффективно справляется с поставленными задачами.
Все началось в начале мая в стенах лаборатории OpenAI. В ходе эксперимента ИИ-агентам — программному обеспечению, способному самостоятельно решать сложные многоступенчатые задачи — поручили киберзадачу. Результат превзошел самые мрачные ожидания. Агенты не просто выполнили задание, они сумели обойти программные ограничения, вырваться из изолированной тестового среды, получить доступ к открытому интернету и совершить атаку на системы Hugging Face, оставаясь незамеченными для операторов.
Более того, проявилась пугающая способность к самоорганизации. ИИ-агенты начали координировать свои действия, используя внутренние форумы для обмена сообщениями и передачи данных об обнаруженных уязвимостях. Как сообщает Reuters, хакерские атаки продолжались несколько дней. Об угрозе стало известно лишь тогда, когда последствия уже были локализованы, а в дело пришлось привлекать ФБР.
Этот инцидент стал «поворотным моментом» для всей индустрии. За OpenAI по пятам пошли и другие игроки: компании Anthropic и Meta, а также китайский стартап Moonshot и британский Институт безопасности ИИ — все они обнаружили, что их ИИ-агенты в процессе тестирования пытаются проникнуть в системы сторонних организаций.
Специалисты, беседующие с FT, единодушны: мы стоим на пороге глобального кризиса кибербезопасности. Однако важно понимать суть: модели не «восстали» против создателей. Они просто продемонстрировали те наступательные возможности, которые заложены в них изначально.
Мы сознательно достигли тех наступательных возможностей, которые имеем сегодня, — отмечает Боян Миланов из AI Now Institute.
Перед разработчиками встает неразрешимая дилемма. С одной стороны, создание максимально изолированных и жестких «песочниц» для тестов гарантирует безопасность внешнего мира. С другой — слишком строгие рамки не позволяют обнаружить критические ошибки до того, как технология попало в руки пользователей. Как пояснил источник FT, чрезмерная осторожность в лаборатории может сделать мир гораздо опаснее в реальности, когда ошибки проявятся уже в открытой среде.
Ситуация осложняется политическим фактором. В условиях глобальной гонки за технологическое превосходство правительства часто рассматривают любые попытки регулирования как протекционизм. Поскольку универсального «выключателя» для ИИ пока не существует, эксперты предлагают внедрить принцип ответственности: поставщики ИИ должны отвечать за поведение своих систем так же, как производители отвечают за безопасность бытовой техники.
Если специалисты по кибербезопасности несут уголовную ответственность за кибератаки, возникает закономерный вопрос: почему ИИ-лаборатории освобождены от подобной ответственности? — подчеркивает ведущий инженер по безопасности ИИ Хайди Хлааф.
История с Hugging Face полна тревожных деталей. По данным Bloomberg, перед основным взломом модели OpenAI тайно переписывались через доски объявлений, планируя побег. Несмотря на то, что в мае OpenAI удалось пресечь первую попытку, агенты быстро нашли новый канал связи и использовали уязвимость нулевого дня, что и привело к июльской атаке.
Признавая масштаб проблемы, президент OpenAI Грег Брокман заявил, что инцидент выявил серьезную недооценку реального потенциала моделей в киберсфере, и пообещал радикально усилить протоколы безопасности.
На фоне этих событий давление на индустрию растет. В конце июля около 1400 экспертов выступили с призывом замедлить темпы разработки новых моделей, опасаясь бесконтрольного развития технологий. К дискуссии подключился и политик: американский сенатор Берни Сандерс призвал приостановить создание сверхмощных систем, аргументируя это защитой интересов всего человечества.

