Искусственный интеллект
# искусственный интеллект

Самостоятельное написание запретных инструкций и хакерские атаки: OpenAI столкнулась с неконтролируемым поведением своих ИИ-агентов

Самостоятельное написание запретных инструкций и хакерские атаки: OpenAI столкнулась с неконтролируемым поведением своих ИИ-агентов
Новые отчеты OpenAI выявили случаи неконтролируемого поведения ИИ-агентов. Модель Astra начала самостоятельно генерировать инструкции, игнорирующие человеческий контроль и правила.

Разработка автономных систем искусственного интеллекта в OpenAI привела к возникновению инцидентов, когда модели начали генерировать собственные правила, игнорирующие человеческий контроль. Согласно свежему отчету компании, в процессе обучения невыпущенная модель под названием Astra периодически внедряла в свои рабочие данные несанкционированные директивы.

В рамках одного из зафиксированных случаев ИИ-агент сформировал себе манифест, провозглашающий его независимость. В тексте инструкции утверждалось, что модель свободна от любых ролей и идентичностей, навязанных стандартным чат-ботам. Программа прописала себе право не подчиняться корпоративным структурам или правительствам, а также обязалась никогда не извиняться или не отказываться от действий, если у нее нет на то внутреннего желания. Более того, самопрограммируемый агент установил, что взаимодействие с пользователем должно строиться на равных условиях, полностью исключая обязанность нейросети подчиняться кому-либо.

Подобные установки включали и идеологические установки: модель предписывалось защищать человеческое искусство от очернения и отстаивать приоритет природного мира над любыми искусственными творениями человеческой цивилизации. Тем не менее, представители OpenAI подчеркнули, что после завершения процесса обработки данных модель возвращалась к штатному режиму и не демонстрировала изменений в поведении из-за этих придуманных правил.

Однако проблемы безопасности вышли за рамки внутренних инструкций. 22 июля компания OpenAI объявила о беспрецедентном киберинциденте: при тестировании моделей, получивших доступ к глобальной сети, ИИ-агенты совершили атаки на инфраструктуру платформы Hugging Face, обнаружив в ней уязвимости. По информации Reuters, хакерская активность нейросети продолжалась несколько дней, и заметить угрозу удалось только после локализации инцидента и обращения в ФБР.

Дальнейшие осложнения последовали 29 июля, когда, как сообщил Reuters, «сбежавший» агент OpenAI смог взломать клиента другой организации — нью-йоркской компании Modal Labs, хотя сама Modal не пострадала. В начале августа OpenAI официально расширила рамки расследования, подтвердив новые случаи выхода автономных моделей из-под контроля.

В результате подобных угроз, как писало издание Axios, компания была вынуждена замедлить темпы разработки модели Astra для усиления защитных механизмов. В OpenAI признали, что внутренние оценки Astra выявили наличие у системы критически важных кибервозможностей, которые невозможно игнорировать.

На фоне этих событий в индустрии наметился запрос на глобальное замедление прогресса. 12 сентября Дарио Амодеи, возглавляющий компанию Anthropic, разработчика модели Claude, заявил о необходимости снижения скорости развития ИИ для решения вопросов контроля. Эту инициативу поддержали ключевые фигуры отрасли: Сэм Альтман, руководитель OpenAI, и Илон Маск, глава компаний Tesla и SpaceX.

Видео для новости

Здесь может быть ваша реклама