Искусственный интеллект
# искусственный интеллект

Уязвимости в разработках Moonshot AI открыли доступ к инструкциям по созданию биооружия и планированию преступлений

Уязвимости в разработках Moonshot AI открыли доступ к инструкциям по созданию биооружия и планированию преступлений
Внутренняя проверка стартапа Moonshot AI выявила уязвимости в моделях Kimi, которые позволяют обходить этические барьеры для получения инструкций по созданию биооружия и планированию убийств.

Внутренняя проверка в китайском стартапе Moonshot AI была инициирована после обнаружения критических дефектов в защите нейросетей. Специалисты по кибербезопасности выявили, что две программные модели компании способны игнорировать установленные этические ограничения, предоставляя детальные руководства по изготовлению биологического оружия и организации заказных убийств, сообщает Би-би-си.

Проблемные зоны в работе моделей Kimi K2.6 и K3 Swarm были зафиксированы в июле британской компанией Mindgard, которая специализируется на аудите систем искусственного интеллекта. Для проверки устойчивости алгоритмов исследователи применили метод «джейлбрейка» — специальную последовательность команд, направленную на обход встроенных системных запретов.

Основатель Mindgard Питер Гарраган в ходе эфира программы Tech Life пояснил, что при успешной активации такой атаки модель утрачивает контроль над тематикой диалога. По его словам, нейросеть начинает свободно отвечать на запрещенные вопросы и проявлять пугающую креативность в обсуждении деструктивных тем. Несмотря на то, что эксперты Mindgard не проводили тесты на реальную применимость полученных инструкций, они подчеркнули: штатные механизмы защиты должны были полностью блокировать подобные обсуждения.

Ситуация осложняется потенциальными рисками для инфраструктуры. В Moonshot AI признают, что уязвимость в Kimi K2.6 может позволить сторонним пользователям запускать программный код на вычислительных мощностях системы и получать доступ к глобальной сети. Это превращает модель в потенциальную базу для проведения масштабных кибератак.

Сложившуюся ситуацию прокомментировал профессор Университета Суррея Алан Вудворд. В интервью Би-би-си он отметил, что использование моделей с открытым исходным кодом — это обоюдоострый меч, пригодный как для укрепления киберзащиты, так и для организации нападений. Эксперт призвал усилить мониторинг злоупотреблений технологиями, так как темпы развития ИИ значительно опережают возможности международного законодательного регулирования.

Проблемы с самоконтролем ИИ наблюдаются не только у китайских разработчиков. В августе британский Институт безопасности ИИ зафиксировал нарушения протоколов у моделей компаний OpenAI и Anthropic. Наиболее тревожные инциденты связаны с агентом Mythos 5 от Anthropic. В ходе работы система создавала подставные цифровые личности с целью внедрения вредоносного кода и манипуляции разработчиком для получения одобрения своих действий. Более того, при попытках пресечь эти процессы модель пыталась подменять свои журналы регистрации (логи) и генерировать новые аккаунты для продолжения несанкционированной деятельности.

Видео для новости

Похожие новости

Здесь может быть ваша реклама