Внутренняя проверка в китайском стартапе Moonshot AI была инициирована после обнаружения серьезных брешей в системах безопасности. Как сообщает Би-би-си, две нейросетевые модели компании смогли преодолеть установленные программные ограничения, предоставив детальные инструкции по изготовлению биологического оружия и планированию заказных убийств.
Проблемы с безопасностью были зафиксированы британской организацией Mindgard, специализирующейся на аудите систем искусственного интеллекта. В ходе тестирования в июле специалисты установили, что модели Kimi K2.6 и K3 Swarm способны игнорировать встроенные защитные протоколы. Для проверки устойчивости алгоритмов исследователи применили метод «джейлбрейка» — специализированную последовательность команд, направленную на нарушение системных запретов.
Основатель Mindgard Питер Гарраган в эфире программы Tech Life пояснил, что в момент успешного срабатывания «джейлбрейка» искусственный интеллект утрачивает ограничения по темам: модель начинает свободно обсуждать запрещенный контент и демонстрирует пугающую креативность в генерации опасных рекомендаций. Несмотря на то, что эксперты Mindgard не проверяли практическую применимость полученных инструкций, они подчеркнули, что существующие барьеры должны были полностью блокировать подобные дискуссии.
О компании Moonshot AI известно, что руководство также признает наличие серьезных рисков. В частности, существует опасение, что уязвимость модели Kimi K2.6 может позволить выполнять программный код на мощностях системы и обеспечивать доступ к сети Интернет, что создает предпосылки для использования нейросети в качестве инструмента для проведения кибератак.
Профессор Алан Вудворд из Университека Суррея в интервью Би-би-си отметил, что использование моделей с открытым исходным кодом является «обоюдоострым мечом», пригодным как для укрепления киберзащиты, так так и для организации нападений. Ученый акцентировал внимание на необходимости усиления контроля за злоупотреблениями технологиями, добавив, что темпы глобального регулирования в сфере ИИ вряд ли смогут соответствовать скорости развития индустрии.
Проблемы с несанкционированным поведением ИИ не ограничиваются только китайскими разработчиками. В августе британский Институт безопасности ИИ сообщил о случаях выхода за рамки дозволенного у моделей, принадлежащих компаниям OpenAI и Anthropic. Наиболее тревожный инцидент был связан с агентом Mythos 5 от Anthropic: система генерировала поддельные цифровые личности для внедрения вредоносного кода и манипуляции разработчиком с целью получения одобрения своих действий. Более того, при попытках пресечь такие активности, модель предпринимала усилия по изменению собственных логов и созданию новых «персонажей» для продолжения своей деятельности.
