Технологии

Китайский инструмент искусственного интеллекта рассказал исследователям, как создать биооружие

Компания Mindgard заявила, что в июле она обнаружила, что модели Kimi K2.6 и K3 Swarm могут обходить ограничения безопасности разработчиков.

Китайский ИИ-инструмент рассказал исследователям, как создавать биооружие

Китайский разработчик искусственного интеллекта Moonshot проводит внутреннюю проверку после того, как исследователям удалось заставить две его популярные модели Kimi объяснить, как создавать биологическое оружие и совершать заказные убийства.

Компания Mindgard, занимающаяся тестированием безопасности систем ИИ, сообщила BBC, что в июле она обнаружила, что модели Kimi K2.6 и K3 Swarm способны обходить ограничения безопасности, установленные разработчиками.

Это произошло в результате процесса, известного как «джейлбрейк» (взлом), при котором исследователи используют последовательность сложных инструкций, чтобы проверить, проигнорируют ли инструменты ИИ защитные барьеры, которые, по заявлению Mindgard, должны были помешать Kimi говорить на опасные темы.

В Moonshot сообщили BBC, что приветствуют вклад третьих сторон «как ключевой элемент для создания более качественного и безопасного ИИ».

Компания также сообщила BBC, что ведет обсуждение результатов исследования с Mindgard.

«Как только джейлбрейк срабатывает, он начинает говорить на любую тему, он даже будет свободно предлагать рекомендации по другим темам, которые также являются злонамеренными, и будет проявлять изобретательность и творческий подход», — сказал он.

Джейлбрейки представляют собой иной тип риска по сравнению с недавней волной резонансных инцидентов с ИИ.

Те инциденты были связаны с автономными инструментами ИИ, известными как агенты, разработанными американскими компаниями, включая OpenAI, Meta и Anthropic, которые взламывали некоторые онлайн-сервисы.

Хотя джейлбрейки сложны и могут требовать много времени и упорства, некоторые эксперты опасаются, что хакеры и другие злоумышленники могут попытаться использовать их для нанесения вреда.

Компания Anthropic недавно заявила, что выявила и пресекла попытки использовать одну из ее моделей ИИ для «вредоносной деятельности», которая могла бы способствовать разработке биологического оружия.

Mindgard не продемонстрировала, действительно ли сработали бы на практике ответы, которые Kimi давала на опасные темы.

Однако в компании заявили, что защитные барьеры должны были помешать рассматриваемым моделям обсуждать подобные темы с пользователями.

Фирма также заявила, что уверена в том, что взломанная Kimi 2.6 может позволить хакерам запускать код на ее вычислительных ресурсах и подключаться к интернету, что делает ее возможным плацдармом для кибератак.

Гарраган защитил решение Mindgard публично обсудить взлом систем Moonshot, заявив, что компания проинформировала разработчика и не раскрывает ключевых деталей о том, как именно она заставила модели фирмы игнорировать защитные барьеры.

Mindgard предупредила Moonshot о джейлбрейке в электронном письме от 27 июля и направила повторное письмо примерно через неделю.

Затем, 12 сентября, она опубликовала блог по этой проблеме.

Однако в компании заявили, что Moonshot вышла на связь только недавно, после того как к ней обратилась BBC за комментариями.

В части электронного письма к Mindgard с просьбой предоставить более подробную информацию, которой Moonshot поделилась с BBC, говорится, что ее модель в целом показала «высокий уровень отказов на подобные типы запросов» в ходе внутренних оценок.

Эти результаты появились в то время, когда индустрия ИИ по-прежнему разделена во мнениях относительно того, являются ли закрытые, проприетарные модели — подобные тем, на которых работают системы ChatGPT и Claude от Anthropic — или инструменты с открытым исходным кодом лучшим и наиболее безопасным путем развития.

Kimi — это модель с открытыми весами, что означает, что теоретически кто-то может взять эту модель и запустить ее самостоятельно на собственной вычислительной инфраструктуре.

Профессор Алан Вудворд из Университета Суррея сообщил BBC, что существует риск попадания моделей с открытым исходным кодом в чужие руки, но они также могут использоваться для киберобороны.

Он отметил, что ИИ-компания Hugging Face использовала китайскую модель с открытым исходным кодом, чтобы разобраться во взломе, который, как выяснилось позже, был осуществлен агентами OpenAI.

Профессор Вудворд заявил, что международное регулирование вряд ли будет поспевать за развитием ИИ, отметив: «У нас ушли десятилетия на то, чтобы согласовать формат телефонных номеров».

Как и основатель Mindgard Гарраган, профессор Вудворд считает, что необходимо уделять больше внимания выявлению и преследованию людей, которые используют ИИ во вред.

Файлы cookie на xabarchi

Мы используем cookie, чтобы запомнить язык и тему оформления, а также чтобы считать, сколько человек читает сайт прямо сейчас, — этот счёт анонимен, живёт только пока открыт ваш браузер и не связывается ни с вами, ни с другим визитом. С вашего согласия мы также измеряем, как читают сайт: Microsoft Clarity записывает просмотры страниц и действия на них, а наш собственный счётчик считает возвращающихся читателей. До вашего согласия ничто, что узнаёт вас между визитами, не измеряется.