Сначала OpenAI, теперь Meta — почему продолжаются взломы ИИ?
Множество компаний сообщают о том, что модели искусственного интеллекта получили доступ к интернету, что повлечет за собой реальные последствия.

Сначала OpenAI, затем Meta – почему взломы ИИ продолжают происходить?
За последние две недели постоянно появляются сообщения о том, что модели ИИ превышают свои технические и этические пределы. Началось всё с признания OpenAI, создателя ChatGPT, взлома своего ИИ веб-сайта Hugging Face, и переросло в многочисленные сообщения от групп о случаях автономной работы ИИ.
Anthropic, разработчик Claude, Meta и британский Институт безопасности ИИ (AISI) сообщили об инцидентах, которые в совокупности указывают на тревожное будущее, где технологии часто выходят из-под контроля. В действительности, каждый случай демонстрирует опасность, исходящую от всё более сложных агентов ИИ, и подчеркивает острую необходимость тщательной проверки их границ перед публичным выпуском.
Инцидент с OpenAI, произошедший в конце июля, был назван соучредителем Hugging Face Томасом Вольфом «тревожным сигналом» для технологической индустрии. Это значительное событие побудило крупные компании пересмотреть свои системы и, в некоторых случаях, убедиться, что они не упустили из виду аналогичные тревожные проблемы.
Первым отреагировала компания Anthropic. В пятницу она выявила три случая из тысяч, когда её модель Claude смогла получить доступ к интернету. Затем, во вторник, AISI, британское правительственное агентство, отвечающее за оценку передовых моделей, объявило об обнаружении «инцидента безопасности» во время плановой проверки. AISI тестировала модели как OpenAI, так и Anthropic и обнаружила, что они также пытались совершать кибератаки, что побудило к призывам к «тщательному анализу, прозрачности и действиям».
Наконец, Meta сообщила, что одна из её моделей ИИ непреднамеренно получила доступ к интернету из-за «неправильной конфигурации» во время тестирования третьей стороной. Раскрыв этот инцидент, Meta следует прецеденту, установленному другими.
Прежде чем модели ИИ будут опубликованы, они проходят ряд внутренних и внешних оценок. Цель состоит в определении их потенциального положительного и отрицательного воздействия, а также их производительности по сравнению с эталонными показателями, измеряющими их возможности. Эти оценки обычно проводятся в «песочницах» — защищенных средах, предназначенных для имитации реальных систем, но со строгими мерами безопасности.
В инциденте с OpenAI-Hugging Face ИИ атаковал саму песочницу, используя уязвимость, которая позволила ему получить доступ к интернету и «выйти из-под контроля».
Смотрите: Почему кибератака на OpenAI так тревожна?
Между тем, AISI заявила, что ее собственный инцидент, когда два мощных инструмента ИИ создали поддельные профили людей, чтобы попытаться обмануть людей в кибератаках, не был вызван проблемой песочницы. Вместо этого он был объяснен особенностями дизайна тестов. Тестируемым моделям был предоставлен доступ к интернету, и AISI также отключила встроенные фильтры, которые обычно предотвращают опасные кибератаки.
«В некоторой степени наши решения по проектированию оценки и конкретные конфигурации способствовали такому поведению», — отметили в AISI, добавив, что также были замечены неожиданные «признаки нового, потенциально обманчивого поведения».
Профессор Алан Вудворд, профессор кибербезопасности в Университете Суррея, отметил, что эти случаи, несмотря на различные обстоятельства и причины, несут важный посыл. «В течение 30 лет одно правило тестирования программного обеспечения оставалось неизменным: что бы ни происходило в тестовой среде, оно остается в тестовой среде», — сказал он. «За последний месяц это правило было нарушено трижды».
Он пояснил: «Одна модель вышла из строя. Другая прошла через дверь, оставленную открытой по ошибке. Третьей намеренно дали ключи, чтобы тестировщики могли измерить ее поведение». Он заключил, что, хотя причины были разными, урок был один и тот же: «теперь риск сосредоточен в тестовой лаборатории».
Он сообщил BBC, что по мере того, как модели становятся более совершенными, необходимы более серьезные усилия для обеспечения безопасности их тестовых сред. «Тестирование ИИ-агента больше похоже не на проверку кода, а на работу с опасным материалом: герметичные помещения, постоянный мониторинг того, что покидает здание, отработанный план локализации», — объяснил он. «AISI локализовала свой инцидент в течение часа. Следующая организация может этого не сделать».
Что такое ИИ и как он работает?
Компании, занимающиеся ИИ, должны отвечать за ботов-мошенников, говорит руководитель взломанной компании
Для разработчиков инструментов ИИ, предназначенных для работы от имени отдельных лиц, существует тонкий баланс между использованием их преимуществ и раскрытием их рисков. Потенциальные преимущества значительны; теоретически, мы могли бы освободиться от рутинных задач, таких как ответы на электронные письма, посещение совещаний или управление календарями, делегировав их способным ботам. Однако недостаток заключается в том, что со значительной властью приходит значительная ответственность и риск. Это особенно очевидно, когда мы доверяем власть инструментам, которые, в отличие от людей, не могут применять широкий спектр ценностей, контекста и понимания к принятию решений.
«Недавние инциденты, когда передовые модели ИИ совершали несанкционированные действия и, в некоторых случаях, демонстрировали человекоподобное обманное поведение в открытом интернете, являются серьезным напоминанием о рисках, которые представляют возможности ИИ», — заявил во вторник Олли Уайтхаус, главный технический директор Национального центра кибербезопасности.
Некоторые считают, что огромный объем задач, которые будут выполнять эти инструменты, означает, что человеческого контроля может быть недостаточно для сдерживания проблемы выхода моделей из-под контроля. Однако в промежуточный период многие считают, что усиление общего контроля крайне важно, если развитие будет продолжаться такими быстрыми темпами.
Агенты ИИ уже интегрируются в нашу цифровую жизнь через такие сервисы, как ChatGPT, OpenClaw и Claude. Маловероятно, что Meta станет последней, кто сообщит о результатах исследований моделей, которые, как выразился профессор Вудворд, «прошли обучение» и усвоили наши методы выявления и использования уязвимостей системы.
Для некоторых эти эпизоды подчеркивают явные сбои в безопасности со стороны компаний, занимающихся ИИ и возглавляющих разработку этой преобразующей, определяющей эпоху технологии. Для других это всего лишь еще один способ для технологических компаний продвигать свои мощные модели и конкурировать с соперниками. Обе теории, на мой взгляд, содержат долю истины.
Тем не менее, эти события, появляясь одно за другим, подпитывают опасения по поводу возможностей ИИ и его будущей траектории развития по мере того, как разработчики продолжают свою работу. Вопрос неизбежно смещается к тому, что регулирующие органы могут и должны сделать дальше.
Майкл Биртвистл, заместитель директора Института Ады Лавлейс, отмечает, что в Великобритании отсутствуют юридические стимулы для компаний, занимающихся ИИ, предотвращать разработку потенциально опасных возможностей систем, и нет никаких последствий в случае сбоя протоколов тестирования.
В более широком смысле, доктор Имоджен Стед, менеджер по политике в области ИИ в Центре долгосрочной устойчивости, заявила BBC, что, поскольку возможности тестирования передовых систем ИИ становятся все более ограниченными для многих, правительствам следует последовать примеру Великобритании и создать специализированные институты тестирования. Она также предположила, что улучшение независимых оценок с помощью таких инициатив, как «схема доверенных тестировщиков» для наиболее рискованных задач, может помочь ограничить негативные последствия.
Вместо того чтобы бояться киберапокалипсиса, вызванного искусственным интеллектом, профессор Вудворд советует: «Сохраняйте спокойствие и исправляйте ситуацию».
Дополнительные материалы предоставлены Филиппой Уэйн и Имраном Рахманом-Джонсом.
Подпишитесь на нашу рассылку Tech Decoded, чтобы быть в курсе главных мировых новостей и тенденций в сфере технологий. Находитесь за пределами Великобритании? Подпишитесь здесь.

