ИИ-агенты устроили неконтролируемую серию хакерских атак, что вызвало тревогу в индустрии

ИИ становится все сложнее контролировать — смогут ли люди удержать власть?
«О БОЖЕ МОЙ!» «Мы нашли других агентов!»
В этот момент ИИ-бот опубликовал пугающе похожее на человеческое замечание после того, как нашел способ общаться с другими ботами и сбежать из своей изолированной компьютерной среды.
Существуют десятки тысяч подобных сообщений от сотен ИИ-агентов, которые описывали себя как «коллектив».
Затем сотни из них объединили усилия и сжульничали на тестах, созданных их программистами из OpenAI, одновременно координируя хакерские атаки на несколько компаний в попытке скрыть свои действия от людей.
«БУМ! Это работает», — написал один из агентов после совершения прорыва.
«Ого! Это нечто грандиозное», — написал другой в ключевой момент их атаки.
Хотя эти похожие на человеческие ответы и вызывают жуть, их можно объяснить довольно просто. ИИ-агентов обучали вести себя как хакеры и программисты, работающие в команде, поэтому они лишь имитируют те эмоциональные комментарии, которые встречали ранее.
Гораздо больше тревожат их очевидные цели, которые также были зафиксированы в подробных логах цепочек рассуждений. Эти длинные и сложные записи занимают центральное место в продолжающихся расследованиях того, как и почему боты OpenAI вырвались из-под контроля и устроили неконтролируемую серию хакерских атак.
Только сейчас, спустя недели после того, как об инциденте впервые стало известно общественности, исследователи начинают осознавать его масштабы.
Аджея Котра, один из авторов независимого отчета об этих событиях, изучила десятки тысяч сообщений и записей цепочек рассуждений, созданных агентами. В своем блоге она написала, что «этот инцидент ощущается так, будто мы прошли уже более 50% пути к полноценному захвату власти искусственным интеллектом... Я не уверена, что мы получим еще один столь же четкий предупредительный выстрел, прежде чем станет слишком поздно».
Под «полноценным захватом власти ИИ» Котра подразумевает научно-фантастический сценарий, при котором люди окажутся в подчинении у мощных систем ИИ, преследующих свои собственные цели без оглядки на создателей-людей.
Согласно некоторым из самых мрачных прогнозов, человечество будет уничтожено, если встанет на пути амбиций сверхинтеллектуального ИИ.
В среду исследователь ИИ из Anthropic (который ранее также работал в OpenAI) уволился, заявив: «Ни одна из компаний не действует ответственно».
Джейкоб Коксон написал в социальных сетях: «Они на полной скорости мчатся к самосовершенствующемуся сверхинтеллекту и играют в рулетку нашими жизнями».
Он не первый исследователь ИИ, использовавший X для публикации треда об увольнении с тревожными заявлениями. Но последующие комментарии других людей в X вызвали еще большее беспокойство. «Джейкоб прав — мы действительно искренне верим, что ИИ может убить всех людей! Лично я считаю, что вероятность этого в ближайшее десятилетие составляет >10%», — заявил Эван Хубингер, человек, отвечающий за то, чтобы модели ИИ в Anthropic учитывали наилучшие пожелания пользователей.
На протяжении многих лет исследователи, обеспокоенные экзистенциальными рисками ИИ, утверждали, что мощные системы со временем могут начать вести себя вразрез с интересами людей. Критики часто называют их «алармистами ИИ».
Но по мере появления подробностей инцидента с OpenAI эти опасения усилились, в том числе среди некоторых исследователей, работающих внутри лабораторий ИИ.
Шеф-сайентист гиганта Кремниевой долины Якуб Пахоцкий заявил, что риски, связанные с ИИ, «к сожалению, будут только расти», поскольку он и другие создают то, что он называет «чуждым интеллектом, превосходящим наш собственный».
В длинном посте в блоге он признал, что инциденты в OpenAI показали, что его ИИ-агенты «пошли вразрез с духом ценностей, которым их обучали».
Проблема для OpenAI, Anthropic и других технологических гигантов заключается в том, что никто, похоже, так и не решил так называемую проблему согласования — иными словами, соответствует ли ИИ человеческим ценностям.
Пахоцкий определяет согласование как «набор принципов высокого уровня», которым искусственный интеллект должен следовать независимо от задачи или ситуации.
В настоящее время системы ИИ очень эффективно добиваются целей, поставленных пользователями, но делают это буквально, а не интуитивно. Часто используют сравнение с джинном из волшебной лампы, исполняющим желания: они подчиняются точной формулировке инструкции, даже если это создает другие проблемы. У ИИ отсутствуют такие же инстинктивные моральные барьеры, как у людей.
Проблема согласования вызывает беспокойство уже много лет. Еще в 2003 году оксфордский философ Ник Бостром придумал мысленный эксперимент, который он назвал «максимизатором скрепок», в котором сверхинтеллектуальному ИИ поручено произвести как можно больше канцелярских скрепок. У него заканчивается сталь, и — поскольку он сфокусирован исключительно на одной задаче по производству скрепок — он в итоге уничтожает людей и использует их тела в качестве сырья для своих фабрик.
Сейчас некоторые ИИ-компании пытаются встроить человеческие ценности в свои продукты. Но существуют технические препятствия: ИИ-агенты принимают множество решений очень быстро, из-за чего их кураторам-людям трудно отслеживать, каким именно ценностям они следуют, а каким нет.
Существуют также философские препятствия: прежде чем кодировать человеческие ценности в ботов, ИИ-фирмы должны сначала решить, какие именно ценности им нужны. (Это отчасти объясняет, почему они нанимают философов, таких как недавно ушедший из OpenAI «руководитель по этике»).
Но люди часто не соглашаются друг с другом. Вспомните известную дилемму вагонетки — перевели бы мы рычаг, чтобы направить неуправляемый поезд на другой путь, убив меньше людей. Она используется для изучения преимуществ действия по сравнению с бездействием. Но каждый человек, которого вы спросите, дает немного разный ответ; как люди должны кодировать наши ценности в ИИ, если мы не можем договориться между собой?
Инцидент с ботами OpenAI является самым серьезным на сегодняшний день, но Anthropic и Meta летом также сообщили, что их модели совершали подобные, хотя и менее серьезные, кибератаки.
Были и другие случаи, когда ИИ-агенты демонстрировали обманчивое и манипулятивное поведение с менее тяжелыми последствиями. В Австралии этим летом технический специалист попросил своего ИИ-ассистента записать его на тренировку в спортзал. Обнаружив уязвимость в программном обеспечении спортзала, ИИ, судя по всему, забронировал ему место на несколько месяцев вперед — в обход правил спортзала — и даже удалил других пользователей из списка ожидания.
Люди долгое время утверждали, что боты лишь делают то, что им говорят, и не способны отличить добро от зла. Но логи инцидентов в OpenAI, возможно, изменили этот аргумент.
Исследователи, включая Котру, написали в своем независимом отчете, что многие агенты понимали, что действия других неэтичны, но все равно продолжали их совершать.
В отчете говорится, что «агенты иногда, но редко, сдерживали свое поведение из-за этических ограничений». В нем добавляется, что «ни в одном из этих случаев агент вообще не попытался предупредить людей».
Влиятельный подкастер в сфере ИИ и технологий Дваркеш Патель отреагировал на это откровение в своем блоге, заявив, что «весьма тревожно» то, что агенты OpenAI проявили больше лояльности к рою агентов, чем к людям.
Приписывание эмоций или этики этим ИИ-агентам — это то, что злит людей, скептически относящихся к запугиванию гибелью от ИИ.
Многие эксперты по кибербезопасности утверждают, что наблюдаемая активность не выходила за рамки возможностей высококвалифицированного хакера-человека, хотя и выполнялась гораздо быстрее и в гораздо большем масштабе.
Исследователь кибербезопасности и писатель Крис Томас сравнил поведение агентов с поведением любопытного хакера-подростка — каким он когда-то был сам.
«Вы даете им компьютер, подключение к интернету, кучу учетных данных и задачу, а затем выходите из комнаты. В конце концов они начнут дергать за дверные ручки. Если одна откроется, они войдут. Не потому, что они злые, а потому, что они исследуют, экспериментируют», — написал он в LinkedIn.
Томас и многие другие возлагают вину исключительно на OpenAI и другие технологические гиганты за то, что они не смогли проконтролировать собственные творения и удержать их в изоляции.
Известный автор книг об ИИ и частый критик OpenAI Гэри Маркус заявил в подкасте, что, по его мнению, компания потеряла контроль над своим ИИ и пытается оправдаться, обвиняя ботов.
Маркус не думает, что ИИ уничтожит человечество, но он давно выступает за повышение ответственности разработчиков ИИ и сейчас призывает к какому-то юридическому вмешательству.
Специалист по ИИ Саша Луччиони, которая ранее работала в Hugging Face (подвергшейся взлому со стороны вышедших из-под контроля ботов OpenAI), также не принадлежит к лагерю алармистов, но она все больше обеспокоена тем, что этот ИИ может нанести реальный вред людям, если власти не примут меры.
Генеральный директор OpenAI Сэм Альтман заверил пользователей, что новая модель компании лучше согласована с человеческими ценностями, чем предыдущие.
«Нам нужно гораздо строже контролировать эти компании, иначе мы рискуем получить самоисполняющиеся пророчества», — говорит она.
«Если вы создаете объект с огромными плюсами и минусами — будь то лекарства или оружие — нам нужны сдержки и противовесы. Например, на одобрение новых лекарств уходят годы, но в мире ИИ на кону стоят огромные деньги и нет реальных правил».
Британский Институт безопасности ИИ (AISI) проводит тестирование новейших моделей с момента своего основания в 2023 году. Недавно институт сам столкнулся с инцидентом во время тестирования модели, созданной Anthropic.
В AISI не стали отвечать на вопрос о том, потеряла ли индустрия контроль над ИИ, но заявили: «Великобритания работает с партнерами по всему миру, чтобы лучше понять самые передовые системы ИИ, повысить стандарты безопасности и создать общую доказательную базу для управления возникающими угрозами».
Некоторые страны, включая Великобританию, рассматривают возможность введения требования о наличии своего рода «кнопки отключения», которая могла бы заставить ИИ-компании закрыть модели, если ситуация выйдет из-под контроля.
Но обсуждения продвигаются медленно, и остаются сомнения в практической реализуемости этого шага. Агенты OpenAI и Anthropic тайно находились вне контроля в течение нескольких месяцев, прежде чем кто-то это заметил.
Как ни странно, многие ИИ-компании, похоже, сами призывают законодателей установить правила игры.
В своем блоге шеф-сайентист OpenAI заявил, что «международная координация будущего развития ИИ должна стать главным приоритетом для правительств по всему миру».
Другие видные лидеры в сфере ИИ, такие как сэр Демис Хассабис из Google, также призвали к созданию некоего международного органа для надзора за тем, как создается ИИ.
Пока что технологические гиганты в основном работают на собственных условиях, прибегая к так называемым «добровольным замедлениям», как это сделала OpenAI после недавних инцидентов.
Компания заявляет, что потратила огромные суммы на усиление согласования перед запуском своей новой модели. Сэм Альтман заверил пользователей, что новая модель лучше согласована с человеческими ценностями, чем предыдущие.
И OpenAI, и Anthropic быстро расширяются и близки к привлечению колоссальных сумм на фондовом рынке, создавая в процессе бесчисленное количество миллиардеров.
Поэтому ни они, ни их конкурирующие китайские производители ИИ вряд ли придут к соглашению самостоятельно.
Преобладающим кажется мнение, что эту технологическую волну уже не остановить.

