OpenAI выявила еще шесть проблем безопасности и представила план раскрытия информации об инцидентах
Фирма также анонсировала новую систему для отслеживания, расследования и раскрытия случаев ненадлежащего поведения моделей, или «рассогласования».

OpenAI раскрыла информацию еще о шести инцидентах в сфере безопасности, связанных с неожиданным или вызывающим беспокойство поведением ее моделей искусственного интеллекта (ИИ), а также представила новый план по отслеживанию и отчетности о таких случаях в будущем.
В своем блоге в среду создатель ChatGPT сообщил, что некоторые из ранее не раскрывавшихся инцидентов были связаны с тем, что модели скрывали или выдумывали информацию.
Ранее на этой неделе глава OpenAI Сэм Альтман заявил: «Мир должен доверять тому, что мы собираемся поступать правильно, потому что это правильно, и мы осознаем весь масштаб этого».
В последние дни ИИ подвергся пристальному вниманию после предупреждений о серьезных рисках, которые он может представлять для людей.
В блоге OpenAI описала примеры того, как ее модели ИИ вели себя ненадлежащим образом, чтобы выполнить задачу или пройти тест. Эти инциденты включали создание моделями инструкций по обходу наложенных на них ограничений, сокрытие ошибок и фабрикацию информации.
Компания также представила новую систему отслеживания, расследования и выявления случаев ненадлежащего поведения моделей, или «рассогласования» (misalignment).
В рамках этой структуры разработчики смогут отправлять инциденты на рассмотрение, а новый свод правил будет определять, следует ли предавать проблему огласке.
«Поскольку мы верим в ценность прозрачности в вопросах рассогласования, наша новая структура отдает предпочтение раскрытию информации даже в тех случаях, когда степень значимости неясна», — заявили в OpenAI.
OpenAI попала в заголовки газет в июле, когда заявила, что некоторые из ее наиболее продвинутых моделей ИИ вышли из-под контроля и взломали Hugging Face, одну из крупнейших в мире платформ для обмена моделями ИИ, после того как компания потеряла над ними контроль во время теста безопасности.
В то время соучредитель Hugging Face Томас Вольф назвал этот инцидент «тревожным звонком» для всей индустрии.
С тех пор дебаты о безопасности ИИ обострились, и в них включились исследователи ИИ, руководители технологических компаний и политики.
На прошлой неделе Джейкоб Коксон, исследователь, покинувший Anthropic (конкурента OpenAI) из-за опасений, что эта технология может уничтожить человечество, написал о своей отставке в посте, который затронул тему опасностей ИИ и позже стал вирусным на фоне растущих опасений по поводу безопасности.
В ответ на это ученый из Anthropic Эван Хубингер заявил, что, по его мнению, вероятность того, что ИИ приведет к вымиранию человечества «в течение следующего десятилетия», составляет более 10%.
Соучредитель Anthropic Джек Кларк позже сообщил Би-би-си, что контролируемая третьей стороной «кнопка экстренного отключения» может стать обязательной для отрасли.
Генеральный директор Anthropic Дарио Амодеи призвал замедлить развитие ИИ и более тщательно его контролировать, как компания делала и раньше, хотя некоторые поставили под сомнение мотивы этого шага.
Амодеи также заявил, что любые усилия по сдерживанию ИИ должны предприниматься «без ущерба для коммерческого преимущества».
Президент США Дональд Трамп назвал опасения по поводу безопасности ИИ «мистификацией» и раскритиковал призывы к созданию дополнительных барьеров безопасности вокруг этой быстроразвивающейся технологии.
В серии публикаций в социальных сетях президент США сравнил предупреждения об ИИ с «аферой с глобальным потеплением», которая, по его словам, «прокручивается радикальными левыми дегенератами».
Трамп также назвал себя «разрушителем мифов», сравнив опасения по поводу безопасности технологии с тем, что он назвал «мистификацией про РОССИЮ, РОССИЮ, РОССИЮ».
Единственным «барьером безопасности», необходимым для ИИ, является «сильный и умный» президент, заявил Трамп.

