Большинство крупных разработчиков искусственного интеллекта не опубликовали и не продемонстрировали планы действий на случай, если их модель попытается обойти контроль человека. К такому выводу пришла организация Guidelight AI Standards, занимающаяся продвижением безопасных практик разработки передового ИИ.

Исследователи оценили пять ведущих лабораторий по степени готовности к подобному сценарию. Лучший результат показала OpenAI, худшие — Anthropic и Meta*. Значимость выводов растет по мере того, как автономные ИИ-агенты получают все больше самостоятельных функций внутри корпоративных систем, а регуляторы Калифорнии и Нью-Йорка начинают требовать раскрытия подобной информации.
Оценка Guidelight строилась на анализе публично доступных материалов компаний Anthropic, Google, OpenAI, Meta* и xAI по ряду параметров: качество логирования и мониторинга внутренней работы систем, наличие практики остановки систем после серии выявленных нарушений, привлечение независимых аудиторов и, главное, наличие конкретного плана сдерживания модели, вышедшей из-под контроля.
Обеспокоенность способностью компаний сдерживать все более автономные модели усилилась после серии инцидентов в области кибербезопасности, когда системы OpenAI, Anthropic и Meta* получали непреднамеренный доступ в интернет в ходе тестирования безопасности и взламывали внешние системы.
По словам главного научного сотрудника Guidelight и бывшего исследователя безопасности OpenAI Стивена Адлера, его удивило, насколько мало компании сообщают о том, как они поступят в случае серьезного инцидента с потерей контроля над моделью.
Guidelight определяет план сдерживания как заранее подготовленный протокол, который активируется при обнаружении попытки модели обойти контроль и описывает, какие права доступа отзываются, кто может продолжать работу с моделью и на каких условиях, а также когда систему необходимо полностью отключить.
Адлер отметил, что есть основания полагать, что ведущие модели передовых компаний в той или иной степени демонстрируют признаки рассогласованности с целями разработчиков.
По большей части планы управления катастрофическими рисками остаются на усмотрение самих компаний, и, по данным отчета Guidelight, публично доступные свидетельства указывают на нехватку готовых протоколов реагирования на чрезвычайные ситуации.
Представитель Google заявил, что отчет Guidelight не отражает полный объем мер безопасности компании, но не ответил на вопрос о существовании недекларируемого внутреннего плана сдерживания.
Представитель OpenAI сообщил, что у компании есть процедура ограничения прав доступа, приостановки рабочих нагрузок и полного отключения модели, которая уже применялась на практике. Meta* отказалась сообщить, есть ли у нее внутренний план сдерживания, сославшись на существующую систему оценки рисков ИИ.
Юрист по вопросам конфиденциальности и ИИ, основатель компании Metaverse Law Лили Ли считает, что нежелание компаний раскрывать полный объем политик сдерживания связано не только с конкурентными, но и с юридическими соображениями: чрезмерно конкретные публичные обязательства при их невыполнении могут стать основанием для исков о недобросовестной рекламе.
Тем временем регуляторы начинают требовать раскрытия подобной информации в обязательном порядке. Калифорнийский закон SB 53, вступивший в силу в этом году, обязывает крупных разработчиков передового ИИ публиковать рамочные документы о выявлении и реагировании на критические инциденты безопасности, аналогичный нью-йоркский RAISE Act вступит в силу в январе.
В прошлом месяце в конгресс был внесен двухпартийный законопроект AI Kill Switch Act, обязывающий крупных разработчиков ИИ создавать и поддерживать технические механизмы экстренного отключения моделей.
Самые низкие оценки за публикацию плана сдерживания получили Meta* и Anthropic — последнее особенно неожиданно на фоне публичной риторики компании о безопасности. Согласно отчету Guidelight, августовский отчет о рисках Anthropic не упоминает ограничение развертывания модели как один из возможных результатов реагирования на инциденты рассогласованности.
Представитель Anthropic заявил, что при обнаружении попытки модели обойти контроль компания проведет оценку риска для определения целесообразности сдерживания. OpenAI получила максимальный для рейтинга результат — 3 из 5 баллов, поскольку неоднократно приостанавливала рабочие нагрузки, включая внутреннее развертывание и обучение моделей, после выявления инцидентов безопасности, хотя формального плана на будущее компания также не представила.
*экстремистская организация, запрещенная на территории РФ
Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.