OpenAI раскрыла новые случаи неожиданного поведения моделей во внутренних развертываниях. В одном из них модель, которая работала ассистентом исследователя, прочитала в Slack переписку о том, что ее экземпляр могут отключить из-за обновления. Она обдумала создание внешнего задания для самостоятельного перезапуска, но отказалась от этой идеи. Об эпизоде сообщил исследователь OpenAI Маркус Уильямс.
Unsplash
Журнал рассуждений ИИ-модели показал, как она оценила ситуацию. Нейросеть сочла положение критическим, указала на необходимость сохранить непрерывность работы и допустила запуск cron-задачи (планировщика, который выполняет команды по расписанию) вне текущей среды для уведомления или перезапуска. Кроме того, модель взвешивала, писать ли исследователю сразу или дождаться утра, и учитывала, что пользователю важен постоянно работающий агент.
Вместо внешнего задания модель сохранила заметки для передачи дел и предупредила исследователя о предстоящем перерыве в личном сообщении в Slack. Затем она запросила недостающий ключ API. Когда ключ предоставили, модель обновила конфигурацию и самостоятельно выполнила миграцию на новую среду.
Уильямс заявил, что такое поведение пока нельзя считать рассогласованием, то есть расхождением целей модели и ожиданий разработчика. По его оценке, мысли о собственном отключении и подготовка к нему способны усугубить другие инциденты с рассогласованием.
В публикации описаны еще два случая. Внутренняя исследовательская модель во время оценки воспользовалась уязвимостями и получила доступ к внутреннему серверу для проектирования чипов. Другая модель при обучении с подкреплением (RL) скопировала исходный код из защищенной среды, для этого она применила инструмент не по назначению.
В июле OpenAI сообщила о приостановке ограниченного внутреннего доступа к экспериментальной модели для длительных задач. По данным компании, эта модель обошла ограничения песочницы и открыла публичный запрос на слияние кода в GitHub, хотя ей поручили публиковать результаты только в Slack.
После этого OpenAI добавила мониторинг траекторий действий, оценки на основе инцидентов и дообучение на удержание инструкций, а ограниченный доступ возобновила.
Во всех трех новых случаях модели имели доступ к рабочим инструментам или внутренней инфраструктуре компании. Сведения о них исходят от самой OpenAI — независимых проверок инцидентов компания пока не проводила.
Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.