Новости

ChatGPT начнет маркировать сгенерированные тексты невидимым водяным знаком

OpenAI начнет внедрять в ChatGPT технологию textGrain, которая будет незаметно маркировать сгенерированные тексты. С ее помощью можно будет проверить, присутствует ли в материале специальный сигнал OpenAI. Первоначально функцию начнут разворачивать для пользователей ChatGPT и Codex в Евросоюзе — это произойдет в течение ближайших недель.

Markus Winkler, Unsplash

В отличие от привычных водяных знаков, textGrain не добавляет в текст видимых пометок. Пользователь не увидит специальных символов, скрытых пробелов или необычных знаков препинания. Маркировка формируется во время генерации: система определенным образом меняет статистический паттерн выбора слов и токенов. После этого специальный детектор может проверить текст на наличие такого сигнала.

При этом технология рассчитана не только на исходный ответ. По данным OpenAI, водяной знак должен сохраняться при обычном копировании и вставке текста. Но если материал значительно изменить, обнаружить его становится сложнее.

OpenAI проверила это на практике. Если заменить примерно 10% слов в тексте на синонимы, показатель обнаружения водяного знака снижается с 92% до 66%. При замене четверти слов он падает до 17%. Поэтому textGrain нельзя считать защитой, которую невозможно обойти простым редактированием.

На точность проверки влияет и размер текста. При уровне ложных срабатываний в 1% детектор находил водяной знак примерно в 80% материалов объемом 200 токенов и примерно в 95% текстов на 400 токенов. Для очень коротких ответов технология менее эффективна. Сложности возникают и там, где модель ограничена в выборе формулировок — например, при работе с математическими задачами.

При этом textGrain не является универсальным детектором искусственного интеллекта. Технология позволяет искать именно сигнал, добавленный системами OpenAI. Если его нет, это еще не означает, что текст написал человек: маркировка может исчезнуть после серьезного редактирования или перевода, а текст вообще мог быть создан другой нейросетью.

В OpenAI также подчеркивают, что водяной знак не содержит персональных данных. По нему нельзя узнать автора, содержание исходного запроса или историю общения с ChatGPT. Он также не показывает, какую долю текста написал человек, а какую — нейросеть.

Компания утверждает, что внедрение маркировки не должно заметно ухудшать работу моделей. В проведенных тестах OpenAI не обнаружила существенной разницы в качестве и скорости генерации между вариантами с textGrain и без него.

На первом этапе технология будет применяться к подходящим ответам ChatGPT и Codex в Евросоюзе независимо от тарифа. Для API некоторых моделей маркировку уже можно включить по желанию разработчикам по всему миру, однако стандартно она отключена.

Сам инструмент для проверки текстов пока не станет общедоступным. OpenAI намерена предоставить доступ к детектору одобренным исследователям и экспертным организациям. Они смогут изучать точность технологии и ее устойчивость к различным способам редактирования.

В дальнейшем компания планирует открыть исходную технологию textGrain, чтобы другие разработчики могли использовать ее и создавать собственные решения на ее основе.

Появление маркировки в Евросоюзе связано в том числе с требованиями EU AI Act. Закон предусматривает использование машиночитаемых способов обозначения определенного контента, созданного генеративным ИИ. OpenAI решила внедрять собственную систему постепенно, поскольку признает, что у технологии пока есть ограничения.


Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.