Новости

Исследователи назвали слова, по которым можно определить, что текст написала нейросеть

Исследователи агентства Graphite выявили в текстах модели Claude Opus 5.5 более 2,5 тыс. слов, фраз и конструкций, по которым можно отличить человеческий текст от сгенерированного ИИ. При этом длинное тире, которое считалось главным признаком ИИ-текста, из речи модели практически исчезло.

Unsplash

Graphite, исследовательское агентство в сфере продвижения, сравнило 10 тыс. статей, созданных Opus 5.5, с 10 тыс. статей людей на те же темы. Признаками ИИ-текста (tells) авторы считают слова, обороты и закономерности, которые встречаются в сгенерированных материалах минимум вдвое чаще, чем в человеческих.

Anthropic заявляет, что новая модель общается естественнее предыдущих. По данным Graphite, у Opus 5.5 признаков меньше, чем у прежних версий линейки, но их все равно еще очень много.

Например, ИИ чаще людей употребляет слова «надежный» (в 23 раза чаще людей), «яснее» (в 14 раз) и «имеет значение» (в 13 раз чаще). Также нейросеть часто использует слова «тихо» и «практичный» — в 11 раз чаще, чем в текстах людей. По словам исследователей, одно такое слово редко выдает ИИ-авторство, но набор этих маркеров создает узнаваемый почерк.

Гораздо показательнее частота употребления словосочетаний. Например, сочетание «имеет значение, потому что» (Matters because) нейросеть использует в 146 раз чаще, «особенно ценный» (especially valuable) в 136 раз чаще. 

Также авторы обнаружили конструкции из трех слов, которые люди не используют совсем, тогда как ИИ-модели — довольно часто. В список вошли «помогает понять» (helps to understand), «статья объясняет, что» (article explains what), «это важно, потому что» (this matters because), «вместе взятые, они» (taken together these) и «это руководство проводит читателя» (this guide walks).

Помимо слов исследователи оценили стилистические особенности. Сильнее всего от человеческих текстов отличаются более высокое лексическое разнообразие, более длинные слова, шаблонные концовки, больший объем текстов и частое использование запятых.

Длинное тире практически перестало быть признаком ИИ. Opus 5.5 использует 0,015 такого знака на 1 тыс. слов — на 99% меньше, чем у Opus 5. Показатель составляет менее 1% от уровня людей, поэтому теперь тире чаще указывает на авторство человека, чем нейросети.

Модель также реже использует манерную прозу, то есть образные выражения и метафоры вместо прямых утверждений. По шкале исследователей, у Opus 5.5 этот показатель на 37% ниже, чем у Opus 5. Тем не менее манерность остается выше человеческой: модель выбирает образность вместо прямой речи в 1,6 раза чаще авторов-людей.


Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.