Американские компании сначала поощряли сотрудников использовать как можно больше ИИ (практику называли токенмаксинг), а затем получили счета. Оказалось, что заранее оценить расходы трудно: согласно опросу Mavvrik и Benchmarkit, только 11% из 396 организаций смогли спрогнозировать траты на ИИ с точностью до 10% в обе стороны. Об этом пишет The Wall Street Journal.

Расход ИИ измеряется в токенах, то есть единицах текста, которые модель обрабатывает при выполнении задачи. Число токенов на конкретную задачу заранее неизвестно. В отличие от классического софта, ИИ действует как работник: выполняет шаги, принимает решения и допускает ошибки, и каждое его действие тарифицируется.
Исследователи из Университета Карнеги — Меллона, Microsoft Research и ряда других американских вузов проверили связь цены и фактических затрат. Они прогнали модели через более чем 6,8 тыс. задач по математике, программированию, науке и другим областям.
В 32% случаев модели с низкой ценой за токен обошлись дороже моделей с высокой ценой. Один из авторов, Лингцзяо Чен, заключил, что по цене токена нельзя судить о том, какая модель дешевле на практике.
Наглядный пример приводит WSJ. Один и тот же запрос на анализ кадра из видео выполнили Gemini 3.1 Pro и более легкая Gemini 3 Flash. Pro справилась за 85 шагов и потратила около $1. Flash сделала 952 шага, несколько раз упиралась в защиту от ботов, пыталась обратиться к другим чат-ботам и поисковикам, затем получила ошибку о превышении лимита токенов и не решила задачу. Стоимость неудачной попытки составила $14.
Расходы колеблются и у одной модели. В тесте шесть моделей — GPT-5.4, GPT-5.4 Mini, Gemini 3.1 Pro, Gemini 3 Flash, Claude Opus 4.7 и Claude Haiku 4.5 — получили запросы на генерацию кода. Каждый запрос выполнялся по пять раз, но в итоге цена каждого прогона даже для одной модели отличалась. Неудачные попытки тоже стоили денег.
Для моделей Anthropic WSJ запросил дополнительные данные, так как в исходное исследование они по этому показателю не входили. Google, Anthropic и OpenAI с тех пор выпустили новые модели, которые показывают более высокие результаты в отраслевых тестах.
Представитель Google заявила, что колебания на уровне отдельных запросов свойственны ИИ и сглаживаются на большом потоке задач. По ее словам, итоговая стоимость зависит от множества факторов, поэтому точно спрогнозить расход может быть сложно. Компания предлагает клиентам лимиты расходов и гибкие тарифы.
Опрос Mavvrik показывает масштаб последствий. В 62% организаций неожиданные расходы на ИИ изменили бизнес-решение за год. Среди них в 40% вопрос дошел до совета директоров, в 33% ввели экстренную заморозку трат, в 25% отложили или отменили внедрение ИИ. ИИ-ассистентами для разработки пользуются 98% компаний, но в отчетность по затратам их включают 42%. Стоит учесть, что Mavvrik сама продает инструменты управления затратами на ИИ.
Gartner прогнозирует, что стоимость ИИ-программирования к 2028 году превысит среднюю зарплату разработчика, и советует считать экономику на единицу результата, а не только расход токенов. WSJ рекомендует компаниям обучать сотрудников выбирать модель под задачу, иначе счета за ИИ превратятся в «черный ящик».
Подпишитесь на «Инк» в Telegram. Там мы пишем нескучным языком о самом важном для предпринимателей. Подписаться.