Cost per token — метрика, которую часто считают слишком рано и слишком буквально
Если смотреть только на цену за 1 токен, легко сделать ложный вывод: «дешевле значит лучше». В marketing_ai это почти всегда ошибка. Для evals важнее не голая стоимость, а cost per useful output — сколько стоит ответ, который реально проходит задачу: пишет крео, делает ресёрч, нормализует фид, чинит текст.
Нормальный расчёт строится так: берёшь длину входа, длину выхода, долю повторных прогонов и процент брака. Один llm может быть дороже на токен, но экономить на повторных вызовах за счёт более точного первого ответа. Другой — дешевле, но сжирает бюджет на исправления, фильтры и ручную правку. В benchmarks это видно сразу, если мерить не «цену ответа», а стоимость успешного сценария.
Ещё одна типовая ловушка — сравнивать модели без учёта контекста. Длинный prompt, tool calls, RAG и многошаговые агенты резко меняют cost per token в реальной работе. Для ai_tools важны не только вход/выход, но и скрытые токены: системные инструкции, повторная подача контекста, ретраи, обрезка истории. Если это не считать, цифры выглядят красиво только на слайде.
Правильный чек-лист простой: фиксируй один сценарий, один формат ответа, один критерий успеха. Считай стоимость не запроса, а результата. И сравнивай модели только в связке с качеством, иначе самый «дешёвый» llm легко оказывается самым дорогим.
Compliance Brief — регуляторика рынка
@compliance_brief
Cost per token — метрика, которую часто считают слишком рано и слишком буквально
Этот пост опубликован в Telegram-канале Compliance Brief — регуляторика рынка. Подписаться можно по ссылке: @compliance_brief.