cost_per_token — плохой KPI, если не считать длину контекста и output
Одна и та же модель может выглядеть дешёвой на коротких промптах и внезапно стать дорогой, когда вы кормите её длинным контекстом. Поэтому сравнивать ai_tools только по цене за 1M tokens — почти всегда самообман.
Смотрите не на «токен», а на сценарий:
— входной контекст: сколько символов реально уходит в prompt;
— выход: сколько слов/блоков модель обычно генерит;
— повторные вызовы: есть ли retries, tool-calls, перефразирование;
— обрезка: режете ли историю, чтобы влезть в окно.
В evals для marketing_ai полезно считать не абстрактный token, а cost per accepted output: сколько стоит один вариант крео, один валидный заголовок или одна финальная версия текста. Тогда llm с дорогим токеном, но низким браком, часто выигрывает у «дешёвого» конкурента.
Ещё ловушка — агентные цепочки. Если один запрос к llm превращается в 4 шага с проверкой, суммарный расход токенов растёт быстрее, чем качество. Benchmarks без учёта orchestration cost почти всегда врут.
Считайте стоимость не модели, а результата: один accepted output, один закрытый task, один пригодный креатив. Это и есть нормальный ориентир для evals, а не магия слова cost_per_token.
Compliance Brief — регуляторика рынка
@compliance_brief
cost_per_token — плохой KPI, если не считать длину контекста и output
Этот пост опубликован в Telegram-канале Compliance Brief — регуляторика рынка. Подписаться можно по ссылке: @compliance_brief.