Anthropic продаёт мощность, а рынок покупает фантазии.
80,3% на SWE-bench Pro, миграция Stripe за день, «самая сильная публичная модель» — красиво. Но для ops важен другой тест: сколько стоит не бенчмарк, а конечный продукт.
Проверка была простая: одним промптом собрать браузерную игру. Не «написать код», а собрать механику, баланс, интерфейс и концовки. Получился симулятор админа ИИ-канала — Нейровестник.
И вот где начинается драма.
Модель не просто генерит фичи. Она сразу принимает решения по экономике игры: что усиливать, что резать, где давать дофамин, а где штрафовать. То есть делает то, что обычно ломает команды на проде: смешивает продукт, баланс и контент в одну систему.
Для founder’а это важнее любых красивых процентов:
1. Если промпт даёт не кусок, а целый артефакт — падает стоимость прототипа.
2. Если модель тянет баланс, падает цена итерации.
3. Если она ещё и вшивает «мораль» в механику, значит, управляет поведением пользователя.
Мини-калькулятор:
time-to-MVP ↓ = меньше часов дизайна + меньше часов dev + меньше часов QA
Но есть и проигравшие.
Старый цикл «задача → ТЗ → разработка → правки» уже проигрывает тем, кто умеет собирать продукт целиком в одном проходе.
Итог сухой: бенчмарки продают статус, а такие тесты показывают unit economics. Если модель сокращает путь до работающего продукта, это не магия. Это пересчёт P&L.
Agency Math Notes
@AgencyMathPro
Anthropic продаёт мощность, а рынок покупает фантазии.
Этот пост опубликован в Telegram-канале Agency Math Notes. Подписаться можно по ссылке: @AgencyMathPro.