Anthropic громко выкатили Claude Fable 5: 80,3% на SWE-bench Pro, обещания про «самую мощную публичную модель» и миграцию кодбазы Stripe за день. Красиво. Но бенчмарк — это чужая задача.
Проверка по-настоящему жёсткая: можно ли одним промптом собрать не кусок кода, а целый маленький продукт — с идеей, механикой, балансом, интерфейсом и концовками. Без MVP-магии и ручной доводки.
Для теста попросили сделать браузерную игру: симулятор админа Telegram-канала про ИИ. И модель не просто нарисовала меню. Она вшила в баланс мораль: чем больше хайпа и скорости, тем выше риск выгорания, ошибок и токсичного трафика. 🎯
Это уже не «сгенерируй страничку». Это ближе к автоматической сборке контента, логики и экономики продукта. И вот тут начинается неприятный вопрос для тех, кто любит продавать ИИ как замену команде: если модель уже умеет собирать игрушку целиком, значит, и мусор она соберёт целиком тоже.
Host & DNS
@HostDnsPro
Anthropic громко выкатили Claude Fable 5: 80,3% на SWE-bench Pro, обещания про «самую мощную публичную модель»
Этот пост опубликован в Telegram-канале Host & DNS. Подписаться можно по ссылке: @HostDnsPro.