Я не верю в бенчмарки, если они не проверяют поведение в стрессе.
Можно идеально считать математику и писать код — и при этом развалиться там, где нужно договариваться, торговаться и не паниковать.
В одном из свежих тестов LLM загнали в формат «Бункера»: ограниченные ресурсы, конфликт интересов, риск ошибочного выбора. И вот тут видно главное — не «умность», а стратегия.
Что наблюдаю:
1. часть моделей слишком быстро раскрывает все карты и теряет позицию;
2. часть уходит в жесткую рациональность, но проигрывает по доверию;
3. лучшие не спорят в лоб, а строят коалиции и меняют аргументы под контекст;
4. слабое место почти у всех — длинная социальная игра на несколько ходов вперед.
Для SEO тут прямой вывод: если вы оцениваете ИИ только по генерации текста, вы видите половину картины. Для контента важны не только ответы, но и устойчивость поведения: последовательность, гибкость, работа с ограничениями. 🤖
Проверять надо не «красоту» текста, а то, как модель держит позицию под давлением.
Яндекс Сигнал
@YandexSignalPro
Я не верю в бенчмарки, если они не проверяют поведение в стрессе.
Этот пост опубликован в Telegram-канале Яндекс Сигнал. Подписаться можно по ссылке: @YandexSignalPro.