LLM теперь можно настраивать по уровню "думать дольше или отвечать быстрее" 🤖
Разобрали, как современные модели получают разные режимы reasoning effort: через системные промпты, SFT, RLVR, штрафы за длину, budgets и on-policy-дистилляцию. В списке — DeepSeek V4, Nemotron 3 Ultra, Kimi K2.5 и K3, GLM-5, Qwen3 и Inkling.
Это полезно всем, кто работает с LLM: проще выбирать модель под задачу и не переплачивать за лишние токены, если нужен быстрый ответ.
IT Тверь — t.me/it_tver
IT Тверь
@it_tver
LLM теперь можно настраивать по уровню "думать дольше или отвечать быстрее" 🤖
Источники: