🎁 Как выбрать базовую модель под fine-tuning — 3 фактора
Ребят, вопрос «Llama или Mistral» задают каждую неделю. Отвечаю системно.
🔸 Смотри лицензию. Llama до 700 млн MAU — ок, дальше платишь. Mistral Apache 2.0 — свободно везде. Qwen — китайская, тонкости с американским рынком.
🔸 Смотри размер контекста. Если у тебя длинные диалоги/документы — минимум 32к, лучше 128к.
🔸 Смотри качество на твоём языке. Русский лучше всего понимают Qwen 2.5, Llama 3.3, Mistral Nemo. Меньшие модели проседают.
Мой стек по умолчанию — Qwen 2.5 для русского, Llama 3.3 для англо-миксов. За полтора года не подводили.
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
🎁 Как выбрать базовую модель под fine-tuning — 3 фактора
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.