💡 Датасеты для fine-tuning: синтетика против реальных данных
Раньше я убивал недели на разметку данных руками. Сейчас уверен: качественная синтетика через сильные модели типа DeepSeek R1 или модели OpenAI часто работает лучше, чем «грязные» логи реального чата.
Моя схема сейчас:
⭐️ беру 500 примеров из реальной переписки, чтобы поймать стиль
⭐️ генерирую 5000 вариаций на их основе через LLM
⭐️ прогоняю всё через скрипт фильтрации на стоп-слова и длину
Ребят, не бойтесь синтетики, главное — дайте модели правильный системный промпт для генерации. А вы чем наполняете обучающую выборку?
➖➖➖➖➖➖➖➖➖➖
Антон Хоменок про дообучение LLM 🧠
Хоменок про дообучение LLM 🧠
@xomenok_llmft
💡 Датасеты для fine-tuning: синтетика против реальных данных
Этот пост опубликован в Telegram-канале Хоменок про дообучение LLM 🧠. Подписаться можно по ссылке: @xomenok_llmft.