Поймать «иероглифы» в ответе LLM — это не баг шрифта. Это симптом того, как модель кодирует текст и где у неё ломается декодинг.
На входе у модели не «слова», а токены. Дальше они живут в многомерном пространстве эмбеддингов: близкие смыслы — близкие вектора, но это не словарь, а координаты. Модель не хранит фразы как строки, она постоянно прогнозирует следующий токен по вероятностям.
Что важно:
- если в распределении токенов у модели каша, она может выбрать редкий мусорный символ;
- если обучение на mixed data, в пространстве соседствуют латиница, кириллица, иероглифы, спецсимволы;
- при плохом температурном режиме или слабом контроле декодера вероятность «срыва» растёт.
То есть иероглиф — не магия, а побочный эффект того, как модель сжимает язык в векторное пространство и обратно раскручивает его в текст 🤖
Если хотите копать глубже: смотрите на токенизацию, logits, temperature, top-p и качество датасета. Именно там обычно и сидит причина.
TechSEO Lab
@TechSEOLabPro
Поймать «иероглифы» в ответе LLM — это не баг шрифта. Это симптом того, как модель кодирует текст и где у неё
Этот пост опубликован в Telegram-канале TechSEO Lab. Подписаться можно по ссылке: @TechSEOLabPro.