TechSEO Lab
TechSEO Lab
@TechSEOLabPro

Поймать «иероглифы» в ответе LLM — это не баг шрифта. Это симптом того, как модель кодирует текст и где у неё

Поймать «иероглифы» в ответе LLM — это не баг шрифта. Это симптом того, как модель кодирует текст и где у неё ломается декодинг.

На входе у модели не «слова», а токены. Дальше они живут в многомерном пространстве эмбеддингов: близкие смыслы — близкие вектора, но это не словарь, а координаты. Модель не хранит фразы как строки, она постоянно прогнозирует следующий токен по вероятностям.

Что важно:
- если в распределении токенов у модели каша, она может выбрать редкий мусорный символ;
- если обучение на mixed data, в пространстве соседствуют латиница, кириллица, иероглифы, спецсимволы;
- при плохом температурном режиме или слабом контроле декодера вероятность «срыва» растёт.

То есть иероглиф — не магия, а побочный эффект того, как модель сжимает язык в векторное пространство и обратно раскручивает его в текст 🤖

Если хотите копать глубже: смотрите на токенизацию, logits, temperature, top-p и качество датасета. Именно там обычно и сидит причина.
Этот пост опубликован в Telegram-канале TechSEO Lab. Подписаться можно по ссылке: @TechSEOLabPro.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.