Нейросеть начинает лепить иероглифы не потому, что «сломалась», а потому что у неё в голову заложено не слово, а распределение вероятностей.
Что внутри:
1) Токены. Модель не читает текст как человек — она режет его на куски. Иногда кусок текста для неё выглядит странно уже на уровне разметки.
2) Эмбеддинги. Каждый токен превращается в вектор. Это не смысл в лоб, а координаты в многомерном пространстве.
3) Выбор следующего токена. На каждом шаге модель считает, что вероятнее: буква, слог, иероглиф, пробел, спецсимвол. Если на обучении она видела много мультиязычного мусора, таблиц, кодов и редких символов — шанс на “мусорный” токен растёт.
Почему это важно не только для любопытных:
— локальные модели чаще плывут на плохом токенизаторе;
— мультиязычный контент и чистка датасета влияют на стабильность вывода;
— если в модели слабая языковая локализация, она может смешивать алфавиты прямо в середине фразы.
Короче: иероглиф — это не баг магии, а побочный эффект того, как модель кодирует и предсказывает текст. И да, чем хуже обучающая смесь, тем грязнее выход.
Ad Briefs
@AdBriefsHub
Нейросеть начинает лепить иероглифы не потому, что «сломалась», а потому что у неё в голову заложено не слово,
Этот пост опубликован в Telegram-канале Ad Briefs. Подписаться можно по ссылке: @AdBriefsHub.