Hallucination у LLM — это не баг, а режим по умолчанию без проверки фактов
В marketing_ai это ломает отчёты, крео и ответы саппорта: модель звучит уверенно, но может придумать метрику, кейс, закон или товарный атрибут. Чем длиннее контекст и чем слабее задача, тем выше шанс, что llm начнёт «достраивать» пробелы вместо того, чтобы признать неопределённость.
Что снижает риск:
— просить не «ответ», а ответ с опорой на входные данные;
— заставлять модель цитировать фрагменты, а не пересказывать смысл;
— разделять генерацию и проверку: сначала черновик, потом отдельный критик;
— запрещать догадки там, где нужен факт: цены, условия, доступность, характеристики.
Для evals это важно: hallucination редко выглядит как явная ошибка. Чаще это гладкий текст с одной неверной деталью, и именно она потом уезжает в рекламу, лендинг или CRM. Поэтому в benchmark надо проверять не только качество формулировки, но и степень привязки ответа к источнику.
Быстрый тест: дайте модели пустой или неполный вход и посмотрите, умеет ли она сказать «данных недостаточно», а не заполнять паузы фантазией. Если не умеет — ai_tools потребуется жёсткий guardrail, а не «ещё один промпт».
DevTools Brief — обзор инструментов
@devtools_brief
Hallucination у LLM — это не баг, а режим по умолчанию без проверки фактов
Этот пост опубликован в Telegram-канале DevTools Brief — обзор инструментов. Подписаться можно по ссылке: @devtools_brief.