Как чистить генеративный текст от галлюцинаций до публикации без ручного ада
Разбираем пайплайн на атомы: сначала не «редактура», а валидация. Любой сгенерированный абзац прогоняйте через 3 фильтра: есть ли факты, есть ли источник для каждого факта, есть ли противоречия внутри текста. Если в предложении есть число, имя, ссылка на закон, API-метод или сравнение — это кандидат на проверку, а не на веру.
Дальше включается автоматическая очистка:
• извлекаем утверждения в список атомарных фактов;
• ищем по внутренней базе, БД продукта или документам knowledge base;
• помечаем всё, что не подтверждено, как needs review;
• удаляем «водяные» обобщения, если они не несут смысла для SEO-страницы.
Тестим связку API и баз данных: лучший шаблон — генерация → fact-check → rewrite только спорных фрагментов. Не надо переписывать весь текст целиком: это дороже по токенам и чаще ломает стиль. Правильнее просить модель вернуть JSON с полями claim, verdict, evidence, action. Тогда можно автоматически оставить подтверждённое, а спорное отправить в отдельную очередь.
Как не словить фильтр за thin content: запрещайте модели выдумывать ссылки, кейсы и цифры без контекста. Просите писать только то, что можно проверить по вашим данным, а для остального ставьте маркеры «нет подтверждения». Чем жестче схема валидации, тем меньше ручной правки и тем выше шанс, что контент пройдет модерацию и даст нормальную индексацию.
Итог простой: не лечите галлюцинации постфактум, стройте контур проверки до публикации — это дешевле, быстрее и масштабируется без роста команды.
AI-страницы в большом
@ai_bulk_pages_ubt
Как чистить генеративный текст от галлюцинаций до публикации без ручного ада
Этот пост опубликован в Telegram-канале AI-страницы в большом. Подписаться можно по ссылке: @ai_bulk_pages_ubt.