Semantic similarity на лендингах: как платформа ловит «другой» сайт с тем же смыслом
Платформы давно смотрят не только на текст в лоб. Для лендинга важны смысловые эмбеддинги: модель сравнивает заголовки, блоки оффера, FAQ, дисклеймеры и даже порядок смысловых секций. Если две страницы выглядят по-разному, но обещают одно и то же, для антифрода это уже не «новый сайт», а близкий клон.
Чаще всего триггерят повторы по таким слоям:
— одинаковая структура: hero → benefits → social proof → CTA
— перефразированный, но тот же оффер
— совпадающие вопросы в FAQ и одинаковые ответы
— повторяющиеся паттерны цифр, обещаний и ограничений
— шаблонные отзывы, где меняются только имена и гео
Отдельно ловится «пачка» страниц: когда домены разные, а смысловые векторы почти совпадают. Для моделей это выглядит как сетка клонированных прелендов, даже если картинки, шрифты и фон отличаются. OCR, извлечение текста и semantic similarity работают вместе: один слой пропустил, второй добрал совпадение. 🧩
Самая частая ошибка — менять визуал, но оставлять одинаковый narrative. Платформа не обязана видеть пиксель в пиксель; ей достаточно узнать тот же сценарий убеждения. Чем больше совпадений в ключевых блоках, тем выше шанс, что лендинг попадёт в категорию повторов и уйдёт в ручную или полуавтоматическую проверку.
Лучше думать не про «маскировку», а про уникальность смысловой архитектуры: разные акценты, другая логика блоков, собственные формулировки и отсутствие серийных шаблонов.
Creative Antifraud — AI-детекция креативов
@creative_antifraud
Semantic similarity на лендингах: как платформа ловит «другой» сайт с тем же смыслом
Этот пост опубликован в Telegram-канале Creative Antifraud — AI-детекция креативов. Подписаться можно по ссылке: @creative_antifraud.