Автоматическая перелинковка на 100k+ страницах: как не утонуть в thin content
Разбираем пайплайн на атомы: сначала строим граф сущностей, потом считаем релевантность, и только затем ставим ссылки. Не наоборот. Если лить автолинки по совпадению ключей, сайт быстро превращается в шумный комбайн: много внутренних переходов, мало пользы для обхода и индексации.
Рабочая схема:
— берём page_id, title, H1, entities, topic_cluster;
— считаем similarity по эмбеддингам или TF-IDF;
— отсекаем дубли, каннибализацию и страницы с низким спросом;
— ограничиваем исходящие ссылки на страницу, чтобы не размазывать вес.
Тестим связку API и баз данных: результат лучше писать не сразу в HTML, а в таблицу связей. Там удобно держать статус, вес, anchor, target_url, reason. Потом отдельный генератор вставляет ссылки в шаблон по правилам: только в контентных блоках, не в меню, не в футере, не в первом экране.
Как не словить фильтр за thin content: каждая ссылка должна объяснять переход. Если анкор повторяется на сотнях страниц без контекста, это уже не перелинковка, а автоспам. Полезно держать whitelist сущностей, blacklist страниц и регулярную переоценку графа, чтобы старые связи не тащили мусор.
Масштабируем выдачу до бесконечности: автоматизация внутренней перелинковки работает, когда у неё есть правила качества, а не просто крон и regex.
AI-страницы в большом
@ai_bulk_pages_ubt
Автоматическая перелинковка на 100k+ страницах: как не утонуть в thin content
Этот пост опубликован в Telegram-канале AI-страницы в большом. Подписаться можно по ссылке: @ai_bulk_pages_ubt.