Парсинг комментариев Telegram ломается не на API, а на хаосе в самих ветках
Если собирать комментарии «в лоб», быстро упираешься в три вещи: ответы внутри ответов, удалённые сообщения и разъезд между постом и обсуждением. Поэтому сначала фиксируй не текст, а связку: пост → discussion thread → message_id. Без этого дальше начинается путаница с дублями и потерянными реплаями.
Что важно сохранять в базе:
— chat_id и thread_id, чтобы не смешивать ветки;
— message_id и reply_to_message_id, чтобы восстановить дерево;
— author_id, timestamp и edit_date, если нужны правки;
— служебные флаги: удалено, скрыто, без текста, только медиа.
Отдельно проверь кейсы с пустыми комментариями, пересланными сообщениями и стикерами. Они часто ломают парсер, если код ожидает только обычный текст. Ещё одна типовая ошибка — брать комментарии по лимиту выборки и считать, что ветка «закончилась», хотя часть сообщений приходит позже. Лучше делать повторный проход по уже собранным thread_id и добирать хвост.
Если нужна аналитика, нормализуй текст до одной формы: убирай лишние пробелы, ссылки, повторяющиеся эмодзи и одинаковые цитаты. Тогда станет проще искать спам, частотные темы и токсичные реплики, а не бороться с шумом. Главное правило простое: сначала строй структуру ветки, потом анализируй содержимое.
Telegram Automation & Userbots: парсинг и автопостинг
@tg_automation_userbots
Парсинг комментариев Telegram ломается не на API, а на хаосе в самих ветках
Этот пост опубликован в Telegram-канале Telegram Automation & Userbots: парсинг и автопостинг. Подписаться можно по ссылке: @tg_automation_userbots.