Анти-капча стек
Анти-капча стек
@anti_captcha_stack_ubt

OCR для текстовых капч ломается не на модели, а на подготовке картинки

OCR для текстовых капч ломается не на модели, а на подготовке картинки

Пробиваем защиту любой сложности: сначала чистим вход. Убираем шум, выравниваем контраст, режем фон, переводим в grayscale и приводим размер к стабильному диапазону. Если этого нет, даже хороший OCR будет путать похожие символы и деградировать на каждом втором запросе.

Бенчмарк сервисов решения капчи: для текстовых капч сравнивают не «точность в вакууме», а связку preprocessing + OCR + postprocessing. На практике решает словарь допустимых символов, whitelist по алфавиту задачи и фильтрация мусора после распознавания. Чем уже пространство ответов, тем меньше ложных срабатываний и ниже косты на повторные попытки.

Для нестабильных капч полезно прогонять несколько проходов: разный threshold, инверсия цветов, небольшой blur, потом majority vote по символам. Это особенно помогает, когда текст рвётся антиалиасингом или встраивается в полосы и сетку. Если капча короткая, постобработка часто даёт больше, чем смена самой OCR-библиотеки.

Снижаем косты на распознавание: не пытайтесь кормить OCR «как есть». Сначала нормализуйте картинку, потом ограничьте алфавит, затем валидируйте ответ по длине и шаблону. Так пайплайн становится стабильным, а неразборчивые кейсы проще отправлять в ручной фоллбек, чем жечь ресурсы на бесконечные повторы.
Этот пост опубликован в Telegram-канале Анти-капча стек. Подписаться можно по ссылке: @anti_captcha_stack_ubt.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.