OCR для текстовых капч: как не сломать пайплайн на ровном месте
Если капча рендерится в canvas или приходит картинкой, OCR часто дешевле и стабильнее, чем полный браузерный стек. Но выигрыш появляется только после нормальной подготовки входа: бинаризация, выравнивание контраста, удаление шума, жесткий кроп по области текста. Без этого распознавание начинает плясать на мелких шрифтах, антиалиасинге и фоновых линиях.
Бенчмарк сервисов решения капчи: сначала меряйте не «точность», а связку «время предобработки + время распознавания + доля ручных ретраев». Если OCR ошибается на одних и тех же символах, обычно виноваты не буквы, а плохая сегментация: текст слипся, рамка задела символ, цветовой канал выбран неверно.
Логика обхода поведенческих паттернов: не гоняйте OCR в лоб на каждый запрос. Ставьте fallback-цепочку — один быстрый проход, затем повтор с другим порогом, потом переключение на иной движок или на шаблонный матчинг для ограниченного алфавита. Для капч из цифр и заглавных букв это особенно заметно: узкий словарь режет ошибки сильнее, чем попытка «умного» распознавания.
Снижаем косты на распознавание: кэшируйте типы капч по хосту, храните статистику по ошибкам символов и выкидывайте заведомо плохие кадры до OCR. Если картинка слишком шумная, дешевле сразу уйти в резервный сценарий, чем тратить цикл на гарантированный брак. Итого: не OCR «решает» текстовую капчу, а пайплайн вокруг него.
Анти-капча стек
@anti_captcha_stack_ubt
OCR для текстовых капч: как не сломать пайплайн на ровном месте
Этот пост опубликован в Telegram-канале Анти-капча стек. Подписаться можно по ссылке: @anti_captcha_stack_ubt.