OCR для текстовых капч: где ломается распознавание и как поднять точность
Текстовая капча кажется простой только на картинке. На практике OCR падает на трёх вещах: шум, нестабильная сегментация символов и нестандартный шрифт. Если на входе есть смаз, рваные контуры или перекрытие знаков, то распознавание превращается в угадывание, а не в чтение.
Рабочая схема обычно такая: — приводим изображение к бинарному виду; — режем фон и артефакты морфологией; — фиксируем высоту и контраст; — проверяем, не ломает ли ресайз форму символов. Для капч с одним словом OCR часто даёт лучший результат, чем для наборов из разрозненных букв.
Дальше упираемся в постобработку. Словарь допустимых символов, regex по длине ответа и фильтр по confidence сокращают число мусорных отправок. Если капча содержит только цифры или ограниченный алфавит, точность растёт заметно сильнее, чем от попыток “обучить всё подряд”. Бенчмарк сервисов решения капчи: на чистом входе выигрывает не самый “умный” движок, а тот, который меньше ошибается на сегментации.
Снижаем косты на распознавание: сначала прогоняем OCR на дешёвом пайплайне, потом отправляем в запасной канал только неуверенные кадры. Так вы не платите за ручной или внешним API каждый запрос, а держите стабильный процент успешного чтения.
Анти-капча стек
@anti_captcha_stack_ubt
OCR для текстовых капч: где ломается распознавание и как поднять точность
Этот пост опубликован в Telegram-канале Анти-капча стек. Подписаться можно по ссылке: @anti_captcha_stack_ubt.