Анти-капча стек
Анти-капча стек
@anti_captcha_stack_ubt

OCR для текстовых капч: где ломается распознавание и как поднять точность

OCR для текстовых капч: где ломается распознавание и как поднять точность

Текстовая капча кажется простой только на картинке. На практике OCR падает на трёх вещах: шум, нестабильная сегментация символов и нестандартный шрифт. Если на входе есть смаз, рваные контуры или перекрытие знаков, то распознавание превращается в угадывание, а не в чтение.

Рабочая схема обычно такая: — приводим изображение к бинарному виду; — режем фон и артефакты морфологией; — фиксируем высоту и контраст; — проверяем, не ломает ли ресайз форму символов. Для капч с одним словом OCR часто даёт лучший результат, чем для наборов из разрозненных букв.

Дальше упираемся в постобработку. Словарь допустимых символов, regex по длине ответа и фильтр по confidence сокращают число мусорных отправок. Если капча содержит только цифры или ограниченный алфавит, точность растёт заметно сильнее, чем от попыток “обучить всё подряд”. Бенчмарк сервисов решения капчи: на чистом входе выигрывает не самый “умный” движок, а тот, который меньше ошибается на сегментации.

Снижаем косты на распознавание: сначала прогоняем OCR на дешёвом пайплайне, потом отправляем в запасной канал только неуверенные кадры. Так вы не платите за ручной или внешним API каждый запрос, а держите стабильный процент успешного чтения.
Этот пост опубликован в Telegram-канале Анти-капча стек. Подписаться можно по ссылке: @anti_captcha_stack_ubt.
tech

Свежие посты в категории «Tech Infrastructure»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.