OCR: Подготовка изображения к распознаванию текста
В этом разделе
Распознавание текста из изображения идеального качества не требует предварительной обработки. К сожалению, большинство реальных документов далеки от идеального качества и требуют некоторой предварительной обработки (удаление шума, определение ориентации текста и т. д.) перед распознаванием, чтобы получить приемлемые результаты распознавания текста.
VintaSoft Imaging .NET SDK
и
VintaSoft Document Cleanup .NET Plug-in
предлагает профессиональные функции для обработки изображений документов перед запуском распознавания текста. Вот неполный список доступных функций:
- Автоинвертация (AutoInvertCommand) - автоматически инвертирует изображение документа.
- Очистка границ (BorderClearCommand) - автоматически преобразует темные границы в белый цвет фона.
- Выравнивание (DeskewCommand) - автоматически поворачивает указанное изображение, чтобы выровнять его.
- Удаление дыроколов (HolePunchRemovalCommand) - автоматически удаляет дыроколы на изображении.
- Удаление линий (LineRemovalCommand) - автоматически удаляет линии на изображении документа (линии форм, таблиц, подчеркивания/зачеркивания текста, шумы).
- Автоинвертация текста (AutoTextInvertCommand) - автоматически инвертирует перевернутый текст на изображении документа.
- Удаление пятен (DespeckleCommand) - автоматически удаляет пятна с изображения.
- Удаление границы (BorderRemovalCommand) - автоматически удаляет темную границу.
- Сегментация документа ([команда DocumentSegmentationCommand]) - определяет различные типы зон на изображении, такие как текст, графика, линии.
В зависимости от качества изображения эти команды можно использовать отдельно или одновременно.
OcrPreprocessingCommand можно использоваться для упрощения кода и одновременного использования нескольких команд обработки изображений. Эта составная команда объединяет некоторые наиболее часто используемые команды обработки изображений, предназначенные для запуска перед распознаванием текста.