OCR (Optical Character Recognition) находит на изображении буквы и цифры и возвращает их обычным текстом. Именно эта технология позволяет достать содержимое из фотографии документа или из скана, внутри которого нет текстового слоя.
Как работает распознавание
Страница проходит несколько шагов: выравнивание наклона, отделение текста от фона, поиск строк и слов, затем сопоставление изображения каждого символа с известными начертаниями с учётом языка. На выходе получается текст, который можно искать, копировать и править.
От чего зависит результат
Главный фактор — исходное изображение. Скан на 300 DPI распознаётся почти без ошибок, фотография под углом и при слабом свете — заметно хуже. Мешают шум, тени, рукописный текст и нестандартные шрифты. Таблицы требуют отдельного шага, иначе структура строк и столбцов теряется.