Решил провести тест отсканированной и немного обработанной в STA странички Толково-энциклопедического словаря.
https://cloud.mail.ru/public/jW4Y/38pik4L4nЗдесь 5 файлов:
- исходный файл изображения tif
- 4 файла PDF, созданные в различных программах с поиском
--- pdfa-файл в Файнридере 12
--- pdfa-файл в Файнридере 16
--- pdfa-файл в Контентридере 16
--- pdf-файл с поиском в Контентридере 16.
Заметил, что в CR16 файл просто pdf-с поиском занимает в разы менее места чем pdfa.
Распознавал страничку языками английский и русский под ударениями.
Предобработка отключена. Я ее сделал в STA.
Кроме бинаризации. На выходе сохранил страницы tif цветной 600dpi. Самый исходник в jpg и занимает 5mb.
Но, многие исходники с перекосом и еще, я привел все страницы к одному размеру.
Если он нужен, то вот он
https://cloud.mail.ru/public/3Lon/TtCs95x89Сканировал не я, в jpg не сохраняю сканы принципиально, но книга уж больно ценная.
При сохранении в PDF и PDFA я выбирал сбалансированное качество и отключал опцию presicion scan для символов.
Интересно, мнение спецов, какое качество из 4 файлов лучше, в плане не столько изображения, сколько самого текста, чтобы поиск по нему был с минимумом ошибок.
P.S. Файнридер 15 пиратский или лицензионный у меня не ставятся даже после танцев с бубном. Первый просит включить службу лицензирования, второй файл лицензии. Первую я ему включал, тогда он пишет, что хочет лицензионный ключ, а файла лицензии у меня нет.