Что такое OCR
OCR (Optical Character Recognition, оптическое распознавание символов) — технология, которая находит буквы на картинке и превращает их в обычный текст. Скан или фото документа — это просто изображение: в нём нельзя выделить слово, найти фразу поиском или исправить опечатку. После распознавания текст можно копировать, редактировать в Word и искать.
Как получить хороший результат
- Снимайте документ сверху, без наклона и при ровном свете.
- Обрежьте лишнее: стол, пальцы, края — обрезать фото.
- Если в PDF уже есть текстовый слой, быстрее и точнее перевести PDF в Word напрямую.
Частые вопросы
Какие файлы можно распознать?
Фото и сканы (JPG, PNG, HEIC, WEBP) и PDF, в том числе многостраничные сканы. Можно выбрать сразу несколько файлов.
Насколько точно распознаётся текст?
Чёткий печатный текст на ровном скане распознаётся почти без ошибок. Хуже — рукописный текст, мелкий шрифт, фото под углом и в тени. Для лучшего результата сканируйте с разрешением 300 dpi.
Файлы загружаются на сервер?
Нет, распознавание идёт в браузере. Из интернета скачиваются только программа распознавания и словари языков (один раз, около 15 МБ), сам документ никуда не отправляется.