Текст из PDF не копируется: что такое скан и что с ним делать
Открываете договор в PDF, пытаетесь выделить абзац — а выделяется вся страница целиком, как картинка. Копировать нечего, поиск ничего не находит, конвертация в Word даёт документ с фотографией вместо текста. Разбираемся, почему так и что здесь реально помогает.
Два принципиально разных PDF

Расширение .pdf ничего не говорит о содержимом. Внутри может быть одно из двух.
Текстовый PDF сделан из программы: Word, Excel, 1С, бухгалтерский сервис. Внутри записаны настоящие символы с координатами. Текст выделяется, копируется, ищется, конвертируется в Word почти без потерь.
PDF со сканами получен из сканера, МФУ или камеры телефона. Внутри — изображения страниц. Букв в файле нет вообще: то, что вы видите, для программы просто набор пикселей. Ни выделить, ни найти, ни скопировать невозможно физически.
Как отличить за пять секунд
- Откройте документ в любом просмотрщике.
- Попробуйте выделить мышью одну строку.
- Выделяется текст — документ текстовый. Выделяется прямоугольник целиком или ничего — это скан.
Второй способ: нажмите Ctrl+F и поищите слово, которое точно есть на странице. Не находит — скан.
Отдельно встречается смешанный вариант: часть страниц из редактора, последняя — скан с подписями. Это нормально: после конвертации текстовая часть будет редактируемой, а страница с подписями останется картинкой.
Что такое OCR и чего от него ждать
OCR — распознавание символов. Программа анализирует изображение, находит на нём формы, похожие на буквы, и восстанавливает текст. Технология работает давно и в хороших условиях даёт точность выше 95%.
Ключевые слова — «в хороших условиях». На результат влияет всё: ровность страницы, освещение, контраст, шрифт, наличие печатей и рукописных пометок. Скан с чёткого принтерного оригинала распознаётся почти идеально. Фотография мятого договора при настольной лампе — плохо.
Где ошибается распознавание
- Похожие символы: русская «о» и латинская «o», цифра 0 и буква О, 1 и I.
- Числа в таблицах: одна неверная цифра в сумме — и документ придётся перепроверять целиком.
- Печати и подписи поверх текста.
- Рукописные пометки на полях.
- Мелкий шрифт в сносках и примечаниях.
Поэтому после распознавания текст всегда нужно вычитывать. Особенно суммы, даты, реквизиты и номера — то есть ровно то, ради чего документ обычно и распознают.
Как снимать документы, чтобы их можно было распознать
Половина проблем решается на этапе съёмки. Если под рукой нет сканера, а есть телефон:
- Кладите лист на ровную однотонную поверхность, лучше тёмную — так границы страницы видны чётче.
- Свет должен быть рассеянным и падать сбоку. Прямая вспышка даёт блик посередине страницы.
- Держите камеру параллельно листу, а не под углом — иначе строки «сходятся» к краю.
- Заполняйте кадр страницей целиком, без стола вокруг.
- Проверяйте резкость до того, как уйдёте: смазанный кадр не спасёт никакая программа.
Сняли — соберите страницы в один документ: картинки в PDF или, если снимали на iPhone, HEIC в PDF. Порядок страниц сохранится, а получатель увидит нормальный документ, а не россыпь фотографий.
Что можно сделать без распознавания
Часто задача решается проще, чем кажется.
Найти исходник
Самый недооценённый вариант. Если документ прислал контрагент, попросите у него файл из редактора — обычно он есть. Пять минут переписки экономят час вычитки распознанного текста.
Переписать нужный фрагмент вручную
Если из документа нужны два абзаца, перепечатать их быстрее и надёжнее, чем распознавать весь файл и потом искать ошибки.
Работать со сканом как есть
Для отправки, подписания и хранения текстовый слой не нужен вовсе. Скан можно сжать, чтобы он проходил по ограничениям почты, повернуть, если страницы легли боком, объединить с другими документами.
Превратить страницы в картинки
Если документ нужно вставить в презентацию или отправить туда, где принимают только изображения: PDF в картинки.
Когда нужен не текст, а смысл
Тут стоит остановиться и подумать, зачем вообще нужен текстовый слой. Чаще всего ответ такой: чтобы найти в документе конкретные условия, суммы, сроки или проверить, не изменилось ли что-то по сравнению с прошлой редакцией.
Если задача в этом, распознавание — лишний промежуточный шаг с риском ошибок. Разбор договора читает документ и показывает спорные условия. Извлечение данных собирает реквизиты, суммы и даты в таблицу. Сравнение редакций показывает, что изменилось между версиями.
Отдельная история — старые документы из семейного архива: свидетельства, письма, справки. Они часто выцвели, помялись и порвались, и распознать их не выйдет просто потому, что текст физически повреждён. Здесь сначала нужна реставрация изображения, и только потом всё остальное.
Коротко
- Если текст не выделяется — внутри картинка, и это не поломка файла.
- Конвертация в Word такому документу не поможет: она перенесёт изображение.
- Распознавание помогает, но требует вычитки — особенно цифр.
- Часто быстрее найти исходник или перепечатать нужный фрагмент.
- Если цель — понять содержание документа, разбор документа решает задачу напрямую.
Чем сканируют без сканера
Если документы приходится оцифровывать регулярно, стоит знать про режим сканирования в телефоне — он есть и без сторонних приложений.
На iPhone: в «Заметках» создайте новую заметку, нажмите на камеру и выберите «Отсканировать документы». Телефон сам найдёт границы листа, выправит перспективу и поднимет контраст.
На Android аналогичное умеет «Google Диск»: плюс в углу и «Сканировать». Результат сразу сохраняется в PDF.
Такие сканы заметно лучше обычных фотографий: страница выпрямлена, фон убран, контраст поднят. И распознаются они тоже лучше.
Как убедиться, что текстовый слой есть
Помимо выделения мышью есть более надёжная проверка: откройте документ и попробуйте найти через Ctrl+F слово, которое точно есть на странице.
Отдельно стоит знать про «двойные» PDF: некоторые сканеры кладут поверх картинки распознанный текст. Внешне это скан, но поиск работает. Такой файл конвертируется в Word нормально — правда, с ошибками распознавания, которые сканер сделал за вас.
Частые вопросы
- Почему из PDF не копируется текст?
- Скорее всего, документ собран из сканов или фотографий: внутри изображения страниц, а не символы. Копировать физически нечего.
- Поможет ли конвертация PDF в Word?
- Нет. Она перенесёт картинку в документ Word. Нужен OCR — распознавание символов.
- Насколько точно распознавание?
- На чётком скане с печатного оригинала — выше 95%. На фотографии мятого документа при плохом свете — существенно хуже. Вычитывать нужно всегда.
- Как отличить скан от обычного PDF?
- Попробуйте выделить строку мышью или найти слово через Ctrl+F. Не получается — это скан.
- Что делать со сканом, если текст не нужен?
- Его можно сжать, повернуть, объединить с другими документами или превратить в картинки — для этого текстовый слой не требуется.
- Как правильно сфотографировать документ?
- Ровная поверхность, рассеянный свет сбоку, камера параллельно листу, страница заполняет кадр целиком.