convert.umnetix Блог

Блог · Документы · 21 августа 2026

Текст из PDF не копируется: что такое скан и что с ним делать

Открываете договор в PDF, пытаетесь выделить абзац — а выделяется вся страница целиком, как картинка. Копировать нечего, поиск ничего не находит, конвертация в Word даёт документ с фотографией вместо текста. Разбираемся, почему так и что здесь реально помогает.

Два принципиально разных PDF

Схема обработки файла в три шага: загрузите, выберите инструмент, скачайте результат
Скан PDF не копируется — распознаём текст за три шага.

Расширение .pdf ничего не говорит о содержимом. Внутри может быть одно из двух.

Текстовый PDF сделан из программы: Word, Excel, 1С, бухгалтерский сервис. Внутри записаны настоящие символы с координатами. Текст выделяется, копируется, ищется, конвертируется в Word почти без потерь.

PDF со сканами получен из сканера, МФУ или камеры телефона. Внутри — изображения страниц. Букв в файле нет вообще: то, что вы видите, для программы просто набор пикселей. Ни выделить, ни найти, ни скопировать невозможно физически.

Как отличить за пять секунд

  1. Откройте документ в любом просмотрщике.
  2. Попробуйте выделить мышью одну строку.
  3. Выделяется текст — документ текстовый. Выделяется прямоугольник целиком или ничего — это скан.

Второй способ: нажмите Ctrl+F и поищите слово, которое точно есть на странице. Не находит — скан.

Отдельно встречается смешанный вариант: часть страниц из редактора, последняя — скан с подписями. Это нормально: после конвертации текстовая часть будет редактируемой, а страница с подписями останется картинкой.

Что такое OCR и чего от него ждать

OCR — распознавание символов. Программа анализирует изображение, находит на нём формы, похожие на буквы, и восстанавливает текст. Технология работает давно и в хороших условиях даёт точность выше 95%.

Ключевые слова — «в хороших условиях». На результат влияет всё: ровность страницы, освещение, контраст, шрифт, наличие печатей и рукописных пометок. Скан с чёткого принтерного оригинала распознаётся почти идеально. Фотография мятого договора при настольной лампе — плохо.

Где ошибается распознавание

Поэтому после распознавания текст всегда нужно вычитывать. Особенно суммы, даты, реквизиты и номера — то есть ровно то, ради чего документ обычно и распознают.

Как снимать документы, чтобы их можно было распознать

Половина проблем решается на этапе съёмки. Если под рукой нет сканера, а есть телефон:

Сняли — соберите страницы в один документ: картинки в PDF или, если снимали на iPhone, HEIC в PDF. Порядок страниц сохранится, а получатель увидит нормальный документ, а не россыпь фотографий.

Что можно сделать без распознавания

Часто задача решается проще, чем кажется.

Найти исходник

Самый недооценённый вариант. Если документ прислал контрагент, попросите у него файл из редактора — обычно он есть. Пять минут переписки экономят час вычитки распознанного текста.

Переписать нужный фрагмент вручную

Если из документа нужны два абзаца, перепечатать их быстрее и надёжнее, чем распознавать весь файл и потом искать ошибки.

Работать со сканом как есть

Для отправки, подписания и хранения текстовый слой не нужен вовсе. Скан можно сжать, чтобы он проходил по ограничениям почты, повернуть, если страницы легли боком, объединить с другими документами.

Превратить страницы в картинки

Если документ нужно вставить в презентацию или отправить туда, где принимают только изображения: PDF в картинки.

Когда нужен не текст, а смысл

Тут стоит остановиться и подумать, зачем вообще нужен текстовый слой. Чаще всего ответ такой: чтобы найти в документе конкретные условия, суммы, сроки или проверить, не изменилось ли что-то по сравнению с прошлой редакцией.

Если задача в этом, распознавание — лишний промежуточный шаг с риском ошибок. Разбор договора читает документ и показывает спорные условия. Извлечение данных собирает реквизиты, суммы и даты в таблицу. Сравнение редакций показывает, что изменилось между версиями.

Отдельная история — старые документы из семейного архива: свидетельства, письма, справки. Они часто выцвели, помялись и порвались, и распознать их не выйдет просто потому, что текст физически повреждён. Здесь сначала нужна реставрация изображения, и только потом всё остальное.

Коротко

Чем сканируют без сканера

Если документы приходится оцифровывать регулярно, стоит знать про режим сканирования в телефоне — он есть и без сторонних приложений.

На iPhone: в «Заметках» создайте новую заметку, нажмите на камеру и выберите «Отсканировать документы». Телефон сам найдёт границы листа, выправит перспективу и поднимет контраст.

На Android аналогичное умеет «Google Диск»: плюс в углу и «Сканировать». Результат сразу сохраняется в PDF.

Такие сканы заметно лучше обычных фотографий: страница выпрямлена, фон убран, контраст поднят. И распознаются они тоже лучше.

Как убедиться, что текстовый слой есть

Помимо выделения мышью есть более надёжная проверка: откройте документ и попробуйте найти через Ctrl+F слово, которое точно есть на странице.

Отдельно стоит знать про «двойные» PDF: некоторые сканеры кладут поверх картинки распознанный текст. Внешне это скан, но поиск работает. Такой файл конвертируется в Word нормально — правда, с ошибками распознавания, которые сканер сделал за вас.

Частые вопросы

Почему из PDF не копируется текст?
Скорее всего, документ собран из сканов или фотографий: внутри изображения страниц, а не символы. Копировать физически нечего.
Поможет ли конвертация PDF в Word?
Нет. Она перенесёт картинку в документ Word. Нужен OCR — распознавание символов.
Насколько точно распознавание?
На чётком скане с печатного оригинала — выше 95%. На фотографии мятого документа при плохом свете — существенно хуже. Вычитывать нужно всегда.
Как отличить скан от обычного PDF?
Попробуйте выделить строку мышью или найти слово через Ctrl+F. Не получается — это скан.
Что делать со сканом, если текст не нужен?
Его можно сжать, повернуть, объединить с другими документами или превратить в картинки — для этого текстовый слой не требуется.
Как правильно сфотографировать документ?
Ровная поверхность, рассеянный свет сбоку, камера параллельно листу, страница заполняет кадр целиком.

Читайте также

ДокументыКак перевести PDF в Word и не потерять форматирование

Почему после конвертации PDF в Word разъезжается вёрстка, в каких случаях этого не избежать и что сделать…

ДокументыКак сфотографировать документы телефоном и собрать в PDF

Как снять документы телефоном так, чтобы их приняли, собрать снимки в один PDF с правильным порядком стра…

ДокументыКак собрать документы в один PDF и разобрать обратно

Как склеить несколько PDF в один документ, вырезать нужные страницы, удалить лишние и уменьшить вес готов…

ИзображенияФото с iPhone не открывается: что такое HEIC и что с ним делать

Почему фотографии с iPhone не открываются на компьютере, что такое формат HEIC, как открыть его на Window…