Тулси
Назад в блог

Гайды

Отсканированный PDF в Markdown: когда нужен OCR

12 мин чтения

Отсканированный PDF хранит страницы как картинки. Мышь не выделяет абзац, копирование даёт пустоту или обрывки. Markdown вы получаете после распознавания текста с изображения: сначала лист как JPG или фото, потом разметка. Если слова в PDF выделяются, текстовый слой есть: откройте PDF → Markdown. Путь для текстовых файлов: как перевести PDF в Markdown. Для «немых» страниц точка входа фото в Markdown: вы загружаете JPG, PNG или WebP, сам .pdf инструмент не принимает. Про движок конвертера: что такое MarkItDown. Формулировки вроде «pdf скан в текст» разобраны в конце.

Почему скан PDF молчит при копировании

Сканер или телефон снимает лист целиком. Программа кладёт снимок внутрь PDF: буквы видны глазами, для компьютера это пиксели. Текстового слоя нет. Поиск по фразе, копирование абзаца и конвертация «в Markdown» опираются на этот слой. Без слоя вы из конвертера текста не получите.

Вы получаете такие файлы: договоры с МФУ, методички с фотокопира, «PDF с телефона» из приложения-сканера, архивы, которые сохранили как картинку «для верности». Файл открывается, печатается, уходит на почту. Правка одного абзаца уже не выходит: выделяется рамка страницы, не слова.

Запросы «pdf скан в текст» и «скан пдф в текст онлайн» как раз про этот зазор. Вы ждёте редактируемый текст. На выходе та же картинка в другой обёртке. Markdown здесь нужен как рабочий .md для заметок, базы и поиска.

Путаница с соседними задачами стоит времени. «Сканировать в PDF» собирает картинки в файл. «PDF в сканированный PDF» часто значит наоборот: сплющить текстовый документ в картинки. Здесь направление одно: из уже готового скана получить текст и разметку.

Как отличить скан от текстового PDF

Откройте файл в любом просмотрщике. Попробуйте выделить абзац мышью, как в Word. Курсор цепляет слова, копирование кладёт фразу в буфер: это текстовый PDF. Курсор рисует прямоугольник на всю страницу, в буфере пусто или мусор: это скан или страница, сохранённая как изображение.

Второй быстрый признак: поиск по редкому слову из середины документа. Нашли вхождения: слой есть. Поиск молчит, хотя слово на экране видно: слоя нет. Третий признак: зум. На скане буквы на большом увеличении распадаются на точки и ступеньки. В текстовом PDF контуры остаются чёткими.

По имени файла судить рано. dogovor-text.pdf бывает пачкой фото. scan-012.PDF иногда собран из Word с нормальным слоем. Смотрите поведение курсора, не название.

Смешанные файлы встречаются: первые листы из Word, приложения сфотографированы. Проверьте две-три страницы из разных частей, не только титул. Иначе вы решите, что «весь PDF текстовый», а середина останется картинкой.

Текстовый слой: слова выделяются

Вы получаете слой при экспорте из Word, вёрстки, сайта. Иногда его добавили позже отдельным распознаванием и сохранили поверх картинки. Для конвертации в Markdown этого достаточно: PDF → Markdown читает слой и собирает заголовки, списки, простые таблицы.

Не гоните такой файл в распознавание «на всякий случай». Вы потратите лимит и получите второй, более грязный текст: колонки поедут, колонтитулы удвоятся. Сначала текстовый путь из статьи как перевести PDF в Markdown.

Страницы-картинки: слоя нет

Каждая страница это фото. Конвертер текстового PDF отдаст пустоту, обрывки или только метаданные вроде имени файла. Распознавание здесь обязательный шаг.

Рабочий порядок: выгрузить листы картинками или снять бумагу камерой, затем фото в Markdown. Сам .pdf на эту страницу не кладут: инструмент ждёт JPG, PNG или WebP.

Когда нужно распознавание текста

Распознавание нужно, когда вы хотите править, искать и класть текст в заметки, а в файле только картинки страниц. Оно не нужно, если слой уже есть и абзац копируется. Оно также лишнее, если вам достаточно самого PDF для печати, подписи или отправки в форму, где ждут скан «как есть».

Ориентир по задаче. Нужен .md для Obsidian, регламент для ассистента, черновик статьи из методички: без текста вы дальше не уйдёте. Нужен файл «чтобы был на диске» и его читают с экрана как картинку: распознавание не добавляет пользы.

Сначала добейтесь читаемой строки на экране. Серый фон, тень от крышки сканера, мелкий кегль, кривой ракурс с телефона: программа угадывает буквы и ошибается в цифрах, фамилиях, номерах пунктов. Переснимите лист или выгрузите его крупнее, потом уже жмите кнопку.

Печатный текст и рукопись это разные входы. Печатный скан, скриншот страницы, фото распечатки ведите в фото в Markdown. Рукописный конспект, письмо, бланк от руки: рукопись → текст или конспект из фото. Путать их дорого: печатный движок слабо держит почерк, рукописный не обязан собирать идеальные Markdown-таблицы из книжного макета.

Юридически значимый оригинал остаётся PDF со сканом. Markdown это рабочая копия. Правьте .md для заметок, а подписанный скан держите рядом.

Как подготовить страницы скана

Сначала отберите листы, которые реально нужны. Гнать стостраничный архив ради трёх абзацев из приложения бессмысленно: дольше ждать, больше мусора чистить, быстрее упереться в размер. Выгрузите диапазон или снимите только эти листы.

Уберите пароль, если файл закрыт. Без доступа ни выгрузка картинок, ни конвертация не пройдут. Слишком тяжёлый PDF сожмите или разрежьте; для картинок из PDF на Тулси ориентир до 25 МБ и до 30 страниц за раз на PDF → JPG. Для распознавания на фото в Markdown лимит около 5 МБ на файл в бесплатном режиме.

Имена сразу пишите по смыслу: reglament-otpusk-s3.jpg, не scan0123.jpg. После пачки .md вы иначе не вспомните, какой лист перед вами.

Свет и геометрия важнее «магического фильтра». Ровная страница, без пальца на поле, без блика ламината. Одна страница в кадре. Поля не обрезаны: иначе пропадёт номер пункта или последняя строка таблицы.

Выгрузить листы в JPG

Откройте PDF → JPG, загрузите скан, скачайте картинки. Несколько страниц приходят архивом ZIP. Разбор сценария «страницы в картинки» есть в PDF в JPG; здесь JPG нужны как сырьё для распознавания.

Откройте полученный JPG на весь экран. Строки должны читаться без увеличения до боли. Если буквы каша, исходный скан мелкий или тёмный: переснимите бумагу или попросите у автора текстовый файл. Гнать нечитаемый JPG в Markdown вы получите дыры в словах и сдвинутые таблицы.

Снять бумагу камерой

Бумажный экземпляр чище старого скана с МФУ. Дневной свет сбоку, телефон параллельно листу, тень от руки вне текста. JPG или PNG с камеры подходят. HEIC с iPhone заранее сохраните как JPG.

Не фотографируйте экран монитора с открытым PDF: муар, блик и второй слой сжатия портят буквы. Либо выгружайте страницу из файла, либо снимайте живую бумагу.

Как получить Markdown со скана на Тулси

Откройте фото в Markdown. Загрузите один JPG, PNG или WebP в пределах лимита. Дождитесь текста в окне результата. Скопируйте фрагмент или скачайте .md. Файл на сервере нужен только для ответа.

Бесплатный режим: до 3 файлов в день в конвертерах Markdown, до 5 МБ на файл. Пачка листов: один файл за прогон, листы по очереди. Крупнее и чаще: смотрите тарифы. Не грузите тот же кадр десять раз «на удачу»: сначала поправьте свет, обрез и резкость.

Текстовый PDF сюда не несите. Для него отдельная страница PDF → Markdown. Смешанный архив разных форматов удобнее гнать через конвертер в Markdown: он принимает и PDF, и картинки, но скан без слоя в PDF всё равно останется немым, пока вы не дадите изображение.

Движок тот же семейства, что и у остальных конвертеров в Markdown. Зачем он вообще и чем отличается от «голого» копирования, разобрано в что такое MarkItDown.

Шаги на странице инструмента

Откройте /foto-v-markdown в браузере. Перетащите картинку страницы в зону загрузки или выберите файл с диска. Запустите конвертацию и дождитесь текста.

Просмотрите начало и середину: заголовки, списки, кусок таблицы. Сохраните .md. Если видите отказ по типу файла, проверьте расширение: нужен снимок, не .pdf. Если отказ по размеру, сожмите JPG или вырежьте одну страницу.

Что сделать с результатом

Положите .md туда, где вы работаете: папка Obsidian, каталог документации, сырьё для ассистента. В шапку сразу допишите дату и откуда взят скан. Через месяц «версия 2» без источника превращается в загадку.

Сверьте цифры, фамилии, номера пунктов с оригиналом. Распознавание путает 8 и 3, «з» и «э», латиницу и кириллицу в одном слове. Для заметок из документов дальше: PDF и Word в Obsidian и база знаний для ИИ.

Как проверить результат и типичные ошибки

Откройте .md рядом со сканом. Три контрольные зоны: шапка (название и дата), середина (таблица или нумерованный список), хвост (подпись, приложения). Так ловите сбои быстрее, чем читая всё подряд.

Смотрите заголовки: уровни # совпадают со смыслом разделов. Крупный колонтитул в заголовок не ставьте. Повторяющиеся «стр. 4» из низа листа удалите поиском. Битую таблицу с съехавшими ячейками упростите до списка: чинить сетку час не стоит.

Типичные ошибки. Грузят скан в PDF → Markdown и удивляются пустому окну. Грузят сам PDF в фото в Markdown и получают отказ по формату. Ждут Word, потому что в поиске рядом «скан в текст ворд». Оставляют кривой кадр и винят сайт. Кладут три .md одного листа с разными датами в одну папку.

Пустой или почти пустой результат: это картинка без читаемого текста, слишком мелкий кегль, тёмная копия или защищённый файл на предыдущем шаге. Каша из колонок: макет в две полосы, программа прочитала «змейкой». Правьте фрагмент руками, не перегенерируйте весь документ бесконечно.

Ещё одна ловушка: править только Markdown и забыть, что для суда, портала и подписи оригинал всё ещё скан. Рабочая копия не заменяет файл, который у вас попросили «в PDF».

Смежные задачи на Тулси

Страница-картинка → .md: фото в Markdown. Текстовый PDF → .md: PDF → Markdown и статья как перевести PDF в Markdown. Выгрузить листы из скана: PDF → JPG.

Рукопись: рукопись → текст. Собрать наоборот PDF из фото чеков и паспорта: JPG → PDF и статья сканы и фото в один PDF. Это сборка скана из фото.

Пачка разных форматов: конвертер в Markdown. Зачем конвертеру MarkItDown: что такое MarkItDown.

Частые вопросы

Как перевести скан PDF в Markdown?

Сначала убедитесь, что страницы это картинки: текст мышью не выделяется. Выгрузите нужные листы через PDF → JPG или сфотографируйте бумагу. Загрузите JPG, PNG или WebP в фото в Markdown и сохраните .md. Проверьте заголовки и цифры глазами, прежде чем класть файл в заметки.

Почему из скана PDF не копируется текст?

В файле нет текстового слоя, только изображение страницы. Просмотрщик показывает буквы, буфер обмена их не видит. Поиск по слову тоже молчит. Распознавание собирает слой заново: вы даёте картинку, получаете текст.

Чем скан PDF отличается от текстового PDF?

В текстовом PDF слова уже лежат как текст: выделение, поиск, PDF → Markdown работают сразу. В скане каждая страница это фото. Внешне оба файла с расширением .pdf. Различие видно по курсору и по поиску, не по иконке.

Нужно ли распознавание, если текст в PDF выделяется?

Нет. Слой уже есть, повторное распознавание добавит ошибки. Откройте PDF → Markdown и следуйте статье как перевести PDF в Markdown. Распознавание оставляйте для страниц, где выделение не работает.

Как распознать текст со скана PDF на сайте?

Выгрузите страницу картинкой или сделайте фото листа. Откройте фото в Markdown, загрузите снимок до 5 МБ, дождитесь .md. На бесплатном режиме до 3 таких файлов в день; лимиты и Про на тарифах. Сам PDF на эту страницу не подходит.

Можно ли загрузить PDF в инструмент «фото в Markdown»?

Нет. Страница принимает JPG, PNG и WebP. Сначала получите изображение листа: PDF → JPG или снимок бумаги. Текстовый PDF сразу несите на PDF → Markdown. Смешение входов даёт отказ по формату или пустой текст.

Что делать, если PDF → Markdown отдаёт пустой результат?

Проверьте, выделяется ли текст в исходнике. Если нет, это скан: переходите к картинке страницы и фото в Markdown. Если выделяется, смотрите пароль, повреждение файла и лимит размера. Пустое окно на текстовом PDF бывает при сломанной структуре; тогда попробуйте другой экспорт исходника.

Подойдёт ли рукописный скан вместо печатной страницы?

Для почерка лучше рукопись → текст или конспект из фото: там ждут именно рукопись, в том числе PDF со страницей тетради. Фото в Markdown рассчитан на печатный текст и скриншоты. Неразборчивые места в рукописи помечаются как [?]; сверьте их с оригиналом.

Сохранятся ли таблицы со скана в Markdown?

Простая сетка из нескольких колонок часто приходит как Markdown-таблица. Объединённые ячейки, рукописные линии, печать под углом ломают структуру. Сверьте одну таблицу с оригиналом и при необходимости упростите её до списка. Цифры в ячейках проверьте отдельно: распознавание путает их чаще букв.

Чем путь со скана отличается от обычного перевода PDF в Markdown?

Обычный перевод читает готовый текстовый слой: один файл .pdf.md на PDF → Markdown. Путь со скана сначала достаёт текст с картинки, потом уже даёт Markdown. Это два разных входа и две разные кнопки. Смешивать их не стоит, даже если в поиске рядом стоят «pdf в markdown» и «pdf скан в текст».

Рядом по теме: как перевести PDF в Markdown, что такое MarkItDown. Рабочие точки входа: фото в Markdown, PDF → Markdown, PDF → JPG.

Получите Markdown со скана

Загрузите JPG, PNG или WebP до 5 МБ. Текст со страницы-картинки придёт как .md. Файл нужен только для ответа.

Фото → Markdown
Поделиться статьей

Читайте также

Отсканированный PDF в Markdown: когда нужен OCR — Тулси