Гайды
Отсканированный PDF в Markdown: когда нужен OCR

Отсканированный PDF хранит страницы как картинки. Мышь не выделяет абзац, копирование даёт пустоту или обрывки. Markdown вы получаете после распознавания текста с изображения: сначала лист как JPG или фото, потом разметка. Если слова в PDF выделяются, текстовый слой есть: откройте PDF → Markdown. Путь для текстовых файлов: как перевести PDF в Markdown. Для «немых» страниц точка входа фото в Markdown: вы загружаете JPG, PNG или WebP, сам .pdf инструмент не принимает. Про движок конвертера: что такое MarkItDown. Формулировки вроде «pdf скан в текст» разобраны в конце.
Почему скан PDF молчит при копировании
Сканер или телефон снимает лист целиком. Программа кладёт снимок внутрь PDF: буквы видны глазами, для компьютера это пиксели. Текстового слоя нет. Поиск по фразе, копирование абзаца и конвертация «в Markdown» опираются на этот слой. Без слоя вы из конвертера текста не получите.
Вы получаете такие файлы: договоры с МФУ, методички с фотокопира, «PDF с телефона» из приложения-сканера, архивы, которые сохранили как картинку «для верности». Файл открывается, печатается, уходит на почту. Правка одного абзаца уже не выходит: выделяется рамка страницы, не слова.
Запросы «pdf скан в текст» и «скан пдф в текст онлайн» как раз про этот зазор. Вы ждёте редактируемый текст. На выходе та же картинка в другой обёртке. Markdown здесь нужен как рабочий .md для заметок, базы и поиска.
Путаница с соседними задачами стоит времени. «Сканировать в PDF» собирает картинки в файл. «PDF в сканированный PDF» часто значит наоборот: сплющить текстовый документ в картинки. Здесь направление одно: из уже готового скана получить текст и разметку.
Как отличить скан от текстового PDF
Откройте файл в любом просмотрщике. Попробуйте выделить абзац мышью, как в Word. Курсор цепляет слова, копирование кладёт фразу в буфер: это текстовый PDF. Курсор рисует прямоугольник на всю страницу, в буфере пусто или мусор: это скан или страница, сохранённая как изображение.
Второй быстрый признак: поиск по редкому слову из середины документа. Нашли вхождения: слой есть. Поиск молчит, хотя слово на экране видно: слоя нет. Третий признак: зум. На скане буквы на большом увеличении распадаются на точки и ступеньки. В текстовом PDF контуры остаются чёткими.
По имени файла судить рано. dogovor-text.pdf бывает пачкой фото. scan-012.PDF иногда собран из Word с нормальным слоем. Смотрите поведение курсора, не название.
Смешанные файлы встречаются: первые листы из Word, приложения сфотографированы. Проверьте две-три страницы из разных частей, не только титул. Иначе вы решите, что «весь PDF текстовый», а середина останется картинкой.
Текстовый слой: слова выделяются
Вы получаете слой при экспорте из Word, вёрстки, сайта. Иногда его добавили позже отдельным распознаванием и сохранили поверх картинки. Для конвертации в Markdown этого достаточно: PDF → Markdown читает слой и собирает заголовки, списки, простые таблицы.
Не гоните такой файл в распознавание «на всякий случай». Вы потратите лимит и получите второй, более грязный текст: колонки поедут, колонтитулы удвоятся. Сначала текстовый путь из статьи как перевести PDF в Markdown.
Страницы-картинки: слоя нет
Каждая страница это фото. Конвертер текстового PDF отдаст пустоту, обрывки или только метаданные вроде имени файла. Распознавание здесь обязательный шаг.
Рабочий порядок: выгрузить листы картинками или снять бумагу камерой, затем фото в Markdown. Сам .pdf на эту страницу не кладут: инструмент ждёт JPG, PNG или WebP.
Когда нужно распознавание текста
Распознавание нужно, когда вы хотите править, искать и класть текст в заметки, а в файле только картинки страниц. Оно не нужно, если слой уже есть и абзац копируется. Оно также лишнее, если вам достаточно самого PDF для печати, подписи или отправки в форму, где ждут скан «как есть».
Ориентир по задаче. Нужен .md для Obsidian, регламент для ассистента, черновик статьи из методички: без текста вы дальше не уйдёте. Нужен файл «чтобы был на диске» и его читают с экрана как картинку: распознавание не добавляет пользы.
Сначала добейтесь читаемой строки на экране. Серый фон, тень от крышки сканера, мелкий кегль, кривой ракурс с телефона: программа угадывает буквы и ошибается в цифрах, фамилиях, номерах пунктов. Переснимите лист или выгрузите его крупнее, потом уже жмите кнопку.
Печатный текст и рукопись это разные входы. Печатный скан, скриншот страницы, фото распечатки ведите в фото в Markdown. Рукописный конспект, письмо, бланк от руки: рукопись → текст или конспект из фото. Путать их дорого: печатный движок слабо держит почерк, рукописный не обязан собирать идеальные Markdown-таблицы из книжного макета.
Юридически значимый оригинал остаётся PDF со сканом. Markdown это рабочая копия. Правьте .md для заметок, а подписанный скан держите рядом.
Как подготовить страницы скана
Сначала отберите листы, которые реально нужны. Гнать стостраничный архив ради трёх абзацев из приложения бессмысленно: дольше ждать, больше мусора чистить, быстрее упереться в размер. Выгрузите диапазон или снимите только эти листы.
Уберите пароль, если файл закрыт. Без доступа ни выгрузка картинок, ни конвертация не пройдут. Слишком тяжёлый PDF сожмите или разрежьте; для картинок из PDF на Тулси ориентир до 25 МБ и до 30 страниц за раз на PDF → JPG. Для распознавания на фото в Markdown лимит около 5 МБ на файл в бесплатном режиме.
Имена сразу пишите по смыслу: reglament-otpusk-s3.jpg, не scan0123.jpg. После пачки .md вы иначе не вспомните, какой лист перед вами.
Свет и геометрия важнее «магического фильтра». Ровная страница, без пальца на поле, без блика ламината. Одна страница в кадре. Поля не обрезаны: иначе пропадёт номер пункта или последняя строка таблицы.
Выгрузить листы в JPG
Откройте PDF → JPG, загрузите скан, скачайте картинки. Несколько страниц приходят архивом ZIP. Разбор сценария «страницы в картинки» есть в PDF в JPG; здесь JPG нужны как сырьё для распознавания.
Откройте полученный JPG на весь экран. Строки должны читаться без увеличения до боли. Если буквы каша, исходный скан мелкий или тёмный: переснимите бумагу или попросите у автора текстовый файл. Гнать нечитаемый JPG в Markdown вы получите дыры в словах и сдвинутые таблицы.
Снять бумагу камерой
Бумажный экземпляр чище старого скана с МФУ. Дневной свет сбоку, телефон параллельно листу, тень от руки вне текста. JPG или PNG с камеры подходят. HEIC с iPhone заранее сохраните как JPG.
Не фотографируйте экран монитора с открытым PDF: муар, блик и второй слой сжатия портят буквы. Либо выгружайте страницу из файла, либо снимайте живую бумагу.
Как получить Markdown со скана на Тулси
Откройте фото в Markdown. Загрузите один JPG, PNG или WebP в пределах лимита. Дождитесь текста в окне результата. Скопируйте фрагмент или скачайте .md. Файл на сервере нужен только для ответа.
Бесплатный режим: до 3 файлов в день в конвертерах Markdown, до 5 МБ на файл. Пачка листов: один файл за прогон, листы по очереди. Крупнее и чаще: смотрите тарифы. Не грузите тот же кадр десять раз «на удачу»: сначала поправьте свет, обрез и резкость.
Текстовый PDF сюда не несите. Для него отдельная страница PDF → Markdown. Смешанный архив разных форматов удобнее гнать через конвертер в Markdown: он принимает и PDF, и картинки, но скан без слоя в PDF всё равно останется немым, пока вы не дадите изображение.
Движок тот же семейства, что и у остальных конвертеров в Markdown. Зачем он вообще и чем отличается от «голого» копирования, разобрано в что такое MarkItDown.
Шаги на странице инструмента
Откройте /foto-v-markdown в браузере. Перетащите картинку страницы в зону загрузки или выберите файл с диска. Запустите конвертацию и дождитесь текста.
Просмотрите начало и середину: заголовки, списки, кусок таблицы. Сохраните .md. Если видите отказ по типу файла, проверьте расширение: нужен снимок, не .pdf. Если отказ по размеру, сожмите JPG или вырежьте одну страницу.
Что сделать с результатом
Положите .md туда, где вы работаете: папка Obsidian, каталог документации, сырьё для ассистента. В шапку сразу допишите дату и откуда взят скан. Через месяц «версия 2» без источника превращается в загадку.
Сверьте цифры, фамилии, номера пунктов с оригиналом. Распознавание путает 8 и 3, «з» и «э», латиницу и кириллицу в одном слове. Для заметок из документов дальше: PDF и Word в Obsidian и база знаний для ИИ.
Как проверить результат и типичные ошибки
Откройте .md рядом со сканом. Три контрольные зоны: шапка (название и дата), середина (таблица или нумерованный список), хвост (подпись, приложения). Так ловите сбои быстрее, чем читая всё подряд.
Смотрите заголовки: уровни # совпадают со смыслом разделов. Крупный колонтитул в заголовок не ставьте. Повторяющиеся «стр. 4» из низа листа удалите поиском. Битую таблицу с съехавшими ячейками упростите до списка: чинить сетку час не стоит.
Типичные ошибки. Грузят скан в PDF → Markdown и удивляются пустому окну. Грузят сам PDF в фото в Markdown и получают отказ по формату. Ждут Word, потому что в поиске рядом «скан в текст ворд». Оставляют кривой кадр и винят сайт. Кладут три .md одного листа с разными датами в одну папку.
Пустой или почти пустой результат: это картинка без читаемого текста, слишком мелкий кегль, тёмная копия или защищённый файл на предыдущем шаге. Каша из колонок: макет в две полосы, программа прочитала «змейкой». Правьте фрагмент руками, не перегенерируйте весь документ бесконечно.
Ещё одна ловушка: править только Markdown и забыть, что для суда, портала и подписи оригинал всё ещё скан. Рабочая копия не заменяет файл, который у вас попросили «в PDF».
Смежные задачи на Тулси
Страница-картинка → .md: фото в Markdown. Текстовый PDF → .md: PDF → Markdown и статья как перевести PDF в Markdown. Выгрузить листы из скана: PDF → JPG.
Рукопись: рукопись → текст. Собрать наоборот PDF из фото чеков и паспорта: JPG → PDF и статья сканы и фото в один PDF. Это сборка скана из фото.
Пачка разных форматов: конвертер в Markdown. Зачем конвертеру MarkItDown: что такое MarkItDown.
Частые вопросы
Как перевести скан PDF в Markdown?
Сначала убедитесь, что страницы это картинки: текст мышью не выделяется. Выгрузите нужные листы через PDF → JPG или сфотографируйте бумагу. Загрузите JPG, PNG или WebP в фото в Markdown и сохраните .md. Проверьте заголовки и цифры глазами, прежде чем класть файл в заметки.
Почему из скана PDF не копируется текст?
В файле нет текстового слоя, только изображение страницы. Просмотрщик показывает буквы, буфер обмена их не видит. Поиск по слову тоже молчит. Распознавание собирает слой заново: вы даёте картинку, получаете текст.
Чем скан PDF отличается от текстового PDF?
В текстовом PDF слова уже лежат как текст: выделение, поиск, PDF → Markdown работают сразу. В скане каждая страница это фото. Внешне оба файла с расширением .pdf. Различие видно по курсору и по поиску, не по иконке.
Нужно ли распознавание, если текст в PDF выделяется?
Нет. Слой уже есть, повторное распознавание добавит ошибки. Откройте PDF → Markdown и следуйте статье как перевести PDF в Markdown. Распознавание оставляйте для страниц, где выделение не работает.
Как распознать текст со скана PDF на сайте?
Выгрузите страницу картинкой или сделайте фото листа. Откройте фото в Markdown, загрузите снимок до 5 МБ, дождитесь .md. На бесплатном режиме до 3 таких файлов в день; лимиты и Про на тарифах. Сам PDF на эту страницу не подходит.
Можно ли загрузить PDF в инструмент «фото в Markdown»?
Нет. Страница принимает JPG, PNG и WebP. Сначала получите изображение листа: PDF → JPG или снимок бумаги. Текстовый PDF сразу несите на PDF → Markdown. Смешение входов даёт отказ по формату или пустой текст.
Что делать, если PDF → Markdown отдаёт пустой результат?
Проверьте, выделяется ли текст в исходнике. Если нет, это скан: переходите к картинке страницы и фото в Markdown. Если выделяется, смотрите пароль, повреждение файла и лимит размера. Пустое окно на текстовом PDF бывает при сломанной структуре; тогда попробуйте другой экспорт исходника.
Подойдёт ли рукописный скан вместо печатной страницы?
Для почерка лучше рукопись → текст или конспект из фото: там ждут именно рукопись, в том числе PDF со страницей тетради. Фото в Markdown рассчитан на печатный текст и скриншоты. Неразборчивые места в рукописи помечаются как [?]; сверьте их с оригиналом.
Сохранятся ли таблицы со скана в Markdown?
Простая сетка из нескольких колонок часто приходит как Markdown-таблица. Объединённые ячейки, рукописные линии, печать под углом ломают структуру. Сверьте одну таблицу с оригиналом и при необходимости упростите её до списка. Цифры в ячейках проверьте отдельно: распознавание путает их чаще букв.
Чем путь со скана отличается от обычного перевода PDF в Markdown?
Обычный перевод читает готовый текстовый слой: один файл .pdf → .md на PDF → Markdown. Путь со скана сначала достаёт текст с картинки, потом уже даёт Markdown. Это два разных входа и две разные кнопки. Смешивать их не стоит, даже если в поиске рядом стоят «pdf в markdown» и «pdf скан в текст».
Рядом по теме: как перевести PDF в Markdown, что такое MarkItDown. Рабочие точки входа: фото в Markdown, PDF → Markdown, PDF → JPG.
Получите Markdown со скана
Загрузите JPG, PNG или WebP до 5 МБ. Текст со страницы-картинки придёт как .md. Файл нужен только для ответа.


