Гайды
PDF с таблицами в Markdown: что теряется

Таблица из PDF в Markdown теряет то, чего в текстовой разметке нет: объединённые ячейки, шапку на несколько столбцов, сетку, нарисованную картинкой, и ячейки со скана без текстового слоя. Конвертер читает слова и линии, которые программа уже знает как текст. Если в PDF таблица это фото страницы, на выходе обрывки или пустые столбцы. Если сетка настоящая, но ячейки склеены, Markdown кладёт подпись в одну клетку и оставляет дыры. Ниже разбор трёх видов таблиц в PDF, что проверить мышью до загрузки, как пройти PDF → Markdown и когда цифры лучше тащить в Excel. Общий путь «файл в .md» описан в как перевести PDF в Markdown. Синтаксис | и поломки уже готовой сетки: почему ломаются таблицы в Markdown.
Почему таблица из PDF теряет сетку
PDF хранит макет страницы. Таблица там может быть набором текстовых блоков с координатами, набором линий плюс подписи, одной картинкой или смесью всего этого. Markdown ждёт прямоугольник: одинаковое число столбцов в каждой строке, заголовок, разделитель из дефисов, данные. Между этими моделями зазор. Конвертер заполняет его догадками: что считать строкой, где граница ячейки, куда деть текст, который визуально сидит «над» двумя колонками.
Люди ищут «pdf с таблицей» и «pdf файл с таблицей», когда в документе уже есть прайс, спецификация, ведомость или бланк, а дальше нужен редактируемый текст. Часть запросов ведёт к скачиванию чужих учебных сеток. Здесь речь про ваш файл: что останется после перевода в .md, а что придётся чинить руками.
Типичный сбой выглядит так. На экране PDF вы видите аккуратную шапку «Цена / срок» на три колонки. В Markdown первая ячейка заполнена, две соседние пустые, числа из тела съехали на столбец влево. Второй сбой: таблица нарисована в макете как изображение. Конвертер либо пропускает её, либо отдаёт подпись «рисунок» без цифр. Третий: скан с МФУ. Мышь не выделяет ячейки, поиск по артикулу молчит.
Ожидание «как в Word, только .md» здесь не работает. Word умеет объединения и рамки. Markdown в репозитории и в заметках умеет pipe-таблицу. Цель конвертации: забрать текст и черновик сетки. Красивую вёрстку оставляйте в исходном PDF, если файл ещё нужен для печати или подписи.
Перед загрузкой решите, зачем вам таблица. Для документации и заметок хватает упрощённой сетки. Для свода, фильтров и формул нужен Excel: тогда Markdown это промежуточный шаг или вообще лишний формат.
Три вида таблиц внутри PDF
Откройте файл и попробуйте выделить одну ячейку мышью. От ответа зависит, что конвертер вообще увидит. Ниже три рабочих типа. Смешанные документы встречаются часто: на одной странице текстовая сетка, на следующей вставленный скриншот из 1С.
Текстовая таблица
Курсор цепляет цифры и заголовки по отдельности. Копирование в буфер даёт слова, иногда с лишними пробелами и переносами. Такой PDF собрали из Word, Excel «печать в PDF» или из программы вёрстки с текстовым слоем. Для PDF → Markdown это лучший исходник: слова есть, сетку программа может собрать.
Проверьте две вещи. Первая: выделяется ли вся строка подряд или программа прыгает по колонкам. Вторая: есть ли в шапке объединения. Если шапка склеена, после конвертации поправьте заголовки вручную. Тело таблицы при этом часто выходит ровнее шапки.
Таблица-картинка
На странице сетка выглядит «живой», но выделение захватывает прямоугольник целиком, как фото. Так сохраняют отчёт из системы, вставляют скриншот прайса, экспортируют макет, где таблица уже растр. Для компьютера это изображение. Конвертер PDF в Markdown читает текстовый слой страницы. Слоя в картинке нет.
Цифры с такой сетки вы получите другим путём: сохраните страницу как JPG или PNG и отдайте в фото таблицы в Excel, если нужны ячейки для расчёта. Для заметок можно прогнать снимок через фото в Markdown, затем руками собрать |. Сам PDF с вложенной картинкой «таблицу не отдаст», пока вы не вынете изображение.
Скан и фото страницы
Страница целиком снята сканером или телефоном. Буквы видны глазам, для программы это пиксели. Поиск по слову из середины таблицы молчит. Зум показывает зерно и ступеньки на линиях. Такой файл разбирают как скан: сначала распознавание, потом разметка. Подробный путь для «немых» страниц: скан PDF в Markdown.
Скан с кривой геометрией ломает столбцы сильнее обычного текстового PDF. Линии сетки съезжают, распознавание путает | с буквой I, пустые ячейки пропадают. Ровный свет, лист без тени от руки и съёмка сверху уменьшают дыры. Рукописные пометки на печатной сетке программа часто читает как мусор в соседней ячейке.
Что теряется: объединения, шапки, ячейки-картинки
Markdown-таблица не знает colspan и rowspan. Подпись, которая в PDF сидит на двух столбцах, должна куда-то лечь. Конвертер кладёт её влево или повторяет. Превью в GitHub и в заметках читает пустые клетки как сдвиг хвоста строки. Итог: числа тарифа оказываются под чужим заголовком.
Шапка в два этажа в PDF привычна: сверху группа «условия», снизу «срок» и «штраф». В .md остаётся один ряд заголовков. Второй этаж либо слипается в одну ячейку, либо уезжает в тело таблицы. До загрузки проще упростить шапку в исходнике. После загрузки проще набрать одну строку заголовков руками.
Ячейка с логотипом, печатью или мини-графиком в PDF выглядит частью таблицы. В Markdown картинка либо пропадает, либо всплывает отдельным файлом вне сетки. Подпись «см. рис.» в ячейке остаётся текстом. Сам рисунок в столбец не встанет.
Повторяющиеся колонтитулы и номера страниц попадают в середину таблицы, если сетка рвётся на развороте. Строка «Страница 3 из 12» оказывается между артикулами. После конвертации пробегитесь поиском по слову «страница» и вырежьте хвосты.
Широкая сетка на всю ширину А4 технически конвертируется. Читать её в README нельзя: горизонтальный скролл, обрезка на телефоне. Для документации оставьте 4–8 колонок. Остальное держите в книге Excel рядом. Если исходник уже лист, минуя PDF, откройте XLSX → Markdown: прямоугольник из книги обычно чище, чем обход через печать в PDF.
Объединённые ячейки в PDF
В макете объединения экономят место: один заголовок на блок колонок, одна подпись «итого» на две строки. Для Markdown это дыра в сетке. Разбейте объединение в исходном Word или Excel и заново сохраните PDF, если файл ваш. Если исходник чужой, после конвертации продублируйте заголовок в каждую колонку или вынесите общую подпись абзацем над таблицей.
Не ждите, что конвертер соберёт HTML-таблицу с объединениями внутри .md. GitHub такой фрагмент часто показывает как код. Для репозитория прямоугольник надёжнее «красивой» шапки из PDF.
Сетка без текстового слоя
Если таблица это картинка или скан, вопрос «сохранятся ли столбцы» закрывается раньше синтаксиса |. Сначала нужны символы. Без слоя конвертер PDF не из чего собирать ячейки. Сохраните страницу изображением, распознайте сетку, затем решайте, нужен ли Markdown или сразу CSV для Excel.
Путаница с запросом «распознать таблицу из pdf» как раз здесь. Люди ждут, что одна кнопка и прочитает пиксели, и разложит столбцы. На Тулси текстовый PDF идёт в PDF → Markdown. Скан сетки для ячеек: фото таблицы в Excel. Смешивать эти входы в одном прогоне бессмысленно.
Как проверить PDF глазами до загрузки
Откройте файл в любом просмотрщике. Выделите заголовок таблицы и одну цифру из тела. Если оба выделяются, идите дальше. Если нет, сначала определите тип: картинка или скан.
Снимите пароль, если файл закрыт: без доступа программа страницу не прочитает. На бесплатном режиме лимит около 5 МБ. Тяжёлый скан сожмите или вырежьте нужные страницы. Гнать стостраничный архив ради одной ведомости на листе 7 значит чистить мусор дольше, чем набрать сетку руками.
Посмотрите шапку. Сосчитайте визуальные столбцы в теле и в заголовке. Если числа не совпадают, объединения уже есть. Запишите себе правильные названия колонок: после конвертации вы сверите их за минуту.
Имя файла пишите по смыслу: price-2026-q3.pdf, не scan4.pdf. После пачки конвертаций так проще найти нужный .md. Личные данные в таблицах (ФИО, счета, диагнозы) лучше вырезать до загрузки на чужой сайт. Файл на Тулси нужен только для ответа, но исходник всё равно ваш.
Что смотреть на странице с сеткой
Линии таблицы ровные, текст внутри ячеек не наезжает на рамку, нет водяного знака поверх цифр. Водяной знак распознавание и конвертер часто принимают за отдельный столбец или за мусор в ячейке.
Проверьте, нет ли вложенной мини-таблицы внутри ячейки. В PDF так рисуют «состав комплекта». В Markdown вложенность пропадёт: внутренние строки смешаются с внешними. Такие блоки после конвертации лучше вынести списком под основной сеткой.
Когда PDF лучше не конвертировать
Нужны формулы, фильтры и свод. Markdown это текст. Считайте в Excel. Нужна юридическая копия с печатями: оставьте PDF. Нужна одна таблица на 40 колонок для внутреннего отчёта: выгрузка из учётной системы в .xlsx короче, чем фотография этой выгрузки в PDF и обратный перевод.
Если таблица уже живёт в книге, не печатайте её в PDF «для конвертера». Прямой путь XLSX → Markdown сохраняет больше границ ячеек, чем растровая печать.
Как прогнать PDF с таблицей на Тулси
Откройте PDF → Markdown. Загрузите один PDF в пределах лимита. Запустите конвертацию. Дождитесь текста в окне результата. Скопируйте .md или скачайте файл. На сервере исходник нужен только для ответа.
Прогоните один чистый файл. Десять повторов «на удачу» не чинят объединения и не добавляют текстовый слой. Если результат пустой, вернитесь к проверке мышью: скорее скан. Если сетка есть, но столбцы съехали, откройте .md в редакторе и выровняйте число | по строкам. Как чинить уже сломанную pipe-таблицу, разобрано в почему ломаются таблицы в Markdown.
Сверьте три строки глазами: заголовки, первую строку данных, строку «итого», если она была. Именно там чаще всего сидят объединения и пустые клетки. Числа с пробелом как разделителем тысяч иногда рвутся на два столбца. Склейте их обратно.
Шаги на странице инструмента
Перетащите PDF в зону загрузки или выберите файл с диска. Нажмите кнопку конвертации. Не закрывайте вкладку, пока текст не появится. Сохраните .md рядом с исходным PDF: через месяц иначе не отличите черновик от выгрузки.
Если файлов несколько типов, удобнее общий конвертер в Markdown. Для этой задачи рабочая точка входа одна: PDF. Word сразу отдавайте в DOCX → Markdown, книгу в XLSX → Markdown.
Что делать, если столбцы съехали
Откройте .md в VS Code или в любом редакторе с моноширинным шрифтом. Посчитайте вертикальные черты в строке заголовка и в первой строке данных. Выровняйте. Пустые ячейки оставьте как ||, не удаляйте их: иначе хвост строки снова уедет.
Шапку в два этажа соберите в один ряд. Длинные примечания из ячеек вынесите под таблицу обычным абзацем. После правки откройте превью GitHub или редактора заметок. Если сетка стоит, сохраните файл. Если нет, разрежьте одну широкую таблицу на две узкие по смыслу.
Когда нужен Excel, Word или снимок сетки
Запрос «таблица из pdf в excel» и «распознать таблицу из pdf в excel» закрывает другой продукт: ячейки для расчёта, не документация. Markdown здесь промежуточный формат в лучшем случае. Скопировать pipe-таблицу в Excel можно, но проще распознать сетку в CSV и открыть книгу.
«PDF в word с таблицами» люди ищут, когда хотят править сетку рамками Word. Тулси в эту сторону не конвертирует. Если исходник текстовый, Markdown вы правите как текст, затем при необходимости собираете Word отдельно. Если исходник скан, сначала распознавание, потом уже выбор: .md, CSV или ручной набор в Word.
Смежные инструменты на сайте. Цифры с фото печатной сетки: фото таблицы в Excel. Готовый лист без PDF: XLSX → Markdown. Текстовый PDF целиком: PDF → Markdown. Скан страницы без таблицы как картинки: скан PDF в Markdown.
Не смешивайте учебные PDF «скачать таблицу» с вашей рабочей выгрузкой. Школьные сетки в поиске рядом по словам, к конвертации вашего прайса они не относятся.
После правки .md положите рядом исходный PDF. В шапке заметки напишите дату выгрузки и число строк, которое вы сверили. Через квартал иначе начнёте править устаревшие тарифы.
Частые вопросы
PDF с таблицей: что останется в Markdown
Останется текст ячеек и черновик сетки, если в PDF есть текстовый слой и таблица близка к прямоугольнику. Объединения, второй этаж шапки и ячейки-картинки вы потеряете или поправите руками. Скан без слоя не даст столбцов, пока вы не распознаете страницу. Для рабочего .md этого обычно хватает. Для бухгалтерии этого мало: берите Excel.
PDF файл с таблицей можно ли сразу грузить в конвертер
Да, если курсор выделяет цифры внутри ячеек и файл без пароля, в пределах лимита размера. Сначала откройте нужную страницу и убедитесь, что сетка не скриншот. Если выделяется только рамка страницы, конвертер PDF в Markdown таблицу не соберёт. Тогда сохраните лист картинкой и идите в распознавание сетки.
Как распознать таблицу из PDF
Сначала определите тип страницы. Текстовый PDF: прогоните файл через PDF → Markdown и поправьте |. Скан или фото сетки: нужен шаг распознавания изображения, иначе символов нет. Для ячеек Excel удобнее фото таблицы в Excel. Смешивать «распознать» и «перевести текст» в одной кнопке нельзя: это разные входы.
Как распознать таблицу из PDF в Excel
Нужны значения в ячейках книги, не pipe-таблица в README. Сохраните страницу как изображение, если PDF это скан, и отдайте снимок в инструмент фото таблицы. Если PDF текстовый, иногда быстрее открыть исходную книгу, из которой печатали PDF. Markdown как мост в Excel работает через копирование, но пустые столбцы после объединений вы всё равно чините.
PDF в Word с таблицами: это тот же путь
Word хранит рамки и объединения. Markdown хранит текст со столбиками через |. Конвертер на Тулси отдаёт .md, не .docx. Если цель именно Word, ищите другой инструмент или правьте исходник. Если цель заметки и Git, Word здесь лишний круг.
Распознать таблицу с PDF: скан или текст
Формулировка «с PDF» в поиске часто значит скан. Проверьте выделением мыши. Текст выделяется: слой есть, распознавание пикселей не нужно. Текст не выделяется: сначала изображение страницы, потом ячейки. Ошибка на этом шаге даёт пустой .md и ощущение, что «сайт сломал таблицу». Исходник молчит: в файле не было символов.
Как перенести таблицу из PDF в Excel
Решите, есть ли текстовый слой. Есть: скопируйте фрагмент после конвертации или, лучше, возьмите исходный .xlsx. Нет: фото страницы и распознавание в CSV. В обоих случаях сверьте суммы и число строк с PDF. Сдвиг на один столбец из-за объединения шапки в Excel незаметен, пока не сломается свод.
Как из PDF скопировать таблицу
В текстовом PDF копирование из просмотрщика даёт слова без сетки: столбцы слипаются пробелами. Конвертация в Markdown сохраняет границы лучше, чем «выделить всё на странице». В скане копирование из просмотрщика пустое. Там копировать нечего, пока нет распознавания. После .md копируйте уже pipe-таблицу в редактор.
Как извлечь таблицу из PDF, если сетка на картинке
Выньте изображение: снимок области в просмотрщике или экспорт страницы в JPG. Дальше распознавание сетки, не PDF-конвертер. Картинка внутри PDF для PDF → Markdown чужая: программа читает текстовый слой страницы. Слой пустой. Цифры с картинки сами в .md не переедут.
Распознать таблицу из PDF в Word: зачем тогда Markdown
Word ищут, чтобы править рамки как в исходнике. Markdown ищут, чтобы положить сетку в заметки, README и базу для ассистента. Если вы уже в экосистеме .md, Word после распознавания добавляет ручную уборку стилей. Соберите прямоугольник в Markdown, проверьте столбцы, и только потом, если нужен документ для коллег без Git, переносите таблицу в Word копированием.
Для пошагового перевода всего файла, не только сетки, откройте как перевести PDF в Markdown. Если столбцы уже в .md и превью едет, чините синтаксис по статье почему ломаются таблицы в Markdown.
Прогоните PDF с таблицей
Загрузите PDF до 5 МБ. На выходе Markdown: текст и сетка, насколько исходник это позволяет. Файл нужен только для ответа.


