Технологии
MarkItDown: что это и зачем нужен конвертеру документов

MarkItDown это открытая утилита Microsoft: она читает PDF, Word, таблицы, слайды и ещё несколько форматов и отдаёт текст в Markdown. Конвертеру документов она нужна, чтобы из офисного файла получить заголовки, списки и таблицы без ручного копирования. На Тулси тот же движок стоит за страницей конвертер в Markdown: загружаете файл в браузере и забираете .md. Ставить Python и качать репозиторий с GitHub для разовой задачи не обязательно. Ниже: что это за проект, какие форматы получаются чище, как пройти путь на сайте и куда деть результат. Для пачки разных файлов смотрите конвертер файлов в Markdown. Для одного PDF удобнее разбор как перевести PDF в Markdown. Сырьё под ассистента разобрано в базе знаний из документов.
Что такое MarkItDown
MarkItDown это утилита Microsoft на Python. Вы даёте ей файл офисного или смежного формата, она возвращает текст Markdown: заголовки, списки, таблицы, насколько исходник это позволяет. На выходе обычный .md или строка текста, которую копируете в редактор.
Запросы «markitdown» и «markitdown что это» приходят с двух сторон. Разработчик готовит документы под ассистента или базу знаний и видит это имя в статье, в репозитории, в чужом скрипте. Редактор или аналитик встречает то же имя на странице конвертера и хочет понять, какая программа внутри обрабатывает его PDF.
Markdown выбран как общий текстовый формат: его кладут в Git, в Obsidian, в папку для модели. В PDF и Word структура спрятана внутри контейнера. Вы спотыкаетесь о вёрстку, когда ищете абзац или режете главы.
На Тулси MarkItDown крутится на сервере за конвертером в Markdown. Вы загружаете файл в браузере. По смыслу ответ тот же, что у локальной утилиты: текст с разметкой заголовков и списков, без установки пакета на свой компьютер.
Установку через pip и клон репозитория оставляйте тем, кто гоняет пачки у себя в контуре и пишет скрипт. Для одного-двух файлов достаточно страницы на сайте.
Зачем Microsoft выложила эту утилиту
Моделям нужен обычный текст. В компаниях лежат PDF методичек, брифы в Word, слайды с тезисами. Руками копировать это в заметки долго, а «проглотить PDF как есть» даёт кашу: колонтитулы, колонки, разрывы страниц.
Microsoft выложила MarkItDown как открытый проект: библиотека читает несколько форматов и приводит их к Markdown. Markdown сохраняет иерархию (заголовок, список, таблица) в виде символов, которые читает и человек, и программа. Разработчики берут её, когда собирают сырьё под ассистента.
Сайты вроде Тулси вызывают эту библиотеку за формой загрузки. Вы получаете шаг «файл → Markdown» в браузере, без своего Python.
Чем Markdown удобен после конвертации
Заголовки с # видны в оглавлении редактора и в поиске по папке. Списки остаются списками. При ровном исходнике таблицы приходят как markdown-таблицы: вы правите их текстом.
Файл .md весит мало и живёт в Git: видно, какая строка изменилась. Word и PDF для такого сравнения подходят хуже. Для личного графа заметок тот же формат забирают в Obsidian; разбор этого сценария есть в PDF и Word в заметки Obsidian.
Ассистенту вы отдаёте обычный текст. Сначала конвертация, потом нарезка и проверка цифр. Конвейер описан в базе знаний для ИИ из документов.
MarkItDown от Microsoft: откуда взялся проект
Запрос «markitdown от microsoft» проверяет авторство: тот ли это открытый проект Microsoft. Да, репозиторий публикует Microsoft. В Word отдельной кнопки MarkItDown нет. Ярлык на рабочий стол сам не ставится.
Проект устроен как библиотека плюс утилита командной строки. Разработчик вызывает её из Python или из терминала, передаёт путь к файлу, получает text_content в Markdown. Сайт-конвертер делает тот же вызов у себя на сервере: вы видите форму загрузки, внутри крутится эта библиотека.
Имя путают с Markdown как языком разметки. Markdown это формат текста. MarkItDown это программа, которая в этот формат переводит чужие файлы. Запрос без уточнения «от microsoft» смешивается с Markdown вообще, с редакторами и с обратным путём «Markdown в PDF».
Лицензия открытая, исходники на GitHub. Для разовой конвертации код читать не нужно. За хабом на Тулси стоит эта библиотека: один вход для нескольких типов файлов.
Репозиторий MarkItDown на GitHub
Запрос «markitdown github» ведёт в репозиторий microsoft/markitdown. Там README, список форматов, примеры вызова, обсуждение ошибок. Ссылка вида https://github.com/microsoft/markitdown в поиске появляется отдельно: нужен этот адрес, без зеркал.
Клонировать репозиторий имеет смысл, если вы встраиваете конвертацию в свой скрипт или смотрите, как обрабатывается конкретный тип файла. Для одного PDF с диска клон не нужен: откройте конвертер и загрузите файл.
Следите за тем, что качаете. Одноимённые пакеты и «скачать markitdown.exe с неизвестного сайта» к этому проекту не относятся. Официальная точка входа: репозиторий Microsoft на GitHub и пакет в индексе Python.
Python у себя или страница в браузере
Локальный путь: Python, пакет markitdown, вызов из скрипта или из терминала. Так делают, когда файлы нельзя выносить из контура, когда нужна пачка на сотни документов или своя постобработка.
Путь в браузере: страница Тулси, загрузка, скачивание .md. Движок тот же семейства. Лимиты другие: на бесплатном режиме до трёх файлов в день, каждый до 5 МБ. Правила хранения исходника смотрите на странице конфиденциальности.
Выбирайте контур по политике компании. Учебный PDF и публичная методичка идут через сайт. Кадровые сканы и чужие договоры без права на внешнюю обработку оставляйте у себя.
Зачем конвертеру документов эта библиотека
Без общей библиотеки конвертер «любой файл → Markdown» держит отдельный разбор под каждый тип. MarkItDown даёт одну точку входа: передали файл, получили текст. Хаб на Тулси опирается на это.
Узкие страницы (PDF → Markdown, Word → Markdown, презентации, таблицы) ходят в тот же движок. На странице короче подсказка и яснее ожидание по типу файла.
Без такой утилиты вы копируете текст руками: выделяете в Acrobat, вставляете в редактор, чините списки. На коротком письме это терпимо. На регламенте на сорок страниц с таблицами руки устают, а заголовки теряются.
Сканы без текстового слоя эта библиотека не читает как фото. Картинка без букв даёт пустой ответ или мусор. Для снимка страницы на Тулси есть фото в Markdown. MarkItDown забирает уже существующий текст из файла.
Практический разбор хаба «несколько форматов на одной странице» лежит в статье конвертер файлов в Markdown. Здесь имя технологии и роль в конвертере. Там выбор хаба против узкой страницы и путаница с «Markdown в PDF».
Какие файлы он переводит и чего ждать
На Тулси обёртка вокруг MarkItDown принимает PDF, Word (.docx), презентации (.pptx), Excel (.xlsx и .xls), EPUB, HTML, CSV, JSON, XML, TXT, Markdown и обычные картинки. Секретные контейнеры и произвольный .exe туда не кладите.
Ждите связный текст там, где в исходнике есть текст. PDF, из которого курсор копирует абзацы. Word со стилями «Заголовок 1». Слайды с тезисами на кадрах. Таблица с подписями строк.
На двухколоночном PDF с врезками, колонтитулами, сносками и SmartArt вы получите склеенные блоки. В сводных таблицах Excel важны формулы; Markdown забирает подписи ячеек. После конвертации правьте такие места руками или режьте исходник на главы.
Имена файлов задавайте осмысленные до загрузки: reglament-otpuska.docx, а не final_v7(1). Иначе через час вы не вспомните, какой .md откуда взялся. Дубликаты одной инструкции в трёх версиях лучше убрать заранее.
PDF, Word, таблицы и слайды
PDF с текстовым слоем MarkItDown читает как поток символов и пытается сохранить абзацы. Заголовки угадывает по начертанию и структуре: с оглавлением в Acrobat они совпадают не всегда. Таблицу из PDF вы получите как markdown-таблицу или как набор строк. Подробный разбор только PDF: как перевести PDF в Markdown. Узкая кнопка: PDF → Markdown.
Word с нормальными стилями заголовков даёт более предсказуемый Markdown: стили Word ближе к иерархии #, ##. Списки и простые таблицы проходят чище, чем в многоколоночном PDF. Точка входа: Word → Markdown.
Со слайдов вы забираете текст с кадров. Порядок блоков может отличаться от того, как вы читаете слайд глазами: сначала заголовок, потом врезка, потом мелкий комментарий. Таблицы Excel удобны, когда нужны подписи и пояснения в ячейках. Формулы и сводные для Markdown не цель.
Сканы и картинки без текстового слоя
Откройте PDF и попробуйте выделить фразу курсором. Курсор не цепляет буквы: перед вами картинка страницы. MarkItDown в базовом режиме забирает уже существующий текст из файла. Ветку распознавания рукописи с ним не путайте.
На Тулси для снимка страницы берите фото в Markdown. Для рукописи и рецептов другая ветка, с распознаванием. Гонять скан через хаб «на удачу» значит получить пустой ответ или обрывки из подписи к картинке.
Печати, подписи и фотографии в Markdown картинкой не появятся. На их месте останется пустота или короткая пометка. Смысл картинки, если он важен, опишите сами рядом с текстом.
Как получить Markdown на Тулси без установки
Откройте конвертер в Markdown. Загрузите файл. Дождитесь текста. Скопируйте его или скачайте .md. Повторите для следующего документа.
Один тип файла весь день: удобнее узкая страница. Только PDF: PDF → Markdown. Только Word: Word → Markdown. Смесь форматов: хаб. Направление одно: в Markdown. Кнопки «Markdown в PDF» и «Markdown в Word» решают обратную задачу.
На бесплатном режиме лимит: три файла в день, до 5 МБ каждый. Большая пачка: смотрите тарифы. Файл нужен, чтобы получить ответ; долгое хранение исходника не предполагается. Политика: конфиденциальность.
Не загружайте то, чего нельзя отдавать во внешний контур по правилам компании. Учебные материалы и публичные регламенты по риску проще, чем кадровые сканы и чужие договоры.
Что проверить сразу после ответа
Заголовки: проверьте, не склеились ли главы в один уровень. Списки: не стали ли сплошным абзацем. Таблицы: не поехали ли колонки. Колонтитулы и номера страниц: не повторяются ли в каждом блоке.
Сверьте ключевые цифры и названия с оригиналом. Для договора, прайса и регламента расхождение в одной цифре важнее «красоты» разметки. Правьте руками или разрежьте исходник и прогоните главу ещё раз.
Откройте .md в редакторе с подсветкой Markdown или посмотрите, чем открыть файл .md. Сырой текст с решётками # это нормальный Markdown. Файл целый.
Когда имеет смысл ставить у себя
Локальная установка нужна, если политика запрещает внешний контур, если файлов сотни, если вы встраиваете шаг в свой скрипт. Тогда идёте в репозиторий Microsoft, ставите пакет в своё окружение и читаете README проекта. Эта статья такой установкой не заменяет документацию пакета.
Для двух методичек перед семинаром страница на Тулси короче. Вы не настраиваете зависимости PDF-парсера и не ловите конфликт версий Python.
Смешивать контуры в одной задаче не стоит: часть файлов на сайте, часть «на всякий случай» локально, потом две папки .md с разными правками. Выберите один путь на пачку.
Смежные задачи на Тулси
Пачка разных типов: конвертер в Markdown и статья конвертер файлов в Markdown. Там про хаб против узких страниц и про хвосты «Markdown в PDF».
Только PDF: PDF → Markdown и как перевести PDF в Markdown. Там про текстовый слой, колонки и типичные сбои у PDF.
Снимок страницы без текстового слоя: фото в Markdown. Рукопись и рецепты идут другой веткой, с распознаванием.
Сырьё под ассистента: база знаний из документов. Личные заметки: PDF и Word в Obsidian. Посмотреть .md как страницу: Markdown → HTML. Обратный путь из Markdown в Word или PDF: другие кнопки на сайте. Хаб «в Markdown» этим не занимается.
Частые вопросы
Что такое MarkItDown?
MarkItDown это открытая утилита Microsoft: она принимает офисный или смежный файл и отдаёт текст в Markdown. Её используют как библиотеку в Python, как команду в терминале и как движок внутри сайтов-конвертеров. На Тулси она стоит за конвертером в Markdown: вы загружаете файл в браузере и забираете .md без установки пакета.
MarkItDown от Microsoft: это официальный проект?
Да. Репозиторий публикует Microsoft, исходники открыты. Это библиотека и утилита командной строки. В Word отдельной кнопки нет, установщика для Windows у проекта тоже нет. Запрос «markitdown от microsoft» проверяет авторство. Для разовой задачи Office рядом ставить не нужно: хватит страницы конвертера или своего Python-окружения.
Где MarkItDown на GitHub?
Официальный репозиторий: microsoft/markitdown на GitHub. Там README, список форматов и примеры вызова. Запросы «markitdown github» и «https github com microsoft markitdown» ведут туда же. Клонировать имеет смысл для встройки в свой скрипт. Один файл с диска проще прогнать через конвертер.
Как скачать MarkItDown?
«Скачать» для этого проекта значит взять исходники с GitHub или поставить пакет Python из официального индекса. Отдельного markitdown.exe с неизвестного сайта ждать не стоит: так подсовывают чужие программы. Если цель получить Markdown из одного PDF, скачивать утилиту не нужно: откройте конвертер в Markdown и загрузите файл. Для своего контура следуйте README репозитория Microsoft.
Как установить MarkItDown?
Локально вы создаёте окружение Python, ставите пакет и вызываете утилиту по документации проекта. Зависимости для PDF и Office-форматов в README описаны отдельно: их пропускают и потом удивляются пустому выводу. На Тулси этот шаг уже сделан на сервере. Вы ставите пакет у себя, только если файлы нельзя выносить или нужен свой скрипт на пачку.
Есть ли MarkItDown онлайн, без Python?
Да. Библиотеку оборачивают формой в браузере. На Тулси это конвертер в Markdown: загрузили файл, забрали текст. Отдельно ставить Python не нужно. Смотрите лимит бесплатного режима (три файла в день, до 5 МБ) и тарифы, если пачка больше. Файл нужен для ответа; правила: конфиденциальность.
Подойдёт ли результат для Claude и других ассистентов?
Да. Markdown удобен как корм для ассистента: заголовки и списки видны модели как текст. Сначала конвертируете документ, проверяете цифры и названия, потом кладёте .md в то хранилище, которое читает ваш ассистент. Запрос «markitdown claude» про этот конвейер. Отдельной кнопки «отправить в Claude» внутри утилиты нет. Сборку базы из файлов смотрите в статье про базу знаний.
Можно ли прогнать PDF через MarkItDown?
Да. PDF с выделяемым текстом даёт связный Markdown, таблицы иногда нужно поправить. Скан без текстового слоя даёт пустоту или мусор: сначала распознавание, потом уже Markdown. На Тулси PDF можно отдать в PDF → Markdown или в общий хаб. Пошаговый разбор только PDF: как перевести PDF в Markdown.
MarkItDown на Python: когда это нужно?
Python-вызов нужен, когда вы пишете свой конвейер: папка на диске, цикл по файлам, своя очистка колонтитулов. Для двух файлов перед встречей достаточно браузера. Запрос «markitdown python» путают с установкой: пакет ставят в окружение, затем вызывают из кода или из терминала по README. Документация проекта на GitHub для этого шага первична, эта статья его не заменяет.
Как пользоваться MarkItDown на Тулси?
Откройте конвертер в Markdown, загрузите PDF, Word, таблицу или слайды, дождитесь текста, скачайте .md или скопируйте его. Проверьте заголовки, списки и таблицы глазами. Если типы файлов разные, оставайтесь на хабе; если весь день один PDF, берите узкую страницу. Обратные кнопки «из Markdown в PDF» не используйте: это другая задача.
Рядом: конвертер файлов в Markdown, как перевести PDF в Markdown, база знаний из документов. Точки входа: конвертер, PDF, Word.
Переведите файл в Markdown
PDF, Word, Excel и слайды в один .md. Без установки Python.


