恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
MarkItDown:把各种文件一口气转成 Markdown 的实用指南
首页
资讯中心
/
MarkItDown:把各种文件一口气转成 Markdown 的实用指南
MarkItDown:把各种文件一口气转成 Markdown 的实用指南
发布时间:2026/8/28 9:56:48
MarkItDown把各种文件一口气转成 Markdown 的实用指南【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown上周我接到一份 40 页的 PDF 调研报告要提炼摘要喂给 LLM。复制粘贴出来全是断行的表格和乱序的标题折腾一小时还不如自己读。后来我用 MarkItDown 把这个 PDF 转 Markdown一条命令搞定出来的文本结构基本能直接进提示词。它是个 Python 写的 Markdown 转换工具PDF、Word、Excel、PPT 这些常见格式都能处理。一条命令把 PDF 变成 Markdown先装工具这条命令会顺带装上 PDF、Office 文档等格式的解析依赖pip install markitdown[all]装完直接跑下面这条命令把报告转成 Markdown 文件markitdown report.pdf -o report.md跑一下看看终端不会有任何输出但当前目录会多出report.md打开后原文的章节标题都变成了#开头的层级段落顺序没乱表格也整整齐齐排成了 Markdown 表格。这个文件现在可以直接塞进提示词了。转出来之后结构、插件与批量处理它保留了哪些结构拿 Word 里的内容试一次最直观三级标题会变成### 标题表格变成带|的 Markdown 表格超链接保留成文字的形式——也就是说标题层级、表格、链接这三样在转换后都能对应上。注意复杂排版的 PDF多栏、无边框表格转出来容易丢层级遇到这种情况可以装上markitdown[all]再试它带的 pdfplumber 对表格识别更稳。让图片自己开口说话转换时如果传入 LLM 客户端文档里的图片会自动生成一段文字说明替换进去这样 LLM 就看得到图表内容了from markitdown import MarkItDown from openai import OpenAI md MarkItDown(llm_clientOpenAI(), llm_modelgpt-4o) print(md.convert(doc_with_images.pdf).text_content)扫描件、截图多一点的文档可以试下 OCR 插件pip install markitdown-ocr转换时加-p启用插件比如markitdown scan.pdf -p --llm-client openai --llm-model gpt-4o。它复用同一套 llm_client 机制不用再额外装一套 ML 库。把整个文件夹批量转成 Markdown想文件批量转 Markdown 的话十来行代码就够了。下面这段会扫描docs/目录把 PDF 和 DOCX 挨个转成同名的.md放进out/import os from pathlib import Path from markitdown import MarkItDown os.makedirs(out, exist_okTrue) md MarkItDown() for name in Path(docs).iterdir(): if name.suffix in (.pdf, .docx): r md.convert(name) Path(fout/{name.stem}.md).write_text(r.text_content, encodingutf-8)跑完预期在out/下看到与源文件同名的 Markdown 文件数量和扩展名一一对应。手边找个真实 PDF 跑一次比看十篇评测都管用。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考