恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
MarkItDown:3 步把 PDF 和 Office 文档转成 Markdown,让 LLM 一条命令读懂文件
首页
资讯中心
/
MarkItDown:3 步把 PDF 和 Office 文档转成 Markdown,让 LLM 一条命令读懂文件
MarkItDown:3 步把 PDF 和 Office 文档转成 Markdown,让 LLM 一条命令读懂文件
发布时间:2026/8/28 9:31:40
MarkItDown3 步把 PDF 和 Office 文档转成 Markdown让 LLM 一条命令读懂文件【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown它能做什么MarkItDown 是一个轻量级 Python 工具把 PDF、PowerPoint、Word、Excel、图片、音频、HTML、CSV/JSON/XML、EPUB、ZIP 等文件统一转换成 Markdown。它转换时会尽量保留文档结构——标题、列表、表格、链接都以 Markdown 形式保留下来而不是压成一段乱序纯文本。它的定位很明确转换结果主要喂给 LLM 和文本分析管线。主流大模型对 Markdown 的兼容性很好而且 Markdown 的 token 开销低适合做文档问答、RAG 索引、批量文本分析。如果你的需求是给人排版看的高保真还原它不是最佳选择。3 条命令跑起来需要 Python 3.10 及以上版本建议先在虚拟环境里操作。普通用户安装即用pip install markitdown[all] markitdown --version开发者从源码安装git clone https://gitcode.com/GitHub_Trending/ma/markitdown cd markitdown pip install -e packages/markitdown[all][all]会装齐所有格式的可选依赖。如果只转换少数几种文件也可以按需装 extras例如pip install markitdown[pdf, docx, pptx]装出来的环境更干净。一条命令转换 PDF 到 Markdown把文件放到本地然后markitdown path-to-file.pdf -o document.md转换结果直接写入 document.md。不想指定输出文件时用重定向markitdown path-to-file.pdf document.md也可以没有实体文件时还支持管道cat path-to-file.pdf | markitdown。图片和音频同样可以直接传入默认会提取 EXIF 元数据。如果希望图片被看懂在 Python API 里传入llm_client和llm_model转换时会生成图片的文本描述md MarkItDown(llm_clientclient, llm_modelgpt-4o) result md.convert(example.jpg)仓库测试目录里就有这类样例图转换后会变成可被模型理解的纯文本值得调的几个参数--use-docintel-e endpoint改用 Azure Document Intelligence 云端提取对扫描件、复杂表格效果明显更好默认不需要有 Azure 资源且本地转换质量不佳时再开。--keep-data-uris输出中默认会截断 base64 数据 URI内嵌图片想要保留就加这个开关默认关闭即可能省不少体积。-x/--extension给无扩展名的输入流提供格式提示走管道或 stdin 转换时建议补上。-p/--use-plugins启用第三方插件比如 markitdown-ocr可以对 PDF、DOCX 里的内嵌图片做 OCR。默认关闭装完用markitdown --list-plugins确认已安装。llm_client/llm_modelPython API为图片和 PPT 内嵌图生成描述。建议只在确实需要时传入避免每次转换都产生 API 调用。用 Docker 部署不想在本地装 Python 环境时仓库根目录自带 Dockerfiledocker build -t markitdown:latest . docker run --rm -i markitdown:latest ~/your-file.pdf output.md镜像内置 ffmpeg 和 exiftool音频和图片元数据都能正常提取。容器里就是进一个文件、出一个 Markdown的单纯命令没有插件体系和配置文件比本地安装更简单但云端提取等高级用法需要在宿主机侧处理。4 个容易踩的坑转换时报错或提示格式不支持原因是安装时没装对应格式的依赖。解法改用markitdown[all]或单独补[pdf]、[docx]等 extras。扫描版 PDF 转出来是空内容或乱码原因是离线提取器认不了纯图片页面。解法换 Document Intelligence-d -e endpoint或装 markitdown-ocr 插件走 LLM 识别两者都需要云端端点或模型。终端里打印输出乱码原因是 stdout 编码吃不下部分字符。解法改用-o直接写文件文件写入走 UTF-8 更稳。在线服务里直接处理用户上传的文件MarkItDown 以当前进程权限做 I/O和open()一样输入被控制就可能被利用。解法先校验输入只调用最窄的convert_local()或convert_stream()不要让用户直接控制文件路径和 URI。另外提醒一句只转换和保存你有权限使用的内容。上手与反馈MarkItDown 是 Microsoft AutoGen 团队维护的活跃开源项目新格式、新插件在持续加入。遇到问题或想加功能可以直接在仓库提 Issue 或 PR想扩展支持新格式可以参考packages/markitdown-sample-plugin写自己的插件。【免费下载链接】markitdownPython tool for converting files and office documents to Markdown.项目地址: https://gitcode.com/GitHub_Trending/ma/markitdown创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考