恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能

  • 首页
  • 资讯中心
  • /
  • DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能

相关资讯

AndroidStudio老项目 macOS运行BlueTooth蓝牙串口助手(Android+Studio源码).rar 2026/9/28 20:43:07
AXI Memory Mapped IP核BAR配置全解析:从原理到性能优化 2026/9/28 20:38:07
Vivado launch_simulation失败的三级定位与修复 2026/9/28 20:38:07

最新资讯

基于Neo4j构建企业级金融风控知识图谱实战指南
Go gRPC 生产级部署:连接池 + 重试 + 超时 + 熔断全攻略
蓝桥杯Java备赛Day6:贪心算法高频模型与实战拆解
姜黄素 / 水飞蓟素 / 酵母复合真菌毒素解毒剂对断奶仔猪氧化还原状态和生长性能的影响 | MDPI Toxins
RT-DETR解析:无NMS实时目标检测如何逼平YOLO
四个运维日常Shell脚本:巡检、日志清理、服务自愈与批量分发

今日推荐

开源模型端侧落地实战:量化、推理加速与Agent上下文管理
AI Evals实战指南:从零搭建LLM应用评估体系与CI/CD集成
Java采购管理系统实战:从数据库设计到事务一致性

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能

发布时间:2026/9/28 20:43:07
DeepSeek-OCR-2基准评测实战:如何在OmniDocBench v1.5上复现文档OCR性能 DeepSeek-OCR-2基准评测实战如何在OmniDocBench v1.5上复现文档OCR性能【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2本文带你完整走一遍DeepSeek-OCR-2的基准评测流程在主流文档理解基准OmniDocBench v1.5上批量运行文档 OCR 推理输出可评测的 Markdown 结果。无论你是想复现论文性能还是评估自己的文档解析链路都能按这份指南快速上手。一、30秒认识DeepSeek-OCR-2文档OCRDeepSeek-OCR-2论文主题Visual Causal Flow的核心思路很直观不再依赖 CLIP 类视觉编码器而是把语言模型本身当作视觉编码器LM as Vision Encoder探索更接近人类阅读方式的视觉编码图像先被 80M 的 Tokenizer 切块压缩再由 Qwen2500M按因果阅读顺序编码输出高压缩比的视觉 token推理时支持动态分辨率默认(0-6)×768×768 1×1024×1024对应(0-6)×144 256个视觉 token兼顾小图速度与大图细节。一句话它是面向文档转 Markdown场景的高性能 OCR 模型也是 OmniDocBench v1.5 上的标杆选手。相关原理细节可查阅项目附带的论文 DeepSeek_OCR2_paper.pdf。二、一键安装3步搭好评测环境 ️官方环境基线CUDA 11.8 PyTorch 2.6.0第 1 步克隆仓库git clone https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2 cd DeepSeek-OCR-2第 2 步创建 Conda 环境conda create -n deepseek-ocr2 python3.12.9 -y conda activate deepseek-ocr2第 3 步安装依赖pip install torch2.6.0 torchvision0.21.0 torchaudio2.6.0 --index-url https://download.pytorch.org/whl/cu118 pip install vllm-0.8.5cu118-cp38-abi3-manylinux1_x86_64.whl pip install -r requirements.txt pip install flash-attn2.7.3 --no-build-isolation 小贴士vLLM 与 Transformers 混装时若提示vllm 0.8.5cu118 requires transformers4.51.1之类冲突可忽略不影响推理运行。核心依赖清单见 requirements.txt。三、OmniDocBench v1.5 批量评测关键配置详解评测入口只有一个脚本run_dpsk_ocr2_eval_batch.py所有可调参数集中在 config.py。只需修改这几项配置项说明默认值MODEL_PATH模型路径Hugging Face 或本地权重deepseek-ai/DeepSeek-OCR-2INPUT_PATHOmniDocBench v1.5 图片目录需自行填写OUTPUT_PATHMarkdown 结果输出目录需自行填写MAX_CONCURRENCY并发数显存不足时调小100NUM_WORKERS图像预处理线程数64PROMPT文档转 Markdown 的评测提示词已配好评测脚本内置了几个关键细节直接影响成绩EXIF 方向校正correct_image_orientation()会根据 EXIF 标签自动旋转图片避免评测数据方向错误导致性能虚低N-gram 去重解码通过 ngram_norepeat.py 中的NoRepeatNGramLogitsProcessorngram40、window90抑制生成卡顿重复td等 token 已加白名单保护结果后处理自动清理公式冗余标记、剥离检测坐标片段输出干净的.md文件。四、跑通评测从图片到Markdown 确认config.py后只需一条命令cd DeepSeek-OCR2-master/DeepSeek-OCR2-vllm python run_dpsk_ocr2_eval_batch.py脚本执行流程读取INPUT_PATH下全部图片 → 多线程动态分辨率预处理 → vLLM 批量并发推理gpu_memory_utilization0.7→ 在OUTPUT_PATH生成与图片同名的 Markdown 文件。随后把OUTPUT_PATH交给 OmniDocBench 官方评测工具即可得到文本编辑距离、公式、表格、阅读顺序等指标。同一目录下还有两个姊妹脚本按需切换单图流式输出run_dpsk_ocr2_image.pyPDF 并发处理run_dpsk_ocr2_pdf.py五、常见问题快速排查 ✅显存不够 / OOM调小MAX_CONCURRENCY或降低gpu_memory_utilizationCUDA 11.8 下 Triton 报错脚本已自动设置TRITON_PTXAS_PATH确认 CUDA 路径为/usr/local/cuda-11.8即可没有 vLLM 环境可改用 Transformers 路线直接运行 run_dpsk_ocr2.py单图精度一致但速度较慢结果含坐标标记这是 grounding 模式的检测片段批量评测脚本已自动剥离单图模式可参考re_match()的实现。六、写在最后DeepSeek-OCR-2 用LM 当视觉编码器的 Visual Causal Flow 架构把文档 OCR 推向了新的压缩比与精度平衡点。按照本文流程你可以在一台 GPU 上完整复现它在 OmniDocBench v1.5 上的评测成绩并以此为基线对比自己的解析方案。动手跑起来才是理解这个模型最快的方式 【免费下载链接】DeepSeek-OCR-2Visual Causal Flow项目地址: https://gitcode.com/gh_mirrors/de/DeepSeek-OCR-2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号