恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

PaddleOCR 营业执照识别怎么做:从跑通第一张图到字段抽取

  • 首页
  • 资讯中心
  • /
  • PaddleOCR 营业执照识别怎么做:从跑通第一张图到字段抽取

相关资讯

DeepSeek-Reasonix内置斜杠命令速查表:高频命令一览全掌握 2026/8/29 10:29:21
OBS Studio 直播录制入门:5 步搭好你的第一场推流 2026/8/29 10:29:21
基于PyTorch与YOLOv8的花卉识别系统毕设实战解析 2026/8/29 10:29:21

最新资讯

Dify智能体创建实战指南:搭建一个能干活的个人助手
AppFlowy 安装配置实战:从克隆到跑通的全流程
Hermes Agent 实战:让 200 篇文献综述在 48 小时内跑通
Hoppscotch API 测试怎么用:免费开源的 API 调试工具安装与使用教程
Hoppscotch 实时接口调试指南:WebSocket 与 SSE 连接、日志排查与选型完整教程
技术写作系统的稳定性改造

今日推荐

云计算SPI三类服务模式是逐层抽象的关系:IaaS提供最底层的硬件资源,PaaS在IaaS基础上封装了开发运行环境,SaaS则进一步封装为可直接使用的软件
最新稳定版(Python 3.14):这是目前官方推荐的最新稳定版本。作为最后一个采用传统“3.x”命名的版本
etc目录下的profile.d文件目录设置环境变量和全局脚本shell

本周热门

Nextcloud 桌面客户端:把同步交给它,你只管改文件
如何将 HTML 转成 Word 文档且格式不丢失?html-to-docx 使用教程
Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

PaddleOCR 营业执照识别怎么做:从跑通第一张图到字段抽取

发布时间:2026/8/29 10:29:21
PaddleOCR 营业执照识别怎么做:从跑通第一张图到字段抽取 PaddleOCR 营业执照识别怎么做从跑通第一张图到字段抽取【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR把营业执照、发票、票据这类证照图片变成可编辑、可入库的文本数据PaddleOCR 的 Python 接口和命令行都能完成先检测文字位置再识别内容配合 PPStructureV3 管线还能解析版面、还原表格、导出 Markdown。本文面向第一次安装使用的读者按跑通最小示例 → 场景用法 → 模型选型 → 问题排查的顺序讲一遍代码均可在本地直接执行。 先看三块核心能力这一节说明 PaddleOCR 拿到一张图后每一步输入什么、得到什么方便你判断该用哪个入口。文本检测 文本识别PaddleOCR管线。输入是一张证照图片处理时分两步检测模型先给出每个文字行的四边形位置框识别模型再逐行输出字符串和置信度输出是一个结果对象rec_texts是文字列表rec_scores是对应的置信度调用res.save_to_img(output)可以保存画了框的效果图res.save_to_json(output)保存结构化结果。默认引擎已包含文档方向分类和弯曲矫正等预处理正放且清晰的图可以关掉以省时间。版面解析PPStructureV3管线。输入是一张结构复杂的文档图处理时先做版面区域检测文字块、标题、表格、图片等再对表格区域做结构识别、对印章区域做识别、对公式区域做识别输出可以是 JSON 或 Markdownres.save_to_markdown(output)。营业执照、发票这类带印章和多栏版式的证照用这条管线比纯 OCR 管线拿到的信息更完整。字段抽取。营业执照需要的统一社会信用代码、法定代表人、注册资本、成立日期等字段不在模型输出里单独成列——它们都在识别结果的文本列表里。做法是遍历rec_texts用正则或关键词匹配把值对应到字段上再拼成字典或写入数据库。字段名固定的证照这一步通常几十行规则就能覆盖不需要额外训练。 最小可运行示例这一节给出最短路径装好依赖、跑一张图先求通再谈参数。python -m pip install paddleocr[all]from paddleocr import PaddleOCR ocr PaddleOCR( use_doc_orientation_classifyFalse, # 关闭方向分类 use_doc_unwarpingFalse, # 关闭弯曲矫正 use_textline_orientationFalse, # 关闭行方向判断 ) result ocr.predict(license.jpg) for res in result: for text, score in zip(res[rec_texts], res[rec_scores]): print(text, round(score, 4))第一次predict会自动下载默认模型之后走本地缓存。三个use_*开关控制预处理方向分类处理倒置的图弯曲矫正处理卷曲扫描件行方向判断处理竖排文字行证照图大多正放清晰关掉三个开关单张耗时会更低。想保存画框图或 JSON在循环里加res.save_to_img(output)、res.save_to_json(output)即可。完整参数说明见 docs/quick_start.md。 什么材料、什么环节会用它财务核对进项发票一批扫描件按目录批量识别把predict的输入从单个路径换成文件路径列表再逐张落库核对金额、税号字段。证照档案数字化营业执照、开户许可证等入库前批量转文本配合上一节说的字段匹配规则生成标准数据表减少人工录入。移动端拍照回传手机拍的证照常带倾斜或阴影初始化时保持use_doc_orientation_classify和use_doc_unwarping默认开启预处理兜底服务端部署时再按需关闭。⚖️ 模型怎么选、参数往哪调按部署位置先定档再按精度要求微调。识别模型精度数据取自官方文档 docs/version3.x/inference_deployment/local_inference/cpp/OCR.md。部署位置建议模型识别精度 (Avg %)模型大小说明服务器 / GPU 节点PP-OCRv5_server_rec默认86.3881 MB精度优先复杂版式更稳普通笔记本 CPUPP-OCRv5_mobile_rec81.2916 MB换约 5 个点精度体积小、快边缘设备 / 移动端PP-OCRv4_mobile_rec78.7410.5 MB极致轻量容忍精度损失有 GPU 时按 docs/quick_start.md 安装对应paddlepaddle-gpu推理吞吐会上一个台阶纯 CPU 部署优先 mobile 档模型比换机器便宜得多。调优主要动三处一是上面三个use_*预处理开关按输入质量取舍二是检测参数limit_side_len大图高分辨率扫描适当调大可改善小字漏检代价是耗时上升三是识别模型档位如表所示切换。 出问题时按现象查现象首次运行卡在下载或下载失败。原因是模型首次自动拉取网络不稳或内网环境容易中断。处理在内网机器上预先把模型包下好放到 PaddleX 的模型缓存目录再运行确认安装的是paddleocr[all]完整功能。现象扫描件上部分文字没被检测到。原因通常是图像模糊或分辨率过低检测阶段就漏了。处理提高扫描分辨率仍漏检时调大检测的limit_side_len让模型看到更大尺寸的特征图。现象旧项目代码在 3.x 上直接报错。原因是 2.x 的use_angle_cls、langch这类参数在 3.x API 中已变更。处理按 docs/quick_start.md 的写法迁移预处理统一改为use_doc_orientation_classify、use_doc_unwarping、use_textline_orientation三个开关语言由模型本身决定不再单独传lang。小结PaddleOCR 的完整链路是预处理 → 检测 → 识别 → 结构化输出本地一条命令即可跑通证照场景再叠上 PPStructureV3 做版面与表格解析按硬件选模型档位即可。安装细节见 docs/quick_start.md模型清单与精度数据见 docs/version3.x/inference_deployment/local_inference/cpp/OCR.md。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号