恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南

  • 首页
  • 资讯中心
  • /
  • GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南

相关资讯

单片机计算机毕设之基于单片机的 GP2Y0A02YK0F 距离数据采集系统设计 基于 STM32 或 51 单片机的数码管实时测距显示系统实现(022105) 2026/9/1 10:10:45
如何把整台虚拟机打包成单文件、在任意机器200ms内启动:smolvm pack可移植镜像完整指南 2026/9/1 10:10:45
VMware Workstation Pro 17 安装激活与虚拟机配置全攻略 2026/9/1 10:10:45

最新资讯

Grok Bot 11个实用用例:从编码调试到文档撰写的AI工作流
大模型驱动的股票分析系统:从指标计算到容器化部署实战
向量分析核心:梯度、散度、旋度与张量基础详解及Python实践
yuzu 模拟器十分钟跑起来:Switch 模拟器完整设置与卡顿排查指南
我的世界Overlay测试指南:拼好种与终末之诗通关验证
为什么不再需要dark:?Kumo语义化颜色Token与深色模式自动化原理揭秘

今日推荐

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

本周热门

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析
数字电路时序基石:深入理解建立时间与保持时间
蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南

发布时间:2026/9/1 10:10:45
GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南 GLM-OCR模型构成拆解CogViT视觉编码器轻量连接器GLM-0.5B解码器完整指南【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款面向复杂文档识别的开源多模态 OCR 模型基于 GLM-V 编码器—解码器架构构建总参数量仅 0.9B。它由三大核心部件组成CogViT 视觉编码器、带 token 下采样的轻量跨模态连接器、以及GLM-0.5B 语言解码器并配合版面分析 并行识别两阶段流水线在 OmniDocBench V1.5 上以 94.62 分拿下综合第一。本文带你从零理解这套架构为何又准、又快、又省。一、整体架构三个部件各司其职 GLM-OCR 的设计思路是视觉负责看、连接器负责翻译、语言模型负责说组件作用参数规模CogViT 视觉编码器在大规模图文数据上预训练提取图像特征占总参数的大头轻量跨模态连接器MLP高效 token 下采样把视觉特征翻译成语言模型能懂的表示极小GLM-0.5B 语言解码器自回归生成文本、表格、公式等识别结果0.5B三者加起来约 0.9B 参数这也是它能轻松跑在消费级显卡甚至 Ollama、Apple Silicon 上的根本原因。二、CogViT 视觉编码器看懂复杂版面 CogViT 是 GLM-V 系列自研的视觉编码器在大规模图文数据上完成预训练因此对文档中的标题层级、表格网格、公式符号等结构有天然的感知能力。微调时的官方配置可以佐证它的地位官方推荐冻结视觉编码器只训练语言部分说明其视觉特征质量已经足够稳定全参微调配置中设置freeze_vision_tower: true冻结 CogViT 视觉编码器见 glm_ocr_full_sft.yaml完整的微调指南见 微调教程三、轻量连接器token 下采样的翻译官 连接器的任务是把 CogViT 输出的大量视觉 token 压缩、投影到语言模型的输入空间。GLM-OCR 的连接器采用高效 token 下采样策略——在保持信息量的同时大幅减少送入解码器的视觉 token 数量直接降低推理时延和显存占用。在微调配置中它对应freeze_multi_modal_projector: true冻结 MLP 跨模态连接器同样建议保持冻结。SDK 侧对图像的处理参数如t_patch_size、min_pixels/max_pixels也集中体现在 config.yaml 的page_loader段落中可理解成喂给 CogViT 之前的预处理策略。四、GLM-0.5B 解码器MTP 加速推理的关键 0.5B 语言解码器负责把视觉特征说出来。它最大的亮点是引入了Multi-Token PredictionMTP损失训练模型一次预测多个 token推理时即可启用投机解码在 vLLM 和 SGLang 中均默认开箱即用。例如 vLLM 启动时会带上--speculative-config {method: mtp, num_speculative_tokens: 3}即让解码器每步打三个草稿、一次性校验显著压低长文档的生成时延。多卡部署脚本 engine.py 中可以看到两种引擎的默认 MTP 参数。配合稳定的全任务强化学习训练策略这套解码器在公式、表格、代码等高风险字符上错字更少、泛化更强。五、两阶段流水线先分块、再并行 单独一个模型还不够GLM-OCR 真正能打在于其两阶段流水线版面分析基于 PP-DocLayout-V3 对整页做布局检测识别出文本块、表格、公式、印章、图片等 25 类区域并映射为 text / table / formula 三种识别任务详见 config.yaml 的label_task_mapping并行识别各区域裁剪后并发送入 CogViT连接器解码器模型不同区域使用不同任务 PromptText / Table / Formula RecognitionSDK 中每个环节都有独立模块便于按需替换页面预处理在 page_loader.py模型调用在 ocr_client.py版面检测在 layout_detector.py结果合并与 Markdown/JSON 输出在 result_formatter.py整条流水线由 pipeline.py 编排。六、架构优势带来的实际收益 ✅这套CogViT 轻量连接器 GLM-0.5B的组合拳最终兑现为四个可感知的收益够准OmniDocBench V1.5 得分 94.62 综合第一公式、表格、信息抽取均达 SOTA够快MTP 投机解码 区域并行识别长文档处理时延大幅下降够省0.9B 参数支持 vLLM / SGLang / Ollama / MLX 多种部署甚至可用无 GPU 的机器通过 self-host 模式 远程调用够稳在复杂表格、代码密集页、印章等真实业务场景保持稳健想验证它对生僻领域的适配能力可以用化学式这类数据做 LoRA 微调8 GB 显存即可跑例如仓库自带的化学结构示例数据集 cosyn_chemical七、一句话总结 CogViT 负责看得懂、轻量连接器负责省着传、GLM-0.5B 解码器负责说得快——正是这一分工明确、总量仅 0.9B 的三段式架构让 GLM-OCR 成为目前性价比最高的开源文档识别模型之一。如果你想动手体验最快路径是pip install glmocr后一行glmocr parse 你的文档.pdf即可看到 Markdown JSON 双格式输出完整用法见 README_zh.md。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号