ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南

GLM-OCR模型构成拆解:CogViT视觉编码器+轻量连接器+GLM-0.5B解码器完整指南 GLM-OCR模型构成拆解CogViT视觉编码器轻量连接器GLM-0.5B解码器完整指南【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款面向复杂文档识别的开源多模态 OCR 模型基于 GLM-V 编码器—解码器架构构建总参数量仅 0.9B。它由三大核心部件组成CogViT 视觉编码器、带 token 下采样的轻量跨模态连接器、以及GLM-0.5B 语言解码器并配合版面分析 并行识别两阶段流水线在 OmniDocBench V1.5 上以 94.62 分拿下综合第一。本文带你从零理解这套架构为何又准、又快、又省。一、整体架构三个部件各司其职 GLM-OCR 的设计思路是视觉负责看、连接器负责翻译、语言模型负责说组件作用参数规模CogViT 视觉编码器在大规模图文数据上预训练提取图像特征占总参数的大头轻量跨模态连接器MLP高效 token 下采样把视觉特征翻译成语言模型能懂的表示极小GLM-0.5B 语言解码器自回归生成文本、表格、公式等识别结果0.5B三者加起来约 0.9B 参数这也是它能轻松跑在消费级显卡甚至 Ollama、Apple Silicon 上的根本原因。二、CogViT 视觉编码器看懂复杂版面 CogViT 是 GLM-V 系列自研的视觉编码器在大规模图文数据上完成预训练因此对文档中的标题层级、表格网格、公式符号等结构有天然的感知能力。微调时的官方配置可以佐证它的地位官方推荐冻结视觉编码器只训练语言部分说明其视觉特征质量已经足够稳定全参微调配置中设置freeze_vision_tower: true冻结 CogViT 视觉编码器见 glm_ocr_full_sft.yaml完整的微调指南见 微调教程三、轻量连接器token 下采样的翻译官 连接器的任务是把 CogViT 输出的大量视觉 token 压缩、投影到语言模型的输入空间。GLM-OCR 的连接器采用高效 token 下采样策略——在保持信息量的同时大幅减少送入解码器的视觉 token 数量直接降低推理时延和显存占用。在微调配置中它对应freeze_multi_modal_projector: true冻结 MLP 跨模态连接器同样建议保持冻结。SDK 侧对图像的处理参数如t_patch_size、min_pixels/max_pixels也集中体现在 config.yaml 的page_loader段落中可理解成喂给 CogViT 之前的预处理策略。四、GLM-0.5B 解码器MTP 加速推理的关键 0.5B 语言解码器负责把视觉特征说出来。它最大的亮点是引入了Multi-Token PredictionMTP损失训练模型一次预测多个 token推理时即可启用投机解码在 vLLM 和 SGLang 中均默认开箱即用。例如 vLLM 启动时会带上--speculative-config {method: mtp, num_speculative_tokens: 3}即让解码器每步打三个草稿、一次性校验显著压低长文档的生成时延。多卡部署脚本 engine.py 中可以看到两种引擎的默认 MTP 参数。配合稳定的全任务强化学习训练策略这套解码器在公式、表格、代码等高风险字符上错字更少、泛化更强。五、两阶段流水线先分块、再并行 单独一个模型还不够GLM-OCR 真正能打在于其两阶段流水线版面分析基于 PP-DocLayout-V3 对整页做布局检测识别出文本块、表格、公式、印章、图片等 25 类区域并映射为 text / table / formula 三种识别任务详见 config.yaml 的label_task_mapping并行识别各区域裁剪后并发送入 CogViT连接器解码器模型不同区域使用不同任务 PromptText / Table / Formula RecognitionSDK 中每个环节都有独立模块便于按需替换页面预处理在 page_loader.py模型调用在 ocr_client.py版面检测在 layout_detector.py结果合并与 Markdown/JSON 输出在 result_formatter.py整条流水线由 pipeline.py 编排。六、架构优势带来的实际收益 ✅这套CogViT 轻量连接器 GLM-0.5B的组合拳最终兑现为四个可感知的收益够准OmniDocBench V1.5 得分 94.62 综合第一公式、表格、信息抽取均达 SOTA够快MTP 投机解码 区域并行识别长文档处理时延大幅下降够省0.9B 参数支持 vLLM / SGLang / Ollama / MLX 多种部署甚至可用无 GPU 的机器通过 self-host 模式 远程调用够稳在复杂表格、代码密集页、印章等真实业务场景保持稳健想验证它对生僻领域的适配能力可以用化学式这类数据做 LoRA 微调8 GB 显存即可跑例如仓库自带的化学结构示例数据集 cosyn_chemical七、一句话总结 CogViT 负责看得懂、轻量连接器负责省着传、GLM-0.5B 解码器负责说得快——正是这一分工明确、总量仅 0.9B 的三段式架构让 GLM-OCR 成为目前性价比最高的开源文档识别模型之一。如果你想动手体验最快路径是pip install glmocr后一行glmocr parse 你的文档.pdf即可看到 Markdown JSON 双格式输出完整用法见 README_zh.md。【免费下载链接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive项目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表