一、为什么需要它
几乎所有文档 AI 流程——企业 PDF 的 RAG 检索、合规审查、学术搜索、财务抽取——最后都会撞上同一堵墙:你没法把一本 200 页的文档,喂给一个一次只能看一页的模型。
在 Unlimited-OCR 之前,标准做法是:把 PDF 按页拆开 → 逐页 OCR → 再把输出拼回去,祈祷跨页的表格没断、第 12 页的脚注没丢锚点、第 30 页的小节标题没串到错章节。这个"拼接"步骤,正是错误被层层放大的地方——它是工程上的权宜之计,不是智能。
本文交付物
用一篇说清 Unlimited-OCR 解决了什么、核心架构怎么做到"整本解析不爆内存"、怎么本地跑起来,以及商用前必须核对的许可细节。读完你能判断它适不适合你的文档流水线。
二、它是什么
Unlimited-OCR 是百度于 2026-06-22 在 GitHub 与 HuggingFace 同步开源的端到端长文档 OCR 模型,国内也有 ModelScope 镜像。一句话定位:把"整本文档"当作一条序列一次性解析,而不是逐页碎处理——像人坐下来抄一本书那样。
它不是调用外部 API 的封装,而是开源了代码 + 模型权重 + 论文。用户侧数据(你有哪些文档要解析)完全留在本地,不外流。基础信息如下:
| 项 | 说明 |
|---|---|
| 开源协议 | MIT(权重开放、商用 OK;落地前建议再核仓库 LICENSE 文件) |
| 参数量 | MoE 总参数 3B,每 token 仅激活约 500M |
| 上下文 | 32K token(训练/推理一致);官方计划扩展至 128K |
| Star 数 | 发布 5 天破万;截至本文整理约 14.2K(用户提供的口径) |
| 获取渠道 | GitHub(baidu/Unlimited-OCR)、HuggingFace、ModelScope 镜像 |
| 部署形态 | Transformers 本地推理 / SGLang 提供 OpenAI 兼容 API |
三、核心原理
长文档 OCR 真正的瓶颈不在"看一页准不准",而在"把 200 页当一整篇读"。Unlimited-OCR 用三块技术把这件事啃下来了:
两阶段 ViT 级联(SAM-ViT 窗口注意力 + CLIP-ViT 全局注意力),中间一道 16× 压缩层。一页 1024×1024 的 PDF 能被压到约 256 个视觉 token,且这些 token 只编码一次、全程不变——这正是 R-SWA 能成立的前提。
把标准全注意力换成"参考滑动窗口注意力"。每个生成 token 都全量关注「参考段」(全部视觉 token + 提示词,固定不变),只在输出侧滑动关注最近 128 个 token。于是 KV 缓存变成固定容量队列——生成 1 万 token 和 10 万 token,内存占用一样。
总参数 3B、每步只激活约 500M。配合 16× 视觉压缩,在单卡 A800/H100 上即可跑,避开逐页付费 API 的"按页征税"。
四、怎么跑起来
两种主流形态,按场景选。下面命令来自官方文档梳理,我未在本地实跑(本机无对应 GPU 环境),仅作可复制的上手路线;实际以仓库 README 为准。
# 方式一:Transformers 本地推理(需 PyTorch,单图 / 多页) pip install transformers torch from transformers import pipeline # 按仓库 README 调用 OCR pipeline,传入多页 PDF 或扫描图 # 方式二:SGLang 提供 OpenAI 兼容 API(生产环境高并发) pip install sglang python -m sglang.launch_server --model-path baidu/Unlimited-OCR --port 30000 # 启动后按 OpenAI 接口规范 POST 文档,拿回结构化文本
国内拉取慢的话,走 ModelScope 镜像拿权重;推理硬件建议先看权重精度与显存占用,再决定单卡还是多卡。文档里提到训练时冻结了 DeepEncoder、只训了解码器 4000 步,说明工程上"视觉编码"是复用成熟的,风险点主要在解码部署。
坑:别把"100 页"当既定能力
官方主打"长文档一次性解析",权威基准实测在 40+ 页文档上指标稳定(Distinct-35 达 96.90%);"100 页级"更像项目宣称的扩展目标,且计划把上下文扩到 128K。落地前用你自己的真实文档长度压测,别直接信宣传数字。
五、实测成绩与选型
关键数字(来自 OmniDocBench 基准与社区评测,非我本机实测):
| 指标 | 数值 | 对照 |
|---|---|---|
| OmniDocBench v1.6 综合 | 93.92% | v1.5 为 93.23% |
| 较 DeepSeek OCR 基线 | +6%(v1.5) | 文本编辑距离 0.038 |
| 40+ 页文档 Distinct-35 | 96.90% | 编辑距离 ≤ 0.1069 |
| 推理速度 | 约 7800+ TPS 且稳定 | 6000 token 时较 DeepSeek OCR 快约 35% |
和传统"分页 OCR + 拼接"相比,Unlimited-OCR 的优势不在单页准确率,而在跨页一致性:章节结构、表格续页、脚注锚点、跨页引用关系都能在单次解析里保住,不再依赖易错的后处理拼接。若你的痛点正好是"长文档串起来就乱",它值得一试。
文档 AI 最难的早已不是"读准一页",而是"把 200 页读成一整篇"。Unlimited-OCR 是第一个真正要解决这个问题、且权重开放的开源模型。
六、小结与商用注意
一句话总结:Unlimited-OCR 把"长文档端到端解析"从工程 workaround 变成了模型能力,MIT 开源、权重可商用、单卡可跑,对做企业文档 RAG、合规审查、学术库的团队是条值得跟的新基线。
- 许可要复核:社区口径为 MIT(商用 OK),但开源模型的"权重条款"有时会单独限制。上线前请打开仓库 LICENSE 文件确认权重商用范围,别只信二手说法。
- 硬件预算:单卡 A800/H100 可跑是官方表述,实际取决于权重精度与并发;先小文档压测再放量。
- 长度预期:40+ 页稳定,更长按宣传目标逐步扩展,用真实文档验证。
- 数据合规:本地推理意味着文档不出域,适合对隐私敏感的政务 / 金融场景——但部署方仍需自行承担内容合规责任。