一、为什么需要它

几乎所有文档 AI 流程——企业 PDF 的 RAG 检索、合规审查、学术搜索、财务抽取——最后都会撞上同一堵墙:你没法把一本 200 页的文档,喂给一个一次只能看一页的模型。

在 Unlimited-OCR 之前,标准做法是:把 PDF 按页拆开 → 逐页 OCR → 再把输出拼回去,祈祷跨页的表格没断、第 12 页的脚注没丢锚点、第 30 页的小节标题没串到错章节。这个"拼接"步骤,正是错误被层层放大的地方——它是工程上的权宜之计,不是智能。

本文交付物

用一篇说清 Unlimited-OCR 解决了什么、核心架构怎么做到"整本解析不爆内存"、怎么本地跑起来,以及商用前必须核对的许可细节。读完你能判断它适不适合你的文档流水线。

二、它是什么

Unlimited-OCR 是百度于 2026-06-22 在 GitHub 与 HuggingFace 同步开源的端到端长文档 OCR 模型,国内也有 ModelScope 镜像。一句话定位:把"整本文档"当作一条序列一次性解析,而不是逐页碎处理——像人坐下来抄一本书那样。

它不是调用外部 API 的封装,而是开源了代码 + 模型权重 + 论文。用户侧数据(你有哪些文档要解析)完全留在本地,不外流。基础信息如下:

说明
开源协议MIT(权重开放、商用 OK;落地前建议再核仓库 LICENSE 文件)
参数量MoE 总参数 3B,每 token 仅激活约 500M
上下文32K token(训练/推理一致);官方计划扩展至 128K
Star 数发布 5 天破万;截至本文整理约 14.2K(用户提供的口径)
获取渠道GitHub(baidu/Unlimited-OCR)、HuggingFace、ModelScope 镜像
部署形态Transformers 本地推理 / SGLang 提供 OpenAI 兼容 API

三、核心原理

长文档 OCR 真正的瓶颈不在"看一页准不准",而在"把 200 页当一整篇读"。Unlimited-OCR 用三块技术把这件事啃下来了:

长文档 多页 PDF / 扫描图 Unlimited-OCR 引擎 DeepEncoder · 16× 视觉压缩 R-SWA · 恒定 KV 缓存 MoE 3B / 激活 500M 结构化文本 保留章节/表格 跨页引用不断裂
图 1:整本文档一次性解析的链路——视觉压缩在前,恒定缓存的解码在后。
1DeepEncoder:把图压到极小

两阶段 ViT 级联(SAM-ViT 窗口注意力 + CLIP-ViT 全局注意力),中间一道 16× 压缩层。一页 1024×1024 的 PDF 能被压到约 256 个视觉 token,且这些 token 只编码一次、全程不变——这正是 R-SWA 能成立的前提。

2R-SWA:KV 缓存恒定不爆

把标准全注意力换成"参考滑动窗口注意力"。每个生成 token 都全量关注「参考段」(全部视觉 token + 提示词,固定不变),只在输出侧滑动关注最近 128 个 token。于是 KV 缓存变成固定容量队列——生成 1 万 token 和 10 万 token,内存占用一样。

3MoE:轻量但够用

总参数 3B、每步只激活约 500M。配合 16× 视觉压缩,在单卡 A800/H100 上即可跑,避开逐页付费 API 的"按页征税"。

四、怎么跑起来

两种主流形态,按场景选。下面命令来自官方文档梳理,我未在本地实跑(本机无对应 GPU 环境),仅作可复制的上手路线;实际以仓库 README 为准。

# 方式一:Transformers 本地推理(需 PyTorch,单图 / 多页)
pip install transformers torch
from transformers import pipeline
# 按仓库 README 调用 OCR pipeline,传入多页 PDF 或扫描图

# 方式二:SGLang 提供 OpenAI 兼容 API(生产环境高并发)
pip install sglang
python -m sglang.launch_server --model-path baidu/Unlimited-OCR --port 30000
# 启动后按 OpenAI 接口规范 POST 文档,拿回结构化文本

国内拉取慢的话,走 ModelScope 镜像拿权重;推理硬件建议先看权重精度与显存占用,再决定单卡还是多卡。文档里提到训练时冻结了 DeepEncoder、只训了解码器 4000 步,说明工程上"视觉编码"是复用成熟的,风险点主要在解码部署。

坑:别把"100 页"当既定能力

官方主打"长文档一次性解析",权威基准实测在 40+ 页文档上指标稳定(Distinct-35 达 96.90%);"100 页级"更像项目宣称的扩展目标,且计划把上下文扩到 128K。落地前用你自己的真实文档长度压测,别直接信宣传数字。

五、实测成绩与选型

关键数字(来自 OmniDocBench 基准与社区评测,非我本机实测):

指标数值对照
OmniDocBench v1.6 综合93.92%v1.5 为 93.23%
较 DeepSeek OCR 基线+6%(v1.5)文本编辑距离 0.038
40+ 页文档 Distinct-3596.90%编辑距离 ≤ 0.1069
推理速度约 7800+ TPS 且稳定6000 token 时较 DeepSeek OCR 快约 35%

和传统"分页 OCR + 拼接"相比,Unlimited-OCR 的优势不在单页准确率,而在跨页一致性:章节结构、表格续页、脚注锚点、跨页引用关系都能在单次解析里保住,不再依赖易错的后处理拼接。若你的痛点正好是"长文档串起来就乱",它值得一试。

文档 AI 最难的早已不是"读准一页",而是"把 200 页读成一整篇"。Unlimited-OCR 是第一个真正要解决这个问题、且权重开放的开源模型。

六、小结与商用注意

一句话总结:Unlimited-OCR 把"长文档端到端解析"从工程 workaround 变成了模型能力,MIT 开源、权重可商用、单卡可跑,对做企业文档 RAG、合规审查、学术库的团队是条值得跟的新基线。

返回技艺录