Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Baidu releases Unlimited-OCR demo on Hugging Face

如果你的工作里要把扫描件、PDF 或长报告批量变成可编辑的文本,OCR 这一环其实长期有个老问题:模型一次只能吃下有限的篇幅,长文档得切成一页一页分别识别,再靠后处理把碎片拼回去——表格跨页、段落跨页、引用跨页时尤其容易错位。百度这次放出的 Unlimited-OCR,卖点正是冲着这个痛点去的。 按官方说法,它能一次性处理 40 多页,并且在这个过程中保持上下文不断裂。换句话说,模型不是把每页当成互不相干的图片孤立识别,而是在更长的跨度上理解文档结构,从而减少跨页拼接带来的错乱。这对长文档转录是个实打实的便利,省掉的正是工程上最烦人的切分与重组环节。 规格方面,它走的是 MoE(混合专家)路线:总参数 3B,但每次推理只激活其中 500M。MoE 的好处是模型可以把"容量"做大、却不必每次都让全部参数参与计算——激活的那部分才真正消耗算力。所以 3B 总参 / 500M 激活意味着它实际推理时的开销,比一个稠密 3B 模型要轻得多,对部署成本和延迟都友好,也更适合塞进批量处理这种要跑很多页的场景。 更值得一提的是它的可得性:百度没有只发个论文或权重,而是直接在 Hugging Face Spaces 上挂了一个公开 demo,任何人都能打开网页试一段自己的文档,不用先搭环境。对想评估它到底好不好用的人来说,这降低了上手门槛——能不能扛住自己手里那种排版复杂的真实文档,自己丢进去试一次就知道。 这条消息是 2026-06-23/24 经 @_akhaliq 在 X 上转发百度官方而被注意到的,目前能确认的就是上面这些:3B 总参 / 500M 激活、一次 40+ 页、上下文保持、公开 demo。 诚实的保留也在这里:原文并没有给出任何基准分数,也没说清它在中英文等具体语言上的识别准确率、对手写体或复杂表格的表现,更没有公布授权协议和能否商用。"一次 40+ 页"是官方自述的能力上限,真实效果如何、和现有 OCR 方案比是领先还是持平,都得等第三方实测或更完整的技术说明出来才能下判断。现阶段它更像一个值得收藏、找机会亲自试一试的新工具,而不是已经被验证的结论。