2026-06-25 · 📦 产品← 本期
Mistral releases OCR 4, claims 72% win rate in blind tests

如果你的活儿里有"把一堆 PDF、合同、报表、幻灯片喂进模型"这一步,那 OCR 这层往往是整条流水线最先掉链子的地方——版面一乱、表格一多、语言一杂,抽出来的文本就开始错位。Mistral 在 6 月 24 日发布的 OCR 4,瞄准的正是这个环节:它不是一个聊天模型,而是专门读文档、把文字和结构抽出来的识别模型,输入覆盖 PDF、Word 和 PowerPoint。
OCR(光学字符识别)这个词容易让人以为只是"把图片里的字认出来",但现代文档识别要做的远不止认字。它得判断哪块是标题、哪块是正文、哪里是一张表格、哪里是一个公式或一处签名——也就是把版面拆成有语义的块,否则下游拿到的就是一团顺序错乱的文字。OCR 4 在这一点上明确做了块级分类:抽取时会标出元素类型(标题、表格、公式、签名等)。这对把结果灌进 RAG 或结构化数据库的人很关键,因为"知道这段是表格"和"只拿到一串字符"是两种完全不同的可用性。
另一个实用的设计是置信度。OCR 4 为每个词、每一页都输出一个置信度分数。在生产环境里,这意味着你可以按分数把可疑的页面挑出来人工复核,而不是对整批结果一视同仁地相信或不信——对要做质量门控的流水线来说,这是个能直接用上的钩子。
语言覆盖方面,官方称支持 170 种语言,并表示对较冷门的语种也"处理得不错"。需要诚实标注的是:这句话原文没有给出任何支撑数据或分语种的测试结果,只是一句定性说法,不宜当成已验证的结论。
至于性能,Mistral 给出的核心证据是一场盲测:在 600 多份文档上,独立评审在 72% 的情况下更偏好 OCR 4 的输出,而非参与对比的其他模型。这个数字听起来不错,但有几处需要保留地看。其一,文章没有点名具体是哪些竞品,所以"赢了谁"无从核实。其二,72% 是"被偏好的比例",属于人类主观偏好投票,不等于某个客观准确率指标;文章虽提到它"在两项基准上都胜过所有受测对手",却没给出基准名称和任何数值分数。其三,这终归是厂商自报的盲测,缺第三方在未污染条件下的复现。
商业层面信息比较清楚:每千页 4 美元,批处理模式降到每千页 2 美元,通过 Mistral API、Mistral Studio 和微软 Foundry 三个入口提供。要注意它是纯 API 服务,没有放出可本地部署的开源权重——这点和 Mistral 一些开放模型的形象不同,对数据合规要求高、不能把文档发到外部 API 的团队是个硬约束。
落到判断:对正在搭文档处理流水线、希望有现成高质量 OCR 选项的团队,这是一个值得纳入对比清单的新供给,块级结构和逐词置信度是两个能落地的卖点。但在你自己的真实文档分布上跑一轮对照之前,别把那 72% 当成结论——厂商盲测的胜率和你的实际数据上的表现,常常是两回事。