返回文章

尽管架构更新,DharmaOCR 仍通过领域专精和定向训练,在巴西葡萄牙语上超越了 Mistral OCR4 和 Unlimited-OCR。本文展示了这一优势背后的证据与机制。

三个月前,我们发表了一篇关于 DharmaOCR 的论文,并开源了其中一个模型。目标非常明确:为巴西葡萄牙语量身打造的光学字符识别技术。

训练流程分为两个阶段。第一阶段是监督微调,利用大量来自不同来源、格式和复杂程度的葡萄牙语文件。这一阶段将模型权重调整至巴西葡萄牙语特有的词汇、句法和文档结构——将表征能力集中到目标语言上,而非分散到更广泛的多语言空间中。第二阶段应用了直接偏好优化:模型不仅学习正确转录,还从竞争输出之间的比较偏好数据中学习,使其在推理时能够持续选择更优的提取结果。这一阶段解决的是另一个问题:不是准确性,而是稳定性。通过抑制导致生成模型产生重复或混乱输出的故障模式,DPO 降低了推理时间和成本,并显著提升了模型在生产环境中的可靠性。

两者结合的结果是,该模型在面向葡萄牙语的基准测试中取得了最高的提取质量分数和最低的退化率。这两个阶段缺一不可。微调阶段构建了领域能力;DPO 阶段则确保这种能力在模型容易失效的条件下依然稳固。

-–

OCR 模型的发展日新月异。但最初促使 DharmaOCR 设计的原因(复杂文档的提取质量以及生产条件下的模型稳定性)并未消失。随着领域的变化,这些差距反而变得更具启发性。

多模态生成模型的普及使基于语言模型的 OCR 变得广泛可用,随后涌现的大量微调 OCR 变体也反映了这一技术普及的速度。然而,这种普及并未改变该技术的基本特性。每个基于生成模型的 OCR 系统都是概率性的。转录错误是这种概率性技术固有的变量。区分模型优劣的关键在于它们犯错的频率和类型。这由两个因素决定:模型的结构(其架构和参数数量)以及这些参数如何针对任务进行训练。

架构和参数数量决定了模型的学习上限。而训练则决定了这种能力如何分配。

这种区别使得专业化成为一个结构性问题,而非设计偏好。当模型在受限领域(单一语言、限定文档类型、特定任务)上训练时,其所有参数都专用于该特定任务。而当模型被训练以覆盖更广泛的领域(例如处理N种语言的多语言模型)时,这些相同的参数就必须在所有领域之间分配。这种分配并非线性:神经元叠加原理意味着单个参数可以同时编码多个特征。但划分是真实存在的,其后果也是真实的。覆盖更多领域的模型,对其中任何特定部分的投入都会减少。

DharmaOCR 的训练方式反向接受了这一约束。该模型并非旨在成为其他语言的最佳选择,也从未有此意图。作为交换,网络中可用的每一个参数都可以专注于巴西葡萄牙语的特定词汇、形态和正字法模式——这是模型资源在该领域最直接的运用方式。

这种集中性,构成了相对于多语言和更广领域模型的固有优势的结构基础。这种优势并不依赖于拥有比竞争对手更大的架构或更复杂的训练流程——新的架构和训练技术能提升任何模型的能力。它取决于这些资源被导向何处:集中于一个领域,而非分散到多个领域。

三个月后,更新的模型已经出现。当这些模型更新、能力更强时,专业化的理由是否依然成立,则是一个不同的问题。

在 DharmaOCR 论文发表三个月后,两款新的 OCR 模型引起了研究界的广泛关注:Mistral OCR4 和 Unlimited-OCR。两者都代表了真正的技术进步——新的训练技术、新的数据集,以及在多项基准评估中跨多种语言的强劲表现。它们是那种能提升 OCR 系统预期交付标准的模型。

当我们让两者都运行在 DharmaOCR 基准测试(一项专门围绕葡萄牙语设计的评估)上时,结果具有决定性。

DharmaOCR 得分为 0.925。Mistral OCR4 得分为 0.798。Unlimited-OCR 得分为 0.7587。

差异显著。Mistral OCR4 比 DharmaOCR 低约 13 个百分点;Unlimited-OCR 则低了超过 16 个百分点。两者均在我们模型之后发布,且都拥有雄厚的研究资源支持。在 DharmaOCR 的基本设计决策是全力集中于葡萄牙语的任务上,专业化优势是可衡量且显著的。

该基准测试是核心发现。以下内容则说明了为何差距会呈现其特定的形态。

-–

处理非平凡的葡萄牙语文档,恰恰揭示了多语言模型通常会在何处失效。ENEM 论文(巴西国家高中考试)将手写文本与巴西葡萄牙语特有的词汇、专有名词和文化参考结合在一起。它们正是那种语言特定训练能产生回报的文档类型。

ENEM 论文手稿

图1:基准评估中使用的ENEM论文手稿及各模型输出结果。红色标记为误读内容。

Mistral OCR4在此类文档评估中,将巴西最广为人知的音乐家兼诗人奇科·布阿尔克(Chico Buarque)的名字误转录为“Chico Barque”。Unlimited-OCR则将其识别为“chico bique”。面对同一文档中嵌入的奇科·布阿尔克引文“O Brasil não exclui, assimila”(“巴西不排斥,而是同化”),Unlimited-OCR输出结果为:“a dose de chico bique, ‘o Brasil no exclu, eliminila’。”

这些并非随机错误。对巴西葡萄牙语接触不足的模型不会随意出错——其错误恰好集中在区分巴西葡萄牙语与多语种语料库的词汇和专有名词上。奇科·布阿尔克并非冷门人物,这个名字在全国范围内广为人知。其在各输出结果中系统性地被扭曲,绝非边缘案例。这是一项诊断:揭示了模型训练未曾触及的领域。

DharmaOCR在相同文档评估中正确识别了这些案例。原因很直接:该模型的训练集中在这一语言空间,将资源导向巴西葡萄牙语特有的词汇和专有名词分布,而非分散到多种语言中。

这些示例旨在说明基准测试,而非替代它。基准测试确立了差距的规模;示例则展示了为何差距集中在语言特异性识别而非通用能力上。

然而,提取准确性仅是生产性能的一个维度。视觉困难下的稳定性是另一维度——从操作层面看,后者失效的后果更为严重。

当生成模型遇到无法清晰识别的文档——字体过小、扫描质量退化、密集手写——其输入信号面临不确定性。主要基于下一个词元预测目标训练的模型在此面临特定弱点:当视觉信号变得模糊时,模型可能继续根据先前学习模式而非源文档生成内容。结果导致文本退化——输出重复、不连贯,且与页面内容语义脱节。

面对字体过小的文档,Mistral OCR4产生的输出与原文毫无关联。

小字体文档

图2:小字体文档

DharmaOCR输出与Mistral OCR4退化输出

图3:DharmaOCR输出与Mistral OCR4退化输出

这并非对源文档的低质量转录,而是完全不同类型的失败。

操作后果与转录错误截然不同。错误的转录在可恢复的层面上存在偏差——它与源文档存在关联,原则上能够被识别并修正。而退化输出则不存在这种关联。它无法被修正,因为根本没有可供修正的目标。对于依赖结构化OCR输出的下游流程——文档分类、信息提取、合规工作流——退化输出并非不准确的数据,而是结构上不可用的数据。自动化本应带来的效率,恰恰在输出停止成为信息的那一刻被彻底抵消。

Mistral OCR4和Unlimited-OCR是优秀的模型,背后有显著的技术进步。本文描述的退化行为并非它们的定义特征,而是指出了当前训练尚未针对该领域解决的一种特定故障条件。问题在于:针对这一问题设计的训练管线应该是什么样。

-–

在DharmaOCR中,答案在于DPO阶段。

监督微调将模型的资源集中到目标领域——即构建上述语言对齐的阶段。但SFT训练的是单个token预测:模型学习根据上下文生成正确的下一个token。在视觉复杂度下,这创造了导致退化的条件。如果输出中的早期token偏离了源文档,后续每个预测都基于这种偏离状态,输出会持续漂移。重复循环和不连贯序列在此背景下是固有特征——它们是逐步骤优化目标、而未考虑完整提取连贯性的可预测结果。

DPO则针对不同的信号进行训练。SFT逐token训练,而DPO基于完整输出的质量训练模型——教会它根据完整提取的连贯性(而非单个预测的准确性)来区分竞争性响应。其效果是稳定性的:在视觉复杂度可能引发漂移的文档上,模型更不容易陷入偏离路径,因为其训练惩罚了在提取层面失去连贯性的输出。

结果正如原始基准测试所展示的:在那些没有此训练阶段的模型会失去连贯性的相同文档上,退化率更低,同时提取准确率更高。

基准测试确立了当前的事实。但对于两年后的情况,它并不那么精确。

有可能——而且很可能——更新的模型最终会在巴西葡萄牙语上超越当前的DharmaOCR。架构会改进,训练技术会进步,数据集会扩大。该领域在每一层面都在向更高能力迈进,没有理由认为这一轨迹会停止。这是意料之中的,也是值得欢迎的。

每一代架构改变的是绝对性能的上限。而不变的是决定哪些系统在特定领域最接近其上限的结构逻辑。

可用资源——算力、参数、训练数据——都是有限的。它们必须被导向某个方向。一个将这些资源集中于单一领域的系统,在该领域内所能提取的价值,将高于将相同资源分散到多个领域的系统。无论通用模型的能力发展到何种程度,这一关系都成立。随着架构的改进,专精模型与通用模型之间的差距可能会演变,但结构性动态不会逆转。我们在之前的一篇文章中更深入地探讨了这一原则,分析了为何随着AI系统的发展,专精化仍能持续带来优势(《为何专精化不可避免》)。

这正是Dharma规划未来方向的基础。目标并非捍卫当前模型的基准地位,而是始终站在新兴技术的前沿——新架构、新训练方法、对齐与评估的新思路——并将它们应用于同一个目标:打造一个专精于巴西葡萄牙语OCR的系统,以尽可能低的成本和最短的推理时间,最充分地利用可用资源。

更好的工具并不会削弱专精化,而是会拓展其所能实现的边界。

三个月前,我们证明了将模型训练集中于特定领域,能够产生相对于通用系统(包括那些更新、资源更丰富的系统)的可衡量优势。这一优势依然存在。同样的原则将决定DharmaOCR如何持续演进——不是固守不变,而是将领域内的所有进步应用于一个始终不变的专精领域。

来源

  • Cardoso, Gabriel Pimenta de Freitas, 等. “DharmaOCR: Specialized Small Language Models for Structured OCR that outperform Open-Source and Commercial Baselines.” arXiv预印本 arXiv:2604.14314 (2026).

延伸阅读

-–

探索 Hugging Face上的Dharma AI 试用我们的交互式演示 下载我们的开源模型,并了解专精AI系统如何在真实企业应用中超越通用模型。