新模型,老优势

通用多语言OCR模型在实际落地中有一个隐藏的代价:面对特定语言(比如巴西葡萄牙语),它们在专有名词、文化词汇面前频频出错,甚至连“Chico Buarque”这样家喻户晓的名字都能识别成“Chico Barque”或“chico bique”。更致命的是,遇到字迹模糊或小字体文档,模型直接输出无意义的重复文本——这不是转录错误,而是结构性失效。这种退化让下游流程彻底无法使用,自动化带来的效率瞬间归零。

DharmaOCR的解法很直接:把模型全部参数集中在巴西葡萄牙语这一个领域上,而不是分散到几十种语言。它先通过监督微调(SFT)让模型学会本地词汇和句式,再用直接偏好优化(DPO)教会模型在完整输出层面保持一致性——不只看单个token对不对,而是看整段转录是否连贯。结果是,即使面对更新、更重资源的Mistral OCR4Unlimited-OCR,DharmaOCR在专有基准上拿到0.925的提取质量分,对手分别是0.798和0.7587。退化率也被压到极低。

这件事给我的启发是:专业化不是权宜之计,而是结构性的优势。只要算力、参数、数据还是有限的,把资源全部押在一个域上就一定比分摊到多个域上能榨出更多价值。新架构能提高所有模型的天花板,但改变不了资源聚焦带来的相对优势。未来OCR会更强,但Dharma的思路不会过时——它会持续吸收前沿技术,把每一点进步都转化成对同一目标语言的极致优化。这不是守成,是更聪明的持续迭代。

Newer Models, Same Advantage

查看原文