
PP-OCRv6:一套1.5M到34.5M参数的50语言OCR模型上线

做OCR的同行都懂:大模型时代遍地是VLN和通用视觉方案,真要落地到多语言的票据、屏幕截图、工业标签时,准度和部署成本经常两头不讨好。你需要一个既能在边缘设备跑、又能支持50种语言的实用方案,而不是一个只能跑云端的庞然大物。PP-OCRv6就是冲着这个痛点来的,它不是为了炫技,就是为了让你能把OCR真正用起来。
它的核心解法很聪明:用一套PPLCNetV4统一骨干网络,把检测和识别的精度锚定在同一套架构上,而非东拼西凑。检测阶段上了RepLKFPN,用轻量的大核特征金字塔处理小字、旋转、低分辨率这类真实世界的脏输入。识别端则是EncoderWithLightSVTR,融合局部和全局注意力来啃多语言和工业字符的硬骨头。最终产出三个版本(tiny 1.5M、small 7.7M、medium 34.5M),medium在测试集上检测Hmean达到86.2%、识别准确率83.2%,比上代服务器版提升了4.6和5.1个百分点。更重要的是,它原生支持Hugging Face、ONNX Runtime和Paddle Inference三套后端,你可以在不同环境里无缝切换,不用改代码。
我的判断是:在VLN/GPT-4o这类全能模型满天飞的背景下,PP-OCRv6证明了专用OCR模型依然有不可替代的价值。同类方案很难在同一套框架下同时兼顾极致的轻量化(1.5M参数量)、多语言扩展(50种语言支持)以及灵活的部署后端。它没去搞什么“颠覆”,而是老老实实把检测、识别、部署三个环节的工程细节磨到位了。这种“小而美、专而精”的路线,对做文档解析、RAG管线、工业质检的团队是实打实的利好。——你不需要为了一个文本识别任务去硬扛几十G的大模型。


