凤凰网科技讯 11月25日,腾讯混元于11月25日推出开源OCR模型HunyuanOCR,该模型参数量为1B,基于混元原生多模态架构构建,在多项OCR应用评测中取得当前最优效果。

该模型采用端到端训练推理范式,通过单次前向推理即可完成多项任务,相比传统级联方案更具效率优势。其架构由原生分辨率视频编码器、自适应视觉适配器与轻量化语言模型三部分组成。
在性能方面,HunyuanOCR在复杂文档解析评测OmniDocBench中获得94.1分,超过谷歌Gemini3-pro等模型;在涵盖文档、街景、手写等九大场景的测试集上,其文字检测与识别能力领先同类开源及商业模型。同时,该模型支持14种小语种翻译,并在ICDAR2025文档翻译比赛中获得小模型赛道冠军。
目前该模型已应用于票据字段抽取、视频字幕识别及拍照翻译等场景,并正式对外开放源代码。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8oZNAy7D6Yd

小同爱分享2 小时前
胡思乱想能瘦身的话,那我现在可能只剩灵魂了。 - 小同爱分享
小同爱分享13 小时前
有时伤害你的,不是对方的绝情,而是你心存幻想的坚持。 - 小同爱分享