腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文
本文最后更新于27 天前,其中的信息可能已经过时,如有错误请发送邮件到big_fw@foxmail.com
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文
腾讯混元Hy ASR 3.0 preview:让语音识别理解上下文

8 月 4 日,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。

Hy ASR 3.0 preview 在多个开源评测集和自建评测集上整体表现领先。在开源评测集中,Hy ASR 3.0 preview 在多语种的WER(Word Error Rate, 词错误率)上都控制在3%左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,整体领先竞品。

在自建评测集上,Hy ASR 3.0 preview在通用识别、方言识别、上下文Context理解、复杂声学场景(高噪、耳语)等场景化评测中,WER也保持较低水平,整体领先竞品。

从用户使用的角度,Hy ASR 3.0 preview重点提升了四类能力,包括:

Hy ASR 3.0 preview的能力提升并非来自单一模块,而是模型架构、数据 Scaling 与后训练优化共同作用的结果。

在架构层面,Hy ASR 3.0 preview 采用兼顾效率与性能的 MoE 架构,并将基座模型升级至 Hy3,进一步增强语言理解、上下文建模和语义推理能力。在语音侧,团队自研无监督语音 Encoder,通过数千万小时级无监督语音数据训练,使其能够从复杂音频中提取高质量的声学表征。

为了持续提升模型的语音建模与理解能力,混元团队对语音 Encoder 和大语言模型进行联合训练,引入数千万小时级、多来源的语音数据,覆盖多种方言、口音和声学环境,并通过高质量数据管线进行精细化标注。在大规模联合预训练的基础上,Hy ASR 3.0 preview 通过多阶段能力注入,逐步获得上下文感知、复杂场景适应和方言识别等能力。

围绕通用识别、上下文理解和复杂场景鲁棒性,团队构建了高质量的 SFT recipe,覆盖上下文context、专业名词、不同声学环境以及多样人群语音。针对方言识别能力,SFT 数据体系进一步覆盖 10 大方言片区和 20 余个二级小片区。

在此基础上,团队进一步引入多阶段强化学习,分别针对通用转写准确性、Any-context 上下文能力和复杂长尾场景进行优化,降低模型在复杂声学环境中的误识别和漏识别问题。

目前Hy ASR 3.0 preview已上线腾讯云官网对外提供 API 服务,可广泛应用于智能客服、内容理解、语音搜索等场景。

元宝深度参与共研并已完成首发上线,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写等能力提升,语音输入更准、更稳,且免费开放;WorkBuddy 等产品也在陆续接入中。

体验地址:

腾讯混元:https://aistudio.tencent.com/visual

腾讯云:https://cloud.tencent.com/document/product/1093/135476

版权声明:

本博客部分内容为转载文章,旨在分享有价值的信息,版权归原作者所有。

转载仅为个人学习与交流目的,不对文章观点负责,亦不用于任何商业用途。

如涉及版权问题,请联系本人删除。

文末附加内容
上一篇
下一篇