AI资讯

阿里巴巴发布Qwen-Audio-3.0-ASR-Flash,医疗场景识别率突破95.36%

阿里巴巴发布了最新的语音识别大模型Qwen-Audio-3.0-ASR-Flash,在医疗、IT编程等多个领域的专业词汇识别上取得显著进展。

AI云图智寻编辑部2026-07-31 12:32
阅读时间:约 2 分钟
阿里巴巴发布Qwen-Audio-3.0-ASR-Flash,医疗场景识别率突破95.36%
7月31日,阿里巴巴发布了最新的语音识别大模型Qwen-Audio-3.0-ASR-Flash。该模型在上下文一致性、行业词识别和热词定制化等方面进行了优化,特别是在医疗场景中的识别率达到了95.36%。

优化方向与技术特点

Qwen-Audio-3.0-ASR-Flash主要在三个维度进行了系统性优化:上下文一致性、行业词识别和热词定制化。此外,该模型还具备语音润色能力,可以直接输出结构化文本。研究团队从医疗、IT编程、股票和社会名人等领域挖掘了大量专业词汇,建成了覆盖多行业的高质量词库,从而加强了模型对专业术语和冷门词的识别能力。

应用场景与性能表现

目前,Qwen-Audio-ASR-Flash系列已经在多个场景中得到验证,包括会议纪要整理、实时字幕、教育录播和智能客服等。在AI评测平台Artificial Analysis上,该模型以1.7%的错字率取得了全球第一的成绩。尤其是在医疗场景中,新模型的专业词汇识别率突破了95.36%,显示出其在特定领域中的卓越性能。

版本与调用方式

Qwen-Audio-3.0-ASR-Flash系列提供了三个版本:Qwen-Audio-3.0-ASR-Flash用于最长5分钟的语音识别;Qwen-Audio-3.0-ASR-Filetrans用于离线文件转写;Qwen-Audio-3.0-ASR-Streaming用于实时语音识别。这些版本现已通过阿里云百炼平台开放调用,用户可以根据具体需求选择合适的版本进行使用。