今天,我们正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash。简单来说,就是让AI更好地听懂专业词汇。这次主要 在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。
目前,Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到广泛验证,曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。对语音识别来说,能不能听得准专业词汇,往往是它能不能真正在行业里用起来的“最后一公里”——这也是这次升级最想解决的问题。
Qwen-Audio-3.0-ASR——现已通过阿里云百炼平台开放调用,提供三个版本:
Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟
Qwen-Audio-3.0-ASR-Filetrans:离线文件转写
Qwen-Audio-3.0-ASR-Streaming:实时语音识别
欢迎体验
Qwen-Audio-3.0-ASR-Flash:
https://help.aliyun.com/zh/model-studio/non-real-time-speech-recognition-for-fun-asr-flash Qwen-Audio-3.0-ASR-Flash-Filetrans:https://help.aliyun.com/zh/model-studio/fun-asr-recorded-speech-recognition-http-api Qwen-Audio-3.0-ASR-Flash-Streaming:https://help.aliyun.com/zh/model-studio/fun-asr-realtime-websocket-api
上下文不“断片”
长音频Context能 力——识别时可参考前文已识别的内容,让跨片段的识别保持连贯,不遗漏、不认错。
在会议、访谈、课程、直播这类长音频里,很多专业术语、英文词汇等,光靠当下这几秒的声音其实判断不准——同一个发音可能对应十几个同音词,模型必须记得前面说过什么,才能在这一段里识别准确。
Qwen-Audio-3.0-ASR-Flash新增了这项能力:在转写当前这段语音时,它能参考近期已经识别出的内容,顺着同一话题里的关键词和语义往下听,从而减少同音词误判,把术语、中英文混说这些容易出错的地方听得更准。哪怕是一场好几个小时的会议录音,同一位发言人的名字、同一个技术概念,也不会因为跨了好几段就被忘掉或认错。更方便的是,这些“记忆”直接来自音频本身,会随对话自动更新。

听得准行业词
行业词识 别——把各行业的专业词汇内化为模型自身的识别能力,无需逐一配置也能持续听准。
“记得住上下文”解决了“说过的词不再认错”的问题;但还有很多专业词,整场对话里可能只出现一次,模型得在“从没见过”的情况下也能一次就听对。传统做法通常靠人工维护词表,费时费力;Qwen-Audio-3.0-ASR-Flash把这件事变成了模型自身的能力,不用人一个个去配,也能在真实业务里越用越准。
具体来说,研究团队持续从医疗、IT编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的"听中率"都有明显提升,其中医疗场景更是突破了95.36%。

热词加多也不乱
热词定 制——通过分级热词机制,让企业按需配置的专属词汇即时生效,加得再多也不会误触发。
行业词库覆盖的是通用场景,但每家企业还有自己的专属叫法。让模型认得这些词,是语音识别落地企业的刚需。传统做法长期有个两难:热词加得越多,误触发也越多,识别结果反而被带偏了。
Qwen-Audio-3.0-ASR-Flash全新升级即时热词定制能力——在传入热词的情况下,热词“听中率”在所有测试集都达到90%以上,多数场景更是突破99%,不再是“提了这项、掉了那项”。对用户来说,这意味着你可以随时把最新的品牌名、人名、术语配成专属热词,实时融进识别里,不用等模型更新,就能精准命中业务里的每一个关键词。

边识别边润色
语音润 色——在识别环节一步完成润色,直接输出去掉口头禅、条理清晰的书面文本。
口语里的“那个”“嗯”这类口头禅会被直接去掉;说话时的自我纠正,比如“我们下周三评审,不对,是周四”,只保留最后的意思;结结巴巴的重复、零散的口述,也会被整理成简洁、书面的表达。这些活都由ASR模型在识别环节一步做完,不用再叫一个下游的文本大模型来帮忙。
在评测中,它去口头禅、去重复后的可读性和忠实度,和“先识别 + 再用Qwen3.6-Plus润色”的两步走方案基本打平(比如所有子集的可读性平均分从没润色时的2.55提升到3.43,优秀可读率从30.75%提升到59.27%)。

1
去除无意义语气词
润色前:
那同时因为 其实您日常我们再去 用一些AI的AI的 一个产品和模型的话,我们 其实 大部分都是在用一些像这种DeepSeek或者是千问,或者是这个 Kimi这样的一个通用模型。
润色后:
同时,因为日常使用AI产品和模型时,我们大部分都在用DeepSeek、千问或Kimi这类通用模型。

2
清理口吃与重复
润色前:
那也是通过,比如说把相关的一些,就是就 电动车的一些,就是它的一些 产品手册啊,还有像是一些 问题集啊,然后产品说明啊这种投喂进去之后,那用户他有车需求的,车辆可以行驶到喇叭不响就可以去定位,比如说 喇叭啊喇叭 不响会有什么问题,然后他文档里面可能给到的一些参考图片。
润色后:
那也是通过把电动车的产品手册、问题集和产品说明等投喂进去。用户有车辆需求时,比如车辆可以行驶但喇叭不响,就可以去定位“喇叭不响会有什么问题”。文档里可能给到的一些参考图片。

3
处理自我纠正
润色前:
这个这个,搜一下那个 遇果香源的 红富士苹果,啊不是,是 烟台栖霞红富士,对,要3斤装的,还带“脆”字的那个。
润色后:
搜一下烟台栖霞红富士,要3斤装、带“脆”字的那个。

4
语义重组
润色前:
对比我们的奔驰C级的汽车和 宝马的,宝,奔驰C级和宝马三系。那 我们再结合我们 前期已经了解到的客户画像,她是一位女性啊,夫妻两个人的每天工作的场景就是上下班的代步。那在这种场景下还有客户 可能比较关注性价比啊,关注它的可靠性啊。会就会有这个 销售话术的引导会给出来。
润色后:
对比奔驰C级和宝马3系,结合前期了解到的客户画像:她是一位女性,夫妻两人每天的工作场景就是上下班代步。在这种场景下,客户可能比较关注性价比和可靠性,销售话术的引导会随之给出。
一套模型听懂30种语言
多语种识 别——把多语种能力集成进同一套模型,一个模型覆盖全球市场,无需频繁切换。
如今越来越多企业走向海外,语音识别要面对的早就不只是中文和英文了:跨境客服要回应不同国家和地区的咨询,国际会议上经常几种语言来回说,海外的音视频内容也在不断增多。相比资料丰富的主流语言,小语种普遍有个难题——训练素材少、口音差异大、口语表达也更随意,往往是最容易听错的环节。
Qwen-Audio-3.0-ASR-Flash把多语种识别能力都集成在同一套模型里:从中文、日语、韩语,到泰语、越南语、印尼语、马来语等东南亚语言,再到印地语、阿拉伯语,以及英语、法语、德语、西班牙语、葡萄牙语、俄语等欧洲主流语言,都能直接识别,不用针对不同市场频繁换模型。
语音识别结果:공개매수는 경영권 확보를 위해 주식을 장외에서 정해진 가격으로 사는 건데 공개매수가 발표되면 해당 주식의 주가는 보통 상승합니다.
(公开收购是指为了取得经营权,在场外按照指定价格购买股票。公开收购发布后,相关股票的价格通常会上涨。)
语音识别结果:Apakah perasaan anda apabila pertama kali mengetahui anda akan mewakili sekolah ataupun negeri ke peringkat kebangsaan?
(当你第一次得知自己将代表学校或所在州参加全国级别的活动时,你是什么感受?)
语音识别结果:Vậy thì qua những cái kinh nghiệm, qua những cái bài học, qua những cái mà anh đúc kết được thì anh nghĩ đâu là yếu tố quan trọng nhất để có thể xây dựng cũng như là giữ vững được một cái đội nhóm hiệu quả?
(根据你的经验、教训和总结,你认为建立并长期维持一支高效团队,最重要的因素是什么?)
用的时候,只要告诉模型这场会议可能涉及哪几种语言,它就会自动开启“多语言混合识别”——以中文、英文、日语为主语言,自由搭配其他小语种,轻松应对“中文+英文+日语”“英文+印尼语”这类跨国会议、多语客服的场景。在七个语种的评测中,它的平均语义错误率仅17.09%,优于Azure、ElevenLabs Scribe v2、Gemini 3.0 Flash以及上一代模型。
低延迟场景也听得准
Qwen-Audio-3.0-ASR-Streaming——面向客服通话、会议实时转写、直播字幕这类对速度要求很高的场景,在保证“几乎不卡顿”地实时出字的同时,把复杂工业场景下的识别准确率也一起拉了上来。
它在保持理论出字延迟300毫秒的同时,进一步提升了复杂工业场景下的识别准确率:中文工业场景的平均错字率仅7.8%,明显领先同类;英文工业场景为11.52%,同样优于其他模型。

从记住上下文,到听准行业词、自由定制热词,再到一步输出干净文字,Qwen-Audio-3.0-ASR-Flash想做的就是在复杂的对话里持续听准、在专业的领域里精准听对、在最终输出时润色到位。目前它已在阿里云百炼平台开放调用,也期待看到大家在会议、教育、客服、出海等真实场景里把它用起来。

