阿里发布Qwen3.8-Omni-Flash全模态模型:音视频能力提升

2026-09-18 17:27:04   |   唐微   |   4369

9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台提供。该模型可同时处理文本、图像、音频和视频输入,支持1M上下文。

全模态模型指可同时处理文本、图像、音频、视频等多种输入形式。官方称,该模型在保持同尺寸文本模型能力的同时,全模态能力较上一代明显提升。在累计30项评测上,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。

基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR/ISR分别提升8.5/14.1分。AliMeeting的DER/cpWER从88.11/89.61降至3.35/17.18。官方称,其音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。

为支持长音视频,官方扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。长音视频理解方面,模型支持按需描述、Agentic主动取证、会议任务推进和视频深度研究报告。可控音视频Caption可指定描述对象、时间范围、信息粒度和输出格式。在Agentic长音视频理解中,OmniVideoBench准确率从63.4提升至67.8,Token消耗从145,736降至79,117,降幅约45.7%。

会议场景中,模型支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险。结合工具调用,还可发送邮件、整理任务或编码。音视频生产方面,Music2MV可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。长电影解说中,用户提供影片和一句话需求,Agent可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

模型优化实验中,Qwen3.8-Omni-Flash在12小时内尝试提升Qwen2.5-Omni-3B的四川话识别能力。它自主选定评测集,经4轮实验构建3413条训练数据,字符错误率从25.79%降至15.30%,相对下降约40.7%。

信息压缩方面,Qwen-MM-Plugins开源Video2Note,可将数小时视频内容生成图文对应的PDF笔记。Omni Skill Creator可从操作演示中提炼标准作业流程,并转化为可复用的Agent Skill。

实时版Qwen3.8-Omni-Flash-Realtime可在音视频流输入同时完成感知与响应,并结合实时上下文调用工具。它还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。官方称,该实时版是首个支持“听声辨位”的全模态大模型,融合空间声音与视觉信息,判断声源方向和距离。它还可通过Skill注入身份设定、表达风格、业务知识与交互规则。

特别提醒:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字、图片等内容的真实性、完整性、及时性本站不作任何保证或承诺,请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时发送相关信息至bireading@163.com,本站将会在48小时内处理完毕。

阿里发布Qwen3.8-Omni-Flash全模态模型:音视频能力提升

2026-09-18 17:27:04 浏览量: 4369 作者: 唐微

9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台提供。该模型可同时处理文本、图像、音频和视频输入,支持1M上下文。

全模态模型指可同时处理文本、图像、音频、视频等多种输入形式。官方称,该模型在保持同尺寸文本模型能力的同时,全模态能力较上一代明显提升。在累计30项评测上,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。在音视频Agent、Coding和长程任务方面,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。

基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR/ISR分别提升8.5/14.1分。AliMeeting的DER/cpWER从88.11/89.61降至3.35/17.18。官方称,其音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。

为支持长音视频,官方扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。长音视频理解方面,模型支持按需描述、Agentic主动取证、会议任务推进和视频深度研究报告。可控音视频Caption可指定描述对象、时间范围、信息粒度和输出格式。在Agentic长音视频理解中,OmniVideoBench准确率从63.4提升至67.8,Token消耗从145,736降至79,117,降幅约45.7%。

会议场景中,模型支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险。结合工具调用,还可发送邮件、整理任务或编码。音视频生产方面,Music2MV可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。长电影解说中,用户提供影片和一句话需求,Agent可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

模型优化实验中,Qwen3.8-Omni-Flash在12小时内尝试提升Qwen2.5-Omni-3B的四川话识别能力。它自主选定评测集,经4轮实验构建3413条训练数据,字符错误率从25.79%降至15.30%,相对下降约40.7%。

信息压缩方面,Qwen-MM-Plugins开源Video2Note,可将数小时视频内容生成图文对应的PDF笔记。Omni Skill Creator可从操作演示中提炼标准作业流程,并转化为可复用的Agent Skill。

实时版Qwen3.8-Omni-Flash-Realtime可在音视频流输入同时完成感知与响应,并结合实时上下文调用工具。它还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。官方称,该实时版是首个支持“听声辨位”的全模态大模型,融合空间声音与视觉信息,判断声源方向和距离。它还可通过Skill注入身份设定、表达风格、业务知识与交互规则。

,

Copyright ©2018 铋读网 All Rights Reserved.

京ICP备18051707号

京公网安备 11011302001633号