
阿里发布Qwen3.8-Omni-Flash原生全模态模型:1M上下文+音视频Agent交付,音频输入成本降超98%,多项基准逼近或超越Gemini 3.8 Flash
阿里通义千问9月18日发布新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本/图像/音频/视频输入与100万Token上下文,30项评测平均提升超25%,AliMeeting说话人错误率从88.11降至3.35,音频输入价格降超98%,配套开源Qwen-MM-Plugins与Live Harness,主打音视频Agent端到端交付。
【新闻原文】
9月18日,阿里巴巴通义千问团队正式发布新一代原生全模态模型 Qwen3.8-Omni-Flash,并同步上线千问AI平台与阿里云百炼(覆盖北京、新加坡、香港、东京、法兰克福、弗吉尼亚等区域)。该模型支持文本、图像、音频、视频四种输入,提供100万Token上下文窗口,基于 Qwen3.8-Flash-Next 架构,核心目标是将全模态模型从"理解内容"推向"规划任务、调用工具、完成创作"的 Agentic 交付阶段。官方数据显示,模型在累计30项评测中较上一代 Qwen3.5-Omni-Plus 平均得分提升超过25%;在音视频Agent评测 WildClawBench-MM 上提升36.5分(71.0分,高于 Gemini 3.8 Flash 的58.9分),AgenticVBench 提升22.3分。多说话人会议识别进步显著,AliMeeting 说话人错误率(DER)从88.11降至3.35,带归属词错误率(cpWER)从89.61降至17.18。价格方面,每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。模型支持113种语言与方言的音频输入、双通道与四通道空间音频解析,兼容 DashScope 与 OpenAI 协议。配套开源 Qwen-MM-Plugins 多模态插件与 Qwen-Live Harness 实时交互运行环境(模型权重本身暂不开源)。官方还演示了"大模型研发小模型"范式:Qwen3.8-Omni-Flash 在12小时内自主完成数据构建与4轮迭代,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从25.79%降至15.30%。
【企服观察】
Qwen3.8-Omni-Flash 的发布,表面上是一次常规的模型迭代,但对IT企服行业来说,它可能是一块重要的分水岭:音视频正在从"AI的感知输入"变成"AI的生产资料",这意味着大量以音视频为核心载体的企业服务,第一次具备了被端到端自动化的技术前提。
第一,成本塌缩是本轮发布最实打实的信号。音频输入每小时降价98%、音视频降价93%以上,这不是营销话术,而是把"批量处理音视频"从预算审批级支出降到了运维可自主决策的成本区间。过去企业想对客服通话录音做全量质检、对培训视频做内容盘点、对会议录像做纪要与待办提取,往往因为API成本只能抽样处理,覆盖率通常不足5%。当处理成本下降两个数量级,"全量分析"取代"抽样分析"将成为企服产品的新默认值。对服务商而言,谁先把全量音视频分析封装成标准化SaaS能力,谁就能在客服质检、合规审查、销售会话分析(Conversation Intelligence)等赛道拿到代际优势。
第二,会议场景的 DER 从88降到3.35,解决的是企服最普遍的痛点之一。多说话人重叠、身份归属混乱是过去语音转写产品难以商用的根本原因,"谁说了什么"比"说了什么"更重要——因为待办、决议、责任都需要归属到人。现在模型能联合理解音画完成说话人切分、身份对应,再结合工具调用直接发邮件、整理任务甚至开始编码,这等于把"会议纪要工具"升级成了"会议执行智能体"。对OA、协同办公、项目管理类厂商,这是必须跟进的能力基线,否则其纪要功能将在半年内显得过时。
第三,"大模型研发小模型"的范式值得每一家做垂直场景的服务商认真研究。通用大模型在12小时内自主构建3413条训练数据、诊断问题、迭代方案,把一个3B小模型的方言识别错误率相对下降40%——这说明定制化模型的研发门槛正在从"需要一个算法团队"降为"需要一个会写需求的产品经理"。对乙方服务商来说,未来向客户交付的将不再是"我们的算法工程师很厉害",而是"我们的智能体产线能在一两天内为你的场景调出专用模型"。研发外包的逻辑可能被重写。
第四,也要保持清醒:模型权重暂不开源,只开源配套插件与运行环境,这意味着深度集成的企业仍要走API路线,数据出境、私有化部署、供应商锁定等问题依旧是央国企与金融客户的决策卡点。此外,官方数据显示其在部分视频理解基准上仍落后于 Gemini 3.8 Flash,"逼近"不等于"全面领先",选型时应要求POC实测而非只看发布会数字。
对IT企服从业者的行动建议:短期(1个月内)梳理自身业务中所有音视频处理环节,用新价格重算全量处理成本,识别"抽样变全量"带来的产品升级机会;中期(1个季度)基于 Qwen-MM-Plugins 与 Live Harness 搭建音视频Agent原型,优先切入会议执行、视频内容资产化、短剧出海译制三个已验证场景;长期则要重新设计自家产品的定价模型——当客户的音视频处理成本下降百倍,按调用量收费的商业模式必须同步演进,否则红利将被上下游拿走。音视频Agent的窗口期已经打开,这一次,动作慢的企业失去的不是效率,而是品类。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。