
阿里千问上线Qwen3.8-Omni-Flash:原生全模态支持1小时音视频输入,1M上下文加音视频Agent,音频API价格降超98%
新闻原文
9月18日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。该模型支持文本、图像、音频、视频四类输入,上下文长度达 1M Token,原生支持最长 1 小时连续音视频输入,核心目标是提升真实生产力场景中的 Agent 能力,推动全模态模型从"理解全模态内容"走向"规划任务、调用工具并完成创作"。模型经阿里云百炼及千问平台云端托管上线,覆盖北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚等多个区域。
能力层面,在累计 30 项评测中,Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%:音视频 Agent、Coding 与长程任务在 WildClawBench-MM 上提升 36.5 分,在 AgenticVBench 上提升 22.3 分,UniClawBench 取得 69.6 分;长音频理解 LongAudioSpan 提升 8.3 分,AliMeeting 的说话人错误率从 88.11 降至 3.35。官方口径下,其音频能力整体超过 Gemini 3.8 Flash,音视频能力接近该模型。
应用层面,模型已打通多条端到端工作流:面对数小时长视频,Agentic 长音视频理解从问题出发自主取证,把 OmniVideoBench 准确率从 63.4 提升至 67.8,同时 Token 消耗下降约 45.7%;多人会议可端到端完成说话人切分、纪要生成与任务执行;此外还支持可控音视频 Caption、Music2MV 音乐视频创作、短剧翻译、长电影解说等生产场景。
生态与成本层面,随模型开源多模态插件工具包 Qwen-MM-Plugins 与实时交互运行环境 Qwen-Live Harness;API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。官方还展示了一项"模型优化模型"实验:Qwen3.8-Omni-Flash 在 12 小时内自主构建 3413 条训练数据,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。(综合凤凰网科技、阿里千问官方信息报道)
企服观察
全模态模型这次的关键变化,不是又多认识了几种文件格式,而是把"音视频"从演示素材变成了生产资料。过去企业里的会议录像、培训视频、客服录音大多躺在网盘里,检索靠文件名、复用靠人肉;当模型能原生吃进一小时连续音视频、并直接输出纪要、待办和风险提示时,这些沉睡的音视频资产第一次具备了被规模化加工的条件。对 IT 企服服务商来说,这里藏着一个非常具体的商机方向:音视频资产化。把客户的会议、培训、售后录音做成可检索、可追溯、可自动派生任务的知识库,是一个横跨制造、金融、医疗、政务的通用需求,而且客单价和续费逻辑都比"接个大模型 API"扎实得多。
价格曲线是第二条值得盯紧的线。每小时音频输入价格降幅超过 98%、音视频超过 93%,这个量级的降价不是营销数字,而是成本结构的重写。举例来说,一个中型企业每天产生 500 小时会议与通话录音,按旧价格做全量转写加理解,一个月的成本可能就足以让项目毙掉;价格降一个数量级之后,"全量处理"与"抽检处理"的界限消失了,质检、合规审查、销售复盘这类原来只能抽样的场景都可以变成全量场景。建议每一个做 AI 应用报价的服务商,把两个月前做的成本模型拿出来重算一遍——你很可能会发现,去年不敢接的单子,今年已经成立了。同理,在给客户做五年期合同时,也要把"模型单价持续下降"写成调价条款,而不是按签约定价一锁到底。
第三层启示在交付能力本身。当模型可以自主决定"看哪一段、听哪几句",传统靠人写提示词、人工切片段的交付方式就落伍了,竞争的焦点正在从 Prompt 工程转向工作流编排:如何设计取证策略、如何挂接业务系统、如何把模型输出落到工单和 CRM 里。Qwen-MM-Plugins 与 Qwen-Live Harness 这类运行环境的开源,实际上是在告诉市场:未来的护城河不在模型本身,而在模型外面的那套"岗位化包装"。企服团队应当把投入从"调模型的技巧"转向"工具链与业务系统连接器"的建设,这才是客户难以自行复制、也难以被云厂商顺手拿走的部分。
组织层面同样需要提前动作。全模态应用落地后,最容易失衡的不是技术而是分工:会议纪要由模型生成后,谁来审核、审核标准是什么、错误由谁兜底,这些流程问题不提前定好,上线第一周就会返工。建议企业在试点期就建立三份轻量文档——音视频处理的范围清单、人工抽检的抽查比例、敏感内容的拦截规则,把 AI 输出当作"助理起草"来管理,而不是当作"系统结果"来免责。工具越强,流程纪律越值钱,这是过去两年所有 RPA 与智能体项目反复验证过的经验。
当然,也要保持清醒。云端托管、未开放权重的模式意味着数据要进厂商的托管区域,对金融、政务、医疗等敏感行业,数据主权与出境合规仍是硬门槛;多区域部署解决了"在哪跑"的问题,但没有自动解决"能不能跑"的问题。建议企服选型时把三件事写进 POC 评审表:一是长音频场景的真实准确率(拿客户自己的嘈杂录音测,不要用官方样例);二是多说话人场景的身份识别与指代消解能力;三是按小时计费的真实成本曲线与峰值并发表现。全模态的大门已经打开,但能走进去的,永远是那些把场景、数据与交付流程提前理顺的团队。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。