
智元交互模型超越谷歌英伟达,登顶全球全模态评测榜首,千问豆包跻身前五
复旦大学DailyOmni最新榜单显示,智元硅光动语大模型以85.21分登顶,超越谷歌Gemini和英伟达,八项指标中斩获六项第一。三款国产大模型跻身前五,中国AI在全模态感知领域形成系统性领先。
【新闻原文】
7月28日,复旦大学研究团队发布的音视频跨模态推理评测基准"每日全模态交互能力评测"(DailyOmni)最新榜单显示:智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩登顶榜首,超越千问、谷歌双子座(Gemini)、豆包及英伟达旗下模型,并在八项细分指标中斩获六项第一。
DailyOmni是行业公认的检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方榜单。与传统的图文理解不同,该榜单重点考察模型在真实开放环境下的"全模态感知"能力——机器人能否在复杂的物理空间中,精准判断"谁在说话""事件发生的先后顺序",并做出恰当的交互决策。
硅光动语是智元自研的具身原生全模态大模型,属于智元"一体三智"(本体、运动智能、作业智能、交互智能)中的交互智能。该模型独创了"思考—表达—行动"(Thinker-Talker-Actor)三层端到端架构,机器人依靠视觉来理解物理世界,不再额外需要语音或文字指令,实现了感知、决策与表达的统一驱动。
值得注意的是,在此次榜单前五名中,除了智元,千问、豆包等多款国产大模型亦跻身前列。三款国产模型占据前五,彰显了中国人工智能在全模态感知领域的技术优势。今年5月,硅光动语大模型通过备案,成为全国首款合规备案的具身智能交互大模型,进入合规商用阶段。
来源:上观新闻/复旦大学DailyOmni/网易
【企服观察】
智元硅光动语大模型登顶DailyOmni全模态评测榜首,这一事件的意义远超一个榜单排名,其背后折射出的产业趋势值得企服行业高度关注。
第一,"全模态感知"能力从实验室走向商业落地,将为企服行业带来全新的交互范式。传统的企服软件交互主要依赖键盘鼠标输入和屏幕显示输出,而全模态感知技术让机器能够同时理解语音、图像、视频、文本等多种信息源,并根据场景自主判断"该不该回应、何时回应、回应谁"。这一能力对于客服、导览、培训、协作等企服场景具有革命性意义——AI不再是"被动等待指令的工具",而是"主动感知环境的协作伙伴"。
第二,智元独创的"思考—表达—行动"三层端到端架构,为企服AI产品设计提供了重要的参考框架。传统AI产品往往是"接受指令→处理→输出结果"的单向流程,而Thinker-Talker-Actor架构强调AI的主动性和交互性。企服产品团队在设计AI功能时,可借鉴这一思路:让AI不仅"回答问题",更要"主动观察、自主决策、直接执行"。
第三,三款国产大模型同时跻身全球前五,表明中国在全模态AI领域已经形成了集团优势。这不是单点突破,而是系统性领先。对于企服行业,这意味着在中国市场落地的AI产品,完全可以使用国产全模态模型获得国际领先水平的交互能力,无需依赖海外模型。
第四,智元硅光动语今年5月通过备案成为首款合规备案的具身智能交互大模型,这一合规先例具有重要的产业示范意义。对于企服企业而言,在AI产品设计阶段就应将合规备案纳入规划,选择已通过备案或具有备案潜力的AI模型作为技术底座,避免产品上线后的合规风险。
第五,全模态交互能力与具身智能的深度融合,预示着"机器人+企服"赛道的加速爆发。智元模型未来将与负责物理操作的VLA模型和虚拟训练环境GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。对于关注AI+服务机器人的企服企业,这是一个明确的赛道信号:技术底座已经就位,商业化落地的窗口正在打开。
总体而言,智元交互模型登顶全球榜首,标志着中国AI在具身智能赛道实现了从"跟随"到"引领"的关键跨越。对于企服行业,全模态交互技术的成熟将为AI产品设计提供全新的想象力,谁能率先将这一能力转化为可落地的商业场景,谁就能在AI企服的下半场占据先机。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。