腾讯混元Hy3正式发布并开源:Agent任务解决率跃升至90%,幻觉率下降44%,定价低至0.25元/百万tokens

腾讯混元Hy3正式发布并开源:Agent任务解决率跃升至90%,幻觉率下降44%,定价低至0.25元/百万tokens

腾讯新闻/IT之家/新浪财经/快科技2026-07-06T00:00:00.000+080010
7月6日,腾讯混元Hy3正式版发布并开源。采用MoE架构295B参数,Agent任务解决率从72%跃升至90%,幻觉率较预览版下降44%。定价输入1元/百万tokens,采用Apache2.0开源协议,已接入WorkBuddy、元宝、ima等超50款产品。
【新闻原文】7月6日,腾讯混元Hy3正式版发布。Hy3是一个快慢思考融合的模型,采用MoE(混合专家)架构,总参数295B、激活参数21B,支持256K上下文长度。相比4月发布的Hy3 preview版本,Hy3在各类任务上实现再次跃升,以较小尺寸首次比肩国内外大尺寸旗舰模型的效果。 Hy3延续了实用、普惠的模型定位,定价为输入1元/百万tokens,输出4元/百万tokens,输入命中缓存价格仅0.25元/百万tokens。开源方面,Hy3采用商业友好度最高的Apache2.0开源协议,全球开发者均可下载和免费商用。 在Agent和工具编排类测试中,Hy3建立了明确的差异化优势。ClawEval pass³拿到68.5,超过DeepSeek V4 Pro的62.4和Qwen 3.7 Max的65.2;SkillsBench 55.3同样领先这两个对手;BrowseComp 84.2与GPT 5.5的84.4几乎持平。代码类测试中SWE-bench Pro从preview的46.0提升到57.9。 Hy3已接入WorkBuddy/CodeBuddy、元宝、ima、Marvis、QQ浏览器、腾讯新闻、WeGame、腾讯乐享、搜狗输入法、微信公众号等产品,另有近50个业务在接入队列中。基于WorkBuddy办公场景内部测评显示,相比Hy3 preview,任务解决率从72%跃升至90%,平均耗时缩短34%。在内部基于真实业务场景的长文、RAG评测中,Hy3正式版的幻觉率较preview版本下降约44%。 【企服观察】腾讯混元Hy3的正式发布与开源,从IT企服行业的视角来看,其意义远超"又一个大模型发布"的常规叙事。它实际上为2026年下半年的AI企服市场划定了三条清晰的技术路线和商业逻辑。 第一,"够用且便宜"正在成为AI企服选型的核心标准。Hy3用295B参数做到了比肩更大尺寸旗舰模型的效果,同时定价仅为GPT 5.5等旗舰模型的十分之一甚至更低。0.25元/百万tokens的缓存价格意味着:对于一个日均调用量在1000万tokens的中型企服SaaS产品,每天的AI推理成本可以控制在2.5元以内。这个成本水平使得"把AI深度嵌入每一个企服产品功能"从"可行性论证"变成了"可执行的商业决策"。对于习惯于等待"AI降价再动手"的企业来说,Hy3的定价意味着窗口期已经打开。 第二,Agent任务解决率从72%跃升至90%,这是企服行业最应该关注的数字。72%到90%的跨越,意味着AI Agent从"偶尔好用"变成了"大多数时候都好用"。在企服场景中,90%的解决率意味着:对于标准化的办公任务(数据处理、文档生成、信息查询),AI已经可以稳定替代人工。这对于企服SaaS产品设计的影响是深远的——当AI Agent的可靠性达到90%时,"人机协作"的产品逻辑可以从"AI辅助人"转向"人监督AI"——这将从根本上改变企服产品的交互设计、定价模式和交付方式。 第三,Apache2.0开源协议的采用是一个关键的战略信号。相比某些模型采用的限制性开源协议,Apache2.0允许任意修改和商用,这对于企服SaaS公司来说意义重大。开源意味着企服公司可以在Hy3的基础上进行私有化部署和二次开发,而不需要担心授权风险。在数据安全和合规性要求日益严格的背景下,"可私有化部署的开源大模型"正在成为金融、政务、医疗等敏感行业企服产品的标配。Hy3的开源策略,恰好踩中了这一需求趋势。 第四,Hy3内部测试中幻觉率下降44%的数据值得深度解读。幻觉——即AI生成看似合理但实际错误的内容——一直是企服行业采用AI的最大障碍之一。44%的幻觉率下降意味着Hy3在"可信度"上有了质的飞跃。对于企服产品来说,"AI说的到底能不能信"这个问题的答案正在从"基本不可信"转向"基本可信"。这种可信度的提升,将直接推动企服产品从"展示AI能力"的演示阶段进入"用AI替代人工操作"的生产阶段。 第五,腾讯混元将Hy3定位为"实用主义路线"而非"参数竞赛路线",这一理念对整个AI企服行业都有启发意义。在过去的两年里,AI行业陷入了一场"参数军备竞赛"——谁的总参数更大、谁的计算量更高、谁在榜单上的数字更好看。但Hy3的选择说明:对于企服场景而言,"效能比"(每单位算力产出的实际业务价值)比"绝对参数规模"更重要。用295B参数做到2-5倍参数规模模型的效果,这实际上定义了一条不同于"更大即更好"的AI发展路径。 腾讯混元Hy3的正式上线,是中国AI大模型从"炫技"走向"实用"的标志性事件。当大模型的价格降到0.25元/百万tokens、Agent解决率达到90%、幻觉率下降44%时,AI企服的时代才真正开始。对于企服SaaS公司来说,现在不是"要不要接入AI"的问题,而是"用哪款模型、怎么接入、接入后如何收费"的问题。而那些率先回答好这些问题的公司,将在2026年下半场的AI企服竞赛中占据先机。

好内容,需要你的鼓励

评论

请评价真实、客观、有价值的内容
0/500

请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。

还没有评论,期待你的第一条客观评价
qidao123.com:企服评测·应用市场·商务社交-IT产业互联网
微信订阅号微信订阅号
微信服务号微信服务号
微信客服微信客服(加群)
小程序小程序
H5H5
关于我们
商务合作
本站浏览量:3672324 ©Copyright 2022-2026 杭州祥升科技有限公司 版权所有浙ICP备20004199号