DeepSeek V4.1 Flash正式发布:全面超越V4 Pro,HBM需求降至1/4,API定价最高下调60%

DeepSeek V4.1 Flash正式发布:全面超越V4 Pro,HBM需求降至1/4,API定价最高下调60%

qidao123.com企服评测-应用市场2026-09-13T09:00:00.000+080011
9月10日,深度求索正式发布全新模型DeepSeek V4.1 Flash,为全新模型结构系列最小尺寸成员,具备原生多模态视觉理解能力,在性能、费用、速度、总用时指标上全面超越旗舰V4 Pro,官方宣布有序下线V4 Pro。模型采用552B参数MoE架构与全新Causal-Encoder-Decoder结构,输入输出不对称设计:输入仅激活8B参数、输出激活16B参数,生成速度提升近2倍;在Terminal-Bench 3.0、DeepSWE v1.1、CyberGym、Automation-Bench等软件工程与智能体基准上领先。KV Cache大幅压缩:HBM需求降至上一代1/4、SSD降至1/8、相对初代缩减至1/437,显著降低Agent任务成本。API模型名deepseek-flash,闲时缓存命中0.02元、未命中1元、输出4元/百万Token,闲时为高峰半价;9月14日12:00起deepseek-v4-pro请求将路由至V4.1 Flash计费。腾讯WorkBuddy、CodeBuddy与OpenCode已全量接入,权重已在HuggingFace开源。
【新闻原文】 9月10日,深度求索(DeepSeek)正式发布全新模型DeepSeek V4.1 Flash。这是DeepSeek全新模型结构系列中尺寸最小的一款,具备原生多模态视觉理解能力,在性能、费用、速度、总用时等指标上全面超越此前的旗舰模型V4 Pro,官方同步宣布将有序下线V4 Pro。 V4.1 Flash采用552B参数MoE架构,引入全新的Causal-Encoder-Decoder(因果编码器-解码器)结构,输入输出两端不对称设计:输入阶段仅激活8B参数,输出阶段激活16B参数,在保持大参数规模的同时,推理成本显著低于已知同尺寸模型。模型经新预训练方式与更大规模强化学习后训练,基准测试全面超越V4 Pro、GLM5.3、Kimi K3等旗舰模型,生成速度提升近两倍;在Terminal-Bench 3.0、DeepSWE v1.1、CyberGym、Automation-Bench等软件工程与智能体任务基准上取得领先成绩。效率方面,新模型大幅压缩KV Cache规模,对HBM的需求降至上一代的1/4,对SSD的需求降至1/8,相对初代模型KV Cache缩减至1/437,显著降低Agent类任务的使用成本。 V4.1 Flash已同步上线DeepSeek API(模型名deepseek-flash),原生支持多模态,旧版V4 Flash与V4 Flash Vision Exp已下线;北京时间9月14日12:00之后、V4.1 Pro上线之前,deepseek-v4-pro的请求将全部路由到V4.1 Flash并按其单价计费。得益于架构创新,官方将定价最高下调60%,延续峰谷定价,闲时价格为高峰时段一半:闲时输入缓存命中0.02元/百万Token、未命中1元/百万Token、输出4元/百万Token。腾讯WorkBuddy、CodeBuddy与OpenCode作为官方合作伙伴已全量接入,模型权重与技术报告已在HuggingFace开源。 【企服观察】 DeepSeek这次发布最值得玩味的不是"又便宜了60%",而是它公开处决了自己的旗舰:一款Flash级模型在性能、费用、速度、总用时四个维度全面超越V4 Pro,然后干脆利落地把V4 Pro踢出产品线。这个动作背后是行业逻辑的根本转变——过去两年"大参数=高智能=高溢价"的模型定价体系正在崩塌,智能本身正在快速沦为大宗商品,而真正的溢价正在向"单位成本下的任务完成度"转移。对企业服务市场来说,这是2026年最重要的一次价格信号。 第一,Agent场景的成本结构将被彻底改写。智能体任务的典型特征是多轮调用、长上下文、反复重读历史,KV Cache命中费用往往占掉大头。V4.1 Flash把KV Cache压到初代的1/437,闲时缓存命中价格低至0.02元/百万Token,相当于缓存读取成本下降98%。这意味着此前因为成本而不敢铺开的Agent场景——7×24小时的合规巡检、全网比价监控、代码仓库级别的自动化维护、千级客户的批量报告生成——现在都可以重新算一遍账,很多去年测算下来"赔钱"的智能体项目,今年预算表可以直接翻绿。建议每一家做AI应用的企业服务公司,本周就把自家产品接入新模型跑一轮回归测试和成本测算,价格变动太快,老测算已经没有参考价值。 第二,"峰谷定价"正在把AI推理变成一种可以套利的资源。闲时半价的机制,本质上是在教企业像电力用户一样"错峰用电"。对于可以异步执行的任务——夜间批处理、报表生成、数据清洗、模型微调,把任务调度到闲时窗口,成本直接砍半。企服厂商应该尽快在自己的产品里内置任务调度策略:实时对话走高峰、后台任务走闲时,这一个小小的工程改动就能把毛利提高15到25个百分点。未来的企业AI架构师,一半的本事在模型选型,另一半在成本调度。 第三,开源+MIT式宽松授权的杀伤力会在企业市场持续显现。权重开放、可商用、可私有化部署,这意味着金融、医疗、政务这些数据不出域的行业,第一次可以用接近API的成本在自有硬件上跑前沿模型。私有化部署服务商、行业模型精调团队、国产算力适配厂商会迎来一波确定性需求:把V4.1 Flash适配到昇腾、海光等国产芯片上,再叠加行业语料微调,就是一条完整可交付的产品线。 最后泼一点冷水:基准分数领先不等于生产环境无坑,独立测试对部分成绩的复现并不完整,旧模型到新模型的行为漂移也可能让线上自动化评测悄然失效。这次迁移还有一个容易被低估的工程细节:9月14日中午之后,所有仍指向deepseek-v4-pro的请求会被静默路由到新模型并按新价格计费——对大多数场景这是降价,但对少数依赖V4 Pro特定输出风格的业务,这意味着输出格式、延迟和评测基线都在无人察觉的情况下发生变化。迁移的正确姿势是:小流量灰度、跑完自有评测集、对比输出质量与耗时分布,再全量切换;同时把持续集成里的模型名和评测断言一并更新,避免"测试还在对旧模型调优、生产已经换了大脑"的错位。另一个提醒是原生多模态的引入:过去需要单独调用视觉模型的截图理解、票据识别、界面走查流程,现在一个模型名就能完成,应用架构可以顺势简化,砍掉那些为视觉能力单独维护的管道和账单。成本红利属于动作快的团队,但稳健的工程流程才是吃到红利的先决条件。

好内容,需要你的鼓励

评论

请评价真实、客观、有价值的内容
0/500

请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。

还没有评论,期待你的第一条客观评价
qidao123.com:企服评测·应用市场·商务社交-IT产业互联网
微信订阅号微信订阅号
微信服务号微信服务号
微信客服微信客服(加群)
小程序小程序
H5H5
关于我们
商务合作
本站浏览量:3672778 ©Copyright 2022-2026 杭州祥升科技有限公司 版权所有浙ICP备20004199号