Cloudflare开源决策模型Clef与Clef-flash:不写字的分类模型,39毫秒帮智能体做选择题

Cloudflare开源决策模型Clef与Clef-flash:不写字的分类模型,39毫秒帮智能体做选择题

qidao123.com企服评测-应用市场2026-10-04T09:00:00.000+08005
10月1日,Cloudflare发布自研开源决策模型Clef与Clef-flash(Apache 2.0,已上架Workers AI与Hugging Face),只回传带概率的分类答案而非生成文字,中位延迟低至约39毫秒,并配套推出企业微调的强化学习服务。

新闻原文

10月1日,Cloudflare在官方博客发布两款自研的开源决策模型Clef与Clef-flash,已上架Workers AI,权重以Apache 2.0授权在Hugging Face开源,同时推出帮助企业用自身数据微调Clef的强化学习服务。这是Workers AI团队训练出的首批模型。

决策模型不生成文字,只针对开发者预设的一组选项,回传带型别、附概率的分类答案。Cloudflare举例:输入一则客服消息,模型判断它是否紧急、该交给哪个团队,程序即可据此分派工单、升级处理或转交真人,无需把请求丢给一个大语言模型去生成长篇理由再解析。

性能上,Clef在Jev决策指数评测中领先,中位延迟约209毫秒,Clef-flash仅约39毫秒,而同类模型Jev约524毫秒;Clef额外带有视觉编码器,可分类图片,上下文从32K提升到64K,且与Jev的API完全兼容。技术上,Clef以冻结的Qwen3.8-27B、Clef-flash以Qwen3.5-9B为骨干再做后训练,推理时只跑一次预填就并行给所有合法选项打分。

落地场景已经很具体:支持工单分流(判断是否紧急、归哪个团队)、威胁情报(给网页分类,配合Browser Run抓取渲染并在2.2秒完成,而通用大模型要4.7秒)、信任与安全(按企业策略对内容打分)、智能体护栏(让agent在调用工具前用几十毫秒问一句"该不该做")。Cloudflare还把AI Gateway捕捉流量、Containers做RL沙箱、Workers AI重新部署串成一条微调链路。

企服观察

决策模型把"判断"从"生成"里拆了出来,又一次重排了智能体的成本结构。过去一个agent每做一步路由或分类,往往要调一次大模型、等它吐理由再解析,又慢又贵;现在一个开源小模型,几十毫秒给出答案加置信度,等于把判断做成流水线上的廉价工位。对企业agent架构,这不是多一个玩具,而是响应速度和单位成本的实打实优化。

为什么39毫秒这条数字值得重视?因为它小到能放在每一次请求的实时路径上发生——"下一步调哪个工具、参数齐了没、这次动作越权没"这类判断,可以发生在每个交互里,而不是攒一批再批处理。当决策几乎零成本,agent才有可能真正做到边干边自查,而不是干完一整段才发现第一步就选错了。

对企业软件,工作流里大量存在"基于当前状态,下一步做什么"的路由判断,过去要么写脆弱的规则引擎,要么硬扛大模型。决策模型把这类判断做成可微调、可检视的标准件,企业可以把常见分支训成自己的小模型,部署在边缘或私有环境,既降成本又不出域。做过审批流、工单分派、告警归类的团队,都该认真评估它的替代空间。

Cloudflare把AI Gateway、Containers沙箱、Workers AI重新部署串成微调链路,说明这单发布的野心不止一个模型,而是一整套"决策模型即服务"的工厂。企业能用自有流量数据去微调、再Redeploy,把通用分类器变成贴合自身业务的专用判断器。这种"模型+数据闭环+托管部署"的组合,比单卖权重更黏客户。

路线分歧已经出现。TypeSafe做Jev、Cloudflare走开源可下载可微调、OpenAI同周发了有限预览的Decisions API托管接口。托管接口上手快但锁定强、数据出域;开源可下载自由度高但要自己运维。对国内厂商,成熟的打法是两者都给:既有托管端点降低试用门槛,也放出权重满足私有化与合规,让客户按数据敏感度自己选。

也要泼冷水。决策模型不生成文字,意味着它没法解释"为什么这么选",置信度分数是使用者判断可靠性的唯一抓手,一旦分数失真,错误会被静默放大。生产化还缺两样:一是托管版与治理套件,让企业能统一纳管;二是和护栏、日志、人工审批的衔接。但方向清楚——智能体基础设施正在分层,生成、决策、执行各司其职。

对国内云厂商和AI公司,这波决策模型的走红也是提醒:开放权重生态正把agent基础设施拆成可替换的薄层,谁先提供好用、可私有化、带治理的决策与路由组件,谁就拿到企业agent的底座门票。别只盯着 flagship 大模型发布,真正黏住企业客户的,往往是这些每天被调用成千上万次的廉价工位。

对企业采购智能体平台,启示很直接:把"决策模型"列为评测清单里的一项独立能力,而不是笼统看大模型跑分。能本地跑、能给置信度、能微调配方的小模型,往往在路由与护栏上比单纯堆参数更实用。选型时不妨专门测一下:在你们真实的若干工作流样本上,它挑对的比例和校准度分别是多少,再决定要不要为它单独留预算。

最后提醒一句工程落地:决策模型的置信度再好看,也要和人工审批、操作日志、回滚机制组成闭环,而不是单点调用。把它当成"第一判断器",关键动作仍留人工确认,才能既降本又不把错误静默放大。智能体底座之争,拼的从来不是谁的模型最大,而是谁把每一层都做得便宜、可控、可审计。

好内容,需要你的鼓励

评论

请评价真实、客观、有价值的内容
0/500

请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。

还没有评论,期待你的第一条客观评价
qidao123.com:企服评测·应用市场·商务社交-IT产业互联网
微信订阅号微信订阅号
微信服务号微信服务号
微信客服微信客服(加群)
小程序小程序
H5H5
关于我们
商务合作
本站浏览量:3745296 ©Copyright 2022-2026 杭州祥升科技有限公司 版权所有浙ICP备20004199号