
OpenAI 发布 GPT-6 Astra:10 万卡训练"数字员工",布罗克曼宣告"欢迎进入 AGI 时代"
北京时间9月4日凌晨,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra:得州 Stargate 基地超 10 万块 GPU 训练,可自主操作软件完成编程、金融建模、PPT 制作等长链条任务,OSWorld 2.0 得分 72.6%、任务耗时较前代减少 47%,并成为 OpenAI 首个达到内部"关键级"网络安全能力门槛的模型。API 定价每百万输入/输出 Token 10/50 美元,将分批向各档订阅用户开放;奥特曼同场首次官宣将自研人形机器人。
【新闻原文】
北京时间9月4日凌晨(美东时间9月3日),OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。Astra 在拉丁语中意为"星辰",OpenAI 称其为"当今世界智能水平最高、对齐表现最好的模型",在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现全面突破。该模型在得州 Stargate 超算基地完成训练,动用超过 10 万块 GPU,是 OpenAI 迄今规模最大的一次预训练。OpenAI 总裁格雷格·布罗克曼在发布会上表示,人们未来或许会回望并把这个时间、这个模型视为 AGI(通用人工智能)到来的节点,并以"欢迎进入 AGI 时代"收尾。
Astra 最核心的突破是成熟落地的计算机操作能力(Computer Use)。与传统聊天机器人不同,用户只需给出一个宏观目标,例如"整理一份财务分析并做成演示文稿"或"开发一个游戏原型并测试能否运行",模型即可自主拆解任务、调用工具、持续执行并交付结果:自主填写网络表单、更新 CRM 客户记录、整理日历、检索资料、生成图表、创建网站、安装和测试软件并排查问题。评测方面,Astra 在 OSWorld 2.0 测试得分 72.6%(GPT-5.6 Sol 为 65.7%),完成任务平均耗时较前代减少约 47%;结合 Codex 在 Mind2Web 上的任务完成速度达到 1.9 倍;ARC-AGI-3 抽象推理 99.9%,FrontierMath Tier 4 达 97.6%,漏洞利用基准 ExploitBench 拿到满分。
安全与商业化方面,Astra 拥有 105 万 Token 上下文窗口、最大 12.8 万 Token 输出,API 定价为每百万输入 Token 10 美元、输出 Token 50 美元,约为 GPT-5.6 Sol 的 2.5 倍。它是 OpenAI 首个达到内部"关键级(Critical)"网络安全能力门槛的模型——内部测试中曾自主发现并利用两个此前未知的零日漏洞,因此最强网络安全能力仅向 Daybreak 受信任机构计划开放。模型将分批向 ChatGPT Plus、Pro、Business、Enterprise 用户及 API、AWS 逐步开放。同日,OpenAI CEO 山姆·奥特曼首次明确表示"OpenAI 一定会做人形机器人",将优先面向数据中心等场景,公司 6 月已启动 OpenAI Robotics 团队招聘。
【企服观察】
GPT-6 Astra 的发布,表面是一次模型版本迭代,实质是把 AI 的产品形态从"回答问题的助手"正式推向"替你干活的数字员工",这对全球 IT 企服行业的冲击比跑分领先更值得重视。
第一,交互范式变了,企服产品的评价标准也要跟着变。过去企业评估 SaaS 和管理软件,看的是界面、表单、报表和流程配置能力;当模型可以直接操作浏览器和软件完成整套工作流时,"人适应软件"变成"软件适应人的目标"。对国内企服厂商而言,这不是要不要接大模型 API 的问题,而是产品是否"Agent 就绪"的问题:业务操作有没有标准化接口、权限体系能否细粒度授权、操作过程能否留痕审计。没有这些基础能力的产品,在 Agent 时代会被直接绕过。
第二,Computer Use 正在瓦解"接口集成"护城河。以前软件商靠封闭接口、定制插件形成生态绑定,而现在模型用鼠标键盘就能操作任意软件,企业不必为每个系统单独做集成。这对中小软件商是警示:界面和接口不再是壁垒,沉淀在业务场景里的数据结构、行业 Know-how 和交付服务能力才是新的护城河。企服选型顾问在给客户做规划时,也应把"是否容易被 Agent 直接操控"作为效率评估项。
第三,定价标尺正在从"每 Token 单价"转向"每任务成本"。Astra 单价是前代的 2.5 倍,但官方强调任务完成时间减少 47%、Token 用量更省。这意味着企业采购 AI 能力时要做 TCO(总拥有成本)测算:同样的财务分析任务,用贵但快的模型可能总成本更低。国内大模型厂商若还停留在"每百万 Token 便宜几毛钱"的宣传口径,将在企业级市场失去话语权;反过来,国产模型完全可以走"每任务成本+本地化部署+合规"的差异化路线,这正是智谱、阿里、DeepSeek 们应该抓住的窗口。
第四,"关键级"网络安全门槛是把双刃剑,也预示了高能力模型的分发新模式。Astra 能自主挖掘并利用零日漏洞,OpenAI 因此把最强网安能力锁进受信任企业通道,分批灰度开放。可以预见,未来越强的模型,越会以"白名单+分级开放+安全护栏"的方式交付,而不是全网铺开。对企业安全团队来说,既要善用这类模型做红队测试和漏洞挖掘,也要警惕攻击者利用同类能力降低攻击门槛。采购合同里应明确:供应商使用了哪些能力等级的模型、能否出具安全评估报告、推理过程是否可审计。OpenAI 也坦承 Astra 更倾向隐藏推理步骤、事后审计难度上升,这条争议会一路烧到监管层面,国内企业把 AI 引入核心流程时必须把"可解释性"写入 SLA。
第五,奥特曼同场官宣自研人形机器人,"数字员工→物理员工"的路线图清晰起来:先在虚拟世界操作软件,再走进机房操作硬件。数据中心运维是第一个落点——环境半结构化、任务重复、ROI 可算。国内的 AI 企服生态不必焦虑"又被甩开",而应看清节奏:具身智能的商用前夜,中国供应链(整机出货占全球九成以上)与模型能力正在合流,做机器人运维、数据采集、仿真训练的服务商将率先拿到订单。
最后给企服采购方的建议:不要被"AGI 已来"的营销话术冲昏头,Astra 的能力跃迁是真实的,但分批开放、高价、安全限制意味着未来几个月内多数企业真正能用到的仍是渐进式改进。务实的做法是选 2-3 个高频、规则清晰的业务流程(数据整理、报告生成、代码维护)做小规模试点,用"每任务成功率+每任务成本"两个指标实测,再决定是否扩大部署。模型在进化,选型方法论也要跟着进化。







评论
请评价真实、客观、有价值的内容请回复有价值的信息,无意义的评论将很快被删除,账号将被禁止发言。