GPT-6 Astra 发布:OpenAI 宣告「欢迎来到 AGI 时代」,真正改变的到底是什么
9 月 4 日,OpenAI 发布了第六代旗舰模型 GPT-6 Astra,这一次的宣传一点都不含蓄:发布口径直接是「欢迎来到 AGI 时代」,OpenAI 的 Greg Brockman 称其为 AGI 的起点,英伟达 CEO 黄仁勋也跟进表态——AGI 已至。
一周过去,舆论已经裂成三股:发布叙事、评测报告、以及开发者到底拿它干什么。如果你在写 agent,第三股才是值得读的。
OpenAI 到底发布了什么
抛开修辞,这次发布本身是具体的:一个为超大输入、电脑操作和长程 agent 工作流而生的新旗舰。
- 百万级上下文。 多家报道把 Astra 的上下文窗口定在百万 token 量级——足以一次性塞进整个代码库或一整天的对话记录。这直接改变了"什么要预处理、什么要切块、什么要检索"的算账方式。
- 自主操作电脑。 OpenAI 力推 Astra 的 computer use 能力:自己移动鼠标、点击、输入,把过去需要人在环里的工作流从头做到尾。
- Agent 优先的定位。 券商研报把它称为「长流程 Agent 任务的旗舰模型」,媒体叙事也趋于一致:继 coding 之后,下一个战场是长程任务执行——以小时和工具调用为单位计量,而不是单次 prompt。
- 编码。 早期拆解大多聚焦一个问题:相比上一代 GPT-5.6「Sol」系列,Codex 式编码进步了多少。
- 视觉:一个能验证的亮点。 不管编码之争如何,Astra 目前在 Roboflow 视觉评测 的 53 个模型里排名 第 1——这是少数能上公开榜单核实的说法。
- 一把双刃剑的网络安全能力。 据报道,OpenAI 将 Astra 的网络安全能力评级为「Critical」,有报道描述它能自主利用未知漏洞——立即被形容为越过了「资安红线」。对防守方,这是极有价值的研究工具;落到坏人手里,就是武器。这引出了下面的沙箱问题。
AGI 宣言,以及它的"收据"
发布口径本身就是新闻——而新闻马上就变得拧巴了。
黄仁勋的「AGI 已至」在欢呼声里同时招来质疑。另有报道称,连 OpenAI CEO 山姆·奥特曼都在给这个词降温——大意是 AGI 只是「营销词」。四个人有四本账:有人指"聪明",有人指"自主",有人指"能替人干活",这些根本不是一回事。如果 OpenAI 自家阵营都说不清 AGI 是什么,最稳妥的理解是:这个词在做营销,不在做度量。
评测数据也在为这种谨慎背书。OpenAI 称 Astra 是"史上最强",但第三方结果喜忧参半:除了 Roboflow 的视觉登顶,The Elec 的报道显示 Astra 在多套评测上落后于 Anthropic 与 Meta 的旗舰。没有谁在所有榜单上都是第一——正因如此,在把生产流量托付给它之前,这些口号值得先打一个问号。
对 agent 开发者意味着什么
对 DeepSeek Harness 的圈子——也就是把模型接进运行时、工具循环和长任务的人——比起 AGI 之争,下面四点更重要。
- 竞争已经打到了你的地盘。 当各家开始宣传"长程任务执行"和"操作电脑"时,被评测的对象越来越接近整套 agent 栈——模型、运行时、工具、沙箱——而不是单次 prompt。模型越自主,能给它"装上腿"、又能"拴住它"的框架就越值钱。
- 百万上下文会重写你的架构。 如果整个代码库都能一次性塞进去,切块和检索就从"必须"变成"可选"。但"付得起"和"应该做"是两回事——上下文成本仍然随长度增长,别凭感觉就重构你的 RAG 管线,先量一量。
- 操作电脑 = 新的攻击面。请把一切都关进沙箱。 一个能点击、能输入、能调用工具的模型,同样可能被越狱去做这些事。如果一个模型能自主利用未知漏洞,那么包围它的隔离层——文件系统、网络、进程边界——就不再是锦上添花,而是你安全姿态的一部分。这是迄今支持"用真实沙箱、最小权限跑 agent 模型"最有力的论据。
- 评测 < 你自己的评估 < 你的工作流。 "史上最强"取决于尺子,而尺子们互相打架。唯一有效的评测,是你拿自己的任务、在自己的环境、按自己的价格跑出来的那套——并且每次有新模型发布就重跑一遍。
- 别把生产钉死在单一厂商上。 模型榜单按月洗牌;能按任务和价格在 OpenAI、Anthropic、DeepSeek 与开源长尾之间切换的路由层和适配器,才是耐久的对冲。模型锁定,是一种你选择去交的税。
结论
GPT-6 Astra 是真材实料的一步——上下文规模、电脑操作、视觉成绩和 agent 化的叙事都指向同一个方向。但「欢迎来到 AGI 时代」不是一条评测结果。真正到来的,是长程 agent 的时代:模型要连续工作数小时、深入系统内部,也因此必须被评估、被路由、被关进沙箱。这个时代奖励的是把模型当作可替换引擎、放进一套纪律化栈里的团队——无论下个月"赢家"是哪家实验室。