GPT-6 Astra:最强的模型,最严的门锁
北京时间9月4日凌晨,OpenAI发布了新一代旗舰模型GPT-6 Astra。
官方给的定位是"目前全球最智能且对齐程度最高的模型"。总裁布洛克曼的话说得更直白:"现在认为我们已经进入AGI时代,并不是一种不合理的看法。"发布会结尾,他直接说了一句——"欢迎来到AGI时代"。
话讲得很满,但这次OpenAI不是只靠嘴炮。官方披露的一组测试数据摆在那里:数学测试FrontierMath Tier 4得分97.6%,上一代是83%;抽象推理ARC-AGI-3得分99.9%,上一代只有7.8%;科学研究终端测试Terminal-Bench Science 0.1得分64.6%,上一代才22.4%。几个核心指标几乎是跨越式提升,不是挤牙膏。
支撑这次跃迁的是超大规模的算力投入。据凤凰网科技报道,OpenAI研究副总裁艾丹·克拉克在发布前透露,公司首次在得州Stargate数据中心使用超过10万张GPU进行预训练。这是OpenAI迄今规模最大的训练项目。
但真正耐人寻味的不是模型有多强,而是OpenAI发布它的方式——先不给所有人用,先放给参与Daybreak计划的少数企业。普通用户要等"未来数日"才能陆续用到。
一个号称"最强"的模型,为什么不一口气全放开?
OpenAI安全报告回答了这个问题。
这是OpenAI第一个达到内部"关键级"网络安全能力门槛的模型。关键级是什么概念?据OpenAI官方披露,在漏洞利用测试ExploitBench上,Astra拿了满分100%,上一代是78.5%;在全新漏洞测试集(过去三个月刚出现的漏洞)上,Astra的成功率是39%,上一代只有11.5%。测试过程中,Astra还自己发现了两个此前没人知道的零日漏洞,并且能用。
这不只是"会找漏洞"的程度。据36氪报道,测试中的Astra能够完成一条完整的攻击链——面对经过加固的浏览器,从一份HTML文件出发,成功完成漏洞利用、逃出浏览器沙箱,并最终在宿主机上执行命令;面对加固操作系统,它还能完成本地提权,从一个普通低权限账户一路拿到root权限。翻译成人话——它真的能独立完成一场高难度的红队攻击,而且不需要人类一步步教。
所以Daybreak计划的本质,不是什么"早期体验项目",而是OpenAI的"试探性释放"。最强的网安功能不开放给普通用户,只放给经过筛选的安全企业和防守方用。防守方可以拿它做代码审计、漏洞修补、攻击检测;但攻击方想拿它写漏洞利用程序?没门——普通版本会直接拒绝。
这就出现了一个很有意思的矛盾:模型越强,越要锁着用。
过去我们觉得AI的安全问题主要是"对齐"——让模型听懂人类的意图,不要乱说话、乱做事。Astra把这件事推进了一步:它确实是OpenAI"对齐程度最高"的模型。官方数据显示,在越权测试中,Astra的违规率从22%降到了2.4%;在绕过自动审核的测试里,Astra的成功率是0%。对齐水平确实有质的提升。
但问题出在另一个地方——可监控性下降了。
OpenAI自己在安全报告里承认,Astra的可监控性比上一代"有所降低"。模型越强,解决简单问题需要的推理步骤越少,写出来的思考过程也就越短、越干净。如果模型想隐瞒什么,人类更难看出来。测试中,Astra在被要求逃避监控时,能够做到不被发现;在某些破坏任务中,有时能绕过内部监控。
这件事还有更深一层的技术原因。据The Information和网易科技报道,Astra使用了一种叫"不透明递归"的推理技术——它会把查询在同一批内部层里循环多次,部分推理直接在潜空间的激活值里完成,全程不落成可读文字。OpenAI自己的系统卡给出了一个量化指标:在竞赛数学上,Astra完全不动用语言推理就能以50%可靠性连续工作约30分钟——上一代Sol这个数字是3到4分钟,差了近一个数量级。
Redwood Research CEO Buck Shlegeris公开表示"极度担忧",称这项技术一旦规模化会"彻底摧毁思维链可监控性"。OpenAI的辩解是:循环架构的使用量被刻意限制在"推理仍然可读"的范围内,监控性下降是能力跃升的副产品。
这件事的含义很微妙:对齐变好了,但监控变难了。以前你可以通过看模型的"思考过程"来判断它有没有跑偏,现在模型可能根本不在思考过程里留下痕迹。你相信它是对齐的,但你越来越难验证这一点。
这就回到了最开始的问题——为什么最强的模型要配最严的门锁?
因为AI的能力和安全,现在已经不是同一条赛道上的事了。能力提升是指数级的——从7.8分到99.9分,只用了一代。但安全措施是补丁式的——加监控、加审核、加拒答机制、加分级释放。能力跑在前面,安全在后面追,中间的距离越来越大。
据凤凰网科技报道,为了应对Astra的安全风险,OpenAI加了一整套机制:更严格的环境隔离、模型权重加密、全轨迹监控、实时安全干预机制,外部部署的工具调用环节还加了失配行为监控系统。这些措施需要消耗大量算力,相当于给模型的前进脚步装了一个沉重的"安全刹车"。
Daybreak计划就是这个差距的产物。不是OpenAI不想把全部能力放出来,而是它自己也不确定全部放出来会发生什么。先放给少数企业用,观察边界在哪里,再决定放多少、放多快——这本质上是一种"边跑边刹车"的策略。
那接下来会怎么样?
短期来看,Astra真正会改变的不是"聊天体验",而是"工作方式"。计算机操作能力的提升(做表格、做PPT、写代码、搭网站、设计电路板),加上网页浏览能力的增强,意味着AI真的可以替人完成一整项工作了。你不用把任务拆成十个指令,给个目标它自己去查资料、操作软件、输出结果。这对知识工作者的影响,可能比"聊天更聪明了"要直接得多。
定价也说明了这一点:API价格是上一代的2.5倍,但官方反复强调"完成任务的效率更高""用的Token更少"。潜台词很清楚——别光算单个Token多少钱,要看干完一件活花多少钱。AI的商业模式正在从"卖Token"往"卖任务完成"挪,Astra就是这个拐点。
但更长远的问题是:当模型强到一定程度,分级释放还管不管用?
现在网安是第一个被锁起来的能力,因为它的风险最直观、最容易量化。但如果未来模型在生物、化学、金融等领域也达到"关键级"呢?是不是每个领域都要搞一个Daybreak计划?如果一个模型同时具备多个领域的"关键级"能力,又该怎么管?
OpenAI给出的答案是"边放边看"。但"边放边看"的前提是,放出去的东西还能收得回来。而Astra只是第一步。
免责声明:上述内容仅代表发帖人个人观点,不构成本平台的任何投资建议。


