会刷题不算什么,能干活才真有用
文|魏琳华
编|刘俊宏
多年以后,人类或许会想起AGI时代的到来,是在一个平平无奇的夜晚。
9月3日,整个AI圈可能都没睡好。先是晚间全球AI大宕机,就当所有人准备洗洗睡的时候,9月4日凌晨三点半,GPT-6 Astra亮相了。
虽然发布会上OpenAI宣布还只对部分企业用户开放,不过好在它没让我们等太久。9月5日,OpenAI全量推送了GPT-6 Astra,让付费用户们及时体验上了新模型。
“欢迎来到AGI时代。”在介绍GPT-6 Astra时,OpenAI总裁Greg Brockman说。
和前几代大模型相比,OpenAI交出的新模型成绩上确实相当耀眼,正如模型的名字“星辰”,它在多个关键基准上跑出了“饱和”的成绩,把编程、长程任务的能力往上拔了一截。
但“会刷题”算不得什么,能干活才真有用。
实际干活时,GPT-6 Astra能做到“又快又省”——交付质量更高的同时,它单次任务的Token消耗和任务耗时都明显低于上一代。Perplexity在自家AI研究智能体评估框架中甚至测出,Astra的单次任务花销低于Fable 5.1。
发布不到一周,Anthropic的新模型Fable 5.1就被GPT-6 Astra抢去了风头。
现场演示和网友实测里,各种复杂的活儿都被丢给了它:操作电脑、填表单、建网站,甚至把电子原理图排成可投产的PCB、在Blender里建好房间模型,再转进虚幻引擎,让用户可以在建模场景中走动查看房屋细节。

支撑这一跃迁的,是又一次“大力出奇迹”:据外媒报道,GPT-6 Astra的训练动用了10万 GPU 的集群,是OpenAI迄今最大规模的一次训练。
那么,这一代模型到底变了什么?所谓AGI时刻到底是真的,还是只是又一次宣言?
性能“饱和”的GPT-6 Astra成色几何?
这次GPT-6 Astra没有“见光死”,实际体验和演示效果差距不大。
昨天,GPT-6 Astra已经正式全量向所有订阅用户开放使用。早上晒出的一众测评案例中,有人惊叹它干活的交付质量,有人提到它跑任务更省Token、成本低。
具体到能力表现层面,GPT-6 Astra在一些特定领域跑出了接近满分的极限分数。人类的考卷已经快“考不下”了。
比如,它在研究级数学基准FrontierMath Tier 4跑到98,官方形容为“饱和”,也就是它的分数已经达到了测试的上限;在强调陌生环境中学习与抽象推理的ARC-AGI-3上,GPT-6 Astra从上一代GPT-5.6 Sol的7.8%直接跳到99.9%。可以说是直接实现了“从0到100”的突破;漏洞利用测试ExploitBench则直接满分100%,GPT-5.6 Sol为78.5%。

最夸张的是ARC-AGI-3,它相当于把大模型扔进一个陌生环境,不给规则说明,看它能不能自己摸索规则并做出正确决策。这个测试对人类来说并不难,100分轻轻松松,但AI之前一直搞不定,徘徊在不及格的区间。
然后,GPT-6 Astra就满分了。三个月时间,AI就进化成人类了?
用ARC Prize Foundation的Greg Kamradt的话来说:“在96%的测试层级上,Astra超越了我们的人类行为效率基线,实际上达到了人类水平。”
OpenAI是怎么做到的?还是用了一点“手段”的——将模型和Harness打配合。
这个99.9%的高分的前提是,它跑在OpenAI为自家模型适配的Harness上,所以效果会更突出。但这并不意味着去掉Harness就立刻“拉胯”。根据X上ARC Prize发布的测评结果是62.7%,这已经是第二名Claude Opus 5的两倍。
但这种成绩还是容易令人质疑。自家模型+自家特调测出来的分,这不是忽悠人么?
厂商自报分数用自家框架,确实是常规操作:DeepSeek上月底发布的DeepSeek V4 Flash,官方在注释里写明基于自家DeepSeek Harness测得,它还同步把Harness作为独立产品推向市场。所以这并不是问题。
不过,GPT-6 Astra的提升也有些许“偏科”。从OpenAI给出的成绩来看,它在部分任务上出现了“倒退”的情况。
以测评模型Agent能力的指标之一——人类终极测试(Humanity’s Last Exam)上,GPT-6 Astra的成绩为57.2%,反而低于GPT-5.6 Sol与Fable 5.1。
这样的偏科成绩,也让测评机构给出了不一样的评估分数。
比如按照Artificial Analysis的通用智能指数,Astra 为61.2,与Sol的60.9基本持平,导致新模型也被不少网友戏称是“更贵版本的Sol”。但实际上,AA测评的指标更多集中在知识、推理等能力上,GPT-6 Astra的强项,多数不在它的测评范围内。

说完上面这些“虚的”测试,我们来看看GPT-6 Astra在商业化已经被验证领域的表现。
在Coding场景上,GPT-6 Astra显然是冲着最强目标冲击的。它在Terminal-Bench 4.0(测评智能体在复杂终端任务上的表现)为57.9%,超过了Fable 5.1的55.8%,而GPT-5.6 Sol在这个基准上只有37.3%。

得益于编程能力的提升,现在人们拿GPT-6 Astra已经能做出媲美真实游戏的作品。不少网友已经晒出了他们拿新模型做出的射击游戏、开放世界冒险游戏等等。从建模和实际体验来看,已经可以算得上成品级别。

智能体维度,相较于上一代,GPT-6 Astra在长程任务的处理能力上了一个台阶。
单看智能体维度的跑分,其中,GPT-6 Astra在Agents' Last Exam(真实软件中完成金融建模、工程设计、媒体制作等专业任务)拿到59.3%,略高于上代Sol的53.6%;OSWorld 2.0(真实桌面环境里看屏幕、点鼠标、敲键盘完成操作)72.6%;在跨系统业务流程的AutomationBench一项上,GPT-6 Astra的得分从GPT-5.6 Sol的18.1%大幅提升至41.4%。
那么,强大能力的代价是什么?
训练出这样的模型,OpenAI靠的是又一次“大力出奇迹”。据外媒报道,GPT-6 Astra的训练动用了10万GPU的集群,这是OpenAI迄今为止最大的训练规模。不得不感慨,Scaling Law的强度还是立竿见影。
但AI圈还有一个共识:高分不一定就“高能”,模型到底好不好用,还得干活层面见真章。
响应更快、Token消耗更少 GPT-6更擅长“干活”
比起跑分,本次大家讨论的一个共识是,GPT-6 Astra充分展示了它“干活能力”的跃升——操作电脑、长任务、端到端交付等能力,它的演示效果都让打工人心动不已。
X上展示的测评也高度一致地落在干活测评上。多数测评图中,GPT-6 Astra在“干的快、干的好”这两项上遥遥领先:Perplexity在自家面向AI研究智能体的评估框架中测试,GPT-6 Astra不仅分数最高,它花的钱也比Fable 5.1更便宜。

是什么让用户纷纷“爽歪歪”?主要是两个关键体验:一是降低成本,二是压缩任务的处理时长。GPT-6 Astra讨人喜欢就在于这两点。
通过有效降低任务输出Token,GPT-6 Astra实现了降低成本的效果。不仅输出冗余大幅精简,比如在考察复杂专业任务的Agents' Last Exam最高分设置下,相比Claude Opus 5少用了约65%的输出Token;面向终端任务的Terminal-Bench 4.0中,Astra 的预估API成本比自家上一代Sol缩减约9%,对比Fable 5.1的降幅更是高达63%。
作为OpenAI的客户,Higgsfield AI CEO Alex Mashrabov表示,Astra比他们测过的其他模型少用了高达20%的Token。
时间消耗上,和上一代模型相比,GPT-6 Astra将部分任务的时间压缩掉近一半。OSWorld 2.0上,Astra完成一个计算机使用任务的平均耗时约40分钟,比上一代Sol的75分钟少了 47%;Mind2Web基准上,Codex任务完成速度做到上一代的1.9倍。
这些改变,不仅和模型各项能力提升相关,可能和OpenAI采用的模型新架构有关。
据The Information报道,OpenAI在GPT-6 Astra采用了一种叫“循环深度”(recurrent depth)的架构技术,它通过复用同一组网络层进行多次内部循环计算,中间推理在隐藏状态中完成,不会全部转化为输出文本。
简单来说,就是原来OpenAI o系列的思考模型基本上会把中间推理步骤以自然语言写出来,变成一条人类可读的思维链。这种“想什么都写出来”的方式,好处是透明,坏处是啰嗦:一个复杂任务可能输出几千个Token的推理过程。
新的架构,让模型内部思考更多,但它输出的Token却减少了,这让它能在办事时做到“又快又省”。
从OpenAI的分享中,另一个可以确认的事实是通过对Harness能力优化,是它办事能力提升的关键。
先从Computer Use(计算机使用)说起,也就是让大模型自主操作电脑浏览、干活的种种能力。对此,OpenAI直接称它“世界上最好的Computer Use模型”:GPT-6 Astra把软件当作“人的工具”来用——让AI填网页表单、更新CRM记录、整理日程,分析数据出图、搭好网站再自己跑一遍前端QA。
OpenAI现场还展示了在KiCad里把电子原理图排成可投产的PCB、在Blender建模后转进虚幻引擎5,让设计师和客户在3D场景中“看”到实际效果。根据平面图,GPT-6 Astra能从零搭建出完整的房屋3D模型,包括墙体、门窗、楼层结构等建筑元素。X上有用户分享的实测效果对比中,也能看到GPT-6 Astra的细节做得已经相当完善。

第二处升级在Codex的“记忆”机制,新增的跨上下文管理机制起到了作用。
Astra可以跨上下文窗口保存“工作笔记”,同时让更早的完整上下文保持可搜索,之前的消息和工具输出都能找回。重点内容主动记下来,漏记的细节还能回头翻,避免因上下文压缩导致细节丢失。
此外,Codex同步推出的“异步提问”机制做了一个产品细节上的优化:有开发者在X上贴出自己让Codex连跑数小时的记录:模型在中途遇到歧义时不再卡死等人工确认,而是先把能独立推进的部分做完,同时攒好问题等用户回答。
这层优化简直救了程序员的命。之前还得守在电脑前一步步确认需求,现在AI终于能清净一会,可以多“摸会鱼”了。
总而言之,GPT-6 Astra确实是一次重磅升级,无论是能力还是实际应用层面。但AGI时代有没有到来?很显然,现在还不该回答这个问题。参考电力时代的经验,AI迟早会走到那一天——
当大模型解决复杂工作变得更快速、更便宜时,AI本身的讨论会逐渐退居幕后,取而代之的是各种AI原生的产品。到那时候,“用不用AI”的讨论就该翻篇了,就像现在早已没人会讨论“要不要用电”。
本文来自投稿,不代表增长黑客立场,如若转载,请注明出处:https://www.growthhk.cn/cgo/169032.html
微信扫一扫
支付宝扫一扫