留言

OpenAI发布GPT-6 Astra,正式迈入AGI新时代

新一代的GPT-6 Astra及其加强版GPT-6 Astra Pro终于揭开了神秘面纱,广大用户期待已久的时刻终于到来了!GPT-6 Astra被称为全球最为智能且协调的模型,重塑了计算机应用、浏览器使用、软件工程、网络安全以及科学和专业工作的标准。OpenAI宣告AGI时代的到来,发布会的高潮部分总裁Greg Brockman直接向大家说出了:“欢迎来到AGI时代”。

在GPT-6的推出之后,原有的竞争对手如Claude和Grok瞬间消失,Astra的强大启动后,似乎直接消灭了全球范围内的其他大型语言模型——看来OpenAI的实力确实非同凡响。这次发布会OpenAI的低调十足不再,训练规模与能力均达到了前所未有的高度。根据介绍,Astra是OpenAI历史上进行的最大规模的训练项目,在位于德克萨斯州的Stargate园区动用了超过十万块GPU进行预训练,并且是OpenAI首个由前代模型的深度参与训练监督的旗舰产品。

GPT-6的定价也随之入市,API的输入和输出价格分别为每百万个token 10美元和50美元,这比GPT-5.6 Sol的价格提升了2.5倍,与晋升不久的Fable 5.1持平(GPT-5.6 Sol当前官方售价为输入4美元、输出20美元/百万token)。

GPT-6 Astra的核心变革在于其功能的扩展,它已不再只是单纯的“回答问题”,而是向“直接完成工作”转变。除了可以生成文本或代码,Astra还能操作电脑和浏览器,执行多步骤的操作,从而提交可直接使用的文档、表格、演示文稿、网站甚至工程项目。其成绩单让人称赞不已,特别是有三项分数引人注目:在FrontierMath Tier 4 v2的测试中得分97.6%;ARC-AGI-3测试的得分达到了99.9%(而GPT-5.6 Sol为7.8%);在ExploitBench中则获得了满分。

ARC-AGI-3是一项测试大型模型在陌生环境下适应能力的任务,不给出任何规则说明,仅将模型放入一个全新的二维游戏中,让其在游戏中进行探索并寻找通关方法。这个分数表明,在面对未知和没有现成解法的问题时,Astra展现了卓越的自主探索与学习规律的能力。不过需要指出的是,这一成绩是通过OpenAI的Responses API Harness运行框架取得的,调整了两项设置以让测试更接近真实智能体的使用情况,但并未针对ARC-AGI-3专门优化,因此99.9%的成绩既反映了基础模型的能力,也包括了记忆管理和Agent运行框架的增益。

编程能力也是Astra的一大升级方向。在Terminal-Bench 4.0中,Astra的得分为57.7%,超过了Fable 5.1的55.8%及GPT-5.6 Sol的37.3%。在DeepSWE v1.1中,Astra得分74.1%,高过了Sol的72.7%和Fable 5.1的67.4%。在数学与科学领域,Astra也表现突出,例如在高难度数学测试FrontierMath Tier 4 v2中取得了97.6%的高分,研究生级科学问答GPQA Diamond的分数达到96%,略胜于Gemini 3.8 Flash的95.3%。

显著的变革在于,Astra能够将代码能力与计算机使用相结合,不仅可以生成代码,还能进入终端和开发工具进行执行、测试、查找错误并进行修改。这样的变化在真实工作的Agent测试中显得尤为明显。在Agents’ Last Exam测试中,Astra得分59.3%,高于GPT-5.6 Sol的53.6%及Claude Opus 5的55.5%。该测试将其置于真实电脑环境中,同时操作软件、终端和文件,完成科研、工程和财务等长流程任务,并根据最终交付物打分。而在更接近实际办公流程的AutomationBench中,Astra的得分从GPT-5.6 Sol的18.1%提升至41.4%,也超过了Fable 5.1的31%。这项测试不仅评估任务的完成情况,还展示了完成任务所需的API成本。数据显示,Astra在各种成本设定下的表现均明显优于Sol。

OSWorld 2.0则更直接考察了其电脑操作能力。在离线测试中,Astra的得分为72.6%,而GPT-5.6 Sol为65.7%。完成单个任务时,Astra的平均耗时约为40分钟,而Sol则需要约75分钟,时间缩短近47%。通过准确率的提升,任务完成所需的时间也得到了缩短,这也在一定程度上解释了Astra较高的定价。

山东女篮荣膺全国女篮锦标赛亚军,拼搏精神彰显团队力量 英才陨落!龚爽年仅37岁离世,其生活习惯或是病魔的隐患