热点资讯

  • 首页 热点资讯 GPT-6 Astra登场,AGI时代正式开启了吗?

GPT-6 Astra登场,AGI时代正式开启了吗?

2026-09-04
7270

在Astra发布前的几个小时内,人工智能行业变得异常混乱。9月3日晚,ChatGPT、Claude与Grok几乎同时遭遇大规模服务故障,许多用户无法访问模型,或是请求遭到失败。就在这时,ChatGPT的官方账号发推表示:“The stars are almost aligned.”,暗示一些重要事情即将发生。网友们迅速开始调侃,猜测Astra在发布过程中可能不小心影响了Anthropic和xAI的服务,甚至连自己也未能幸免。然而,这一调侃并未得到实质证据的支持,只是个别网民的趣味言论。值得注意的是,就在两天前,OpenAI宣布这款尚在开发中的模型已成为其首个通过网络安全能力标准“Critical”阈值的模型。最终,群星的确“就位”了。北京时间9月4日,OpenAI正式推出了GPT-6 Astra。然而,此次发布并非全量上线,Astra仅对部分拥有Trusted Access/Daybreak账户的机构和经过认定的网络安全用户开放,其他Plus、Pro、Business、Enterprise和API用户仍需再等几天。

在9月4日的内部发布会上,OpenAI总裁Greg Brockman对Astra给予了夸张的评价:“欢迎来到AGI时代。”同时,OpenAI研究副总裁Aidan Clark从另一个角度指出Astra的独特之处:“这是首次在德克萨斯州Stargate站点利用超10万张GPU进行预训练,从数据中心网络到推理内核再到模型本身的部署,皆围绕这一训练规模从零开始设计。”他还提到,Astra是OpenAI首次让上一代模型深度参与训练过程的AI产品,虽不能算是“AI自我训练”,但已经在很大程度上引入了上一代的AI技术。

与此同时,OpenAI也将Astra称为“全球最强且最对齐的模型”。在基准测试方面,最引人注目的数据来自ARC-AGI-3测试。此测试旨在评估模型在全新的2D环境中,通过试错方式学习完成目标的能力。Astra在OpenAI自己配置的Provider Adapter下,达到了99.9%的成绩。然而,这个数字需要深入分析。ARC Prize所使用的标准衡量工具给Astra的分数只有62.7%。二者的主要区别在于测试条件的不同,OpenAI发现低分不是因为模型能力不足,而是测试设定限制了模型的记忆表现。为此,OpenAI对ARC-AGI-3的实现进行了调整,使用了自家的Responses API和两个特殊设定,分别为保留推理与压缩。在这种新系统下,Astra的分数从62.7%跃升至99.9%。此外,在双方成功完成的任务中,Provider Adapter的处理速度提升了约3.66倍,token消耗减少了49%,如同开启了外挂一般。

在高难度数学基准FrontierMath Tier 4中,Astra的得分为97.6%。值得注意的是,OpenAI资助了这项基准的开发,并对部分题目拥有独特访问权。其他关注的得分还有:DeepSWE v1.1 74.1%和BenchCAD 95.9%,以及Terminal-Bench科学任务的64.6%。显而易见,OpenAI并不打算仅仅通过一系列基准分数来介绍Astra。打开官网,案例应用几乎一个接一个被列出,从KiCad、Excel、Blender、Power BI,到网站问答、找医生预约、填写税表、制作PPT,再到游戏开发和数据分析,显示出Astra强大的应用潜力。

反抗的勇气:委内瑞拉人民的沉默与无奈

让运动成为你生活中最美好的习惯!...



[无下一篇]

让运动成为你生活中最美好的习惯!...