GPT-6 Astra:AGI时代的序幕

传闻得到了证实,甚至超出了预期:OpenAI今日正式发布GPT-6 Astra,这款前沿模型被公司视为可能标志着通用人工智能(AGI)时代的开启,这与其长期追求的”能在大多数具有经济价值的工作中超越人类的高度自主系统”的目标相吻合。

在今天早前的闭门媒体简报会上,OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)以异常直接的方式阐述了这一信息,并在会议结束时表示:”欢迎来到AGI时代。”

即使是按照前沿AI发布的标准来看,这也是一个极其重要的定位。但对企业而言,Astra的意义可能更为具体:OpenAI将GPT-6 Astra定位为计算新时代,用户(包括员工)不再需要点击鼠标或敲击键盘(除非他们愿意)。

OpenAI提供给媒体的发布材料称其为”世界上最好的计算机使用模型”。

该模型不需要开发者针对AI系统需要使用的每个应用程序构建专门的API集成,Astra的设计理念是像人一样操作软件——能够跨浏览器、电子表格、网站和桌面应用程序工作,生成完整的文档和演示文稿,执行多步骤工作流程,而不是仅仅告诉用户如何完成这些任务。

实际上,公司展示了一段GPT-6 Astra的宣传视频,从1980年代的AI演示开始,当时一个人请电脑画一个黄色圆形,电脑简单完成了这一任务,然后切到现在,展示多位OpenAI员工通过语音与Astra互动,要求将黄色圆形变成火箭,然后在几分钟内创建一个完整的3D游戏,在eBay上创建商品列表,所有这些都仅通过语音输入完成。

Astra将于周四开始向企业客户推出,通过OpenAI的Daylight项目(受控访问程序)。OpenAI表示,在接下来的几天内,它将对ChatGPT Plus、Pro、Business和Enterprise客户开放,也可通过OpenAI API以及AWS Bedrock和Microsoft Azure等云平台使用。

从回答问题到操作计算机

企业对Astra的期望很大程度上建立在计算机操作能力上。

OpenAI表示,该模型可以填写在线表格、更新CRM记录、整理日程安排、进行网络研究并将结果起草为文档或电子邮件。它可以操作电子表格、在Python笔记本中分析科学数据、在Power BI中工作、创建和测试网站、操作KiCad和FreeCAD等工程应用程序,以及安装和排除软件故障。

这些能力指向企业AI架构的一个重要潜在变化。

在生成AI繁荣的大部分时间里,公司需要通过API、插件、检索系统和专用工具将模型连接到企业系统。布罗克曼认为,计算机使用智能体可能开始绕过部分集成工作,因为软件已经为高度通用的智能体——人类用户——设计了一个接口。

“在这个庞大的时代,我们一直受困于人们编写连接器,并费尽心力地将这些连接构建到人们已经可以使用的所有工具中,”布罗克曼说。

他补充道,通过足够强大的计算机使用能力,智能体可以”快速浏览电子表格、填写表格、跨网页导航”。

布罗克曼表示,这个想法可以追溯到OpenAI的早期,当时研究人员讨论围绕人类使用计算机时可获得的基本输入和输出来训练智能体:像素、键盘和鼠标。

“我感觉我们真的实现了第一个智能体,它真正能够以一种极其有用的方式做到这一点,”他说。

OpenAI报告称,在OSWorld 2.0的离线子集中,Astra得分为72.6%,每个任务耗时约40分钟,而GPT-5.6 Sol的得分为65.7%,耗时约75分钟——每个任务节省了大约47%的时间。

公司还展示了Astra执行从创建3D游戏到准备法律协议并同时处理无关请求等各种任务。更广泛的信息是,该模型旨在超越熟悉的聊天机器人模式,即人类不断提供下一步指令。

“有了Astra,用户拥有了难以置信的能力,可以做到在不到一年前似乎还很遥远的事情,”OpenAI研究员米娅·格莱丝(Mia Glaese)在简报会上说。”凭借这些能力,我们期望人们能够跨应用程序委托更复杂的工作,而人类只需在更高层次上指导工作。”

这种转变——从提示AI到监督AI——最终可能对企业比对学术基准上的又一次提升更为重要。

OpenAI称Astra代表其训练的最大飞跃

在简报会上讨论Astra开发的OpenAI研究员艾丹·克拉克(Aidan Clark)将其描述为公司最大规模的训练运行。

据克拉克介绍,Astra是第一个使用超过10万DBU在公司的Stargate基础设施上进行预训练的OpenAI模型,也是第一个让先前模型在监督下一代模型训练中发挥重要作用的模型。

“根据我们在预训练期间监控的评估结果,我们相信从Sol到Astra的能力提升代表了比Sol到先前模型更大的能力增长,”克拉克说。

OpenAI将Astra的能力归因于大规模预训练和强化学习的结合,旨在教会模型连接信息和执行越来越长的任务。

由此产生的基准测试数据令人瞩目。

OpenAI报告称,Astra在FrontierMath Tier 4 v2上的得分为97.6%,在DeepSWE v1.1上为74.1%,在BenchCAD上为95.9%,在GPQA Diamond上为96%,在ExploitBench上为100%。它还在ARC-AGI-3上获得了98.6%的分数。

但最后一个数字附带一个重要说明——并突显了行业讨论模型智能时日益增长的问题。

Astra在ARC-AGI-3上得分98.6%,这是否意味着AGI?

ARC-AGI已成为衡量AI系统能否推广到陌生问题而非重现通过训练获得的能力的最受关注的尝试之一。

在当前的ARC-AGI-3排行榜上,传统前沿模型的运行得分远低于Astra报告的98.6%结果。

但这种比较并不直接。

OpenAI自己的评估说明指出,Astra使用了公司的Responses API工具,而比较模型可以在不同配置下运行。

这一区别很重要,因为最近的另一个ARC-AGI-3结果展示了模型周围系统能带来多大的性能提升。

8月,英伟达(NVIDIA)报告称,其智能体变异算子(Agentic Variation Operators),或称AVO架构,在ARC-AGI-3公共集中的25个环境和183个级别上均获得了100%的分数。但英伟达并没有创建一个突然跃升至100%的基础模型。AVO使用了Claude Opus 5,英伟达表示基础模型的基线约为30%。

AVO添加了持久内存、工具、反馈和恢复等机制,使智能体能够在长时间运行的任务中保持进展,而不是将每次交互都视为完全独立的。

英伟达的…


关注微信号:智享开源,及时了解更新信息。

原文链接:https://venturebeat.com/technology/welcome-to-the-agi-era-openai-launches-gpt-6-astra

评论列表
发表评论
😀 😂 😃 😄 😅 😆 😉 😊 😋 😎 😍 😘 🥰 😜 😝 🤗 🤔 😭 😤 👍

为你推荐
Ta的个人站点

Mark Do发布文章2926篇

如我距离死亡还有45年,我还活着,该怎么度过现在。


公众号:智享开源

分类