OpenAI 发布了 GPT-6 Astra,标志着人工智能技术的显著进步,这是迄今为止其最强大的模型。Greg Brockman 称之为 “能力上的代际飞跃”,Astra 被誉为迄今为止最接近实现人工通用智能(AGI)的模型。值得注意的是,这是第一个被认为能够在没有人类干预的情况下,自主入侵安全系统的 OpenAI 模型。这些进步使 GPT-6 Astra AGI 成为 AI 能力演变中的一个关键发展。
在测试中,GPT-6 Astra 在 ExploitBench 上得分 100%。第二次评估使用了谷歌 V8 JavaScript 引擎中的 20 个最新漏洞。在该评估中,Astra 超越了其前身 GPT-5.6 Sol,发现并链式利用了两个之前未知的零日漏洞。该模型据报导能够独立发现之前未知的软件缺陷,并将其链式成在强化系统上有效的利用,而无需逐步的人类监督。
在演示中,Astra 格式化了一个法律合同,构建了一个 3D 游戏,并在搜索食物选项的同时预订了网球场。报告称它可以在 KiCad 中布局印刷电路板,并从 W-2 表单起草税务申报。报告还称它能够在 Unity 中构建 3D 城市场景。这些演示和报告显示了在文档格式化、软件和游戏开发、日程安排、电子设计、税务起草和 3D 场景构建等应用中的能力。
本摘要列出了 GPT-6 Astra 的报告测试结果和演示。它提供了这些结果,而不附加其他解释或分析。这里没有包含更多的技术细节。
对GPT-6 Astra的科学评估包括改进了关于素数之间间隙的数学结果。该模型在生物学、化学、医学和物理学的测试中设定了新的标杆,覆盖了多个科学领域。未经证实的泄露报道称,ARC-AGI3基准得分为98.6%,而这些泄露数据仍未得到确认。评估是对Astra性能报告评估的一部分。
Astra在OpenAI的准备框架下超越了“关键”阈值。Astra的自主性使得监控比以往系统更困难,评估表明Astra比早期模型更难追踪。Jakub Pachocki表示,公司将通过激活监控或使其思维链更加透明来加强监控。这些措施被描述为计划中的监控变化。
这些评估结果和所述监控措施未附加进一步分析。此处未提供更多解释。
OpenAI的GPT-6 Astra被视为该公司迄今为止最强大的模型,并在报告中被描述为通向人工通用智能的一步。该模型的先进能力包括自主网络操作和广泛的科学表现,其自主性被报道使得监控比以往系统更困难。
OpenAI的员工,包括Jakub Pachocki,表示公司将通过激活监控或使模型的思维链更透明来加强监控。


