各厂语言模型

OpenAI 确认下一代模型 Astra:连解10道未解数学题,多Agent长时推理首次亮相

2026年8月8日2 次阅读
OpenAI 确认下一代模型 Astra:连解10道未解数学题,多Agent长时推理首次亮相

8月1日,OpenAI 在一篇数学研究博文中首次确认了下一代前沿模型的名称——Astra。这不是一次常规的模型迭代,而是一个全新的模型家族,定位为"能连续工作数小时甚至数天"的长时推理系统。伴随确认而来的,是 Astra 交出的第一份成绩单:一次性解决了10个此前未被证明的数学问题,其中一项证明了非 sofic 群的存在性,直接回应了群论领域的一个重大开放问题。

Astra 是什么:从短任务到长时推理

目前主流大模型擅长的是"短任务"——写一段代码、回答一个问题、翻译一段文字。Astra 的目标完全不同:它被设计为协调多个 Agent 在长时间跨度内持续工作,能够规划、推理、试错、自我纠偏,直到问题被解决。

OpenAI CEO Sam Altman 本周在华盛顿向政界人士和监管者演示了 Astra,强调其在复杂项目和高等数学上的潜力。据 The Information 报道,Astra 将成为 OpenAI 现有 Sol、Terra、Luna 之外的第四个模型家族

最终命名尚未确定——可能叫 GPT-6,也可能是 GPT-5 系列的某个变体(如 GPT-5.7)。发布日期也未公布。

10个数学证明:AI 推理的新高度

Astra 的10个证明覆盖了高维几何、编码理论、群论、量子复杂度、格密码学和极值组合学等领域。曼彻斯特大学数学家 Thomas Bloom(运营 erdosproblems.com)在 X 上称这些结果为"大新闻",认为其意义超过了 OpenAI 今年5月发表的单位距离猜想反例。

关键细节:

  • 成本:OpenAI 表示,生成全部10个证明的 token 消耗按 Sol 的 API 价格计算约 2000 美元。这不是一个天文数字,但考虑到这些是此前人类数学家未能解决的问题,性价比令人侧目。
  • 形式化验证:每个证明都被 Astra 用 Lean 形式化,生成了机器可检查的正确性证书。OpenAI 在 GitHub 上公开了形式化代码,并发布了推理过程的详细 walkthrough。
  • 人机协作方式:Astra 生成论证,人类研究者协助将论证整理为论文并完成形式化。OpenAI 明确表示,数学论证本身来自 Astra,不应将 AI 生成的证明署名为人类作者——并引用了《莱顿 AI 与数学宣言》作为署名规范参考。

OpenAI 研究员 Noam Brown 在 X 上补充说,团队也尝试了千禧年难题但尚未成功,不过"每个问题投入的算力并不多,test-time compute 还可以推得更远"。

监管首秀:美国新 AI 框架的第一个受审模型

Astra 的另一个"第一":据 The Information 报道,它预计将成为首个接受美国新 AI 监管框架审查的模型。该框架要求 AI 模型在公开发布前须提交联邦政府审核,特朗普政府计划在本周内完成框架定稿。

这意味着 Astra 的发布节奏不仅取决于技术就绪度,还取决于政策流程。OpenAI 在 GPT-5.6 Sol 的发布中已经采取了"先小范围预览、再逐步开放"的策略,Astra 可能延续甚至强化这一模式。

仍待验证的挑战

长时推理和多 Agent 协作并非没有风险。Google 和 MIT 的联合研究曾发现,在紧密耦合的任务中,多 Agent 设置反而可能因为协调开销和错误累积而表现更差。Astra 能否在长时间运行中避免错误滚雪球、在偏离轨道时自我纠偏,是它能否兑现承诺的关键。

OpenAI 首席科学家 Jakub Pachocki 去年曾表示,公司目标是构建能"在问题上工作数小时甚至数天"的 AI 系统。到2028年3月,OpenAI 希望拥有一个完全自主的 AI 研究员。Astra 可能就是通往那个目标的关键一步。

---

基于多家媒体转述整理,主要来源:The Decoder、The Information、OpenAI 官方博文。

参考来源

评论

0 条已公开
登录注册后可以参与评论。

正在加载评论...