
OpenAI Astra 连破十项数学难题,AI 正在改变数学研究
OpenAI 下一代模型 Astra 公布十项数学与理论计算机科学成果,并提供 Lean 形式化证明。本文分析这些结果的分量、验证边界及其对数学家的影响。
OpenAI 的下一代模型 Astra 已经从“解数学题”走向“产生新数学结果”:2026 年 8 月 1 日,OpenAI 公布了十项由其内部版本生成的数学与理论计算机科学进展,并同步发布论文、推理过程和 Lean 形式化文件。 如果这些结果通过独立复核,它们的意义会超过一次新的 benchmark 纪录;但“OpenAI 发布成果”仍不等于“数学共同体已经正式确认十个猜想被解决”[1]。
这次真正值得关注的不是某一道题,而是模型开始跨领域、批量地产出研究级结果。单点突破可能是偶然,批量突破则可能意味着数学研究的生产方式正在改变。
TL;DR
- OpenAI 公布的是十项不同类型的成果,包括证明、反例和上下界改进,并非严格意义上的“十个猜想全部被证明”。
- Astra 是尚未公开的下一代主要模型;OpenAI 称其找到这些解法所需 token 按 Sol API 价格估算约为 2000 美元。
- 公开的 249 页论文与 Lean 文件提高了可检验性,但不能替代独立专家对命题翻译、新颖性和学术意义的审查。
- 这批结果如果成立,最大的影响不是数学家立即失业,而是证明搜索和技术试错的边际成本快速下降。
- 数学家的稀缺价值将更多转向选题、解释、验证、概念提炼和研究组织。
Astra 公布了哪些数学成果?
OpenAI 的官方公告列出十项结果,涉及八个以上的研究方向[1]:
| 领域 | Astra 公布的结果 |
|---|---|
| 高维球堆积 | 确定 Cohn–Elkies 线性规划的渐近强度并改进通用上界 |
| 二进制与球面编码 | 在全部参数范围内给出指数级更强的上界 |
| 群论 | 构造非 sofic 群,回答一个核心开放问题 |
| 算子代数 | 给出 Connes 刚性猜想的反例 |
| 算术电路复杂度 | 改进计算永久行列式所需电路与公式的复杂度下界 |
| 量子复杂性 | 证明一般有限双人量子博弈的指数平行重复定理 |
| 格问题 | 证明欧氏最近向量问题具有多项式因子的近似困难性 |
| 凸几何 | 在所有维度上证明 Ehrhart 体积猜想中的尖锐上界 |
| Ramsey 理论 | 得到多色三角 Ramsey 数的超指数下界 |
| 极值图论 | 推翻紧致性与退化猜想,解决两个 Erdős 问题 |
这些工作被整理成一份 249 页论文合集。其中有些章节给出完整证明,有些通过构造反例推翻长期猜想,还有一些改善了经典上下界[2]。
因此,“Astra 解决十个数学猜想”适合做新闻标题,却不是最准确的学术描述。更稳妥的说法是:OpenAI 提交了十项潜在重大的数学与理论计算机科学成果。
为什么它比 AI 获得奥数金牌更重要?
数学竞赛题很难,但它们属于封闭问题:题目已经有人设计,结论已知,而且通常存在一条能在有限时间内写出的解题路线。
开放研究没有这些条件。研究者往往连命题应该被证明还是推翻都不知道。工作中真正昂贵的部分包括选择方向、连接远距离知识、搜索反例、发现构造,以及判断一条已经投入数周的路线是否值得继续。
OpenAI 在 2026 年 5 月已经展示过一次类似能力。当时,一个内部通用模型使用代数数论中的工具,推翻了延续近 80 年的 Erdős 平面单位距离猜测。该证明经过外部数学家检查,Tim Gowers 将其视为 AI 数学发展的里程碑[3]。
如果那次还可以被看成一次特别成功的单点突破,Astra 此次跨越高维几何、群论、量子复杂性和格密码等领域,就更接近能力层面的变化。
一个结果可能来自偶然或筛选。十项不同类型的研究结果同时出现,说明模型可能开始具备可重复的数学探索能力。最终是否如此,还要看外界复核和后续模型能否继续产生同等级成果。
2000 美元的 token 成本意味着什么?
OpenAI 称,找到这十项结果所用 token 按 Sol API 价格折算约为 2000 美元[1]。
这个数字不能理解为“2000 美元完成十项数学研究”。它不包括 Astra 的训练成本、基础设施、研究人员、问题选择、失败项目、人工整理和形式化工作,也没有告诉外界为了筛选出这十项结果一共评估了多少问题。
真正值得注意的是边际探索成本。
传统研究中,一名数学家可能花几周确认某条思路走不通。模型可以并行尝试大量路线:寻找反例、检查特殊情况、组合不同定理、运行计算实验,最后只把少数有希望的结果交给人类深挖。
如果这种能力可以稳定复现,未来的研究预算可能从“资助一条证明路线”变成“购买一片证明搜索空间”。模型未必代替提出重要问题的人,却会显著降低技术试错的价格。
从 Astra 到同行认可,中间还有四个环节

OpenAI 对此次成果采用的公开流程,大致可以拆成四步:模型产生数学论证,人类使用同一模型整理成论文,模型将论证形式化为 Lean 文件,随后由数学共同体检查和解释结果[1]。
这四步不能合并成一句“机器已经证明”。每一步解决的问题不同:
- 模型生成回答是否能找到候选思路和完整论证;
- 人类整理把探索过程变成可阅读、可引用的论文;
- Lean 检查判断形式化结论能否从写入系统的前提推出;
- 同行复核确认形式命题对应原问题,并判断新颖性、重要性与潜在影响。
OpenAI 已在 GitHub 公开十项结果的 Lean 4 文件、构建说明和独立证明检查方法[4]。这比只展示一段流畅的模型回答可靠得多,也让外界可以针对具体定义和证明步骤提出异议。
但 Lean 检查通过不是“绝对正确”的同义词。形式系统验证的是被编码后的命题。专家仍要确认原始问题是否被准确翻译、前提是否合理、定义是否符合领域惯例,以及关键困难有没有被转移到未经说明的假设中。
Lean 也不会判断一项结果是不是首次出现,或者它是否像厂商公告描述的那样重要。机器可以验证逻辑推导,学术价值仍然需要共同体判断。
为什么现在还不能宣布“数学被 AI 攻克”?
目前的模型开发者、论文发布者和证明责任方都是 OpenAI。公司公开了大量可检查材料,这是积极信号,但独立复核仍然不可省略。
OpenAI 自己此前就提供过一个反例。2026 年 2 月,公司发布内部模型对 First Proof 研究题的十次尝试,其中一份最初被认为很可能正确的证明,在收到题目作者和社区反馈后被确认存在错误[5]。
这说明在前沿数学中,“论证看起来完整”与“证明真正成立”之间,可能只差一个隐藏得很深的漏洞。模型越善于写出专业、连贯的数学文本,审阅者越不能只凭阅读流畅度判断正确性。
Astra 此次同时给出长篇论文和形式化文件,证据水平明显更高。截至 2026 年 8 月 2 日,合适的判断仍然是:这是一批有重大潜力、已经具备较强可验证性,但仍在等待独立共同体充分审查的研究结果。
数学家会被 Astra 取代吗?
短期内不会,但数学家的工作组合会改变。
研究数学包含选题、猜想、路线搜索、技术推导、验证、解释和理论推广。Astra 首先压缩的是路线搜索与技术试错的成本,而这两部分通常会占用研究者大量时间。
当候选证明的供应量增加,以下能力反而会更加稀缺:
- 判断什么问题值得解决;
- 识别模型结果的真正创新点;
- 把长篇机器证明压缩成可以被人理解的新概念;
- 发现一项技术还能迁移到哪些领域;
- 设计可靠的人机研究流程;
- 对大量机器成果进行独立审计。
未来的数学家可能更像问题设计者、研究导演和证明审计者。技术推导不会消失,但手工完成每个中间步骤不再必然是研究工作的中心。
这种变化还会冲击学术制度。AI 生成的证明应该如何署名?使用模型的论文需要披露多少过程?掌握私有模型与算力的公司是否会形成研究优势?没有同等工具访问权的年轻学者如何竞争?
OpenAI 表示,如果数学论证完全由 AI 产生,就不应把它描述为纯粹的人类原创[1]。与此同时,《莱顿人工智能与数学宣言》要求数学界重视署名、训练数据、科研公平、企业权力与人类理解等问题[6]。
这些问题不是模型正确率之外的附属讨论。Astra 越强,它们越需要尽快形成可执行的规范。
Astra 是否证明 AGI 已经到来?
不能。
数学具有清晰规则、海量数字化文献和可自动检查的证明,是 AI 最容易建立训练与验证闭环的研究领域之一。模型在形式推理上的进步,不会自动等比例迁移到依赖实验设备、现实观测、隐性经验和模糊目标的学科。
公开材料也没有证明 Astra 可以独立完成完整科研循环。人类仍然参与问题选择、稿件整理、结果发布和责任承担。OpenAI 没有公布全部失败项目,因此外界暂时无法计算模型对任意开放问题的真实成功率。
这批成果能支持的结论更具体:通用 AI 已经有可能在某些研究级数学问题上产生原创、完整且值得正式审查的论证。
这个结论本身已经足够重要,没有必要把它包装成 AGI 宣言。
AI 数学真正的拐点可能已经到来
过去,计算机帮助数学家进行数值计算、搜索文献和验证有限情况。Astra 开始尝试选择证明路线、连接概念、构造反例并完成长篇论证。这两类辅助并不处在同一个层级。
如果十项结果经独立复核成立,数学发现将第一次清晰地呈现出一种新形态:可以大规模并行搜索,可以用形式系统自动检查,并且可以通过增加推理资源扩大产出。
但数学的目标不只是把命题从“未知”改成“已证”。证明还要提供理解,让人看见结论为什么成立,以及它与其他结构之间有什么联系。
未来真正稀缺的也许不再是机器能否生成更多定理,而是人类能否消化、组织并拥有这些定理。Astra 可能没有终结数学家,却很可能已经开启了数学研究自动化的新阶段。
FAQ
Astra 是 OpenAI 已经发布的模型吗?
不是。OpenAI 将 Astra 描述为下一代主要模型,此次结果来自其内部版本。截至 2026 年 8 月 2 日,公告没有给出公开上线时间、API 价格或完整技术规格[1]。
Astra 真的解决了十个数学猜想吗?
不完全准确。十项成果中既有证明,也有反例和上下界改进。它们已经以论文和 Lean 文件形式发布,但仍需要各领域专家完成独立复核。
Lean 文件可以证明结果绝对正确吗?
Lean 可以严格检查形式化命题能否从给定前提推出,但不能自动判断形式化版本是否忠实对应原始问题,也不能判断结果的新颖性和学术意义。
2000 美元是训练 Astra 的成本吗?
不是。这是 OpenAI 按 Sol API 价格估算的解题 token 成本,不包含模型训练、基础设施、人员、失败实验、选题和论文整理。
Astra 会让数学家失业吗?
更可能发生的是工作重组:证明搜索和技术试错被大量自动化,而选题、解释、验证、概念提炼与研究组织变得更重要。
References
- OpenAI. Ten advances in mathematics and theoretical computer science. August 1, 2026. openai.com/index/ten-advances-in-mathematics
- OpenAI. Ten Advances in Mathematics and Theoretical Computer Science. August 2026. cdn.openai.com/pdf/ten-proofs-oai.pdf
- OpenAI. An OpenAI model has disproved a central conjecture in discrete geometry. May 20, 2026. openai.com/index/model-disproves-discrete-geometry-conjecture
- OpenAI. Ten Advances in Mathematics and Theoretical Computer Science — Lean 4 formalizations. Retrieved August 2, 2026. github.com/openai/ten-proofs
- OpenAI. Our First Proof submissions. February 20, 2026. openai.com/index/first-proof-submissions
- Leiden Declaration Working Group. Leiden Declaration on Artificial Intelligence and Mathematics. May 2026. leidendeclaration.ai
更多文章

2026 年 Together AI 替代方案:5 个平台横向对比
2026 年在找 Together AI 替代方案?从模型覆盖、价格、速度和 API 设计四个维度,对比 OpenRouter、Replicate、RunPod、Hugging Face 和 reAPI。


fal.ai 替代方案 2026:5 个平台横向对比
在找 fal.ai 平替?本文对比 Replicate、Together AI、RunPod、Hugging Face 和 reAPI 的模型覆盖、价格、速度与 API 设计。


DeepSeek V4 1M 上下文怎么用?输入、输出、max_tokens、计费与并发
DeepSeek V4 的 1M 上下文是输入与输出共享的总预算,最大输出为 384K。本文讲清 max_tokens、缓存计费、Flash/Pro 并发与 API 配置。
