与此主题相关未来科技与人工智能委员会

OpenAI 新模型测试 4000 道未解数学题

  • OpenAI 发布 722 篇 AI 撰写数学论文
  • DeepSeek 新模型解决 4000 个开题问题
  • OpenAI 警告部分证明未完全验证

数学测试一直是检验 AI 模型(如 ChatGPT 和 Claude)能力的基准方法。OpenAI 表示,其最新模型在现有数学测试中的表现已经接近极限,这也让这些测试参考价值逐渐降低。为此,研究人员决定挑战更高难度。

他们向一款尚未公开发布的模型提供了约 4,000 道未被解答的数学难题。结果出人意料,同时也引发关注。

该 AI 生成了 722 篇学术论文,内容归为 372 个相关成果系列。OpenAI 称,每一项成果平均耗时约 3 小时的推理计算。

“数学界即将迎来令人激动的时代!” BeInCrypto 未来科技与 AI 专家委员会成员 Stefano Gogioso 表示

AI 的进步速度会不会过快?

这才是更深层的隐忧。前沿 AI 如今已不仅仅是解答已知问题,还在尝试为未知问题提出可能的答案。

这意味着,无论是研究员、工程师还是分析师,其理论工作产能都可能大幅提升。

但 AI 产出并不等同于“真理”。OpenAI 的部分论文配有可由计算机自动检验的 Lean 证明,但也有论文尚未被验证。OpenAI 警告称,尚未核查的结果“可能存在问题”。

这也带来了新的瓶颈:AI 生成研究的速度,或许会超过人类审核的能力。

AI 能否直接进行投资预测与决策?

理论上有可能,但金融领域的复杂性完全不同。

数学证明最终总能验证对错,而金融市场则充满噪音、持续波动。

近期金融领域的基准测试显示,前沿 AI 仍难以应对复杂的投资研究,关于市场时机的研究也尚未发现 AI 具备显著的预测优势。

短期内,AI 更有可能助力深度研究,而不是“完美预测”。

具备数小时持续推理能力的 AI,可以同步梳理财报披露、电话会议、宏观数据及多种假设场景,测试人类分析师难以覆盖的大量假设。

这正是 OpenAI 实验释放的最大信号:AI 正具备以巨大规模产出专业分析工作的能力。下一步挑战,将是如何甄别哪些结果值得信任。

文章免责声明

BeInCrypto 致力于提供公正、透明的报道。本新闻文章旨在提供准确、及时的信息。但读者仍应自行独立核实事实,并在根据本内容作出任何决定之前咨询专业人士。请注意,我们的条款与条件、隐私政策及免责声明已更新。