开发过程中有些细节容易被忽略,今天挑几个重点聊一聊。
这篇目录
- 1 -> 引言
- 2 -> 开放研究如何区别于竞赛题
- 3 -> 科学发现至少要过四道门
- 4 -> AI 最先突破的,为什么是数学和计算密集型领域
- 5 -> 更难的问题是署名、机会与研究方向
- 6 -> 我们已经进入“AI 参与发现”的阶段
1 -> 引言
“AI 会不会取代科学家”是一个很容易把讨论带偏的问题。它把科学简化成得出答案,也把科学家简化成一台更慢的推理机器。现实中的科研包含选题、建模、实验、证据判断、同行交流和长期责任,远比回答一道难题繁琐。
但到了 2026 年,这个问题已经不能再用“AI 只会拼接训练数据”轻松带过。8 月,OpenAI 公布了十项数学和理论计算机科学结果,声称它们解决或显著推进了多个长期开放问题;Anthropic 随后披露,一套由约六十个子 Agent 组成的系统,在黎曼假设相关问题上改进了一个保持多年的下界。两家公司都公开了推导、验证材料或形式化证明,试图让学术共同体检查这些结果。
这至少说明了一件事:在某些能够快速验证、允许大规模试错的领域,AI 已经动手参与知识生产。与其急着给它贴上“原创”或“不原创”的标签,不如先弄清它搞定了科研流程中的哪一部分,哪些部分仍然离不开人,以及科学共同体怎样检查一项来自机器的贡献。
2 -> 开放研究如何区别于竞赛题
过去几年,模型在考试、竞赛和已知答案基准上的进步非常快,但这些成绩并不能证明它能做研究。竞赛题经过精心设计,目标清楚,答案存在,通常也能在有限时间内验证。科研问题则可能连问题本身都没有定义好,失败路径几乎无限,而且“看起来合理”的答案可能多年后才暴露错误。
OpenAI 在十项数学与理论计算机科学进展中列出的主题涉及高维球堆积、编码理论、群论、算术电路繁琐性、量子繁琐性和格密码等领域。官方说明称,模型生成数学论证后,人类参与整理手稿,并使用 Lean 为论证制作形式化证书。OpenAI 还特别讨论了署名责任:如果论证主要由 AI 产生,把它描述为纯粹的人类成果会误导读者。
Anthropic 的案例同样有意思。研究版本的 Claude 先产生了数百个想法而没有成功,随后用一天多时间协调约六十个子 Agent,运行大量数值检查和脚本。贡献关键数学思路的 Agent 只占少数,其他 Agent 或提供线索,或验证结论,或彻底失败。这个过程消耗了约 3100 万输出 Token,说明所谓“灵光一现”背后其实是极高密度的搜索和筛选。Anthropic 对过程的公开说明也保留了详细材料,方便外部专家判断。
它们和竞赛题最大的区别,是系统没有从题库中取回一个标准答案,而是在开放问题上形成了此前未被接受的论证路径。当然,“此前没有被广泛知道”和“原创”之间仍有距离;结果还要同行检查,相关工作也可能依赖已有文献中的隐含线索。但轻松说 AI 只是在复述,已经不足以解释这些现象。
3 -> 科学发现至少要过四道门
把一项结果称为科学发现,至少要回答四个问题。
第一,它是否新颖。模型可能重新发现已经存在但训练数据中不显眼的结论,也可能把几个已知定理组合成新的推论。判断新颖性要充分的文献检索和领域专家,而不是模型自报“这是新的”。
第二,它是否正确。数学可以借助形式化验证建立很强的确定性,代码可以运行测试,材料和生物研究则往往要真实实验。模型能够生成一条漂亮推导,并不意味着每个隐含前提都成立。形式化证明很重要,但形式化系统只能验证被写进去的命题,不能自动保证研究问题选得有意义,也不能代替对现实实验条件的判断。
第三,它是否重要。一个结论可能完全正确,却只是对参数做了微小改进。科学价值不只来自难度,还来自它是否改变搞懂、打开新办法或解决真实瓶颈。这个判断高度依赖领域背景和研究品味。
第四,它能否被归责和复现。其他研究者应该知道数据、工具、模型版本、提示、计算预算和人工干预发生在哪里。如果结果出错,需要有人承担修正责任。AI 可以贡献论证,但责任不能凭空消失。
这四道门让“AI 做科研”从一句宣传语变成可检查的流程。模型生成新假设只是动手,能够通过新颖性、正确性、重要性和复现审查,才接近科学共同体意义上的发现。
如果把四道门落实成研究记录,每一道都需要不同证据,不能用同一个“模型很有信心”替代。
验证门核心问题最有价值的证据不能替代它的东西新颖性是否已经有人提出或发表系统文献检索、领域专家复核模型声称“未见相关工作”正确性推导或实验是否成立形式化证明、独立复现、真实实验语言流畅、内部自洽重要性是否改变搞懂或解决瓶颈与现有最佳结果比较、专家判断只报告统计显著或微小增量可归责与复现谁做了什么,别人能否重做数据、代码、环境、干预记录只提供最终论文或摘要
最小证据包甚至可以先用结构化记录表达。重点不在格式,而在于保存失败和不确定性,而不是只留下最终成功故事。
{
"hypothesis_id": "H-017",
"claim": "待验证的具体命题",
"prior_work_check": {
"databases": ["数据库A", "数据库B"],
"status": "needs_expert_review"
},
"experiment": {
"code_revision": "commit-id",
"environment": "environment-lockfile",
"random_seed": 42
},
"result": "rejected",
"counter_evidence": ["实验三在边界条件下失败"],
"independent_replication": "pending"
}
记录 rejected 与记录成功同样重要。否则后续 Agent 会重复消耗算力探索已经失败的方向,研究团队也无法判断结果是不是从大量未披露的尝试中偶然挑出来的。
4 -> AI 最先突破的,为什么是数学和计算密集型领域
数学对 AI 有一个特殊优势:失败通常可以被快速验证。一个证明要么有逻辑缺口,要么能够经受形式化检查;一个数值猜想可以运行大量实验;不同 Agent 可以在相对独立的路线中并行搜索。只要单次尝试成本足够低,大量失败就不再不可承受。
理论计算机科学、密码分析、软件优化和部分生物信息学也具有类似特征。它们可以把假设转化成代码、模拟或形式化对象,让系统获得短周期反馈。AI 不必完全“搞懂世界”才产生价值,只要能在巨大的候选空间中提出比随机搜索更好的下一步,并从验证结果中调整策略,就可能推进研究。
更难自动推进的领域往往缺少这种快速反馈。一个新药是否安全有效,需要实验、临床和时间;社会政策的影响无法在沙箱里完整重演;地质、生态和材料实验还受到仪器、样本和环境限制。语言模型可以帮助读文献、设计实验和分析数据,却不能把现实世界压缩成几分钟的验证回路。
这也是为什么 AI 科研近期较强的进展通常伴随工具:代码执行、数据库、定理证明器、模拟器、实验设备和多 Agent 协作。单纯的对话模型负责提出文字答案,研究系统还要把答案送进能够反驳它的环境。
科学家的工作重心正在移动。
当生成假设和编写分析代码的成本下降,科研的瓶颈会转移到更上游和更下游。
上游是选题。一个系统可以在一天里生成上千个方向,但什么问题值得投入、什么指标代表进展、哪些假设虽然可算却没有意义,仍然需要深厚领域经验。问题启动量增加以后,稀缺资源不再只是想法,而是选择值得追踪的想法。
下游是验证。AI 产出越多,同行评审、实验资源和专家注意力越容易被淹没。研究团队务必建立更严格的证据包:原始数据、运行环境、失败分支、统计假设、形式化证书和模型参与记录。否则论文数量会增长,可信知识却未必同步增长。
科学家的价值因此可能从“亲手搞定每一步”转向设计研究系统、判断证据和承担结论责任。这并不比过去轻松。事实上,当 AI 能快速推进大量分支时,人需要更强的辨别力,知道什么时候应该鼓励系统继续,什么时候应该怀疑一份过于顺利的结果。
OpenAI 在面向学术研究者的计划中提到,研究人员已把 ChatGPT 和 Codex 用于提出假设、获取知识、编写研究代码和分析结果。Anthropic 也在生命科学中展示了模型参与蛋白设计和分析化学的案例。这些信号更像科研工具链的重构,而不是一台机器独自坐在实验室里宣布发现。
5 -> 更难的问题是署名、机会与研究方向
一旦 AI 能对研究结论产生实质贡献,传统署名规则会遇到麻烦。作者通常意味着对东西负责,也意味着拥有学术信用。模型既不能承担法律和职业责任,也不是一个可以接受质询的研究者;但如果人只提供一句目标,把机器生成的结果全部署在自己名下,同样不诚实。
更可行的做法,是把模型贡献具体记录下来:它提出了哪些核心思路,执行了哪些实验,人修改了哪些部分,最终由谁核验并承担责任。论文作者仍然是人,但办法和贡献声明需要比“使用 AI 润色”详细得多。
机会分配也会改变。大规模 Agent 搜索依赖模型能力、计算预算和工具接入。如果少数实验室可以并行探索数百万条路径,它们可能快速占据更多研究问题。开放验证材料、提供研究者访问计划和建立公共基础设施,会比单纯发布成果更重要。
还有一个更隐蔽的风险:模型可能把研究带向最容易验证的方向。形式化、数据丰富、反馈快速的问题会获得更多关注,而需要长期观察、难以量化或社会价值很高但商业回报有限的问题,可能被进一步边缘化。AI 能提高研究速度,却不应该独自决定科学往哪里走。
6 -> 我们已经进入“AI 参与发现”的阶段
现在就宣布“AI 已经成为独立科学家”还太早。它缺少稳定的研究品味、长期责任和对现实世界的完整理解,公开结果也需要时间接受学术共同体检验。
但说 AI 只能辅助写作,同样落后于现实。在有强验证器、丰富工具和可并行搜索空间的领域,AI 已经能够提出新思路、编写实验、排除失败路线,并把少数有效结果推进到专业研究者务必认真检查的程度。
更准确的判断是:我们正在进入 AI 参与发现的阶段。下一场竞争不只是谁拥有最强模型,而是谁能建立最可信的研究回路——允许机器大胆生成,要求证据严格验证,让专家保留方向与责任,并把过程公开到足以被其他人复现。
科学的核心从来不是“谁最先说出一个答案”,而是一个答案如何成为人类可以共同信任的知识。AI 可以改变前半程的速度,但后半程的标准不能因此降低。
感谢各位大佬支持!!!
互三啦!!!
就写这么多吧,内容比较基础,适合入门回顾。有补充的地方欢迎留言一起完善。
评论 (0)
暂无评论