WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
设置Settings
⌘K
更新于 —KKelly
Brand Casebook/虎嗅

AI让科研变成“科学自动机”,副作用是什么?

上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S。几年前

·2026.08.09·10 min 阅读
背景基于真实抓取数据整理

本条来自 虎嗅(Business / 中文商业),聚焦 technology、ai。 上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S。几年前,我在线上参加过一个讨论AI4S的小会。我记得我偏保守,觉得大概率是一个有趣的小浪花,还试着从第一性原理去论证这一点,用了一个逻辑严密但现在完全想不起来...... 本文来自微信公众号: 知识分子 ,作者:张峥(香港大学教授、港沪创研院首席科学家),题图来自:视觉中国 上一篇说到了“ AI开权与闭源:差距、困境与机会 ”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S (AI for Science) 。 几年前,我在线上参加过一个讨论AI4S 的小会。我记得我偏保守,觉得大概率是一个有趣的小浪花,还试着从第一性原理去论证这一点,用了一个逻辑严密但现在完全想不起来的论证骨架。 显然,我错得离谱。 科学自动机 我以为的“小浪花”滚成了大浪,这两年更是明显在加速:按今年3月的《AI for Science 创新图谱》,近五年全球相关论文翻了一倍多,材料、量子科技、航空航天这几个方向年均增速超过30%。前几年的数据是,中国的发表量全球第一,篇均被引不如美国。政府动作也密集,中美欧英日这两年陆续出了国家级部署。 国内的投入主要走专项和课题,国外的钱则压在自主实验室这类公司上。Periodic Labs 去年九月拿了3亿美元种子轮,做的是AI 提假设、机器人跑合成,目标是找高温超导材料。Lila Sciences 累计融了5.5亿美元,生命科学、化学、材料都做,把自动化实验室开放成平台给别人用。 生成这一头的动静最大。今年2月,上海日行迹 (Analemma) 的FARS 系统开始全球直播,第一轮连续跑了228 小时,出了100 篇AI 领域的短论文。然后,他们借助斯坦福的审稿系统Agentic Reviewer ,按深度学习顶会ICLR 的标准来打分,FARS生成的论文平均分是5.05——而ICLR 2026 人类投稿的均值是4.21,最终录用的均值是5.39。后来又跑了17 天,166 篇,平均两小时一篇,单篇成本一千多美元。 但分数打完就完了,不会回过头去改进下一轮。这是一条流水线加一道质检。 十个数学问题的进展。图源:OpenAI 难的是质检那一头。8 月1 日OpenAI 公布的那十个数学问题,每个结果都配了Lean 4 的机器可核验证书;Google 上周发的Science One Framework,讲的是给推理的每一步挂上证据链;上海AI 实验室的书生·端砚在蛋白质和材料上做干湿闭环,专门加了独立的评审智能体去查引用、核输出。做法不同,要解决的是同一件事:怎么让机器自己判断一个结果站不站得住。 如果这一头也接了回去,合格的灌进论文池,下一轮从上一轮起步,这就成了一台科学自动机。 不同的领域也不一样。计算机和数学这类领域会率先闭合,验证在机器里就能完成,不用等湿实验。而其他领域,要闭的是物理世界,得用上机器人。 按 上一篇文章 的逻辑,闭环一旦转起来,生产力会上一个台阶。那么,靠这样的科学自动机,我们能不能在AI4S 上走在前面? 我认为 这是一条滑向局部最优的路,而且会有两个陷阱。 第一个陷阱:能力陷阱 这样的自动机真转起来,碳基科学家还剩下什么?通常的答案是: 品味和判断 (taste and judgement) 。 这两个听上去很虚头巴脑的东西,对每一个成熟的科学家来说,都是真实存在的能力。哪个方向值得做,哪个结果不对劲、说不上来哪里不对但就是不对,这些判断每天都要用。没有谁讲得清它们究竟是什么,不存在一部葵花宝典,我们只知道,不亲身被科研过程毒打很多年,它们长不出来。 跳开这种毒打,走捷径,品味和判断力都无法养成。港大一位同事跟我说起他的博士生的工作,用了一个数学上很漂亮的方法,跑完性能没有一点提高。他问为什么,学生说不知道,那方法是某个AI 建议的。 写作是最容易被跳开的那一环。Writing is half of research,这是我导师经常挂在嘴边的话,我当时以为说的是把文章写漂亮,心中还有些不齿,后来才知道完全不是这么回事。我们做系统研究,得搭原型、跑实验,最后写成文章,一篇下来九个月左右,在各个领域里算出慢活儿的。麻烦的是在写的时候,我们常常发现还有更干净的设计,偏差小还能救,偏差大的时候,前面辛辛苦苦写完的代码和跑完的实验就得推倒重来。 那个更干净的设计,不动笔是不会出现的。 而在自动机成型的过程中,这些环节会最先被交出去。今天已经没有人会为了锻炼判断力而拒绝让AI 写初稿——效率差摆在那里,你不用,别人用; 机构考核的是产出,不是能力的养成 。所以这个退场很可能是不可逆的。 前面说的FARS,我问过一位上海交大熟识的教授怎么看那批文章的质量。他说如果拿交大博士生的平均水平来比,六篇排个序,这些“机器造”能排到下面那三篇。 我当时的反应是:如果没有弱三篇,哪来强三篇? 有人会说,主编不写稿,判断力照样好。但主编是当过记者的,他的判断是存量。问题在下一代:如果他们一进场就自愿退出这些环节, 没有经过毒打,将来的品味从哪里来,判断力从哪里来? 这就好比让一个滴酒不沾的人去做品酒师,让一个从来不听音乐的人去做乐评人。 第二个陷阱:天花板陷阱 如果大家对对抗式图片生成,也就是第一波DeepFake 的图像背后的技术还有印象的话,应该记得那套东西的原理很简单:一个网络负责造假图,另一个网络负责分辨真假,两边对着练,直到分辨的那个认不出来。 科学自动机在大框架上和对抗学习很类似。撇开细节不提,那么这样的对抗总会在哪一天收敛,成为一个成熟的流水线,源源不断地流出新的科学成果。 会流出什么样的成果呢? 科学自动机能出什么,取决于它能搜的范围,而这个范围从一开始就锁定在已有的语料里:哪些数据、哪些方法、哪些指标。这个范围可能极大,混搭出来的组合数远超一个人类科学家能穷尽的量。 这样的工作,在某些领域会特别有用。材料筛选、老药新用、天气预报,本质都是在已知空间里做组合搜索,换来的是吞吐量的大幅提高。各家自己公布的数字都在这个量级上:抗菌物质挖掘的成功率是人类专家的几十倍,芯片设计效率提升五到十倍、周期缩短一半,气象模型比传统数值方法快上千倍。 有没有发现一条原来不知道的规律?据我所知,还没有。 这样的自动流水线产生的成果,是把窟窿很多的地板暴力填平。 我们把眼光先收回到上一篇的AI4SE。对这一两年AI 编程能力有了解的读者一定知道,除了大量自动生成的编程语料之外,最要紧的是引入了skill、workflow、harness 这几样东西。 封装、复用、把复杂的活拆成固定步骤,是软件工程的基础概念,语料里比比皆是,大模型讲起来头头是道。可模型自己动不动就产出“屎山屎海”,真去改这个毛病的,还是人类工程师。 实话说,如果AI 自己回头一看,说这几样该用到我自己身上,而且还用上了,那我觉得ASI 真的快到了。 那么,大模型那么强,能不能突破这个瓶颈呢?答案是,目前还不能。根本原因在于大模型是一个超级模式补全器,能力再强,也走不出已知语料泛化所能到达的边界 (这一点我在Comprehension Without Competence 一文里有详细的实验和分析,TMLR 2025) 。 但科学史上那些重大的突破,几乎都是在已有的概念之外发生的。负数、复数、非欧几何,当年都不在任何人的语料里。把落地的苹果和绕地的月亮看成同一回事,也是这样一步。 抬高天花板,靠的是一个可被泛化的新概念、新结构。 反过来设想一下。如果整数之外我们全部用分数表达,用祖冲之割圆术那套方法算到小数点后七位,做个杯子、桌子和车轮已经足够圆,并不需要一个理想的圆。 在已有的语料空间里搜索,只会产生“够好就可以了”的成果。科学自动机可以快速填满地板,但抬不高天花板。 8 月1 日OpenAI 那批数学结果是个显著的进步:难度比之前高出一截,十个问题都开放了至少十年。路子跟陶哲轩和Thomas Bloom 的erdosproblems.com 是同一条——那个网站把Erdős 提过的近一千个问题整理成数据库,一群人在上面用AI 一道道推。 但这仍然是在填地板。这些问题都是人提的,等在那儿几十年,等的是答案,不是问题。 “够好还不够”“没用也要搞”,加上抽象癖,是顶尖科学家区别于其他人的地方。这样的人是时代的异类。 如果把每个人的贡献看作文明前进的一个梯度,这些人贡献的是相当不平滑的毛刺——放在训练里,正是大模型为了不跑飞而千方百计要压掉的那种。 AlphaFold 是抬高天花板的样子:几十年里大家都在算一个物理问题,DeepMind 把它换成学一个预测问题。数据是几十年公共投入攒下来的,换掉的是看这个问题的角度。这关键的一步,不在任何现存的搜索空间里。 总结 和AI4SE 不同,AI4S 的闭环如果照目前这种“科学自动机”的形式发展下去,固然在某些领域会带来实际的成果,但泛化开来有两个不小的副作用。 能力陷阱是指人在链条里的位置往后退,保留下来的品味和判断只能在科研过程里被毒打很多年才长得出来。这一代人的判断是存量,问题在下一代:一进场就自愿退出这些环节,品味和判断从哪里来? 天花板陷阱是指它能搜的范围从一开始就锁定在已有的语料里。地板可以被暴力填平,换来的是吞吐量。而抬高天花板要的是新结构,新结构常常在语料之外。 填地板本身没有错,只是科学上大的进步要靠抬天花板。只靠暴力铺满地板,甚至会丧失抬天花板的能力。 抬高天花板有很多条路,在AI 时代,哪一条都要求碳基科学家调整策略,而不是懒惰退场。 下一篇我们聊聊AI 时代的教育。 本文来自微信公众号: 知识分子 ,作者:张峥

Case Intelligence基于真实正文拆解

上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截

  • 上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截

上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S。几年前,我在线上参加过一个讨论AI4S的小会。我记得我偏保守,觉得大概率是一个有趣的小浪花,还试着从第一性原理去论证这一点,用了一个逻辑严密但现在完全想不起来...... 本文来自微信公众号: 知识分子 ,作者:张峥(香港大学教授、港沪创研院首席科学家),题图来自:视觉中国 上一篇说到了“ AI开权与闭源:差距、困境与机会 ”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S (AI for Science) 。 几年前,我在线上参加过一个讨论AI4S 的小会。我记得我偏保守,觉得大概率是一个有趣的小浪花,还试着从第一性原理去论证这一点,用了一个逻辑严密但现在完全想不起来的论证骨架。 显然,我错得离谱。 科学自动机 我以为的“小浪花”滚成了大浪,这两年更是明显在加速:按今年3月的《AI for Science 创新图谱》,近五年全球相关论文翻了一倍多,材料、量子科技、航空航天这几个方向年均增速超过30%。前几年的数据是,中国的发表量全球第一,篇均被引不如美国。政府动作也密集,中美欧英日这两年陆续出了国家级部署。 国内的投入主要走专项和课题,国外的钱则压在自主实验室这类公司上。Periodic Labs 去年九月拿了3亿美元种子轮,做的是AI 提假设、机器人跑合成,目标是找高温超导材料。Lila Sciences 累计融了5.5亿美元,生命科学、化学、材料都做,把自动化实验室开放成平台给别人用。 生成这一头的动静最大。今年2月,上海日行迹 (Analemma) 的FARS 系统开始全球直播,第一轮连续跑了228 小时,出了100 篇AI 领域的短论文。然后,他们借助斯坦福的审稿系统Agentic Reviewer ,按深度学习顶会ICLR 的标准来打分,FARS生成的论文平均分是5.05——而ICLR 2026 人类投稿的均值是4.21,最终录用的均值是5.39。后来又跑了17 天,166 篇,平均两小时一篇,单篇成本一千多美元。 但分数打完就完了,不会回过头去改进下一轮。这是一条流水线加一道质检。 十个数学问题的进展。图源:OpenAI 难的是质检那一头。8 月1 日OpenAI 公布的那十个数学问题,每个结果都配了Lean 4 的机器可核验证书;Google 上周发的Science One Framework,讲的是给推理的每一步挂上证据链;上海AI 实验室的书生·端砚在蛋白质和材料上做干湿闭环,专门加了独立的评审智能体去查引用、核输出。做法不同,要解决的是同一件事:怎么让机器自己判断一个结果站不站得住。 如果这一头也接了回去,合格的灌进论文池,下一轮从上一轮起步,这就成了一台科学自动机。 不同的领域也不一样。计算机和数学这类领域会率先闭合,验证在机器里就能完成,不用等湿实验。而其他领域,要闭的是物理世界,得用上机器人。 按 上一篇文章 的逻辑,闭环一旦转起来,生产力会上一个台阶。那么,靠这样的科学自动机,我们能不能在AI4S 上走在前面? 我认为 这是一条滑向局部最优的路,而且会有两个陷阱。 第一个陷阱:能力陷阱 这样的自动机真转起来,碳基科学家还剩下什么?通常的答案是: 品味和判断 (taste and judgement) 。 这两个听上去很虚头巴脑的东西,对每一个成熟的科学家来说,都是真实存在的能力。哪个方向值得做,哪个结果不对劲、说不上来哪里不对但就是不对,这些判断每天都要用。没有谁讲得清它们究竟是什么,不存在一部葵花宝典,我们只知道,不亲身被科研过程毒打很多年,它们长不出来。 跳开这种毒打,走捷径,品味和判断力都无法养成。港大一位同事跟我说起他的博士生的工作,用了一个数学上很漂亮的方法,跑完性能没有一点提高。他问为什么,学生说不知道,那方法是某个AI 建议的。 写作是最容易被跳开的那一环。Writing is half of research,这是我导师经常挂在嘴边的话,我当时以为说的是把文章写漂亮,心中还有些不齿,后来才知道完全不是这么回事。我们做系统研究,得搭原型、跑实验,最后写成文章,一篇下来九个月左右,在各个领域里算出慢活儿的。麻烦的是在写的时候,我们常常发现还有更干净的设计,偏差小还能救,偏差大的时候,前面辛辛苦苦写完的代码和跑完的实验就得推倒重来。 那个更干净的设计,不动笔是不会出现的。 而在自动机成型的过程中,这些环节会最先被交出去。今天已经没有人会为了锻炼判断力而拒绝让AI 写初稿——效率差摆在那里,你不用,别人用; 机构考核的是产出,不是能力的养成 。所以这个退场很可能是不可逆的。 前面说的FARS,我问过一位上海交大熟识的教授怎么看那批文章的质量。他说如果拿交大博士生的平均水平来比,六篇排个序,这些“机器造”能排到下面那三篇。 我当时的反应是:如果没有弱三篇,哪来强三篇? 有人会说,主编不写稿,判断力照样好。但主编是当过记者的,他的判断是存量。问题在下一代:如果他们一进场就自愿退出这些环节, 没有经过毒打,将来的品味从哪里来,判断力从哪里来? 这就好比让一个滴酒不沾的人去做品酒师,让一个从来不听音乐的人去做乐评人。 第二个陷阱:天花板陷阱 如果大家对对抗式图片生成,也就是第一波DeepFake 的图像背后的技术还有印象的话,应该记得那套东西的原理很简单:一个网络负责造假图,另一个网络负责分辨真假,两边对着练,直到分辨的那个认不出来。 科学自动机在大框架上和对抗学习很类似。撇开细节不提,那么这样的对抗总会在哪一天收敛,成为一个成熟的流水线,源源不断地流出新的科学成果。 会流出什么样的成果呢? 科学自动机能出什么,取决于它能搜的范围,而这个范围从一开始就锁定在已有的语料里:哪些数据、哪些方法、哪些指标。这个范围可能极大,混搭出来的组合数远超一个人类科学家能穷尽的量。 这样的工作,在某些领域会特别有用。材料筛选、老药新用、天气预报,本质都是在已知空间里做组合搜索,换来的是吞吐量的大幅提高。各家自己公布的数字都在这个量级上:抗菌物质挖掘的成功率是人类专家的几十倍,芯片设计效率提升五到十倍、周期缩短一半,气象模型比传统数值方法快上千倍。 有没有发现一条原来不知道的规律?据我所知,还没有。 这样的自动流水线产生的成果,是把窟窿很多的地板暴力填平。 我们把眼光先收回到上一篇的AI4SE。对这一两年AI 编程能力有了解的读者一定知道,除了大量自动生成的编程语料之外,最要紧的是引入了skill、workflow、harness 这几样东西。 封装、复用、把复杂的活拆成固定步骤,是软件工程的基础概念,语料里比比皆是,大模型讲起来头头是道。可模型自己动不动就产出“屎山屎海”,真去改这个毛病的,还是人类工程师。 实话说,如果AI 自己回头一看,说这几样该用到我自己身上,而且还用上了,那我觉得ASI 真的快到了。 那么,大模型那么强,能不能突破这个瓶颈呢?答案是,目前还不能。根本原因在于大模型是一个超级模式补全器,能力再强,也走不出已知语料泛化所能到达的边界 (这一点我在Comprehension Without Competence 一文里有详细的实验和分析,TMLR 2025) 。 但科学史上那些重大的突破,几乎都是在已有的概念之外发生的。负数、复数、非欧几何,当年都不在任何人的语料里。把落地的苹果和绕地的月亮看成同一回事,也是这样一步。 抬高天花板,靠的是一个可被泛化的新概念、新结构。 反过来设想一下。如果整数之外我们全部用分数表达,用祖冲之割圆术那套方法算到小数点后七位,做个杯子、桌子和车轮已经足够圆,并不需要一个理想的圆。 在已有的语料空间里搜索,只会产生“够好就可以了”的成果。科学自动机可以快速填满地板,但抬不高天花板。 8 月1 日OpenAI 那批数学结果是个显著的进步:难度比之前高出一截,十个问题都开放了至少十年。路子跟陶哲轩和Thomas Bloom 的erdosproblems.com 是同一条——那个网站把Erdős 提过的近一千个问题整理成数据库,一群人在上面用AI 一道道推。 但这仍然是在填地板。这些问题都是人提的,等在那儿几十年,等的是答案,不是问题。 “够好还不够”“没用也要搞”,加上抽象癖,是顶尖科学家区别于其他人的地方。这样的人是时代的异类。 如果把每个人的贡献看作文明前进的一个梯度,这些人贡献的是相当不平滑的毛刺——放在训练里,正是大模型为了不跑飞而千方百计要压掉的那种。 AlphaFold 是抬高天花板的样子:几十年里大家都在算一个物理问题,DeepMind 把它换成学一个预测问题。数据是几十年公共投入攒下来的,换掉的是看这个问题的角度。这关键的一步,不在任何现存的搜索空间里。 总结 和AI4SE 不同,AI4S 的闭环如果照目前这种“科学自动机”的形式发展下去,固然在某些领域会带来实际的成果,但泛化开来有两个不小的副作用。 能力陷阱是指人在链条里的位置往后退,保留下来的品味和判断只能在科研过程里被毒打很多年才长得出来。这一代人的判断是存量,问题在下一代:一进场就自愿退出这些环节,品味和判断从哪里来? 天花板陷阱是指它能搜的范围从一开始就锁定在已有的语料里。地板可以被暴力填平,换来的是吞吐量。而抬高天花板要的是新结构,新结构常常在语料之外。 填地板本身没有错,只是科学上大的进步要靠抬天花板。只靠暴力铺满地板,甚至会丧失抬天花板的能力。 抬高天花板有很多条路,在AI 时代,哪一条都要求碳基科学家调整策略,而不是懒惰退场。 下一篇我们聊聊AI 时代的教育。 本文来自微信公众号: 知识分子 ,作者:张峥

❧
Case Study Breakdown暂无深拆版本
Evidence阅读原文 · 虎嗅
Related Articles
【“十五五”健康规划精读】真正值得盯的,其实就这三条AI制药,新痛点AI 正将我们带进名为“螺旋”的赛博邪教OpenAI研究员:我们都不读论文了OpenAI 用1年时间证明,你并不用为AI 换浏览器
关联播客真实 RSS 单集
An interview with Elon Musk
The Intelligence · 2026.07.23
Leadership Summit 2026: AT&T CEO John Stankey on Developing Technology and Talent in the AI Era
HBR IdeaCast · 2026.07.16
Why creativity matters more than ever in the age of AI - Adobe CMO, Lara Balazs
Uncensored CMO · 2026.07.15
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇
ai
ai

上一篇说到了“AI开权与闭源:差距、困境与机会”,中国开权模型在 AI4SE 这一档已经追平头部闭源,AI4B 还差一截。这一篇讲另一个热点:AI4S。几年前,我在线上参加过一个讨论AI4S的小会。我记得我偏保守,觉得大概率是一个有趣的小浪花,还试着从第一性原理去论证这一点,用了一个逻辑严密但现在完全想不起来...... 本文来自微信公众号: 知识分子 ,作…

系统商务英语 →
来源
阅读原文 · 虎嗅 ↗
发布:2026.08.09
类型:Business / 中文商业
话题:technology、ai
相关阅读
虎嗅/2026.08.09
【“十五五”健康规划精读】真正值得盯的,其实就这三条
虎嗅/2026.08.09
AI制药,新痛点
虎嗅/2026.08.09
AI 正将我们带进名为“螺旋”的赛博邪教
虎嗅/2026.08.09
OpenAI研究员:我们都不读论文了
虎嗅/2026.08.09
OpenAI 用1年时间证明,你并不用为AI 换浏览器
个人笔记
自动同步到云端