OpenAI研究员:我们都不读论文了
前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。在顶会发论文都「进化」成这样了吗?一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心...... 本文来自微信公众号: 机器之心 ,作者:机器之心 前沿实验室的人几乎不读论文了? OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假! 事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」
本条来自 虎嗅(Business / 中文商业),聚焦 technology、ai。 前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。在顶会发论文都「进化」成这样了吗?一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心...... 本文来自微信公众号: 机器之心 ,作者:机器之心 前沿实验室的人几乎不读论文了? OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假! 事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。 在顶会发论文都「进化」成这样了吗? 一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心结论——这一层层拷问下来,顶会论文究竟有几篇经得起检验? 还真有人这么干了。 105篇中,只有8篇「合格」 今年7月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的SAI,公布了一次大规模「实验审稿」。 他们选中的,是ICML 2026全部168篇Oral论文。 今年ICML共收到23918篇投稿,最终只有168篇获得Oral资格,占比约0.7%。 换句话说,SAI检查的已经是两万多篇投稿中筛出的最顶层。 除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。 SAI审查了全部168篇Oral,其中只有104篇论文代码开源,最终完成了105篇完整复现。 其中,只有34篇复现了超过40%的主张;复现比例超过80%的,只剩8篇。 无论每篇论文至少包含1项、3项还是5项可验证主张,复现得分中位数始终在28%—30%,整体分布变化不大。 排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有42%—50%;当每篇论文至少包含3项可验证主张时,中位数稳定在42%。 复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。 还有4篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。 SAI还列举了两个更具体的例子。 一篇论文把「只训练基础模型0.77%的参数」写成主要卖点,实际发布的检查点却训练了6.31%的参数,约为宣称数字的8倍。 另一篇论文展示了由裁判模型评分的可靠性表格,开源代码中却找不到这个裁判模型,也没有脚本能够算出表格里的数字。 劣质论文,收益高风险低 SAI的复现结果可以说是相当糟糕。 更糟糕的是,这里发现的问题还只是「有条件被发现」的问题。 那些没有代码的论文,直接就「无懈可击」。 而即使代码完全公开,想要验证一篇论文,所花费的时间、精力和金钱都是巨额的,最后的结果还不如人意,不知道要多崩溃了。 按照SAI基于Google Cloud公开按需价格给出的估算,完整重跑一篇ICML Oral论文,成本中位数约为8900美元。105篇论文中,17篇超过10万美元,最昂贵的一篇接近220万美元。 论文越依赖大规模算力,独立复现就越困难。 没有代码,别人无从检查;有了代码,也未必有人付得起这个成本。 于是,一篇存在问题的论文完全可能顺利通过评审、获得引用,再被写进简历,换来录取、教职或者大实验室的工作机会。 偶然有人发现结果对不上,会议也很少重新审查,论文也未必会被撤回。 这就是评论区所说的「做出糟糕的研究有收益,却几乎没有代价」。 不读论文,但是招聘要看论文 在大模型领域,确实有许多真正重要的进展不再以论文的形式出现。 作为OpenAI的工程师,站在产业前沿,有这种感受并不难理解。毕竟有更充足的算力、更快的实验反馈和大量不公开的内部结果,有「不读论文」的底气。 但这么说出来,多少有点微妙。 一条评论讽刺科技公司里的人这样是「上岸后抽走梯子」:从高校招走研究人员,建立在学术界公开积累的成果之上,用更高的价格抢走人才和GPU,自己越来越少接受同行评审,最后却转过头宣布学术研究「主要是骗局」 稍显刻薄,但确实有道理。 这些前沿实验室的人可以「不读论文」,但是想进入的人还是要先发论文。 对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。 申请博士、寻找教职、进入OpenAI这样的前沿实验室,都要依靠论文获得关注度。 产业界的人在进入大实验室之后轻视论文,却仍然用论文数量、会议级别和引用成绩筛选站在门外的人。 论文于是陷入一种尴尬的位置:它在知识传播上的可信度受到质疑,在人才竞争中的价值却丝毫没有消失。 所以,「大实验室已经不读论文了」听起来稍显清高和傲慢。因为真正有资格不读论文的人,往往已经凭借论文跨过了那道门槛。 当然,也不是所有学生都是精心设计骗局的学术反派。 一位高校研究者开玩笑说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。 有的人在「争做学术骗子」,而有的人还挣扎在LaTeX。 参考链接: https://x.com/MathewShen42/status/2084465434506768867 https://x.com/kellerjordan0/status/2084721463089902074 https://sai.science/blog/how-much-science-is-verifiable https://x.com/mengyer/status/2085134204786921886
前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」
- 前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」
前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。在顶会发论文都「进化」成这样了吗?一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心...... 本文来自微信公众号: 机器之心 ,作者:机器之心 前沿实验室的人几乎不读论文了? OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假! 事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。 在顶会发论文都「进化」成这样了吗? 一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心结论——这一层层拷问下来,顶会论文究竟有几篇经得起检验? 还真有人这么干了。 105篇中,只有8篇「合格」 今年7月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的SAI,公布了一次大规模「实验审稿」。 他们选中的,是ICML 2026全部168篇Oral论文。 今年ICML共收到23918篇投稿,最终只有168篇获得Oral资格,占比约0.7%。 换句话说,SAI检查的已经是两万多篇投稿中筛出的最顶层。 除了和传统审稿人一样阅读论文的方法、实验设计和结果,SAI Review还会下载代码、模型和数据,配置环境并运行实验,最后把运行结果与论文原文逐项对照。 SAI审查了全部168篇Oral,其中只有104篇论文代码开源,最终完成了105篇完整复现。 其中,只有34篇复现了超过40%的主张;复现比例超过80%的,只剩8篇。 无论每篇论文至少包含1项、3项还是5项可验证主张,复现得分中位数始终在28%—30%,整体分布变化不大。 排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有42%—50%;当每篇论文至少包含3项可验证主张时,中位数稳定在42%。 复现里最常见的问题都遇到了:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码跑出的结果和论文对不上。 还有4篇论文依赖已经下线的模型。后来的研究者即使愿意花钱、花时间,也不可能重新得到相同结果。 SAI还列举了两个更具体的例子。 一篇论文把「只训练基础模型0.77%的参数」写成主要卖点,实际发布的检查点却训练了6.31%的参数,约为宣称数字的8倍。 另一篇论文展示了由裁判模型评分的可靠性表格,开源代码中却找不到这个裁判模型,也没有脚本能够算出表格里的数字。 劣质论文,收益高风险低 SAI的复现结果可以说是相当糟糕。 更糟糕的是,这里发现的问题还只是「有条件被发现」的问题。 那些没有代码的论文,直接就「无懈可击」。 而即使代码完全公开,想要验证一篇论文,所花费的时间、精力和金钱都是巨额的,最后的结果还不如人意,不知道要多崩溃了。 按照SAI基于Google Cloud公开按需价格给出的估算,完整重跑一篇ICML Oral论文,成本中位数约为8900美元。105篇论文中,17篇超过10万美元,最昂贵的一篇接近220万美元。 论文越依赖大规模算力,独立复现就越困难。 没有代码,别人无从检查;有了代码,也未必有人付得起这个成本。 于是,一篇存在问题的论文完全可能顺利通过评审、获得引用,再被写进简历,换来录取、教职或者大实验室的工作机会。 偶然有人发现结果对不上,会议也很少重新审查,论文也未必会被撤回。 这就是评论区所说的「做出糟糕的研究有收益,却几乎没有代价」。 不读论文,但是招聘要看论文 在大模型领域,确实有许多真正重要的进展不再以论文的形式出现。 作为OpenAI的工程师,站在产业前沿,有这种感受并不难理解。毕竟有更充足的算力、更快的实验反馈和大量不公开的内部结果,有「不读论文」的底气。 但这么说出来,多少有点微妙。 一条评论讽刺科技公司里的人这样是「上岸后抽走梯子」:从高校招走研究人员,建立在学术界公开积累的成果之上,用更高的价格抢走人才和GPU,自己越来越少接受同行评审,最后却转过头宣布学术研究「主要是骗局」 稍显刻薄,但确实有道理。 这些前沿实验室的人可以「不读论文」,但是想进入的人还是要先发论文。 对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。 申请博士、寻找教职、进入OpenAI这样的前沿实验室,都要依靠论文获得关注度。 产业界的人在进入大实验室之后轻视论文,却仍然用论文数量、会议级别和引用成绩筛选站在门外的人。 论文于是陷入一种尴尬的位置:它在知识传播上的可信度受到质疑,在人才竞争中的价值却丝毫没有消失。 所以,「大实验室已经不读论文了」听起来稍显清高和傲慢。因为真正有资格不读论文的人,往往已经凭借论文跨过了那道门槛。 当然,也不是所有学生都是精心设计骗局的学术反派。 一位高校研究者开玩笑说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。 有的人在「争做学术骗子」,而有的人还挣扎在LaTeX。 参考链接: https://x.com/MathewShen42/status/2084465434506768867 https://x.com/kellerjordan0/status/2084721463089902074 https://sai.science/blog/how-much-science-is-verifiable https://x.com/mengyer/status/2085134204786921886
前沿实验室的人几乎不读论文了?OpenAI的一位研究员一句话扫射三大顶会:太多夸大其词和造假!事情的起因,是一篇效果好得让人想不通的ICLR论文,网友研究了一下才发现其中的「秘诀」。在顶会发论文都「进化」成这样了吗?一看代码是否开源,二看实验方法里有没有藏着什么「歪门邪道」,三才是跑出来的结果又能不能支撑核心...... 本文来自微信公众号: 机器之心 ,作…