PDF当死,ARA该立!论文是时候Agent原生了
以后论文的第一读者不是人,而是AI?
本条来自 量子位(AI / 中文),聚焦 technology。 近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究, 让AI从辅助工具升级为科研协作者
以后论文的第一读者不是人,而是AI?
- 啥情况? 统治科研圈几十年的PDF格式,都需要因AI而“退休”…
- 因为以后 论文的第一读者不是人,而是AI??
- 对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;
- 概括来说,论文最后通过PDF呈现的只是 “我们最后做成了什么” ;
- 近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Artifact)
以后论文的第一读者不是人,而是AI?
啥情况? 统治科研圈几十年的PDF格式,都需要因AI而“退休”…
因为以后 论文的第一读者不是人,而是AI??
近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究, 让AI从辅助工具升级为科研协作者
据IEEE报道,ARA团队在一篇名为 The Last Human-Written Paper: Agent-Native Research Artifacts 的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示:
AI需要一种不同的内容格式,而 AI的需求,理应被置于首位。
一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。
现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。
而 PDF 就是过去科研知识共享的最核心代表。
PDF代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现,“有问题”。
ARA团队认为, 真实的科研从来不是一条从问题直通答案的直线 ,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。
然而,当这些探索被写成论文时,那棵枝杈横生的“探索树”通常会被修剪成一条干净、连贯的成功路径。
而 ARA团队 将这种损失称为 “叙事税” ,即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃, 后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。
除了“叙事税”,传统论文还存在着 “工程税” 。
一篇论文只要能让审稿人信服,便算完成了使命。
但“说服审稿人”与“让AI完整复现”完全是两套标准。
模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。
研究团队统计了PaperBench中的8921项专家复现要求,发现 仅有45.4% 在论文PDF中得到了完整说明。
对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;
但对 AI来说,论文里没写,那就意味着只能靠猜(或者瞎编) ,它也很无奈。
不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。
概括来说,论文最后通过PDF呈现的只是 “我们最后做成了什么” ;
但如果通过ARA,展现的还有 “为什么这么做”“具体怎么做”“哪些方法已失败”以及“原始证据在哪里” ,追求的是 知识优于叙事 。
更形而上来说, PDF只有结果,ARA还包括了整个过程。
道理似乎是这个么道理,但“一切存在皆合理”,PDF能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。
为了让ARA真正跑起来,研究团队设计了三套配套机制:
1、Live Research Manager: 负责在研究过程中持续记录实验、决策、转向与失败路线;
2、ARA Compiler: 负责将现有的PDF和代码仓库转换为ARA格式;
3、ARA原生审稿系统: 负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。
为了体现ARA真的比PDF好用,研究团队分别从 理解 、 复现 和 延伸 三个维度进行了测试。
在理解测试中,研究人员设置了450个问题,要求AI从ARA或传统PDF加代码仓库中寻找答案。
结果显示,使用ARA的AI准确率达 93.7% ,而传统材料组仅为 72.4% ,相差 21.3% 。
差距最大的是“复盘失败” ,当问题涉及失败方案、替代路线和实验教训时, ARA组准确率为81.4%,传统材料组仅15.7% ——原因很简单, 传统论文里压根就没有这些信息。
在复现测试中,团队选取了15篇附带GitHub仓库的机器学习论文,设置了150项复现任务。
其中,ARA组的难度加权成功率为 64.4% ,传统组为 57.4% 。且 任务越难,ARA的优势就越明显 :
ARA在简单、中等和困难三档任务中,分别领先 4.9% 、 5.6% 和 8.5% 。
在最具挑战性的研究延伸环节,ARA组赢下了3项RE-Bench开放任务,但 另有2项被传统论文组反超。
ARA组在全部5项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作: 利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。
这也对应了论文中的另一组数据。在论文分析24008次AI Agent运行中, 90.2%的资金成本都消耗在失败探索上 ,而传统论文几乎不会保存这些失败。
在她设想的人机科研关系中,AI不再只是润色论文、查找资料或生成代码的辅助工具,而是能 真正成为参与阅读、复现和延伸研究的科研主体。
而 科研人员则可以更加聚焦于那些AI难以替代的判断、创新和品味工作 ,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。
不过,虽然ARA的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。
它离成为“PDF终结者”还有很长的一段道路要走。
ARA的第一个缺陷,就是它目前 实验的范围较窄,普适性较弱 ,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「PDF当死,ARA该立!论文是时候Agent原生了」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究, 让AI从辅助工具升级为科研协作者…