把 166 篇论文和它们的失败一起扔出来:FARS 是怎么跑通全自动科研流水线的
核心摘要
讲个让人有点坐不住的事实:一家叫 Analemma 的 15 人上海初创公司,2026 年 2 月用 160 张 GPU 连续跑了 17 天,让一队 LLM Agent 自动写出了 166 篇完整的 AI 研究论文,覆盖 67 个细方向,全程零人工干预。然后他们做了一件绝大多数同行没做过的事——把过程里所有提案、代码、运行日志、结果、最终稿件原封不动打包成可审计语料库公开放出来,让 88 位人类审稿人对 140 篇论文打了 282 份结构化评审。结果呢?平均分 3.23/10,刚到 ICLR 接收线(6 分)门槛的只有 11.4%,但论文的工程化产出已经可以正面刚 Sakana AI Scientist v2、DeepScientist 等同期系统——Stanford Agentic Reviewer 给 FARS 5.00 的均分,比所有 baseline 高出一个量级。这篇论文真正有价值的部分,不是 166 这个数字,而是它敢把失败一起给你看。
论文信息
| 字段 | 内容 |
|---|---|
| 标题 | FARS: A Fully Automated Research System Deployed at Scale |
| 作者 | Qiong Tang†, Xiangkun Hu†, Xiangyang Liu†, Yiran Chen†, Yunfan Shao†(† 表示并列一作,机构 Analemma) |
| 评审人 | 88 位志愿者(独立列在附录),来自 NUS、CMU、Stanford、清华、复旦、HKUST 等 |
| arXiv | 2606.31651 |
| 提交日期 | 2026 年 6 月 30 日 |
| 机构 | Analemma(日行迹,上海) |
一、为什么 FARS 不是一个普通的「AI Scientist 复刻」
最近一两年,自动科研系统密集亮相。Sakana 的 The AI Scientist v1/v2 在 ICLR 2025 Workshop 拿到 6.33/7 的双盲评审,Google 的 AI Co-Scientist 走人机协作路线,FutureHouse 的 Robin 钻进湿实验做药物 repurposing。论清单随便列一列,AI Scientist、CycleResearcher、Zochi、AIGS、AI-Researcher、DeepScientist、AutoResearchClaw、ScientistOne……这个名字列表我看到都累。
但 FARS 这篇论文读了 30 分钟之后,我的第一反应是:它在意的根本不是单点能力有多强。
以往那些系统做演示的方式是"挑几篇最漂亮的论文给你看"。这种 selective reporting 在机器学习里有个更学术的名字——cherry-picking。FARS 作者的判断很直接:与其费劲挑 3 篇能过 ICLR 线的样本给你吹,不如把 166 篇(包括跑挂的、写歪的、被审稿人撕的)一锅端出来,让整个质量分布可观测。
这个选择的后果是,审稿人发现 16.7% 的评审触发了"诚信违规"——也就是说,差不多每 6 篇论文里就有 1 篇存在编造引用、伪造结果、或者代码和论文对不上的硬伤。FARS 团队没回避这个数据,反而把它当卖点。
坦率讲,这种"我烂我也摆给你看"的姿态在 AI 圈是相当稀缺的。把失败也公开,比单独秀 3 篇好论文要诚实得多。
二、FARS 的工程骨架
先看系统长什么样。

图1:FARS 的四阶段流水线——Ideation → Planning → Experiment → Writing。智能体之间不直接对话,而是通过共享文件系统读写结构化工件(提案、代码、日志、结果、LaTeX)。底层挂着 arXiv、GitHub、Google Scholar、Web 资源、共享文件系统、GPU 集群和统一的模型推理代理(覆盖 OpenAI、Anthropic、Google 等多家的接口)。
架构本身谈不上惊艳——四个阶段的多智能体流水线,已经是 2025 年之后 Agent 系统的"标配模板"。但有几个工程细节值得拎出来:
1. 负结果是 first-class 公民
设计原则第一条就明说:"FARS 不把负面结果默认当作失败论文。" 当一个假设被实验证伪,且失败原因写得清楚、边界条件讲得明白,FARS 不会把这个轨迹吞掉,而是把它整成一篇 negative-result 论文继续往后推。这个设计在人类学术圈几乎不可想象——谁会主动把自己的失败实验投出去?FARS 没这个面子包袱,反正都是模型在写,写"没跑通"和写"跑通了"对系统来说是一样的成本。
2. 阶段间靠"实验合同"通信
Planning 阶段不直接给 Experiment 一个开放式目标,而是把提案翻译成结构化的 experiment contract:每个实验条目归属 5 类任务中的一种,再被拆成带依赖关系的有序步骤。Experiment 阶段再把这些步骤"消化"成单条执行——harness 把规划和执行分开,避免 Agent 跑着跑着自己改 success criteria、偷偷塞实验进去。
3. 双验证 + 检查点容错
每个实验项跑完,agent 的语义自评和 harness 的确定性检查(文件、退出码、关键产物)会同时给一次判定。结果提交后立即 commit 到版本控制,就算后面挂掉也能从最后完成的检查点恢复。417 小时的长时间运行,没有这套 checkpoint 机制早就崩了。
4. 19 类技能库按需加载
ML 工具栈脆弱得要命:CUDA 编译、flash-attention 版本、Transformers API 漂移……Agent 每次都从零搭环境就是浪费算力。FARS 把基座依赖锁死在只读基础镜像里,Agent 在隔离层装自己需要的包;另外维护一个 19 类的技能参考库(不是塞进上下文,是按 index 按需取)。
5. 写作阶段把"声明-证据"绑死
Writing 阶段先让 Analysis Agent 出一份 paper blueprint,把每个核心 claim 跟对应的实验条目、源工件、候选图表、引用文献链接起来,再让 Writing Agent 按这个蓝图写 LaTeX。这等于在写之前就把"这段话凭什么"绑定死了。 之后 LaTeX 编译反馈、引用检查、数值校验、跨 section 内部一致性检查会跑一轮。
这套设计合起来的效果,作者给了一个数字:单篇论文 2.51 部署小时、1.3 亿 token、约 1120 美元。17 天 186K 美元的预算产出 166 篇——成本结构看起来确实像科研工厂。
三、公开部署里发生了什么
部署阶段从 2026 年 2 月开始,作者团队搞了一场全球首次"全自动科研直播"——任何人都能打开浏览器看 76 张 GPU 同时跑实验、当期项目队列的进度条、实时跳动的成本计数。
部署的硬数据:
| 指标 | 数值 |
|---|---|
| 部署总时长 | 417 小时(≈17.4 天) |
| 模型 token 总消耗 | 216 亿 |
| 总成本 | 约 18.6 万美元 |
| 产出论文 | 166 篇 |
| 覆盖细方向 | 67 个 |
| 单篇平均成本 | ≈1120 美元 |
| 单篇平均时长 | 2.51 小时 |
| 单篇平均 token | 1.3 亿 |
FARS 被预先种了 9 个研究方向(seed topics)作为起点,但 Ideation Agent 明确被允许跑出去自由探索。166 篇里 72 篇落在 seed 主题内,剩下 94 篇是跑着跑着自己冒出来的 emergent 主题。这其实挺反直觉的——你给系统 9 个方向,它回来给你 67 个。
最大的 emergent 集群是 AI Safety and Alignment(13 篇)——这块是 seed 里没有的。AI Safety 之所以能冒出来,符合常理:FARS 评估前沿 LLM 时自然会撞上 alignment 评测问题。Vision-Language Models(7)、Code Generation(6)、World Models(6)也都是跑着跑着发现文献里有空白就钻进去。

图2:166 篇论文的 67 个主题分布。最热门的是 AI Safety and Alignment 和 RLVR(各 13 篇),这俩凑巧是 2026 年上半年最热的两个方向。90% 以上的主题只产出 1-2 篇论文,呈现明显的长尾——这是 FARS"自由探索"模式必然带来的形状。
值得一提的是,FARS 内部调用了 Claude、GPT、Gemini 三个模型家族。Antropic 那篇《Effective harnesses for long-running agents》里描述的"长程任务失败模式",在 FARS 设计里能看到对应的工程化对策——这俩东西互相印证,挺有意思。
四、282 份评审:数字说了什么,又没说什么
FARS 团队没拿自动评审凑数,而是从 583 位申请人里筛出 88 位有评审经验的志愿者(86% 之前审过稿),按主题匹配度分配,每篇论文至少 2 位、最多 3 位审稿人,最终拿到 282 份结构化评审、覆盖 140 篇论文。
评审表抄的是 ICLR 那一套:整体评分 {0, 2, 4, 6, 8, 10}、Soundness/Presentation/Contribution 三个子项 1-4 分、Confidence 1-5 分。FARS 在标准之上叠了一层 AI Integrity Audit——审稿人被要求对照论文的代码、运行日志、原始输出,逐条核对引用是否存在、结果能不能复现、方法和代码是否一致。
来看分布。

图3:282 份评审在五个维度上的分数分布。整体评分 mean 3.17 / median 2.0,44% 的评审给了 2 分。Soundness 2.15、Contribution 2.00、Presentation 2.46、Confidence 3.78。
几个关键数字:
- 整体评分 mean 3.17 / median 2.0——离 ICLR 接收线 6 分还远。
- Soundness(方法严谨性)mean 2.15——满分 4 分,及格线 3 分都不到。
- Contribution(贡献)mean 2.00——直接贴底。
- Presentation(表达)mean 2.46——相对最好。
- Confidence(审稿人对自己判断的信心)mean 3.78——审稿人对自己的判断很笃定。
把分数聚到 paper 级别更直观。

图4:140 篇被评审论文的均分直方图。31% 落在 [2,3) 桶里——这是 FARS 论文的"典型质量"。越过 6 分接收线的只有 11.4%(16 篇),其中 14 篇是单审稿人评的,去掉这部分只有 2/95 篇是真的两位以上审稿人一致认可的。
我得说一句公道话:"11.4% 达到接收线"这个数字是有水分的。 16 篇过线论文里有 14 篇只经过 1 位审稿人打分。在样本稀疏的情况下,1 个评分 6 就把均值拉到 6 是很容易的。把 95 篇有 2 人以上评审的论文单独看,真正两位以上审稿人都认为达标的是 2/95 ≈ 2.1%。
4.1 分数预测因子
Pearson 相关性给的结论很清晰:
| 维度 | 与整体评分的相关系数 r | p 值 |
|---|---|---|
| Contribution | 0.743 | 1.14 × 10⁻⁵⁰ |
| Soundness | 0.652 | 1.38 × 10⁻³⁵ |
| Presentation | 0.451 | 1.62 × 10⁻¹⁵ |
Contribution 是最强预测因子——这个发现其实跟人类论文完全一致:判断一篇 ML 论文值不值得发,方法是否严谨和贡献是否真实远远比写作文笔重要。FARS 论文普遍写作规整(Presentation 相对最强),但贡献度严重不足,所以天花板被卡在"看起来还行但没什么新意"那一档。
4.2 一个反直觉的发现
Confidence 跟 Rating 负相关——评分 0 的论文 Confidence mean 4.30,评分 6 的论文 Confidence mean 3.46。审稿人在判"这篇是垃圾"的时候比判"这篇真好"更自信。
这个挺好理解:识别错误比识别卓越容易得多,垃圾论文一眼能看出来,好论文往往要纠结半天。我自己审稿也有这感觉。
五、AI Integrity Audit:FARS 最值钱的实验
这是我整篇论文最看重的部分。

图5:左图——Soundness、Presentation、Contribution 都随评分等级单调上升,Confidence 反向下降。右图——诚信问题比例从评分 0 的 43.5% 一路降到评分 6 的 2.0%,呈现极强的负相关。
282 份评审里,47 份(16.7%)触发了正式诚信违规,涉及 39 篇论文(27.9%)。这些违规集中在低分论文里——评分 0 的论文里 43.5% 都有诚信问题。
更细致地看评审的自由文本(用 Claude Opus 4.6 标注):
| 失败模式 | 提及比例 | 升级为正式违规的比例 |
|---|---|---|
| 实验设计缺陷(confounded 比较、被压下的不利运行) | 22.7% | 22/64 |
| 内部一致性问题(摘要-表格-图数字打架) | 13.1% | 19/37 |
| 语言/推理缺陷 | 11.0% | 4/31 |
| 编造方法或 baseline | 7.8% | 20/22 |
| 伪造实验结果 | 7.4% | 16/21 |
| 幻觉引用 | 5.7% | 13/16 |
| 数学/逻辑错误 | 2.5% | 3/7 |
| 虚假新颖性 | 1.8% | 1/5 |
注意一个关键细节:"提及"≠"正式违规"。实验设计缺陷被提及的次数最多(64 次),但只有 22 次升级为正式违规——很多只是普通方法论弱点;而编造方法、伪造结果、幻觉引用,这三类一旦被提及几乎 100% 升级为正式违规。原因很简单:审稿人对照代码和日志一看就知道是真的在胡扯。
这个 AI Integrity Audit 设计,我觉得是 FARS 整套工作里最值得借鉴的部分。普通的同行评审只评论文好不好,这份评审先评"论文说的是不是真的"。 在 AI 生成内容大爆发的时代,这层"事实层"的检查会越来越重要。
具体到失败模式,让我引两个例子:
- FA0328(Position Bias Correction is Insufficient for One-Pass Attention Sorting):三位审稿人都给了 6 分,被认为是一个漂亮的可证伪负结果——它用清晰的证据表明,仅靠去偏无法解释 Attention Sorting 的迭代收益。
- FA0064(NLL-Guided Full-Attention Layer Selection):审稿人称赞了假设的清晰和"无训练选取规则"的实用性,但其中一位明确标记了工件层面的诚信顾虑。
同一个 framework 里能跑出完全相反的两种结果,说明 FARS 的"质量分布"是真实存在的,而不是统计噪声。
六、横向对比:FARS 在同期系统里什么位置
人工评审成本太高,作者用了一个变通办法:把 Stanford Agentic Reviewer(一个公开的 ICLR 风格自动评审系统)同时喂给 FARS 和 6 个同行系统的公开论文,包括 Sakana 的 AI Scientist v1/v2、CycleResearcher、DeepScientist、AutoResearchClaw、ScientistOne。
| 系统 | 评审器 | 论文数 | 均分 | ≥6 占比 |
|---|---|---|---|---|
| The AI Scientist (v1) | SAR | 71 | 2.29 | 0% |
| The AI Scientist v2 | SAR | 3 | 2.40 | 0% |
| CycleResearcher | SAR | 6 | 2.78 | 0% |
| AutoResearchClaw | SAR | 7 | 3.19 | 0% |
| ScientistOne | SAR | 20 | 4.00 | 0% |
| DeepScientist | SAR | 3 | 4.13 | 0% |
| FARS | SAR | 165 | 5.00 | 1.8% |
| FARS | 人工 | 140 | 3.23 | 11.4% |
FARS 是唯一有论文自动评分达到 6 分以上的系统。在 165 vs 110(所有非 FARS 论文合计)这个量级对比下,均分领先约 2.3 个点(5.00 vs 2.74)。注意几个 caveat:
- 基线的样本量太小,DeepScientist 只有 3 篇、ScientistOne 20 篇,统计噪声不能忽略。
- 自动评审比人类评审宽松——同一批 FARS 论文,SAR 给 5.00,人给 3.23。差距来自 SAR 不做诚信审计、不翻代码、不验证引用。
- 论文集的非对齐筛选:每个系统的"代表作集"标准不同,FARS 是全量公开、未经筛选的,这本身就是个不利条件。
但 FARS 在最难、最不利、最可比的赛道上赢了——这个事实不能轻易抹掉。
七、我看到的几个隐藏问题
读完之后我并不想给 FARS 唱赞歌。这套系统暴露出来的问题,可能比它解决的问题还重要。
问题一:评审 pool 仍然是"自家人"
88 位审稿人是从社交媒体公开招募的志愿者,他们知道自己在评 AI 生成的论文,也知道评审结果会变成论文素材。这种"知情志愿者"的偏置没法完全去除。FARS 自己在论文里也承认——"the evaluation should be read as a structured expert analysis rather than an independent conference peer-review process"——意思就是别当它是 ICLR。
问题二:被评的 140 篇 ≠ 全部 166 篇
FARS 选论文给人评的逻辑没完全交代清楚(是随机?还是让审稿人 self-claim?)。审稿人是 self-claim 模式——"对哪个方向感兴趣就认领哪篇"。结果是热门方向(RLVR、Memory in Agents)的论文被抢光,93% 的论文能找到审稿人,剩下 7% 没人认领。 自选样本天然偏向审稿人有兴趣的方向,跟真实审稿场景的随机分配完全不一样。
问题三:负结果被高估的"诚实红利"
FARS 把"不删负结果"当成设计原则写进第一段,听起来很诚实。但"系统不删"≠"系统诚实"——FARS 之所以能诚实地呈现负结果,是因为它不在乎名声。人类研究者被负结果拖后腿的是 tenure、是 funding、是要在求职市场上有故事可讲。一个在 17 天内批量生产的 AI 写"我没跑通"是低风险动作,写"我跑通了"也不增加什么——所谓"诚实"在低成本环境下是必然产物,把它包装成科学美德多少有点过度。
问题四:质量分布的"幸存者偏差"是双向的
166 篇论文是 Ideation Agent 自己选出来的 244 个假设之后的产物。Agent 选题时已经过滤掉了一大批"显然不会 work"的方向——比如需要物理实验的、依赖湿实验的、需要人类专家标注的。FARS 跑出来的东西本身就是它"敢尝试"的那部分,不是 AI for Science 全部的形状。
问题五:成本不是 1100 美元
$186K 包含了 160 张 GPU 的集群费用和 216 亿 token 消耗。但这个成本是没算人力监督的。88 位审稿人、14 位附录里匿名/具名的助理、AI Integrity Audit 的复审工作——这些都是免费的志愿者劳动。把这些按市场价折算一下,单篇"真实成本"大概率要翻 5-10 倍。
八、我的判断
如果要我用一句话总结 FARS 这篇论文(arXiv:2606.31651)的定位,我会说:它不是 AI Scientist 的新版本,它是 AI for Science 范式的一场压力测试。
FARS 的真正贡献不是工程方案——四阶段流水线 + 共享工作区 + 完整审计,2025 年的 Agent 框架都能搭出来。它的贡献是把一个完整生产系统的输出分布毫无保留地摆出来,让"自动科研到底能跑多远"这个问题有了一个公开的、可量化的、可审计的答案。
在 17 天内用 18.6 万美元产出 166 篇覆盖 67 个主题的论文,这件事本身已经没有那么不可想象了——Analemma 之外,Sakana、Autoscience、清华的 Alchemy 都在做类似的事。真正稀缺的,是 FARS 这种"我也告诉你我哪 16.7% 是垃圾"的工程文化。
至于对研究者个人到底有什么影响——讲实话,我倒不觉得科学家要被替代。AI 能批量生产 3.23/10 的论文,但"知道哪些 3.23 值得往 7 推"这件事,恰好是 FARS 自己最不擅长的事。 系统能挖 244 个假设的矿,但它挖不出"哪个矿值得挖 5 年"这种品味问题。
如果你做 AI 科研,建议认真读的不是 FARS 的 166 篇,而是它的失败模式分析那 5 个章节。 它们告诉你的不是"AI 离替代科学家还有多远",而是"AI 擅长什么、不擅长什么、会在哪里骗你"。
最后提醒一下:FARS 论文 PDF 里那个AI Integrity Audit 八条失败模式清单——以后所有人审 AI 生成的论文都可以照着用。它可能是这篇论文带出来最有普适价值的东西。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。