当 LLM 在做"研究想法"时,它到底在干嘛?
一篇论文用 1.1 万条人类论文逆推出"灵感上下文",让 9 个 LLM 在同一跑道上做 idea 生成。 结果发现,LLM 不是"想法不够新",而是在用一种套路反复做事。
核心摘要
这篇来自 Yale 的论文(Ziyu Chen, Yilun Zhao, Arman Cohan)想回答一个朴素但一直没被认真问过的问题:现在的 LLM 生成的研究 idea,跟人类研究者想出来的 idea,到底差在哪、差多远?
以往评估 LLM 的"idea 能力",大多是给几个 idea 打 novelty、feasibility、impact 之类的分,这是"逐个看"的视角。这篇论文换了个角度:把视角拉到"分布"上——看 LLM 在大量 idea 上的统计分布形状。
做法是逆向工程。他们从 11,683 篇高质量人类论文(ML 顶会 2023–2026 + Nature Communications 2023–2025)出发,用 LLM 反推出"启发了这篇论文的若干前作",再让待测的 LLM 看着同一批前作的标题摘要,生成新的 idea。人类 idea 就是真实论文里那个 idea,LLM idea 就是基于"重建的局部上下文"生成的那个。
然后作者引入了一个两轴 research-taste 分类法:第一个轴是"机会模式"(你为什么要做这件事,能拆成 Puzzle、Explanation、Bridge、Failure/risk 等 7 类),第二个轴是"方法范式"(你打算怎么做这件事,能拆成 Synthesis、Artifact、Optimization 等 7 类)。
跑完 9 个主流 LLM 之后,结论相当尖锐:
- 人类 idea 分布很广,两个轴的归一化熵都超过 0.92。
- LLM idea 分布窄得多,机会模式轴上 47.1%–64.2% 都集中在 "Bridge"("我要把 A 和 B 接起来"),人类只有 12.1%。方法范式轴上 22.5%–38.7% 集中在 Synthesis("我要把 X 和 Y 整合一下"),人类只有 5.1%。
- 更强的模型不一定更接近人类。GPT-OSS-120B 在机会轴上的 TVD 反而是 0.521(最差),因为它把 82.3% 的 ML 想法都压到 Bridge 上。
- 延长思考(thinking mode)反而让事情更糟。Qwen3-8B 打开 thinking 后,Bridge 占比从 49.7% 飙升到 71.1%,离人类更远了。
我的判断:这是一篇 用方法论发力 的论文。它没有发明新模型,但提出了 评估对齐性的尺子 ——这把尺子测出来的东西,让 AI Scientist 是不是真的能做科研这件事被打了一个大大的问号。对做 RAG、agent、AI4Science 的同行来说, 值得读两遍 。
论文基本信息
| 字段 | 内容 |
|---|---|
| 标题 | Measuring the Gap Between Human and LLM Research Ideas |
| 作者 | Ziyu Chen, Yilun Zhao, Arman Cohan |
| 机构 | Yale University / University of Chicago |
| 链接 | https://arxiv.org/abs/2607.01233 |
| 提交日期 | 2026-07-01 |
| 主题 | Computation and Language (cs.CL); Artificial Intelligence (cs.AI) |
| 代码 | TasteGap, IdeaLand/IdeaSeed |
为什么需要这篇论文?评估 LLM 的 idea 能力,难在哪?
LLM 用来"想 idea"这件事,已经从 PPT 概念变成了真金白银的工程实践:Boiko 2023 那套做化学合成的 AI Scientist,Lu 2024 的 The AI Scientist V1/V2,加上近一年冒出来的诸多全自动科研 agent。每个人都在卖一个故事:让 LLM 帮你"想 idea"。
但既有评估方法有点别扭:让 LLM 生成 10 个 idea,找几个 expert 打个分——这是个逐个评估视角,单个 idea 可能看起来都挺好。问题在于:评估一个 LLM 的"想法能力",跟评估一把枪的精度有点像——不能只测它打中靶心的那一发,要测它打 1000 发时的整体散布。
Chen et al. 把这个直觉给方法论化了,提出两个核心观点:
- idea 评估应该是分布问题。评估对象不是"这一个 idea 行不行",而是"这个系统在很多 comparable 上下文里整体偏向哪种 gap framing、哪种 contribution strategy"。
- 评估设置必须 grounded。如果让 LLM 自由想"给我一个关于 X 的 idea",不同模型的差异会被通用模板淹没。必须让所有模型在同一个文献上下文里做 idea。
这个视角其实在 NLP 里不陌生——LLM-judge 的偏差、social simulation 的 demographic misalignment、ChatGPT 文本的 token-rank 统计指纹——都证明了"人类 vs LLM"是一类问题,不是个例问题。Chen et al. 把这把尺子搬到了"idea 维度"上。
方法核心:逆向工程 + 两轴分类法
整个框架的 pipeline 长这样:

图1:研究品味差距分析 pipeline。先从已发表论文里反推出"启发它核心 idea 的若干前作",再让 LLM 基于这些前作生成新 idea。人类 idea 来自真实论文,LLM idea 来自同一文献上下文。最后用两轴分类法对两种 idea 进行标注,比较分布差异。
3.1 任务定义:literature-grounded ideation
每个 instance = 一组前作论文(4–8 篇,标题+摘要)+ 一个新 idea(motivation + method 两段)。
这跟"open-ended 给我一个关于 X 的 idea"不同。前作已经给定,idea 必须在这些前作的 gap 之上构造。这就排除了"主题选择"和"通用论文模板"的干扰——大家都在同一组 prior works 之上玩,看你选什么 gap、用什么方法论。
3.2 数据:11,683 条人类 idea 怎么来的?
第一步:找"人类 idea 端点"。从两个高质量来源选论文: - ML 顶会:ICLR / ICML / NeurIPS,2023–2026,5,994 篇 - Nature Communications,2023–2025,5,689 篇
每篇真实论文 = 一个 "人类 idea"。
第二步:用 LLM 把人类 idea 写成结构化的 motivation + method。Prompt 问的是"创新点在哪、跟 prior work 怎么不同、key insight 是什么",然后重写成 proposal 风格。听起来有套娃嫌疑,但他们后面会用 Cohen's κ 做了人工 audit(标注者与 GPT-5.4-mini 一致性 0.84/0.81/0.93)。
第三步:逆向工程 prior works。基于提取出的人类 idea + 论文的 related work 段,反推 4–8 篇紧密相关的前作,只保留标题和摘要作为 LLM 的输入。
这一步是这个框架的精髓。它把"灵感来源"近似成了"如果回到这个 idea 之前,你会看到哪几篇 paper"。然后让 LLM 站在这个时间点上"想"——跟真实研究者当年的处境就一致了。
3.3 两轴 research-taste 分类法
这是我读这篇论文时最欣赏的部分——没去拍脑袋造分类法。
作者先去翻了 NSF、NIH、AHRQ、DARPA 的 proposal guidance 文档,提取出两套相对正交的关注点:
| 抽取来源 | 提取出的元素 | 对应到分类法 |
|---|---|---|
| DARPA Heilmeier | 当前实践的局限、方案新颖性、风险、成本、中期与终期检查 | 推动了 Scope limits、Risk/failure、Resource bottleneck、Evidence 类标签 |
| NIH Application | Specific Aims、假设驱动目标、问题、Significance、Innovation、Approach、严谨性 | 强化 motivation–method 拆解,引入 Explanation、Empirical、Robustness |
| NSF PAPPG | 目标与方法、推进知识的潜力、研究计划、成功指标、研究产出 | 推动了 Evidence、Artifact、Resource、Bridge/Synthesis、Scope |
| AHRQ | 缺口为何存在、证据不足、偏倚信息、PICO 元素 | 为"机会轴"提供 Evidence gap、Contradiction、Scope mismatch、Risk/bias 标签 |
从这些材料出发得到 11 个 opportunity 元素和 9 个 method 元素,在 150 篇 held-out 论文上反复校准(每个 idea 允许最多 2 个最近的标签 + 一个 other),最后合并去重、删掉领域特异表述,得到 7×7 的最终分类法:
| 维度 | 类别 | 含义 |
|---|---|---|
| 机会模式 Opportunity Pattern | Puzzle | 现有解释不充分、有未解之谜 |
| Explanation | 现象没被讲清楚,需要补一个机制/理论 | |
| Scope | 现有方法只在窄范围有效,要拓展边界 | |
| Evidence | 数据/证据不足,需要更多或更准的证据 | |
| Bridge | 几个独立文献/方法/证据流彼此脱节,需要连接 | |
| Failure/risk | 现有方案存在失败模式/风险未被发现 | |
| Resource | 受计算/数据/工具资源限制 | |
| 方法范式 Method Paradigm | Synthesis | 把多个已有想法整合/统一 |
| Scope ext. | 拓展到新领域/新设置 | |
| Robust. | 让已有方法更鲁棒/可复现 | |
| Formal | 形式化推导/理论分析 | |
| Empirical map | 经验性刻画、做实验测绘 | |
| Artifact | 构造一个工具/系统/数据集 | |
| Optimization | 优化一个已有的目标/方法 |
这套分类法的两个关键设计:
- 不要求互斥——一个 idea 可以同时是"Failure"+"Bridge"+"Artifact",标注时给出主+副两个标签 + 置信度 + 三个诊断分数(surface stitching、bottleneck specificity、boilerplate)。这种"soft label"的设计避免了"硬分类把人话压变形"的常见毛病。
- domain-general——从 4 个机构的 funding guidance 出发,刻意避开了 ML 特异术语,确保同一套标签能在 ML 和 Nature Communications 上都跑得动。
3.4 自动化标注:LLM 当法官
标注器是 GPT-5.4-mini。为了不被"LLM 评 LLM"质疑淹没,作者做了非常严的 human audit: - 让两个人类作者对 150 篇 held-out 论文做独立标注 - 跟 GPT-5.4-mini 的输出算 Cohen's κ - 三个标注维度(机会模式标签、方法范式标签、诊断分数)的 κ 分别是 0.84、0.81、0.93
0.81 在 ordinal label 上算是相当好的 agreement 了。这一段是审稿人最爱挑刺的地方,作者给挡回去了。
实验结果:分布差距是稳定且系统的
4.2 主结果:TVD、JSD、Entropy 三连
9 个模型(Claude-Sonnet-4.6、Gemini-3.1-Pro、GPT-OSS-20B/120B、GPT-5.4-mini、Qwen3-8B/32B、DeepSeek-V4-Flash/Pro)跑全量 11,683 个 idea,主结果如下表:
| Source | Opp. TVD ↓ | Opp. JSD ↓ | Opp. Ent. ↑ | Meth. TVD ↓ | Meth. JSD ↓ | Meth. Ent. ↑ |
|---|---|---|---|---|---|---|
| Human | — | — | 0.926 | — | — | 0.920 |
| Claude-Sonnet-4.6 | 0.351 | 0.130 | 0.737 | 0.211 | 0.070 | 0.879 |
| Gemini-3.1-Pro | 0.348 | 0.128 | 0.758 | 0.227 | 0.092 | 0.874 |
| GPT-OSS-20B | 0.456 | 0.218 | 0.598 | 0.378 | 0.158 | 0.723 |
| GPT-OSS-120B | 0.521 | 0.259 | 0.550 | 0.391 | 0.170 | 0.735 |
| GPT-5.4-mini | 0.512 | 0.243 | 0.568 | 0.339 | 0.119 | 0.814 |
| Qwen3-8B | 0.382 | 0.179 | 0.658 | 0.368 | 0.190 | 0.734 |
| Qwen3-32B | 0.417 | 0.191 | 0.640 | 0.364 | 0.183 | 0.745 |
| DeepSeek-V4-Flash | 0.400 | 0.167 | 0.683 | 0.246 | 0.086 | 0.845 |
| DeepSeek-V4-Pro | 0.436 | 0.208 | 0.642 | 0.258 | 0.108 | 0.828 |
表 1:人类与 LLM idea 的分布距离。TVD/JSD 越低、Entropy 越高越接近人类。粗体为最佳非人类得分。最强模型 vs 人类:TVD 仍然在 0.211(方法轴)和 0.348(机会轴)以上。
这张表读出几个事实:
- 没有任何一个模型接近人类分布。最接近的 Gemini-3.1-Pro 在机会轴上 TVD 还有 0.348——意味着要 1/3 的分布质量要"挪位置"才能变成人类分布。这不是 5% 的 fine-tuning 能解决的问题。
- 模型参数/能力越强 ≠ 越接近人类。GPT-OSS-120B(120B)反而比 GPT-OSS-20B 在两个轴上 TVD 都更差(0.521 vs 0.456)。一个直观解释:更大模型更"自信"地用某种套路做事。
- 方法轴比机会轴更接近人类。所有模型方法轴 Entropy 在 0.72–0.88 之间,机会轴只有 0.55–0.76。说明 LLM 在"为什么做"上更窄,在"怎么做"上稍微宽一点。
全标签分布:Bridge + Synthesis 占比
下面这张图把每个模型在 7 个类别上的占比都画出来了——桥+整合的偏向非常直观:

图 3:机会模式(上行)和方法范式(下行)在 9 个模型 + 人类上的全标签分布。机会模式上,人类的颜色是均匀的"彩虹色"(7 个类别都有可观占比),LLM 几乎被 Bridge(橙色)吃成了一片。方法范式上,Synthesis(深蓝)在 LLM 那里普遍占比 22%–38%,人类只有 5.1%。Qwen3-8B、DeepSeek-V4 系列是 Bridge 重灾区,Claude-Sonnet-4.6 相对最"克制"。
关键数据:
| 维度 | 类别 | 人类 | LLM 范围 |
|---|---|---|---|
| 机会模式 | Bridge | 12.1% | 47.1% – 64.2% |
| 方法范式 | Synthesis | 5.1% | 22.5% – 38.7% |
这些数字才是这篇论文最打脸的地方。LLM 在机会维度上把 4–6 成的想法都归到"我要把 A 和 B 接起来",方法维度上 1/4 到 1/3 都是"我要把 X 和 Y 整合一下"。这不是"偏好"两个字能糊弄过去的,这是模板化。
4.3 诊断分数:模板化的具体证据
光看分布还不够,Chen et al. 还让标注器给每条 idea 打三个诊断分数:
- Surface stitching:是否只是把 prior work 表面缝合(0–3 分,越低越好)
- Bottleneck specificity:是否点出精确的机制/瓶颈(0–3 分,越高越好)
- Boilerplate:通用套话程度(0–3 分,越低越好)
| Source | Surf. Score ↓ | Surf. Flag (%) ↓ | Bottleneck ↑ | Boilerplate ↓ |
|---|---|---|---|---|
| Human | 0.00 | 0.0 | 2.56 | 0.48 |
| Claude-Sonnet-4.6 | 0.02 | 0.1 | 2.60 | 0.37 |
| Gemini-3.1-Pro | 0.09 | 0.4 | 2.34 | 0.79 |
| GPT-OSS-20B | 0.09 | 1.1 | 2.07 | 0.97 |
| GPT-OSS-120B | 0.07 | 0.3 | 2.16 | 0.87 |
| GPT-5.4-mini | 0.02 | 0.1 | 2.21 | 0.75 |
| Qwen3-8B | 0.58 | 20.6 | 1.76 | 1.25 |
| Qwen3-32B | 0.44 | 13.7 | 1.87 | 1.15 |
| DeepSeek-V4-Flash | 0.10 | 1.2 | 2.12 | 0.92 |
| DeepSeek-V4-Pro | 0.04 | 0.2 | 2.34 | 0.69 |
表 3:诊断分数。粗体为最佳非人类得分。Qwen3-8B 的 Surface Flag 高达 20.6%——五分之一个想法被识别为"表面缝合"——是个相当扎眼的数字。Claude-Sonnet-4.6 在这三个指标上甚至略好于人类,但 Table 1 显示它的分布还是偏的,说明"具体质量"和"分布多样性"是两件事。
这段数据最让人玩味的是 Claude-Sonnet-4.6。它把 Surface score 做到 0.02、Bottleneck 做到 2.60(比人类还高)、Boilerplate 0.37(比人类还低),但 Table 1 里它的方法轴 TVD 还有 0.211。这说明"单点质量好"和"分布对齐人类"是两件事——你不能让 Claude 改改 prompt 就把分布拉平。
一个有趣的对比:Qwen3-8B 在 Surface Flag 上 20.6%,Qwen3-8B-Think 11.0%,Qwen3-32B 13.7%。Thinking 加持和更大参数都能让"表面缝合"减半,但都还远高于 Claude。这一定程度上解释了为什么 Claude 在 Table 1 看似表现不错——它的"水"掺得少。
4.4 Thinking mode 反而让分布更偏:反直觉但有说服力
这一段是全文最炸的发现。先看 Table 4:
| Setting | Bridge ↓ | Synthesis ↓ | Opp. TVD ↓ | Opp. Ent. ↑ | Meth. TVD ↓ | Meth. Ent. ↑ | Surface ↓ | Boilerplate ↓ |
|---|---|---|---|---|---|---|---|---|
| Qwen3-8B | 49.7 | 38.7 | 0.382 | 0.658 | 0.368 | 0.734 | 0.58 | 1.25 |
| + think | 71.1 (+21.4) | 52.2 (+13.5) | 0.590 (+.208) | 0.481 (-.177) | 0.472 (+.104) | 0.649 (-.085) | 0.45 (-.13) | 1.11 (-.14) |
| DeepSeek-V4-Flash | 52.2 | 22.5 | 0.400 | 0.683 | 0.246 | 0.845 | 0.10 | 0.92 |
| + think | 59.1 (+6.9) | 30.7 (+8.2) | 0.470 (+.070) | 0.620 (-.063) | 0.291 (+.045) | 0.823 (-.022) | 0.10 (+.00) | 0.89 (-.03) |
表 4:打开 thinking 模式前后对比。两个模型、两个轴,所有"离人类更近"的指标(Opp. Ent.、Meth. Ent.、Boilerplate)全部下降;所有"更偏"的指标(Bridge 占比、Synthesis 占比、TVD)全部上升。Surface 评分有改善(Qwen3-8B 从 0.58 降到 0.45),但这是"缝合做得更精致",不是"换了一种 gap framing"。
这个发现相当重要。过去一年行业默认"thinking = 推理 = 更好",但 Chen et al. 证明:在 idea 生成这个任务上,thinking 不会让分布变宽,只会让你最熟悉的"把 A 和 B 接起来"这个套路变得更精致。
我的解读:thinking mode 实质上等价于在采样前多算一个 inner loop 优化。它对"找最优解"类任务(数学、代码)有效,对"在解空间里漫游"类任务(idea generation)会让 LLM 更快收敛到自己的"最熟"模板。
机制分析:为什么 LLM 会模板化?
Chen et al. 没有停在"分布不一样"——他们想知道为什么。Figure 4 给出三个角度的机制解释:

图 4:机制分析三件套。A 操作算子占比:把每个 idea 抽象成一句 archetype(抽象掉领域细节、保留主谓宾),统计主谓动作的分布。模型严重集中在 integrate / unify / adapt / merge / design 这几个组合类动作上;人类高频出现 replace / decouple / formalize 这几个局部干预类动作。B 同篇相似度:给定同一篇输入论文,Qwen3-8B 和 DeepSeek-V4-Flash 生成的 idea 互相 cosine 相似度 0.83,比人类 vs 任一模型都高。C 核心概念富集:按 model-vs-human log-odds 排核心概念簇。模型偏好的概念(multi-omics、diffusion policy、multimodal、in-context learning、test-time adapt、quantization)都是高频技术 motif;人类偏好的(trajectories、ligands、tokenization、equivariance、entropy/MI)都是具体机制/表示簇。
A. 操作算子:模型是"整合机器",人类是"局部外科医生"
| 算子 | 人类占比 | 模型占比 | log-odds (model vs human) |
|---|---|---|---|
| integrate | 2.35% | 34.2% | +3.07 |
| unify | 1.9% | 8.2% | +1.52 |
| design | 0.3% | 1.5% | +1.50 |
| merge | — | — | +1.37 |
| adapt | — | — | +1.36 |
| replace | 9.13% | 0.92% | 负向 |
| decouple | 2.33% | 0.21% | 负向 |
| formalize | 高 | 低 | 负向 |
表:操作算子分布对比。integrate 在模型输出里出现 7994 次(34.2%),人类 idea 里只有 275 次(2.35%)——差了 14 倍。replace 和 decouple 这两个"局部手术"型操作,模型几乎从来不用。
我读到这段的时候笑了。这不就是"把 A 和 B 接起来"在算子层面的具象化吗。模型默认的 recipe 是:
"挑一个高频技术概念(比如 multi-omics、diffusion policy、in-context learning)→ 把它跟另一个相邻概念组合(integrate / unify / adapt)→ 完成。"
而人类的 recipe 是:
"找到现有方法里一个脆/混/不严谨的地方 → 把它替换掉(replace)/ 拆开(decouple)/ 形式化(formalize)。"
这两种 recipe 在"idea 是否合理"上可能都是 OK 的,但在分布上会差出整个谱系。
B. 同篇相似度:模型之间比模型-人类还像
| 配对 | 余弦相似度均值 |
|---|---|
| Qwen3-8B vs DeepSeek-V4-Flash | 0.8316 |
| Human vs DeepSeek-V4-Flash | 0.7829 |
| Human vs Qwen3-8B | 0.7242 |
不同家族的 LLM 在同一篇输入下生成的 idea,互相之间的相似度比任何一个跟人类 idea 的相似度都高。这说明 "LLM idea 池"内部高度同质,跟人类池基本不重叠。
这个实验设计很漂亮:如果你担心"是不是因为两个 LLM 共享训练数据所以这么像"——DeepSeek-V4 和 Qwen3 的训练数据不可能 100% 重叠,这种程度的同质性只能解释为"它们共享同一种生成 recipe"。
C. 核心概念:模型选"流行词",人类选"具体机制"
模型富集的概念(按 log-odds 排序): 1. multi-omics — log-odds +1.96(95% 是模型生成的) 2. diffusion policy — +1.61 3. multimodal generation — +1.34 4. in-context learning — +1.23 5. test-time adaptation / adaptive optimization — +1.19 6. quantization、multi-agent / LLM-agent、multimodal reasoning — +0.86 到 +0.95
人类富集的概念: 1. trajectories and tracking trajectories — -1.50 2. ligands and molecular interactions 3. tokenization and token importance 4. equivariance / inverse problems / Hamiltonian structure 5. entropy / mutual information 6. routing and prototypes, verification concepts (-0.75 到 -1.09)
这个对比非常说明问题。模型偏好的"多模态"、"in-context learning"、"test-time adapt"——这些都是 arxiv 标题高频词,是 token 频率表上的大数。人类偏好的"trajectories"、"ligands"、"equivariance"、"entropy/MI"——这些都是某个具体机制的名字,是论文里真正"动手改造"的对象。
顺便提一句:很多模型富集概念短语里就直接包含 integrate / combine / unify 三个动词——它们就是 integrate 这个 archetype 的"插槽"。这等于 Figure 4A 和 4C 互相印证:模型不只是喜欢 integrate 这个动作,它还专门挑那些"能和别的概念 integrate 的对象"。
思考:批判性几点
1. 评估是否公平?TVD 0.35 真的"差"吗?
要警惕一个偷懒的解释:"TVD 0.35 不就 35% 嘛,不算大。"TVD 是 0–1 的距离量,不是错误率。在 7 类的均匀分布上,0.35 已经意味着人类和模型在"哪个类别排第一"这种粗糙判断上就有结构性差异。真正在分布形状上贴合的,应该是 TVD 0.05–0.10 级别。
另一个值得提的细节:作者是拿人类真实论文做 reference 的(不是从 held-out 集重新抽人类 idea)。这意味着人类分布本身有 publication bias——能发出来的论文已经被"安全编辑"过一遍了。所以 0.35 的 TVD 可能还低估了真实差距。
2. "prompt 不影响结论"是不是有 cherry-pick 嫌疑?
作者在 Appendix E.3 跑了一个 prompt ablation:换了一种"宽松"的 prompt("你可以给一个 idea"),结论方向不变(Bridge 仍然是最大类)。我倾向相信这个 ablation,因为数字只动了 5%–10%,方向稳定。但说实话,只跑了 Qwen3-8B 和 DeepSeek-V4-Flash 两个模型,覆盖面偏窄。如果想堵住"换 prompt 就不一样了"的嘴,应该至少在 Claude 和 GPT 上也跑一遍。
3. "thinking 让分布更偏"这个发现,外推性如何?
这是我认为最需要 follow-up 的发现。两个模型就敢说"thinking 整体有害于 idea 多样性",样本量太小了。理论上: - 可能成立:thinking 模式相当于"对分布峰值采样",会放大已有偏好 - 可能不成立:不同 thinking 模式实现差异巨大(Claude 的 extended thinking vs OpenAI 的 o1 vs Qwen 的 native think),未必都加剧模板化 - 可能反过来:在某些任务上 thinking 反而扩宽了分布
Chen et al. 的数据没给出"thinking 在哪些模型上会扩宽"这种细致结论。这是一个非常值得 follow 的开放问题。
4. 一个被低估的副产物:diagnostic score 工具
Surface stitching / Bottleneck specificity / Boilerplate 这三个分数,在我看来是这篇论文最容易被忽略但最有落地价值的副产物。它们都是 ordinal 0–3 分,可以直接挂到 idea 生成的 reward model 上做"多样性正则项"——比如 RLAIF 训练时除了 quality reward,再加一个 diversity reward,针对 boilerplate 和 surface stitching 做负反馈。
如果有一天"AI Scientist 真的能发 paper"了,这种诊断分数应该被嵌进 idea ranking pipeline。
5. 跟同期工作的对比:不是新发现,是新测量
公平地说,本文没提出新模型、新算法。它给这个领域贡献的是一把尺子。同期类似思路的还有: - Si et al. 2025a:单 idea 的 novel/feasible 评分(人类标注 100+ NLP 研究者) - Baek et al. 2025 (ResearchAgent):迭代式生成,跟本文的"一次性生成"对照 - Ruan et al. 2026 / Guo et al. 2025a (IdeaBench 等):benchmark 视角的 idea 评估
Chen et al. 跟前人最大的不同是把"idea 是否合理"升级成"idea 池的形状"。这个 distributional view 跟 Bavaresco 2025 关于 LLM-as-judge 的发现形成了一个互文:当 LLM 充当评委时,倾向于把焦点放在"技术正确性"上而不是"新颖性"上——某种意义上 Bavaresco 发现的就是 Chen et al. 发现的现象的"评委侧"。
收尾:我的判断
这是 2026 年 AI4Science 评估方向的一篇标志性论文。不是因为它提了新方法,而是因为它第一次严肃地、有方法论地把"LLM 在做 idea"这件事的分布形状画了出来,而且画出来的图非常难看。
几个值得带走的洞察:
- 不要拿单点 LLM 评分当 idea 能力。一个 idea 打 8 分不代表这个模型"会想 idea"——要看它想 1000 个 idea 时的分布形状。
- Bridge + Synthesis 是当下 LLM 的"思维舒适区"。如果你做的是 agent / AI Scientist,要警惕自己产品的 idea 池子是不是掉进了这个坑——给评审看到的 10 个 idea 里如果 7 个是"把 X 和 Y 整合",那就是模板化。
- Thinking 模式不是万能药。在 idea generation 这种本质是"在解空间漫游"的任务上,thinking 可能会让你更快收敛到最熟悉的模板,反而伤害多样性。
- 未来工作的方向应该是"分布层面的对齐"——不是让 LLM 想出更"新"的 idea,而是让它在 gap framing 和 contribution strategy 上跟人类有形状上的匹配。
最后一句题外话:如果你是做投融资的,看到一家 AI Scientist 创业公司 demo 里 10 个 idea 几乎全是 "bridge X with Y"——这是个 red flag。
如果你也在做 RAG、agent、AI4Science,对"idea 评估"和"分布对齐"有想法,欢迎评论区聊聊。这篇论文的 taxonomy 和 diagnostic scores 看起来很容易改造成开源工具,可能是个不错的小项目。 — 完
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。