当 LLM 在做"研究想法"时,它到底在干嘛?

一篇论文用 1.1 万条人类论文逆推出"灵感上下文",让 9 个 LLM 在同一跑道上做 idea 生成。 结果发现,LLM 不是"想法不够新",而是在用一种套路反复做事。


核心摘要

这篇来自 Yale 的论文(Ziyu Chen, Yilun Zhao, Arman Cohan)想回答一个朴素但一直没被认真问过的问题:现在的 LLM 生成的研究 idea,跟人类研究者想出来的 idea,到底差在哪、差多远?

以往评估 LLM 的"idea 能力",大多是给几个 idea 打 novelty、feasibility、impact 之类的分,这是"逐个看"的视角。这篇论文换了个角度:把视角拉到"分布"上——看 LLM 在大量 idea 上的统计分布形状。

做法是逆向工程。他们从 11,683 篇高质量人类论文(ML 顶会 2023–2026 + Nature Communications 2023–2025)出发,用 LLM 反推出"启发了这篇论文的若干前作",再让待测的 LLM 看着同一批前作的标题摘要,生成新的 idea。人类 idea 就是真实论文里那个 idea,LLM idea 就是基于"重建的局部上下文"生成的那个。

然后作者引入了一个两轴 research-taste 分类法:第一个轴是"机会模式"(你为什么要做这件事,能拆成 Puzzle、Explanation、Bridge、Failure/risk 等 7 类),第二个轴是"方法范式"(你打算怎么做这件事,能拆成 Synthesis、Artifact、Optimization 等 7 类)。

跑完 9 个主流 LLM 之后,结论相当尖锐:

  • 人类 idea 分布很广,两个轴的归一化熵都超过 0.92。
  • LLM idea 分布窄得多,机会模式轴上 47.1%–64.2% 都集中在 "Bridge"("我要把 A 和 B 接起来"),人类只有 12.1%。方法范式轴上 22.5%–38.7% 集中在 Synthesis("我要把 X 和 Y 整合一下"),人类只有 5.1%。
  • 更强的模型不一定更接近人类。GPT-OSS-120B 在机会轴上的 TVD 反而是 0.521(最差),因为它把 82.3% 的 ML 想法都压到 Bridge 上。
  • 延长思考(thinking mode)反而让事情更糟。Qwen3-8B 打开 thinking 后,Bridge 占比从 49.7% 飙升到 71.1%,离人类更远了。

我的判断:这是一篇 用方法论发力 的论文。它没有发明新模型,但提出了 评估对齐性的尺子 ——这把尺子测出来的东西,让 AI Scientist 是不是真的能做科研这件事被打了一个大大的问号。对做 RAG、agent、AI4Science 的同行来说, 值得读两遍 。


论文基本信息

字段 内容
标题 Measuring the Gap Between Human and LLM Research Ideas
作者 Ziyu Chen, Yilun Zhao, Arman Cohan
机构 Yale University / University of Chicago
链接 https://arxiv.org/abs/2607.01233
提交日期 2026-07-01
主题 Computation and Language (cs.CL); Artificial Intelligence (cs.AI)
代码 TasteGap, IdeaLand/IdeaSeed

为什么需要这篇论文?评估 LLM 的 idea 能力,难在哪?

LLM 用来"想 idea"这件事,已经从 PPT 概念变成了真金白银的工程实践:Boiko 2023 那套做化学合成的 AI Scientist,Lu 2024 的 The AI Scientist V1/V2,加上近一年冒出来的诸多全自动科研 agent。每个人都在卖一个故事:让 LLM 帮你"想 idea"。

但既有评估方法有点别扭:让 LLM 生成 10 个 idea,找几个 expert 打个分——这是个逐个评估视角,单个 idea 可能看起来都挺好。问题在于:评估一个 LLM 的"想法能力",跟评估一把枪的精度有点像——不能只测它打中靶心的那一发,要测它打 1000 发时的整体散布。

Chen et al. 把这个直觉给方法论化了,提出两个核心观点:

  1. idea 评估应该是分布问题。评估对象不是"这一个 idea 行不行",而是"这个系统在很多 comparable 上下文里整体偏向哪种 gap framing、哪种 contribution strategy"。
  2. 评估设置必须 grounded。如果让 LLM 自由想"给我一个关于 X 的 idea",不同模型的差异会被通用模板淹没。必须让所有模型在同一个文献上下文里做 idea。

这个视角其实在 NLP 里不陌生——LLM-judge 的偏差、social simulation 的 demographic misalignment、ChatGPT 文本的 token-rank 统计指纹——都证明了"人类 vs LLM"是一类问题,不是个例问题。Chen et al. 把这把尺子搬到了"idea 维度"上。


方法核心:逆向工程 + 两轴分类法

整个框架的 pipeline 长这样:

Figure 1: 研究品味差距分析总览图

图1:研究品味差距分析 pipeline。先从已发表论文里反推出"启发它核心 idea 的若干前作",再让 LLM 基于这些前作生成新 idea。人类 idea 来自真实论文,LLM idea 来自同一文献上下文。最后用两轴分类法对两种 idea 进行标注,比较分布差异。

3.1 任务定义:literature-grounded ideation

每个 instance = 一组前作论文(4–8 篇,标题+摘要)+ 一个新 idea(motivation + method 两段)。

这跟"open-ended 给我一个关于 X 的 idea"不同。前作已经给定,idea 必须在这些前作的 gap 之上构造。这就排除了"主题选择"和"通用论文模板"的干扰——大家都在同一组 prior works 之上玩,看你选什么 gap、用什么方法论。

3.2 数据:11,683 条人类 idea 怎么来的?

第一步:找"人类 idea 端点"。从两个高质量来源选论文: - ML 顶会:ICLR / ICML / NeurIPS,2023–2026,5,994 篇 - Nature Communications,2023–2025,5,689 篇

每篇真实论文 = 一个 "人类 idea"。

第二步:用 LLM 把人类 idea 写成结构化的 motivation + method。Prompt 问的是"创新点在哪、跟 prior work 怎么不同、key insight 是什么",然后重写成 proposal 风格。听起来有套娃嫌疑,但他们后面会用 Cohen's κ 做了人工 audit(标注者与 GPT-5.4-mini 一致性 0.84/0.81/0.93)。

第三步:逆向工程 prior works。基于提取出的人类 idea + 论文的 related work 段,反推 4–8 篇紧密相关的前作,只保留标题和摘要作为 LLM 的输入。

这一步是这个框架的精髓。它把"灵感来源"近似成了"如果回到这个 idea 之前,你会看到哪几篇 paper"。然后让 LLM 站在这个时间点上"想"——跟真实研究者当年的处境就一致了。

3.3 两轴 research-taste 分类法

这是我读这篇论文时最欣赏的部分——没去拍脑袋造分类法。

作者先去翻了 NSF、NIH、AHRQ、DARPA 的 proposal guidance 文档,提取出两套相对正交的关注点:

抽取来源 提取出的元素 对应到分类法
DARPA Heilmeier 当前实践的局限、方案新颖性、风险、成本、中期与终期检查 推动了 Scope limits、Risk/failure、Resource bottleneck、Evidence 类标签
NIH Application Specific Aims、假设驱动目标、问题、Significance、Innovation、Approach、严谨性 强化 motivation–method 拆解,引入 Explanation、Empirical、Robustness
NSF PAPPG 目标与方法、推进知识的潜力、研究计划、成功指标、研究产出 推动了 Evidence、Artifact、Resource、Bridge/Synthesis、Scope
AHRQ 缺口为何存在、证据不足、偏倚信息、PICO 元素 为"机会轴"提供 Evidence gap、Contradiction、Scope mismatch、Risk/bias 标签

从这些材料出发得到 11 个 opportunity 元素和 9 个 method 元素,在 150 篇 held-out 论文上反复校准(每个 idea 允许最多 2 个最近的标签 + 一个 other),最后合并去重、删掉领域特异表述,得到 7×7 的最终分类法:

维度 类别 含义
机会模式 Opportunity Pattern Puzzle 现有解释不充分、有未解之谜
Explanation 现象没被讲清楚,需要补一个机制/理论
Scope 现有方法只在窄范围有效,要拓展边界
Evidence 数据/证据不足,需要更多或更准的证据
Bridge 几个独立文献/方法/证据流彼此脱节,需要连接
Failure/risk 现有方案存在失败模式/风险未被发现
Resource 受计算/数据/工具资源限制
方法范式 Method Paradigm Synthesis 把多个已有想法整合/统一
Scope ext. 拓展到新领域/新设置
Robust. 让已有方法更鲁棒/可复现
Formal 形式化推导/理论分析
Empirical map 经验性刻画、做实验测绘
Artifact 构造一个工具/系统/数据集
Optimization 优化一个已有的目标/方法

这套分类法的两个关键设计:

  1. 不要求互斥——一个 idea 可以同时是"Failure"+"Bridge"+"Artifact",标注时给出主+副两个标签 + 置信度 + 三个诊断分数(surface stitching、bottleneck specificity、boilerplate)。这种"soft label"的设计避免了"硬分类把人话压变形"的常见毛病。
  2. domain-general——从 4 个机构的 funding guidance 出发,刻意避开了 ML 特异术语,确保同一套标签能在 ML 和 Nature Communications 上都跑得动。

3.4 自动化标注:LLM 当法官

标注器是 GPT-5.4-mini。为了不被"LLM 评 LLM"质疑淹没,作者做了非常严的 human audit: - 让两个人类作者对 150 篇 held-out 论文做独立标注 - 跟 GPT-5.4-mini 的输出算 Cohen's κ - 三个标注维度(机会模式标签、方法范式标签、诊断分数)的 κ 分别是 0.84、0.81、0.93

0.81 在 ordinal label 上算是相当好的 agreement 了。这一段是审稿人最爱挑刺的地方,作者给挡回去了。


实验结果:分布差距是稳定且系统的

4.2 主结果:TVD、JSD、Entropy 三连

9 个模型(Claude-Sonnet-4.6、Gemini-3.1-Pro、GPT-OSS-20B/120B、GPT-5.4-mini、Qwen3-8B/32B、DeepSeek-V4-Flash/Pro)跑全量 11,683 个 idea,主结果如下表:

Source Opp. TVD ↓ Opp. JSD ↓ Opp. Ent. ↑ Meth. TVD ↓ Meth. JSD ↓ Meth. Ent. ↑
Human — — 0.926 — — 0.920
Claude-Sonnet-4.6 0.351 0.130 0.737 0.211 0.070 0.879
Gemini-3.1-Pro 0.348 0.128 0.758 0.227 0.092 0.874
GPT-OSS-20B 0.456 0.218 0.598 0.378 0.158 0.723
GPT-OSS-120B 0.521 0.259 0.550 0.391 0.170 0.735
GPT-5.4-mini 0.512 0.243 0.568 0.339 0.119 0.814
Qwen3-8B 0.382 0.179 0.658 0.368 0.190 0.734
Qwen3-32B 0.417 0.191 0.640 0.364 0.183 0.745
DeepSeek-V4-Flash 0.400 0.167 0.683 0.246 0.086 0.845
DeepSeek-V4-Pro 0.436 0.208 0.642 0.258 0.108 0.828

表 1:人类与 LLM idea 的分布距离。TVD/JSD 越低、Entropy 越高越接近人类。粗体为最佳非人类得分。最强模型 vs 人类:TVD 仍然在 0.211(方法轴)和 0.348(机会轴)以上。

这张表读出几个事实:

  1. 没有任何一个模型接近人类分布。最接近的 Gemini-3.1-Pro 在机会轴上 TVD 还有 0.348——意味着要 1/3 的分布质量要"挪位置"才能变成人类分布。这不是 5% 的 fine-tuning 能解决的问题。
  2. 模型参数/能力越强 ≠ 越接近人类。GPT-OSS-120B(120B)反而比 GPT-OSS-20B 在两个轴上 TVD 都更差(0.521 vs 0.456)。一个直观解释:更大模型更"自信"地用某种套路做事。
  3. 方法轴比机会轴更接近人类。所有模型方法轴 Entropy 在 0.72–0.88 之间,机会轴只有 0.55–0.76。说明 LLM 在"为什么做"上更窄,在"怎么做"上稍微宽一点。

全标签分布:Bridge + Synthesis 占比

下面这张图把每个模型在 7 个类别上的占比都画出来了——桥+整合的偏向非常直观:

Figure 3: 全标签分布

图 3:机会模式(上行)和方法范式(下行)在 9 个模型 + 人类上的全标签分布。机会模式上,人类的颜色是均匀的"彩虹色"(7 个类别都有可观占比),LLM 几乎被 Bridge(橙色)吃成了一片。方法范式上,Synthesis(深蓝)在 LLM 那里普遍占比 22%–38%,人类只有 5.1%。Qwen3-8B、DeepSeek-V4 系列是 Bridge 重灾区,Claude-Sonnet-4.6 相对最"克制"。

关键数据:

维度 类别 人类 LLM 范围
机会模式 Bridge 12.1% 47.1% – 64.2%
方法范式 Synthesis 5.1% 22.5% – 38.7%

这些数字才是这篇论文最打脸的地方。LLM 在机会维度上把 4–6 成的想法都归到"我要把 A 和 B 接起来",方法维度上 1/4 到 1/3 都是"我要把 X 和 Y 整合一下"。这不是"偏好"两个字能糊弄过去的,这是模板化。

4.3 诊断分数:模板化的具体证据

光看分布还不够,Chen et al. 还让标注器给每条 idea 打三个诊断分数:

  • Surface stitching:是否只是把 prior work 表面缝合(0–3 分,越低越好)
  • Bottleneck specificity:是否点出精确的机制/瓶颈(0–3 分,越高越好)
  • Boilerplate:通用套话程度(0–3 分,越低越好)
Source Surf. Score ↓ Surf. Flag (%) ↓ Bottleneck ↑ Boilerplate ↓
Human 0.00 0.0 2.56 0.48
Claude-Sonnet-4.6 0.02 0.1 2.60 0.37
Gemini-3.1-Pro 0.09 0.4 2.34 0.79
GPT-OSS-20B 0.09 1.1 2.07 0.97
GPT-OSS-120B 0.07 0.3 2.16 0.87
GPT-5.4-mini 0.02 0.1 2.21 0.75
Qwen3-8B 0.58 20.6 1.76 1.25
Qwen3-32B 0.44 13.7 1.87 1.15
DeepSeek-V4-Flash 0.10 1.2 2.12 0.92
DeepSeek-V4-Pro 0.04 0.2 2.34 0.69

表 3:诊断分数。粗体为最佳非人类得分。Qwen3-8B 的 Surface Flag 高达 20.6%——五分之一个想法被识别为"表面缝合"——是个相当扎眼的数字。Claude-Sonnet-4.6 在这三个指标上甚至略好于人类,但 Table 1 显示它的分布还是偏的,说明"具体质量"和"分布多样性"是两件事。

这段数据最让人玩味的是 Claude-Sonnet-4.6。它把 Surface score 做到 0.02、Bottleneck 做到 2.60(比人类还高)、Boilerplate 0.37(比人类还低),但 Table 1 里它的方法轴 TVD 还有 0.211。这说明"单点质量好"和"分布对齐人类"是两件事——你不能让 Claude 改改 prompt 就把分布拉平。

一个有趣的对比:Qwen3-8B 在 Surface Flag 上 20.6%,Qwen3-8B-Think 11.0%,Qwen3-32B 13.7%。Thinking 加持和更大参数都能让"表面缝合"减半,但都还远高于 Claude。这一定程度上解释了为什么 Claude 在 Table 1 看似表现不错——它的"水"掺得少。

4.4 Thinking mode 反而让分布更偏:反直觉但有说服力

这一段是全文最炸的发现。先看 Table 4:

Setting Bridge ↓ Synthesis ↓ Opp. TVD ↓ Opp. Ent. ↑ Meth. TVD ↓ Meth. Ent. ↑ Surface ↓ Boilerplate ↓
Qwen3-8B 49.7 38.7 0.382 0.658 0.368 0.734 0.58 1.25
+ think 71.1 (+21.4) 52.2 (+13.5) 0.590 (+.208) 0.481 (-.177) 0.472 (+.104) 0.649 (-.085) 0.45 (-.13) 1.11 (-.14)
DeepSeek-V4-Flash 52.2 22.5 0.400 0.683 0.246 0.845 0.10 0.92
+ think 59.1 (+6.9) 30.7 (+8.2) 0.470 (+.070) 0.620 (-.063) 0.291 (+.045) 0.823 (-.022) 0.10 (+.00) 0.89 (-.03)

表 4:打开 thinking 模式前后对比。两个模型、两个轴,所有"离人类更近"的指标(Opp. Ent.、Meth. Ent.、Boilerplate)全部下降;所有"更偏"的指标(Bridge 占比、Synthesis 占比、TVD)全部上升。Surface 评分有改善(Qwen3-8B 从 0.58 降到 0.45),但这是"缝合做得更精致",不是"换了一种 gap framing"。

这个发现相当重要。过去一年行业默认"thinking = 推理 = 更好",但 Chen et al. 证明:在 idea 生成这个任务上,thinking 不会让分布变宽,只会让你最熟悉的"把 A 和 B 接起来"这个套路变得更精致。

我的解读:thinking mode 实质上等价于在采样前多算一个 inner loop 优化。它对"找最优解"类任务(数学、代码)有效,对"在解空间里漫游"类任务(idea generation)会让 LLM 更快收敛到自己的"最熟"模板。


机制分析:为什么 LLM 会模板化?

Chen et al. 没有停在"分布不一样"——他们想知道为什么。Figure 4 给出三个角度的机制解释:

Figure 4: 机制分析三件套

图 4:机制分析三件套。A 操作算子占比:把每个 idea 抽象成一句 archetype(抽象掉领域细节、保留主谓宾),统计主谓动作的分布。模型严重集中在 integrate / unify / adapt / merge / design 这几个组合类动作上;人类高频出现 replace / decouple / formalize 这几个局部干预类动作。B 同篇相似度:给定同一篇输入论文,Qwen3-8B 和 DeepSeek-V4-Flash 生成的 idea 互相 cosine 相似度 0.83,比人类 vs 任一模型都高。C 核心概念富集:按 model-vs-human log-odds 排核心概念簇。模型偏好的概念(multi-omics、diffusion policy、multimodal、in-context learning、test-time adapt、quantization)都是高频技术 motif;人类偏好的(trajectories、ligands、tokenization、equivariance、entropy/MI)都是具体机制/表示簇。

A. 操作算子:模型是"整合机器",人类是"局部外科医生"

算子 人类占比 模型占比 log-odds (model vs human)
integrate 2.35% 34.2% +3.07
unify 1.9% 8.2% +1.52
design 0.3% 1.5% +1.50
merge — — +1.37
adapt — — +1.36
replace 9.13% 0.92% 负向
decouple 2.33% 0.21% 负向
formalize 高 低 负向

表:操作算子分布对比。integrate 在模型输出里出现 7994 次(34.2%),人类 idea 里只有 275 次(2.35%)——差了 14 倍。replace 和 decouple 这两个"局部手术"型操作,模型几乎从来不用。

我读到这段的时候笑了。这不就是"把 A 和 B 接起来"在算子层面的具象化吗。模型默认的 recipe 是:

"挑一个高频技术概念(比如 multi-omics、diffusion policy、in-context learning)→ 把它跟另一个相邻概念组合(integrate / unify / adapt)→ 完成。"

而人类的 recipe 是:

"找到现有方法里一个脆/混/不严谨的地方 → 把它替换掉(replace)/ 拆开(decouple)/ 形式化(formalize)。"

这两种 recipe 在"idea 是否合理"上可能都是 OK 的,但在分布上会差出整个谱系。

B. 同篇相似度:模型之间比模型-人类还像

配对 余弦相似度均值
Qwen3-8B vs DeepSeek-V4-Flash 0.8316
Human vs DeepSeek-V4-Flash 0.7829
Human vs Qwen3-8B 0.7242

不同家族的 LLM 在同一篇输入下生成的 idea,互相之间的相似度比任何一个跟人类 idea 的相似度都高。这说明 "LLM idea 池"内部高度同质,跟人类池基本不重叠。

这个实验设计很漂亮:如果你担心"是不是因为两个 LLM 共享训练数据所以这么像"——DeepSeek-V4 和 Qwen3 的训练数据不可能 100% 重叠,这种程度的同质性只能解释为"它们共享同一种生成 recipe"。

C. 核心概念:模型选"流行词",人类选"具体机制"

模型富集的概念(按 log-odds 排序): 1. multi-omics — log-odds +1.96(95% 是模型生成的) 2. diffusion policy — +1.61 3. multimodal generation — +1.34 4. in-context learning — +1.23 5. test-time adaptation / adaptive optimization — +1.19 6. quantization、multi-agent / LLM-agent、multimodal reasoning — +0.86 到 +0.95

人类富集的概念: 1. trajectories and tracking trajectories — -1.50 2. ligands and molecular interactions 3. tokenization and token importance 4. equivariance / inverse problems / Hamiltonian structure 5. entropy / mutual information 6. routing and prototypes, verification concepts (-0.75 到 -1.09)

这个对比非常说明问题。模型偏好的"多模态"、"in-context learning"、"test-time adapt"——这些都是 arxiv 标题高频词,是 token 频率表上的大数。人类偏好的"trajectories"、"ligands"、"equivariance"、"entropy/MI"——这些都是某个具体机制的名字,是论文里真正"动手改造"的对象。

顺便提一句:很多模型富集概念短语里就直接包含 integrate / combine / unify 三个动词——它们就是 integrate 这个 archetype 的"插槽"。这等于 Figure 4A 和 4C 互相印证:模型不只是喜欢 integrate 这个动作,它还专门挑那些"能和别的概念 integrate 的对象"。


思考:批判性几点

1. 评估是否公平?TVD 0.35 真的"差"吗?

要警惕一个偷懒的解释:"TVD 0.35 不就 35% 嘛,不算大。"TVD 是 0–1 的距离量,不是错误率。在 7 类的均匀分布上,0.35 已经意味着人类和模型在"哪个类别排第一"这种粗糙判断上就有结构性差异。真正在分布形状上贴合的,应该是 TVD 0.05–0.10 级别。

另一个值得提的细节:作者是拿人类真实论文做 reference 的(不是从 held-out 集重新抽人类 idea)。这意味着人类分布本身有 publication bias——能发出来的论文已经被"安全编辑"过一遍了。所以 0.35 的 TVD 可能还低估了真实差距。

2. "prompt 不影响结论"是不是有 cherry-pick 嫌疑?

作者在 Appendix E.3 跑了一个 prompt ablation:换了一种"宽松"的 prompt("你可以给一个 idea"),结论方向不变(Bridge 仍然是最大类)。我倾向相信这个 ablation,因为数字只动了 5%–10%,方向稳定。但说实话,只跑了 Qwen3-8B 和 DeepSeek-V4-Flash 两个模型,覆盖面偏窄。如果想堵住"换 prompt 就不一样了"的嘴,应该至少在 Claude 和 GPT 上也跑一遍。

3. "thinking 让分布更偏"这个发现,外推性如何?

这是我认为最需要 follow-up 的发现。两个模型就敢说"thinking 整体有害于 idea 多样性",样本量太小了。理论上: - 可能成立:thinking 模式相当于"对分布峰值采样",会放大已有偏好 - 可能不成立:不同 thinking 模式实现差异巨大(Claude 的 extended thinking vs OpenAI 的 o1 vs Qwen 的 native think),未必都加剧模板化 - 可能反过来:在某些任务上 thinking 反而扩宽了分布

Chen et al. 的数据没给出"thinking 在哪些模型上会扩宽"这种细致结论。这是一个非常值得 follow 的开放问题。

4. 一个被低估的副产物:diagnostic score 工具

Surface stitching / Bottleneck specificity / Boilerplate 这三个分数,在我看来是这篇论文最容易被忽略但最有落地价值的副产物。它们都是 ordinal 0–3 分,可以直接挂到 idea 生成的 reward model 上做"多样性正则项"——比如 RLAIF 训练时除了 quality reward,再加一个 diversity reward,针对 boilerplate 和 surface stitching 做负反馈。

如果有一天"AI Scientist 真的能发 paper"了,这种诊断分数应该被嵌进 idea ranking pipeline。

5. 跟同期工作的对比:不是新发现,是新测量

公平地说,本文没提出新模型、新算法。它给这个领域贡献的是一把尺子。同期类似思路的还有: - Si et al. 2025a:单 idea 的 novel/feasible 评分(人类标注 100+ NLP 研究者) - Baek et al. 2025 (ResearchAgent):迭代式生成,跟本文的"一次性生成"对照 - Ruan et al. 2026 / Guo et al. 2025a (IdeaBench 等):benchmark 视角的 idea 评估

Chen et al. 跟前人最大的不同是把"idea 是否合理"升级成"idea 池的形状"。这个 distributional view 跟 Bavaresco 2025 关于 LLM-as-judge 的发现形成了一个互文:当 LLM 充当评委时,倾向于把焦点放在"技术正确性"上而不是"新颖性"上——某种意义上 Bavaresco 发现的就是 Chen et al. 发现的现象的"评委侧"。


收尾:我的判断

这是 2026 年 AI4Science 评估方向的一篇标志性论文。不是因为它提了新方法,而是因为它第一次严肃地、有方法论地把"LLM 在做 idea"这件事的分布形状画了出来,而且画出来的图非常难看。

几个值得带走的洞察:

  1. 不要拿单点 LLM 评分当 idea 能力。一个 idea 打 8 分不代表这个模型"会想 idea"——要看它想 1000 个 idea 时的分布形状。
  2. Bridge + Synthesis 是当下 LLM 的"思维舒适区"。如果你做的是 agent / AI Scientist,要警惕自己产品的 idea 池子是不是掉进了这个坑——给评审看到的 10 个 idea 里如果 7 个是"把 X 和 Y 整合",那就是模板化。
  3. Thinking 模式不是万能药。在 idea generation 这种本质是"在解空间漫游"的任务上,thinking 可能会让你更快收敛到最熟悉的模板,反而伤害多样性。
  4. 未来工作的方向应该是"分布层面的对齐"——不是让 LLM 想出更"新"的 idea,而是让它在 gap framing 和 contribution strategy 上跟人类有形状上的匹配。

最后一句题外话:如果你是做投融资的,看到一家 AI Scientist 创业公司 demo 里 10 个 idea 几乎全是 "bridge X with Y"——这是个 red flag。


如果你也在做 RAG、agent、AI4Science,对"idea 评估"和"分布对齐"有想法,欢迎评论区聊聊。这篇论文的 taxonomy 和 diagnostic scores 看起来很容易改造成开源工具,可能是个不错的小项目。 — 完


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。