人工智能
IDEAgent使研究构思生成效率提升3.89倍
IDEAgent利用谱系、多目标反馈和序列记忆来平衡LLM生成的研究构思的质量与多样性。在8个计算机科学领域的32个主题上测试,其Yield(超过质量阈值的多样化构思)是先前方法的3.89倍。

大型语言模型在过去几年已经实现了科学发现的大部分自动化。它们可以扫描论文、提出假设,甚至起草实验。但有一个问题反复出现:它们产生的想法要么相互重复,要么过于不成熟而无法继续。大多数系统要么优化质量要么优化多样性,从未同时兼顾两者。
来自德克萨斯大学奥斯汀分校和新加坡科技设计大学研究人员的一篇新论文认为,将构思视为单目标优化是错误的框架。他们提出了一种质量-多样性(QD)搜索,并构建了一个名为IDEAgent的多智能体框架来运行它。
IDEAgent并非孤立地产生想法。它通过谱系来进化它们,专门的智能体根据多目标反馈处理修复和完善,这涵盖了质量方面。对于多样性,系统维护一个轻量级的序列记忆,包含已完成的想法、它们的祖先,甚至被拒绝的提议,并将每个新想法与该历史进行比较。目的是在不牺牲合理性的情况下强制新颖性。
“现有系统要么为质量要么为多样性独立生成和优化想法,”作者写道。
为了衡量这种联合优化的效果,团队创建了一个新指标称为Yield:相互多样且都通过预定质量阈值的最大想法集的大小。Yield用一个数字表示一个目标,之前需要用单独的质量和多样性分数来跟踪。
结果很明显。在涵盖计算机科学8个子领域的32个主题上,IDEAgent在Yield上比最佳基线高出3.89倍。更具说服力的是:它在8倍于竞争者的主题上实现了非零Yield,意味着许多以前没有返回任何价值的主题现在产生了一套可用的想法。
| 指标 | 最佳基线 | IDEAgent | 提升 |
|---|---|---|---|
| Yield分数(平均) | 0.18 | 0.70 | 3.89倍 |
| Yield > 0的主题数 | 2 | 16 | 8倍 |
作者将改进归功于修复和完善循环,该循环构建了逻辑严谨性和清晰度,同时保持想法的非显而易见性。他们指出,大部分多样性增益来自于与历史祖先和被拒绝提案的比较,这是一种廉价技巧,阻止系统围绕相同的老套想法打转。
这篇论文揭示了一个如果你只看基准数字很容易忽略的张力。一个高质量生成流程可以产生在纸面上看起来很严谨但聚集在相同起点的想法。一个最大化多样性的流程可以产生广泛分布但大部分是无用的想法。IDEAgent表明,当你将过程重新定义为在质量-多样性景观上的搜索而不是单个最佳答案时,这两个目标并不冲突。
这种景观方法是否适用于更难的领域,如生物学、硬件、数学,仍有待观察。当前评估仅涵盖计算机科学。但LLM系统应该记住它已经想过什么并明确避免重复的想法是可移植的。
IDEAgent在GitHub上开源,地址为github.com/declare-lab/IDEAgent。作者鼓励其他团队在QD搜索框架基础上进行构思,这表明他们认为这是一个基础,而不是成品。考虑到Yield数字,这是一个值得关注的基础。
- 来源 : Research idea generation gets 3.89x better with IDEAgent — 2026-07-24
每天早晨用 3 分钟掌握科技要闻
每个工作日一封邮件,只讲真正重要的 AI 与科技动态。