AgenticBBO-Bench 跨五大领域基准测试 LLM 智能体黑盒优化能力
A Closer Look at Agentic BBO: Benchmarking LLM Agents for Black-Box Optimization
arXiv 预印本推出 AgenticBBO-Bench,在合成函数、超参数优化、数据库调优、芯片设计和分子设计五大领域统一有限预算评估智能体黑盒优化。
发生了什么
这是一篇未经同行评议的 arXiv 预印本,作者推出跨领域基准 AgenticBBO-Bench,把合成函数、超参数优化、数据库调优、芯片设计和分子设计放在统一的有限预算评估协议下比较。实验显示,智能体式 BBO 在全部五个领域上的家族平均分都高于直接用 LLM 的方法,并在其中四个领域超过最优数值优化器。作者还设了一个五任务前沿挑战,在 Codex 智能体框架下评测了七个 LLM,其中 GPT-6 Astra 和 DeepSeek-V4.1-Flash 位于性能与成本的帕累托前沿。
为什么重要
此前各家智能体 BBO 研究的任务领域和系统配置各不相同,结果难以横向比较、单个设计选择的影响剥离不出来,这个基准在统一预算下直接回答了智能体相对直接调 LLM 和传统数值优化器到底强多少。对搭分子优化管线的研发团队,三条经验直接影响系统设计:堆数值工具不一定涨分,任务语义普遍有用而更具体的先知先验反而不可靠,数值优化器还能接住智能体建立的搜索轨迹继续放大收益。对按成本选模型的工程团队,帕累托前沿给出了七个模型在性能与花费之间的取舍参照。
还缺什么
材料没有披露五个领域各自的具体任务、指标定义和分数差距,也没说被数值优化器反超的那一个领域是否就是分子设计,这直接关系到结论对制药场景的相关性,待确认。分子设计子集上智能体是否同样胜出、用了哪些分子任务和评价函数,需要读原文和 GitHub 代码。后续关注这篇预印本是否通过同行评议、版本是否更新,以及更多模型和方法在该基准前沿挑战上的成绩。
来源:AI × 生物医药 · arxiv.org