2026-06-26 · 🧠 模型← 本期
Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability
LLM 作为 agent 落地,核心动作之一就是调用外部工具:查数据库、调 API、跑代码、搜网页。近期的工具使用基准(tool-use benchmark)确实在不断进化,任务越设越复杂、链条越拉越长。但这篇论文指出它们共享一个不切实际的默认前提——假设工具环境是干净、稳定、可信的:你调用工具,它就乖乖按预期返回正确结果。
现实完全不是这样。生产环境里的工具会超时、会限流、会返回格式错乱的脏数据、会偶发性报错、甚至会返回看似正常实则错误的结果。一个真正可靠的 agent,关键能力之一恰恰是在工具不靠谱时怎么办——是重试、是换路径、是优雅降级并如实告知,还是把脏数据当真往下传、最终给出错误答案。而现有基准因为默认工具完美,根本测不到这一层。
这篇的贡献就是把'工具环境不可靠'(tool-environment unreliability)这个维度系统化地补进评测里,构建了一个新基准,在工具会失败、会不稳定的设定下去压测工具使用 agent,从而衡量它们在逆境下的真实韧性,而不只是在理想环境里的任务完成率。
为什么值得关注:'function calling 能跑通'和'function calling 在生产里可靠'之间,隔着的恰恰是这层不可靠性。很多在干净基准上分数漂亮的 agent,一旦遇到真实世界里工具的各种抽风,表现可能断崖式下跌——而这部分风险此前一直缺乏标准化的衡量手段。这篇把这个盲区变成了可测量的指标。
影响层面,对做 agent 框架、function calling、生产环境工具集成的人,这提供了一把更贴近现实的尺子:与其只看 agent 在理想条件下能完成多复杂的任务,不如同时看它在工具不可靠时是稳健还是脆弱。这对评估一个 agent 能不能真正上生产,是更相关的指标。
局限要标注:'不可靠'有很多种形态——超时、错误返回、脏数据、间歇性故障各不相同,这个基准具体覆盖了哪些失败模式、模拟得有多真实,决定了它的代表性,需要看完整论文。基准给出的结论也依赖于所测模型和工具集,迁移到自有场景时仍需自行验证。