Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

如果你在做 agent 系统,多半绕不开一个问题:怎么大规模地评测它。一条多步轨迹要让人逐步看哪步对、哪步错,在主流 agentic 基准上往往要花几个小时,根本没法 scale 到衡量性能或筛训练数据的量级。于是 LLM-as-a-judge(用一个语言模型去批评另一个 agent 的输出)成了普遍做法——既在最终结果层面打分,也在过程层面逐步挑错。问题是,这些自动批评本身的"靠谱程度"通常没被测过:评判者说某一步错了,它是真错、还是位置蒙对了但理由是错的、抑或是误报?这正是 Counsel 想填的空。 Counsel 把自己定位为首个面向 agentic 任务的元评测(meta-evaluation)公开数据集。所谓元评测,就是不直接评 agent,而是去评"评判者"——衡量自动批评相对人类判断有多准。它选了两个有代表性的 agent 基准:tau-bench,对应客服类 agent;DA-Code,对应编码类 agent。这两类任务一个偏对话与流程合规,一个偏代码正确性,覆盖了 agent 评测里两条很不一样的轨道。 数据构成上,Counsel 先收集开源(open-weight)LLM 评判模型在这两个基准上产出的过程级批评(process-level critiques),也就是评判者针对轨迹里一步步操作给出的挑错意见;再叠加一层人类对这些批评的元评测。注意它特意用的是开源评判模型,而不是把评判者锁死在某个闭源黑箱里——这让批评本身可被检视、可被复现,也契合"先把评判者本身搞清楚"的研究意图。 人类标注的设计是这套数据集的核心。对于评判者标出的每一处错误,标注者要把它归入三类:spot on(命中,确实是错且指对了)、correct location but poor reasoning(位置对但理由差,错对了地方但解释站不住)、should not have flagged(根本不该标,属于误报)。这个三分法很关键,因为它把"评判准不准"拆成了两个独立的维度——错误位置是否找对,以及给出的理由是否成立。一个评判者可能凑巧标在了出错的步骤上,但解释完全是错的;只看"标没标对位置"会高估它的可靠性,Counsel 的分类正好把这种"蒙对位置、理由稀烂"的情况单独拎出来。 数据集的质量由标注一致性背书:标注者之间达到 Krippendorff's alpha 0.78。Krippendorff's alpha 是衡量多名标注者判断一致程度的统计量,0.78 通常被视为可靠区间,意味着这套三分类标准不是各人各判,而是足够清晰、可重复。基于这些标签,Counsel 进一步把 LLM 评判的批评按"与人类对齐程度"分层——既看错误在轨迹中的位置对齐,也看理由是否对齐(原文摘要在此处截断,未给出更细的分层统计数字)。 对从业者意味着什么:如果你正用 LLM-as-a-judge 来跑 agent 评测、或用它的批评去筛选 / 标注训练数据,那么"评判者本身有多准"直接决定了你下游结论和数据质量的可信度。Counsel 提供的是一把带人类标签的尺子,可以用来校准自动评判、定位它在哪类错误上爱误报或爱给烂理由,从而避免把不可靠的自动批评当成可靠 ground truth。 诚实的局限:这是一份元评测数据集而非新方法,它本身不提升任何 agent 的能力,价值在于"让评判更可被衡量"。覆盖面目前是 tau-bench 与 DA-Code 两个基准、过程级批评、开源评判模型这一组合,能否外推到其他任务域、其他评判模型仍需看后续验证。除标注一致性 alpha 0.78 外,原文给出的 summary 在分层细节处截断,更具体的对齐分布、各评判模型表现等量化结果原文未在此给出。
相关