SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition
让AI裁判在挑选两个回答哪个更好时,把判断依据一条条摆出来
现在常用的做法是让另一个AI大模型当裁判,在两个回答A和B之间只选一个更好的,但这样完全看不出裁判为什么这么选,也分不清是裁判判错了还是这个案例本身就很模糊。SESSE从裁判自己以往判断出错的案例中自动提炼出具体的评价子问题,把它们归类打包成一套可复用的问题库,评估时让裁判对每个相关问题投A/B/不适用票,既给出最终结论又留下逐条可查的依据,全程不需要额外训练。在RewardBench基准测试中,SESSE的准确率和常规的思维链裁判方式基本持平,还接近一个经过专门训练的裁判模型,但完全不需要训练过程。
METAL MEDIA 解读图
让AI裁判在挑选两个回答哪个更好时,把判断依据一条条摆出来
- 01常见的AI裁判评估方式只给出A或B一个笼统选择,无法看出是哪个质量维度促成了这个判断,也无法区分是裁判出错还是案例本身存在真实的模糊性。
- 02SESSE先收集裁判模型在验证数据集上判断错误的案例,从这些错误中自动生成具体的评价子问题,再把相近的问题聚成25个类别,形成一套可反复使用的问题库。
- 03实际评估时只挑选与当前样本相关的类别,让裁判对每个类别投A/B/不适用票,所有类别投票的多数结果即为最终判断,票数相等则判定为平局并不计入准确率。
- 04在包含1000个样本的RewardBench验证集上,搭配Gemini 2.5 Flash的SESSE达到93.3%准确率,与普通思维链裁判方式相比没有统计学上的显著差异,也接近经过专门微调训练的裁判模型RISE-Judge-32B(92.7%)。
- 05能力较弱的裁判模型(Qwen2-VL-7B)与基准方法的差距在统计上更显著;而平局比例(该模型21.3% 对比 Gemini系列的2.6%到3.5%)可以在不需要标准答案的情况下,提前预警裁判模型可靠性不足。
他们做了什么
- 常见的AI裁判评估方式只给出A或B一个笼统选择,无法看出是哪个质量维度促成了这个判断,也无法区分是裁判出错还是案例本身存在真实的模糊性。
- SESSE先收集裁判模型在验证数据集上判断错误的案例,从这些错误中自动生成具体的评价子问题,再把相近的问题聚成25个类别,形成一套可反复使用的问题库。
- 实际评估时只挑选与当前样本相关的类别,让裁判对每个类别投A/B/不适用票,所有类别投票的多数结果即为最终判断,票数相等则判定为平局并不计入准确率。
- 在包含1000个样本的RewardBench验证集上,搭配Gemini 2.5 Flash的SESSE达到93.3%准确率,与普通思维链裁判方式相比没有统计学上的显著差异,也接近经过专门微调训练的裁判模型RISE-Judge-32B(92.7%)。
- 能力较弱的裁判模型(Qwen2-VL-7B)与基准方法的差距在统计上更显著;而平局比例(该模型21.3% 对比 Gemini系列的2.6%到3.5%)可以在不需要标准答案的情况下,提前预警裁判模型可靠性不足。
| System | Holistic | SESSE | Tie% | |
|---|---|---|---|---|
| non-tie | tie | non-tie | ||
| Qwen2-VL-7B | 0.698 | 0.667 | 0.663‡ | 21.3% |
| Flash Lite | 0.880 | 0.679 | 0.820‡ | 2.6% |
| Gemini 2.5 Flash | 0.945 | 0.695 | 0.933 | 3.5% |
| RISE-Judge (32B)† 18 | 0.927 | — |
| n | Qwen2-VL-7B | Gemini 2.5 Flash | Flash Lite |
|---|---|---|---|
| 1 | 0.626 | 0.923 | 0.790 |
| 2 | 0.648 | 0.933 | 0.804 |
| 3 | 0.663 | 0.927 | 0.801 |
| 5 | 0.644 | 0.932 | 0.820 |
| 7 | 0.645 | 0.929 | 0.817 |
| 10 | 0.643 | 0.930 | 0.819 |
| Config | keff | SESSE acc (n=10) | SESSE (n∗) |
|---|---|---|---|
| Qwen self-generated | 8 | 0.640 | 0.663 (n∗=3) |
| Qwen+Gemini bank | 14 | 0.637 | 0.663 (n∗=2) |
| Config | Judge | Bank | Degradation (% val) | C1 (Ambiguous) | C2 (Decomposition) | C3 (Semantic equiv.) |
|---|---|---|---|---|---|---|
| Flash Lite | Flash Lite | self-generated | 105 (10.5%) | 49% | 26% | 26% |
| Gemini 2.5 Flash | Gemini 2.5 Flash | self-generated | 48 (4.8%) | 29% | 23% | 48% |
为什么重要
能够看清AI裁判做出判断所依据的具体条目,使用者就可以发现基准数据集中的标注错误,以及裁判模型自身的偏差,而不是盲目相信一个不透明的单一评分。由于整个流程不需要额外训练,这种可解释性可以以几乎零训练成本叠加在现有的AI裁判系统之上。
本文术语
- LLM-as-judge · 让大语言模型代替人工来评判另一个AI输出质量的做法
- 思维链(Chain-of-thought, CoT) · 让模型在给出最终答案前先写出一步步推理过程的提示技巧
- RewardBench · 一个用于测试AI回答对比判断准确率的基准数据集
- 不适用(NA)投票 · 当某个评价标准不适用于当前样本时,裁判可以选择的选项
- McNemar检验 · 一种只对比两种方法判断结果不一致的样本,以判断差异是否具有统计学意义的检验方法
无法转载的图表
- Figure 1: SESSE replaces holistic judgment with structured decomposition — criteria emerge automatically from the judge’s own error cases, producing per-criterion vote evidence.
- Figure 2: SESSE pipeline: offline bank construction (Stages 0–4, once) and online per-example inference (Stage 5).
论文原文摘要(英文)
LLM-as-judge evaluation reduces response quality assessment to a single holistic A/B preference choice, providing no mechanism to isolate which quality dimensions drove the preference or distinguish model errors from genuine label ambiguity. We propose SESSE (Sketch, Expand, Sort, Summarize, Evaluate), a training-free framework that decomposes holistic judgment into structured sub-questions mined directly from the judge's own error cases; requiring no oracle responses, task-specific rubrics, or fine-tuning. On RewardBench (n=1,000), SESSE achieves near-parity with the chain-of-thought baseline and is competitive with RISE-Judge-32B (92.7%), a fine-tuned specialist, while remaining fully training-free. Per-criterion vote evidence provides an interpretable audit trail for diagnosing label ambiguity and judge failure modes unavailable from a single holistic output token.
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调