K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

arXiv:2608.183032026-08-20

让AI裁判在挑选两个回答哪个更好时,把判断依据一条条摆出来

现在常用的做法是让另一个AI大模型当裁判,在两个回答A和B之间只选一个更好的,但这样完全看不出裁判为什么这么选,也分不清是裁判判错了还是这个案例本身就很模糊。SESSE从裁判自己以往判断出错的案例中自动提炼出具体的评价子问题,把它们归类打包成一套可复用的问题库,评估时让裁判对每个相关问题投A/B/不适用票,既给出最终结论又留下逐条可查的依据,全程不需要额外训练。在RewardBench基准测试中,SESSE的准确率和常规的思维链裁判方式基本持平,还接近一个经过专门训练的裁判模型,但完全不需要训练过程。

METAL MEDIA 解读图

让AI裁判在挑选两个回答哪个更好时,把判断依据一条条摆出来

  1. 01常见的AI裁判评估方式只给出A或B一个笼统选择,无法看出是哪个质量维度促成了这个判断,也无法区分是裁判出错还是案例本身存在真实的模糊性。
  2. 02SESSE先收集裁判模型在验证数据集上判断错误的案例,从这些错误中自动生成具体的评价子问题,再把相近的问题聚成25个类别,形成一套可反复使用的问题库。
  3. 03实际评估时只挑选与当前样本相关的类别,让裁判对每个类别投A/B/不适用票,所有类别投票的多数结果即为最终判断,票数相等则判定为平局并不计入准确率。
  4. 04在包含1000个样本的RewardBench验证集上,搭配Gemini 2.5 Flash的SESSE达到93.3%准确率,与普通思维链裁判方式相比没有统计学上的显著差异,也接近经过专门微调训练的裁判模型RISE-Judge-32B(92.7%)。
  5. 05能力较弱的裁判模型(Qwen2-VL-7B)与基准方法的差距在统计上更显著;而平局比例(该模型21.3% 对比 Gemini系列的2.6%到3.5%)可以在不需要标准答案的情况下,提前预警裁判模型可靠性不足。
这是 METAL MEDIA 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 常见的AI裁判评估方式只给出A或B一个笼统选择,无法看出是哪个质量维度促成了这个判断,也无法区分是裁判出错还是案例本身存在真实的模糊性。
  2. SESSE先收集裁判模型在验证数据集上判断错误的案例,从这些错误中自动生成具体的评价子问题,再把相近的问题聚成25个类别,形成一套可反复使用的问题库。
  3. 实际评估时只挑选与当前样本相关的类别,让裁判对每个类别投A/B/不适用票,所有类别投票的多数结果即为最终判断,票数相等则判定为平局并不计入准确率。
  4. 在包含1000个样本的RewardBench验证集上,搭配Gemini 2.5 Flash的SESSE达到93.3%准确率,与普通思维链裁判方式相比没有统计学上的显著差异,也接近经过专门微调训练的裁判模型RISE-Judge-32B(92.7%)。
  5. 能力较弱的裁判模型(Qwen2-VL-7B)与基准方法的差距在统计上更显著;而平局比例(该模型21.3% 对比 Gemini系列的2.6%到3.5%)可以在不需要标准答案的情况下,提前预警裁判模型可靠性不足。
Table 1: RewardBench val (n=1,000), dev-optimal n∗. ‡p<0.05 McNemar (non-tie subset). †SFT+DPO.
SystemHolisticSESSETie%
non-tietienon-tie
Qwen2-VL-7B0.6980.6670.663‡21.3%
Flash Lite0.8800.6790.820‡2.6%
Gemini 2.5 Flash0.9450.6950.9333.5%
RISE-Judge (32B)† 180.927
Table A.1: Accuracy (excl. ties) vs. n (self-generated banks; bold = n∗).
nQwen2-VL-7BGemini 2.5 FlashFlash Lite
10.6260.9230.790
20.6480.9330.804
30.6630.9270.801
50.6440.9320.820
70.6450.9290.817
100.6430.9300.819
Table B.1: Qwen2-VL-7B with Gemini-generated vs. self-generated bank (val).
ConfigkeffSESSE acc (n=10)SESSE (n∗)
Qwen self-generated80.6400.663 (n∗=3)
Qwen+Gemini bank140.6370.663 (n∗=2)
Table C.1: Degradation bucket distribution. C1 = genuine ambiguity (high vote entropy); C2 = decomposition failure (SESSE consistently wrong ≥65% non-NA votes against label); C3 = semantic equivalence (high NA rate, responses too similar to discriminate). Percentages of degradation rows per config.
ConfigJudgeBankDegradation (% val)C1 (Ambiguous)C2 (Decomposition)C3 (Semantic equiv.)
Flash LiteFlash Liteself-generated105 (10.5%)49%26%26%
Gemini 2.5 FlashGemini 2.5 Flashself-generated48 (4.8%)29%23%48%

为什么重要

能够看清AI裁判做出判断所依据的具体条目,使用者就可以发现基准数据集中的标注错误,以及裁判模型自身的偏差,而不是盲目相信一个不透明的单一评分。由于整个流程不需要额外训练,这种可解释性可以以几乎零训练成本叠加在现有的AI裁判系统之上。

本文术语

  • LLM-as-judge · 让大语言模型代替人工来评判另一个AI输出质量的做法
  • 思维链(Chain-of-thought, CoT) · 让模型在给出最终答案前先写出一步步推理过程的提示技巧
  • RewardBench · 一个用于测试AI回答对比判断准确率的基准数据集
  • 不适用(NA)投票 · 当某个评价标准不适用于当前样本时,裁判可以选择的选项
  • McNemar检验 · 一种只对比两种方法判断结果不一致的样本,以判断差异是否具有统计学意义的检验方法

无法转载的图表

  • Figure 1: SESSE replaces holistic judgment with structured decomposition — criteria emerge automatically from the judge’s own error cases, producing per-criterion vote evidence.
  • Figure 2: SESSE pipeline: offline bank construction (Stages 0–4, once) and online per-example inference (Stage 5).
在原文中查看图表 →

论文原文摘要(英文)

LLM-as-judge evaluation reduces response quality assessment to a single holistic A/B preference choice, providing no mechanism to isolate which quality dimensions drove the preference or distinguish model errors from genuine label ambiguity. We propose SESSE (Sketch, Expand, Sort, Summarize, Evaluate), a training-free framework that decomposes holistic judgment into structured sub-questions mined directly from the judge's own error cases; requiring no oracle responses, task-specific rubrics, or fine-tuning. On RewardBench (n=1,000), SESSE achieves near-parity with the chain-of-thought baseline and is competitive with RISE-Judge-32B (92.7%), a fine-tuned specialist, while remaining fully training-free. Per-criterion vote evidence provides an interpretable audit trail for diagnosing label ambiguity and judge failure modes unavailable from a single holistic output token.

作者 · Dae Lee, Mihai Delgeanu, Adel Youssef

在 arXiv 阅读

最新论文

全部论文 →

METAL MEDIA 最新报道