컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

AI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법

arXiv:2608.183032026-08-20

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

AI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법

요즘 AI 모델의 답변 품질을 평가할 때 다른 AI(LLM 심판)에게 A와 B 중 어느 게 나은지 하나만 고르게 하는 방식이 널리 쓰이는데, 이 방식은 왜 그런 판단을 내렸는지 알 방법이 없다. SESSE는 이 심판 모델이 틀렸던 사례들에서 자동으로 세부 평가 기준(질문)들을 뽑아내고, 그 기준별로 A/B/해당없음 투표를 받아 최종 판단과 함께 근거를 남기는 훈련 없는 방법이다. RewardBench 벤치마크에서 SESSE는 기존 방식과 비슷한 정확도를 내면서, 별도로 학습시킨 전문 평가 모델과도 맞먹는 성능을 훈련 과정 없이 달성했다.

METAL MEDIA 해설 도표

AI가 두 답변 중 뭐가 나은지 고를 때, 왜 그렇게 골랐는지 항목별로 보여주는 방법

  1. 01LLM 심판이 A/B 중 하나만 고르는 기존 방식은 어떤 이유로 그 답을 골랐는지, 모델이 틀린 건지 원래 애매한 문제인지 구분할 수 없다는 문제가 있다.
  2. 02SESSE는 심판 모델이 검증용 데이터셋에서 틀렸던 사례들을 모아, 그 사례에서 자동으로 세부 평가 질문들을 만들어내고 비슷한 질문끼리 25개 그룹으로 묶은 뒤 대표 질문 묶음(뱅크)을 만든다.
  3. 03실제 평가할 때는 관련 있는 그룹만 골라 A/B/해당없음으로 각각 투표시키고, 다수결로 최종 결과를 정하며 동점이면 판단을 보류한다.
  4. 041,000개 예시로 구성된 RewardBench 검증셋에서 Gemini 2.5 Flash 기준 SESSE는 93.3% 정확도를 기록해 기존 방식과 통계적으로 유의미한 차이가 없었고, 별도로 학습된 전문 평가 모델 RISE-Judge-32B(92.7%)와도 비슷한 수준이었다.
  5. 05심판 모델이 약할수록(Qwen2-VL-7B) 기존 방식과의 격차가 커졌고, 동점 비율이 높을수록(21.3% vs Gemini의 2.6~3.5%) 그 모델의 신뢰도가 떨어진다는 신호로 쓸 수 있었다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. LLM 심판이 A/B 중 하나만 고르는 기존 방식은 어떤 이유로 그 답을 골랐는지, 모델이 틀린 건지 원래 애매한 문제인지 구분할 수 없다는 문제가 있다.
  2. SESSE는 심판 모델이 검증용 데이터셋에서 틀렸던 사례들을 모아, 그 사례에서 자동으로 세부 평가 질문들을 만들어내고 비슷한 질문끼리 25개 그룹으로 묶은 뒤 대표 질문 묶음(뱅크)을 만든다.
  3. 실제 평가할 때는 관련 있는 그룹만 골라 A/B/해당없음으로 각각 투표시키고, 다수결로 최종 결과를 정하며 동점이면 판단을 보류한다.
  4. 1,000개 예시로 구성된 RewardBench 검증셋에서 Gemini 2.5 Flash 기준 SESSE는 93.3% 정확도를 기록해 기존 방식과 통계적으로 유의미한 차이가 없었고, 별도로 학습된 전문 평가 모델 RISE-Judge-32B(92.7%)와도 비슷한 수준이었다.
  5. 심판 모델이 약할수록(Qwen2-VL-7B) 기존 방식과의 격차가 커졌고, 동점 비율이 높을수록(21.3% vs Gemini의 2.6~3.5%) 그 모델의 신뢰도가 떨어진다는 신호로 쓸 수 있었다.
Table 1: RewardBench val (n=1,000), dev-optimal n∗. ‡p<0.05 McNemar (non-tie subset). †SFT+DPO.
SystemHolisticSESSETie%
non-tietienon-tie
Qwen2-VL-7B0.6980.6670.663‡21.3%
Flash Lite0.8800.6790.820‡2.6%
Gemini 2.5 Flash0.9450.6950.9333.5%
RISE-Judge (32B)† 180.927
Table A.1: Accuracy (excl. ties) vs. n (self-generated banks; bold = n∗).
nQwen2-VL-7BGemini 2.5 FlashFlash Lite
10.6260.9230.790
20.6480.9330.804
30.6630.9270.801
50.6440.9320.820
70.6450.9290.817
100.6430.9300.819
Table B.1: Qwen2-VL-7B with Gemini-generated vs. self-generated bank (val).
ConfigkeffSESSE acc (n=10)SESSE (n∗)
Qwen self-generated80.6400.663 (n∗=3)
Qwen+Gemini bank140.6370.663 (n∗=2)
Table C.1: Degradation bucket distribution. C1 = genuine ambiguity (high vote entropy); C2 = decomposition failure (SESSE consistently wrong ≥65% non-NA votes against label); C3 = semantic equivalence (high NA rate, responses too similar to discriminate). Percentages of degradation rows per config.
ConfigJudgeBankDegradation (% val)C1 (Ambiguous)C2 (Decomposition)C3 (Semantic equiv.)
Flash LiteFlash Liteself-generated105 (10.5%)49%26%26%
Gemini 2.5 FlashGemini 2.5 Flashself-generated48 (4.8%)29%23%48%

왜 중요한가

AI 평가 결과를 그냥 믿는 게 아니라 어떤 기준에서 왜 그런 판정이 나왔는지 확인할 수 있으면, 평가 데이터에 있는 라벨 오류나 심판 모델의 편향을 찾아내고 고칠 수 있다. 별도의 학습 과정 없이 기존 심판 모델에 적용 가능해서, AI 모델 품질 검증 파이프라인을 운영하는 실무자에게 비용 부담 없는 진단 도구가 될 수 있다.

이 논문의 용어

  • LLM-as-judge · 사람 대신 대형언어모델(LLM)에게 다른 AI의 답변 품질을 평가하게 하는 방식
  • Chain-of-thought(CoT) · 모델이 답을 내기 전에 단계별 추론 과정을 글로 풀어쓰게 하는 프롬프트 기법
  • RewardBench · AI 답변 두 개 중 어느 것이 더 나은지 평가하는 벤치마크 데이터셋
  • NA(Not Applicable) 투표 · 특정 평가 기준이 해당 사례에 적용되지 않을 때 심판이 선택하는 항목
  • McNemar 검정 · 두 방법의 정답 여부가 갈리는 경우만 놓고 통계적으로 유의미한 차이가 있는지 확인하는 검정법

본문에 싣지 못한 그림

  • Figure 1: SESSE replaces holistic judgment with structured decomposition — criteria emerge automatically from the judge’s own error cases, producing per-criterion vote evidence.
  • Figure 2: SESSE pipeline: offline bank construction (Stages 0–4, once) and online per-example inference (Stage 5).
원문에서 그림 보기 →

저자 · Dae Lee, Mihai Delgeanu, Adel Youssef

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사