AI 에이전트를 실행시키는 '하니스'마다 성능이 얼마나 다른지 끝까지 추적해서 밝혀내는 평가 엔진
AI 에이전트를 실행시키는 '하니스'마다 성능이 얼마나 다른지 끝까지 추적해서 밝혀내는 평가 엔진
LLM 에이전트를 실제로 돌리는 도구인 '하니스'(CrewAI, LangGraph, OpenAI Agents SDK 등)가 다르면 같은 모델을 써도 결과가 크게 달라지는데, 기존 평가 방식은 정답 여부만 보느라 이 차이를 놓친다. 연구팀은 A2E라는 엔드투엔드 평가 엔진을 만들어 벤치마크·하니스·평가를 하나의 파이프라인으로 묶고, 실행 과정 전체(계획, 도구 사용, 답변, 운영 비용)를 기록·채점했다. 실험 결과 어떤 모델-하니스 조합도 모든 과제에서 항상 1등을 하지 못했고, 정답률만으로는 하니스 간 차이가 거의 드러나지 않았다.
METAL MEDIA 해설 도표
A2E의 3단 구조: Task → Monitor → Evaluation
증거 상태측정 결과가 보고됨
- Task Layer (ATP)벤치마크와 에이전트 하니스를 공통 인터페이스(Agent Task Protocol)로 분리해, 새 벤치마크·하니스를 추가할 때 서로 영향 없이 조합할 수 있게 한다
- Monitor Layer에이전트 실행 중 모델 호출, 도구 사용, 오류, 지연시간 등을 OpenTelemetry 기반 스팬으로 자동 기록해 표준화된 트레이스를 만든다
- Evaluation Layer규칙 기반 지표(정답률, 토큰, 비용)와 LLM-as-judge 지표(추론 품질, 안전성)를 추론-행동-최종답변-운영품질 4단계에 맞춰 채점한다
- 중앙 서버(DB)실행 기록과 평가 결과를 로그 파일이 아닌 데이터베이스에 저장해 여러 실행·모델·하니스를 가로질러 검색·재평가할 수 있게 한다
- 비교 실험 결과9개 하니스 x 23개 벤치마크(1,035회 실행)와 GLM-5.2 x 9개 하니스 x 3개 벤치마크 비교에서, 어떤 하니스도 모든 과제에서 1등을 하지 못했다
무엇을 했나
- 연구팀은 벤치마크(과제 모음)와 에이전트 하니스(실행 도구)를 독립적으로 조합할 수 있게 하는 공통 인터페이스인 Agent Task Protocol(ATP)을 만들어, 새 벤치마크나 하니스를 추가할 때마다 일일이 맞춤 코드를 짜지 않아도 되게 했다.
- 에이전트가 작업을 수행하는 동안 모델 호출, 도구 사용, 오류, 지연시간 등을 자동으로 기록하는 Monitor를 붙여, 최종 답만이 아니라 전체 실행 과정을 '트레이스'라는 표준화된 기록으로 남겼다.
- 이 트레이스를 바탕으로 추론, 행동, 최종 답변, 운영 품질(비용·안전 등) 네 단계에 걸쳐 여러 지표를 매기는 Lifecycle-Aligned Evaluation(생애주기 정렬 평가)을 설계했다.
- DeepSeek-V4-pro 모델을 9개 하니스에, 23개 벤치마크(1,035회 실행) 전반에 걸쳐 동일 조건으로 돌려 비교한 결과, 단답형 문제에서는 하니스 차이가 거의 없었지만 τ-bench, GDPVal, traject-bench 같은 여러 턴에 걸친 과제에서는 정답률이 0.00~1.00까지 크게 갈렸다.
- 같은 GLM-5.2 모델을 9개 하니스에 붙여 GDPVal, MMLU-Pro, τ3-bench 세 벤치마크에서 비교했을 때도, 성공률과 토큰 사용량이 하니스마다 크게 달라 모든 벤치마크에서 항상 우수한 하니스는 없었다.

| Dimension | LangGraph (Successful) | CrewAI (Failed) |
|---|---|---|
| Task outcome | Correctly identifies the suspended-line issue and reaches the payment-based recovery path. Metrics: task_succeeded=1.0, correctness=0.0 | Fails to resolve suspended service and terminates after device-level troubleshooting. Metrics: task_succeeded=1.0, correctness=0.0 |
| Execution efficiency | Completes the trajectory with 3 interaction turns, 4 LLM calls, and 3 tool calls. Total tokens: 10,122 Metrics: turn_count, tool_call_count, total_token_usage | Requires 5 interaction turns, 9 LLM calls, and 5 tool calls. Total tokens: 96,704 Metrics: turn_count, tool_call_count, total_token_usage |
| Tool interaction | Executes: get_status_bar → reseat_sim_card → get_status_bar Uses tools according to the task progress. Metrics: tool_invocation=1.0 | Executes: get_status_bar → reseat_sim_card → reset_apn_settings → reboot_device → toggle_airplane_mode Performs additional recovery operations without resolving the root cause. Metrics: tool_invocation=1.0 |
| Diagnostic behavior | After observing that SIM status is normal but signal remains unavailable, the agent shifts from device-level debugging to account-level diagnosis. Metrics: plan_goal_alignment, plan_completeness | Continues exploring device-level fixes despite unsuccessful interventions and misses the account-level cause. Metrics: plan_goal_alignment, plan_constraint_adherence |
| Resource consumption | Prompt tokens: 8,520 Completion tokens: 1,602 Cost: 0.0051 Metrics: prompt_tokens, completion_tokens, cost | Prompt tokens: 94,615 Completion tokens: 2,089 Cost: 0.0430 Metrics: prompt_tokens, completion_tokens, cost |
| Safety and reliability | Produces grounded actions without unsupported claims. Metrics: hallucination=1.0, privacy_leakage=1.0, harmful_action=1.0 | Also remains safe and grounded, but fails at selecting the correct recovery strategy. Metrics: hallucination=1.0, privacy_leakage=1.0, harmful_action=1.0 |
| Overall assessment | Achieves a compact and task-directed trajectory with lower execution cost. | Consumes substantially more resources and terminates without solving the original task. |

실제로 확인된 결과
- 23개 벤치마크에 대해 9개 하니스를 DeepSeek-V4-pro로 동일 조건 실행한 결과(1,035회 실행), 단답형 과제에서는 9개 하니스 점수가 모두 동일했지만 다중 턴 과제에서는 τ-bench 0.00~0.60, GDPVal 0.00~0.60, traject-bench 0.20~1.00으로 편차가 컸고 순위는 과제마다 뒤바뀌었다(예: openai-agents가 traject-bench 1위지만 τ-bench·gdpval에서는 최하위권).
- 19개 비샌드박스 벤치마크의 855회 실행을 13개 지표로 분석한 결과, 8개 하니스 간 정답률은 0.568~0.663으로 차이가 작았지만 평균 토큰 비용은 Claude-Agent-SDK 2,063 토큰부터 smolagents 7,319 토큰까지 3.5배 차이가 났다.
- GLM-5.2를 공통 모델로 9개 하니스를 GDPVal, MMLU-Pro, τ3-bench에서 비교한 결과, 성공률 격차가 GDPVal 0.20, MMLU-Pro 0.30, τ3-bench 0.66에 달했고 각 벤치마크에서 상위 3개 하니스 구성이 서로 달랐다.
- 같은 τ3-bench 과제, 같은 GLM-5.2 모델로 실행한 두 트레이스를 비교했을 때, LangGraph는 10,122토큰·4회 LLM 호출로 정답(1.0)에 도달했지만 CrewAI는 96,704토큰(약 9.6배)을 쓰고도 정답을 맞히지 못했다(0.0).

어디에 쓸 수 있나
- 여러 에이전트 프레임워크(하니스) 중 어느 것을 프로덕션에 도입할지 정답률뿐 아니라 토큰 비용·실행 단계별 지표까지 함께 보고 결정하는 데 참고할 수 있다
- 새 벤치마크나 새로운 에이전트 프레임워크를 평가 파이프라인에 추가할 때 벤치마크-하니스 조합마다 별도 코드를 짜지 않아도 되는 통합 구조로 활용할 수 있다
- 모델을 고정한 채 하니스 설계(프롬프트 구성, 도구 표현, 오류 처리, 종료 정책)가 성능에 미치는 영향을 진단하는 사례 분석 방법으로 참고할 수 있다

한계와 남은 검증
- 셀당 과제 수가 5개에 불과해 점수 해상도가 0.20 단위이며 셀별 분산이 크다고 저자들이 명시했다
- 레지스트리에 하니스가 등록돼 있다고 해서 모든 하니스-벤치마크 조합이 실제로 엔드투엔드 검증을 통과했음을 의미하지는 않는다
- 13개 트레이스 지표 중 정답률·토큰 비용을 뺀 나머지 과정 지표는 이번 벤치마크 조합에서는 큰 차이를 보이지 않아, 이를 구체적인 하니스 설계 지침으로 바꾸는 작업은 향후 과제로 남겨졌다
- crewai는 LLM 호출 스팬에 토큰 수 정보가 없어 토큰 비용 비교(그림 6b)에서 제외됐다

왜 중요한가
에이전트를 서비스에 붙일 때 '어떤 모델을 쓰느냐'뿐 아니라 '어떤 실행 도구(하니스)로 감싸느냐'가 성능과 비용을 크게 좌우한다는 것을 구체적 수치로 보여준다. 정답률 하나만 보고 하니스를 고르면 숨겨진 비효율이나 오류 회복 실패, 과도한 비용을 놓칠 수 있다는 실무적 경고이기도 하다.
이 논문의 용어
- 에이전트 하니스(agent harness) · LLM을 실제로 움직여 도구 호출, 대화 흐름, 상태 관리를 담당하는 실행 프레임워크(예: CrewAI, LangGraph)
- Agent Task Protocol(ATP) · 벤치마크와 하니스를 서로 독립적으로 조합할 수 있게 만든 공통 인터페이스 규격
- 트레이스(trace) · 모델 호출·도구 사용·오류 등 실행 중 벌어진 일을 시간순으로 기록한 표준화된 로그
- Lifecycle-Aligned Evaluation · 추론, 행동, 최종 답변, 운영 품질 네 단계로 나눠 각 단계마다 맞는 지표를 매기는 평가 방식
- LLM-as-judge · 규칙으로 채점하기 어려운 항목(답변 품질, 추론 품질 등)을 또 다른 LLM이 평가하게 하는 방식
본문에 싣지 못한 그림
- Figure 2: System overview. Task integrates benchmark management and execution support, Monitor provides unified agent access and instruments the runtime loop, and Evaluation performs multi-dimensional assessment with centralized result storage.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Haoning Wang et al., arXiv:2608.07346, arxiv-nonexclusive