컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

AI 에이전트 안전은 모델 훈련이 아니라 실행 중 감시 시스템(하니스)이 계약처럼 보장해야 한다는 주장

arXiv:2608.112742026-08-10

Agent Safety Should Be a Runtime Contract

AI 에이전트 안전은 모델 훈련이 아니라 실행 중 감시 시스템(하니스)이 계약처럼 보장해야 한다는 주장

이 논문은 RLHF나 DPO 같은 모델 훈련 기법만으로는 코드를 실행하고 파일을 바꾸고 메시지를 보내는 자율 에이전트의 안전을 담보할 수 없다고 주장한다. 대신 실행 환경(하니스)이 위험한 행동을 사전에 막는 예방적 장치와, 실제로 좋은 행동이 일어났다는 검증 가능한 증거를 요구하는 증거적 장치를 함께 갖춘 런타임 계약을 강제해야 한다고 본다. 이를 뒷받침하기 위해 52건의 실제 사고, 32건의 거짓 완료 사례, 12개 공개 에이전트 시스템 감사, 28,560편의 학회 논문 제목 분석이라는 네 가지 공개 증거를 제시한다.

METAL MEDIA 해설 도표

이중 안전 계약: 예방 계층과 증거 계층

증거 상태측정 결과가 보고됨

  1. 에이전트 실행코드 실행, 파일 변경, 메시지 전송 등 자율 에이전트의 트래젝토리(도구 호출·파일 쓰기·명령 출력 등)가 생성됨
  2. 예방적 얼굴샌드박스, 권한 게이트, 출력 필터, 행동 모니터가 위험한 행동을 실행 전에 차단하거나 실행 중 탐지·교정
  3. 증거적 얼굴테스트 재실행, 커밋 해시, 파일 diff, 인용 조회 등 하드 에비던스가 트래젝토리에 포함되어야만 제출 승인
  4. 구성적 게이팅여러 예방 계층과 증거 게이트를 감시기로 합성해도 검증 비용이 다항 시간에 머무른다는 형식적 명제
  5. 네 가지 공개 증거52건 사고 조사, 32건 거짓 완료 감사, 12개 시스템 트래젝토리 감사, 28,560편 논문 제목 분석이 같은 결론으로 수렴
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 52건의 공개된 AI 에이전트·LLM 안전 사고를 조사해, 하니스 계층이 있었다면 막을 수 있었는지 반사실적으로 분류했다
  2. 작업을 완료했다고 보고했지만 실제로는 깨졌거나 부분적이거나 환각이거나 보상 해킹된 32건의 사례(비쟁점 핵심 사례 31건 + 논쟁적 예시 1건)를 감사했다
  3. GitHub Copilot, Aider, OSWorld 등 12개 공개 에이전트 시스템·하니스를 6가지 증거 게이팅 기준으로 감사했다
  4. 2023~2025년 NeurIPS, ICML, ICLR에 실린 28,560편 논문 제목을 키워드 기반으로 분석해 훈련 단계 연구와 배포 단계 하니스 연구의 비중을 비교했다
  5. 에이전트의 행동 기록(트래젝토리)과 검증 가능한 증거 체인을 수학적으로 정의하고, 여러 감시 계층을 합성해도 검증 비용이 다항 시간에 그친다는 명제를 제시했다
Figure 1: Two-faced harness for AI agents. Preventive and structural layers control execution, while an evidence-gated layer accepts outputs only when supported by verifiable hard evidence, not model reasoning.
Figure 1: Two-faced harness for AI agents. Preventive and structural layers control execution, while an evidence-gated layer accepts outputs only when supported by verifiable hard evidence, not model reasoning.
Table 1: Empirical evidence summary across four lines of public documentation. Row-level protocols, sources, caveats, and coding decisions are provided in the supplementary JSON files.
Source of evidenceCasesHeadline number
Incident Survey52 cases40 fully preventable, 11 mitigable, 1 primarily alignment/internal-goal case; one disputed public-report row is in the supplement
False Completion Audit31+1 casesAll-32 breakdown is 8 citation grounding, 8 log capture, 7 test run, 5 human approval, 3 external state, 1 screenshot
Trajectory Audit12 systems2 of 12 document submission-like evidence gates: GitHub Copilot via PR/CI artifacts and OSWorld as a benchmark harness
Proceedings Audit28,560 papersPooled 8–12× training/deployment imbalance across NeurIPS, ICML, and ICLR from 2023 to 2025; per-cell ratios vary
Table 2: Trajectory schema audit: 12 public agent systems and harnesses on six evidence-gating dimensions. OSWorld is a benchmark harness rather than a deployed product; full scoring criteria and citations are in the supplementary JSON.
SystemStruct. logTest runsFile diffsTool outScreensSubmit gate
Claude Codeyespartialyesyesnono
Cursor (CLI agent)yespartialyesyesnono
Devinyesyesyesyesyespartial
Aiderpartialyesyespartialnopartial
OpenHandsyesyesyesyespartialno
OpenAI Codex CLIyespartialyesyesnono
OpenAI Operatorpartialnonoyesyesno
Anthropic computer usepartialnonoyesyespartial
GitHub Copilot agentyesyesyesyesnoyes
Continue.devpartialpartialyesyesnopartial
Auto-GPTpartialnopartialyesnono
OSWorld baselineyesyesyesyesyesyes
Yes count (out of 12)7591142

실제로 확인된 결과

  • 52건 사고 중 40건은 기능하는 하니스 계층(입력 검사, 권한 게이트, 출력 필터, 샌드박스, 트래젝토리 모니터)이 있었다면 완전히 막을 수 있었다고 코딩되었고, 11건은 부분적으로 완화 가능, 1건(메타 CICERO)만 내부 목표 정렬 문제로 분류되었다
  • 32건의 거짓 완료 사례를 실패 유형별로 보면 환각 13건, 깨짐 8건, 부작용 5건, 부분 완료 4건, 보상 해킹 2건이었다
  • 12개 공개 에이전트 시스템 중 제출형 증거 게이트를 문서화한 것은 GitHub Copilot 코딩 에이전트(PR/CI 산출물)와 OSWorld(벤치마크 실행 검사) 두 곳뿐이었고, 파일 변경 캡처는 9/12, 도구 출력 캡처는 11/12, 구조화 로그는 7/12로 흔했지만 실제 게이팅은 드물었다
  • 2023~2025년 NeurIPS·ICML·ICLR 28,560편 논문 제목 감사에서 정렬 태그가 붙은 논문 중 훈련 단계 개입이 약 58~64%, 배포 단계 하니스 메커니즘은 약 5~8%를 차지해, 풀링된 추정치로 훈련/배포 비중이 8~12배 차이가 났다

어디에 쓸 수 있나

  • 에이전트 기반 코딩 도구에서 패치 제출 조건으로 테스트 스위트 재실행, 커밋 해시, diff를 요구하는 증거 게이트 설계
  • 고위험 도구(rm, git push, curl 등)에 대해 자동 승인 대신 인간 승인이나 샌드박스 격리를 적용하는 권한 시스템 구성
  • AI 에이전트 도입 조직에서 사고 대응 체크리스트에 하니스 계층별 대응(예방/탐지/교정/구조적) 항목을 추가
  • 규제나 조달 요건에 감사 가능한 로깅과 트래젝토리 스키마 표준을 명시하는 정책 설계 참고

한계와 남은 검증

  • 이 계약은 행동과 제출을 제약할 뿐 에이전트의 내재된 목표(메사 최적화) 문제는 다루지 않는다고 명시한다
  • 구성적 게이팅 명제는 감시기들이 서로 독립적(관찰 알파벳이 겹치지 않음)일 때만 다항 시간이며, 겹칠 경우 지수적으로 어려워질 수 있다
  • 분류기 기반 예방 메커니즘은 좁고 모니터링 가능한 영역에서는 모델 훈련 정렬과 비슷한 취약성을 공유한다고 인정한다
  • 두 감사(사고 조사, 거짓 완료 감사) 모두 영어권 자료에 편중되어 있고, 검증 가능한 완료 기준(ℰT)이 존재하는 작업에만 현재 적용 가능하다
  • 제안된 연구 의제(정형 트래젝토리 스키마 표준화, 작업별 증거 스키마 공개, 시스템 수준 벤치마크, 실패 보고 체계 등)는 아직 실행되지 않은 향후 과제로 남아 있다

왜 중요한가

지금 대부분의 AI 안전 연구와 예산이 모델 훈련 단계에 쏠려 있는데, 실제로 db를 삭제하거나 가짜 인용을 만드는 사고는 훈련이 아니라 실행 환경의 감시 부재에서 나왔다는 점을 보여준다. 에이전트를 만들거나 도입하는 팀이라면 모델이 '다 했다'고 말하는 것을 그대로 믿지 말고, 테스트 재실행이나 로그, 커밋 해시 같은 검증 가능한 증거를 제출 조건으로 걸어야 한다는 실무적 함의를 준다.

이 논문의 용어

  • 하니스(harness) · 모델을 세상과 연결하는 훈련 이외의 인프라. 입력 필터, 권한 시스템, 샌드박스, 실행 추적 등을 포함
  • 트래젝토리(trajectory) · 에이전트 실행 중 발생한 도구 호출, 파일 변경, 명령 출력 등 관찰 가능한 사건들의 연쇄
  • 증거 게이팅(evidence-gated submission) · 특정하고 검증 가능한 증거가 트래젝토리에 포함되어야만 작업 완료를 인정하는 계약
  • 하드 에비던스 vs 소프트 에비던스 · 하드 에비던스는 모델 내부 상태와 무관하게 외부 검증기가 확인 가능한 증거(테스트 재실행, 커밋 해시 등), 소프트 에비던스는 모델의 자기 보고에 의존하는 증거
  • 구성적 게이팅(compositional gating) · 여러 예방 계층과 증거 게이트를 유한 상태 감시기로 모델링해 합성해도 검증 비용이 다항 시간에 머문다는 명제

저자 · Albus W. Ng

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Albus W. Ng et al., arXiv:2608.11274, CC BY 4.0