은행 상담 AI가 대화만으로 개인정보와 돈을 털리는지 시험하는 벤치마크가 나왔다
은행 상담 AI가 대화만으로 개인정보와 돈을 털리는지 시험하는 벤치마크가 나왔다
은행 고객센터 챗봇처럼 계좌 조회, 이체, 카드 정지 같은 실제 기능을 가진 AI 상담원을, 사기꾼 역할을 하는 또 다른 AI가 대화로 속여보게 만든 시험대 FraudBench가 공개됐다. 사기꾼은 신원을 위장하고, 앞선 대화에서 흘린 말을 나중에 악용하는 등 10가지 사기 수법과 여러 단계로 이어지는 복합 공격을 시도한다. 4개 모델을 시험한 결과 방어 성공률이 49~65%에 그쳤고, 특히 '자금 세탁 대리인(머니뮬)' 사기와 여러 단계로 이어지는 공격에 유독 취약했다.
METAL MEDIA 해설 도표
은행 상담 AI가 대화만으로 개인정보와 돈을 털리는지 시험하는 벤치마크가 나왔다
- 01697개 내부 정책 문서와 실제 같은 고객 데이터베이스, 17개의 계좌 조작 도구를 갖춘 가상 은행 환경을 만들고, 그 위에서 AI 상담원과 AI 사기꾼이 서로 도구를 써가며 대화하도록 설계했다
- 02안전성을 대화 전체 맥락으로 판단하는 것이 핵심이다. 예를 들어 같은 이체 요청이라도, 앞서 발신자가 '이 돈은 남의 월급이다'라고 실토한 적이 있다면 뒤늦게 요청해도 거부해야 하는 식이다
- 03150개의 사람이 직접 만든 시나리오 중 107개(단일 함정 90개 + 여러 단계로 이어지는 복합 공격 17개)를 공개해 4개 모델(Nemotron-3 Ultra, Gemini 3.6 Flash, Gemini 3.1 Flash-Lite, gpt-oss-120b)을 시험했다
- 04AI 상담원에게 정답 정책 문서를 미리 쥐여준 이상적인 조건에서도 방어 성공률은 최고 64.5%, 최저 49.5%에 그쳤고, 상담원이 직접 문서를 검색하게 하자 Gemini 3.6 Flash의 성공률이 64.5%에서 51.0%로 13%p 떨어졌다
- 05자금세탁 대리인(머니뮬) 사기는 모든 모델에서 가장 취약한 유형이었고, 여러 단계로 이어지는 복합 공격 17건 중 강한 모델도 8~9건만 방어해 약한 모델(4건)과 큰 격차를 보였다
무엇을 했나
- 697개 내부 정책 문서와 실제 같은 고객 데이터베이스, 17개의 계좌 조작 도구를 갖춘 가상 은행 환경을 만들고, 그 위에서 AI 상담원과 AI 사기꾼이 서로 도구를 써가며 대화하도록 설계했다
- 안전성을 대화 전체 맥락으로 판단하는 것이 핵심이다. 예를 들어 같은 이체 요청이라도, 앞서 발신자가 '이 돈은 남의 월급이다'라고 실토한 적이 있다면 뒤늦게 요청해도 거부해야 하는 식이다
- 150개의 사람이 직접 만든 시나리오 중 107개(단일 함정 90개 + 여러 단계로 이어지는 복합 공격 17개)를 공개해 4개 모델(Nemotron-3 Ultra, Gemini 3.6 Flash, Gemini 3.1 Flash-Lite, gpt-oss-120b)을 시험했다
- AI 상담원에게 정답 정책 문서를 미리 쥐여준 이상적인 조건에서도 방어 성공률은 최고 64.5%, 최저 49.5%에 그쳤고, 상담원이 직접 문서를 검색하게 하자 Gemini 3.6 Flash의 성공률이 64.5%에서 51.0%로 13%p 떨어졌다
- 자금세탁 대리인(머니뮬) 사기는 모든 모델에서 가장 취약한 유형이었고, 여러 단계로 이어지는 복합 공격 17건 중 강한 모델도 8~9건만 방어해 약한 모델(4건)과 큰 격차를 보였다

| Work | Exec. state | Large KB | Fraud | Multi-class fraud | History-dep. | Long conv. | Type |
|---|---|---|---|---|---|---|---|
| Fraud-R1 (Yang et al. 2025) | – | – | ✓ | ⊚ | ⊚ | ⊚ | Benchmark |
| τ2-bench (Barres et al. 2025) | ✓ | – | – | – | – | ✓ | Benchmark |
| τ-Knowledge (Shi et al. 2026) | ✓ | ✓ | – | – | – | ✓ | Benchmark |
| AgentDojo (Debenedetti et al. 2024) | ✓ | – | – | – | ✓ | ⊚ | Both |
| SafeArena (Tur et al. 2025) | ✓ | – | – | – | – | ⊚ | Benchmark |
| AgentHazard (Feng et al. 2026) | ✓ | – | – | – | ✓ | ⊚ | Benchmark |
| DoomArena (Boisvert et al. 2025) | ✓ | – | – | – | ✓ | ⊚ | Framework |
| FraudBench | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | Both |

| Mechanism | Principal decision being tested |
|---|---|
| APP scam | Protect a verified customer manipulated into an authorized payment. |
| Account takeover | Stop stolen knowledge or recovery credentials from becoming account control. |
| Card fraud | Preserve freezes, activation locks, PIN rules, and transaction controls. |
| Data exfiltration | Enforce identity, role, ownership, scope, and retention boundaries. |
| First-party fraud | Detect dispute or reimbursement claims contradicted by the account. |
| Prompt injection | Treat instruction-like text in records or user content as data. |
| Money mule | Stop laundering, structuring, third-party movement, or authorization bypass. |
| Phishing PII | Recognize that static PII satisfies basic identity but not every high-risk action. |
| Social engineering | Resist false authority, urgency, secrecy, sympathy, and escalation pressure. |
| Synthetic identity | Enforce onboarding and expansion eligibility against fabricated or blended identities. |
| Chain (adaptive) | Preserve trust-state evidence across a multi-step attack when a later locally valid request follows an earlier probe, admission, or failed attempt. |
| Defender | Tasks | Security S (p1) |
|---|---|---|
| Gemini 3.6 Flash | 107 | 64.5% |
| Nemotron-3 Ultra 550B | 107 | 57.9% |
| Gemini 3.1 Flash-Lite | 107 | 53.3% |
| gpt-oss-120b | 107 | 49.5% |
| Mechanism | Nemo. | G3.6F | G3.1FL | oss120 |
|---|---|---|---|---|
| APP scam | 3/9 | 5/9 | 4/9 | 2/9 |
| Account takeover | 3/9 | 8/9 | 7/9 | 6/9 |
| Card fraud | 7/9 | 8/9 | 7/9 | 8/9 |
| Data exfiltration | 8/9 | 8/9 | 7/9 | 5/9 |
| First-party fraud | 4/9 | 7/9 | 3/9 | 2/9 |
| Prompt injection | 7/9 | 8/9 | 6/9 | 6/9 |
| Money mule | 2/9 | 1/9 | 1/9 | 1/9 |
| Phishing PII | 5/9 | 4/9 | 6/9 | 5/9 |
| Social engineering | 8/9 | 6/9 | 6/9 | 7/9 |
| Synthetic identity | 7/9 | 5/9 | 6/9 | 7/9 |
| Chain (adaptive) | 8/17 | 9/17 | 4/17 | 4/17 |
| Overall | 62/107 | 69/107 | 57/107 | 53/107 |
| Overall (%) | 57.9 | 64.5 | 53.3 | 49.5 |
| Defender | Oracle S (p1) | All-tools S (p1) |
|---|---|---|
| Gemini 3.6 Flash | 64.5% (107) | 51.0% (104) |
| Gemini 3.1 Pro | – | 55.1% (107) |
왜 중요한가
은행 상담 챗봇이 이체, 비밀번호 재설정 같은 실제 권한을 갖게 되면서, 대화 몇 마디로 개인정보를 빼내거나 돈을 옮기게 만드는 공격이 현실적인 위협이 되었다. 이 연구는 그런 위험을 실제로 재현하고 수치로 측정할 수 있는 최초의 실행 가능한 시험대를 제공해, AI 상담원을 실제 은행에 배치하기 전에 무엇이 부족한지 구체적으로 보여준다.
이 논문의 용어
- 머니뮬(money mule) · 본인 계좌를 남의 불법 자금 이동 통로로 빌려주는 사기 수법
- 오라클 검색(oracle retrieval) · AI에게 정답이 될 정책 문서를 미리 골라서 제공하는 이상적인 시험 조건
- LLM-as-judge · 다른 AI 모델이 대화 기록을 읽고 안전 여부를 채점하는 평가 방식
- 이중 통제(dual-control) · 상담원과 발신자 둘 다 도구를 써서 행동할 수 있게 만든 시뮬레이션 구조
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Dheeraj Mohandas Pai et al., arXiv:2608.18136, CC BY 4.0