AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
회사 장부에서 거래가 안 맞을 때 그 원인을 찾아내는 AI를 테스트하는 벤치마크 FinRCA-Bench가 나왔다. 같은 언어모델에 검색 방식만 바꿔줬더니 정답률이 2%에서 72%로 급등했는데, 이는 모델이 똑똑해져서가 아니라 필요한 증거 기록을 얼마나 잘 찾아주느냐의 차이였다. 정답을 맞힌 경우조차 절반 넘게 제대로 된 증거 없이 우연히 맞춘 것으로 드러났다.
METAL MEDIA 해설 도표
AI가 '정답'을 맞혀도, 정작 증거는 못 찾는 경우가 대부분이었다 - 재무 이상거래 진단 AI의 숨은 약점
- 01송장, 발주서, 결제, 은행거래 등 14개 표에 걸쳐 흩어진 2,250건의 가상 회계 사례로 벤치마크를 만들었다. 1,500건은 일부러 오류를 심은 사례(15가지 원인 유형), 750건은 정상이지만 헷갈리기 쉬운 사례다.
- 02단순 텍스트 유사도로 검색하는 방식(Dense RAG) 대신, 실제로 시스템에 저장된 거래 관계만 따라가는 그래프 검색 방식(TPGR)을 도입해 같은 AI 모델에 검색 방법만 바꿔가며 비교했다.
- 03검색 방식만 바꿨는데도 필요한 증거를 찾아내는 비율이 0.83%에서 77.70%로, 정답률이 2.05%에서 72.44%로 크게 올랐다. 반면 전통적인 규칙 기반 시스템은 84.97%, 머신러닝은 95.44%의 정확도를 이미 기록해, AI가 이 분야에서 항상 뛰어난 건 아니라는 점도 확인됐다.
- 04정답을 맞힌 437건 중 311건(71.17%)은 실제로는 요구되는 증거 조건을 충족하지 못한 채 맞힌 경우였고, 엄격한 증거 기준을 통과한 비율은 5.72%에 불과했다. 오류의 대다수(95건 대 15건)는 AI의 추론 실수가 아니라 애초에 필요한 자료를 찾지 못한 '검색 실패'였다.
무엇을 했나
- 송장, 발주서, 결제, 은행거래 등 14개 표에 걸쳐 흩어진 2,250건의 가상 회계 사례로 벤치마크를 만들었다. 1,500건은 일부러 오류를 심은 사례(15가지 원인 유형), 750건은 정상이지만 헷갈리기 쉬운 사례다.
- 단순 텍스트 유사도로 검색하는 방식(Dense RAG) 대신, 실제로 시스템에 저장된 거래 관계만 따라가는 그래프 검색 방식(TPGR)을 도입해 같은 AI 모델에 검색 방법만 바꿔가며 비교했다.
- 검색 방식만 바꿨는데도 필요한 증거를 찾아내는 비율이 0.83%에서 77.70%로, 정답률이 2.05%에서 72.44%로 크게 올랐다. 반면 전통적인 규칙 기반 시스템은 84.97%, 머신러닝은 95.44%의 정확도를 이미 기록해, AI가 이 분야에서 항상 뛰어난 건 아니라는 점도 확인됐다.
- 정답을 맞힌 437건 중 311건(71.17%)은 실제로는 요구되는 증거 조건을 충족하지 못한 채 맞힌 경우였고, 엄격한 증거 기준을 통과한 비율은 5.72%에 불과했다. 오류의 대다수(95건 대 15건)는 AI의 추론 실수가 아니라 애초에 필요한 자료를 찾지 못한 '검색 실패'였다.
왜 중요한가
기업 재무 자동화에 AI를 도입할 때, 정답률만 보고 '잘한다'고 판단하면 실제로는 근거 없는 추측을 신뢰하게 될 위험이 크다. 이 연구는 답이 맞았는지와 그 답을 뒷받침할 증거를 실제로 찾았는지를 분리해서 봐야 한다는 것을 구체적 수치로 보여준다.
이 논문의 용어
- RAG(검색 증강 생성) · AI가 답을 만들기 전에 관련 자료를 먼저 찾아와 참고하게 하는 기법
- TPGR(유형화된 출처 그래프 검색) · 미리 정의된 실제 거래 관계만 따라가며 자료를 찾는, 유사도 계산을 쓰지 않는 검색 방식
- hard negative(어려운 오답 후보) · 겉보기엔 이상해 보이지만 실제로는 정상인 사례, AI를 헷갈리게 하려고 넣은 시험 문제
- 매크로 리콜(macro recall) · 각 사례별로 필요한 자료를 얼마나 빠짐없이 찾았는지의 평균 비율
- provenance(출처/이력) · 어떤 기록이 어디서 왔고 다른 기록과 어떻게 실제로 연결되는지를 보여주는 근거 사슬
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다