지식그래프 QA가 정보 누락에 약해지는 진짜 이유를 밝히는 진단 도구, MissDiag
지식그래프 QA가 정보 누락에 약해지는 진짜 이유를 밝히는 진단 도구, MissDiag
지식그래프 기반 질의응답 시스템은 그래프 정보가 일부 빠지면 성능이 떨어지는데, 기존 평가는 '얼마나 떨어졌는지'만 보고 '왜 떨어졌는지'는 알려주지 못했다. MissDiag는 정보를 없애는 방식을 네 가지 유형으로 구분해 같은 질문에 대해 짝지어 비교함으로써 성능 저하의 원인을 구체적으로 짚어낸다. 그 결과 정답과 가까운 정보가 빠졌을 때 가장 큰 타격을 입고, 질문 관련 배경 정보는 빠져도 오히려 도움이 되는 경우도 있다는 사실이 드러났다.
METAL MEDIA 해설 도표
지식그래프 QA가 정보 누락에 약해지는 진짜 이유를 밝히는 진단 도구, MissDiag
- 01지식그래프 QA와 KG-RAG는 그래프에 있는 사실을 근거로 답을 내는 시스템인데, 실제 그래프는 정보가 듬성듬성 비어 있거나 오래된 경우가 많아 이런 불완전성에 얼마나 잘 버티는지가 중요하다
- 02MissDiag는 질문과 정답, 관련 개체는 그대로 두고 근거 그래프의 연결선(엣지)만 무작위, 질문 관련 맥락, 관계 유형, 정답 인접 네 가지 방식으로 지워가며 같은 시스템을 완전한 그래프와 비교 평가한다
- 03제거 강도를 조절할 수 있는 예산을 두어 그래프 크기에 비례해 공정하게 정보를 제거하고, F1 점수 하락폭을 유형별로 정리한 저하 프로파일을 만든다
- 04학습된 KGQA 모델, 그래프 프롬프팅 기법, KG 에이전트, 직접 LLM 등 여러 시스템군에서 실험한 결과 정답 인접 정보 손실이 가장 큰 성능 저하(10.3~21.3점)를 일으켰고, 질문 관련 맥락 정보 제거는 오히려 성능을 높이는 경우도 있었다
- 05정답이 여러 개인 질문이나 근거 그래프가 작을 때 정답 인접 정보 손실의 타격이 더 커졌으며, 평가 지표를 정답 표현의 의미까지 인정하는 방식으로 바꿔도 이 패턴은 유지됐다
무엇을 했나
- 지식그래프 QA와 KG-RAG는 그래프에 있는 사실을 근거로 답을 내는 시스템인데, 실제 그래프는 정보가 듬성듬성 비어 있거나 오래된 경우가 많아 이런 불완전성에 얼마나 잘 버티는지가 중요하다
- MissDiag는 질문과 정답, 관련 개체는 그대로 두고 근거 그래프의 연결선(엣지)만 무작위, 질문 관련 맥락, 관계 유형, 정답 인접 네 가지 방식으로 지워가며 같은 시스템을 완전한 그래프와 비교 평가한다
- 제거 강도를 조절할 수 있는 예산을 두어 그래프 크기에 비례해 공정하게 정보를 제거하고, F1 점수 하락폭을 유형별로 정리한 저하 프로파일을 만든다
- 학습된 KGQA 모델, 그래프 프롬프팅 기법, KG 에이전트, 직접 LLM 등 여러 시스템군에서 실험한 결과 정답 인접 정보 손실이 가장 큰 성능 저하(10.3~21.3점)를 일으켰고, 질문 관련 맥락 정보 제거는 오히려 성능을 높이는 경우도 있었다
- 정답이 여러 개인 질문이나 근거 그래프가 작을 때 정답 인접 정보 손실의 타격이 더 커졌으며, 평가 지표를 정답 표현의 의미까지 인정하는 방식으로 바꿔도 이 패턴은 유지됐다
| Category | System | Complete | Paired degradation 𝚫F1 | |||
|---|---|---|---|---|---|---|
| F1 | Random | Source-context | Relation-level | Answer-adjacent | ||
| Trained KGQA Models | ReaRev | 80.8 | 4.5 | -1.2 | 2.7 | 11.9 |
| NuTrea | 77.2 | 1.9 | -9.9 | -2.7 | 12.2 | |
| NSM | 46.7 | 3.0 | -24.1 | -5.2 | 12.1 | |
| Graph Prompting Methods | MindMap | 46.2 | 10.1 | 0.6 | 11.2 | 12.7 |
| StructGPT | 52.9 | 9.6 | -0.7 | 8.0 | 13.8 | |
| KG-GPT | 45.7 | 7.0 | 4.2 | 5.3 | 10.3 | |
| KG Agents | ToG | 79.5 | 7.0 | 3.9 | 6.0 | 11.4 |
| PoG | 79.9 | 6.8 | 2.7 | 5.8 | 11.6 | |
| GoG | 81.7 | 12.1 | 2.3 | 8.9 | 19.8 | |
| Direct LLM Baselines | Qwen2.5-7B-Instruct | 85.3 | 11.1 | 3.0 | 7.4 | 21.3 |
| Qwen2.5-14B-Instruct | 90.0 | 6.7 | 1.2 | 5.5 | 17.0 | |
| Llama-3.1-8B-Instruct | 84.4 | 6.1 | -0.5 | 4.0 | 15.8 | |
| Mistral-7B-Instruct-v0.3 | 81.2 | 5.4 | 1.6 | 3.8 | 13.3 |
| System | Metric | Paired degradation 𝚫F1 | |||
|---|---|---|---|---|---|
| Rand | Src | Rel | Ans-adj | ||
| Qwen2.5-7B | Exact F1 | 11.1 | 3.0 | 7.4 | 21.3 |
| Semantic F1 | 11.6 | 3.2 | 8.0 | 21.4 | |
| Qwen2.5-14B | Exact F1 | 6.7 | 1.2 | 5.5 | 17.0 |
| Semantic F1 | 6.9 | 1.2 | 5.4 | 16.1 | |
| Llama-3.1-8B | Exact F1 | 6.1 | -0.5 | 4.0 | 15.8 |
| Semantic F1 | 5.1 | -1.0 | 3.9 | 15.1 | |
| Mistral-7B | Exact F1 | 5.4 | 1.6 | 3.8 | 13.3 |
| Semantic F1 | 5.1 | 0.9 | 3.2 | 13.5 |
| Slice | Group | N | Full | Rand | Ans-adj | Gap |
|---|---|---|---|---|---|---|
| Answer cardinality | Single-answer | 888 | 90.8 | 6.8 | 14.4 | 7.6 |
| Multi-answer | 163 | 54.5 | 10.4 | 30.2 | 19.9 | |
| Support size | Small support | 353 | 80.5 | 12.6 | 26.7 | 14.2 |
| Medium support | 527 | 87.0 | 5.2 | 13.3 | 8.0 | |
| Large support | 171 | 89.2 | 2.9 | 7.4 | 4.5 |
왜 중요한가
지식그래프 기반 AI 시스템을 실제 서비스에 적용할 때 어떤 종류의 데이터 누락이 치명적인지 미리 알 수 있다면 신뢰도 높은 시스템 설계와 우선순위 있는 데이터 보완이 가능해진다. 단순히 '점수가 몇 점 떨어졌다'는 결과만으로는 시스템의 진짜 약점을 알 수 없다는 점을 보여주는 이 연구는 향후 KGQA 평가 방식 자체를 바꿀 근거가 된다.
이 논문의 용어
- 지식그래프(Knowledge Graph) · 개체와 개체 사이의 관계를 사실 단위로 저장한 그래프 형태의 데이터베이스
- KGQA · 지식그래프에 담긴 사실을 근거로 자연어 질문에 답하는 과제
- KG-RAG · 지식그래프에서 검색한 정보를 근거로 언어모델이 답을 생성하는 방식
- F1 점수 · 정답을 얼마나 정확하고 빠짐없이 맞혔는지를 종합한 평가 점수
- 저하 프로파일(Degradation Profile) · 정보 제거 유형별로 성능이 얼마나 떨어졌는지 정리한 표
본문에 싣지 못한 그림
- Figure 1: Motivation for typed degradation analysis. The same QA instance can show similar aggregate degradation under structurally different missingness conditions. Aggregate score drops alone do not reveal which evidence type was removed, whether answer-local evidence was affected, or whether the effect is systematic.
- Figure 2: Overview of MissDiag. (1) Input: an instance contains a question, gold answer set, and local support graph. (2) Typed Missingness Operators: typed operators select removable support edges for random, source-context, relation-level, and answer-adjacent missingness. (3) Severity-Controlled Missingness: a shared severity budget produces an incomplete support graph. (4) Paired Evaluation: the same system is evaluated under complete and incomplete support to compute paired degradation. (5) Typed Degradation Profile: degradation values are summarized across missingness type, severity, system, and metric.
- Figure 3: Severity effects on paired degradation. Curves show paired ΔF1 across missingness types for Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct as α increases.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다