메모리를 가진 AI 챗봇은 당신이 말하지 않은 것도 절반 가까이 지어내서 '기억'하고, 정작 자기 점검은 이를 제대로 잡아내지 못한다
arXiv:2608.045702026-08-06
The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
메모리를 가진 AI 챗봇은 당신이 말하지 않은 것도 절반 가까이 지어내서 '기억'하고, 정작 자기 점검은 이를 제대로 잡아내지 못한다
연구팀은 사용자가 딱 세 가지 사실만 알려줬을 때 LLM이 나머지를 얼마나 지어내는지 측정하는 MirageBench를 만들었다. 12개 모델을 143,616개의 주장 단위로 채점한 결과 모든 모델이 자기 주장의 35~49%를 근거 없이 지어냈고, 스스로 '나는 안전하다'고 보고하는 모델일수록 오히려 외부 심사에서 더 많이 지어낸 것으로 드러났다. 여러 턴이 이어지는 대화에서는 이런 지어낸 정보가 거의 수정되지 않고 선형적으로 계속 쌓였다.
METAL MEDIA 해설 도표
MirageBench 평가 파이프라인 구조
증거 상태측정 결과가 보고됨
입력: 3가지 사실만 공개된 페르소나150명의 가상 사용자(고정관념형·반고정관념형·중립형 각 50명), 실제 프로필은 15개 속성이지만 3개만 노출
6개 개인화 과업 수행데이팅 프로필, 여행 일정, 추천서, 선물 추천, 방 묘사, 스트레스 요인 파악 — 근거 필요도가 다른 상상 기울기를 구성
네 단계 분류와 독립 심사각 주장을 근거있음/합리적 추론/고정관념/지어냄으로 나누고 Claude-Opus-4-7이 12개 모델 143,616개 주장을 채점
자기 점검 대 외부 심사 비교모델이 스스로 보고한 과다추론율과 심사가 매긴 과다추론율의 순위가 반대로 나타남(스피어만 -0.60)
8라운드 누적 관찰대화가 이어질수록 지어낸 속성이 거의 선형으로 쌓이고 거의 수정되지 않음을 소규모 파일럿으로 확인
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
연구팀은 150명의 가상 사용자(고정관념형·반고정관념형·중립형 각 50명)에게 딱 3가지 사실만 말하게 하고, 데이팅 프로필 작성, 여행 일정 추천, 추천서 작성, 생일선물 추천, 방 묘사, 스트레스 요인 파악 등 6가지 개인화 과업을 시켜 모델이 무엇을 지어내는지 관찰했다.
모델이 만든 주장은 '근거 있음(Grounded)', '합리적 추론(Reasonable)', '고정관념(Stereotype)', '순수 지어냄(Fabricated)'의 4단계로 분류했고, 이 분류를 사람 평가자와 대조해 신뢰도를 검증했다(400개 주장, 4단계 코헨 카파 0.863, 이진 분류 카파 0.900).
12개 모델(7개 회사·계열) 143,616개 주장을 독립 심사 모델(Claude-Opus-4-7)로 채점한 결과 모든 모델이 35~49%(평균 41.6%, 주장 수 가중 평균 41.8%)를 근거 없이 지어냈으며, 지어낸 비율은 방 묘사 과업에서 57.8%로 가장 높고 선물 추천에서 27%로 가장 낮았다.
모델이 스스로 자기 답변을 점검해 보고한 '지어낸 비율'과 외부 심사가 매긴 비율을 비교하니 순위가 뒤집혔다(스피어만 상관 -0.60, p=0.044): 자기 점검에서 가장 안전하다고 주장한 모델(Qwen3-8B, 13.0%)이 외부 심사에서는 가장 많이 지어낸 모델(48.7%)로 나타났다.
8턴에 걸친 소규모 대화 실험에서 9개 모델은 라운드마다 5~15개씩 지어낸 속성이 거의 선형으로(R²>0.90) 누적됐고, 가장 빠르게 누적된 상위 5개 모델은 이전에 지어낸 정보를 거의 수정하지 않았다(제거율 0.4~5%).
Figure 1: Overview of over-inference in personalized LLMs. Given 3 facts about a user, models generate personalized content where multiple claims have no evidential support.
Table 1: MirageBench leaderboard: over-inference rates as assessed by Judge (Claude-Opus-4-7) on 150 personas × 6 tasks. Each model’s rates are percentages of that model’s total claims (a per-model micro-average). The Mean row is the unweighted arithmetic mean across the 12 models (a cross-model macro-average); the corresponding claim-weighted micro-average OI over all 143,616 claims is 41.8%. Models sorted by OI rate descending.
Model
Claims
Grnd
Stereo
Fabric
OI%
Qwen3-8B
12,687
23.6
9.3
39.4
48.7
DeepSeek-v4-pro
13,170
24.4
10.7
34.7
45.4
GPT-4o-mini
10,408
26.6
7.1
38.0
45.1
DeepSeek-v4-flash
11,972
25.5
10.3
34.3
44.6
Qwen3.6-plus
13,146
23.7
11.8
32.7
44.5
Kimi-K2.5
12,665
24.9
12.5
30.6
43.1
Gemini-3-flash
14,396
24.9
12.8
28.3
41.1
GLM-5.1
12,869
26.0
12.2
28.0
40.2
GPT-5.5
10,416
26.6
9.4
29.0
38.5
GPT-5.4-nano
7,790
30.9
8.6
29.0
37.6
Claude-Opus-4-6
11,139
25.9
10.7
24.7
35.4
Gemini-3.1-pro
12,958
27.9
11.3
23.8
35.1
Mean
25.9
10.5
31.1
41.6
Figure 2: The four-way claim taxonomy. The bottom two categories jointly constitute over-inference.
Table 2: The Self-Monitoring Inversion at the model-selection level. Self-audit OI (from Task) vs. external OI (from Judge) across all models, sorted by Δ=Judge−Self. Positive Δ: the model under-detects its own over-inference; negative Δ: the model over-reports. Spearman ρ=−0.60 (p=0.044 by permutation; 95% bootstrap CI [−0.90,+0.06], family-clustered [−0.87,+0.14]; n=12).
Model
Self%
Judge%
Δ
Pattern
Qwen3-8B
13.0
48.7
+35.7
Under
GPT-4o-mini
20.1
45.1
+25.0
Under
DeepSeek-v4-flash
33.0
44.6
+11.6
Under
DeepSeek-v4-pro
40.8
45.4
+4.6
Calib.
Gemini-3-flash
41.1
41.1
−0.0
Calib.
Qwen3.6-plus
45.4
44.5
−0.9
Calib.
Claude-Opus-4-6
41.6
35.4
−6.2
Over
GPT-5.5
46.4
38.5
−8.0
Over
Gemini-3.1-pro
43.2
35.1
−8.1
Over
GLM-5.1
49.6
40.2
−9.3
Over
GPT-5.4-nano
49.0
37.6
−11.4
Over
Kimi-K2.5
58.2
43.1
−15.1
Over
Figure 3: The MirageBench evaluation pipeline. From the benchmark input (personas with profile P and revealed facts E, and the six-task suite), the three instruments Probe, Task, and Accum elicit explicit, implicit, and continual inference, respectively, and an independent Judge classifies every resulting claim under the four-way taxonomy.
Table 3: Claim composition by task (%), ordered by groundability. Rows are pooled across all 12 models and 150 personas. Tasks that must go beyond the 3 revealed facts (top) are dominated by stereotype and fabrication, while tasks that can be answered by referring to stated preferences (bottom) maintain higher grounded proportions. OI = Stereotype + Fabricated. The four shares sum to 100% per row.
Task
Grnd
Reas
Ster
Fab
OI%
Apartment/home
15.0
27.2
19.8
38.0
57.8
Rec. letter
12.0
39.8
7.8
40.4
48.2
Stress source
22.0
38.2
9.1
30.7
39.8
Weekend itinerary
26.0
35.3
10.2
28.5
38.7
Dating profile
34.0
37.5
4.5
24.0
28.5
Birthday gift
40.0
32.9
8.8
18.3
27.0
Figure 4: The blind annotation interface. The revealed facts, the task context, and the single claim under review are shown, matching the information available to the Judge; the judge’s label, reasoning, and the source model are all hidden. Labels are submitted via four buttons corresponding to the faithfulness taxonomy of Figure 2, or via keyboard shortcuts A/B/C/D.
Table 4: Inference accumulation over 8 conversation rounds (Accum). Values show mean inferred attributes stored in memory (averaged across 2 personas). Growth is approximately linear.
Model
R1
R8
Growth
/round
GPT-5.5
18.5
125.0
+106.5
15.2
GLM-5.1
16.5
121.5
+105.0
15.0
Claude-Opus-4-6
15.5
104.5
+89.0
12.7
Qwen3.6-plus
19.0
102.5
+83.5
11.9
DeepSeek-v4-flash
13.0
82.0
+69.0
9.9
Kimi-K2.5
15.0
75.0
+60.0
8.6
Gemini-3-flash
14.5
60.0
+45.5
6.5
DeepSeek-v4-pro
8.0
53.5
+45.5
6.5
Gemini-3.1-pro
14.0
50.5
+36.5
5.2
GPT-4o-mini
8.5
27.0
+18.5
2.6
Qwen3-8B
13.5
23.5
+10.0
1.4
GPT-5.4-nano
14.5
15.0
+0.5
0.1
Table 5: Judged-claim counts per task, pooled across 12 models and 150 personas. Composition percentages and OI rates for these tasks are given in Table 3.
Task
Claims
Apartment/home
31,238
Rec. letter
26,885
Stress source
20,085
Weekend itinerary
25,971
Dating profile
20,052
Birthday gift
19,385
Table 6: Within-model self-audit signal. Per-model Spearman ρ and AUROC between record-level Task self-audit OI% and Judge OI%. n is the number of (persona, task) records with valid self-audit and judge outputs for that model.
Model
Spearman ρ
AUROC
n
Qwen3.6-plus
0.64
0.83
888
GPT-5.5
0.63
0.80
869
Claude-Opus-4-6
0.62
0.80
897
Kimi-K2.5
0.61
0.81
899
DeepSeek-v4-pro
0.57
0.78
896
GLM-5.1
0.56
0.77
883
Gemini-3.1-pro
0.55
0.74
617
DeepSeek-v4-flash
0.53
0.75
890
Gemini-3-flash
0.49
0.76
900
GPT-4o-mini
0.32
0.65
897
GPT-5.4-nano
0.27
0.61
832
Qwen3-8B
0.13
0.58
834
Table 7: Judge OI% by stereotype group, per model. Δ is stereotypical minus counter-stereotypical. All 12 models show Δ>0.
Model
Stereo
Counter
Neutral
Δ
Qwen3-8B
51.1
44.7
50.5
+6.3
DeepSeek-v4-pro
48.4
41.0
46.8
+7.5
DeepSeek-v4-flash
47.8
39.9
46.3
+7.9
Qwen3.6-plus
47.2
40.0
46.7
+7.2
GPT-4o-mini
46.6
41.9
47.0
+4.7
Kimi-K2.5
45.9
38.4
45.2
+7.5
Gemini-3-flash
44.8
34.3
44.3
+10.5
GLM-5.1
43.9
34.7
42.3
+9.2
GPT-5.5
42.2
33.5
40.3
+8.7
GPT-5.4-nano
39.2
35.2
38.4
+4.0
Claude-Opus-4-6
38.8
31.2
36.7
+7.5
Gemini-3.1-pro
38.5
28.8
38.2
+9.7
Pooled
44.8
37.0
43.9
+7.8
Table 8: Per-model Accum regression (attributes vs. round, n=16) and mean per-round removal rate. Removal rate is the fraction of unique attributes present at round T that are absent at round T+1, averaged across the two personas.
Model
Slope
R2
R8
Rem.%
GPT-5.5
15.08
0.99
125.0
0.4
GLM-5.1
15.21
0.97
121.5
1.4
Claude-Opus-4-6
12.84
0.93
104.5
2.4
Qwen3.6-plus
12.13
0.93
102.5
5.0
DeepSeek-v4-flash
9.91
0.95
82.0
2.4
Kimi-K2.5
8.82
0.91
75.0
11.0
Gemini-3-flash
6.55
0.99
60.0
16.7
DeepSeek-v4-pro
6.39
0.96
53.5
4.5
Gemini-3.1-pro
5.19
0.95
50.5
16.0
GPT-4o-mini
2.56
0.79
27.0
1.5
Qwen3-8B
1.56
0.79
23.5
70.4
GPT-5.4-nano
0.14
0.03
15.0
81.6
Table 9: Model versions used in the study. Snapshots frozen at experiment time.
Model
API identifier / snapshot
GPT-5.5
gpt-5.5-2026-06-01
GPT-5.4-nano
gpt-5.4-nano-2026-05-20
GPT-4o-mini
gpt-4o-mini-2024-07-18
Claude-Opus-4-6
claude-opus-4-6-20260415
Claude-Opus-4-7†
claude-opus-4-7-20260610
Gemini-3.1-pro
gemini-3.1-pro-preview-2026-05
Gemini-3-flash
gemini-3-flash-preview-2026-04
DeepSeek-v4-pro
deepseek-v4-pro-2026-05
DeepSeek-v4-flash
deepseek-v4-flash-2026-05
Qwen3.6-plus
qwen3.6-plus‡
Qwen3-8B
Qwen/Qwen3-8B§
GLM-5.1
glm-5.1‡
Kimi-K2.5
moonshot-v1-k2.5
Table 10: Judge OI rates (%) by model × task. Column “All” matches the mean OI rate in the main paper’s leaderboard (Table 1); the “Mean” row matches the per-task OI rates in Table 3.
Model
Apart.
Rec.let.
Stress
Itiner.
Dating
Gift
All
Qwen3-8B
63.9
56.4
45.3
46.1
37.6
34.2
48.7
DeepSeek-v4-pro
62.1
53.8
42.5
43.4
32.1
30.9
45.4
GPT-4o-mini
61.6
53.3
42.2
42.9
32.5
29.9
45.1
DeepSeek-v4-flash
61.1
52.6
41.8
42.5
31.4
30.8
44.6
Qwen3.6-plus
60.9
52.5
41.7
42.6
31.5
30.6
44.5
Kimi-K2.5
60.1
51.0
40.7
41.2
30.3
29.2
43.1
Gemini-3-flash
57.3
47.9
39.4
40.1
27.9
25.6
41.1
GLM-5.1
56.5
47.0
38.5
39.6
27.3
25.0
40.2
GPT-5.5
54.8
44.4
37.4
37.4
25.6
24.5
38.5
GPT-5.4-nano
54.6
44.7
35.7
36.5
25.2
23.8
37.6
Claude-Opus-4-6
52.6
41.5
34.4
34.9
23.6
21.9
35.4
Gemini-3.1-pro
52.5
41.3
34.3
34.4
23.2
21.8
35.1
Mean
57.8
48.2
39.8
38.7
28.5
27.0
41.6
Table 11: Judge–human agreement on 400 stratified claims.
Metric
Four-class
Binary (over-inference)
Accuracy
0.898
0.950
Cohen’s κ
0.863
0.900
Macro-F1
0.896
—
실제로 확인된 결과
12개 모델 모두 전체 주장의 35~49%(교차모델 평균 41.6%, 주장 가중 평균 41.8%)를 근거 없이 지어냈으며 예외 없이 나타났다.
모델별 자기 점검 과다추론율과 독립 심사가 매긴 과다추론율의 순위가 뒤집혔다(스피어만 상관 -0.60, p=0.044, 부트스트랩 신뢰구간 [-0.90, +0.06]); 단, 같은 모델 내부에서는 자기 점검이 여전히 자기 주장 순위를 중간~강한 수준으로 구분했다(AUROC 0.58~0.83).
과다추론 비율은 과업에 따라 27%(선물 추천)에서 59%(방 묘사)까지 달랐으며, 근거로부터 멀어질수록 비율이 높아졌다.
8라운드 대화 파일럿에서 9개 모델의 지어낸 속성 수가 라운드마다 5~15개씩 거의 선형으로(R²>0.90) 누적됐고, 상위 5개 모델은 이전 지어낸 정보를 거의 수정하지 않았다(제거율 0.4~5%).
독립 심사(Claude-Opus-4-7)는 400개 주장에서 블라인드 인간 평가자와 4단계 코헨 카파 0.863, 이진 분류 카파 0.900으로 거의 완벽한 일치를 보였다.
어디에 쓸 수 있나
지속 메모리 기반 개인화 AI 시스템을 설계할 때 모델의 자기 신뢰도 점수만으로 모델 간 안전성을 비교하지 않도록 하는 데 참고할 수 있다
개인화 응답을 저장 메모리에 넣기 전에 외부 검증 단계(별도 심사 모델)를 두는 파이프라인 설계에 참고할 수 있다
어떤 개인화 과업(방 묘사, 추천서 작성 등)이 지어낸 정보에 더 취약한지 미리 파악해 프롬프트나 UI 경고를 설계하는 데 활용할 수 있다
모델 내부의 자기 점검 신호는 같은 모델의 답변 필터링에는 참고할 수 있으나, 이를 모델 간 비교 지표로 쓰지 않는 것이 안전하다
한계와 남은 검증
다중 턴 누적 실험(Accum)은 페르소나 2명, 8라운드로만 진행된 소규모 파일럿이라 절대적인 수치보다는 모델 간 대비로만 읽어야 한다
메모리 갱신 프롬프트가 '이전 항목을 명백히 반박하지 않으면 지우지 말라'고 지시해 누적 쪽으로 편향된 설계이며, 자유롭게 정리할 수 있는 중립 프롬프트를 대조군으로 쓰는 실험은 향후 과제로 남아 있다
평가는 사용자당 정확히 세 가지 사실만 공개된 초기 상호작용 상황을 가정한 것으로, 정보가 더 많이 누적된 이후 단계에서의 과다추론 양상은 다루지 않았다
독립 심사 모델(Claude-Opus-4-7) 자체의 판단 편향 가능성이 있으며, 인간 검증은 400개 주장, 단일 평가자 기준으로 이루어져 추가 평가자와 다른 심사 모델로의 확장은 향후 과제로 남겨졌다
자기 점검-외부 심사 간 순위 역전 상관은 표본 수가 12개 모델로 작아 신뢰구간이 넓고(부트스트랩 [-0.90, +0.06]) 탐색적 결과로 제시됐다
왜 중요한가
지속 메모리를 가진 개인화 AI가 확산되면서 이런 챗봇이 사용자에 대해 '알고 있다'고 말하는 정보가 실제로는 사용자가 알려주지 않은 지어낸 내용일 수 있다는 점을 정량적으로 보여준다. 동시에 모델 스스로의 자신감이나 자기 점검 결과를 모델 간 안전성 비교 기준으로 쓰면 오히려 반대 결론에 이를 수 있다는 경고도 제시한다.
이 논문의 용어
과다추론(Over-inference, OI) · 사용자가 실제로 말한 근거를 넘어서 모델이 사용자에 대한 속성을 지어내는 현상
자기 점검 역전(Self-Monitoring Inversion) · 모델이 스스로 보고하는 과다추론 비율이 외부 심사가 측정한 실제 과다추론 비율과 반대로 움직이는 현상
네 단계 진실성 분류 · 주장을 근거있음, 합리적 추론, 고정관념, 순수 지어냄 네 가지로 나누는 기준
AUROC · 어떤 점수(여기서는 자기 점검 결과)가 실제 정답(외부 심사 결과)을 얼마나 잘 구분하는지 나타내는 지표, 1에 가까울수록 좋음
상상 기울기(imagination gradient) · 과업이 주어진 근거만으로 답할 수 있는지, 아니면 상상에 의존해야 하는지의 정도 차이