LLM 에이전트가 경험을 쌓을수록 오히려 헷갈려 하는 문제를, 기억을 4칸짜리 서랍으로 압축해 해결한 연구
LLM 에이전트가 경험을 쌓을수록 오히려 헷갈려 하는 문제를, 기억을 4칸짜리 서랍으로 압축해 해결한 연구
자가진화형 LLM 에이전트는 과거 경험(메모리)을 저장하고 그 유용성을 점수(Q값)로 학습하는데, 경험이 쌓일수록 점수를 매길 대상이 계속 늘어나 피드백이 분산되고, 성공 보상이 관련 없는 메모리에도 잘못 배분되는 '메모리-보상 함정'이 생긴다. RoMeRL은 이 문제를 해결하려고 메모리 저장 공간을 계속 늘리는 대신, 성공/실패와 고정된 대표/최근 변화라는 두 축으로 나눈 4개의 고정 칸에 경험을 담아 순환시킨다. ALFWorld와 LifelongAgentBench 실험에서 성능은 오르고, 콜드스타트 비율·메모리 크기·LLM 호출 수는 크게 줄었다.
METAL MEDIA 해설 도표
RoMeRL: 늘어나는 메모리를 4칸으로 압축하는 구조
증거 상태측정 결과가 보고됨
- 기존 방식의 문제저장된 경험마다 별도의 유용성 점수를 매겨 경험이 쌓일수록 점수 대상이 무한히 늘어나고, 성공 보상이 관련 없는 메모리에도 잘못 배분되는 메모리-보상 함정이 생긴다
- 4개 고정 좌표로 압축성공/실패(극성)와 대표사례/최근변화(역학)를 교차해 PCC(성공 대표), PAC(성공 전환), NCC(실패 대표), NAC(최근 실패) 4칸만 유지한다
- 온라인 갱신·교체새 경험이 들어오면 4칸 중 해당 칸의 내용을 갱신하거나 더 나은 사례로 교체하며, 기존 유용성 점수를 웜스타트로 물려받는다
- 이론적 근거좌표 수를 줄이면 좌표당 평균 피드백이 늘고, 오염-정화 전이 모델에서 오염된 좌표가 남을 확률에 상한이 존재함을 증명했다
- 측정된 효과ALFWorld·LifelongAgentBench에서 성공률 상승, Cold-Q 비율 80.0% 감소, 피드백 밀도 약 6.0배 증가, 메모리 크기 84.4% 감소, LLM 호출 21.1% 감소
무엇을 했나
- 문제 정의: 기존 학습형 메모리 시스템은 저장된 경험(궤적)마다 별도의 유용성 점수를 매기는데, 경험이 늘수록 점수 대상 공간이 무한히 커져 한정된 피드백이 옅게 퍼진다.
- 메모리-보상 함정: 하나의 작업 성공 보상이 그 작업에서 함께 참조된 여러 메모리에 동시에 배분되기 때문에, 실제로 기여하지 않은 관련 없는 메모리도 긍정적 점수를 받아 계속 살아남을 수 있다.
- 해결 방법: RoMeRL은 매 작업마다 성공/실패(결과 극성)와 오래 유지되는 대표 사례/최근 상태 변화(메모리 역학)라는 두 기준을 교차시켜 4개의 고정된 '의미 좌표'(PCC, PAC, NCC, NAC)만 유지하고, 새 경험이 들어오면 이 4칸의 내용만 갱신하거나 교체한다.
- 이론적 근거: 좌표 수를 줄이면 각 좌표가 받는 평균 피드백 횟수가 늘어난다는 것과, 좌표가 오염됐다가 정화되는 과정을 일반적인 상태전이 모델로 분석해 오염된 좌표가 남아있을 확률의 상한을 제시했다.
- 실험 결과: ALFWorld·LifelongAgentBench(OS, DB 과제)에서 RoMeRL은 기존 최강 베이스라인 대비 전체 평균 성공률을 3.2%p 높였고, 업데이트를 한 번도 못 받은 '콜드-Q' 비율을 80.0% 줄였으며, 피드백 밀도는 약 6.0배 늘고, 메모리 크기는 84.4%, LLM 호출 수는 21.1% 줄었다.

| Method | Lifelong Agent Bench | ALFWorld | Overall Avg. | LLM Calls Avg Num. | Memory Avg Num. | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| OS Last / CSR | OS | Last / CSR | DB Last / CSR | DB | Last / CSR | P&P | Examine | Clean | Heat | Cool | Pick-2 |
| OS | |||||||||||
| Last / CSR | |||||||||||
| DB | |||||||||||
| Last / CSR | |||||||||||
| Model | DS-V4-flash | DS-V4-flash | GPT-5.4-mini | – | – | – | |||||
| No Memory | 0.646 | 0.550 | 0.883 | 0.827 | 0.861 | 0.850 | 0.855 | 0.788 | 0.783 | – | – |
| Pass@10 | – / 0.756 | – / 0.906 | – | – | – | – | – | – | – | – | – |
| RAG | 0.700 / 0.752 | 0.556 / 0.844 | 0.891 | 0.834 | 0.868 | 0.855 | 0.858 | 0.796 | 0.795 | – | – |
| Mem0 | 0.691 / 0.733 | 0.575 / 0.841 | 0.897 | 0.841 | 0.873 | 0.858 | 0.872 | 0.805 | 0.802 | – | – |
| MemP | 0.768 / 0.796 | 0.631 / 0.942 | – | – | – | – | – | – | – | 570K | 45K |
| MemRL | 0.808 / 0.820 | 0.632 / 0.934 | 0.908 | 0.855 | 0.887 | 0.865 | 0.871 | 0.812 | 0.830 | 570K | 45K |
| RoMeRL (ours) | 0.824 / 0.838 | 0.680 / 0.952 | 0.968 | 0.957 | 0.901 | 0.862 | 0.880 | 0.826 | 0.862 | 450K | 7K |

| Method | Round-10 SR (%) ↑ | Positive Noise Updates ↓ | Final Noise Ratio (%) ↓ |
|---|---|---|---|
| MemRL | 79.2 | 3.7 | 1.02 |
| MemRL + UCB | 78.4 | 7.2 | 1.20 |
| RoMeRL | 82.0 | 2.4 | 0.15 |
| Inference Model | Base | Transfer | Gain (Δ) |
|---|---|---|---|
| LifelongAgentBench–OS | |||
| GPT-5.4-mini | 67.0 / 3.23 | 81.6 / 2.22 | +14.6 / -1.01 |
| Gemini-3.5-flash | 74.0 / 4.53 | 81.4 / 3.02 | +7.4 / -1.51 |
| LifelongAgentBench–DB | |||
| GPT-5.4-mini | 93.0 / 2.15 | 96.8 / 2.00 | +3.8 / -0.15 |
| Gemini-3.5-flash | 96.2 / 2.44 | 97.6 / 2.18 | +1.4 / -0.26 |

| Component | Configuration / Version | Notes |
|---|---|---|
| Backbone LLM | DS-V4-flash | Used for LifelongAgentBench |
| GPT-5.4-mini | Used for ALFWorld | |
| Embedding Model | Text-Embedding-3-Large | Used for Intent and Query encoding |
| Generation Params | Temperature =0.0 | General (Greedy decoding) |
| Top-p =1.0 | Default |
| Benchmark Setting | ||||
|---|---|---|---|---|
| Parameter | Description | Lifelong Bench (OS) | Lifelong Bench (DB) | ALFWorld |
| RoMeRL (Ours) | ||||
| α | Learning Rate | 0.3 | 0.3 | 0.3 |
| ωQ | Q-Weight Balance | 0.5 | 0.5 | 0.5 |
| δ | Similarity Threshold | 0.50 | 0.37 | 0.62 |
| k1 | Cosine Similarity Recall Size | 10 | 10 | 5 |
| k2 | Final Memory Selection Size | 5 | 5 | 3 |
| Qinit | Initial Q-value | 0.5 | 0.5 | 0.0 |
| Baselines | ||||
| kRAG | Retrieval Top-k | 5 | 5 | 3 |
| kSelfRAG | Retrieval Top-k | 5 | 5 | 3 |
| kMemP | Retrieval Top-k | 5 | 5 | 3 |
| Benchmark | Runtime Learning | Transfer Learning | Split / Note |
|---|---|---|---|
| Lifelong Agent (OS) | 500 tasks | 500 tasks | 7:3 Split (Seed 42) |
| Lifelong Agent (DB) | 500 tasks | 500 tasks | 7:3 Split (Seed 42) |
실제로 확인된 결과
- RoMeRL은 전체 평균 성공률 0.862로 최강 베이스라인의 0.830보다 3.2%p 높다(Table 1).
- OS 과제 기준 Cold-Q 비율이 MemRL은 29%에서 44.9%로 상승한 반면, RoMeRL은 28%에서 9.0%로 낮아졌고, 피드백 밀도는 4.96에서 29.93으로 약 6.0배 증가했다(Figure 3).
- 평균 메모리 크기가 45K에서 7K로 84.4% 줄었고, LLM 호출 수는 570K에서 450K로 21.1% 줄었다(Table 1).
- 노이즈 10%를 주입한 스트레스 테스트에서, UCB를 더한 MemRL은 노이즈 긍정 업데이트가 3.7에서 7.2로, 최종 노이즈 비율이 1.02%에서 1.20%로 늘었지만, RoMeRL은 각각 2.4와 0.15%로 억제하면서 성공률 82.0%로 가장 높았다(Table 2).
- 4개 모델-과제 조합 모두에서 학습된 메모리 상태를 다른 LLM 백본으로 옮겨도 점수가 오르고 평균 실행 단계 수가 줄었다(Table 3).

어디에 쓸 수 있나
- 장기간 운영되며 경험을 계속 쌓는 고객 응대·업무 자동화 에이전트의 메모리 관리 구조 설계
- 메모리 저장 공간과 LLM 호출 비용을 제한된 자원 안에서 유지해야 하는 에이전트 시스템
- 다른 LLM 백본으로 교체할 때도 기존에 학습된 절차적 경험을 재사용하고 싶은 상황

한계와 남은 검증
- 여전히 작업 단위의 최종 결과 보상에만 의존하므로, 어떤 메모리가 실제로 원인이었는지 완전히 구분하는 인과적 credit assignment 문제는 해결되지 않았다.
- 제안한 오염-정화 전이 모델의 실제 파라미터(감마, 람다)를 추정하려면 반사실적(counterfactual) 롤아웃 같은 좌표 단위 인과 라벨이 필요한데, 이는 아직 별도로 검증되지 않았다.
- 실험은 ALFWorld와 LifelongAgentBench의 OS/DB 과제로 한정되어 있으며, 더 개방적이고 긴 호라이즌의 과제에 대한 평가는 향후 과제로 남겨졌다.
- 4개 고정 좌표(2x2 구조)는 본 논문이 제시한 최소 설계이며, 더 세밀한 보상이나 다른 분류 기준을 결합한 확장은 아직 검증되지 않았다.
왜 중요한가
에이전트가 오래 쓰일수록 기억이 무한정 쌓여 관리 비용과 오작동 위험이 커지는 것은 실제 서비스 운영에서 큰 부담인데, 이 연구는 저장 공간을 고정 크기로 유지하면서도 성능을 유지·개선할 수 있음을 보여준다. LLM을 다시 학습시키지 않고도 메모리 구조만 바꿔 효율을 높일 수 있다는 점에서, 장기 운영되는 에이전트 시스템 설계에 실질적인 참고가 된다.
이 논문의 용어
- Cold-Q 비율 · 메모리 대표 항목이 등록된 이후 한 번도 직접적인 유용성 점수 업데이트를 받지 못한 비율. 낮을수록 피드백이 잘 도달했다는 뜻
- 메모리-보상 함정(MRT) · 하나의 작업 성공 보상이 함께 참조된 여러 메모리에 동시에 배분되면서, 실제 기여가 없는 메모리도 긍정 점수를 받게 되는 현상
- PCC/PAC/NCC/NAC · RoMeRL이 유지하는 4개의 고정 메모리 칸. 각각 긍정-대표, 긍정-최근전환, 부정-대표, 부정-최근 실패를 담당한다
- Cumulative Success Rate(CSR) · 여러 에폭(반복 학습 주기)에 걸쳐 적어도 한 번 이상 해결된 작업의 비율
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Yi Yang et al., arXiv:2608.02508, arxiv-nonexclusive