게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다
게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다
ForgeWM은 마인크래프트 같은 게임 화면을 키보드·마우스 입력에 맞춰 실시간으로 다음 장면을 생성하는 AI 모델이다. 원래 여러 프레임을 한꺼번에 보고 그림을 그리던 모델을 네 단계에 걸쳐 개조해서, 과거 정보만 보고 1번, 2번, 4번의 계산만으로도 빠르게 다음 장면을 만들어내도록 만들었다. 그 결과 화질, 카메라 조작 정확도, 움직임 정확도에서 비교 대상보다 나은 성적을 냈고, FPS 게임용 컨트롤러 조작에도 같은 방법이 통했다.
METAL MEDIA 해설 도표
게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다
- 01원래 모델은 영상 전체를 한꺼번에 보고 그림을 그리는 방식이라 실시간 게임에 쓰기 어려웠는데, 이를 과거 장면만 보고 순서대로 그리는 방식으로 바꾸는 네 단계 학습법을 제안했다.
- 02키보드의 켜짐/꺼짐 신호와 마우스의 연속적인 움직임 신호를 압축된 영상 조각과 어긋나지 않게 맞추는 것이 핵심 난제였고, 이를 전용 통로로 처리하는 액션 모듈로 해결했다.
- 031단계는 게임 화면에 적응시키고, 2단계는 순서대로 그리는 방식을 가르치고, 3단계는 적은 계산 단계로도 그릴 수 있게 압축하고, 4단계는 모델이 스스로 만든 화면을 보고 또 배우게 해서 오차 누적을 줄였다.
- 04마인크래프트 실험에서 이미지 화질, 실제 이동 궤적과의 유사도, 반대 방향 조작 인식 정확도, 마우스 조작 정확도에서 비교 모델들보다 앞섰고, 기준 영상과의 차이(LPIPS)도 가장 작았다.
- 05한 번 저장해둔 영상을 나중에 다시 노이즈를 살짝 입혀 다듬는 '리플레이 정제' 기능을 넣어, 새로 4단계로 처음부터 그리는 것과 비슷한 화질을 내면서도 원래 경험한 장면 구도를 3배 더 잘 유지했다.
무엇을 했나
- 원래 모델은 영상 전체를 한꺼번에 보고 그림을 그리는 방식이라 실시간 게임에 쓰기 어려웠는데, 이를 과거 장면만 보고 순서대로 그리는 방식으로 바꾸는 네 단계 학습법을 제안했다.
- 키보드의 켜짐/꺼짐 신호와 마우스의 연속적인 움직임 신호를 압축된 영상 조각과 어긋나지 않게 맞추는 것이 핵심 난제였고, 이를 전용 통로로 처리하는 액션 모듈로 해결했다.
- 1단계는 게임 화면에 적응시키고, 2단계는 순서대로 그리는 방식을 가르치고, 3단계는 적은 계산 단계로도 그릴 수 있게 압축하고, 4단계는 모델이 스스로 만든 화면을 보고 또 배우게 해서 오차 누적을 줄였다.
- 마인크래프트 실험에서 이미지 화질, 실제 이동 궤적과의 유사도, 반대 방향 조작 인식 정확도, 마우스 조작 정확도에서 비교 모델들보다 앞섰고, 기준 영상과의 차이(LPIPS)도 가장 작았다.
- 한 번 저장해둔 영상을 나중에 다시 노이즈를 살짝 입혀 다듬는 '리플레이 정제' 기능을 넣어, 새로 4단계로 처음부터 그리는 것과 비슷한 화질을 내면서도 원래 경험한 장면 구도를 3배 더 잘 유지했다.


| Stage | Initialization | Training Context | Objective | Output |
|---|---|---|---|---|
| 0 | Base | Full-clip bidirectional | FM | Domain teacher |
| 1 | Base | Clean causal history | Causal FM | Causal teacher |
| 2 | Stage 1 | Clean causal history | Online CD | Few-step initializer |
| 3 | Stage 2 | Self-generated history | DMD | 1/2/4-step students |
| Model | Visual Quality | Temporal Quality | Action Controllability | Efficiency | |||||
|---|---|---|---|---|---|---|---|---|---|
| IQ↑ | LPIPS↓ | AQ↑ | Subj. Cons.↑ | Flow Prof.↑ | KCtrl↑ | Mouse Acc.↑ | Latency (ms)↓ | FPS↑ | |
| Matrix-Game 2.0 | 0.6282 | 0.6443 | 0.4583 | 0.7349 | 0.9343 | 0.9156 | 0.7061 | 370.9 | 32.35 |
| HY-WorldPlay | 0.6133 | 0.6172 | 0.4855 | 0.9466 | 0.8288 | 0.9286 | 0.5818 | 2164.3 | 7.54 |
| ForgeWM-1 (1-step) | 0.6776 | 0.6529 | 0.4807 | 0.8279 | 0.9403 | 0.9545 | 0.7848 | 168.2 | 72.10 |
| ForgeWM-2 (2-step) | 0.6865 | 0.6171 | 0.4814 | 0.8349 | 0.9429 | 0.9740 | 0.8268 | 239.7 | 50.31 |
| ForgeWM-4 (4-step) | 0.6788 | 0.6168 | 0.4860 | 0.7613 | 0.9420 | 0.9740 | 0.8102 | 369.6 | 32.47 |


| Stage 0 | Stage 1 | Stage 2 | Stage 3 | |
|---|---|---|---|---|
| Objective | ℒFM | ℒ1 | ℒ2 | ℒ3 |
| Trainer | FM | causal FM | consist. distill. | DMD |
| Attention | bidir. | causal | causal | causal |
| Init | base | base | Stage 1 | Stage 2 |
| Blk. (latents) | 21 | 3 | 3 | 3 |
| Trainer iterations | 4k | 20k | 6k | 4k |
| Gen. lr | 2e−6 | 2e−5 | 2e−6 | 2e−6 |
| Critic lr | – | – | – | 4e−7 |
| Global batch | 8 | 8 | 8 | 8 |
| EMA | – | – | 0.99/200 | 0.99/200 |


| Stage | Inference regime | LPIPS↓ | IQ↑ | AQ↑ | SC↑ |
|---|---|---|---|---|---|
| 0 | bidirectional teacher (ref.) | 0.814[.809,.819] | 0.455 | 0.463 | 0.677 |
| 1 | teacher-forced causal | 0.806[.799,.812] | 0.508 | 0.454 | 0.700 |
| 2 | causal consistency | 0.605[.600,.610] | 0.659 | 0.483 | 0.760 |
| 3 | distribution matching | 0.617[.613,.620] | 0.716 | 0.489 | 0.760 |
| Game | LPIPS↓ | PSNR↑ | Flow | Ratio |
|---|---|---|---|---|
| Xonotic | 0.5828 | 11.21 | 13.88 | 1.66 |
| Modern Warfare III | 0.6352 | 11.61 | 8.15 | 1.35 |
| Modern Warfare | 0.6479 | 10.99 | 8.29 | 1.46 |
| Warzone | 0.6695 | 10.66 | 9.13 | 1.78 |
| Halo Infinite | 0.6730 | 9.75 | 11.23 | 1.46 |
| Halo | 0.6920 | 9.31 | 13.28 | 1.29 |
| Call of Duty | 0.6933 | 9.67 | 10.40 | 1.16 |
| Macro-average | 0.6562 | 10.46 | 10.62 | 1.45 |
왜 중요한가
게임이나 시뮬레이션 속에서 사람의 조작에 즉각 반응하는 AI 영상 생성기를 만들려면 계산 속도와 조작 정확도를 동시에 잡아야 하는데, ForgeWM은 그 두 마리 토끼를 잡는 구체적인 학습 절차를 제시한다. 이는 게임 엔진 없이도 그럴듯한 게임 화면을 실시간으로 만들어내는 '월드 모델' 기술을 실제 서비스에 가깝게 만드는 실용적 진전이다.
이 논문의 용어
- 월드 모델(World Model) · 카메라나 그래픽 엔진 없이, 과거 화면과 조작 입력만 보고 다음 화면을 예측해 만들어내는 AI 모델
- 인과적(Causal) 생성 · 미래 장면을 만들 때 이후 시점 정보를 보지 않고 과거 정보만 순서대로 사용하는 방식
- 증류(Distillation) · 복잡하고 느린 모델의 성능을 더 가볍고 빠른 모델에 옮겨 담는 학습 기법
- LPIPS · 두 영상이 사람 눈에 얼마나 비슷하게 보이는지를 수치로 재는 지표, 낮을수록 원본과 비슷함
- 리플레이 정제(Replay-Time Refinement) · 저장해둔 영상 초안에 살짝 노이즈를 더한 뒤 다시 다듬어 화질을 높이는 후처리 방법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Xinye Li et al., arXiv:2608.14022, CC BY 4.0