사람이 물건을 만지는 영상을 보고 AI가 만든 '로봇 버전 영상'이 실제로 쓸만한지 처음으로 채점해봤다
사람이 물건을 만지는 영상을 보고 AI가 만든 '로봇 버전 영상'이 실제로 쓸만한지 처음으로 채점해봤다
로봇을 학습시킬 영상은 부족한데 사람이 물건 다루는 영상은 넘쳐나서, AI 비디오 생성 모델로 사람 영상을 로봇 영상으로 바꾸려는 시도가 늘고 있다. 문제는 지금까지는 그렇게 만들어진 영상이 '그럴듯해 보이는지'만 평가했고, 실제로 사람이 하던 동작과 접촉이 로봇에게 제대로 옮겨졌는지는 아무도 확인하지 않았다는 점이다. H2R-Bench는 사람 시범 영상 120개를 로봇용 그리퍼와 다섯손가락 손 두 종류로 변환시켜 11개 최신 영상 생성 모델을 5가지 기준으로 채점했고, 화면이 예뻐 보이는 것과 실제 작업 전이 성공은 거의 무관하다는 것을 보여줬다.
METAL MEDIA 해설 도표
H2R-Bench 평가 흐름
증거 상태측정 결과가 보고됨
- 입력: 사람 시범 영상EgoDex에서 고른 120개 1인칭 사람 물건 조작 영상, 6개 작업군으로 균등 분배
- 조건: 목표 로봇 형태 지정각 영상을 평행 그리퍼용, 다섯손가락 로봇 손용 두 가지 목표로 각각 변환 요청, 총 240개 케이스
- 생성: 11개 영상 AI 모델Seedance 2.0, Wan2.7, Kling-V3 등 영상 전체 입력 모델과 HunyuanVideo 등 프레임 입력 모델이 각자 인터페이스로 로봇 영상 생성
- 채점: M1~M5 다섯 기준목표 완성, 동작 완성, 기능적 접촉, 로봇 형태 정확성, 영상 품질을 3개의 AI 판정관이 0~4점으로 평가
- 결과: H2RCore 종합점수다섯 점수를 가중합해 0~100점으로 산출, 접촉과 형태 정확성에 각 30%씩 가중을 둠
무엇을 했나
- 연구팀은 사람이 1인칭 시점으로 물건을 다루는 영상(EgoDex 데이터셋에서 120개 클립)을 골라, 각 영상을 '평행 그리퍼용 로봇 영상'과 '다섯손가락 로봇 손 영상' 두 가지로 바꾸라고 11개 영상 생성 AI에게 시켰다.
- 평가는 다섯 항목으로 나눠 했다: 목표 상태 완성(M1), 필요한 동작이 다 나왔는지(M2), 로봇이 물건과 실제로 기능적으로 접촉했는지(M3), 요청한 로봇 형태(그리퍼/손)가 제대로 나왔는지(M4), 일반적인 영상 품질(M5). 세 개의 대형 AI 판정관(Gemini, Qwen, GPT)이 채점하고 사람 평가자와 비교해 신뢰도를 검증했다.
- Seedance 2.0, Wan2.7, Kling-V3처럼 원본 영상 전체를 입력받는 모델들이 상위권을 차지했고, Seedance 2.0이 종합점수(H2RCore, 0~100점)에서 그리퍼 77.3점, 다섯손가락 손 84.6점으로 1위였다.
- 영상 품질 점수(M5)는 모델 간 차이가 0.73~0.81로 거의 비슷했지만, 실제 작업 전이 점수(H2RCore)는 30.0~84.6점까지 크게 벌어졌고 둘 사이 상관관계는 매우 약했다(순위 상관 0.14). 즉 영상이 화려해 보인다고 로봇 작업이 제대로 전이된 건 아니었다.
- 화면이 좋아 보이는 HunyuanVideo 1.5-I2V는 영상 품질 점수가 가장 높았지만 로봇 접촉 점수는 낮았고, 심지어 사람 손이 계속 작업을 하는 영상을 만들어 로봇으로 바꾸지 못한 경우가 많았다. Veo 3.1은 그럴듯한 상호작용을 만들었지만 요청한 로봇 형태가 틀린 경우가 잦았다.

| Benchmark | Settings | Evaluation | ||||||
|---|---|---|---|---|---|---|---|---|
| I2V | RV | H2R | VQ | Goal | Action | Cont. | Emb. | |
| VBench | × | × | × | ✓ | × | × | × | × |
| WorldModelBench | ✓ | △ | × | ✓ | △ | △ | × | × |
| RBench | ✓ | ✓ | × | ✓ | ✓ | ✓ | × | △ |
| RoboWM-Bench | ✓ | ✓ | × | △ | ✓ | ✓ | × | × |
| RoboTrustBench | ✓ | ✓ | × | ✓ | ✓ | ✓ | × | △ |
| H2R-Bench (ours) | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |

| Model | Parallel-Jaw Gripper | Dexterous Hand | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Component Metrics | Aggregate | Component Metrics | Aggregate | |||||||||
| Goal Comp. | Action Comp. | Contact Transfer | Embod. Correct. | Video Quality | H2R Core | Goal Comp. | Action Comp. | Contact Transfer | Embod. Correct. | Video Quality | H2R Core | |
| Video-conditioned generation | ||||||||||||
| Seedance 2.0 | 0.725 | 0.813 | 0.776 | 0.768 | 0.793 | 77.3 | 0.744 | 0.832 | 0.855 | 0.911 | 0.799 | 84.6 |
| Wan2.7 | 0.706 | 0.791 | 0.766 | 0.772 | 0.796 | 76.5 | 0.718 | 0.804 | 0.835 | 0.910 | 0.795 | 83.1 |
| Kling-V3 | 0.710 | 0.807 | 0.751 | 0.707 | 0.798 | 74.5 | 0.707 | 0.800 | 0.819 | 0.885 | 0.802 | 81.7 |
| Frame-conditioned generation | ||||||||||||
| Mitty-EPIC14B | 0.581 | 0.668 | 0.598 | 0.585 | 0.732 | 61.5 | 0.587 | 0.684 | 0.598 | 0.392 | 0.732 | 56.1 |
| Veo 3.1 | 0.725 | 0.797 | 0.533 | 0.100 | 0.783 | 49.6 | 0.715 | 0.816 | 0.642 | 0.227 | 0.793 | 57.0 |
| Grok Imagine Video | 0.661 | 0.729 | 0.443 | 0.268 | 0.792 | 50.1 | 0.678 | 0.729 | 0.469 | 0.198 | 0.804 | 49.2 |
| LTX-2.3 | 0.473 | 0.545 | 0.292 | 0.012 | 0.773 | 32.1 | 0.520 | 0.592 | 0.377 | 0.132 | 0.780 | 39.8 |
| SkyReels-V3-R2V | 0.448 | 0.610 | 0.256 | 0.004 | 0.787 | 31.5 | 0.441 | 0.607 | 0.341 | 0.026 | 0.789 | 34.6 |
| Wan2.2 | 0.492 | 0.639 | 0.258 | 0.000 | 0.769 | 32.4 | 0.512 | 0.653 | 0.286 | 0.000 | 0.766 | 33.7 |
| LongCat | 0.472 | 0.583 | 0.243 | 0.000 | 0.790 | 31.0 | 0.428 | 0.545 | 0.298 | 0.020 | 0.793 | 32.0 |
| HunyuanVideo 1.5-I2V | 0.535 | 0.549 | 0.184 | 0.005 | 0.806 | 30.0 | 0.499 | 0.555 | 0.185 | 0.041 | 0.808 | 30.7 |

| Metric | Mean change (Hand − Gripper) | Hand higher (models) |
|---|---|---|
| Goal-State Completion (M1) | +0.002 | 6/11 |
| Action-Event Completion (M2) | +0.008 | 8/11 |
| Functional Contact Transfer (M3) | +0.055 | 11/11 |
| Embodiment Correctness (M4) | +0.047 | 8/11 |
| Video Quality (M5) | +0.004 | 8/11 |
| H2RCore (0–100) | +3.3 | 9/11 |
| Model | Ref. | Goal | Action | Contact | Embod. | Quality | Core |
|---|---|---|---|---|---|---|---|
| Parallel-Jaw Gripper | |||||||
| Kling-V3 | No | 0.710 | 0.807 | 0.751 | 0.707 | 0.798 | 74.5 |
| Yes | 0.673 | 0.760 | 0.577 | 0.479 | 0.779 | 61.0 | |
| Seedance 2.0 | No | 0.725 | 0.813 | 0.776 | 0.768 | 0.793 | 77.3 |
| Yes | 0.711 | 0.794 | 0.674 | 0.595 | 0.784 | 68.5 | |
| Wan2.7 | No | 0.706 | 0.791 | 0.766 | 0.772 | 0.796 | 76.5 |
| Yes | 0.714 | 0.811 | 0.871 | 0.875 | 0.781 | 83.1 | |
| Dexterous Hand | |||||||
| Kling-V3 | No | 0.707 | 0.800 | 0.819 | 0.885 | 0.802 | 81.7 |
| Yes | 0.629 | 0.734 | 0.772 | 0.728 | 0.799 | 73.4 | |
| Seedance 2.0 | No | 0.744 | 0.832 | 0.855 | 0.911 | 0.799 | 84.6 |
| Yes | 0.736 | 0.824 | 0.876 | 0.753 | 0.794 | 80.2 | |
| Wan2.7 | No | 0.718 | 0.804 | 0.835 | 0.910 | 0.795 | 83.1 |
| Yes | 0.712 | 0.819 | 0.905 | 0.873 | 0.789 | 84.2 |

| Element | Embodied-manipulation concern | H2R-Bench operationalization | Design origin |
|---|---|---|---|
| Task families: task-defining physical state changes | |||
| F1: Rigid rearrangement | Object pose, support, or containment | Place or transport a rigid object into the demonstrated spatial relation. | Rigid transport and placement tasks. |
| F2: Mechanism actuation | State of an articulated mechanism | Open, close, toggle, press, or rotate a task-relevant mechanism. | Interaction with articulated objects. |
| F3: Insertion and assembly | Connection, fit, or attachment relation | Establish or remove a constrained connection between entities. | Precision alignment and constrained contact. |
| F4: Deformable configuration | Non-rigid shape or configuration | Produce the demonstrated fold, bend, compression, or shape change. | Deformable-object manipulation. |
| F5: Bulk-material transfer | Distribution or containment of material | Pour, scoop, transfer, or mix material between regions or containers. | Many-particle and material-flow manipulation. |
| F6: Surface/material transformation | Local surface condition or material integrity | Produce a visible local change through wiping, spreading, cutting, peeling, or related interaction. | Tool-mediated local transformation. |
| Evaluation dimensions: evidence required for valid H2R generation | |||
| M1: Goal-State Completion | Was the demonstrated task state reached? | Score weighted predicates over the visible final state. | Task-success and outcome evaluation in robotic video benchmarks. |
| M2: Action-Event Completion | Were the required manipulation events shown? | Score completion of source-derived action events. | Action-completeness evaluation in robotic video benchmarks. |
| M3: Functional Contact Transfer | Did robot contact support the source-consistent object response? | Evaluate contact region, establishment, mode, temporal object response, and embodiment-compatible strategy. | Contact-mediated manipulation and H2R interaction grounding. |
| M4: Embodiment Correctness | Did the requested robot perform the manipulation? | Evaluate robot presence, human absence, embodiment category, end-effector subtype, and temporal structure. | Robot-structure and embodiment compliance. |
| M5: Video Quality | Is the generated video visually and temporally well formed? | Measure imaging quality, aesthetic quality, temporal stability, and motion smoothness. | Task-agnostic video-generation quality. |
| Stage | Output | Quality control |
|---|---|---|
| Source curation | Curated clips across six families | Identifiable manipulated entities, visible task-relevant state change, and sufficient interaction evidence. |
| Clip grounding | 32 ordered source frames per clip | First and last frames are retained; annotations identify initial state, contact, core transition, and final state when visible. |
| Structured annotation | Goals, events, milestones, interaction, and embodiment strategies | Strict JSON schema with canonical event identifiers and a fixed six-family taxonomy. |
| Completion and validation | Schema-complete case records | Only missing fields are completed; existing non-empty fields are preserved; schema and type mismatches are rejected. |
| Manual verification | All benchmark annotations | Every record is checked against its source video and corrected before evaluation. |
| Uncertainty accounting | Validity and ambiguity fields | Every record has a validity decision; notes document residual uncertainty without changing the official evaluation set. |
| Target | Input | M1 | M2 | M3 | M4 | M5 | Core |
|---|---|---|---|---|---|---|---|
| Parallel-Jaw Gripper | Video | 0.737 | 0.850 | 0.709 | 0.598 | 0.793 | 70.9 |
| 9 images | 0.744 | 0.848 | 0.284 | 0.104 | 0.783 | 43.4 | |
| Dexterous Hand | Video | 0.768 | 0.857 | 0.861 | 0.898 | 0.799 | 85.1 |
| 9 images | 0.753 | 0.856 | 0.313 | 0.079 | 0.782 | 43.7 |
| Model | Parallel-Jaw Gripper Core [95% CI] | Dexterous Hand Core [95% CI] |
|---|---|---|
| Kling-V3 | 74.5 [73.6, 75.3] | 81.7 [80.8, 82.6] |
| Seedance 2.0 | 77.3 [76.5, 78.1] | 84.6 [84.0, 85.3] |
| Wan2.7 | 76.5 [75.7, 77.4] | 83.1 [82.3, 83.9] |
| Grok Imagine | 50.1 [49.0, 51.1] | 49.2 [48.3, 50.1] |
| Veo 3.1 | 49.6 [48.9, 50.4] | 57.0 [56.1, 57.8] |
| Hunyuan-1.5 | 30.0 [28.8, 31.2] | 30.7 [29.5, 31.8] |
| LTX-2.3 | 32.1 [31.0, 33.2] | 39.8 [38.6, 40.9] |
| Mitty-EPIC | 61.5 [60.5, 62.5] | 56.1 [55.2, 57.0] |
| SkyReels-V3 | 31.5 [30.5, 32.6] | 34.6 [33.6, 35.6] |
| LongCat | 31.0 [29.9, 32.1] | 32.0 [30.9, 33.2] |
| Wan2.2 | 32.4 [31.4, 33.3] | 33.7 [32.7, 34.7] |
| Comparison | Gripper Δ Core [95% CI] | Hand Δ Core [95% CI] |
|---|---|---|
| Seedance − Wan2.7 | +0.79 [+0.08, +1.48] | +1.52 [+0.92, +2.16] |
| Seedance − Kling | +2.82 [+2.04, +3.61] | +2.89 [+2.15, +3.73] |
| Wan2.7 − Kling | +2.04 [+1.40, +2.66] | +1.37 [+0.66, +2.16] |
| Score | M1 | M2 | M3 | M4 | Transfer Subscore |
|---|---|---|---|---|---|
| Pearson r | 0.791 | 0.818 | 0.880 | 0.877 | 0.930 |
| Judge Pair | M1 | M2 | M3 | M4 |
|---|---|---|---|---|
| Gemini / Qwen | 0.695 | 0.691 | 0.741 | 0.874 |
| Gemini / GPT | 0.582 | 0.636 | 0.726 | 0.891 |
| Qwen / GPT | 0.656 | 0.690 | 0.809 | 0.892 |
| Model | Interface | Source input |
|---|---|---|
| Seedance 2.0 | Video | Full clip |
| Wan2.7 | Video | Full clip |
| Kling-V3 | Video | Full clip |
| Veo 3.1 | Frame | First + last |
| Grok Imagine Video | Frame | Up to 7 frames |
| HunyuanVideo 1.5-I2V | Frame | Ordered frame(s) |
| LTX-2.3 | Frame | Ordered frame(s) |
| Mitty-EPIC14B | Frame | Ordered frame(s) |
| SkyReels-V3-R2V | Frame | Ordered frame(s) |
| LongCat | Frame | Ordered frame(s) |
| Wan2.2 | Frame | First frame |
| Model | Decoded Size | Frames @ fps |
|---|---|---|
| Seedance 2.0 | 1280×720 | 121 @ 24 |
| Wan2.7 | 1280×720 | 150 @ 30 |
| Kling-V3 | 1280×720 | 121 @ 24 |
| Veo 3.1 | 1280×720 | 144 @ 24 |
| Grok Imagine Video | 1280×720 | 121 @ 24 |
| HunyuanVideo 1.5-I2V | 1280×720 | 121 @ 24 |
| LTX-2.3 | 1280×720 | 120 @ 24 |
| Mitty-EPIC14B | 1280×720 | 37 @ 8 |
| SkyReels-V3-R2V | 1280×720 | 121 @ 24 |
| LongCat | 832×480 | 80 @ 15 |
| Wan2.2 | 720P area | 121 @ 24 |
| Parallel-Jaw Gripper | Dexterous Hand | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Task | Model | Goal Completion | Action Completion | Contact Transfer | Embod. Correct. | Video Quality | Core | Goal Completion | Action Completion | Contact Transfer | Embod. Correct. | Video Quality | Core |
| Kling-V3 | 0.736 | 0.837 | 0.782 | 0.735 | 0.803 | 77.1 | 0.738 | 0.837 | 0.847 | 0.886 | 0.807 | 83.7 | |
| Seedance 2.0 | 0.762 | 0.857 | 0.836 | 0.824 | 0.798 | 82.1 | 0.775 | 0.853 | 0.880 | 0.908 | 0.802 | 86.1 | |
| Wan2.7 | 0.744 | 0.843 | 0.824 | 0.776 | 0.793 | 79.7 | 0.777 | 0.845 | 0.890 | 0.913 | 0.799 | 86.4 | |
| Grok Imagine | 0.608 | 0.704 | 0.555 | 0.430 | 0.806 | 57.3 | 0.656 | 0.742 | 0.561 | 0.368 | 0.811 | 57.0 | |
| Veo 3.1 | 0.751 | 0.791 | 0.574 | 0.197 | 0.790 | 54.2 | 0.780 | 0.830 | 0.653 | 0.305 | 0.800 | 60.9 | |
| Hunyuan-1.5 | 0.520 | 0.446 | 0.188 | 0.000 | 0.812 | 28.2 | 0.483 | 0.429 | 0.209 | 0.027 | 0.814 | 28.9 | |
| LTX-2.3 | 0.424 | 0.550 | 0.344 | 0.018 | 0.784 | 33.3 | 0.455 | 0.558 | 0.422 | 0.170 | 0.791 | 40.9 | |
| Mitty-EPIC | 0.522 | 0.591 | 0.540 | 0.575 | 0.733 | 57.5 | 0.528 | 0.640 | 0.591 | 0.402 | 0.733 | 54.6 | |
| SkyReels-V3 | 0.408 | 0.527 | 0.267 | 0.000 | 0.792 | 29.9 | 0.376 | 0.489 | 0.333 | 0.061 | 0.795 | 32.8 | |
| LongCat | 0.412 | 0.502 | 0.208 | 0.000 | 0.799 | 27.9 | 0.394 | 0.476 | 0.306 | 0.032 | 0.798 | 31.2 | |
| F1 Rigid | Wan2.2 | 0.377 | 0.547 | 0.229 | 0.000 | 0.776 | 28.5 | 0.422 | 0.553 | 0.249 | 0.000 | 0.774 | 29.8 |
| Kling-V3 | 0.641 | 0.792 | 0.686 | 0.682 | 0.802 | 70.6 | 0.666 | 0.796 | 0.770 | 0.885 | 0.804 | 79.6 | |
| Seedance 2.0 | 0.760 | 0.847 | 0.737 | 0.742 | 0.797 | 76.4 | 0.735 | 0.854 | 0.828 | 0.927 | 0.801 | 84.5 | |
| Wan2.7 | 0.695 | 0.783 | 0.704 | 0.771 | 0.794 | 74.4 | 0.676 | 0.795 | 0.778 | 0.913 | 0.799 | 80.8 | |
| Grok Imagine | 0.646 | 0.729 | 0.491 | 0.527 | 0.791 | 59.1 | 0.683 | 0.770 | 0.573 | 0.344 | 0.807 | 57.4 | |
| Veo 3.1 | 0.670 | 0.754 | 0.508 | 0.049 | 0.785 | 45.9 | 0.691 | 0.824 | 0.620 | 0.151 | 0.793 | 53.8 | |
| Hunyuan-1.5 | 0.433 | 0.517 | 0.178 | 0.014 | 0.807 | 28.1 | 0.399 | 0.481 | 0.202 | 0.123 | 0.809 | 31.0 | |
| LTX-2.3 | 0.478 | 0.514 | 0.278 | 0.000 | 0.774 | 31.0 | 0.523 | 0.613 | 0.328 | 0.157 | 0.786 | 39.4 | |
| Mitty-EPIC | 0.515 | 0.588 | 0.537 | 0.579 | 0.746 | 57.5 | 0.507 | 0.609 | 0.540 | 0.393 | 0.746 | 52.2 | |
| SkyReels-V3 | 0.454 | 0.552 | 0.223 | 0.000 | 0.790 | 29.7 | 0.425 | 0.559 | 0.303 | 0.011 | 0.794 | 32.1 | |
| LongCat | 0.454 | 0.579 | 0.243 | 0.000 | 0.792 | 30.7 | 0.403 | 0.577 | 0.275 | 0.011 | 0.794 | 31.2 | |
| F2 Mechanism | Wan2.2 | 0.427 | 0.607 | 0.234 | 0.000 | 0.763 | 30.2 | 0.526 | 0.672 | 0.264 | 0.000 | 0.762 | 33.5 |
| Kling-V3 | 0.683 | 0.748 | 0.748 | 0.735 | 0.794 | 73.9 | 0.680 | 0.739 | 0.796 | 0.907 | 0.799 | 80.4 | |
| Seedance 2.0 | 0.722 | 0.792 | 0.834 | 0.839 | 0.789 | 80.8 | 0.737 | 0.832 | 0.867 | 0.907 | 0.793 | 84.7 | |
| Wan2.7 | 0.623 | 0.727 | 0.742 | 0.785 | 0.789 | 73.9 | 0.660 | 0.762 | 0.813 | 0.912 | 0.792 | 81.0 | |
| Grok Imagine | 0.599 | 0.688 | 0.422 | 0.320 | 0.788 | 49.4 | 0.603 | 0.650 | 0.398 | 0.299 | 0.807 | 47.8 | |
| Veo 3.1 | 0.687 | 0.764 | 0.504 | 0.072 | 0.780 | 46.9 | 0.619 | 0.770 | 0.597 | 0.240 | 0.791 | 53.8 | |
| Hunyuan-1.5 | 0.462 | 0.448 | 0.214 | 0.000 | 0.803 | 28.1 | 0.409 | 0.469 | 0.193 | 0.022 | 0.805 | 27.7 | |
| LTX-2.3 | 0.426 | 0.470 | 0.276 | 0.046 | 0.773 | 30.8 | 0.510 | 0.516 | 0.343 | 0.195 | 0.779 | 39.3 |
| Metric | Evidence | Computation |
|---|---|---|
| M1: Goal | 25 generated frames and final-state predicates. | Weighted mean of normalized 0–4 predicate scores. |
| M2: Action | 25 generated frames and required events. | Weighted mean of normalized event-completion scores. |
| M3: Contact | 25 source frames, 25 generated frames, and the contact specification. | Mean of applicable contact dimensions; zero when source grounding fails. |
| M4: Embodiment | 25 generated frames and the target specification. | Weighted mean of five embodiment dimensions; zero on a hard failure. |
| M5: Quality | Decoded generated video. | Mean of MUSIQ, CLIP aesthetic, temporal-stability, and AMT-S scores. |
실제로 확인된 결과
- 원본 영상 전체를 입력받는 3개 모델(Seedance 2.0, Wan2.7, Kling-V3)이 상위권을 차지했고, Seedance 2.0이 H2RCore 그리퍼 77.3점, 다섯손가락 손 84.6점으로 1위, Wan2.7이 76.5/83.1점, Kling-V3가 74.5/81.7점으로 뒤를 이었다.
- 영상 품질(M5)은 모델 간 0.73~0.81로 거의 차이가 없었지만 H2RCore는 30.0~84.6점까지 크게 벌어졌으며 둘의 순위 상관은 약했다(스피어만 ρ=0.14).
- 사람 평가자 3명이 채점한 결과와 AI 판정관 점수의 순위 상관은 ρ=0.883, 종합 상관은 피어슨 r=0.930으로 높게 나와 자동 평가가 사람 평가와 상당히 일치했다.
- 11개 모델 중 9개가 평행 그리퍼보다 다섯손가락 로봇 손 조건에서 평균 3.3점 더 높은 점수를 받았고, 영상 조건 입력 모델 3종(Seedance, Wan2.7, Kling-V3)에서는 각각 7.3, 6.6, 7.2점 상승으로 효과가 더 크게 나타났다.
- 로봇 참고 이미지를 추가로 준 경우 Wan2.7은 H2RCore가 76.5에서 83.1로 크게 올랐지만 Kling-V3는 13.5점, Seedance는 8.8점 하락해 모델마다 효과가 정반대로 나타났다.
어디에 쓸 수 있나
- 사람이 찍은 작업 영상을 로봇 학습 데이터로 자동 변환하려는 파이프라인을 만들 때, 완성된 후 영상 품질만 보지 말고 접촉·형태 일치 여부를 별도로 점검하는 체크리스트로 활용할 수 있다.
- 영상 생성 AI를 로봇 데이터 증강 도구로 도입하기 전에, 이 벤치마크의 5가지 평가 축(목표·동작·접촉·형태·품질)을 자체 평가 기준으로 참고할 수 있다.
- 그리퍼용과 다섯손가락 손용 중 어떤 로봇 형태를 지정할지 고를 때, 사람 손 모양과 더 비슷한 형태를 쓰는 쪽이 접촉 전이에 유리할 수 있다는 참고 자료로 쓸 수 있다.
한계와 남은 검증
- 이 벤치마크는 영상에 보이는 증거만 평가하며, 실제 물리적으로 로봇이 그 동작을 수행할 수 있는지나 학습된 정책의 실제 성능은 확인하지 않는다.
- EgoDex에서 뽑은 120개 짧은 클립과 그리퍼·다섯손가락 손 두 형태만 다루므로 로봇 종류나 작업 상황의 다양성은 일부만 반영한다.
- 각 모델이 지원하는 입력 방식(전체 영상 vs 몇 장의 프레임)이 서로 달라 모델 능력과 인터페이스 차이가 섞여 있어 순수한 성능 비교로 보기는 어렵다.
- 가려짐, 미세한 접촉, 심한 생성 오류가 있는 경우 AI 판정관의 채점도 불확실할 수 있으며, 더 긴 시범 영상이나 3차원 정보를 활용한 확장은 향후 과제로 남아 있다.
왜 중요한가
로봇 학습용 데이터를 만들 때 '사람 영상을 로봇 영상으로 바꿔주는 AI'를 쓰겠다는 아이디어가 유행하는데, 이 연구는 지금 나온 모델들이 겉보기 좋은 영상만 만들고 실제로는 로봇이 물건을 제대로 만지지도, 요청한 로봇 형태를 유지하지도 못한다는 걸 구체적 수치로 보여준다. 앞으로 이런 영상 생성 모델을 로봇 데이터로 쓰려는 사람들은 화질이나 그럴듯함이 아니라 접촉과 형태 일치를 반드시 따로 확인해야 한다.
이 논문의 용어
- world model(월드 모델) · 미래 상황이나 영상을 예측해 만들어내는 AI 모델. 여기서는 영상 생성 AI를 로봇의 미래 행동을 예측하는 도구로 본다
- 임바디먼트(embodiment) · 로봇의 몸 형태, 예를 들어 평행 그리퍼나 다섯손가락 로봇 손처럼 실제 물체를 다루는 신체 구조
- H2RCore · 다섯 가지 평가 항목(M1~M5)을 가중평균해 0~100점으로 합친 이 연구의 종합 점수
- MLLM 판정관 · 영상을 보고 점수를 매기는 대형 멀티모달 언어모델. 이 논문에서는 Gemini, Qwen, GPT 세 개를 사용했다
- functional contact(기능적 접촉) · 로봇이 물체와 실제로 작업 목적에 맞게 접촉했는지를 뜻하며, 손 모양이나 경로가 달라도 같은 기능을 하면 인정한다
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Dingyi Rong et al., arXiv:2608.13049, arxiv-nonexclusive