컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

20만원짜리 헤드셋으로 550시간 분량의 1인칭 스테레오 영상을 모아 로봇 학습용 데이터로 공개한 프로젝트

arXiv:2608.082852026-08-07

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

20만원짜리 헤드셋으로 550시간 분량의 1인칭 스테레오 영상을 모아 로봇 학습용 데이터로 공개한 프로젝트

Ego-OSCAR는 시중에서 구할 수 있는 부품과 3D 프린팅 부품만으로 만든 대당 200달러 이하의 머리 착용형 스테레오 카메라·IMU 촬영 장비다. 저자들은 이 장비로 인도 내 25명의 기여자를 통해 40개 이상의 실내 환경에서 약 550시간(카메라당) 분량의 1인칭 스테레오 영상과 IMU 데이터를 모았고, 이를 행동 캡션과 3D 손 재구성 정보까지 붙여 공개했다. Project Aria 같은 고가 연구용 장비의 정밀도를 노리는 대신, 대규모 크라우드소싱 촬영이 가능한 가장 저렴하고 방어 가능한 대안을 만드는 것이 목표라고 밝힌다.

METAL MEDIA 해설 도표

Ego-OSCAR 촬영-처리 파이프라인

증거 상태측정 결과가 보고됨

  1. 헤드셋 하드웨어글로벌 셔터 스테레오 카메라, 6축 IMU, SBC, ESP32 마이크로컨트롤러로 구성된 200달러 미만 착용형 장비
  2. 시간 동기화카메라 노출 신호(SoE)와 IMU를 ESP32가 병합하고 LED 플래시로 프레임을 앵커링해 700µs 오차로 정렬
  3. 현장 배포인도 내 25명 기여자가 40개 이상 환경에서 6개월간 1,462개 세션, 카메라당 약 550시간 촬영
  4. 품질 필터워치독, 배치 검증, 손 가시성 선별을 거쳐 96% 세션이 사용 가능한 데이터로 확정
  5. 주석 계층20만9,315개 자유형식 행동 캡션과 WiLoR 기반 프레임 단위 3D 손 재구성이 전체 코퍼스에 부착
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 하드웨어 동기화된 글로벌 셔터 스테레오 카메라, 6축 IMU, 임베디드 리눅스 보드(SBC), 실시간 마이크로컨트롤러를 조합해 대당 약 200달러(약 19,100루피) 부품비로 헤드셋형 촬영 장비를 만들었다.
  2. 카메라의 노출 시작 신호(SoE)를 마이크로컨트롤러가 받아 IMU 데이터와 시간 동기화하고, LED 깜빡임으로 프레임 번호를 앵커링하는 방식으로 영상-IMU 간 잔차 지연을 700마이크로초까지 줄였다.
  3. 13대의 장비로 촬영한 결과 정류 후 평균 픽셀당 에피폴라 오차 0.4px, 카메라별 재투영 오차 0.03px 미만을 달성했고, SGBM·RAFT-Stereo로 전체 시야각에서 디스패리티(깊이) 지도를 별도 튜닝 없이 뽑아낼 수 있었다.
  4. 6개월간의 실전 배포에서 전체 촬영 세션의 96%가 사용 가능한 데이터를 만들어냈고, 손 검출기(WiLoR)는 전체 프레임의 94%에서 손을 검출했으며, 20개 보류 시퀀스 중 12개에서 시각-관성 주행거리계(VINS-Fusion)가 안정적 궤적을 만들어냈다(같은 조건에서 능동 스테레오를 쓰는 Intel RealSense는 15개).
  5. 1,462개 세션, 25명 기여자, 40개 이상 환경에서 20만9,315개의 자유형식 행동 구간 캡션과 프레임 단위 3D 손 재구성 데이터를 공개했으며, 상위 20개 행동 표현이 전체의 1.5%에 불과한 롱테일 분포를 보였다.
Figure 1: Open-source egocentric capture system.
Figure 1: Open-source egocentric capture system.
Table 1: Bill of Materials.
ComponentINRFunction
Dexcin USB stereo camera6,300Stereo capture, global shutter
Radxa Rock 5C (2 GB)6,500SBC: capture, encode, store
Heatsink (Radxa)800Thermal management
256 GB SD card2,500OS + ∼16–18 hr recording
USB cable, A–C 90°300Camera ↔ SBC
ICM-20948 6-axis IMU800Inertial sensing
Seeed Xiao ESP32-S3650UX + watchdog MCU
Misc. electronics300LEDs, buzzer, button, wiring
3D-printed shells + screws300Enclosure
Visor / cap300Head mount
USB-C PD cable, 90°150SBC ↔ power
10,000 mAh power bank500Power
Total19,100∼USD 200
(b) Mechanical Outline
(b) Mechanical Outline
Table 2: Comparison with existing egocentric datasets. Figures are as reported by each dataset’s own publication. “Cam-h” denotes camera-hours. Ego-Exo4D hours combine egocentric and exocentric video.
DatasetHoursWearersCameraSync. IMUDense action labelsOpen HW
Ego4D [7]3,670931Mono consumer, rolling shutter (stereo in a subset)PartialTimestamped narrationsNo
Ego-Exo4D [8]1,286740Aria: mono RGB + 2 mono SLAMYesNarrations + expert commentaryNo
EPIC-K.-100 [2]10037Mono head-mountedNo90K segments, closed taxonomy (97 verbs / 300 nouns)No
Nymeria [15]300264Aria + body mocapYes301.5K narration sentencesNo
Ours550/cam (1,100 cam-h)25Calibrated RGB stereo, global shutter, per-session calib.Yes 120 Hz209,315 segments, open vocabulary, ≈100% coverageYes ∼USD 200
(c) Device in action
(c) Device in action
Table 3: Dataset overview: measured dimensions and what each supports.
DimensionEvidenceRelevance
Video scale≈550 h per camera (≈1,100 stereo cam-h)Large calibrated stereo RGB corpus
Capture geometrySynchronized pair + per-session calibrationMetric binocular depth cues, not just RGB
Delivery formatMP4 (H.264, 1280×720, 30 fps)Direct ingestion into video pipelines
Label densityMedian 94 segments/sessionDense temporal supervision, not clip-level tags
Action vocabulary460 observed verbsCoverage of manipulation primitives
Object vocabulary32,630 object phrasesWide object, material and tool coverage
Effective breadth57,104 verb–object combinationsCompositional, resistant to rare-label inflation
Temporal structure192,509 ordered task transitionsSequence structure for world models
Contributors25 user IDs / 13 devicesVariation in behavior, routine and execution style
Figure 2: System Overview: Hardware architecture.
Figure 2: System Overview: Hardware architecture.
Table 4: Most frequent observed task expressions and their share of all labeled segments.
Task expressionOccurrencesShare
idle / no manipulation6590.31%
cut sewing thread with scissors2690.13%
close refrigerator door2380.11%
peel garlic clove2120.10%
open refrigerator door2120.10%
turn on kitchen faucet1390.07%
pick up iron from side table1340.06%
turn off kitchen faucet1240.06%
adjust stove burner knob1220.06%
rinse small metal cup under running water1190.06%
adjust stove control knob1150.05%
roll dough on rolling board with rolling pin1090.05%
Figure 3: Data utility results.
Figure 3: Data utility results.
Table 5: Activity-domain composition of the Ego-OSCAR-550h dataset (keyword-derived, approximate).
Activity domainLabeled hoursPrimary in
Cooking and food preparation187 h664 sessions
Dishwashing and kitchen cleanup90 h258 sessions
Textile and craft (sewing, tailoring, flowers)54 h214 sessions
Laundry and clothing care45 h145 sessions
Organizing and storage39 h87 sessions
Cleaning and housekeeping29 h87 sessions
Generic manipulation and transitions106 h7 sessions
(b) Stereo depth maps
(b) Stereo depth maps
Table 6: Per-contributor coverage (percentiles across the 25 contributors).
Contributor-level diversity measure25thMedian75th
Labeled action segments5,1836,25812,075
Distinct task expressions4,0305,6369,115
Distinct action verbs90152178
Figure 4: Task diversity in the Ego-OSCAR-550h dataset.
Figure 4: Task diversity in the Ego-OSCAR-550h dataset.
Table 7: Sequence and composition signals in the dataset.
SignalEvidenceWhy it matters
Verb–object composition57,104 unique combinationsSystematic generalization across skills and objects
Broadly recombined verbs132 verbs with 25+ objects; 66 with 100+Reuse of manipulation primitives across object types
Ordered task transitions192,509 unique transitionsTemporal structure for sequence learning
Per-session sequence richnessMedian 86 transitions/session95.8% of sessions contain 10+ distinct transitions
Cross-contributor support19.4% of instances seen across 2+ contributorsReduces reliance on a single execution style

실제로 확인된 결과

  • 13대 장비 기준 정류 후 평균 에피폴라 오차 0.4px, 카메라당 재투영 오차 0.03px 미만으로 스테레오 기하가 검증됐다.
  • 영상-IMU 간 잔차 시간 지연이 Kalibr 검증 기준 700마이크로초로 확인됐다.
  • 20개 보류 시퀀스 중 12개에서 VINS-Fusion이 안정적 궤적을 냈으며(비교 대상 Intel RealSense는 15/20, 다만 능동 스테레오라는 이점을 가짐), 손 검출률은 전체 코퍼스에서 94%로 측정됐다.
  • 6개월 실전 배포에서 전체 세션의 96%가 사용 가능한 데이터를 만들어냈고, 1,462개 세션·25명 기여자·40개 이상 환경에서 카메라당 약 550시간(총 약 1,100 카메라-시간)이 수집됐다.
  • 20만9,315개의 자유형식 행동 구간과 프레임 단위 3D 손 재구성이 코퍼스 전체에 걸쳐 부착됐고, 상위 20개 행동 표현이 전체 인스턴스의 1.5%에 불과한 롱테일 구조가 확인됐다.

어디에 쓸 수 있나

  • 로봇 학습(VLA)이나 월드모델 사전학습을 위한 대규모 1인칭 시각-행동 데이터 수집
  • 저비용 장비를 자체 제작해 특정 도메인(가사, 공예 등)의 1인칭 데이터를 크라우드소싱으로 모으는 프로젝트
  • 스테레오 깊이·손 동작 인식 연구를 위한 캘리브레이션 완료된 원시 데이터 활용
  • 기존 연구용 장비(Project Aria 등) 접근이 어려운 팀이 자체 촬영 파이프라인을 구축할 때 참고할 오픈 하드웨어 설계

한계와 남은 검증

  • 이 데이터로 학습한 로봇 정책이 기존 데이터셋보다 실제로 더 나은 성능을 낸다는 것은 입증되지 않았으며, 이는 저자들이 밝힌 향후 과제다.
  • 카메라 궤적에 대한 모션캡처나 서베이 기반 정답(ground truth)이 없어 12/20이라는 수치는 궤적 정확도가 아니라 단순 수렴 여부만 나타낸다.
  • 코퍼스는 인도 내 25명의 기여자, 13대의 공유 장비로 촬영되어 가정 중심 활동에 편중되어 있고 지리적으로 제한적이다.
  • 소비자급 IMU가 자세 오차의 주요 원인이며 더 고급 IMU로 교체 가능하지만 아직 벤치마크되지 않았다.
  • 장비는 촬영 전용이라 세션 중 실시간으로 불량 데이터를 걸러낼 수 없고, 착용 시 압박점·처짐·방수 부재 등 내구성 문제도 남아 있다.

왜 중요한가

로봇을 위한 시각-언어-행동(VLA) 모델은 대규모의 다양한 데이터를 필요로 하는데, 텔레오퍼레이션은 비싸고 시뮬레이션은 현실과 차이가 나며 기존 1인칭 데이터셋은 고가 장비로만 만들어져 확장이 어렵다. 누구나 조립할 수 있는 저가 오픈소스 촬영 장비와 그 결과물을 공개함으로써, 데이터 수집의 진입 장벽을 낮추고 연구팀들이 자체적으로 대규모 1인칭 데이터를 모을 수 있게 한다.

이 논문의 용어

  • 1인칭(Egocentric) 영상 · 머리에 착용한 카메라로 촬영해 촬영자의 시야를 그대로 담은 영상
  • 글로벌 셔터 · 센서의 모든 픽셀을 동시에 노출해 빠른 움직임에도 이미지 왜곡이 없는 촬영 방식
  • IMU(관성측정장치) · 가속도와 회전 속도를 측정해 기기의 움직임을 감지하는 센서
  • 스테레오 캘리브레이션 · 좌우 두 카메라의 위치·왜곡 관계를 수치로 정리해 정확한 깊이 계산이 가능하게 하는 보정 작업
  • 시각-관성 주행거리계(VIO) · 영상과 IMU 데이터를 함께 써서 카메라의 이동 경로를 추정하는 기술

저자 · Gunjan Paul

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Gunjan Paul et al., arXiv:2608.08285, CC BY 4.0