컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

google-ai-edge/eval

9PythonApache-2.0

구글이 온디바이스 AI 모델 성능을 표준 벤치마크로 재는 도구를 공개했다

ai-edge-eval은 구글이 만든 온디바이스용 경량 모델 포맷인 LiteRT LM 모델과 HuggingFace 같은 일반 모델을 같은 방식으로 평가할 수 있는 커맨드라인 도구다. ifeval, mmlu, piqa, mmmu 같은 텍스트 및 이미지+텍스트 벤치마크를 lm-eval이나 lighteval 같은 기존 평가 프레임워크 위에서 실행한다. 사용자가 직접 만든 데이터셋과 채점 기준으로 커스텀 평가를 등록해 돌릴 수도 있다.

무엇을 하는 레포인가

  1. LiteRT LM 모델과 HuggingFace 등 일반 모델을 하나의 CLI로 동일하게 평가할 수 있게 했다
  2. lm-eval, lighteval 두 평가 프레임워크를 백엔드로 골라 쓸 수 있고, 텍스트 전용 및 이미지+텍스트(멀티모달) 과제를 모두 지원한다
  3. --limit, --sample-range 옵션으로 평가 샘플 수를 줄여 빠르게 디버깅할 수 있다
  4. JSON Lines 형식 데이터셋과 채점 함수만 파이썬 파일로 등록하면 자기만의 평가 과제를 만들 수 있다
  5. 리눅스, macOS, WSL2 환경에서 동작하며 Apache 2.0 라이선스로 공개됐다

왜 중요한가

온디바이스에 올리는 소형 언어모델을 만들거나 튜닝하는 개발자에게 성능 측정 방식을 통일해주는 표준 도구가 된다. 벤치마크 데이터셋 자체는 각각 라이선스가 달라 사용자가 직접 확인해야 한다는 점도 함께 짚는다.

이 레포의 용어

  • LiteRT LM · 구글의 온디바이스 실행용 경량 언어모델 포맷
  • lm-eval · EleutherAI가 만든 언어모델 벤치마크 평가 하네스
  • lighteval · HuggingFace 계열의 대안 평가 프레임워크
  • 멀티모달(multimodal) · 이미지와 텍스트를 함께 입력받아 처리하는 방식
  • JSON Lines(.jsonl) · 한 줄에 하나씩 JSON 객체를 쓰는 데이터 파일 형식

레포 원문 소개 (영문)

google-ai-edge/eval

소속 · google-deepmind

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사