google-ai-edge/eval
구글이 온디바이스 AI 모델 성능을 표준 벤치마크로 재는 도구를 공개했다
ai-edge-eval은 구글이 만든 온디바이스용 경량 모델 포맷인 LiteRT LM 모델과 HuggingFace 같은 일반 모델을 같은 방식으로 평가할 수 있는 커맨드라인 도구다. ifeval, mmlu, piqa, mmmu 같은 텍스트 및 이미지+텍스트 벤치마크를 lm-eval이나 lighteval 같은 기존 평가 프레임워크 위에서 실행한다. 사용자가 직접 만든 데이터셋과 채점 기준으로 커스텀 평가를 등록해 돌릴 수도 있다.
무엇을 하는 레포인가
- LiteRT LM 모델과 HuggingFace 등 일반 모델을 하나의 CLI로 동일하게 평가할 수 있게 했다
- lm-eval, lighteval 두 평가 프레임워크를 백엔드로 골라 쓸 수 있고, 텍스트 전용 및 이미지+텍스트(멀티모달) 과제를 모두 지원한다
- --limit, --sample-range 옵션으로 평가 샘플 수를 줄여 빠르게 디버깅할 수 있다
- JSON Lines 형식 데이터셋과 채점 함수만 파이썬 파일로 등록하면 자기만의 평가 과제를 만들 수 있다
- 리눅스, macOS, WSL2 환경에서 동작하며 Apache 2.0 라이선스로 공개됐다
왜 중요한가
온디바이스에 올리는 소형 언어모델을 만들거나 튜닝하는 개발자에게 성능 측정 방식을 통일해주는 표준 도구가 된다. 벤치마크 데이터셋 자체는 각각 라이선스가 달라 사용자가 직접 확인해야 한다는 점도 함께 짚는다.
이 레포의 용어
- LiteRT LM · 구글의 온디바이스 실행용 경량 언어모델 포맷
- lm-eval · EleutherAI가 만든 언어모델 벤치마크 평가 하네스
- lighteval · HuggingFace 계열의 대안 평가 프레임워크
- 멀티모달(multimodal) · 이미지와 텍스트를 함께 입력받아 처리하는 방식
- JSON Lines(.jsonl) · 한 줄에 하나씩 JSON 객체를 쓰는 데이터 파일 형식
레포 원문 소개 (영문)
google-ai-edge/eval
GitHub에서 보기주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소