컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

google-ai-edge/LiteRT-CLI

35PythonApache-2.0

모바일·엣지용 AI 모델을 변환부터 실행까지 한 번에 처리하는 명령줄 도구

LiteRT-CLI는 구글이 만든 명령줄 도구로, 파이토치 등으로 만든 AI 모델을 스마트폰이나 PC에서 돌아가는 LiteRT(구 TFLite) 형식으로 바꾸고, 크기를 줄이고(양자화), 특정 칩에 맞게 미리 컴파일하고, 실제 기기에서 실행·속도 측정·구조 시각화까지 한 번에 처리한다. CPU, GPU, NPU(신경망 전용 칩) 등 다양한 하드웨어와 데스크톱, 안드로이드, 클라우드 등 다양한 플랫폼을 지원한다. 아직 초기 미리보기 단계로 일부 플랫폼과 기능이 제한적이다.

무엇을 하는 레포인가

  1. download, convert, quantize, compile, run, benchmark, visualize 등 하나의 litert 명령어로 모델 개발 워크플로우 전체를 처리한다
  2. 허깅페이스에서 모델을 내려받고, 파이토치 모델을 LiteRT 형식으로 변환하며, INT8/INT4 양자화로 모델 용량을 줄이고, 퀄컴 NPU 등 특정 칩에 맞춰 미리 컴파일(AOT)할 수 있다
  3. 안드로이드 기기나 데스크톱에서 CPU/GPU/NPU로 모델을 실제 실행하고 지연시간을 벤치마크할 수 있으며, Model Explorer로 모델 구조를 시각화할 수 있다
  4. Gemma 같은 거대언어모델은 litert lm 명령으로 실행 및 벤치마크가 가능하며, 코딩 에이전트에 스킬 파일을 등록해 자연어 프롬프트로도 작업을 시킬 수 있다
  5. 현재는 Linux에서만 compile 기능이 지원되고, macOS와 Windows는 일부 기능이 빠져 있으며 NPU는 퀄컴만 지원되고 미디어텍·구글 텐서는 곧 지원 예정이다

왜 중요한가

엣지 AI 모델을 만들 때 변환, 양자화, 실기기 테스트, 성능 측정 도구가 제각각이라 번거로웠는데, 이를 하나의 명령줄 도구로 통합해 개발 속도를 크게 높여준다. 특히 코딩 에이전트와 연동해 자연어 지시만으로 모델 최적화·배포 작업을 자동화할 수 있다는 점이 실무에 유용하다.

이 레포의 용어

  • LiteRT · 구글의 모바일·엣지 기기용 경량 AI 모델 실행 포맷(과거 TFLite)
  • 양자화(Quantization) · 모델의 숫자 정밀도를 낮춰(예: INT8) 크기와 연산량을 줄이는 기법
  • NPU · 신경망 연산에 특화된 전용 반도체 칩
  • AOT 컴파일 · 실행 전에 미리 특정 하드웨어에 맞게 컴파일해두어 실행 시 지연을 줄이는 방식
  • Model Explorer · AI 모델의 내부 구조를 그래프로 시각화해주는 구글 도구

레포 원문 소개 (영문)

A convenient CLI to streamline LiteRT related development workflows, including converting, quantizing, compiling, managing, running, benchmarking and visualizing LiteRT (TFLite) models on various hardwares (CPU / GPU / NPU) across platforms (desktop, mobile or cloud).

소속 · google-deepmind

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사