컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

google-ai-edge/LiteRT-LM

6,127C++Apache-2.0

구글이 스마트폰, 노트북, 워치에서 거대언어모델을 직접 돌리는 실행 엔진을 공개했다

LiteRT-LM은 구글이 만든 오픈소스 추론 프레임워크로, 거대언어모델(LLM)을 서버 없이 휴대폰·노트북·라즈베리파이 같은 엣지 기기에서 직접 실행시켜 준다. Gemma, Llama, Phi-4, Qwen 등 다양한 모델을 지원하고 GPU와 NPU 가속, 이미지·음성 입력, 함수 호출(에이전트) 기능까지 갖췄다. 이미 Chrome, Chromebook Plus, Pixel Watch 같은 구글 실제 제품에 탑재되어 쓰이고 있다.

무엇을 하는 레포인가

  1. 무엇을: LLM을 클라우드 서버 대신 안드로이드, iOS, 웹, 데스크톱, IoT 기기에서 직접 구동시키는 오케스트레이션(실행 관리) 레이어를 만들었다
  2. 어떻게: LiteRT라는 구글의 경량 추론 엔진 위에서 동작하며, 파이썬·코틀린·스위프트·자바스크립트·C++ 등 여러 언어로 API를 제공하고 CPU·GPU·NPU 가속과 다중 토큰 예측(MTP) 같은 최신 기법으로 속도를 높였다
  3. 결과: Gemma4 모델을 MTP 기법과 함께 사용하면 추론 속도가 최대 3배까지 빨라졌고(공식 블로그 기준), 라즈베리파이나 노트북에서도 바로 명령어 한 줄로 모델을 내려받아 실행할 수 있다
  4. 최근 버전(v0.16.0)에서는 C 언어 API를 위한 완성된 라이브러리 파일(prebuilt)을 모든 지원 플랫폼에 배포하고, 리눅스 arm64 기기용 실험적 YNNPACK 가속 기능을 추가했다

왜 중요한가

모델을 서버에 보내지 않고 기기 안에서 바로 실행하면 인터넷 연결 없이도 쓸 수 있고 개인정보가 외부로 나가지 않는다. 개발자 입장에서는 안드로이드 앱, 웹, 데스크톱 프로그램에 동일한 방식으로 AI 기능을 붙일 수 있는 표준 도구가 생긴 셈이다.

이 레포의 용어

  • LLM(거대언어모델) · 방대한 텍스트로 학습되어 대화, 요약, 코드 작성 등을 하는 AI 모델
  • 엣지 기기 · 서버가 아닌 스마트폰, 노트북, IoT 기기처럼 사용자 손 안에 있는 장치
  • NPU · AI 연산에 특화된 전용 반도체 칩
  • 다중 토큰 예측(MTP) · 한 번에 여러 단어(토큰)를 예측해 생성 속도를 높이는 기법
  • 함수 호출(Tool Use) · AI 모델이 외부 프로그램이나 도구를 스스로 호출해 작업을 수행하는 기능

레포 원문 소개 (영문)

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

소속 · google-deepmind

GitHub에서 보기

주목받는 레포

레포 전체 보기 →

METAL MEDIA 최신 기사