google-ai-edge/LiteRT-LM
구글이 스마트폰, 노트북, 워치에서 거대언어모델을 직접 돌리는 실행 엔진을 공개했다
LiteRT-LM은 구글이 만든 오픈소스 추론 프레임워크로, 거대언어모델(LLM)을 서버 없이 휴대폰·노트북·라즈베리파이 같은 엣지 기기에서 직접 실행시켜 준다. Gemma, Llama, Phi-4, Qwen 등 다양한 모델을 지원하고 GPU와 NPU 가속, 이미지·음성 입력, 함수 호출(에이전트) 기능까지 갖췄다. 이미 Chrome, Chromebook Plus, Pixel Watch 같은 구글 실제 제품에 탑재되어 쓰이고 있다.
무엇을 하는 레포인가
- 무엇을: LLM을 클라우드 서버 대신 안드로이드, iOS, 웹, 데스크톱, IoT 기기에서 직접 구동시키는 오케스트레이션(실행 관리) 레이어를 만들었다
- 어떻게: LiteRT라는 구글의 경량 추론 엔진 위에서 동작하며, 파이썬·코틀린·스위프트·자바스크립트·C++ 등 여러 언어로 API를 제공하고 CPU·GPU·NPU 가속과 다중 토큰 예측(MTP) 같은 최신 기법으로 속도를 높였다
- 결과: Gemma4 모델을 MTP 기법과 함께 사용하면 추론 속도가 최대 3배까지 빨라졌고(공식 블로그 기준), 라즈베리파이나 노트북에서도 바로 명령어 한 줄로 모델을 내려받아 실행할 수 있다
- 최근 버전(v0.16.0)에서는 C 언어 API를 위한 완성된 라이브러리 파일(prebuilt)을 모든 지원 플랫폼에 배포하고, 리눅스 arm64 기기용 실험적 YNNPACK 가속 기능을 추가했다
왜 중요한가
모델을 서버에 보내지 않고 기기 안에서 바로 실행하면 인터넷 연결 없이도 쓸 수 있고 개인정보가 외부로 나가지 않는다. 개발자 입장에서는 안드로이드 앱, 웹, 데스크톱 프로그램에 동일한 방식으로 AI 기능을 붙일 수 있는 표준 도구가 생긴 셈이다.
이 레포의 용어
- LLM(거대언어모델) · 방대한 텍스트로 학습되어 대화, 요약, 코드 작성 등을 하는 AI 모델
- 엣지 기기 · 서버가 아닌 스마트폰, 노트북, IoT 기기처럼 사용자 손 안에 있는 장치
- NPU · AI 연산에 특화된 전용 반도체 칩
- 다중 토큰 예측(MTP) · 한 번에 여러 단어(토큰)를 예측해 생성 속도를 높이는 기법
- 함수 호출(Tool Use) · AI 모델이 외부 프로그램이나 도구를 스스로 호출해 작업을 수행하는 기능
레포 원문 소개 (영문)
LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.
GitHub에서 보기주목받는 레포
- vorssaint/vorssaint-utils메뉴바 아이콘 하나로 유료 맥 앱 열 개 값을 대신하는 오픈소스 도구
- Alishahryar1/free-claude-code코딩 AI 에이전트를 무료 모델 49곳에 자유롭게 연결해주는 로컬 프록시
- freestylefly/awesome-gpt-image-2GPT-Image2로 원하는 이미지를 정확히 뽑아내는 프롬프트 설계도 532개를 모아놓은 저장소
- block/buzz사람과 AI 에이전트가 같은 채팅방에서 함께 일하는 오픈소스 협업 플랫폼
- NousResearch/hermes-agentNous Research가 만든, 쓰면 쓸수록 스스로 똑똑해지는 AI 에이전트 Hermes
- virgiliojr94/book-to-skill기술서 PDF를 AI 에이전트가 언제든 펼쳐볼 수 있는 '스킬'로 바꿔주는 도구
- VoltAgent/awesome-agent-skillsAI 코딩 도구가 특정 작업을 '전문가처럼' 하도록 도와주는 매뉴얼 1000개 이상을 한곳에 모았다
- anthropics/claude-plugins-community누구나 만든 Claude 확장 기능을 한곳에 모아 설치하게 해주는 저장소