google-ai-edge/LiteRT-LM
谷歌开源了能让大语言模型直接在手机、笔记本和手表上运行的推理引擎
LiteRT-LM是谷歌开发的开源推理框架,能让大语言模型(LLM)不依赖服务器,直接在手机、笔记本电脑、树莓派等边缘设备上运行。它支持Gemma、Llama、Phi-4、Qwen等多种模型,具备GPU和NPU加速、图像与语音输入支持以及可用于智能体的函数调用功能。目前已经实际用在Chrome、Chromebook Plus、Pixel Watch等谷歌产品中。
它做什么
- 做了什么:构建了一个编排层,让大语言模型直接在Android、iOS、网页、桌面和物联网设备上运行,而不是依赖云端服务器
- 怎么做的:该框架运行在谷歌轻量级推理引擎LiteRT之上,提供Python、Kotlin、Swift、JavaScript、C++等多语言API,并通过CPU/GPU/NPU加速以及多令牌预测(MTP)等技术提升速度
- 效果如何:据谷歌官方博客,将MTP技术用于Gemma4模型可使推理速度提升最多3倍,并且在树莓派或笔记本上只需一行命令就能下载并运行模型
- 最新的v0.16.0版本为所有支持平台发布了带版本号的C API预编译库文件,并为Linux arm64平台新增了实验性的YNNPACK加速功能
为什么重要
在设备本地运行模型而非把数据发送到服务器,意味着应用可以离线使用且用户数据不外泄。对开发者来说,这提供了一套统一的工具,可以用同样的方式给Android应用、网页和桌面程序添加设备端AI能力。
本仓库术语
- 大语言模型(LLM) · 通过海量文本训练、能够对话、摘要、写代码的AI模型
- 边缘设备 · 手机、笔记本电脑、物联网设备等用户手中的终端,区别于远程服务器
- NPU · 专门为AI运算设计的芯片
- 多令牌预测(MTP) · 一次预测多个词元(token)以加快生成速度的技术
- 函数调用(Tool Use) · 让AI模型自主调用外部程序或工具来完成任务的能力
仓库简介(英文)
LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库