K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/LiteRT-LM

6,127C++Apache-2.0

谷歌开源了能让大语言模型直接在手机、笔记本和手表上运行的推理引擎

LiteRT-LM是谷歌开发的开源推理框架,能让大语言模型(LLM)不依赖服务器,直接在手机、笔记本电脑、树莓派等边缘设备上运行。它支持Gemma、Llama、Phi-4、Qwen等多种模型,具备GPU和NPU加速、图像与语音输入支持以及可用于智能体的函数调用功能。目前已经实际用在Chrome、Chromebook Plus、Pixel Watch等谷歌产品中。

它做什么

  1. 做了什么:构建了一个编排层,让大语言模型直接在Android、iOS、网页、桌面和物联网设备上运行,而不是依赖云端服务器
  2. 怎么做的:该框架运行在谷歌轻量级推理引擎LiteRT之上,提供Python、Kotlin、Swift、JavaScript、C++等多语言API,并通过CPU/GPU/NPU加速以及多令牌预测(MTP)等技术提升速度
  3. 效果如何:据谷歌官方博客,将MTP技术用于Gemma4模型可使推理速度提升最多3倍,并且在树莓派或笔记本上只需一行命令就能下载并运行模型
  4. 最新的v0.16.0版本为所有支持平台发布了带版本号的C API预编译库文件,并为Linux arm64平台新增了实验性的YNNPACK加速功能

为什么重要

在设备本地运行模型而非把数据发送到服务器,意味着应用可以离线使用且用户数据不外泄。对开发者来说,这提供了一套统一的工具,可以用同样的方式给Android应用、网页和桌面程序添加设备端AI能力。

本仓库术语

  • 大语言模型(LLM) · 通过海量文本训练、能够对话、摘要、写代码的AI模型
  • 边缘设备 · 手机、笔记本电脑、物联网设备等用户手中的终端,区别于远程服务器
  • NPU · 专门为AI运算设计的芯片
  • 多令牌预测(MTP) · 一次预测多个词元(token)以加快生成速度的技术
  • 函数调用(Tool Use) · 让AI模型自主调用外部程序或工具来完成任务的能力

仓库简介(英文)

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道