K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/LiteRT-CLI

35PythonApache-2.0

一个命令行工具搞定端侧AI模型的转换、瘦身和运行

LiteRT-CLI是谷歌推出的命令行工具,能把PyTorch等模型转换成手机和电脑上使用的LiteRT(原TFLite)格式,通过量化压缩模型体积,为特定芯片预先编译,并在真实设备上运行、跑基准测试和可视化模型结构。它支持CPU、GPU、NPU等硬件,覆盖桌面、安卓和云端等平台。目前仍处于早期预览阶段,平台和功能支持有限。

它做什么

  1. 一条litert命令即可覆盖下载、转换、量化、编译、运行、基准测试、可视化整个模型开发流程
  2. 可以从Hugging Face下载模型,将PyTorch模型转换为LiteRT格式,通过INT8/INT4量化压缩模型,并针对高通NPU等特定芯片进行提前编译(AOT)
  3. 能在安卓设备或桌面上用CPU/GPU/NPU实际运行模型、测量延迟,并用Model Explorer将模型结构可视化
  4. 像Gemma这样的大语言模型可以通过litert lm命令运行和测试性能,还能通过技能文件接入编码智能体,用自然语言提示完成任务
  5. 目前compile功能只支持Linux,macOS和Windows部分功能缺失,NPU目前只支持高通,联发科和谷歌Tensor即将支持

为什么重要

开发端侧AI模型时,转换、量化、真机测试、性能测量往往要用不同工具,十分繁琐,这个工具把它们整合进一个命令行,大幅提升开发效率。它与编码智能体的结合意味着只用自然语言指令就能自动完成模型优化和部署工作,对实际工作很有帮助。

本仓库术语

  • LiteRT · 谷歌面向手机和端侧设备的轻量AI模型格式,前身是TFLite
  • 量化(Quantization) · 降低模型数值精度(如INT8)以减少体积和计算量的技术
  • NPU · 专门用于神经网络运算的芯片
  • AOT编译 · 运行前针对特定硬件预先编译,以减少运行时的启动延迟
  • Model Explorer · 谷歌推出的以图形方式展示AI模型内部结构的工具

仓库简介(英文)

A convenient CLI to streamline LiteRT related development workflows, including converting, quantizing, compiling, managing, running, benchmarking and visualizing LiteRT (TFLite) models on various hardwares (CPU / GPU / NPU) across platforms (desktop, mobile or cloud).

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道