google-ai-edge/ai-edge-quantizer
谷歌发布工具,无需重新训练就能把训练好的AI模型压缩进手机和边缘芯片
AI Edge Quantizer(AEQ)是谷歌推出的训练后压缩工具,用于把已经训练好的LiteRT(原TensorFlow Lite)模型变得更小更快,方便部署到手机CPU、GPU和NPU上。开发者可以对不同层混用不同精度,也可以只选择特定层进行压缩,还能直接测量压缩后的精度损失。该工具同时提供命令行和Python接口。
它做什么
- 把视觉模型、大语言模型和生成式AI流水线压缩成INT8、INT4等低比特整数格式,部署到手机CPU、GPU、NPU上
- 支持用正则表达式只对特定层做选择性量化,也支持混合精度,比如部分层用INT4、部分层用INT8
- 内置分块量化、通过Hadamard变换抑制异常值以在INT4/INT2等超低比特下保持精度,以及GPTQ、OCTAV等优化算法
- 提供三种量化方式:无需校准数据的动态量化、质量最好但没有速度提升的仅权重量化,以及需要校准数据、把权重和激活值都变成整数的静态量化
- 提供命令行工具aeq和Python API,内置MSE、SNR、余弦相似度、KL散度等误差校验,并能与Model Explorer配合可视化量化效果
为什么重要
训练后量化是让大模型在手机等资源受限设备上落地的关键方法之一,且不需要承担重新训练的成本。分层选择压缩和内置精度校验功能,让开发者在实际部署包括最新大语言模型时更容易权衡速度与精度。
本仓库术语
- 训练后量化(PTQ) · 模型训练完成后,不重新训练,直接把数值转成低比特格式来压缩模型
- LiteRT · 谷歌面向移动和边缘设备的AI运行时,前身叫TensorFlow Lite
- NPU · 专门用于加速AI运算的芯片
- 静态量化与校准 · 用样本数据先跑一遍模型收集统计信息,再把权重和激活值都转成整数的量化方式
- GPTQ、OCTAV · 用于减少量化带来精度损失的优化算法
仓库简介(英文)
AI Edge Quantizer: flexible post training quantization for LiteRT models.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库