google-ai-edge/mediapipe
谷歌推出的工具包,可在手机或浏览器上直接运行人脸、手部、姿态和物体识别AI,无需联网服务器
MediaPipe是谷歌开源的工具包,用于构建人脸、手部、姿态追踪等设备端机器学习功能,可运行在手机、网页浏览器、桌面和边缘设备上。它提供开箱即用的预训练模型,还配有用自己的数据定制模型、以及在浏览器中查看效果的工具。由于处理过程在设备本地完成,图像或视频等输入数据不需要发送到服务器。
它做什么
- MediaPipe Solutions打包了视觉、文本、音频等任务的现成AI功能(Tasks,即API集合),例如物体检测、文本分类、音频分类,可部署到Android、iOS、网页和桌面。
- MediaPipe Model Maker让开发者用自己的数据重新训练这些模型,MediaPipe Studio则可以直接在浏览器中查看效果并进行性能对比。
- 在这些成品方案底层是更低层的C++系统MediaPipe Framework,由数据单元Packets、流程结构Graphs和处理节点Calculators组成,用于搭建自定义的实时机器学习流水线。
- 由于图像、视频、文本等输入数据在设备本地处理而不发送到谷歌服务器,这些API也能用于对隐私敏感的数据,不过关于API使用性能的统计指标仍会发送给谷歌。
- 该项目已用于Google Meet背景特效、AR艺术功能、手语识别界面、假肢控制等实际产品,项目在GitHub上获得36530颗星。
为什么重要
MediaPipe让开发者无需从零训练模型、也不必依赖服务器往返通信,就能为应用添加经过实际验证的实时摄像头与音频AI功能。其设备端隐私设计以及覆盖移动端、网页、桌面、边缘设备的跨平台能力,为需要快速上线感知类功能的团队提供了实用基础。
本仓库术语
- MediaPipe Tasks · 预先做好的视觉/文本/音频AI功能集合,可直接接入应用的API
- MediaPipe Framework · 由Packets、Graphs、Calculators组成的底层C++系统,用于搭建实时处理流水线
- 设备端处理 · 图像或视频等输入数据不发送到服务器,而是直接在设备本地处理
- Model Maker · 用自己的数据重新训练现有模型以进行定制的工具
- MediaPipe Studio · 在浏览器中查看模型效果并比较性能的工具
仓库简介(英文)
Cross-platform, customizable ML solutions for live and streaming media.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库