K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/mediapipe

36,530C++Apache-2.0

谷歌推出的工具包,可在手机或浏览器上直接运行人脸、手部、姿态和物体识别AI,无需联网服务器

MediaPipe是谷歌开源的工具包,用于构建人脸、手部、姿态追踪等设备端机器学习功能,可运行在手机、网页浏览器、桌面和边缘设备上。它提供开箱即用的预训练模型,还配有用自己的数据定制模型、以及在浏览器中查看效果的工具。由于处理过程在设备本地完成,图像或视频等输入数据不需要发送到服务器。

它做什么

  1. MediaPipe Solutions打包了视觉、文本、音频等任务的现成AI功能(Tasks,即API集合),例如物体检测、文本分类、音频分类,可部署到Android、iOS、网页和桌面。
  2. MediaPipe Model Maker让开发者用自己的数据重新训练这些模型,MediaPipe Studio则可以直接在浏览器中查看效果并进行性能对比。
  3. 在这些成品方案底层是更低层的C++系统MediaPipe Framework,由数据单元Packets、流程结构Graphs和处理节点Calculators组成,用于搭建自定义的实时机器学习流水线。
  4. 由于图像、视频、文本等输入数据在设备本地处理而不发送到谷歌服务器,这些API也能用于对隐私敏感的数据,不过关于API使用性能的统计指标仍会发送给谷歌。
  5. 该项目已用于Google Meet背景特效、AR艺术功能、手语识别界面、假肢控制等实际产品,项目在GitHub上获得36530颗星。

为什么重要

MediaPipe让开发者无需从零训练模型、也不必依赖服务器往返通信,就能为应用添加经过实际验证的实时摄像头与音频AI功能。其设备端隐私设计以及覆盖移动端、网页、桌面、边缘设备的跨平台能力,为需要快速上线感知类功能的团队提供了实用基础。

本仓库术语

  • MediaPipe Tasks · 预先做好的视觉/文本/音频AI功能集合,可直接接入应用的API
  • MediaPipe Framework · 由Packets、Graphs、Calculators组成的底层C++系统,用于搭建实时处理流水线
  • 设备端处理 · 图像或视频等输入数据不发送到服务器,而是直接在设备本地处理
  • Model Maker · 用自己的数据重新训练现有模型以进行定制的工具
  • MediaPipe Studio · 在浏览器中查看模型效果并比较性能的工具

仓库简介(英文)

Cross-platform, customizable ML solutions for live and streaming media.

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道