K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

google-ai-edge/mediapipe-samples-web

64TypeScriptApache-2.0

无需服务器,浏览器里就能识别人脸、手势和身体姿态的示例合集

这个仓库把谷歌的MediaPipe Tasks API打包成一系列可直接运行的网页演示。内容涵盖人脸和手部追踪等视觉任务、环境声音分类、文本情感分析等,全部在浏览器里用CPU或GPU实时处理完成。只需几条pnpm命令就能在本地跑起来体验。

它做什么

  1. 视觉功能包括能在脸上定位478个三维关键点的人脸特征点检测器、为每只手追踪21个三维关键点的手部特征点检测器,以及同时追踪人脸、双手和全身姿态的整体特征点检测器
  2. 还包含点击即可抠出指定物体的交互式分割、给物体画出边框的目标检测,以及用于比较图片相似度的图像向量化(embedding)功能
  3. 同时支持音频和文本任务,包括声音分类、语言检测、文本情感分类,以及用于比较语义相似度的文本向量化
  4. 所有处理都在设备端(浏览器内)完成,属于端上机器学习,数据不需要发送到云端服务器
  5. 只需执行pnpm install和pnpm dev就能启动本地开发服务器直接体验,项目还用Playwright搭建了端到端(E2E)测试来保证功能稳定

为什么重要

网页开发者不用搭建服务器或自己训练模型,就能直接借用这些代码给自己的网站加上人脸识别、手势识别等功能。由于一切都在浏览器内完成,这也为想要避免把用户数据传到服务器的隐私友好型产品设计提供了参考。

本仓库术语

  • MediaPipe Tasks API · 谷歌推出的工具集,用于实现人脸、手部、姿态识别等端上机器学习功能
  • 端上机器学习 · 直接在用户设备(如浏览器)上运行,而不用把数据发送到远程服务器的机器学习方式
  • 特征点检测器(Landmarker) · 用于定位人脸、手或身体关键坐标点的模型
  • 向量化(Embedding) · 把图片或文本转换成数字向量,以便比较它们之间的相似程度
  • 端到端测试(E2E testing) · 像真实用户一样,从头到尾验证整个应用流程是否正常

仓库简介(英文)

A collection of examples for the MediaPipe Task APIs that can run fully inside your browser.

所属 · google-deepmind

在 GitHub 打开

热门仓库

全部仓库 →

METAL MEDIA 最新报道