google-ai-edge/mediapipe-samples-web
无需服务器,浏览器里就能识别人脸、手势和身体姿态的示例合集
这个仓库把谷歌的MediaPipe Tasks API打包成一系列可直接运行的网页演示。内容涵盖人脸和手部追踪等视觉任务、环境声音分类、文本情感分析等,全部在浏览器里用CPU或GPU实时处理完成。只需几条pnpm命令就能在本地跑起来体验。
它做什么
- 视觉功能包括能在脸上定位478个三维关键点的人脸特征点检测器、为每只手追踪21个三维关键点的手部特征点检测器,以及同时追踪人脸、双手和全身姿态的整体特征点检测器
- 还包含点击即可抠出指定物体的交互式分割、给物体画出边框的目标检测,以及用于比较图片相似度的图像向量化(embedding)功能
- 同时支持音频和文本任务,包括声音分类、语言检测、文本情感分类,以及用于比较语义相似度的文本向量化
- 所有处理都在设备端(浏览器内)完成,属于端上机器学习,数据不需要发送到云端服务器
- 只需执行pnpm install和pnpm dev就能启动本地开发服务器直接体验,项目还用Playwright搭建了端到端(E2E)测试来保证功能稳定
为什么重要
网页开发者不用搭建服务器或自己训练模型,就能直接借用这些代码给自己的网站加上人脸识别、手势识别等功能。由于一切都在浏览器内完成,这也为想要避免把用户数据传到服务器的隐私友好型产品设计提供了参考。
本仓库术语
- MediaPipe Tasks API · 谷歌推出的工具集,用于实现人脸、手部、姿态识别等端上机器学习功能
- 端上机器学习 · 直接在用户设备(如浏览器)上运行,而不用把数据发送到远程服务器的机器学习方式
- 特征点检测器(Landmarker) · 用于定位人脸、手或身体关键坐标点的模型
- 向量化(Embedding) · 把图片或文本转换成数字向量,以便比较它们之间的相似程度
- 端到端测试(E2E testing) · 像真实用户一样,从头到尾验证整个应用流程是否正常
仓库简介(英文)
A collection of examples for the MediaPipe Task APIs that can run fully inside your browser.
在 GitHub 打开热门仓库
- vorssaint/vorssaint-utils一个免费菜单栏应用,顶替十几款付费Mac工具
- Alishahryar1/free-claude-code一个本地代理,把编程AI助手接到49家免费或低价模型服务商,不再只能用一家付费服务
- freestylefly/awesome-gpt-image-2把532个GPT-Image2案例拆解成可复用模板的提示词工程库
- block/buzz一个让人类和AI智能体在同一空间里聊天、写代码、做审查的开源协作平台
- NousResearch/hermes-agentNous Research推出的Hermes是一款越用越聪明的AI智能体
- virgiliojr94/book-to-skill把技术类书籍PDF变成AI编程助手随时可查阅的技能包
- VoltAgent/awesome-agent-skills把上千份让AI编程助手秒变专家的操作手册集中放在一个地方
- anthropics/claude-plugins-community一个把大家做的Claude插件集中起来供安装的仓库