MMPose WholeBody:133关键点全身姿态估计5分钟跑通
【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose
录一段舞蹈跟练视频,你想知道老师每一帧的手指尖、脚尖的落点,再和自己的动作逐帧对比。传统姿态估计只给 17 个人体关节,手和脸是缺失的。MMPose(OpenMMLab 姿态估计工具箱)的 WholeBody 模块给每个人标注 133 个关键点,把身体、面部、双手、双脚一次性覆盖。
133个关键点分布在哪里
一张图上的 133 个点分四组:
- 身体 17 点:从头到脚的主要关节,是姿态估计最基础的骨架
- 面部 68 点:眉、眼、鼻、嘴的五官轮廓
- 双手 42 点:每只手 21 点,覆盖五根手指的全部关节
- 足部 10 点:每只脚 5 点,从脚踝到大脚趾
这套布局与 COCO-WholeBody 数据集一致,相比传统 17 点方案,多出来的正是面部、手指、脚趾这些细节信息。
架构上是自顶向下两段式:人体检测器先在图里圈出每个人,姿态模型再逐人输出 133 点。好比安检先认出人群,再由工作人员逐个登记,比一张网络硬扛全图更稳,遮挡多的人也不会互相干扰。
5分钟跑通第一个WholeBody姿态Demo
克隆仓库并安装(仓库内含测试图片,无需额外下载数据):
git clone https://gitcode.com/GitHub_Trending/mm/mmpose cd mmpose pip install -v -e .用 Inferencer 接口跑全身姿态推理,wholebody别名会自动拉取预训练权重,不用手写检测和姿态的拼装配置:
python demo/inferencer_demo.py \ tests/data/coco/000000000785.jpg \ --pose2d wholebody \ --vis-out-dir vis_results/wholebody可视化结果落在vis_results/wholebody/目录,能看到人身上画出的全身关键点。输入换成视频、文件夹或摄像头流都可以,比如传tests/data/crowdpose/整个目录,它会批量推理目录下所有图片。
场景深拆:把舞蹈视频变成自动评分系统
projects/just_dance/ 项目用全身关键点做"老师 vs 学员"的舞蹈对比,链路是这样的:
- 输入:一段示范视频(老师)和一段跟练视频(学员)
- 处理:wholebody 模型逐帧提取 133 个关键点,再做片段对齐,逐帧计算两人关键点的相似程度
- 输出:并排对比视频加一个分数
完整流程一行命令:
python projects/just_dance/process_video.py \ teacher.mp4 student.mp4这个场景为什么离不开全身关键点:舞蹈对比要看手脚的位置。只有 17 个身体关节时,两个人骨架一样但手举高低的差异会被判成满分,42 个手部点和 10 个足部点正是让评分变"挑剔"的部分。分数本质上就是逐帧关键点位置差的汇总,点越密,对动作细节越敏感。项目里还有基于 Gradio 的网页版(app.py),支持摄像头实时输入。
怎么挑模型,新手容易踩哪些坑
configs/wholebody_2d_keypoint/rtmpose/ 目录下是现成的全身模型,COCO-WholeBody val 上的精度如下:
| 模型 | 输入 | Whole AP | 定位 |
|---|---|---|---|
| rtmw-m | 256x192 | 0.582 | 最快,适合实时流、移动端 |
| rtmw-l | 256x192 | 0.660 | 均衡,实时级别 |
| rtmw-l | 384x288 | 0.701 | 高精度,离线分析 |
(另有 rtmw-x,384x288 下为 0.702,只比 rtmw-l 高 0.001,通常不值得为此牺牲速度。)
视频流要保 30fps,选 rtmw-m 或 rtmw-l 256x192;离线分析手部、足部细节,直接上 rtmw-l 384x288。RTMPose 系列在官方基准下 GPU 推理可达 130+ FPS,实时性有官方数据背书。
两个常见坑:
- 人漏检:默认人框置信度阈值偏高,人小或模糊时会丢人,把
--bbox-thr调低到 0.3 左右试试。 - 两组模型搞混:
rtmpose-xxx配置是 COCO-WholeBody 单数据集训练,rtmw-xxx是 14 个数据集混合训练(cocktail14),整体精度更高;用哪组配置就配哪组权重,名字对不上会报错。
下一步去哪
MMPose WholeBody 把身体、面部、双手、双脚的姿态变成了一组可直接计算的 133 点数据。想继续看官方跑法,读 全身姿态 Demo 文档;想核对数据集和更多模型精度,查 2d_wholebody_keypoint.md。
【免费下载链接】mmposeOpenMMLab Pose Estimation Toolbox and Benchmark.项目地址: https://gitcode.com/GitHub_Trending/mm/mmpose
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考