InsightFace SCRFD 人脸检测实战:3 个调优点把单帧耗时压到 11ms
2026/9/3 13:20:46 网站建设 项目流程

InsightFace SCRFD 人脸检测实战:3 个调优点把单帧耗时压到 11ms

【免费下载链接】insightfaceState-of-the-art 2D and 3D Face Analysis Project项目地址: https://gitcode.com/GitHub_Trending/in/insightface

假设你要给一路实时视频流加上人脸框,要求每帧稳定检测出人脸并返回坐标,还不能让整条流水线卡住。InsightFace 的 SCRFD 人脸检测器就是为这种"要快、又要准"的场景准备的:它在 0.67M 参数量下做到 WIDERFace Easy 93.78%,VGA 分辨率单帧约 4.2ms。下面从选档位、跑通最小闭环到调优和上线检查,给你一份能直接照着做的交接文档。

先定需求:按硬件与精度选模型档位

这一节帮你回答"到底用哪个 SCRFD 规格"。InsightFace 的检测方法有三种:RetinaFace、SCRFD、blazeface_paddle(见 detection/README.md)。SCRFD 是其中的效率担当,同一精度下参数量比 RetinaFace(ResNet50,29.50M 参数、21.7ms)低一个数量级。SCRFD 又按 FLOPs 分成几档,精度随档位升高,耗时也随档位上升,官方在 VGA 分辨率下的实测数据如下(来自 detection/scrfd/README.md):

模型档位EasyMediumHard参数量(M)推理耗时(VGA)
SCRFD_500M90.5788.1268.510.573.6ms
SCRFD_2.5G93.7892.1677.870.674.2ms
SCRFD_10G95.1693.8783.053.864.9ms
SCRFD_34G96.0694.9285.299.8011.7ms

取舍建议:边缘设备、多路并发选 500M 或 2.5G;单路高清晰度、追求 Hard 集召回选 10G;只有极难场景(大遮挡、远距离)才上 34G。带_KPS后缀的档位额外输出 5 个关键点,耗时基本不变,需要人脸对齐时优先选它。

十分钟跑通第一个检测结果

这一节给你一条最短路径:装环境、自动拉模型、几行代码出框。优先"先跑通",不碰识别、属性等其它模块。

git clone https://gitcode.com/GitHub_Trending/in/insightface cd insightface/python-package && pip install -e .

python-package是 Python 包源码,安装后即可自动从模型库下载默认模型(含 SCRFD 检测器)。核心推理调用如下,参考 examples/demo_analysis.py 的写法,检测类封装在 python-package/insightface/model_zoo/scrfd.py:

import cv2 from insightface.app import FaceAnalysis app = FaceAnalysis(allowed_modules=['detection']) app.prepare(ctx_id=-1, det_size=(640, 640)) faces = app.get(cv2.imread('t1.jpg')) print(faces[0].bbox, faces[0].kps)

allowed_modules=['detection']让它只加载检测器;ctx_id=-1走 CPU(改成 0 用 GPU)。faces[0].bbox是原图尺度下的[x1,y1,x2,y2,score]kps是 5 个关键点。仓库自带的测试图 t1.jpg 里有 6 张人脸,len(faces)应为 6,可以拿来验证结果是否正确。

三个真正影响耗时的调优点

这一节帮你把跑通的版本再榨出余量,每条给"原理 + 关键配置 + 预期收益"。

1. 下调输入分辨率。前向耗时主要由特征图尺寸决定。detect()内部会把图像 resize 到det_size再推理,改小即可省算力。官方在 AMD Ryzen 9 3950X、SCRFD-0.5GF、单线程下的实测:

输入尺寸单线程耗时
640×48028.3ms
320×24011.4ms

即分辨率减半,耗时约降到原来的 1/2.5。人脸本身较小的场景直接选 320×320 或更小,收益最明显。

2. 只加载检测模块。FaceAnalysis默认会把目录下所有 onnx(识别、属性等)都加载并逐帧推理,纯检测场景用不上。用allowed_modules=['detection']过滤掉多余模型,减少初始化时间和每帧无谓的计算。

3. 复用 anchor 中心缓存与动态输入 ONNX。forward()会把各尺度特征图的网格中心点anchor_centers存进self.center_cache(上限 100 组,见 detection/scrfd/tools/scrfd.py 的center_cache逻辑),相同分辨率的连续帧不必重算 mgrid。导出 ONNX 时保留默认动态输入,同一模型即可接受不同尺寸,免去多份固定 shape 的模型。

换档位时只改一处即可:

app.prepare(ctx_id=-1, det_size=(320, 320)) faces = app.get(img, max_num=0, det_metric='default')

上线前检查清单

这一节帮你在部署前逐项确认,避免"本地能跑、线上翻车"。

  • 输入尺寸:det_size是否与目标摄像头分辨率匹配,人脸是否会小于可解析的最小尺寸
  • 推理后端:ctx_id选 CPU(-1) 还是 GPU(0),GPU 下确认 provider 生效
  • 检测阈值:det_thresh默认 0.5,按误检/漏检权衡调整
  • NMS:nms_thresh默认 0.4,重叠人脸多时可适当下调
  • 并发与线程:多线程下OMP_NUM_THREADS与业务线程数是否冲突
  • 模型完整性:确认 onnx 文件 hash 未被截断损坏
  • 日志与监控:单帧耗时、每帧检出人脸数的埋点,便于回归

新手高频翻车点

现象:小脸检测不到,只有大头。原因:det_thresh默认 0.5 偏高,或输入分辨率下小脸已低于一个像素级特征。处理:把det_thresh降到 0.3~0.4 试召回,同时确认det_size足够大,别为了提速把小脸"裁没"。

现象:换了分辨率,框的位置整体偏移或大小不对。原因:detect()内部做了 resize + padding,并除以det_scale还原回原图尺度;如果你手动又缩放了一次,坐标就错位了。处理:直接用detect()返回的坐标,不要再二次缩放;确认归一化用的是 mean/std = 127.5/128。

现象:CPU 实测比预期慢一大截。原因:默认把识别、属性等所有模块都加载并逐帧跑了,或OMP_NUM_THREADS被外部脚本设成 1(官方 CPU 基准就是在OMP_NUM_THREADS=1下测的)。处理:加allowed_modules=['detection'],并按实际核心数配置线程。

继续深入

以上覆盖的是 SCRFD 检测这条主线。想训练自己的模型,看 detection/scrfd/README.md 里的训练与 WIDERFace 评估流程;想把检测接上人脸识别,参考python-package/insightface/model_zoo/arcface_onnx.pyrecognition/下的各框架实现。先把检测跑稳,再往上叠加,是接入 InsightFace 最省事的顺序。

【免费下载链接】insightfaceState-of-the-art 2D and 3D Face Analysis Project项目地址: https://gitcode.com/GitHub_Trending/in/insightface

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询