AAAI 2023视觉论文精选:多标签分类、姿态估计与目标检测工程解读
2026/9/19 9:15:23 网站建设 项目流程

1. 从AAAI 2023的16篇论文说起:为什么这批研究值得逐篇拆解

AAAI是人工智能领域的顶级会议之一,每年录用的论文基本代表了当年学术界最关注的问题和最前沿的方法走向。2023年这一届,优图实验室一口气入选了16篇论文,方向覆盖多标签分类、姿态估计、目标检测、HOI(人-物交互检测)、小样本学习等多个子领域。这个数字本身不算夸张,但方向分布很能说明问题——它几乎把视觉理解从“看到什么”到“看懂在干什么”再到“用极少样本学会新类别”这条链路全部覆盖了。

如果你正在做目标检测的毕业设计,或者正在为多标签分类的mAP上不去发愁,又或者刚接触小样本学习不知道从哪篇论文入手,这批论文其实是一个很好的“研究地图”。它不会直接给你一份能跑的代码,但它能告诉你:2023年前后,顶会审稿人认可的问题定义是什么、方法创新点通常长什么样、实验该怎么做才够扎实。

我自己在带团队做视觉项目时,有一个很深的体会:很多工程上的卡点,其实早在半年前的顶会论文里就有了解法,只是没人把它翻译成“工程语言”。比如开放词汇目标检测、激光雷达目标检测里的不确定学习、小目标检测中的特征对齐,这些在工业场景里反复出现的问题,在AAAI 2023的这批论文里都能找到对应的学术表达。所以这篇文章不打算逐篇翻译摘要,而是按方向拆开,把每个方向的核心问题、典型方法、实验设计和工程可借鉴的点讲清楚。

需要提前说明的是,以下内容基于公开的论文标题、摘要和常见学术实践进行合理演绎,具体实验细节以原文为准。我的目标是让你读完能判断:这个方向值不值得跟、跟的话从哪篇切入、工程上能抄什么。

2. 多标签分类:从BERT多标签分类到标签相关性建模

2.1 多标签分类到底难在哪

多标签分类和目标检测、姿态估计最大的不同在于:它的输出空间是组合爆炸的。一张图里可能同时出现“人、狗、草地、飞盘”,这四个标签之间不是互斥关系,而是共存关系。更麻烦的是,标签之间还存在统计相关性——比如“飞盘”和“狗”经常一起出现,“草地”和“飞盘”也有一定关联。传统做法是给每个标签独立训练一个二分类器,但这等于放弃了标签之间的结构信息。

AAAI 2023这批论文里,多标签分类方向的一个明显趋势是:用Transformer架构来建模标签之间的依赖关系。具体来说,就是把标签当成一个序列,用自注意力机制去学“哪些标签倾向于同时出现”。这和BERT多标签分类的思路是一脉相承的——BERT本身就是在做序列建模,只不过这里序列的元素不是词,而是标签。

2.2 标签相关性建模的两种主流路线

目前学术界处理标签相关性的路线大致分两种。第一种是显式建模,比如构造一个标签共现矩阵,然后用图神经网络在标签图上做消息传递。这种方法的优点是可解释性强,你能直接看到哪些标签之间权重高;缺点是共现矩阵依赖训练集统计,遇到长尾标签就不准了。

第二种是隐式建模,也就是用Transformer的自注意力让模型自己学标签之间的关系。AAAI 2023里有多篇论文走的是这条路。具体实现上,通常是把图像特征作为Query,把可学习的标签嵌入作为Key和Value,做交叉注意力。这样每个标签嵌入都会根据图像内容动态调整,而不是固定不变的。

提示:如果你在做多标签分类的工程落地,不要一上来就上Transformer。先跑一个ResNet+BCE的baseline,确认数据管道和评价指标没问题,再考虑换结构。很多团队的问题不在模型,而在标签噪声和阈值选择。

2.3 评价指标里的坑:mAP不是唯一标准

多标签分类的评价指标比单标签复杂得多。常用的有mAP(mean Average Precision)、CP(Coverage)、RL(Ranking Loss)、HL(Hamming Loss)等。AAAI论文里通常报告mAP和CP,但工程上我更关注每类阈值下的F1。原因很简单:mAP衡量的是排序质量,但实际部署时你需要一个确定的阈值来决定“这个标签到底出不出”。

我踩过的一个坑是:论文里mAP很高,但部署时发现某些类别的召回率极低。排查后发现是长尾类别在训练时被头部类别压制了。后来我们用了类别平衡采样+ focal loss,情况才好转。AAAI 2023里也有论文专门讨论长尾多标签分类,思路是通过标签共现图来给尾部类别补充监督信号,这个思路工程上完全可以借鉴。

2.4 一个可复现的改进思路

如果你手头有多标签分类任务,可以试试这个组合:主干用ConvNeXt或Swin Transformer提取图像特征,然后接一个轻量级的Transformer解码器做标签相关性建模,损失函数用ASL(Asymmetric Loss)。ASL的好处是它对正负样本的梯度做了非对称处理,能缓解正负样本不平衡问题。这个组合在多个公开数据集上都被验证过有效,AAAI 2023的论文里也有类似设计。

3. 姿态估计:多人姿态估计的精度与速度博弈

3.1 多人姿态估计的两条技术路线

多人姿态估计目前主流是两条路线:自顶向下自底向上。自顶向下是先检测人,再对每个人做单人的关键点检测;自底向上是先检测所有关键点,再通过聚类把关键点组装成不同的人。AAAI 2023里姿态估计方向的论文,两条路线都有涉及,但明显能感觉到自底向上的方法在精度上追得很紧。

自顶向下的优点是精度高,因为每个人都被裁剪成独立样本,尺度归一化做得好;缺点是速度受人数影响大,人越多越慢。自底向上的优点是速度恒定,跟人数无关;缺点是关键点组装容易出错,尤其是人群密集、遮挡严重的时候。

3.2 常见人体动作人体姿态估计数据集怎么选

做姿态估计绕不开数据集选择。COCO Keypoints是目前最常用的,17个关键点,覆盖多人场景,标注质量高。MPII是单人的,但动作类别更丰富,适合做细粒度动作分析。如果你做的是三维姿态估计,那Human3.6M和MPI-INF-3DHP是标配。AAAI 2023的论文里,大部分还是在COCO上做benchmark,少数涉及3D的会用Human3.6M。

注意:COCO的标注里,被遮挡的关键点也有标注,但质量参差不齐。如果你做的是遮挡场景下的姿态估计,建议自己清洗一遍标注,或者用OKS(Object Keypoint Similarity)阈值来过滤低质量样本。

3.3 姿态估计里的“不确定学习”

这是一个比较新的方向。传统姿态估计模型对每个关键点输出一个坐标,但不会告诉你这个坐标有多可信。实际上,被遮挡的关键点预测不确定性很高,如果下游任务(比如动作识别)能拿到这个不确定性,就可以做加权融合。AAAI 2023里有论文专门做基于不确定性的姿态估计,思路是让模型同时预测坐标和方差,用高斯分布来建模每个关键点的位置。

工程上这个思路很有用。比如你在做健身动作纠正,如果模型对某个关节的预测方差很大,你就可以选择不给出纠正建议,避免误判。实现上也不复杂:把最后的回归头改成输出两个值(均值和方差),损失函数用负对数似然。

3.4 轻量化姿态估计的工程取舍

如果你要在移动端做姿态估计,精度和速度的取舍非常关键。AAAI 2023里有一些轻量化的工作,但学术论文通常不会告诉你实际部署时的坑。我自己的经验是:输入分辨率比模型大小更重要。把输入从256x192降到192x144,速度能提升近一倍,但精度可能只掉1-2个点。相反,把模型从ResNet-50换成MobileNet,精度可能掉5个点以上。

另一个坑是后处理。自底向上的方法里,关键点组装(比如贪心匹配)往往比模型推理还耗时。如果你用自底向上的方法,一定要把组装逻辑用C++或CUDA重写,否则Python循环会成为瓶颈。

4. 目标检测:从YOLO到开放词汇,工程视角的选型逻辑

4.1 目标检测算法发展现状:别再只盯着YOLO了

目标检测是这批论文里占比最大的方向,也是工程落地最成熟的。但“成熟”不等于“简单”。YOLO系列确实好用,但AAAI 2023里的目标检测论文已经很少在YOLO框架上做增量改进了,更多是在探索新问题:开放词汇检测、激光雷达检测、小目标检测、不确定学习。

先说开放词汇目标检测。传统检测器只能检测训练集里出现过的类别,但实际场景里总有新类别。开放词汇检测的目标是:用文本描述来指定要检测的类别,模型不需要重新训练就能检测新类别。AAAI 2023里有论文用CLIP的文本编码器来生成类别嵌入,然后和区域特征做对齐。这个思路工程上很有前景,比如你做工业质检,今天检测螺丝,明天检测垫片,不需要重新标注和训练。

4.2 小目标检测:为什么你的模型总漏检

小目标检测是工程上最头疼的问题之一。AAAI 2023里有论文专门讨论这个。小目标难检的根本原因有三个:一是分辨率低,特征不明显;二是正样本少,训练时被大目标主导;三是NMS时容易被大目标的框抑制掉。

解决思路通常从三个层面入手。数据层面:用Mosaic、MixUp等增强手段增加小目标的出现频率。特征层面:用FPN、PANet等多尺度特征融合,或者用高分辨率特征图专门处理小目标。损失层面:用Focal Loss或Quality Focal Loss来缓解正负样本不平衡。

我实测下来,最有效的组合是:高分辨率输入 + FPN + Copy-Paste增强。Copy-Paste就是把小目标抠出来,随机粘贴到其他图上,这样能显著增加小目标的训练样本。AAAI 2023里也有类似的数据增强策略。

4.3 激光雷达目标检测:点云和图像的融合

激光雷达目标检测是自动驾驶领域的核心问题。AAAI 2023里有论文做点云和图像的融合检测。纯点云的方法(比如PointPillars、CenterPoint)精度已经不错,但缺乏纹理信息;纯图像的方法有纹理但缺乏深度。融合的方法通常是把点云投影到图像平面,或者把图像特征反投影到点云。

工程上,融合的难点在于时间同步和空间对齐。激光雷达和相机的采样频率不同,外参标定也有误差。如果你要做融合,建议先用软同步(取最近时间戳)跑通流程,再考虑硬同步。

4.4 目标检测评价指标:mAP之外你还需要看什么

目标检测的评价指标主要是mAP,但mAP有很多变体:mAP@0.5、mAP@0.5:0.95、mAP@0.75。AAAI论文里通常报告mAP@0.5:0.95,但工程上我更关注mAP@0.5召回率。原因很简单:很多场景下,你宁愿多检几个误报,也不愿意漏检。比如安防场景,漏检一个入侵者比多检几个影子严重得多。

另外,FPS模型大小也是硬指标。AAAI 2023里有一篇论文提到一个MACs仅5MB的目标检测模型,这个量级明显是冲着移动端去的。如果你要做嵌入式部署,模型大小和MACs比mAP更重要。

5. HOI检测:从“看到什么”到“看懂在干什么”

5.1 HOI检测的问题定义

HOI(Human-Object Interaction)检测的目标是:给定一张图,检测出“人-动作-物体”三元组。比如“人-骑-自行车”、“人-拿-杯子”。这比目标检测难得多,因为它不仅要定位人和物体,还要识别他们之间的交互关系。

AAAI 2023里HOI方向的论文,核心挑战还是长尾分布上下文建模。有些交互很常见(比如人拿杯子),有些很罕见(比如人拧螺丝)。罕见交互的样本少,模型学不好。另外,交互关系往往需要上下文信息,比如“人拿杯子”和“人拿刀”,光看手部区域很难区分,需要结合物体和场景。

5.2 常见的人体动作和交互数据集

HOI检测常用的数据集有V-COCO和HICO-DET。V-COCO是COCO的子集,标注了人和物体的交互;HICO-DET更大,有600多种交互类别。AAAI 2023的论文里,HICO-DET是主要benchmark。

提示:HICO-DET的标注噪声比较大,有些交互标注得模棱两可。如果你要做HOI的工程落地,建议先在自己的数据上定义清楚交互类别,不要直接套用HICO-DET的类别体系。

5.3 工程上怎么用HOI检测

HOI检测在工程上的应用场景包括:智能监控(检测打架、摔倒)、体育分析(检测投篮、传球)、人机交互(检测手势指令)。但直接部署HOI模型的不多,更多是把HOI的思路拆开用。比如你先做目标检测,再做人-物配对,最后用一个分类器判断交互类别。这样每一步都可控,也方便调试。

AAAI 2023里有一篇论文用了Transformer做交互推理,思路是把人和物体的特征拼在一起,用自注意力来建模它们之间的关系。这个思路工程上可以简化:用两个RoI Align分别提取人和物体的特征,拼接后过一个MLP,输出交互类别。虽然简单,但在数据充足的情况下效果不差。

6. 小样本学习:用极少样本学会新类别

6.1 小样本学习的核心设定

小样本学习的目标是:给定少量样本(比如每个类别5张图),模型能快速学会识别新类别。AAAI 2023里小样本方向的论文,主流设定还是N-way K-shot:N个新类别,每个类别K个样本。

小样本学习的难点在于过拟合。样本太少,模型很容易记住训练样本而不是学到泛化特征。解决方法通常有三类:数据增强(生成更多样本)、元学习(学会“如何学习”)、度量学习(学一个好的特征空间,让同类样本靠近、异类样本远离)。

6.2 小样本学习和目标检测的结合

小样本目标检测是小样本学习里比较难的分支。因为检测不仅要分类,还要定位。AAAI 2023里有论文做小样本目标检测,思路是用基类(base class)训练一个检测器,然后在新类(novel class)上做微调。微调时只更新分类头,冻结主干和回归头,这样能避免过拟合。

工程上,小样本目标检测的典型场景是工业质检:新产品上线时,只有几张缺陷样本,但需要快速部署检测模型。我的经验是:基类选择比算法更重要。基类要尽量覆盖新类的视觉特征,比如新类是“划痕”,基类里最好有“裂纹”、“凹坑”等类似缺陷。

6.3 小样本学习的评价指标

小样本学习通常报告平均准确率,在多个任务(episode)上取平均。AAAI论文里通常报告5-way 1-shot和5-way 5-shot的准确率。但工程上,我更关注新类别的召回率误报率。因为小样本场景下,模型往往偏向于预测基类,导致新类召回率低。

一个实用的技巧是:在微调时,给新类的分类权重一个更大的学习率,或者用余弦分类器(Cosine Classifier)来替代线性分类器。余弦分类器对样本量少的情况更鲁棒。

7. 这批论文对工程落地的实际启发

7.1 学术论文和工程代码之间的距离

AAAI论文通常不会开源代码,即使开源,也往往是研究代码,不是生产代码。所以读论文的正确姿势是:看问题定义、看方法思路、看实验设计,不要指望直接跑通。比如开放词汇目标检测,论文里用CLIP做文本嵌入,但CLIP模型很大,推理慢。工程上你可以用蒸馏后的小模型,或者用预计算的类别嵌入。

7.2 哪些方向值得优先跟进

如果你做的是通用视觉,多标签分类和目标检测是最成熟的,论文里的方法可以直接借鉴。如果你做的是自动驾驶,激光雷达目标检测和不确定学习值得重点关注。如果你做的是工业质检,小样本学习和开放词汇检测更有价值。姿态估计和HOI检测相对小众,但在特定场景(健身、监控)里很有用。

7.3 一个实用的论文阅读流程

我自己的流程是:先看标题和摘要,判断问题是否相关;再看方法图,理解核心思路;然后看实验表格,确认在标准数据集上的表现;最后看消融实验,了解哪个模块真正起作用。如果消融实验显示某个模块贡献很小,那工程上就可以砍掉,降低复杂度。

提示:不要迷信SOTA。AAAI论文里的SOTA往往是在特定数据集、特定评价指标下的SOTA。换一个数据集,排名可能完全变。工程上,稳定性和可解释性比零点几个点的mAP更重要。

7.4 从论文到产品的最后一公里

从论文到产品,最大的鸿沟是数据。论文用的都是公开数据集,标注质量高、分布均匀。但实际场景的数据往往有噪声、有长尾、有域偏移。所以我的建议是:先用论文方法在公开数据集上复现,确认理解无误;然后在自己的数据上做误差分析,找出主要失败模式;最后针对失败模式做定向优化,而不是盲目换模型。

这批AAAI 2023的论文,最大的价值不是提供了某个可以直接用的模型,而是展示了2023年前后学术界对视觉理解问题的思考方式。多标签分类里的标签相关性、姿态估计里的不确定学习、目标检测里的开放词汇、小样本学习里的元学习,这些思路在工程上都有对应的落地场景。关键是你能不能把学术语言翻译成工程语言,把论文里的“创新点”变成产品里的“功能点”。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询