STATION 10 · HUMAN POSE & ACTION
人体姿态估计与动作识别 · 姿态估计总览
从人体区域输入到关键点、骨架连接与姿态向量输出,建立人体姿态估计任务的整体视图。
预设样例 · 机制拆解
POSE · SKELETON · ACTION
POSE PIPELINE
Person detector + keypoint head
Top-down 两阶段:先找人,再估计关键点
METHOD MATRIX
典型算法路线对比
路线代表方法计算方式适合场景主要限制
Top-downMask R-CNN Keypoint / AlphaPose先检测人,再对每个 crop 估计关键点单人、少量多人、高精度展示依赖人体检测质量,人数多时成本升高
Bottom-upOpenPose / Associative Embedding先找全图关节点,再按肢体关系分组多人密集场景、实时演示关节点分组容易受遮挡和交叉肢体影响
HeatmapCPM / HRNet / SimpleBaseline为每个关节点预测热力图,取峰值坐标需要解释“模型如何定位关节”的教学页热力图分辨率会影响坐标精细度
坐标回归DeepPose直接回归归一化关节点坐标说明早期端到端姿态向量思想空间细节较弱,复杂姿态下稳定性不足
TransformerTokenPose / ViTPose用 token 建模全局人体结构关系遮挡、长肢体依赖、复杂姿态模型较大,浏览器端部署成本更高
LSP 偏运动姿态,FLIC 偏上半身标注,COCO 提供常用 17 点人体关键点定义。
判断预测点与标注点距离是否小于归一化阈值,适合解释关键点是否“落准”。
COCO 使用 OKS 衡量整个人体关键点匹配程度,再计算 Keypoint AP。