摘要
本申请提供了一种基于人体姿态的实时视频动作计数方法。该方法包括:获取输入的视频片段,以及需要计数的动作类别文本;针对输入视频片段,使用实时人体姿态估计方法BlazePose逐帧提取,获得人体姿态序列;使用轻量化Transformer模型编码所述姿态序列,并引入交叉注意力融合所述类别文本的语义,从而获得包含周期性动作语义的表征序列;将所得表征序列的每一表征解码为单通道密度图,并使用Sigmoid函数调整密度图取值区间;对密度图进行帧级概率累加,得到整个视频片段中某动作类别的重复次数,即目标输出。本申请通过设计轻量化模型降低计算开销,实现了视频动作的实时计数,提升了模型的推理效率与准确性,适用于健身监测、运动评估等需要高实时性的场景。