通过 LMSF 重新融合局部特征、BAE 增强边界相关时序特征,保留短时局部变化与边界线索。
2026 年投稿,现于 Neurocomputing 审稿流程中;结论以最终发表版本为准。
查看研究详情研究目标:让机器不仅知道视频里发生了什么,还能判断动作从什么时候开始、到什么时候结束,并在类别未知或标注不足时保持理解能力。
从 Kinect 采集的骨架序列出发:两阶段滤波清理异常数据、时序归一化对齐样本,用异构双分支网络识别行为类别(DB-HPN)。
不只识别「做了什么」,还定位「从何时到何时」。在 ActionFormer 类一阶段架构上,让局部判别线索与边界变化不被注意力弱化(SAEFormer)。
真实世界的动作类别开放且长尾。目标是让定位能力泛化到训练时未见过的类别——当前处于方向调研与学习阶段。
视觉语言模型提供文本与视频语义对齐的可能;测试时自适应(原型与动量更新)让模型在部署后继续校准。候选研究路线,非既成成果。
状态如实标注——在审就是在审,不写成已发表。
每一项都带编号,可在官方登记系统查证。
ORCID:0009-0006-8542-0902