研究主线
在审

SAEFormer: Semantic-Aware Enhancement for Temporal Action Localization

通过 LMSF 重新融合局部特征、BAE 增强边界相关时序特征,保留短时局部变化与边界线索。

Neurocomputing · 2026THUMOS14 Average mAP 69.7 (I3D) / 71.4 (VideoMAE V2)

2026 年投稿,现于 Neurocomputing 审稿流程中;结论以最终发表版本为准。

研究问题

堆叠注意力可能弱化短时局部变化,常规表示对动作起止处的变化不够敏感,边界定位精度因此受限。

方法与行动

在 ActionFormer 类一阶段架构上,用 LMSF 重新融合局部卷积、输入参考和局部峰值响应,保留局部判别线索;用 BAE 增强与边界变化相关的时序特征。完成多数据集实验、消融和诊断分析。

公开结果

THUMOS14 上 I3D 特征 Average mAP 69.7、VideoMAE V2 特征 71.4。2026 年投稿,现于 Neurocomputing 审稿流程中(不表述为已录用)。

下一步

根据审稿意见迭代方法,并探索与零样本、开放词汇设定的结合。

公开边界

处于审稿流程,结论以最终发表版本为准;不声称全数据集 SOTA。

查看对应项目闭环