全部笔记
科研手记3 min

开放词汇:从封闭类别到开放世界

传统动作识别假设类别集合是封闭的——训练时见过哪些类,测试时就只认这些。但真实世界不是这样。

开放词汇设定下,模型需要理解用自然语言描述的任意类别。这要求模型不只是"记住"类别,而是"理解"动作的语义。

VLM(视觉语言模型)提供了文本和视频对齐的可能。把 TAL 迁移到开放词汇,是我为博士阶段准备的核心方向之一。难点在于:如何让时序定位的精度,不因为词汇开放而崩塌。