科研手记3 min
开放词汇:从封闭类别到开放世界
传统动作识别假设类别集合是封闭的——训练时见过哪些类,测试时就只认这些。但真实世界不是这样。
开放词汇设定下,模型需要理解用自然语言描述的任意类别。这要求模型不只是"记住"类别,而是"理解"动作的语义。
VLM(视觉语言模型)提供了文本和视频对齐的可能。把 TAL 迁移到开放词汇,是我为博士阶段准备的核心方向之一。难点在于:如何让时序定位的精度,不因为词汇开放而崩塌。
传统动作识别假设类别集合是封闭的——训练时见过哪些类,测试时就只认这些。但真实世界不是这样。
开放词汇设定下,模型需要理解用自然语言描述的任意类别。这要求模型不只是"记住"类别,而是"理解"动作的语义。
VLM(视觉语言模型)提供了文本和视频对齐的可能。把 TAL 迁移到开放词汇,是我为博士阶段准备的核心方向之一。难点在于:如何让时序定位的精度,不因为词汇开放而崩塌。