RResearch · 研究主线

让机器理解,人在何时做了什么

研究目标:让机器不仅知道视频里发生了什么,还能判断动作从什么时候开始、到什么时候结束,并在类别未知或标注不足时保持理解能力。

  1. 01

    骨架行为识别

    Skeleton-based HAR研究起点

    从 Kinect 采集的骨架序列出发:两阶段滤波清理异常数据、时序归一化对齐样本,用异构双分支网络识别行为类别(DB-HPN)。

  2. 02

    时序动作定位

    Temporal Action Localization当前主战场

    不只识别「做了什么」,还定位「从何时到何时」。在 ActionFormer 类一阶段架构上,让局部判别线索与边界变化不被注意力弱化(SAEFormer)。

  3. 03

    零样本 / 开放词汇 TAL

    Zero-shot / Open-vocabulary调研中

    真实世界的动作类别开放且长尾。目标是让定位能力泛化到训练时未见过的类别——当前处于方向调研与学习阶段。

  4. 04

    VLM 与测试时适应

    VLM & Test-time Adaptation博士预备

    视觉语言模型提供文本与视频语义对齐的可能;测试时自适应(原型与动量更新)让模型在部署后继续校准。候选研究路线,非既成成果。

论文与研究稿

状态如实标注——在审就是在审,不写成已发表。

专利与软件著作权

每一项都带编号,可在官方登记系统查证。

发明专利2026-03 授权

基于融合数据增强的人体行为识别方法及系统

第一发明人ZL 202511883513.6
发明专利2026-05 授权

基于人体骨骼结构的动作识别方法及系统

第二发明人ZL 202610335712.1
软件著作权2026-01 登记

极光康复云平台系统 V1.0

著作权人 · 排名第一2026SR0034553
软件著作权2024-09 登记

基于人体骨架运动序列的人体行为识别系统 V1.0

排名第二2024SR1360416

ORCID:0009-0006-8542-0902

全部笔记