Area of research
Computer Vision and Pattern Recognition · Artificial Intelligence
Research interest
Research interests include Computer science, Artificial intelligence, Convolutional neural network, Benchmark (surveying), Discriminative model, and Deep learning.
DiffusionAD: Norm-Guided One-Step Denoising Diffusion for Anomaly Detection
Context Perception Parallel Decoder for Scene Text Recognition
Instruction-Guided Scene Text Recognition
FoodLMM: A Versatile Food Assistant Using Large Multi-Modal Model
OmniTracker: Unifying Visual Object Tracking by Tracking-With-Detection
Retrieval Augmented Recipe Generation
MeViS: A Multi-Modal Dataset for Referring Motion Expression Video Segmentation
NuScenes-QA: A Multi-Modal Visual Question Answering Benchmark for Autonomous Driving Scenario
A Survey on Video Diffusion Models
SimDA: Simple Diffusion Adapter for Efficient Video Generation
MotionEditor: Editing Video Motion via Content-Aware Diffusion
OmniViD: A Generative Framework for Universal Video Understanding
PromptFusion: Decoupling Stability and Plasticity for Continual Learning
Adversarial Prompt Tuning for Vision-Language Models
PolarFormer: Multi-Camera 3D Object Detection with Polar Transformer
MSMDFusion: Fusing LiDAR and Camera at Multiple Scales with Multi-Depth Seeds for 3D Object Detection
SVFormer: Semi-supervised Video Transformer for Action Recognition
Prototypical Residual Networks for Anomaly Detection and Localization
Masked Video Distillation: Rethinking Masked Feature Modeling for Self-supervised Video Representation Learning
StyleAdv: Meta Style Adversarial Training for Cross-Domain Few-Shot Learning
Look Before You Match: Instance Understanding Matters in Video Object Segmentation
Enhancing the Self-Universality for Transferable Targeted Attacks
ResFormer: Scaling ViTs with Multi-Resolution Training
Implicit Temporal Modeling with Learnable Alignment for Video Recognition
Locate Before Answering: Answer Guided Question Localization for Video Question Answering
On the Importance of Spatial Relations for Few-shot Action Recognition
Towards Transferable Adversarial Attacks on Image and Video Transformers
Unlearnable Clusters: Towards Label-Agnostic Unlearnable Examples
M2TR: Multi-modal Multi-scale Transformers for Deepfake Detection
SVTR: Scene Text Recognition with a Single Visual Model