Area of research
Signal Processing · Artificial Intelligence
Research interest
Research focused on Speech recognition and Artificial intelligence, with related work in Watermark, Polyphony, Natural language processing. Notable publications include 'CMUA-Watermark: A Cross-Model Universal Adversarial Watermark for Combating Deepfakes', 'An Improved Cascade R-CNN-Based Target Detection Algorithm for UAV Aerial Images', and 'A Multi-grained based Attention Network for Semi-supervised Sound Event Detection'.
CB-PSR: Adaptive Contextual Biasing for Prompt-Driven Speech Recognition
GLFER-Net: a polyphonic sound source localization and detection network based on global-local feature extraction and recalibration
Introducing Multilingual Phonetic Information to Speaker Embedding for Speaker Verification
Speech-Text Based Multi-Modal Training with Bidirectional Attention for Improved Speech Recognition
Hierarchical Softmax for End-To-End Low-Resource Multilingual Speech Recognition
Investigation into Phone-Based Subword Units for Multilingual End-to-End Speech Recognition
CMUA-Watermark: A Cross-Model Universal Adversarial Watermark for Combating Deepfakes
An Improved Cascade R-CNN-Based Target Detection Algorithm for UAV Aerial Images
A Multi-grained based Attention Network for Semi-supervised Sound Event Detection
A generalized network based on multi-scale densely connection and residual attention for sound source localization and detection
Mel-S3r: Combining Mel-Spectrogram and Self-Supervised Speech Representation for Voice Conversion