← back to search

Kai Yu

Shanghai Jiao Tong University · CN
Area of research
Artificial Intelligence · Signal Processing
Research interest
Research interests include Speech Recognition and Synthesis, Speech and Audio Processing, Topic Modeling, and Natural Language Processing Techniques.
h-index
47
citations
11,406
works
503
NIH funding
primary concept
email

Recent publications

A Survey on Speech Large Language Models for Understanding
IEEE Journal of Selected Topics in Signal Processing 2026cited by 3position: contributordoi
Recent Advances in Discrete Speech Tokens: A Review.
2026cited by 0position: contributordoi
SelfSE: Self-Supervised Speech Enhancement via Noisy Speech Refinement
IEEE Transactions on Audio, Speech and Language Processing 2026cited by 0position: contributordoi
Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
IEEE Transactions on Audio, Speech and Language Processing 2026cited by 0position: contributordoi
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
IEEE Journal of Selected Topics in Signal Processing 2026cited by 0position: contributordoi
Developing ChemDFM as a large language foundation model for chemistry
Cell Reports Physical Science 2025cited by 28position: contributordoi
MOS-GAN: Mean Opinion Score GAN for Unsupervised Speech Enhancement
IEEE Signal Processing Letters 2025cited by 4position: contributordoi
MFA-KWS: Effective Keyword Spotting With Multi-Head Frame-Asynchronous Decoding
IEEE Transactions on Audio, Speech and Language Processing 2025cited by 2position: contributordoi
DFM: Dialogue foundation model for universal large-scale dialogue-oriented task learning
AI Open 2025cited by 2position: contributordoi
EveMRC: Two-Stage Bidirectional Evidence Modeling for Multi-Choice Machine Reading Comprehension
IEEE Transactions on Audio, Speech and Language Processing 2025cited by 1position: contributordoi
Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis
Proceedings of the 33rd ACM International Conference on Multimedia 2025cited by 1position: contributordoi
AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding
Proceedings of the 32nd ACM International Conference on Multimedia 2024cited by 25position: contributordoi
Beyond the Status Quo: A Contemporary Survey of Advances and Challenges in Audio Captioning
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2024cited by 15position: contributordoi
Spatial-temporal distribution of labeled set bias remote sensing estimation: An implication for supervised machine learning in water quality monitoring
International Journal of Applied Earth Observation and Geoinformation 2024cited by 12position: middledoi
Towards Weakly Supervised Text-to-Audio Grounding
IEEE Transactions on Multimedia 2024cited by 9position: contributordoi
Genre: generative multi-turn question answering with contrastive learning for entity–relation extraction
Complex & Intelligent Systems 2024cited by 8position: middledoi
Unsupervised Speech Enhancement Using Optimal Transport and Speech Presence Probability
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2024cited by 7position: contributordoi
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
Proceedings of the 17th ACM International Conference on Web Search and Data Mining 2024cited by 1position: contributordoi
E$^{3}$TTS: End-to-End Text-Based Speech Editing TTS System and Its Applications
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2024cited by 1position: contributordoi
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
Proceedings of the 31st ACM International Conference on Multimedia 2023cited by 35position: contributordoi
Speech Enhancement With Integration of Neural Homomorphic Synthesis and Spectral Masking
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2023cited by 14position: contributordoi
Speaker Adaptive Text-to-Speech With Timbre-Normalized Vector-Quantized Feature
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2023cited by 10position: contributordoi
A Heterogeneous Graph to Abstract Syntax Tree Framework for Text-to-SQL.
2023cited by 0position: contributordoi
Semantic Enhancement Framework for Robust Speech Recognition
Communications in Computer and Information Science 2023cited by 0position: contributordoi
Phone-Level Prosody Modelling With GMM-Based MDN for Diverse and Controllable Speech Synthesis
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2022cited by 16position: contributordoi
Neural Fusion for Voice Cloning
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2022cited by 11position: contributordoi
Data augmentation based non-parallel voice conversion with frame-level speaker disentangler
Speech Communication 2022cited by 9position: contributordoi
Towards Duration Robust Weakly Supervised Sound Event Detection
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2021cited by 41position: contributordoi
Voice Activity Detection in the Wild: A Data-Driven Approach Using Teacher-Student Training
IEEE/ACM Transactions on Audio, Speech, and Language Processing 2021cited by 35position: contributordoi
Towards a new generation of artificial intelligence in China
Nature Machine Intelligence 2020cited by 238position: contributordoi

Grants

No grants ingested yet.

Frequent collaborators

· 35 papers (2019–2026)Xie Chen · Shanghai Jiao Tong University8 papers (2023–2026)Chenpeng Du · Shanghai Jiao Tong University7 papers (2022–2026)Lu Chen · Nanchang University5 papers (2019–2025)Shuai Wang · Elsevier, Inc.5 papers (2019–2026)Wenbin Jiang · Shanghai Jiao Tong University4 papers (2023–2026)Yanmin Qian · Shanghai Jiao Tong University3 papers (2016–2020)Fei Wen · Shanghai Jiao Tong University3 papers (2024–2026)Mengyue Wu · Northwestern Polytechnical University3 papers (2021–2024)Hongshen Xu · Huazhong University of Science and Technology3 papers (2023–2025)Zhi Chen · Microsoft Research Asia (China)3 papers (2019–2025)Ruisheng Cao · Shanghai Jiao Tong University3 papers (2023–2025)Yiwei Guo · Shanghai Jiao Tong University3 papers (2023–2026)Qi Chen · China Guodian Corporation (China)2 papers (2023–2024)Xuenan Xu · Elsevier, Inc.2 papers (2024–2024) · 2 papers (2019–2020)Bo Chen · Shanghai Jiao Tong University2 papers (2022–2022)Ziyang Ma · Shanghai Jiao Tong University2 papers (2026–2026)Qi Liu · Sun Yat-sen University2 papers (2020–2020)Heinrich Dinkel · PLA Academy of Military Science2 papers (2021–2021)