Research Scientist at Shanda Group Corp
Research Scientist at Shanda Group Corp
I am a Research Scientist at Shanda Group Corp, working on speech and language AI.
My research studies reliable speech intelligence in complex acoustic scenes, spanning robust speech processing, multi-talker speech understanding, and speech language models. I am particularly interested in how speech models can exploit increasingly powerful learned priors while remaining faithful to the underlying acoustic evidence.
🎉 2026.06, Three papers accepted to INTERSPEECH 2026.
🙌 2026.04, Joined Shanda AI Research Tokyo as a Research Scientist.
🎉 2025.12, Two papers accepted to ASRU 2025.
My research progresses from recovering reliable speech evidence, to understanding and attributing that evidence in complex acoustic scenes, and ultimately to grounding speech language models and generative systems in the observed speech.
Reliable Perception: Robust Speech Processing
Recover reliable speech evidence from noisy, reverberant, and otherwise degraded observations.
Speech Enhancement · Noise-Robust ASR · Dereverberation
Evidence Attribution: Multi-Talker & Speaker-Grounded Speech
Understand what was said, who said it, and which acoustic evidence belongs to which source in overlapping speech scenes.
Multi-Talker ASR · Speaker Grounding · Separation / TSE
Grounded Modeling: Speech LLMs & Spoken Interaction
Leverage language-model and generative priors while keeping model decisions grounded in the observed speech.
Speech LLMs · Grounded Generation · Speech-to-Speech
Multi-Talker ASR
Serialized Output Prompting for Large Language Model-based Multi-Talker Speech Recognition
IEEE ASRU, 2025
Proposes serialized output prompting to improve large language model-based recognition in overlapping multi-talker speech.
Speech Enhancement
Combining Deterministic Enhanced Conditions with Dual-Streaming Encoding for Diffusion-Based Speech Enhancement
IEEE/ACM TASLP, 2025
Introduces a diffusion-based speech enhancement framework with deterministic enhanced conditions and dual-stream encoding.
Robust Speech Processing
Waveform-domain Speech Enhancement Using Spectrogram Encoding for Robust Speech Recognition
IEEE/ACM TASLP, 2024
Presents a waveform-domain speech enhancement method with spectrogram encoding for robust speech recognition.