Open-source models, code, and resources from my research on speech understanding and generation.
Open-source models, code, and resources from my research on speech understanding and generation.
Sarashina-TTS: Japanese-Centric LLM-Based Text-to-Speech
Japanese and English speech generation, zero-shot voice generation, diverse speaking styles, and cross-lingual synthesis.
[Technical Report] [Huggingface] [GitHub] [Benchmark]
Kana-Whisper: Katakana-Oriented Japanese Speech Recognition
A fine-tuned Whisper large-v3-turbo model that transcribes Japanese speech directly into katakana sequences
[Huggingface]
Joyo-kanji-yomi-benchmark: Kanji-Level Pronunciation Evaluation for Japanese TTS
Covering all 2,136 Joyo kanji, 4,378 readings, and 13,095 native-speaker-verified test sentences.
[Huggingface]