I am a first-year Ph.D student at Nara Institute of Science and Technology (NAIST, Japan 🇯🇵) and interested in the field of Natural Language Processing (NLP), especially mechanistic interpretability (MI) and Multimodal models.
Please reach out to me by "ozaki.shintaro.ou6 at naist.ac.jp"
April 2026 ~ Present. Ph.D student at NAIST, Nara 🦌, JAPAN.
Prof. Taro Watanabe @ NLP Lab.
April 2024 ~ March 2026. M.Eng. at NAIST, Nara 🦌, JAPAN.
April 2020 ~ March 2024. B.S. at Meiji University, Tokyo🗼, JAPAN,
Mechanistic Interpretability, Multimodal LLMs, and Natural Language Processing.
August, 2026 - Present: Research Intern at Creative AI Lab, Sony.
June, 2024 ~ Present: Research Assistant at Research and Development Center for Large Language Models (LLMC), National Institute of Informatics (NII).
Affiliated with the interpretability team.
April, 2025 ~ May, 2025: Visiting Research at MBZUAI, UAE 🇦🇪.
August, 2024 ~ September, 2024. Research Intern at Hitachi R&D.
June, 2024 ~ September, 2024: Research Assistant at LLMC, NII.
Affiliated with the evaluation team.
January, 2024 ~ May, 2024: Research Intern at NII.
Peer-reviewed Journal
尾崎 慎太郎, 林 和樹, 坂井 優介, 上垣外 英剛, 林 克彦, 渡辺 太郎. 大規模視覚言語モデルにおける芸術作品の多言語説明生成能力の評価. 自然言語処理 33巻2号. 2026. [paper]
Peer-reviewed Conference
Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe. Simile Understanding in Text-to-Image Models: An Evaluation Framework. ACM MM 2026. 2026/11. [paper] [arxiv]
Justin Vasselli, Arturo Martinez Peguero, Shintaro Ozaki, Frederikus Hudi, Haruki Sakajo, and Taro Watanabe. Nearest-Neighbor Retrieval for Indigenous Image Captioning. AmericasNLP 2026. 2026/07. [paper] Shared Task 2nd Place.
Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, and Taro Watanabe. Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies. EACL 2026 (Main). 2026/03. [paper] [arxiv]
Hongyu Sun, Yusuke Sakai, Haruki Sakajo, Shintaro Ozaki, Kazuki Hayashi, Hidetaka Kamigaito, Taro Watanabe. LoCt-Instruct: An Automatic Pipeline for Constructing Datasets of Logical Continuous Instructions. EMNLP 2025 (Main). 2025/11. [paper]
Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, and Taro Watanabe. BQA: Body Language Question Answering Dataset for Video Large Language Models. ACL 2025 (Main). 2025/08. [arxiv] [paper]
Shintaro Ozaki, Yuta Kato, Siyuan Feng, Masayo Tomita, Kazuki Hayashi, Wataru Hashimoto, Ryoma Obara, Masafumi Oyamada, Katsuhiko Hayashi, Hidetaka Kamigaito and Taro Watanabe. Understanding the Impact of Confidence in Retrieval Augmented Generation: A Case Study in the Medical Domain. BioNLP 2025. 2025/08. [arxiv] [paper]
Shintaro Ozaki, Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, and Taro Watanabe. Towards Cross-Lingual Explanation of Artwork in Large-scale Vision Language Models. NAACL 2025 (Findings). 2025/05. [arxiv] [paper]
Adam Nohejl, Frederikus Hudi, Eunike Andriani Kardinata, Shintaro Ozaki, Maria Angelica Riera Machin, Hongyu Sun, Justin Vasselli, and Taro Watanabe. Beyond Film Subtitles: Is YouTube the Best Approximation of Spoken Vocabulary?. COLING 2025. 2025/01. [arxiv] [paper]
Keito Kudo, Hiroyuki Deguchi, Makoto Morishita, Ryo Fujii, Takumi Ito, Shintaro Ozaki, Koki Natsumi, Kai Sato, Kazuki Yano, Ryosuke Takahashi, Subaru Kimura, Tomomasa Hara, Yusuke Sakai, and Jun Suzuki. Document-level Translation with LLM Reranking: Team-J at WMT 2024 General Translation Task. Proceedings of the Ninth Conference on Machine Translation (WMT'24), 2024/11. [paper] [paper]
Takehiro Sato, Shintaro Ozaki, and Daisaku Yokoyama. An Implementation of Werewolf Agent That does not Truly Trust LLMs. The 2nd Workshop of AI Werewolf and Dialog System (AIWolfDial). 2024/09. [arxiv] [paper]
Others
動画生成モデルにおける直喩理解と喩体の生成挙動. 王 略丞 , 尾崎 慎太郎, 上垣外 英剛, 林 克彦, Kwon Jingun, 奥村 学, 渡辺 太郎. 第21回NLP若手の会 シンポジウム(YANS), 2026/08. [link]
Hyeonwoo Song, Shintaro Ozaki, Kazuki Hayashi, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe . Constructing a Multilingual Parallel Corpus from Fandom Wikis: A Pokemon Case Study. 第21回NLP若手の会 シンポジウム(YANS), 2026/08. [link]
王 略丞, 尾崎 慎太郎, 上垣外 英剛, 林 克彦, Kwon Jingun, 奥村 学, 渡辺 太郎. 直喩理解能力に着目した画像生成モデルの評価フレームワーク. 第268回自然言語処理研究会. 2026/06. [paper] 若手奨励賞.
尾崎 慎太郎, 橋本 航, 上垣外 英剛, 林 克彦, 渡辺 太郎. n-gramに基づく推論モデルの信頼度と較正特性の分析. 第32回言語処理学会年次大会. 2026/03. [paper]
尾崎 慎太郎, 平岡 達也, 大竹 啓永, 大内 啓樹, 磯沼 大, Benjamin Heinzerling, 乾 健太郎, 渡辺 太郎, 宮尾 祐介, 大関 洋平, 髙木 優. 大規模言語モデルの潜在言語は一貫しているべきか?. 第32回言語処理学会年次大会. 2026/03. [paper] 委員特別賞.
王 略丞, 尾崎 慎太郎, 上垣外 英剛, 林 克彦, Kwon Jingun, 奥村 学, 渡辺 太郎. 画像生成モデルにおける直喩喩体の生成挙動分析. 第32回言語処理学会年次大会. 2026/03. [paper] 委員特別賞.
加藤 優汰. 尾崎 慎太郎, 林 和樹, 坂井 優介, 上垣外 英剛, 林 克彦, 渡辺 太郎. 知識グラフの反復的な探索による画像の詳細な説明文の生成. 第32回言語処理学会年次大会. 2026/03. [paper]
林 和樹, 尾崎 慎太郎, 神野 倫行, 上垣外 英剛, 渡辺 太郎. Noisy Channel に基づく生成確率による画像生成評価. 第32回言語処理学会年次大会. 2026/03. [paper] 優秀賞.
Shintaro Ozaki, Tatsuya Hiraoka, Hiroto Otake, Hiroki Ouchi, Masaru Isonuma, Benjamin Heinzerling, Kentaro Inui, Taro Watanabe, Yusuke Miyao, Yohei Oseki, Yu Takagi. Do LLMs Need to Think in One Language? Correlation between Latent Language and Task Performance. Japanese Symposium on Open Large Language Models. 2025/11. [link]
Hiroto Otake, Hiroki Ouchi, Shintaro Ozaki, Tatsuya Hiraoka, Taro Watanabe, Yusuke Miyao, Yohei Oseki, Yu Takagi. Formation of Geospatial Representations in Large Language Models and the Effect of Training Data. Japanese Symposium on Open Large Language Models. 2025/11. [link]
Shintaro Ozaki, Kazuki Hayashi, Hidetaka Kamigaito, and Taro Watanabe. Revealing Socio-Economic Bias in Text-to-Image Models. 第20回NLP若手の会 シンポジウム(YANS), 2025/09. [link]
加藤 優汰. 尾崎 慎太郎, 林 和樹, 小原 涼馬, 上垣外 英剛, 渡辺 太郎, 小山田 昌史, 林 克彦. あなたのLLM、信用できますか? —ペルソナの観点による分析—. 第20回NLP若手の会 シンポジウム(YANS), 2025/09. [link]
Shintaro Ozaki, Tatsuya Hiraoka, Hiroto Otake, Hirki Ouchi, Masaru Isonuma, Benjamin Heinzerling, Kentaro Inui, Taro Watanabe, Yusuke Miyao, Yohei Oseki, and Yu Takagi. Do LLMs Need to Think in One Language? Correlation between Latent Language and Task Performance. 2025/05. [arxiv]
大竹 啓永, 大内 啓樹, 尾崎 慎太郎, 平岡 達也, 渡辺 太郎, 宮尾 祐介, 大関 洋平, 高木 優. 大規模言語モデルにおける地理表現の形成と訓練データの影響. 第39回 人工知能学会全国大会. 2025/05. [paper]
Shintaro Ozaki, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, and Taro Watanabe. TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation. 2025/04. [arxiv]
尾崎 慎太郎, 平岡 達也, 大竹 啓永, 大内 啓樹, 渡辺 太郎, 宮尾 祐介, 大関 洋平, 高木 優. 大規模言語モデルにおけるペルソナの役割と内部動作の理解. 第31回 言語処理学会年次大会. 2025/03. [paper]
尾崎 慎太郎, 加藤 優汰, 馮 思遠, 富田 雅代, 林 和樹, 小原 涼馬, 小山田 昌史, 林 克彦, 上垣外 英剛, 渡辺 太郎. 検索拡張生成による信頼度の影響: 医療分野における分析. 第31回 言語処理学会年次大会. 2025/03. [paper]
佐藤 岳大, 尾崎 慎太郎, 横山 大作. 戦略的発話の多様な生成を目指した人狼エージェントの構築. 第31回言語処理学会年次大会. 2025/03. [paper]
尾崎 慎太郎, 林 和樹, 坂井 優介, 上垣外 英剛, 林 克彦, 渡辺 太郎. 大規模視覚言語モデルによる芸術作品の多言語説明生成. 第262回自然言語処理研究会. 2024/12. [paper]
尾崎 慎太郎, 林 和樹, 大羽 美悠, 坂井 優介, 上垣外 英剛, 渡辺 太郎. マルチモーダル大規模言語モデルは非言語コミュニケーションを理解しているか?. 第19回NLP若手の会 シンポジウム(YANS), 2024/09. [link] 奨励賞.
LLM-jp. LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs. [arXiv], 2024/07.
尾崎慎太郎, 横山大作. 国会議事録を使用した政党ごとのスタンスの変遷の分析. pp. 2487-2492. 第30回 言語処理学会年次大会, [paper], 2024/03.
尾崎慎太郎, 横山大作. 国会議事録を用いた政党のスタンス分析に向けて. 第18回NLP若手の会 シンポジウム(YANS), 2023/08. [link]
ARR, ACL SRW, WMT, and others.