名古屋工業大学
工学研究科工学専攻 情報工学系プログラム メディア情報分野
工学部 情報工学科 メディア情報分野
私たちは動画像理解を中心に,計算機が実世界を理解するための研究を幅広く行っています.動画というメディアは,映像だけでなく音声やテキスト,さらには状況や文脈までも含むマルチモーダルな情報源です.スポーツ映像,医用画像,監視カメラ映像など,多種多様な分野への応用を考えて,AI技術の可能性を拡げています.
動作認識
動作認識 (Action Recognition)
ゼロショット動作認識 (Zero-Shot Action Recognition, ZSAR)
動作検出
時空間動作検出 (Spatio-Temporal Action Detection)
空間的動作検出 (Temporal Action Localization, TAL)
弱教師あり空間的動作検出 (Wealky-supervised Temporal Action Localization, WTAL)
イベント検出 (Event Detection)
物体との相互作用の検出 (Human-Object Interaction (HOI) detection)
物体検出
物体検出 (Object Detection)
人物検出 (Person Detection)
歩行者検出 (Pedestrian Detection)
Open-Vocabulary物体検出 (Open-Vocabulary Object Detection)
追跡
物体追跡 (Object Tracking, Visual Object Tracking, VOT)
単一物体追跡 (Single Object Tracking, SOT)
複数物体追跡 (Multiple Object Tracking, MOT)
セグメンテーション
セマンティックセグメンテーション (Semantic Segmentation)
インスタンスセグメンテーション (Instance Segmentation)
パノプティックセグメンテーション (Panoptic Segmentation)
アモーダルセグメンテーション (Amodal Segmentation)
動画セグメンテーション (Video Segmentation)
物体追跡セグメンテーション (Video Object Segmentation)
姿勢推定
人物姿勢推定 (Human Pose Estimation, HPE)
キャプショニング・説明生成
画像キャプショニング (Image Captioning, Dense Captioning)
動画キャプショニング (Video Captioning, Dense Video Captioning)
質問応答・領域特定
視覚質問応答 (Visual Question Answering, VQA)
動画質問応答 (Video Question Answering, VideoQA)
視覚的根拠の決定・グラウンディング (Visual Grounding, Video Grounding)
生成・変換
画像生成 (Text-to-Image Generation, T2I)
動画生成 (Text-to-Video Generation, T2V)
画像から動画への変換 (Image-to-Video Generation, I2V)
拡散モデルによる画像・動画生成 (Diffusion Models for image / video generation)
GANによる画像・動画生成 (GANs for image / video generation)
編集・補完(Editing / Inpainting / Outpainting)
画像編集 (Image editing, Image-to-Image Generation, I2I)
画像・動画編集 (Image / Video Editing)
インペインティング (Image Outpainting)
動画アウトペインティング (Video Outpainting)
画像・動画補完 (Image / Video Completion)
基盤モデル(LLM / VLM)
大規模言語モデル (LLM, Large Language Model)
視覚言語モデル (VLM, Visual Language Model)
大規模視覚言語モデル (LVLM, Large Visual Language Model)
マルチモーダルLLM (Multimodal LLM, MLLM)
ネットワークアーキテクチャ
CNNモデル (CNN models, CNNs)
時系列モデル (Sequence models), RNN / LSTM
Vision Transformerモデル (Vision Transformer models, ViTs)
自己アテンション・相互アテンション (Self-Attention, Cross-Attention)
アテンションマップ (Attention Maps)
トークン削減,トークンマージ (Token reduction / merging)
Manba
マルチエージェント対話 (Multi-Agent Dialogue)
Chain-of-Thought (CoT)
パラメータ効率化
パラメータ効率のよい再学習 (PEFT, Parameter Efficient Fine-Tuning)
アダプタ・LoRA (Adapters, LoRA)
複数LoRAの分離・合成 (Separation / Composition of Multiple LoRAs)
様々な学習方法
教師あり学習 (Full-supervised Learning)
弱教師あり学習 (Weak-supervised Learning)
半教師あり学習 (Semi-supervised Learning)
マルチラベル学習 (Multi-label learning)
マルチインスタンス学習 (Multiple Instance Learning, MIL)
自己教師あり学習 (Self-supervised Learning)
様々な環境への対応
マルチドメイン学習 (Multi-Domain Learning)
マルチタスク学習 (Multi-Task Learning)
マルチデータセット学習 (Multi-Dataset Learning)
ドメイン適応 (Domain Adaptation)
特徴の学習
対照学習 (Contrastive Learning)
埋め込み (Embedding)
表現学習 (Representation Learning)
潜在表現学習 (Latent Representation Learning)
Disentangled Representation Learning
効率的な学習
Zero-shot学習,Few-shot学習 (Zero-/Few-shot Learning)
プロンプト学習 (Prompt Learning)
学習クエリ (Learnable Queries)
Prompt Tuning
コンテキスト内学習 (In-context Learning)
連続的な学習
長尺動画学習 (Long-form video learning)
オンライン動画ストリーム学習 (Online Video stream Learning)
継続学習 (Continual Learning)
モデル構造
知識蒸留 (Knowlede Distillation)
アンサンブル学習 (Ensemble Learning)
MoE (Mixture-of-Experts)
MoVE (Mixture-of-Vision Experts)
データ拡張
データ拡張 (Data Augmentation)
動画用データ拡張 (Video Data Augmentation)
バイアスの解析と対策
データセットバイアス (Dataset Bias)
静的バイアス (Static Bias)
物体バイアス (Object Bias)
表現バイアス (Representation Bias)
選手追跡 (Player Tracking)
ボールとシャトルの検出・追跡 (Ball / Shuttle Detection and Trackinig)
コート検出と白線検出 (Court and Line Detection)
ショット分類 (Shot Classification)
ショット・ヒットの時刻の検出 (Shot/Hit Detection)
ラリーの検出と解析 (Rally Detection and Analysis)
ラリー回数の計測 (Rally Counting)
ボール回転数計測 (Ball Spin Estimation)
戦術キャプション生成 (Tactical captioning)
戦術解析 (Tactical Analysis)
スキル判定 (Skill Estimation)
カメラキャリブレーション (Camera Calibration)
データセット構築とアノテーション (Dataset Construction and Annotation)