研究内容
エッジAI
イベントカメラなどの新しいビジョンセンサと、軽量で効率的なAIを組み合わせ、実世界の変化を素早く捉えるセンシング技術を研究しています。センサの特性を活かした画像復元や動き・三次元構造の推定に加え、推論処理や通信量の削減、能動学習によるラベル付けの効率化にも取り組んでいます。限られた計算資源やデータのもとで、高精度かつ実時間で動作するAIの実現を目指します。
- イベントカメラの密なタスクにおける推論の効率化(MIRU2026)
- 通信帯域を考慮したイベント表現学習(MIRU2026)
- EMARS: Event-based Motion-Aware Correction, Deblurring and Interpolation of Rolling Shutter Images(ICIP 2026)
- Geometric-Photometric Event-based 3D Gaussian Ray Tracing (CVPR 2026 Highlight)
- Simultaneous Motion And Noise Estimation with Event Cameras(ICCV2025)
- イベントカメラを用いたシュリーレンイメージング技術による空気の対流の非侵襲推定
- イベントカメラを用いた三次元人体スキャン
- イベントベースオプティカルフロー推定のための自己教師あり学習によるノイズ除去
- イベントカメラによるオプティカルフローとエゴモーション推定
- Non-Deep Active Learning for Deep Neural Networks
- 車載イベントカメラによるオプティカルフロー推定
- イベントカメラを用いた照明条件やぶれに頑健な二次元コード認識
フィジカルAI
人やロボットの動作を理解・予測し、適切な行動の生成や制御へつなげる研究を進めています。映像からの人物検出・追跡、姿勢推定、行動認識、環境理解を基盤として、物理的な整合性を考慮した動作生成や強化学習による制御に取り組んでいます。また、静止画像から生成した擬似動画を活用するなど、動きの表現を効率的に学習する手法も探究し、人とAIが実世界で協調するための知能を目指します。
- Data Collection-free Masked Video Modeling
- Guided by the Way: The Role of On-the-route Objects and Scene Text in Enhancing Outdoor Navigation
- Boosting Outdoor Vision-and-Language Navigation with On-the-route Objects
- 術具情報を考慮した形成外科手術における自動工程分類
- 音響情報を用いた人物姿勢推定
- 動的シーングラフ生成における物体と関係性の同時検出
- Retrieving and Highlighting Action with Spatiotemporal Reference
- Temporal Action Proposal からのモーメント・文章間マッチング
- 人と物体の存在確率を用いた日常行動認識
- 工場生産ラインにおける詳細行動認識
- CNNを用いた距離学習による人物再同定
- 追跡軌跡の再同定を用いたオンライン複数物体追跡
- 行動遷移映像における時系列行動認識
- キャリブレーションフリー視線推定
マルチモーダルAI
画像・映像、言語、音などの異なる情報を結び付け、世界を理解し、新しい表現を生み出すAIを研究しています。画像と言語の対応を学習したモデルや生成モデルを活用し、少数データによる画像認識、言葉を手掛かりとする領域分割、音と映像を統合した理解・生成などに取り組んでいます。多様な情報の相互補完と学習済みモデルの有効活用を通じて、未知の対象や状況にも柔軟に対応するAIを目指します。
- マルチモーダル事前知識を活用した大規模化可能な意味ジェスチャー生成(MIRU2026)
- Textual Inversionによる共通テキスト埋め込み表現に基づくゼロショットMusic-to-Image生成(MIRU2026)
- DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers(NeurIPS 2026採択)
- 異なる光学衛星画像の自動色調整合に向けたOverlap-aware ViT Harmonizer(SSII2026)
- Reference-Free Image Quality Assessment for Virtual Try-On via Human Feedback(ECCV2026)
- Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning (CVPR 2026)
- Listening without Looking: Modality Bias in Audio-Visual Captioning(ICIP 2026)
- 4D Reconstruction from Sparse Dynamic Cameras(CVPR 2026 Workshop 4DV)
- Sign-to-Speech Prosody Transfer (ICPR2026)
- Pre-training with Synthetic Patterns for Audio
- Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos
- Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding
- Formula-Supervised Sound Event Detection: Pre-Training Without Real Data
- Rethinking Image Super-Resolution from Training Data Perspectives
- Proto-Adapter: Efficient Training-Free CLIP-Adapter for Few-Shot Image Classification
- 小売商品棚を対象にした画像認識のための大規模データセット構築
- MaskDiffusion: Exploiting Pre-trained Diffusion Models for Semantic Segmentation
- TAG: Guidance-free Open-Vocabulary Semantic Segmentation
- Boosting Semantic Segmentation by Conditioning the Backbone with Semantic Boundaries
- 重要パッチ選択に基づく効率的な動画認識
- 効率的な3DCG背景制作のための360度画像の周辺補完
- 完全合成画像での学習による文書画像の影除去
- 動画内の音と映像によるイベント推定タスクにおける時間方向クロスモーダルアテンションの導入
- Fast Soft Color Segmentation
- 自然言語指示文による物体画像の属性変換
- Segmentation のためのスーパーピクセル上でのGraph Convolutional Neural Networks
- CNN分類器を用いた画像識別における顕著性マップ生成
- GANによるカラー調整と画像補完の同時実行
フィールドAI
センシングとAIの研究成果を、宇宙・スポーツ・ファッション・医療などの実際の現場へ届ける研究を進めています。衛星画像の解析、スポーツ動作の評価、バーチャル試着、手術工程の認識や診断支援など、各分野に固有の課題に向き合い、専門家や企業との連携を通じて技術を磨いています。実環境の制約や利用者の視点を踏まえ、現場で役立つシステムと新たな価値の創出を目指します。
- 行動スポッティングと行動セグメンテーションを併用したゴルフスイングのフェーズ検出
- 手と術具の相互作用に基づく特徴融合を用いたOpen Surgeryにおける術具検出(MIRU2026)
- 専門家の視線を活用したフィギュアスケートジャンプの質の評価
- 専門家の視線を活用したフィギュアスケートジャンプの質の評価
- マルチモーダルな手指データによる変形性関節症の検出
- 距離画像を使用した側弯症診断
- 定常配置の学習に基づく物体の操作方法推定
- 操作タスク入力に基づく物体の機能部推定
- Tactile Logging:人間動作解析に基づく物体表面への操作履歴の記述手法
- 機能属性の空間配置に着目した類似形状物体の6自由度姿勢推定
- 背面モアレ画像からの脊柱配列推定による側弯症スクリーニング
- テニスの試合映像におけるショット検出
- ラグビー映像解析システム
- アメリカンフットボール映像解析システム
- スイマートラッキングシステム
