arXiv雑要約
画像・音声 - 2026/07/30 公開
知識誘導によるアトミックアクションを用いた行動の解きほぐしと認識 [cs.CV]目的:複雑なシーンにおける複数同時発生の微細な行動構造のモデル化
- 行動認識は,ロボティクスや監視システムなど,様々な分野で重要な役割を果たす。
- 既存手法は包括的な表現に頼る傾向があり,微妙な相互作用や詳細な意味を捉えにくい。
- 本研究は,より正確な行動の解きほぐしと認識を可能にするための知識誘導アプローチを提案する。
- 大規模言語モデルを用いて行動ラベルをアトミックアクションに分解し,空間・時間的な意味情報を明示的に提供する。
- 知識注入モジュール(KIM)は,アトミックアクションの知識をビデオ特徴に統合し,特徴の識別能力を向上させる。
- 知識解きほぐしモジュール(KDM)と知識解きほぐし損失(KD Loss)により,知識コンポーネントのより明確な解きほぐしを促し,最先端の性能を達成する。
野生環境で撮影された単一の人間の画像からの体重と身長推定 [cs.CV, cs.AI, cs.LG]目的:体重と身長の推定
- 体重と身長は,身体的・精神的健康,生活習慣,経済状況を示す重要な指標である。
- ポーズ,カメラ位置,外観,背景など多様な条件により,野生環境での画像からの自動BMI推定は困難である。
- 本研究は,様々な条件下で撮影された画像からBMI,体重,身長を推定する手法を確立することを目指す。
- RGB,深度マップ,ポーズアフィニティマップ,エッジマップなどの異なるモダリティを用いた深層ニューラルネットワークの性能を検証した。
- 身長,体重,BMIの真値ラベルを含む6105枚の新しいデータセットを提案し,公開した。
- 実験結果から,全身画像が半身画像や顔画像よりも優れた推定精度を示すことが明らかになった。
TraceCLIP:パッチからのCLSへの貢献度から局所的意味を復元 [cs.CV, cs.AI]目的:局所的意味の復元
- 画像と言語の理解は,物体検出やセマンティックセグメンテーション等,多様なタスクの基盤となる重要な研究分野である。
- CLIPは強力だが,画像全体に対する学習であるため,局所的な視覚と言語の対応関係が十分に捉えられていないという課題がある。
- CLIP内部の情報を活用し,追加学習や外部モデルなしで局所的意味を復元し,セマンティックセグメンテーションの精度向上を目指す。
- TraceCLIPは,CLSアテンション出力におけるパッチ固有の項を分離することで,潜在的なパッチレベルの意味的証拠を復元する。
- 貢献度から得られた意味的応答を,セマンティック・測地線トポロジーゲートに変換し,最終層のパッチ親和性を調整することで,特徴再構成を行う。
- 8つのゼロショットセマンティックセグメンテーションベンチマークにおいて,既存の学習不要手法を平均で1.3〜4.5ポイント上回るmIoUを達成した。
Two2Four: 人間の動きからの四足歩行の操演生成 [cs.GR, cs.LG]目的:人間の動きデータからの四足歩行動作生成手法
- 仮想制作におけるリアルな動物の動きは重要であり,表現の幅を広げる。
- 従来のモーションキャプチャやモーションリターゲティングは,動物特有の動きを再現しにくい。
- 人間の動きから自然で制御可能な四足歩行動作を自動生成し,制作ワークフローを改善する。
- 本研究では,四足歩行モーションデータのみで学習した生成拡散モデルを用いて,人間の動きを四足歩行動作に変換する。
- 構造化された条件付けとインペインティング戦略により,歩行,走行,ジャンプなど多様な動作に対応可能である。
- 頭部の動きや個々の四肢の制御といった,きめ細かい直感的な制御も実現し,リアリティと制御性を向上させた。
DVPSFormer:自律走行のための効率的なオンライン深度認識ビデオパノラマセグメンテーション [cs.CV]目的:自律走行のための4次元シーン理解
- 安全な自律走行には,周囲環境の包括的な理解が不可欠である。
- 既存手法は計算コストが高く,リアルタイムでの意思決定には不向きである。
- リアルタイム処理可能な効率的なパノラマセグメンテーション手法を開発する。
- 提案手法DVPSFormerは,シーンの離散化と連続化を組み合わせることで,高速かつ正確な深度推定とセマンティックセグメンテーションを実現した。
- オンライン多数決機構により,インスタンス追跡中の分類精度が向上し,時間的な一貫性が強化された。
- Cityscapes-DVPSおよびSemKITTI-DVPSベンチマークにおいて,最先端の性能を達成した。
一枚の写真には多くの言葉がある - ハイブリッド深層学習による皮膚曝露データ活用と安全性評価の向上 [cs.CV, cs.AI, cs.LG]目的:画像からの皮膚曝露量の定量化
- 労働安全衛生において,皮膚曝露は健康リスクに直結するため,正確な評価が重要である。
- 従来の皮膚曝露評価は時間と労力を要し,大規模なデータ収集が困難であった。
- 画像データから効率的に半定量的な曝露情報を抽出し,安全性評価の精度向上を目指す。
- 開発されたハイブリッド画像解析手法は,画像中の皮膚曝露量を定量化できることが示された。
- Mask R-CNNとカラーベースのアルゴリズムの組み合わせにより,人体を検出し,背景の影響を除去し,皮膚をセグメント化することが可能となった。
- 皮膚曝露面積と全身ピクセル比の算出結果は,人間の見積もりと約80%の合致率を示した。
Rad-JEPA 3D:3D CTスキャンに対する放射線科的関節埋め込み予測モデル [cs.CV]目的:3D CTスキャンのボリューメトリック表現学習
- 医療画像解析において,CTスキャンデータは豊富だが専門家によるアノテーションは不足しているため,自己教師あり学習が重要である。
- 既存のボリューメトリックエンコーダは,ダウンストリームタスクに必要な空間構造や幾何学的構造を十分に保持できないという課題がある。
- Rad-JEPA 3Dは,マスクされた視点からの潜在的特徴を予測することで,空間構造を保持し,より高精度なボリューメトリック表現を獲得することを目指す。
- Rad-JEPA 3Dは,MambaとAttentionを組み合わせたハイブリッドエンコーダとHidden States Orthogonal Regularization (HSOR)を導入することで,より一貫性と識別力のあるボリューメトリック表現を生成する。
- 約12万件のCTスキャンで事前学習した結果,Rad-JEPA 3Dはコンパクトなサイズ(40億パラメータ)ながら,最先端のVQAや空間推論ベンチマークにおいて優れた性能を達成した。
- アブレーションスタディにより,ハイブリッドブロックとHSORが相補的な効果をもたらし,誘起された空間構造がボリューメトリック推論タスクにおいて言語モデルの規模を代替できることが示された。
野生環境における動画の影除去:詳細保持型動画拡散モデルによるアプローチ [cs.CV]目的:野生環境における動画の影除去手法
- 動画処理技術は,監視システムや自動運転など幅広い分野で不可欠であり,その性能向上は重要である。
- 現実の複雑な環境下での影除去は,照明条件や影の外観の多様性,学習データの不足により困難である。
- 本研究は,複雑な環境下においても高品質な影除去を可能とする手法を開発し,実用的な動画処理技術の向上を目指す。
- 本手法は,事前学習済みの動画拡散モデルをLoRAで微調整することで,ロバストな影除去を実現している。
- VAEデコーダへの詳細注入モジュールや,影マスクをガイドとした周波数分解変調モジュールにより,詳細なテクスチャを保持しつつ影アーティファクトを抑制している。
- Depth Anything 3からの単眼深度情報を用いることで,困難な照明条件下でも幾何学的な整合性を考慮した影除去を可能にしている。
物理学とプライバシーの融合:プライバシー保護のための連合学習型PINNによる脳腫瘍バイオメカニカルモデリング [cs.CV]目的:脳腫瘍バイオメカニカルモデリングにおけるプライバシー保護
- 脳腫瘍は脳組織の力学的特性を変化させるため,診断・治療において重要である。
- 患者データ集約型の深層学習は,GDPRやHIPAA等のプライバシー規制と,汎化性能の限界という課題がある。
- 連合学習と物理情報ニューラルネットワークにより,プライバシーを保護しつつ,高精度なモデリングを目指す。
- 連合学習モデルの全体精度は91.4%に達し,非連合学習ベースライン(90.0%)を上回った。
- 腫瘍クラス全体で平均AUCは0.985,特に下垂体腫瘍の精度は85.6%から94.5%に向上した。
- 物理ベース制約と連合学習を組み合わせることで,性能劣化なく滑らかな変位場を得られた。
ラグを考慮した双手行動セグメンテーションのためのクロスハンドアライメント [cs.CV]目的:双手行動セグメンテーションにおける,左右の手の表現のずれを考慮したアライメント手法
- 人間の行動理解において,両手の協調的な動きは重要な情報であり,正確な認識が求められる。
- 従来の双手行動セグメンテーションは,左右の手のずれを無視しており,正確性に課題があった。
- 左右の手のずれを明示的にモデル化することで,セグメンテーション性能の向上を目指す。
- 提案手法LACAは,左右の手の特徴ストリーム間の時間オフセット分布を推定し,クロスハンド情報を活用する。
- HA-ViDとATTACHデータセットで実験した結果,LACAはPolyphonyの性能を平均F1@50で2.1~2.9ポイント向上させた。
- LACA-Cは,リアルタイム性を重視した条件下で,高い遷移キューのリコール率と低い誤検出率を達成した。
BG-REAL:背景操作検出・局在化のための実データに基づいたベンチマーク [cs.NI, cs.DC, cs.CV]目的:背景操作の検出と局在化に関するベンチマーク
- 画像フォレンジック分野は,デジタル証拠の信頼性確保に不可欠であり,その重要性は増している。
- 既存の評価手法は,前景オブジェクトに焦点を当てがちで,背景領域の操作検出には不十分な場合がある。
- 本研究は,背景領域の操作に特化した,より実用的な評価基準を確立することを目的とする。
- BG-REALは,Open Images V7のインスタンスセグメンテーションデータを用いて構築された,7,000枚の実データサンプルから構成される。
- 既存のベースラインモデルの誤分類率を評価した結果,再エンコードされた正画像が操作画像と誤認識されるリスクがあることが示された。
- BG-REALは,汎用的な画像操作検出ベンチマークを補完する,背景操作に焦点を当てたベンチマークとしての役割を担う。
スプラインに基づく境界表現:疎な視点からの再構成と等幾何解析を用いたシミュレーション [cs.CV, cs.CE]目的:疎な視点画像からの三次元形状再構成とシミュレーションのための境界表現手法
- 画像から三次元形状を復元する技術は,デジタルツインや設計の分野で不可欠である。
- 画像再構成で得られる形状は,数値シミュレーションに必要な滑らかさや閉鎖性を満たしていない。
- 画像再構成とシミュレーションに適した形状を,一つの最適化フレームワークで実現することを目指す。
- 提案手法FORGE-SIMは,手動介入なしに疎なRGB画像からBスプライン境界表現を直接再構成できる。
- 再構成された形状はコンパクトで滑らか,かつ閉鎖的であり,CADやシミュレーションにそのまま利用可能である。
- 観測された熱状態や意味情報をスプライン基底に投影することで,シミュレーションへの即時利用を可能にした。
LumaGuide:拡散モデルにおけるトレーニング不要HDR生成のための分布形状制御 [cs.CV]目的:拡散モデルにおけるHDRコンテンツ生成のための分布形状制御
- 現実的な画像生成が可能だが,学習データの統計的偏りがHDR生成を制限する。
- 既存の拡散モデルでは,学習データに依存したバイアスがHDR生成のボトルネックとなる。
- モデルの再学習なしに,出力分布を直接制御することでHDR生成を実現する。
- LumaGuideは,拡散モデルのサンプリング過程を制御し,ターゲットの特徴分布に合わせることでHDR生成を実現する。
- 輝度分布を調整するだけで,コヒーレントなハイライトと影の詳細を維持したHDR画像を生成可能である。
- データ駆動型プリセット,参照画像,テキストによる予測を用いて,ターゲット分布を柔軟に指定できる。
エッジデバイス向け猛禽類軽量画像分類:ビデオフレーム抽出,知識蒸留,TensorRTデプロイによる希少種データセット拡張 [cs.CV, cs.LG, eess.IV]目的:風力タービンにおける衝突軽減のための,リアルタイムエッジ展開を目的とした猛禽類の軽量画像分類
- 風力発電の普及に伴い,鳥類との衝突問題が深刻化しており,自動識別技術による対策が急務である。
- 猛禽類は種間の類似性が高く,画像認識における正確な識別が困難であるという課題がある。
- 希少種の画像データ不足を解消し,識別精度向上とリアルタイム処理性能の両立を目指す。
- DINOv2-Lを教師として知識蒸留を行った結果,MobileNetV4,ViT-Small,EfficientNet-B0といった軽量なモデル群が良好な性能を示した。
- ビデオフレーム抽出によりデータセットを拡張したことで,特にオオワシとステラーワシの誤識別率が大幅に低下し,White-tailed Eagleの再現率が最大38.6%向上した。
- EfficientNet-B0をNVIDIA Jetson Orin NanoにTensorRT FP16でデプロイしたところ,3.19ms/image (313 images/s)という高速処理を実現し,FP32との精度劣化はほぼ見られなかった。
アメリカにおける宗教ラジオ放送のウェブストリーム録音による大規模テキストコーパス [cs.CL, cs.CY, cs.SD, stat.AP]目的:アメリカにおける宗教ラジオ放送のテキストデータ
- 宗教ラジオはアメリカで広く普及しているが,学術的な研究が少ない分野である。
- 大規模なテキストデータが存在しないため,内容レベルでの分析が困難であった。
- 宗教ラジオ放送の内容分析を可能にする大規模なコーパスを構築すること。
- 本研究では,2025年7月の1か月間,785の異なるストリームから宗教ラジオ放送を録音し,6000万行以上の音声データを生成した。
- 自動パイプラインを用いてテキスト化と話者分離を行い,さらに大規模言語モデルで番組形式とトピックをラベル付けした。
- これにより,地域や宗派ごとの宗教放送の研究,社会・政治問題に関する議論の分析,音声処理研究への貢献が期待される。
頭頸部癌における遠隔転移予測に対する基盤モデル由来の埋め込み表現と従来手法の性能比較 [cs.FL, math.LO, cs.CV, physics.med-ph]目的:頭頸部癌患者の遠隔転移リスク予測
- 頭頸部癌の予後改善には,早期の遠隔転移リスク予測が不可欠である。
- 従来の機械学習は専門知識を要する領域の事前知識に依存し,時間と労力を要する。
- 基盤モデルを活用することで,専門知識や注釈付きデータセットへの依存を軽減する。
- CT基盤モデル由来の埋め込み表現を用いたモデルは,従来のラディオミクスや深層学習モデルを上回る性能を示した。
- CT基盤モデルは,AUC 0.791を達成し,ラディオミクス(0.772)や深層学習(0.753)よりも高い結果となった。
- CT基盤モデルは,ラディオミクスと深層学習を組み合わせたモデル(AUC 0.794)と同等の性能を示した。
HeteroPROPMT:リアルタイムかつプライバシー保護された異種協調知覚フレームワーク [cs.CV, cs.RO]目的:異種環境における協調知覚の実現
- 自動運転システムの安全性向上には,周囲環境の正確な把握が不可欠である。
- 異種センサーやモデルを使用する車両間では,特徴空間のずれが検知性能低下の要因となる。
- 本研究は,プライバシーを保護しつつ,異種環境下でも効率的な協調知覚を実現することを目指す。
- HeteroPROMPTは,モジュール型プロンプトと軽量な学習により,異種エージェントの特徴を統一的な特徴空間に迅速に整列させる。
- 既存手法と比較して,大幅に少ない学習パラメータ数で,平均精度を向上させることを実験的に示した。
- 提案手法は,エージェントの機密情報を保護しながら,リアルタイムなモダリティ分類とルーティングを可能にする。
Eddeep:拡散MRIにおける高速渦電流歪み補正のための深層学習フレームワーク [cs.CV]目的:拡散MRIにおける渦電流による幾何学的歪みの高速補正
- 拡散MRIは脳組織の微細構造解析に不可欠だが,渦電流歪みによる影響を受けやすい。
- 既存の補正手法は精度が高い一方,計算コストが高く,大規模データ解析のボトルネックとなる。
- 深層学習を用いて,高速かつ高精度な渦電流歪み補正を実現し,解析パイプラインの効率化を図る。
- Eddeepは,外観の標準化と物理制約に基づいた登録ネットワークにより,単一のフォワードパスで歪み補正を行う。
- UK BiobankおよびMemodynデータセットにおいて,FSL Eddyと同等の補正品質を,大幅な時間短縮で達成した。
- 本研究は,深層学習が大規模研究や臨床応用における高速拡散MRI処理を可能にすることを示唆する。
MoSAIC:部分的な局所的なモーションスタイル変換のためのアラインメント介入監督 [cs.CV]目的:部分的な局所的なモーションスタイル変換のための手法
- モーション編集は,キャラクターアニメーションにおいて重要な技術であり,多様な表現を可能にする。
- 既存のデータセットでは,任意の部位・局所的なコンテンツに対応するペアデータが不足している。
- アラインメント介入監督により,選択的なモーション編集の精度と制御性を向上させる。
- MoSAICは,コンテンツと参照の特徴を解剖学的領域ごとに分割し,ルート軌跡を独立して条件付けすることで,モーションスタイル変換を行う。
- 部分的なルーティングは,保存領域の誤差を軽減し,不要な領域への影響を抑制することを示した。
- アラインメント介入監督を維持することで,ターゲット領域への応答性と要求されたルーティングの影響度を高めることが確認された。
見るか知るか:マルチモーダル大規模言語モデルにおける視覚的文脈への依存性 [cs.HC, q-bio.NC, eess.SY, cs.SY, cs.CV]目的:マルチモーダル大規模言語モデルにおける視覚的文脈への依存性の評価
- 近年,画像とテキストを統合するマルチモーダル大規模言語モデルの研究が盛んに行われている。
- これらのモデルは事前学習された知識に依存しやすく,視覚情報と矛盾する場合に性能が低下することが課題である。
- 視覚情報の利用状況と事前知識への依存性を分析し,モデルの制御性を改善することを目指す。
- 粗視覚情報はモデルに保持されており,属性の再構成が可能であることが示された。
- 視覚情報を利用または無視するよう指示しても,基本的なモデルの視覚的文脈への依存性は不安定である。
- 教師ありファインチューニングにより制御性が向上し,活性化パッチングで視覚と事前知識のトレードオフが特定された。
ニューラルオーディオコーデックトークンを用いた自己教師あり音声学習における訓練言語感受性の解明 [cs.SD, cs.CL]目的:ニューラルオーディオコーデックトークンを用いた自己教師あり音声学習における言語感受性の分析
- 音声処理技術は,多様な応用において重要であり,その効率的な学習法の確立が求められている。
- 自己教師あり学習は大量のデータが必要だが,計算コストやデータ保管の課題が存在する。
- ニューラルオーディオコーデックを用いた自己教師あり学習の言語依存性を明らかにし,汎用的な利用を目指す。
- 下流タスクの性能は,コーデックの訓練言語に依存しないが,自己教師あり学習の事前学習言語に強く依存することが示された。
- 単一のコーデックを複数言語で再利用できる可能性が示唆された。
- 自己教師あり学習の事前学習言語を目標言語に合わせることが重要であることが示された。
学習の限界におけるポストトレーニング:ファインチューニングへのゲーム理論的アプローチ [cs.LG, cs.AI, cs.GT]目的:言語モデルのファインチューニングにおける報酬と参照ポリシーからの逸脱のバランス
- 言語モデルの性能向上は重要であり,特定のタスクへの適応が求められる。
- KL正則化項の係数設定が,経験則やハイパーパラメータ探索に頼りがちである。
- 統計的識別力に基づいた最適な正則化係数を導出し,効率的なファインチューニングを実現する。
- 提案手法は,Qwen3-8BおよびLlama-3.2-1Bを用いた実験で,継続学習設定において競争力のある報酬保持のトレードオフを示す。
- ゲーム理論的枠組みにより,報酬1単位あたりの統計的識別可能性を最大化する正則化パラメータを決定する。
- このフレームワークは,オープンソースモデルを提供するAPIプロバイダーの監査にも応用可能である。
Zero-Fi:コントラスト信号言語アライメントによるゼロショットWi-Fiベース人間活動認識 [cs.IR, cs.CV, cs.AI]目的:ゼロショットWi-Fiベース人間活動認識の実現
- Wi-Fiセンシングは,非侵襲的な活動認識に有効であり,高齢者見守り等への応用が期待される。
- 既存手法は,事前に定義された活動に限定され,未知の活動の認識には対応できないという課題がある。
- 自然言語による活動記述とWi-Fi信号の対応付けにより,未知活動の認識を可能にすることを目指す。
- 提案手法Zero-Fiは,Wi-Fi信号と自然言語記述を共通の埋め込み空間に配置することで,ゼロショット認識を実現した。
- 大規模データセットでの実験により,Zero-Fiが未知活動クラスの認識において有効であることが示された。
- 信号言語アライメントにより,Wi-Fiセンシングの応用範囲を拡張できる可能性が示唆された。
競争的限界における共謀:価格水準監査は構造的に盲目的である [eess.SY, cs.RO, cs.SY, cs.DB, cs.GT, cs.AI, cs.CR]目的:アルゴリズムによる共謀の可能性
- デジタル経済における価格設定メカニズムの透明性と公正性の確保は重要である。
- 既存の共謀検出手法は,巧妙な共謀行為を見抜くのが困難である。
- 価格設定アルゴリズムの共謀を検出し,規制するための新たなアプローチを提示する。
- 価格データのみに基づく共謀検出は,特定の条件下では盲目的になりうる。
- 言語モデルを用いた実験では,モデル間の入札行動に有意な相関が見られた。
- 入札者の数をカウントすることによって,共謀をある程度抑制できる可能性がある。
3以下の歪みを持つ距離的投票における感度と差分プライバシー [cs.CY, cs.GT, cs.DS]目的:距離的投票における,感度と差分プライバシーのトレードオフに関する研究
- 投票ルールは集団的意思決定の基礎であり,公平性やプライバシー保護が重要である。
- 既存の投票ルールでは,感度とプライバシー保護の両立が困難であった。
- 歪みを3以下に抑えつつ,感度と差分プライバシーを両立するルールを構築すること。
- 歪みを$3-\varepsilon$以下に抑えつつ,最悪ケースの感度を$O((\log m+1)/n)$に制限するランダム化ルールを提案した。
- 単一の当選者をサンプリングするメカニズムにおいて,歪みを$3-\varepsilon$以下に抑え,($O((\log m+\log(1/\delta)+1)/n),\delta$)-差分プライバシーを保証するルールを構築した。
- 両方の構成は,温度パラメータのみが異なる,定数サイズの候補リストに対するギブス分布を使用している。
非登録WLI/NBI内視鏡画像における登録に基づくスペクトル融合による病変セグメンテーション [cs.CV]目的:非登録WLI/NBI内視鏡画像ペアの病変セグメンテーション
- 内視鏡検査は,消化器疾患の早期発見・治療に不可欠であり,病変の正確な認識が重要である。
- WLIとNBIは空間的にずれやすく,単純な融合では非対応領域が混ざり,セグメンテーション精度が低下する。
- 信頼度に基づいた特徴融合により,WLIとNBIの相補的な情報を最大限に活用し,病変セグメンテーションの精度向上を目指す。
- 提案手法は,WLIとNBIの特徴を複素表現で選択的に融合することで,病変セグメンテーション性能を向上させた。
- WLIは形状に関する大きさ応答を,NBIは構造に敏感な位相応答を提供するという役割分担が有効であることが示された。
- 信頼度に基づく登録と複素領域融合が,セグメンテーション性能向上に不可欠であることが検証された。
エージェント型音声認識のためのボイスメモリー [cs.NI, cs.CL, cs.AI, cs.SD, eess.AS]目的:エージェント型音声認識におけるボイスメモリーの提案
- 音声認識の精度向上は,人間と機械の自然な対話を可能にする上で重要である。
- 従来の音声認識システムは,ドメイン適応性や過剰修正の問題を抱えている。
- 本研究は,ドメイン知識を効率的に活用し,過剰修正を抑制することで,音声認識の精度と信頼性を向上させることを目指す。
- ボイスメモリーは,推論時に固定された修正器がドメイン固有のメモリーを参照し,仮説を修正するかどうかを決定する。
- 非同期的にスコアゲート付き最適化器がメモリーを編集し,性能向上が確認された場合にのみ変更を適用する。
- 実験の結果,ボイスメモリーは,10種類のHyPoradiseドメインにおいて,重み付き単語誤り率を8.36%から7.52%に低減することに成功した。
統合マルチモーダルモデルは一つの空間で思考するのか?クロスブランチステアリングによる考察 [cs.CV]目的:統合マルチモーダルモデルにおける意味空間の統一性と転移性
- マルチモーダルな情報処理は,人間のような知能を実現する上で不可欠であり,その重要性は増している。
- 既存モデルでは,テキストと画像などの異質表現間の意味の整合性が課題となっている。
- 異なるブランチ間の意味空間の非対称性を明らかにし,モデルの表現能力を評価する。
- 理解ブランチから学習したステアリングベクトルは,生成ブランチに転移し,制御可能な画像合成と意味の忠実性を向上させる。
- 生成ブランチからのステアリングは効果が限られており,表現のミスマッチが示唆される。
- 理解ブランチは物体中心の意味を,生成ブランチは低レベルな外観特徴を主に捉えていると考えられる。
魚が似ているとき:二分岐弾性を用いた個体追跡 [cs.CV]目的:魚群のような高密度で均質的な対象物の個体追跡
- 複数物体追跡は,監視や行動分析など,様々な分野で重要な役割を担う技術である。
- 魚群のような個体間の類似性が高く,密集し,変形が激しい対象物の追跡は困難を極める。
- 本研究は,計算コストを抑えつつ,高精度な個体追跡を可能にする新しい手法を提案する。
- TIDEは,高価な外観特徴に依存せず,空間的・構造的な一貫性を活用する適応幾何学的対応IoUを用いる。
- 軽量なL分岐は,わずか20.47G FLOPsでHOTA 28.43を達成し,SU-Tと比較して38.7倍の計算量削減を実現した。
- スケーラブルなS分岐はHOTA 29.98を達成し,高精度なクラウド分析と効率的なエッジ追跡の間のギャップを埋めた。
FAS-R1:推論型顔なりすまし検出のための統一マルチタスクMLLM [cs.IR, cs.CV, cs.AI]目的:顔なりすまし検出,攻撃の意味的理解,および画像に基づく証拠の提示
- 顔認証技術の信頼性確保は,セキュリティ上の重要な課題であり,なりすまし検出は不可欠である。
- 既存のなりすまし検出モデルは識別能力に偏り,説明能力に欠ける場合が多い。
- より高度な推論能力と汎化性能を持つ,統一的ななりすまし検出フレームワークを開発すること。
- 提案手法FAS-R1は,認証精度98.75%,攻撃タイプ認識精度93.33%を達成した。
- FAS-R1は,クロスドメインの汎化性能や,説明の質においても既存手法を上回る結果を示した。
- Degradation-Simulated Augmentation (DSA) とDifficulty-Aware GRPO (DA-GRPO)により,難しい攻撃に対する性能が向上した。
MIDIからギタータブ譜への転写のための明示的な音符イベントトークン化と音程妥当性制約付きデコーディング [cs.NI, cs.SD]目的:ギタータブ譜の転写
- 音楽情報処理分野において,自動楽譜作成は重要な課題であり,演奏や学習の支援に繋がる。
- データセットの規模が異なると,既存のシーケンス to シーケンスモデルの汎化性能が低下する問題がある。
- データセット規模に依存せず,より高精度なギタータブ譜の自動生成を目指す。
- 提案手法は,大規模データセットDadaGPにおいて,ベースラインモデルFretting Transformerよりもタブ譜の精度を向上させた。
- 特に,小規模データセットLeducで直接学習した場合,精度向上が顕著であった。
- 音程妥当性制約付きデコーディングにより,精度がさらに向上し,無効な音程予測を除去後の残差を定量的に評価することが可能となった。
CG-World:ワールドモデルのための大規模ワールドステートデータセットとプロトコル [cs.AI, cs.CV, cs.GR]目的:ワールドモデルのためのワールドステートデータセットおよびプロトコル
- 現実世界の複雑さを理解するAI開発に不可欠であり,ロボティクスやシミュレーションへの応用が期待される。
- 既存のデータセットは,状態,行動,イベント,観測の関連性を十分に捉えられていないという課題がある。
- 中間状態を明示的に記録することで,介入学習や反事実的推論を可能にするデータセットを構築する。
- CG-Worldは,85万件の時系列セグメントを含む大規模データセットであり,多様な情報を記録している。
- このデータセットを用いることで,制御された生成,行動モデリング,および具現化されたポリシー転移が可能となることが示された。
- 将来的には,データ収集とコミュニティの協力により,ワールドモデルの共通データ基盤を拡大していく予定である。
効率的な転移学習とGrad-CAMによる解釈可能な画像レベルのニキビ重症度分類 [cs.RO, cs.CV]目的:ニキビ重症度分類の自動化
- ニキビは多くの若者や大人に影響を与え,適切な治療と臨床試験の指標に正確な重症度評価が不可欠である。
- 従来の評価方法は,評価者間のばらつきや画像条件の変動により,客観性に欠ける場合がある。
- 本研究では,客観的かつ再現性のあるニキビ重症度評価システムの構築を目指す。
- EfficientNet-B0を用いた転移学習により,高精度なニキビ重症度分類器を開発した。
- テストデータセットにおいて,93.5%の正解率と94.4%のmacro-F1スコアを達成した。
- Grad-CAMによる可視化により,モデルが顔の臨床的に重要な領域に注目していることが確認された。
マルチ比率DiT再構成残差の音声アンカーによる融合:クロスドメイン音声ディープフェイク検出 [cs.CL, cs.IR, cs.SD, cs.AI]目的:クロスドメイン音声ディープフェイク検出における性能向上
- 音声認証システム等において,ディープフェイク技術によるセキュリティリスクが高まっている。
- 既存のディープフェイク検出器は,生成モデルや録音条件の変化に弱いという課題がある。
- ドメイン変化にロバストな検出手法を開発し,ディープフェイクの検出精度を向上させる。
- 拡散Transformer(DiT)を用いた再構成残差に着目し,音声アンカーによる融合手法を提案した。
- ASVspoof 5 EvalおよびITW Fullの評価において,高い検出性能を達成した(それぞれ6.5442%/0.18456,13.8372%/0.36921)。
- 再構成残差が補完的な証拠となり,ドメイン間の転移学習に有効であることが示唆された。
HERMES:PET/CT画像を用いた頭頸部腫瘍のセグメンテーション,TNM病期分類,および再発フリーサバイバルのためのハイブリッドアンサンブル [cs.CL, cs.CV, physics.med-ph]目的:頭頸部腫瘍のセグメンテーション,TNM病期分類,再発フリーサバイバル予測
- 頭頸部腫瘍の正確な診断と治療計画には,画像解析と病期分類が不可欠である。
- 既存の手法では,セグメンテーション,病期分類,予後予測を統合的に行うことが困難であった。
- PET/CT画像と臨床情報を活用し,これらの課題を克服する統合的なアルゴリズムを開発する。
- HERMESは,セグメンテーション,病期分類,再発フリーサバイバルの3つのタスクを統合的に実行する。
- 予測マスクから得られる幾何学的特徴量を活用することで,N病期分類の精度を向上させた。
- ディープラーニングと臨床リスク因子を組み合わせたアンサンブルモデルにより,再発フリーサバイバル予測の精度を高めた。HECKTOR 2026検証リーダーボードにおいて,総合スコア0.6454を達成した。
リソースごとのRHIトラッキングなしのグローバルパスバリア:ベンダ間クロススタディwith Blade [cs.GR, cs.PF]目的:GPUのパフォーマンス効率改善
- グラフィックスAPIの進化により,メモリ依存関係の管理が重要となっている。
- 従来のRHIでは,リソースごとの状態追跡によるオーバーヘッドが大きいという課題がある。
- リソース追跡なしでグローバルパスバリアを利用し,パフォーマンスを向上させる。
- Bladeを用いた実験により,冗長なバリアを削除することでGPU実行時間を最大32.3%削減できることが示された。
- グローバルバリアの範囲をパスの種類から導出することで,NVIDIAとAMDのグラフィックスチェーンでそれぞれ5.0%,6.7%の性能向上が確認された。
- wgpuのレコード&サブミットコストは高いものの,これは単なるトラッキングによるものではない可能性が示唆された。
UAV対UAV追跡のための意味認識時間的適応 [cs.CV]目的:UAV対UAV追跡における信頼性の高い追跡性能の向上
- 低空域セキュリティの重要性が高まっており,敵対的なUAVの追跡技術が求められている。
- 追跡対象と追跡機体の両方が移動するため,視点変化やモーションブラーが課題となる。
- ターゲットの記述情報を活用し,時間的な状態伝播を安定化させることを目指す。
- 提案手法SATATrackは,ターゲットの記述情報に基づいた意味認識コンテキスト伝播(SACP)により,急激な外観変化下でもターゲットの同一性を維持する。
- 訓練時にコントラスティブ正則化を使用することで,意味的に類似した背景領域への反応を抑制する。
- 推論時には,Temporal-Aware Distribution Alignment(TADA)により,特徴分布をオンラインで整列させ,安定性を向上させる。
EgoSafe: 視覚的安全理解のための一人称モバイルキャプチャベンチマーク [cs.HC, cs.CV]目的:視覚的安全理解における因果的推論能力の評価
- 現実世界での安全確保には,単なる物体認識を超えた,不確実性下での因果推論が不可欠である。
- 既存の評価指標は,第三者視点の映像や二値分類に偏り,一人称視点における認知的なギャップを捉えきれていない。
- 本研究は,一人称視点における安全シナリオを対象とした,より厳密な因果推論能力の評価を目指す。
- EgoSafe-Benchは,12,000のユニークな評価サンプルと,階層的推論評価(HRE)プロトコルを用いて,一人称視点における安全性評価を可能にする。
- 最先端のLVLM(Qwen3-VL, Gemini, VideoLLaMA 3等)の評価により,記述的スコアは高いものの,因果推論と論理的推論において脆弱性が見られた。
- 本研究は,論理的に頑健なビデオ理解システムの開発を促進するための,挑戦的なデータセットと評価フレームワークを提供する。
AtlasLC:オブジェクト中心3Dガウシアン スプラッティングの高速コーデック対応圧縮 [cs.GR]目的:オブジェクト中心3Dガウシアン スプラッティングの効率的な圧縮手法
- XR分野において,フォトリアリスティックな表現が求められる中,高効率な3Dデータ圧縮が不可欠である。
- 既存の圧縮手法はシーン全体を対象とする場合が多く,オブジェクト単位の圧縮には適していない。
- オブジェクト単位で,アセット準備コスト,コーデック互換性,デコード遅延を改善することを目指す。
- AtlasLCは,元画像やカメラ姿勢,アセット毎の最適化を必要とせずに,既存のガウシアンアセットを直接圧縮できる。
- ローカル競争プルーニングと決定論的アトラスパッキングを組み合わせることで,アセット準備時間を最大25倍,圧縮時間を最大5倍短縮。
- 類似の構造化ベースラインと比較して,約6~8%ビット数を削減しつつ,知覚的・幾何学的な品質を維持している。
CineWeaver:再学習不要な参照制御型マルチショット長尺動画生成による映画的ストーリーテリング [cs.CV]目的:映画的なストーリーテリングのための参照制御型マルチショット長尺動画生成手法
- 動画生成技術は,エンターテイメントやコンテンツ制作において重要性が増しており,高品質な動画生成が求められている。
- 既存の動画生成モデルは,マルチショット,詳細な制御,長尺化という要件を同時に満たすことが難しく,個別に再学習が必要となる。
- 本研究は,再学習なしでこれらの要件を満たす統一的なフレームワークを構築し,高品質な長尺動画生成を実現することを目指す。
- CineWeaverは,学習済みの動画拡散モデルを活用し,位置エンコーディングと注意メカニズムを操作することで,明確なショット遷移を可能にする。
- また,ショットルーテッド参照条件付けメカニズムとアンカーメモリメカニズムを導入し,ショットごとの詳細な制御と一貫性のあるグローバルな外観を実現した。
- 実験結果から,CineWeaverは,高品質で一貫性のある長尺の映画的な動画を生成できることが示された。
TPCD:トーン・プレッシャー対照的デコーディングと視覚言語モデルにおけるラベルフリー・ゲーティングボトルネック [cs.CV]目的:視覚言語モデルにおける,プレッシャーによる誤ったコミットメントを抑制する手法の開発
- 視覚言語モデルは多様なタスクに応用可能だが,不適切な指示によって誤った出力を生成する可能性がある。
- 高圧的なプロンプトが,モデルに無理な推論を強いる問題が存在する。
- プレッシャーを活用した対照的デコーディングにより,モデルの信頼性を向上させることを目指す。
- 高圧プロンプトに対する攻撃成功率は高く,安全な中立化によって大幅に低下する。
- トーン・プレッシャー対照的デコーディング(TPCD)は攻撃成功率をさらに低下させるが,肯定的な応答の精度が低下する。
- タスク優先/不一致ゲートを用いることで,肯定的な精度を維持しつつ攻撃成功率を低減できる。
音声LLMにおける韻律駆動型脱獄:統制された研究とメカニズム分析 [cs.SD, cs.CL]目的:音声LLMの脱獄可能性
- 音声LLMは対話型AIの重要な要素であり,安全性確保が不可欠である。
- 従来の安全性評価はテキストに焦点を当てており,音声による影響は未解明であった。
- 韻律の違いが音声LLMの脱獄に及ぼす影響を定量的に評価し,対策を検討する。
- 固定されたテキスト内容に対し,韻律(興奮度,権威性,話速など)を変化させることで,脱獄成功率が大幅に向上することが示された。
- 特に,パニック,怒り,早口の韻律設定は,中立的な設定と比較して,脱獄成功率が著しく高かった。
- 音声による韻律操作は,テキストのみの操作よりも効果的であり,音声LLMの安全性評価における重要な要素であることが示唆された。
空間的意味論から時間的文脈へ:眼球運動軌跡を活用した弱教師あり医用画像セグメンテーション [cs.CV]目的:医用画像セグメンテーションのための眼球運動に基づく弱教師あり学習
- 医用画像セグメンテーションは医療診断・治療において重要であり,高精度な自動化が求められている。
- 従来手法はピクセル単位の注釈に多大な労力が必要であり,臨床現場での導入が困難である。
- 眼球運動データを活用し,注釈コストを削減しつつ高精度なセグメンテーションを実現することを目的とする。
- 提案手法TrailNetは,空間的意味論と時間的文脈を統合的に活用することで,従来の弱教師あり学習の課題を克服した。
- 眼球運動軌跡に着目し,不確実性を考慮したネットワーク構造により,セグメンテーション性能を向上させた。
- 公開データセットを用いた実験により,最先端手法を上回るDice係数(81.25%,81.85%)を達成した。
ThinkOmni:音声フォージェリ検出・局在化のための推論駆動型オムニモーダルLLMフレームワーク [cs.SD]目的:音声フォージェリ検出と局在化における汎化性能向上
- 音声フォージェリ検出は,デジタルコンテンツの信頼性確保に不可欠であり,その重要性は増している。
- 既存手法は,データセット固有の低レベルな特徴に過剰適合しやすく,未知の操作への汎化が課題である。
- 操作の証拠と予測を結びつけ,より堅牢なフォレンジック推論を実現するフレームワークを開発する。
- ThinkOmniは,フォレンジック推論,スプーフィング検出,時間的局在化を統合的に行うオムニモーダルLLMフレームワークである。
- 新たに構築したForensic-Aware Chain-of-Thought(FACoT)データセットを活用し,FMILによる表現学習とFCMLによる損失関数最適化を行った。
- 広範な実験の結果,ThinkOmniはクロスデータセットにおける検出と局在化の両方で高い汎化性能を示した。
MedARC:3D医療ビジョン言語モデルのための視覚トークン適応的冗長性圧縮(学習不要) [cs.CV]目的:3D医療画像とビジョン言語モデルを統合することによるコンピュータ支援診断の可能性
- 医療診断における3D画像利用の重要性が増しているが,計算コストが課題。
- 3D画像は冗長性が高く,既存のトークン圧縮法では臨床的に重要な情報を損失するリスクがある。
- 視覚トークンの冗長性を効率的に圧縮し,診断性能を維持・向上させること。
- MedARCは,3つの指標に基づきトークンの重要度を評価し,冗長なトークンを統合することで,視覚トークン数を削減する。
- CT-RATEおよびMR-RATEデータセットでの実験により,MedARCが視覚トークン数を削減しつつ,診断性能を維持または向上させることが示された。
- MedARCの計算コストは,トークン数削減によるメリットによって相殺され,特に大規模言語モデルにおいて効果が期待される。
表現軌跡は重要である:外挿分布検出と画像分類の補完的証拠 [eess.SY, cs.SY, cs.CV]目的:外挿分布検出と画像分類における表現軌跡の有用性
- 画像認識の信頼性向上は,安全なAIシステム構築に不可欠である。
- 既存手法では,未知のデータに対する誤検出率が高止まりしている。
- 表現学習過程における軌跡情報を活用し,信頼性評価を改善する。
- 表現学習の各段階における変化を分析することで,サンプル特有の連続性が確認された。
- 遷移の驚き度をスコア化することで,外挿分布検出の誤検出率を大幅に低減することが示された。
- モデル構造やデータ分布の変化に応じて,軌跡情報が有用な信頼性指標となり得る。
Speech2Grasp:テキスト条件化把持検出を音声による把持へ効率的に転移させる手法 [cs.RO, cs.CV]目的:人間型ロボットにおけるテキスト条件化把持検出の,音声への効率的な転移
- 人間との自然な対話には,多様な入力情報を理解する能力が不可欠である。
- 既存のビジョン言語モデルはテキスト入力を前提としており,自然な音声入力への対応が課題である。
- テキスト条件化モデルの知識を活用し,少ないデータで音声入力に対応する手法を開発する。
- 軽量なMLPベースのプロジェクターにより,ALBEFモデルを音声に適応させることが可能となった。
- Speech2Graspは,従来のASRパイプラインを上回り,推論遅延を削減することを示した。
- 確立されたテキスト条件化システムを音声へ拡張する実用的なパラダイムを提案する。
3DGBGS:コンパクトな新規視点合成のための3次元グラニュールボールガウススプラッティング [cs.CV]目的:新規視点合成のためのコンパクトなアンカーベースフレームワーク
- 3次元コンテンツの高品質なレンダリングが求められており,リアルタイム性が重要視されている。
- 既存のアンカーベース手法は,点分布の不均一性への適応が難しく,モデルのコンパクト性とのトレードオフが生じている。
- 空間的に不均一な点分布に適応し,モデルのコンパクト性とレンダリング品質の両立を目指す。
- 3DGBGSは,SfM点群を3次元グラニュールボールで適応的に分割することで,モデルのコンパクト性を高めている。
- 提案手法は,初期アンカー数と最終アンカー数をそれぞれ平均で37.1%,10.0%削減し,モデルストレージを9.8%削減した。
- レンダリング品質を維持しつつ,モデルサイズを大幅に削減できることが実験で示された。
ContactFlow:具現化を超えたビデオ行動条件付け [cs.RO, cs.CV]目的:ビデオ行動条件付けによる,具現化を跨いだ転移
- ロボット計画において,行動の結果を事前に予測・検証する世界モデルの重要性が高まっている。
- 既存のビデオベースの世界モデルは,特に接触を含む操作の物理的制約を捉えるのが難しい。
- 具現化に依存しない行動表現を通じて,人間とロボット間の知識転移を可能にすること。
- Contact Flowは,アクターと対象物間の3D接触点の軌跡で操作を符号化する,具現化に依存しない行動表現である。
- Contact Flowを条件として大規模なビデオ生成モデルを学習することで,物理的に妥当な操作結果を予測する世界モデルを構築した。
- DROIDデータセットと実世界の実験で,人間によるデモンストレーションと異なるロボット具現化間での転移が確認された。
X線画像を用いたVGG16,VGG19,ResNet50モデルによる肺疾患の分類 [cs.CV, cs.AI, cs.LG]目的:肺X線画像に基づく肺疾患分類
- 呼吸器疾患の増加に伴い,早期発見と正確な診断が重要視されている。
- 画像診断における疾患の自動診断システムの精度向上が課題である。
- 深層学習モデルを用いて,肺疾患の分類精度を向上させることを目指す。
- VGG16,VGG19,ResNet50の3モデルで肺疾患分類を行い,良好な結果が得られた。
- 特にResNet50は,効率性と高い精度により,他のモデルと比較して最も優れた性能を示した。
- これらの深層学習モデルは,将来的に肺疾患診断の実践に貢献し,早期発見と患者の予後改善に繋がる可能性がある。
