arXiv雑要約

画像・音声 - 2026/07/31 公開

  • 肺疾患分類のためのマルチモーダル深層学習:公開胸部X線データを用いたテクスチャベースの機械学習パイロット研究 [eess.IV, cs.CV]目的:肺疾患分類におけるテクスチャベースの機械学習による性能評価
    • 医療画像解析において,機械学習による病気の自動分類は重要である。
    • 限られたデータセットでは,汎化性能の向上が課題である。
    • 深層学習と複数の画像情報を組み合わせることで,分類精度を向上させる。
    • 古典的なテクスチャ特徴量と古典的分類器を用いて,COVID-19と他の肺炎の識別を試みた。
    • 患者レベルの5分割交差検証の結果,最高平均精度は75.4%,AUCは0.755であった。
    • このパイロット研究は,将来的な深層学習アーキテクチャの設計を促すものである。

    Link: https://arxiv.org/abs/2607.27286

  • オルト・ポジトロニウムの三光子ベイズイメージング [physics.med-ph, cs.CV, physics.comp-ph]目的:三光子イベントごとの画像再構成アルゴリズムの開発
    • PET検査は機能画像を提供し,病状の早期発見や治療効果の評価に不可欠である。
    • 従来のPETは二光子事象に依存しており,ポジトロニウム崩壊の三光子チャネルの情報を活用できていない。
    • 三光子事象から得られる情報を活用し,より高精度なPET画像再構成を可能にすること。
    • TRIOアルゴリズムは,時間情報とエネルギー情報に加え,量子電磁力学に基づいた事前知識を統合したベイズ推論に基づく新しい画像再構成法である。
    • シミュレーション結果は,従来の方式と比較して位置誤差を大幅に低減し,1.62cmという高い精度を示した。
    • 本手法は既存のTOF-PETスキャナに容易に適用可能であり,臨床応用が期待される。

    Link: https://arxiv.org/abs/2607.27741

  • Endo-NeRF++:多解像度ハッシュエンコーディングを用いた不確実性認識型ニューラルレンダリングによる動的手術シーン再構成 [eess.IV, cs.CV]目的:動的手術シーン再構成における不確実性への対応
    • ロボット支援低侵襲手術の発展には,正確な手術シーンの再構成が不可欠である。
    • 組織変形,遮蔽,反射,限られた視点により,手術シーンの再構成は困難である。
    • 組織変形や手術器具による遮蔽下でも,再構成精度と時間的な一貫性を向上させる。
    • 提案手法Endo-NeRF++は,多解像度ハッシュグリッドエンコーディング,時間特徴量融合,不確実性に基づいた適応サンプリングを導入する。
    • 実験結果から,提案手法はPSNRを最大1.22dB(4.3%)向上させ,SSIMを最大5.3%増加,LPIPSを最大55.1%削減することが示された。
    • 不確実性に基づく適応サンプリングにより,レンダリング品質と幾何学的整合性が向上する。

    Link: https://arxiv.org/abs/2607.27825

  • TSOG:時間的・空間的に順序付けられたガウス関数に対するフォーマット [math.AT, cs.CG, math.MG, eess.IV, cs.CV, cs.GR]目的:4Dガウススプラッティングコンテンツの効率的な表現形式
    • 3Dコンテンツの可視化において,高品質かつ効率的なデータ表現が重要である。
    • 4Dガウススプラッティングは高負荷であり,ファイルサイズが大きいという課題がある。
    • 4Dガウススプラッティングのファイルサイズを大幅に削減し,効率的な表現を可能とする。
    • 提案手法TSOGは,既存のSOGフレームワークを時間領域に拡張することで,90%を超えるファイルサイズ削減を実現した。
    • 画質評価では,PSNRの変化が-0.42dBから+0.85dBの範囲に留まり,品質劣化は最小限であることが示された。
    • これにより,次世代4Dコンテンツの効率的な表現,保存,配信が可能となる。

    Link: https://arxiv.org/abs/2607.28049

  • ReGenVC:超低ビットレートにおけるエンドツーエンドのリアルタイム生成型ビデオコーディング [eess.SP, cs.SY, eess.SY, eess.IV, cs.CV]目的:超低ビットレートでのトーキングヘッドビデオの圧縮とリアルタイムでのデコード
    • ビデオ圧縮技術は,ネットワーク帯域幅の制限下で高品質な映像伝送を実現するために重要である。
    • 従来のビデオコーデックでは,超低ビットレートにすると画質が著しく低下し,ブロックノイズが発生しやすい。
    • 生成モデルを活用し,超低ビットレートでも高品質なビデオをリアルタイムにデコードすること。
    • ReGenVCは,従来のコーデックと比較して,ビットレートを約1/10に削減し,画質の劣化を抑制した。
    • 4ステップの知識蒸留とモデル保持システム技術により,リアルタイムデコードを実現した(8GPUで24fps)。
    • ハイブリッドCPU-GPU構成により,GPUメモリ使用量を削減しつつ,エンコーダーも24fpsで動作することを確認した。

    Link: https://arxiv.org/abs/2607.28144

  • スナップショットプロット:一貫した色分けによる並列単変量プロットとしての要約表の表示 [stat.AP, cs.GR, cs.HC]目的:要約表の視覚化手法
    • 実証研究において,サンプル特性の把握は重要である。
    • 従来の「表1」では,グループ間の比較が困難な場合がある。
    • グループ間比較を容易にし,数値変数の詳細な情報を提示すること。
    • スナップショットプロットは,背景特性の比較,特にグループ間での比較を容易にする。
    • 従来の「表1」と比較して,数値変数の詳細な情報をより多く提供する。
    • スナップショットプロットは,ハンモックプロットの一種として実装可能である。

    Link: https://arxiv.org/abs/2607.28302

  • タルスキの定理,超モジュールゲーム,および均衡の複雑性 [cs.CC, cs.GT]目的:単調関数と超モジュールゲームにおける固定点および均衡の計算複雑性
    • 経済学における均衡存在証明において,単調性やタルスキの定理の利用は広範である。
    • タルスキの定理が保証する固定点や均衡を見つける計算量の解析は十分に進んでいない。
    • 本研究は,タルスキの定理に基づく固定点探索の計算複雑性を明らかにする。
    • 単調関数の固定点探索は,d次元グリッド上で少なくともlog^2 N回の関数評価を必要とする。
    • 簡潔に与えられた単調関数の固定点探索問題は,PLSおよびPPADクラスに属する。
    • 超モジュールゲームの均衡探索は,タルスキ問題と同程度に計算が困難である。

    Link: https://arxiv.org/abs/1909.03210

  • 強化学習における表現と不変性 [cs.AI, cs.GT, cs.LG]目的:強化学習フレームワーク間の相対的な知能を維持するマッピング可能性
    • 強化学習は,自律的な意思決定を行うための重要な技術であり,様々な分野への応用が期待されている。
    • 異なる強化学習フレームワーク間では,エージェントの変換が必要であり,その過程で知能が損なわれる可能性がある。
    • 異なるフレームワーク間での知能維持可能なマッピングの条件を明らかにすること。
    • ある知能の測定方法において,相対的な知能を維持するための十分条件を提案した。
    • 特定の決定論的および確率的強化学習フレームワーク間では,この条件を満たせないことを示した。
    • これは,異なるバージョンの強化学習間に本質的な違いが存在することを示唆している。

    Link: https://arxiv.org/abs/2112.07752

  • カルテシアングリッドマップにおける2次元視認性問題の効率的な解法とそのヒューリスティックパス計画への応用 [cs.HC, cs.CG, cs.GR, cs.RO]目的:2次元グリッドにおける視認性問題の効率的な解法
    • ロボットの自律的なナビゲーションや環境理解において,視認性は重要な要素である。
    • 従来の視認性判定アルゴリズムは計算コストが高く,大規模な環境では実用性に乏しい。
    • 本研究は,計算コストを抑えつつ,高速かつ正確な視認性判定を実現する。
    • 提案手法は,前処理を必要とせず,障害物の数や形状に依存しない単一パスで視認性を評価する。
    • 計算・メモリの複雑さは$\mathcal{O}(n)$であり,グリッドセルあたり最大10回の算術演算で済む。
    • 視認性をヒューリスティックとして活用することで,局所最適解に陥らないパスプランナーを実装した。

    Link: https://arxiv.org/abs/2403.06494

  • 非ラミア表面におけるロバストな単眼深度推定に向けて [cs.CV]目的:非ラミア表面における単眼深度推定のロバスト性向上
    • 単眼深度推定は,自動運転やロボット工学など,幅広い応用分野で重要性を増している。
    • 既存手法は,透明または鏡面のような非ラミア表面の深度推定において性能が低下する課題がある。
    • 追加のマスク精度に依存せず,照明変化にも強い深度推定手法を開発し,そのロバスト性を高める。
    • 提案手法は,Boosterデータセットで非ラミア表面の精度を33.39%向上させ,Mirror3Dデータセットでは5.21%向上させた。
    • TRICKY2024競技会のテストセットにおいて,ToM領域でのdelta1.05で90.75という最高性能を達成した。
    • 勾配領域での制約とランダムトーンマッピングによる照明変動への対応により,ロバストな深度推定を実現した。

    Link: https://arxiv.org/abs/2408.06083

  • オブジェクトの顕著性を用いた定量画像分析の構造化 [cs.CV]目的:画像におけるオブジェクトの顕著性の測定
    • 画像は強力なコミュニケーション手段であり,視覚的要素の構成が解釈に影響する。
    • 既存の画像分析手法は,オブジェクトの重要性を考慮せず,均一に扱う傾向がある。
    • 画像の構成要素の重要性を考慮した定量分析を可能にすること。
    • オブジェクトの顕著性を測定するフレームワークを提案し,認知心理学とコンピュータビジョンの知見を統合した。
    • キュレーターが意図した構成が,人間の視線に影響を与えることを眼球追跡実験で検証した。
    • 顕著性を考慮した特徴量の重み付けが,画像のイデオロギー的分析を向上させることを示した。また,政治広告におけるジェンダー表現の偏りを明らかにした。

    Link: https://arxiv.org/abs/2409.00216

  • ID-Guard:識別を阻害することで顔操作に対抗する汎用的なフレームワーク [cs.CC, cs.CV, cs.AI]目的:顔操作に対抗するための汎用的なフレームワーク
    • 深層学習技術の悪用による顔操作は,個人の権利を侵害する深刻な問題となっている。
    • 従来の防御手法は,顔の識別可能な特徴を残してしまう可能性があり,個人を特定されるリスクがある。
    • 顔操作を効果的に阻止しつつ,個人識別情報を保護することを目的とする。
    • ID-Guardは,多様な顔操作モデルに対して有効に防御できることが示された。
    • 操作された画像において,識別可能な領域を効果的に劣化させることが確認された。
    • 顔補完や顔認識システムからの回避も可能であり,他のタスクへの組み込みも容易である。

    Link: https://arxiv.org/abs/2409.13349

  • 深層学習による消費者製品由来のマイクロプラスチックおよびナノプラスチックの形態学的検出と分類 [cs.CV, cs.AI, stat.AP, stat.ME]目的:マイクロプラスチックおよびナノプラスチックの自動検出・分類のためのデータセット
    • プラスチック汚染は健康や環境に深刻な影響を与えており,その調査が急務である。
    • 従来の分析手法は手間と時間がかかり,効率的な技術が求められている。
    • マイクロプラスチック研究のためのデータセット不足を解消し,技術進歩を促進する。
    • 新規のオープンソースデータセット「MiNa」を開発し,現実的な水環境下でのSEM画像を収録した。
    • 最先端の物体検出アルゴリズムをMiNaに適用し,有効性と課題を評価した。
    • 本データセットは,マイクロプラスチック研究の基盤となり,今後の発展に貢献する。

    Link: https://arxiv.org/abs/2409.13688

  • 現代ポピュラー音楽におけるピッチ分析手法:Primaalの商業作品における現象学的分析 [cs.CC, cs.DM, cs.HC, cs.SD]目的:現代ポピュラー音楽におけるピッチ関連要素の分析
    • 音楽表現の多様化に伴い,伝統的な音楽理論では捉えきれない現代ポピュラー音楽の分析が重要である。
    • 西洋古典音楽の理論に基づくピッチ分析では,現代ポピュラー音楽特有の表現を十分に説明できない。
    • 現代ポピュラー音楽におけるピッチの特性を明らかにし,新たな分析手法を提案することを目的とする。
    • Primaalの楽曲は,西洋古典音楽の慣習とは異なるピッチ処理を行っていることが明らかになった。
    • 特に「ピッチの不確実性」を意図的に作り出す手法(音の不協和性,多重のピッチ喚起,高次倍音の強調,連続的な周波数変化)が特徴的である。
    • ピッチは離散的な音符ではなく,音階の周りに分布しており,その分布幅が表現パラメータとして機能している。

    Link: https://arxiv.org/abs/2502.08131

  • MedHallTune:視覚言語モデルにおける医学的幻覚を軽減するための指示チューニングベンチマーク [cs.AI, cs.CL, cs.CV]目的:視覚言語モデルにおける医学的幻覚の評価と軽減
    • 医療分野での視覚言語モデル活用が進む中で,その信頼性が不可欠である。
    • 視覚言語モデルが,事実に基づかない情報を生成する幻覚が課題となっている。
    • 医学的幻覚を抑制し,医療現場での信頼性を向上させることを目指す。
    • 本研究では,10万枚以上の画像と100万組の指示ペアを含む大規模ベンチマークMedHallTuneを提案した。
    • MedHallTuneを用いた評価により,既存モデルの医学的正確性,関連性,詳細度,リスクレベルを分析した。
    • MedHallTuneでのファインチューニングは,幻覚の抑制とVQAタスクのゼロショット性能向上に貢献することが示された。

    Link: https://arxiv.org/abs/2502.20780

  • オブジェクト検出モデルにおけるテスト時バックドア検出 [cs.RO, cs.CV]目的:オブジェクト検出モデルに対するバックドア攻撃の検出
    • 画像認識技術は広く利用されているが,悪意のある攻撃による脆弱性が問題となっている。
    • オブジェクト検出は出力する対象が多いため,バックドア攻撃の検出が困難である。
    • テスト時にバックドア攻撃を受けたサンプルを検出し,誤った予測を防ぐことを目指す。
    • 提案手法TRACEは,様々な背景下での検出結果の一貫性に着目し,バックドア攻撃を受けたサンプルを検出する。
    • TRACEは,前景および背景の変換を適用し,オブジェクトの信頼度分散を計算することで,変換の一貫性を評価する。
    • 実験結果から,TRACEは既存の手法よりもAUROCが30%向上し,適応的な攻撃にも耐性があることが示された。

    Link: https://arxiv.org/abs/2503.15293

  • EHGCN:運動を考慮したGCNによるユークリッド・双曲融合によるハイブリッドイベントストリーム知覚 [cs.CV]目的:ハイブリッドイベントストリーム知覚のための,ユークリッド空間と双曲空間における階層的融合
    • イベントカメラは高速かつ高ダイナミックレンジな情報を提供し,知覚タスクにおいて重要性が増している。
    • 既存のGNNベース手法は,ユークリッド空間でのみ接続性を考慮するため,長距離依存性の把握が困難である。
    • イベントストリームの非等方性および階層構造を捉え,イベント知覚の性能向上を目指す。
    • 提案手法EHGCNは,イベントストリームをユークリッド空間と双曲空間で共同にモデリングすることで,イベントの階層構造を自然に捉える。
    • マルチスケールボクセルグリッドとガウス分布モデリングに基づくイベント選別により,ノイズを抑制し,特徴的なイベントを保持する。
    • オブジェクト検出・認識タスクにおける実験結果から,提案手法の有効性が確認された。

    Link: https://arxiv.org/abs/2504.16616

  • PoseMaster: スタイライズされたポーズ生成のための統一的な3Dネイティブフレームワーク [cs.DM, math.CO, cs.IR, cs.RO, math.OC, cs.CV]目的:スタイライズされたポーズ生成の3D統合フレームワーク
    • 2D,3D,動画など幅広い分野で,ターゲットポーズに合わせたコンテンツのスタイライズが重要である。
    • 既存手法は2Dモデルを利用し3Dに変換するため,精度と多様性に限界がある。
    • 3D空間情報を直接活用し,より高精度で多様な3Dポーズスタイライズを実現する。
    • PoseMasterは,既存の最先端手法と比較して,定性的・定量的な評価において著しい性能向上を示した。
    • 3Dメッシュとスケルトン間の厳密な空間的整合性により,自動スキニングモデルとの組み合わせでアニメーション可能なアセットを直接生成できる。
    • 大規模な「画像-スケルトン-メッシュ」データセットにより,同一性の保持と幾何学的整合性を同時に学習することが可能になった。

    Link: https://arxiv.org/abs/2506.21076

  • ポストトレーニングによる動画生成におけるシーン遷移認識の向上 [cs.CV, cs.AI]目的:シーン遷移認識の向上
    • AI動画生成技術は急速に進歩しており,高品質な動画生成が期待される。
    • 既存モデルは単一シーン動画学習が中心で,複数のシーンを含む長尺動画の生成に課題がある。
    • シーン遷移の認識能力を高めることで,より自然な多シーン動画生成を目指す。
    • 新たに「Transition-Aware Video (TAV)」データセットを構築し,シーン遷移を含む動画を学習データとして利用した。
    • TAVデータセットを用いたポストトレーニングにより,プロンプトに基づいたシーン遷移の理解度が向上した。
    • 生成されるシーン数と,プロンプトで求められるシーン数との乖離が縮小し,画像品質も維持された。

    Link: https://arxiv.org/abs/2507.18046

  • VLMにおける継続学習:忘却を超えた調査と分類 [cs.CV, cs.LG]目的:視覚言語モデルの継続学習に関する課題と解決策の体系的な整理
    • AIの発展において,視覚と言語を組み合わせたモデルの重要性は増しており,その能力向上は不可欠である。
    • 継続的に変化するデータへの対応が難しく,過去の知識を失う「破滅的忘却」が大きな問題となっている。
    • 視覚言語モデル固有の忘却メカニズムを解明し,継続学習を可能にするための指針を示す。
    • 本調査は,予測型VLMと生成型MLLMにおける継続学習の現状を包括的にレビューし,その特性と課題を明確化した。
    • 記憶のドリフトに対処するリプレイ戦略,モダリティ間の整合性を保つ正則化,効率的なパラメータ適応など,4つの主要なパラダイムを提示した。
    • 評価プロトコルの重要性を強調し,領域と能力の双方を考慮したベンチマークへの移行を促した。

    Link: https://arxiv.org/abs/2508.04227

  • 分離して活用:完全教師なし異常検知のためのクロス分割蒸留 [cs.DL, stat.AP, cs.CV]目的:完全教師なし異常検知における,汚染データからの堅牢な異常検出
    • 異常検知は,製造,金融,セキュリティなど幅広い分野で重要であり,異常を早期に特定することで損失を最小限に抑える。
    • 従来の異常検知手法は,訓練データに異常が含まれる場合,その異常を正常パターンと誤認しやすいという課題がある。
    • 本研究は,訓練データ中の異常の影響を分離し,クロス分割蒸留により堅牢な疑似教師信号を生成することで,この課題を解決することを目指す。
    • 提案手法であるクロス分割蒸留(CDD)は,複数のデータ分割で個別に学習を行い,各分割で生成された正常特徴を相互に活用することで,グローバルな異常耐性表現を獲得する。
    • 実験結果から,CDDは既存手法と比較して,ノイズを含む異常検知データセットにおいて有意な性能向上を達成することが示された。
    • CDDは,訓練データ中の異常を積極的に活用しつつ,異常にロバストなモデルを構築する新たなアプローチを提供する。

    Link: https://arxiv.org/abs/2508.18007

  • 複合ストレス下における植物の窒素ストレス重症度を空間的・時間的深層学習フレームワークで高精度に分類 [cs.SC, cs.CV, cs.AI, cs.LG]目的:複合ストレス環境下における植物の窒素ストレス重症度の分類
    • 植物は様々なストレスにさらされ,特に窒素欠乏は生育に大きな影響を与える。
    • 窒素ストレスは,乾燥や雑草との競合など他のストレスと複合的に発生し,判別が困難である。
    • 本研究は,複合ストレス下で窒素ストレスの重症度を正確に特定する手法を開発する。
    • 提案するCNN-LSTMパイプラインは,98%という高い精度を達成した。
    • 空間的特徴のみを利用するCNNモデル(80.45%)や,既存の機械学習手法(76%)を大きく上回る結果である。
    • 本手法は,窒素欠乏,水ストレス,雑草圧の複雑な相互作用を捉え,効果的な窒素ストレスの早期発見に貢献する。

    Link: https://arxiv.org/abs/2509.06625

  • 無脊椎動物における汎用的なシナプス検出に向けた試み [cs.CV]目的:無脊椎動物におけるシナプス検出の汎用性を高めること
    • 行動や病理の違いは神経回路の構造に強く関連しており,そのメカニズム解明が重要である。
    • シナプスの信頼性・大規模な検出は困難であり,微細な変化の理解を妨げている。
    • 異なるデータセット間でのシナプス検出の汎化性能を向上させることを目指す。
    • 新規に作成した多様なEMベンチマークを用いて,SimpSynという軽量なモデルを開発した。
    • SimpSynは,最先端モデルであるSynfulと比較して,シナプス部位検出のF1スコアで一貫して良好な性能を示した。
    • SimpSynはシンプルな後処理戦略によって性能が向上し,大規模コネクトーム解析への応用が期待される。

    Link: https://arxiv.org/abs/2509.17041

  • MusicWeaver:検証可能な局所編集を伴う長編音楽のプログラム可能生成 [cs.SD, cs.MM]目的:長編音楽生成のためのプログラム駆動型生成手法
    • 音楽生成技術は近年著しく進歩しており,高品質な音声合成が可能になっている。
    • 従来のシステムでは,楽曲構造の意図を反映させることが難しく,局所的な修正には再生成が必要となる。
    • 楽曲構造を明示的に制御し,局所的な編集を効率的に行うことで,創造性を支援する。
    • MusicWeaverは,音楽生成を計画段階とレンダリング段階に分解することで,構造的な制御と編集可能性を実現する。
    • 計画段階では楽曲構造を表現するプログラムを生成し,レンダリング段階ではそのプログラムに基づいて音声を合成する。
    • 提案手法は,編集操作がプログラムの有効性を維持することを数学的に保証し,高品質な編集を可能にする。

    Link: https://arxiv.org/abs/2509.21714

  • ソーシャルメディアにおける統一的なマルチモーダルな誤情報検出:ベンチマークデータセットとベースライン [cs.AI, cs.CV]目的:ソーシャルメディアにおけるマルチモーダルな誤情報の検出
    • ソーシャルメディア上での誤情報は社会に深刻な影響を与え,その検出は喫緊の課題である。
    • 従来の誤情報検出手法は,人間が作成した情報とAIが生成した情報で異なるため,汎用性に欠ける。
    • 人間とAIが作成した両方の誤情報を扱える,統一的な検出手法の開発を目指す。
    • 本研究では,既存のリソースと新たに生成したAI生成例を組み合わせた98Kサンプルからなるベンチマークデータセット OmniFake を構築した。
    • 両方の種類の欺瞞に対処できるフレームワーク UMFDet を提案し,視覚言語モデルを基盤とし,カテゴリを意識した専門家混合(CMoE)アダプターを使用する。
    • 実験の結果,UMFDet は,両方の欺瞞タイプにおいて,競合する専門的なベースラインよりも常に優れた性能を示した。

    Link: https://arxiv.org/abs/2509.25991

  • あらゆる体型の人間メッシュモデリング [cs.CV]目的:人間中心のタスクのための構造的基盤となる体モデルの提供
    • 多様な人間を扱うタスクにおいて,正確な3D人体モデルは不可欠である。
    • 既存のモデルは高価な3Dスキャンに依存し,利用可能な形状空間が限られている。
    • 誰でもアクセス可能な,現実的で多様な人体モデルを構築すること。
    • Annyは,MakeHumanのデータに基づいた,微分可能な人体モデルである。
    • Annyは,性別,年齢,身長,体重などのパラメータで形状を制御できる。
    • Annyを用いた学習は,スキャンベースのモデルと同等の性能を示すことが示された。

    Link: https://arxiv.org/abs/2511.03589

  • MOON2.0:Eコマース製品理解のための動的モダリティバランス型マルチモーダル表現学習 [cs.RO, cs.CV, cs.AI, cs.IR, cs.LG]目的:Eコマース製品理解のためのマルチモーダル表現学習
    • Eコマースにおける製品理解の精度向上は,顧客体験や売上増加に不可欠である。
    • 既存のマルチモーダル大規模言語モデルは,モダリティ間の不均衡やノイズの影響を受けやすい。
    • MOON2.0は,モダリティ間のバランスを改善し,製品内の情報の整合性を高めることで,この課題を解決する。
    • MOON2.0は,動的なモダリティバランス機構により,マルチモーダルジョイント学習を促進し,モダリティ間の不均衡を軽減する。
    • デュアルレベルアライメント手法により,製品内の視覚情報とテキスト情報の意味的な整合性をより効果的に活用する。
    • MBE2.0ベンチマークにおいて,最先端のゼロショット性能を達成し,マルチモーダルアライメントの改善が可視化された。

    Link: https://arxiv.org/abs/2511.12449

  • 移動赤外小ターゲット検出のためのオムニ勾配逆伝播 [cs.CV]目的:移動赤外小ターゲット検出における性能向上
    • 赤外線捜索・追跡システムにおいて,小ターゲット検出は重要な要素である。
    • 低信号対雑音比,ターゲットと背景の不均衡,弱識別特徴により,検出は極めて困難である。
    • 曖昧なフレーム内特徴表現がボトルネックであるという知見に基づき,特徴学習を再考する。
    • 提案手法BP-FPNは,勾配分離低レベルショートカット(GILS)により,詳細なターゲット情報を効率的に組み込む。
    • 方向性勾配正則化(DGR)により,逆伝播中の階層的特徴の一貫性を強化する。
    • 複数の公開データセットで最先端の性能を達成し,BP-FPNは逆伝播の視点から設計された初のFPNである。

    Link: https://arxiv.org/abs/2511.13013

  • PartDiffuser: 離散拡散によるパーツごとの3Dメッシュ生成 [cs.CV]目的:アーティストがデザインしたメッシュ生成におけるグローバル構造の一貫性とローカル詳細の忠実度のバランス
    • 3Dコンテンツ制作において,高品質なメッシュモデルの自動生成は不可欠である。
    • 既存の自己回帰モデルは,エラーの蓄積や詳細な表現の困難さを抱えている。
    • パーツごとに拡散処理を行うことで,高品質かつ構造的に一貫性のあるメッシュ生成を実現する。
    • PartDiffuserは,セマンティックセグメンテーションに基づき,パーツごとに自己回帰と並列拡散を組み合わせる。
    • DiTアーキテクチャとパーツを意識したクロスアテンション機構により,グローバルとローカルの生成タスクを分離し,制御する。
    • 実験結果は,PartDiffuserが最新モデルを凌駕し,リアルのアプリケーションに適した高詳細な3Dメッシュを生成することを示している。

    Link: https://arxiv.org/abs/2511.18801

  • EmoFeedback$^2$: LVLMベースの報酬とテキストフィードバックによる継続的な感情画像生成の強化 [cs.CV, cs.AI]目的:継続的な感情画像生成における品質向上
    • ユーザーの記述と感情値を一致させる画像生成技術の重要性が高まっている。
    • 既存手法では,生成画像からの感情フィードバックが不足し,感情の連続性の制御が困難である。
    • LVLMを活用し,感情に応じた報酬とテキストフィードバックで感情の忠実度を高める。
    • 提案手法EmoFeedback$^2$は,感情認識と報酬に基づき,生成モデルの微調整を導き,画像の感情の連続性を向上させる。
    • LVLMは生成画像の感情を分析し,プロンプトを洗練させることで,より詳細な感情表現を実現する。
    • カスタムデータセットと公開データセットの両方で,既存の最先端手法を上回る性能を示す。

    Link: https://arxiv.org/abs/2511.19982

  • 生成的なインペインティング局所化におけるVAEと拡散アーティファクトの分離:DinoLizer [cs.CV, cs.AI]目的:生成的なインペインティングにおける操作領域の局所化
    • 画像生成技術の発展に伴い,編集された領域の検出が重要になっている。
    • 既存手法では,生成されたアーティファクトと元の画像の区別が困難な場合がある。
    • DINOv2を活用し,インペインティング領域と再構成領域を分離することで,より正確な局所化を目指す。
    • DinoLizerは,提案データセットと最先端のインペインティングデータセットで,既存の最先端手法を上回る性能を示した。
    • JPEG圧縮(二重)に対しても非常に高いロバスト性を持つことが確認された。
    • 平均して,DinoLizerは2番目に良いモデルと比較して,交差比率(IoU)スコアが20%向上した。

    Link: https://arxiv.org/abs/2511.20722

  • MetaRank:タスクを考慮したモデル転移可能性推定のための指標選択 [cs.CV]目的:モデル転移可能性推定指標の自動タスク適応選択
    • 転移学習は,事前学習済みモデルの再利用により効率的な学習を可能にする重要な技術である。
    • 最適な事前学習モデルの選択は計算コストが高く,既存の指標選択は経験則に頼ることが多い。
    • タスクに応じた適切な指標を自動的に選択することで,モデル選択の効率化と性能向上を目指す。
    • MetaRankは,類似タスクでの性能に基づいて指標を絞り込み,ペアワイズ順位付けを利用して指標を再ランク化する。
    • データセットと順位付けの類似度を組み合わせることで,過去の指標間の知識転移を実現する。
    • 11の事前学習モデル,13の指標,14のデータセットでの実験により,MetaRankが既存手法を大幅に上回ることが示された。

    Link: https://arxiv.org/abs/2511.21007

  • 文脈計測:迷彩の文脈化された指標 [cs.CY, cs.HC, cs.SY, eess.SY, cs.CV]目的:迷彩物体セグメンテーションのための評価指標
    • 迷彩は文脈に依存するが,既存の指標は文脈的手がかりを無視している。
    • 予測マップと正解データ間の次元と範囲の欠陥が評価の課題となっている。
    • 文脈を考慮した評価パラダイムを構築し,人間の知覚との整合性を高める。
    • 文脈計測は,確率的ピクセル相関フレームワークに基づいた新たな評価指標である。
    • 4つのメタ指標を用いた実験により,文脈計測は既存の指標を凌駕することが示された。
    • 迷彩シナリオ向けに設計された初の指標であり,その有効性が確認された。

    Link: https://arxiv.org/abs/2512.07076

  • MRD:物理ベースの微分可能なレンダリングを用いた3Dシーン理解のためのビジョンモデルの探査 [cs.CV, cs.GR]目的:ビジョンモデルにおける3Dシーンの隠れた理解の探査
    • 深層学習は目覚ましい進歩を遂げているが,モデルの内部表現や判断根拠の解明が課題である。
    • ビジョンモデルは2D入力で学習されるにも関わらず,3Dシーンの理解能力があると仮定されている。
    • 物理的に異なる3Dシーンパラメータが同じモデル活性化を生み出す例を探し,モデルの理解度を評価する。
    • MRDを用いることで,モデルが同じ活性化を示す物理的に異なる3Dシーンパラメータを特定することが可能になった。
    • モデルは形状や材質,照明といった物理的属性に対して,感受性や不変性を示すことが判明した。
    • 本研究は,コンピュータービジョンと人間の視覚の理解を深める可能性を秘めている。

    Link: https://arxiv.org/abs/2512.12307

  • マルチエージェントバンディット問題における手続き的公平性 [cs.MA, cs.AI, cs.GT, cs.LG]目的:マルチエージェントバンディット問題における手続き的公平性の定式化と評価
    • 複数エージェントの行動を最適化する分野で,公平性は重要な検討課題である。
    • 従来の公平性の指標は結果に偏重し,意思決定プロセスへの参加機会の不平等を見過ごす場合がある。
    • 意思決定における発言権の平等という観点から公平性を捉え,新たな公平性指標を提案し評価する。
    • 結果の公平性を重視する従来の指標では,発言権の平等が犠牲になることが確認された。
    • 手続き的公平性を考慮したポリシーは,結果の公平性指標をわずかに犠牲にすることで,発言権の平等を担保する。
    • 公平性の概念は価値観によって異なり,明示的な規範的選択が必要であることが示唆された。

    Link: https://arxiv.org/abs/2601.10600

  • マルチモーダル強化学習による医療画像レポート生成のスケール拡大 [cs.RO, cs.CL, cs.CL, cs.CV, cs.CL]目的:医療画像レポート生成の性能向上
    • 医療現場における画像診断支援は,医療の質向上と効率化に不可欠である。
    • 既存手法は,表面的なパターンへの過学習や,マルチモーダルな理解の不足といった課題がある。
    • 評価指標を直接最適化する強化学習を用いることで,汎化性能の高いレポート生成を目指す。
    • UniRG-CXRは,胸部X線画像レポート生成において,既存の最先端技術を大幅に上回る性能を達成した。
    • 強化学習を統合的なメカニズムとして活用することで,教師ありファインチューニングの限界を克服し,多様な医療機関や臨床現場への適応を実現した。
    • UniRGは,医療画像レポート生成のための汎用的なフレームワークとして,今後の発展が期待される。

    Link: https://arxiv.org/abs/2601.17151

  • 公共交通機関への公正かつ効率的な投資 [cs.FL, cs.GT, cs.MA]目的:公共交通機関のインフラ投資に関する研究
    • 都市における移動の効率化は,経済活動や生活の質に不可欠である。
    • 交通インフラの投資は費用がかさみ,限られた資源の効率的な配分が課題となる。
    • 公平性と効率性を考慮した投資戦略の最適化を目指す。
    • 単一の利用者を対象とする場合,ダイクストラ法と動的計画法を組み合わせた多項式時間アルゴリズムを開発した。
    • このアルゴリズムを基に,二人の利用者を対象とする問題も解決可能であることを示した。
    • 利用者の数に応じた計算複雑性を分析し,特定の条件下では固定パラメータ時間で解けることを示した。

    Link: https://arxiv.org/abs/2602.03687

  • 異なるアーキテクチャ間でのタスクベクトル輸送:学習不要アプローチ [cs.IR, cs.NI, cs.DC, cs.LG, cs.AI, cs.CV]目的:異なる幅のモデル間におけるタスク更新の輸送
    • 大規模事前学習モデルの応用は重要だが,各モデル変種での再学習コストが高い。
    • 同アーキテクチャ間でのタスク更新の転移は可能だが,異アーキテクチャ間では未検討である。
    • アーキテクチャの違いを考慮した,学習不要なタスク更新の転移手法を確立する。
    • Theseusは,タスク更新を中間表現への影響として捉え,異なる幅のモデル間での輸送を可能にする。
    • 表現空間を直交プロクルステス分析で整列させることで,安定した閉形式解が得られ,更新の幾何学的構造を維持する。
    • 画像認識および言語モデル実験において,追加の学習や逆伝播なしにベースラインを上回る一貫した改善が確認された。

    Link: https://arxiv.org/abs/2602.12952

  • 疎な二元行列ゲームの複雑性 [cs.CC, cs.GT, econ.TH]目的:逆多項式近似精度における,定数疎な勝敗二元行列ゲームのε-近似ナッシュ均衡の計算困難性
    • ゲーム理論は,経済学,コンピュータサイエンスなど幅広い分野に応用され,戦略的意思決定を分析する上で重要である。
    • ナッシュ均衡の計算はNP困難であり,大規模なゲームでは実用的な解法が限られている。
    • 疎な二元行列ゲームに対する計算複雑性を明らかにし,効率的な解法の限界を示す。
    • 3疎な勝敗二元行列ゲームにおけるε-近似ナッシュ均衡の計算はPPAD困難であることが証明された。
    • この結果は,2疎なゲームが多項式時間で解けることと整合性がある。
    • 本研究は,疎なゲームにおいてもナッシュ均衡の計算が困難であることを示唆している。

    Link: https://arxiv.org/abs/2602.18380

  • エネルギー駆動型適応的視覚トークンプルーニング:効率的な視覚言語モデルのために [cs.RO, cs.CV, cs.AI]目的:視覚言語モデルにおける効率化のための視覚トークンプルーニング手法
    • 視覚言語モデルの発展は目覚ましいが,計算コストが課題となっている。
    • 既存手法は固定されたトークン予算を用いるため,画像の情報密度を考慮できていない。
    • 画像ごとの情報密度に応じてトークン予算を最適化し,効率と精度を両立すること。
    • 提案手法E-AdaPruneは,視覚特徴行列の特異値スペクトルから画像固有のトークン予算を決定する。
    • 単純な画像ではトークン数を削減し,複雑な画像ではより多くのトークンを割り当てることで,計算資源を効率的に利用する。
    • SQA$^\mathrm{I}$ベンチマークにおいて,トークン数を35.8%削減しつつ,性能劣化を0.52%に抑え,複雑なケースでは性能を1.94%向上させた。

    Link: https://arxiv.org/abs/2603.05950

  • RiO-DETR:リアルタイム指向物体検出のためのDETR [cs.CV]目的:リアルタイム指向物体検出の実現
    • 物体検出は,画像認識における重要な課題であり,自動運転や監視システム等,幅広い応用が期待される。
    • 従来の物体検出手法では,向きを持つ物体(例えば,車両や船)の検出精度が十分でないという課題があった。
    • 本研究では,DETRを改良し,リアルタイム性と高精度を両立する指向物体検出手法を確立する。
    • RiO-DETRは,DETRを指向バウンディングボックスに適応するための課題(向きの依存性,角度の周期性,探索空間の拡大)を解決した。
    • 角度推定と位置クエリの分離,回転補正された直交アテンション,分離された周期的な精度向上,および角度多様性の注入が,その有効性を示した。
    • DOTA-1.0,DIOR-R,FAIR-1M-2.0における実験により,RiO-DETRがリアルタイム指向検出において新たな速度と精度のトレードオフを達成した。

    Link: https://arxiv.org/abs/2603.09411

  • 信頼度誘導拡散による高信頼性超低磁場から高磁場MRI合成 [cs.CL, cs.CV]目的:低磁場から高磁場へのMRI画像合成の信頼性向上
    • 高磁場MRIは高画質だが,設備制限がある。低磁場MRIの活用が重要。
    • 超低磁場では,解剖学的詳細の劣化が空間的に不均一であり,不安定な高周波成分が発生しやすい。
    • 空間的な信頼性を高め,解剖学的に整合性のとれた画像を合成することを目指す。
    • ReDiffは,3つのコントラストと2つのデータセットで最低のLPIPSスコアを達成し,PSNRおよびSSIMにおいても競争力がある。
    • 下流のセグメンテーション分析では,解剖学的構造の保存が改善されていることが示された。
    • 不確実性自体が有用な信頼性信号として機能することが確認された。

    Link: https://arxiv.org/abs/2603.11325

  • セマンティック・ジオメトリ保存による視覚言語モデルの継続学習 [cs.CV, cs.LG]目的:視覚言語モデルの継続学習におけるセマンティック・ジオメトリの保存
    • 大規模な事前学習済みモデルの活用は,多様なタスクへの応用を可能にする重要な技術である。
    • 継続学習において,過去の知識を忘却する「破滅的忘却」が大きな課題となっている。
    • 事前学習と過去の段階で獲得した知識を維持しつつ,新しいタスクに適応することを可能にする。
    • 本研究では,新しいタスクの学習によって生じるセマンティック・ジオメトリの歪みを抑制する手法を提案した。
    • 敵対的アンカーを用いたセマンティック・ジオメトリ保存(SeGP-CL)により,安定性と前方転送性能を向上させた。
    • 五つの継続学習ベンチマークにおいて,最先端の性能を達成し,セマンティック・ジオメトリをより良く保存することが示された。

    Link: https://arxiv.org/abs/2603.12055

  • 視覚言語モデルOCRにおける幾何学的リスク制御 [cs.CV]目的:視覚言語モデルOCRの信頼性向上
    • 視覚言語モデルはOCRの柔軟性を高めるが,誤ったテキスト生成のリスクがある。
    • 重要な記録において,誤った出力は棄権よりもコストが高い場合がある。
    • 視覚的根拠に基づいたテキスト出力を保証する制御メカニズムの確立。
    • 幾何学的リスクコントローラー(GRC)は,モデルに依存しない制御手法であり,構造的に不自然な出力を排除する。
    • GRCは,再現性のある固定された判断ルールに基づいて,視覚的証拠に裏付けられた候補のみを出力する。
    • 実験により,出力されたテキストのエラー率を削減しつつ,高い網羅性を維持できることが示された。

    Link: https://arxiv.org/abs/2603.19790

  • SyncBreaker:段階認識型マルチモーダル敵対的攻撃による音声駆動型トーキングヘッド生成 [cs.CV]目的:音声駆動型トーキングヘッド生成における悪用リスク軽減策の開発
    • 音声駆動型トーキングヘッド生成技術は,リアルな映像生成を可能にする重要な分野である。
    • 既存の保護手法は単一のモダリティに限定され,効果的な顔の動き抑制が困難である。
    • 画像と音声を同時に擾乱することで,顔と口の同期ずれを効果的に誘発し,悪用を防ぐ。
    • SyncBreakerは,画像ストリームにMulti-Interval Sampling(MIS)を導入し,静止した顔画像への誘導を強化する。
    • 音声ストリームにはCross-Attention Fooling(CAF)を適用し,特定の時間間隔における音声条件付きクロスアテンション応答を抑制する。
    • 実験の結果,SyncBreakerは単一モダリティのベースラインよりも口の同期ずれと顔の動きの悪化に優れていることが示された。

    Link: https://arxiv.org/abs/2604.08405

  • 多言語ビジョン言語大規模モデルにおける標的化された解釈可能な安全ニューロン強化 [cs.CV]目的:多言語およびマルチモーダルリスクを軽減するための安全ニューロンの特定と標的化された安全チューニング
    • ビジョン言語大規模モデルの普及に伴い,多言語・マルチモーダルにおける安全性の確保が重要となっている。
    • 低リソース言語指示と視覚的文脈間の複合的なリスクが既存手法では捉えきれず,安全性の境界形成が困難である。
    • 安全ニューロンを特定し,それらを標的としたチューニングにより,多言語・マルチモーダルリスクを同時に軽減することを目指す。
    • 本手法は,少数の安全ニューロンを調整するだけで,多言語およびマルチモーダル安全性を向上させる。
    • 有害な要求と無害な入力に対するFFN表現を比較することで,安全拒否に関連するニューロン活性化強度を特定する。
    • ニューロン活性化と対応する下層射影列を共同モデル化し,安全のためのニューロンと汎用的なニューロンを分離する。

    Link: https://arxiv.org/abs/2604.08881

  • 生きた世界の物語作成:実行可能なマルチエージェントシナリオのためのツール制約LLMエージェント [cs.CV]目的:実行可能なマルチエージェントシナリオの作成
    • 3D生きた世界のシナリオ作成は,物語の自由度とシミュレーションの厳密さを両立させる必要があり,その重要性が増している。
    • 大規模言語モデルはプロンプト内のルールを無視し,動的な世界の状態を追跡することが困難であるという課題があった。
    • シミュレーターの状態に照らして検証された操作を通じてシーンを構築することで,有効な仕様を生成することを目指す。
    • 提案手法では,エージェントが既存のシナリオグラフからテキストを生成し,そのグラフと元のグラフを比較することで,0.83のF1スコアでイベントを,0.77で順序を再現することに成功した。
    • 従来の段階的パイプラインでは実行可能な仕様が生成されなかったのに対し,提案手法を用いることで,予算モデルでも25回の試行のうち80%で実行可能な仕様が生成された。
    • 本手法は,GESTの表現力を最大限に引き出す最初の試みであると考えられる。

    Link: https://arxiv.org/abs/2604.10383

  • S-GRPO:大規模視覚言語モデルの統一的なポストトレーニング [cs.LG, cs.CL, cs.CV]目的:大規模視覚言語モデルの適応に関する研究
    • 視覚と言語を理解するAIの開発は,様々な応用を可能にする重要な研究分野である。
    • 既存の手法は,汎用性の低下や最適化の停滞といった課題を抱えている。
    • 本研究は,これらの課題を克服し,効率的な適応を実現することを目指す。
    • 提案手法S-GRPOは,模倣学習と強化学習を統合することで,単独手法の欠点を克服する。
    • 特に,探索に失敗した場合に正解データを注入するCGI機構が,学習の加速と安定化に貢献する。
    • 実験結果は,S-GRPOが汎用性を維持しつつ,ドメイン適応において優れた性能を発揮することを示した。

    Link: https://arxiv.org/abs/2604.16557

  • 圧縮CTからの学習:特徴注意スタイル変換と構造化因数分解射影によるリソース効率な医用画像解析 [cs.NI, cs.CV, eess.IV]目的:胸部異常検出のための,圧縮CTデータを用いた効率的な医用画像解析手法
    • AIによる医療画像診断は進歩しているが,計算資源の制約が実用化の障壁となっている。
    • 非圧縮CTデータは情報量が多い反面,処理に高い計算能力を要し,データ転送にも負担が大きい。
    • 圧縮CTデータから高精度な診断を実現し,リソース制約下でのAI活用を可能にすることを目指す。
    • 提案手法CT-Liteは,圧縮CTデータを用いながら,非圧縮データと同等の精度をほぼ維持できることを示した。
    • 特徴注意スタイル変換(FAST)と構造化因数分解射影(SFP)により,パラメータ数を削減し,計算コストを低減した。
    • CT-RATE,NIDCH,Rad-ChestCTの3データセットで有効性が確認され,リソース制約下での臨床評価への道を開いた。

    Link: https://arxiv.org/abs/2605.00448

  • AI誘導下における集団の戦略的相互作用:誰が実際にプレイしているのか [cs.GT, cs.MA, econ.TH]目的:AI誘導集団における戦略的相互作用の分析
    • AI技術の発展に伴い,多数のエージェントをAIが指示する場面が増加している。
    • AIによる共通の指示は,エージェント間の協調を変化させ,インセンティブの不一致が問題となる。
    • AI誘導プロバイダー間の戦略的相互作用を分析し,協調の可能性を明らかにすること。
    • AI指示の共有は,特定の条件下でのみ均衡行動を変化させ,協調が生まれる可能性がある。
    • クライアントのシェアは,ベースゲームに応じて,協調にプラス,マイナス,または非単調な影響を与える。
    • 繰り返しゲームにおいては,間接的な観察と識別不能性にもかかわらず,実行可能な合理的な結果が維持される。

    Link: https://arxiv.org/abs/2605.06525