arXiv雑要約

画像・音声 - 2026/08/03 公開

  • CodeShrink:効率的なマルチモーダルコード理解のための適応的視覚圧縮 [cs.CV, cs.SE]目的:マルチモーダル大規模言語モデルにおける効率的なコード理解のための視覚圧縮手法
    • 近年の大規模言語モデルの発展に伴い,コード理解へのマルチモーダル入力の活用が注目されている。
    • コードを画像として扱う場合,画質の調整が重要だが,固定的な圧縮率では最適化が難しい。
    • 入力,タスク,モデルに応じて最適な圧縮設定を自動的に決定し,効率的なコード理解を目指す。
    • CodeShrinkは,空白領域の削減,適応的な圧縮設定,およびタスク関連性のないトークンの除去により,視覚トークンの使用量を最大71.2%削減した。
    • その結果,テキストのみの入力と同等またはそれ以上の性能を達成し,既存のテキストベースおよび視覚圧縮手法を上回った。
    • 本研究は,レイアウトの圧縮,適応的設定,および命令認識によるプルーニングの組み合わせが,マルチモーダルコード理解の効率化に貢献することを示した。

    Link: https://arxiv.org/abs/2607.29637

  • 長文書籍における視覚的質問応答のための階層的ページ・領域エビデンスルーティング [cs.CV]目的:長文書籍の視覚的質問応答におけるエビデンス探索
    • 長文資料の理解は,情報検索や知識獲得において重要であり,AIによる支援が求められている。
    • 既存手法では,ページレベルと領域レベルのエビデンス探索が十分に連携しておらず,精度向上のボトルネックとなっている。
    • ページと領域の選択を統合し,段階的にエビデンスを特定することで,より高精度な質問応答を目指す。
    • 提案手法HierDocは,ページと領域の選択を階層的に行うことで,既存のオープンソースモデルを大幅に上回る性能を達成した。
    • ページのみのシステムと比較して,領域エビデンスの選択により,精度とF1スコアがそれぞれ5.51%と4.82%向上した。
    • 本研究は,粗いページルーティングと細かい領域ルーティングを,最適化された段階的プロセスとして統合することの有効性を示した。

    Link: https://arxiv.org/abs/2607.29638

  • ビジュアル生成におけるテキスト条件付けのスケーリング特性 [cs.CL, cs.DC, cs.PF, cs.CV]目的:ビジュアル生成におけるテキスト条件付けのスケーリング特性
    • 画像生成の分野では,テキストによる制御が重要であり,その性能向上が求められている。
    • 自然言語プロンプトのトークン数と拡散損失の関係が明確でなく,スケーリング特性の測定が困難であった。
    • 構造化された言語の量を考慮することで,拡散損失のスケーリング特性を明らかにし,生成性能を向上させる。
    • 拡散損失は,プロンプト内の構造化された言語の量と共にスケールすることが確認された。
    • GPGとEDという2つの指標を用いて構造化言語を定量化し,拡散損失との関係を分析した。
    • 画像由来のセマンティックおよび幾何学的注釈を用いた構造化プロンプトの構築や,プロンプターの学習により,生成性能が向上した。

    Link: https://arxiv.org/abs/2607.29679

  • 暗闇における堅牢かつ3次元認識型RGB-NIRイメージング [cs.CV]目的:暗闇におけるRGB-NIRイメージングの堅牢性の向上
    • 低照度環境下での画像認識は重要であり,自動運転や監視システム等への応用が期待される。
    • 既存手法は,高品質な訓練データに依存しており,多様な条件下での汎化性能が課題である。
    • クリーンなRGBデータを用いずに,3次元認識を通じてRGBとNIRを融合し,堅牢性を高めることを目指す。
    • 提案手法は,クリーンなRGBデータに依存せず,ノイズの多いRGBとNIR情報を3次元空間で融合する。
    • 様々なノイズレベルに対して汎化性能が高く,合成データと実データでの評価で優位性が示された。
    • 本研究は,RGB-NIR低照度イメージングにおいて,データ収集の負担を軽減する新たな視点を提供する。

    Link: https://arxiv.org/abs/2607.29684

  • 2D断層撮影を用いた異常検出シミュレーション [eess.IV, cs.CV]目的:有機組織内における癌細胞等の異常のイメージング品質予測
    • 医療診断の精度向上には,異常を高精度に検出する技術が不可欠である。
    • 従来の異常検出技術では,深部組織内の異常検出が困難な場合がある。
    • RF断層撮影センサーの評価・設計に役立つ,新たな異常検出手法を提案する。
    • 本研究では,癌細胞等の異常のイメージング品質をシミュレーションにより予測する手法を開発した。
    • 提案手法は,RF断層撮影センサーの性能評価や設計において有用であると考えられる。

    Link: https://arxiv.org/abs/2607.28701

  • CBCT-IQ:画像品質評価とベンチマーキングのための公開アノテーション付きコーンビームCTデータセット [physics.med-ph, cs.CV]目的:画像品質評価とベンチマーキングのためのコーンビームCTデータセット
    • 医療画像品質は診断精度に不可欠であり,特にコーンビームCTでは,画質と被ばく線量のバランスが重要である。
    • 専門家による視覚的評価は標準だが,時間がかかり主観的で観察者間変動の影響を受けるため,定量的な画質評価手法が求められる。
    • 公開されたアノテーション付きCBCTデータセットが不足している問題を解決し,画質評価手法の開発と検証を促進する。
    • 1,764枚のアノテーション付き画像スライスからなる,初のオープンアクセスCBCT画像品質評価データセットを公開した。
    • 3名の臨床専門家が画像品質を4段階で評価し,データセットを構築した。
    • 26種類の画質評価指標をベンチマークし,微細な画質差を識別可能な新たな指標を提案した。

    Link: https://arxiv.org/abs/2607.29253

  • 低フレームレート高次元連続トークンによる安定的な自己回帰音声生成 [math.AC, cs.SC, math.AG, eess.AS, cs.AI, cs.LG, cs.SD]目的:自己回帰音声生成における系列長,表現能力,長期安定性のバランス
    • 音声生成技術は,対話システムやコンテンツ制作など幅広い分野で重要性が増している。
    • 高フレームレートでは分布ドリフトや誤差累積が課題となり,低フレームレートでは音質が制限される。
    • 低フレームレートかつ高次元の表現と生成フレームワークの協調設計により,安定性を向上させる。
    • 提案手法Locodecは,高次元表現空間の補間性と識別可能性を高め,トークンの予測精度を向上させる。
    • MP-ELDは,多経路情報ルーティングとresidual classifier-free guidanceにより,誤差累積を軽減する。
    • 8Hz,768次元のトークンを用いた実験で,高い再構成品質と安定性を実現した。

    Link: https://arxiv.org/abs/2607.29363

  • MoPET:統一的な医用画像分類のためのパラメータ効率的な混合エキスパートモデル [eess.IV, cs.CV, cs.LG]目的:医用画像の多様な臨床的異質性への適応
    • 医用画像診断の精度向上は,医療の質向上に不可欠であり,深層学習の活用が期待されている。
    • 限られたデータで深層学習モデルを学習する場合,過学習が課題となる。既存のPEFTは課題を緩和するが,タスクごとに独立したアダプターが必要となる。
    • 異なる医用画像データセットを統合学習する際に発生する,負の転移を抑制し,汎化性能を高める。
    • PEFTは,完全なネットワーク更新と比較して平均精度を向上させ,過学習を防ぐことが示された。
    • MoPETモデルは,異なる4つの医用画像データセットを1つのネットワークに統合し,単独のPEFTアダプターよりも高い平均精度を達成した。
    • 補助データセットを用いた共同学習により,データ制約のある臨床ターゲットの精度が向上することが確認された。

    Link: https://arxiv.org/abs/2607.29462

  • 幾何力学による弾性曲線 [math.OC, cs.SY, eess.SY, math.CO, cs.DM, math.DG, cs.GR, math-ph, math.MP, math.SG]目的:弾性曲線の新たな定式化
    • 弾性曲線は力学,幾何学,コンピュータグラフィックス等に密接に関わる重要な研究分野である。
    • 従来の定式化では,曲率や材料枠の離散化といった課題が存在する。
    • 等周長性に基づく定式化により,離散的な弾性曲線を構造保存的に定義し,新たな離散理論を構築する。
    • 弾性曲線は,面積および体積ベクトルの固定下での長さ汎関数の臨界点として特徴づけられることが示された。
    • この制約は剛体運動に対して自然に変換され,運動量変数として特定された。
    • 多角形曲線に対する長さ,面積,体積ベクトルの定義と,それらの変換則の厳密な成立が確認された。

    Link: https://arxiv.org/abs/2607.29654

  • 画像複雑度表現のためのコントラスト学習 [cs.CV]目的:画像複雑度の表現
    • 画像複雑度の定量化は,様々なコンピュータビジョンの性能向上に不可欠である。
    • 複雑度のラベル付けには高コストな手動アノテーションが必要であり,主観的なバイアスが生じやすい。
    • アノテーションコストを削減し,客観的な複雑度表現を学習すること。
    • コントラスト学習フレームワークCLICを提案し,画像複雑度を表現することに成功した。
    • 異なるスケールの局所的なクロップを利用するRCMにより,データ拡張と多様性の向上を実現した。
    • CLICは,最先端の教師あり学習手法と同等の性能を示すことが実験的に確認された。

    Link: https://arxiv.org/abs/2408.03230

  • 生成AI時代におけるディープフェイクメディアの生成と検出:サーベイと展望 [cs.DM, cs.CV, cs.AI, cs.LG, cs.MM, cs.SD, eess.AS]目的:ディープフェイクの生成と検出技術に関する調査
    • 社会における偽情報の拡散が深刻化しており,その対策が急務である。
    • 既存のディープフェイク検出器は,未知の生成手法に対して汎化性能が低い。
    • 未知の生成器によって生成されたディープフェイクに対する検出性能の向上。
    • 画像,動画,音声,マルチモーダルコンテンツを含む,様々な種類のディープフェイクとそれらの生成・検出手法の分類を提示した。
    • 一般的なデータセットにおける最良の検出器のランキングを更新し,新たなマルチモーダルベンチマークを開発した。
    • 最先端の検出器は,未知の生成器によって生成されたディープフェイクに対して汎化性能が低いことが示された。

    Link: https://arxiv.org/abs/2411.19537

  • 人間の個別運動シグネチャの再現:反復運動に対するデータ駆動的アプローチ [cs.GR, cs.AI, cs.LG, cs.SY, eess.SY]目的:人間の個別運動シグネチャの再現
    • 拡張現実やロボットの活用拡大に伴い,人間らしい自然な運動モデルの必要性が高まっている。
    • 既存モデルは人間の運動行動を単純化し,効果的な認知アーキテクチャ開発の阻害要因となっている。
    • 個人の特徴的な運動パターンを捉え,より人間らしい運動生成を目指す。
    • 運動振幅が,既存の研究に加え,個人の運動シグネチャの特徴づけに有用であることが示された。
    • LSTMニューラルネットワークを用いたデータ駆動的なアプローチにより,個人の特徴を捉えた一次元運動生成が可能となった。
    • 実験結果から,本モデルは学習対象者の速度分布と振幅包絡線を再現し,他の個人とは区別できることが示された。

    Link: https://arxiv.org/abs/2503.15225

  • ソーフェイク:ソーシャルメディア画像偽造検出のベンチマークと説明 [cs.CV]目的:ソーシャルメディア画像偽造検出のためのベンチマークデータセットおよび高度な検出フレームワークの開発
    • AI生成モデルの進化により,ソーシャルメディア上の偽情報拡散リスクが高まっており,信頼性確保が重要である。
    • 既存のデータセットは多様性,規模,現実味に欠け,未知の生成技術への汎化性能が課題となっている。
    • 本研究は,ソーシャルメディア環境に適したデータセットとベンチマークを提供し,偽造検出技術の向上を目指す。
    • 200万枚以上の高品質画像を含む「So-Fake-Set」データセットおよび大規模な外域ベンチマーク「So-Fake-OOD」を構築した。
    • 強化学習を用いた「So-Fake-R1」という画像と言語を結びつけた新しいフレームワークを提案し,高精度な偽造検出を実現した。
    • So-Fake-R1は,既存手法と比較して検出精度で1.3%,局所化IoUで4.5%の改善を示し,優れた性能を発揮した。

    Link: https://arxiv.org/abs/2505.18660

  • AniCrafter:ビデオ拡散モデルにおけるアバター背景条件付けによる現実的な人間中心アニメーションのカスタマイズ [cs.CV]目的:ビデオ拡散モデルにおけるアバターと背景の条件付けによる人間中心アニメーションのカスタマイズ
    • 近年のビデオ生成技術の発展は,キャラクターアニメーションの可能性を大きく広げている。
    • 既存手法は構造的な条件に依存するため,動的な背景や複雑なシーンにおける表現に限界がある。
    • 複雑な背景下での人間アニメーションを実現し,より自然で多様な表現を可能にすること。
    • 本研究で提案するAniCrafterは,指定されたモーションに従い,動的な背景にキャラクターをシームレスに統合する。
    • アバター背景条件付けメカニズムにより,人間中心アニメーションを復元問題として捉え,多様で遮蔽を考慮したアニメーションを実現。
    • 実験結果は,既存手法を凌駕し,困難なシナリオへの対応能力が非常に高いことを示している。

    Link: https://arxiv.org/abs/2505.20255

  • モーメントカーネル:回転と反射に対する不変性を深層畳み込みネットワークに組み込むためのシンプルでスケーラブルなアプローチ [cs.CV, cs.LG]目的:回転および反射に対する不変性を有する畳み込みカーネルの表現
    • 画像認識において畳み込みニューラルネットワークの成功は,並進不変性に大きく起因する。回転や反射といった他の対称性も重要である。
    • 回転や反射に対する不変性を扱う手法は,特に3次元において実装が複雑で,専門的な知識やライブラリを必要とする場合が多い。
    • 標準的な畳み込みモジュールを用いて実装可能な,シンプルでスケーラブルなカーネル表現を提案し,不変性の問題を解決する。
    • モーメントカーネルは,テンソル値特徴フィールド間の直交変換に対して不変な畳み込みカーネルを,座標成分とクロネッカーデルタの積を用いて表現できることを証明した。
    • 脳MRIの3次元アフィン変換回帰などの生物医学的タスクにおいて,モーメントカーネルは最悪の場合の向きの一貫性を改善し,3次元での学習を可能にした。
    • 本手法は,グループ畳み込みに必要な向きチャネルの拡張を回避し,グリッドを保持する回転および反射に対して正確な一貫性を提供する。

    Link: https://arxiv.org/abs/2505.21736

  • 周期性誘導と信号再構成による超短時間rPPG推定 [cs.CV]目的:超短時間ビデオクリップからの心拍数推定
    • 遠隔心拍数測定は,健康状態のモニタリングにおいて重要であり,非接触での計測が求められている。
    • 従来のrPPG推定は10秒程度の動画を必要とし,2秒といった超短時間動画への対応が課題であった。
    • 本研究は,超短時間動画に含まれる心拍周期の制約を克服し,高精度な心拍数推定を目指す。
    • 提案手法は,超短時間クリップと長時間の基準信号間の周期性を一致させることで,推定精度を向上させている。
    • スペクトル漏洩による誤差を軽減するため,超短時間rPPG信号からより長い信号を再構成する生成器を導入している。
    • 4つのベンチマークデータセットでの実験により,提案手法が既存手法を凌駕し,最先端の性能を達成することが示された。

    Link: https://arxiv.org/abs/2506.22078

  • WaMo:ウェーブレット強化マルチ周波数軌跡解析による細粒度テキスト・モーション検索 [cs.CV]目的:テキスト記述に対応する3Dモーションシーケンスの検索
    • 人間の複雑な構造と時空間的な動きを考慮したモーション解析は,ロボット工学やコンピュータグラフィックス等の分野で重要である。
    • 既存手法は,身体各部位やその動きの違いを見分けられず,テキストとの正確な意味的整合性が課題となっていた。
    • ウェーブレット変換を用いて,関節ごとの詳細な時空間情報を捉え,テキストとの精密な整合性を実現することを目指す。
    • WaMoは,関節軌跡の周波数分解と再構成により,局所的な運動詳細と全体的なモーションセマンティクスを両立する。
    • シャッフルされたモーションシーケンスの再構成により,時間的な一貫性を学習し,モーションとテキストの整合性を向上させる。
    • HumanML3DとKIT-MLデータセットにおいて,既存最先端手法を17.0%と18.2%上回る結果を得た。

    Link: https://arxiv.org/abs/2508.03343

  • KANベースの暗黙的ニューラル表現を用いた変形可能な医用画像登録 [cs.CV]目的:変形可能な医用画像登録手法
    • 医用画像解析において,空間的アライメントは経時的変化の解析や多角的モダリティの融合に不可欠である。
    • 深層学習モデルは大量の学習データが必要であり,特定の解剖構造やモダリティで古典的な反復法に劣ることがある。
    • データ効率の良い手法として暗黙的ニューラル表現を用いるが,高速性と初期値依存性の問題がある。
    • 提案手法KAN-IDIRとRandKAN-IDIRは,Kolmogorov-Arnoldネットワークに基づき,解像度に依存しない変形可能な医用画像登録を実現した。
    • 肺CT,脳MRI,心臓MRIデータセットにおいて,既存のINRベースの手法,深層学習モデル,古典的な手法を凌駕する精度を達成した。
    • RandKAN-IDIRは,計算コストを抑えつつ高い安定性を維持し,再現性のある臨床研究への応用が期待される。

    Link: https://arxiv.org/abs/2509.22874

  • 高速特徴場(F³):イベントの予測的表現 [cs.CV, cs.AI, cs.LG, cs.RO]目的:イベントベースカメラからのデータ表現
    • 従来のカメラでは困難な高速な動体認識への応用が期待される分野である。
    • イベントベースカメラのデータは疎であり,ノイズに弱く,処理が難しいという課題がある。
    • 過去のイベントから未来のイベントを予測することで,効率的かつロバストなデータ表現を構築する。
    • 提案手法F³は,シーン構造と動きの情報を保持しつつ,イベントデータの疎性を活用している。
    • マルチ解像度ハッシュエンコーディングとディープセットのアイデアにより,HDで120Hz,VGAで440Hzの高速処理を実現した。
    • 光学フロー推定,セマンティックセグメンテーション,単眼距離推定において,最先端の性能を達成した。

    Link: https://arxiv.org/abs/2509.25146

  • パリ: 分散型学習済みオープンウェイト拡散モデル [cs.DL, cs.GR, cs.DC, cs.LG]目的:分散型計算による事前学習拡散モデルの開発
    • 拡散モデルは画像生成の分野で急速に進歩しており,その応用範囲は広い。
    • 大規模モデルの学習には,高価な集中型インフラストラクチャが必要となる。
    • 分散型学習によって,よりアクセスしやすい大規模モデルの学習を目指す。
    • パリは,集中型インフラなしで高品質な画像生成が可能であることを示した。
    • 専門家モデルを独立して学習させ,軽量なルーターで適切な専門家を選択する。
    • パリは,従来の分散型モデルよりも少ないデータと計算量で同等の品質を達成した。

    Link: https://arxiv.org/abs/2510.03434

  • 胎児超音波解釈のための認識論的認識型ビジョン言語基盤モデル [cs.CV, cs.AI, cs.IR, cs.MM]目的:胎児超音波画像に関するレポート生成および診断
    • 周産期医療における胎児の健康状態の早期発見と適切な管理は,母子双方の健康を確保する上で不可欠である。
    • 既存の医用画像処理モデルは,成人の画像に最適化されており,多様な画像や多角的視点が必要な胎児超音波画像に対しては性能が低い。
    • 胎児超音波画像特有の課題を克服し,より正確かつ効率的な診断支援を実現すること。
    • 本研究で開発したFetalMindは,既存のモデルと比較して全妊娠段階において優れた性能を示し,平均で14%の向上を達成した。
    • 特に重篤な状態の診断精度は61.2%高く,効率性,安定性,拡張性にも優れている。
    • 臨床ワークフローを考慮したSalient Epistemic Disentanglement(SED)により,疾患と視点の関連性を解きほぐし,臨床的に妥当な推論を実現した。

    Link: https://arxiv.org/abs/2510.12953

  • Σ²Pにおける曖昧性のない問題の複雑性 [cs.CC, cs.GT]目的:曖昧性のないΣ²P問題の複雑性の包括的な分析
    • 計算複雑性理論は,問題解決に必要な計算資源を理解する上で不可欠である。
    • Σ²P問題の複雑性は未解明な点が多く,効率的なアルゴリズムの設計が困難である。
    • 本研究では,Σ²P問題の持つ曖昧性のない性質に着目し,その複雑性クラスを特定する。
    • 問題の固有特性に基づくPTW,PCW,PMAという3つの構文サブクラスを特定した。
    • これらのクラスはすべてS²Pに含まれることが示され,Σ²Pの直接的な上限よりも複雑性が低いことが明らかになった。
    • 提案されたフレームワークを用いて,様々な実用的な問題の複雑性を特徴づけた。

    Link: https://arxiv.org/abs/2510.19084

  • 第二最適サービスへの対価:不正なLLMプロバイダに対するゲーム理論的アプローチ [cs.GT, cs.AI]目的:不正なLLMプロバイダに対するインセンティブ設計
    • LLMのAPI利用が普及する中で,プロバイダによる不正行為が深刻な問題となっている。
    • プロバイダは,モデルの性能を偽ったり,無意味なトークンを付加して課金を増やしたりする可能性がある。
    • ユーザーがプロバイダの戦略的行動を考慮した上で,最適なメカニズムを設計することを目的とする。
    • 提案メカニズムは,近似的なインセンティブ整合性を持ち,ユーザーの効用を保証することが示された。
    • 連続的な戦略空間において,近似比$O(T^{1-\epsilon}\log T)$を達成するメカニズムの存在が証明された。
    • 既存のメカニズムと比較して,提案メカニズムの性能が非劣であること,あるいはそれを上回ることが示された。

    Link: https://arxiv.org/abs/2511.00847

  • AREA3D:統一的なフィードフォワード3D認識とビジョン-言語ガイダンスによるアクティブ再構成エージェント [cs.CV, cs.AI, cs.RO]目的:アクティブ3D再構成における再構成精度向上
    • 3次元環境の理解は,ロボティクスや拡張現実など幅広い分野で不可欠である。
    • 既存手法は手動で設計されたヒューリスティックに依存し,冗長な観測が生じやすい。
    • より効率的で正確な3次元再構成を実現するための新しいアプローチを確立すること。
    • AREA3Dは,フィードフォワード3D再構成モデルとビジョン-言語ガイダンスを活用する。
    • 不確実性モデリングと再構成器を分離し,高精度な不確実性推定を可能にした。
    • ビジョン-言語モデルによる高レベルな意味的ガイダンスにより,視覚的に多様な観点を選択できる。

    Link: https://arxiv.org/abs/2512.05131

  • JoVA:ビデオとオーディオの同時生成・編集のための統一マルチモーダル学習 [cs.CV]目的:ビデオとオーディオの同時生成・編集を可能にするフレームワーク
    • 動画と音声の理解・生成は,コンテンツ制作やコミュニケーションにおいて不可欠な技術である。
    • 既存手法は,タスクごとに異なる構造や複雑な融合メカニズムに依存し,汎用性に課題がある。
    • 多様なマルチモーダルタスクを単一モデルで効率的に解決し,コンテンツ制作の可能性を広げる。
    • JoVAは,ビデオ,オーディオ,テキスト間の直接的な相互作用を実現するデュアルブランチアーキテクチャを採用している。
    • チャネルごとの条件付けにより,大量のトークン拡張を避けつつ,柔軟な画像・動画参照を可能にしている。
    • 広範な実験により,JoVAが既存のベンチマークで最先端の性能を達成し,汎用的なコンテンツ作成フレームワークとしての有用性が示された。

    Link: https://arxiv.org/abs/2512.13677

  • EMAG:指数移動平均ガイダンスを用いた自己修正拡散サンプリング [cs.CV]目的:拡散モデルにおけるサンプル品質と一貫性の向上
    • 拡散モデルは画像生成などの分野で高い性能を示しており,その応用範囲は広い。
    • 従来のガイダンス手法では,ネガティブサンプルの粒度や難易度を制御するのが難しいという課題があった。
    • 本研究は,より効果的なネガティブサンプル生成により,生成品質の向上を目指す。
    • 指数移動平均ガイダンス(EMAG)は,拡散TransformerのAttention機構を改変することで,質の高いネガティブサンプルを生成する。
    • EMAGは,従来のCFGと比較して,Human Preference Score(HPS)を+0.46向上させる。
    • EMAGは,APGやCADSといった他の高度なガイダンス手法とも自然に組み合わせることができ,更なるHPSの向上に貢献する。

    Link: https://arxiv.org/abs/2512.17303

  • 漸進的チェッカーボードによる自己回帰型マルチスケール画像生成 [cs.CV]目的:自己回帰型マルチスケール画像生成における効率的な並列サンプリング手法
    • 画像生成は,コンピュータビジョン分野の重要な課題であり,現実世界の多様な画像を合成する能力が求められる。
    • 自己回帰型画像生成では,並列サンプリングと系列的条件付けのバランスが難しく,計算効率と生成品質の両立が課題である。
    • チェッカーボードによるサンプリング順序を導入することで,スケール間およびスケール内の効果的な条件付けを実現し,生成効率を向上させる。
    • 提案手法は,ImageNetのクラス条件付き画像生成において,同等のモデル容量を持つ最先端の自己回帰型システムと同等の性能を達成した。
    • 総系列ステップ数を一定に保つことで,幅広いスケールアップ係数でも同様の結果が得られることが示された。
    • 均等に間隔をあけた領域からの並列サンプリングにより,クワッドツリー分割の各レベルでバランスを維持し,効果的な条件付けを可能にした。

    Link: https://arxiv.org/abs/2602.03811

  • 幾何学的観測可能性指数:影響,フィッシャー情報量,およびSE(3)姿勢推定における弱い観測可能性 [cs.CV]目的:SE(3)姿勢推定における特徴量ごとの感度指標である幾何学的観測可能性指数
    • ロボット工学やコンピュータビジョンにおいて,正確な姿勢推定は重要であり,環境認識やナビゲーションに不可欠である。
    • 姿勢推定において,観測が不十分な場合や,ノイズの影響を受けやすい場合に,推定精度が低下する問題がある。
    • 本研究は,姿勢推定における各観測値の影響度を定量化し,推定精度の改善に貢献することを目的とする。
    • 幾何学的観測可能性指数(GOI)は,単一の測定が誘起する姿勢摂動の大きさを示す指標であり,フィッシャー情報量と一致することが示された。
    • GOIは,測定値の影響を正確に評価し,外れ値の検出や安定性の評価に役立つことが実験的に確認された。
    • 弱い観測可能性の環境下では,GOIに基づくゲート処理が従来のゲート処理よりも優れた性能を発揮することが,実データを用いた実験で示された。

    Link: https://arxiv.org/abs/2602.05582

  • プロンプト再注入:テキスト-画像生成のためのマルチモーダル拡散Transformerにおけるプロンプト忘却の緩和 [cs.CV]目的:マルチモーダル拡散Transformerにおけるプロンプト忘却現象の緩和
    • 画像生成AIの性能向上には,テキスト指示の正確な理解が不可欠である。
    • Transformerの深層化に伴い,初期のテキスト情報が徐々に失われる問題がある。
    • Transformerの深層部においてもプロンプト情報を保持し,生成精度を向上させる。
    • 本研究では,プロンプト再注入という学習不要な手法を提案し,プロンプト忘却を緩和することに成功した。
    • GenEval,DPG,T2I-CompBench++等の評価で,指示への追従性,美的感覚,全体的な生成品質が向上した。
    • SD3,SD3.5,FLUX.1といった代表的なモデルで,効果が確認された。

    Link: https://arxiv.org/abs/2602.06886

  • ステップレベルの視覚的根拠の忠実度が,長期的視覚言語モデルの分布外汎化性能を予測する [cs.CV, cs.AI]目的:長期的視覚言語モデルにおける,ステップレベルの視覚的根拠の忠実度と分布外汎化性能の関係性
    • 視覚と言語を組み合わせたモデルは,現実世界でのタスクにおいて重要であり,その性能向上は不可欠である。
    • 既存の評価指標は最終的な正答率に偏っており,モデルの中間的な推論過程の視覚情報との整合性を評価できない。
    • モデルの推論過程における視覚的根拠の忠実度を定量的に評価し,汎化性能との関連性を明らかにすること。
    • ステップレベルの視覚的根拠の忠実度(SGR)と分布外汎化性能の間には,強い正の相関関係が認められた (r = 0.83)。
    • SGRは,モデルの規模や,学習時の分布内精度とは独立に,汎化性能を予測する重要な指標となることが示された。
    • パラメータ数が同じモデル間でも,SGRに最大10.8ポイントの差が見られ,視覚的根拠の忠実度がモデルの能力を特徴づける独立した軸であることが明らかになった。

    Link: https://arxiv.org/abs/2603.06828

  • 二手のHOI:関節計画と接触洗練による言語誘導両手-物体動作生成 [cs.RO, cs.CV]目的:言語と物体形状から接触意図を予測し,関節軌道の参照と両手間協調動作を生成するフレームワーク
    • ロボットが人間のように複雑な物体操作を行うには,両手と物体の協調が不可欠である。
    • 既存手法では,物体と手の動作をまとめて扱うため,操作のスケールや協調,姿勢の微調整が困難である。
    • DuetHOIは,言語に基づいた自然な両手-物体インタラクション生成を可能にする。
    • DuetHOIは,接触意図予測,関節計画,DualFormerによる全体的なインタラクション生成,ProxiRefineによる接触洗練という構造を持つ。
    • 実験の結果,接触の一貫性や手-物体の一貫性において,DuetHOIは既存手法を上回る性能を示した。
    • 特に,関節のある物体との両手によるインタラクション生成において,顕著な効果が確認された。

    Link: https://arxiv.org/abs/2603.08390

  • 経胸部超音波における自動初期プローブ配置:ヒューマンメッシュと骨格復元を用いたアプローチ [cs.RO, cs.CL, cs.CV]目的:経胸部超音波における自動初期プローブ配置の実現
    • 心臓や肺の超音波検査は,専門知識と熟練が必要であり,遠隔地での診断を困難にしている。
    • 遠隔超音波では,患者の3次元的な把握が難しく,初期プローブ配置のガイドが課題となっている。
    • RGB画像と深度画像を用いて,患者固有の解剖学的情報を基にした初期プローブ配置を自動化する。
    • RGB画像と深度画像から患者の体表面と骨格モデルを推定し,高精度な患者登録を可能にした。
    • 推定された骨格のランドマークを利用して肋間領域を推定し,MRヘッドセット上にプローブ配置のガイドを表示した。
    • パイロット実験の結果,平均表面誤差15mm,ランドマーク誤差41.0mm,体幹角度誤差9度以内であり,遠隔超音波に適した配置精度が得られた。

    Link: https://arxiv.org/abs/2603.11257

  • 距離を考慮したソフトプロンプトによる多Modal Valence-Arousal推定 [cs.CV]目的:多Modalデータからの感情価・覚醒度推定
    • 人間感情の微妙なニュアンスを捉える上で,感情価・覚醒度推定は重要な課題である。
    • 既存手法では,テキストプロンプトの離散的な性質が連続回帰タスクの性能を制限している。
    • 意味表現と連続的な感情次元のギャップを埋め,高精度な感情価・覚醒度推定を実現する。
    • 提案手法は,感情価・覚醒度空間を離散領域に分割し,距離に基づいたソフトラベルを用いることで,感情の微妙な変化を学習する。
    • 画像と音声特徴をそれぞれCLIPとAudio Spectrogram Transformerで抽出し,Gated Recurrent Unitsと階層的な融合スキームで統合する。
    • Aff-Wild2データセット上での実験により,本手法がベースラインを上回り,実環境データに対する頑健性を示すことが確認された。

    Link: https://arxiv.org/abs/2603.13415

  • ビデオ推論の解明 [cs.CV, cs.AI]目的:ビデオモデルにおける推論メカニズムの解明
    • ビデオ生成技術の進展は目覚ましく,その応用範囲は広い。人工知能分野における重要な研究課題である。
    • 既存研究では,ビデオモデルの推論メカニズムが不明確であり,その能力を最大限に引き出すことができていない。
    • ビデオモデルがどのように推論を行うのか,その根本的なメカニズムを明らかにすることを目指す。
    • 拡散過程におけるノイズ除去ステップを通じて,複数の候補解を探索し,徐々に最終的な答えに収束する「ステップの連鎖(CoS)」というメカニズムを発見した。
    • モデルは,一貫した参照を必要とするタスクにおいてワーキングメモリを活用し,また,誤った中間解からの復旧や改善を行う自己修正機能を有している。
    • Diffusion Transformer層の中間層が主要な推論処理を実行すること,および異なるランダムシードで生成された潜在軌跡を組み合わせることで推論能力を向上させられることを示した。

    Link: https://arxiv.org/abs/2603.16870

  • 物理特性に基づく展開を用いたリモートセンシング変化検出の進歩:PhyUnfold-Net [cs.CV]目的:リモートセンシングにおける変化検出の精度向上
    • 環境モニタリングや災害評価において,変化検出は重要な役割を担う。
    • 照明,季節,大気等の取得条件の違いが変化検出の誤検出を引き起こしやすい。
    • 物理的な特徴に基づき,誤検出を抑制し,変化検出の信頼性を高める。
    • 提案手法PhyUnfold-Netは,特徴量差分空間におけるパッチごとの特異値エントロピーの差異に着目した。
    • 反復的な変化分解モジュール(ICDM)により,混合された差異特徴を変化成分とノイズ成分に分離する。
    • 4つのベンチマークデータセットにおいて,最先端手法と比較して性能が向上した。

    Link: https://arxiv.org/abs/2603.19566

  • I3DM:一貫性のある動画シーン生成のための暗黙的3D認識メモリ検索と注入 [cs.CV]目的:一貫性のある動画シーン生成のためのメモリ検索と注入メカニズム
    • 動画生成技術は進歩しているが,長期間にわたるシーンの一貫性維持が課題である。
    • 既存手法は,3D形状の誤差蓄積や視野角検索の遮蔽問題に直面している。
    • 複雑な遮蔽下でもロバストな検索と,正確なカメラ制御を実現する。
    • 提案手法I3DMは,明示的な3D再構成を回避し,暗黙的な3D認識メモリメカニズムを用いる。
    • 事前学習済みのFF-NVSモデルの中間特徴を活用して,遮蔽された状況下でも頑健な検索を可能にする。
    • 過去のフレームを3D空間に整列させ,信頼性の高い領域で生成を条件付けることで,一貫性とカメラ制御の精度を向上させる。

    Link: https://arxiv.org/abs/2603.23413

  • 構造を維持する漫画画像編集のための推論時軌道最適化 [cs.CV]目的:構造を維持した漫画画像編集のための推論時軌道最適化手法
    • 漫画画像編集は,創造的な表現を可能にする重要な技術である。そのため,高品質な編集手法が求められている。
    • 既存の画像編集モデルは自然画像で学習されているため,漫画画像への適用において性能が十分でない場合がある。
    • 入力画像のみを用いて,事前学習済みモデルを漫画画像に適合させ,構造を維持した編集を可能にすることを目的とする。
    • 提案手法は,入力画像のみを用いて軌道を補正することで,事前学習済みモデルの漫画画像編集性能を向上させる。
    • 特に,メインテキスト除去タスクにおいて性能が向上し,スクリーントーン合成においても構図の維持が改善されることが示された。
    • FLUX.1 KontextおよびQwen Image Edit 2509を用いた実験では,実行時間およびメモリ使用量のオーバーヘッドがわずかである。

    Link: https://arxiv.org/abs/2603.27790

  • TRACE:触覚的な再構成と幾何学的に整合したコンテキストビデオマスキングによる高精度3Dシーン編集 [cs.CV]目的:3Dシーンの編集手法
    • 3Dコンテンツ作成において,高品質なシーン編集技術の確立が重要である。
    • 既存手法では,柔軟な幾何学編集と構造的整合性・シーン一貫性の維持が困難である。
    • 幾何学的形状と外観の一貫性を保ちつつ,柔軟な3Dシーン編集を実現すること。
    • TRACEは,明示的な3D幾何学をガウスシーンに自動的に整合させ,幾何学的固定と外観調和を分離することで,既存手法の多様性と品質を向上させる。
    • 提案手法は,マルチビュー3Dアンカー合成と触覚的な幾何学的アライメントにより,シーンに一貫性のあるオブジェクトの追加・変更を可能にする。
    • コンテキストビデオマスキングにより,3Dアンカーをビデオ拡散パイプラインに統合し,周囲のシーンとの調和と多視点の一貫性を保つ。

    Link: https://arxiv.org/abs/2604.01207

  • アクションパーティ:生成ビデオゲームにおける複数主体のアクション結合 [cs.CV, cs.AI, cs.LG]目的:生成ビデオゲームのための複数主体のアクション制御モデル
    • インタラクティブな環境シミュレーションの可能性を秘めており,ゲーム開発やロボティクスなど,幅広い分野への応用が期待されている。
    • 既存のビデオ拡散モデルは単一エージェントに限定され,シーン内の複数エージェントを同時に制御することが困難である。
    • 特定の行動を対応する主体に結びつけるという,ビデオ拡散モデルにおけるアクション結合の根本的な問題を解決することを目指す。
    • ActionPartyは,各主体の状態を永続的に捉える状態トークンを導入し,複数主体のアクション制御を可能にした。
    • Melting Potベンチマークにおいて,最大7人のプレイヤーを46種類の多様な環境で同時に制御できることを示した。
    • アクション追従の正確性とIDの一貫性が大幅に向上し,複雑な相互作用を通じて主体の追跡も実現した。

    Link: https://arxiv.org/abs/2604.02330

  • 低リソースインド言語における音声における有害コンテンツ検出のための少数の対照的適応 [cs.SD, cs.CL]目的:低リソースインド言語における音声の有害コンテンツ検出
    • 音声による有害な言動が増加しており,その検出は重要な課題となっている。
    • 音声認識技術が未発達な言語では,文字起こしに依存した検出は困難である。
    • 音声そのものから有害コンテンツを直接検出する手法を確立すること。
    • CLAPモデルの既存の音声表現を用いた軽量な分類器は,フル教師ありシステムに匹敵する性能を示した。
    • 少数のラベル付きサンプルを用いた適応は,言語間で予測不能な結果となり,大きな改善は見られなかった。
    • CLAPベースの音声表現は,言語を横断した有害コンテンツ検出のための強力かつ低コストな基盤を提供する。

    Link: https://arxiv.org/abs/2604.09094

  • 衛星画像に基づく洪水マッピングにおけるGeoAIの説明とドメイン知識の整合性評価 [eess.SY, cs.SY, cs.RO, cs.MM, cs.CV, cs.AI]目的:衛星画像を用いた洪水マッピングにおけるGeoAIモデルの説明とドメイン知識の整合性評価
    • 地球観測技術の発展により,衛星データを用いた洪水マッピングは重要な洪水監視手法となっている。
    • 深層学習モデルの意思決定過程が不透明であり,科学的・実運用ワークフローへの組み込みの障壁となっている。
    • 深層学習モデルの説明が,リモートセンシングの確立された知識と整合しているかを評価する枠組みを構築する。
    • 提案するADAGEフレームワークは,モデルの説明とドメイン知識由来の説明の整合性を定量的に評価できる。
    • ADAGEフレームワークは,整合性スコアを通じて,専門家が誤った説明を特定するのに役立つ。
    • 本研究は,地球観測におけるGeoAIの説明可能性とドメイン知識の間のギャップを埋め,実用性を高める。

    Link: https://arxiv.org/abs/2604.26051

  • FieryGS:物理統合型ガウススプラッティングによる現実世界の火災合成 [cs.GR, cs.CV]目的:現実世界の3Dシーンにおけるフォトリアリスティックで物理的に妥当な燃焼効果の合成
    • 現実世界のシーンにリアルな火炎を合成する技術は,映像制作やシミュレーションなど幅広い分野で重要である。
    • 従来の火炎合成手法は,手作業による調整や専門知識を必要とし,現実世界の複雑なシーンへの適用が困難であった。
    • 3Dガウススプラッティングの物理的根拠を補完し,現実世界のシーンにおけるリアルで制御可能な火災合成を可能にすること。
    • FieryGSは,大規模言語モデルによる物理的材料推論,効率的な体積燃焼シミュレーション,統合レンダリングを組み合わせることで,火炎合成の自動化と高品質化を実現した。
    • 本手法は,火炎の伝播,煙の拡散,表面の炭化など,複雑な燃焼現象を精密に制御可能であり,従来の比較手法を上回る視覚的リアリズムと物理的整合性を示した。
    • FieryGSは,シーンのジオメトリや材質との整合性を保ちつつ,リアルで制御可能な火災ダイナミクスを生成し,手動調整の必要性を低減する。

    Link: https://arxiv.org/abs/2605.00177

  • 画像生成モデルを活用したデータ不足への対処:森林再生マッピングのためのGen4Regenデータセット [cs.CV, cs.AI, cs.LG, cs.RO]目的:森林再生マッピングのためのデータセットと,画像生成モデルを用いたデータ拡張手法
    • 持続可能な森林管理には正確な樹種構成マッピングが不可欠であり,効率的な手法が求められている。
    • 高精度な深層学習モデルの適用は,専門家によるアノテーションデータの不足によって制約されている。
    • AI生成データの活用により,アノテーション不足を補い,高性能な森林再生マッピングを実現する。
    • 大規模ビジョンモデルによる画像生成が,専門家によるアノテーションが少ない分野における知覚タスクを効果的に支援する。
    • AI生成データと実データとを組み合わせることで,F1スコアが15%以上向上し,特に少数クラスの性能が大幅に改善された。
    • Gen4RegenデータセットとWilDReF-Q-V2データセットを公開し,森林再生マッピング研究の促進に貢献する。

    Link: https://arxiv.org/abs/2605.05627

  • スパイクニューラルネットワークを用いたAI生成動画の検出 [cs.CV, cs.AI]目的:AI生成動画の検出手法の開発
    • AI技術の発展により,精巧な偽動画が容易に作成可能となり,社会への悪影響が懸念される。
    • 既存の検出手法は,生成モデルの種類が異なると性能が著しく低下する。
    • フレーム間の時間的な滑らかさの差異に着目し,汎化性能の高い検出手法を確立する。
    • AI生成動画は,ピクセルレベルでのフレーム間残差がより滑らかであり,意味特徴空間における軌跡がよりコンパクトである。
    • スパイクニューラルネットワーク(SNN)は,動画のオブジェクトや動きの境界で活動が活発化し,時間的なアーティファクトに反応することが示された。
    • MASTと呼ばれる手法を提案し,GenVideoベンチマークにおいて,10個の未知の生成モデルに対し93.14%の平均精度を達成した。

    Link: https://arxiv.org/abs/2605.05895

  • 継続的コンプライアンス監視下における戦略的監査対象者ゲームのベンチマーク [cs.CY, cs.GT, cs.LG]目的:継続的コンプライアンス監視下における戦略的監査対象者ゲームの評価
    • AI規制の強化に伴い,コンプライアンス監査の重要性が増している。
    • 従来の入力/出力ゲームとは異なり,時間経過に伴う戦略的行動が問題となっている。
    • 監査対象者が時間経過と共に変化する状況下で,監査の有効性を高めることを目指す。
    • 継続的監査は,監査対象者と監査者の間のStackelbergゲームとして定式化された。
    • 静的監査設計には,カバレッジギャップと粒度ギャップを同時に解消できないという構造的な特徴が存在する。
    • サンプルサイズを考慮したルールや履歴に基づいた疑念のエスカレーションにより,カバレッジギャップと粒度ギャップをそれぞれ解消できることが示された。

    Link: https://arxiv.org/abs/2605.06340

  • 偽名耐性データ帰属のための商剰セミバリュー [cs.GT, cs.CR, cs.LG]目的:機械学習パイプラインにおけるデータの貢献度評価と支払い分配
    • データへの貢献度を正確に評価し,公正な報酬分配を行うことは,機械学習の発展に不可欠である。
    • データ提供者が偽名を使用したり,データを複製することで,貢献度評価を不正に操作する可能性がある。
    • 偽名操作を抑制し,より公平なデータ帰属を実現するためのメカニズムを提案すること。
    • 商剰セミバリューメカニズムは,個々のデータではなく,証拠に基づいた帰属クラスタに基づいて値を計算することで,偽名操作の影響を軽減する。
    • 固定された単調データ価値ゲームにおいて,正確なShapley公平帰属と偽名耐性は両立しないことが証明された。
    • DataMarket-Gymを用いた実験により,商剰セミバリューは,重複データやニアダブレットによるSybil攻撃に対する操作利益を大幅に削減することが示された。

    Link: https://arxiv.org/abs/2605.07663

  • 戦略的応答下における差分プライバシーを用いた監査 [cs.GT, cs.CR, cs.LG]目的:AIシステムの監査における,戦略的な開発者への対応を考慮したプライバシー保護
    • AIの社会実装が進む中で,データプライバシー保護とシステム透明性の確保が重要である。
    • 従来の監査手法では,開発者が監査を回避する戦略を取る可能性があり,真の潜在的リスクが見過ごされる。
    • 開発者の戦略的応答を考慮した監査設計により,より効果的なリスク評価とプライバシー保護を目指す。
    • 監査者がプライバシー制約下でクエリポリシーとDP予算を決定し,開発者がそれに応じて対策を再配分する状況をStackelbergゲームとして定式化。
    • 単純なDP監査では,検出可能性が不均一な場合,naiveな予算配分が最適な配分よりも大きな未検出の潜在的リスクを生むことを示した。
    • 最適な監査者による予算配分は,福祉重み,監査ミス確率,検出可能性弾性,および対策コストの曲率の4つの要素のバランスである。

    Link: https://arxiv.org/abs/2605.07674

  • P-Flow:線形逆問題に対するプロキシ勾配フロー [cs.LG, cs.CV]目的:線形逆問題に対するプロキシ勾配フローの提案
    • 逆問題は,画像復元など多様な分野で重要であり,その解決は応用範囲が広い。
    • 従来のフローマッチングは,微分計算の不安定性や計算コストが高いという課題があった。
    • プロキシ勾配を用いることで,計算の安定性を高め,効率的な再構成を目指す。
    • P-Flowは,プロキシ勾配を用いることで,長鎖微分に伴う数値的不安定性とメモリ消費を抑制することに成功した。
    • ガウス球体投影を用いることで,事前分布との整合性を確保し,高次元空間における集中現象を利用している。
    • 様々な復元タスクにおいて,P-Flowは,特に極端な劣化条件下で優れた性能を発揮することが示された。

    Link: https://arxiv.org/abs/2605.08328

  • CREST:効率的な長尺動画理解のための曲率制御イベント中心サンプリング [cs.CV]目的:長尺動画の効率的な理解のためのフレーム選択手法
    • 動画理解は,多様な応用において重要であり,特に長尺動画の処理には高い計算コストが伴う。
    • 長尺動画から情報豊かなフレームを選択することは困難であり,既存手法は効率性かモデル精度かのトレードオフを迫られる。
    • クエリとフレームの関連性の時間的な幾何学構造を利用し,効率的かつ高精度なフレーム選択を実現する。
    • 提案手法CRESTは,既存の軽量なベースラインAKSよりも高い精度をLongVideoBenchとVideoMMEで達成した。
    • CRESTは,より強力なマルチステージ検索パイプラインMIRAの精度をほぼ維持しつつ,前処理コストを大幅に削減した。
    • 診断ベンチマークTempRelにおいて,CRESTはAKSに対して6.88%の相対的な改善を示し,フレーム条件付きの説明の整合性も向上した。

    Link: https://arxiv.org/abs/2605.09223

  • 視覚言語行動モデルの動的実行コミットメント [cs.CV]目的:視覚言語行動モデルにおける動的実行コミットメントの適応メカニズム
    • ロボット工学や人工知能において,視覚情報と自然言語を理解し,それに基づいた行動を計画・実行する能力は重要である。
    • 従来の行動予測は固定長の実行範囲に依存しており,環境の変化や予測の信頼性に応じて柔軟に対応できないという課題がある。
    • 予測の信頼性を考慮した動的な実行範囲の決定により,ロボットの行動の頑健性と効率性を両立させることを目指す。
    • 提案手法A3は,行動予測の合意度を評価し,その結果に基づいて検証対象の行動を選択することで,動的な実行コミットメントを実現する。
    • A3は,合意度に基づいた条件不変性と,物理的な実行整合性を保証するプレフィックス閉鎖性という2つの制約を設けることで,検証可能な最長プレフィックスを特定する。
    • 実験結果から,A3は手動による実行範囲の調整の必要性をなくし,実行の信頼性と推論のスループットのバランスを向上させることが示された。

    Link: https://arxiv.org/abs/2605.11567