arXiv雑要約

画像・音声 - 2026/08/03 公開

  • DoubleHelix:LLMを用いた音声視覚音声認識のための構造化されたクロスモーダル融合 [cs.SD, cs.AI]目的:音声と視覚のモダリティの有効な融合
    • 近年,音声と視覚情報を組み合わせることで,よりロバストな音声認識が期待されている。
    • 既存の手法では,クロスモーダル相互作用が単一ステップで処理され,反復的な改良が不足している。
    • 構造化された反復的なクロスモーダル相互作用による性能向上を目指す。
    • DoubleHelixは,LRS3データセットにおいて,クリーンな音声で0.68%のWERを達成した。
    • これは,同じバックボーン設定下で,これまでの最高結果を5.6%相対的に上回る。
    • 評価されたバブルノイズ条件下では,SNR -5dBで11.6%のWERを達成し,ロバスト性が向上した。

    Link: https://arxiv.org/abs/2607.29112

  • 凍結されたピクセル空間拡散モデルは,自身のサンプルによって自己誘導可能である [cs.CV]目的:ピクセル空間拡散モデルによる画像生成の質の向上
    • 画像生成分野において,高品質な画像を効率的に生成することが重要視されている。
    • ピクセル空間での拡散モデルは,高次元空間での全体構造と局所的なテクスチャの学習が困難である。
    • 事前学習済みの拡散モデルを活用し,低コストで生成品質を向上させることを目指す。
    • 凍結された事前学習済みのピクセル拡散モデルの中間層出力を利用し,粗い構造を捉えることで自己誘導を行う。
    • モデル自身が生成したサンプルを用いて中間層の予測ヘッドを学習することで,高周波成分の学習不足を改善する。
    • Synthetic Self-Guidance (SSG)により,ImageNet上の複数のピクセル拡散モデルにおいてFIDを50%以上削減し,計算コストも大幅に削減する。

    Link: https://arxiv.org/abs/2607.29122

  • SciFigPlag-Bench:科学図版の出所を考慮した盗用検出のためのベンチマーク [cs.CV, cs.LG]目的:科学図版の盗用検出に関する評価基準
    • 科学的発見の視覚的証拠となる図版の重要性が増している。
    • 図版の盗用は,評価基準として確立された多Modalな問題として未だ十分に調査されていない。
    • 特定の出所図版からの証拠の再利用,変換方法,再利用箇所の特定を可能にする。
    • SciFigPlag-Benchは,2582組の正例と2541組の負例を含むハイブリッドベンチマークである。
    • このベンチマークは,ペア検出,出所帰属,階層的な再利用タイプ分類,再利用対応局所化の4つの診断タスクをサポートする。
    • 多様なVision-Languageモデルを用いた実験により,初期ベースラインが確立され,詳細な出所推論,再利用タイプ理解,空間的証拠の接地における課題が明らかになった。

    Link: https://arxiv.org/abs/2607.29124

  • 腹腔鏡下手術における深層学習を用いた術中ガーゼセグメンテーションの第一例 [cs.CV]目的:腹腔鏡下手術における術中ガーゼのセグメンテーション
    • 手術中の出血制御や体液吸収に不可欠なガーゼは,術後遺残により重篤な合併症を引き起こす可能性がある。
    • 実際の術中データを用いたガーゼセグメンテーションの研究は,アノテーション付きデータセットの不足により進んでいない。
    • 本研究は,現実的な臨床環境下でのガーゼセグメンテーションを深層学習で実現し,データ不足を克服することを目指す。
    • 深層学習モデルを用いた術中ガーゼセグメンテーションの有効性を実証し,血腫とガーゼ検出のトレードオフという課題を克服した。
    • 不完全なアノテーションや自動追跡によるセグメンテーションマスクの活用が,汎用的な手術環境下での性能向上に寄与することが示された。
    • 本研究は,ロボット支援手術やその他下流アプリケーションにおける患者安全性の向上と術後成績の改善に貢献する可能性がある。

    Link: https://arxiv.org/abs/2607.29132

  • スケジュール化されたインペインティングによるインタラクティブな生成モーション編集 [cs.GR]目的:インタラクティブな生成モーション編集手法
    • VFXやゲーム開発において,既存モーションの修正・拡張は不可欠であり,制作効率に直結する。
    • 大規模生成モデルはモーション生成に優れるが,既存モーションのインタラクティブな編集には対応できていない。
    • 既存モーションを保持しつつ,生成モデルを活用して自然な形でモーションをインタラクティブに編集すること。
    • スケジュール化されたインペインティングにより,モーションの合成と編集を統合する新しいパラダイムを実現した。
    • 本手法は,元のモーションの保持と新しいコンテンツの生成のバランスを,時空間的に細かく制御することを可能にする。
    • 既存アニメーションの洗練,モーションクリップの拡張,組み合わせなどの編集用途に柔軟に対応できることが示された。

    Link: https://arxiv.org/abs/2607.29133

  • 効率的な3D大規模言語モデルのための自己教師あり点群エンコーダの有効性 [cs.CV]目的:3D大規模言語モデルにおける点群エンコーダの効率的な活用
    • 3D理解は,ロボティクスやコンピュータビジョンなど幅広い分野で重要性を増している。
    • 既存の3D-LLMは,計算コストの高いマルチモーダルエンコーダに依存しており,研究・開発の障壁となっている。
    • 低コストな自己教師あり点群エンコーダが,効果的な代替手段となるかを検証する。
    • MiniGPT-3Dを用いて実験を行った結果,ランダム初期化されたエンコーダでも高い精度が得られることが示された。
    • PCP-MAEとMaskTransformerの組み合わせが,自己教師あり学習において最高の精度(59.00%)を達成した。
    • 幾何学的エンコーダは,ModelNet40のような閉じたデータセットでの分類性能が課題であることが確認された。

    Link: https://arxiv.org/abs/2607.29136

  • 見覚えはあるか?行動シグナル埋め込みを用いた合成顔データセットのメンバーシップ推論 [eess.SY, cs.SY, cs.CV, cs.AI, cs.LG]目的:合成顔データセットにおけるデータセットレベルのメンバーシップ推論
    • 生体認証技術の発展に伴い,プライバシー保護とデータアクセス制限が重要となる。
    • 合成データは実データで生成されるため,元のデータ情報が漏洩するリスクが存在する。
    • 合成データのプライバシーリスクを評価し,情報漏洩対策の強化を目指す。
    • 顔認識モデルと合成データセットを用いた実験で,合成データセットの特定に100%成功した。
    • ジェネレーターの元データセットの特定率は54.5%であり,実データ由来の痕跡が残存することが示された。
    • 合成データはプライバシー保護のために,より強力な情報漏洩対策が必要であることが示唆される。

    Link: https://arxiv.org/abs/2607.29144

  • AI生成画像偽造の局所化のための漸進的意思決定 [cs.CV]目的:AI生成画像偽造の局所化手法
    • AI技術の進展により,画像偽造が高度化し,検出が困難になっているため,その対策が急務である。
    • 既存の局所化モデルは,全ての偽造パターンを学習しきれておらず,特にAI生成画像への対応が課題となっている。
    • 曖昧な証拠から信頼性の高い意思決定を行い,偽造領域を正確に特定することを目指す。
    • 本研究では,最終的な偽造局所化を適応的な逐次意思決定プロセスとして再定義した。
    • 軽量な意思決定エビデンスプロジェクターと,不確実性・境界を考慮したEG-Mambaを導入し,局所化状態を段階的に更新する。
    • 従来の操作データのみで学習しても,未知のAI生成偽造において大きな改善が見られ,漸進的意思決定の有効性が示された。

    Link: https://arxiv.org/abs/2607.29156

  • MoRAE:テキストからモーション生成のための流れに優しい自己教師あり潜在表現 [cs.CV, cs.AI]目的:テキストからモーション生成における潜在表現の構築
    • モーション生成は,人間らしい自然な動きの実現に不可欠であり,様々な応用分野で重要性が増している。
    • 既存手法では,潜在空間の設計が難しく,生成されるモーションの品質や安定性に課題があった。
    • 本研究は,モーション特有の問題に対処し,安定かつ高品質なモーション生成を可能にする潜在表現を構築することを目指す。
    • 提案手法MoRAEは,既存のMotion-JEPAの潜在空間の不安定性を改善し,より安定したモーション生成を実現した。
    • MoRAEは,潜在表現の設計とモーション結合学習により,デコーダーに敏感な方向への誤差増幅を抑制した。
    • その結果,MoRAEは最先端の性能を達成し,非自己回帰的Flow-Matching DiTと組み合わせることで,優れたモーション生成を実現した。

    Link: https://arxiv.org/abs/2607.29180

  • SERUM:ユーザーモデリングのための状態抽出と洗練 [cs.LG, cs.AI, cs.CV]目的:ユーザーの意図とワークフローの構造化モデル
    • プロアクティブな対話型アシスタント実現には,ユーザー理解が不可欠である。
    • 生のスクリーンアクティビティからモデル構築は未解決の課題である。
    • 非構造化動画から解釈可能なプロセスモデルを自動生成すること。
    • 反復的なラベル洗練により,安定した状態語彙(概略的均衡)に収束することが確認された。
    • 正規化されたマルコフモデルは,頻度ベースラインと比較して,低いパープレキシティと高い行動予測を達成した。
    • 最終パスのラベルは,最初のパスのラベルよりも正確で,意味的に改善されていると評価された。

    Link: https://arxiv.org/abs/2607.29181

  • 少数ショットリモートセンシングシーン分類のための局所一貫性のある推移的情報最大化 [cs.SC, cs.CV]目的:少数ショットリモートセンシングシーン分類における性能向上
    • リモートセンシング技術は,地球規模の環境変化の監視や災害対策において不可欠である。
    • 十分な学習データが得られない場面が多く,少数ショット学習が課題となっている。
    • 推移的学習と局所一貫性を組み合わせることで,少数ショット時の分類精度向上を目指す。
    • 提案手法LC-TIMは,既存のTIM++に局所一貫性正則化項を追加し,計算コストを抑えつつ性能を向上させている。
    • 複数のリモートセンシング基礎モデルからの情報を統合するマルチソース拡張により,さらに分類精度が向上する。
    • 実験結果から,推移的学習がゼロショットベースラインを上回り,特に少数ショット環境においてLC-TIMが最先端の性能を示すことが示された。

    Link: https://arxiv.org/abs/2607.29192

  • 超大規模言語モデルによる汎用的な超音波画像セグメンテーション [cs.CV]目的:超音波画像の汎用的なセグメンテーション
    • 超音波検査は普及が進んでおり,画像セグメンテーションの重要性が増している。
    • 従来の超音波画像セグメンテーションは,特定のタスクに限定されるか,専門家の指示が必要だった。
    • テキストによる指示で柔軟なセグメンテーションを実現し,臨床現場での利便性を向上させる。
    • 本研究では,超音波画像に特化した画像・マスク・概念の組を用いてSAM3を適応させたUltraSAM3を提案する。
    • UltraSAM3は,37の公開データセットと13の解剖学的カテゴリーを含む大規模な超音波セグメンテーションコーパスで学習されており,多岐にわたる臓器や病変において優れた性能を示す。
    • さらに,複雑な自然言語クエリを簡潔な超音波概念プロンプトに変換する指示駆動型エージェントを導入し,セグメンテーションの堅牢性を向上させた。

    Link: https://arxiv.org/abs/2607.29200

  • ドメイン分割に基づく漸進的学習によるソースフリードメイン適応 [cs.CV]目的:ソースフリードメイン適応における性能向上
    • プライバシー保護の重要性が増す中,データ共有の制限を回避する手法が求められている
    • 従来の自己学習法は信頼性の高い予測を持つサンプルに偏りがちで,他のサンプルの活用が不十分である
    • データ内の難易度に応じた分割と段階的な学習により,適応能力の向上を目指す
    • 提案手法DPLは,ターゲットドメインを容易に,そして困難に適応可能なサブドメインに分割する。
    • 不確実性を考慮した自己学習とサブドメイン間のクラスアライメントにより分類精度を向上させる。
    • 容易に順応できるサンプルから一貫性学習を行い,難易度の高いサンプルには局所的な構造情報を活用する。

    Link: https://arxiv.org/abs/2607.29202

  • 二重のセマンティックガイダンスとグローバル・ローカル相互変調を用いたマルチモーダル物体再識別 [cs.RO, cs.SY, eess.SY, cs.CV]目的:マルチモーダル物体再識別における性能向上
    • 多様な情報源を活用し,より高精度な物体識別が求められている。
    • 既存手法は,セマンティック情報の活用やグローバル・ローカル特徴の連携が不十分である。
    • セマンティックガイダンスと特徴変調により,高精度かつロバストな再識別を目指す。
    • 提案手法では,テキスト情報を視覚的特徴に統合し,セマンティック認識を向上させている。
    • マスクとグローバルコンテキストの相互作用により,細粒度の特徴アラインメントを強化している。
    • 局所的なセマンティック情報に基づく特徴集約により,識別能力の高い表現を獲得している。

    Link: https://arxiv.org/abs/2607.29207

  • MLLM時代における顕著オブジェクト検出のルネサンスの時が来たのか? [cs.CV]目的:MLLMの能力を活用した顕著オブジェクト検出における課題と改善策
    • 画像認識分野において,画像中の重要なオブジェクトを特定する技術は不可欠である。
    • 従来の顕著オブジェクト検出は,タスク固有の学習に依存しており,汎用性に課題があった。
    • MLLMの潜在能力を最大限に引き出し,ゼロショット学習による検出性能の向上を目指す。
    • MLLMは局所化において最先端手法を上回る性能を示すものの,セグメンテーションでは劣るというギャップが明らかになった。
    • このギャップは,MLLMとアノテーションにおける前景のカーディナリティ,粒度,範囲の不一致が主な原因であると分析された。
    • 学習を必要としないFOCUSフレームワークを提案し,13のベンチマークで最先端手法を上回る性能を達成した。

    Link: https://arxiv.org/abs/2607.29222

  • CorrelationFlow: LiDARシーンフロー推定のための学習不要幾何学的アプローチ [cs.CV, cs.RO]目的:LiDARシーンフロー推定における新たな幾何学的枠組みの提案
    • 自動運転やロボティクスにおいて,周囲環境の正確な把握は不可欠であり,シーンフロー推定はその重要な要素である。
    • 既存手法は学習に基づくものが多く,疎なデータや高速移動物体などに対する汎化性能が課題となっていた。
    • 学習に依存せず,古典的なコンピュータビジョン技術を用いて,よりロバストなシーンフロー推定を目指す。
    • CorrelationFlowは,接続成分ラベリングと鳥瞰図上の占有画像における相関最大化という,古典的な手法に基づいている。
    • Argoverse 2 2026 Scene Flow Challengeにおいて,教師なし学習手法として2位の成績を収めた。
    • 特に長距離における性能劣化が少なく,学習に基づく手法の限界を克服する可能性を示唆している。

    Link: https://arxiv.org/abs/2607.29237

  • モデルの事前知識と視覚的証拠が衝突する場合:選択的事前知識の調整による常識に基づいた幻覚の軽減 [cs.CV, cs.AI]目的:視覚言語モデルにおける常識に基づいた幻覚の軽減
    • 視覚言語モデルの性能向上には,視覚情報と常識的な知識の統合が不可欠である。
    • 常識的な事前知識が,明確な視覚的証拠よりも優先される場合,誤った推論が生じることがある。
    • 視覚的証拠と矛盾する事前知識の影響を抑制しつつ,常識的な推論能力は維持すること。
    • 提案手法である選択的事前知識の調整(SPC)は,反事実的な画像に対する精度を大幅に向上させる。
    • SPCは,常識的な画像を対象とする際の精度をほぼ維持しながら,この改善を実現している。
    • SPCの有効性は,幻覚のカテゴリーや候補応答の順列など,様々な状況下で確認された。

    Link: https://arxiv.org/abs/2607.29240

  • TAVI-TEC:経カテーテル大動脈弁留置術の手術計画のためのAIベースツール [cs.CV, cs.AI, cs.LG]目的:経カテーテル大動脈弁留置術(TAVI)の前準備における効率化と標準化
    • TAVIは高齢化に伴い増加しており,正確かつ迅速な術前計画が重要である。
    • CT画像からの手動計測には時間と専門知識が必要であり,術者間差が生じやすい。
    • AIを用いてCT画像から必要な計測を自動化し,術前計画の効率化と精度向上を目指す。
    • TAVI-TECは,SAPIEN 3 Ultra(S3U)弁を用いたTAVI患者の術前CTAスキャンを約2~6分で処理可能である。
    • 大動脈弁輪面積(CCC=0.934,ICC=0.935,R^2=0.881)および周囲長(CCC=0.909,ICC=0.909,R^2=0.854)は,医師による計測と高い一致性を示した。
    • 弁サイズ予測モデルは全体で82%の精度を達成し,誤分類の多くは隣接するサイズ間での発生であった。

    Link: https://arxiv.org/abs/2607.29243

  • OsteoCAD:骨腫瘍セグメンテーションのための人間協調型クラウド・エッジフレームワーク [cs.CV, cs.AI]目的:骨腫瘍セグメンテーションのためのクラウド・エッジフレームワーク
    • 医療画像解析はAI/深層学習により進展しているが,導入には計算資源や専門知識が課題である。
    • 多くの医療機関では,計算資源や専門知識の不足がAI/深層学習の導入を阻害している。
    • 高度な技術知識や複雑な設定なしに,深層学習を活用したeHealthソリューションを実現すること。
    • OsteoCADは,データセット作成からモデル推論までの一連の深層学習機能を統合した,ユーザーフレンドリーなeHealthフレームワークである。
    • 本フレームワークは,リモートGPUインフラストラクチャへの安全な接続により,ローカル環境のハードウェア制約を克服する。
    • メキシコにおける骨腫瘍セグメンテーションの実証実験により,OsteoCADの有効性が示された。

    Link: https://arxiv.org/abs/2607.29266

  • 訓練不要なアドベクションによるリモートセンシング画像のエンティティレベル少数ショットセグメンテーション [cs.RO, cs.DM, math.CO, cs.IR, cs.CL, cs.CY, cs.HC, cs.CV]目的:リモートセンシング画像の少数ショットセグメンテーション手法
    • リモートセンシング技術は,地球観測や環境モニタリングにおいて不可欠であり,高精度な画像解析が求められる。
    • 既存手法は,高コストな学習や,断片的でノイズの多い予測結果という課題を抱えている。
    • 本研究は,追加学習なしにドメインシフトと局所ノイズを軽減し,セグメンテーション精度を向上させることを目指す。
    • 提案手法は,汎用的なSAM3の幾何学的事前知識を活用し,カテゴリに依存しないエンティティプリミティブを生成する。
    • 少数ショット推論をピクセルレベルからエンティティレベルへ変換することで,ドメインシフトの影響を軽減する。
    • アドベクション方程式に基づくセマンティック洗練メカニズムにより,セマンティック連続性を向上させ,局所的なテクスチャノイズを抑制する。

    Link: https://arxiv.org/abs/2607.29278

  • ParaASR:高速かつ長文脈LLMベース音声認識のためのマルチトークン予測 [cs.SD]目的:LLMベース音声認識における高速化と長文脈処理
    • 近年の音声認識は,大規模言語モデルの活用により精度が向上している。
    • 自己回帰デコーディングのコストがデコーダのサイズに依存し,精度と応答速度のトレードオフが生じている。
    • 音声信号の制約を利用し,マルチトークン予測による並列化でこのトレードオフを解消することを目指す。
    • ParaASRは,40億パラメータのLLMデコーダを用いて,1ステップあたり複数のトークンを出力するマルチトークン予測(MTP)を導入した。
    • 提案手法は,音声の決定的な構造により,標準的な自己回帰デコーディングの安全性を保ちつつ,平均5.0/6のトークンを採択することを確認した。
    • 様々なベンチマークで,中国語,英語,長文評価においてそれぞれ2.97%,3.68%,3.70%の平均エラー率を達成し,リアルタイムファクタ(RTF)は0.0053に達した。

    Link: https://arxiv.org/abs/2607.29279

  • 4Dガウススプラッティングにおける観察ギャップの埋積:視点・時間選択と生成的洗練による手法 [cs.CV]目的:4Dガウススプラッティング再構成の改善
    • 動的なシーンをフォトリアリスティックに表現する技術であり,映像制作や仮想現実などへの応用が期待される。
    • 視点情報の不足により,空間・時間的に観察が不十分な領域が生じ,特に大きな動きのあるシーンでアーティファクトが発生しやすい。
    • 観察が不十分な領域を特定し,生成モデルを用いて効果的に補完することで,4Dガウススプラッティングの再構成精度を向上させる。
    • 本手法では,レンダリング感度とモーションを考慮した観察密度に基づき,仮想視点を能動的に選択する。
    • 生成された画像において,信頼性の低い領域を除去し,4Dガウススプラッティングを微調整することで,アーティファクトを低減する。
    • 新しいデータセットを用いた評価により,既存手法と比較して,定性的・定量的に優れた結果が得られた。

    Link: https://arxiv.org/abs/2607.29284

  • BWM:ロボット学習のための低コスト高忠実度ワールドシミュレータ [cs.CY, cs.HC, cs.RO, cs.CV]目的:ロボット学習用ワールドシミュレータの構築
    • ロボットの安全な学習には,現実世界を忠実に再現するシミュレーション環境が不可欠である。
    • 既存の物理シミュレータは,アセット作成や調整にコストがかかり,現実世界との乖離が生じやすい。
    • 現実世界と遜色ないシミュレーションを低コストで実現し,ロボットの学習効率向上を目指す。
    • BWMは,初期環境ガイダンス,動的な視覚的履歴,ロボット行動との時間的整合性を組み合わせた行動条件付きワールドモデルである。
    • WorldArenaベンチマークと実機ロボット実験において,シミュレータの忠実度と実用性が向上していることが示された。
    • BWMは,WorldArena Challengeのトラック1およびトラック2の2つのアプリケーションで全体1位となった。

    Link: https://arxiv.org/abs/2607.29302

  • CALM-AH:ABAW11で較正されたマルチモーダルアンサンブルと,信頼性ゲート付きマルチエキスパート合意による動画レベルの曖昧さと躊躇の認識 [cs.DC, eess.SY, cs.SY, cs.NI, cs.CV]目的:曖昧さと躊躇の動画レベル認識
    • 人間コミュニケーション理解において,言葉以外の非言語的な手がかりは重要である。
    • 曖昧さや躊躇の自動認識は,自然な対話の理解において困難である。
    • マルチモーダルな特徴とエキスパート合意により,認識精度を向上させる。
    • 提案手法CALM-AHは,ABAW11データセットにおいてMacro-F1スコア0.7525を達成した。
    • さらに,信頼性ゲート付きマルチエキスパート合意(RG-MEC)を導入し,Macro-F1スコア0.7771に改善した。
    • RG-MECは,複数エキスパートの一致によって誤認識を抑制し,高い信頼性で補正を行う。

    Link: https://arxiv.org/abs/2607.29310

  • DualDiT:条件付き二重出力拡散TransformerによるOCT画像とセグメンテーションマスクの同時生成 [cs.CV, cs.AI]目的:OCT画像とセグメンテーションマスクの同時生成
    • 医療画像解析において,アノテーション付きデータ不足は深刻な課題であり,特にOCT画像のような専門知識が必要な分野では顕著である。
    • 従来の画像生成モデルはU-Netに基づいたものが多く,Transformerを用いた拡散モデルの可能性は十分に探求されていない。
    • 本研究では,データ不足を補い,高品質なセグメンテーションを可能にするOCT画像とマスクの同時生成を目指す。
    • DualDiTは,FIDおよびsFIDにおいて,DDPMやLDMなどの既存モデルを上回る優れた生成品質を達成した。
    • 専門家評価において,生成画像が実画像と誤認される割合が46%,実画像が生成画像と誤認される割合が42%であった。
    • DualDiTで生成した画像とマスクを追加することで,セグメンテーションテストセットにおけるDice係数とIoUスコアが向上した。

    Link: https://arxiv.org/abs/2607.29337

  • SatEdit:VLM誘導セグメント注釈によるマスク条件画像編集 [cs.CV]目的:衛星画像編集のためのマスク条件フレームワークの構築
    • 衛星画像編集は地理空間分析や都市計画に不可欠であり,高精度な編集技術の需要が高まっている。
    • 高品質な編集データセットの作成にはコストがかかり,大規模な注釈付きデータの入手が課題である。
    • ラベルなし画像から教師信号を生成し,データ効率の良い衛星画像編集を実現することを目指す。
    • SatEditは,セグメンテーションモデルとVision-Language Model(VLM)を活用して,マスクとセマンティックラベルを自動生成する。
    • 生成されたマスクに基づいたインペインティングにより,編集サンプルを生成し,軽量な人間による検証を経て学習データセットを構築する。
    • SatEditは,既存モデルと比較して,マスク領域のセマンティックアラインメントにおいて最高の性能(CLIPスコア0.6322,CLIP delta 0.0726)を示した。

    Link: https://arxiv.org/abs/2607.29367

  • VFAD:変分意味プロンプトと周波数適応表現学習によるゼロショット異常検知 [cs.CV]目的:未見のカテゴリにおける異常の検知と局在化
    • 異常検知は,製造や医療など,様々な分野で重要であり,異常を早期に発見することで,損失を最小限に抑えることができる。
    • 既存手法では,多様な異常の意味や微妙な局所的な変化を捉えることが難しく,汎化性能が課題となっている。
    • 本研究は,意味的ガイダンスと視覚表現学習を強化することで,異常識別と精密な局在化の向上を目指す。
    • 提案手法VFADは,変分意味プロンプト抽出器(VSPE)を用いて,異常に関連する局所的な意味情報を集約し,視覚特徴とテキスト特徴のより正確な整合を実現する。
    • 周波数適応表現集約(FARA)モジュールを開発し,ウェーブレット変換に基づく周波数分解と周波数特化型エキスパート集約により,異常識別能力の高い視覚表現を獲得する。
    • 13の産業および医療ベンチマークデータセットを用いた実験により,VFADが既存の最先端ゼロショット異常検知手法を様々な異常シナリオで凌駕することが示された。

    Link: https://arxiv.org/abs/2607.29370

  • 条件付き潜在的輸送による高密度時間的コントラスト合成 [cs.RO, cs.CV, cs.AI]目的:乳がん管理のための造影剤なし,または造影剤低減化イメージングワークフローの実現
    • 乳がん管理において,動的造影強調MRIは不可欠だが,安全性の問題や撮影時間の長さが課題となっている。
    • 既存のコントラスト合成法は,空間的リアリズムと時間的連続性の両立が難しく,臨床的な検証も不足している。
    • 本研究は,患者固有の造影変化を単一の処理で予測する新しいフレームワークを提案することで,上記の問題を解決する。
    • 提案手法は,空間的,知覚的,時間的,分布的な指標において,既存手法および最先端モデルを上回る性能を示した。
    • 合成された造影強調画像は,腫瘍セグメンテーションの精度を22.4%向上させ,境界セグメンテーションエラーを39%以上削減した。
    • 読者調査の結果,70%の症例において,合成画像が実際のDCE-MRIと同等の臨床的判断を可能にすることが示された。

    Link: https://arxiv.org/abs/2607.29394

  • OSEF:クロスビデオシーン手順計画のためのワンステップエビデンス融合 [cs.CV]目的:クロスビデオシーン手順計画におけるエビデンスの取得,局所化,行動シーケンスの予測
    • ロボットによる実世界でのタスク実行には,ビデオからの手順理解が不可欠である。
    • 従来のビデオシーン手順計画は,エビデンス取得の課題を考慮していない。
    • 本研究は,エビデンス取得と計画を同時に行うことで,その問題を解決する。
    • 提案手法OSEFは,クロスビデオシーン手順計画のベンチマークにおいて,既存手法を上回る性能を示した。
    • 特に,同じタスクのビデオを用いた評価において,正確なビデオ選択と計画成功率が大幅に向上した。
    • OSEFのトークン全体適応インターフェースが,性能向上に大きく貢献していることが示された。

    Link: https://arxiv.org/abs/2607.29401

  • 注意ヘッドにおける役割の変化:VLMの幻覚の理解と検出 [cs.CV]目的:VLMにおける幻覚の理解と検出
    • 画像とテキストを組み合わせた生成AIは目覚ましい発展を遂げているが,その信頼性が課題となっている。
    • 既存の研究では特定の幻覚パターンに焦点を当てており,複数のパターンが複雑に絡み合った現実の幻覚に対応できていない。
    • 注意ヘッドレベルでの分析により,幻覚の発生メカニズムを明らかにし,汎用的な検出手法を開発すること。
    • 注意ヘッドの役割変化(Role-Break)が幻覚の重要な指標となることが示された。
    • Role-Breakに基づいた軽量な線形検出器は,VLMのファインチューニングなしで高い検出精度(平均AUROC 93.23%)を達成した。
    • 検出されたトークンに対する介入実験により,識別的な設定で直接的な対応が可能であることが示唆された。

    Link: https://arxiv.org/abs/2607.29412

  • QR構造熱トリガーによる赤外線ビジョン-言語モデルへの標的型意味攻撃 [cs.CV, cs.AI]目的:赤外線ビジョン-言語モデルへの標的型意味操作
    • 赤外線技術は,従来の視覚情報だけでは捉えられない状況下での認識を可能にするため,重要性が高まっている。
    • 赤外線ビジョン-言語モデルは,構造化された熱的摂動に対する脆弱性,およびクロスモーダル意味的整合性の安定性が十分に研究されていない。
    • 本研究は,赤外線ビジョン-言語モデルに対する解釈可能な攻撃表面を特定し,ロバスト性の評価の必要性を強調する。
    • 提案手法QR-STTは,モデルの再学習なしに,赤外線画像のわずかな熱的摂動により,モデルの意味的解釈を標的とする概念へと誘導する。
    • 最適化された摂動は,画像分類だけでなく,画像キャプション生成やVQAタスクにおいても,標的に一貫した意味ドリフトを引き起こす。
    • QR構造パターンが,言語駆動型の赤外線知覚に対する解釈可能な攻撃対象領域として示された。

    Link: https://arxiv.org/abs/2607.29445

  • 暗黙的ニューラル表現分類のための重み空間混合エキスパート [cs.CV]目的:暗黙的ニューラル表現の分類における性能向上と解釈性の向上
    • 近年,座標ベースのニューラルネットワークの重みとして信号を符号化する暗黙的ニューラル表現が注目されている
    • 暗黙的ニューラル表現のパラメータは高次元かつ複雑な構造を持つため,重み空間での直接的な分類は困難である
    • 重み空間における識別情報の分布を理解し,分類性能を向上させることを目指す
    • 提案手法は,標準的なベンチマークにおいて最先端の精度を達成し,低解像度データセットから高解像度ImageNet-1Kまで幅広いデータに対応する
    • 重み空間の属性化およびプルーニング手法を開発し,分類に最も関連性の高いパラメータを特定することで,暗黙的ニューラル表現が識別情報をどのように符号化するかについての洞察を得た
    • 分析の結果,クラス固有の構造が暗黙的ニューラル表現の層内で出現することが明らかになり,MoEアーキテクチャの重み空間学習への適合性が示唆された

    Link: https://arxiv.org/abs/2607.29463

  • アフォーダンスセグメンテーションのための軽量ニューラルネットワーク:デコーダモジュールの強化 [cs.CV, cs.LG, cs.PF]目的:アフォーダンスセグメンテーションにおける汎化性能と計算コストのトレードオフに関する分析
    • ウェアラブルロボットにおける視覚的なアフォーダンスセグメンテーションは,ロボットの自律性を高める上で重要である。
    • 高水準な抽象化能力が必要なアフォーダンスセグメンテーションでは,通常,大規模なモデルが用いられる。
    • ウェアラブルロボットの限られた計算資源において,リアルタイムでの処理を可能にする軽量なモデルを開発する。
    • 提案手法は,既存のベースライン手法と比較して,汎化性能を向上させながら,計算コストを低く抑えることができた。
    • 本研究で得られたモデルは,一般的な実世界のデータセットにおいて優れた性能を示した。
    • ウェアラブルロボットへの実装可能性を示す結果が得られた。

    Link: https://arxiv.org/abs/2607.29473

  • 腹腔鏡手術用臓器セグメンテーションにおけるクラス特化デコーダを用いた転移学習 [cs.CV, cs.LG]目的:腹腔鏡手術画像における複数臓器のセグメンテーション性能向上
    • 手術支援の高度化には,臓器の正確な認識が不可欠であり,その自動化が求められている。
    • 手術データは臓器の大きさや露出度に偏りがあり,少数派クラスのセグメンテーションが困難である。
    • 異なる手術領域間での知識共有により,データ不足や偏りを克服し,セグメンテーション精度を向上させる。
    • クラス特化デコーダを用いることで,各臓器の解剖学的特徴を効果的に学習できることが示された。
    • 異なる手術領域間で事前学習を行うことで,学習の収束が早まり,セグメンテーション性能が向上することが確認された。
    • 転移学習では少数派クラスのセグメンテーション精度向上には限界があり,クラス間の不均衡は依然として課題である。

    Link: https://arxiv.org/abs/2607.29509

  • 双方向グラフドメイン適応と双曲線残差符号化を用いた,rs-fMRIによるクロスサイトMDD識別 [cs.CV, q-bio.NC]目的:クロスサイトrs-fMRIデータからの大うつ病(MDD)識別
    • 精神疾患の客観的診断は重要であり,脳機能の解析は有用な情報を提供する。
    • rs-fMRIデータはサイト間での分布のずれや機能的結合の多様性が課題となる。
    • 複数の機能的結合の視点を統合し,サイト間のずれを軽減し,識別精度を向上させる。
    • 提案手法は,7つのラベルなしターゲットドメインにおいて,平均精度73.60%,AUC 71.90%を達成した。
    • 異質な機能的結合の視点を統合的にモデル化し,双曲線残差符号化を用いた表現の改善が有効であることを示した。
    • 多源ドメイン適応により,異なるサイト間のデータの分布のずれを効果的に軽減できることを実証した。

    Link: https://arxiv.org/abs/2607.29531

  • OSAGEN:物体認識型マスク事前知識と多段階分離拡散による産業異常生成 [cs.CV]目的:産業異常の生成手法
    • 産業界における品質管理において,異常検知と局所化は不可欠であり,不良品の早期発見に繋がる。
    • 実データでの異常事例が不足しており,ピクセルレベルの注釈作成も困難であるため,異常検知の精度向上が課題である。
    • 少ない教師データとマスク情報を用いて,より現実的で局所的な制御が可能な異常画像を生成することを目指す。
    • OSAGENは,物体認識型マスク事前知識と多段階分離拡散を組み合わせることで,異常の実現性と局所制御性を向上させた。
    • QBGにより,正常画像からオブジェクト構造をマスク拡散に注入し,オブジェクトを意識した事前知識を生成する。
    • MVTec ADとVisAのデータセットにおいて,従来のSOTA手法と比較して高いAP/F1スコアを達成した。

    Link: https://arxiv.org/abs/2607.29533

  • K空間署名:医療用ディープフェイク検出のための周波数領域表現学習 [cs.CY, cs.HC, cs.CV]目的:医療用ディープフェイクの検出
    • 医療画像診断の信頼性確保は,患者の安全と医療の質に不可欠である。
    • 生成モデルの悪用により,医療画像に偽造が施され,誤診や不適切な治療を招く恐れがある。
    • 周波数領域に着目し,偽造画像特有の痕跡を検出することで,ディープフェイクを識別する。
    • 提案手法は,医療画像生成時に生じるハードウェアや生成モデルの痕跡をK空間署名として捉える。
    • K空間署名と3D MLP-Mixerアーキテクチャの組み合わせにより,高い検出精度(Accuracy 0.99以上,ROC-AUC 0.99以上)を達成した。
    • 未知のスキャナで取得されたデータに対しても,頑健な汎化性能を示し(Accuracy最大0.93),高い識別能力を維持した。

    Link: https://arxiv.org/abs/2607.29541

  • MoRoute:文脈内マルチモーダル動画生成のための動的ルーティング [eess.SY, cs.SY, cs.CV]目的:マルチモーダル動画生成における動的ルーティング手法
    • 動画生成の多様なタスクに対し,テキスト・画像・動画を組み合わせた柔軟な制御が求められている。
    • 既存手法では,事前学習済みのVLMとDiTの連携が難しく,両者の能力を十分に活用できていない。
    • VLMとDiTを動的ルーティングにより接続し,マルチモーダル理解と動画合成の対応関係を学習する。
    • MoRouteは,VLMとDiTを異なるアーキテクチャを持つ専門家として捉え,動的層ルーティングで接続する。
    • 各DiTブロックは入力に応じてVLMの最適な層を選択し,マルチモーダル理解と動画合成の適応的な対応関係を学習する。
    • IntelligentVBench,OpenVE-Bench,RefVIE-Benchにおいて,既存手法を平均0.15~0.34ポイント上回る性能を示した。

    Link: https://arxiv.org/abs/2607.29545

  • DynoDINO:DINO特徴からの動的な潜在的情報を活用した多相医用画像セグメンテーション [cs.RO, cs.CV]目的:多相医用画像セグメンテーションの精度向上
    • 病変の診断・特性評価において,多相造影CTが重要視されている。
    • 相間の解剖学的ずれや不完全な画像取得により,時間的な情報の途絶が生じやすい。
    • 相間のずれを修正し,時間相関を強化することで,診断精度を高める。
    • DynoDINOは,LiTS,PLC-CECT,WAW-TACEの3つの大規模データセットで,境界の識別と構造の忠実度において一貫して性能を向上させた。
    • スライスレベルのアライメントにより相間対応を確立し,Multi-phase Fusion Modelで時間相関を強化する。
    • Mix-attention機構やAdaptive Gating Mechanismにより,診断上有益なコントラストの変化を保持し,ずれによるアーチファクトを抑制する。

    Link: https://arxiv.org/abs/2607.29568

  • AI画像検出の説明:ヒートマップが実際に示していること [cs.CV]目的:AI画像検出におけるヒートマップの示す内容の解明
    • オンライン市場における偽造画像の問題は深刻であり,その検出技術の信頼性が重要である。
    • 既存のAI画像検出器は,画像生成技術の進化により容易に欺瞞される可能性がある。
    • 本研究は,AI画像検出器の評価方法を改善し,より信頼性の高い検出を実現することを目指す。
    • 画像圧縮履歴が,AIによる単純な評価に大きな影響を与えることが示された。
    • 生成画像を実画像の形式にエンコードすることで,検出性能が大幅に向上することが確認された。
    • ヒートマップの解釈可能性は,検出器の反応に依存しており,決定的な説明は未だ得られていない。

    Link: https://arxiv.org/abs/2607.29581

  • TraceViT:視覚的抽象推論のための根拠に基づいたトレース監視 [cs.CL, cs.CV, cs.AI]目的:視覚的抽象推論におけるトレース監視の有効性
    • AIの汎用的な問題解決能力を測る上で,抽象的な推論能力は不可欠である。
    • 既存の視覚的推論モデルは,最終的な出力のみを学習対象としており,推論過程が最適化されていない。
    • 視覚的推論の各ステップを,明確な根拠と制約のもとで学習させることを目指す。
    • 提案手法TraceViTは,ARC-AGI-1で67.8%のpass@2,ARC-AGI-2で24.3%の精度を達成した。
    • トレース監視は,タスクへの根拠付けと組み合わせることで初めて効果を発揮することが示された。
    • プログラムの実装を検証・分解することで,意味的に単調な変換チェーンを構築した。

    Link: https://arxiv.org/abs/2607.29586

  • 継続学習におけるタスク適応型分布外検出スコアの較正 [cs.CL, cs.CV, cs.LG]目的:継続学習システムの分布外検出性能低下とその緩和策
    • 継続学習は,学習済みタスクの性能維持と新規タスクの学習を両立する重要技術である。
    • 継続学習において,分布外検出能力の低下(分布外忘却)が課題となっている。
    • 本研究は,分布外検出スコアの較正を通じて,継続学習における性能低下を抑制することを目指す。
    • 分布外忘却は,既存タスクの分類性能とは相関が弱いことが示された。
    • エネルギーベースおよび特徴ベースの検出器において,それぞれConfidence GapとManifold Crowdingが性能低下の原因であることが判明した。
    • 提案手法TOODは,リプレイバッファ統計を用いた事後較正により,多くの設定で分布外検出性能を向上させた。

    Link: https://arxiv.org/abs/2607.29592

  • CoDe-SSM:効率的な超高解像度画像復元のための文脈・詳細分離状態空間モデル [eess.SY, cs.SY, cs.CV]目的:超高解像度画像復元における文脈と詳細の分離
    • 超高解像度画像復元は,視覚体験の向上に不可欠であり,その需要は増加の一途を辿っている。
    • 既存手法では,計算コスト削減と細部の鮮明さ維持のバランスが課題となっている。
    • 文脈と詳細を分離することで,効率性と復元品質の両立を目指す。
    • 提案手法CoDe-SSMは,文脈情報を集約するパスと,詳細情報を処理するパスを分離した構造を持つ。
    • グローバルクラスタースキャンモジュール(GCSM)により,領域間の文脈共有と計算コストの分離を実現している。
    • 複数のベンチマーク実験において,CoDe-SSMは既存手法を上回る復元品質と効率性を示すことが確認された。

    Link: https://arxiv.org/abs/2607.29595

  • FibVLA:フィボナッチサンプリングによる効率的な時系列視覚言語行動モデル [cs.RO, cs.CV]目的:視覚言語行動モデルにおける,長期的な時系列情報の効率的な捉え方
    • マルチモーダル情報を活用し,物理世界における行動を推論する技術は,具現化されたAI応用の汎用的な解決策となる。
    • 長期的な時系列情報を符号化すると,推論効率が低下するという問題がある。
    • 時系列情報の捉え方と推論効率の両立を目指し,FibVLAを提案する。
    • FibVLAは,大規模な視覚エンコーダーの再学習なしに,行動のスムーズさと成功率を大幅に向上させる。
    • フィボナッチ再帰的推論戦略により,リアルタイムの閉ループフィードバックに基づいた長距離計画ステップを生成する。
    • 実世界の評価において,ビデオベースのベースラインと比較して,優れたリアルタイム応答性を示す。

    Link: https://arxiv.org/abs/2607.29596

  • FriendBench:人間とマルチモーダル大規模言語モデルにおける対人的な親密度の推論ベンチマーク [cs.CL, cs.AI, cs.CV, cs.HC]目的:対人的な親密度の推論
    • 社会状況の理解は言葉だけでなく行動からも行われるため,その評価法の確立が重要である。
    • 既存の評価方法では,言葉以外の非言語的な要素が十分に考慮されていない場合がある。
    • 対話の様子から親密度を推論するモデルの性能を客観的に評価し,その課題を明らかにすること。
    • FriendBenchベンチマークにおいて,テキスト,音声,動画の各モダリティで26種類のモデルと人間パネルの比較を行った。
    • 最良のモデルは各モダリティにおいて人間の精度と同等であったが,推論の傾向に違いが見られた(モデルは「見知らぬ人」に偏りやすい)。
    • 人間は視覚情報から恩恵を受ける一方,モデルはそれほどではないことが示された。

    Link: https://arxiv.org/abs/2607.29602

  • WCM:視覚・言語・行動強化学習のための世界批判モデル [cs.RO, cs.CL, cs.CV]目的:視覚・言語・行動(VLA)モデルの強化学習後学習における性能向上
    • ロボット制御において,視覚情報と言語指示を統合した行動計画は重要であり,VLAモデルがその鍵となる。
    • 従来の批判モデルは単一フレームの入力に依存し,ロボット制御のような部分観測環境への対応が課題であった。
    • WCMは世界モデルを組み込むことで,時間的構造を捉え,より正確な価値推定を実現する。
    • 提案手法WCMは,軽量なLeJEPAアーキテクチャに基づき,潜在状態と価値を同時に予測する。
    • WCMは,Pi0,Pi0.5,OpenVLA-OFTを含む様々なVLAバックボーンに容易に組み込むことが可能である。
    • 149タスクを含む実験結果から,WCMが分布内・分布外の両環境で最先端の性能を達成することが示された。

    Link: https://arxiv.org/abs/2607.29613

  • 説明可能性-性能係数の人間中心の検証 [cs.LG, cs.AI, cs.CV]目的:説明可能性の質の定量化
    • 高リスク分野での深層学習利用拡大に伴い,信頼性のあるXAIの重要性が増している。
    • 説明忠実度の客観的評価や,XAI指標と人間理解との整合性が課題となっている。
    • 特徴選択の疎性とモデル性能のバランスを考慮したEPCスコアで説明可能性を評価する。
    • EPCスコアは,ネットワーク活性化,データ次元,説明性能間の依存関係を明らかにする。
    • EPCスコアが高いほど,人間の語彙感情判断や空間視覚注釈との整合性が高いことが確認された。
    • 提案手法は,表形式,テキスト,画像といった様々なデータ形式で有効であることが示された。

    Link: https://arxiv.org/abs/2607.29614

  • RayViT:視点ロバストな模倣学習のためのレイ条件付き視覚表現 [cs.RO, cs.CV]目的:視覚情報とロボットの動作の関連性学習
    • ロボットの視覚的技能獲得において,画像からの直接学習は重要である。
    • RGB画像には幾何学的情報が明示的に含まれず,カメラの変動に弱いという課題がある。
    • カメラの幾何学的情報を組み込み,ロバストな視覚表現を学習することを目的とする。
    • RayViTは,既存のViTバックボーンにカメラの幾何学情報を注入する軽量なアーキテクチャである。
    • シミュレーションおよび実機ロボット実験により,カメラの変動に対するロバスト性が向上することが示された。
    • RoboCasaベンチマークでは約13%,実世界タスクでは平均完了ステージ数が1.78向上した。

    Link: https://arxiv.org/abs/2607.29622

  • FlexComposer: 画像から動的な映像への統一的な映像合成,柔軟な軌跡制御を伴う [cs.CV]目的:画像および動的な映像素材を用いた映像合成の統一的フレームワーク
    • 映像制作や視覚効果において,既存の映像に外部アセットをシームレスに組み込む技術は不可欠である。
    • 既存手法は,制御の精度と忠実度の間でトレードオフがあり,動的なアセットのダイナミクスを維持できないか,精密な配置が困難である。
    • 静止画像と動的な映像の両方を扱える,軌跡制御に基づいた統一的な映像合成手法を確立し,高精度な合成を実現する。
    • FlexComposerは,オブジェクトの固有モーションと全体的な変位を分離する統一的な表現を導入し,多様な入力を安定化された潜在空間に標準化する。
    • VAEの潜在空間の変換等変性に着目し,パラメータ不要な機構により,カノニカル特徴をターゲット軌跡に輸送する空間認識型潜在空間注入戦略を採用する。
    • 手続き型シミュレーション,現実世界のシネマティック映像,生成データを組み合わせたハイブリッドデータセットと,Synthetic-to-Realカリキュラムにより,物理的に妥当な照明と影の調和を学習する。

    Link: https://arxiv.org/abs/2607.29627

  • OASIS:3Dガウススプラッティングによる遮蔽を考慮した単一画像からの手アバター再構成 [cs.CV]目的:単一画像からの手アバター再構成
    • 人間と機械のインタラクションにおいて,手は重要な役割を担うため,正確な手のアバター再構成が求められる。
    • 単一画像からの再構成は情報が不足し,特に自己遮蔽や複雑な変形により,高精度な再構成が困難である。
    • 遮蔽を考慮し,効率的かつ詳細な手アバター再構成を実現することで,その課題を解決する。
    • 本研究では,3Dガウススプラッティングを活用したOASISを提案し,単一画像からの手アバター再構成において高い性能を発揮する。
    • 入力画像情報を3D形状に整合させ,遮蔽の影響を考慮した特徴表現により,ロバストな再構成を実現した。
    • 実験の結果,既存手法と比較して,視覚的な品質と効率の両面で優れていることを示した。

    Link: https://arxiv.org/abs/2607.29633