arXiv雑要約

画像・音声 - 2026/08/05 公開

  • SeCo-SBIR:ゼロショットスケッチベース画像検索のための意味的に整合的なプロンプト学習 [cs.CV]目的:ゼロショットスケッチベース画像検索における性能向上
    • 画像検索技術は,大量の画像データから目的の画像を効率的に見つけ出すために不可欠である。
    • スケッチからの画像検索は,スケッチと写真の間のドメインギャップが課題となる。
    • 過学習のリスクを抑えつつ,スケッチと写真のドメインに適応させることが求められる。
    • SeCo-SBIRは,テキスト誘導型のマルチモーダルプロンプト戦略と摂動に基づく整合性制約を導入することで,この課題を解決する。
    • これにより,CLIPの汎化性能を維持しつつ,スケッチと写真のドメインに適応した表現学習を可能にする。
    • その結果,3つの標準的なゼロショットスケッチベース画像検索ベンチマークにおいて,最先端の結果を達成した。

    Link: https://arxiv.org/abs/2608.03120

  • 修正後拡散:ノイズ除去軌道の展開前に概念を分離する [cs.CV, cs.AI]目的:テキストと画像拡散モデルにおける概念の構成生成の忠実度向上
    • 画像生成AIは急速に発展しており,その応用範囲は広がり続けている。しかし,複雑な概念の組み合わせにおいて課題がある。
    • 複数の概念を扱う際,生成された画像で概念が誤って省略されたり,混ざり合ったりする問題が発生する。
    • 初期段階での概念配置の調整により,生成画像の概念構成の正確性を高めることを目指す。
    • 本研究では,学習を必要としないフレームワーク「Rectify-then-Diffuse (RTD)」を提案し,初期概念配置を修正することで構成生成の精度向上を実現した。
    • 提案手法は,概念マップ間のオーバーラップを分離する「Soft-Overlap Disentanglement (SOD)」と,勾配を正規化する「Isotropic Gradient Rectification (IGR)」から構成される。
    • 実験結果から,RTDは最先端の性能を示し,AE-BenchにおいてBLIP-VQAを45.8%,ImageRewardを19.6%改善し,CO3より2.3倍高速に動作することが確認された。

    Link: https://arxiv.org/abs/2608.03135

  • クロスシティ物体検出のための凍結高解像度推論:AI City Challenge 2026 研究 [cs.CV]目的:クロスシティ物体検出における汎化性能向上
    • 都市間のデータ分布の差異に対応した物体検出は,自動運転などの実用化において重要である。
    • 異なる都市で学習・評価を行う際,学習都市に偏ったモデルとなりやすい。
    • パラメータ更新なしに高解像度推論を行うことで,汎化性能を向上させることを目指す。
    • 704x704で学習したモデルを1120x1120で凍結推論した結果,集約APが0.3272から0.3654に向上した。
    • 特に,小さい物体に対する相対的な改善幅,および中規模物体に対する絶対的な改善幅が大きかった。
    • 集約的なクロスシティフィードバック下では,インドメイン検証APの向上は信頼できるモデル選択指標とはならない可能性がある。

    Link: https://arxiv.org/abs/2608.03136

  • 経路から段階へ:視覚と言語によるナビゲーションにおける意味的進捗と局所実行の分離 [cs.CV, cs.RO]目的:視覚と言語によるナビゲーションにおける意味的進捗と局所実行の分離
    • ロボットナビゲーションの分野では,人間が理解できる指示に基づいた自律的な移動が重要である。
    • 既存の手法では,進捗の追跡エラーと実行エラーの区別が難しく,誤った状態からの意思決定が課題となっている。
    • 意味的進捗の追跡と行動生成を分離し,より正確なナビゲーションを実現することを目指す。
    • 提案手法Route2Stepは,段階レベルのインターフェースを通じて意味的進捗と行動生成を分離することで,ナビゲーション性能を向上させた。
    • R2R-CEデータセットにおいて,成功率(SR)を48.1%から55.3%,パス長(SPL)を43.3%から48.2%に改善した。
    • 実世界の屋内・屋外環境における実験でも,Route2Stepの有効性が実証された。

    Link: https://arxiv.org/abs/2608.03143

  • CROSS:遠隔センシング参照セグメンテーションのためのカスケード蒸留と二重制約による接地 [cs.CV]目的:遠隔センシング参照セグメンテーションにおける性能向上
    • 遠隔センシングは広範囲の地理空間情報を取得し,様々な応用分野で不可欠である。
    • 既存手法は事前学習済みモデルに依存しやすく,局所的なずれや空間的推論の欠如が課題である。
    • CROSSは,アーキテクチャ間の連携強化と空間的推論能力の向上を目指す。
    • CROSSは,言語誘導カスケード蒸留により,VLMとSAMの連携を強化し,局所化精度を向上させる。
    • また,空間・視点対照学習を通じて,誤った情報を排除し,論理的な一貫性を強化する。
    • 実験結果から,CROSSは最先端の性能を示し,空間的記述の摂動に対するロバスト性も確認された。

    Link: https://arxiv.org/abs/2608.03147

  • 多物体および関節を持つ人与物体のインタラクション生成のための表面キーポイント表現 [cs.HC, cs.CL, cs.RO, cs.DC, eess.SY, cs.SY, cs.CV]目的:多物体および関節を持つ人与物体のインタラクション生成
    • 日常生活において,人間は周囲の物体との動きと協調する必要がある。
    • 既存のHOI生成手法は,単一の剛体物体とのインタラクションを想定しており,複数の物体や関節を持つ物体には対応できない。
    • 多様な物体数や関節機構を持つインタラクションに対応できる表現と生成手法を開発する。
    • 表面キーポイント軌跡を物体運動表現として提案し,点ダイナミクスから直接多物体協調と多様な関節機構に対応する。
    • 身体部位と物体間の接触をモデル化するため,時空間接触距離場を導入し,全身,多物体,関節設定を拡張した。
    • 実験結果から,提案手法は単一物体,多物体,関節インタラクション設定において既存手法と同等またはそれ以上の性能を示す。

    Link: https://arxiv.org/abs/2608.03158

  • 洞窟に屈するか,納得するか:動画大規模言語モデルにおける時間的サンプリングゲートが服従を示す仕組み [cs.RO, cs.MM, cs.CV]目的:動画大規模言語モデルにおける,イベントの発生順序に関する誤り
    • 動画理解は,AIの応用範囲を広げる上で不可欠であり,その精度向上は重要な課題である。
    • 動画大規模言語モデルは,イベントの発生順序を誤認識することがあり,その原因の特定が難しい。
    • 動画のサンプリング方法と,証拠の重み付けに着目し,モデルの誤認識を改善する。
    • モデルがイベントの情報を捉えられていない場合,真実と虚偽の主張を区別できないことが示された。
    • イベントの情報が捉えられていても,モデルは虚偽の主張に屈することがあり,これは証拠の重み付けに限界があることを示唆する。
    • 提案された reversal test は,順序認識精度を向上させ,モデルが判断できない場合には棄権することで,より信頼性の高い結果を得る。

    Link: https://arxiv.org/abs/2608.03160

  • 拡散スペクトル埋め込みによる堅牢な画像ウォーターマーク [cs.CR, cs.CV]目的:画像ウォーターマークの堅牢性向上
    • デジタルコンテンツの保護が重要であり,改ざん検出や真正性確認にウォーターマーク技術が用いられる。
    • 既存のウォーターマーク技術は,歪みや意図的な除去に対して脆弱であり,検出精度が低下しやすい。
    • 拡散スペクトル埋め込みを用いて,画像全体に情報を拡散し,除去耐性を高めることを目指す。
    • SpreadMarkは,従来のエンコーダー・デコーダー方式と比較して,各ビットが画像全体に拡散されるため,除去が困難である。
    • COCOとDIV2Kデータセットを用いた評価において,再生攻撃や潜在空間スパース化攻撃に対する検出率が高いことが示された。
    • 埋め込まれたウォーターマークは視覚的に認識できず,画像の品質を維持しつつ,高い堅牢性を実現している。

    Link: https://arxiv.org/abs/2608.03165

  • マルチハイパーグラフにおけるEFX配分 [cs.GT, cs.AI]目的:異質な単調価値を持つエージェント間での,分割不可能な資源の公正な配分
    • 公正な資源配分は,社会的な公平性を実現するための重要な研究テーマである。
    • 資源配分における「羨望フリー」性の保証は困難であり,特に単調価値関数を持つエージェントに対しては未解決の問題が多い。
    • ハイパーグラフ構造を利用し,EFX配分の存在可能性と効率的な構築法を明らかにすること。
    • 周長が4以上のハイパーグラフにおいて,一般的な単調価値を持つエージェントに対して常にEFX配分が存在し,多項式時間で構築可能であることを示した。
    • 周長が4以上のマルチハイパーグラフにおいても,特定の条件を満たす頂点が存在する場合,EFX配分が存在し,擬似多項式時間で構築可能であることを示した。

    Link: https://arxiv.org/abs/2608.03171

  • 周波数分散型時間アンサンブルによる脳波・fNIRSを用いた想像筆記の解読 [eess.SY, cs.MS, cs.SY, cs.CV, cs.HC]目的:脳波とfNIRSデータを用いた,個人を跨いだ想像筆記の解読
    • 脳活動の非侵襲的な解析は,脳機能の理解や新たなインターフェース開発に不可欠である。
    • 脳波データはノイズが多く,個人差が大きいため,高精度な解読が困難である。
    • 周波数特性を考慮した時間的アンサンブル学習により,脳波データのロバスト性を向上させる。
    • 提案手法FREDは,複数の周波数帯域の脳波を組み合わせることで,解読精度を向上させている。
    • テストデータに対する適応や制約なしで,公開データセットにおいて0.8076の精度を達成した。
    • fNIRSデータの追加は脳波のみの場合と比較して,精度への影響はわずかであった。

    Link: https://arxiv.org/abs/2608.03176

  • EditFlow3D:軌道維持による3Dアセットの局所編集自動化 [cs.CV]目的:3Dアセットの局所編集手法
    • 3Dコンテンツ制作において,効率的かつ高品質な編集作業が求められている。
    • 既存手法では,正確な3Dマスクの取得が難しく,編集対象領域外の構造・外観維持が課題である。
    • 本研究は,3Dアセットの局所編集を自動化し,高精度な編集と構造維持を実現することを目指す。
    • EditFlow3Dは,VLMを用いて編集意図を解釈し,3D編集マスクと視覚ガイダンス画像を自動生成する。
    • マスク誘導型微分フローにより編集対象領域に焦点を当て,段階的な軌道維持により編集対象領域外の一貫性を保つ。
    • EditFlow-Benchを含む評価により,既存手法よりも正確な編集と構造維持効果が示された。

    Link: https://arxiv.org/abs/2608.03179

  • CRIL-U-Net:T1wおよびFLAIR MRIからの焦点性皮質異形成のセグメンテーションのためのコンパクトな比率相互作用学習 [cs.CV]目的:焦点性皮質異形成のセグメンテーション精度向上
    • 難治性焦点性てんかんの重要な原因である焦点性皮質異形成の正確な診断が求められている。
    • 病変が小さく,MRIでの特徴が曖昧なため,自動セグメンテーションは困難である。
    • T1wとFLAIR MRI間の効率的な相互作用学習により,セグメンテーション精度を高める。
    • CRIL-U-Netは,Dice係数において従来のU-NetやAttention U-Netよりも高い性能を示した。
    • FTF損失関数を用いた場合,CRIL-U-Netは85例中44例で病変の重複を検出した。
    • コンパクトなクロスモーダル表現学習はFCDセグメンテーションを改善するが,さらなる検証が必要である。

    Link: https://arxiv.org/abs/2608.03185

  • 微分可能な物理レンダリングによるオンラインとオフライン筆跡の架け橋 [cs.CV, cs.RO]目的:オンラインとオフライン筆跡の生成手法の統合
    • フォント設計,生体認証,ロボットによる書道など,多様な応用分野で重要な技術である。
    • オンライン手法は構造を捉えるがテクスチャが粗く,オフライン手法は見た目はリアルだが筆順を無視する。
    • 筆跡の運動と画素レベルの外観を結びつける物理モデルと,微分可能なレンダリングが必要とされる。
    • 提案手法は,筆跡の運動と視覚的表現を繋ぐコンパクトな物理ブラシモデルを導入した。
    • テキストとスタイル画像に基づいて筆跡を予測し,ブラシパラメータを抽出し,微分可能なレンダリングを行う。
    • 実験とロボット書道の実演により,構造と視覚的な忠実性が確認された。

    Link: https://arxiv.org/abs/2608.03198

  • DRIFT:フローマッチングVLAのノイズ除去軌道を敵対的パッチ攻撃で逸脱させる [cs.CV, cs.LG]目的:フローマッチングVLAに対する敵対的パッチ攻撃手法の開発
    • ロボットの自律制御において,視覚と言語情報を統合したVLAモデルの重要性が増している。
    • 既存のVLAモデルは攻撃に強いとされていたが,多段階のノイズ除去過程を考慮した攻撃が不足していた。
    • 本研究は,ノイズ除去軌道を攻撃することで,VLAモデルの脆弱性を明らかにし,安全性評価に貢献する。
    • 提案手法DRIFTは,ロボットのグリッパーに配置する単一の普遍的な敵対的パッチを用いて,オフザシェルフのポリシーを攻撃する。
    • 入力空間での最適化における勾配の競合により,最初のノイズ除去ステップのみを攻撃することが,より強力かつ低コストであることが示された。
    • pi0およびpi0.5において,DRIFTはLIBEROの4つのスイートでほぼ全ての解けるタスクを,既存手法よりも大幅に上回る性能で失敗させる。

    Link: https://arxiv.org/abs/2608.03207

  • クロススコープ:ジョイントデュアルスコープ手術ビデオ予測のための役割非対称ワールドモデル [cs.CL, cs.CV, cs.RO]目的:デュアルスコープ手術ビデオ予測における役割非対称ワールドモデルの提案
    • 手術支援AIの発展は,熟練医の技術伝承や手術の質の向上に不可欠である。
    • 複数の視点からの情報統合は困難であり,特に役割の異なるカメラ間の協調が課題である。
    • 役割を考慮した情報伝達により,より正確な手術ビデオ予測を実現することを目指す。
    • CrossScopeは,役割非対称なワールドモデルを通じて,デュアルスコープ手術ビデオの予測精度を向上させた。
    • 母体スコープからの幾何学的運動情報は,子スコープの予測に役立ち,子スコープの視覚情報は,空間的な対応がある場合にのみ母体スコープの予測を支援する。
    • 実験結果から,CrossScopeは既存のベースラインモデルを凌駕し,役割を意識した情報ルーティングの重要性が示された。

    Link: https://arxiv.org/abs/2608.03211

  • iFAN:推論を意識したPlain Mask Transformerの学習 [cs.CV]目的:マスクTransformerにおける推論プロセスの最適化
    • 画像セグメンテーションは,コンピュータビジョンの基盤技術であり,様々な応用分野で重要である。
    • 既存のマスクTransformerは,推論時のクエリ間の競争が学習中に最適化されていないという課題がある。
    • 推論品質と整合性の高いクエリ競争を実現し,より良い中間層の予測を最終層に伝播させる。
    • iFANは,APMRにより,確率マスクスコアと予測マスク品質を整合させることで,精度向上を実現した。
    • CLSDを用いることで,中間層の優れた予測を最終層へ伝達し,性能を改善した。
    • COCO,ADE20K,Cityscapesにおける実験で,一貫した性能向上が確認された。

    Link: https://arxiv.org/abs/2608.03216

  • 3人者オークションブリッジ - 統計的アルゴリズム戦略 [cs.GT]目的:3人者オークションブリッジにおける統計的アルゴリズム戦略
    • オークションブリッジは世界中で認知されたカードゲームであり,その戦略的思考は重要である。
    • 3人者オークションブリッジでは,動的なパートナーと対戦相手が戦略を複雑にしている。
    • 本研究は,動的な状況下での最適な戦略を統計的アルゴリズムを用いて明らかにすることを目指す。
    • 本研究では,様々なシナリオに対する正確なアルゴリズムと,それに対応する勝利戦略を開発した。
    • アルゴリズムに基づいてデータをシミュレーションし,特定のゲームに勝利する確率値を定義した。
    • これにより,ゲームプランニングや計算知能に関わる洞察が得られた。

    Link: https://arxiv.org/abs/2608.03217

  • 自己教師あり表現による生成的データセット蒸留 [cs.CV, cs.AI]目的:データセット蒸留における生成モデルの指針
    • 大規模データセットの効率的な利用が求められているため,データセットの圧縮技術が重要である。
    • 既存手法はランダム初期化ネットワークを対象としており,事前学習済みモデルへの適用が課題である。
    • 事前学習済みモデルの表現空間を考慮したデータセット蒸留手法を開発し,性能向上を目指す。
    • 自己教師あり学習の幾何構造を拡散モデルの指針に変換するフレームワーク(SRG)を提案した。
    • SRGは,クラスごとのプロトタイプを構築し,表現空間におけるプロトタイプのアライメント,クラス間識別,クラス内割り当てを目的とする。
    • 複数のデータセットとIPC設定で,評価された生成ベースラインをSRGが安定的に上回る性能を示した。

    Link: https://arxiv.org/abs/2608.03218

  • クロスサイト解釈可能性を考慮した皮膚科画像診断のためのオープン言語学的概念統合学習 [cs.CV]目的:クロスサイトにおける解釈可能な皮膚科画像診断の実現
    • 臨床判断において,人間が理解可能なコンピュータ支援診断は不可欠である。
    • 既存の概念ベースモデルは,データセット固有の適応に依存し,異なるサイト間での汎化性能が低い。
    • 異種モダリティや異なる臨床分類体系を統一的に扱うことで,費用のかかるラベルエンジニアリングを削減する。
    • UniConは,統一された概念プロトタイプコードブックを用いて,異なるモダリティの概念システムをシームレスに統合する。
    • オープン言語学的アプローチにより,テキストラベルの制約を克服し,不確実な臨床状況における境界感度を向上させる。
    • 信頼性ゲート付きボトルネック集約によって,一貫性のある推論と転移可能な臨床修正を可能にする調整可能な介入インターフェースを提供する。

    Link: https://arxiv.org/abs/2608.03225

  • 臨床情報に基づくトリモーダル生存予測:局所プロトタイプ関連性とグローバル特徴アライメント [cs.CV, cs.CL]目的:トリモーダルデータを用いた生存予測の性能向上
    • 生存予測は,患者の治療方針決定において不可欠であり,正確な予測が求められている。
    • 臨床情報が離散的かつ疎であるため,既存手法では十分に活用されていない。
    • 臨床情報を活用し,異なるモダリティ間の相互作用を効果的にモデル化すること。
    • CIGTSurvは,臨床情報をトリモーダル学習に統合するフレームワークであり,生存予測において最先端の性能を達成した。
    • 臨床情報をアンカーとして,局所プロトタイプ関連性とグローバル特徴アライメントを導入することで,モダリティ間の対応関係と分布の一貫性を強化している。
    • TCGAの5つの癌コホートにおける実験により,CIGTSurvが既存手法を上回る性能を示すことが確認された。

    Link: https://arxiv.org/abs/2608.03247

  • マルチフォーカス画像融合における鮮明度コントラストと類似性選択 [cs.CV]目的:マルチフォーカス画像融合による,全領域が焦点の合った画像の生成
    • 画像認識技術の向上は,監視,医療,自動運転など幅広い分野で不可欠である。
    • 既存手法では,入力画像間の直接的な相互作用が不十分で,性能と解釈性に限界がある。
    • 鮮明度コントラストと類似性選択によって,焦点領域の保持と自然な境界の復元を目指す。
    • 提案手法CSNetは,鮮明度コントラストアテンションモジュールにより,鮮明な特徴を強調し,ぼやけた特徴を抑制する。
    • 類似性選択戦略によって,入力画像から最適なピクセルを選択し,曖昧な領域の精度を向上させる。
    • 定量評価および定性評価の結果,提案手法は最先端の性能を達成した。

    Link: https://arxiv.org/abs/2608.03252

  • 歌唱音声合成におけるメロディーを維持した歌詞編集のための連続潜在自己回帰モデル CLASVS [cs.SD]目的:歌唱音声合成におけるメロディーを維持した歌詞編集手法
    • 歌唱音声合成技術は,音楽制作やエンターテイメント分野において重要な役割を担っている。
    • 既存手法では,歌詞変更時にメロディーや話者固有の音色が崩れやすいという課題があった。
    • 歌詞編集時にメロディー,話者,自然さを維持しつつ,より柔軟な歌詞変更を可能にすること。
    • 提案手法CLASVSは,参照音声とメロディーを維持しつつ歌詞を編集する連続潜在自己回帰モデルである。
    • State-Control-Transition (SCT)ルーティングとProgressive State-Control Grounding (PSCG)学習により,歌詞とメロディーの制御を安定化させている。
    • Mandarin語のベンチマークテストにおいて,既存手法と比較して性能が大幅に向上し,メロディー,話者類似性,知覚品質を維持した。

    Link: https://arxiv.org/abs/2608.03253

  • ナノモーフ-3D:ナノ材料再構成のためのエンドツーエンド物理駆動型展開フレームワーク [cs.CV]目的:ナノ材料の3次元再構成
    • ナノ材料の構造と特性の関係性を解明するためには,正確な3次元形状把握が不可欠である。
    • 電子トモグラフィーは「ミッシングウェッジ」問題により幾何学的歪みが大きく,ノイズの影響も深刻である。
    • 本研究は,ミッシングウェッジによる歪みを軽減し,複雑な3次元構造を正確に再構成することを目指す。
    • 提案手法NanoMorph-3Dは,ナノ材料の形態学的特徴に基づき,物理駆動型アンローリングネットワークを構築した。
    • 階層的アテンション機構と正弦波アテンションにより,長距離3D依存性とスケール不変性を実現し,投影データの整合性を高めた。
    • シミュレーションと実データ間のギャップを埋めるアンスーパーバイズド・デュアルストリーム機構により,多様な形状を高速かつ高精度に再構成できる。

    Link: https://arxiv.org/abs/2608.03257

  • 聞くことで見る:状態を識別する音声視覚インスタンスセグメンテーション [cs.MM, cs.CV, cs.SD]目的:音声視覚インスタンスセグメンテーションにおける,音を立てる個々の対象の正確な識別と追跡
    • マルチモーダルな情報処理の重要性が高まる中,音と視覚情報を統合する技術が求められている。
    • 既存手法では,重なり合う音響イベントと視覚インスタンスの対応付けや,非同期の音声視覚ダイナミクスの処理が困難である。
    • 重なり合う音源と視覚インスタンスの正確な対応付けと,時間的にずれ込んだ信号に対するロバストな追跡を実現すること。
    • 提案手法H2Sは,Acoustic-Semantic Projector(ASP)とAsynchronous Dynamics Modulator(ADM)を導入し,高い性能を発揮する。
    • AVISegデータセットにおいて,H2SはSOTAの性能を達成し,COCO pretrained ResNet50を用いた場合に48.54 mAPを獲得した。
    • これは,既存手法を7.8%上回る結果であり,音声と視覚情報の効果的な統合を示している。

    Link: https://arxiv.org/abs/2608.03264

  • クラスター誘導プロトタイプ混合による効率的なビデオデータセット蒸留 [cs.CV, cs.AI]目的:ビデオデータセットの効率的な蒸留
    • ビデオデータセットは大規模になりがちであり,学習コストの増大を招くため,圧縮が重要である。
    • 既存の蒸留手法は最適化に時間がかかり,特にビデオの時系列次元が計算コストを増大させる。
    • 勾配ベースの最適化なしに,効果的な蒸留ビデオを構築することを目指す。
    • ProtoBlendは,教師誘導によるクリップ選択,クラスター誘導によるプロトタイプ割り当て,そして混合による効率的な蒸留を実現する。
    • 4つの行動認識ベンチマークにおいて,ProtoBlendは反復最適化なしに,競争力のある精度と効率のトレードオフを達成した。
    • 各クラスの代表的なサンプルを保持し,多様なバリエーションをカバーすることで,より少ないデータで高い性能を維持している。

    Link: https://arxiv.org/abs/2608.03269

  • GUI-Lens:汎用VLMsを用いたGUIグラウンディングのための粗い段階から細かい段階へのクロッピング [cs.CV, cs.AI]目的:GUIグラウンディングの精度向上
    • GUIエージェントの信頼性向上に不可欠であり,ヒューマンコンピュータインタラクションの分野で重要である。
    • 高解像度で要素が密集したGUIにおいて,VLMが正確な位置を特定することが難しい。
    • GUI-Lensは,視覚的観察を通じて対象を特定し,曖昧さや不正確さを解消することを目指す。
    • GUI-Lensは,OCRテキストとUIコンポーネントを座標参照として提示することで,汎用VLMのGUIグラウンディング能力を向上させる。
    • 粗い段階から細かい段階へクロッピングを繰り返すことで,視覚的な詳細を徐々に拡大し,対象を特定する。
    • 4つのGUIグラウンディングベンチマークと3つのVLMバックエンドにおいて,最大24.9%の精度向上とGPT-5.5による最先端の性能を達成した。

    Link: https://arxiv.org/abs/2608.03270

  • 3DGSI-Assessor:3Dガウススプラッティング画像品質評価のための大規模データセットとLMMベース手法 [cs.CV]目的:圧縮された3Dガウススプラッティングの画像品質評価
    • 3Dガウススプラッティングはリアルタイムな新規視点合成に重要だが,データ容量が課題となる。
    • 従来の画像品質評価指標は,3DGS特有の歪みを捉えきれない。
    • 3DGSの幾何学特性と色属性の歪みを個別に診断できる評価手法を開発する。
    • 大規模データセット3DGS-IEval-15K+を構築し,多様なシーンと圧縮レベルで評価データを収集した。
    • LMMベースの3DGSI-Assessorを提案し,全体,幾何学,色品質の3次元を一度に予測するフレームワークを実現した。
    • 3DGSI-Assessorは3DGS-IEval-15K+で最先端の性能を示し,他のNVSベンチマークでも高い汎化性能を発揮した。

    Link: https://arxiv.org/abs/2608.03279

  • 安全なテキスト誘導画像生成のためのテスト時スケーリング:中間クリーン推定による [cs.CV, cs.AI]目的:テキスト誘導画像生成における安全性とポリシー遵守の確保
    • 拡散モデルの応用拡大に伴い,不適切なコンテンツ生成のリスク管理が重要となっている。
    • 既存の防御策はテキスト中心であり,視覚的シグナルを考慮していない点が課題である。
    • 生成過程の中間画像を活用し,テスト時にスケーリング可能な安全性確保手法を開発する。
    • 生成過程で推定される中間クリーン画像を活用し,禁止概念を検出するスパースマージン目的関数を提案。
    • 違反が検出された場合,テキスト条件付け空間において構造化低ランク残差をTruncated Backpropagationで最適化。
    • Stable Diffusion v1.4とv3.5を用いた実験で,既存手法よりも優れた性能が確認された。

    Link: https://arxiv.org/abs/2608.03284

  • PLS-Calib:地表運動制約下におけるイベントカメラとオドメトリの偏最少二乗法による較正 [cs.RO, cs.RO, cs.CV]目的:イベントカメラとオドメトリの外部回転較正
    • ロボット知覚システムの性能において,センサー間の正確な較正は不可欠である。
    • 従来の較正手法は全自由度を励起する運動を必要とし,地表制約ロボットには不向きである。
    • 地表制約ロボットにおけるロバストかつ高精度な較正を実現すること。
    • 提案手法PLS-Calibは,偏最少二乗法を用いてセンサー間の潜在的な運動相関をモデル化する。
    • イベントカメラ向けに極性情報を考慮した表現を導入し,円形較正ターゲットのコントラストを向上させた。
    • シミュレーションと実環境実験により,既存手法と比較して較正のロバスト性と精度が大幅に向上することが示された。

    Link: https://arxiv.org/abs/2608.03296

  • 不均衡な医療画像分類のための再帰的コントラスト学習 [cs.CV]目的:不均衡な医療画像分類における性能向上
    • 医療画像診断の精度向上は,疾患の早期発見と治療に不可欠である。
    • 疾患の発生頻度の偏りから,医療画像分類ではクラス不均衡が課題となる。
    • 少数クラスの表現力を高め,クラス間の分離を改善することを目指す。
    • 提案手法RCLは,過去の特徴状態を再利用することで少数クラスのサポート領域を拡大する。
    • DINOv3とLoRAアダプターをバックボーンに,Temporal Memory Queue (TMQ) を用いることで,多様なグローバル参照を提供しコントラスト学習を強化する。
    • 実験結果から,RCLは既存手法と比較して一貫した性能向上を示すことが確認された。

    Link: https://arxiv.org/abs/2608.03304

  • Any-OPD:表現空間の橋渡しによるフローマッチングモデルのための異質オンポリシー蒸留 [cs.NI, cs.MM, eess.IV, cs.LG, cs.CV]目的:異種モデル間でのオンポリシー蒸留の枠組み
    • 生成モデルの性能向上は,画像生成技術の発展に不可欠である。
    • オンポリシー蒸留はモデル構造の制約が強く,異なるモデル間での適用が困難であった。
    • モデル構造の違いを克服し,任意のモデル間での蒸留を可能にすることを目的とする。
    • Any-OPDは,教師モデルと生徒モデルの潜在空間の不一致を,モデルに依存しない表現空間で比較することで解決した。
    • 120億パラメータのFLUX.1-devを25億パラメータのSD3.5-Mediumに蒸留した結果,生徒モデルのPickScoreとHPSv3が大幅に向上した。
    • これにより,生徒モデルは教師モデルの性能に匹敵する能力を獲得し,計算コストを大幅に削減することができた。

    Link: https://arxiv.org/abs/2608.03316

  • LocAnyMed:マルチモーダル医用画像に対するビジョンと言語のグラウンディング [cs.CV]目的:マルチモーダル医用画像に対するビジョンと言語のグラウンディングのためのデータセットとモデルの性能向上
    • 医用画像診断の精度向上と,AIによる診断の解釈可能性向上が求められている。
    • 既存の医用画像ローカリゼーションリソースは,モダリティやタスクごとに分散しており,活用が難しい。
    • 多様な医用画像モダリティに対応した統一的なデータセットを構築し,グラウンディングモデルの性能を向上させる。
    • LocAnyMed-200Kデータセットを構築し,CT,光学画像,超音波,X線画像など,約20万件の画像-クエリ-回答ペアを提供した。
    • LocateAnything-3BをLocAnyMed-200Kでファインチューニングすることで,F1@IoU 0.50が10.64から85.59に大幅に向上した。
    • LocAnyMed-CoT-20Kは,解釈可能性を高めるための根拠を付与しており,異なるデータセット間での汎化性能を向上させた。

    Link: https://arxiv.org/abs/2608.03322

  • PolyLayout:複数部屋のマンハッタンレイアウト推定 [cs.CV]目的:複数部屋のマンハッタンレイアウト推定手法
    • 屋内シーン理解において,部屋レイアウト推定は重要な基礎技術である。
    • 既存手法は,データセットへの汎化性能や部屋形状の制約に課題がある。
    • 部屋間の構造的特徴を考慮し,汎化性能の高い推定手法を開発する。
    • 提案手法PolyLayoutは,部屋レイアウトをマンハッタンポリゴンとして表現し,複数部屋を同時に最適化する。
    • 学習済みの特徴量と出力レイアウトのみを教師データとして,エンドツーエンドで学習を行う。
    • 新たなベンチマークデータセットを用いて評価を行い,既存手法を上回る精度とロバスト性を示した。

    Link: https://arxiv.org/abs/2608.03323

  • SPADE:高速ビデオ拡散モデル推論のための入力適応型スパース注意エンジン [cs.CV]目的:ビデオ拡散モデルの高速推論のための入力適応型スパース注意エンジンの開発
    • ビデオ生成の質向上は重要だが,計算コストが課題となっている。
    • ビデオトークン数が増加すると,自己注意機構の計算量が指数関数的に増加する。
    • 入力に応じて重要トークンを選択し,計算コストを削減することを目指す。
    • SPADEは,3Dブロッキングと動的マスクを定義するvDiT-SSR,SICSを用いたランタイムスキーム生成,および低オーバーヘッド実行機構を組み合わせる。
    • Hunyuan-VideoおよびWan 2.1/2.2を用いた実験で,SPADEはスパース性を高め,注意機構を2.26x-3.40x,推論を1.49x-1.80x高速化することを示した。
    • 画質を維持しつつ,計算効率を大幅に改善することが確認された。

    Link: https://arxiv.org/abs/2608.03335

  • オラクル条件付けが展開を誤らせる場合:心エコー画像セグメンテーションにおける条件付け-可用性バイアス [cs.CV, cs.AI]目的:心エコー画像セグメンテーションにおける,訓練・評価時と展開時で信号品質が異なる場合に生じる問題の検証
    • 心エコー画像は,心臓疾患の診断とモニタリングに不可欠であり,自動セグメンテーション技術の精度向上が求められている。
    • 機械学習モデルは,訓練データに存在する近道学習の影響を受けやすく,展開時に性能が低下する可能性がある。
    • オラクル条件付けによる性能向上と,実際の展開環境でのバイアスを評価し,ロバストなモデル構築を目指す。
    • オラクル条件付けされたモデルは,展開時に性能が著しく低下する可能性が示された。特に,CAMUSデータセットにおいて顕著であった。
    • 展開時に利用可能な位相推定値をランダムに摂動させる手法や,展開を意識したチェックポイント選択により,性能ギャップを縮小できることが示された。
    • セグメンテーションの精度回復が必ずしも心臓の駆出率(EF)の誤差改善に繋がらないことが示唆され,評価指標の重要性が強調された。

    Link: https://arxiv.org/abs/2608.03342

  • テキストから画像モデルは適切な参照枠を描画できるか? [cs.CV]目的:参照枠の違いによる画像生成の課題評価
    • テキストから画像生成において,空間指示の理解は不可欠である。多様な指示を正確に反映することが求められる。
    • 指示表現の解釈が参照枠によって異なり,意図したレイアウトと異なる結果が生じる場合がある。
    • 画像生成モデルが,カメラ視点とオブジェクトの向きという異なる参照枠を区別できるか検証する。
    • 既存の画像生成モデルは,カメラ視点での指示よりも,オブジェクトの向きを参照した指示において平均で41.8%低い精度を示す。
    • 最も性能の良いモデルでも,参照枠に基づく指示の精度は44.3%に留まり,課題が残る。
    • 視覚的なフィードバックを利用したプロンプト書き換え手法により,参照枠に基づく指示の精度が25.0%から29.2%に向上した。

    Link: https://arxiv.org/abs/2608.03357

  • ArtECulture:マルチモーダル大規模言語モデルにおける文化条件付きの視覚的感情理解のベンチマーク [cs.CL, cs.CV]目的:文化条件付きの視覚的感情理解
    • 感情理解は人間とAIのコミュニケーションにおいて不可欠であり,その精度向上は重要な課題である。
    • 既存研究では感情の文化的差異が無視されており,普遍的な感情モデルでは正確な理解が困難である。
    • 文化特有の感情認識を評価し,文化知識をAIに組み込むことで,より高精度な感情理解を目指す。
    • 本研究で構築したArtECultureベンチマークは,英語,中国語,アラビア語の文化圏における感情ラベルと説明を含む6,792点の美術作品データセットである。
    • 16種類のマルチモーダル大規模言語モデル(MLLM)のゼロショット評価の結果,現状では50%以下の精度に留まっていることが示された。
    • 文化知識ベースを活用したRetrieval-Augmentedフレームワークが,感情予測と説明生成の双方において性能向上に貢献することが確認された。

    Link: https://arxiv.org/abs/2608.03358

  • DRPFNet:RGB-Tオブジェクト検出のための二重ドメイン残差漸進的融合ネットワーク [cs.CV]目的:RGB-Tオブジェクト検出におけるロバスト性の向上
    • 可視光と熱画像の相補的な情報を活用し,照明や天候に左右されない検出が求められている
    • 既存手法では,スケールごとに独立に融合を行うため,知識の伝達やノイズ抑制,周波数・空間協調性に課題がある
    • 構造,特徴,強調の3つのレベルで協調的な融合戦略により,これらの課題を解決することを目指す
    • DRPFNetは,ボトムアップ型知識蓄積と双方向強化によるクロススケール伝搬を確立し,スムーズな情報フローを保証する。
    • 周波数帯域分離とエッジガイダンスにより,RGBの高周波エッジと熱画像の低周波構造を協調的に抽出することで,表現品質を向上させる。
    • エッジガイダンスによる二重ドメイン精錬により,前景・背景の識別を強化し,高精度なオブジェクト局在化を達成する。

    Link: https://arxiv.org/abs/2608.03370

  • 3D複数人モーション予測のための残差フローマッチングと動的クロスインタラクション [cs.CV]目的:3D複数人モーション予測の精度向上
    • 人間行動理解において,複数人の動きを予測することは,ロボット工学や仮想現実などの応用にとって重要である。
    • 既存手法では,モーション予測の構造的一貫性や信頼性のあるエージェント間のインタラクションが課題となっていた。
    • 本研究は,構造的安定性と信頼性の高い社会的文脈の抽出を両立することで,モーション予測の精度を向上させる。
    • 提案手法では,決定論的粗視化事前知識を用いてモーションの残差を予測することで,構造的な安定性を確保している。
    • 動的クロスインタラクション機構により,エージェント間メッセージパッシングのタイミングを統合過程と同期させ,信頼性の高い社会的文脈を抽出している。
    • 複数のデータセットにおいて,提案手法が最先端の予測精度を達成している。

    Link: https://arxiv.org/abs/2608.03379

  • FreqAdapt:RAW画像検出のための周波数適応処理 [cs.CV]目的:RAW画像における物体検出性能の向上
    • 視覚認識において,より多くの情報を持つRAWデータの活用が重要視されている。
    • 従来の物体検出はsRGB画像に依存しており,RAWデータの持つ潜在的な利点が活かされていない。
    • RAWデータの特性を考慮した周波数領域での処理により,検出性能の課題解決を目指す。
    • 提案手法FreqAdaptは,軽量でありながら,多様な環境下で最先端の性能を達成する。
    • FreqAdaptは,ISP処理を周波数領域にマッピングすることで,物理特性に基づいた最適な処理を実現する。
    • 既存の物体検出フレームワークに容易に組み込むことが可能であり,RAWドメインにおける新たな解決策を提供する。

    Link: https://arxiv.org/abs/2608.03385

  • SRAP:特異値分解による摂動の改良を用いた,知覚できない顔交換防御 [cs.CV, cs.LG]目的:顔交換モデルに対する防御性能の向上
    • 顔画像はプライバシーと身元確認において重要であり,ディープフェイク技術による悪用を防ぐ必要がある。
    • 既存の防御手法は,画像品質の低下や,防御効果と視覚的な自然さのトレードオフという課題がある。
    • 画像品質を維持しつつ,顔交換に対する防御性能を高めることを目指す。
    • SRAPは,最適化の各ステップで,チャネルごとのTruncated SVDとアイデンティティ重要度マスクを組み合わせることで,高周波成分を抑制し,防御効果を維持する。
    • CelebA-HQとVGGFace2-HQでの実験により,SRAPは既存手法と比較して,保護された画像の品質を大幅に向上させながら,同等の身元情報破壊性能を示すことが確認された。
    • SRAPは,顔交換防御と視覚的な自然さのバランスを最適化し,実用的な防御手法となりうる。

    Link: https://arxiv.org/abs/2608.03395

  • 蒸留された道路:センサー,解像度,地域に依存しない道路ネットワーク抽出 [cs.CV, cs.AI, cs.LG]目的:道路ネットワーク抽出の汎化性能向上
    • 道路ネットワークは,自動運転や地図作成など,様々な分野で不可欠な情報である。
    • 既存モデルは特定の解像度や地域に最適化され,未知の環境への汎化性能が低い。
    • 多様な環境で安定した道路抽出を実現する学習戦略の開発。
    • 本研究では,解像度を徐々に下げるカリキュラム,マルチセンサー学習,トポロジーを考慮した教師あり学習を組み合わせた。
    • その結果,大陸を跨いだ複数の衛星プラットフォームにおける0.3-1.0mの画像に対して,単一モデルで高い汎化性能を実現した。
    • 公開ベンチマークにおいて,最先端技術を最大22 F1ポイント,15 APLSポイント上回り,推論速度も3倍向上した。

    Link: https://arxiv.org/abs/2608.03407

  • 地球埋め込み [cs.RO, cs.DC, cs.CE, cs.CV]目的:地球観測における埋め込み表現の特性と応用
    • 地球観測データの活用範囲拡大に不可欠であり,効率的なデータ分析を可能にする。
    • 大規模な衛星画像データの処理・分析に,高い計算コストと専門知識が必要となる。
    • 埋め込み表現を用いることで,データ処理コストを削減し,より幅広いユーザーが地球観測データを利用可能とする。
    • 埋め込み表現は,位置情報,画像パッチ,ピクセルを要約するベクトルとして機能し,繰り返しモデルをトレーニングする手間を省く。
    • 土地被覆マッピング,生態学的モデリング,社会経済予測,セマンティック検索など,幅広い分野への応用事例が報告されている。
    • 埋め込み表現の選択,評価,保存,圧縮,公開に関する指針が提示され,海洋や大気に関する今後の課題も議論されている。

    Link: https://arxiv.org/abs/2608.03410

  • マルチタスク・マルチフレーム視覚ピアノトランスクリプション [cs.SD, cs.AI, cs.CV, cs.MM, eess.IV]目的:視覚ピアノトランスクリプションにおける音符の開始,終了,保持,ベロシティの予測
    • ピアノ演奏の理解や自動演奏への応用において,正確な楽譜推定が不可欠である。
    • 従来の視覚ピアノトランスクリプションは,音符の開始検出に偏っており,終了位置の精度が低い。
    • 本研究は,音符の終了位置とベロシティの予測精度向上を目指す。
    • 提案手法V2Nは,ピアノ演奏動画から音符の開始,終了,保持,ベロシティを同時に予測する完全なシステムである。
    • マルチタスク学習とフレーム単位の教師あり学習により,音符の終了位置とベロシティの予測が可能となり,開始位置の精度も向上した。
    • ピアノVAMとR3データセットにおいて,最先端の結果を達成した。

    Link: https://arxiv.org/abs/2608.03419

  • 双曲拡散:双曲平面上でのシャープかつスケーラブルなタイル生成 [cs.MA, cs.CV]目的:双曲平面上での有限な視覚フィールドの生成
    • 近年,拡散モデルによる画像生成が注目を集めている。特に,大規模な画像生成において効率的な手法が求められている。
    • 従来の拡散モデルは,ユークリッド空間を前提としており,双曲空間のような非ユークリッド空間への適用が困難であった。
    • 双曲平面上でのタイル生成における,歪みや不整合を解消し,高品質な画像を生成することを目的とする。
    • HyperbolicDiffusionは,学習を必要としない手法であり,双曲平面H2上で直接視覚フィールドを生成できる。
    • 双曲Blooming Coverは,ウィンドウ配置を高速な動的計画法に変換し,理論的な保証を提供する。
    • 幾何学に基づいた後処理により,歪みを修正し,一貫性のある画像を生成することで,視点に依存しない生成が可能となる。

    Link: https://arxiv.org/abs/2608.03422

  • 構造誘導Transformerによるロバストな局所特徴点マッチング [cs.CV]目的:ロバストな局所特徴点マッチング手法の開発
    • 測量や3D再構成などの分野において,正確な画像対応は不可欠である。
    • Transformerモデルは広範囲のモデリング能力を持つが,構造の重要な特徴への注意が散漫になる場合がある。
    • 構造を意識した注意機構により,特徴点マッチングの精度向上を目指す。
    • 提案手法SGFormerは,Transformerの注意機構を構造情報に基づいて適応的に更新する。
    • TSAモジュールを導入し,初期の局所特徴を利用して構造周辺の表現を強化することで,注意の焦点を絞る。
    • 実験により,SGFormerが注意の散漫さを軽減し,マッチング精度を大幅に向上させることが示された。

    Link: https://arxiv.org/abs/2608.03423

  • オリーブジェマ:地中海式・ヨーロッパ料理認識のための30億パラメータ視覚言語モデル [cs.CV, cs.AI]目的:地中海式およびヨーロッパ料理の認識と推論
    • 食生活評価において,自己申告による食日誌の代替手段として画像認識が注目されている。
    • 食品のクラス内ばらつきや視覚的に類似した料理が多く,詳細な食品認識が困難である。
    • 専門的な食品認識において,大規模なモデルに匹敵する性能を小規模なモデルで実現する。
    • OliveGemmaは,3種類のヨーロッパの研究プロジェクトデータセットを用いて微調整された視覚言語モデルである。
    • 3分割交差検証の結果,トップ1精度は92.96%±0.91%と,既存のCNNベースラインや大規模言語モデルを上回った。
    • 食品カテゴリーの可能性のある材料の正確な特定においても,90.79%±1.3%という高い精度を達成した。

    Link: https://arxiv.org/abs/2608.03428

  • SLAMFormer-$\infty$:無制限なフロントエンド・バックエンド処理のための無限SLAM Transformer [cs.CV, cs.RO]目的:大規模データセットにおける軌跡推定とシーン再構成の性能向上
    • ロボットの自律移動や拡張現実(AR)において,環境理解は不可欠である。正確な環境マップ構築が求められる。
    • 従来のSLAM手法は,処理範囲に距離制限があるか,大規模環境での計算負荷が大きいという課題があった。
    • SLAMFormer-$\infty$は,距離制限なく長距離の軌跡や大規模シーンを扱えるSLAMシステムの構築を目指す。
    • SLAMFormer-$\infty$は,従来のフレームワークに依存せず,柔軟な座標系とスケールを定義することで,長距離のフロントエンド・バックエンド処理を可能にした。
    • 実験結果から,SLAMFormer-$\infty$は大規模データセットにおいて,軌跡推定とシーン再構成の両方で優れた性能を示した。
    • 特に,17kmを超える超長距離シーケンスにおいても,安定した動作を実現し,汎用性の高さが確認された。

    Link: https://arxiv.org/abs/2608.03429

  • 運動分解能4D CBCT再構成のための埋め込みバックプロジェクション演算子を持つデュアルドメインU-Net [cs.CV, cs.LG]目的:運動分解能4D CBCT再構成手法
    • 胸部癌の放射線治療において,画像誘導は重要であり,4D CBCTはその精度向上に貢献する。
    • 従来の4D CBCTはスキャン時間が長く,被ばく線量増加やモーション/スパースサンプリングアーチファクトが生じやすい。
    • 呼吸信号や明示的な投影ビンニングなしに,従来のフリーブリージングスキャンから4D CBCTを再構成し,これらの課題を解決する。
    • 腫瘍および食道の視認性に関して,臨床専門家は提案手法を従来のSART-TV画像よりも好む傾向があった。
    • シミュレーションデータでは,提案手法はSART-TVと同等の画質を示し,4D再構成を可能にした。
    • 臨床スキャンでは,提案手法はより鮮明な動的構造と,モーションストリークアーチファクトの低減を実現した。

    Link: https://arxiv.org/abs/2608.03430

  • ノイズの置き換えを止める:ラベル修正とサンプル重み付けのための二重ソース信頼性評価 [cs.LG, cs.CV]目的:ラベルノイズ学習におけるラベル修正とサンプル重み付けのための信頼性評価手法
    • 教師あり学習の性能はラベルの品質に大きく依存し,ノイズラベルはその学習を阻害する。
    • 既存手法では,観測ラベルと擬似ターゲット間の信頼性が暗黙的に結合されており,一方の信頼性低下が他方を増大させる。
    • 観測ラベルと擬似ターゲットを独立に評価し,信頼性に応じた修正と重み付けを行うことで,ノイズの伝播を抑制する。
    • 提案手法TRACEは,観測ラベルの損失適合度,浅い関係の安定性,予測一致に基づいて信頼性を評価する。
    • 同時に,擬似ターゲットはモデルの確信度で評価し,それぞれの信頼性スコアを用いて修正と重み付けを制御する。
    • 合成データおよび実データでの実験により,TRACEは既存手法を上回り,より信頼性の高い擬似教師あり学習を実現することが示された。

    Link: https://arxiv.org/abs/2608.03432