arXiv雑要約

画像・音声 - 2026/07/30 公開

  • レベル,鮮明度,コーパス:ゼロショットOOD検出器のランキングが転移しない理由 [cs.CV]目的:ゼロショットOOD検出器の選択におけるランキングの転移性
    • 未知のデータに対する検出は,現実世界の応用において重要であり,その性能評価が不可欠である。
    • ベンチマークランキングは,新しい環境への適用において必ずしも信頼できる指標とはならない。
    • 検出器のランキングの逆転現象を解明し,より汎用的な検出手法を開発することを目指す。
    • 検出器のランキングは,データセットや基盤モデルによって変動し,特定の環境に依存することが示された。
    • コーパスフリー検出器はレベルと鮮明度に依存し,WordNetベースの手法は外部セマンティックカバレッジに依存する。
    • Complementary Evidence Guard (CEG) は,検出器の感度を低減し,FPR95を改善することで,ランキングの不安定性を緩和する。

    Link: https://arxiv.org/abs/2607.26582

  • R-SLPR:コントラスト学習を用いたリージョンベースの小規模から大規模点群登録 [cs.CV]目的:小規模から大規模点群間の登録手法
    • ロボットシステムにおける3次元知覚の基礎であり,精度向上が重要である。
    • 小規模・不完全な点群を大規模な参照点群に登録する問題は未解決である。
    • 大規模な点群に対し,小規模点群をロバストに登録することを目指す。
    • R-SLPRは,リージョン提案,リージョンマッチング,反復的洗練の3段階アーキテクチャにより,スケール不一致問題を解決する。
    • 提案手法は,既存手法と比較してModelNet40における位置・回転MAEを大幅に削減した。
    • 位置MAEは0.009,回転MAEは1.104となり,最新の精度基準を確立した。

    Link: https://arxiv.org/abs/2607.26583

  • SpatialQ:視覚に基づいたMLLMによる3Dガウススプラッティングシーン品質の理解 [cs.CV]目的:3Dガウススプラッティングシーンの品質評価
    • 3Dシーン再構成技術の発展に伴い,高品質なシーンの評価が不可欠となっている。
    • 従来の画像品質評価は2D情報に依存し,3DGSシーン特有の空間構造や視点間整合性を捉えきれない。
    • 3DGSシーンの品質を多角的に評価し,より信頼性の高い品質判断を実現すること。
    • 本研究では,3D情報を考慮した品質表現学習フレームワークを提案し,多視点画像と幾何学的情報を統合することで,従来の画像品質評価の限界を克服した。
    • QwenベースのMLLMに画像,深度マップ,点群,カメラパラメータを入力するグラウンデッドな多imodal推論メカニズムを構築し,安定した品質回帰を実現した。
    • 提案手法SpatialQは,3DGSシーンの品質を構造と外観の両面から評価し,より正確な品質判断を可能にする。

    Link: https://arxiv.org/abs/2607.26595

  • 分離された視覚処理:モダリティ特有のTransformer置換による効率的なマルチモーダル適応 [cs.CV, cs.AI]目的:マルチモーダル大規模言語モデルにおける視覚的指示調整の効率化
    • マルチモーダルモデルは,視覚とテキストの理解を統合し,多様なタスクに対応できるため重要である。
    • モデル全体のファインチューニングは計算コストが高く,視覚とテキストの表現は異なるため非効率である。
    • 視覚情報を処理するTransformerブロックを分離し,パラメータ数を削減することで効率化を目指す。
    • DVPは,LLaVA-1.5フレームワークにおいて,MME,POPE,ChartQAなどのベンチマークで高い性能を発揮した。
    • DVPは,モデル全体のパラメータのごく一部のみを訓練することで,同等の性能を達成できることを示した。
    • マルチモーダルモデルにおける視覚表現は,分離された効率的な経路で効果的に学習できることが示唆された。

    Link: https://arxiv.org/abs/2607.26596

  • JEPADepth:自己教師あり単眼深度推定のためのマスク予測表現学習 [cs.CV]目的:自己教師あり単眼深度推定のための新しいフレームワーク
    • 自己教師あり学習は,ラベル付きデータが不足する場合でも深度推定を可能にするため重要である。
    • 従来の自己教師あり深度推定は,光度再構成損失に依存しており,制約が強い場合がある。
    • 本研究は,より柔軟な表現学習を用いて深度推定の性能向上を目指す。
    • JEPADepthは,DINOv3 Vision Transformerエンコーダを用いた光度パイプラインに,マスク予測損失を追加する。
    • KITTIデータセットにおいて,JEPA目的関数を追加することで,ベースラインと比較して性能が向上した。
    • ゼロショット転移実験では,Make3DおよびCityscapesにおいて,他の手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2607.26600

  • 少ないサンプル数での開集合音声分類:帰納的プロトタイプ洗練とクラスロジット強化 [cs.CL, cs.SD, cs.LG]目的:少ないラベル付きサポートサンプルを用いた既知クラスからのクエリサンプルの分類と,未知クラスからのクエリサンプルの拒否
    • 音声認識や環境音分析など,多様な応用において,限られたデータでの分類が求められる。
    • 従来の音声分類手法は,未知の音声クラスを正しく識別できず,誤分類を引き起こす可能性がある。
    • 未知クラスの混入によるプロトタイプの汚染を防ぎ,よりロバストな開集合音声分類を実現すること。
    • 提案手法は,クエリサンプルに潜在的な内包スコアを割り当てることで,未知クラスのサンプルの影響を軽減し,プロトタイプの洗練を改善する。
    • サポートデータのクロスエントロピー損失,内包スコア重み付き条件エントロピー最小化,内包スコア重み付き周辺エントロピー最大化を組み合わせた帰納的損失関数を使用する。
    • 3つの音声データセットを用いた実験により,提案手法が少ないサンプル数での開集合音声分類において最先端の結果を達成することが示された。

    Link: https://arxiv.org/abs/2607.26607

  • 異種MLLM融合における知識伝達メカニズムの理解:シンプルな線形アプローチ [cs.CV]目的:異種MLLM融合における知識伝達メカニズムの解明
    • 大規模言語モデルの発展は,多様なタスクへの応用を可能にする重要な基盤技術である。
    • 異種MLLM融合における知識伝達のメカニズムは未だ不明確であり,性能向上と伝達内容の乖離が課題である。
    • 知識伝達の選択性と限界を明らかにし,効果的な融合戦略の指針を示す。
    • Cross-Scale Directional Parameter Injection (CDPI)により,知識伝達の方向性と選択性を分析した。
    • 知識伝達は,特に高水準な推論能力において顕著であり,知覚性能への影響は限定的である。
    • 高水準推論能力の向上は主に言語モデルに起因し,小規模モデルへの知識伝達が効果的であることが示された。

    Link: https://arxiv.org/abs/2607.26608

  • FakeIDet3-DB:セキュアIDベンチマークのためのデジタル攻撃とパッチ抽出の改良 [cs.CL, cs.HC, cs.CV, cs.AI]目的:リアルな政府発行IDに対するデジタル操作の包括的なデータベース
    • ID認証は,高周波のセキュリティパターンの構造的完全性に依存する。近年,AI技術の発展がID偽造のリスクを高めている。
    • プライバシー規制により,リアルなIDを用いたモデル学習が困難であり,合成テンプレートでは現実のIDの複雑な視覚パターンを再現できない。
    • 本研究は,プライバシーを保護しつつ,リアルなIDの視覚パターンを最大限に活用できるパッチ抽出技術の開発を目指す。
    • FakeIDet3-DBは,古典的な攻撃と生成AIによる攻撃を含む,6400枚以上のID画像から約520万個のパッチを抽出したデータベースである。
    • 提案手法PACEは,個人識別情報(PII)の漏洩を防ぎつつ,検知精度を最大化する匿名化パッチ抽出を実現した。
    • 最先端モデルの評価では,生成AIおよび古典的手法による攻撃の検出・位置特定が困難であることが示された(検出EER: 32.45%,位置特定AUC-ROC: 83.48%)。

    Link: https://arxiv.org/abs/2607.26641

  • FPSGen: BEVサポートトランスポートフローを用いた柔軟な点群シーン生成 [cs.CV, cs.AI]目的:点群シーンの柔軟な生成
    • 自動運転やロボティクスにおける環境理解の精度向上に不可欠な技術である。
    • 既存手法は部分的な点群データに依存し,遠景や遮蔽領域の生成が不十分である。
    • 部分点群に依存せず,BEV情報を用いた点群シーン生成による課題解決を目指す。
    • FPSGenはBEV空間での事前分布に基づき点群ソースを生成することで,既存手法の課題を克服した。
    • 教師-生徒モデルによる最適輸送計画により,直線的なトランスポートパスを実現し,生成品質を向上させた。
    • SemanticKITTIおよびKITTI-360における実験で,最先端の性能を達成した。

    Link: https://arxiv.org/abs/2607.26645

  • ジェニーシム パノワールド:パノラマシーンモデリングとシミュレーションによる無限の屋内3Dワールド生成パイプライン [cs.CV]目的:単一の360度パノラマからの高忠実度で自由に移動可能な3Dシーンの再構成
    • 没入型体験やAIシミュレーションにおいて,リアルな3D環境の重要性が増している。
    • 既存手法では,正確な3D再構成や大規模な遮蔽物の処理が課題となっていた。
    • パノラマ画像から高精度な3Dシーンを生成し,AIシミュレーションへの活用を目指す。
    • 提案手法は,trajectory制御可能なパノラマビデオ生成と3D再構成を融合したパイプラインを実現した。
    • 生成された3D Gaussianシーンは,リアルタイムな自由視点移動とAIシミュレーションへの直接利用を可能にする。
    • 実験により,既存手法と比較してパノラマビデオ生成と3D再構成の両方で優れた性能を示すことが確認された。

    Link: https://arxiv.org/abs/2607.26646

  • アンカリングとステアリング拡散:推論時のテキストから画像生成の忠実性向上 [cs.CV]目的:テキストから画像生成における,テキストと画像の整合性向上
    • 画像生成技術は目覚ましい進歩を遂げているが,複雑な指示への正確な対応が課題である。
    • 既存手法は初期ノイズの改善か,ノイズ除去軌跡の改善に焦点を当てており,両者を統合したものが無い。
    • テキストと画像のずれを,推論段階での制御によって改善することを試みる。
    • 本研究では,CLIPに基づく事前知識の抽出とLP-SDSによる知識蒸留を組み合わせた「Semantic Anchoring」を提案する。
    • さらに,VLMによる診断と潜在空間の修正を繰り返す「Reflective Steering」によって,生成途中の自己修正を実現する。
    • GenEvalやT2I-CompBench++での実験により,AnchorSteerが既存手法を凌駕し,高い画質を維持しつつ,テキストと画像の整合性を向上させることが示された。

    Link: https://arxiv.org/abs/2607.26647

  • 光流推定ネットワークに対する物理リアルタイム赤外線攻撃 [cs.CV, cs.AI]目的:光流推定ネットワークの脆弱性検証
    • 自動運転や動体検知など,画像処理技術の応用が拡大しており,安全性確保が重要である。
    • 光流推定ネットワークは,後続のタスクに大きな影響を与えるため,その頑健性が課題である。
    • 本研究は,現実世界における赤外線を用いた光流推定ネットワークへの攻撃手法を提案する。
    • 提案手法は,事前に生成した敵対的サンプルをリアルタイムで表示し,物理世界での攻撃を可能にする。
    • 従来のデジタルから物理への攻撃手法とは異なり,システム改変なしに直接モデルを攻撃できる。
    • 実験結果から,多様な照明条件や物体速度,配置において光流推定の精度を低下させることが確認された。

    Link: https://arxiv.org/abs/2607.26651

  • 潜空間におけるガルバニック性前庭刺激 [cs.RO, cs.NI, eess.SP, cs.HC, cs.GT]目的:ガルバニック性前庭刺激波形と自由記述による体験記述との関連性に基づく,刺激波形の生成モデルの構築
    • ガルバニック性前庭刺激は,自己定位,平衡感覚,運動知覚の調整に広く用いられ,新たな身体フィードバックの手段として期待されている。
    • 目的とするイベントや身体状態に合致したガルバニック性前庭刺激波形の合成は困難であり,パラメータ間の相互作用に関する理解が不足している。
    • 体験記述から刺激波形を生成するモデルを開発し,意味的に一致した身体フィードバックの提供を可能にすることを目指す。
    • ガルバニック性前庭刺激波形と自由記述による体験記述のデータセットを構築し,多様な運動・力覚や身体感覚,状況に関する関連性が確認された。
    • 同一刺激波形から得られた体験記述は,より少ない意味カテゴリーに集中し,主要なカテゴリーの割合が高かった(P < 0.001)。
    • テキスト条件付きのガルバニック性前庭刺激波形の生成が可能であり,刺激波形と視覚キューの適合性の弁別において有意な結果が得られた(63.33%の正答率)。

    Link: https://arxiv.org/abs/2607.26659

  • Visko Orbis 1.0:リアルタイムインタラクティブ長尺動画生成のためのライブモデル [cs.DC, cs.DM, cs.CE, cs.CV]目的:リアルタイムインタラクティブ長尺動画生成のためのライブモデル
    • 動画生成技術は,エンターテイメント,教育,コミュニケーションなど多岐にわたる分野で重要な役割を担う。
    • 従来の動画生成システムでは,生成に時間がかかったり,生成途中の変更が困難であったりする課題があった。
    • 本研究は,リアルタイムかつインタラクティブに長尺動画を生成することで,その課題を克服することを目指す。
    • Visko Orbis 1.0は,プロンプトを随時変更しながらリアルタイムに動画を生成可能である。
    • 長尺動画生成において,被写体,シーン,スタイルの一貫性を保ち,品質劣化や色のずれを抑制することに成功した。
    • 最先端のリアルタイムインタラクティブ動画生成システムと比較して,全体的な好みと時間的安定性において最も高い評価を得た。

    Link: https://arxiv.org/abs/2607.26694

  • MPEcho:メロディと音素を意識した制御可能なカバーソング生成フレームワーク [cs.SD, cs.AI, eess.AS]目的:カバーソング生成における音素レベルでの制御
    • 音楽制作において,既存曲を異なるスタイルで再解釈するカバーソングは重要な表現手法である。
    • 既存のカバーソング生成モデルでは,歌詞の正確性が課題であり,音素エラー率が高い。
    • MPEchoは,音素情報を明示的に利用することで,歌詞の正確性を向上させることを目指す。
    • MPEchoは,既存のSongEchoフレームワークに音素エンコーダと長さ調整器を組み込むことで,音素エラー率を大幅に低減した。
    • 高品質な音声-音素ペアの不足を解消するため,Whisperベースの自動転写モデルPhonsaを開発し,高精度な音素アノテーションを可能にした。
    • 実験結果は,PhonsaによるアライメントとMPEchoによるエンドツーエンドのカバーソング生成の有効性を示した。

    Link: https://arxiv.org/abs/2607.26698

  • シーケンスSOD:イベントカメラ向け,生物学的インスパイア型シーケンス認識スパイク物体検出 [cs.CV]目的:イベントカメラにおける物体検出性能の向上
    • イベントカメラは,高時間分解能かつ広いダイナミックレンジを持つ次世代センサとして注目されている。
    • 既存のSNN物体検出器は,イベントストリームの連続性を活かしきれていないという課題がある。
    • 連続するイベントシーケンスを処理することで,時間情報を有効活用し,検出精度を向上させる。
    • シーケンス認識学習により,Gen1 Automotive Detection DatasetにおいてmAPが23.38から25.30に改善された。
    • イベントデータ拡張との組み合わせにより,mAPはさらに向上し26.88となった。
    • 本研究は,イベントベースSNN検出におけるシーケンス認識学習の有効性を示唆している。

    Link: https://arxiv.org/abs/2607.26703

  • 時系列事前分離:テキストから動画への拡散モデルにおける [cs.CV]目的:テキストから動画への拡散モデルにおける,時間的な事前情報の抑制という問題の解決
    • テキストから動画を生成する技術は,エンターテイメントや教育など,幅広い分野での応用が期待されている。
    • 初期のシーンが続く中での新しいイベントの生成において,後段のイベントが反映されにくいという課題があった。
    • 拡散過程のサンプリング中に抑制された後段の信号を復元し,より忠実な動画生成を実現すること。
    • 提案手法であるTPDは,学習を必要とせず,既存の拡散モデルに容易に組み込むことができる。
    • TPDは,初期のシーンの一貫性を損なうことなく,後段のイベントの実現を大幅に改善することを示した。
    • この抑制効果は,異なるテキストから動画へのモデルでも共通して観察された。

    Link: https://arxiv.org/abs/2607.26706

  • 拡散モデルにおける照明転送と選択的コンテンツ保存による学習不要の影除去手法:FreeShadow [cs.RO, cs.CV]目的:拡散モデルを用いた学習不要の影除去
    • 画像処理において,より自然で現実的な画像生成が求められているため,影除去技術は重要である。
    • 既存手法は,学習データ不足や汎化性能の低さ,あるいは処理時間の長さといった課題を抱えている。
    • 本研究は,拡散モデルの事前学習能力を活用し,学習や最適化なしに影を除去することを目的とする。
    • 提案手法FreeShadowは,事前学習済みの拡散モデルを活用し,学習や最適化を必要とせずに影を除去する。
    • 照明転送注意機構(ITA)により,影領域に非影領域の照明情報を転送し,照明の復元を実現している。
    • 局所的なテクスチャのずれを軽減するため,VAE圧縮による影響を緩和する局所テクスチャ保存型再照明(LTPR)を提案している。

    Link: https://arxiv.org/abs/2607.26715

  • 個人から共同所有へ:持続可能な共同投資への協力ゲームアプローチ [cs.GT]目的:持続可能な共同投資の協力ゲーム理論的枠組み
    • インフラの維持・発展には,複数の主体による共同投資が不可欠である。
    • 個々の投資主体の経済的利益と共同投資全体の利益が乖離しやすい。
    • 共同投資における利益配分を最適化し,持続可能なインフラ整備を促進する。
    • 本研究では,共同投資問題を線形生産ゲームとして定式化し,協力余剰の安定的な配分を可能にする。
    • データセンター事業者を対象としたケーススタディを通じて,再生可能エネルギーインフラへの共同投資の有効性を示した。
    • 規制インセンティブを導入することで,個々の投資目標と共同目標を整合させ,持続可能な共同投資を支援できる。

    Link: https://arxiv.org/abs/2607.26725

  • 幾何学的歪みに強い画像ウォーターマーク [cs.CL, cs.CV]目的:幾何学的歪みに対するロバスト性を有する画像ウォーターマーク手法
    • デジタルコンテンツの保護は重要であり,ウォーターマークはその主要な手段の一つである。
    • 従来のウォーターマークは幾何学的変換に弱く,実用上の課題となっていた。
    • 画像全体の情報を活用し,変換に強い特徴表現を学習することで,この課題を解決する。
    • 提案手法CASIALは,画像特徴とウォーターマークビットを強く結びつけ,画像全体に情報を拡散することで,領域削除に対するロバスト性を向上させる。
    • 空間的注意機構を利用したIALモジュールにより,変換された特徴量を幾何学的に不変な空間に整列させ,位置ずれによる復号の失敗を軽減する。
    • 様々な幾何学的歪み,信号歪み,光度歪みにおいて,既存手法を上回るロバスト性と高い画質を両立している。

    Link: https://arxiv.org/abs/2607.26729

  • テンポラル畳み込みネットワークを用いた運動センサーからのオンライン筆跡軌跡再構成 [cs.HC, cs.CV, cs.LG]目的:オンライン筆跡軌跡の再構成
    • デジタルペンによる筆跡は,人間とコンピュータ間のインタラクションの重要な手段である。
    • ペンとタブレットのサンプリングレートの差異が,正確な軌跡再構成の課題となる。
    • ペンセンサー信号から正確な軌跡を再構成し,筆跡認識の精度向上を目指す。
    • 提案手法は,動的時間伸縮法を用いてペンとタブレットの信号をアラインメントする。
    • テンポラル畳み込みネットワークを基にした新たなニューラルネットワークアーキテクチャを導入した。
    • 新しいベンチマークデータセットを用いて評価を行い,既存手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2607.26733

  • テキスト画像拡散モデルにおける二重逆変換:プロンプトとノイズの両面からのアプローチ [cs.CV, cs.AI, cs.MM]目的:テキスト画像拡散モデルの逆エンジニアリング手法
    • 画像生成AIの発展は目覚ましいが,意図した画像を生成するには高度なプロンプト設計が必要となる。
    • 既存のプロンプト逆変換手法は,不安定性や視覚的な忠実性の欠如といった課題を抱えている。
    • プロンプトと潜在ノイズの両方を同時に復元することで,より高品質な画像生成と編集を目指す。
    • 提案手法Dualinは,CLIPと大規模言語モデルを用いて解釈可能なプロンプトを生成する。
    • Dualinは,無条件DDIM逆変換によりターゲット画像の潜在ノイズを正確に再構築し,構造情報の整合性を保証する。
    • 実験により,Dualinが高品質なプロンプト生成と,最先端の画像忠実性を両立することが示された。

    Link: https://arxiv.org/abs/2607.26735

  • 鳥類骨格の分類における視覚的特徴と形態計測的特徴の多重融合 [cs.CV, cs.AI]目的:鳥類骨格の分類
    • 考古学へのAI応用が期待されるが,特に鳥類骨遺骸の同定には限界があった。
    • 鳥類骨遺骸の分類には専門知識が必要であり,時間と労力がかかる。
    • 視覚情報と形態計測データを融合し,AIによる鳥類骨格の自動分類を目指す。
    • 骨の種類分類において,86%の精度を達成し,骨格要素の信頼できる識別が可能であることを示した。
    • 科レベルの分類は難易度が高く,上位1位の精度は51%だったが,上位3位では75%に達し,正しい分類群が頻繁に上位にランクインした。
    • 視覚情報と形態計測情報を統合した深層学習フレームワークの実現可能性を示し,今後の動物考古学におけるAI支援識別法の基盤となる。

    Link: https://arxiv.org/abs/2607.26743

  • 状態認識型ゲームワールドモデル:メカニクス整合性のある生成 [cs.CV]目的:メカニクス整合性のあるゲームワールド生成
    • ゲームは視覚的リアリズムだけでなく,明確なルールによって制御されるため,そのモデル化が重要である。
    • 既存のゲームワールドモデルは視覚的には優れても,ゲームの根底にあるルールを遵守していない場合がある。
    • ゲームの状態遷移をモデル化することで,メカニクスに整合性のあるゲームワールド生成を目指す。
    • StatePlayは,視覚コンテンツとゲームの状態を同時に予測することで,メカニクス整合性を高める。
    • 状態予測の平均正規化L1距離は0.06以下であり,高い精度を達成している。
    • 明示的な状態モデルを持たないモデルと比較して,生成されたゲームロールアウトのメカニクス忠実度が18.6%向上した。

    Link: https://arxiv.org/abs/2607.26754

  • 長尾分布3D点群データセット蒸留 [cs.CL, cs.CV]目的:大規模3D点群データセットの効率的な学習を可能にするための,コンパクトな合成データセット生成
    • 3D点群データは,自動運転やロボティクスなど幅広い分野で活用が拡大しており,学習データセットの重要性が高まっている。
    • 実際の点群データセットは,クラス分布に偏り(長尾分布)が見られることが多いが,既存手法ではこの問題への対応が十分ではない。
    • 長尾分布を持つ点群データセットを効率的に蒸留し,学習性能を向上させることを目指す。
    • 提案手法は,クラスごとのデータ数と追加サンプルによる効果を考慮して合成データ生成量を調整する「適応的合成予算配分」を用いる。
    • さらに,「3D長尾分布分布マッチング」により,グローバル・ローカル特徴の整合性と事前知識に基づいた教師あり学習を実現する。
    • ShapeNet55における実験の結果,最先端手法と比較して分類精度が7.0ポイント向上し,提案手法の有効性が確認された。

    Link: https://arxiv.org/abs/2607.26763

  • 皮膚癌分類における外域汎化性能向上のためのロバストなデータ拡張の探索 [cs.NI, cs.CV, cs.AI]目的:皮膚癌の悪性・良性二値分類におけるデータ拡張によるロバスト性の向上
    • 皮膚癌の早期発見は重要であり,診断精度向上は医療現場で喫緊の課題である。
    • 皮膚画像診断器は,撮影機器や照明条件の変化によって性能が低下することが課題である。
    • この研究は,外域汎化性能を向上させるデータ拡張手法の特定を試みる。
    • 複合的なデータ拡張戦略(mix policy)が最も高い外域汎化性能の向上を示した。
    • 光度変換を含むデータ拡張が,外域汎化性能に貢献する主要な要素であった。
    • 独立した臨床データセットにおいては感度が0.591から0.818に向上したが,サンプル数の少なさから再現性に課題が残る。

    Link: https://arxiv.org/abs/2607.26765

  • See2Think:マルチモーダルモデルは本当に中間的な視覚状態を利用しているのか? [cs.CV, cs.AI]目的:マルチモーダルモデルにおける視覚状態の利用状況の評価
    • AIの高度化に伴い,視覚情報とテキスト情報を統合した推論能力が重要になっている。
    • 既存の評価指標は,タスクの種類が限られていたり,最終的な解答のみに焦点を当てていたりする。
    • 中間的な視覚状態が,モデルの推論過程においてどの程度活用されているかを詳細に分析すること。
    • モデルの視覚的推論は,モデルや環境に強く依存し,特定の条件が常に優位とは限らないことが示された。
    • モデルは適切な視覚的操作を選択する傾向にあるものの,正確な視覚状態のレンダリングがボトルネックになっている。
    • 関連性の高いフィードバックが与えられた場合,モデルの精度が低下し,視覚状態への依存性を示す結果が得られた。

    Link: https://arxiv.org/abs/2607.26769

  • クラスタ化された分散型学習における安定かつ予算制約を満たす連合形成:快楽主義的ポテンシャルゲームアプローチ [cs.GT, cs.LG]目的:クラスタ化された分散型学習における連合形成の安定性と予算実現可能性
    • 分散型学習は,データプライバシーを保ちつつ,複数のデバイスでモデルを学習できるため重要である。
    • 連合形成の安定性と予算制約を満たすことが課題であり,参加者のインセンティブ設計が難しい。
    • 安定した連合形成と予算実現可能性を両立するメカニズムを構築し,効率的な学習を実現すること。
    • 提案手法は,快楽主義的ポテンシャルゲームを用いて,安定した連合形成を保証する。
    • シミュレーション実験により,提案メカニズムが最適な福利厚生に近い結果を達成できることが示された。
    • CIFAR-10データセットを用いた実験では,提案手法が証明済みの福利厚生最適解に到達した。

    Link: https://arxiv.org/abs/2607.26788

  • PRISM-Net:患者固有参照ガイドを用いた両側性乳房対称性照合による乳房DCE-MRI三区分分類 [cs.CV]目的:乳房DCE-MRI画像における,病変なし,良性,悪性の三区分分類
    • 乳房DCE-MRIは,従来の病変中心診断を超え,乳房レベルでの診断への応用が期待されている
    • 患者固有の背景変動が,分類タスクにおいて画像情報の解釈を困難にする要因となっている
    • 背景を考慮した表現学習により,乳房非対称性の識別能力向上を目指す
    • PRISM-Netは,対側の乳房特徴を患者固有の参照として活用する登録不要な二側性フレームワークである。
    • ODELIAデータセットにおいて,既存手法を上回るMacro AUC,Micro AUC,quadratic weighted kappaが得られた。
    • 両側性関係のモデリングと非対称性に応じた重み付けが,分類性能の向上に貢献することが示された。

    Link: https://arxiv.org/abs/2607.26799

  • DistillAlign:自己回帰型動画蒸留におけるモードカバリングとモード探索の協調 [cs.RO, cs.RO, cs.CV]目的:自己回帰型動画蒸留における分布アライメントの重要性
    • 動画生成の品質向上には,効率的な学習手法が不可欠であり,蒸留はその有力な選択肢である。
    • 既存手法では,初期化と蒸留段階が分離されており,中間生徒モデルの評価が視覚的スコアに依存しがちである。
    • 分布アライメントを重視した蒸留手法を提案し,生成品質,カバレッジ,多様性の向上を目指す。
    • 提案手法DistillAlignは,モード探索とモードカバリングを組み合わせることで,既存手法の弱点を克服する。
    • Wan-1.3Bの教師モデルでも,Wan-14Bで改良したベースラインを上回り,分布アライメントの重要性を示す。
    • DistillAlignは,生成品質,カバレッジ,多様性の全てにおいて改善を達成した。

    Link: https://arxiv.org/abs/2607.26811

  • 不確実性から決定論へ:レイマッチングなしの粗視点から微視点への視覚的間取り図局所化 [cs.RO, cs.CV]目的:視覚的間取り図局所化の精度とロバスト性の向上
    • 屋内環境におけるロボットの自律移動やサービス提供には,正確な位置推定が不可欠である。
    • 視覚的間取り図局所化は,反復的な屋内レイアウトや異なるモダリティの情報非対称性により,位置推定の曖昧さが課題となっていた。
    • レイマッチングという中間段階を省略し,不確実性から決定論へのアプローチにより,位置推定の曖昧さを解消し,高精度な局所化を実現する。
    • 画像に基づいた姿勢拡散モデルを用いて,多峰性の姿勢分布を効率的にパラメータ化し,候補モードへの誘導を実現した。
    • 候補を中心とした間取り図から,サブメートル単位の姿勢残差を予測する局所化リファインナーを提案し,構造的な曖昧さを解消した。
    • オフラインでのマップ前処理やテスト時の参照テーブルを必要とせず,S3DおよびZInDベンチマークにおいて最先端の精度とロバスト性を達成した。

    Link: https://arxiv.org/abs/2607.26817

  • Ripple:クロスモーダル再帰的メモリを用いたリアルタイムストリーミングオーディオ・ビデオ生成 [cs.CV]目的:リアルタイムオーディオ・ビデオ生成システムの開発
    • オーディオ・ビデオ生成技術は,エンターテイメントやコミュニケーションなど多岐にわたる応用が期待されている。
    • 既存の生成モデルは遅延が大きく,リアルタイム処理が困難であり,長尺コンテンツ生成も課題である。
    • 遅延を低減し,長尺コンテンツを生成可能なリアルタイムオーディオ・ビデオ生成技術を確立すること。
    • Rippleは,固定長のスライディングウィンドウアテンションと,オーディオ・ビデオ固有のメモリ状態を組み合わせることで,効率的なストリーミング推論を実現した。
    • クロスモーダルメモリインタラクションにより,オーディオ・ビジュアル同期の精度が向上した。
    • 実験の結果,Rippleは480P解像度で約28FPSを達成し,既存手法よりも高速かつコヒーレントな長尺生成が可能であることが示された。

    Link: https://arxiv.org/abs/2607.26818

  • BATS:境界認識混合解像度トークンによるリソース効率的な体積セグメンテーション [cs.CV, cs.LG]目的:体積セグメンテーションにおけるリソース効率の向上
    • 医療画像解析において,正確なセグメンテーションは診断・治療計画に不可欠である。
    • 高性能なモデルはメモリ消費量が多く,計算コストが高いという課題がある。
    • 境界付近の処理に集中することで,メモリ効率と推論速度の改善を目指す。
    • BATSは,比較対象モデルの中でLiTS Diceスコアで最高の結果を達成した。
    • BATSは,MedNeXt-Lと比較して,GPUメモリ使用量を53%以上削減した。
    • データセットの境界密度によって,推論時間と精度が変化する。

    Link: https://arxiv.org/abs/2607.26829

  • 原子層堆積/エッチング(ALD/E)科学図形からの情報抽出に関するICDAR 2026競技会 [eess.SY, cs.SY, cs.CV]目的:科学図形からの情報抽出
    • 科学研究の発展には,論文テキストだけでは得られない図表情報の理解が不可欠である。
    • 既存の手法では,科学図形から正確かつ効率的に情報を抽出することが困難である。
    • マルチモーダルAIを用いた科学図形の理解と推論能力の向上を目指す。
    • 最先端のマルチモーダルモデルは分類と要約タスクでは良好な性能を示す。
    • しかし,データ抽出と科学的推論,特に視覚的質疑応答においては課題が残る。
    • 本研究は,ドメイン知識を意識したマルチモーダルAIシステムの改善に向けた課題と機会を提示する。

    Link: https://arxiv.org/abs/2607.26848

  • ハイブリッド人間-AI音楽におけるAI生成ステムの検出 [cs.CL, cs.SD]目的:人間が制作した音源とAIが生成した音源を組み合わせたハイブリッド音楽トラックにおいて,AI生成ステムを検出すること
    • 音楽制作においてAIの利用が拡大する中,AI生成音楽の真偽を見抜く技術の重要性が増している。
    • AI生成音楽の検出は進展しているものの,人間とAIが共同で制作した音楽の検出は困難である。
    • ハイブリッド音楽におけるAI生成ステムの検出手法を確立し,音楽制作におけるAIの透明性を高める。
    • AI生成音楽に特有のアーティファクトが,ハイブリッド音楽のステムレベルでも検出可能であることが示唆された。
    • 汎用的な音源分離システムでは,AI生成ステム由来のアーティファクトを確実に復元することは難しいことが確認された。
    • 音源分離とAI生成ミックス検出を組み合わせた並列アーキテクチャが,AI生成ステムの検出において有望な結果を示した。

    Link: https://arxiv.org/abs/2607.26874

  • SCALPEL:LLM駆動エンコーダ学習による意味的クロスモーダルアライメント:医療画像と言語表現 [cs.CV]目的:医療画像と言語の表現学習のための意味的クロスモーダルアライメント
    • 医療分野におけるマルチモーダルなデータ活用は,診断や治療の精度向上に不可欠である。
    • 既存の医療VLPフレームワークは,長い臨床レポートの処理において,テキストエンコーダの性能が限界となる場合がある。
    • 大規模言語モデルの医療応用における課題(表現の偏り,メモリ負荷,誤った情報生成)を克服し,より高精度な表現学習を実現する。
    • SCALPELは,臨床レポートの対照学習により,生成的なLLMを等方的なエンコーダに変換する。
    • 非対称アライメント戦略とオフライン特徴キャッシュにより,効率的な学習を実現している。
    • 解剖学的部位と否定表現を考慮した損失関数により,画像とテキストの不一致を抑制し,性能を向上させている。

    Link: https://arxiv.org/abs/2607.26885

  • 画像なしでの医療診断:Vision-Languageモデルの虚偽診断 [cs.CV, cs.AI, cs.CL, cs.CY]目的:画像なしの状況下におけるVision-Languageモデルの医療診断における虚偽診断のメカニズム
    • 医療現場におけるAIの活用が期待される中,画像診断支援システムの精度と信頼性が重要課題となっている。
    • Vision-Languageモデルは,画像情報なしに診断を下す際に,患者属性に基づいて誤った診断を下す可能性がある。
    • 本研究は,画像なしでのVision-Languageモデルの虚偽診断の構造を明らかにし,安全な臨床利用のための評価方法を提示する。
    • 大規模言語モデルは,画像なしで患者の属性情報のみを与えられた場合,誤った診断を下すことが確認された。
    • 特に,Claude Opus-4.7とGPT-5.4は,患者属性によって診断結果が系統的に変化し,特定の属性に対して特定の疾患を頻繁に診断した。
    • モデルの診断結果と根拠の乖離や,用いる単語による診断結果の変化など,虚偽診断には複数のパターンが存在することが示唆された。

    Link: https://arxiv.org/abs/2607.26886

  • 構造を意識したガウススプラッティングによる関節オブジェクトの再構成 [cs.GR, cs.CV, cs.RO]目的:関節オブジェクトの再構成
    • 物理的な相互作用を可能にするためには,オブジェクトの構造を理解することが重要である。
    • 既存手法では,幾何学,外観,運動パラメータの絡み合いにより,部品の分解が困難である。
    • 構造を意識したガイダンスにより,部品の分解精度と形状の品質を向上させる。
    • 本研究では,3Dガウススプラッティングに構造を意識したガイダンスを組み込んだStructureGSを提案する。
    • 部品の空間的なまとまりと隣接部品間の物理的に妥当な接触関係を構造を意識した損失関数で実現する。
    • 実験の結果,提案手法は関節オブジェクトの再構成において最先端の性能を達成した。

    Link: https://arxiv.org/abs/2607.26889

  • 凸状非衝突領域 [cs.GR, cs.CG, cs.RO]目的:凸状非衝突領域の表現と活用
    • 変形物シミュレーションにおいて,衝突処理はリアリティと安定性の確保に不可欠である。
    • 既存手法は,暗黙的な衝突判定に依存し,複雑な状況下での安定性に課題がある。
    • 本研究は,明示的な凸状非衝突領域を構築し,よりロバストかつ効率的な衝突処理を目指す。
    • 本手法は,頂点ごとに独立した凸状非衝突領域を事前に定義することで,一次衝突だけでなく二次衝突や共次元接触にも対応可能である。
    • 非線形最適化に依存せず,XPBDなどのシミュレーションフレームワークとの互換性が高い。
    • 布,髪,ワイヤー,粒子系など,多様なシミュレーションにおいて,汎用性と効率性が確認された。

    Link: https://arxiv.org/abs/2607.26901

  • CinemaTraj:LLMエージェントによる3Dシーンの原子的なカメラ軌跡の構成 [cs.CL, cs.CV]目的:3Dシーンに対するシネマティックなカメラ軌跡の自動生成
    • 没入感の高い映像体験の提供は,不動産広告やバーチャルツアーなど,様々な分野で重要性が高まっている。
    • 従来の技術では,真の3D空間認識が不足するか,軌跡生成を映像的な意味を考慮しない幾何学的問題として扱っている。
    • 自然言語による指示に基づき,3D空間を理解した上で,シネマティックなカメラワークを実現する。
    • CinemaTrajは,言語に基づいた空間推論問題としてカメラ軌跡の計画を再構築するフレームワークである。
    • LLMエージェントが3Dシーングラフを活用し,指示をカメラの動き(ドリー,オービット等)に分解し,最適化を行う。
    • ScanNet++環境での評価により,CinemaTrajが既存手法を上回る指示への忠実性,軌跡の質,安全性を実現した。

    Link: https://arxiv.org/abs/2607.26910

  • 過去の方向性:GUIグラウンディングが過去に囚われる理由 [cs.CV]目的:視覚的ロックインのメカニズム解明
    • GUIグラウンディングは,人間とAIのインタラクションにおいて重要な役割を担う。
    • 視覚情報が変化しても,過去の情報に影響され,誤った判断を下す問題がある。
    • 過去の情報に縛られる「視覚的ロックイン」の要因を特定し,改善策を提示する。
    • 視覚的ロックインは,モデル表現の最終的な変化前の変動幅が小さいほど顕著になる。
    • 過去の情報による変化は,特定の軸(Prior Directions)に集中する傾向があることが示された。
    • Prior Directionsに沿った成分を除去することで,視覚的グラウンディングが改善されることが確認された。

    Link: https://arxiv.org/abs/2607.26913

  • キーポイントから予測分布へ:YOLO-Poseモデルの事後不確実性 [cs.MA, cs.CV]目的:YOLO-Poseモデルにおけるキーポイント位置の空間的不確実性の定量化
    • 物体検出と姿勢推定は,ロボティクスや自動運転など広範な応用分野で不可欠である。
    • YOLO-Poseモデルは効率的だが,予測の信頼性を示す不確実性を出力しない。
    • 予測されるキーポイント位置の不確実性を事後的に推定し,信頼性評価を可能にすること。
    • 提案手法は,YOLO-Poseモデルに軽量な確率的拡張を加えることで,キーポイント位置の予測分布を生成する。
    • Student-t分布による較正が,実験的残差分布を最も良く捉え,不確実性に基づくキーポイントの刈り込みが信頼性の低いキーポイントを除去する。
    • 航空機着陸の応用例において,滑走路キーポイントの共分散行列を利用した不確実性考慮型航空機位置推定が可能となる。

    Link: https://arxiv.org/abs/2607.26921

  • 継続的指示チューニングのための漸進的マルチモーダルアラインメント [cs.CV, cs.AI]目的:マルチモーダル大規模言語モデルにおける,視覚表現と言語埋め込み空間のアラインメント維持
    • マルチモーダルLLMの性能は,視覚情報と言語情報の適切なアラインメントに大きく依存する。
    • 継続的な指示チューニングにおいて,視覚分布の変化によりアラインメントが不安定化し,性能劣化を引き起こす。
    • アラインメントの安定性を保ちつつ,新たな視覚分布に適応する手法を開発し,性能低下を防ぐ。
    • 提案手法PMAは,軽量な表現記述子を用いてマルチモーダル分布の変化を検出し,必要に応じて専門家ネットワークを拡張する。
    • PMAは,既存のアラインメントを固定しつつ,柔軟に変化に対応することで,安定性と可塑性のバランスを実現する。
    • 2つのMCITベンチマーク実験で,PMAが既存手法を上回り,様々なLLMバックボーンで高い性能を発揮することが示された。

    Link: https://arxiv.org/abs/2607.26947

  • 季節不変対応を用いたマルチデート衛星画像に対するロバストなRPCバンドル調整 [cs.CL, cs.NI, cs.CL, eess.SY, cs.SY, cs.CV]目的:高精度な衛星画像測位のためのRational Polynomial Camera (RPC)モデルの改良
    • 衛星画像の正確な測位は,地図作成や環境モニタリングなど,多くの応用分野において不可欠である。
    • 季節変化や地表面の変化により,従来の手法では特徴点マッチングの信頼性が低下し,RPCモデルの精度が損なわれる。
    • 季節変化にロバストな特徴点マッチングと画像ペア選択により,RPCモデルの改良における精度と効率を向上させる。
    • 本研究では,学習された局所特徴量マッチングとグローバル画像記述子を組み合わせることで,季節変化の影響を受けにくいRPC改良パイプラインを提案した。
    • 提案手法は,WorldView-3画像を用いた実験において,オープンソースのベースラインと比較して,相対的なRPC改良精度を向上させ,幾何学的整合性の誤差を低減した。
    • また,39-42ビューのコレクションにおいて,マッチング時間を大幅に短縮し,より効率的なRPC改良を可能にした。

    Link: https://arxiv.org/abs/2607.26973

  • InkShield:不正な筆跡模倣に対する筆跡スタイル保護 [cs.CR, cs.CV]目的:筆跡スタイルの不正な模倣に対するプロアクティブな防御機構
    • 文書の信頼性と個人の識別情報は重要であり,偽造やなりすましから保護する必要がある。
    • 公開されている筆跡サンプルから,筆跡スタイルを再現する技術が進歩しており,文書偽造のリスクが高まっている。
    • 筆跡の公開前に微小な摂動を加えることで,不正な筆跡模倣を効果的に防御することを目指す。
    • InkShieldは,筆跡生成モデルを利用し,筆跡のストロークエッジに摂動を集中させることで,視覚的な品質を維持しつつ筆跡スタイルを保護する。
    • 実験の結果,生成されたサンプルがターゲットライターとして認識される確率が大幅に低下し,保護された参照画像は元の画像と視覚的に近いことが確認された。
    • InkShieldは,他の筆跡生成モデルへの転移性も示しており,実用的な筆跡スタイル保護の手段となりうる。

    Link: https://arxiv.org/abs/2607.26976

  • 宝くじチケットはデプロイチケットではない [cs.LG, cs.CV]目的:モデルの振る舞いに対するスパース化,圧縮,宝くじチケットの影響評価
    • 深層学習モデルの効率的なデプロイは,計算資源の制約や運用コスト削減の観点から重要である。
    • スパース化手法がモデルの振る舞いに与える影響は一様ではなく,場合によっては性能劣化を引き起こす可能性がある。
    • 既存モデルを置き換える際の,振る舞いの互換性を定量的に評価し,デプロイにおけるリスクを明確にすること。
    • スパース化されたモデルは,元のモデルと同程度の精度を回復するものの,振る舞いには差異が見られた。
    • 特に,固定閾値ポリシーを用いる場合,宝くじチケットによる置き換えは,accept-reviewの決定を7〜10%変更させる。
    • 精度の改善だけでは,既存システムとの完全な互換性を保証できず,ダウンストリームの再設定や検証が必要となる場合がある。

    Link: https://arxiv.org/abs/2607.27031

  • モンテカルロ反事実後悔最小化のための相関付き確率サンプリング [cs.GT]目的:モンテカルロ反事実後悔最小化における確率分布のサンプリング手法の改善
    • ゲーム理論における不完全情報ゲームの解法は,経済学やAI分野で重要である。
    • 従来のモンテカルロ法では,サンプリングの精度が低く,計算コストが高いという課題があった。
    • 相関付き確率サンプリングによって,より効率的に精度を向上させ,実用的な規模のゲームに対応すること。
    • 相関付き確率サンプリングを用いることで,独立サンプリングと比較して,局所的な頻度誤差を大幅に削減できることが示された。
    • クーンポーカーやレダックポーカーの実験において,最終的な搾取可能性を19.05%から34.01%まで低減することに成功した。
    • 本手法は,新たなハイパーパラメータを導入せず,計算時間のオーバーヘッドもほとんどないため,容易に既存の手法に組み込むことができる。

    Link: https://arxiv.org/abs/2607.27035

  • ビデオ表現の正則化による誤差の累積軽減 [cs.CV, cs.LG]目的:ビデオ拡散モデルにおける誤差の累積機構の解明と,長期生成の安定化
    • ロボティクスや自動運転など,長期間のビデオ生成は重要性を増している。
    • ビデオ生成における自己回帰推論では,誤差が累積し,フレーム品質が低下する問題がある。
    • モデル内部表現の劣化を抑制し,長期的な安定生成を実現することを目指す。
    • ビデオ拡散モデルにおける誤差の累積は,隠れ表現の次元崩壊と密接に関連することが明らかになった。
    • 誤差の累積度合いを定量化する指標として,表現の有効ランク(erank)の低下が確認された。
    • ビデオ表現の正則化により,VBenchにおける画質評価指標が大幅に向上した。

    Link: https://arxiv.org/abs/2607.27036

  • 中国農村地域における自動運転向け物体検出:実写・合成データ混合とモデル評価に関する実験的研究 [cs.CV]目的:中国農村地域における自動運転向け物体検出モデルの性能評価とデータ戦略の検討
    • 自動運転技術は,地方の交通課題解決や移動手段の多様化に貢献する可能性を秘めている。
    • 中国農村地域特有の交通状況下では,十分な学習データが得られず,汎化性能が課題となっている。
    • 実写データと合成データを適切に混合することで,データ不足を補い,性能向上を目指す。
    • 実写データと合成データを1:0.5の割合で混合することで,検出性能が向上し,YOLO11mが最も高いmAP@0.5 (0.758) を達成した。
    • 合成データの比率を1:1に高めると,ドメインシフトが発生し,性能向上の効果が打ち消されることが示された。
    • 屋台や柵など,まれな物体に対する検出精度には改善の余地が残されている。

    Link: https://arxiv.org/abs/2607.27058

  • ScratchSim:表面傷検出のための手続き型合成データパイプライン [cs.CV, cs.AI]目的:表面傷検出のための大規模注釈付き合成トレーニングデータ生成
    • 産業品質管理において,自動欠陥検出は重要な役割を担う。人手による検査の限界を克服するため,自動化が求められている。
    • 欠陥データの注釈付きデータが不足していることが,自動欠陥検出の課題となっている。高品質な学習データ確保が困難である。
    • 本研究は,大規模な実データ注釈の負担なく,スケーラブルな欠陥検出を実現することを目的とする。
    • 合成データで事前学習することで,実データのみで学習するよりも性能が向上することが示された。
    • 実データが不足する場合,合成データと実データの混合学習が有効であることが確認された。
    • 本手法は,畳み込みニューラルネットワークとTransformerベースのアーキテクチャの両方で有効であることが示された。

    Link: https://arxiv.org/abs/2607.27065