arXiv雑要約

画像・音声 - 2026/08/04 公開

  • NISF++:2D心臓短軸・長軸MR画像からの幾何学的基盤に基づいた3D+時間的心機能暗黙的表現 [cs.CY, cs.IR, cs.CV]目的:心臓MR画像からの3D+時間的心機能の暗黙的表現構築
    • 心臓疾患の診断・治療において,心臓の3次元的かつ時間的な機能把握は重要である。
    • 従来の深層学習アーキテクチャは,2D画像処理に偏り,複数平面からの情報を統合しにくい。
    • 本研究は,心臓MR画像から一貫性のある3D+時間的表現を構築し,空間的・時間的な精度向上を目指す。
    • 提案手法は,様々な角度のMR画像から共有の3D+時間的表現を構築し,スライス間の空間的・時間的整合性を実現した。
    • 呼吸や患者の動きによる画像ずれを補正する機能を持ち,スライス位置の精度向上を定量・定性的に示した。
    • 分割性能は既存手法と同等であり,精度向上により,教師データの限界を超える予測も可能となった。

    Link: https://arxiv.org/abs/2608.00752

  • Hi-TOPS:階層的トポロジー認識スコアリング事前分布による3Dパーツ分解 [cs.CL, cs.GR, cs.CV]目的:3Dパーツ分解のための階層的トポロジー認識スコアリング事前分布
    • 3D形状の理解と操作において,パーツ分解は重要な基盤技術である。
    • 既存手法は,関節や薄い構造の保持とノイズへのロバスト性のバランスが課題である。
    • 関節や薄い構造を正確に保持しつつ,ノイズに強い安定した分解を目指す。
    • 提案手法Hi-TOPSは,多解像度のFlow-Freezeフィールドを用いて,パーツ分解の精度を向上させる。
    • Flow領域はパーツの広がりを支援し,Freeze領域は関節や薄い構造近傍での成長を抑制する。
    • 多様なベンチマークテストにおいて,Hi-TOPSはセマンティック情報や2D事前知識なしに,安定した分解結果を提供した。

    Link: https://arxiv.org/abs/2608.00767

  • ChordVideo:低エネルギー伝搬による,ワンステップで学習不要な,時間的に一貫性のある動画編集 [cs.CV]目的:ワンステップ画像生成モデルを用いた,学習・転置不要な動画編集手法
    • 動画編集は,コンテンツ制作において不可欠であり,その効率化と高品質化が求められている。
    • 既存手法では,フレームごとに編集を行うと時間的なちらつきや編集強度のずれが生じる。
    • 時間的な一貫性を保ちつつ,効率的に動画編集を行うこと。
    • ChordVideoは,フレーム間のノイズ共有と因果集約により,時間的なちらつきと編集強度のずれを大幅に削減する。
    • TGVE/DAVISデータセットにおいて,ChordVideoはワープ誤差を78%,ちらつきを49%削減し,フレームの一貫性と背景のPSNRを向上させる。
    • 他の複数ステップ編集器と比較して,大幅に少ないモデルステップ数で競合する性能を達成する。

    Link: https://arxiv.org/abs/2608.00769

  • ORCESTRA:混合現実におけるVLM駆動のビジュアルロボットプログラミング [cs.RO, cs.CV, cs.HC]目的:混合現実環境におけるロボットのデジタルツインのプログラミング手法
    • ロボットの活用範囲拡大のため,より直感的で安全なプログラミング手法が求められている。
    • 従来のロボットプログラミングは専門知識が必要で,物理環境での検証にリスクを伴う。
    • 言語と視覚情報を用いた混合現実環境で,安全なロボットプログラミングを実現すること。
    • 本システムは,複合現実空間において,ロボットのデジタルツインを,コーディングなしでウェイポイント教示や言語による制御によってプログラミングすることを可能にする。
    • 言語モデルを用いて,自然言語による指示を構造化されたデジタルツインの計画に変換し,ロボットの動作を予測・検証できる。
    • 異なるロボットの形態に対応し,物理的な配置前に複合現実空間で安全性を確認できる点が特徴である。

    Link: https://arxiv.org/abs/2608.00775

  • 私的な位置選好を持つオークション [cs.MA, cs.GT]目的:位置選好を持つ入札者によるオークションにおける効率的な配分
    • オークション設計は,資源配分の効率性を高める上で重要な役割を果たす。
    • 入札者の選好が非公開である場合,効率的な配分を達成することが難しい。
    • 入札者の位置選好を考慮したオークションメカニズムの設計による効率性向上を目指す。
    • 標準的な一律価格オークションでは,あらゆるタイプ構成において効率的な配分を ex-post で実現する戦略プロファイルは存在しないことが示された。
    • 分布に依存しない均衡厚生保証は $\frac{1}{2}$ であることが証明された。
    • 入札額の二進数表現に加えて,少なくとも1ビットの情報伝達が必要であることが,決定論的な一次ラウンドオークションにおいて示された。

    Link: https://arxiv.org/abs/2608.00786

  • CADENA:段階的CADリバースエンジニアリング [cs.CV]目的:既存の形状から編集可能なモデルへの変換
    • 現代のエンジニアリングの基盤であり,設計・製造において不可欠な技術である。
    • 既存の形状を編集可能なCADモデルに変換するには,専門的な知識と労力が依然として必要とされる。
    • 中間形状の検証を繰り返す人間工学に基づき,段階的にCADプログラムを再構築する手法を確立する。
    • CADENAは,ターゲット形状と予測ジオメトリを各ステップで比較しながら,パラメトリックCADプログラムを逐次的に構築する。
    • 機械部品のリバースエンジニアリング手法を評価するためのベンチマークデータセットCADENA-Benchを新たに導入した。
    • CADENAは,既存手法と比較してCADENA-Benchおよび複数のデータセットで優れた性能を発揮した。

    Link: https://arxiv.org/abs/2608.00799

  • AIMold:複雑な金型設計のための自律型AIパイプライン [cs.CV]目的:複雑形状の部品に対応した金型設計の自動化
    • プラスチック製品の大量生産において金型設計は不可欠であり,製造業の効率化に貢献する。
    • アンダーカット等を含む複雑形状の金型設計は専門知識が必要であり,自動化が困難である。
    • 複雑形状に対応可能な金型設計を自動化し,専門家の負担軽減と効率化を目指す。
    • 本研究では,複雑な形状のCADモデルと,それに対応する金型アセンブリをペアにしたデータセットMoldCADを構築した。
    • このデータセットを活用し,離型方向の予測,補助部品の特定,そして分割面の構築を行うパイプラインを提案した。
    • 提案パイプラインは,完全自動化された工業用金型設計の実現に貢献し,製造を意識したCAD生成の発展に寄与する。

    Link: https://arxiv.org/abs/2608.00800

  • ウェアラブル無声音声インターフェースのための大規模オープンボキャブラリ三種モ−ダルデータセットSoniSpeech [cs.SD, cs.HC, cs.LG]目的:ウェアラブル無声音声インターフェースのための大規模三種モ−ダルデータセット
    • ウェアラブル無声音声インターフェースは,利便性が高く,様々な応用が期待されるため重要である。
    • 既存のウェアラブル無声音声インターフェースは,語彙サイズが小さく,実用性に課題がある。
    • 本研究は,大規模かつオープンボキャブラリなデータセットを構築し,認識性能の向上を目指す。
    • SoniSpeechは,超音波エコープロファイル,音声,顔面ビデオの三種モ−ダルデータセットであり,18,000の発話を含む。
    • このデータセットを用いて,オープンボキャブラリ無声音声認識のベンチマークを確立し,26.3%の単語誤り率を達成した。
    • データセットは公開されており,今後の研究開発に貢献することが期待される。

    Link: https://arxiv.org/abs/2608.00803

  • フリーミアムだけで十分である [cs.RO, cs.CL, cs.RO, cs.GT]目的:生成AIサービスの需要と最適な価格・品質戦略
    • 生成AIの急速な発展に伴い,サービスの提供コストと品質向上が重要な課題となっている。
    • 無料提供によるデータ収集とプライバシー保護のバランスが,サービスの持続可能性を左右する。
    • サービスの収益性と品質を両立させるための,最適な価格設定と品質管理戦略を明らかにすること。
    • 有料リクエストと無料リクエストのバランスにより,サービスの品質が安定した状態に収束することが示された。
    • 最適な価格・品質戦略は,ユーザーの価値閾値を用いて表現可能であり,閉形式解が存在する場合もある。
    • 推論コストに応じて,無料サービス提供の条件が変化することが明らかになった。

    Link: https://arxiv.org/abs/2608.00823

  • 脆弱X症候群におけるα・γ脳波バイオマーカーのための深層学習CNNと再帰解析 [cs.LG, cs.AI, cs.CV, physics.data-an, q-bio.NC]目的:脆弱X症候群の脳波表現型を自動的に特徴づけるための深層学習フレームワーク
    • 神経発達障害の客観的指標が求められており,脳波は非侵襲的な評価手段として重要である。
    • 脆弱X症候群の脳波におけるα波とγ波の異常は確認されているが,その定量的な解析が課題である。
    • 深層学習を用いて,脳波のα波とγ波を統合的に解析することで,より正確なバイオマーカーを開発すること。
    • 提案手法は,単一のモダリティよりも高い識別性能を示し,γ波の特徴量が特に有効であることが示された。
    • α波とγ波の統合解析は,最も優れた全体的な性能を示し,深層学習による非線形表現の有用性が示唆された。
    • 本研究は,脆弱X症候群の診断,層別化,治療モニタリングへの応用が期待される,スケーラブルな脳波バイオマーカー開発への道を開く。

    Link: https://arxiv.org/abs/2608.00835

  • モデルをツールとして:統合マルチモーダルビジュアルトラッキングのためのエージェント的協調フレームワーク [cs.CY, cs.HC, cs.CV]目的:統合マルチモーダルビジュアルトラッキングのためのエージェント的協調フレームワーク
    • 近年,ビジュアルトラッキングは進歩を遂げているが,入力コンテキストの長さに依存し,性能向上の限界が見られる。
    • 既存手法は,汎用モデルを単一的に利用するか,セグメンテーションモデルをトラッキングパイプラインに改造するため,各モデルの強みを活かしきれていない。
    • 異種モデルをツールとして協調させ,それぞれの強みを統合することで,長期間トラッキングにおけるエラー訂正能力を高める。
    • 提案手法ACTrackは,RGBベンチマークにおいて,既存の最先端トラッカーを大幅に上回る性能を達成した。
    • パラメータ効率的な適応戦略により,30%の学習可能なパラメータで,LasHeR,VisEvent,TNL2K,DepthTrackといったマルチモーダルベンチマークでも優れた性能を示した。
    • ACTrackは,ターゲット識別,モーション推定,注意散漫の検出,エラー累積の軽減といった機能を,ツール間の協調によって実現している。

    Link: https://arxiv.org/abs/2608.00847

  • MIDAL:アクセシブルな学習のための数学画像記述 [cs.DC, cs.AR, cs.CV, cs.HC]目的:アクセシブルな学習を支援するための数学画像記述データセット
    • STEM教育における教材のアクセシビリティ向上は,学習機会の均等化に不可欠である。
    • 数学などの専門分野の画像記述は,複雑な表現や専門用語が多く,作成が困難である。
    • 数学画像の自動記述を通じて,STEM教材のアクセシビリティ改善に貢献すること。
    • MIDALは,2,020枚の数学画像を含むデータセットであり,複数の教育レベルに対応している。
    • このデータセットは,視覚言語モデルの訓練に役立ち,アクセシビリティに配慮した画像記述の生成を支援する。
    • MIDALは,数学的推論能力と回答能力を向上させる言語モデルのファインチューニングにも利用可能である。

    Link: https://arxiv.org/abs/2608.00868

  • 時系列衛星画像からの訓練不要汎用作物マッピング:PhenoStitch [cs.CV, cs.LG]目的:汎用作物マッピングのパイプライン
    • 食料安全保障の観点から,作物の分布把握は重要であり,その効率化が求められている。
    • 従来の作物のマッピング手法は,大量のラベル付きデータとタスク固有のモデル学習に依存しており,新しい地域への適用が困難である。
    • 本研究では,ラベルをほとんど必要とせず,タスク固有の学習を行わずに汎用的な作物マッピングを実現することを目指す。
    • PhenoStitchは,事前に学習済みの分割モデルと,光学およびレーダーデータの時系列情報を活用することで,少ないラベルで高精度な作物マッピングを可能にした。
    • PASTIS-Rデータセットにおいて,既存のベースライン手法と比較して,作物のmIoU,セグメンテーション品質,汎用品質において優れた性能を示した。
    • レーダー観測データが最も大きな性能向上に貢献し,グラフエネルギーによるマージとコンパクトなフェノロジー特徴量も改善に寄与することが示された。

    Link: https://arxiv.org/abs/2608.00870

  • 連合学習における類似度重み集約と全体的差分プライバシーによる脳病変セグメンテーション [cs.AI, cs.CR, cs.CV]目的:脳病変セグメンテーションのための連合学習フレームワークの開発
    • 医療画像診断において,複数施設が協力してモデルを学習することで,より高精度な診断が可能となる。
    • 各施設のデータ分布の不均一性や,モデル更新を通じた情報漏洩のリスクが課題となっている。
    • データ共有を伴わない,プライバシー保護された連合学習システムの実現を目指す。
    • 提案手法DP-SimAggは,類似度に基づく重み付け集約とサーバー側の差分プライバシーメカニズムを統合する。
    • 厳格なプライバシー予算下(epsilon = 1)においても,競争力のあるセグメンテーション性能を維持した。
    • プライバシー予算を緩和した場合(epsilon = 10),非プライベートなベースラインに匹敵する性能が得られた。

    Link: https://arxiv.org/abs/2608.00872

  • DRONEAUDIONET:ドローン聴覚に基づく探索・救助のためのノイズ抑制 [cs.SD, eess.AS]目的:ドローン聴覚のためのノイズ抑制手法
    • ドローンは,捜索救助,野生動物モニタリングなど,空中音響シーン分析への応用が期待される。
    • ドローンのローターノイズが混合信号を支配し,音源の分離が極めて困難である。
    • ドローンに特化したノイズ抑制により,音響知覚の信頼性向上を目指す。
    • DRONEAUDIONETは,既存手法と比較して,下流の音響分類性能を改善する。
    • 特に,人間の音声に関する性能向上は顕著である。
    • この研究は,ドローンを用いた現実世界の探索・救助への応用可能性を示す。

    Link: https://arxiv.org/abs/2608.00875

  • 局所 Chan-Vese 分割のための MBO スキーム [cs.NI, cs.DC, cs.CV, cs.NA, eess.IV, math.NA]目的:局所 Chan-Vese (LCV) モデルの解法
    • 画像処理において,正確な画像分割は重要であり,医療診断や画像解析の精度向上に不可欠である。
    • 従来の Chan-Vese モデルは,輝度変化に弱く,複雑な画像を正確に分割することが困難である。
    • 本研究は,LCV モデルの効率的な解法を提供し,よりロバストで高速な画像分割を実現することを目指す。
    • 提案手法は,LCV モデルを解くための Merriman-Bence-Osher (MBO) スキームを導出し,効率的な実装を提案する。
    • 本アルゴリズムは,2相および多相分割に対応し,カラー画像への拡張も議論する。
    • 様々なグレースケール画像およびカラー画像(医療画像や顕微鏡画像を含む)への適用により,提案手法の有効性が示された。

    Link: https://arxiv.org/abs/2608.00893

  • PeCA:アニメーション動画におけるテスト時ペイントバケット彩色のためのパレットコンテキスト支援推論 [cs.CL, cs.CV]目的:アニメーション動画のテスト時ペイントバケット彩色における性能向上
    • アニメーション制作において,手描きアニメーションの彩色作業は重要な工程である。
    • 領域の曖昧性により,参照デザインシートとの対応付けが困難な場合がある。
    • 空間的・時間的コンテキストを活用し,テスト時にこの課題を解決することを目指す。
    • 提案手法PeCAは,追加学習なしで既存のパイプラインに組み込むことが可能である。
    • 実験の結果,既存のベンチマークと新規テストケースで性能向上が確認された。
    • 空間的・時間的コンテキストを考慮することで,曖昧な領域の彩色精度が向上する。

    Link: https://arxiv.org/abs/2608.00903

  • 見上げ,振り返り:パノラマSLAMのための凍結済み基礎モデルにおける隠れた注意と潜在的な方向性 [cs.CV]目的:単眼パノラマSLAMにおける誤差の原因となるカメラの傾き,スケールドリフト,誤ったループクロージャ問題の解決
    • パノラマSLAMは広範囲なカメラ回転下で視覚的な重複の恩恵を受けるが,実用化には精度向上が不可欠である。
    • 従来のSLAMはカメラの傾きやスケールの変動に弱く,誤ったループクロージャが頻繁に発生する。
    • 凍結済み基礎モデルの持つ隠れた注意と方向性情報を活用し,ロバストなSLAMを実現すること。
    • 凍結済みパノラマ基礎モデルが,明示的な幾何学的出力に加えて,重力や再訪可能性を示す有用な内部情報を持つことが示された。
    • HALO-SLAMは,重力読み出しによるIMU不要な球面正準化と,注意に基づいたループクロージャにより高い精度を実現した。
    • 5つのパノラマベンチマークにおいて,100%のシーケンス成功率と,既存手法と比較して30~88%のATE削減を達成した。

    Link: https://arxiv.org/abs/2608.00925

  • スティプル:視覚慣性追跡を用いたリアルタイム増分ガウススプラッティング [cs.RO, cs.CV]目的:リアルタイムの3Dガウススプラッティングによるシーン再構成
    • ロボティクスやXRなど,リアルタイムな環境理解が求められる分野において重要である。
    • 従来の3Dガウススプラッティングは,前処理や学習に時間を要し,リアルタイム処理には不向きである。
    • 視覚慣性追跡と組み合わせることで,リアルタイムな再構成を実現し,その課題を解決する。
    • 効率的な視覚慣性追跡システムBasaltと,3Dガウススプラッティング実装Brushを活用した新たな手法を提案した。
    • 3DGSの重い前処理や学習ステップを,追跡システムからの情報にアクセス可能な効率的な増分学習戦略に置き換えた。
    • SLAMと3DGSの相乗効果を活かし,リアルタイム3D再構成の可能性を示した。

    Link: https://arxiv.org/abs/2608.00931

  • GraRe:フローズン6DoFグリッパー検出器のための候補再ランキング [cs.RO, cs.RO, cs.AI, cs.CV, cs.LG]目的:グリッパー候補の再ランキング
    • ロボットハンドによる物把持は,自動化において重要な役割を担う。
    • 既存のグリッパー検出器の信頼度と把持品質が一致せず,良好な候補が低い順位になりがち。
    • 検出器を変更せずに,候補の順位を改善することで把持成功率の向上を目指す。
    • GraReは,候補属性,シェル層状の局所形状,オブジェクトのコンテキストから把持品質を推定する。
    • 提案手法により,GraspNet-1Billionにおいて平均APが最大13.60ポイント向上した。
    • 実ロボット実験でも,雑然とした環境下での安定した把持が実証された。

    Link: https://arxiv.org/abs/2608.00946

  • Swimm3R:水中3D再構成のための媒体を考慮したSfMスプラッティング [cs.CV, cs.RO, eess.IV]目的:水中3D再構成における散乱と減衰による失敗への対処
    • 水中環境の3D再構成は,海洋調査や資源探査など,多岐にわたる応用分野で重要である。
    • 水中では,光の散乱と減衰が激しく,従来の3D再構成手法では正確な復元が困難である。
    • 本研究は,媒体の影響を考慮したSfMとUnderwater Beta Splattingを組み合わせることで,水中環境におけるロバストな3D再構成を目指す。
    • Swimm3Rは,空気中の幾何学的事前知識を抽出し,水中画像形成パラメータ,カメラ姿勢,復元された点群を回帰する。
    • Underwater Beta Splattingは,Betaプリミティブと散乱を考慮した幾何学的勾配により,安定した水中幾何学的表現を実現する。
    • バーバドス水中ビデオデータセットを用いて,Swimm3Rが困難な水中環境下で一貫した海底幾何学を復元できることを示す。

    Link: https://arxiv.org/abs/2608.00950

  • 混合相補問題求解ライブラリMixedComplementarityProblems.jl:高速バッチ処理型オープンソース内部点法ソルバー [cs.GT, cs.RO, cs.SY, eess.SY]目的:混合相補問題に対する内部点法ソルバーの実装と性能評価
    • 非線形計画問題やゲーム理論,ロボティクスなど幅広い分野で最適化問題の必要条件として現れる
    • 既存のPATHソルバーは高性能だがクローズドソースであり,利用制限がある
    • オープンソースで並列処理に対応し,自動微分が可能な高性能ソルバーを開発する
    • MixedComplementarityProblems.jlは,標準的なベンチマークにおいてPATHと同等の信頼性を示す。
    • CPUマルチスレッドによるバッチ処理では,PATHに比べて約100倍の高速化を実現した。
    • GPU実装も高速化を示すが,問題規模によってはCPUに劣る場合がある。

    Link: https://arxiv.org/abs/2608.00959

  • MonitorVLM-v2:リアルタイム安全違反検知のためのビジョン言語フレームワーク [cs.CV]目的:安全違反の検知
    • 産業現場における安全性確保は不可欠であり,監視システムの高度化が求められている。
    • 既存のビジョン言語モデルは,推論に時間がかかり,リアルタイムでの多画面監視には不向きである。
    • 本研究は,迅速かつ決定的な安全違反検知を実現し,現場での実用性を高めることを目指す。
    • MonitorVLM-v2は,推論速度を19.45倍に向上させ,従来の目視検査よりも2.78倍多くの違反を検出した。
    • ビジョン言語モデルによる安全評価を,有限の規制決定空間における確率推論として再構築した。
    • 提案手法は,実運用中の地下鉱山施設において4ヶ月間,10台のカメラフィードで検証された。

    Link: https://arxiv.org/abs/2608.00975

  • 医療画像基礎モデルのための位置情報を意識した微細粒度表現学習 [cs.CV]目的:医療画像解析における微細粒度視覚表現の学習
    • 医療画像解析において,微細な視覚表現は診断上重要な証拠を捉えるために不可欠である。
    • 既存の学習戦略では,臨床的に意味のある表現と空間的な一貫性を両立することが困難である。
    • 位置情報を意識した学習により,空間的な一貫性と臨床的な意味を同時に獲得することを目指す。
    • 提案手法LoFiは,画像とテキスト,そして位置情報を組み合わせた学習を行うことで,優れた性能を発揮する。
    • 大規模医療グラウンディングデータセットMedGを構築し,LoFiの学習を大規模化することで性能向上を実現した。
    • LoFiは,一般的なモデルや既存の医療画像モデルを上回り,様々なタスクにおいて高い精度を示した。

    Link: https://arxiv.org/abs/2608.00976

  • フローマッチングのための片側分位共役 [cs.DC, cs.LG, cs.AI, cs.CV]目的:フローマッチングにおける効率的な共役構造の構築
    • 生成モデルの学習において,データ分布の学習は重要な課題である。高品質なサンプル生成には,適切な確率経路の設計が必要となる。
    • 従来のフローマッチングでは,共役構造の計算コストが課題であった。特に,バッチサイズが大きい場合に計算量が急増する。
    • 本研究は,計算コストを抑えつつ,より高品質なサンプル生成を実現する共役構造を提案する。
    • 提案手法であるQC-FMは,データバッチのみから共役を構築し,ペアワイズコスト行列や割り当て問題を回避する。
    • 選択されたスライスにおいて回帰分散を排除し,理想的なフローを直線的にすることで,サンプル品質を向上させる。
    • CIFAR-10,CelebA,FFHQ,ImageNet-64等のデータセットにおいて,従来のBaselineやOT-CFMよりも優れた性能を示す。

    Link: https://arxiv.org/abs/2608.00978

  • 粗い周辺チェックを通過させることは安価である:LLMペルソナパネルにおけるペルソナ混合と不正確な介入効果推定 [cs.AI, cs.CL, cs.GT]目的:LLMペルソナパネルにおける介入効果の推定精度と,その検証における周辺チェックの重要性
    • LLMを実験参加者として利用する研究が増加しており,その妥当性評価が重要になっている。
    • LLMの応答と人間のデータの類似性を評価する際の,適切な検証基準が確立されていない。
    • LLMペルソナパネルを用いた研究において,粗い周辺チェックを通過させることで,厳密な効果推定をせずに検証が可能になることを示す。
    • 固定されたペルソナ条件付きGPT-4.1構成のパネルは,戦略的ゲームにおいて,事前に登録された基準を満たした。
    • プロンプトのばらつきは大きく,不確実性の仮定によってその割合が変動したが,全体として許容範囲内であった。
    • 介入は,継続プロセスとそのテキスト表現の両方を変化させ,表現の制御可能性を示唆した。

    Link: https://arxiv.org/abs/2608.00979

  • Fisher情報量の視点からのマルチモーダル異常検知におけるクロスモーダル融合バイアスの理解と克服 [cs.CV]目的:マルチモーダル異常検知におけるクロスモーダル融合バイアスの軽減
    • マルチモーダル学習は,多様な情報源を活用し,よりロバストで精度の高い認識を可能にするため重要である。
    • クロスモーダル融合バイアスは,マルチモーダル学習における性能向上の大きな阻害要因となっている。
    • 本研究は,クロスモーダル融合バイアスを定量的に分析し,その影響を軽減する手法を提案する。
    • 本研究では,Fisher情報行列を用いて,マルチモーダル異常検知におけるクロスモーダル融合バイアスの影響を分析した。
    • UCFBという,プラグアンドプレイ可能なフレームワークを提案し,Fisher情報に基づいた動的キャリブレーションとカノニカル類似性分析によりバイアスを軽減した。
    • MVTec 3D-ADとEyecandiesデータセットにおける実験で,UCFBは様々な設定において一貫した性能向上を示した。

    Link: https://arxiv.org/abs/2608.00986

  • ゼロショット画像キャプションのための合成教師データのエンティティ忠実な修正 [cs.CV, cs.CL]目的:ゼロショット画像キャプションにおける合成教師データのエンティティレベルの忠実度向上
    • 画像とテキストの理解に基づく,高度な画像キャプション生成技術の重要性が高まっている。
    • 合成データは学習データ不足を補うが,画像とテキストの対応関係のずれが性能低下の要因となる。
    • エンティティレベルでの対応関係を明示的に修正し,合成教師データの信頼性を高めることを目指す。
    • 提案手法ReCapは,画像内のエンティティを検出し,それに基づいてキャプションを書き換えることで,エンティティレベルの対応関係を強化する。
    • 信頼性の低い合成ペアに対しては,動的な重み付け学習戦略を適用し,学習への影響を抑制する。
    • 実験により,ReCapが画像とテキストの一貫性を向上させ,ゼロショット画像キャプションのベンチマークで最先端の性能を達成することが示された。

    Link: https://arxiv.org/abs/2608.00994

  • 電気羊は夢を見るか? 高精度な視覚言語モデルの幻覚ベンチマークのための人間による記述サンプル [cs.CV, cs.AI, cs.CL]目的:視覚言語モデルの幻覚検出独立性を保つための人間による記述サンプルの有用性
    • モデルの進化が速いため,幻覚評価の普遍的な手法が求められている
    • 既存のベンチマークは特定のモデルに依存するため,汎用性に欠ける
    • 人間が記述したサンプルを用いて,モデル非依存な幻覚ベンチマークを確立すること
    • 人間が記述したサンプルは,モデル生成サンプルと比較して高い合意度を示した
    • データセットの内容制御が可能であり,視覚言語モデルからのサンプルと分布が類似している
    • 人間データはモデルベースの幻覚ベンチマークの代替として有効であると考えられた

    Link: https://arxiv.org/abs/2608.01021

  • WAM-Diff2:効率的な自動運転VLAのための階層的AR-to-Diffusion蒸留 [cs.CL, cs.RO, cs.AI, cs.CV]目的:自動運転における,効率性と認知能力を両立するVLAモデルの構築
    • 自動運転技術は,交通事故の削減や移動の自由度の向上に貢献し,社会にとって重要な課題である。
    • 既存のVLAモデルは計算コストが高く,また,逐次的な処理によるバイアスが課題となっていた。
    • 事前学習済みARモデルを効率的なDiffusionモデルに変換し,高性能かつ高速な自動運転を実現すること。
    • WAM-Diff2は,段階的な蒸留戦略により,ベースモデルの知識を保持しつつ高速化を実現した。
    • 実験結果から,WAM-Diff2は既存のARモデルと同等の性能を発揮し,exposure biasを軽減することが示された。
    • 推論速度は2.8倍に向上し,システムレベルの最適化と組み合わせることで最大15.1倍の加速となった。

    Link: https://arxiv.org/abs/2608.01035

  • FactorJEPA:密集したグローバルサウス都市環境における未来予測のための,レイアウト・エージェント・インタラクションチャネルへの分解 [cs.NI, cs.AI, cs.CV, cs.LG]目的:グローバルサウスの密集した都市環境における未来予測性能の向上
    • 現実世界の構造とダイナミクスを捉えるWorld Modelは,ロボティクスやAI研究において不可欠である。
    • 既存のWorld Modelは,主に低密度で構造化された環境を対象としており,混雑した都市環境への適用が課題であった。
    • 本研究は,多様性と部分的観測性を持つ環境下での密なインタラクションダイナミクスを維持し,予測精度を向上させることを目指す。
    • FactorJEPAは,レイアウト,エンティティ,インタラクションを分解的に予測することで,未来予測の精度を向上させた。
    • Causal L1,Mask-ratio slopeなどの評価指標において,既存手法を上回る結果が得られた。
    • 再現性のあるモーション情報と予測精度のトレードオフを明らかにし,異なるバックボーンモデルで結果が一致することを確認した。

    Link: https://arxiv.org/abs/2608.01049

  • Struct-GStream:構造化3Dガウスを用いた低ビットレートでの効率的な自由視点ビデオストリーミング [cs.CE, cs.SY, eess.SY, cs.CV]目的:効率的な自由視点ビデオストリーミングのための手法
    • リアリティの高い映像体験の提供が求められており,自由視点ビデオはその重要な技術の一つである。
    • 既存手法はリアルタイムレンダリングが難しく,学習に時間がかかる,またはストレージ容量が大きいという課題がある。
    • 構造化3Dガウスを用いることで,低ビットレートで高品質な自由視点ビデオストリーミングを実現し,上記の課題を解決する。
    • 提案手法Struct-GStreamは,動的アンカーポイントとグローバルパッチング戦略により,高速な学習と低ビットレートでの高品質レンダリングを実現した。
    • 実験結果から,Struct-GStreamは既存のオンライン学習手法と比較して,学習時間,ストレージ,レンダリング品質において大幅な性能向上を示した。
    • 競争力のあるレンダリング速度を維持しつつ,自由視点ビデオ構築における効率性と品質の両立を達成した。

    Link: https://arxiv.org/abs/2608.01053

  • 構造化された視覚的知覚のためのマージナル貢献度割り当て [cs.CV, cs.AI]目的:構造化された視覚的知覚タスクにおけるマージナル貢献度割り当て
    • マルチモーダル大規模言語モデルの応用範囲拡大に伴い,視覚情報と言語情報の連携が重要になっている。
    • 従来の強化学習手法では,応答レベルでのみ指導が行われ,個々のオブジェクトボックスへの貢献度を区別できない。
    • 各予測ボックスの貢献度を個別に評価し,より正確なオブジェクト検出とセグメンテーションを可能にすることを目指す。
    • 提案手法MCR-GRPOは,各ボックスの貢献度をleave-one-out比較によって推定することで,応答レベルの指導の粒度ミスマッチを解消する。
    • MCR-GRPOは,セット値の変化を測定し,貢献度の高いボックスに正の報酬を与え,冗長なボックスを抑制することで,マージナルアトリビューションを安定化させる。
    • 実験の結果,提案手法は既存のGRPOベースラインと比較して,REC,DOD,セグメンテーション,カウントの各ベンチマークで最先端の性能を示した。

    Link: https://arxiv.org/abs/2608.01055

  • 拡張KAFR:手術ビデオ効率的解析のための運動学的適応パラダイム [cs.CV]目的:手術ビデオの効率的な解析手法
    • 手術支援AIの発展に伴い,手術ビデオ解析の重要性が高まっている。
    • 手術ビデオは長時間に及ぶため,計算負荷が大きいという課題がある。
    • 運動学的情報に基づき,重要なフレームのみを抽出することで計算コストを削減する。
    • KAFRは,全フレームのわずか0.58%のみを用いて91.0%のF1スコアを達成した。
    • これは,一般的な4%のフレームサンプリングと比較して約7倍のフレーム削減に相当する。
    • 本研究の結果は,KAFRが腹腔鏡手術環境においても有効であることを示している。

    Link: https://arxiv.org/abs/2608.01058

  • ワンクエリ,多スケール:効率的な階層的クロスビュー地理位置特定のための疎な混合エキスパートモデル [cs.CV]目的:クロスビュー地理位置特定における効率性と精度向上
    • 地理位置特定は,ロボット工学や自動運転などの分野で重要な役割を果たす。
    • 既存手法は,大規模な画像データベースの検索にコストがかかる,または解像度の変化に対応しにくい。
    • グローバルな多スケール表現学習とローカルな階層的検索を分離し,効率性と精度を両立させる。
    • GeoMoEは,既存の最高手法と比較して,Just Zoom InデータセットでR@40mが95.78%と高い性能を示す。
    • VIGOR-Mベンチマークでは,R@1が62.39%を達成し,記述子マッチングに必要な計算量は既存の網羅的な検索手法の5.27%で済む。
    • 異なる解像度で学習したモデルは,他の解像度でも高い性能を発揮し,汎化性能も高い。

    Link: https://arxiv.org/abs/2608.01060

  • ReACT-CLIP:応答を考慮したテスト時防御によるビジョン言語モデルの堅牢性向上 [cs.RO, cs.CV]目的:ビジョン言語モデルに対するテスト時の敵対的ロバスト性の向上
    • 画像とテキストを組み合わせたモデルは多様な応用が期待され,その信頼性が重要である。
    • 敵対的攻撃に対して,既存の防御手法は攻撃の強さに応じた適切な修正が難しい。
    • 入力ごとの修正強度と防御介入の必要性を適切に判断する手法を開発する。
    • ReACT-CLIPは,入力の特徴量の変動度合いと予測の不安定性を評価することで,最適な修正強度を決定する。
    • 本手法は,モデルやプロンプトの学習を必要とせず,様々なデータセットや攻撃に対して有効であることが確認された。
    • ReACT-CLIPは,高いロバスト性と精度の両立を実現し,敵対的攻撃に対する防御性能を大幅に向上させる。

    Link: https://arxiv.org/abs/2608.01067

  • PlantRig - 骨から枝へ:植物骨格再構成のための自己回帰リギングモデルの適応 [cs.CV, cs.GR]目的:植物骨格再構成のための自己回帰リギングモデルの適応
    • 植物モデリングは,ゲームやシミュレーションにおいて重要な役割を担う。効率的な植物モデル構築が求められている。
    • 既存のリギングモデルは人型キャラクター向けに最適化されており,植物のような多様な構造への適用が難しい。
    • 植物固有の分岐パターンに対応できるよう,リギングモデルの構造的ボトルネックを解消し,汎化性能を向上させる。
    • UniRigやSkinTokensといった既存モデルを植物骨格再構成に適用した結果,植物の複雑な分岐構造を適切に再現することが困難であった。
    • UniRigは分岐を直線的に簡略化し,SkinTokensは過剰なセグメンテーションと不安定な出力空間を示すことが判明した。
    • 複数の合成データセットを用いたファインチューニングにより,モデルは正確な分岐トポロジーを学習し,葉を含む植物全体にも汎化できるようになった。

    Link: https://arxiv.org/abs/2608.01072

  • 単一テスト時適応のためのロジット起源中心化 [cs.LG, cs.CV]目的:単一テスト時適応における性能低下とその解決策
    • 表形式データは現実世界の多くの場面で利用されており,深層学習モデルの活用が期待されている。
    • 訓練データとテストデータの分布が異なる場合,深層学習モデルの性能が著しく低下する。
    • ストリーミング環境下での単一データに対する適応方法を確立し,性能劣化を改善すること。
    • 本研究では,バッチ依存型アプローチがストリーミング環境下で性能を著しく低下させることを示した。
    • その解決策として,ロジット空間をシフトさせる軽量な手法であるPLOCを提案した。
    • PLOCは5つの表形式データベンチマークにおいて,既存手法を大きく上回る性能を示した。

    Link: https://arxiv.org/abs/2608.01074

  • 分離と検出:潜在拡散による統一的なドラムトランスクリプションとステム生成 [cs.SD]目的:ドラムのシンボルイベントへの自動トランスクリプションと編集可能なドラムステムの生成
    • 音楽制作において,ドラム音源の分離・編集は重要な役割を担う。より柔軟な音楽制作を可能にする。
    • 従来のドラムトランスクリプション手法では,音源分離が行われず,編集やリミックスに利用できるステムが得られないという課題がある。
    • 潜在拡散モデルを用いてドラム音源を分離し,トランスクリプションの精度向上と編集可能なステムの提供を目指す。
    • 提案手法は,強力なU-Netベースのドラム分離基盤と比較して,全体的なトランスクリプションF1スコアで一貫して改善が見られた。
    • キックとスネアのF1スコアでは,代表的なエンドツーエンドのドラムトランスクリプションシステムを上回り,分離されたオーディオステムも提供する。
    • オンセット分岐(OB)は安定したトランスクリプションの改善に貢献し,音色分岐(TB)は再構成,音響ステム品質,オンセット検出のトレードオフを変化させる。

    Link: https://arxiv.org/abs/2608.01093

  • レテ:忘却はどれほど困難か? - 医療画像における連合学習のアンラーニングのベンチマーク [cs.CV]目的:医療画像における連合学習のアンラーニング手法の評価
    • 医療データの連合学習は,プライバシー保護とモデルの汎化性能向上に不可欠である。
    • データ削除要求への対応が難しく,既存のアンラーニング手法の有効性が不明確である。
    • 医療画像データに対するアンラーニング手法の性能評価と課題の明確化。
    • 既存手法の性能差は,忘却要求の難易度に依存することが示された。
    • 容易なデータ削除では,ユーティリティを維持する手法間に差が見られない。
    • 複数の医療タスクにおいて,クライアントの削除はタスク性能にほとんど影響を与えないことが判明した。

    Link: https://arxiv.org/abs/2608.01094

  • SSR:学習不要な物体中心マスクのための類似度シフトによる改良 [eess.SY, cs.SY, cs.RO, cs.CV]目的:物体中心マスクの改良
    • 物体認識や画像セグメンテーションにおいて,より正確な物体抽出が求められている。
    • 既存の物体中心モデルでは,マスクの断片化,境界の漏れ,誤った領域の統合といった課題が存在する。
    • 学習を伴わずに,既存のモデルの出力マスクの精度を向上させることを目指す。
    • Similarity-Shift Refinement (SSR) は,自己教師ありVision Transformerを用いて,学習なしで物体中心マスクを改良する手法である。
    • SSRは,自己注意値集約の前後のパッチ間の類似度の変化を測定し,関係を強化し,疎なアフィニティグラフを構築する。
    • 様々なベンチマークにおいて,SSRはAdjusted Rand Indexを平均8.5%改善し,汎用性と有効性が示された。

    Link: https://arxiv.org/abs/2608.01103

  • パッチからエビデンスボールへ:Few-Shot全スライド画像分類のためのクラス条件付きエビデンス検索 [cs.CV]目的:Few-Shot全スライド画像分類におけるクラス条件付きエビデンス検索手法
    • 病理診断において,全スライド画像は重要な情報源であり,診断の精度向上に不可欠である。
    • Few-Shot環境下では,スライドレベルのラベルが限られており,信頼性の高い集約メカニズムを学習することが困難である。
    • 本研究は,疎な局所的特徴を構造化し,Few-Shot環境下での分類性能向上を目指す。
    • 提案手法EviBallは,局所パッチをセマンティック・空間的な割り当てと中心の洗練によりエビデンスボールとして組織する。
    • タスク固有のクラスクエリを用いて,エビデンスボールを検索し,クラス条件付きのエビデンス表現を生成する。
    • 実験結果から,EviBallは既存手法と比較して,多様なFew-Shot設定において優れた性能を示すことが確認された。

    Link: https://arxiv.org/abs/2608.01104

  • SG-Layout:LLMによる構造化シーングラフ誘導レイアウト生成 [cs.CV, cs.AI]目的:構造化された空間知識をLLMに組み込むレイアウト生成フレームワーク
    • 自然言語から空間的に一貫性のあるレイアウトを生成することは,LLMにとって基本的な課題である。
    • 既存のLLMは,オブジェクト間の幾何学的関係や構造的依存性を捉えるのが難しい。
    • シーングラフ埋め込みをLLMの言語空間にマッピングし,指示に基づいた制御可能なレイアウト生成を可能とする。
    • SG-Layoutは,関係が密で構成が複雑なシーンにおいて,空間推論の精度と幾何学的整合性を向上させた。
    • グラフ構造化された特徴量アライメントが,制御可能なレイアウト生成の強化に有効であることが示された。
    • 画像レイアウト生成,屋内シーン合成,ロボットオブジェクト再配置タスクで有効性が確認された。

    Link: https://arxiv.org/abs/2608.01106

  • CoT-Edit:思考の連鎖による指示動画編集 [cs.CV]目的:複雑なシーンにおけるテキスト駆動の指示に基づく動画編集の実現
    • 動画編集は,コンテンツ制作において不可欠であり,その効率化が求められている。
    • テキストのみの指示では,空間的な関係性や物理的制約を捉えきれず,曖昧な結果となる場合がある。
    • セマンティックな意図と空間的な実行を橋渡しし,より正確な動画編集を可能にすること。
    • 思考の連鎖(CoT)を活用したマルチモーダル大規模言語モデルが,動画と指示に基づき,詳細な編集指示を生成する。
    • 生成された空間情報は,オブジェクトのスケールや接触関係を考慮したマスク生成を導き,局所的な修正精度を高める。
    • 拡散ベースのエディタが,マスクと指示を用いて高精度で一貫性のある動画編集を実現する。

    Link: https://arxiv.org/abs/2608.01113

  • JoyAI-Talker:共感的な音声エージェントのための双方向音声対話大規模モデル [cs.SD]目的:共感的な対話と音声エージェントの知性を実現する双方向音声対話システムの開発
    • 音声エージェントの高度化は,人間と自然なコミュニケーションを可能にし,様々な分野での応用が期待されるため重要である。
    • 既存の音声対話システムは,テキストベースのモデルの性能を十分に活かせず,「認知的な劣化」という課題を抱えている。
    • 本研究では,音声とテキストを統合的に学習し,認知的な劣化を抑制することで,より高度な音声対話を実現することを目指す。
    • JoyAI-Talkerは,テキストによる指示を通じて音声の属性やパラ言語的イベントを柔軟に制御し,より自然で表現豊かな音声応答を可能にした。
    • Persona-Adaptive Empathetic Response (PAER)フレームワークを導入することで,話者の感情や状態を考慮した共感的な応答を生成することが可能となった。
    • Joy-Duplexとの統合により,リアルタイムなターン制御を実現し,ユーザー割り込み時の応答率0.88,誤トリガー率の低さを両立した。

    Link: https://arxiv.org/abs/2608.01119

  • MiniWorld:ビデオワールドモデルのゼロからの学習の民主化 [cs.CV]目的:ビデオワールドモデルのゼロからの学習のための再現可能なフレームワーク
    • ビデオワールドモデルは,エージェントの行動に基づいた環境の変化を学習し,具現化されたAIやインタラクティブなシミュレーションの基盤となる。
    • 既存の研究は,事前学習済みのモデルへの依存度が高く,複雑な学習パイプラインや計算資源を必要とする。
    • MiniWorldは,限られた計算資源でエンドツーエンドに学習可能な軽量かつ透明性の高い基盤を提供する。
    • MiniWorldは,ブロック因果Video Diffusion TransformerとFlow Matchingを組み合わせることで,効率的な学習を実現した。
    • Diffusion Forcingと二段階の継続学習により,時間モデリングの精度と安定性を向上させた。
    • ロールKVキャッシュとパイプライン化された非同期ノイズ除去により,効率的なストリーミング生成を可能にした。

    Link: https://arxiv.org/abs/2608.01127

  • FeDepth:ロボットの多様性下における深さ推定のための連合学習 [cs.RO, cs.CV]目的:ロボットの多様性下における深さ推定のための連合学習フレームワーク
    • ロボットの汎化性能向上のため,多様な環境データでの学習が重要視されている。
    • 連合学習は分散学習を可能にするが,クライアント間のドメインシフトにより性能が低下する。
    • ロボット環境における連続的なドメイン遷移に対応し,連合学習のロバスト性を向上させる。
    • 提案手法FeDepthは,ソフトクラスタリングを用いた記述子ベースのクラスタ化された連合学習フレームワークである。
    • FeDepthは,複数のクラスタへの参加を許可することで,ドメイン間の連続的な遷移を捉えることができる。
    • 様々な深さ推定アーキテクチャにおいて,標準的なFLやクラスタ化されたFLよりも一貫してロバスト性が向上することが示された。

    Link: https://arxiv.org/abs/2608.01129

  • 知識に基づく視覚的質問応答のための統一ヘテロソース注意喚起検索 [cs.IR, cs.CL, cs.CV]目的:知識ベースを用いた視覚的質問応答における関連エンティティ知識の検索
    • 視覚的情報を基盤とした質問応答は,AI研究の重要な課題であり,その性能向上が求められている。
    • 既存手法では,単一の検索モダリティに依存し,複数の情報源からの知識を統合できていないという課題がある。
    • 異なる情報源からの知識を効率的に統合し,視覚的質問応答の精度を向上させることを目指す。
    • UniHEARは,異なる情報源からのエンティティ検索と再ランキングを統合した軽量フレームワークである。
    • 粗い検索記述子と,検索に誘導された注意モダリティゲーティングを導入することで,検索ソースを考慮した効率的な再ランキングを実現した。
    • E-VQAとInfoSeekにおける実験により,UniHEARが最先端の性能を達成し,Recall@1を最大6.7ポイント向上させたことが示された。

    Link: https://arxiv.org/abs/2608.01147

  • InteracVid:ライブチャット動画から構築されたリアルなインタラクティブなオーディオビジュアル応答データセット [cs.DC, cs.CL, cs.CV]目的:ライブチャット動画から抽出されたインタラクティブなオーディオビジュアル応答データセット
    • AIとのより自然な対話実現には,テキストだけでは表現しきれない,多様な応答形式が不可欠である。
    • 既存のデータセットは,外部からの刺激に対する応答ではなく,映像の説明に重点が置かれている。
    • 外部刺激に対するリアルなオーディオビジュアル応答を学習するためのデータセットを構築すること。
    • InteracVidは,59K以上のライブストリーム動画から454K以上のコンテキスト・クエリ・応答の組を含む大規模データセットである。
    • 人間による評価の結果,抽出されたインタラクションは因果関係が明確で,自然かつ時間的に完結していることが確認された。
    • InteracVidでファインチューニングすることで,インタラクションプランニングとオーディオビジュアル応答生成の性能が向上することが示された。

    Link: https://arxiv.org/abs/2608.01157

  • ストリーミング動画向けトークン圧縮における集合的思考 [cs.CV]目的:ストリーミング動画におけるトークン圧縮手法
    • 動画LLMの効率化が重要であり,メモリ使用量と遅延を抑制する必要がある。
    • 既存手法はトークンを個別に評価し,トークン間の相互作用を考慮していない。
    • 過去の情報と現在の情報を考慮した効率的なトークン圧縮を目指す。
    • NovaCovは,ストリーミング動画に特化した初の学習不要な集合的トークン圧縮器である。
    • 過去の情報を効率的に管理するHistorical Reference Bankと,情報補完を重視する目的関数を用いる。
    • 実験の結果,既存手法を上回り,ReKVの精度を99.6%維持しつつ,LLMのプレフィリング遅延を46%削減した。

    Link: https://arxiv.org/abs/2608.01169