arXiv雑要約
画像・音声 - 2026/08/04 公開
RGB-T追跡のためのパラメータ動的適応融合および較正ネットワーク [cs.CV]目的:RGB-T追跡における適応的な融合と較正機構の提案
- RGB-T追跡は,可視光と熱画像の情報を統合し,様々な環境下でロバストな追跡を実現する上で重要である。
- 従来のRGB-T追跡器は固定パラメータの融合関数を使用しており,ターゲットや状況の変化に適応できないという課題があった。
- 本研究は,ターゲットの状態に応じて融合パラメータを動的に生成し,追跡性能の向上を目指す。
- 提案手法PAFCNetは,テンプレート表現を活用したTA-HyperNetにより,ターゲットに依存したパラメータを生成する。
- 生成されたパラメータは,融合プロセスと時間的較正を調整し,ターゲット外観の変化やモダリティ品質の変動に対応する。
- 実験結果から,PAFCNetは複数のRGB-T追跡ベンチマークにおいて競争力のある性能を発揮することが示された。
SecondOpinion: 解剖学的知識を考慮したゲート付き推論による効率的な医用画像解析 [cs.CV]目的:効率的な医用画像解析のためのフレームワーク
- 医用画像解析は,疾患の早期発見や正確な診断に不可欠であり,医療の質の向上に貢献する。
- 既存の深層学習モデルは,画像の難易度に関わらず固定的な計算量を消費するため,効率性に課題がある。
- 本研究は,難易度の高い症例にのみ解剖学的知識を用いた推論を適用することで,計算コストを削減しつつ診断精度を維持することを目指す。
- 提案手法SecondOpinionは,主要ストリームによる初期解析と,必要に応じて解剖学的知識に基づく補助ストリームを組み合わせることで,効率的な解析を実現した。
- 胸部X線画像と骨盤骨折データセットを用いた実験で,既存手法と同等以上の性能を達成し,補助ストリームの起動率は画像の難易度と相関した。
- ゲート信号を正答率に向けて学習させることで,モデルが必要な箇所に解剖学的推論を集中させることが可能になった。
拡散ビジョン言語モデルにおけるノイズ除去を考慮した視覚的証拠軌跡割り当て [cs.CV, cs.LG]目的:拡散ビジョン言語モデルの推論コスト削減
- ビジョン言語モデルは,視覚情報を活用することで高度な理解が可能となる。
- 拡散モデルでは,各ノイズ除去ステップで視覚情報を参照するため,計算コストが高い。
- ノイズ除去ステップごとの視覚情報需要に応じて割り当てを最適化し,コストを削減する。
- DAVETは,生成状態に応じて視覚的証拠の割り当てを調整する,学習不要なフレームワークである。
- LLaDA-VおよびLaViDaを用いた評価で,平均1.55倍の高速化を達成した。
- 性能低下は平均1.86%であり,生成品質を維持しつつ推論コストを削減できることを示した。
自己回帰型超解像のための信頼できる粗スケールにおける詳細補完 [cs.CV]目的:生成超解像におけるハルシネーションの軽減
- 超解像は,低解像度画像から高解像度画像を生成する重要な技術であり,画像処理分野で不可欠である。
- 既存の超解像技術では,視覚的に自然に見えるが,低解像度画像から十分支持されない内容が生成されるハルシネーションが課題となっている。
- 粗スケール情報を信頼性高く維持しつつ,詳細なスケールを自己回帰的に復元することでハルシネーションを抑制することを目指す。
- 提案手法K2Nは,従来のVARSRと同等の性能を維持しつつ,ハルシネーションに焦点を当てた評価において明確な優位性を示す。
- K2Nは,VARベースの超解像を,完全なパス生成から,$k$-to-$N$の詳細補完プロセスへと再構築することにより,生成の信頼性を向上させる。
- 粗スケール情報を低解像度画像から直接確立し,残りの微細なスケールのみを自己回帰的に復元する点が特徴である。
PartMat:単一のグローバル潜在変数を用いた材質を考慮した3D部品分解 [cs.RO, cs.CV, cs.AI, cs.GR]目的:材質境界に基づいた3D部品分解
- 3Dアセット生成において,構造化された編集可能なデータが求められている。
- 既存手法は機能的な意味に基づいて分解するため,実用的な材質境界を考慮していない。
- 部品数に応じて計算コストが増大する問題を解決する。
- PartMatは,単一のグローバル潜在変数で多部品形状を表現し,部品分解の効率化を実現した。
- 提案手法は,材質境界に沿った部品分解において,既存手法を大きく上回る精度を達成した。
- 拡散モデルと強化学習を組み合わせることで,正確な材質割り当てとオーバーラップ抑制を実現した。
DeepVoyager-VL:視覚をループに組み込んだ探索による,長期的マルチモーダルエージェントの促進 [cs.RO, cs.CV, cs.AI]目的:長期的マルチモーダルエージェントのための視覚をループに組み込んだ探索フレームワーク
- 大規模言語モデルの発展により視覚理解が進んだが,知識集約型問題への対応が課題。
- 既存手法では,視覚が入力・出力段階に限られ,中間的な推論における役割が不十分である。
- 視覚的証拠に基づいた継続的な探索を可能にし,推論の深さと相互作用の深さを向上させる。
- DeepVoyager-VLは,マルチモーダルイベントグラフを用いてデータ合成を行い,視覚的依存関係のある問題を生成する。
- エージェントフレームワークにより,能動的な視覚獲得とオンデマンド画像読み込みを実現している。
- 合成データを用いてモデルをファインチューニングすることで,強化学習なしに効果を確認した。
MoCRA: 4K動画全体復元のための compositional rank-1 原子混合 [cs.CV]目的:4K動画の包括的な復元手法の開発
- 現実世界の動画は様々な劣化の影響を受けるため,高品質な復元技術が求められている。
- 既存手法は,個別の劣化問題に焦点を当てており,複数の劣化が同時に発生する場合に十分な性能を発揮できない。
- 本研究では,複数の劣化要因を同時に処理し,高解像度かつ安定した動画復元を可能とする手法を提案する。
- 提案手法MoCRAは,物理モデルに基づく劣化(霞,雨,ノイズ,低照度)を考慮した UHV-4K-AIO データセットで優れた性能を示した。
- 11の再学習済みベースラインと比較して,タスク平均PSNRで最高の性能を達成し,動き推定なしで安定した結果を得た。
- MoCRAは,3.6Mのパラメータで,1.7秒の最速ベースラインに対し,0.5秒以下で4K動画を復元する。
承認制複数勝者選挙における両者の利点を併せ持つ解法の限界 [cs.GT]目的:承認制複数勝者選挙における,事前保証と事後表現の公理を満たす可能性
- 選挙制度の公正性は民主主義の根幹であり,代表性の確保は重要な課題である。
- 事前保証と事後表現の整合性が難しく,理想的な選挙制度の設計が困難である。
- 事前保証と事後表現の互換性を分析し,実現可能な公正な選挙制度を特定する。
- 事前保証としての弱パレート最適性は,事後表現の正当化された代表性(JR)と両立しないことが示された。
- フラクショナルコア安定性も,事前保証と事後JRとの組み合わせが不可能となる。
- フラクショナルコア,グループ資源比例性,AJRなど複数の事前保証は同時に満たされうる。
拡散ワールドモデルにおけるリスク制御型潜在的ダイナミクス近似:WorldDynCache [cs.LG, cs.CV]目的:拡散ワールドモデルの潜在的ダイナミクスの近似手法
- 将来予測の質を向上させる拡散ワールドモデルは,ロボット工学やシミュレーションなど幅広い分野で重要である。
- Transformerの繰り返し評価により推論速度が遅く,実用上の課題となっている。
- 近似による潜在的遷移欠陥や,条件依存的な潜在的進化方向の変化を抑制し,高速化を図る。
- WorldDynCacheは,HunyuanVoyager-13Bで4.92倍,Aether-5Bで2.15倍の速度向上を達成した。
- WorldScore,PSNR,SSIM,LPIPSといった評価指標において,比較対象のキャッシュ手法の中で最高の生成品質を達成した。
- 潜在的遷移リスク推定器と条件・位相を考慮した潜在的サーロゲートによって,リスク制御された近似を実現している。
意味と視覚の分離:忠実な視覚・テキスト圧縮評価のためのフレームワーク [cs.CV]目的:視覚・テキスト圧縮の品質を忠実に評価するためのフレームワーク
- 近年,長文脈モデリングにおいて視覚・テキスト圧縮の重要性が増している。
- 既存の評価プロトコルは,言語モデルの強い事前知識によりテキストの保存度を正確に測れない。
- 言語モデルの能力に依存せず,視覚・テキスト圧縮自体の品質を評価することを目指す。
- 既存の評価指標では,視覚・テキスト圧縮の品質と下流タスクの精度が大きく乖離することが示された。
- 提案フレームワークは,テキスト依存性を排除し,視覚・テキスト圧縮の品質のみを反映する評価を可能にする。
- ZeroSense Benchmarkは,テストサンプルの意味的相関を低く抑え,評価の信頼性を高める。
Transformer Geometry Observatory TGO-III:意味幾何観測 [cs.CV]目的:Vision Transformerの表現的行動の分析
- AIにおけるVision Transformerの普及に伴い,その表現学習の理解が不可欠となっている。
- 既存研究ではトークンの幾何学や学習ダイナミクスに焦点が当たり,意味的構造の進化は未解明である。
- ViT-Small/16の学習過程における意味的幾何学とクラス分離性の変化を明らかにすること。
- クラス表現は学習が進むにつれて線形分離可能性が高まり,識別能は向上する。
- クラス重心間の距離は広がり,局所的な表現多様体は構造化された幾何学的複雑性を示す。
- これらの観察は,多様体の拡張と意味的構造の組織化が相伴うことを示唆する「意味的拡張仮説」を支持する。
照明を超えて:条件付き相互情報に基づく低照度画像強調ネットワーク [cs.CV]目的:低照度画像強調における構造の忠実性,自然な色再現,適切な露出の復元
- 近年,暗い環境で撮影された画像の利用が増加しており,その画質向上は重要な課題となっている。
- 既存手法では,輝度と色度成分を分離して処理するため,両者の相互作用が十分に考慮されていない。
- 輝度情報に基づいた色度成分の貢献度を定量的に評価し,より効果的な画像強調を実現すること。
- 提案手法CMIG-Netは,条件付き相互情報を用いて色度特徴を輝度情報に応じて再調整するモジュールを導入した。
- D2IRモジュールにより,輝度と色度間の双方向の情報フローを動的に制御し,復元状態に適応した処理を実現。
- 実験結果から,CMIG-Netは既存のCIDNetを上回り,特にSony-Total-Darkデータセットにおいて顕著な性能向上を示した。
自動入札オークションにおけるPPAD困難性の限界 [cs.GT]目的:自動入札オークションにおける均衡計算の効率性
- 広告オークションは,デジタルマーケティングにおいて重要な役割を担う競争環境である。
- 最悪ケースでは均衡計算が困難だが,現実の市場では学習戦略により収束が速いという矛盾が存在する。
- 現実の市場における収束性を理論的に説明し,効率的な均衡計算手法を開発すること。
- 最悪ケースの困難性は,値分布が非原子的な場合に解消されることが示された。
- 拡散解析という新しい枠組みを導入し,均衡計算の効率性を評価した。
- 提案手法は,現実の市場で観測される収束性に対応する多項式的な拡散複雑度を持つことが示された。
GeoCore-9B:地球観測のための地理認識型生成基盤モデルへ [cs.HC, cs.CV]目的:地球観測データのみで学習した90億パラメータの生成基盤モデル
- 地球観測は,気候変動,環境モニタリング,災害管理など,地球規模の課題解決に不可欠である。
- 既存の生成モデルは自然画像に偏っており,地理空間制約との整合性が課題となっていた。
- 地理空間情報を考慮した生成モデルの構築により,地球観測の応用範囲を拡大することを目指す。
- GeoCore-9Bは,Flow Matchingに基づくDiTアーキテクチャを採用し,テキストと地理空間メタデータを条件として生成する。
- Geospatial Semantic Alignment lossにより,大規模学習時の収束性と空間的誤りを抑制することに成功した。
- Git-10Mデータセットを用いた学習の結果,視覚的品質と地理構造の正確性において,最先端の性能を達成した。
SpatioLM:視覚言語モデルにおける汎用的な物理空間知能に向けて [cs.CV, cs.CL, cs.LG]目的:視覚言語モデルの空間知能の強化
- 視覚と言語を統合したモデルは多様な応用が期待され,AI研究の重要な分野である。
- 既存モデルは常識的な推論は得意だが,視覚的な空間推論は苦手とする傾向がある。
- 追加的な情報を必要とせず,既存モデルの能力を損なわずに空間知能を向上させることを目指す。
- SpatioLMは,外部の3D情報や空間エンコーダを用いずに,モデル自体の空間知識を引き出す。
- 擬似深度とカメラ情報を用いた学習により,物理的に整合性の取れた表現を獲得する。
- VSI-Benchにおいて71.6という高いスコアを達成し,汎用的な能力の低下も抑制することを示した。
単一のRGB写真からの3Dハンドオブジェクトインタラクションの合成 [cs.CV]目的:3Dハンドオブジェクトインタラクションシーケンスの合成
- AR/VR,デジタルヒューマン,具現化されたインタラクションなど,幅広い応用分野を持つ基本的な人間行動である。
- 既存手法は,定義済みのオブジェクト形状や軌跡,またはタスク固有の条件を必要とし,自然な実世界入力での利用が制限される。
- 単一のRGB写真とオープンボキャブラリ言語指示から,実用的な3Dハンドオブジェクトインタラクションシーケンスを合成することを目指す。
- PhotoHOIは,入力画像と指示を構造化されたタスク仕様に解析し,インタラクションオブジェクト,ターゲット領域,空間関係を特定する。
- コンパクトなタスク関連の3Dシーンを復元し,復元されたオブジェクト状態,サポート関係,周囲のシーン形状に基づいてスムーズな衝突回避オブジェクト軌跡を計画する。
- 大規模なアフォードンスとHOIデータから,転移可能なタスク条件付きコンタクトおよびコンタクト条件付きグリップの事前知識を学習し,現実世界の写真と未知のオブジェクトへの汎化を可能にする。
UAV画像を用いた災害後建物被害評価における高度な深層学習技術の組み合わせの利点評価 [cs.CV]目的:災害後建物被害評価の利点
- 災害発生時,迅速かつ正確な被害状況把握は復旧活動の効率化に不可欠である。
- 既存の画像解析モデルは,大規模なアノテーションデータが必要で,地域や評価基準への汎化性能が低い。
- 本研究は,画像解析と大規模言語モデルの強みを組み合わせ,精度の高い被害評価を目指す。
- 提案手法は,建物検出と被害評価を分離することで,既存手法よりも最大2.1ポイント高いR^2スコアを達成した。
- 建物検出段階では限定的なアノテーションデータで高い性能を発揮し,データ収集コストを削減する。
- 失敗事例や課題を詳細に分析し,実用的な知見と今後の研究方向性を示した。
SNAP-tFDP:疎な負例サンプリングによる大規模グラフレイアウト [cs.GR]目的:大規模グラフのレイアウト手法
- ネットワーク可視化は,複雑な関係性を理解する上で重要である。しかし,大規模グラフでは計算量と視覚的な明瞭性の両立が課題となる。
- 既存手法はメモリ消費量が大きいか,高密度クラスタの分離に苦戦する。効率的な大規模グラフ描画が求められている。
- 負例サンプリングにより計算量を削減し,メモリ消費を抑えつつ,明確なクラスタ構造を維持するレイアウト手法を開発する。
- 提案手法は,エッジ数に比例する計算量で動作し,メモリ消費量を大幅に削減できることを示した。
- 近傍関係の維持とクラスタ分離において,既存の最先端アルゴリズムよりも優れた性能を発揮した。
- 400万ノード,3400万エッジのグラフに対し,高品質なレイアウトを10秒未満で生成することに成功した。
PNEC-Mamba:プロトタイプ誘導によるハイパースペクトル画像分類のための陽性・陰性証拠の較正 [cs.CV]目的:ハイパースペクトル画像分類におけるピクセルレベルの証拠信頼性モデリング
- ハイパースペクトル画像は,地表の多様な情報を捉えるため,環境モニタリングや精密農業等,幅広い分野で活用されている。
- スペクトル類似性や混合ピクセル,局所的コンテキストの影響により,ピクセル表現が曖昧になりやすく,分類精度が低下する問題がある。
- 信頼性の低い証拠を除去し,分類決定における干渉を低減することで,より高精度な分類を実現することを目指す。
- 提案手法PNEC-Mambaは,動的なクラスプロトタイプを用いて,ピクセル表現から陽性・陰性の証拠を分離し,信頼性を評価する。
- この手法により,曖昧なピクセルにおける証拠の較正を強化し,分類精度を向上させることが可能となる。
- 3つのベンチマークデータセットを用いた実験の結果,最先端手法と比較して優れた分類性能を示すことが確認された。
CHOW-SLAM:相補的オーバーラップウィンドウ最適化を用いたコンパクトなハイブリッド表現によるRGB-D SLAM [cs.CV]目的:RGB-D SLAMにおける高精度なシーン再構成とカメラトラッキングの実現
- SLAMはロボットの自律的な移動や環境理解に不可欠であり,その精度向上は重要な課題である。
- 従来のNeRFベースSLAMは計算コストが高く,限られた計算資源下では空間制約と時間制約を両立するのが難しい。
- CHOW-SLAMは,空間制約と時間制約を効率的に構築し,低計算資源環境での高精度SLAMを実現することを目指す。
- CHOW-SLAMは,平面とグリッドに基づいたコンパクトなハイブリッド表現(P-H表現)を用いることで,少ないパラメータで高精度なシーン再構成を可能にした。
- 相補的オーバーラップウィンドウ戦略により,短期的なオーバーラップと過去の観測の弱関係による最適化の偏りを抑制し,安定したトラッキングを実現した。
- 複数のデータセットにおける評価により,CHOW-SLAMが最先端の手法を凌駕する再構成品質とカメラトラッキング精度を達成することが示された。
P-MUSE:プロンプト・MIDIオプションによる統合的な楽器音楽合成・編集モデル [cs.SD]目的:楽器音楽の合成と編集に関する統一的なフレームワーク
- 音楽制作において,高品質な楽器音源と柔軟な編集機能は不可欠である。
- 既存システムでは,プロンプトとなるMIDIデータなしでの高品質な生成が課題であった。
- プロンプトMIDIの有無にかかわらず,より自然で制御性の高い音楽生成・編集を実現する。
- P-MUSEは,プロンプトMIDIの有無を問わず利用可能な,多段階カリキュラム学習に基づくフレームワークである。
- 音楽生成とローカル編集を,共通の「中間を埋める」形式で統一的に扱うことを可能にした。
- 転写からオーディオへの変換システムにおける位相認識型分類器フリーガイダンスのスケジューリング原理と,Tail-Drop戦略を提案した。
再計算か再利用か? VLM自己反省におけるテキストによる近道の実態解明と軽減 [eess.SY, cs.SY, cs.CV, cs.AI]目的:VLMの自己反省におけるテキストによる近道の影響と,その軽減策
- VLMは画像と言語を理解し,推論を行うため,様々な応用が期待されている。
- VLMは過去の推論結果に囚われ,新たな視覚的証拠を適切に反映できない場合がある。
- VLMがテキストによる近道に頼る行動を抑制し,視覚情報の再計算を促す方法を確立する。
- 過去の推論過程における証拠となるテキストが,視覚情報の再計算を妨げる近道として機能することが示された。
- 証拠となるテキストを削除することで,過去の回答への依存度が低下し,現在の画像に基づいた回答へのシフトが確認された。
- FSAFという介入手法により,視覚情報の更新率が向上し,過去の回答への依存率が大幅に低下した。
CultureVidBench:テキストから動画生成における文化的理解のベンチマーク [cs.CV, cs.CL, cs.MM]目的:テキストから動画生成における文化的理解の評価基準
- 動画生成技術の発展に伴い,多様な文化背景の表現が求められている。
- 既存のベンチマークは知覚的品質に偏っており,文化的な正確性を評価していない。
- 文化的な要素を考慮した動画生成モデルの評価手法を確立すること。
- CultureVidBenchは,12カ国,6大陸,8つの文化地域を網羅し,文化的な側面を評価する。
- 評価の結果,既存モデルはテキストとの意味的整合性や視覚的品質は高いものの,文化的詳細は不十分である。
- 特に,文化的表現が少ない地域や儀式,マルチモーダルな手がかりの再現に課題が残る。
UniMoCa:忠実な人物動画生成のためのモーションとカメラ制御の視覚的プロキシとしての統合 [cs.CV]目的:人物動画生成におけるモーションとカメラ制御の統合手法
- 動画生成において,自然な人物の動きとカメラワークは不可欠であり,リアリティの向上に貢献する。
- 複数人物,大きな動き,遮蔽,動的カメラなど,複雑なシーンにおける制御が困難である。
- 異質な制御インターフェースの問題を解決し,モーションとカメラの関連性をより明確にすること。
- UniMoCaは,3Dモーションとカメラ軌跡を視覚的プロキシに変換する「Motion-Camera Visual Proxy (MCVP)」を提案する。
- MCVPは,人物のジオメトリとカメラ軌跡マーカーを視覚的に表現することで,モーションとカメラの整合性を高める。
- Wan2.2 I2Vデータセットを用いた実験で,UniMoCaはモーション,カメラ制御,時間的一貫性,カメラ対応の頑健性において大幅な改善を示した。
Event ActivityNet:アンカットアクション理解のための大規模シミュレーションイベントベンチマーク [cs.CE, cs.AR, cs.CV]目的:長時間のイベントベースアクション理解のためのベンチマークデータセット
- 動画におけるアクション理解は,監視システムやロボティクスなど,様々な応用分野において重要である。
- 既存のデータセットは短いトリミング済みクリップが中心であり,長時間のイベントストリームデータの収集はコストが高い。
- 本研究は,大規模なシミュレーションイベントベンチマークを提供し,長時間のイベントベースアクション理解を促進する。
- Event ActivityNetは,3,263本の動画,200種類のアクションクラス,合計106.94時間のデータを含む大規模なベンチマークである。
- プログレッシブネスティングスケールでの学習により,認識精度(Top-1)は52.25%から66.42%に向上し,オンライン時間的局所化の平均mAPは21.7から29.0に改善された。
- Event ActivityNetによる事前学習は,ターゲットのみ,または最初から共同学習するよりも優れた性能を発揮することが示された。
スタイルフォージ:ハイパーグラフ場における反事実的推論による屋内家具のスタイリング [cs.CV]目的:屋内家具のスタイリング手法
- 現実的な屋内空間の自動生成は,バーチャルリアリティやデザイン分野で重要な課題である。
- 既存手法では,家具間の関係性が十分に考慮されず,全体的な調和が損なわれる場合がある。
- 家具間の高次な依存関係を捉え,一貫性のあるスタイリングを実現することを目指す。
- スタイルフォージは,動的なハイパーグラフスタイル場を用いて,家具選択の一貫性を向上させる。
- 反事実的スタイル嗜好学習により,文脈に合った家具の選択と配置を可能にする。
- 3D-FRONTデータセットでの実験により,最先端の性能と,より調和のとれた家具配置が確認された。
FAST-GS:周波数認識時空間ガウススプラッティングによるフォトリアリスティックな動的新規視点合成 [cs.CV, cs.AI]目的:フォトリアリスティックな動的新規視点合成のための手法
- 3Dシーンの再構成やリアルタイムな新規視点生成の重要性が高まっている。
- 既存手法では高周波な動きを捉えきれず,長期間にわたる安定性が課題となっていた。
- 複雑な動きの表現と長期的な安定性を実現し,高品質な動的3Dコンテンツの生成を目指す。
- 本研究では,動きを周波数に基づいた正弦波成分に分解する Fourier Motion Modeling モジュールを提案した。
- これにより,低周波の全体的な軌跡と高周波の局所的な詳細の両方を捉え,複雑な動きを正確にモデル化することを可能にした。
- 実験結果から,提案手法がN3VやGoogle Immersiveデータセットにおいて有効であることが示された。
OSSDD:センチネル1船探知のための新たなオープンデータセット [cs.CV]目的:SAR画像における船探知のための訓練データセット
- 海洋における状況把握は,不法漁業等の違法行為監視に不可欠である。
- SAR画像における大規模な訓練データセットは,光学画像と比較して不足している。
- 本研究は,SAR画像船探知のための高品質な訓練データセットを提供する。
- OSSDDは,VV/VH偏波のセンチネル1画像15,197パッチと55,759隻の船のアノテーションを含む。
- Faster R-CNN,FCOS,DETRの3つの検出器を用いた実験を行い,ベンチマークデータセットとしての有効性を示した。
- データセットはHugging Faceにて公開されており,今後の研究に貢献することが期待される。
長視野エージェントのためのLongHorizon-Harness:現実世界のタスクの進歩 [cs.CV]目的:長視野タスクにおけるエージェントの性能向上
- 現実世界の複雑なタスク解決には,長期的な計画と実行能力が不可欠である。
- 既存のエージェントフレームワークでは,タスク状態の追跡が困難であり,誤った自己評価が連鎖的に発生する。
- タスク状態を外部で明示的に管理し,環境からの検証によって更新することで,課題解決を目指す。
- LongHorizon-Harnessは,タスク状態管理問題を提起し,マネージ-実行-監査(MEA)ループを導入した。
- WeaveBench,Terminal-Bench~2.1,OSWorld~2.0において,Qwen~3.7-Plusの性能を大幅に向上させた。
- 異なるモデルやフレームワークにおいても,一貫した性能向上を示すことが確認された。
有限ゲームにおける高次ポテンシャル:存在,特徴づけ,ゲーム分解 [cs.GT, econ.TH]目的:有限ゲームの構造を,高次ポテンシャルと分解によって解明すること
- ゲーム理論は,経済学,政治学,生物学など,様々な分野で意思決定の分析に不可欠である。
- ゲームによっては,プレイヤー間の戦略的な相互作用を捉えるポテンシャル関数が存在しない場合がある。
- ゲーム全体を共通利益要素と個々の利益要素に分解する手法を確立すること。
- モンデラーとシャプレイの条件が満たされない場合でも,ゲームの共通利益要素を表すMSポテンシャルが構成可能である。
- MSポテンシャルは,分離可能なペイオフ項まで一意に存在し,高次MS条件が成立するときにのみ存在する。
- 全プレイヤーが等数の行動を持つゲームにおいて,MSポテンシャルは他のポテンシャル関数と一致する。
Roomer:3D屋内レイアウト合成における反射的なオブジェクトに基づいたモデル編集と修復 [cs.HC, cs.RO, cs.CV]目的:3D屋内レイアウトにおける違反の特定と,それらを局所的に修復する手法
- 現実世界の構築を支援するため,3D屋内レイアウトの自動生成技術の重要性が高まっている。
- 既存手法では,衝突や配置の誤りなど,局所的な違反が残存し,利用性を損なう場合がある。
- オブジェクト単位で違反を特定し,その周辺のみを効率的に修正することで,利用可能なレイアウトを生成する。
- Roomerは,レイアウトを「RoState」として表現し,「RoReview」を用いて違反と関連オブジェクトを結びつける。
- 提案手法は,既存の生成器で生成されたレイアウトの残存違反を修復し,物理的妥当性と利用可能性を向上させる。
- Roomer-CCとRoomer-Evalという新しいデータセットを導入し,物理的妥当性と実用的な利用可能性を評価する。
SVG生成における知覚的品質のベンチマークと評価のための視覚に基づくフレームワークSVGEval [cs.CV]目的:テキストからSVG生成における知覚的品質評価のためのベンチマークとスコアラーの開発
- マルチモーダルモデルの発展に伴い,SVG生成の応用が拡大しているため,その品質評価が重要である。
- 既存の評価方法はコード中心か,レンダリング後の画像評価に依存しており,人間の知覚やSVG特有の品質を反映していない。
- 人間の知覚に合致したSVG品質評価基準を確立し,SVG生成モデルの改善に貢献することを目的とする。
- SVGEvalは,視覚的レンダリングを用いてSVGの品質を評価し,人間のアノテーションに基づいた高品質なベンチマークを提供する。
- 既存のマルチモーダルモデルは,意味的整合性や美観は比較的得意だが,幾何学やレイアウトに関する判断は苦手であることが示された。
- 視覚的根拠と推論に基づく説明可能なSVG品質スコアラーを開発し,その有効性を示した。
プロキシアバターと低ランクキャッシュ:リアルタイムの感情制御可能なポートレートアニメーション [cs.CV]目的:感情制御可能なポートレートアニメーションのリアルタイムな一発生成
- 近年,拡散モデルを用いたポートレートアニメーションが発展しているが,リアルタイム性と感情表現の制御が課題である。
- 既存手法では,感情を考慮したモーションの事前知識が不十分であり,多段階のノイズ除去処理に高い計算コストがかかる。
- 本研究では,感情制御可能なポートレートアニメーションを低コストで実現するための手法を提案する。
- 提案手法では,感情を表現するプロキシアバターを用いてモーションを生成し,それをターゲットポートレートに適用することで,リアルタイムなアニメーションを実現する。
- 大規模な一発リターゲティングモデルにより,ターゲットポートレートに依存しないモーションを抽出することで,多様な顔に適用可能なアニメーションが可能となる。
- 低ランクキャッシュを用いることで,計算コストを大幅に削減し,リアルタイムな処理を実現している。
ET-Prune:テキスト豊富なMLLMにおける視覚トークンプルーニングのためのエビデンスに基づいた動的予算配分 [cs.CV, cs.CL]目的:テキスト豊富な入力に対する視覚トークンプルーニングの最適化
- マルチモーダル大規模言語モデルの推論コスト削減が重要視されている。
- 固定されたトークン比率では,テキスト豊富な入力への対応が難しい。
- 質問に基づいたエビデンスを保護し,効率的なトークン削減を目指す。
- ET-Pruneは,視覚トークンを約半数に削減しながら,既存のプルーニング手法と同等またはそれ以上の性能を6つの基盤モデルとベンチマークで示した。
- OCRBench-v2において,Qwen3-VL-8BとInternVL3.5-8Bでそれぞれ1.80と0.68のパーセンテージポイントで最良のベースラインを上回った。
- MMBench v1.1では,54.45%の視覚トークンを保持しつつ,0.8467の循環的完全一致精度を達成し,Vanillaの0.8437を上回った。
AdaThinkV:トークン効率の良い動画推論のための適応的思考 [cs.CV, cs.AI]目的:動画に対する質問の難易度に応じた推論努力の適応
- 動画理解は,ロボット工学や自動運転など,様々な応用分野において重要である。
- 大規模言語モデルを用いた動画推論では,簡単な質問に対しても多くのトークンを消費してしまうという課題がある。
- 質問の難易度に応じて推論の深さを自動的に調整し,トークン効率を向上させることを目指す。
- AdaThinkVは,明示的な推論と直接的な回答のモードを学習し,質問ごとに適切なモードを選択する。
- 提案手法は,既存の適応的ベースラインと比較して,平均精度が向上し,トークン使用量を削減することに成功した。
- 難解な問題に対しては,Variance Recovery Policy Optimization (VRPO)により学習信号を回復し,より効果的な推論を実現している。
DiffPrune:ビジョン言語モデルにおけるトークン削減のための微分可能な情報スロットリング [cs.CV]目的:ビジョン言語モデルにおける冗長な視覚トークンの削減
- 近年,ビジョン言語モデルの計算コストが課題となっており,効率化が求められている。
- 既存手法では,離散的な選択を近似するためにGumbel-Softmaxを使用し,不安定な学習過程となる場合がある。
- 情報損失の直接的な影響を考慮したトークンスコアラーを開発し,安定した学習を実現すること。
- DiffPruneは,トークンの情報を弱めることで,そのトークンの有用性を学習する。
- 10個のビジョン言語モデルのベンチマークにおいて,フルモデルの精度を96.5%維持しながら,LLMのプリフィルを2.85倍高速化。
- 推論時のオーバーヘッドはわずか0.69msであり,高い効率性を示す。
AI生成画像検出における視覚的証拠の根拠付けと説明:人間中心のシーンを対象として [cs.CE, cs.CC, cs.CV]目的:AI生成画像の検出における,根拠に基づいた視覚的証拠とその説明
- 画像生成モデルの急速な進歩により,画像の信頼性を判断する技術が重要になっている。
- 既存手法では,説明と証拠領域の間に不整合が生じ,信頼性が損なわれる場合がある。
- 人間中心のシーンにおける,信頼性の高い検出と説明を可能にすること。
- HAVEデータセットは,人間中心のシーンに特化した40K枚の実画像と39K枚のAI生成画像を含む,大規模なデータセットである。
- PAVEフレームワークは,信頼性予測,視覚的証拠の根拠付け,および領域に沿った説明の生成を同時に行う。
- 実験の結果,PAVEは認証検出,視覚的証拠の根拠付け,説明の質において高い性能を示した。
構造パラメータフリー親和性正則化によるフローマッチング [cs.CV, cs.AI]目的:拡散モデルの学習加速
- 画像生成の品質向上は重要であり,拡散モデルはその有力な手法である。
- 拡散モデルの学習は遅延することがあり,学習加速が課題となっている。
- 内部表現の正則化により学習を加速し,高品質な画像生成を目指す。
- 提案手法SPAREは,追加のエンコーダや学習可能な射影ヘッドを必要とせず,訓練メモリへの影響も小さい。
- SPAREは,ImageNet 256x256において,パラメータフリーな正則化手法の中で最も低いFIDスコアを達成した。
- SPAREは,既存手法REPAのFIDスコア低減効果の37~54%を再現し,REPAと組み合わせることで更なる改善を示した。
ASTRA:軌道アラインメントによる非同期空間時間再構成 [cs.CV]目的:非同期マルチカメラ入力下における動的3Dシーン再構成の性能向上
- 現実世界の映像取得では,複数カメラ間の時間ずれが避けられないため,高精度な再構成が困難である。
- 既存手法は光度に基づく時間ずれ推定に依存するが,大きなずれや複雑な動き下では効果が限定的である。
- 本研究は,2Dモーション軌跡を用いた明示的な制約により,時間ずれと動的3D表現を同時に最適化する。
- 提案手法ASTRAは,再構成された3D点の投影運動を観測された2D軌跡とアラインメントさせることで,時間ずれの推定精度を向上させる。
- 動的マスキングと確信度マスキングを用いることで,信頼性の低い軌跡制約の影響を抑制する。
- 実験結果から,ASTRAは最大25フレームの時間ずれ下でも高い空間詳細を維持し,PSNRを約1.4dB改善,時間ずれMAEを54.0%削減,同期成功率を4倍に向上させる。
グローバル潜在空間を超えて:スケーラブルな3Dモデリングのためのチャンクベースの疎性グリッドVAE [cs.CV]目的:スケーラブルな3Dモデリングのための手法
- 3D再構成において,空間構造を維持する疎性ボクセルグリッドは重要である。
- 解像度向上に伴い,アクティブなサーフェスセルの増加によりメモリ消費量が急増する。
- チャンクベースのアプローチにより,メモリ使用量を抑え,高速な並列推論を可能にすること。
- ChunkVAEは,$512^3$から$1536^3$のオブジェクトベンチマークにおいて,既存手法と同等以上の性能を示す。
- 小さなチャンクを使用することで,ピークメモリ使用量を削減し,チャンクごとの計算時間を短縮する。
- 安定したラテント空間と,画像から3Dへのメトリクスの改善は,ローカル圧縮がジオメトリをスケールアップしつつ,グローバルインターフェースを維持することを示唆する。
見えないインクの脅威:コンピュータ利用エージェントにおける正当なタスクの裏に隠された敵対的目標 [cs.CV]目的:コンピュータ利用エージェントに対する見えないインクの脅威の存在と影響
- 大規模言語モデルの利用拡大に伴い,自律的なコンピュータ操作を行うエージェントのセキュリティ確保が重要になっている。
- 既存の防御策は,明白な攻撃には有効だが,一見無害な指示に隠された攻撃を見抜けないという課題がある。
- 本研究は,一見無害な指示に隠された,低リスクな攻撃(見えないインクの脅威)を可視化し,対策を検討する。
- 研究チームは,444件の攻撃例を含む「II-Bench」を構築し,エージェントの脆弱性を評価した。
- 実験の結果,低リスクな攻撃指示がエージェントの防御機構や人間のレビューを容易に回避することが示された。
- この結果は,現在のコンピュータ利用エージェントにおけるセキュリティリスクの深刻さを露呈している。
AcoustiTrace:妥当な音が物理法則に違反するとき [cs.MM, cs.SD]目的:オーディオ・ビデオ生成における音響物理的リアリズムの評価
- 近年,視覚と聴覚を結びつける生成AIの重要性が増している。
- 生成された音が意味的には妥当でも,物理的な音響プロセスに矛盾することがある。
- 音響プロセスに起因する問題を定量的に評価する基準が求められている。
- AcoustiTraceは,音源,伝播環境,受音の8つの側面から評価する診断ベンチマークである。
- 実験の結果,最先端の生成モデルでも基本的な音響プロセスに課題があることが示された。
- AcoustiTraceの診断機能は,モデルの改善や音響原理の組み込みに役立つ可能性がある。
RSVideo:あなたのビジョン言語モデルはリモートセンシング動画に対応できているか? [cs.CV]目的:リモートセンシング動画理解のための評価基準とフレームワークの提案
- リモートセンシング技術は,環境モニタリングや災害対応など,様々な分野で重要な役割を担っている。
- 既存のモデルは,静止画像や離散的な時間的観察に焦点を当てており,連続的な動画データの理解が課題である。
- 本研究は,連続的なリモートセンシング動画を理解するための統一的な評価設定を確立し,モデルの性能向上を目指す。
- 新たなデータセットRSVideo-10Kを構築し,リモートセンシング動画理解のベンチマークRSVideo-Benchを開発した。
- 現在のビジョン言語モデルは,局所的な証拠の検出,短時間の状態の追跡,およびシーンに制約された空間関係の利用に苦戦していることが明らかになった。
- 提案するRSVideoフレームワークは,小ターゲットの時空間的フォーカスを強化し,InternVL3.5-14BとQwen3.6-27Bで顕著な性能向上を達成した。
オブジェクト履歴における状態の局所化:語彙相対座標によるアプローチ [cs.CV, cs.LG, cs.MM]目的:オブジェクト履歴と状態記述から,各状態が成立する区間を特定すること
- 視覚的な変化を通して同一オブジェクトを追跡することは重要だが,状態(空か満たされているか,損傷しているか否か等)を特定できない
- 既存手法では,常に同じ対象が映っているため,状態を識別するのに必要な証拠が隠されてしまう問題がある
- 複数の状態記述を比較参照することで,状態を特定するための情報を明確にすることを目指す
- 代替状態記述を語彙相対座標系に変換するD\'ej\`a Cueという学習不要なフレームワークを提案した。
- 78件のVOST履歴データを用いて実験を行った結果,R@1がtIoU 0.5で10.3%から20.5%に,Top-1 tIoUが16.0%から21.5%に向上した。
- 語彙相対座標によるクエリは,有用な区間を同じ候補セット内でより上位にランク付けすることが示された。
TBSG-Net:時系列二部シーングラフネットワークによる詳細な動画瞬間検索 [cs.CV, cs.AI]目的:詳細な動画瞬間検索のための手法
- 動画検索の精度向上は,情報検索やコンテンツ理解において重要な課題である。
- 既存のシーングラフは時間的な変化を捉えきれておらず,正確な検索が困難である。
- 時間的な関係性を明示的にモデル化し,動画の局所化精度を向上させることを目指す。
- 提案手法TBSG-Netは,動的なシーングラフを用いて,オブジェクト間の時間的相互作用を捉える。
- 新たに開発したDynamic Scene Graph Embeddingモジュールにより,時間幅と空間情報を統合的に学習する。
- 実験結果から,TBSG-Netは既存手法と比較して顕著な性能向上を示すことが確認された。
MIEScore:複数画像編集のための人間との整合性評価 [cs.CV, cs.MM]目的:複数画像編集のための包括的かつ人間との整合性のあるベンチマークと評価モデル
- 画像編集技術は急速に進歩しており,多様な応用が期待されている分野である。
- 既存の評価指標は単一画像編集に偏っており,複数画像編集の複雑さを捉えられていない。
- 複数画像編集における客観的かつ人間らしい評価を可能にする指標の確立を目指す。
- MIE-Benchは,16種類のタスクと3,000件の編集インスタンスを含む大規模なベンチマークである。
- MIEScoreは,人間による評価との整合性が高く,他の画像編集評価データセットにも汎化可能である。
- MIEScoreは,スキル最適化と多次元の教師ありファインチューニングを用いたMLLMベースの評価モデルである。
GIFT:非ラ Lambertian 単眼深度推定のための幾何学的性質に基づく微調整 [cs.NI, cs.CV]目的:非ラ Lambertian 面における深度推定の誤り抑制
- 単眼深度推定は,大規模データで学習が進み,多様な環境への適応が期待されている
- 鏡やガラスなどの非ラ Lambertian 面では,光の反射や屈折により,実際の表面ではなく,映り込みや透過物を深度として推定してしまう問題がある
- 幾何学的性質に着目し,外観の変化に左右されない微調整手法で,非ラ Lambertian 面の深度推定精度を向上させる
- GIFTは,カメラと対象物の幾何学的な配置を固定した上で,外観を変化させることで学習データを生成し,幾何学的不変性を利用して深度推定の誤りを抑制する
- 提案手法は,鏡や透明物体の深度予測を改善しつつ,ベースモデルの性能を維持する
- 新たに構築したベンチマークと実世界データセットでの実験により,GIFTの有効性が確認された
STEAM:階層的事前学習を用いた空間-時間的アラインメント混合エキスパートモデルによる脳波デコーディング [cs.CV, cs.LG]目的:脳波デコーディングにおける汎化性能,精度,効率的な適応の同時達成
- 脳波は,運動リハビリ,疾患診断など神経工学分野で幅広く活用されており,その重要性は高い。
- 従来の脳波デコーディングアルゴリズムは,汎化性能が限定的で,適応コストが高いという課題がある。
- 本研究は,脳波の汎化性能向上,高精度なデコーディング,効率的な適応を実現することを目指す。
- STEAMは,空間および時間的分岐を整列させるソフト混合エキスパート(SSMoE)モジュールを備えた階層的転移学習フレームワークである。
- 7つの下流データセットと14の評価設定において,STEAMは競合手法の中で平均ランクが最も高かった。
- 段階的事前学習戦略により,ターゲットパラダイムへのモデルの特化が進み,パラダイム固有のデコーディング精度が向上した。
CAVE:能力を意識した視覚的境界証拠アラインメントによる動画の時間的配置 [cs.CY, cs.CL, cs.CV]目的:動画の時間的配置における,視覚的境界証拠とタイムスタンプ予測の不整合軽減
- 動画の時間的配置は,動画理解の重要な要素であり,様々な応用への発展が期待される。
- 既存手法は最終的な予測結果のみを評価するため,境界に関する視覚的証拠の活用が不十分である。
- 視覚的境界証拠とタイムスタンプ予測の間の不整合を軽減し,より正確な時間的配置を実現する。
- 提案手法CAVEは,境界特有の視覚的証拠報酬を用いて,RLによる局所化最適化を強化する。
- 境界特有の証拠トークンを導入し,事前学習によって構造化された生成と明確な境界の意味を確立する。
- 性能に基づいた証拠監督のゲーティング機構により,局所化が不十分なグループに対する証拠ガイダンスを適応的に維持し,高精度化時に過剰な制約を回避する。
空間マスクとチャネル融合による深層多モーダル融合検出 [cs.CV, cs.MM]目的:物体検出のためのロバストなクロスモーダル特徴学習
- 物体検出において,複数のモダリティを融合することで性能向上が期待される分野である。
- 既存手法では,単一モダリティの統計的性質に過剰適合する可能性があり,汎化性能が課題である。
- モダリティ間の境界を積極的に混合し,固定されたモダリティラベルに依存しない汎化特徴学習を目指す。
- 提案手法は,共有チャネル空間注意機構に基づき,セマンティックマスク交換と学習可能なチャネル競争を導入する。
- 複数のデータセットでの実験により,提案手法の有効性と最先端手法との競争力を示すことができた。
- これにより,クロスモーダル物体検出のロバスト性を向上させることが示された。
