arXiv雑要約
画像・音声 - 2026/07/31 公開
FaithEyes:マルチエージェントによるプロセス画像検証を通じた忠実なツール利用に向けて [cs.NI, cs.NI, cs.DC, cs.CV]目的:忠実なツール利用の実現
- 視覚言語モデルは,信頼性と解釈可能性の高いマルチモーダル推論を可能にする強力な手法として注目されている。
- 既存のモデルは,質問に関連性の低い画像を利用するなど,ツールを不誠実に利用する傾向がある。
- ツール利用の有用性を評価し,報酬を調整することで,不誠実なツール利用を抑制することを目指す。
- FaithEyesは,VLMを用いて各プロセス画像が質問への回答に役立つかを判断するマルチエージェント自己判断フレームワークである。
- 判断結果を推論コンテキストに注入し,有用なツールの比率でツール報酬を調整することで,報酬ハッキングを抑制する。
- SFT+RLパイプラインによる学習の結果,既存のベンチマークにおいて同等以上の精度を達成し,ツール利用の忠実性を大幅に向上させた。
Qwen-UI-Agent技術報告:次世代の実世界中心型GUIエージェントへ [cs.AI, cs.CV]目的:実世界での利用を目指したGUIエージェントの構築
- デジタルデバイスの汎用的な操作実行者として,GUIエージェントの重要性が高まっている。
- 既存のエージェントは,実環境での信頼性や複雑なタスクの実行に課題がある。
- 多様な環境に対応し,自律的に能力を向上させるGUIエージェントの実現を目指す。
- Qwen-UI-Agentは,モバイル,コンピュータ,Web環境で高い性能を示す。
- モバイル環境では,MobileWorldで82.1%,MobileWorld-Realで92.2%の成功率を達成した。
- Opus 4.8,Gemini 3.1 Pro,GPT-5.6 Solを含む最先端モデルと比較しても遜色ない性能を発揮する。
自己生成:オンラインアンカー投射メモリとAction-3D RoPEを用いた自己中心的視点での世界-行動モデリング [cs.CV, cs.AI]目的:自己中心的視点の世界-行動シミュレーションによる,限られた実世界の訓練データ拡張
- 具現化されたAIにとって,自己中心的視点ビデオは豊富な操作経験を提供する重要な学習データである。
- 様々なシーン,物体,動作,具現化に対応した自己中心的視点データの収集には高コストがかかるという課題がある。
- 本研究は,実世界のデータ不足を補い,ロボットの汎化性能を向上させることを目指している。
- 提案手法は,事前学習済みのビデオ生成モデルを基盤とし,幾何学的な情報を考慮した2つの条件付け機構を導入している。
- オンラインアンカー投射メモリ(OAPM)は,初期フレームの3Dシーンアンカーを保持しつつ,自己回帰的な生成中に最新の状態を定期的に更新する。
- 実データ400件に合成データ400件を加えることで,シングルアームタスクの成功率が77%から84%,デュアルアームタスクでは53%から70%に向上した。
Space2Ground 2.0:ストリートレベル画像と衛星画像を融合した農業モニタリングのためのマルチソースデータセットとフレームワーク [cs.CV]目的:農業モニタリングのためのマルチソースデータセット及びフレームワーク
- 食料安全保障の確保は重要であり,正確な農業モニタリングが不可欠である。
- 衛星観測だけでは俯瞰的な視点しか得られず,雲の影響も受ける。
- ストリートレベル画像と衛星画像を融合し,より高精度な農業モニタリングを実現する。
- Space2Ground 2.0は,Sentinel-1 SAR,Sentinel-2マルチスペクトルデータとMapillaryのストリートレベル画像を統合した。
- キプロスにおける2022年の栽培期において,90万枚以上の画像から46,050枚のストリートレベル画像を選定し,8,581の圃場と関連付けた。
- ストリートレベル画像は,衛星データと組み合わせることで,圃場レベルの作物分類精度を向上させることが示された。
TARS:3D情報を用いない動画再撮影のための時間ステップを考慮したデータスケーリング [cs.CV]目的:テキストによるセマンティックな視点指定を通じた動画再撮影
- 動画の視点やカメラワークを制御する技術は,VR/ARなどの没入型体験や映像制作において重要である。
- 既存手法は,3D再構成の品質に依存したり,ペアとなる動画の不足により汎化性能が低いといった課題がある。
- 3D情報を必要とせず,少ないデータでカメラ制御と視点変更を可能にすることを目的とする。
- TARSは,時間ステップごとの感度分析に基づき,カメラモーションが確立される初期段階に着目した学習を行う。
- データスケーリングとテキスト・カメラの条件付けにより,大規模なカメラモーション下でも自然な再撮影を実現した。
- 実験により,TARSが既存手法よりも正確かつ時間的に一貫性のあるカメラ制御を提供することが示された。
Theia:大規模多Modalキャプション生成とIncidents1Mデータセットのデータフリー知識蒸留のための自動検証 [cs.CV, cs.AI, cs.MM]目的:災害応答のための大規模多Modalデータセットの構築と自動検証
- 災害管理のような重要分野では,高品質な多Modalデータセットが不可欠である。知識蒸留による知識転移に特に重要。
- 既存のデータセットは,説明テキストがないか,テキストと画像の意味が一致していないという問題がある。
- データフリー知識蒸留のための信頼性の高い多Modalデータセットを自動的に構築・検証することを目指す。
- Qwen3.5の異なるモデル(4B denseモデルと35B MoEモデル)を用いて,Incidents1Mから10万枚の画像を復元し,高品質なテキスト記述を生成した。
- 画像からLLMを隠蔽するimage-blind LLM-as-a-Judge検証パイプラインを導入し,データフリー知識蒸留におけるモダリティギャップをシミュレーションした。
- 2つのアーキテクチャ間の高い意味的合意(78.65/100)と,高いPrecision(77.6%)と低いRecall(46.0%)が確認された。
MSCM-net:マルチスケール畳み込みとMambaに基づくハイパースペクトル画像分類手法 [cs.CV]目的:ハイパースペクトル画像分類のためのモデル
- リモートセンシングや工学分野で広く利用され,その分類手法の研究は重要である。
- CNNやTransformerでは局所性の制約や計算コストが高いという課題がある。
- 局所特徴抽出と長系列モデリングを両立させ,計算複雑性を低減することを目指す。
- 提案手法MSCM-netは,マルチスケールCNNとMambaを組み合わせた新しいアーキテクチャを採用している。
- マルチスケール特徴抽出モジュール(MCSE)とMambaブロックのスタックにより,空間・分光情報の融合を強化する。
- 3つのベンチマークデータセットで実験を行い,高い分類性能と低い計算複雑性を実現した。
視覚的曖昧性を超えて:詳細な長文キャプションによる困難なシナリオでのロバストな単眼深度推定 [cs.CV]目的:困難なシナリオにおけるロバストな単眼深度推定の実現
- 単眼深度推定は,自動運転やロボット工学など幅広い応用分野において重要である。
- 非ランバーティアン表面や悪天候などの状況下では,視覚的曖昧性により深度推定の精度が低下する。
- 詳細な長文キャプションを活用し,視覚的曖昧性を緩和することで深度推定のロバスト性を向上させる。
- 提案手法CapDepthは,詳細な長文キャプションから得られる情報を活用することで,深度推定の精度を大幅に向上させる。
- 特に,非ランバーティアン表面における深度誤差を25.0%,悪天候下では22.0%削減することに成功した。
- 動的なキャプションエンコーダとテキスト適応型デコーダにより,テキスト情報の有効活用と深度推定の安定化を実現した。
タイコ:プログラムによるワールドモデルを用いた能動的抽象化(ARC-AGI-3) [cs.AI, cs.CV, cs.SC]目的:ゲームのルール,隠れた状態,目標を推論しつつ,行動効率を維持する能力の獲得
- 汎用人工知能(AGI)の実現には,未知の環境に適応し,効率的に学習する能力が不可欠である。
- 既存の手法では,複雑なゲーム環境において,効率的なルール抽出と目標達成が困難である。
- インタラクティブな環境で,テスト可能なモデルを生成し,その利用価値を判断する手法を確立する。
- タイコは,ゲーム固有のモデルを構築・利用することで,行動効率を高めることを可能にした。
- 特にGPT-5.6 SolとOpus 5は,100.00のRHAEを達成し,全てのレベルをクリアした。
- Opus 5は,従来の人間ベースラインと比較して,61%少ない行動回数でゲームを完了した。
RGB-Dカメラを用いた埋め込みデバイスにおけるアフォードンスセグメンテーションのパレート最適解探索 [cs.CV, cs.LG, cs.RO]目的:埋め込みデバイスにおけるアフォードンスセグメンテーションのためのパレート最適解の探索
- ウェアラブルロボットの実現には,環境との相互作用を理解するアフォードンスセグメンテーションが不可欠である。
- 従来の小型ネットワークは,ハードウェア制約が厳しいため,実用的な性能を発揮できない場合がある。
- ハードウェアアクセラレータを活用し,性能とハードウェア要件のバランスを取る手法を確立することを目指す。
- 提案手法は,RGB-D情報を統合した小規模な深層ネットワークを生成し,既存手法と比較して有効性が確認された。
- 生成された解は,汎化性能とハードウェア要件のバランスが取れたパレート最適解を特定する傾向にある。
- Jetson NanoとRealSense RGB-Dカメラを用いたプロトタイプシステムは,標準的なバッテリーでリアルタイム性能を達成した。
MonoVoc:軽量単眼オープンボキャブラリー3Dガウスにおける幾何学と意味の分離 [cs.CV, cs.AI]目的:単眼動画からのコンパクトで解釈可能かつ検索可能なオブジェクトレベルのセマンティックガウスマップの出力
- 次世代のインタラクティブシステムにおいて,自然言語による3Dシーンの理解は不可欠である。
- 既存の3Dガウスフレームワークは,多視点キャプチャ要件や高コストな最適化,大規模なメモリ消費が課題である。
- 幾何学と意味を分離することで,メモリ効率の良いオープンボキャブラリー3Dシーン理解を実現する。
- 本手法は,従来の最先端手法と比較してメモリ使用量を大幅に削減する。
- Replicaデータセットにおける評価で,レンダリング忠実度とセグメンテーション精度が良好に維持された。
- 日常的な単眼動画からの3D検索と質問応答を効率的,かつスケーラブルに実現する。
ObjectStream: ストリーミング動画理解のための潜在的オブジェクトをメモリアンカーとして [cs.CV, cs.AI]目的:ストリーミング動画理解におけるメモリ管理の枠組み
- 動画理解は,AI技術の発展とともに,様々な応用分野で重要性が増している。
- 従来の動画理解モデルは,文脈を効率的に保持できず,長時間の動画処理が課題であった。
- 潜在的オブジェクトをメモリアンカーとして利用し,動画文脈の保持効率と理解精度を向上させる。
- ObjectStreamは,既存のVideo-LLM表現から潜在的オブジェクトを抽出し,フレーム間でリンクすることで,持続的なメモリアンカーを構築する。
- オンラインストリーミング評価において,OVO-Bench Real-Time Visual Perceptionのスコアを10.0ポイント向上させ,GPUメモリ消費量とTTFTを約50%削減した。
- オフラインの長動画ベンチマークにおいても,大幅なトークン削減を達成しながら,ベースラインを上回る性能を示した。
AdaAnchor4D:アンカー条件付きの単眼UAV 4D再構成のための時空間特徴集約 [cs.CV]目的:単眼UAV動画を用いた複雑な都市シーンの動的再構成
- 都市の再構成は,自動運転や都市計画など,様々な応用分野で重要性が増している。
- 従来の動的ガウス法では,UAVシーンの多様な局所的な動的特性に対応できず,ゴーストやぼやけが生じやすい。
- 局所的な状態に合わせた動的表現を獲得し,UAVシーンにおける再構成の質を向上させる。
- 提案手法AdaAnchor4Dは,アンカー条件付き特徴集約(ACFA)により,局所・時間的状態に応じた動的表現を獲得する。
- アンカー状態の変形と局所ガウス幾何学的変形を分離し,非一様幾何学的サンプリングと均一グリッドパラメータ化の不一致を軽減する。
- UAV-Arc4D,VisDrone,UAVDTの実験において,代表的な動的ガウス法よりも高いレンダリング品質を維持しつつ,リアルタイムレンダリング性能を達成した。
同じ枝,異なる樹木:冠動脈セグメンテーションとFFR-CT判断一致のための分岐連結性指標 [cs.CV]目的:冠動脈セグメンテーションの質評価と,FFR-CTによる治療判断の一致度向上
- 虚血性心疾患の診断と治療において,冠動脈の正確な画像解析が不可欠である。
- 既存の評価指標では,分岐部位における連結性の断絶を見逃し,治療判断に影響を及ぼす可能性がある。
- 分岐連結性指標(BCS)を用いて,セグメンテーションの連結性を評価し,FFR-CT判断への影響を検証する。
- BCSは標準的な指標では捉えきれない,セグメンテーションの連結性の質を評価できることが示された。
- 重度の疾患において,BCSが高いほど,予測された形状と正解形状を用いたFFR-CT判断の一致度が高かった(OR 2.16)。
- ソフトBCSとSkeleton Recallは,同じ枝を復元するものの,異なる樹木構造を構築することから,両方の指標を報告することを推奨する。
マルチモーダル大規模言語モデルにおける学習不要トークン剪定のためのトークン傾向の捉え方 [cs.CV]目的:マルチモーダル大規模言語モデルにおける効率的なトークン剪定手法
- マルチモーダル大規模言語モデルの効率化は,その実用性と普及のために不可欠である。
- 既存の学習不要な剪定手法は,静的なヒューリスティックに依存し,重要なトークンを誤って削除する可能性がある。
- 本研究は,トークンの重要度の時間的な変化を捉え,誤った削除を防ぐことで,より効率的な剪定を目指す。
- 提案手法Trend-aware Pruningは,トークン剪定を静的な決定から時間的な軌跡モデリングの問題へと変化させる。
- 注意の流れの勢いを捉えることで,初期評価では重要度が低いにも関わらず,後で重要になる「late-blooming」トークンを再活性化する。
- 実験結果から,提案手法は多様なマルチモーダルタスクにおいて,効率と性能のトレードオフを改善し,77.8%以上のトークン削減を達成することが示された。
非通知の受信者説得学習 [cs.GT]目的:受信者への戦略的な情報開示
- 情報開示を通じて行動を左右するベイジアン説得は,経済学や機械学習において重要である。
- 外部情報源の影響を考慮したモデルが少なく,現実の状況との乖離が生じている。
- 受信者の私的な情報伝達スキームが不明な状況下での最適な説得戦略を学習すること。
- 提案アルゴリズムは,受信者の私的なスキームを知る送信者の最適戦略と比較して,後悔 bound $\widetilde{O}(T^{3/4})$ を達成する。
- 本研究では,指数的に増加する信念空間の分割問題を,一次元の変化点検出問題に帰着させることで効率的な学習を実現している。
- これにより,状態空間と受信者シグナルアルファベットのサイズに依存する多項式時間で解を導くことが可能となる。
Teffic-Audio:真偽の識別 [cs.CL, cs.SI, cs.SD, cs.AI]目的:音声ディープフェイクの検出
- 音声技術の進歩に伴い,悪意ある音声改ざんが容易になり,社会的信用を損なうリスクが高まっている。
- 既存のディープフェイク検出システムは,様々な改ざん手法や環境条件の変化に弱く,汎化性能が課題である。
- 多様な条件でロバストな性能を発揮し,実用的なディープフェイク検出を実現すること。
- Teffic-Audioは,Conformerベースのエンコーダ,多頭注意機構による統計的プーリング,そして二値分類器というシンプルな構造を採用している。
- 多源データ,攻撃・ソースバランスサンプリング,多様なオーディオ拡張といった学習レシピにより,汎化性能を向上させている。
- オープンソースデータのみで学習し,Speech-DF-Arenaの14のテストセットで1.454%のEERを達成し,リーダーボードで現時点で公開されているシステム中最優位な性能を示した。
ShadowDancer:動画とその影から統一的なダイナミクス表現を学習し,あらゆるアクションをビデオ世界モデルに教える [eess.SY, cs.SY, cs.CC, cs.CL, cs.CV, cs.AI, cs.LG]目的:インタラクティブなビデオ世界モデルにおけるあらゆるアクションのフレームレベル制御
- ビデオ世界モデルは,現実世界の複雑な動きを再現可能にするため,ロボット工学やシミュレーションなど多くの分野で重要である。
- 既存の手法では,アクションを正確に表現することが難しく,多様なダイナミクスに対応した精密な制御が困難である。
- 実演動画から学習することで,アクションの汎化性能を高め,新しい環境下でも再現可能にすることを目指す。
- ShadowDancerは,同じダイナミクスを異なる外観で再現する「影ペア」を大規模に構築することで,アクションの制御性を高める。
- 「影ペア」間の予測を行うことで,外観の違いを排除し,ダイナミクスの本質的な表現を獲得する。
- 実験の結果,既存の手法と比較して,アクションの転移性能と長期的なアクションの再現性が大幅に向上した(平均86%の勝率)。
自動抽出された概念活性化ベクトルによる画像類似性の説明 [cs.CV]目的:画像類似性における概念重要度の特定
- 画像類似性は多くの画像処理応用に不可欠であり,その判断根拠の理解が求められている。
- 既存の説明手法では,局所的な根拠しか示せず,類似性を駆動するグローバルな要因の特定が困難である。
- 潜在的な概念空間での摂動を通じて,画像類似性を説明し,その判断根拠を明らかにすることを試みる。
- Sparse Autoencoderを用いて自動抽出した概念活性化ベクトル(CAV)が,画像類似性の説明に有効であることが示された。
- 概念空間における摂動は,画像データの分布をより忠実に反映し,概念重要度は真の類似度スコアと線形関係にあることが確認された。
- 本手法は,個々の画像ペアだけでなく,画像群全体の類似性を説明し,類似性の理由を明らかにするExemplar Retrievalも実現した。
大規模基盤モデル時代における手と物体のインタラクション:再構成,生成,および具現化された転移 [cs.RO, cs.CV]目的:手と物体のインタラクションに関する基盤モデルの事前知識
- 手と物体のインタラクションは,ロボット工学やコンピュータビジョンの重要な課題である。
- 既存研究は,事前知識の導入箇所や不確実性の低減効果について体系的な分析が不足している。
- 手と物体のインタラクションにおける基盤モデルの事前知識の分類と活用方法を整理・分析すること。
- 本調査は,手と物体のインタラクションに関する基盤モデルの事前知識を体系的にレビューした最初の試みである。
- 事前知識を幾何学的,意味的,視覚的の3つのファミリーに分類し,各ファミリーの要素を特定した。
- ロボット学習における手と物体のインタラクションから得られた知識の活用についても考察した。
大規模クロス地域リモートセンシング洪水監視フレームワーク:運用マッピングと影響分析 [cs.CV]目的:広範囲な洪水監視と被害評価のためのフレームワーク
- 洪水災害の軽減には,効果的な監視が不可欠である。人口やインフラへの影響を最小限に抑える必要がある。
- 大規模な環境多様性のある地域での信頼性のあるリモートセンシングが課題であり,汎化能力の不足やアノテーションデータ不足が問題となる。
- 限られたデータ条件下での洪水検出能力向上と,データ不足や欠損モダリティへの対応を目指す。
- 教師あり学習モデルU-Net++が,今回のデータ条件下では自己教師あり学習モデルAnySatよりも優れた洪水予測精度を示した。
- AnySatは,より安定した性能を発揮し,大量のラベルなしデータや推論時のモダリティ欠損に対する優位性を持つ。
- 2019年のトゥルン洪水への適用結果は,公式な評価と概ね一致しており,深層学習とマルチモーダル衛星データの統合の可能性を示した。
QQWorld:ワールドモデル正則化のための分位点-分位点マッチング [cs.LG, cs.AI, cs.CV, cs.MM, cs.RO]目的:ワールドモデルの潜在分布の質的向上
- 効率的な計画立案には,潜在空間での未来状態予測が不可欠であり,その性能は潜在分布の質に大きく依存する。
- 既存手法では,裾の重いサンプルに対して正則化効果が減衰し,潜在分布の制御が不十分になる場合がある。
- 裾の重いサンプルに対しても効果的な正則化を実現し,潜在分布の制御精度を向上させる。
- QQWorldは,EPの代わりに分位点-分位点マッチングを用いることで,潜在空間におけるガウス分布との整合性を高める。
- クロスバッチQQにより,ランキングプールの拡大とバイアス-バリアンスのトレードオフを特徴づける。
- 4つの制御環境において,QQWorldはLeWMの計画成功率を改善し,より薄い潜在分布のテールを実現する。
負の対照群がラジオミクスと画像基盤モデルの特徴における容量依存性の混同要因を明らかにする [cs.CV, cs.LG]目的:ラジオミクスおよび画像基盤モデルの特徴における容量依存性混同要因の評価
- 腫瘍生物学の非侵襲的バイオマーカー開発が期待され,画像解析技術の重要性が高まっている
- 特徴量が腫瘍の体積や撮像アーチファクトに影響を受け,真の画像構造を反映していない可能性がある
- 画像の特徴量が独立した空間信号を捉えているか評価し,信頼性の高いバイオマーカー開発を目指す
- READII-2-ROQCフレームワークを用いて,3つの公開癌画像コホート(3,552腫瘍)を解析した結果,複数のモデルが空間構造を破壊しても性能を維持することが示された
- これは,特徴量が体積や文脈に依存した混同要因の影響を受けていることを示唆している
- READII-2-ROQCは,解釈可能で生物学的に根拠のある画像バイオマーカーと再現性のあるラジオミクスのワークフローを開発するための品質管理戦略を提供する
ニシモリ温度における疎グラフ上の Kohn-Sham スペクトル埋め込み:画像分類への応用 [cs.LG, cs.CV, cs.IT, math.IT]目的:画像分類のための,関連するランダム結合イジングモデルのニシモリ温度で評価される疎グラフスペクトル埋め込み
- 画像分類は,コンピュータビジョンの基盤技術であり,様々な応用分野で不可欠である。
- 深層ニューラルネットワークは高い性能を誇るが,モデルサイズが大きく,計算コストが高いという課題がある。
- 本研究は,疎グラフを用いた効率的なスペクトル埋め込みにより,軽量かつ高性能な画像分類器を開発する。
- 提案手法 KSSE は,ImageNet-1000 データセットにおいて 88.93% の Top-1 精度を達成した。
- KSSE は,Swin-L や ViT-H/14 と同等の性能でありながら,モデルサイズをそれぞれ 10 倍,30 倍削減した。
- グラフ構造の最適化技術である star-domain surgery により,効率的な計算と高い精度を実現した。
ViewMind3D:訓練不要な3D-QAのためのモジュール式視点認識推論 [cs.CL, cs.CV]目的:3D空間における質問応答の実現
- ロボットの知覚や自律行動において,3次元空間の理解は不可欠である。
- 従来の3D-QA手法は,高コストなアノテーションを必要とする訓練に依存している。
- 汎用的なLLM/VLMを活用し,訓練なしで3D-QAを実現する。
- ViewMind3Dは,多視点情報を活用し,3D再構成を必要とせずに空間推論を行う。
- 質問に応じて適切な視点を選択し,言語によるオブジェクトの指示に基づいて視覚情報を捉える。
- ScanQAとSQA3Dにおいて,既存手法と同等以上の性能を達成し,特に空間的根拠を持つ質問への回答精度が向上した。
VisualRouter:質問に基づいた長尺ビデオ理解のためのビジュアルサンプリング [cs.CV]目的:長尺ビデオ理解のための質問に基づいたビジュアルサンプリング手法
- 近年の大規模ビジョン言語モデルの進展によりビデオ理解は向上したが,長尺ビデオの処理は課題である。
- 既存のサンプリング手法は冗長性や時間的カバー率の不足,あるいは質問タイプへの対応不足が問題である。
- 質問の種類に応じた効率的なビジュアルサンプリングにより,長尺ビデオ理解の精度向上を目指す。
- VisualRouterは,質問をグローバルまたはローカルに分類し,それぞれに対応したサンプリング戦略を適用する。
- グローバル質問に対しては,関連性と時間的カバー率を両立したハイブリッド戦略を用いる。
- ローカル質問に対しては,イベントに基づいたフレーム選択戦略により,関連性,カバー率,多様性をバランスさせる。
視覚言語モデルは画像内のAI編集について推論できるか [cs.CV]目的:AI編集された画像に関する視覚言語モデルの推論能力の評価
- AIの信頼性確保には,AIによる画像改ざんの検出が不可欠である。画像生成技術の進展により,改ざん検出は困難になっている。
- 従来の二値分類器は解釈可能性と汎化性能に乏しい。既存の視覚言語モデルは,明示的な推論の教師データに依存している。
- 本研究は,視覚言語モデルに,教師データに頼らず,強化学習を用いてAI生成画像の編集に関する推論を学習させることを目指す。
- 提案手法は,従来の画像フォレンジック検出器と同等の検出・局所化性能を,より弱い教師データで達成した。
- グループ相対ポリシー最適化(GRPO)に基づく学習フレームワークと,有効交差比(eff-IoU)という統一的な評価指標を導入した。
- 強化学習は,視覚言語モデルにAI生成コンテンツに関する推論を教えるための効果的かつスケーラブルなメカニズムとなりうる。
ナノ衛星によるオンボード推論と生成データ拡張を通じた自律航空機監視への道 [eess.SY, cs.SY, cs.AI, cs.CV]目的:ナノ衛星からの自律航空機監視に関するワークフロー
- 地球低軌道からの航空機監視は,災害対応や安全保障において重要性が高い。
- 従来のシステムでは,大量の画像データを地上に送信する必要があり,通信帯域がボトルネックとなる。
- データ送信量の削減と,希少な航空機クラスの検出精度の向上が課題。
- オンボード推論と生成データ拡張の組み合わせにより,データ送信量と処理遅延を削減できることが示された。
- 生成された合成データを用いてデータセットのバランスを調整することで,少数クラスの検出精度が向上した。
- 量子化された検出器は,オンチップメモリに適合し,軌道上で毎秒25~30フレームの処理が可能であることが確認された。
リアルタイムPixOODへ: 自律走行車向け効率的な異常セグメンテーション [cs.CV]目的:自律走行車における異常セグメンテーションの効率化
- 自動運転の安全性確保は喫緊の課題であり,異常検知はその重要な要素である。
- 高精度な異常セグメンテーション手法は計算コストが高く,組込みハードウェアへの実装が困難である。
- 組込み環境を含む多様なプラットフォーム上でのリアルタイム処理を実現すること。
- 提案手法は,PixOODのNeyman-Pearsonスコアリングを再構成し,TensorRTによる最適化を行うことで大幅な高速化を実現した。
- デスクトップ環境では最大182 FPS,Jetson AGX Orinでは75 FPSを達成し,それぞれ20倍,18倍の高速化を示した。
- 本研究により,高度な異常セグメンテーションを自律走行車や鉄道アプリケーションに効率的に組み込むことが可能となった。
聴覚世界:CTスキャンからの微細な耳介構造セグメンテーションのための階層的行動誘導型世界モデリング [cs.CV]目的:耳介構造の微細なセグメンテーション
- 医療画像解析において,正確な耳介構造の把握は診断や治療計画において重要である。
- CT画像における耳介は占める領域が小さく,境界が不規則で,周囲組織との区別が困難である。
- 微細かつ複雑な耳介構造のセグメンテーション精度向上を目指す。
- 提案手法は,既存のセグメンテーション手法と比較して,CT画像における微細・不規則・重複する耳介構造のセグメンテーション精度を大幅に向上させる。
- 潜在的な世界モデルによる推論を用いることで,従来の逐次予測を超えた解剖学的推論が可能となる。
- HD95を43%以上削減し,その有効性を実証した。
アルゴリズムにおける因果性の役割 [cs.CL, cs.LG, cs.CY, cs.GT]目的:アルゴリズムによる是正策の役割
- 高リスクな分類問題において,個人の結果改善は重要である。
- 既存手法は予測反転のみに注力し,真の資格改善を考慮しない。
- 因果構造を考慮し,戦略的な行動を抑制する是正策を開発する。
- 因果的パフォーマンスフレームワークを用いて是正策の失敗モードを形式化。
- 因果構造を無視した是正策が,誤った行動変容を誘発する可能性が示された。
- 提案手法は,標準的な手法と比較して性能が向上し,モデルの再学習頻度を軽減する。
複数参照画像に基づくビデオキャプション生成 [cs.CL, cs.CV]目的:複数参照画像とビデオを結びつけたキャプションの生成
- ビデオコンテンツの理解と活用において,視覚要素とテキスト情報の連携は不可欠である。
- 既存のビデオキャプションモデルは,特定の視覚要素と参照画像の関連付けが不十分である。
- ビデオと複数参照画像間の正確な対応関係を確立し,より詳細で信頼性の高いキャプション生成を目指す。
- 提案手法RefCaptionerは,既存のオープンソースモデルの中で最も高い性能を達成した。
- 生成されたキャプションは,アノテーターからの評価も高く,ビデオの忠実な再構築に貢献する。
- MRVBenchという新しいベンチマークを用いて,キャプションの事実性と複数参照画像との関連付けを評価した。
フレーム選択を超えて:長編動画理解のための生成潜在的証拠集約 [cs.CL, cs.CV]目的:長編動画理解における性能向上
- 動画理解は,様々な分野で応用が期待されており,その重要性は増している。
- 既存手法では,動画から抽出されたキーフレーム間の関連性が十分に活用されていない。
- 本研究では,キーフレーム間の情報を集約し,動画理解の精度向上を目指す。
- 提案手法GenEvAは,既存のフレーム選択ベースラインと比較して,一貫して性能が向上する。
- 4つのベンチマークにおいて,LLaVA-Videoの平均スコアが+5.2ポイント,Qwen2.5-VLのLVBench精度が+10.1ポイント向上した。
- 動画トークンのオーバーヘッドはわずか0.11%~0.40%で,タスクに応じた効率的な証拠利用が確認された。
自身の弱点証明を行うエージェント:安全な対戦相手の搾取のための信頼度スケジュールに基づく制限付き応答 [cs.GT, cs.AI, cs.MA]目的:対戦相手の欠陥を利用した価値の獲得
- 不完全情報ゲームにおいて,ナッシュ均衡戦略は安全だが,対戦相手の弱点を活かす余地を残す。
- 対戦相手の弱点を利用する際,安全性と効率性のバランスを取ることが難しい。
- エージェント自身で検証可能な安全な搾取手法を確立すること。
- 提案手法(CS-RNR)は,エージェントが実際に実行する戦略を証明書によって保証する最初の対戦相手搾取法である。
- Leduc Hold'emにおいて,既存手法と比較して$6.2$倍の利益を得ながら,予算内に戦略を収めることができた。
- 一連のゲーム(Leduc, Liar's Dice, 5-rank Leduc)において,$36{,}000$回の検証で証明書の許容範囲内に収まった。
除去すべきもの,保存すべきもの:汎用画像復元における二重曖昧性解消 [cs.CV, cs.AI]目的:汎用画像復元のための二重曖昧性解消
- 画像劣化は多様であり,その復元は重要な課題である。現実的な画像を扱う上で不可欠な技術。
- 既存手法では,劣化条件と画像内容が混同し,復元品質を阻害する問題がある。
- 劣化条件と内容の分離により,より高品質な画像復元を実現することを目指す。
- 提案手法DAR-Netは,劣化状態を構造化し,チャンネル方向と空間方向の曖昧性を解消する。
- 標準的なベンチマークテストにおいて,最先端の競合手法を0.14dB〜0.34dB上回る性能を達成した。
- CDD-11やWeatherBenchにおいても優れた性能を示し,汎用性の高さが確認された。
MarkushGlyphとOCSRGlyph:化学構造認識の改善 [cs.CY, cs.CV]目的:化学構造画像の線形表記への変換
- 特許や論文に多く含まれる化学構造は,データベース化や機械学習に不可欠である。
- 特にMarkush構造の解析は難易度が高く,既存手法では十分な性能が得られていない。
- 画像全体を読み込むことで,Markush構造の解析精度向上を目指す。
- 本研究では,立体化学を考慮したことで,OCSRモデルOCSRGlyphの性能が向上した。
- Markush構造解析のため,視覚情報とテキスト情報を統合的に処理するMarkushGlyphを提案した。
- 既存の評価指標の問題点を改善し,Markush構造翻訳の正確性をより適切に評価できる新たな指標を導入した。
ScaFE:LLM生成臨床特徴プログラムによる効率的な瘢痕分類 [cs.CE, cs.CV, cs.LG]目的:臨床写真からの病理的瘢痕分類
- 瘢痕分類は,患者のQOLに影響する重要な医療課題である。
- 専門家によるラベル付けデータが限られ,病院間での撮影条件にばらつきがある。
- LLMを活用し,データ効率が高く,監査可能な特徴プログラムによる分類を目指す。
- ScaFEは,3病院のデータセットにおいて,81.0%のサイト・マクロバランスアキュラシーを達成した。
- 既存の基盤モデルBiomedCLIPを10.0%上回る性能を示し,データ効率の高さも確認された。
- 実行可能なプログラムの成功率が66.7%から95.0%に向上し,特徴の根拠も検証された。
拡散Transformerを用いたマルチモーダル意図駆動型ネットワーク:医療画像融合 [cs.RO, cs.ET, cs.CV]目的:医療画像融合による診断支援の精度向上
- 多様な画像診断モダリティの情報を統合し,臨床診断を支援する上で重要である。
- 既存手法は画一的な融合規則に依存し,診断意図や病理構造の理解が不足している。
- 診断意図を考慮した,より高精度な医療画像融合を実現することを目指す。
- 提案手法MINDは,BioMedGPTを用いて診断意図に基づいた融合テキストを生成し,病理構造を考慮した融合を可能にする。
- 1次元化による空間情報の損失を抑制するため,Multi-scale Latent Adapterを導入し,特徴抽出を強化する。
- 融合画像と診断意図のずれを解消するため,医療画像の意味的一貫性損失を設計し,セマンティックな連結を強化する。
テキストからの衛星画像変化検出:効率的な前後の画像組み合わせ手法 [cs.CL, cs.CV, cs.IR]目的:衛星画像アーカイブにおける変化検出のための,効率的な前後画像組み合わせモジュールの設計と評価
- 地球観測の運用において,変化検出は重要な課題であり,迅速な変化把握が求められている。
- 大規模な衛星画像アーカイブからの変化検出は計算コストが高く,処理速度がボトルネックとなることが多い。
- 本研究は,高速かつ高精度な変化検出を実現するための,前後画像組み合わせモジュールの最適な設計を模索する。
- 2段階の検索手法(差分モデルによる候補絞り込みとアテンション融合による再ランク付け)は,LEVIR-CCにおいてフル融合と同等の再現率を達成しつつ,クエリコストを10~15倍削減した。
- 線形時間スキャンを行うMambaは,ビジョンTransformerで一般的なパッチ数では,アテンションに比べて速度上の利点を示さなかった。
- 融合表現の圧縮(TBF)は,パラメータ数を2.3倍,レイテンシを1.6倍削減したが,過度な圧縮は変化検出に重要な情報を損失させる可能性があることが示された。
チーレ投票ルールに基づく構造化選挙のためのアルゴリズム [cs.GT, cs.AI, cs.DS, cs.MA]目的:承認型委員会選挙における勝者決定問題の計算複雑性
- 選挙制度の効率的な設計は,民主的な意思決定の根幹をなす重要な課題である。
- 承認型選挙における勝者決定は,計算困難な問題であり,大規模選挙での実用性が課題となっている。
- チーレ投票ルールにおける特定の条件下での計算効率化を目指す。
- チーレ投票ルール下では,有権者の承認票パターンが候補者間の依存関係を形成することが示された。
- Voter Interval (VI)ドメインにおいて,Proportional Approval Voting (PAV)を含むチーレ投票ルールに対し,FPTアルゴリズムが設計された。
- 候補者を承認する有権者が2人以下のインスタンスに対し,多項式時間アルゴリズムが提供され,VIドメインにおけるPAVの計算複雑性に関する理解が深まった。
ROAD:3D形状生成のための識別的意味論の双方向目的アラインメント [cs.CV]目的:3D形状生成における識別的意味論の活用による計算コスト削減
- 高精度な3D生成は重要だが,計算資源を大量に消費する課題がある。
- 既存手法では,3D形状をゼロから学習するため,効率性に課題が残る。
- 識別モデルが持つ3D世界の理解を活用し,生成コストを削減することを目指す。
- ROADは,拡散変換器に識別的知識を転送することで,3D生成のトレーニングコストを削減する。
- 生成モデルと識別モデルの潜在空間の異質性に対処するため,双方向目的アラインメント戦略を導入。
- Step1X-3Dと比較して,1.5%のトレーニングデータで競争力のある性能を達成し,計算コストを大幅に削減。
3つの順位付けにおけるケメニー集計の複雑性 [cs.GT, cs.CC, cs.DM, math.CO, math.OC]目的:ケメニー則を用いた順位付け集計の計算複雑性
- 多数の意見を統合する際の合理的な判断方法の確立が重要である。
- ケメニー則の計算はNP困難であり,現実的な規模の問題への適用が難しい。
- 3つの順位付けに対するケメニー則の計算困難性を厳密に証明し,問題の構造を明らかにする。
- 3つの順位付けに対して,ケメニースコアの計算はNP完全であることが示された。候補ペアが常に2対1で分割される場合でも同様である。
- 固定された順位付け数に対して,問題の計算困難性の分類が完了し,スレーター順序やマローズモデルなど,関連する問題にも適用できる。
- 3つの等距離な順位付けに対するケメニースコアおよびケンダルタウ中心のNP完全性が,6コピー構成によって証明された。
MixFrag:脆弱性に基づいたVision Transformerの混合精度事後学習量子化 [cs.CV, cs.LG]目的:Vision Transformerの混合精度事後学習量子化における精度割り当ての最適化
- 画像認識モデルの軽量化は,モバイル環境などリソース制約のあるデバイスでの利用に不可欠である。
- 既存の量子化手法は,Transformerの各コンポーネントの量子化に対する感度差を考慮せず,非効率な精度割り当てになる。
- MixFragは,コンポーネントの脆弱性を評価し,最適なビット割り当てを行うことで,より効率的な量子化を目指す。
- MixFragは,ImageNet-1Kにおける複数のVision Transformerアーキテクチャで,競争力のある分類性能を達成した。
- COCOオブジェクト検出・インスタンスセグメンテーションにおいて,既存の混合精度PTQ手法中最先端の性能を示した。
- 提案された脆弱性指標は,学習されたビット割り当てとの強い相関関係が確認された。
VAD:マルチモーダルオンポリシー蒸留におけるターゲット再構成に対する視覚的証拠の帰属 [cs.CV, cs.CL]目的:マルチモーダルオンポリシー蒸留における視覚的証拠の帰属
- マルチモーダル学習は,多様な情報源を活用し,より高度な認識能力を実現する上で重要である。
- 従来の蒸留法では,視覚的情報と言語的情報が混在しており,どの修正が視覚的証拠に基づいているかの特定が困難である。
- 視覚的証拠に基づいたターゲット再構成により,蒸留の精度と解釈性を向上させることを目指す。
- VADは,教師の修正における視覚的証拠に起因する部分を推定するカウンタファクチュアルターゲット再構成アルゴリズムである。
- 実験の結果,VADは直接的な特権視点蒸留や視覚的優位性重み付けよりも優れた性能を示し,タスク関連の視覚的修正が強化された。
- カウンタファクチュアルターゲット再構成が,ソース混合型監視に対する有効な代替手段であることが示唆された。
ビーコン:エージェント的視覚推論の実行時期と方法の認識 [cs.CV]目的:マルチモーダル大規模言語モデルにおける複雑なタスクの成功率向上
- 視覚的情報とテキストを統合した高度な推論能力は,AIの汎用性向上に不可欠である。
- 既存のエージェント的視覚推論モデルは,ツール使用の適応性に課題を抱えている。
- ツール使用による性能向上を,容易な問題への悪影響なく実現すること。
- 本研究では,必要に応じてツールを適切に利用する適応性と,ツール使用による真の性能向上を実現するBeaconを提案する。
- Beaconは,タスクの必要性に応じた適応的なツール呼び出しと,最も困難な問題に対するツール使用能力強化のメカニズムを導入する。
- 多様なベンチマーク実験の結果,Beaconは全体的な性能と,モード適応性とツール効果の両方において大幅な改善を示す。
OSReward:クロスプラットフォームのコンピュータ利用報酬モデルに対する標準化された評価の導入 [cs.AI, cs.CL, cs.CV]目的:コンピュータ利用エージェントの報酬モデルの評価基準の確立
- コンピュータ利用エージェント研究は,デジタル世界における自動化の可能性を広げる重要な分野である。
- 大規模なタスク遂行検証が難しく,人間の評価に頼る部分が大きいという課題がある。
- VLM(Vision-Language Model)の信頼性を評価し,より安価で信頼性の高い報酬モデルを開発すること。
- 既存の最先端VLMですら,理想的な評価者には及ばず,失敗事例を成功と誤認する傾向が見られた。
- OS-Shepherd-100Kという,推論注釈付きの軌跡判断コーパスを構築・公開することで,コミュニティに貢献した。
- OS-Shepherd(9Bおよび35B)をトレーニングし,商用モデルと同等の性能を30〜60%低いコストで実現した。
キメラ:ハイブリッド視覚拡散Transformerの設計とチンチラによるスケーリング [cs.CV]目的:高解像度画像,長尺動画,マルチモーダルコンテキストに対応する視覚生成のための効率的な拡散モデルの設計
- 視覚生成における高解像度化,長尺化,マルチモーダル化のニーズが高まっている
- 従来の全注意機構は計算コストが非常に高く,高解像度・長尺データへの適用が困難である
- 効率的な長文脈処理を可能にするハイブリッドなアーキテクチャとスケーリング手法を開発すること
- キメラは,Kimi Delta Attention,Multi-head Latent Attention,畳み込み層を組み合わせたハイブリッドなバックボーン構造を持つ
- HeteroPというモジュールごとのハイパーパラメータ転送スキームにより,最適な計算資源配分を実現
- 11Bパラメータのキメラモデルは,2Bの活性パラメータで,既存のモデルと比較して計算効率が大幅に向上
PhiZero:物理言語に基づくワールドモデル [cs.CV]目的:物理世界の状態遷移を記述するコンパクトな離散表現である物理言語に基づくワールドモデルの構築
- 物理シミュレーションは,ロボティクスやコンピュータビジョンの発展に不可欠な技術である。
- 既存のモデルは高次元の視覚情報に依存し,物理法則の明示的な理解が困難である。
- 物理言語を用いることで,物理世界の進化を明示的に推論し,より現実的なシミュレーションを実現する。
- PhiZeroは,物理言語を推論し,それを映像に変換する「推論→レンダリング」というパラダイムを採用している。
- 生成・理解に関する様々なベンチマーク実験で,PhiZeroの物理的に整合性の取れたワールドモデルとしての能力が確認された。
- リアルでインタラクティブなワールドモデリング,詳細な行動条件付きシミュレーション,ゼロショットモーション転送の可能性を示した。
ACE-Data-0:人間中心の環境キャプチャによる具現化されたデータエンジン [cs.CV]目的:人間中心の環境における知覚,全身運動,操作,物体状態,音,触覚の進化を捉えたデータセットの構築
- 具現化された知能は,人間の行動を理解する上で不可欠であり,多様なデータを統合的に分析する必要がある。
- 既存のデータセットは,視点,モダリティ,空間スケールが分断されており,知覚と行動のループを完全に捉えられていない。
- ACE-Data-0は,これらの課題を解決し,具現化されたAI研究のための包括的なデータ基盤を提供する。
- ACE(Ambient Capture Engine)は,現実の家庭環境を空間的にキャリブレーションされた,時間的に同期された記録スタジオに変える。
- ACE-Data-0は,200のタスクカテゴリ,50人の参加者,2つの環境で合計150時間のデータと1700万フレームのビデオを含む。
- このデータセットは,模倣学習,ワールドモデル,視覚-言語-行動システム,具現化されたAIの基盤として活用可能である。
ReToken:ビジュアル検索のためのビジョン言語モデルを改善する一つのトークン [cs.CV, cs.AI, cs.LG]目的:ビジュアル検索におけるビジョン言語モデルの性能向上
- 画像とテキストの組み合わせた情報処理は,多様な応用を可能にする重要な技術である。
- 長大な視覚的コンテキストを処理する際,モデルの性能が低下し,計算資源も圧迫されるという課題がある。
- クエリに関連する視覚的トークンを効率的に選択し,計算コストを削減することで,性能向上を目指す。
- ReTokenは,わずかな画像QAデータセットのみで学習可能であり,様々なベンチマークで一貫した性能向上を示す。
- Visual Haystacksにおいて,Qwen3VL-8Bの性能を13.4ポイント,InternVL3.5を12.4ポイント向上させた(20%以上の相対的な改善)。
- LVBenchでは,Qwen3VL-8Bを用いて長尺動画に対してゼロショット転移を行い,8.0ポイントの性能向上を実現した。
