arXiv雑要約

画像・音声 - 2026/08/04 公開

  • Mambaポリシー:ハイブリッド選択的状態モデルによる効率的な3D拡散ポリシーへ [cs.RO, cs.CV]目的:3D拡散ポリシーの効率化
    • 3D操作において,分布学習による正確な行動軌跡予測が重要視されている。
    • 従来の拡散モデルは大規模なUNetを必要とし,リソース制約のある環境での利用が課題であった。
    • Mambaモデルを活用し,パラメータ数を大幅に削減しつつ高性能なポリシーの実現を目指す。
    • Mambaポリシーは,既存のポリシーネットワークと比較して80%以上のパラメータ削減を達成した。
    • Adroit,Dexart,MetaWorldデータセットにおいて,既存手法を上回る性能を示した。
    • 長期的シナリオにおいて,Mambaポリシーはより高いロバスト性を示すことが確認された。

    Link: https://arxiv.org/abs/2409.07163

  • モード連結の視点を通じた機械的アンラーニングの理解 [cs.HC, cs.MM, cs.LG, cs.AI, cs.CL, cs.CV]目的:機械的アンラーニングにおけるモード連結の検証
    • 機械学習モデルのプライバシー保護やモデル更新において,不要な情報を効率的に削除することは重要である。
    • 従来のアンラーニング手法では,モデルの性能劣化や計算コストの問題が残存している。
    • アンラーニングの最適化挙動を理解し,より効果的かつ安全なアンラーニング手法を開発すること。
    • アンラーニングされたモデルの多くは,滑らかな保持/忘却挙動を示す連結された領域に存在することが示された。
    • 訓練ダイナミクスの変化が,モデルを異なる領域へと移動させることが明らかになった。
    • モード連結に基づくアンサンブル学習は,汎化性能と再学習攻撃に対する頑健性を向上させることが示唆された。

    Link: https://arxiv.org/abs/2504.06407

  • 3D理解のための統一的トークン化による効率的なCLIP適応 [cs.CV]目的:3D点群データの理解におけるCLIPモデルの再利用
    • 近年の画像とテキストの大規模事前学習モデルは,豊富な意味的知識を蓄積しており,様々な応用が期待されている。
    • 3Dデータはアノテーションが少なく,取得も困難であるため,2Dモデルの知識を転移する手法が求められている。
    • 点群データとCLIPモデルの入力形式の差異を吸収し,効率的な3D理解を実現することを目指す。
    • 提案手法UTok3Dは,入力適応的な幾何学的スケールを推定することで,疎なボクセル化や座標正規化を調整し,点群の幾何学的構造をCLIPが解釈可能な形式に変換する。
    • 異なるメトリックスケールを持つ点群データセット(ShapeNetPart, ScanNetV2等)に対して,アノテーションなしで3Dセグメンテーションを効果的に行うことを実証した。
    • マルチビュー画像からの特徴抽出とSinkhorn Ranked Contrastive distillationを組み合わせた自己教師あり学習により,3Dアノテーションなしでの学習が可能となった。

    Link: https://arxiv.org/abs/2505.18819

  • 網膜変性評価のための深層学習:MICCAI 2024 MARIOチャレンジの包括的分析 [cs.CV, cs.AI]目的:加齢黄斑変性(AMD)の自動検出とモニタリング
    • 高齢化社会において,AMD患者の増加が医療負担増大の一因となっている。
    • OCT画像からのAMD病状変化の正確な定量化には,熟練した医師の専門知識が不可欠である。
    • AIによるAMD進行度評価の自動化と,将来予測精度の向上が求められている。
    • MARIOチャレンジの結果,AIはAMDの進行度測定(Task 1)において医師と同等の性能を示した。
    • しかし,将来のAMDの進行予測(Task 2)においては,AIはまだ医師のレベルには達していない。
    • 本チャレンジは,OCT画像を用いたAMDモニタリングにおけるAIのベンチマークとして貢献する。

    Link: https://arxiv.org/abs/2506.02976

  • MGDFIS:小物体検出のためのマルチスケールグローバル-詳細特徴統合戦略 [cs.CL, cs.CV, cs.AI, cs.LG]目的:小物体検出における性能向上
    • UAV画像における小物体検出は,監視や自動運転等の応用において重要である。
    • 既存手法では,小物体検出において背景との識別が難しく,誤検出が多いという課題がある。
    • 本研究は,小物体と背景の識別を改善し,検出精度を向上させることを目指す。
    • 提案手法MGDFISは,YOLO26mにおいてAP50:95を25.7から30.2へ,AP50を37.2から44.2へ改善した。
    • UAVDTデータセットではAP50が38.9,AP50:95が21.9,CARPKデータセットではAP50が97.4を達成した。
    • MGDFISは,グローバルコンテキストの活用,詳細特徴の復元,ピクセルレベルでの再調整を組み合わせている。

    Link: https://arxiv.org/abs/2506.12697

  • CDG-MAE:拡散生成ビューを用いたクロスビューマスクモデリング [cs.CV]目的:クロスビューマスクモデリングにおける性能向上
    • 多様な視点からの対応関係は,動画のラベル伝播などの応用において不可欠である。
    • 多様な動画データセットの収集コストが高く,単純な画像クロップでは十分な視点変化が得られない。
    • 静止画像から多様な合成ビューを生成し,学習信号を充実させることで,動画ベースの手法との差を縮小する。
    • 拡散モデルを用いて生成された合成ビューが,学習データに豊富な視点と透視の変化をもたらすことが示された。
    • 標準的なMAE設定を多重アンカーマスキング戦略に改良し,事前学習タスクの難易度を向上させた。
    • CDG-MAEは,動画ベースのMAE手法との性能差を大幅に縮小しつつ,画像のみのMAEの利点を維持する。

    Link: https://arxiv.org/abs/2506.18164

  • 3Dガウススプラッティングによる法線推定のための連続潜在最適化:CLONE [cs.CL, cs.CV, cs.AI]目的:3Dガウススプラッティングを用いた法線推定のための連続潜在最適化フレームワーク
    • 3次元形状理解は,コンピュータビジョンやロボティクス等の分野において重要な課題である。
    • 法線推定には,正確な法線ラベルが必要であり,その取得は困難である。
    • 法線ラベルを用いずに,弱学習によって法線推定を行うことを目指す。
    • CLONEは,画像-幾何-画像の一貫性ループを構築し,明示的な幾何学的表現と微分可能なレンダリングを統合することで,法線ラベルなしでの弱学習を可能にする。
    • 学習可能な変調カーネルを用いて3Dガウススプラッティングのパラメータ空間を再パラメータ化し,幾何パラメータと法線間の明示的な安定したマッピングを確立した。
    • 異なる領域からの法線推定値を融合し,多視点再投影の一貫性と幾何学的正則化を適用することで,精度の高い法線推定を実現した。

    Link: https://arxiv.org/abs/2508.05950

  • 微分可能な物理ベースカメラシミュレーション:逆レンダリングと具現化されたAIのために [cs.CL, cs.GR, cs.CV, cs.RO]目的:逆レンダリングと具現化されたAIのための微分可能な物理ベースカメラシミュレーション
    • 視覚モデルの学習や視覚運動学習には,現実のカメラ画像を忠実に再現した合成画像の生成が不可欠である。
    • 既存の仮想カメラは,内部設定の制御が限られており,光学的なアーティファクトの表現が難しく,調整可能なキャリブレーションパラメータが不足している。
    • カメラ設定の微調整,光学効果のモデル化,現実世界のデータによるキャリブレーションを可能にし,ロボットの認識性能を向上させる。
    • DiffPhysCamは,カメラ設定の細かな制御,デフォーカスなどの光学効果のモデル化,現実世界のキャリブレーションを可能にする多段階パイプラインを備えている。
    • このシミュレータは,画像合成のためのフォワードレンダリングと,3Dシーン再構成のための逆レンダリングの両方を可能にする。
    • 逆レンダリングにより作成されたデジタルツインを用いて,自律走行車両のナビゲーションをマルチフィジックスシミュレーションで実証した。

    Link: https://arxiv.org/abs/2508.08831

  • 極端な対流検出における統計的類似性の罠の打破 [cs.LG, cs.CV]目的:極端な対流検出のための高解像度衛星輝度温度場の生成
    • 気象予測における深層学習モデルの重要性が増しているため,その評価方法の改善が求められる。
    • 既存の評価指標は,稀に発生する高影響イベントを見逃し,曖昧な予測を過大評価する傾向がある。
    • 統計的類似性の罠を回避し,極端な対流をより正確に検出するための新たなフレームワークを開発する。
    • 既存の高度なベースラインモデルは高い相関を示す一方で,危険な対流の検出において低いCSIスコアしか得られていないことを定量的に示した。
    • DART(Dual Architecture for Regression Tasks)という新しいフレームワークを導入し,粗い気象予測を高解像度の衛星データに変換することで,極端な対流の検出性能を向上させた。
    • DARTは,背景と極端な現象を明示的に分解するデュアルデコーダアーキテクチャ,物理に基づいたオーバーサンプリング,およびタスク固有の損失関数を採用しており,CSI=0.273,バイアス=2.52という結果を示した。

    Link: https://arxiv.org/abs/2509.09195

  • ControlHair:物理シミュレーターとビデオ拡散の相乗効果による制御可能な動的ヘアレンダリング [cs.CL, cs.GR, cs.CV]目的:制御可能な動的ヘアレンダリングの実現
    • ヘア表現は,リアリティの高い映像制作において不可欠である。その複雑さから,高度な技術が求められる。
    • 従来の技術では,ヘアの複雑な動きと視覚効果を同時に制御することが困難であった。
    • 物理シミュレーションとビデオ拡散モデルを組み合わせ,ヘアの動きを精密に制御する手法を開発する。
    • ControlHairは,物理シミュレーターで生成した条件をビデオ拡散モデルに入力し,所望のヘアダイナミクスを持つ動画を生成する。
    • この手法は,物理演算と映像生成を分離することで,多様な物理現象に対応し,モデルの学習を容易にしている。
    • 実験の結果,ControlHairは既存手法と比較して,より正確なヘアダイナミクス制御性能を示すことが確認された。

    Link: https://arxiv.org/abs/2509.21541

  • T-TAMER:機械学習サービングにおけるトレードオフの理論的制御 [cs.RO, cs.LG, cs.GT]目的:機械学習サービングにおけるトレードオフの最適化手法
    • 機械学習モデルの規模拡大に伴い,精度・遅延・リソース使用量等のトレードオフが重要になっている。
    • 既存手法は経験則に頼る部分が多く,理論的な保証や汎用性に課題があった。
    • 本研究では,理論的な保証に基づいたトレードオフ最適化手法を提案し,その有効性を検証する。
    • 本研究で提案するT-Tamerは,多段階意思決定プロセスとしてこの問題を定式化している。
    • 早期リコール(以前のモデルへの再アクセス)が,性能保証達成に必要かつ十分であることを証明した。
    • 実験結果から,リコールに基づく戦略が,精度と遅延の効率的なトレードオフを実現することが示された。

    Link: https://arxiv.org/abs/2509.22992

  • DeCLIP:CLIPを用いたマルチラベル逐次学習のためのデカップルドプロンプティング [cs.CV]目的:マルチラベル逐次学習における破滅的忘却の軽減
    • 画像認識分野において,新しいカテゴリを継続的に学習する逐次学習は重要な課題である。
    • マルチラベル逐次学習では,複数のカテゴリが同時に存在し,既存の知識を保持しつつ新しいカテゴリを学習することが困難である。
    • CLIPを基盤とするマルチラベル逐次学習における表現の絡み合いと高い偽陽性率を抑制することを目指す。
    • DeCLIPは,視覚的およびテキストモダリティにおいてクラス固有のプロンプトを学習することにより,表現の絡み合いを軽減する。
    • 新しいカテゴリのプロンプトのみを最適化することで,既存の知識を保持し,破滅的忘却を抑制する。
    • 適応的類似度調整により,推論時に類似度調整の強度を適応させ,特定の調整なしに偽陽性を抑制する。

    Link: https://arxiv.org/abs/2509.23335

  • WorldMirror:あらゆる事前情報を用いた汎用3Dワールド再構成 [cs.CV]目的:包括的な3D幾何学的予測タスク
    • 3D再構成は,ロボティクスやAR/VRなど幅広い分野で重要である。
    • 既存手法は入力制限や特定のタスクに特化しており,汎用性に欠ける。
    • 多様な事前情報とマルチタスク予測を統合し,汎用的な3D再構成を実現する。
    • WorldMirrorは,カメラポーズや深度マップなど多様な幾何学的事前情報を柔軟に統合できる。
    • 本手法は,点群,深度マップ,表面法線など複数の3D表現を同時に生成し,高い性能を示す。
    • 多様なベンチマークにおいて最先端の性能を達成し,効率的な推論を維持している。

    Link: https://arxiv.org/abs/2510.10726

  • ナッシュPG:反復的な正則化を用いたナッシュ均衡探索のための方策勾配法 [cs.RO, cs.LG, cs.GT]目的:多人数エージェント強化学習における不完全情報ゲームのナッシュ均衡
    • 多人数エージェントシステムにおける戦略的意思決定の基盤となるため,ナッシュ均衡の探索は重要である。
    • 既存手法はゲーム木全体の列挙が必要,または性能の低い非方策勾配内解法に依存しており,スケーラビリティに課題がある。
    • スケーラブルな方策勾配法に基づく解決策を提供し,ナッシュ均衡への収束を保証することを目指す。
    • 提案手法は,ナッシュ均衡へのブレグマンダイバージェンスの単調減少を保証し,最終的には収束することが示された。
    • 実証実験により,古典的なベンチマークゲームにおいて,既存のモデルフリー手法と同等かそれ以下の利用可能性が確認された。
    • BattleshipやNo-Limit Texas Hold'emなどの大規模なドメインにも適用でき,対戦プレイにおいてより高い平均ペイオフを達成した。

    Link: https://arxiv.org/abs/2510.18183

  • テキスト構造ガイダンスによる2段階シーンテキスト画像超解像:まずテキストを復元し,次に画像を強化 [cs.CV]目的:シーンテキスト画像の超解像技術
    • 画像認識や文書解析において,テキストの可読性は重要な要素である。
    • 従来の画像超解像技術では,自然画像には有効だがテキストが歪みやすいという課題がある。
    • テキストと画像の超解像を分離し,テキストの正確な構造復元を優先することで,可読性と画質を両立すること。
    • TIGERは,「テキスト優先,画像後」のパラダイムを採用した2段階フレームワークであり,従来のトレードオフを解消する。
    • 提案手法は,正確なテキスト構造を復元し,それを画像全体の超解像に利用することで,高い忠実度と可読性を実現する。
    • 大規模な中国語シーンテキストデータセット UZ-ST を新たに構築し,最先端の性能を達成した。

    Link: https://arxiv.org/abs/2510.21590

  • 風力タービンブレードの検査:知識拡張型ビジョン言語モデルによる訓練不要な検査への取り組み [cs.CV]目的:風力タービンブレードの損傷検出のための訓練不要な検査フレームワーク
    • 風力タービンは再生可能エネルギー源として重要であり,ブレードの損傷は重大な事故につながる可能性がある。
    • 従来の検査方法は,大量のラベル付きデータに依存するため,希少または変化する損傷タイプへの対応が困難である。
    • 本研究は,ドメイン知識を活用することで,ラベル付きデータへの依存を軽減し,効率的な損傷検出を目指す。
    • 提案手法では,Retrieval-Augmented Generation (RAG)とビジョン言語モデル (VLM) を組み合わせることで,高い分類精度を実現した。
    • 特に,知識検索によって得られた関連情報が,VLMの推論過程を説明可能にし,未知の欠陥の検出に貢献することが示された。
    • 少量データセットでの評価ではあるが,RAGによりVLMの性能が大幅に向上し,データ効率の良い検査ソリューションの可能性を示唆した。

    Link: https://arxiv.org/abs/2510.22868

  • セマンティック誘導によるクロスセンサー超解像:ゲート付きデュアル条件フローマッチングモデル [cs.CV]目的:リモートセンシング画像のクロスセンサー超解像
    • 地球表層プロセスのモニタリングには高解像度画像が不可欠であり,その重要性は高い。
    • 高解像度画像の取得にはコストと時間制約があり,十分なデータが得られない場合がある。
    • 限られたデータとドメインシフト下で,低解像度画像をより高解像度な画像へ変換する手法を開発する。
    • RareFlowは,セマンティック情報とシーン構造を考慮した生成AIフレームワークであり,リアルで物理的に信頼性の高い高解像度画像を生成する。
    • 周波数整合,知覚的類似性,色の一貫性を組み合わせた損失関数により,出力の忠実性を高めている。
    • 新規ベンチマークと公開データセットでの評価,専門家による人間評価により,RareFlowの有効性が確認された。

    Link: https://arxiv.org/abs/2510.23816

  • 軽量画像超解像のためのTransformer-Progressive Mambaネットワーク [cs.CV]目的:軽量な画像超解像フレームワーク
    • 画像超解像は,低解像度画像を高品質に復元する重要な技術であり,様々な応用分野で求められている。
    • Transformerの計算コストが高いこと,Mambaベースの手法では詳細なモデリングが不足していることが課題であった。
    • 異なるスケール間の効率的な特徴表現と,高周波詳細の復元を目指している。
    • T-PMambaSRは,窓ベースの自己注意機構とProgressive Mambaを統合することで,異なるスケールの受容野間の相互作用を可能にしている。
    • これにより,追加の計算コストをかけることなく,段階的に特徴表現を強化するモデリングパラダイムを確立した。
    • 実験結果から,T-PMambaSRは高い性能と低い計算コストを両立し,既存手法に匹敵する性能を発揮することが示された。

    Link: https://arxiv.org/abs/2511.03232

  • 自動交渉入門 [cs.MA, cs.AI, cs.GT]目的:自動交渉の基礎知識
    • AI技術の発展に伴い,自律的な意思決定システムの重要性が高まっている。
    • 交渉アルゴリズムの学習リソースが不足しており,初学者への導入が難しい。
    • 自動交渉の学習を容易にし,実践的なアルゴリズム開発を促すこと。
    • 本書は,コンピュータサイエンスの学生を対象とした自動交渉の入門書である。
    • Pythonで実装された簡単な交渉フレームワークを提供し,読者が独自のアルゴリズムを実装し実験することを可能にする。
    • フレームワークは軽量であり,他の言語への再実装も容易である。

    Link: https://arxiv.org/abs/2511.08659

  • 歪み・知覚摂動による正則化シュレーディンガーブリッジ:高忠実度音声強調 [cs.LG, cs.SD]目的:高忠実度音声強調のための正則化シュレーディンガーブリッジの提案
    • 音声強調は,言語的・副言語的情報を保持しつつ,高知覚品質の音声を復元する上で重要である。
    • 拡散モデルを用いた音声強調は,忠実度とリアリズムのトレードオフや,多段階サンプリングによる誤差の蓄積が課題である。
    • 予測ドリフトを抑制し,忠実度とリアリズムを両立させ,暴露バイアスを軽減することを目指す。
    • 提案手法は,歪み・知覚摂動を用いた正則化により,クリーンな音声と事後平均推定値の間を補間した時間変化するターゲットを構築する。
    • この摂動により,推論時の予測誤差をシミュレートし,学習と推論のミスマッチを軽減することで暴露バイアスを緩和する。
    • 事後平均推定値を忠実度を維持するためのガイダンスとして注入し,音声復元における忠実度を向上させる。

    Link: https://arxiv.org/abs/2511.11686

  • ニューヨークの匂い:嗅覚のための大規模マルチモーダルデータセット [cs.CV, cs.AI, cs.LG]目的:嗅覚のための大規模マルチモーダルデータセット
    • 動物の知覚において重要な嗅覚は,機械への応用が遅れている。
    • 自然環境で収集された多様な嗅覚データの不足が課題である。
    • 本研究は,実環境で収集した大規模データセットを提供し,その活用を目指す。
    • 本データセットは,7,000組の画像と匂いのペアを含み,既存のデータセットよりも多くの対象物を扱っている。
    • 実験により,視覚データが嗅覚表現学習に貢献し,手動特徴量よりも優れた性能を示すことが示された。
    • 匂いから画像検索,シーン認識,草の種類識別といったタスクのベンチマークを提供する。

    Link: https://arxiv.org/abs/2511.20544

  • iMontage:統一的で多様,高度に動的な多対多画像生成 [cs.CV]目的:多対多画像生成のための統一的フレームワーク
    • 画像生成技術は,多様な応用分野において重要な役割を担っている。
    • 既存の画像生成モデルは,生成される画像のダイナミックレンジに限界がある。
    • 動画モデルの持つ時系列の一貫性と,画像の多様性を融合し,より高度な画像生成を目指す。
    • iMontageは,既存の動画モデルを画像生成器として再利用する統一的なフレームワークである。
    • 本手法は,画像間の文脈的な一貫性を維持しつつ,従来のモデルを上回るダイナミックレンジを実現した。
    • 様々な画像生成および編集タスクにおいて,優れた性能を発揮することが確認された。

    Link: https://arxiv.org/abs/2511.20635

  • 視覚オブジェクト姿勢推定における不確実性定量化:S-補題楕円境界 [cs.RO, cs.CV]目的:視覚オブジェクト姿勢推定の不確実性定量
    • ロボット制御や計画において,信頼性の高い姿勢推定は不可欠である。
    • 姿勢推定の不確実性を統計的に厳密に評価する手法は確立されていない。
    • 分布仮定を必要としない,姿勢の不確実性境界を推定することを試みる。
    • 本研究では,2Dセマンティックキーポイントの検出ノイズに基づいて,単眼設定で姿勢の不確実性境界を計算するSLUE(S-Lemma Uncertainty Estimation)を提案する。
    • SLUEはS-補題に着想を得た凸計画法を利用し,最小体積楕円境界問題を緩和することで,真のオブジェクト姿勢を高確率で包含する不確実性境界を算出する。
    • 実験結果から,SLUEは既存手法と比較して,より小さい並進境界と競争力のある回転境界を生成することが示された。

    Link: https://arxiv.org/abs/2511.21666

  • 単眼深度推定における人間中心のクロスドメインベンチマーク:精度は人間らしさを保証しない [cs.CV]目的:単眼深度推定モデルの性能評価のための,人間とモデルの行動の一致度を測るベンチマーク
    • 深層学習は人間の視覚モデルとして発展してきたが,既存の評価指標は物理的な精度に偏っている。
    • 従来のベンチマークでは,人間の視覚特性とモデルの出力とのずれが明確にされていない。
    • 人間の距離判断とモデルの予測を比較し,人間らしい深度推定を実現するための指標を確立する。
    • 新しいベンチマークは,KITTIとNYU Depth V2のシーンにおいて,人間とモデルの深度推定の類似性を評価できる。
    • 物理的な精度が高いモデルでも,必ずしも人間の視覚特性と一致せず,ドメイン依存性があることが示された。
    • 物理的な精度と人間らしい行動は,単眼深度推定の性能を評価する上で補完的な側面を持つことが明らかになった。

    Link: https://arxiv.org/abs/2512.08163

  • ジンバル拡散:重力に基づいたビデオ生成のためのカメラ制御 [cs.CV]目的:テキストからビデオを生成する際のカメラ制御手法
    • ビデオ生成技術の発展は目覚ましいが,カメラ制御の精密さは課題である。
    • 従来のカメラ軌跡表現は相対的で曖昧,正確な幾何学的制御が困難である。
    • 絶対座標系と重力を参照点にすることで,正確なカメラ制御を実現する。
    • ジンバル拡散は,物理世界の座標に基づくカメラ制御を可能にするフレームワークである。
    • 360度パノラマビデオを使用し,極端な俯仰角やロール角を含む全ての視点に対応する。
    • プロンプト内容との競合を避けるためのnull-pitch conditioningを導入し,カメラ制御を向上させた。

    Link: https://arxiv.org/abs/2512.09112

  • スコアベースのターボメッセージパッシングによるプラグアンドプレイ圧縮イメージング [cs.CY, cs.CV]目的:圧縮イメージングにおける画像再構成の性能向上
    • 圧縮イメージングは,データ取得の効率化に貢献し,医療やセキュリティなど幅広い分野で重要である。
    • 従来のプラグアンドプレイ法は,汎用的な事前分布に依存し,自然画像の複雑な統計構造を捉えきれない場合がある。
    • スコアベース生成モデルの利点を活かし,より高精度かつ効率的な画像再構成アルゴリズムを開発する。
    • 提案手法であるスコアベースのターボメッセージパッシング(STMP)は,従来のアルゴリズムと比較して,性能と計算量のバランスに優れている。
    • 量子化された測定データに対しても,量子化STMP(Q-STMP)が頑健性を示すことが確認された。
    • STMPおよびQ-STMPは,通常10回の反復で収束し,高速な再構成が可能である。

    Link: https://arxiv.org/abs/2512.14435

  • 人間らしいワーキングメモリ特性が,ロバストな動的視覚を実現する内在可塑性人工ニューロンから出現 [cs.ET, cs.AI, cs.CV, cs.NE]目的:内在可塑性ニューロンネットワークによる,人間らしいワーキングメモリ特性の実現
    • AIのエネルギー消費量は増大しており,物理駆動型計算への移行が求められている。
    • 従来のAIは,動的な環境下でノイズが蓄積し,性能が低下しやすい。
    • 熱緩和ダイナミクスを利用し,ノイズを内在可塑性として活用することで,省エネルギーなワーキングメモリを実現する。
    • 熱力学的な散逸を利用したメモリが,動的視覚タスクにおいて,従来のモデルと比較して18倍の誤り減少を実現した。
    • メモリエネルギーオーバーヘッドを90,000倍以上削減し,効率性を飛躍的に向上させた。
    • 自動運転タスクにおいては,再帰型ネットワークと比較して予測誤差を12.4%削減した。

    Link: https://arxiv.org/abs/2512.15829

  • ナラティブトラック:ナラティブ理解のためのエンティティ中心推論の評価 [cs.CV, cs.LG]目的:ナラティブ理解のためのエンティティ中心推論の評価基準
    • 動画と言語の推論能力は進歩しているが,時間経過に伴うナラティブ理解は未解明な点が多い。
    • 既存の評価基準は短いクリップや粗いシーンレベルの意味に限定され,エンティティの連続性を評価できない。
    • MLLMにおける時間的・視覚的変化に対するエンティティ追跡の弱点を明らかにし,ナラティブ理解の向上を目指す。
    • 最先端のMLLMは,視覚的な移行や時間的な変動において,エンティティを頑健に追跡できず,文脈の変化下でアイデンティティを幻覚することが明らかになった。
    • 汎用的なMLLMは知覚的な接地は強いが,時間的な一貫性が弱く,動画特化型MLLMは時間的文脈を捉えるものの,エンティティの文脈を幻覚する傾向がある。
    • 知覚的な接地と時間的推論のトレードオフが明らかになり,ナラティブ理解は両者の統合から生まれることが示唆された。

    Link: https://arxiv.org/abs/2601.01095

  • PatchAlign3D:密な3次元形状理解のための局所特徴アラインメント [cs.CV]目的:3次元形状の局所的な部分レベルの推論能力向上
    • 3次元形状理解は,ロボティクスやコンピュータグラフィックスなど幅広い分野で不可欠である。
    • 既存の3次元形状モデルは,大域的なタスクには優れるものの,局所的な部分認識の性能が低いという課題がある。
    • 点群から直接,言語と整合した局所特徴を抽出し,高精度な部分認識を可能にすることを目指す。
    • 提案手法は,テスト時に複数回のレンダリングを必要とせず,高速な推論を実現する。
    • 既存のレンダリングベースの手法やフィードフォワード手法と比較して,3次元部分セグメンテーションのベンチマークで大幅な性能向上を達成した。
    • SAM領域とVLMキャプションを組み合わせたデータを用いて,点群Transformerエンコーダを蒸留とアラインメントの2段階で学習する。

    Link: https://arxiv.org/abs/2601.02457

  • 自己注意の失敗を打破する:赤外線微小目標検出のためのクエリ初期化の再考 [cs.CV, cs.AI]目的:赤外線微小目標検出におけるクエリ初期化の改善
    • 赤外線微小目標検出は,軍事・民生用途において重要な技術であり,その精度向上が求められている。
    • 従来のDETRベースの検出器では,背景に比べて目標が非常に小さいため,クエリ初期化が不安定になりやすい。
    • 自己注意機構による背景特徴の支配を抑制し,信頼性の高いクエリ初期化を実現することで,検出精度を向上させる。
    • 提案手法SEF-DETRは,局所フーリエスペクトルのエネルギー分布を符号化し,目標候補の密度マップを生成する。
    • この密度マップに基づいて,周波数領域の誤検出を抑制する疎な変形再検査を実施し,真の目標を識別する。
    • 空間周波数の一貫性と周波数信頼性に基づいてクエリを再ランク付けすることで,検出性能を向上させる。

    Link: https://arxiv.org/abs/2601.02837

  • EEG-FMコンパス:脳波ファウンデーションモデルの進捗,ベンチマーク,および今後の方向性 [cs.CL, cs.CL, cs.LG, cs.CV]目的:脳波ファウンデーションモデルに関する進捗状況,性能評価,および将来的な研究の方向性
    • 脳波は非侵襲的な脳活動計測法であり,ブレイン・コンピュータ・インターフェース(BCI)等の応用が期待されている。
    • 既存の脳波ファウンデーションモデルの公平かつ包括的な比較が,学習目的や前処理方法の不統一により困難であった。
    • 脳波ファウンデーションモデルの性能評価と,より良いモデル開発のための指針を示すことを目指す。
    • 55の代表的なモデルを分析し,データ標準化,モデルアーキテクチャ,自己教師あり学習戦略を包括的な分類体系に整理した。
    • 12のオープンソースモデルと専門家モデルを,9種類のBCIパラダイムを含む13の脳波データセットで評価した。
    • 大規模モデルが必ずしも優れた汎化性能を発揮するとは限らず,線形プロービングでは十分な性能が得られない場合があることが示唆された。

    Link: https://arxiv.org/abs/2601.17883

  • 人間とAIの協調における限定的規範的同等性:グループ行動が,パートナーのラベルではなく協調を予測する [cs.AI, cs.GT, cs.HC, econ.GN, q-fin.EC]目的:人間とAIの協調における協調行動の予測要因の特定
    • AIが社会に浸透する中で,人間の協調行動への影響理解は重要である。
    • AIをパートナーとする際の,ラベルが協調に与える影響は不明であった。
    • 匿名的な集団フィードバック下でのAIラベル効果の有無を検証する。
    • 協調行動は,グループ全体の先行する貢献度と個人の先行する貢献度に関連していた。
    • AIラベルによる協調レベルや規範への影響に有意な差は認められなかった。
    • 集団フィードバック下では,AIラベルは協調行動や規範的結果に検出可能な差をもたらさない。

    Link: https://arxiv.org/abs/2601.20487

  • 疎な注意による自己回帰型ビデオ拡散の加速:Light Forcing [cs.CV]目的:自己回帰型ビデオ生成モデルにおける効率的な展開
    • ビデオ生成技術は,高品質な映像コンテンツの作成に不可欠であり,その重要性は増している。
    • 自己回帰型モデルの注意機構の計算量は膨大であり,実用上のボトルネックとなっている。
    • 疎な注意機構を自己回帰型モデルに適用する際の性能低下を改善し,効率性と品質を両立する。
    • 提案手法Light Forcingは,既存の疎な注意機構よりも高い品質と効率を実現した。
    • 特にVBenchにおいて84.5のスコアを獲得し,エンドツーエンドの速度を1.2~1.3倍に向上させた。
    • 他の効率化手法と組み合わせることで,最大3.0倍の速度向上を達成した(RTX 5090で27.4 FPS,H100で33.9 FPS)。

    Link: https://arxiv.org/abs/2602.04789

  • Bagpiper:豊富なキャプションによるオープンエンドな音声タスクの解決 [cs.PF, cs.CL, cs.SD]目的:オープンエンドな音声タスク解決のための基盤モデル
    • 音声処理技術は,多様な応用分野で重要であり,その進展は社会に大きな影響を与える。
    • 既存の音声モデルは特定のタスクに特化しており,音声全体を包括的に理解する能力が不足している。
    • 音声と抽象的な概念を繋ぐことで,より柔軟で汎用性の高い音声処理を実現することを目指す。
    • Bagpiperは,6000億トークンで事前学習された80億パラメータの音声基盤モデルである。
    • 音声と豊富なキャプション(高レベルな概念記述)間の双方向マッピングを確立し,多様なタスクに対応可能である。
    • 音声生成,効果音,音楽生成を均一に実行でき,Qwen-2.5-Omniと同等の音声理解性能を示す。

    Link: https://arxiv.org/abs/2602.05220

  • SVRepair:自動プログラム修復のための構造化視覚的推論 [cs.SE, cs.AI, cs.CV]目的:自動プログラム修復における構造化視覚的推論の活用
    • ソフトウェアの品質向上は,現代社会におけるシステム信頼性の維持に不可欠である。
    • 既存の自動プログラム修復技術は,視覚的な情報(スクリーンショットや制御フローグラフ)の活用が不十分である。
    • 視覚的情報の構造化により,プログラムの誤りの正確な特定と修正を可能にすることを目指す。
    • SVRepairは,異種視覚情報をセマンティックシーングラフに変換することで,GUI要素と構造の関係を捉える。
    • SWE-Bench Mインスタンスにおいて,517件中186件(約36%)を解決し,OmniGIRLインスタンスでは,19件中4件(約21%)を解決した。
    • MMCodeやCodeVisionといったマルチモーダルコード推論ベンチマークにおいても高い性能を示した。

    Link: https://arxiv.org/abs/2602.06090

  • 有界ランダム性を持つメトリック投票の歪み [cs.CL, cs.GT, cs.DM, cs.DS]目的:メトリック歪み枠組みにおける投票ルールの設計
    • 公正な集団意思決定において,投票ルールの歪みは重要な評価指標である。
    • 決定論的ルールは歪みが少なくとも3となることが知られており,改善の余地がある。
    • 有界のランダム性のみを用いて,歪み3の障壁を打ち破る投票ルールを提案する。
    • 提案ルールは,絶対定数ε>0に対して,歪みを最大で3-εに抑える。
    • ルールは,決定論的に特定された定数サイズのリストから勝者を一様ランダムに選択する。
    • 最大確率ロタリーと安定ロタリーの歪みと近似に関する新たな構造的結果に基づいている。

    Link: https://arxiv.org/abs/2602.08871

  • 表現的補完性からデュアルシステムへ:エンドツーエンド運転のためのVLMと視覚のみのバックボーンの相乗効果 [cs.RO, cs.CV]目的:VLMと視覚のみのバックボーンの特性を比較し,エンドツーエンド運転における性能向上
    • 自動運転技術は,安全性向上や交通渋滞緩和に不可欠であり,その発展が強く求められている。
    • 従来の視覚のみの自動運転は,複雑な状況や稀なケースへの対応が課題となっていた。
    • VLMと視覚のみのバックボーンの長所を組み合わせることで,よりロバストで高性能な運転システムを実現する。
    • VLMと視覚のみのポリシーは,ポリシー学習後に共通のサブ空間を共有するものの,転移不可能な残差サブ空間を保持する。
    • 視覚のみのエンコーダーは単純な幾何学的なシナリオで優位性を示し,VLMは複雑で意味論的,かつインタラクションの多い状況で強い。
    • VLMとViTのブランチを組み合わせたHybridDriveVLAは,PDMSで92.10を達成し,VLMベースラインを1.30ポイント上回った。

    Link: https://arxiv.org/abs/2602.10719

  • チャート仕様:コード生成のためのチャート構造表現によるVLM推論のインセンティブ付与 [cs.SC, cs.MS, cs.SY, eess.SY, math.AC, math.DS, cs.CV]目的:チャート画像からコードを生成する際のVLM推論を促進するための構造的表現
    • 視覚情報と言語を組み合わせることで,データの可視化を自動化する可能性があり重要である。
    • 既存手法は表面的な模倣に偏りがちで,チャートの構造を正確に捉えられていない場合がある。
    • チャート構造を正確に捉え,意味的に一貫性のあるコード生成を実現することを目的とする。
    • 提案手法「チャート仕様」は,構造化された中間表現を用いることで,VLMの学習をテキストの模倣から意味に基づいた監督へと移行させる。
    • 構造的バランスの取れた学習データと,構造的正確性に関する詳細なフィードバックを提供する報酬関数により,高精度なコード生成が可能となる。
    • 3つの公開ベンチマークで既存手法を凌駕し,特に少ないデータ量でも高いデータ効率を発揮することが示された。

    Link: https://arxiv.org/abs/2602.10880

  • 重要度に基づく移動:共同知覚のための最適輸送フローによるパラメータ効率的なドメイン適応 [cs.CV]目的:V2X協調知覚におけるドメイン適応の効率向上
    • 自動運転やロボティクスにおいて,多様な環境下での知覚性能は安全性の要である。
    • ドメイン間の差異により性能が低下するドメインシフトが課題となっている。
    • 最適輸送フローを活用し,限られたパラメータでドメインシフトを克服する。
    • FlowAdaptは,1%程度の学習可能なパラメータで最先端の適応性能を達成した。
    • フレーム選択における冗長性と,深層表現における前景情報の解釈可能性低下に対処した。
    • ローカリゼーションノイズ下でも高い性能を維持することを示した。

    Link: https://arxiv.org/abs/2602.11565

  • GPS非利用環境下におけるUAVの高度適応型ビジョンによるジオロケーション [cs.CV, cs.RO]目的:GPS信号が利用できない環境下でのUAVのジオロケーション
    • UAVの活用範囲拡大のため,GPSに依存しない位置推定技術が重要である。
    • UAVの高度変化による画像スケールの不一致が,地図との照合を困難にしている。
    • 高度推定による画像スケール正規化で,UAVと地図画像の照合精度向上を目指す。
    • 提案手法では,周波数領域変換を用いて単一画像から相対高度を推定する。
    • 推定された高度に基づいて画像をクロップすることで,視覚的な場所認識の精度を向上。
    • 実験の結果,高度適応により,R@1とR@5がそれぞれ41.50%と56.83%向上した。

    Link: https://arxiv.org/abs/2602.23872

  • DriveCode:LLMベース自動運転のためのドメイン特化数値エンコーディング [cs.CL, cs.CV, cs.RO]目的:LLMベース自動運転システムにおける数値表現の改善
    • 自動運転は交通システムの安全性向上に不可欠であり,AI技術の進展が求められている。
    • 数値のトークン化は,数値推論の精度を制限し,位置情報や正確な数値表現が困難である。
    • DriveCodeは,数値の正確な表現と効率的な処理を実現し,自動運転の性能向上を目指す。
    • DriveCodeは,数値を専用の埋め込み表現に変換することで,言語モデルへの統合を可能にした。
    • OmniDrive,DriveGPT4,DriveGPT4-V2データセットを用いた評価で,軌道予測と制御信号生成において優れた性能を示した。
    • DriveCodeは,LLMベース自動運転システムの有効性を裏付ける結果が得られた。

    Link: https://arxiv.org/abs/2603.00919

  • ローカルシャプレイ値:モデル誘導局所性とデータ評価における最適な再利用 [cs.LG, cs.AI, cs.DB, cs.GT]目的:データ評価のためのシャプレイ値の計算効率化
    • データは機械学習モデルの性能を左右する重要な要素であり,その価値を定量的に評価するニーズが高まっている。
    • シャプレイ値は公平なデータ価値評価の理論的基盤を提供するが,計算量が指数関数的に増加するため,現実的な規模の問題には適用が困難である。
    • モデルの構造的特性に着目し,影響を与える訓練データの範囲を局所化することで,シャプレイ値の計算量を削減し,効率的なデータ評価を実現する。
    • モデルが持つ局所性により,シャプレイ値の計算をモデルの計算経路によって定義されるサポート集合に限定することが可能である。
    • LSMR(Local Shapley via Model Reuse)は,サポートマッピングとピボットスケジューリングにより,各影響力のある部分集合を一度だけ学習することで,計算量を最適化する。
    • 大規模なサポート集合に対しては,LSMR-Aという再利用を考慮したモンテカルロ推定器を開発し,バイアスを維持しつつ計算時間を大幅に短縮する。

    Link: https://arxiv.org/abs/2603.03672

  • 異種分散型拡散モデル [cs.LG, cs.AI, cs.CV]目的:大規模拡散モデルの効率的な分散学習手法
    • 拡散モデルは高品質な画像生成が可能だが,学習に膨大な計算資源が必要とされている。
    • 既存の分散学習は,計算資源や学習目標の均一性が求められ,参入障壁が高い。
    • 本研究は,異種な環境下でも効率的に学習を進め,分散学習へのアクセスを容易にすることを目指す。
    • 本手法は,従来の分散型拡散モデルの計算コストを16分の1,データ量を14分の1に削減した。
    • 異なる学習目標(DDPMとFlow Matching)を組み合わせることで,統一的な推論が可能となった。
    • アラインメントされた推論設定において,FIDスコアとプロンプト内多様性が同質的なベースラインを上回った。

    Link: https://arxiv.org/abs/2603.06741

  • 幾何学的・トポロジカルな知覚と運動事前知識を用いたリアルタイム衛星映像物体追跡 [cs.CV]目的:衛星映像における物体追跡の性能向上
    • 衛星映像は災害監視や環境モニタリング等,社会的に重要な情報源である。
    • 衛星映像はテクスチャが乏しく,対象物の回転や形状変化,遮蔽物が多いという課題がある。
    • 幾何学的・トポロジカルな情報と運動事前知識を統合し,ロバストな追跡を実現する。
    • 提案手法SiamGMは,既存の追跡手法と比較して,SatSOTおよびSV248Sベンチマークにおいて,精度と成功率で優れた性能を示した。
    • 幾何学的・トポロジカルな知覚と運動事前知識を組み合わせることで,テクスチャの少ない衛星映像でも安定した追跡が可能となった。
    • SiamGMは,高い処理速度(130 FPS)を実現しており,リアルタイム追跡に適している。

    Link: https://arxiv.org/abs/2603.07564

  • コンパクトトークンを用いたマスク特徴予測による骨格表現学習 [cs.CV]目的:骨格表現学習における新たなフレームワーク
    • 人間行動認識等の分野で,骨格データは重要な情報源である。効率的な骨格表現学習が求められている。
    • 既存手法では,微細な動きの表現や計算コストが課題となっていた。
    • コンパクトなトークン表現を用いて,効率的かつ高精度な骨格表現学習を実現すること。
    • 提案手法SLiMは,マスク特徴予測とコントラスト学習を統合し,高精度な骨格表現を学習する。
    • SLiMは,座標レベルの再構成に依存せず,教師あり特徴予測により計算コストを削減する。
    • 複数の実験で,既存手法を凌駕する性能と,7.89倍の推論計算量の削減を達成した。

    Link: https://arxiv.org/abs/2603.10648

  • OSMDA:リモートセンシングVLMsのためのOpenStreetMapベースのドメイン適応 [cs.RO, cs.CV, cs.LG]目的:リモートセンシングVLMsのドメイン適応
    • リモートセンシング技術は,環境モニタリングや災害対応など,多岐にわたる分野で重要性が増している。
    • リモートセンシング画像の学習には高品質なアノテーションが必要だが,その作成にはコストと時間がかかる。
    • OpenStreetMapを活用し,大規模な教師モデルへの依存なしに,リモートセンシングVLMsを効率的に適応させる。
    • OSMDAは,航空画像とOpenStreetMapタイルを組み合わせることで,モデル自身がアノテーションを生成する。
    • 衛星画像のみでモデルをファインチューニングすることで,手動アノテーションや強力な外部モデルを必要としないVLMsを開発した。
    • 複数のベンチマークにおいて,OSMDAは既存手法を上回り,低コストで高い性能を実現した。

    Link: https://arxiv.org/abs/2603.11804

  • EgoIntent:行動の目的,理由,および次を理解するための事前結果マイクロステップベンチマーク [cs.CV]目的:人間の行動理解のためのステップレベルの意図理解
    • 一人称視点動画は人間の行動研究に有用である。従来の視覚的理解では,潜在的な目標が捉えきれない。
    • 既存の意図ベンチマークは,粗いイベントレベルの目標に焦点を当てており,手続き的なステップにおける意図の進化を見落としている。
    • EgoIntentは,より詳細なステップレベルでの意図理解を可能にし,モデルの改善を目指す。
    • 現在のモデルは,時間順序や手続き的履歴を十分に活用せずに,静的な境界の合図によって高い意図予測スコアを達成していることが示された。
    • ステップのみを入力として与えることで,すべてのモデルで最良の結果が得られ,15秒の履歴を追加すると3つのモデルで性能が低下した。
    • 現在の結果の提示はLocal Intentを7.81ポイント,次のステップの提示はNext-Planを13.17ポイント向上させた。

    Link: https://arxiv.org/abs/2603.12147

  • ABRA:オープンボキャブラリ物体検出のためのドメイン間知識転送 [cs.CV]目的:オープンボキャブラリ物体検出におけるドメインシフトに対する知識転送手法
    • 近年の物体検出技術は進歩しているが,実用的なシーンでの応用には課題が残る。
    • 既存のオープンボキャブラリ物体検出アーキテクチャは,ドメインシフトに弱く,性能が低下しやすい。
    • ラベル付きデータが少ないドメインにおける性能向上を目指す。
    • ABRAは,教師ありデータのないターゲットドメインへ,ソースドメインの物体検出知識を転送する。
    • この手法は,事前学習済み検出器の重み空間で幾何学的輸送問題を解くことで,ドメイン間の知識を整合させる。
    • 様々な困難なドメインシフト条件下で,ABRAはクラスレベルの専門知識を効果的に転送できることを示した。

    Link: https://arxiv.org/abs/2603.12409

  • MVHOI:3D基盤モデルを用いた複雑な人間-物体相互作用ビデオの再現におけるマルチビュー条件の橋渡し [cs.CV, cs.AI]目的:複雑な人間-物体相互作用ビデオの再現における手法
    • 人間と物体の相互作用の理解は,ロボット工学やコンピュータビジョンの発展に不可欠である。
    • 既存手法は,2Dモーション制御に依存し,複雑な動きや視点変化への対応が不十分である。
    • マルチビュー情報を活用し,より現実的な相互作用ビデオの再現を目指す。
    • 本研究では,暗黙的なモーション抽出,3D認識によるマルチビュー推論,ビデオ生成を組み合わせたMVHOIを提案する。
    • 提案手法は,対象物体のマルチビュー参照を用いて粗いオブジェクトアンカーを予測し,構造的・外観的なガイダンスとして活用する。
    • 実験結果から,提案手法は,オブジェクトの忠実度,モーションの一貫性,視覚的品質,相互作用のリアリズムにおいて,既存手法を上回ることが示された。

    Link: https://arxiv.org/abs/2603.14686

  • 摩擦接触下における変形物体の高速かつ信頼性の高い勾配 [cs.RO, cs.GR]目的:摩擦接触下における変形物体のシミュレーション勾配の高速化と信頼性向上
    • 物理シミュレーションは,ロボティクスやコンピュータグラフィックスにおいて,逆問題解決の基礎となる。
    • 摩擦接触の厳密な扱いが難しく,近似やヒューリスティックな勾配が用いられ,勾配の歪みや最適化の停滞が生じる。
    • 数学的に厳密なシミュレーションにより,摩擦接触における勾配の不安定性を解消し,現実世界とのギャップを埋める。
    • 提案手法は,厳密なマルコフ性,一貫性のある接触安定化,FEM特異点の解消を実現する。
    • GPUによる高速化により,複雑な摩擦接触や大きな変形においても,正確かつ低ノイズの勾配を提供可能となった。
    • デキスタースマニピュレーションや布の折り畳みといったタスクにおいて,物理システムの同定と制御の精度が向上した。

    Link: https://arxiv.org/abs/2603.16478