arXiv雑要約

画像・音声 - 2026/08/04 公開

  • FLBR-MWUダイナミクスの収束性改善 [cs.GT]目的:FLBR-MWUダイナミクスの二重性のギャップに関する収束率
    • ゲーム理論は,経済学,コンピュータサイエンスなど幅広い分野に応用され,最適な戦略の決定に不可欠である。
    • 既存のアルゴリズムでは,収束率が不明確であったり,実用的な性能が十分でなかったりする課題があった。
    • 本研究は,FLBR-MWUダイナミクスにおける具体的な収束率を確立し,OGDAとの比較を通じて実用的な性能を評価する。
    • 本研究により,FLBR-MWUダイナミクスの二重性のギャップに対する収束率が,時間によらずゲームパラメータに依存する幾何学的収束率 $O(c^t)$ であることが示された。
    • 実験結果から,FLBR-MWUは,ゼロサムゲームを解くための最良のラストイテレート法の一つであるOGDAの性能に匹敵するか,場合によってはそれを上回ることが示された。
    • FLBR-MWUは,中間ステップと実際の更新ステップで異なる学習率を使用することで,収束性を改善していると考えられる。

    Link: https://arxiv.org/abs/2608.01170

  • DynActiveGS:動的シーン再構成のためのアクティブガウススプラッティング [cs.CL, cs.SI, cs.CV, cs.AI]目的:動的環境における自律的な探索のための,3Dガウススプラッティングに基づく動的認識型アクティブ再構成フレームワーク
    • ロボットが環境を理解し,安全に動作するためには,正確な3Dマップの構築が不可欠である。
    • 従来の3D再構成手法は,動的な環境の変化に対応できず,不正確なマップを生成する可能性がある。
    • 動的なシーンにおいてもロバストな再構成を実現し,効率的な探索を可能にすることを目的とする。
    • 提案手法DynActiveGSは,オンラインでの不確実性予測と重み付けガウス最適化により,動きのノイズの影響を抑制し,3Dガウスシーン表現を徐々に再構成する。
    • 構造的不確実性と運動誘発的不確実性を明示的に分離することで,再構成が不十分な静的領域と,動的に信頼性の低い領域を区別する。
    • これらの不確実性に基づいて,情報豊かで安定した観測を優先する動的認識型視点選択と動的制約パスプランニングを実行する。

    Link: https://arxiv.org/abs/2608.01178

  • 制度介入下における社会的報酬と罰の共進化 [cs.AI, cs.GT, cs.MA, math.DS, nlin.AO]目的:社会的ジレンマにおける協力,社会福祉,および執行効率の進化の様相
    • 社会生活において,協力は集団の存続と繁栄に不可欠である。協力のメカニズム解明は重要課題。
    • 協力の維持には,フリーライダー問題や集団内対立といった課題が存在する。効果的な解決策が求められる。
    • 制度介入とピアインセンティブの相互作用を通じて,協力と社会福祉を最大化する方策を提示する。
    • ピア罰は協力促進に最も効果的だが,ピア報酬は社会福祉に有利であることが示された。
    • 制度によるピアインセンティブ戦略への報奨は,協力と福祉の両方を大幅に向上させる。
    • 制度による罰は,不正行為者への直接的な処罰が最も有効であり,ピアインセンティブ戦略への処罰は逆効果となる。

    Link: https://arxiv.org/abs/2608.01183

  • 3DZip:空間認識型特徴多様性に基づく3次元質問応答のためのトークン圧縮 [cs.CV, cs.LG]目的:3次元質問応答における計算・メモリ負荷の軽減
    • 3次元視覚・言語モデルの発展は,空間推論を可能にし,様々な応用への道を開く。
    • 従来の3次元VLMsは大量のトークンを生成し,計算コストとメモリ消費量が課題となっていた。
    • 空間構造を考慮したトークン圧縮により,効率的な3次元質問応答を実現することを目指す。
    • 提案手法3DZipは,粗視化,特徴多様性に基づくアンカー選択,空間制約下でのマージの3段階でトークン圧縮を行う。
    • 3DZipは既存の圧縮手法と比較して,性能を94.7%維持しながらトークン数を128に削減し,推論速度を1.92倍に向上させた。
    • 3次元質問応答のベンチマークにおいて,3DZipは既存手法を安定的に上回る性能を示した。

    Link: https://arxiv.org/abs/2608.01185

  • QuerySplat:3DGS予測における幾何学と外観表現の分離 [cs.CV]目的:3D Gaussian Splattingによる3次元再構成の高品質化
    • 3D再構成技術は,仮想現実やロボット工学など幅広い分野で重要性を増している。
    • 既存手法では,空間の柔軟性や構造の冗長性,幾何学と外観の混合などが課題となっていた。
    • 幾何学的な事前知識と外観の分離により,より鮮明で姿勢依存性の低いレンダリングを実現すること。
    • QuerySplatは,姿勢に依存しないモデリング能力を備え,従来のクエリベースモデルのぼやけ問題を軽減する。
    • レンダリングの忠実度において,ピクセルアラインド手法を安定的に上回る性能を示す。
    • DL3DVベンチマークにおいて,最先端の性能を達成し,平均PSNRをそれぞれ2.30dB,1.04dB向上させた。

    Link: https://arxiv.org/abs/2608.01186

  • 人間はより多様である:理想化されたAI開発競争における最先端LLMの極端なポリシー [cs.AI, cs.CY, cs.GT, cs.LG, cs.MA]目的:AI開発競争における大規模言語モデル(LLM)エージェントの戦略的安全行動
    • AI開発競争は加速の一途を辿り,安全性の確保が喫緊の課題となっている。
    • AIエージェント間の競争環境下では,安全性を重視するよりも速度を優先するインセンティブが生じ得る。
    • LLMエージェントの安全戦略を検証し,競争環境における意思決定プロセスを解明すること。
    • LLMは強いルール想起能力を持つ一方で,状況追跡や期待報酬の計算に弱点を示す場合がある。
    • 検証された計算能力や応答形式の変更が,ゲームルールを固定した状態でも行動に影響を与えることが示唆された。
    • モデルによって行動パターンが異なり,競争相手の数が増えることが単一の効果をもたらすわけではないことが明らかになった。

    Link: https://arxiv.org/abs/2608.01193

  • 格子ベース分散型連合学習における評判駆動協力:進化ゲーム理論による考察 [cs.AI, cs.CR, cs.DC, cs.GT, math.DS]目的:分散型連合学習における協力行動のメカニズム解明と性能向上
    • プライバシー保護と機械学習の融合が求められる中,分散型連合学習は重要な技術である。
    • 中央管理主体不在下では,悪意ある参加者によるフリーライド問題が発生しやすい。
    • 有限合理性を持つエージェント間の戦略進化を分析し,協調性を高めることを目指す。
    • 提案手法は,平均精度を約70%から82%に向上させることに成功した。
    • 協調頻度をベースラインの5%以下からほぼ100%に引き上げ,システム安定性を高めた。
    • 精度の分散を0.40から0.002に大幅に低下させ,収束を加速させた。

    Link: https://arxiv.org/abs/2608.01197

  • PRISM: エンドツーエンド自律運転モーションプランニングのための特権的確率潜在的教師あり学習 [cs.RO, cs.CV]目的:エンドツーエンド自律運転システムのモーションプランニング性能向上
    • 自動運転技術の発展は,安全性向上と効率化に不可欠であり,社会実装が期待されている。
    • エンドツーエンド学習では,複雑なモデルの潜在層への勾配が弱まり,学習が困難になる場合がある。
    • 本研究は,潜在表現を直接的に教師データで正則化することで,この問題を解決することを目指す。
    • 潜在表現を確率分布として扱い,ELBOを用いて最適化する新しいフレームワークを提案した。
    • nuScenesデータセットを用いた実験により,将来のGTパスで潜在表現を教師あり学習することで,プランニング性能が向上することが示された。
    • 提案手法は,既存のベースラインと比較して,プランニングL2誤差を8%削減し,衝突率を3%減少させた。

    Link: https://arxiv.org/abs/2608.01201

  • 果実-HSNet:ハイパースペクトル画像に基づく果実成熟度予測のための機械学習アプローチ [cs.CV, cs.LG]目的:果実成熟度予測のための機械学習アーキテクチャ
    • 農業分野において,収穫前後の管理に役立つ果実成熟度予測の重要性が高まっている。
    • ラベル付きデータの不足や,様々なハイパースペクトルカメラや果実の種類への汎化性の欠如が課題となっている。
    • これらの課題に対処し,よりロバストで汎用性の高い成熟度予測手法を開発することを目指す。
    • 提案手法Fruit-HSNetは,既存の深層学習モデルと比較して,全体的な精度で12%の改善を示した。
    • DeepHS Fruitデータセットを用いた実験により,Fruit-HSNetが最先端の性能を達成し,全体精度70.73%を記録した。
    • フーリエ変換と中心ピクセルスペクトルシグネチャに基づく空間-スペクトル特徴抽出モジュールが効果的であることが示された。

    Link: https://arxiv.org/abs/2608.01202

  • デコーディング形式が重要,摂動はそうではない:視覚言語モデルにおけるテスト時スケーリングのための選択の一貫性監査 [cs.CV, cs.AI]目的:視覚言語モデルにおけるテスト時スケーリングのための選択戦略の評価
    • 大規模言語モデルの推論能力向上に,テスト時スケーリングが有効である。
    • 視覚言語モデルへの応用は難しく,自己検証に基づく選択手法が単純な多数決に劣ることが課題である。
    • 画像に基づいた選択信号を強化し,摂動を用いた選択手法の有効性を検証する。
    • 摂動に基づく選択(Pgs)は,TextVQAにおいて最多決よりも高い性能を示す場合がある。
    • しかし,デコーディング形式と計算資源を統制したMatchedCtrlと比較すると,Pgsの優位性は確認されない。
    • 摂動の一貫性は,視覚への依存性を部分的に診断するに過ぎず,単独では有効な選択信号とはなりえない。

    Link: https://arxiv.org/abs/2608.01207

  • VaRS-Doc:潜在的自己探索による解釈を考慮したビジュアルドキュメント検索のためのバリアント表現 [cs.CV]目的:ビジュアルドキュメント検索におけるクエリに関連するページを効率的に特定すること
    • 企業内検索や論文探索など,視覚的に豊富なドキュメントの検索需要が高まっている。
    • 既存手法は固定表現を用いるため,クエリ意図に応じた多様な解釈を捉えきれない。
    • ドキュメントの効率的なインデックス化と,クエリに依存した表現の獲得を両立すること。
    • VaRS-Docは,ドキュメントエンコード時に潜在的な解釈を探索することで,多様な表現を獲得する。
    • これにより,クエリに最適な表現を適応的に選択し,検索性能を向上させる。
    • 実験の結果,既存の最先端手法と比較して,優れた検索性能が確認された。

    Link: https://arxiv.org/abs/2608.01211

  • 予算集約における個人公平性 [cs.GT, econ.TH]目的:予算集約問題における個人公平性の保証
    • 複数個人の選好を統合する際に,社会全体の効率性と公平性の両立が重要である。
    • 既存の公平性概念では,個々の主体に対する公平性が保証されない場合がある。
    • 個人に対する公平性保証を定義し,効率性と両立可能な集約方法を模索する。
    • $\ell_t$ノルム($t \ge 1$)に基づく効用関数に対しては,個人公平性とパレート効率を両立する多項式時間アルゴリズムが存在する。
    • $\ell_1$ノルムの場合,パレート効率性,戦略合理性,そして弱い公平性の概念でさえ,常に両立可能ではないことが証明された。
    • 小規模なパラメータ設定においては,3つの公理を満たすルールが存在する。

    Link: https://arxiv.org/abs/2608.01228

  • 森林から未来の首都へ:PlanetScope画像によるヌサンタラ新首都(IKN)における土地被覆変化の追跡(2021年~2026年) [cs.CV]目的:ヌサンタラ新首都(IKN)における土地利用と植生被覆の変化評価
    • 都市開発が環境に与える影響の把握は,持続可能な都市計画と環境保全のために重要である。
    • 大規模な都市開発は,森林減少や炭素貯蔵量の減少といった環境問題を引き起こす可能性がある。
    • 本研究は,リモートセンシング技術を用いて,IKNの開発に伴う環境変化を定量的に把握することを試みる。
    • 2021年から2026年にかけて,IKNのNDVIは平均17.1%減少し,炭素貯蔵量は0.28%減少した。
    • 開発地の面積は672%増加し,植生面積は18.1%減少した。特に2023年から2024年にかけて植生喪失が顕著であった。
    • 造成活動の鈍化と既に造成済みの土地への開発シフトにより,2024年から2025年には一時的にNDVIと炭素貯蔵量が回復した。

    Link: https://arxiv.org/abs/2608.01230

  • MLLM生成画像検出のためのベンチマークデータセット:GPT Image2 & Nano Banana2 [cs.NI, cs.DB, cs.CC, cs.DM, math.CO, math.OC, cs.CV]目的:MLLM生成画像の検出に関するベンチマークデータセットの構築と評価
    • 近年のMLLMの進化により,AI生成画像の利用が拡大しており,その真偽性の判断が重要となっている。
    • 既存のベンチマークは初期の生成モデルに依存しており,高品質かつ多様な生成画像の検出能力を評価するには不十分である。
    • 本研究は,MLLM生成画像に対応した新たなベンチマークデータセットを構築し,検出器の性能低下を明らかにすることを目的とする。
    • 本研究で構築したベンチマークデータセットは,現実的な応用シナリオを網羅し,多様な生成プロトコルを採用している。
    • 既存の検出器が高品質な生成画像に対して性能が低下することが示され,誤検出率や見逃し率の分析が行われた。
    • 構造的アーティファクトを重視したSAP-DSPという新しいフレームワークが提案され,ベンチマーク上での安定した検出結果が確認された。

    Link: https://arxiv.org/abs/2608.01258

  • ビジョン-言語-行動モデルにおける軌道事前分布としてのエルミート曲線 [cs.RO, cs.CV]目的:ロボット操作におけるビジョン-言語-行動(VLA)モデルの行動チャンク構造化
    • ロボットの自律的な操作能力向上には,視覚情報と自然言語指示を統合した行動計画が不可欠である。
    • 既存のVLAモデルでは,行動チャンクが弱く構造化されており,実行時にぎこちない動きや不連続性が生じる。
    • エルミート曲線を用いることで,滑らかで連続的な軌道を明示的に生成し,ロボットの操作性能を向上させる。
    • エルミート曲線による軌道事前分布は,離散的・連続的な生成モデルの両方で有効であることが示された。
    • 特に,エルミート正則化は,LIBEROおよびLIBERO-plusベンチマーク,実ロボットタスクにおいて,成功率の大幅な改善を達成した。
    • 軌道事前分布の構造化は,実行時の制約よりも学習の誘導バイアスとしてより効果的であることが示された。

    Link: https://arxiv.org/abs/2608.01265

  • グローバルコードブックによる動画トークン圧縮の再考:一度学習して,どこでも圧縮 [cs.CV, cs.AI]目的:動画トークン圧縮手法の開発
    • 動画LLMの普及に伴い,動画データの効率的な処理が重要となっている。
    • 動画トークン系列の冗長性が,その後の言語モデル処理における計算コストを増大させている。
    • オフラインで学習したコードブックを用いて,動画トークンを効率的に圧縮し,計算コストを削減すること。
    • 提案手法ONCEは,オフラインで学習したグローバルコードブックを用いて,オンラインでの軽量な圧縮を実現する。
    • 複数の動画理解ベンチマークにおいて,既存手法と同等の性能を維持しつつ,推論遅延を最小限に抑えることが示された。
    • モデル固有の設計に依存せず,汎用的に適用可能な圧縮フレームワークである。

    Link: https://arxiv.org/abs/2608.01271

  • 拡散パイプラインにおける球面マップガイダンスによる全身キャプチャ:制約のない画像からのアプローチ [cs.CV]目的:制約のない画像からの全身キャプチャにおけるグローバルな対応関係の確立
    • 多様な視点,ポーズ,クロップ,オクルージョン下での全身キャプチャは,現実世界の応用において不可欠である。
    • 従来の技術では,推定されたポーズやジオメトリの信頼性が低く,高精度なマッチングや外観転送が困難である。
    • 不確実な対応関係を活用し,拡散モデルによる再構成を誘導する新しいアプローチを提案する。
    • 提案手法Astrolabeは,凍結された視点誘導球面マップ(SPH)を基盤としたアダプターであり,様々な環境で高い性能を示す。
    • Puzzle-IOIおよび4D-Dressデータセットにおいて,画像評価指標および幾何評価指標の全てにおいて改善が確認された。
    • 特に,後方視点における画像品質の向上,および4D-Dressにおける幾何学的安定性が注目される。

    Link: https://arxiv.org/abs/2608.01276

  • TurboClear:領域校正分布一致と融合によるワンステップオブジェクト効果除去 [cs.CV]目的:オブジェクトとそれに伴う効果の除去
    • 画像編集分野において,オブジェクト除去技術は重要な役割を担う。
    • 拡散モデルを用いた除去手法は高品質だが,処理コストが高いという課題がある。
    • ワンステップで効率的にオブジェクトと効果を除去するモデルの開発。
    • TurboClearは,既存手法と比較して最大で40.04倍の計算効率向上を実現した。
    • また,OmniPaintに対しては最大665倍の高速化を達成し,同等以上の除去品質を維持した。
    • 領域校正分布一致(RDM)と学習可能な空間融合(LSF)が,この効率性と品質の両立に貢献している。

    Link: https://arxiv.org/abs/2608.01288

  • データ適応型トークン削減によるU-Netと拡散Transformerの調和 [cs.CL, cs.CL, eess.SY, cs.SY, cs.CV, cs.AI, cs.LG]目的:拡散Transformerの表現力とU-Netのエンコード・デコード利点を,データ適応型トークンマージにより統合すること
    • 拡散Transformerは,スケーラビリティとマルチモーダルタスクへの適応性から,生成モデリングの中核的アーキテクチャとして重要である。
    • 従来の拡散Transformerでは,表現品質の低下やエンコーダー・デコーダーの不均衡といった課題が存在する。
    • データ適応型トークンマージを用いることで,Transformerアーキテクチャとの互換性を高め,効率的なダウンサンプリング・アップサンプリングを実現する。
    • 提案手法UDTは,既存のU-Net型拡散Transformerを上回り,REPAと同等の性能を全てのモデルサイズで達成した。
    • アーキテクチャ最適化とREPAを組み合わせることで,UDTはSiTのFID 7.9を1400エポック(CFGなし)で凌駕する性能を,40エポックで実現した。
    • SD-VAEおよびVA-VAEを用いた結果,FID 1.38(320エポック)および1.35(500エポック)を達成し,拡散Transformerの新たな基盤となりうることを示した。

    Link: https://arxiv.org/abs/2608.01298

  • 人間の行う画像融合のランキング:赤外・可視融合評価のための学習されたペアワイズ優先度指標 [cs.CY, cs.CV, cs.AI]目的:赤外・可視画像融合アルゴリズムのランキング評価手法の開発
    • 画像融合は,可視光と赤外線の情報を統合し,より多くの情報を持つ画像を生成する重要な技術である。
    • 既存の評価指標は,人間の知覚と必ずしも一致せず,融合アルゴリズムの性能を正確に反映できない場合がある。
    • 人間のペアワイズ比較の判断を模倣する,効率的かつスケーラブルな評価指標を構築し,より人間らしい評価を実現する。
    • 学習された指標LPIFMは,人間のA/B/Tie比較プロトコルを再現可能な代替手段として機能することを示した。
    • LPIFMは,シーンや手法の汎化性能において,人間のペアワイズ決定を正確に追跡し, Bradley-Terryランキングを再現した。
    • 既存の評価指標と比較して,ペアワイズ精度とランキング相関の両方でLPIFMが大幅に優れた性能を示した。

    Link: https://arxiv.org/abs/2608.01301

  • 対称的融合を超えて:タスク依存のモダリティ強みを活用したRGB-Event 小物体検出 [cs.CV]目的:RGBとEventデータのタスク依存のモダリティ強みを活用した小物物体検出手法
    • 近年の自動運転などにおいて,高速移動する小型物体を正確に検出することが重要となっている。
    • 従来のRGB-Event検出器は,両モダリティを均等に融合するため,それぞれの強みが活かされていない。
    • タスクに応じて各モダリティの役割を分担することで,検出精度を向上させることを目指す。
    • Eventデータは位置特定に,RGBデータは分類にそれぞれ強みを持つことが示された。
    • 提案手法AERODetは,位置特定と分類を分離し,各タスクに応じてモダリティの信頼性を調整する。
    • 実験により,AERODetが最先端の性能を達成し,特にFREDデータセットで顕著な改善が確認された。

    Link: https://arxiv.org/abs/2608.01302

  • スペクトル誘導型オートエンコーダ:事前学習済み視覚潜在表現の利用 [cs.CV]目的:事前学習済み視覚モデルの潜在表現を用いた画像生成の改善
    • 視覚モデルは画像理解において重要な役割を担う。その潜在表現は,様々な応用可能性を秘めている。
    • 視覚モデルの潜在表現は直接モデル化が難しく,特に高周波成分のスペクトルミスマッチが課題である。
    • 高周波成分の抑制と意味情報の分離により,潜在空間のモデル化を容易にすることを目的とする。
    • SPAEは,コンパクトなボトルネックを用いて安定した意味情報を抽出するとともに,高周波成分を抑制する。
    • チャネルワイズマスキング戦略により,ボトルネックチャネルにおける意味情報と高周波詳細の分離を促進する。
    • SPAEは,視覚理解,生成品質,再構成精度において良好なバランスを実現した。

    Link: https://arxiv.org/abs/2608.01306

  • Remember-R1:強化学習による長文脈における視覚情報の忘却の軽減 [cs.CG, cs.MM, cs.CL, cs.CV]目的:長文脈における視覚情報の忘却軽減策
    • マルチモーダル大規模言語モデルの複雑なタスク処理能力向上は重要である。
    • 長文脈になると,モデルが視覚情報よりもテキスト情報に依存し,視覚情報を忘却しやすい。
    • 視覚情報の活用と維持を直接制御し,長文脈における忘却を軽減することを目指す。
    • Remember-R1は,推論過程への直接的な強化学習による介入により,視覚情報の忘却を軽減する。
    • 実験により,Remember-R1が多様なモデル規模とベンチマークで推論性能を改善することが示された。
    • 視覚的注意力の低下を抑制することで,効果的な忘却軽減が確認された。

    Link: https://arxiv.org/abs/2608.01314

  • LongChart VQA:複雑な複数グラフ推論のためのMLLMの包括的ベンチマーク [cs.CL, cs.AI, cs.CV]目的:複雑な複数グラフ推論を必要とするタスクにおけるMLLMの性能評価
    • MLLMは,コンテキストウィンドウの拡大と推論能力の向上により,複雑なエージェントタスクでの利用が進んでいる。
    • 既存のベンチマークは単一グラフの理解に重点が置かれており,グラフ間の複雑な関連性を評価するには不十分である。
    • 複数グラフの複雑さを捉え,一貫性と妥当性を確保するベンチマークを開発し,MLLMの能力を詳細に分析すること。
    • LongChartは,平均6.5枚の画像と31.2個の質問を含むVQAデータセットであり,複雑な複数グラフ推論を評価可能である。
    • 10種類の最先端MLLMを評価した結果,計算複雑度が増加すると精度が低下し,ばらつきが大きくなることが示された。
    • 推論パターン,補助ツール,画像摂動に対する頑健性が性能に影響を与える要因として分析された。

    Link: https://arxiv.org/abs/2608.01328

  • SphereVideo: プロトタイプアンカーを用いたハイパースフィア境界による継続的なAI生成動画検出 [cs.CV]目的:AI生成動画と実動画の識別
    • AI技術の発展に伴い,生成動画の検出が重要となっている。
    • 既存の検出器は,新しい生成モデルへの汎化性能が低いという課題がある。
    • 継続学習により,検出器の適応能力向上を目指す。
    • SphereVideoは,実動画の特徴分布がコンパクトであるという知見に基づき,ハイパースフィア上で実動画のプロトタイプを形成する。
    • このプロトタイプをアンカーとして,決定境界の進化を制御し,破滅的忘却を軽減する。
    • フレームレベルとクリップレベルの両方で実データの時間的ダイナミクスをモデル化し,見慣れないデータにおいても高い性能を示す。

    Link: https://arxiv.org/abs/2608.01334

  • 眠っている運転手:JEPAの新しい運転データの評価における限界 [cs.HC, cs.CV, cs.LG]目的:自動運転データの異常検知手法の評価
    • 自動運転技術の発展には,大量の運転データの効率的な評価が不可欠である。
    • 人間のレビューだけでは,膨大なデータ全てを精査することは現実的ではない。
    • 自己教師あり学習による異常検知が有効かどうかの検証を試みる。
    • 自己教師あり学習モデルJEPAは,異なるデータセット間では高い性能を示すように見える。
    • しかし,同一データセット内での評価では,性能が大幅に低下し,ランダムと同等の結果となる。
    • 教師あり学習による評価ではJEPAより高い性能が得られ,自己教師あり学習の目標設定に課題があることが示唆される。

    Link: https://arxiv.org/abs/2608.01336

  • Driver2Map:オンライン高精度地図作成のための人間運転の模倣 [cs.CV]目的:オンライン高精度地図の構築
    • 自動運転システムの実現には不可欠であり,安全性向上に貢献する。
    • 異なるデータソース間のずれや視点差により,効果的な融合が困難である。
    • マルチモーダルデータの効率的な活用と地図構造の事前知識の活用により,ロバストな地図構築を目指す。
    • 提案手法Driver2Mapは,既存手法と比較してIoUとAPの指標で優れた性能を示した。
    • 「二段階アライメント」戦略により,異なるモダリティ間の空間的なずれを低減することに成功した。
    • カメラの姿勢情報を活用した「Pose-Guided BEV Fusion」により,俯瞰視点での特徴量オーバーラップを抑制した。

    Link: https://arxiv.org/abs/2608.01338

  • DeVIT:デルタ計算を用いた低消費電力Vision Transformerの加速 [cs.CV, cs.AI, cs.AR]目的:Vision Transformerの加速手法
    • Transformerは様々な分野で高性能だが,計算量が多く,リソースが限られたデバイスでの利用が課題。
    • モデルの量子化はメモリ使用量を削減するが,その特性を最大限に活かせていない。
    • 量子化による値の局所性を活用し,乗算器を使用しない行列積計算を実現する。
    • DeVITは,デルタ計算によりVision Transformerの行列乗算を効率化し,低消費電力化を実現した。
    • 値の局所性を利用することで,乗算器を削減し,ハードウェアの複雑さを軽減する。
    • リソース制約のあるデバイスへのTransformerの展開を可能にする。

    Link: https://arxiv.org/abs/2608.01343

  • プロンプト駆動型シミュレーションと特徴摂動によるクロスドメイン少数ショット物体検出 [cs.CY, cs.CL, cs.CV]目的:クロスドメイン少数ショット物体検出における汎化性能の向上
    • ドメイン間のずれが大きい場合やターゲットドメインのラベルデータが少ない状況において,物体検出の性能を維持することが重要である。
    • 既存のデータ拡張手法は,複雑なドメインシフトのモデリングに限界があり,十分な性能改善が得られない場合がある。
    • 大規模な視覚言語モデルを活用し,意味的に一貫性のある多様な訓練サンプルを生成することで,ドメイン不変な表現学習を目指す。
    • PSP-FSODは,プロンプト駆動型ドメインシミュレーションと特徴摂動正則化を統合したフレームワークであり,高品質なドメイン多様性のある教師信号を生成する。
    • 提案手法は,物体配置を誘導し,意味的・空間的なずれを軽減するグラウンディング認識生成スキームを採用することで,前景適応を改善する。
    • ガウスノイズ注入による特徴摂動メカニズムにより,摂動下での一貫性のある予測を促し,ドメイン固有のヒントへの依存を低減する。

    Link: https://arxiv.org/abs/2608.01348

  • PixVL:マスクとテキストの一貫性サイクルによるピクセルレベルMLLMの自己教師あり学習 [cs.CV]目的:ピクセルレベルの多種多様な大規模言語モデルの自己教師あり学習
    • 画像認識の分野において,特定の物体や領域への理解が求められている
    • 高品質なマスクとテキストのペアが不足しており,領域理解の学習を妨げている
    • ラベルなしデータから自己検証サイクルを構築し,領域理解とセグメンテーションの精度向上を目指す
    • PixVLは,マスクとテキストの一貫性サイクルを導入することで,ピクセルレベルMLLMが領域記述を生成し自己検証することを可能にした
    • confuser-awareな意味的検証やクロスビュー検証により,学習の安定性を高め,形状の近さによるショートカットを防ぐ
    • 領域理解とセグメンテーションを相互に生成・検証する戦略により,両タスクの性能を向上させた

    Link: https://arxiv.org/abs/2608.01354

  • CORTIVA:補完的視覚教師の候補スコア融合による脳波・脳磁図からの画像検索 [cs.CV]目的:脳波および脳磁図からの画像検索における性能向上
    • 脳活動からの視覚経験の復号は,神経科学や脳コンピュータインタフェースの発展に不可欠である。
    • 既存手法では,多様な視覚的情報を単一の埋め込み表現に統合し,候補順位の多様性を損なっている。
    • CORTIVAは,異なる経路からのスコアを融合することで,この問題を解決し,より正確な画像検索を実現する。
    • CORTIVAは,THINGS-EEG2ベンチマークにおいて,Top-1精度73.5%,Top-5精度95.3%を達成し,既存の最良手法を上回った。
    • THINGS-MEGデータセットにおいても,モダリティ固有のニューラルエンコーダと組み合わせることで,Top-1精度42.4%を達成した。
    • 経路除去再学習や重み制御実験により,CORTIVAの性能向上は,補完的な経路スコアの統合に起因することが示された。

    Link: https://arxiv.org/abs/2608.01355

  • 敵対的蒸留を活用した,乳癌特異的で偏りの除去された病理画像ファウンデーションモデルのカスタマイズ [cs.CV]目的:乳癌特異的な病理画像ファウンデーションモデルのカスタマイズ手法
    • デジタル病理において,組織表現の学習モデルが重要視されている。診断支援や研究への応用が期待される。
    • 汎用的な学習モデルは計算コストが高く,特定の癌種への適用においてデータ分布の不一致や偏りが課題となる。
    • 敵対的蒸留により,軽量で偏りの少ない乳癌特異的なモデルを構築し,性能低下を防ぐことを目指す。
    • SmartStuフレームワークを用いることで,汎用モデルよりも30倍以上小型な乳癌特異的モデルを生成できる。
    • 生成されたモデルは,汎用モデルと同等かそれ以上の性能を,バランスアキュラシーとAUCで示している。
    • 敵対的蒸留は,ノイズとなる特徴を抑制し,重要な形態学的特徴を認識させることで,性能向上に貢献する。

    Link: https://arxiv.org/abs/2608.01356

  • 病理基盤モデル間の相乗効果の理解:適応的融合によるアプローチ [cs.CV]目的:病理基盤モデル間の相乗効果の解明
    • 病理画像解析の精度向上は,疾病診断や治療方針の決定において不可欠である。
    • 既存の病理基盤モデルは,学習データやアーキテクチャの違いから,偏りが存在する。
    • 複数のモデルの長所を組み合わせ,よりロバストで解釈可能な予測を目指す。
    • AdaFusionは,複数の凍結された病理基盤モデルからの情報を統合し,予測精度を向上させる。
    • 特徴量圧縮とサンプル条件付きゲーティングモジュールにより,モデルごとの貢献度を適応的に調整する。
    • モデルの特性と組織表現型間の相乗効果を明らかにする解釈可能な可視化を提供し,結果は形態学的パターンと整合性がある。

    Link: https://arxiv.org/abs/2608.01370

  • FineMoLA:クリップレベルの監督下からの詳細なモーション-言語対応へ [cs.CV]目的:詳細なモーション-言語対応の学習
    • モーション生成は近年進歩しているが,言語との連携が重要である。
    • 既存データセットでは,モーションフレームとテキストの対応が不十分である。
    • フレームレベルでの詳細なモーション-言語対応を自動的に学習すること。
    • 提案手法FineMoLAは,クリップレベルの注釈からフレーム-フレーズ間の対応を学習する。
    • 長文記述をアクションを含むフレーズに分割し,最適輸送問題としてモーション-言語対応を定式化する。
    • SnapMoGen実験により,学習された対応がベースラインよりも優れていることが示された。

    Link: https://arxiv.org/abs/2608.01392

  • SG-WAM:幾何学的認識のある行動空間における自己誘導型ワールドモデリング [cs.RO, cs.CV]目的:幾何学的認識のある行動空間における自己誘導型ワールドモデリングの学習
    • ロボットの自律的な行動計画や制御において,環境の予測は不可欠である。
    • 既存のワールドモデルは,行動生成と環境予測の整合性,または幾何学的情報の活用において課題がある。
    • 行動生成と環境予測を両立させ,幾何学的情報を統合したワールドモデルの構築を目指す。
    • 提案手法SG-WAMは,ポリシーから導出される表現空間で幾何学的認識のある行動条件付きダイナミクスを学習する。
    • SG-WAMは,LIBEROおよびLIBERO-Plusにおいて,高い成功率(それぞれ98.5%,73%)を達成した。
    • 強固なベースラインと比較して,分布内および分布外の現実世界評価で優れた性能を示した。

    Link: https://arxiv.org/abs/2608.01397

  • 病理全スライド画像の学習不要な分布外検出 [cs.CV]目的:病理全スライド画像における分布外データの検出手法
    • 医療におけるAI活用には安全性確保が不可欠であり,専門外のデータへの誤診を防ぐ必要がある。
    • 既存の分布外検出手法は,病理画像特有の巨大データ,微細な病理学的差異,組織処理のばらつきに対応できていない。
    • 本研究は,病理全スライド画像における分布外検出の精度向上を目指し,AIの安全な臨床応用を促進する。
    • 提案手法ZIOは,学習なしで病理全スライド画像の分布外検出を実現し,既存手法を上回る性能を示した。
    • ZIOは,画像とテキスト情報を組み合わせた多imodal表現を用いることで,分布外検出の精度を向上させている。
    • 5つの独立したコンソーシアムからの14,700枚以上の全スライド画像を用いた評価により,ZIOの有効性が確認された。

    Link: https://arxiv.org/abs/2608.01407

  • GenTrack:ロボットネイティブなモーション生成とゼロショットヒューマノイドトラッキングのための物理的アライメント [cs.CL, cs.RO, cs.CV]目的:ロボットネイティブなモーション生成とゼロショットヒューマノイドトラッキングのための物理的アライメント手法
    • 汎用ヒューマノイドロボットの制御において,多様な参照に対応できるトラッキング技術が重要である。
    • 大規模な学習データが必要であり,データ収集コストが課題となっていた。
    • 生成されたモーションとロボットの実行可能性のギャップを埋め,ゼロショットでの制御能力を向上させる。
    • GenTrackは,生成器とトラッカーをオンラインで協調学習させることで,ロボットが実行可能なモーション生成を可能にした。
    • 生成されたモーションは,セマンティックな整合性を保ちつつ,よりロボットネイティブなものとなった。
    • 特に,未知の参照に対して,トラッキングの精度とゼロショットでの対応範囲が大幅に向上した。

    Link: https://arxiv.org/abs/2608.01410

  • 評価ルール:テキスト評価指標の統計的・戦略的整合性 [cs.AI, cs.GT, cs.LG]目的:テキスト評価指標の統計的および戦略的な整合性
    • 自然言語生成システムの評価は重要であり,客観的指標の信頼性が求められる。
    • 既存指標は人間評価との相関で評価されるが,最適化目的に利用される場合,戦略的な操作が可能となる。
    • 人間評価との相関だけでなく,操作耐性を持つ指標の設計を目指す。
    • 人間評価との高い相関関係が必ずしも戦略的な整合性を示唆するものではないことが示された。
    • 相互情報量に基づく指標は,操作耐性を大幅に向上させることが確認された。
    • 新たな指標が,人間評価との相関性と操作耐性の両立を実現した。

    Link: https://arxiv.org/abs/2608.01423

  • PackingGPT:ラストマイル配送における実家具のための3D梱包エージェント [cs.CV]目的:異種家具を車両に梱包するタスクに関するベンチマークデータセットとベースラインモデル
    • 物流効率化において,空間利用最大化はコスト削減と環境負荷低減に不可欠である。
    • 既存のコンテナ梱包アルゴリズムは,家具の形状や重量,積載状況の複雑さを考慮していない。
    • 現実的な条件下での安定的な家具梱包を実現し,ラストマイル配送の効率を向上させる。
    • 現実的な家具梱包データセットを構築し,多様な形状・重量の家具を考慮した評価を可能にした。
    • PackingGPTフレームワークを提案し,レゴブロックのように段階的に家具を配置するアプローチを採用した。
    • 重心制約を考慮したモデルLLPは,セダン車シミュレーションでの梱包失敗率を0.67%に大幅に削減した。

    Link: https://arxiv.org/abs/2608.01427

  • 動的操作:単一の静的デモンストレーションからの動的操作の実現 [cs.RO, cs.CV, cs.LG]目的:動的操作の実現
    • ロボットが複雑な環境で活動するためには,動的状況下での物体操作能力が不可欠である。
    • 動的なシナリオの組み合わせの複雑さから,大量のデータが必要となる点が課題である。
    • 単一の静的デモンストレーションから多様な動的操作を合成し,リアルタイムな実行を可能にすることを目指す。
    • 提案手法DynamicManipは,効率的なデータ拡張パイプラインと低遅延な模倣学習ポリシーによって,これらの課題に取り組む。
    • シミュレーションと実機実験の結果,DynamicManipはデータ効率の大幅な向上と,動的操作タスクにおける性能向上を実現した。
    • 成功率が平均18.4%向上し,ポリシー照会遅延が32.9%低減した。

    Link: https://arxiv.org/abs/2608.01452

  • マルチモーダルメモリ圧縮による長期的身体性意思決定 [cs.CV, cs.CL]目的:長期的身体性意思決定におけるエージェントの性能評価
    • 人間を支援するエージェントの重要性が高まっており,長期的な意思決定能力が求められている。
    • 既存のエージェントは,多次元な人間の選好を統合し,長期的な視点での合理的な意思決定が困難である。
    • マルチモーダルな情報を効率的に圧縮し,長期的な意思決定の質を向上させることを目指す。
    • DunphyBenchという新たなベンチマークを提案し,エージェントの長期的な人間中心の身体性意思決定能力を評価した。
    • 最先端のVLM駆動エージェントのボトルネックがメモリ管理にあることを診断し,MeMentoを開発した。
    • MeMentoは,メモリ使用量を85.38%削減しつつ,VLM駆動エージェントの精度を7.18%向上させた。

    Link: https://arxiv.org/abs/2608.01456

  • 衛星ダウンリンクにおける明確性重み付きビット割り当て [cs.NI, cs.CV, eess.IV]目的:明確な領域の画質を維持しつつ,衛星からのデータ伝送に必要なビット数を削減すること
    • 地球観測衛星は大量の画像データを取得するが,地上局との通信時間には限りがあるため,効率的なデータ圧縮が重要である。
    • 従来のシステムでは,雲検知器の誤検出により,明確な領域の画素データが不要に破棄される問題がある。
    • 雲の領域に割り当てるビット数を減らし,明確な領域に多くのビットを割り当てることで,画質を維持しつつデータ量を削減する。
    • 明確性重み付きコーデックは,既存の学習圧縮ベースラインと比較して,同等の画質で最大47.8%少ないバイト数でデータを伝送できる。
    • 提案手法は,従来の雲検知器を使用するフレーム破棄ルールよりも,エンコーダーの処理時間とエネルギー消費を削減する。
    • 中断される可能性のある通信においても,明確な領域のデータ配信量を2倍以上に向上させ,理論上の上限の83.6%に達する。

    Link: https://arxiv.org/abs/2608.01457

  • VGER:ボクセル誘導によるグローバルイベントランキングを用いたイベントクラウド帰属 [cs.CV, cs.AI]目的:イベントクラウド帰属の精度向上
    • イベントカメラは効率的な知覚に有用な情報を取得するが,その活用には透明性と信頼性の向上が課題である。
    • 既存手法は点レベルでの帰属に偏っており,イベント固有の時空間構造を考慮できていない。
    • イベントの重要度をランキング化し,予測に重要なイベントを特定することで,モデルの解釈性を高める。
    • 提案手法VGERは,イベントレベルの勾配情報とタスクに応じたボクセル摂動情報を組み合わせることで,高精度なイベント帰属を実現する。
    • VGERは,高重要度イベントと低重要度イベントを明確に区別する統一的なイベントランキング戦略を導入する。
    • 3つのイベントベースベンチマークにおいて,VGERは既存手法と比較して,削除性能において一貫した改善を示す。

    Link: https://arxiv.org/abs/2608.01470

  • Slot2Text:効率的かつ空間追跡可能な外科用MLLMのためのオブジェクト中心視覚トークン化 [cs.CV, cs.CL, cs.LG]目的:外科手術場面理解のための多Modal大規模言語モデルにおける視覚トークンの効率化と空間追跡性の向上
    • 外科手術支援AIの発展には,術中映像を正確に理解し,適切な情報を提供する技術が不可欠である。
    • 既存のMLLMは,多数の視覚トークンを用いるため,計算コストが高く,回答根拠の空間的な特定が困難である。
    • 視覚情報をコンパクトなスロット潜在表現に変換し,計算効率と空間追跡性を両立させることを目指す。
    • Slot2Textは,視覚入力を少数領域のスロット潜在表現に変換することで,従来のモデルと比較してトークン消費量を91.8%削減した。
    • Slot2Text-Fastは,質問応答において最先端の性能に匹敵し,視覚プレフィックスを大幅に削減することに成功した。
    • Slot2Text-Reasonは,追加のトークン消費と遅延を伴うものの,領域の特定,位置,空間的証拠の追跡を可能にした。

    Link: https://arxiv.org/abs/2608.01473

  • ガバナンスが分析を凌駕する:資格証に基づく相互レビューの発生と操作可能性 [cs.GT]目的:資格証に基づく相互レビューの発生と操作可能性に関する分析
    • 研究評価の効率化が求められる中,論文投稿・査読のガバナンスが重要性を増している。
    • 現在のガバナンス規則は,インセンティブ特性の分析が不十分なまま導入されている。
    • 論文投稿・査読システムのインセンティブ構造を分析し,公平なガバナンス規則を設計すること。
    • 生成AIの普及により論文作成コストは低下したが,査読コストは変わらず,ガバナンス規則が導入されている。
    • 分析の結果,現在の制度下では,一部の研究者に査読負担が集中していることが明らかになった。
    • 提案する修正により,査読負担を均等化し,不正な投稿インセンティブを抑制できる可能性が示された。

    Link: https://arxiv.org/abs/2608.01476

  • 知覚された音声の解釈可能なMEGデコーディング:皮質起源と検索を駆動する刺激特徴 [cs.LG, cs.SD, q-bio.NC]目的:知覚された音声のMEGデコーディングにおける皮質起源と,検索を駆動する刺激特徴の特定
    • 脳機能研究において,非侵襲的なMEGによる音声処理メカニズムの解明は重要である。
    • 深層学習を用いたMEGデコーディングでは,モデルの解釈性が低く,どの音声特徴が検索を駆動しているか不明である。
    • MEGデコーディングの解釈性を高め,音声処理に関わる皮質起源と特徴を明らかにすること。
    • 改良されたモデルは,MEG-MASCデータセットにおいて39.75±0.34%のTop-1精度を達成し,パラメータ数を大幅に削減した。
    • モデルの重みはソース空間にマッピングされ,音声知覚ネットワークと一致する発生源を再現し,左半球で高周波リズム成分が顕著であった。
    • 刺激特徴の介入実験により,19個の刺激特徴のうち15個が検索に貢献し,特に沈黙,音強度,母音,音響的な開始が大きな影響を与えた。

    Link: https://arxiv.org/abs/2608.01481

  • コンパクトな統一マルチモーダルトラッキングに向けて:知識蒸留と構造的プルーニングの相乗効果 [cs.CV]目的:統一マルチモーダルオブジェクトトラッキングにおける効率化
    • 多様なセンサーデータを活用し,ロバストなトラッキングを実現する分野である。
    • 最先端モデルの計算コストが高く,エッジデバイスへの実装が困難である。
    • 予測ヘッドの効率化と,軽量なモデルと重いモデル間の知識伝達ギャップの解消を目指す。
    • 提案手法は,5つのベンチマークで既存の最先端手法を大きく上回る性能を示した。
    • RGBT234において91.5%のMPRを達成し,単一のRTX 4090上で54 FPSで動作する。
    • 教師モデルと比較して5倍の速度向上を達成しつつ,高い精度を維持している。

    Link: https://arxiv.org/abs/2608.01488

  • ガウシアンセレクター:グラフ最適化による3Dガウシアン スプラッティングにおける軽量な人間によるオブジェクト選択 [cs.CV]目的:3Dシーンからのオブジェクト選択手法
    • 3Dシーン編集や具現化されたインタラクションにおいて,効率的なオブジェクト選択は不可欠である。
    • 既存手法は計算コストが高く,十分な視点からの情報が必要となる場合が多い。
    • 少ない視点と簡単なscribble(落書き)入力から,効率的に3Dオブジェクトを選択すること。
    • 提案手法 GaussianSelector は,学習を必要とせず,少ない視点とscribbleガイダンスから対話的なオブジェクト選択を実現する。
    • ガウスを幾何学的にまとまりのあるスーパーポイントに粗化し,外観と空間情報を利用したグラフを構築することで,効率的な選択を可能にする。
    • 実験により,GaussianSelector は最先端のmulti-view SAMベース手法と同等の選択品質を,少ないインタラクション視点と低い計算コストで達成することが示された。

    Link: https://arxiv.org/abs/2608.01492

  • 事前学習済み検出Transformerにおける3D物体レベルの理解の探求 [cs.CV]目的:事前学習済み2D検出Transformerが物体に関する3D情報をどの程度表現しているかの評価
    • 物体検出はコンピュータビジョンの基礎であり,自動運転やロボット工学等に応用される
    • Transformerモデルは2D情報を学習するが,3D情報をどの程度獲得しているかは不明
    • 2D情報のみから3D情報を推測する能力を明らかにし,モデルの理解度を深める
    • 事前学習済みのDETRモデルは,3Dに関する有用な情報を驚くほど表現していることが示された
    • 特に,カメラからの深度や相対的な3D位置といった情報を,明示的な3D学習なしに獲得している
    • この結果は,2Dモデルが潜在的に3D情報を理解している可能性を示唆する

    Link: https://arxiv.org/abs/2608.01495

  • 平均報酬保証を持つ交代時間テンポラルロジック [cs.LO, cs.GT, cs.MA]目的:戦略的および定量的な推論を組み合わせる方法
    • ゲーム理論と検証の分野において,戦略的行動と定量的な性能保証を統合的に扱う重要性が増している。
    • 従来のATL*では,長期的な報酬の保証を組み込むことが難しく,表現力に限界があった。
    • 長期的な平均報酬の閾値を保証する戦略の存在性を形式的に検証すること。
    • 本研究で導入したATL*_mpは,ATL*の表現力を拡張し,平均報酬制約とテンポラル制約を同時に扱うことを可能にした。
    • 1次元制約下では,モデル検査の複雑さはATL*と同程度の2EXPTIME-完全であることが示された。
    • 記憶容量の要求量を,閾値の分母の関数として線形に評価できることを示した。

    Link: https://arxiv.org/abs/2608.01499