arXiv雑要約

画像・音声 - 2026/08/04 公開

  • 非常に高次元の特徴選択における確率的逐次探索 [cs.LG, cs.CV, stat.ML]目的:非常に高次元の特徴選択問題における効率的な特徴選択手法
    • 特徴選択は機械学習モデルの性能向上と解釈性の向上に不可欠である。
    • 高次元データにおける全探索型特徴選択は計算コストが高く,現実的ではない。
    • 本研究は,高次元データでも効率的に特徴選択を行うための確率的探索手法を提案する。
    • 提案手法sSFFSは,500次元のmadelonデータセットにおいて,従来のSFFSと同等の性能を維持しつつ,評価回数を大幅に削減した。
    • 5000次元のgisetteデータセットにおいて,sSFFSは従来のランキング手法を凌駕し,高次元データにおける有効性を示した。
    • 10105次元のreutersデータセットにおいて,sSFFSは既存手法を上回り,特徴選択の精度と計算効率の両面で優れた結果を得た。

    Link: https://arxiv.org/abs/2608.01502

  • ローリングシャッターカメラの自己較正 [cs.CV]目的:ローリングシャッターカメラのカメラ内部パラメータと読み出し時間比の推定
    • ローリングシャッターカメラは広く普及しているが,動きのある場面で歪みが生じやすい。
    • 従来の較正手法は,較正ターゲットや特殊なハードウェアが必要であり,制約の多い環境で使用される。
    • 較正ターゲットを用いずに,カメラ内部パラメータと読み出し時間比を自己較正することを目指す。
    • 提案手法は,自己較正バンドル調整として実装され,ローリングシャッターの画像生成モデルを活用する。
    • 連続時間軌道推定と時間的に歪んだグローバルシャッター画像としての解釈を組み合わせた二重投影モデルを提案する。
    • シミュレーションおよび実データ実験により,提案手法の精度,ロバスト性,実用性が確認された。

    Link: https://arxiv.org/abs/2608.01509

  • 不確実性 guided boundary-aware ドメインincremental 超音波セグメンテーション [cs.CV]目的:ドメインincremental超音波セグメンテーションにおける継続学習の性能向上
    • 臨床画像における継続学習は,診断精度向上に不可欠であり,医療現場での応用が期待される。
    • 既存手法では,新たなドメインへの適応時に以前の知識が失われやすく(破滅的忘却),性能低下を招く。
    • 予測不確実性を活用し,忘却リスクの高い領域に焦点を当て,継続学習時の性能低下を抑制することを目指す。
    • 提案手法 UCBound-Net は,モンテカルロ dropout による不確実性を活用し,境界領域の知識蒸留を強化する。
    • 不確実性calibration正則化と不確実性guided exemplar selectionにより,破滅的忘却を効果的に軽減することを示した。
    • 乳房超音波と甲状腺超音波のデータセットを用いた実験で,既存手法と比較して,backward transfer が改善し,高いDice係数を達成した。

    Link: https://arxiv.org/abs/2608.01518

  • 多肢選択値から見えないもの:段階的参加型ゲームにおける匿名値の情報量 [cs.NI, cs.GT]目的:段階的参加型ゲームにおける匿名値が捉えられない情報量の特定
    • 協力ゲーム理論は,資源配分や意思決定における公平性の評価に不可欠である。
    • 匿名値に基づく評価指標は,プレイヤー間の公平性を考慮できない場合がある。
    • 本研究は,匿名値が捉えきれない情報を明らかにし,公平な評価指標の設計に貢献する。
    • 線形プレイヤー対称値,パワー指数,重要度指標といった評価指標は,匿名値からは捉えられない情報が存在することが示された。
    • 3人のプレイヤーからなるゲームにおいて,特定の投票ルールは匿名指標によって区別できない「盲目領域」が存在することが確認された。
    • 段階数が増えるほど,監査回避が容易になり,プレイヤー間の隠れた連携が可能になることが示唆された。

    Link: https://arxiv.org/abs/2608.01527

  • ST-LoRA:不確かさ認識型農業セグメンテーションのための単一軌道LoRAアンサンブル [cs.CV]目的:不確かさ認識型農業セグメンテーションのための効率的なアンサンブル手法
    • デジタル農業では,正確な予測と信頼性の高い不確かさ推定が不可欠である。特にセマンティックセグメンテーションのような高密度予測タスクにおいて重要である。
    • 従来のアンサンブル法は計算コストとメモリ消費が大きく実用性に課題がある。一方,単一モデルによる近似では,不確かさの質が低下する可能性がある。
    • 本研究では,LoRAとスナップショットアンサンブルを組み合わせることで,単一の学習軌道から多様なアンサンブルメンバーを効率的に構築し,不確かさの質を維持しつつ計算コストを削減することを目的とする。
    • ST-LoRAは,GrowliFlower-LとBUP20の2つの農業データセットにおいて,SegFormerとMask2Formerを用いて,セグメンテーション精度とキャリブレーションにおいて,フルランクアンサンブルと同等またはそれ以上の性能を示した。
    • 学習時間,推論遅延,メモリフットプリント,ストレージ要件を大幅に削減し,Snapshot Ensemble,MC Dropout,Deep Deterministic Uncertaintyといった効率的なベースラインと比較して,画像/ピクセルレベルのOoD検出,シフト下のキャリブレーション安定性,クロスシード分散において優れた性能を発揮した。
    • アブレーション研究により,高密度予測においては,言語モデルとは異なり,アテンション層ではなくフィードフォワード層が重要なLoRAターゲットであることが示された。

    Link: https://arxiv.org/abs/2608.01530

  • 汎用的な記号推論のための再帰型ビジョン言語モデル [cs.CV]目的:汎用的な記号推論における再帰型ビジョン言語モデルの性能向上
    • 大規模言語モデルの応用範囲拡大のため,複雑な記号推論能力の向上が求められている。
    • 既存の大規模言語モデルは,固定長の自己回帰型推論により,体系的な探索や反復が苦手である。
    • 事前学習済みの言語モデルの知識と再帰的推論を組み合わせることで,記号推論の性能を向上させる。
    • R-Qwenは,事前学習済みQwenを基盤とした再帰的推論フレームワークであり,既存の再帰型モデルやより大規模な言語モデルを上回る性能を示す。
    • Hierarchical Supervision Weighting (HSW)の適応により,勾配分散が50%以上減少し,学習の収束が加速する。
    • 特にARC-AGIデータセットでは,ベースラインと比較して27.6%の改善が見られ,再帰的洗練の有効性が示された。

    Link: https://arxiv.org/abs/2608.01534

  • STAR-VLM:自動車レーダーによる教師あり学習を用いた,運動と速度推定のための時空間的根拠付けビジョン言語モデル [cs.CV, cs.RO]目的:運動と速度推定のための時空間的根拠付けビジョン言語モデルの性能向上
    • 自動運転技術の発展において,周囲環境の正確な理解が不可欠である。
    • 既存のビジョン言語モデルは,時空間推論能力や動的シーンにおける正確な計測能力に課題がある。
    • 自動車レーダーによる教師あり学習を通じて,ビジョン言語モデルの時空間推論能力と速度推定精度を高める。
    • STAR-VLMは,自動車レーダーのレンジとドップラー情報を活用し,ラベルフリーな学習を実現している。
    • 運動分類および速度推定において,既存の手法を上回る最先端の性能を達成した。
    • 自動車レーダーが,実世界の自動運転における時空間認識能力を持つビジョン言語モデル構築のための,費用対効果の高い教師データ源となりうることを示した。

    Link: https://arxiv.org/abs/2608.01535

  • V-Mem:モダリティルーティングによる長期マルチモーダルエージェントメモリの検索 [cs.AI, cs.CL, cs.CV, cs.IR]目的:長期的なマルチモーダルエージェントメモリのためのモダリティルーティング検索システム
    • 近年,ユーザーとLLMエージェント間のインタラクションはマルチモーダル化が進んでおり,多様なデータ形式を扱う必要性が高まっている。
    • 既存のエージェントメモリは主にテキストに焦点を当てており,画像などの他のモダリティに関する質問への対応が不十分である。
    • V-Memは,クエリと証拠のモダリティをルーティングすることで,マルチモーダル環境における検索性能の向上を目指す。
    • V-Memは,会話をラウンドに分割し,同じラウンド内のターゲットモダリティコンテンツを返すことで,モダリティギャップを克服する。
    • 類似度と関連性のギャップを解消するため,クエリから生成されたアンカーを使用して,関連する証拠に近い検索を行う。
    • Mem-GalleryおよびLoCoMoの評価において,既存のシステムと比較して高いLLM評価スコアを示し,特に画像を含む質問において顕著な改善が見られた。

    Link: https://arxiv.org/abs/2608.01543

  • 識別軸,データ量ではない:対照コーパスが音声埋め込みに教えること [cs.CL, cs.SD]目的:対照学習における音声埋め込みモデルの特性解明
    • 音声認識や感情認識等の音声処理技術は,様々な応用分野で重要性が増している。
    • 対照学習において,目的とする属性が埋め込みに反映されない場合がある。
    • 対照コーパスの構造が,音声埋め込みモデルが学習する属性を制御することを明らかにする。
    • 対照コーパスに文の内容を固定した上で,抑揚情報を加えることで,キーワードスポッティングの性能が大幅に向上した。
    • 感情認識性能は一時的に低下するものの,抑揚制御されたコーパスでファインチューニングすることで回復し,キーワードスポッティング性能とのトレードオフも確認された。
    • キャプションの類似度を上げるだけでは感情認識性能は回復せず,キャプションの多様性を低下させて感情が識別軸となるようにすることで性能が向上した。

    Link: https://arxiv.org/abs/2608.01560

  • 濃霧下における視覚知覚の強化:多クラスの霧密度モデリングによるアプローチ [cs.CL, cs.CV, cs.AI]目的:濃霧下でのロバストな視覚知覚の実現
    • 自動運転技術の発展には,悪天候下での安定した知覚能力が不可欠である。
    • 濃霧などの視界不良環境下では,既存の知覚システムの性能が著しく低下する。
    • 霧密度に応じたモデルを構築することで,悪天候下での知覚性能の向上を目指す。
    • 霧密度ごとに異なる知覚モデルを訓練することで,濃霧条件下での性能向上が確認された。
    • 特に,非常に濃い霧の場合,再現率は0.076から0.232へと15.6%ポイント改善された。
    • 汎用モデルではなく,複数の専門モデルを用いることが,自動運転における視覚知覚のロバスト性を高める効果が示唆された。

    Link: https://arxiv.org/abs/2608.01572

  • D^2-4DGS: 二重深度誘導による疎カメラ4Dガウススプラッティング [cs.CV]目的:疎カメラ環境下における動的な新規視点合成の性能向上
    • 動的シーンの表現とレンダリングにおいて,4Dガウススプラッティングは効率的な手法として注目されている。
    • 従来の4Dガウススプラッティングは,十分な幾何学的制約のために多視点動画を必要とし,撮影コストが高い。
    • 単眼深度と多視点幾何学的深度の相補性を活かし,疎な視点からの再構成における幾何学的精度と安定性を高める。
    • 提案手法D^2-4DGSは,単眼深度推定と多視点幾何学的深度を整合させ,信頼性の高い幾何学的アンカーを特定する。
    • これらのアンカーは一貫性に基づいたプルーニングと深度監視をサポートし,再構成が不十分な領域の密度化に役立つ。
    • 9つのデータセットにおける評価で,D^2-4DGSは既存手法と比較して平均1.33dB高いPSNRを達成した。

    Link: https://arxiv.org/abs/2608.01588

  • 心臓デジタルツインにおける測定規約がキャリブレーションゲインとして偽装される場合 [cs.RO, cs.CV]目的:心臓デジタルツインにおける測定規約とキャリブレーションの分離
    • 心臓デジタルツインは臨床画像を生理学的測定に変換し,個別化医療の発展に貢献する。
    • キャリブレーション研究では固定された基準規約が仮定されることが多く,測定誤差の原因となり得る。
    • 測定規約がキャリブレーションゲインとして誤認される問題を解決し,正確な測定を可能にすること。
    • エコー心電図の4つのフロントエンドにおいて,位相調整がCAMUSのバイアスを除去すると考えられたが,検証の結果,その効果は否定された。
    • 単平面の真値を用いたEF誤差はモデル間で統計的に差がなかったが,CAMUSの二平面EFは臨床EFを+6.3ポイント上回る結果となった。
    • EchoNet-Dynamicの複製実験により,基準となる測定規約を適切に設定することで,バイアスの過大評価が解消され,CAMUSのランキングが逆転した。

    Link: https://arxiv.org/abs/2608.01602

  • 音声からの表情豊かな3D顔面アニメーションと頭部運動の生成 [cs.GR]目的:3D顔面アニメーションと頭部運動の生成
    • 現実的な人間とのインタラクションを実現するため,自然な顔と頭部の動きを生成する技術は不可欠である。
    • 高品質な3Dデータが不足しており,複雑な感情表現の動きをモデル化することが困難である。
    • 大規模な2D動画を活用し,感情に即した3Dの顔と頭部運動を生成することを目指す。
    • 本手法ETHeadは,最先端の手法と比較して,著しく優れた性能を示す。
    • 感情変調型確率的マスキング機構により,音声表現と視覚動態の整合性が向上した。
    • 生成されたモーションは,他の3D頭部アニメーションフレームワークにも転用可能である。

    Link: https://arxiv.org/abs/2608.01605

  • 共役不変量が定めるメタ可換順列は,ラベル付けまでの範囲である [cs.GT, math.GR]目的:メタ可換順列の決定における共役不変量の限界
    • Hurwitz quaternions は代数整数論において重要な役割を担う
    • 素因数分解における順列の決定には,素の性質に関する詳細な情報が必要
    • 共役不変量のみでメタ可換順列を決定できる範囲を明らかにすること
    • 共役不変量のみでは,メタ可換順列をラベル付けまで特定できないことが示された。
    • 素のノルムとトレースのみでは,順列の完全な構造を決定できない限界がある。
    • 具体例として(3,5)における4つの素の挙動から,共役不変量の限界が明確にされた。

    Link: https://arxiv.org/abs/2608.01610

  • 線形多時間スケール保持によるメモリ効率の良い視覚言語ブリッジ [cs.ET, cs.CV, cs.AI]目的:視覚言語モデルのメモリ効率向上
    • 視覚言語モデルは画像処理において高い計算コストが課題となっている。
    • 従来のAttention機構はメモリ消費量が大きく,高解像度画像の処理が困難である。
    • 本研究は,効率的なメモリ管理により長文脈の視覚情報を扱えるモデルの構築を目指す。
    • 提案手法LIA-MTRは,16,000トークンにわたる文脈を正確にルーティングできることが確認された。
    • LIA-MTRは,11.2GBのVRAMで262,144パッチの画像を処理可能であり,従来のMHAと比較して大幅なメモリ効率の改善が見られた。
    • MMEベンチマークにおいて,LIA-MTRは産業標準のMLPベースラインを上回り,特に物体永続性において10%の絶対的な改善が示された。

    Link: https://arxiv.org/abs/2608.01614

  • 形態にとらわれないモーション:抽象的なモーション表現からのクロスカテゴリモーション転移のブートストラップ [cs.CV]目的:異なる形態の物体間のモーション転移
    • 映像のモーション転移は,リアリティのあるアニメーション生成に不可欠であり,応用範囲が広い。
    • 従来の技術では,参照対象と生成対象の形状が大きく異なると,モーション転移が困難になる。
    • 形状の違いに依存しない,より汎用的なモーション転移手法を開発し,モーション生成の自由度を高める。
    • 本研究では,抽象的なモーション表現を用いて,クロスカテゴリ間のモーション転移を可能にする新しいフレームワークを提案した。
    • 提案手法は,異なる形状の物体間でも,意味のあるダイナミクスを保持したモーション生成を実現した。
    • 新しいデータセットとベンチマークを公開することで,モーション転移研究の発展に貢献する。

    Link: https://arxiv.org/abs/2608.01628

  • 空間スペクトル視覚的アンカー学習によるMLLMの視覚劣化軽減 [cs.CV]目的:多種多様なモダリティを持つ大規模言語モデル(MLLM)における視覚的劣化軽減
    • 近年,MLLMの性能は飛躍的に向上しているが,視覚的理解には課題が残る。
    • 推論時にMLLM内部の表現が変化し,情報が劣化する問題が存在する。
    • 外部の視覚モデルからの知識を活用し,表現のずれを抑制することを目指す。
    • 提案手法SSVALは,外部視覚モデルの知識を安定的に保持する視覚的アンカーを学習する。
    • 空間・周波数領域での表現アライメント損失により,中間層での視覚的特徴の学習を促進する。
    • 実験の結果,SSVALは既存手法と比較して,顕著な性能向上を達成した。

    Link: https://arxiv.org/abs/2608.01635

  • 効率的な一人称視点でのグラウンディングのための動的解像度ルーティング [cs.CV]目的:一人称視点でのグラウンディングにおける効率的な解像度ルーティング手法
    • 一人称視点での状況認識は,ロボット工学や拡張現実などへの応用が期待され,重要性が増している。
    • 高解像度入力が必要となる一方,大規模言語モデルの計算コストが課題となっている。
    • ピクセル空間での動的解像度ルーティングにより,計算コストを削減しつつ,高い精度を実現することを目指す。
    • 提案手法SmartResは,従来のトークン削減手法と比較して,最大67%の視覚トークン削減を実現した。
    • 解像度を落とした画像で全体像を把握し,重要な領域のみを高解像度で処理することで,計算効率を高めている。
    • Ego4DおよびEgoIntentionデータセットでの実験により,SmartResが最先端手法よりも最大1.66倍高速に推論可能であることが示された。

    Link: https://arxiv.org/abs/2608.01638

  • StreamTalk:キーポーズアンカリングを用いたストリーミング共同発話ジェスチャー生成 [cs.CV, cs.AI, cs.GR]目的:リアルタイム共同発話ジェスチャー生成のための手法
    • 人間らしいコミュニケーションにおいて,ジェスチャーは言語と並んで重要な役割を担う。
    • 既存のストリーミング手法では,誤差が蓄積し,長期間のシーケンスでドリフトが発生しやすい。
    • 前方拘束の欠如を克服し,ドリフトを抑制する手法を開発すること。
    • StreamTalkは,生成・検索・洗練の周期的なサイクルを持つ閉ループフレームワークである。
    • 提案手法は,キーポーズをアンカーとして利用することで,ドリフトを効果的に抑制することに成功した。
    • BEAT2データセットにおいて,最先端の性能を達成し,76 FPSでリアルタイムに動作する。

    Link: https://arxiv.org/abs/2608.01643

  • CRAFT:視覚言語モデルのためのビデオトークン再帰的適応融合による圧縮 [cs.CV, cs.AI]目的:ビデオトークンの圧縮手法
    • 動画理解において,視覚言語モデルは大量の視覚トークンを処理する必要があり,計算コストが増大する。
    • 既存の圧縮手法は,適応性の低さか,学習コストの高さという課題がある。
    • 効率性と適応性の両立を目指し,動画の冗長性を考慮した圧縮手法を提案する。
    • CRAFTは,パラメータ不要なトークン選択と学習可能なトークン融合を分離することで,効率的な圧縮を実現した。
    • CRAFTは,バックボーンの平均精度を約97%維持しながら,約8倍の圧縮率を達成した。
    • CRAFTは,複数のビデオベンチマークにおいて,既存の最先端のトークン圧縮手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2608.01644

  • StreamSplat:ストリーミングフィードフォワード3Dガウススプラッティング [cs.DC, cs.HC, cs.DC, cs.CV]目的:逐次的に到着するキャリブレーションされたビューに対応可能なストリーミングフィードフォワード3Dガウススプラッティングフレームワーク
    • 新しい視点からの合成は,仮想現実や拡張現実など幅広い分野で重要な技術である。
    • 既存手法は固定されたコンテキストビューを前提とするため,オンラインでの逐次更新が困難である。
    • 本研究は,ストリーミングデータに対して効率的に高品質な新規視点合成を実現することを目指す。
    • StreamSplatは,ボクセルアラインドコーズキャッシュ(VACC)を用いて,シーンの履歴を効率的に保存・活用する。
    • ヒストリープロジェクテッドデプスアンカリング(HPDA)とキャッシュガイド特徴注入(CGFI)により,履歴の再利用と性能向上を実現した。
    • DL3DV,RealEstate10K,ScanNetの実験により,StreamSplatは既存手法と同等以上の性能を示し,長尺のストリームデータにも対応可能であることが示された。

    Link: https://arxiv.org/abs/2608.01659

  • 根拠,網羅,そして洗練:長編動画質疑応答のための証拠中心フレーム選択 [cs.CV]目的:長編動画質疑応答におけるスパースかつ重要な証拠の特定
    • 動画理解と自然言語処理の融合は,人間のような知的な情報処理の実現に不可欠である。
    • 既存手法は局所的な関連性に着目しやすく,一度予算を使い切ると証拠の再取得が困難である。
    • テキストと視覚的証拠の連携を強化し,多様なコンテキストを維持することで精度向上を目指す。
    • GCRは,固定予算下でのフレーム選択を共同的な証拠キュレーション問題として扱うことで,学習を必要としないフレームワークを実現した。
    • LongVideoBenchとVideo-MMEのベンチマークにおいて,既存の強豪手法を2.54%と1.93%ポイント上回る性能を示した。
    • GCRは,7B LLaVA-OVバックボーンと32フレームで,それぞれ64.25%と62.15%の精度を達成した。

    Link: https://arxiv.org/abs/2608.01660

  • FairForensics:視覚と言語モデルによる表現と人口統計の解析を通じた汎用性の高い公平なディープフェイク検出 [cs.CV]目的:汎用性と公平性を有するディープフェイク検出手法の開発
    • ディープフェイク技術の高度化に伴い,その検出技術の重要性が増している。
    • 既存の公平性を重視した検出器は,未学習の操作や異なる人口統計グループへの一般化性能が低い。
    • 人口統計的バランスの取れたデータセットを用いて,汎化性能と公平性を両立する検出手法を開発する。
    • 提案手法FairForensicsは,表情と人口統計情報を考慮した視覚と言語モデルに基づき,ディープフェイクの一般化性能と公平性を向上させる。
    • 表情エンコーダと表情認識型視覚エンコーダにより,精巧な偽造パターンを捉え,ID情報による偏りを軽減する。
    • 人口統計情報に基づいた言語エンコーダと,集団を考慮したプロトタイプ公平性目的関数により,偽造特徴と人口統計情報の分離を促進する。

    Link: https://arxiv.org/abs/2608.01661

  • セグメンテーション基盤モデルのための少数の概念プロンプト学習:視覚的根拠付けによるアプローチ [cs.CV, cs.AI]目的:セグメンテーション基盤モデルにおける少数の概念プロンプト学習
    • 医療画像解析における自動セグメンテーションの精度向上は,診断・治療の効率化に不可欠である。
    • 既存のプロンプタブルセグメンテーション基盤モデルは,臨床タスクにおいて期待される性能を発揮できていない。
    • 視覚的根拠付けによる概念プロンプト学習で,画像とマスクペアから学習し性能を回復させる。
    • 提案手法FS-CPLは,超音波や内視鏡検査の4つの公開ベンチマークにおいて,従来のテキストプロンプトと比較して最大でDice係数を0.62向上させた。
    • FS-CPLは,SAM3とMedical SAM3の両方の性能を向上させ,バックボーンに依存しない汎用性を示した。
    • 視覚的概念プロンプトは,ドメイン固有の事前学習と相補的な効果を発揮することが示された。

    Link: https://arxiv.org/abs/2608.01663

  • FAUによるImageCLEF 2026タスクにおけるマルチモーダル推論:堅牢な候補スコアリングと簡潔な多言語画像質問応答 [cs.CV, cs.LG]目的:マルチモーダル推論システムの開発と評価
    • 画像とテキストの理解を組み合わせるマルチモーダル推論は,教育・科学分野における情報処理の基盤となる。
    • 複雑な図表や数式を含む画像に対する質問応答は,既存のモデルでは信頼性が低い場合がある。
    • 推論時のスコアリング,アンサンブル,プロンプティング等の工夫により,モデルの性能を最大限に引き出す。
    • Visual MCQにおいて,直接的な候補ラベルのスコアリングとスコア融合により高い精度を達成した。
    • Visual OpenQAにおいて,画像強調,簡潔な回答プロンプティング,決定論的デコーディング,後処理により,優れた結果を得た。
    • モデル固有の学習なしに,Visual MCQで3位,Visual OpenQAで1位の成績を収めた。

    Link: https://arxiv.org/abs/2608.01664

  • ランキング前割り当て:汎用LLMのためのデカップルドトークン圧縮 [cs.AI, cs.SD]目的:汎用LLMにおけるトークン圧縮手法
    • マルチモーダルLLMの性能向上には,効率的なトークン圧縮が不可欠である。
    • 既存手法では,各モダリティへの容量配分とトークン選択が同時に決定される。
    • モダリティごとに予算を事前に割り当て,公平なトークン選択を実現する。
    • Macerは,精度を維持しつつ,トークンコストを大幅に削減できる。
    • Qwen2.5-Omni-7Bにおいて,25%のトークン保持率で,フルトークンの性能の98.7%を維持した。
    • OmniVinci-9Bでは,既存手法と比較して最大12.9ポイントの性能向上が見られた。

    Link: https://arxiv.org/abs/2608.01665

  • 運動空間における生成ブラウン橋拡散による心筋ひずみ分析の向上 [cs.CV, cs.LG]目的:心筋ひずみ分析の精度向上
    • 心臓機能評価において,心筋ひずみ分析は重要な役割を担う。
    • 既存手法は,手動調整が必要で精度が低いか,高価な撮像が必要である。
    • 標準的な心臓MRI画像から高精度なひずみ値を生成する手法を開発する。
    • 提案手法は,既存の学習ベースのアプローチと比較して,運動予測とひずみ分析の精度を大幅に向上させる。
    • 生成モデルを活用することで,ルーチンな心臓MRIシーケンスから高品質な運動由来のひずみ値を合成できる。
    • 本研究は,臨床現場での心臓機能評価に貢献する,費用対効果の高いAIツールの開発につながる可能性がある。

    Link: https://arxiv.org/abs/2608.01677

  • 医療画像における生成AIと基盤モデル [cs.CV]目的:医療支援における生成AIと基盤モデルの応用
    • 近年,AI技術は目覚ましい発展を遂げ,医療分野においてもその活用が期待されている。
    • 医療データの利用制限や計算資源の不足が,AI開発の課題となっている。
    • 国産データと計算資源を活用し,高性能な医療支援AIを開発すること。
    • 生成AIは,画像生成の拡散モデルやテキスト生成のLLMといった技術を基盤としている。
    • 基盤モデルは,汎用的な知識を学習し,多様な医療タスクに応用できる可能性を秘めている。
    • 国内データと計算資源の活用により,医療支援AIの発展が期待される。

    Link: https://arxiv.org/abs/2608.01686

  • 消費者余剰を最大化する最適な事前知識不要メカニズム [cs.GT]目的:消費者余剰の最大化
    • メカニズムデザインは,資源配分やインセンティブ設計において重要な役割を果たす。
    • 既存のメカニズムは,事前知識に依存したり,効率性や真実性を損なう場合がある。
    • 事前知識を必要とせず,効率性と真実性を両立するメカニズムを開発する。
    • 本研究により,エージェント数$n$における残余余剰の期待値が,最適な社会厚生$W(N)$を$n$番目の調和数$H_n$で割った値以上となるメカニズムが確立された。
    • この保証は,単一アイテムオークションにおいても最適であり,ベイズインセンティブ整合性というより弱い要件下でも成り立つ。
    • 提案メカニズムは,厚生最大化VCGが多項式時間で実行可能な場合に多項式時間で動作し,粗代替財や複数ユニット評価,自然な単一パラメータ実現可能性制約に対して効率的なメカニズムを提供する。

    Link: https://arxiv.org/abs/2608.01693

  • プレイヤー中心のボールアクション検出のためのエンティティ認識シーケンス変換 [cs.CV, cs.AI]目的:プレイヤー中心のボールアクション検出におけるイベント検出とアクター属性の明確化
    • スポーツ映像解析は,高度な技術を必要とし,競技理解や戦術分析に不可欠である。
    • 既存手法では,プレイヤー個々の動きや相互作用を正確に捉えることが難しい場合がある。
    • プレイヤーをエンティティとして明示的にモデル化することで,検出精度を向上させる。
    • 提案手法ME-DSTは,FOOTPASSデータセットにおいてMicro F1スコア0.778を達成した。
    • これは,既存のTAAD+DSTベースラインを10.3パーセントポイント上回る結果である。
    • エンティティ軸の維持とロールIDのエンコードが,性能向上に重要な役割を果たすことが示された。

    Link: https://arxiv.org/abs/2608.01696

  • 適応的攻撃シーケンスと時間変動攻撃強度を持つスタッケルベルクセキュリティゲームにおけるオンライン学習 [cs.RO, cs.SY, eess.SY, eess.SY, cs.SY, cs.GT]目的:時間変動攻撃強度を持つ繰り返しスタッケルベルクセキュリティゲームにおける後悔最小化オンライン学習
    • セキュリティゲームは,資源配分問題として現実世界のセキュリティ対策を分析する上で重要である。
    • 従来のセキュリティゲームでは,攻撃者の行動パターンや攻撃強度の時間変化への対応が課題であった。
    • 本研究は,時間変動する攻撃強度と適応的な攻撃シーケンスを考慮したオンライン学習アルゴリズムを開発し,その有効性を示す。
    • 完全情報フィードバック下では,楽観的なタイブレーキングルールを用いたoracleとFollow-the-Perturbed-Leaderを組み合わせ,$\mathcal{O}(\sqrt{T})$ の期待後悔を達成した。
    • banditフィードバック下では,複数のフォロワーが同じ攻撃者タイプを共有する場合,バリオセントリック・スパンナ構成を用いてユーティリティ推定値を再構築し,$\mathcal{O}(T^{2/3})$ の期待後悔を達成した。
    • 広範なシミュレーションにより,完全および部分的な情報フィードバック下でのアプローチの堅牢性と有効性が確認された。

    Link: https://arxiv.org/abs/2608.01703

  • UniSim-SLAM:統一Sim(3)最適化によるフィードフォワードSLAM [cs.CV]目的:長系列における幾何学的矛盾と軌道ドリフトの軽減
    • SLAMはロボットの自律移動や環境理解に不可欠であり,その精度向上は重要な課題である。
    • 従来のSLAMは計算負荷が高く,リアルタイム処理が困難である。また,長系列データにおける累積誤差が問題となる。
    • 多様な座標系と不整合なスケールを持つ予測を統合し,高精度かつ低遅延なSLAMを実現することを目指す。
    • UniSim-SLAMは,軽量な2ビューキーフレームトラッキングと,定期的なマルチビューサブマップリファインメントを組み合わせることで,高精度なSLAMを実現した。
    • TUM RGB-Dおよび7-Scenesデータセットにおいて,UniSim-SLAMは最先端の精度を達成し,TUM RGB-Dで軌道誤差を38.5%,7-Scenesで45.9%削減した。
    • Sim(3)上での統一的な多層ファクターグラフを用いることで,グローバルキーフレーム姿勢とサブマップ姿勢を同時に最適化し,幾何学的な一貫性を確保した。

    Link: https://arxiv.org/abs/2608.01706

  • 空間クエリ:ビジョン言語モデルにおける幾何学的基盤のマルチインスタンス空間推論のベンチマーク [cs.NI, cs.CL, cs.CV]目的:ビジョン言語モデルにおける幾何学的基盤のマルチインスタンス空間推論の評価
    • 画像と言語を理解するモデルは進歩したが,正確な空間推論は未だ課題である。
    • 複数の同じカテゴリの物体間での比較を必要とする空間推論において,信頼性が低いという問題点がある。
    • 単一画像から,物体間の距離や位置関係を正確に推定する手法を確立することを目指す。
    • SPATIALQUERYという,特定のタスクに特化した追加学習なしでCIDQ推論を行うフレームワークを開発した。
    • SPATIALQUERY-1Mという,100万件以上のRGB画像のみの質問応答ペアを含むベンチマークを構築した。
    • Qwen3-VL-8BとSPATIALQUERYを組み合わせることで,既存のモデルを上回る性能を達成した。

    Link: https://arxiv.org/abs/2608.01709

  • STC-Net:電気発光画像に基づく太陽電池のクラックセグメンテーションと電力損失推定 [cs.CV]目的:太陽電池のクラックセグメンテーションと電力損失推定
    • 太陽電池の信頼性確保は,再生可能エネルギー利用拡大の鍵となる。
    • 既存のセグメンテーション手法では,微細かつ細長いクラックの正確な検出が困難である。
    • クラック検出精度向上と,それに基づく電力損失推定手法の確立を目指す。
    • 提案手法STC-Netは,エッジ情報とスペクトル情報を活用し,クラックの連続性と境界の保持を改善した。
    • PVEL-Sデータセットを用いた実験で,STC-Netは高いセグメンテーション精度(MIoU 72.52%)を示した。
    • セグメンテーション結果からクラック領域を抽出し,電力損失推定への応用可能性を示した。

    Link: https://arxiv.org/abs/2608.01714

  • 極度の暗闇とモーションブラーが交わる時:統一的なRAW復元のためのMeanFlow [cs.CV, cs.AI]目的:極低照度RAW画像の復元
    • 近年,暗所での画像撮影が増加しており,RAWデータの高画質化が重要となっている。
    • 既存手法は照明とノイズに焦点を当て,実用的な低照度撮影におけるモーションブラーへの対応が課題であった。
    • 現実的なモーションブラーを考慮した,極低照度RAW画像の復元手法を確立することを目指す。
    • 提案手法では,モーションブラーを付加した新しいデータセットSIDEDを構築し,学習に利用した。
    • ドメイン条件付き表現キャリブレーションを備えた統一的なRAWトークナイザーとMeanFlowを用いることで,高画質化を実現した。
    • 物理に基づいたリファインメントモデルにより,照明・反射率の一貫性,ピクセル忠実度,色再現性を向上させた。

    Link: https://arxiv.org/abs/2608.01720

  • G-Skin:生成的な視覚事前知識を用いた3Dガウスのバインディング学習 [cs.CV]目的:3Dガウス表現における表現力豊かで高忠実度なアニメーションのための生成的なスキニングフレームワーク
    • 3Dガウススプラッティングは写実的かつ効率的なレンダリングを実現し,3Dアセットの表現方法として急速に普及している。
    • 3Dガウスは表面に限定されず,明示的なトポロジー接続を持たないため,メッシュベースの手法を直接適用することが難しい。
    • 高品質なスキニングデータの取得コストが高いため,データ不足を克服し,汎化性能の高いスキニング手法を開発する。
    • G-Skinは,2Dビジョン基盤モデルを活用した骨格制御可能な画像生成モデルにより,強力なモーション事前知識を疑似ガイダンスとして活用する。
    • 幾何形状を考慮した正則化項を組み込んだ最適化パイプラインにより,学習プロセスを安定化させ,滑らかで構造的に一貫性のあるスキニング重みを生成する。
    • G-Skinは,アニメーションによるレンダリングアーティファクトを軽減するために設計された3Dガウス表現の拡張バリアントにも柔軟に対応する。

    Link: https://arxiv.org/abs/2608.01726

  • 視線誘導と判断方法の学習:品質認識を用いた解像度非依存型画像品質評価 [cs.NI, cs.CV]目的:画像品質評価における解像度非依存性の実現
    • 画像品質評価は,画像処理技術の発展において不可欠であり,様々な応用分野で重要性が増している。
    • 既存手法は,解像度依存性や,多様なデータセットへの対応の難しさ,計算コストの高さといった課題を抱えている。
    • 本研究は,これらの課題を克服し,より汎用性と効率性に優れた画像品質評価手法を開発することを目的とする。
    • 提案手法ReLIQSは,CLIPベースの多重スケールパッチ駆動型アーキテクチャであり,解像度非依存性を実現し,高品質な評価を可能にする。
    • ReLIQSは,複数の主観評価データセットから学習し,多様な歪みや解像度に対応できる汎化性能を示す。
    • 計算コストを抑えつつ,既存のCNN,CLIP,MLLMベースの手法と同等またはそれ以上の性能を達成する。

    Link: https://arxiv.org/abs/2608.01730

  • デジタル描画画像からの画家検証:IDraw [cs.RO, cs.CV]目的:デジタル描画の作者性検証手法
    • デジタルアートの普及により,著作権保護と紛争解決が重要になっている。
    • 完成した描画のみから作者性を検証するのは困難である。筆圧等の情報が欠如する。
    • 描画行動を画像から推論し,描画内容の影響を抑制することで検証精度向上を目指す。
    • IDrawは,描画とセンサー信号のペアから学習し,検証対象画像から描画行動を推論する。
    • 描画内容の共通部分を特定し,抑制することで,作者固有の描画特徴を抽出する。
    • 新しい画家に対して,既存手法よりも最大40%高い精度で作者性検証が可能となった。

    Link: https://arxiv.org/abs/2608.01737

  • RL-Lock: interlocking アセンブリ生成のための強化学習 [cs.AI, cs.GR]目的: interlocking アセンブリの生成
    • 構造的安定性から,様々な実用的な応用例が存在する。
    • 既存手法は,複雑な形状に対して時間がかかったり,解を見つけられない場合がある。
    • 強化学習を用いて,効率的に interlocking アセンブリを生成すること。
    • 本研究では,強化学習フレームワークRL-Lockを提案し,既存手法に頼っていた手動探索ヒューリスティクスを排除した。
    • 構造化された行動チャンキングとMCTSガイド付きの方策価値学習を組み合わせることで,探索空間を効率的にナビゲートできる。
    • 実験により,RL-Lockは interlocking アセンブリの生成において有効であり,特に困難なケースで有効性が示された。

    Link: https://arxiv.org/abs/2608.01744

  • 非線形スペクトル事前処理による高忠実度卓上ナノスコピー [cs.GR]目的:卓上ナノスコピーにおける高忠実度化
    • ナノテクノロジー分野の進展に伴い,高解像度な画像取得技術が不可欠となっている。
    • 従来の光学顕微鏡法では,解像度に限界があり,微細構造の観察が困難である。
    • 低光束環境下での高解像度イメージングを実現し,検出器のビット深度の制約を克服すること。
    • 本研究では,厳密な線形性を必要としない新しい融合アプローチを導入し,高精度な再構成を可能にした。
    • この手法は,ノイズ抑制と物理的忠実度との間のトレードオフを軽減し,強い分散下でも堅牢なイメージングを可能にする。
    • これにより,有効なスペクトル帯域が大幅に広がり,卓上ナノスコピーの可能性を拡大する。

    Link: https://arxiv.org/abs/2608.01746

  • SPECTRA:バンドルーティング埋め込みと段階的LoRAによる地理空間基盤モデルのクロスセンサー微調整 [cs.CV, cs.AI]目的:地理空間基盤モデルのクロスセンサー微調整手法
    • 地理空間データは,地球観測,気候,気象など多岐にわたり,その活用が重要である。
    • 事前学習済みモデルを実用的なデータセットに適応する際,スペクトルミスマッチや微調整コストが課題となる。
    • スペクトルミスマッチの解消と微調整コストの削減を両立し,モデルの性能向上を目指す。
    • SPECTRAは,Band-Routed Embedding(BRE)により,ダウンストリームセンサーの全てのバンドを活用し,性能向上を実現した。
    • Stage-wise Transferability-aware LoRA(ST-LoRA)は,転移可能性の高い段階に学習パラメータを集中させ,微調整コストを削減した。
    • 実験結果から,SPECTRAは既存手法と比較して,より少ないパラメータで高い性能を発揮することが示された。

    Link: https://arxiv.org/abs/2608.01751

  • ビジョン言語モデルによる都市の荒廃状況の把握:デトロイトの事例研究 [cs.CL, cs.CV, cs.AI]目的:都市の荒廃状況の評価手法
    • 都市計画,再開発,公衆衛生の維持において,都市の荒廃状況を把握することは不可欠である。
    • 従来の荒廃状況調査は,人的コストと時間がかかるため,大規模な継続的な実施が困難である。
    • オープンソースのビジョン言語モデルを活用し,低コストで継続的な荒廃状況の追跡・管理を可能にすること。
    • 複数のストリートビュー画像を用いることで,評価精度が向上することが示された。
    • 大規模なビジョン言語モデルは,推論においてそれぞれ異なる強みを持つことが明らかになった。
    • アンサンブル学習器は,個々のベースモデルを上回り,あらゆる住宅状況や荒廃状況の評価において頑健性が向上した。

    Link: https://arxiv.org/abs/2608.01753

  • 物理整合性のある計算回折イメージングによる光電気SNR限界の打破 [cs.GR]目的:回折限界に迫るレンズレスイメージング技術であるプティコグラフィの性能向上
    • 高分解能イメージングの必要性が高まる中,従来の光学顕微鏡の限界を打破する手法が求められている。
    • プティコグラフィは検出器の非理想性,特に低光量下でのノイズの影響を受けやすく,性能が制限されている。
    • 検出器の信頼性を物理的な制約として組み込み,プティコグラフィの性能を向上させることを目指す。
    • 検出器のピクセルごとの応答を較正し,空間分解能のある信頼度マップを構築することで,データの質を向上させた。
    • 提案手法は,従来の高度なノイズ除去手法と比較して,検出器由来のバックグラウンドの抑制と構造的回折情報の保持のバランスを改善した。
    • 実験結果から,SNRが約2倍向上し,再構成画像はレイリー限界に接近し,k係数は約0.65に達したことが示された。

    Link: https://arxiv.org/abs/2608.01757

  • ピクセルは無視し,超ピクセルが見る:意味中心SSMによる悪天候画像復元 [cs.CV]目的:悪天候下で劣化された画像から鮮明な視界を回復すること
    • 悪天候は視界を遮り,画像認識や安全な自動運転を困難にするため,復元技術は重要である。
    • 既存手法はピクセル間の関係に焦点を当てており,悪天候による空間的な不均一性を考慮できていない。
    • 意味領域に着目し,より効果的な画像復元手法を開発すること。
    • 提案手法SSRは,超ピクセルを用いて意味的に関連する領域内で関係性をモデリングする。
    • 超ピクセルガイド選択的スキャン機構(S³M)により,知覚的に一貫性のある領域間で関係性を効率的にモデル化する。
    • 領域レベルゲーティング機構(RGM)により,各意味超ピクセル単位での劣化外れ値を補正し,復元性能を向上させる。

    Link: https://arxiv.org/abs/2608.01760

  • DecoupleGS:エンドツーエンド自律運転テストのためのインタラクティブ3Dガウススプラッティング [cs.CV]目的:エンドツーエンド自律運転アルゴリズムの厳密な閉ループ検証
    • 自律運転システムの安全性向上には,現実的な環境での評価が不可欠である。
    • 既存のシミュレーション環境は,高精度,インタラクティブ性,リアルタイム性を両立できていない。
    • 大規模なエンドツーエンド評価に適した,高精度かつ効率的なシミュレーション環境の構築。
    • DecoupleGSは,高品質な静的背景と操作可能な動的エージェントを分離することで,視覚的な忠実度とリアルタイム性能を両立した。
    • アセット圧縮,幾何学的登録,プロキシベースのライティングにより,忠実度と効率性のトレードオフを最適化した。
    • 提案手法は,エンドツーエンド自律運転評価のための実用的な閉ループセンサーシミュレーションプラットフォームを提供する。

    Link: https://arxiv.org/abs/2608.01761

  • LiveLight:インタラクティブな制御によるリアルタイムストリーミングビデオの再照明 [cs.CV]目的:リアルタイムストリーミングビデオの再照明とインタラクティブな3D照明制御
    • 映像制作やVR/AR分野において,現実感の高い映像表現は不可欠である。
    • 従来の再照明技術は計算コストが高く,リアルタイム処理が困難であった。
    • 拡散モデルを用いたリアルタイム再照明フレームワークを構築し,インタラクティブな制御を実現する。
    • LiveLightは,拡散モデルを用いてリアルタイムストリーミングビデオの再照明と3D照明制御を可能にする初のフレームワークである。
    • 軽量アダプター,ジオメトリ誘導フィードバックブランチ,プログレッシブローリングウィンドウ戦略により,高品質かつ高速な処理を実現している。
    • 実世界および合成データセットでの実験により,既存のオフラインベースラインと比較して,時間的安定性,照明制御性,ユーザーの好みに優れることが示された。

    Link: https://arxiv.org/abs/2608.01771

  • 物語画像生成における社会バイアスの調査 [cs.CV, cs.AI]目的:テキスト画像生成モデルにおける社会バイアスの発現様式
    • 画像生成技術はコンテンツ作成や教育に利用され,社会への影響力が大きいため,公平性の検証が重要である。
    • 既存の研究では写真生成に偏った評価が多く,物語性のある画像におけるバイアスの現れ方は不明であった。
    • 写真,ストーリーボード,コミックの生成においてバイアスの度合いを比較し,バイアスの可視化メカニズムを解明する。
    • プロプライエタリモデルでは,写真生成で平均25.9%のバイアスが認められ,ストーリーボードとコミック生成でそれぞれ9.6ppと18.2pp増加した。
    • 写真は微妙な視覚的要素でバイアスを表現する一方,ストーリーボードとコミックはイベントの順序やキャラクター配置などを通してより明示的にバイアスを表現する。
    • 写真生成では見えにくいバイアスが,物語性のある画像形式では表面化する可能性があり,多様な形式での評価の重要性を示唆する。

    Link: https://arxiv.org/abs/2608.01780

  • GPT-4o-miniと教師の平均点による音楽分析の自動採点比較検証:一回パス展開,再現性,戦略固有のバイアス [cs.SD, cs.HC, stat.AP]目的:音楽分析の記述式解答に対する自動採点の妥当性および再現性評価
    • 音楽分析は専門知識を要し,質の高い教育に不可欠である。採点業務の効率化が求められている。
    • 記述式解答の採点は時間と労力を要し,採点者によるばらつきが生じやすいという課題がある。
    • GPT-4o-miniを用いた採点戦略の有効性を検証し,より公平かつ効率的な採点方法を確立すること。
    • GPT-4o-miniは音楽分析の記述式解答に対して安定したスコアを生成可能であることが示された。
    • Few-shot prompting with chain-of-thought reasoning (Fs+CoT)は教師の平均点との一致度が高く,最適な戦略と言える。
    • Retrieval-augmented generation (RAG)は過大評価の傾向があり,self-consistency (SC)は再現性は高いが一致度は低い。

    Link: https://arxiv.org/abs/2608.01783

  • ユニバーサルマルチモーダル埋め込みにおける視覚的アイデンティティの解明 [cs.CV, cs.AI, cs.CL]目的:視覚的アイデンティティ識別能力の向上
    • マルチモーダルな情報処理は,画像やテキストなど多様なデータを統合し,より高度なAIシステムの実現に不可欠である。
    • 既存のユニバーサルマルチモーダル埋め込み手法では,インスタンス検索や再識別のようなタスクで重要な視覚的アイデンティティ識別が十分でない。
    • 視覚的アイデンティティ識別を強化し,より包括的なユニバーサルマルチモーダル埋め込みの構築を目指す。
    • 本研究では,視覚的アイデンティティ識別に関する大規模ベンチマークであるMVEBを提案し,評価と学習を支援する。
    • アイデンティティを考慮したサンプリングメカニズムを用いた学習フレームワークを提示し,汎用的なマルチモーダル性能を維持しつつ,視覚的アイデンティティ識別能力を向上させた。
    • 実験結果から,提案手法がユニバーサルマルチモーダル埋め込みに強力な視覚的アイデンティティ識別能力を付与できることが示された。

    Link: https://arxiv.org/abs/2608.01794

  • オーディオ深偽検出のための多重バックボーン自己教師あり学習アンサンブルと生成・検出の非対称性に関するクロス・トラック分析 [cs.SD, cs.CR]目的:オーディオ深偽検出と生成タスクにおける性能向上
    • 近年,AI技術の発展により,音声データの偽造が容易になり,社会的な問題となっている。
    • 既存の深偽検出システムは,巧妙に生成された深偽音声に対して十分な堅牢性を有していない。
    • 多重バックボーンによる自己教師あり学習アンサンブルが,深偽検出の精度向上に貢献する。
    • ImageCLEF 2026のオーディオ深偽検出タスクにおいて,提案手法は0.9522という高いスコアを達成した。
    • 生成タスクにおいても,F5-TTS v1をベースとしたシステムが,語彙誤り率4.99%,文字誤り率2.07%で1位となった。
    • 生成側と検出側で非対称性が認められ,生成側の回避能力と検出側の識別能力の差が示唆された。

    Link: https://arxiv.org/abs/2608.01796