arXiv雑要約
画像・音声 - 2026/07/30 公開
SciFigAlign:論文証拠との視覚的アライメントのファインチューニングによる科学図表のスコアリング [cs.CV, cs.AI]目的:科学論文の図表の品質評価手法の開発
- 科学論文における図表は,研究成果の重要な伝達手段であり,その品質は論文の信頼性に影響する。
- 既存の画像評価手法は,図表が論文の主張を裏付けているかを判断できないという課題がある。
- 論文の内容と図表の内容を統合的に評価し,図表の品質をより正確にスコアリングすること。
- 提案手法SciFigAlignは,図表,キャプション,引用段落,論文コンテキストを入力とし,CLIPとSciBERTをファインチューニングすることで,高精度なスコアリングを実現した。
- 論文レベルの分割において,平均絶対誤差(MAE)は0.3524,ペアワイズ正解率は81.64%を達成し,既存のLLMベース手法と比較して相対誤差を59%削減した。
- 論文証拠に基づいた入力,引用コンテキストのノイズ除去,ランキング学習が,科学図表評価において重要であることが確認された。
マルチモーダル空間推論における視覚的貢献度評価 [cs.CV, cs.AI]目的:空間推論ベンチマークにおける視覚情報の貢献度評価手法
- マルチモーダルAIの発展には,視覚情報と言語情報の効果的な統合が不可欠である。
- 既存の空間推論ベンチマークは,視覚情報がなくても正解に辿り着ける場合があり,真の視覚的貢献度を測れない。
- 視覚情報が意思決定にどの程度貢献しているかを定量的に評価し,モデルの視覚的推論能力を正確に把握すること。
- 提案手法Visual Credit Audit (VCA)により,画像がモデルの判断をテキストのみの場合や空白画像よりもどれだけ支持しているかを分離して評価できる。
- 実験の結果,既存のモデルの12.73-26.25%の正解は視覚情報による貢献が確認できず,画像置換実験で正答率が大きく低下した。
- VCAは,ベンチマークの成功を,正答性,追加の画像サポート,および関係の一貫性のある応答に分解することで,より詳細な分析を可能にする。
SciFigQual-Bench:科学論文における図の品質評価のためのベンチマーク(全文コンテキスト付き) [cs.CV, cs.AI]目的:科学論文における図の品質評価
- 科学論文において,図は実験結果やシステム構造を伝える上で不可欠な要素である。
- 既存の画像品質評価手法は自然写真やAI生成画像向けであり,科学論文への適用が困難である。
- 図とキャプション,引用文,論文コンテキストを考慮した包括的な評価手法を開発し,誤解を招く図を特定すること。
- SciFigQual-Benchは,科学論文の図を明瞭度,レイアウト,キャプションとの適合性,コンテキストとの関連性,誤解のリスクの5つの側面から評価する。
- SFQ-Agent(F3)をGPT-5.6-Solと組み合わせて使用することで,平均絶対誤差0.418,一貫性率93.4%という最高の結果が得られた。
- 従来のベンチマークと比較して,図と関連情報の紐付けにより,より詳細な評価が可能になった。
DINOv3特徴の段階的注意洗練による効率的な前眼部セグメンテーション [cs.RO, cs.SY, eess.SY, cs.CV]目的:前眼部セグメンテーションのロバスト性と汎化性能の向上
- 眼計測や臨床画像解析において,前眼部セグメンテーションは不可欠な要素である。
- 医療現場では,多様な画像取得条件やアノテーション不足により,既存手法の汎化性能が課題となっている。
- 事前学習済みモデルを効率的に活用し,限られたパラメータで高精度なセグメンテーションを実現することを目指す。
- 提案手法は,8つの眼科画像取得プロトコルと7つの解剖学的クラスのアノテーションを含む333枚の臨床データセットで,mIoU 85.55\%を達成した。
- 従来の畳み込みニューラルネットワークやTransformerベースの手法,DINOv3ベースの手法と比較して,全体的な性能が最も優れていた。
- 未知の4つの公開データセットにおいても,ドメインシフトに対するロバスト性が最も高かった。
ペアワイズ安定なエージェント配置設計 [cs.CY, cs.CY, cs.DS, cs.GT]目的:ペアワイズ安定なエージェント配置の設計
- 多エージェントシステムにおける配置問題は,様々な分野で重要である。
- 安定性や公平性を保証した配置を見つけることは困難であり,計算コストも高い。
- 配置先グラフの構造を設計可能とすることで,安定性と効率性の両立を目指す。
- 本研究では,ペアワイズ安定性を基準とした,効率的なグラフ設計フレームワークを提案した。
- 古典的な安定マッチング理論の結果を拡張し,より一般的な設定で適用可能なことを示した。
- 計算可能性と最適性のトレードオフや,グラフ同型性問題との関連性などが明らかになった。
MMAC:音声キャプションのための大規模多次元ベンチマーク [cs.SD, cs.AI]目的:音声キャプションの評価基準
- 音声大規模言語モデルの発展に伴い,音声の内容を詳細に記述する能力が重要になっている。
- 既存の評価方法では,情報網羅性や記述の信頼性を的確に診断することが困難である。
- MMACは,音声キャプションの多面的な評価を可能にし,モデルの改善に貢献する。
- MMACは,20以上のデータソースから収集された5,638の音声クリップを含む大規模なベンチマークである。
- 6つの能力カテゴリと15の評価次元を網羅し,生成されたキャプションの情報を詳細に分析する。
- 評価の結果,既存の音声大規模言語モデルに明らかな差異が確認された。
周波数強制:スペクトル自己固定化による長尺動画の自己回帰生成 [cs.CV]目的:長尺動画生成における誤差蓄積の軽減
- 動画生成技術は,エンターテインメントやコミュニケーションにおいて重要な役割を担う。
- 自己回帰型動画拡散モデルでは,長尺生成時に誤差が蓄積し,画質劣化や不安定化が生じる。
- 周波数領域での解析に基づき,スペクトル自己固定化により長尺動画の安定性を向上させる。
- 提案手法FreqForcingは,学習不要で誤差蓄積を抑制し,5秒間の事前学習モデルを2分間の生成に拡張する。
- 実験により,既存の学習不要手法を凌駕し,学習ベースの手法と遜色ない性能を示すことが確認された。
- 低周波成分の固定化と高周波成分の活用により,視覚的な安定性と動きの自然さを両立している。
Veritas++:知覚を重視したオンポリシー蒸留による価値認識型AIGI検出 [cs.CV]目的:AI生成画像(AIGI)検出のための知覚能力強化
- 画像生成モデルの進化によりAIGIが普及し,堅牢な検出技術が不可欠となっている。
- 既存の多Modal大規模言語モデルは,詳細な異常の認識に課題が残っている。
- Veritas++は,知覚能力を基礎としたAIGI検出の信頼性向上を目指す。
- Veritas++は,細部の視覚的特徴,意味的異常,ピクセルレベルの違いという3つの知覚能力に焦点を当てた学習を行う。
- 提案手法Perception-oriented Learning(PoRL)は,検証可能な報酬を用いてこれらの能力を強化する。
- Value-aware On-Policy Distillation(VaOPD)により,効率的な性能向上と既存性能の維持を実現した。
マルチタスク学習による小規模なVLMを用いた根拠に基づいたGI内視鏡VQAへの取り組み [cs.CV]目的:GI内視鏡画像に対するVQAにおける根拠に基づいた応答の実現
- 消化器内視鏡検査は,病変の早期発見に不可欠であり,その精度向上は患者の予後改善に繋がる。
- 既存のVLMは高い正答率を示すものの,その根拠となる視覚的証拠の説明が不十分である。
- 少ないアノテーションでVLMの内部表現を改善し,根拠に基づいたVQAを可能にすること。
- 既存のVQAデータセットを活用し,補助的なグラウンディングと記述タスクを構築することで,モデルの性能を向上させた。
- 小規模VLMをマルチタスク学習でファインチューニングすることで,正答率の向上と,回答トークンと関連画像領域の整合性改善を確認した。
- in-distributionおよびout-of-distributionデータ両方において,一貫した性能向上が認められた。
計算可能だが学習不可能な情報価値自由均衡とアルゴリズム共謀の規制 [cs.GT]目的:情報価値自由均衡の計算可能性と学習可能性の乖離
- ゲーム理論は,経済学,政治学,コンピュータサイエンスなど,様々な分野で戦略的な意思決定を分析する上で不可欠である。
- 均衡概念の計算可能性と学習可能性の間の関係は未解明であり,アルゴリズムによる均衡の実現可能性に影響を与える。
- アルゴリズム共謀の規制において,学習による情報交換の不可避性を明らかにすること。
- 情報価値自由均衡は効率的に計算可能であるものの,広範な学習アルゴリズムでは学習不可能であることが示された。
- これは,従来の均衡概念とは対照的であり,オフライン計算とオンライン学習の難易度に差が生じることを意味する。
- 合理的な学習下では,価値ある情報の交換が不可避であり,従来の独占禁止規制との整合性が課題となる。
LLM支援言語使用における言語的単一化 [cs.AI, cs.CL, cs.GT]目的:LLM支援による言語使用における言語的多様性の変化
- 言語は社会の多様性を反映し,文化伝達の基盤である。その変化は社会全体に影響を及ぼす。
- LLMの普及により,言語表現が均質化し,個性が失われる懸念がある。
- LLMの利用方法を分析し,言語的多様性を維持するための方法を探る。
- LLMの共有モデルは,著者を共通の規範へと導き,言語表現の均質化を促進する。
- 再帰的なフィードバックは,共有規範を変化させるが,著者間の多様性は維持される。
- 個別化されたモデルは,多様な著者-モデル間の均衡を保ち,言語的多様性を維持しうる。
DLAM:時間制約を持つ分布潜在行動 [cs.IR, cs.RO, cs.AI, cs.CV]目的:視覚,言語,行動モデルにおける潜在行動表現の学習
- ロボットの行動学習において,ラベル付きデータの不足が課題であり,より効率的な学習手法が求められている。
- 潜在行動モデルは有用だが,再構成に基づく学習では,ロボットの行動生成に必要な構造が欠如しがちである。
- 時間的な制約を考慮し,より安定した潜在行動表現を学習することで,ロボットの制御性能向上を目指す。
- DLAMは,各遷移を対角ガウス分布として表現することで,潜在行動の不確実性を捉え,時間的な一貫性を高める。
- 再構成と正規化された構成・反転処理により,視覚的変化と潜在空間の構造を整合させ,より正確な再構成を可能にする。
- MetaWorld MT50などのタスクにおいて,既存手法と比較して優れた方策学習性能を示す。
季節ステレオ:生成AIによるマルチデート衛星画像からのロバストな稠密ステレオマッチング [cs.CV]目的:マルチデート衛星画像からの不一致推定
- 衛星画像からの正確な3D再構成は,土地利用変化の監視や災害評価等に不可欠である。
- 季節や照明条件が異なるマルチデート画像間のステレオマッチングは,外観変化が大きいため困難である。
- 生成AIを活用し,教師データ不足を克服することで,大規模な3D再構成を可能にすること。
- SeasonStereoは,制御された季節的外観変化を持つ合成画像ペアで学習することにより,時間差のある衛星画像から不一致を推定する。
- 同手法は,LiDARで教師あり学習した最先端モデルと同等の精度を達成し,より鮮明な幾何学的詳細を生成する。
- 実データを用いたアラインメントされたマルチデート画像やLiDARデータによるラベルを必要とせず,大規模な3D再構成への実用的な道を提供する。
意思決定を必要とするアプリケーション向けマルチモーダルLLMにおける説明可能かつ効率的な空間推論 [cs.CV]目的:マルチモーダルLLMにおける空間判断の透明性向上と監査可能性の確保
- ロボティクスなど,意思決定を伴う分野でLLMの利用が進む中,その判断根拠の明確化が重要である。
- LLMは空間認識や物体幻覚の問題を抱えており,判断の信頼性に課題がある。
- 深さ情報と空間関係情報を組み合わせることで,LLMの空間推論能力を改善し,判断の根拠を明確にすること。
- ByDeWay-V2は,深さ情報に加え,物体間の幾何学的関係を構造化された形でLLMに提供することで,空間推論能力を向上させた。
- Qwen2.5-VLにおいて,既存手法LDPと比較して,BLINK空間サブセットでF1スコアが46%相対的に改善された。
- リソース制約のある環境下でも動作可能な軽量な構成を実現し,リアルタイムな意思決定支援への応用を示唆した。
CTファウンデーションモデルの解剖学的文脈適応 [cs.CV, cs.AI]目的:CT画像における解剖学的文脈を考慮したファウンデーションモデルの適応手法
- 医療画像解析の進歩は,疾患の早期発見や診断精度向上に不可欠である。
- 既存のCTファウンデーションモデルは,詳細な解剖学的情報を十分に活用できていない。
- 解剖学的文脈を考慮しつつ,効率的にファウンデーションモデルを適応させること。
- ACAは,既存のCTファウンデーションモデルをわずか1時間以内の学習で,解剖学的な知識に特化した画像-言語対応モデルへと適応させる。
- ACAは,解剖学的レベルの埋め込み表現を用いて,解剖学構造間の関係性を捉え,放射線レポートからのテキスト情報と整合させる。
- MerlinとCT-RATEデータセットにおける評価で,ACAはゼロショット分類タスクにおいて,既存手法を上回る性能を示した。
HumanCLAW:ビジョン言語モデルは身体を通して行動できるか [cs.CV, cs.RO]目的:ビジョン言語モデルの行動能力の評価
- ロボティクスにおけるAIの応用が進む中で,物理世界での行動計画能力の評価が重要である。
- 既存の評価方法では,モデルの判断と運動制御のどちらが失敗の原因かを特定しにくい。
- モデルの行動判断能力を,低レベルな実行機構から切り離して評価することを目指す。
- HumanCLAWフレームワークを構築し,モデルの行動判断と実際の運動を分離して評価した。
- 構築したHumanCLAW-Benchを用いて9つの最先端VLMをテストした結果,どのモデルもベンチマークを解決できなかった。
- 現在のVLMは,自己位置や目標達成状況などの身体に関する認識能力が不足していることが示唆された。
VidMap:ビデオに基づく構造復元のための時間構造の活用 [cs.CV, cs.RO]目的:ビデオベースの構造復元における時間構造の活用
- ナビゲーションやシーン理解のための大規模学習データ獲得に不可欠な技術である。
- SLAMは初期化や過渡的な失敗に弱く,SfMは対称性や激しい動きに弱いという課題がある。
- SLAMとSfMの長所を組み合わせ,任意の長尺の未較正ビデオの正確な復元を目指す。
- 提案手法は,既存のSLAMやSfMの手法と比較して,ロバスト性と精度が大幅に向上している。
- 特に,激しい動きや視覚的な対称性を含む多様なデータセットにおいて,その有効性が確認された。
- 時間的順序を重要な要素として活用し,信頼性の高いループクロージャを実現している。
TurboVLA:RTX 4090上で1GB未満のVRAMで32Hzを実現するリアルタイム視覚言語行動モデル [cs.CV, cs.RO]目的:視覚,言語,行動の直接的なマッピング
- ロボット工学における視覚,言語,行動の統合は,より柔軟で人間らしいインタラクションを可能にする上で重要である。
- 従来のVLAモデルは大規模言語モデルに依存するため,計算コストとメモリ消費量が大きいという課題がある。
- 本研究では,計算効率の高いVLAモデルを構築し,ロボットのリアルタイム制御を可能にすることを目的とする。
- TurboVLAは,従来のLLM中心のアプローチと比較して,パラメータ数,推論遅延,VRAM使用量を大幅に削減することに成功した。
- LIBEROデータセットにおいて,平均成功率97.7%を達成し,既存のより大規模なVLAポリシーと同等またはそれ以上の性能を示した。
- TurboVLAは,効率的なロボット操作のための新たな視覚,言語,行動の接続方法を提供する,シンプルかつ効果的な代替手段である。
放射線画像におけるVision-Languageモデルベンチマークの法医学的再現性監査:意図されたプロトコルから公開された成果物まで [cs.CV, cs.AI, cs.CL]目的:放射線画像におけるVision-Languageモデルベンチマークの再現性に関する法医学的監査
- 医療AIの発展には,客観的で信頼性の高い評価が不可欠である。
- 既存のベンチマークでは,データ,コード,レポート間の整合性が十分に検証されていない。
- ベンチマークの再現性を検証し,信頼性のある評価を確立すること。
- 監査の結果,計画された300回のモデル・プロンプト呼び出しのうち297回がレポートを生成した。
- データセットの分割保持,画像極性反転,レポートの切り捨てなどの問題が確認された。
- これらの不整合により,統計的分析結果に変化が生じ,オリジナルの性能評価は撤回された。
腫瘍輪郭に基づくグリオマグレード分類のための形状に基づく帰納的バイアス [eess.IV, cs.CV, cs.LG]目的:グリオマグレード分類における形状情報の活用
- 脳腫瘍の正確なグレード分類は,治療方針の決定に不可欠である。
- 従来の画像解析では,形状情報を十分に活用できていない場合がある。
- 形状に基づく帰納的バイアスを導入することで,分類精度と効率の向上を目指す。
- 腫瘍輪郭の形状情報を活用したシンプルなMLPが,ResNet-18やViT-Tinyよりも高い分類精度を達成した。
- MLPは,パラメータ数を大幅に削減しながら,同等の,またはそれ以上の性能を示した。
- シミュレーション実験では,形状に基づくモデルがピクセルベースのモデルよりも優れた汎化性能を示した。
スケーラブルなプロンプトベースビデオストリーミング:ScalablePromptus [eess.IV, cs.CV, cs.MM]目的:プロンプトベースビデオストリーミングのロバスト性向上
- 低ビットレートでのビデオ伝送が求められる状況が増加しており,新しい伝送技術が不可欠である。
- 既存のプロンプトベースストリーミングは,ネットワークの不安定性に弱く,品質が大きく低下する問題がある。
- ネットワーク環境に左右されず,安定した品質でビデオストリーミングを実現することを目指す。
- 提案手法ScalablePromptusは,意味的・色彩を考慮したプロンプト反転,球面線形補間,ドロップアウト学習を導入した。
- これにより,部分的または欠損したプロンプトからも,意味のあるビデオを再構成することが可能になった。
- 損失のある環境下では,ベースラインと比較して性能劣化を82~95%削減し,実用的なロバスト性を実現した。
胸部X線画像機械学習における臨床的妥当性の再考:評価基準が性能を規定する方法 [stat.ME, cs.CL, stat.AP, stat.ML, eess.IV, cs.CV, cs.LG]目的:胸部X線画像機械学習における評価基準の選択が,モデルの性能とランキングに与える影響の系統的な調査
- 胸部X線画像は,呼吸器疾患の診断において不可欠であり,機械学習による診断支援への期待が高い。
- 既存の評価基準は,臨床判断を正確に反映していない可能性があり,誤ったモデル選択につながる恐れがある。
- 臨床的に妥当な評価基準の選択方法を明確にし,機械学習モデルの信頼性を向上させることを目指す。
- 画像分類器の性能評価において,ラベルの出典によって結果が大きく異なり,モデルのランキングが変動することが示された。
- 画像品質評価指標と専門家の判断との一致は,指標の種類に大きく依存し,一般的な指標は必ずしも一致しないことが判明した。
- 評価基準の選択は,どのモデルが最適であるかを決定する重要な要素であり,臨床的妥当性を考慮した選択が不可欠である。
スタイル拡散TTSモデルの潜在空間適応によるゼロショット顔から音声合成 [eess.AS, cs.AI, cs.SD]目的:顔画像からの音声予測
- 歴史的人物やゲームキャラクターのように音声データがない場合でも,人物の口調を再現する技術が求められている。
- 従来の音声合成は参照音声が必要であり,視覚情報のみでは音声のクローン化が困難であった。
- 顔画像から音声スタイルを抽出し,自然な音声を生成することを可能とする。
- 静止画の顔画像から,自然な音声合成が可能であることが示された (UTMOS 3.7-4.0)。
- 顔画像と生成された音声の検索において,偶然よりも高い一致率が確認された。
- 英語で学習した顔-スタイルマッピングは,スペイン語の音声合成にも応用可能であることが示され,言語非依存性を示唆している。
最良選択ゲームにおける再選択 [math.CO, cs.GT]目的:対称群上の確率分布の組み合わせ論的公式
- 組み合わせ論や確率論において,順列の確率分布は重要な研究対象である。
- 既存の確率分布の表現は,計算が複雑で直感に乏しい場合がある。
- 新たな組み合わせ論的公式により,確率分布の理解を深めることを目指す。
- Steck分布と呼ばれる確率分布に対し,底上最大値を用いた新しい組み合わせ論的公式を導出した。
- この公式は,Pitman-Stanleyの結果を特殊な場合として包含する。
- 最良選択ゲームモデルを定義し,最適な戦略が古典的なモデル(1/e)と類似の勝率をもたらすことを示した。
ニューラルネットワーク支援リフティングステップによるJPEG 2000の高度な可変レートロスレス画像圧縮 [cs.CV, eess.IV]目的:JPEG 2000における高効率な画像圧縮手法
- 画像圧縮は,データ保存容量や通信帯域の効率化に不可欠であり,様々な応用分野で重要視されている。
- 従来の画像圧縮手法では,圧縮率と画質のバランスが課題であり,特に高圧縮率化に伴い画質の劣化が問題となる。
- 本研究は,ニューラルネットワークを活用し,JPEG 2000のリフティングステップを改善することで,高圧縮率化と高画質化を両立させる。
- 提案手法は,JPEG 2000の既存システムに容易に組み込むことが可能であり,既存の可変レート・解像度特性を維持する。
- 幅広いビットレートにおいて,平均で17.4%のBDビットレート削減を達成し,優れた圧縮効率を示す。
- 高周波成分のエイリアシングを抑制し,再構成画像の視覚的品質を向上させる。
近似EFX割り当ての限界への挑戦 [cs.GT, cs.AI, cs.DM]目的:加法的な評価関数を持つエージェント集合への分割不可能な商品の割り当て
- 公正な資源配分は社会経済活動において不可欠であり,特に分割不可能な商品の場合,その実現は困難である。
- 完全な羨望フリー性(EFX)の実現は計算量的に難しく,近似的なEFX割り当ての限界が課題となっている。
- 近似EFXの存在範囲を広げ,既存の近似率の壁を超えることを目指している。
- エージェント数が7以下,評価値が3以下,またはマルチグラフで表現可能な場合,2/3-EFX割り当ての存在が示された。
- 2/3-EFXという緩和された条件により,完全なEFX割り当てが可能な設定よりも広範な設定で存在結果が得られた。
- 既存の0.618の壁を超え,より高い近似保証(2/3)を達成し,近似EFX割り当てに関する知見を深めた。
粒子フィルタリングに基づく潜在拡散による逆問題解決 [cs.CV]目的:画像に基づく逆問題の解決
- 画像処理において,ノイズ除去や解像度向上など逆問題の解決は重要な課題である。
- 従来の逆問題解決手法では,解空間の探索が不十分であり,多様な解が得られない場合がある。
- 本研究では,解空間の非線形探索を可能にする新たなフレームワークを提案し,逆問題解決の精度向上を目指す。
- 提案手法PFLDは,FFHQ-1KとImageNet-1Kデータセットを用いた実験で,既存の最先端手法PSLDを上回る性能を示した。
- 特に,超解像,ガウシアンぼかし除去,および画像補完といった逆問題タスクにおいて,その効果が確認された。
- 粒子フィルタリングによる解空間の探索が,より高品質な解の生成に貢献していると考えられる。
顔表情行動単位認識におけるシームスネットワークを用いた1フレーム較正 [cs.CV, cs.AI, cs.LG]目的:顔表情行動単位 (AU) 認識における較正戦略
- 表情分析において,AU認識は重要な役割を担う。個人差が大きいことから,汎化性能が課題となっている。
- 未知の顔に対するAU認識では,個人差によるバイアスが大きく,精度が低下する問題がある。
- 中立表情の1フレーム画像を用いた較正により,バイアスを軽減し,認識精度を向上させることを目指す。
- 提案手法である較正シームスネットワーク (CSN) は,DISFA,DISFA+,UNBC-McMasterデータセットにおいて,IR50の性能を大幅に改善した。
- CSNは,単純な引き算による較正方法や,その微調整版と比較しても優れており,最先端の非較正モデルを上回る性能を示した。
- 顔の属性(しわ,眉の位置,ヒゲなど)によるバイアスを効果的に軽減することで,AU強度推定とAU検出の両方において高い精度を実現した。
現実世界のためのニューラル・ラディアンス・フィールド:サーベイ [cs.CV, cs.GR]目的:ニューラル・ラディアンス・フィールドに関する最新の研究動向と課題
- 3次元空間の表現は,コンピュータビジョンやロボティクスなど多様な分野で不可欠である。
- 従来の3次元表現方法では,複雑なシーンの再現に限界があった。
- ニューラル・ラディアンス・フィールドの応用範囲と解決すべき課題を明確にすること。
- ニューラル・ラディアンス・フィールドは,2次元画像から複雑な3次元シーンを効果的に再構築できる。
- 本サーベイでは,理論的な進歩と代替的なシーン表現をまとめ,新たな課題を調査している。
- 再構成への応用例や,コンピュータビジョン,ロボティクスへの影響,必要なデータセットとツールキットについてもレビューしている。
マルチモーダル大規模言語モデル時代の動的シーングラフ生成に関する詳細な検討 [cs.CV]目的:動的シーングラフ生成の質の向上
- 動画理解において,物体とそれらの関係性の把握は重要な課題である。
- 既存の動的シーングラフ生成は,評価方法や生成されるグラフの質に課題が残る。
- マルチモーダル大規模言語モデルを活用し,より実用的で質の高い動的シーングラフ生成を目指す。
- 本研究では,従来の評価プロトコルが持つ精度と再現率のトレードオフ,そして関係性の生成における情報量の少なさを指摘した。
- 新たに5つの評価指標を導入することで,動的シーングラフの質をより総合的に評価できるようになった。
- 大規模言語モデルを直接利用したモデル設計により,最先端の性能を達成した。
OmniAD:マルチモーダル推論による産業異常の検知と理解 [cs.CV]目的:産業異常の検知と理解のためのフレームワーク
- 産業設備の安定稼働には,異常の早期発見と迅速な原因特定が不可欠である。
- 従来の異常検知は検知に留まり,詳細な分析や知識の活用が十分でない場合が多い。
- 視覚情報とテキスト情報を統合し,異常の検知と詳細な原因分析を同時に行うことを目指す。
- OmniADは,MMADベンチマークにおいて79.1という高い性能を達成し,Qwen2.5-VL-7BやGPT-4oといった既存モデルを上回った。
- テキスト生成による異常検知と,視覚情報に基づくテキスト推論を組み合わせることで,きめ細かい分析を実現した。
- SFTとGRPOを組み合わせた学習戦略により,少ないデータでの汎化性能を向上させた。
未知の共変量シフト下における信頼度誘導データ拡張による知識蒸留の改善 [cs.CV]目的:未知の共変量シフト下での知識蒸留性能向上
- 大規模モデルの汎用性が高く,小規模モデルへの知識転移が重要視されている。
- 訓練データとテストデータの分布のずれが,知識蒸留の性能低下を招く。
- 教師モデルと生徒モデルの不一致を最大化するデータ拡張で,分布ずれを軽減する。
- 提案手法は,CelebA-HQ,SpuCo Birds,BAR,Spurious ImageNetにおいて,最先端のデータ拡張手法と比較して高い精度を達成した。
- 特に,最悪グループと平均グループの精度,およびSpurious ImageNetの虚偽スコアにおいて改善が見られた。
- 教師と生徒の不一致を最大化する拡散ベースのデータ拡張が,共変量シフトに対する有効性を示した。
注意誘導型コントラストデコーディング:MLLMにおける幻覚の軽減 [cs.RO, cs.CV, cs.CL]目的:MLLMにおける幻覚軽減のための手法
- マルチモーダルLLMの性能向上は,人間とAIのより自然なインタラクションを可能にする。
- 既存のMLLMは,誤った視覚的情報に過度に依存し,事実に基づかない内容を生成しやすい。
- 視覚情報への注意を制御することで,幻覚を抑制し,より信頼性の高い生成を目指す。
- 注意誘導型コントラストデコーディング(ASCD)は,テキスト中心のヘッドを増幅し,重要な視覚トークンを抑制することで,幻覚を最大38.2%削減する。
- ASCDは,5つのMLLMバックボーンと3つのデコーディングスキームで,VQAベンチマークの精度も向上させる。
- 注意誘導は,シンプルかつモデルに依存しないアプローチで,より安全で忠実なマルチモーダル生成を可能にする。
周期性誘導と信号再構成による超短時間rPPG推定 [cs.CV]目的:超短時間ビデオクリップからの心拍数推定
- 遠隔心拍数測定は健康管理や医療分野で重要性が増している。
- 既存手法は10秒程度のビデオを前提とし,2秒以下の超短時間ビデオへの対応が課題である。
- 超短時間ビデオから正確な心拍数を推定するための新たな手法を開発する。
- 提案手法では,周期性誘導により超短時間ビデオにおける心拍数の変動を捉える。
- スペクトルリーケージを抑制するため,信号再構成によりより正確な心拍数推定を実現する。
- 4つのベンチマークデータセットで,提案手法が既存手法を上回る性能を示すことが確認された。
拡張形ゲームにおける最適相関均衡の複雑性について [cs.GT, cs.CC]目的:拡張形ゲームにおける相関均衡の閾値問題の複雑性
- ゲーム理論は,経済学,コンピューター科学など,様々な分野で意思決定を分析する上で重要である。
- 相関均衡の効率的な計算は未解決問題であり,特に大規模なゲームでは計算量が課題となる。
- 拡張形ゲームにおける相関均衡の計算困難性を明らかにし,その複雑性クラスを特定すること。
- 拡張形ゲームにおける相関均衡の閾値問題は,PSPACE困難であることが証明された。
- ナッシュ均衡の閾値問題はER完全であり,相関均衡よりも計算が難しいことが示された。
- エージェント形式相関均衡の閾値問題はNP困難であり,様々な相関均衡概念の複雑性分類が確立された。
VideoNorms:ビデオ言語モデルの文化的認識に関するベンチマーク [cs.CV, cs.AI, cs.CL, cs.CY]目的:ビデオ言語モデルにおける文化的規範認識の評価
- グローバル展開が進む中で,文化的な背景を理解したAIの重要性が高まっている。
- 既存のビデオ言語モデルは,文化的規範の理解に偏りがあり,誤った判断を下す可能性がある。
- 異なる文化圏のビデオデータを用いて,モデルの文化的認識能力を客観的に評価する。
- USと中国のテレビ番組を用いて構築されたデータセットVideoNormsを用いて,複数のビデオ言語モデルを評価した。
- モデルは,アメリカの規範よりも中国の規範の抽出において性能が劣る傾向が見られた。
- 非言語的証拠の提供は,言語的証拠よりも困難であることが示された。モデルのサイズ拡大だけでは性能向上は限定的である。
ウェアラブル心電図パッチにおけるオンデバイス推論とワイヤレスストリーミング:エネルギー効率の高いマルチモーダル深層学習 [cs.RO, cs.LG, cs.CV]目的:ウェアラブル心電図パッチにおける,心電図(ECG)と心音図(PCG)のマルチモーダル深層学習
- ウェアラブルセンサは医療現場での継続的な健康モニタリングに不可欠であり,その低消費電力化が求められている。
- ウェアラブルデバイスのリソース制約から,データ処理をデバイス上で行うか,クラウドへ送信するかという課題がある。
- 本研究は,デバイス上でのデータ処理が,エネルギー効率の面で優位性を持つことを検証する。
- 提案する深層畳み込みニューラルネットワーク(CNN)は,0.975という高い精度を達成した。
- NPUによる推論は,CPUによる推論と比較して約1/7のエネルギー消費で済んだ。
- 一般的なデータサイズにおいて,ローカル推論は生データストリーミングよりも大幅にエネルギー効率が良い。
クリーン画像バックドアにおける生成トリガー最適化によるステルス性と攻撃力のトレードオフ打破 [cs.AR, cs.RO, cs.CV, cs.CR, cs.LG]目的:クリーン画像バックドア攻撃におけるトリガー最適化
- 深層学習モデルのセキュリティ確保は重要であり,悪意のある攻撃に対する防御が不可欠である。
- 既存手法では,攻撃成功に必要なポイズニング率が高いと,正常精度が低下し,攻撃が露呈しやすい。
- トリガー自体を最適化することで,正常精度の低下を最小限に抑え,よりステルス性の高い攻撃を実現する。
- 提案手法GCBは,条件付きInfoGANを用いて,強力かつステルスなトリガーとなりうる自然な画像特徴を特定する。
- GCBは,少数のポイズニング例からバックドアを学習し,正常精度の低下を1%未満に抑えることに成功した。
- GCBは,6つのデータセット,5つのアーキテクチャ,4つのタスクで高い汎用性を示し,回帰やセグメンテーションにも適用可能である。
LISA-3D:マルチビュー整合性による言語-画像セグメンテーションの3次元化 [cs.CV]目的:言語指示に基づいた3次元再構成のためのマスク生成手法
- 3次元再構成は,ロボット工学やコンピュータビジョンにおいて重要な役割を担う技術である。
- 自由形式の指示を理解し,視点変化に安定した3次元再構成マスクの生成が課題となっていた。
- マルチビュー整合性を活用し,少ないパラメータで高品質な3次元再構成を実現する。
- 提案手法LISA-3Dは,既存のセグメンテーションモデルLISAに低ランク適応(LoRA)層を導入することで,3次元再構成性能を向上させた。
- 微分可能な再投影損失を用いることで,追加の3次元テキストアノテーションなしに,複数視点間の整合性を確保している。
- ScanReferとNr3Dデータセットにおいて,わずか11.6Mのパラメータ更新で,2次元マスクと3次元再構成の両方の精度が向上した。
文脈測定:カモフラージュのための文脈的指標 [cs.RO, cs.CV]目的:カモフラージュ物体セグメンテーションの評価指標
- カモフラージュは文脈に依存するが,既存の評価指標は文脈的情報を考慮していない。
- 予測マップは多次元データだが,正解データは二値ラベルであるという次元の欠陥がある。
- ピクセル間の依存関係を捉えきれないという範囲の欠陥を解消する。
- 文脈測定は,確率的ピクセル相関フレームワークに基づいた文脈を意識した評価パラダイムである。
- 正解データにピクセルレベルの文脈的親和性を付加し,知覚サイクルを構築することで,人間の知覚との整合性を高めている。
- 4つのメタ指標を用いた広範な実験の結果,文脈測定はカモフラージュ物体セグメンテーションのための広く採用されているすべての既存指標を総合的に上回った。
文脈における運動学的マイニング:テキスト-モーション蒸留による少量ショットアクション合成 [cs.CV]目的:少量ショットアクション合成のための手法
- 近年,骨格ベースのヒューマンアクティビティ認識において,大規模アノテーション済みモーションデータセットの取得コストが課題となっている。
- 汎用的なテキスト-モーション生成モデルは,HARに必要な運動学的精度やクラス識別能力に欠けるため,HARタスクへの適用が難しい。
- テキストエンコーディング空間における意味的対応を利用し,運動学的知識の蒸留を通して,HARに適したモーション生成を実現する。
- 提案手法KineMICは,CLIPテキスト埋め込みを用いて,HARラベルとテキスト-モーションデータ間の対応関係を確立する。
- その結果,生成されるモーションの一貫性が向上し,堅牢なデータ拡張源となり,精度が+23.1%改善された。
- KineMICはHumanML3DとNTU RGB+D 120を用いて検証されており,各アクションクラスあたりわずか10サンプルで効果を発揮する。
LiDARDraft:多様な入力からのLiDAR点群生成 [cs.CL, cs.CY, cs.CV]目的:LiDAR点群の生成
- 自動運転シミュレーションにおいて,現実的で多様なLiDAR点群は不可欠である。
- 既存手法では,LiDAR点群の複雑さと制御信号の単純さのバランスが難しく,高品質な生成と多様な制御が課題である。
- 多様な条件に対応しつつ,高品質なLiDAR点群生成を可能にする手法を開発すること。
- LiDARDraftは,3Dレイアウトを介して多様な条件信号とLiDAR点群を結びつけることで,高品質な点群生成を実現する。
- テキストや画像などの様々な入力から容易に生成可能な3Dレイアウトを活用し,セマンティックおよび深度制御信号へと変換する。
- ピクセルレベルのアライメントにより,テキストやスケッチからの環境生成を可能にする「ゼロからのシミュレーション」を実現する。
絵画の中を歩く:インターネットの事前知識に基づく一人称世界モデル [cs.CV]目的:アクションに条件付けされた世界モデル
- 現実世界の複雑な変化を予測する能力は,ロボット工学やコンピュータビジョンの発展に不可欠である。
- 既存の世界モデルは,汎化性やリアリズムと物理的な正確性の両立が難しい。
- インターネット上の大規模な動画データから得られる事前知識を活用し,より正確な未来予測を可能にすること。
- 本研究で提案するEgoWMは,既存の動画拡散モデルを再利用することで,アクションに忠実な未来予測を実現する。
- EgoWMは,Structural Consistency Score(SCS)において,既存手法を最大65%上回る物理的な正確性を示す。
- 異なる動画拡散モデルやロボットの形態,行動空間への適用可能性が確認され,ロボットの計画にも応用可能である。
人間を考慮した多ロボットハンドオーバーのための,大規模言語モデルに基づいた動的タスクプランニングと階層的時相論理 [cs.RO, cs.CV]目的:多ロボットハンドオーバーにおける動的タスクプランニング
- ロボットの協調作業は,製造業や物流など様々な分野で重要性を増している。
- 従来のタスクプランニングは,複雑な環境変化への対応が難しく,柔軟性に欠ける。
- 人間との連携を考慮した,よりロバストで効率的なタスクプランニング手法の開発。
- 大規模言語モデルと階層的時相論理を組み合わせることで,人間が指定したタスクをロボットが実行可能な計画に変換することに成功した。
- 動的な環境変化(ユーザーの動きや指示の更新)に対して,リアルタイムな知覚と再計画ループを通じて計画を動的に改善できることを示した。
- シミュレーションと実機実験の結果,提案手法は既存手法と比較して,成功率とインタラクションの流暢性が大幅に向上し,再計画のオーバーヘッドを削減できることがわかった。
大規模位置最適化ゲームにおける均衡 [cs.GT]目的:位置最適化ゲームにおける均衡の存在と収束
- ゲーム理論は,経済学,政治学,生物学など,多様な分野における戦略的相互作用を分析する上で重要である。
- 従来のゲーム理論では,大規模なプレイヤー数における均衡の存在や特性が必ずしも明らかではない。
- 本研究は,大規模なプレイヤー数における位置最適化ゲームの均衡を明らかにし,その収束性を分析することを目的とする。
- プレイヤー数 $n$ が十分に大きい場合,純粋均衡および対称混合均衡が存在することが示された。
- 均衡は極端であり,全てのプレイヤーは $\mathcal{X}$ の有限部分集合 $\mathcal{X}^*$ 上で戦略を選択する。
- 純粋均衡および対称混合均衡は,分布 $Q$ によって誘導される分布 $P$ に収束し,その収束速度が $n$ に関して評価された。
PatchDenoiser:パラメータ効率の良いマルチスケールパッチ学習と融合による低線量CT画像ノイズ除去手法 [eess.SY, cs.MA, cs.RO, cs.SY, math.OC, cs.CV, cs.AI]目的:低線量CT画像のノイズ除去
- CT検査における被ばく線量を低減することは,患者の安全確保において重要である。
- 低線量CT画像はノイズが多く,臨床解釈や画像解析の精度低下を招く。
- 高精度なノイズ除去を実現し,臨床現場での実用性を高めることを目指す。
- PatchDenoiserは,従来のCNNやGANベースの手法と比較して,PSNRおよびSSIMにおいて優れた性能を示した。
- スライス厚,再構成カーネル,HUウィンドウの変化に強く,異なるスキャナ間でもファインチューニングなしに一般化可能である。
- パラメータ数を約9分の1,推論ごとのエネルギー消費量を約27%削減し,実用性と効率性を両立した。
RA-Det:ロバスト性非対称性を用いたAI生成画像検出への道 [cs.CV]目的:AI生成画像の普遍的な検出
- 画像生成技術の進歩は,画像認識システムの信頼性を損なう恐れがある。
- 外観に基づく検出器は,生成画像の微妙な差異に弱く,安定性に課題がある。
- 画像の摂動に対する応答に着目し,ロバスト性非対称性を検出することで問題を解決する。
- 自然画像と生成画像では,微小な摂動に対する意味表現の安定性に差が見られる(ロバスト性非対称性)。
- RA-Detは,このロバスト性非対称性を利用し,汎用的な検出器として高い性能を発揮する。
- 14種類の生成モデルに対して,既存の検出器より平均7.81%高い性能を達成した。
空間的に疎な線形注意を用いた低遅延イベントベース物体検出 [cs.CV]目的:低遅延イベントベース物体検出のための手法
- イベントカメラは高速応答が可能であり,リアルタイムな物体検出への応用が期待されている。
- 既存のイベントベースニューラルネットワークは学習効率や計算量,遅延の点で課題がある。
- 空間的な疎性を活かした効率的な線形注意機構を導入し,低遅延かつ高精度な物体検出を実現する。
- 提案手法SSLA-Detは,Gen1およびN-Caltech101データセットにおいて,既存のアシンクロナス手法を上回る性能を達成した。
- SSLA-Detはそれぞれ0.375 mAP,0.515 mAPの最先端精度を達成し,同時に対象となるベースラインと比較して,イベントあたりの計算量を20倍以上削減した。
- 線形注意が低遅延イベントベースビジョンにおいて高い可能性を持つことを示した。
網膜VLMにおけるドメイン特化知識のアンカリングのための深層専門家注入 [cs.CV, cs.AI]目的:網膜VLMにおけるドメイン特化知識の埋め込みによる性能向上
- 眼科診断は専門知識を要するため,AIによる自動化は医療現場での負担軽減に貢献する。
- 汎用的な画像認識モデルは,微細な病理学的特徴の識別が難しく,誤診のリスクがある。
- 専門家の知識をVLMに効率的に組み込み,より信頼性の高い眼科AIを開発することを目指す。
- 提案手法EyExInは,専門家知識をVLMに注入することで,視覚的特徴と言語モデルの間の連携を強化する。
- EyExInは,解剖学的コンテキストと病理学的意味合いを分離し,病変信号を強調することで,精度向上を実現した。
- 4つのベンチマークにおいて,大規模なプロプライエタリシステムを凌駕する性能を示し,眼科AIの発展に貢献する。
臨床グラフ媒介蒸留による非ペアMRIからCFI高血圧予測 [cs.CV]目的:非ペアのMRIと網膜画像を用いた高血圧予測における知識伝達
- 高血圧の早期発見は,脳卒中や心疾患などの重大な健康問題の予防に不可欠である。
- 網膜画像は低コストだが,高血圧関連の兆候が微細で予測精度が低い。
- MRIの知見を網膜画像モデルに転移し,高血圧予測の精度向上を目指す。
- 臨床グラフ媒介蒸留(CGMD)は,MRI由来の高血圧に関する知識を,ペアデータなしで網膜画像モデルに伝達する。
- CGMDは,両コホートを繋ぐ臨床的類似性に基づくkNNグラフを活用し,MRI教師モデルの表現を伝播させる。
- 実験結果から,CGMDは従来の蒸留法や非グラフ補完法よりも網膜画像に基づく高血圧予測を改善することが示された。
