arXiv雑要約
画像・音声 - 2026/07/30 公開
SMSP:視覚的錯覚を認識するための多重スケール知覚のプラグアンドプレイ戦略 [cs.CV, cs.MM]目的:マルチモーダル大規模言語モデルにおける視覚的錯覚への脆弱性の克服
- 近年,画像とテキストを扱うモデルの性能向上は目覚ましいが,人間の知覚とのずれが課題となっている。
- 既存のモデルは,隠れたパターンを持つ視覚的錯覚に弱く,安全性への懸念も生じている。
- 高周波成分への注意バイアスを抑制し,人間らしい知覚に近い画像表現を可能にすること。
- 提案手法SMSPは,評価した全てのマルチモーダル大規模言語モデルにおいて,視覚的錯覚に対する性能を大幅に向上させた。
- 例えば,Qwen3-VL-8B-Instructの正答率は13.0%から84.0%へと大きく改善された。
- 本研究は,モデルの視覚知覚に関する新たな知見を提供し,その強化のための実用的な解決策を示す。
拡散Transformerの性能向上:パラメータ効率的な較正による改善 [cs.CV]目的:拡散Transformerの生成能力向上
- 画像生成などの分野で,拡散モデルは高品質な結果を生み出す重要な技術となっている。
- 拡散Transformerは強力だが,その性能を最大限に引き出すための効果的な手法が課題である。
- 少ないパラメータで拡散Transformerの性能を最適化し,生成品質と効率を向上させる。
- 提案手法Calibriは,わずか約100個のパラメータを調整するだけで,様々なテキスト画像モデルで性能向上を達成した。
- Calibriは,画像生成に必要な推論ステップ数を削減し,高品質な出力を維持する。
- 拡散Transformerブロックに学習されたスケーリングパラメータを導入することで,性能が大幅に改善されることが示された。
SceneExpander:テキストによる指示に基づいた自由視点挿入による3Dシーン拡張 [cs.CV]目的:テキスト指示に基づく3Dシーン拡張
- 3Dシーン表現はコンテンツ制作,シミュレーション,インタラクティブ体験において重要性が増している。
- 既存のシーンをユーザー制御下で反復的に拡張するワークフローが一般的だが,既存手法では対応が難しい。
- 3Dシーンの不整合やアーティファクトを抑制し,高品質な拡張を実現することを目指す。
- SceneExpanderは,パラメトリックな3D再構成モデルにテスト時適応を適用することで,シーン拡張時の不整合を軽減する。
- アンカー蒸留により既存シーンの安定化,挿入視点自己蒸留により挿入された視点の予測を保持する。
- ETHシーンおよびオンラインデータでの実験により,拡張の品質と再構成の精度が向上することが示された。
SPROUT:農業分野向けスケーラブルな拡散基盤モデル [cs.CV]目的:農業画像認識のための拡散基盤モデル
- 作物の構造理解は重要だが,詳細なアノテーションはコストがかかる。
- 汎用画像モデルは農業画像への転移性が低いという課題がある。
- 作物の構造を保持した表現学習により,効率的な表現を獲得する。
- SPROUTは,260万枚のラベルなし画像から学習することで,構造を重視した表現を獲得した。
- 器官セグメンテーション,作物・雑草の識別,深度推定,計数など,様々なタスクで既存モデルを上回る性能を示した。
- ラベル効率と計算効率の面でも,汎用モデルや作物特化型モデルと比較して優位性が見られた。
ビデオに基づいた数値推論におけるVLMの失敗モードの診断 [cs.CV]目的:ビデオに基づいた数値推論におけるVLMの失敗モードの診断
- 視覚情報と言語を結びつけるモデルの重要性が増しており,複雑な推論能力が求められている。
- 既存の評価基準は断片的で,多様な数値推論タスクを網羅できていない現状がある。
- より詳細な分析を可能にする,包括的な数値推論ベンチマークの必要性が存在する。
- VidNumは,ビデオと数値情報を結びつけた推論能力を評価するための新しいベンチマークである。
- 最良のVLMでも人間の精度には及ばず,特に構造化された推論や行動に基づいた推論に課題が残る。
- ゼロショットCoTプロンプティングは必ずしも有効ではなく,モデルやタスク構造によって効果が変動する。
ディープラーニングを用いたEMITのハイパースペクトル放射測定によるメタンポイント源のグローバルモニタリング [cs.CV, cs.LG, physics.ao-ph]目的:メタンポイント源のグローバルモニタリング手法の開発
- メタンは短期的な気候変動に大きな影響を与え,安全上の問題やシステムの非効率性も引き起こすため,モニタリングが重要である。
- 従来のメタン検出は手作業によるプルームの識別が中心で,グローバル規模での効率的なモニタリングが課題であった。
- EMITのデータを用いて,高精度で迅速なメタンプルームの検出と位置特定を可能にすることを目指す。
- MAPL-EMITモデルは,EMITの放射スペクトル全体を活用し,シーン内の全ピクセルにおけるメタン濃度の増大を同時に取得する。
- 合成データによる評価で,既存の手法よりも高い再現率と精度でプルームを識別し,微弱なプルームも捉えることが確認された。
- 実際のEMITデータを用いて,既知のプルーム複合体の84%を捉え,また人間による分析よりも多くのプルームを検出した。これにより,従来検出されていなかった発生源の特定も可能となった。
Hyper-FEOD:スパースハイパーグラフによるフレームイベントオブジェクト検出と高精度MoE [cs.CV]目的:フレームベースRGBカメラとイベントストリームの統合によるロバストな物体検出
- 動的な環境下での物体検出において,RGBとイベントデータの組み合わせが有効である。
- RGBとイベントデータ間の複雑な相互作用や意味の異質性をうまく捉えることが課題である。
- 高精度な検出を実現するために,ハイパーグラフを用いた表現学習の強化を目指す。
- Hyper-FEODは,ハイパーグラフ駆動の2つの要素により,クロスモーダル表現学習を強化する。
- イベント活動のヒントを活用し,モーションに重要なスパースなトークンを特定し,高次の関係推論を行う。
- 空間ゲーティング機構と補助的なルーター損失により,安定した学習と最適な特徴量の洗練を実現する。
視覚トークン剪定が校正を改善するのはいつか?MLLMにおけるエビデンスカバレッジの役割 [cs.CV]目的:マルチモーダル大規模言語モデル(MLLM)における視覚トークン剪定が校正に与える影響の分析
- MLLMは画像とテキストを理解するため,様々な応用が期待されており,その効率化が重要である。
- 視覚トークン剪定は計算コスト削減に有効だが,その精度への影響が十分に検証されていない。
- 視覚トークン剪定による校正の変化を分析し,最適な剪定方法を明らかにすることを目指す。
- 視覚トークン剪定は,トークン数の削減だけでなく,モデルの校正にも影響を与えることが示された。
- POPEとLLaVA-1.5の実験では,カバレッジに基づく剪定が精度を維持しつつ,校正誤差を大幅に減少させた。
- 一方で,Attentionに基づく剪定は精度を低下させ,校正精度も悪化することが確認された。
LLMベースの社会粒子群における記憶が集合的・協調的行動に与える影響 [cs.AI, cs.CL, cs.GT, cs.MA]目的:LLMエージェントの多エージェントシステムにおける集合的・協調的ダイナミクスの記憶による影響
- LLMの社会行動モデル化は,人間社会の複雑さを理解するための新たなアプローチとして注目されている。
- LLMエージェントの記憶メカニズムは,その行動特性に重要な影響を与えるものの,未解明な点が多い。
- 本研究は,LLMエージェントの記憶長が協調行動に及ぼす影響を明らかにすることを目的とする。
- 記憶長のわずかな変化でさえ,協調行動を著しく抑制することが示された。
- Big Five性格特性は,人間実験の結果と一部一致するエージェントの行動と相関関係が見られた。
- LLMが記憶を解釈する方法が,生成エージェントベースモデリングにおける創発的な社会行動の重要な要因であることが示唆された。
POINTS-Seeker: ビジュアルメモリ管理を備えたマルチモーダル検索エージェントのオープンレシピ [cs.CV]目的:マルチモーダル検索エージェントの構築に関するオープンなレシピ
- 大規模マルチモーダルモデルの活用が期待されるが,リアルタイム処理と知識集約型クエリに課題がある。
- 既存モデルでは,検索エージェントをゼロから開発するためのレシピが不足し,長期的な対話におけるコンテキストの肥大化が問題となる。
- エージェントの育成とコンテキスト管理のボトルネックを解消し,マルチモーダル検索の性能を向上させる。
- エージェントの初期段階に「Agentic Seeding」を導入し,ツール使用と計画能力を基盤モデルから引き出した。
- 適応的なメモリ管理機構「V-Fold」を提案し,過去の情報を視覚空間に折り込むことで,コンテキストの冗長性を削減した。
- 開発したPOINTS-Seeker-8Bは,6つのマルチモーダル検索ベンチマークで最先端の性能を達成した。
SparseContrast:効率的かつ正確なコントラスト学習のための動的疎注意 [cs.CV]目的:医療画像におけるコントラスト学習のための動的疎注意フレームワーク
- 医療画像診断は,疾患の早期発見と治療に不可欠であり,高精度な画像解析が求められる。
- 従来のコントラスト学習は計算コストが高く,医療画像の冗長な領域を処理してしまう問題点がある。
- SparseContrastは,計算効率を向上させつつ,診断精度を維持・向上させることを目指す。
- SparseContrastは,動的疎注意機構を導入することで,計算量を最大40%削減することに成功した。
- 診断上重要な領域に選択的に焦点を当てることで,精度を損なうことなく効率的な学習を可能にした。
- 本手法は,様々なバックボーンアーキテクチャに適用可能であり,限られた計算資源下での医療画像診断に貢献する。
SpectraDINO:赤外帯域におけるRGBビジョン基盤モデルのモダリティ条件付き適応 [cs.CV]目的:赤外帯域を網羅するRGBビジョン基盤モデルの適応
- ロボティクスや自動運転において,低照度下や悪天候下での知覚に不可欠な赤外線技術の重要性が高まっている。
- 既存の赤外線知覚システムは,センサーごとにバックボーンを構築する必要があり,汎用性に欠けるという課題がある。
- 異なる赤外線帯域を統一的に処理できる基盤モデルを開発し,赤外線知覚システムの性能向上を目指す。
- SpectraDINOは,NIR,SWIR,LWIRの各帯域を単一のViTでサポートするモダリティ条件付き適応基盤モデルである。
- 7つの検出・セグメンテーションベンチマークにおいて,モダリティ特化型手法と同等またはそれ以上の性能を示す。
- FMBにおけるmIoUで公表済みの最高結果を2.6ポイント,SemanticRTで1.4ポイント上回り,SWIR検出においてmAPで2.7ポイント改善された。
トポロジー制約付き量子化nnUNetによる効率的かつ解剖学的に正確な3D歯分割 [cs.CV]目的:効率的かつ解剖学的に正確な3D歯分割のためのトポロジー制約付き量子化nnUNetフレームワーク
- 医療画像解析は,病変の早期発見や治療計画の精度向上に不可欠であり,その自動化が求められている。
- 深層学習モデルの量子化は計算効率を高めるが,空間歪みが生じ,解剖学的構造の正確性が損なわれる場合がある。
- 量子化による空間歪みを抑制しつつ,歯のトポロジー構造を維持することで,臨床的に有用な分割精度を実現すること。
- 本研究で提案する手法は,従来の量子化モデルと比較してトポロジーエラーを大幅に低減することを示した。
- 特に,歯数,隣接関係,空洞の完全性といった重要な解剖学的構造の維持に貢献する。
- 提案手法は,整数演算のみによる推論が可能であり,リソースに制約のある臨床環境への導入に適している。
CAST:キャプション誘導による視覚的注意操作を通じて,大規模視覚言語モデルにおける物体幻覚を軽減する [cs.CV]目的:大規模視覚言語モデルにおける物体幻覚の軽減
- 視覚と言語を理解するAIの発展は,多様な応用を可能にする重要な課題である。
- 大規模視覚言語モデルは,視覚情報とは異なる内容を生成する物体幻覚を起こしやすい。
- キャプション誘導による注意操作で,モデルの視覚情報への注意を強化し,幻覚を抑制する。
- 提案手法CASTは,追加学習なしに既存のモデルに組み込むことが可能である。
- CASTは,5つの一般的なLVLMと5つのベンチマークにおいて,平均6.03%の物体幻覚の軽減を達成した。
- 推論コストをほとんど増加させず,他の基本能力を維持しながら,最先端の性能を示す。
蒸留,拡散,セグメント:マルチレベル蒸留とグラフ拡散に基づく自律運転のための教師なし3Dセマンティックセグメンテーション [cs.IR, cs.CV]目的:教師なし3Dセマンティックセグメンテーション手法
- 自動運転の知覚において,LiDARによるセマンティックセグメンテーションは不可欠な技術である。
- 詳細なアノテーションコストが高い上に,屋外シーンの偏りが安全上重要な小型オブジェクトの検出を困難にする。
- スケール変化下での小型オブジェクト保持,モダリティ間の一貫性,文脈伝播の効率化といった課題を解決する。
- 提案手法DDSは,既存の教師なしセグメンテーション手法と比較して,oAcc,mAcc,mIoUをそれぞれ最大2.9%,9.7%,4.1%改善した。
- 粗い粒度から細かい粒度へのマルチレベル蒸留によって,異なるスケールのオブジェクトに対する3D領域のヒントを補完し,小型オブジェクトの保持を向上させている。
- グラフ拡散により,スーパーポイント間の文脈情報を効率的に伝播させ,初期特徴をアンカーすることで表現の精度を高めている。
テキストから楽譜を生成:Text2Score [cs.DM, cs.SD]目的:テキストプロンプトからの楽譜生成
- 音楽生成におけるテキスト制御の重要性が高まっている。
- テキストと音楽の対応データが不足しており,自動キャプションの精度が課題である。
- 楽譜生成において,テキストによる制御と高品質な生成を目指す。
- Text2Scoreは,プランニング段階と実行段階の2段階フレームワークである。
- 楽譜データから直接教師信号を得ることで,ノイズの多いキャプションベースの学習を回避する。
- 客観評価と主観評価の両方において,既存手法を上回る性能を示す。
VideoFDB:対話型エージェントにおける全二重視覚・音声能力の評価 [cs.CV, cs.CL, cs.HC]目的:全二重の視覚・音声能力を有する対話型エージェントの評価
- 自然な人間との対話を実現するには,音声だけでなく視覚情報も同時に処理する能力が不可欠である。
- 既存の全二重ベンチマークは主に音声に焦点を当てており,視覚情報の統合が十分でない。
- 自然な対話に必要な,視覚と音声の同時処理能力を評価するための基盤を提供する。
- VideoFDBは,実際のビデオ通話から収集された237件の対話データセットである。
- 既存の視覚・音声エージェントは,視覚情報を明示的な質問応答には利用するものの,自然な対話に必要な同時処理には課題があることが示された。
- 音声からアバターを生成するシステムは,全二重の非言語的合図の生成が構造的に困難であることが判明した。
VistaHop:長期的視覚的深層探索のベンチマーク [cs.CV, cs.AI, cs.CL]目的:視覚的深層探索タスクの評価
- 画像理解と推論の能力は,多様な応用において重要であり,その進歩が求められている。
- 既存のベンチマークは,探索範囲や反復的な視覚情報の活用が限定的であり,現実的な課題に対応できていない。
- 長期間にわたる視覚情報の探索と推論能力を評価し,より高度なモデル開発を促進すること。
- VistaHopは,反復的な画像検査,視覚的アンカーのグラウンディング,および長期的証拠トラバーサルを評価するベンチマークである。
- 最先端のMLLMであっても,VistaHopを完全に解決するには至っておらず,SenseNova-MARS-32BでPass@1が26.33%に留まっている。
- この結果は,視覚的深層探索のための専用ベンチマークと,より改善されたエージェント手法の重要性を示唆している。
オウロボロス空間:空間推論のためのデータ・モデルループの閉環 [cs.MS, physics.comp-ph, cs.RO, cs.CV, cs.AI]目的:空間推論のためのデータ・モデルループの閉環
- マルチモーダル大規模言語モデルの性能向上には,空間推論能力が不可欠である。
- 既存手法は静的なデータセットに依存し,モデルの学習段階に応じたデータ選定が不十分である。
- モデルの能力に合わせたデータ分布の進化により,効率的な学習を目指す。
- オウロボロス空間は,プロポーザーとソルバーの二重の役割を持つ自己進化型学習フレームワークである。
- Qwen3-VL-4BおよびQwen3-VL-8Bにおいて,従来のデータセットと比較して大幅な性能向上を達成した。
- VSI-Benchでは,4Bモデルで9.9ポイント,8Bモデルで6.8ポイントの絶対的な改善が見られた。
LOCUS:マルチモーダル大規模言語モデルにおける微細な知覚を強化するための局所的な視覚的手がかり探索 [cs.CV]目的:マルチモーダル大規模言語モデルにおける微細な視覚的知覚の向上
- 画像とテキストを統合するモデルは,現実世界とのインタラクションに不可欠であり,応用範囲が広い。
- 既存モデルは,高解像度画像から必要な局所的な詳細を確実に抽出できていないという課題がある。
- 局所的な手がかり探索を学習させることで,モデルが視覚的根拠をより正確に特定することを可能にする。
- LOCUSは,局所的な画像の一部を手がかりとして与えることで,モデルに空間的な対応関係を学習させる。
- 実験により,LOCUSは微細な視覚的理解力を向上させ,誤った情報を抑制し,推論能力を維持することが示された。
- 注意メカニズムの分析から,LOCUSはタスクに関連する領域への集中力を高めることが明らかになった。
BrainG3N:制御可能な3D脳MRI生成のための二目的トークナイザー [cs.AI, cs.CV, cs.LG]目的:3D脳MRI生成のための,臨床情報を保持しつつ高精度な再構成を可能にする二目的トークナイザーの開発
- 3D脳MRIは臨床神経学や神経腫瘍学において不可欠であり,生成モデルによるデータ拡張が求められている。
- 既存のトークナイザーは再構成精度を優先するあまり,臨床情報の保持が不十分であるという課題があった。
- 臨床情報保持と再構成精度の両立を目指し,臨床タスクと制御可能な生成を可能にする埋め込み空間を構築する。
- 開発したトークナイザーは,23の線形プロービングベンチマークにおいて,既存モデルを21/23のタスクで上回る性能を示した。
- 臨床情報を埋め込んだ拡散トランスフォーマーは,6変数の条件付き生成や患者特異的な縦断的予測を可能にした。
- 本研究により,臨床タスクと制御可能な生成の両方をサポートする単一の3D脳MRI埋め込み空間が確立された。
AerialMetric:実世界におけるUAV単眼計量深度推定のベンチマークと適応 [cs.CV]目的:UAV空撮画像における単眼計量深度推定の評価と適応
- ドローン技術の発展に伴い,空撮画像を用いた環境理解の重要性が高まっている。
- 既存の深度推定モデルは,地上データで学習されているため,空撮画像への適用に課題がある。
- 本研究は,空撮画像に適応した深度推定モデルの評価基準と改善策を提供する。
- 本研究では,UAV空撮画像に特化したベンチマークデータセットAerialMetricを構築した。
- 既存の最先端モデルを評価した結果,空撮環境下における深度予測の性能にばらつきが見られた。
- AerialMetricを用いてモデルをファインチューニングすることで,空撮画像における最先端性能を達成した。
会話型トーキングフェイス生成のための柔軟性,自然性,効率性を高める試み [cs.CV]目的:会話型トーキングフェイス生成における柔軟性,自然性,効率性の向上
- 近年,人間らしいインタラクションの実現が求められており,その一環として会話型トーキングフェイス生成の研究が盛んである。
- 既存手法では,複数人での長時間の対話において,柔軟性,自然性,効率性のバランスが課題となっていた。
- 本研究では,複数人対話に対応し,自然な動作とリアルタイム性を両立する新たなフレームワークを開発することを目指す。
- 提案手法InterTalkは,モーションベースのアーキテクチャを採用し,リアルタイムな会話合成を可能にした。
- InterTalkは,複数人間の会話ダイナミクスを明示的にモデル化することで,参加者数の制約を克服し,高い柔軟性を実現した。
- モーションフィードバックの導入や反復生成戦略により,自然な挙動を強化し,高品質な対話体験を提供する。
Auto-AEG:オープンボキャブラリオーディオイベントグラウンディングのためのスケーラブルなデータ構築 [cs.HC, cs.CY, cs.IR, cs.SD, cs.AI]目的:オープンボキャブラリオーディオイベントグラウンディングのためのデータ構築手法
- 音響イベントの理解は,音声認識,ロボット工学,監視システムなど幅広い分野で重要である。
- 既存手法では,限定されたラベルセットでのみ高精度なイベント検出が可能であり,新しいイベントへの対応が難しい。
- 大規模なデータセットの不足を解消し,任意の自然言語クエリに対応できるイベントグラウンディングを実現する。
- 本研究で提案するAuto-AEGは,プログラムによる合成クリップと実世界の音声に対する擬似ラベルを活用し,スケーラブルなデータ構築パイプラインを実現する。
- AEGBenchという新たなベンチマークにおいて,Auto-AEGはゼロショット性能に対して大幅な改善(mIoUで+73.9%および+23.1%)を示した。
- この改善は,他のオーディオイベント検出ベンチマークにも一般化し,LALMの時系列局在化能力を効果的に拡張できることを示唆している。
G2VD:反事実的介入と因果的解離による汎化可能なAI生成動画検出 [cs.CV, cs.AI]目的:AI生成動画の汎化可能な検出手法
- AI動画生成技術の急速な発展に伴い,セキュリティリスクが高まっており,信頼性の高い検出技術が求められている。
- 既存手法は,学習データと異なる生成モデルに対して性能が著しく低下する。ドメイン固有のバイアスに依存した学習が原因である。
- ドメイン固有のバイアスを弱め,本質的なフォレンジックな手がかりを捉えることで,汎化性能の高い検出を実現する。
- G2VDは,VAEに基づく再構成と周波数・ピクセル領域のアライメントにより,反事実的サンプルを生成し,ドメイン固有のバイアスと真偽ラベル間の相関を弱める。
- ドメインアンカー化された2つのブランチとHSICに基づく制約を持つ因果的解離分類器を設計し,フォレンジックな手がかりとドメイン固有のバイアスを分離する。
- 4つの公開データセットでの実験により,高いクロスドメイン性能が示され,GenVidBenchにおいて,F1値とAUCが最先端手法を上回る。
建設における自動溶接ロボットのための転移学習による高度な溶接線セグメンテーション:双方向セグメンテーションネットワークの限界への対処 [cs.CV, cs.LG]目的:建設における自律型ロボット溶接のための信頼性の高い溶接線セグメンテーション
- 建設現場でのロボット溶接は,人手不足解消や生産性向上に不可欠であり,自動化技術の確立が求められている。
- 強烈な照明,反射,薄い溶接構造など,建設現場特有の環境要因がセグメンテーション精度を低下させる課題がある。
- 本研究は,反射に強く,軽量なセグメンテーションフレームワークを開発し,ロボット溶接における実用的な知覚ソリューションを提供することを目指す。
- 提案手法は,従来のベースラインと比較して,Joint IoUを22.36%向上させ,81.76%およびmIoU 90.73%を達成した。
- 特に,反射条件下で発生する深刻なゼロIoUの失敗事例の96.33%を改善することが示された。
- 実験結果から,提案する最適化戦略は,軽量なリアルタイムセグメンテーションアーキテクチャに特に有効であることが示唆された。
VendorBench-100:深偽造画像検出のための統一的クロスパラダイムベンチマーク [cs.CV, cs.AI]目的:深偽造画像検出モデルの性能評価
- 画像偽造技術の進歩に伴い,その検出技術の重要性が増している。
- 深偽造画像検出手法は複数存在するが,統一的な評価基準がないため比較が困難である。
- 異なる手法間の公平な比較を可能にするベンチマーク環境の構築。
- 本研究では,36種類のモデルを評価するクロスパラダイムベンチマーク「VendorBench-100」を提案した。
- 商用APIが最も高い性能を示したが,一部のオープンソースモデルもLLMに匹敵する性能を発揮した。
- ROC-AUCは必ずしも実用性を反映せず,MCCや特異度と併せて評価する必要があることが示された。
Face-Trace:オープンセット属性特定と合成顔生成モデルの漸進的発見 [cs.CV]目的:合成顔画像の生成モデルの属性特定
- 生成AIの進展により,鑑識技術への新たな課題が生じている。
- 既存手法は,訓練時に観測したモデルのみを想定するクローズドセットでのみ有効である。
- 未知の生成モデルからの画像も識別し,その起源を整理することを目指す。
- Face-Traceは,既知モデルの分類,エネルギーベースでの拒否,未知モデルの発見を組み合わせる。
- WILDデータセットでの実験で,クローズドセット属性特定精度は96.73%を達成した。
- 拒否精度は71.25%のバランス精度を示し,拒否されたサンプルは意味のある未知の生成モデルグループにクラスタリングされた。
トリコグラムバチの長期多重物体追跡のためのベンチマーク:WaspMOT [cs.CV]目的:トリコグラムバチの長期多重物体追跡に関する評価基準
- 多重物体追跡は,ロボット工学や自動運転など,様々な分野で不可欠な技術である。
- 既存のベンチマークは短時間の動画に偏っており,長期的な追跡性能を評価するには不十分である。
- 本研究は,長時間にわたる追跡における物体IDの維持という課題に取り組む。
- WaspMOTは,約12,000フレーム(8分以上)のトリコグラムバチ追跡データセットであり,長期的なID維持の難しさを示した。
- 既存の追跡手法は,WaspMOTにおいて顕著な軌跡の断片化を示すことが明らかになった。
- 単純な空間的な軌跡連結手法が性能向上に貢献し,さらなる改善の余地があることを示した。
不完全な視覚的事前情報からのロバストな4D運転シーン再構成 [cs.CV]目的:多様な自動運転シミュレーションのための4D運転シーン再構成
- 自動運転技術の発展には,現実世界の多様な環境を再現できるシミュレーションが不可欠である。
- 既存手法は,正確なカメラ姿勢やLiDAR深度など,正確な事前情報に大きく依存しており,ノイズの多いデータには弱い。
- 本研究は,ノイズの多い事前情報でもロバストな再構成を可能にするフレームワークを開発する。
- 提案手法であるAGGは,背景とカメラ姿勢の更新と,動的エージェント学習を明示的に分離する戦略を採用している。
- 適応的トポロジー進化モジュールにより,グラフ構造の修正,エージェントの生成,ガウス関数の再割り当て,偽陽性の除去を積極的に行う。
- KITTIとWild-30ベンチマークにおける実験により,ノイズの多い事前情報下での視覚的な忠実性とロバスト性において,既存手法を上回ることが示された。
EA-Nav:身体認識を用いた安全な視覚ナビゲーション方策の学習 [cs.RO, cs.CV]目的:身体認識を取り入れた視覚ナビゲーション方策
- 具現化された知能において,ナビゲーションは重要な課題である。多様な環境への適応能力が求められる。
- 単に視覚情報のみに依存すると,異なる身体を持つエージェント間で行動の予測に曖昧さが生じる。
- 身体の形状を考慮することで,ナビゲーションにおける曖昧さを軽減し,安全性を向上させることを目指す。
- 提案手法は,異なる身体設定においてナビゲーション性能を効果的に向上させる。
- インターネット動画から構築されたクロス・エンボディメントナビゲーションデータセットと,身体形状を条件トークンとして導入する事前学習を行う。
- デカップルドアーキテクチャに基づくマルチモーダル情報注入メカニズムと,危険なサンプルを用いた軌跡拡張戦略により,安全なナビゲーションを実現する。
完全楽曲生成の最前線:階層型自己回帰的計画とフローマッチングレンダリングの融合 [cs.SD, cs.AI, eess.AS]目的:歌詞,テキスト記述,音楽的属性から高品質な完全楽曲を生成する統合的なフレームワーク
- 音楽生成は,創造性の拡張や新しい音楽体験の提供において,重要な役割を担う。
- 既存の手法では,楽曲全体の構造を維持しつつ,高品質な音楽を生成することが困難であった。
- 歌詞や音楽的属性に基づき,楽曲全体の構造と品質を向上させる生成手法を開発する。
- 提案フレームワークは,歌詞から楽曲生成,インストゥルメンタル音楽生成,カバー曲生成の3つのタスクに対応可能である。
- ハイブリッドLMとFullDiTの組み合わせにより,楽曲全体の構造を計画し,高品質なオーディオを生成している。
- DPO,GRPO,OPDといった報酬に基づいた後学習戦略が,音楽性とレンダリング品質の向上に貢献している。
聞くことだけに集中せよ:堅牢な全能型音声理解のための音声に基づいた足場コンテキストの内部化 [cs.SD]目的:重なり合った音声や騒音下における全能型音声モデルの理解度向上のための手法
- 音声認識技術は,人間と機械のコミュニケーションにおいて不可欠であり,その精度向上は重要な課題である。
- 全能型音声モデルは,複数話者の重なりや騒音環境下では性能が著しく低下する。
- 音声に基づく足場コンテキストを内部化することで,モデルが音声を聞き取る能力を高め,ショートカットを防ぐ。
- 音声に基づいた足場コンテキスト(AGSC)を用いることで,重なり合った騒音環境下での平均単語誤り率(mpWER)が大幅に低下した。
- AGSCは,テスト時に足場を排除することで,モデルが音声に依存せずに推論できる能力を維持する。
- ストリーミング制御のための共同GDPOタスクを用いることで,モデルはいつ足場を利用するか,どのように話者属性付きのトランスクリプトを生成するかを学習する。
キーストロークノイズからテキストへの変換:キーボードに対する自己教師あり音響盗聴攻撃 [cs.CR, cs.SD]目的:キーストローク音のみからの入力テキストの再構築
- キーボード操作音は,情報漏洩のリスクを孕む重要な攻撃対象となり得る。
- 標的デバイス固有のラベル付きデータなしでの音響盗聴は,困難であった。
- 少ないキーストローク数でも,高精度なテキスト再構築を可能にすること。
- 本研究では,自己教師あり学習とTransformerモデルを用いて,標的デバイスのラベルなしデータのみでテキストを再構築する手法を提案した。
- 近距離録音環境下では,100-150個のキーストロークで99%を超える高い再構築精度を達成し,既存手法を大幅に上回った。
- 様々なラップトップや録音環境(距離,壁越し,オンライン会議)においても,高い再構築精度(90%以上)を維持した。
CausalGate:Transformerモジュール剪定のための因果重要度蒸留 [cs.LG, cs.CL, cs.CV, stat.ML]目的:Transformerモジュールの剪定における因果重要度蒸留
- 大規模言語モデルの効率化は,その利用拡大と運用コスト削減に不可欠である。
- 既存手法は相関に基づく指標に依存し,意味的な正確性に重要な非線形構造を捉えきれない。
- 因果介入に基づき,各モジュールの重要度を正確に評価し,効率的な推論を可能にすること。
- CausalGateは,AttentionやMLPサブ層を介入により分離し,最終的なlogit分布の変化をKLダイバージェンスで測定する。
- 静的なゲートを導入することで,ランタイムのルーティングオーバーヘッドを排除し,計算効率を向上させる。
- TinyLlama,Qwen,Llama-3等の評価で,既存手法を上回り,ハードウェアのレイテンシを削減することを示した。
化学自律型研究所におけるロボットの故障分析ベンチマーク:LabRobFail [cs.RO, cs.CV]目的:化学自律型研究所におけるロボットの故障分析の学習と評価のためのフレームワーク
- 科学的発見の加速に貢献しうる自律型研究所の実現に向け,信頼性の向上が不可欠である。
- 化学実験の不可逆性と安全性,および故障データの不足が,自律型研究所の進展を阻害している。
- ロボットの故障分析能力を向上させ,安全かつ信頼性の高い自律型研究所を実現することを目指す。
- LabRobFailは,制御,物理,意味レベルで制御可能な故障を注入し,70以上のタスクシナリオ,5つの故障カテゴリ,11の細かい故障タイプを含む2万件以上の軌跡データセットを構築した。
- LabRobFail-VLMは,故障検出において90.83%の精度,時間的局在化において77.21%の精度を達成し,汎用VLMを大幅に上回る性能を示した。
- リアルタイム監視システムとして統合することで,下流タスクの成功率を4〜16%向上させ,詳細な故障理解がクローズドループリカバリに有効であることが示された。
AptAvatar:実用化向けアバターの高速かつ鮮明な長尺オーディオ駆動ビデオ生成 [cs.CE, math.OC, cs.CV]目的:実用化可能なアバターのオーディオ駆動ビデオ生成手法
- バーチャルコンテンツ制作において,リアルで自然なアバター表現の需要が高まっている。
- 既存手法では,高速化のために画質や動きの表現力が犠牲になることが多い。
- 高品質を維持しつつ,生成処理を高速化することで実用化を促進する。
- AptAvatarは,140億パラメータのフレームワークを用いて,高速かつ表現力豊かな長尺アバタービデオ生成を実現した。
- 2NFEsという少ない計算量で720pの鮮明な動画を生成し,60倍の高速化を達成した。
- Endpoint-Anchored Distribution DistillationとSelf-Generated History Replayという技術により,高品質を維持しつつ効率的な生成を可能にした。
現在の検索システムは全ての証拠を網羅しているか? 連結型クロスドキュメント検索の制御された研究 [cs.CV, cs.CL, cs.IR]目的:連結型ドキュメント検索における証拠網羅性の評価
- 複雑な情報要求に応えるため,関連文書の検索は重要である。特に複数条件を満たす証拠の特定は困難。
- 従来の検索システムは,文書が条件を全て満たしているか検証せず,部分的な証拠のみで満足してしまう傾向がある。
- 複数条件を全て満たす証拠を含む文書を正しく上位に表示することを目指す。
- 条件分解による密なバックボーンの性能向上(6.8~7.3ポイント)と,テキスト・視覚的融合による更なる改善(8.7ポイント)が確認された。
- 大規模言語モデルのスケーリング(0.6Bから8Bへ)は,完全一致の成功率に影響を与えなかった。
- 最も性能の良いハイブリッドシステムでも,完全一致の成功率は35.8%に留まり,証拠網羅性がボトルネックであることが示された。
FilmBench:シネマティックな映像生成のためのフィルムグレードベンチマーク [cs.CV, cs.AI]目的:シネマティックな映像生成モデルの評価
- 映像生成技術は進歩しているが,プロの映像制作との差は残る
- 既存ベンチマークは評価基準が粗雑で,映画制作の基準に合致しない
- 映画制作の言語に基づいた,より厳密な評価基準を確立すること
- FilmBenchは,映画アカデミーの伝統と専門家の協力を基に構築されたベンチマークである。
- 評価は,3軸12要素35項目のシネマティックな分類体系に基づいて行われる。
- 評価結果は,既存のウェブベースベンチマークよりも低いスコアを示し,ダイナミックな美学や複数ショットの性能に課題があることが示された。
SADe:弱アノテーションによる少サンプルセグメンテーションのための疎アトムサポート汚染除去 [eess.SY, cs.SY, cs.CV]目的:少サンプルセグメンテーションにおける弱アノテーションの汚染問題の解決
- 少サンプルセグメンテーションは,限られた学習データで物体を識別する上で重要である。
- 実用的なサポートスーパーバイズは,粗いアノテーションになりやすく,誤った情報を含む場合がある。
- 弱アノテーションに含まれるノイズを除去し,セグメンテーション精度を向上させる。
- SADeは,クエリ情報なしにサポートパッチの信頼性を推定する予測器に依存しないサポート汚染除去層である。
- SADeは,9種類のプロンプトショット組み合わせのうち6つで最高のクエリmIoUを達成した。
- SADeをプラグインとして使用することで,4つの固定ダウンストリームモデルと2つのデータセットで,生のサポートと比較して70/72のケースで性能が向上した。
フォトグラメトリク再構成におけるトラック漏れのない保留検証:プロトコル,感度,限界 [cs.CV, cs.RO]目的:フォトグラメトリク再構成の信頼性自己推定法の確立
- 3次元再構成技術は,様々な分野で活用が広がっている重要な技術である。
- 再構成の品質評価には外部基準が不可欠だが,常に利用可能とは限らない。
- 外部基準なしに再構成自体の信頼性を評価する手法を提案し,その限界を明らかにする。
- 提案手法は,再構成の内部幾何学的整合性を評価する指標として機能する。
- 良好な再構成は高い自己整合性を示す一方,絶対精度は保証されない。
- 歪んだ再構成であっても,内部的に整合性が取れている場合,高い信頼度を示すことがある。
WHTMix:ウォルシュ・アダマールトークン混合による効率的なステレオ深度推定 [cs.MA, cs.CV, eess.IV, eess.SP]目的:ステレオ深度推定の効率化
- 自動運転,ロボティクス,ARなどへの応用が期待され,高解像度かつ低遅延な処理が求められる分野である。
- TransformerベースのMatcherにおいて,シーン全体の文脈を統合するglobal self-attentionの計算量が画像のピクセル数に対して二乗で増加する。
- データ非依存なウォルシュ・アダマール変換によるトークン混合でself-attentionを置き換え,計算量を削減し,処理速度を向上させる。
- 提案手法WHTMixは,合成運転データにおいて,従来のself-attentionベースの手法と同等の精度を維持しつつ,モデルの計算量を2.46倍,推論速度を2.65倍に削減した。
- この効果は,系列長とチャンネル幅の比率に依存し,高解像度ステレオマッチングに特に有効であることが理論的・実験的に示された。
- 遠方物体に対応する小視差ピクセルを重視するハイブリッドlog-disparity損失関数を導入し,遠方物体の誤差を低減することに成功した。
作物被害評価のための安全性を考慮したカスケード推論:制御された誤差トレードオフ [cs.CV]目的:小規模農家の画像ベースの農業保険における作物被害の検出
- 農業保険は,小規模農家にとって重要な収入保障手段であるため,被害の正確な評価が不可欠である。
- 従来の画像分類器は,誤検知と見逃しを平等に扱い,被害を見逃した場合の損失が大きいという農業保険の特性に対応できていない。
- 被害の見逃しを最小限に抑え,誤検知と見逃しの間のトレードオフを制御する被害検出システムを構築すること。
- 提案手法CascadeCropNetは,特定の再現率目標(Rec-Damaged >= 0.95)を満たすように調整された2段階のカスケードアーキテクチャである。
- ケニアの小規模農家のトウモロコシ畑のデータセット(Eyes on the Ground)を用いた評価では,CascadeCropNetはRec-Damaged = 0.974を達成し,基準モデルと比較して被害の見逃しを最大54%削減した。
- システムは,入力の劣化に対して,誤分類よりもエスカレーションを優先することで,アーキテクチャの分離によるエラー封じ込めを実現している。
I2VShield:DiTベース画像から動画モデルに対する効率的な能動的防御フレームワーク [cs.CV, cs.AI]目的:DiTベース画像から動画モデルに対するプライバシー保護手法
- 動画生成モデルの急速な進歩に伴い,画像から動画モデルの悪用が深刻化しているため,防御技術が不可欠である。
- 既存の能動的防御は勾配ベースの敵対的攻撃に依存し,大量のVRAMを必要とするため,リソースが限られた環境での利用が困難である。
- 本研究は,計算コストを削減しつつ,DiTベースI2Vモデルに対する効果的な防御を実現することを目指す。
- 提案手法I2VShieldは,敵対的学習を組み込んだテキスト適応摂動生成により,計算負荷を軽減しつつ,視覚的な不可知性を維持する。
- I2VShieldは,DiTベースI2Vモデルの脆弱性を突くMultimodal Attention Disruption (MAD)攻撃を実装し,内部アテンション特徴の乖離を最大化する。
- 実験結果から,I2VShieldは様々なデータセットとDiTベースI2Vモデルに対し,特に時空間的な一貫性を破壊する上で高い保護性能を示す。
LAIAデータセット:知能自動車のためのラベル付き注意 [cs.CV, cs.AI, cs.SE]目的:自律走行研究を豊かにするための人間による注意データ
- 自動運転技術は,安全性向上や移動の効率化に不可欠であり,社会実装が期待されている。
- エンドツーエンド型学習は解釈可能性に課題があり,その改善が求められている。
- 人間とAIの注意メカニズムを比較することで,AIの振る舞いを理解し,説明可能性を高める。
- LAIAデータセットは,CARLAシミュレーターを用いて,多様な気象条件下で約15時間の運転データを収集した。
- このデータセットは,RGB画像,セマンティックセグメンテーション,深度,光学的フロー,CANバス信号,眼球追跡データなどを含む。
- LAIAを用いて人間とAIの注意を比較することで,AIモデルの挙動に関する洞察を得ることができた。
ビデオオブジェクト挿入とレイヤー分解のための明示的なレイヤーモデリング [cs.RO, cs.CV]目的:ビデオオブジェクト挿入およびレイヤー分解における明示的なレイヤーモデリング
- ビデオ編集において,現実的な合成やオブジェクトの再利用,一貫した操作は重要である。
- 既存手法は明示的な前景レイヤーの監督なしに,暗黙的な推論やシーンごとの最適化に頼っており,限界がある。
- 本研究は,明示的なレイヤーの監督下で,ビデオのレイヤー表現を直接学習することを目的とする。
- 大規模なトリプレットビデオデータセットTriLayerを導入し,合成,背景,前景ビデオを整列させた。
- RGB合成とRGBA前景レイヤーを共同でモデル化する二分枝拡散フレームワークDBL-Diffusionを提案した。
- DBL-InsertとDBL-Decomposeを通じて,挿入忠実度と分解品質を大幅に向上させることが示された。
相互作用するストリームに対する知識誘導型マルチモーダル推論:ビデオレベルの曖昧さと躊躇の認識 [cs.CV, cs.AI]目的:ビデオレベルでの曖昧さと躊躇の認識
- 健康行動変容の遅延や放棄に関わる感情状態の理解は,公衆衛生上の課題解決に不可欠である。
- 表情,音声,言語,身体表現といった複数のモダリティ間の不一致から生じる曖昧さと躊躇の認識は困難である。
- マルチモーダルなコンフリクトとして曖昧さと躊躇を捉え,時間経過とともに展開する様相をモデル化することを目指す。
- 提案手法PRISM-AHは,クロスモーダルな不協和をスコアリングし,次の時間ウィンドウを予測することで,躊躇の兆候を検出する。
- 知識誘導型大規模言語モデルが専門家の分類に基づき構造化された証拠を推論し,検証性能が向上する場合にのみ結果を統合する。
- 公開テストデータセットにおいて,PRISM-AHはマクロF1スコア0.6133を達成し,ベースラインの0.2827を上回った。
MLVC:実世界展開のためのマルチプラットフォーム学習型ビデオコーデック [eess.IV, cs.AI, cs.CV, cs.LG]目的:実世界展開を目的とした,マルチプラットフォーム対応のハードウェアに強い学習型ビデオコーデックの開発
- ビデオ圧縮技術は,通信帯域幅の削減やストレージ容量の効率化に不可欠である。
- 既存のニューラルビデオコーデックは,プラットフォーム間での互換性が低く,計算コストが高いという課題がある。
- 多様なハードウェア上で安定した動作と高い圧縮性能を両立する,実用的なビデオコーデックの実現を目指す。
- MLVCは,ハードウェアHEVCと比較して70%以上のBDレート(MOS)改善をVCDビデオ会議ベンチマークで達成した。
- 主観評価において,多様なプラットフォームで動作しないDCVC-RTと同等の画質を実現した。
- MLVCのエンコーダーとデコーダーは,Apple,Intel,Qualcommの汎用NPU上で平均100 FPSで動作する。
乳房超音波画像分類のためのGCNフレームワークにおける画像エンコーダの選択とグラフホモフィリーの分析 [eess.IV, cs.CV, cs.LG]目的:乳房超音波画像分類における画像エンコーダの選択と,それによって構築されるグラフ構造のホモフィリーの関係性の解明
- 乳房超音波検査は普及しているが,熟練した医師による読影に依存しており,読影のばらつきや負担が大きい。
- 標準的な超音波画像は,スぺックルノイズや撮像条件の変化の影響を受けやすく,良性と悪性の識別が困難である。
- グラフ構造を用いることで,患者間の類似性を活用し,分類精度向上を目指す。画像エンコーダの選択がその性能に大きく影響する。
- 高容量の画像エンコーダは,グラフのホモフィリーを向上させ,分類性能の改善に繋がる。
- テストセットにおけるグラフのホモフィリーと分類精度には強い相関関係が見られ,高容量エンコーダは高いホモフィリーと高精度を実現する。
- エンコーダ選択がグラフ構造の質に影響し,それが分類性能に繋がることを示唆しており,グラフベースの乳房超音波画像分類において,エンコーダ選択は重要な要素である。
