arXiv雑要約
画像・音声 - 2026/08/05 公開
ReCamDriving:LiDARなしカメラ制御による新規軌道向けビデオ合成 [cs.CV]目的:新規軌道に対応したビデオ合成手法
- 自動運転におけるシミュレーションデータの活用は,安全性向上とコスト削減に不可欠である。
- 既存手法では,現実世界との乖離や3次元構造の不整合といった課題が存在する。
- LiDARに依存せず,カメラ制御による高精度なビデオ合成を実現し,自動運転のデータ拡張を可能にする。
- ReCamDrivingは,構造的に完全な3DGSレンダリングを幾何学的な指針として利用する,純粋なビジョンベースのフレームワークである。
- 2段階のプログレッシブな訓練パラダイムを採用し,粗い制御と微細な視点・幾何学的なガイダンスを組み合わせる。
- 3DGSに基づいたクロス軌道データキュレーション戦略により,一方向のビデオから一貫した横方向の軌道監視を可能にするParaDriveデータセットを構築した。
T2VAttack:テキストから動画への拡散モデルに対する敵対的攻撃 [cs.CV]目的:テキストから動画への拡散モデルの敵対的攻撃に関する包括的調査
- テキストから動画への生成技術は急速に進歩しており,その応用範囲は広い。
- 拡散モデルの安全性に関する研究は十分ではなく,敵対的攻撃に対する脆弱性が懸念される。
- 現在の拡散モデルの潜在的な脆弱性を明らかにし,堅牢性を評価することを目的とする。
- わずかなプロンプトの変更(単語の置換や挿入)が,動画のセマンティックな忠実度と時間的ダイナミクスを著しく低下させる。
- T2VAttack-Sは,プロンプト中の重要な単語を同義語に置き換えることで攻撃を行い,T2VAttack-Iは,最適化された単語を挿入する。
- ModelScope,CogVideoX,Open-Sora,HunyuanVideoを含む最先端のT2Vモデルに対する敵対的攻撃の有効性を示す。
分割不能なアイテムのグループ間での公正な分割に関する上限 [cs.GT]目的:カップル間の分割不能なアイテムの公正な割り当ての限界
- 資源配分は,経済学,コンピュータサイエンス,日常生活において重要な問題である。
- 分割不能なアイテムの公正な分割は,複雑な組み合わせ最適化問題であり,困難を伴う。
- カップル間のアイテム分割における嫉妬の自由度の限界を明らかにすること。
- エージェント数n,カップル数n/2のインスタンスにおいて,嫉妬の自由度を√nアイテムまで保証できない下限を示す。
- グループ数k,エージェント数nの一般的なモデルにおいて,嫉妬の自由度を√n-kアイテムまで保証できない下限を示す。
- 素数冪であるkに対して,上限O(min{√(n-k)log k, n-k})を証明し,残りの疎な領域に対して改善された上限を示す。
自動マーケットメーカーにおける防御的リバランス [cs.GT]目的:アービトラージによる価値漏洩から自動マーケットメーカー(AMM)を保護するメカニズム
- 分散型金融(DeFi)におけるAMMの重要性が増しており,流動性維持が不可欠である。
- AMMはアービトラージに脆弱であり,流動性プロバイダーに損失をもたらす可能性がある。
- アービトラージからAMMを保護し,流動性プロバイダーの利益を最大化すること。
- 本研究で導入された防御的リバランスは,AMM間の直接的な資産移動によってアービトラージを防ぐ。
- リバランスにより,一部のAMMの流動性を増加させ,他のAMMの流動性を損なうことなく,アービトラージフリーな状態に移行できる。
- 最適なリバランス問題は凸最適化問題として定式化でき,効率的な解法が存在する。
クラスの進化に対応:段階認識型クラス増分学習のためのベンチマークとフレームワーク [cs.DC, cs.DB, cs.LG, cs.CV]目的:段階認識型クラス増分学習における,クラス内形態変化とクラス間忘却の評価
- 機械学習における継続学習は,限られたリソースで効率的に知識を獲得するために重要である。
- 既存のクラス増分学習手法は,クラスの形態が静的であるという前提に依存しており,現実世界のデータには対応が難しい。
- 本研究は,クラスの形態的進化を考慮した新たな継続学習パラダイムを提示し,その評価基準を提供する。
- 段階認識型クラス増分学習(Stage-CIL)というパラダイムを新たに定義し,クラスの形態変化に対応する学習を可能とした。
- 10ドメイン,2段階のベンチマークデータセットStage-Benchを構築し,クラス間忘却と段階レベルの性能劣化を評価できる環境を整備した。
- 固定サイズメモリプールを活用したSTAGEを提案し,既存手法と比較して優れた性能を示すことで,進化を意識したモデリングの有効性を実証した。
手術室における自己教師あり非キャリブレーションマルチビュー動画匿名化 [cs.CV]目的:手術室における動画データのプライバシー保護
- 手術室の研究において,患者のプライバシー保護は不可欠であり,動画データ活用には必須である。
- 既存手法は,新たな臨床環境への適応に手動アノテーションが必要であり,カメラ再配置時のキャリブレーションが課題である。
- 本研究は,アノテーションやカメラキャリブレーションなしに,手術室動画の匿名化を効率的に行うことを目指す。
- 提案手法は,時間的・マルチビュー文脈を利用し,検出漏れを補完する自己教師ありドメイン適応によって検出精度を向上させる。
- 4D-ORデータセットと実手術データセットにおいて,それぞれ99%と97%の高い再現率を達成した。
- 生成された擬似ラベルを用いてリアルタイム全身検出器を学習し,実用的な性能を実証した。
効率的な計算病理のための展開に優しい基盤フレームワーク [cs.CV, cs.AI]目的:計算病理タスクにおける効率的な画像解析のための基盤フレームワーク
- 病理画像解析は,疾患の診断精度向上や創薬に不可欠であり,医療分野において重要性が増している。
- 既存の病理画像解析モデルはパラメータ数が多く,計算資源を大量に消費するため,実用的な展開が困難である。
- 本研究は,計算資源の制約下でも高性能な病理画像解析を実現し,実用的な展開を可能にすることを目的とする。
- LitePathは,Virchow2と比較してパラメータ数を28分の1,FLOPsを403.5分の1に削減した。
- NVIDIA Jetson Orin Nano Super上で,Virchow2の104.5倍の速度でスライドを処理し,消費電力も171分の1に抑制された。
- 45の多施設共同コホートにおいて,LitePathは平均ランクでVirchow2を上回り,分類タスクと生存分析タスクで同等以上の性能を維持した。
スタイルを考慮した光沢制御による生成的な非フォトリアリスティックレンダリング [cs.GR, cs.CV]目的:生成モデルにおける光沢と芸術様式の表現
- 視覚情報から材質を認識する能力は,絵画や絵画などの芸術的表現においても重要である。
- 光沢は材質の重要な要素だが,芸術様式との関係性や制御方法が十分には解明されていない。
- 光沢と芸術様式を分離して制御することで,より詳細な非フォトリアリスティック画像生成を目指す。
- 学習モデルの潜在空間において,光沢が他の視覚要素から分離されていることが明らかになった。
- この表現を利用し,潜在拡散モデルへの軽量アダプターを導入することで,光沢の微調整が可能となった。
- 提案手法は既存モデルと比較して,学習された要素の分離性と制御性に優れていることが示された。
Fusion-Poly:空間的・時間的融合に基づく3Dマルチオブジェクトトラッキングの多面体フレームワーク [cs.CV, cs.RO]目的:3Dマルチオブジェクトトラッキングにおける,非同期LiDARとカメラデータの空間的・時間的融合
- 自動運転やロボティクスにおいて,周囲環境の正確な把握は不可欠であり,3Dオブジェクトトラッキングはその重要な要素である。
- LiDARとカメラは異なるサンプリングレートで動作するため,データの時間的整列が課題であり,高頻度な情報活用が困難である。
- 非同期データの有効活用により,軌道推定の精度向上と,よりロバストなトラッキングを実現することを目的とする。
- Fusion-Polyは,同期フレームと非同期フレームを区別し,利用可能な検出モダリティに応じて適応するカスケードマッチングモジュールを導入した。
- 高頻度なモーション予測,差分更新,および信頼度に基づいたライフサイクル管理により,軌道推定の精度と安定性を向上させた。
- nuScenesテストセットにおいて,76.5%のAMOTAを達成し,トラッキング・バイ・ディテクション方式において最新技術を確立した。
SAMSEM:IC金属配線セグメンテーションのための汎用性と拡張性のあるアプローチ [cs.CR, cs.CV]目的:IC金属配線セグメンテーションの実現
- グローバル化するサプライチェーンにおいて,ハードウェアコンポーネントの信頼性確保が重要課題となっている。
- 従来の機械学習モデルは,製造プロセスや技術の違いにより,ICごとにパラメータ調整が必要であり,汎用性に課題があった。
- 異なるIC間での金属配線検出精度の向上を目指し,汎用的なセグメンテーション手法を開発する。
- Meta社のSAM2をIC金属配線セグメンテーションに適用し,多スケールセグメンテーションアプローチを開発した。
- ピクセルベース損失に加え,トポロジーベース損失を用いることで,電気的接続性を重視したセグメンテーションを実現した。
- 14種類のICから収集した大規模データセットを用いてファインチューニングを行い,高い汎化性能を実証した。
画像セグメンテーションにおける不確実性量化と絡み合いの再考 [cs.CV]目的:画像セグメンテーションにおける不確実性の評価と解明
- 医療画像セグメンテーション等の安全性が重要な分野において,不確実性の定量化は不可欠である。
- 不確実性の分解における,データ由来の不確実性とモデル由来の不確実性の間の絡み合いが,解釈性と実用性を損なう問題がある。
- 様々な不確実性モデリング手法の組み合わせにおける絡み合いを定量化し,その影響を評価することで,より信頼性の高いセグメンテーションを目指す。
- アンサンブル法は,他の手法と比較して一貫して低い絡み合いを示し,優れた性能を発揮する。
- Softmaxモデルは,較正性能においてデータセットに依存するものの,多くの場合,他のデータ由来の不確実性モデリング手法を上回る。
- Softmaxアンサンブルは,すべてのタスクにおいて顕著な性能を示す。
網膜底写真のための解釈可能な基盤モデルへ [cs.CV, cs.LG, stat.CO]目的:網膜底写真の解釈可能性
- 眼科領域では,正確な診断が不可欠であり,AIの活用が期待されている。
- 既存の基盤モデルはブラックボックス化しており,判断根拠の説明が困難である。
- 解釈可能性を重視した基盤モデルを構築し,信頼性の高い診断支援を目指す。
- 提案手法DualIFMは,BagNetバックボーンにより,モデルの意思決定過程に忠実なクラスエビデンスマップを生成する。
- DualIFMは,2次元投影層を通じて表現空間を可視化し,臨床的に意味のあるクラスターや潜在的な相関関係を明らかにする。
- 80万枚以上の網膜底写真を用いて学習したDualIFMは,パラメータ数が16倍多いRETFoundと同等の性能を達成し,未知データに対しても解釈可能な予測を提供する。
OsteoFlow:リャプノフ則に基づくフロー蒸留による下顎再建後の骨リモデリング予測 [cs.CV]目的:下顎再建後の骨リモデリング予測手法
- 下顎再建後の長期的な骨変化予測は臨床的に重要であり,治療計画や患者予後の改善に貢献する。
- 既存の生成モデルは,長期予測において軌跡の一貫性や解剖学的正確性を維持することが困難である。
- 本研究は,データが少ない状況下でも長期的な骨リモデリング予測を可能とする手法を開発する。
- OsteoFlowは,術後5日目のCT画像から1年後のCT画像を予測するフローベースのフレームワークである。
- リャプノフ則に基づく軌跡蒸留により,幾何学的な対応関係を維持しつつ,生成能力を損なわない。
- 344のROIにおける評価の結果,OsteoFlowは既存手法を大幅に上回り,切除領域における平均絶対誤差を約20%削減した。
HyVIC:変分オートエンコーダに基づくメトリック駆動型空間・スペクトルハイパースペクトル画像圧縮アーキテクチャ [cs.CV]目的:ハイパースペクトル画像圧縮における空間・スペクトル特徴学習の効果
- リモートセンシングにおけるハイパースペクトルデータ量は急増しており,効率的な圧縮技術が不可欠である。
- 既存の圧縮手法は自然画像向けに設計されたモデルを流用しており,ハイパースペクトル画像の特有の冗長性を考慮していない。
- ハイパースペクトル画像に特化した空間・スペクトル特徴学習により,圧縮性能の向上を目指す。
- 提案手法HyVICは,空間・スペクトル特徴学習を独立に制御可能であり,高い再構成精度を実現する。
- 様々な圧縮率において高い空間・スペクトル再構成精度を達成し,最先端技術を最大4.66dB上回るBD-PSNRを記録した。
- 実験結果に基づき,学習型変分ハイパースペクトル画像圧縮に関する指針を提示する。
StereoVGGT:ステレオ視覚のための学習不要な視覚幾何変換器 [cs.AR, cs.CV]目的:ステレオ視覚タスクにおける高性能な特徴抽出バックボーンの提案
- 3Dデバイスの進化に伴い,ステレオ視覚は重要な研究分野となっている。
- 既存のバックボーンはカメラポーズの明示的な学習を欠き,性能のボトルネックとなっている。
- VGGTの幾何学的詳細劣化を軽減し,ステレオ視覚に適した特徴抽出を実現する。
- 提案手法StereoVGGTは,KITTIベンチマークで公開されているすべての手法の中で1位を獲得した。
- StereoVGGTは,事前に学習済みのVGGTを活用し,学習不要な特徴調整パイプラインを導入することで,幾何学的劣化を抑制する。
- これにより,モデル内に埋め込まれたカメラキャリブレーション知識を活用し,相対的なタスクにおいて高い有効性を示す。
NearID:ニアアイデンティティ識別子を用いたアイデンティティ表現学習 [eess.SY, cs.SY, cs.CV]目的:アイデンティティ表現の信頼性向上
- パーソナライズ生成や画像編集において,視覚エンコーダの性能が重要である。
- 既存のエンコーダは,アイデンティティと背景の文脈が混同されている場合がある。
- 背景文脈の影響を排除し,アイデンティティを識別可能な信号として分離すること。
- ニアアイデンティティ識別子を用いたデータセットNearID(19Kアイデンティティ,316K識別子)を構築した。
- 厳格な評価プロトコル下で,事前学習済みのエンコーダは低い識別率(SSR)を示すことが確認された。
- 凍結されたバックボーン上で,階層的なコントラスト学習によりSSRを99.2%に向上させ,人間による評価との整合性も高めた。
VLMは言葉を必要とする:視覚言語モデルは意味的アンカーを優先し,視覚的な詳細を無視する [cs.CV, cs.CL]目的:視覚言語モデルにおける詳細な視覚認識の失敗原因の解明
- 視覚言語モデルはマルチモーダルタスクで高い性能を示すが,詳細な視覚的知覚を要するタスクでは失敗することがある。
- 視覚的な情報は内部表現に存在しても,詳細な視覚的知覚が十分に活用されていないという問題がある。
- 言語モデルが持つ意味ラベルの欠如が,視覚情報の利用を妨げている点を明らかにし,その対策を探る。
- 視覚言語モデルは,視覚的な要素を既知の概念にマッピングできる場合,言語を通して推論を行う傾向がある。
- マッピングが困難な場合,モデルは不安定で誤った記述に頼ってしまうことが確認された。
- 未知の要素に任意の名前を付与することで性能が向上し,タスク固有のファインチューニングはさらなる汎化性能をもたらす。
タロットSAM3:参照表現セグメンテーションのための訓練不要SAM3 [cs.CV]目的:あらゆる参照表現セグメンテーションの実現
- 画像と自然言語の理解を結びつける参照表現セグメンテーションは,AI研究において重要である。
- 既存手法は大規模データセットに依存し,表現の種類の一般化が課題であった。
- 本研究は,訓練なしで任意の参照表現に対応できるフレームワークを開発し,この課題を解決する。
- 提案手法Tarot-SAM3は,表現の解析と評価を支援するReasoning Interpreter (ERI) を導入し,SAM3へのプロンプトを改善する。
- Mask Self-Refining (MSR) フェーズでは,DINOv3の特徴を用いてマスクを比較・修正し,セグメンテーション精度を高める。
- 実験により,Tarot-SAM3が明示的・暗黙的な参照表現セグメンテーションにおいて高い性能を示すことが確認された。
自然環境下における単一画像反射除去に関するNTIRE 2026チャレンジ:データセット,結果,および手法 [cs.CV]目的:単一画像反射除去タスクにおける最先端技術の進歩
- 画像修復において,反射除去は重要な要素であり,より自然な画像を復元する上で不可欠である。
- 既存研究の多くは合成データや限定的な実データに依存しており,現実世界の応用における性能評価に課題がある。
- 現実世界の多様な反射状況に対応できるデータセットと,それを用いた高性能な反射除去手法の開発。
- NTIRE 2026チャレンジでは,現実世界の様々な反射に対応したデータセットOpenRR-5kが提供された。
- チャレンジには100名以上が登録し,最終評価段階には11チームが参加した。
- 上位手法は反射除去性能を向上させ,専門家から高い評価を得た。
人間志向セマンティック画像品質評価 LoViF 2026 チャレンジ:手法と結果 [cs.CV]目的:人間志向セマンティック画像品質評価の新たなベンチマーク構築
- 画像処理技術の発展に伴い,人間の視覚特性に合致した品質評価の重要性が増している。
- 既存の画像品質評価は,セマンティック情報の損失を人間目線で捉える点が不十分である。
- セマンティック情報の損失を考慮した画像品質評価手法の開発を促進すること。
- LoViF 2026 チャレンジでは,人間志向セマンティック画像品質評価のためのSeIQAデータセットが構築された。
- 58チームが登録し,6チームが最終テスト段階で有効な解答を提出した。
- 提出された手法はSeIQAデータセット上で最先端の性能を達成した。
微視的・巨視的ギャップの架橋:周波数認識型セマンティックアライメントによる画像操作局所化 [cs.CV]目的:画像操作局所化の精度向上
- 画像生成技術の進展に伴い,画像操作の検出・局所化技術の重要性が増している。
- 既存手法は,低レベルな特徴や高レベルな意味情報のみに依存し,両者の統合が課題である。
- 伝統的な操作と拡散生成による操作の両方を局所化できる汎用的な枠組みを構築する。
- 提案手法FASAは,適応的な二重帯域DCTモジュールとパッチレベルのコントラスティブアライメントにより,周波数特性とセマンティック情報を効果的に統合する。
- セマンティック情報を周波数パスウェイに注入するsemantic-frequency side adapterにより,多スケール特徴間の相互作用を実現し,局所化精度を向上させる。
- OpenSDIや既存のベンチマークにおいて,最先端の局所化性能,汎化性能,およびロバスト性を示す。
オンライン学習からマルチキャリブレーションへの効率的なブラックボックス還元と,Φ後悔最小化への新たな経路 [cs.LG, cs.GT]目的:オンライン学習とオンラインマルチキャリブレーション間の還元
- 機械学習の分野において,予測の精度向上と信頼性評価は重要な課題である。
- マルチキャリブレーションは高次元データにおいて効率的なアルゴリズムが確立されていなかった。
- オンライン学習の理論と手法を応用し,効率的なマルチキャリブレーションを実現する。
- オンライン学習アルゴリズムと期待変分不等式(EVI)ソルバーの組み合わせにより,高次元マルチキャリブレーションが可能となることが示された。
- 本研究は,既存アルゴリズムの分析を統一し,オンライン学習からマルチキャリブレーションへの保証を転送する。
- オンラインマルチキャリブレーションからΦ後悔最小化への還元を通じて,新たな経路が確立され,既存の結果が簡略化され,改善されたレートが得られた。
話者T2AV: 自己回帰拡散モデリングによる音声と動画の同時生成 [cs.CV, cs.CL, cs.MM, cs.SD, eess.AS]目的:音声と動画の同時生成におけるクロスモーダル整合性の向上
- 近年,マルチモーダルなコンテンツ生成の重要性が高まっており,特に音声と動画の同時生成は注目されている。
- 既存モデルでは,高レベルな意味情報と低レベルな詳細情報を過度に絡め合い,効率が低下している。
- 本研究では,高レベルな情報を共有しつつ,低レベルな情報をモダリティ固有に処理することで,効率と品質を向上させる。
- Talker-T2AVは,音声と動画のクロスモーダル整合性,動画品質,音声品質において,既存の二分岐ベースラインモデルを上回る性能を示した。
- 特に,唇のシンクロ精度が向上し,カスケードパイプラインよりも一貫性のあるコンテンツを生成できることが確認された。
- 共有された自己回帰言語モデルが,音声と動画を統合的なパッチレベルのトークン空間で推論する点が有効である。
TransVLM:あらゆるショット遷移を検出するためのビジョン言語フレームワークとベンチマーク [cs.CV, cs.AI]目的:ショット遷移検出タスクの形式化と,それに対応するビジョン言語モデル(VLM)フレームワークTransVLMの提案
- 動画解析において,正確なショット境界検出は,動画の構造理解やコンテンツ検索に不可欠である。
- 従来のショット境界検出は,複雑な遷移に対して脆弱であり,動画ショットが破損する可能性がある。
- 連続的な時間的セグメントとして遷移を明示的に検出することで,ショット遷移検出の精度向上を目指す。
- TransVLMは,色と光学的フローを組み合わせた特徴表現を直接処理することで,時間的な認識能力を大幅に向上させる。
- 大規模なデータ合成エンジンと包括的なベンチマークを開発し,ロバストな学習を可能にした。
- 実験の結果,TransVLMは従来のヒューリスティック手法や最先端のVLMを凌駕する優れた性能を示した。
CHASE:曖昧性に対応した選択的予測のための競合仮説 [cs.HC, cs.CV]目的:曖昧性に対応した選択的予測における,競合仮説の比較による意思決定または差し控えの判断
- 部分的な情報しか得られない状況下での確実な意思決定は困難であり,信頼性の高い不確実性推定が重要となる。
- 従来の選択的予測法は,局所的な矛盾した証拠により誤った確信度を導き出す場合がある。
- 競合仮説を明示的に比較することで,真の曖昧性を捉え,より安全な意思決定を可能にすること。
- 競合仮説を考慮したCHASEは,従来の不確実性推定手法と比較して,全体的な棄権しない正答率,三方向正答率,および曖昧性に対応した棄権率で統計的に有意な改善が見られた。
- 特に,非常に高い曖昧性条件下において,全体的な整合性が最大11.0%,三方向正答率が最大8.8%相対的に向上した。
- 80%のカバレッジにおいて,CHASEは最高のベースラインと同等の選択的リスク境界を維持しつつ,90%のカバレッジでは全体的なリスクを9.9%削減した。
MedCRP-CL:ベイジアン非パラメトリック意味モダリティ探索による継続的な医用画像セグメンテーション [cs.CV, cs.LG]目的:継続学習における医用画像セグメンテーションのためのタスク構造のオンライン探索と構造を考慮した継続学習
- 医用画像セグメンテーションは医療診断・治療において不可欠であり,その精度向上は患者予後の改善に繋がる。
- 既存の継続学習手法は,タスク間の競合により性能が低下するか,事前定義されたタスク分類に依存する。
- 本研究は,タスク構造を動的に探索し,知識転移を促進することで,医用画像セグメンテーションの継続学習における性能低下を抑制する。
- 提案手法MedCRP-CLは,臨床テキストプロンプトからタスク構造を動的に推論し,意味モダリティと呼ばれるグループを形成する。
- 意味モダリティごとにLoRAアダプタを維持し,モダリティ内EWCによる正則化を行うことで,パラメータの分離と知識転移を両立する。
- 16の医用セグメンテーションタスクにおいて,MedCRP-CLはベースラインを8.0%上回り,パラメータ数を6分の1に削減しつつ,Dice係数73.3%と忘却率4.1%を達成した。
Stream3D:エビデンスメモリによる逐次マルチビュー3D生成 [cs.CV]目的:逐次的なマルチビュー3D生成の実現
- 現実世界では,視覚情報は連続的な映像ストリームとして提供されることが多い。
- 既存の3D生成モデルは,単一の画像から高品質な3Dモデルを生成するが,ストリームデータに対しては時間的な一貫性が課題。
- ストリームデータに対する時間的一貫性を保ちつつ,3D生成を行う手法の確立。
- Stream3Dは,既存の3D生成モデルを再学習なしでストリームデータに対応させる初のシステム。
- エビデンスメモリと呼ばれるコンパクトなメモリを用いて,過去のフレームを選択的にキャッシュすることで時間的一貫性を実現。
- 実験により,Stream3Dは既存手法と比較して,フォトメトリックおよび幾何学的評価指標において優れた性能を示した。
GEM-4D:幾何学的情報を強化した動画ワールドモデルによるロボット操作 [cs.CV, cs.RO]目的:ロボット操作のための動画ワールドモデル
- ロボットが現実世界で自律的に行動するためには,周囲の環境を正確に理解する必要がある。
- 従来の動画ワールドモデルは見た目はリアルだが,物理的な一貫性に欠ける場合がある。
- この研究は,幾何学的情報を活用することで,より物理的に整合性の高い動画生成を目指す。
- GEM-4Dは,事前学習済みの幾何モデルから抽出した4D対応情報を注入することで,動画生成の物理的精度を向上させた。
- これにより,動画予測と幾何学的整合性の両方で,最先端の性能を達成した。
- 実世界でのロボット操作の成功率を61%から81%に改善した。
ActQuant:視覚言語行動モデルのための行動誘導型4bit未満量子化 [cs.CV, cs.AI]目的:視覚言語行動モデルの効率的な量子化手法の開発
- ロボットの自律行動を実現する上で不可欠な視覚言語行動モデルの重要性が高まっている。
- エッジデバイスでの利用のためには計算量の削減が課題であり,量子化が有効な手法である。
- 既存の量子化手法では性能劣化が大きいため,より効果的な量子化手法が求められている。
- ActQuantは,行動予測への貢献度に応じて重み行列にビット幅を割り当てることで,低ビット量子化における性能劣化を抑制する。
- アクションに配慮した曲率を用いてブロックごとの量子化スケールを最適化し,制御に影響の大きい重みに動的範囲を集中させる。
- 実機UR3アームでの実験により,ActQuantはベースラインと同等の成功率を維持しつつ,メモリフットプリントを2.5倍削減することを示した。
OmniTryOn:一度に何でも試着! [cs.CV]目的:多様な着用物を動画内の人物に同時に転送するタスクの実現
- 動画の仮想試着技術は,ECサイト等での購買体験向上に不可欠である。
- 既存手法は単一の衣類の転送に限定され,複数オブジェクトの同時試着が困難である。
- 外部事前知識への依存を解消し,自然な物理シミュレーションと高品質な映像を実現する。
- 提案手法 OmniTryOn は,既存の動画仮想試着モデルや汎用的な動画編集手法を大幅に上回る性能を示す。
- First Frame Wearable Cache戦略により,初期フレームから多様な着用物を直接生成プロセスに提供する。
- Spatiotemporally Consistent RoPE (STC-RoPE) により,複雑な人体動作と背景のダイナミクスを厳密に保持する。
距離に基づいたメモリ集約:自己回帰型ビデオ拡散モデルにおける [cs.CV]目的:自己回帰型ビデオ生成における長期的な一貫性向上
- ビデオ生成技術は,コンテンツ制作や多様な応用において重要性を増している。
- ビデオ長が長くなるにつれて,KVキャッシュのサイズが膨大になり,計算資源の制約となる。
- 固定されたキャッシュ予算内で,過去の情報を効率的に集約し,長期的な一貫性を維持すること。
- FadeMemは,距離に基づいてKVブロックを階層的に組織することで,メモリ効率を向上させる。
- 詳細な情報は急速に失われ,粗いシーン構造は長期的に有用であるという仮説に基づいている。
- アーキテクチャ変更なしに,長期的な一貫性と視覚品質を両立し,さらに動的なモーションを改善する。
拡散Transformerにおける専門家分解と特徴再利用の整合:MoECa [cs.LG, cs.CV]目的:拡散Transformerの効率化のためのキャッシュ機構
- 拡散モデルは高品質な画像生成を可能にするが,計算コストが高い。
- MoEを用いた拡散Transformerは計算効率の改善が見られるものの,タイムステップ間の冗長計算がボトルネックとなる。
- 専門家分岐レベルでの特徴再利用により,タイムステップ間の冗長性を低減し,推論速度を向上させる。
- MoECaは専門家分岐レベルでキャッシュを行うことで,既存のトークンレベルのキャッシュ手法よりも効率的に計算量を削減する。
- MoECaは専門家を考慮した適応制御と同期されたキャッシュ更新により,中間状態の安定性を維持する。
- 実験により,MoECaは生成品質を維持しつつ,最大2.93倍の高速化を実現することが示された。
SIFT:ビデオ拡散モデルにおける物理的に妥当なモーションのための自己想像による微調整 [cs.CV]目的:ビデオ拡散モデルにおける物理的に妥当なモーションの生成
- 近年のビデオ生成技術の発展は目覚ましいが,生成されるモーションの物理的妥当性が課題となっている。
- 既存のビデオ拡散モデルは,データバイアスと再構成ベースの学習設計により,モーションエンタングルメントを起こしやすい。
- 自己想像による微調整(SIFT)により,再構成の近道から脱却し,物理的に妥当なモーションを学習することを目指す。
- 提案手法SIFTは,モデルが生成したビデオから学習することで,現実のビデオの再構成に依存しない学習を実現する。
- モーションを意識した識別的な教師信号と,段階的なハードケースリプレイ戦略を用いることで,学習の安定化と高速化を図った。
- 実験の結果,生成ビデオの物理的リアリズム,モーションの分離性,制御性が大幅に向上することが示された。
VLAFlow:共同学習と未来潜在的アラインメントによる視覚言語行動モデルの統合的学習フレームワーク [cs.CV, cs.AI, cs.RO]目的:視覚言語行動モデルの学習パラダイムの比較可能性向上
- ロボット操作の高度化に貢献する視覚言語行動モデルの研究が活発である。
- 既存モデルは構造やデータが異なり,学習パラダイムの効果を比較しづらい問題がある。
- 学習パラダイムの効果を公平に比較するための統一的なフレームワークを構築する。
- VLAFlowは,異なる学習目標を比較するための統一的なフローマッチングフレームワークを提供する。
- 言語による監督学習は,視覚言語の汎化性能を維持するのに役立つことが示された。
- 未来潜在的アラインメントは状態遷移と行動結果のモデリングを改善し,MindLWPIが最も安定した性能を示した。
等変深層学習の基礎:グラフニューラルネットワークと層ニューラルネットワークの統合 [cs.LG, cs.AI, cs.CV]目的:等変ニューラルネットワークの理論的基盤
- 自然や社会には対称性が遍在する。深層学習において対称性を考慮することで,汎化性能向上やデータ効率化が期待される。
- 幾何学的深層学習とトポロジカル深層学習は,それぞれ異なるアプローチで対称性を扱っており,統合的な枠組みが存在しない。
- 面順序(面カテゴリ)上の等変バンドルを用いて,グラフニューラルネットワークと層ニューラルネットワークを統一的に表現する。
- 線形順序等変写像の表現を特徴づけ,等変ニューラルネットワーク(OENN)の層を構築した。
- 連続順序等変写像に対する普遍近似定理を証明し,層ニューラルネットワークへの応用可能性を示した。
- OENNとカテゴリ等変ニューラルネットワーク(CENN)の関係を明確にし,より一般的なカテゴリ的対称性の活用を示唆した。
視覚と言語モデルにおけるエラーの原因:見落としなのか知識不足なのか [cs.CV, cs.CL]目的:知識集約型視覚質疑応答におけるエラーの分類と原因特定
- 近年,視覚と言語を組み合わせたモデルが発展しているが,その性能向上にはさらなる理解が必要である。
- 既存研究では,エラーを個別に分析するか,単純な誤りとして扱うため,根本的な原因の特定が困難である。
- 本研究は,エラーを構造的に分類し,モデルのどの段階で問題が発生しているかを明らかにすることを目指す。
- 知識集約型視覚質疑応答において,エラーはエンティティ認識の前,または認識後で発生することが確認された。
- 視覚トークン表現はエンティティ認識に関連する判断に有効であり,プロンプトの隠れ状態は回答の成功を予測する上で有用であった。
- エラー原因の特定に基づいた介入手法(画像修復,エンティティ補足,質問の書き換えなど)への応用が期待される。
単一カメラを超えて:スポーツビデオ理解における能動的な多視点推論 [cs.CV]目的:スポーツビデオ理解のための多視点推論のベンチマークとフレームワーク
- スポーツビデオは,動きが速く遮蔽も多いため,単一視点での理解が困難である。
- 既存のベンチマークは,スポーツビデオにおける多視点情報の活用能力を評価していない。
- 多視点ビデオを活用したスポーツビデオ理解の性能向上を目指す。
- 本研究では,公式試合記録に基づいた多視点ビデオベンチマーク「SportMV-Bench」を開発した。
- 既存のMLLMは,多視点情報を効果的に活用できておらず,ボトルネックは視覚的認識と視点選択にあることが示された。
- 能動的な視点選択と証拠に基づく推論を行う「SportMV-Agent」が,既存モデルを15.61%上回る性能を示した。
ニューラルモルフィング:ニューラル音声コーデックにおけるシーケンス最適化トークンレベルモルフィング [cs.SD]目的:ニューラル音声コーデックにおけるトークンレベルの音声変換手法
- 音声圧縮技術の発展は,高品質な音声伝送と保存に不可欠である。
- 既存のコーデックでは,音色の制御や詳細な音声編集が困難である。
- ユーザーが指定した音色を効率的に組み込み,リアルタイムで音声変換を実現する。
- ニューラルモルフィングは,学習を必要とせず,トークン領域で音声効果を適用する。
- 残差ベクトル量子化(RVQ)トークンを利用し,ユーザーパレットから適切なトークンを選択・置換する。
- リズム構造を維持しつつ,音色や残差の詳細をパレットから付与することで,自然なハイブリッドな音声を生成する。
10億パラメータを超えるマルチモーダル感情言語モデルは本当に必要か? [cs.AI, cs.CL, cs.CV, cs.MM]目的:マルチモーダル感情認識の効率的なフレームワーク開発
- ロボットやモバイルデバイス等のリソース制約のある環境でのリアルタイム展開が求められている
- 既存のマルチモーダル大規模言語モデルはパラメータ数が多く,計算コストが高い
- 小規模なモデルでも高性能なマルチモーダル感情認識を実現し,効率的な展開を可能にする
- 知識蒸留により,大規模モデルの知識を10億パラメータ以下の軽量なモデルに効率的に転移させるLight-MERを提案した。
- 最適な輸送損失と多報酬最適化戦略を導入し,Light-MERの学習能力を向上させた。
- 9つのベンチマークデータセットで最先端の性能と推論効率の向上が確認された。
ドリフトワールド:ドリフトによる高速な世界モデル構築 [cs.RO, cs.CV, cs.LG]目的:ロボットの行動計画のための高速な世界モデルの構築
- ロボットの自律的な行動において,未来予測は重要な役割を果たす。
- 拡散モデルは高精度だが,サンプリングに時間がかかり,リアルタイム制御のボトルネックとなる。
- ドリフトモデルを用いて,高速かつ高精度な未来予測を実現し,ロボットの計画能力を向上させる。
- ドリフトワールドは,拡散モデルと比較して17倍高速に未来フレームを生成できる。
- 標準的なロボット操作ベンチマークにおいて,最先端の意思決定性能を達成した。
- オフラインシミュレーターとしても活用でき,実世界のロボットポリシーの評価と高い相関を示した。
フレティク:エンジニアリングされたスペクトル特徴と保留評価によるブラウザネイティブなエレキギター弦分類 [cs.NI, cs.SD, cs.LG, eess.AS]目的:単音のエレキギター音声から,特定のピッチをどの弦が生成したかを分類すること
- ギター演奏における音響分析は,音楽情報処理の重要な分野であり,自動演奏支援や音楽教育への応用が期待される。
- 単一のピッチは複数の弦で生成可能であり,音色の違いは訓練されていない人間には認識が難しいという課題がある。
- ブラウザ上で動作する弦分類システムを構築し,実演奏データに対する汎化性能を評価することを目的とする。
- 26次元の特徴量表現(周波数帯域エネルギー,スペクトル統計量,13個のメル周波数ケプストラム係数)を用いて,97.25%という高い分類精度をフレームレベル検証分割で達成した。
- 比較学習法を導入し,同一ピッチの弦ペアのデータを収集することで,精度が25.78%向上することが確認された。
- 保留評価による検証では,シャッフル分割による精度よりも低い結果が得られ,シャッフル分割が現実の汎化性能を過大評価することが示された。
欠損部品検出における視覚言語モデルの限界:MissingBench-Verified [cs.HC, cs.RO, cs.CV]目的:視覚言語モデルが,画像内の必須部品の欠損を認識できない原因の検証
- 視覚言語モデルは画像認識の精度向上に貢献するが,誤認や幻覚といった課題も存在する。
- 現実世界の知識によるバイアスと,欠損部品を含む画像の学習データ不足が問題である。
- 視覚言語モデルの検査・監視タスクにおける根本的な限界を明らかにすること。
- 主要な10モデルに対し,必須部品が欠損した画像を検証した結果,高い誤認率が確認された。
- 画像処理ツール(トリミング,コントラスト調整等)の利用や,推論時間の延長,ファインチューニング等の既存の対策は,改善効果がほとんど認められなかった。
- これは,現在のプロンプトや事後修正技術ではこの問題に対処できないことを示唆し,アーキテクチャや学習方法の根本的な見直しが必要である。
3D膝MRIセグメンテーションのための強度正規化手法の体系的なベンチマークとドメイン間汎化性能 [cs.CV, cs.AI]目的:3D膝MRIセグメンテーションにおける強度正規化手法の評価
- 医療画像における深層学習の臨床応用には,安定した性能が不可欠である。
- MRI画像ではスキャナーやプロトコルにより強度分布が異なり,汎化性能の課題となる。
- ドメイン間の強度分布のずれに対するロバストな正規化手法を特定する。
- Zスコア,Nyúlヒストグラムマッチング,CLAHEが他の手法よりも高いロバスト性を示した。
- データセット間での性能低下が大きく,強度正規化の効果は限定的であった。
- ドメインシフトへの対処など,他の戦略との組み合わせが重要である。
URHead:ヘッドアバターにおけるメッシュと3DGSの共同最適化のための統一UV空間表現 [cs.GR, cs.CV]目的:ヘッドアバターの高品質かつアニメーション可能な表現
- デジタルヒューマンの需要増加に伴い,リアリティと制御性の両立が重要課題となっている。
- メッシュ表現は形状制御に優れるが写実性が不足し,Gaussian表現は写実的だが構造の一貫性に課題がある。
- メッシュとGaussian表現の長所を統合し,高品質かつ制御可能なヘッドアバターの生成を目指す。
- 提案手法URHeadは,メッシュとGaussian表現を共通のUV空間で統合することで,両者の相乗効果を実現した。
- 適応的なGaussianサンプリングによる共同最適化により,各コンポーネントの役割を自動的に学習し,詳細な形状と写実性を両立した。
- URHeadは,既存手法と比較して,再構成品質とアニメーションの一貫性において優れた性能を発揮する。
Cortex:Quakeにおける凍結された視覚特徴を用いたコンパクトな行動模倣 [cs.CV, cs.AI, cs.LG]目的:Quakeにおける行動模倣ポリシーの限界
- ゲームAI研究は,人間らしい行動を再現し,複雑な環境で自律的に動作するAIを開発する上で重要である。
- 行動模倣は大量のデータに依存し,環境の変化に弱いという課題がある。
- 凍結された視覚特徴を用いることで,計算コストを抑えつつ,行動模倣の性能を向上させることを目指す。
- Cortexは,Quakeのデータセットで訓練された,比較的コンパクトな行動模倣ポリシーである。
- Cortexはレベルを完全にクリアすることはできないものの,初期段階のエリアは安定して到達し,一定のキル数を記録した。
- 視覚情報の密度を高めることで,戦闘能力と生存率が向上することが示された。
医療におけるワールドモデル:信頼性の高い臨床応用に向けた基盤,応用,課題 [cs.HC, cs.CV]目的:医療におけるワールドモデルの基盤,応用,および課題に関する知見の体系化
- 医療AIの発展には,静的な予測を超え,時間経過に伴う患者の状態変化を理解することが不可欠である。
- 既存の医療AIは,患者の状態変化や介入の効果を予測する能力に限界がある。
- 患者の状態変化をモデル化し,介入の効果をシミュレーションすることで,より高度な医療AIを実現する。
- 医療ワールドモデルは,患者の状態表現,時間的変化のモデリング,介入条件付きシミュレーション,医師による計画立案の4つの能力を中心に発展している。
- 現在の研究は,技術的な実現可能性を示しているものの,多くが過去データに依存し,特定のタスクや前臨床段階にとどまっている。
- 臨床応用には,精確な介入表現,強固な因果的根拠,不確実性の推定,安全性,そして多施設共同での前向き検証が重要となる。
知識誘導によるアトミックアクションを用いた行動の解きほぐしと認識 [cs.CV]目的:複雑なシーンにおける行動認識のための,知識誘導による行動表現の解きほぐし
- 行動認識は,ロボット工学やビデオ監視など,様々な応用分野において重要な役割を担う。
- 既存手法は,全体的な表現に依存しており,微妙な相互作用や細粒度の意味を捉えきれない。
- 本研究は,細粒度の意味知識を用いて行動表現を強化し,より正確な解きほぐしを可能にすることを目指す。
- 大規模言語モデルを用いて行動ラベルをアトミックアクションに分解することで,空間・時間的意味を明示的に提供する。
- 知識注入モジュール(KIM)は,アトミックアクションの知識をビデオ特徴に統合し,表現力を向上させる。
- 知識解きほぐしモジュール(KDM)と知識解きほぐし損失(KD Loss)により,行動知識のより明確な解きほぐしを促し,最先端の性能を達成する。
HERMES:PET/CTにおける頭頸部腫瘍のセグメンテーション,TN分類,および再発フリーサバイバル予測のためのハイブリッドアンサンブル [cs.CV, physics.med-ph]目的:頭頸部腫瘍のセグメンテーション,病期分類,再発フリーサバイバルの予測
- 頭頸部腫瘍の正確な診断と治療計画は,患者の予後を改善する上で極めて重要である。
- 従来の画像解析や病期分類は,主観的な判断に左右されやすく,精度に限界がある。
- PET/CT画像と臨床情報から,より客観的かつ高精度な腫瘍評価と予後予測を実現すること。
- HERMESは,腫瘍セグメンテーション,病期分類,再発フリーサバイバル予測を単一のコンテナ化されたアルゴリズムで統合した。
- セグメンテーション予測マスクから得られる幾何学的特徴量を活用することで,N病期分類の精度を向上させた。
- 独自のコンコーダンス追跡サバイバル損失関数を用いた深層学習モデルと臨床リスク専門家を組み合わせ,予後予測の精度を高めた。
HumanCLAW:ビジョン言語モデルは身体を介して行動できるか [cs.CV, cs.RO]目的:ビジョン言語モデルの行動能力の評価
- ロボット工学やAIにおいて,現実世界での行動は重要な課題である。
- VLMの行動決定と運動制御が密接に結びついており,失敗原因の特定が困難である。
- VLMの行動決定と低レベルな実行を分離し,行動知能を測定すること。
- HumanCLAWフレームワークを構築し,VLMの行動能力を評価した。
- HumanCLAW-Benchは,1218のエピソードから構成される大規模なベンチマークである。
- 最先端のVLM9つをテストした結果,いずれもベンチマークを解決できず,成功率は16.8%にとどまった。
JigShape:VLMにおける視覚幾何学的推論の評価 - ジグソーパズルを通じて [cs.CV, cs.AI]目的:視覚情報と幾何学的制約に関する推論能力の評価
- 視覚言語モデル(VLM)の性能向上には,視覚情報と幾何学的知識の統合が不可欠である。
- 既存のベンチマークは矩形カットを使用しており,テクスチャの繰り返し領域で曖昧な正解が生じる。
- 明確な正解が得られるジグソーパズルを用いて,VLMの幾何学的推論能力を評価し,課題を明確化する。
- 既存のVLMは,特に大規模なパズルにおいて幾何学的推論能力が著しく不足していることが示された。
- 教師ありファインチューニングは小規模なパズルで高い性能を示すが,パズルの規模が大きくなると性能が急激に低下する。
- この結果は,現在のモデルアーキテクチャが,ピース数の増加に伴う制約充足の一貫性を維持できないことを示唆している。
