arXiv雑要約
画像・音声 - 2026/08/04 公開
前治療CT画像からの多モーダルNSCLC生存予測のための構造的プロキシ特徴 [cs.CV, cs.AI]目的:非小細胞肺癌(NSCLC)の生存予測精度の向上
- 肺癌は世界的に死亡原因上位であり,治療効果の層別化は依然として困難である。
- 従来の画像特徴量は腫瘍内の不均一性を十分に捉えきれていない。
- 腫瘍の不均一性と形態間の相互作用を捉えるプロキシ特徴を導入し,予測精度向上を目指す。
- 提案手法は,既存の多モーダルモデルと比較して,Lung1コホートにおいてC-index 0.641,iAUC 0.731を達成した。
- シミュレーション由来のプロキシ特徴が,従来の画像特徴量,深層学習,臨床情報に加えて,予測情報を提供することが示唆された。
- 係数最適化分析では,最高C-index 0.662,iAUC 0.748が観察された。
十分支持ナッシュ均衡に対する支持縮小 [cs.GT, cs.DS]目的:双行列ゲームにおける十分支持ナッシュ均衡(WSNE)を計算するための構造的手続き
- ゲーム理論は,経済学,政治学,生物学など,多様な分野で意思決定の分析に不可欠である。
- ナッシュ均衡の計算は,特に大規模ゲームにおいては計算量が膨大になる場合がある。
- WSNEを効率的に計算することで,現実的なゲーム状況における均衡点の特定を可能にする。
- 支持縮小手続きは,行プレイヤーのマキシミン戦略と列プレイヤーのマキシミン戦略の支持を交互に保持することでWSNEを求める。
- この手続きは,合理的な双行列ゲームにおいて,1/2-WSNEを決定論的な多項式時間で計算するアルゴリズムを提供する。
- さらに,この手続きは,WSNEを求めるための問い合わせアルゴリズムの効率を改善する。
シーン2サウンド:3Dガウス世界のための聴覚に基づいたサウンドスケープ生成 [cs.DC, cs.DC, cs.MA, cs.CV, cs.MM, cs.SD]目的:3Dガウス世界における空間的に一貫性のあるサウンドスケープの生成
- 3Dコンテンツのリアリティ向上には,視覚情報に加えて聴覚情報の提供が不可欠である。
- 既存の音声生成手法は,視点に依存するため,移動するリスナーに対して一貫した音響体験を提供できない。
- 3Dガウス世界のオブジェクトを特定し,それらに音声を発することで,空間的に一貫性のあるサウンドスケープを実現する。
- 提案手法Scene2Soundは,学習を必要とせず,入力された3Dガウス世界からサウンドスケープを生成する。
- Scene2Soundは,視覚と言語モデルを用いて音源となるオブジェクトを特定し,3Dガウスセットマッチングによってそれらを3D空間に配置する。
- 生成された3DGS世界と実環境からの360度キャプチャで,既存手法と同等の音質を保ちながら,空間的な一貫性を実現することを検証した。
クロス投影:建築図面における視点変化を超える幾何学的根拠付け [cs.RO, eess.SY, cs.SY, cs.CV, cs.AI, cs.CL]目的:異種建築図面における構成要素の同一性保持と幾何学の外部化の診断
- 建築設計は,空間理解とコミュニケーションにおいて不可欠であり,その精度が重要である。
- 従来の画像認識は視点変化を前提とするため,建築図面の断面や立面といった異種図面に対応できない。
- 視覚言語モデルが,異なる種類の建築図面間で幾何学的な情報を正確に理解できるか検証する。
- GPT-5.5はカテゴリー判断で82.4%のスコアを達成し,Qwen3-VL-32B-InstructとGLM-4.5Vを上回った。
- 候補選択問題では高い性能を示す一方,自由な幾何学的ローカリゼーションは脆弱であり,特にQwenとGLMでは精度が低い。
- カテゴリーの正答率だけでは,候補なしでの空間的信頼性を保証できず,建築図面を用いたCAD/BIMシステムへの応用には注意が必要である。
DreamTraj:未レンダリング動画拡散潜在層から6自由度オブジェクト軌跡を生成 [cs.CL, cs.CV]目的:6自由度オブジェクト軌跡の生成
- ロボットの知覚と行動の連携には,正確なオブジェクト軌跡予測が不可欠である。
- 既存のデータセットは詳細な言語-運動アノテーションが不足しており,予測器は特権入力に依存している。
- 動画生成を経ずに,拡散モデルの内部表現から直接軌跡を復号する手法を確立すること。
- 提案手法DreamTrajは,単一のRGB画像とタスク指示から6自由度オブジェクト軌跡を予測する。
- DreamTrajは,マルチフレーム入力や特権入力を必要とせず,生成-抽出パイプラインより4.6倍高速に動作する。
- 翻訳および回転の予測において,既存の最先端手法を上回る性能を達成した。
SPAD強度画像化のための実用的なノイズモデリング [cs.DC, cs.CV]目的:SPAD強度画像におけるノイズモデリングと較正のフレームワーク
- 低照度下や高ダイナミックレンジな画像取得に有用なSPADカメラの活用が期待されている。
- SPADカメラは強度画像モードでは光子タイムスタンプを用いないため,ノイズ分解が困難である。
- 本研究では,SPADカメラの実用的なノイズモデリングと較正を行い,画像ノイズ低減を目指す。
- 提案手法では,二項分布に基づくフレーム累積モデルと,露出依存的な暗電流および露出非依存的なバイアス項を導入した。
- ピクセルごとの応答非一様性も考慮し,専用の較正手順とノイズ合成パイプラインを構築した。
- 実験結果から,提案するノイズモデルが優れていることが示された。
画像空間における規則発見 [cs.CV]目的:画像空間における視覚的規則の発見と問題解決
- 画像処理技術は,人間の視覚認知を模倣し,多様な応用分野で重要性が増している。
- 既存の画像編集モデルは,複雑な指示を理解し,正確に実行することが困難である。
- 本研究は,画像編集モデルが画像ベースの指示を理解し,自律的に問題を解決する能力を評価する。
- WISRDベンチマークを用いて,画像空間における規則発見能力を評価した結果,Nano Banana Proが最も高い性能を示した。
- 現在の画像編集モデルは,外部からの指示がなくても,画像内にレンダリングされた指示に部分的に依存することが明らかになった。
- Nano Banana Proは,4x4の数独問題で70.0%,RAVENパターンの発見問題で22.9%の正答率を達成した。
全タイプオーディオに対するディープフェイク検出のための隠れドメインルーティング [cs.SD]目的:全タイプのオーディオディープフェイク検出における精度向上
- 音声,環境音,歌声,音楽など多様なオーディオタイプへのディープフェイク技術の悪用が深刻化している。
- 推論時にオーディオタイプが不明なため,各タイプに対応した最適な検出が困難である。
- 隠れオーディオドメインを推定し,タイプごとの特性を考慮した検出を行うことで,精度向上を目指す。
- 隠れオーディオドメインの推定と,タイプごとの専門家モデル(expert)の組み合わせにより,高い精度を実現した。
- 開発セットの分析,ルーティング手法の比較,および各コンポーネントの結果から,オーディオドメイン分離と補完的な検出能力が示された。
- AT-ADD Track2の最終評価において,96.10%のTrack2 Macro-F1を達成し,最終リーダーボードで1位を獲得した。
光子からの光流 [cs.PF, cs.DB, cs.DC, cs.HC, cs.CL, cs.CV]目的:高速・低照度環境下における光流推定
- 高速運動や暗所での映像解析は重要であり,従来のカメラでは困難な課題である。
- 従来のカメラはフレームレートや感度限界から,ブレや露出不足を引き起こしやすい。
- SPADカメラの特性を生かし,高精度な光流推定を,従来の方式に頼らず実現する。
- 本研究では,SPADストリームから直接高密度光流を推定するQuantaFlowを提案する。
- QuantaFlowは,反復的な光流精緻化プロセスに表現形式の構築を組み込み,光子フラックス変換を用いて多スケール表現を生成する。
- 合成データセットと実データ実験により,QuantaFlowの有効性と汎用性が示された。
SpatialAfford:アフォードを考慮したVLMsに,どこを見るべきか,どこに接地すべきかを教える [cs.CV]目的:アフォードを考慮した視覚的注意の調整と座標予測の精緻化
- ロボットの知能向上には,環境とのインタラクションが不可欠であり,そのためにはアフォード理解が重要である。
- 既存のコンパクトなVLMsは,アフォードに特化した視覚的注意が弱く,正確なアフォード接地が難しい。
- アフォード領域への注意調整と座標予測を段階的に行うことで,アフォード接地性能を向上させる。
- SpatialAffordは,ShareRobot-Bench,ReasonAff,PartAffordにおいて,アフォード接地性能を継続的に向上させた。
- 40億パラメータのコンパクトなモデルで,70億+パラメータの強豪モデルを上回る性能を達成した。
- モデルに「どこを見るべきか」を明示的に教えることで,空間的推論能力を向上させた。
RadYOLO:CTおよびMRIにおける計算効率の高い3Dオブジェクト検出とセグメンテーション [cs.CL, eess.AS, cs.CV, cs.AI, cs.LG]目的:3D医療画像におけるオブジェクト検出とセグメンテーション
- 医療画像解析は,疾患診断や治療計画において不可欠であり,精度向上が求められている。
- 既存の深層学習モデルは計算コストが高く,リソース制約のある環境での利用が困難である。
- 計算効率を保ちつつ,高精度な3Dオブジェクト検出とセグメンテーションを実現する手法の確立。
- RadYOLOは,5つのCT/MRIデータセットにおいて,nnDetectionの検出性能を上回る,または同等な結果を示した。
- 病変検出においてはnnU-Netよりも良好な性能を発揮し,大臓器の検出ではnnU-Netが優位性を示した。
- 推論速度はnnU-Netと比較して8~46倍高速であり,CPU環境でも実用的な速度を実現した。
骨盤骨セグメンテーションモデルの動的信頼度ガイドによるテスト時適応 [cs.CV]目的:骨盤骨セグメンテーションモデルのテスト時適応
- ロボット支援下手術の精度向上に不可欠であり,医療現場での応用が期待される分野である。
- 異なる医療機関間でのデータ分布の差異により,モデルの性能が著しく低下する課題がある。
- 新たな臨床環境下での性能劣化を抑制し,セグメンテーションの精度と一貫性を維持すること。
- 提案手法ReGAは,ドロップアウトに基づくアンサンブル予測を用いた信頼度指標SICEにより,境界の誤りを軽減する。
- ReGAは,信頼度に基づく特徴量の適応的更新と,解剖学的整合性を強化するコントラスト学習により,既存手法を上回る性能を示す。
- 3つの異種な骨盤CTデータセットにおいて,未知の臨床領域への効果的な適応を実証した。
GuideGround:VLMによる意味理解と視点に基づいた推論による3D視覚的グラウンディング [cs.CV]目的:3Dシーンにおける対象物局所化
- 3Dシーン理解は,ロボティクスや拡張現実など,多様な応用分野において重要である。
- 既存手法は,意味理解と視点推論の精度向上の点で課題が残されている。
- VLMを活用することで,意味理解と視点推論を強化し,グラウンディング性能の向上を目指す。
- 提案手法GuideGroundは,VLMを用いて意味的特徴を強化し,視点に特化した仮説検証を行う。
- ReferIt3Dベンチマークにおいて,既存の最先端手法を安定的に上回る性能を示す。
- 詳細な消去実験により,提案する意味理解と視点推論戦略の有効性が確認された。
複雑な劣化下における画像融合のためのテキスト誘導フローマッチング [cs.CL, cs.CV, cs.AI]目的:現実的な劣化シナリオ下における赤外・可視画像融合
- 画像処理技術は,監視,医療,自動運転など幅広い分野で重要であり,その性能向上は社会に貢献する。
- 劣化は画像情報を損ない,融合の質を低下させるため,劣化の影響を軽減する技術が求められている。
- テキスト情報を活用し,劣化に合わせた動的なガイダンスにより,より高品質な画像融合を実現する。
- 提案手法TGFusionは,劣化抑制とクロスモーダル融合を統合したテキスト誘導フローマッチングフレームワークである。
- テキストを独立した意味ストリームとして表現し,視覚表現との双方向的な相互作用を可能にすることで,劣化の意味を動的に活用する。
- 公的なベンチマークおよび複雑な劣化シナリオにおける実験により,知覚品質,自然さ,構造詳細の保持,赤外線顕著性の保持において優れた性能を示す。
DocPO:段階的報酬によるドキュメントポリシー最適化の高度化 [cs.CV]目的:ドキュメント解析におけるポリシー最適化
- ドキュメント理解は情報抽出の基盤であり,その自動化は重要である。
- 高精度な解析においては,編集距離に基づく報酬の識別力が低下する。
- 報酬の鋭さを高め,識別力を向上させることで学習信号を改善する。
- 提案手法Step-Aware Annealing (SAA)は,報酬の曲率を段階的に増加させる。
- SAAは,ドキュメント要素ごとの報酬設計と組み合わせることで,性能を向上させた。
- OmniDocBenchおよびDocElemHardでの実験により,SAAの有効性が確認された。
潜在フロー整合による逆問題に対するハイブリッドドメイン事後サンプリング [cs.CV]目的:逆問題における高精度な解の復元
- 画像生成において圧縮空間での効率的な表現が重要視されている。
- 事前学習済みオートエンコーダの幾何学的な限界により,高周波成分の復元が困難である。
- 物理的な測定との整合性と意味的制約を分離し,高周波成分を復元する。
- 提案手法HDPSは,ピクセル空間で測定残差を吸収し,生成多様体へ構造補正を投影する。
- 最適化ベースの潜在的アライメントにより,ピクセル空間のアーティファクトを抑制し,意味的ドリフトを防ぐ。
- 様々な逆問題において,HDPSは最先端の結果を達成し,高周波構造の復元に成功した。
拡散エージェントMI:分布に基づいた,ツール統合された自己進化型エージェントによる忠実な視覚的推論 [cs.CV]目的:忠実な視覚的推論を実現するための分布に基づいたツール統合型自己進化エージェント
- 視覚的推論は,ロボティクスやAIアシスタントなど,様々な応用分野で不可欠な能力である。
- 既存のツール統合型視覚言語エージェントは,推論経路と実際の計算の乖離により,信頼性に課題がある。
- 提示されたエージェントは,分布的視覚メカニズム解釈可能性に基づき,説明と内部表現の乖離を解消することを目指す。
- 拡散エージェントMIは,GeoQA,SciVis,VQA-v2などのデータセットで,既存の自己進化型エージェントと比較して最大5.1ポイントの精度向上を達成した。
- 相互情報量に基づく忠実性と人間による解釈可能性の一致も2倍以上に向上した。
- エネルギー項と検証器は相補的であり,組み合わせることで分布レベルと軌跡レベルの両方の忠実性を高める。
堅牢なウォーターマークとバックドアモデル:ステルスなバックドアによる拡散セマンティックウォーターマークの回避 [cs.CR, cs.AI, cs.CV]目的:拡散モデル生成画像に対するウォーターマーク検出パイプラインの脆弱性とその回避手法の検証
- 生成AIの普及に伴い,生成されたコンテンツの真正性確認が重要となっているため。
- セマンティックウォーターマークは頼りになるものの,その検出にニューラルネットワークが使用されている点が弱点となりうる。
- VAEエンコーダにステルスなバックドアを埋め込み,ウォーターマーク検出を回避する手法を提案し,その有効性を検証する。
- 提案手法GhostVAEは,良質な画像に対するウォーターマーク検出性能を維持しつつ(真陽性率94.4%),トリガー活性化下で高い回避成功率(94.6%)を達成した。
- 既存の17種類の防御策に対しても,入力空間,パラメータ空間,潜在空間においてステルス性が保たれていることが確認された。
- 本研究は,セマンティックウォーターマークシステムの信頼性を根本的に損ない,ニューラルネットワーク要素に対するエンドツーエンドのセキュリティ対策の必要性を示唆する。
ゼロコスト仮想RNA:クロスモーダルWSI検索による免疫療法シグネチャーの近似 [cs.CV]目的:胃腺癌における免疫療法反応の予測
- 免疫療法は癌治療の重要な手段であり,その効果予測は患者の予後を改善する上で不可欠である。
- 従来のRNAシグネチャーは高コストであり,広く利用できるものではないという課題がある。
- H&E画像のみを用いて,RNAシグネチャーを低コストで近似し,免疫療法反応を予測することを目指す。
- VITAは,H&E画像とRNAデータを共同潜在空間にマッピングすることで,遺伝子配列解析なしでRNAシグネチャーを近似する。
- 分類精度0.72,スピアマン相関係数0.66を達成し,連続的な表現型スペクトルを維持した。
- VITAは,免疫療法の前段階スクリーニングツールとして,費用対効果が高く有用である。
プロンプト遵守を超えて:音声生成における属性レベルの音声制御の監査 [cs.SD]目的:音声生成における属性レベルの音声制御の評価方法
- 自然言語による音声生成制御が発展しているが,その品質評価は十分ではない。
- 既存の評価ではプロンプトとの一致のみが重視され,意図しない変化が無視されている。
- プロンプト遵守に加え,音声の属性変化を詳細に監査し,制御の精度向上を目指す。
- 音声生成システムにおいて,意図した属性の変化に伴い,他の属性にも変化が生じることが確認された。
- システムごとに,意図しない属性の変化のパターンが異なっていることが示された。
- VoDER-Calという候補選択器を導入し,高い適合性と低いオフターゲット偏差を両立することで,生成品質を向上させた。
DrawAI:ラスタ画像を編集可能にするためのエージェントベースのベンチマークとワークフロー [cs.RO, cs.CV]目的:ラスタ画像から構造化された編集可能な成果物を復元すること
- 画像生成技術の発展に伴い,複雑な視覚的コミュニケーションのニーズが高まっている。
- 生成されたラスタ画像はピクセルで構成され,内容や関係性の検査・修正が困難である。
- 画像の忠実性を保ちつつ,編集可能性を向上させる手法を確立すること。
- DrawAI-Benchは,科学図表,プレゼンテーションスライド,ポスター,図など,現実的な視覚的作成シナリオを網羅するベンチマークである。
- DrawAI-Flowは,Parser AgentとReconstruction Agentからなる二段階のエージェントベースのワークフローであり,編集可能な構造を改善する。
- モデルの能力,ハーネスの選択,ワークフロー設計によって,再構成の品質とコストが大きく変動することが示された。
DexMani:熟練者による操作可能性ガイダンスを用いた器用な回転 [cs.IR, cs.AR, cs.RO, cs.AI, cs.CV]目的:器用な物体の回転のための人間由来の操作可能性ガイダンス
- ロボットハンドによる複雑な操作は重要であり,多様な物体に対して柔軟に対応できる能力が求められる。
- 従来の強化学習は,特定のロボットハンドに依存し,将来の回転の持続可能性を考慮しない場合がある。
- DexManiは人間による操作を学習し,ロボットハンドの操作可能性の変化を予測することで,この問題を解決する。
- DexManiは,人間の実演データから接触条件付きの操作可能性の進化を学習する。
- この学習結果を用いて強化学習を誘導することで,異なるロボットハンドでも回転スキルを獲得できる。
- Shadow Hand,Allegro Hand,XHandにおいて,既知・未知の物体に対して最高の成功率を達成した。
テスト時カリキュラムによるオープンセットAIGC検出 [cs.CV]目的:オープンセットAIGC画像検出における性能向上
- 生成AI技術の急速な発展により,生成画像検出の重要性が増している。
- 生成モデルの進化により,既存の検出器は分布シフトに弱く,汎化性能が課題である。
- テストデータを用いて検出器を適応させ,未知の生成モデルへの対応能力を高める。
- 提案手法TTCは,信頼性の高い疑似ラベルから学習を開始し,段階的に難易度を上げることで,テスト時の適応を可能にする。
- Cross-Scale Pseudo-Label Refinementにより,複数解像度からの情報を統合し,より信頼性の高い適応を実現する。
- AIGCGuardという新たなベンチマークを構築し,多様な生成モデルに対する有効性を示すことで,実用的なテスト時適応フレームワークを確立した。
視覚言語モデル表現の局所幾何学的分解:LENSによる解析 [cs.AI, cs.CL, cs.CV]目的:視覚言語モデル表現における局所幾何学的構造の理解
- 近年,視覚と言語を統合するモデルが発展しているが,その内部表現の解釈は困難である。
- 既存の解釈手法は,大域的な線形方向のみに着目し,局所的な低次元構造を見落とす可能性がある。
- 本研究は,局所幾何学的分解を通じて,視覚言語モデル表現の理解を深めることを目指す。
- LENSは,視覚言語モデルの活性化を,混合因子分析を用いた局所的な低ランクガウス近傍に分解する手法である。
- LLaVA-1.5-7BとQwen3-VL-8Bへの適用により,モデルの融合メカニズムに合致した層深さ依存的な融合軌跡が明らかになった。
- 近傍の中心への活性化の補間は,生成を因果的に誘導し,既存手法よりも優れた性能を示した。
トークンレベルのクロスエントロピーを超えて:自己回帰型画像生成のためのFréchet分布ポストトレーニング [cs.CV]目的:自己回帰型画像生成モデルの性能向上
- 画像生成技術は,多様な応用分野において重要な役割を担う。
- 教師あり学習と評価指標の間の不一致が課題となっていた。
- 生成画像の分布品質を直接最適化することで,この不一致を解消する。
- Fréchet分布ポストトレーニング(FD-loss)は,ImageNetデータセット上でFIDとFDr6を平均してそれぞれ41.4%と52.0%削減した。
- 最も優れた結果では,FIDが2.42から1.43に改善し,追加のパラメータや推論ステップは不要であった。
- FD-lossは,モデルの表現空間におけるFréchet距離を唯一の目的関数として,事前学習済みの離散生成モデルを適応させる。
AnyBand:周波数認識によるインコンテキストスペクトル補完を通じた統一マルチバンド幅音声拡張 [cs.SD]目的:多様なバンド幅の音声に対する高周波成分の復元
- 音声通信や認識において,高周波成分は音声の知覚品質や明瞭性に不可欠である。
- 既存手法は特定のカットオフ周波数に依存し,変化する入力バンド幅への対応が困難である。
- AnyBandは,カットオフ周波数に依存しない汎用的なバンド幅拡張手法を確立することを目指す。
- AnyBandは,低周波スペクトルをプロンプトとして高周波成分を生成するインコンテキストスペクトル補完という新しいアプローチを提案する。
- 訓練には欠損帯域条件付きフローマッチングと,バランスの取れたカットオフカリキュラムが用いられる。
- 実験の結果,AnyBandは既存手法と比較してスペクトル再構成性能が向上し,知覚品質も優れていることが示された。
内部を緩和し,全体を均衡化する:幾何学に基づいた視覚言語混合エキスパートの負荷分散 [cs.NI, cs.CL, cs.CV, cs.AI]目的:視覚言語混合エキスパートにおける負荷分散の改善
- 大規模言語モデルと画像処理の融合が進む中で,効率的な計算資源の利用が重要となっている。
- 既存の負荷分散手法では,トークン数のばらつきにより,負荷の偏りが生じやすい。
- 画像とテキストの特性を考慮した新たな負荷分散手法により,負荷の均衡化を図る。
- 提案手法ReBAは,様々なベンチマークにおいて,既存手法Std-Auxと同等のタスク精度を維持しつつ,負荷を軽減することに成功した。
- 画像内のトークン群は画像ソースごとに強くグループ化されるため,画像境界に着目したルーティングにより負荷分散が改善される。
- ReBAは,画像解像度やタイリングの変化といった物理的な変動下においても,平均負荷および最大負荷を低減することが示された。
UOT-IR:固定予算による高声部数シンボリック音楽の構造的ルーティング [cs.SD, cs.AI, cs.LG]目的:高声部数シンボリック音楽の固定トラック数表現への変換
- 音楽生成・分析・編曲において,シンボリック音楽の利用が拡大している。
- 多くの下流タスクでは固定長の表現が必要だが,既存手法では構造や演奏性が損なわれる。
- 構造的ルーティング問題として圧縮を再定義し,構造と演奏性を保ちつつ表現をコンパクト化する。
- UOT-IRは,テンプレート標準化と適応的保存の両設定で優れた性能を示した。
- 適応的保存においては最高のNote-F1 (0.9120) を達成した。
- テンプレート標準化においては,構造コストと構造的混乱率が最小となった。
Eコマース画像生成のための要素認識型グループ学習 [cs.CV, cs.AI, cs.LG]目的:Eコマース画像生成におけるプロンプト品質向上のための手法
- Eコマースにおける商品画像の重要性が増しており,魅力的な画像が売上に大きく影響する。
- 既存のビジョン言語モデルでは,生成された画像からフィードバックを得てプロンプトを改善する際に課題がある。
- 画像品質を左右する要素ごとの貢献度を考慮した,より精密な報酬最適化を目指す。
- 提案手法EAGLE-GRPOは,報酬を要素ごとに分解し,カーネルリッジ回帰を用いて要素レベルでの貢献度を算出する。
- 追加のロールアウトや別モデルを必要とせず,解釈可能な要素ごとの優位性を導き出すことが可能である。
- 実験の結果,EAGLE-GRPOは競合手法よりも長期間にわたり性能向上を維持し,より高品質なEコマース画像を生成することが示された。
超広角網膜画像に対する基盤モデルの表現伝移 [cs.CV]目的:超広角網膜画像における基盤モデルの表現伝移に関する研究
- 医療画像解析において,基盤モデルの活用が広がり,その性能向上が期待されている。
- 弱教師あり学習への応用において,事前学習戦略が表現伝移に与える影響は不明な点が多い。
- 超広角網膜画像における疾患分類において,事前学習戦略の最適化を目指す。
- 事前学習戦略の違いが,凍結された表現伝移に大きく影響することが示された。
- 教師あり学習や自己蒸留に基づくモデルが,MAEよりも高い性能を示した。
- 大規模なDINOv3モデルは,糖尿病網膜症の重症度分類においてDINOv1と同等の性能を示した。
インスタンスピン:座標ピンニングによるインスタンス指定可能レイアウト-画像拡散 [cs.CV]目的:インスタンス指定可能なレイアウト-画像拡散の実現
- 画像生成において,意味的な制御が重要視されている。特にレイアウトからの生成では,カテゴリレベルのセグメンテーションマップが利用される。
- 既存手法では,同じカテゴリのオブジェクトが一体として扱われ,境界の曖昧さや外観の平均化,インスタンス間の特徴の混同が生じやすい。
- 本研究は,密集したレイアウトにおけるインスタンスの分離と,全体的なシーンの一貫性の維持を目指す。
- InstancePinは,各オブジェクトインスタンスを明示的な座標アンカーで固定することで,インスタンス指定可能なレイアウト-画像拡散フレームワークを実現した。
- カテゴリレベルの生成知識を維持しつつ,座標ピンニング注意機構を用いて空間的な制御を学習するインスタンス認識アダプターを導入した。
- Cityscapesデータセットでの実験により,InstancePinが密集したレイアウトにおけるインスタンスの絡み合いを軽減し,画像品質と意味的な一貫性を向上させることが示された。
ビデオ生成における不可逆的過程の発達遅延の診断 [cs.CV]目的:ビデオ生成モデルにおける不可逆的過程の発達状況の評価
- 物理現象の多くは不可逆であり,その理解は現実世界の再現を目指す生成モデルにとって重要である。
- 既存の評価指標では,ビデオ生成モデルが物理的制約(不可逆性)を遵守しているかを正確に測定することが困難である。
- ビデオ生成モデルが不可逆的過程を適切に表現できていないという問題を,新しい評価手法を用いて明らかにする。
- 生成されたビデオは,現実の映像と比較して,不可逆的属性において進展がほとんど見られないことが判明した。
- 評価プロトコル(進行度と静止率)を用いることで,生成ビデオと現実の映像を明確に区別することが可能になった。
- 後処理による誘導は操作可能である一方,属性空間での一調性を強制することで,この操作可能性を排除できることが示された。
生成困難性が存在する場所:ターゲット表現に関する実証研究 [cs.CV]目的:画像生成器が学習すべき分布の定義であるターゲット表現の特性
- 画像生成技術は,現実世界の多様な画像を合成する上で不可欠であり,その発展はAI研究の重要なテーマである。
- ターゲット表現が生成性能に与える影響は十分に解明されておらず,最適な表現選択が困難である。
- 異なるターゲット表現が生成プロセスにおいて,困難性の所在をどのように変化させるかを明らかにすること。
- DINOv2表現は,収束速度と計算効率に優れる一方で,広範囲なノイズ除去と直接的な文脈融合から恩恵を受ける。
- ピクセル表現は最適化が遅く,予測,マスキング,ガイダンス設定の調整が不可欠である。
- MAE表現は忠実な再構成と意味的クラスタリングを示すものの,DINOv2と比較して生成品質は劣る。
ParticleGen:パーティクル効果生成のためのマルチエージェントシステム [cs.GR]目的:パーティクル効果の自動生成
- デジタルエンターテインメントにおいて,視覚効果は不可欠であり,高品質な表現が求められている。
- 高品質なパーティクル効果の作成には専門知識と手間がかかり,パラメータ調整が難しい。
- 自然言語による指示から,実行可能なパーティクルシステムを自動的に生成することを目指す。
- 本研究では,自然言語による指示からパーティクルシステムを生成するマルチエージェントフレームワークを提案した。
- 提示手法は,生成・パラメータ化パイプラインとレンダリングフィードバックによる反復改善を組み合わせる。
- 視覚的な問題と原因を特定する診断メカニズムを導入し,Unreal Engine 5で有効性を示した。
WiFuse:振幅と遅延ドップラーチャネル特徴を融合した注意メカニズムによるヒューマンアクティビティ認識 [cs.CV]目的:ヒューマンアクティビティ認識のためのフレームワーク
- Wi-Fiセンシングはプライバシーを保護し,非侵襲的な手法として注目されている。
- 反射面やハードウェアオフセット等の環境特性が認識精度を低下させる。
- 環境の影響を受けにくい高精度な認識手法を開発する。
- WiFuseフレームワークは,振幅と遅延ドップラー表現を融合することで,従来の課題を克服した。
- 提案手法は,XRF55データセットで最大95.28%,Wi-MIRデータセットで最大98.20%の全体精度を達成した。
- 転移学習を用いることで,マルチパス,ノイズ等の条件下でも高い認識性能を発揮することが示された。
PixelSR:ピクセル分類による効率的な画面コンテンツ超解像 [cs.CV]目的:画面コンテンツ超解像の性能向上と推論速度の高速化
- 画面コンテンツはテキストやグラフィックスで構成され,自然画像とは異なる特性を持つため,専用の技術が求められる。
- 既存の超解像技術では,画面コンテンツ特有の構造や冗長性を十分に活用できていない点が課題である。
- 画面コンテンツの特性を考慮し,効率的かつ高速な超解像を実現することで,既存技術の限界を克服する。
- 提案手法PixelSRは,ピクセル分類によるコンテンツ注意機構を導入し,超解像性能を向上させた。
- 推論時には,ピクセルの繰り返し性を利用したキャッシュ機構により,高速化を実現した。
- 実験結果から,PixelSRは最先端の性能を達成しつつ,推論時間を短縮することに成功した。
幾何学に基づく感情調節による,制御可能でフォトリアリスティックな感情表現対話顔生成 [cs.CV]目的:制御可能かつフォトリアリスティックな感情表現対話顔生成
- 感情表現対話顔生成は,人間とコンピュータの自然なコミュニケーションを実現する上で重要な技術である。
- 既存手法では,制御性と視覚的な忠実度の両立が困難であり,感情表現が平均化される問題がある。
- 暗黙的な表現の豊かさと明示的な幾何学的な制約を組み合わせ,感情表現の精密な制御と高画質化を目指す。
- GemTalkは,拡散モデルを用いて暗黙的な表現と明示的な幾何学的制約を融合させることで,高品質な感情表現対話顔生成を実現した。
- 提案手法は,感情の強度の連続的な制御を可能にし,視覚的な品質を損なうことなく,より自然で表現力豊かな顔の動きを生成する。
- 実験結果から,GemTalkがフォトリアリズムと感情表現のダイナミクスにおいて優れた性能を示すことが確認された。
CopyCat:被写体から画像へのモデルにおける微細な被写体一貫性の向上 [cs.CE, cs.CV]目的:被写体から画像へのモデルにおける微細な被写体一貫性の改善
- 近年,個人に合わせた画像生成技術が発展しているが,被写体特有の詳細な特徴を維持することが課題となっている。
- 高品質な詳細な被写体情報の学習データ収集にはコストがかかり,合成データでは詳細な特徴の再現が難しい。
- CopyCatは,わずか数秒で事前学習済みモデルを微調整し,被写体の一貫性を向上させることを目指す。
- CopyCatは,軽量なFine-grained Consistency LoRA (FCLoRA) を追加し,単一のプロキシ画像を用いてモデルを微調整する。
- この自己再構成目標により最適化が簡素化され,数秒で効果的な微調整が可能となる。
- 実験の結果,DreamBenchとXVerseBenchにおいて,単一および複数被写体の設定下で,被写体一貫性の向上が確認された。
水平方向優先の打破:長尾の向きバイアスからロールに強い単眼深度推定へ [cs.CL, cs.CV]目的:単眼深度推定におけるロールに対する頑健性の向上
- 単眼深度推定は,自動運転やロボット工学など,様々な分野で重要な役割を担う技術である。
- 既存の深度推定モデルは,カメラのわずかな傾き(ロール)によって精度が大きく低下するという問題がある。
- 本研究は,訓練データの向きの偏り(水平方向優先)が原因であることを明らかにし,ロールに対する頑健性を向上させることを目指す。
- 提案手法であるID-Constraintは,幾何学的・空間的推論タスクによる追加の学習を通して,深度バックボーンの回転安定性を高める。
- ID-Constraintは訓練時にのみ使用され,推論時のアーキテクチャは変更されない。
- 5つのベンチマークデータセットでの実験により,提案手法の有効性が確認された。
境界信頼型照明・色彩相互作用ネットワーク:リモートセンシング画像からの影除去 [cs.CV]目的:リモートセンシング画像からの影除去
- リモートセンシングは広範囲な地表面情報を取得する上で不可欠であり,その精度は解析結果に直結する。
- 影は地表面の視覚情報を遮り,放射特性を歪めるため,画像解析の信頼性を低下させるという課題がある。
- 影の境界を正確に捉え,照明と色彩の相互作用を考慮することで,より自然な影除去を実現する。
- 提案手法BRIC-Netは,CIELAB統計に基づいた信頼度に基づき,影の除去と非影領域の保存を両立している。
- AeroDS-Synデータセットで29.46dB,SRGTAデータセットで27.96dBという高いPSNR値を達成した。
- AISDおよびAeroDS-Realデータセットでは,知覚に基づく画像品質評価指標PIQEで最低スコアを獲得し,良好な結果を示した。
Proteus:切り捨てに強いLiDAR点群圧縮のためのエントロピーモデル [cs.CV]目的:LiDAR点群圧縮における切り捨て耐性の向上
- 自動運転やロボット工学において,LiDARは環境認識の重要な役割を担う。正確な3D情報が不可欠である。
- 無線通信における信号の劣化や欠損により,LiDARデータの信頼性が損なわれる可能性がある。
- 無線チャネルの影響を受けにくい,ロバストなLiDAR点群圧縮技術の開発。
- Proteusは,重要なレンジビットプレーンと重要でないレンジビットプレーンを分離することで,切り捨てに対する耐性を実現した。
- 実験結果から,Proteusは最大70%のビットストリームの切り捨てにも耐え,既存の標準規格や学習型圧縮器を上回る性能を示した。
- レンジの切り捨てが空間分解能の低下に直接対応し,再現された点群の劣化を限定的に抑えることが確認された。
E2Pano:イベントからパノラマ画像再構成の学習 [cs.CL, cs.CV]目的:イベントカメラからのパノラマ画像再構成手法
- 高速回転走査によるモーションブラーの無いパノラマ画像生成が期待される分野。
- 既存手法は計算コストが高いか,パノラマ画像に対応した幾何学的な配慮が不足している。
- 幾何学的な制約を考慮し,効率的なイベントからパノラマ画像への再構成を目指す。
- 提案手法E2Panoは,球面座標を維持し,軽量なモジュールと球面Transformerを活用する。
- 合成データおよび実環境データにおいて,最適化ベースの手法よりも再構成品質とコストが改善された。
- 合成データのみで学習しながらも,実環境データへの転移可能性が示された。
FreqAnchorAD:周波数偏差アンカリングによる言語非依存ゼロショット異常検出 [cs.CV]目的:未知のターゲットドメインにおける異常の検出と欠陥領域の局所化
- 画像認識の分野において,教師なしの異常検知は重要な課題である。
- 既存手法は空間特徴空間での識別が中心で,微細な変化と正常な変動を区別できない。
- 周波数領域に着目し,異常の周波数特性を明示的にモデル化することで検出精度向上を目指す。
- 提案手法FreqAnchorADは,周波数強調応答を用いて異常を識別するフレームワークである。
- 局所周波数補償モジュール(LFCM)と周波数偏差アンカープロジェクター(FDAP)により,高精度な異常検出を実現した。
- 13のベンチマークデータセットで最先端の性能を達成し,画像レベルおよびピクセルレベルでの異常検出に優れている。
AeroLLE:夜間航空画像強調のための制約付き疑似教師あり学習とAeroNight-1.5Kベンチマーク [cs.CV]目的:夜間航空画像の強調技術の開発
- 夜間航空画像は,監視や災害状況把握に有用だが,暗所での撮影が困難である。
- 夜間航空画像の不均一な露出や弱い構造情報が,画像強調の精度を低下させている。
- 生成された正常光画像を利用しつつ,形状やテクスチャの変化を抑制する手法が求められている。
- 提案手法AeroLLEは,段階的な処理により視認性を向上させ,空間適応的な露出・色校正を行う。
- SAECCにより,色補正の範囲と空間変化を制限することで,より自然な画像強調を実現した。
- AeroNight-1.5Kベンチマークを用いた実験により,提案手法の有効性が実証された。
ビデオ理解のためのカバー率駆動型適応キーフレーム選択 [cs.CL, cs.CL, cs.CV, cs.AI]目的:ビデオ理解における計算コスト削減
- 大規模なビデオデータの活用が重要視される中で,計算効率が課題となっている。
- 既存手法では,クエリごとに適切なキーフレーム数を決定できず,大量のフレームを処理する必要がある。
- クエリとフレームの関連性のプロファイルを推定し,カバー率に基づいてキーフレーム選択を効率化する。
- 提案手法CSESは,既存手法と比較して,フレームのスコアリング数を4~13倍,キーフレーム数を18.4~20.5%削減できる。
- CSESは,フレーム選択処理を3.1~5.4倍高速化することに成功した。
- 精度を維持しながら計算コストを削減し,ビデオ理解の効率化に貢献する。
生成画像は忘れやすい:合成画像検出のための機械的アンラーニングの視点 [cs.CV, cs.LG]目的:生成画像の検出
- 生成モデルの悪用に対抗するため,生成画像の堅牢な検出は不可欠である。生成AIの普及に伴い,その重要性は増している。
- 既存手法は人間によるアノテーションに依存し,未知の分布への汎化性能が低いという課題がある。
- 大規模ビジョンモデルのアンラーニング特性を利用し,自然画像と生成画像の忘却速度の差に着目する。
- 大規模ビジョンモデルは自然画像と生成画像の両方の特徴を捉えやすく,識別能力が低いことが判明した。
- アンラーニング時,生成画像の特徴劣化が自然画像よりも速く進行することを発見した。
- データアクセス不要なデータフリー検出と,データ駆動型検出の二つの手法を提案し,従来の検出手法を上回る性能を実証した。
視覚基盤モデルにおける局所的結合情報の復元:フォービエーションプローブ [cs.RO, cs.RO, cs.CV]目的:視覚基盤モデルにおける局所的結合情報の復元
- 画像認識技術は,コンピュータビジョンの根幹であり,多様な応用分野で重要性が増している。
- 既存の評価方法は,画像全体の情報を集約するため,局所的な情報の損失を見過ごす可能性がある。
- フォービエーションプローブを用いて,局所的な情報保持能力を評価し,モデルの改善に貢献する。
- 従来のグローバル読み出しは,合成データで単独の対象に対しては高い性能を示すが,ノイズ下や改変下では性能が低下する。
- 一方,フォービエーション読み出しは,ノイズ下でもオラクル読み出しに近い性能を維持し,局所的な信号を効果的に復元する。
- 自然画像タスクでは,質問条件付きのフォービエーションが,局所的な色の精度を大幅に向上させ,空間情報の重要性を示唆する。
バックドアの緩和:デコイショートカットと知識の分離 [cs.RO, cs.LG, cs.CV]目的:深層ニューラルネットワークにおけるバックドア攻撃の緩和
- 深層学習モデルの信頼性は重要であり,特に第三者データに依存する学習環境ではバックドア攻撃のリスクが存在する。
- バックドア攻撃は,わずかな悪意のあるデータによってモデルを操作し,予測を誤らせる可能性がある。
- バックドア知識を隔離し,モデルの性能を維持しながらバックドア攻撃の影響を軽減すること。
- 提案手法Trapping and Removing (TR)は,バックドア知識を捕捉する軽量なショートカット枝を導入し,学習後にその枝を削除することでバックドアを緩和する。
- エントロピーに基づく重み割り当てによる知識分離戦略は,悪意のあるサンプルをショートカットに誘導し,メインネットワークの良性学習を促進する。
- 自動ショートカット生成戦略により,様々なモデルアーキテクチャへの一般化性能が向上する。
MDTD-ArtIR:テクスチャオーバーレイ劣化に対する美術画像修復のための画像編集・復元モデルのベンチマーク [cs.CV]目的:美術画像修復における画像編集と復元モデルの性能評価
- 美術作品のデジタルアーカイブ化が重要視される中で,損傷した画像の高品質な復元が課題となっている。
- 既存の研究では,劣化の種類が限定的であり,美術作品特有の複雑な劣化パターンに対応できない。
- 半透明な劣化を含む美術画像に対する,より現実的な修復手法の確立を目指す。
- 画像編集モデルが,一般的な復元モデルよりも多様な劣化に対して一貫して高い性能を示すことが確認された。
- 構造化されたプロンプトエンジニアリングにより,詳細の保存と構造の一貫性を重視した修復が可能となった。
- 修復可能な意味情報とプロンプト制御可能性が,美術画像修復において重要な要素であることが示唆された。
視覚的推論のための潜在的有用性学習 (LUT) [cs.CV]目的:視覚的推論における潜在的な有用性を学習すること
- マルチモーダル大規模言語モデルの発展に伴い,視覚理解の重要性が増している。
- 既存の潜在的視覚推論手法は,中間層での高コストな教師データに依存している。
- 標準的なVQAペアのみで学習可能な,効率的な潜在的推論フレームワークの構築を目指す。
- LUTは,潜在的な有用性を重視した学習により,既存の潜在的推論手法を上回る性能を示す。
- Utility-Aware Latent Distillation SFTにより,より信頼性の高い潜在的軌跡を学習できる。
- Latent Attribution Policy Optimizationにより,強化学習における潜在的なステップの最適化が可能となる。
