arXiv雑要約
画像・音声 - 2026/08/05 公開
等変性音楽Transformer [cs.SD, cs.AI]目的:音楽表現空間における等変性の概念
- 音楽認知において,時間移動や音高変化に対する不変性は重要である。
- 既存の音楽Transformerは,規模拡大に伴い等変性が低下する。
- 等変性を明示的に学習することで,音楽構造のより良い表現を目指す。
- 提案手法Equivariant Music Transformer(EMT)は,自己知識蒸留と正則化損失により等変性を実現した。
- EMTは,既存手法と比較して,等変性と生成能力の両面で優れていることを示した。
- 標準的な言語モデリングでは音楽の対称性を捉えきれないことが示唆された。
GeoMAR:幾何学的に整列した特徴を解放し,マスクされた自己回帰的盲目顔復元を実現する [cs.CV]目的:盲目顔復元のための幾何学的に整列した特徴の活用
- 顔画像は個人識別や社会生活において重要な役割を担うため,高品質な復元技術が求められている。
- 既存のコードブックに基づく復元手法は,条件付け特徴の曖昧性や予測メカニズムの脆弱性といった課題を抱えている。
- 幾何学的に整列した特徴を用いることで,よりロバストな顔復元を可能にすることを目指している。
- 提案手法GeoMARは,幾何学的に整列した特徴を活用することで,顔画像の復元性能を向上させている。
- デュアル入力抽出パイプラインとアラインドジオメトリックプライアーズインジェクターにより,信頼性の高い特徴抽出を実現している。
- マスクされた自己回帰的(MAR)プロセスを用いることで,段階的に顔の複雑な領域を洗練し,視覚的な一貫性を高めている。
PRISM:多変量異常検知のための強力な時系列-画像変換表現 [cs.RO, cs.LG, cs.AI, cs.CV]目的:多変量時系列異常検知における画像ベース表現の構築と評価
- 予測保全,金融,クラウドコンピューティングなど幅広い分野で時系列異常検知が重要視されている。
- 多変量時系列データにおける適切な表現の選択が困難であり,性能に大きな影響を与える。
- 時系列データを画像に変換する際の最適な手法を模索し,異常検知性能の向上を目指す。
- PRISMというメタワークフローを開発し,7000件以上の実験を通じて画像ベース表現の有効性を示した。
- PRISMの適切な設定は,14データセットのうち10個で最良のVUS-PRを達成し,競合手法を平均41%上回った。
- ImageNetで事前学習したエンコーダが時系列異常検知に効果的に転移することを確認した。
拡散モデルの嗜好性整合のための潜在報酬レジスタ [cs.LG, cs.CV]目的:拡散モデルと人間の嗜好性との整合
- 近年の生成モデル研究において,人間の嗜好に合致した高品質な画像生成が重要な課題となっている。
- 従来の報酬信号は最終生成物のみで評価されるため,多段階のノイズ除去過程における因果関係の特定が困難である。
- 中間的な潜在変数から直接嗜好性を推定し,効率的な嗜好性整合を実現することを目指す。
- 提案手法である潜在報酬レジスタは,ノイズの多い潜在変数から高精度に嗜好性を推定可能である。
- 報酬勾配を用いたオンポリシー蒸留(RG-OPD)は,従来の強化学習手法を凌駕し,計算コストを大幅に削減する。
- 報酬誘導サンプリング(RGS)は,パラメータ更新なしに最先端の性能を達成し,嗜好性整合と知覚品質の両方を向上させる。
拡散に基づくインペインティングモデルの漸進的学習による重なり指紋の分離 [cs.CV, cs.CR]目的:重なり指紋の分離
- 犯罪現場や生体認証において,指紋は重要な証拠であり,個人識別に不可欠である。
- 現場で採取された指紋は重なっていることが多く,既存手法では分離が困難である。
- 拡散モデルを用いて,重なり指紋を分離し,より高精度な個人識別を可能とする。
- 提案手法は,Stable Diffusionモデルを基盤とし,指紋の特徴を考慮したインペインティングを行うことで,重なり指紋を効果的に分離できる。
- 実験結果から,本手法で再構成された指紋は,元の指紋との照合において高い確率で一致することが確認された。
- 多チャンネル条件付けによるoverlap-awareインペインティングが,分離性能向上に貢献する。
UniWorld-Design:ピクセル生成からレイヤーネイティブなデザインへ [cs.CV]目的:画像生成における構造化された視覚的構成の実現
- 画像生成技術は,創造性の拡張やコンテンツ制作の効率化に不可欠である。
- 従来の画像生成はピクセル単位で行われるため,編集や理解が困難である。
- レイヤー構造を導入することで,画像の生成・理解・編集を容易にすることを目指す。
- UniWorld-Designは,画像の生成・理解・編集の単位として,セマンティックなRGBAレイヤーを用いる。
- Text-to-RGBAモデルはテキストから直接RGBAアセットを生成し,Image-to-Layerモデルは画像と指示に基づいてRGBAレイヤーを生成する。
- Crelloベンチマークにおいて,I2Lモデルは既存モデルと比較して,RGB L1エラーを37%削減し,Alpha Soft IoUを34%改善した。
JoyAI-Video-Edit:自己回帰的拡散によるリアルタイムなオープンエンド動画編集 [cs.CY, cs.CV]目的:リアルタイムなオープンエンド動画編集のためのフレームワーク
- 動画編集技術は,コンテンツ制作やコミュニケーションにおいて不可欠であり,その効率化が求められている。
- 既存の動画編集手法は,リアルタイム性,品質維持,長期的な一貫性の確保が課題となっていた。
- 低遅延かつ高品質な動画編集を実現し,動画の長さに関わらず安定した結果を得ることを目指す。
- JoyAI-Video-Editは,160億パラメータの自己回帰的拡散モデルであり,リアルタイムでオープンエンドな動画編集を可能にする。
- Chunk-wise autoregressive adaptation,SA-DMD,Long-Horizon Autoregressive Distillationを組み合わせることで,編集品質と安定性を向上させている。
- 自動評価および人間評価の結果,既存のストリーミングエディタやオフラインシステムと比較して優れた性能を示すことが確認された。
疎なポジティブラベル下における鳥類バイオアコースティクスの転移学習 [cs.SD]目的:鳥類バイオアコースティクスにおける転移学習の有効性検証
- 生物多様性評価や野生動物保護において,継続的かつ非侵襲的なモニタリングは不可欠である。
- 多くのデータセットではポジティブラベルが疎であり,未アノテーション種を不在と断定できないという課題がある。
- 疎なラベル環境下における転移学習の性能向上と,弱教師あり学習としての課題解決を目指す。
- 複数のバイオアコースティックデータセットを信頼性に基づいて統合するフレームワークを提案した。
- BirdCLEF+ 2026検証データにおいて,単純なソースプーリング戦略を上回る性能を達成した(macro average precision 0.584,macro AUC 0.860)。
- 特に受動的音響モニタリングデータセットと生物学に基づいたソース選択が性能向上に寄与した。
Video-DeepResearch:次世代マルチモーダル深層研究エージェントに向けて [cs.RO, cs.CV, cs.AI]目的:連続する動画ストリームに対するマルチモーダルエージェントの拡張
- 画像認識を超え,動画理解が求められる現代において,より高度な情報処理技術が必要とされている。
- 既存モデルでは,テキスト検索に偏ったり,外部ツールを有効活用できていないという課題がある。
- 動画内の時空間的情報を正確に捉え,外部ツールとの連携を強化することで,より高度な研究支援を目指す。
- 提案手法Video-DRは,フレーム間の視覚的情報を段階的に活用するパイプラインにより,既存モデルの課題を克服した。
- 実験結果から,Video-DR-35B-A3Bは平均精度64.0%を達成し,Claude-4.5-Sonnet (59.0%)やGPT-5 (52.5%)を上回った。
- 30B-A3Bモデルも59.3%の精度を示し,コンパクトなモデルでも高い性能を発揮することが示された。
知覚的アンカリング:プロトタイプ誘導によるテキスト校正を用いた学習不要のオープンボキャブラリ意味セグメンテーション [cs.CV]目的:オープンボキャブラリ意味セグメンテーションにおける性能向上
- 画像認識分野において,詳細なシーン理解は重要な課題である。意味セグメンテーションはそのための鍵となる技術。
- 既存手法では,テキスト埋め込みが汎用的な概念に偏り,視覚表現との間にギャップが生じ,精度が低下することがある。
- 視覚的証拠に基づいたテキスト埋め込みの校正により,視覚表現との整合性を高め,セグメンテーション精度を向上させる。
- 提案手法PTCは,初期マッチングスコアに基づき信頼性の高い視覚的証拠を選択し,カテゴリー固有の視覚的プロトタイプを構築する。
- PTCは,構築されたプロトタイプを用いてテキスト埋め込みを校正し,視覚表現とのアライメントを強化する。
- 8つのベンチマークにおける実験で,PTCが既存手法の性能を大幅に向上させ,より正確なセグメンテーション結果が得られることが示された。
アゴジック:LLMネイティブなテキストからシンボリック音楽生成のためのパフォーマンスタイミング付き音楽トークン [cs.SD, cs.CL]目的:テキストから音楽への言語モデルにおける音楽のトークン化方法の効果の測定
- 音楽生成AIの発展において,音楽の表現方法が生成品質に大きく影響する。
- 既存の研究では,音楽のトークン化方法とモデル性能の関係が明確にされていない。
- パフォーマンスタイミングを考慮した新たなトークン化方法によって,モデル性能を向上させる。
- 既存のモデルを固定し,トークン化方法のみを変更することで,表現方法が分布的忠実度に大きく影響することを確認した。
- 特に,リリースされたPMT (Performance-Timed Music Tokens)は,既存のビートグリッドよりも低いFMDスコアを達成し,小規模モデルでも高性能を実現した。
- キャプションに沿った生成に関しては,軽量な制約を加えることで楽器のF1スコアと正しいキーの精度を向上させた。
ParVL:マルチモーダルLLMのための並列スケーリングと拡張可能な計算資源配分 [cs.CL, cs.CL, cs.CV, cs.CL]目的:マルチモーダルLLMのスケーリング戦略
- 近年,画像とテキストを扱うマルチモーダルLLMの重要性が増しており,高性能化が求められている。
- 既存のスケーリング手法では,メモリ消費量や推論遅延の増加が課題であり,柔軟な計算資源配分が難しい。
- ParVLは,既存のバックボーンパラメータを再利用し,タスクに応じた最適な計算資源配分を可能にすることで,この課題を解決する。
- ParVLは,単一ブランチのベースラインと比較して,全体的なマルチモーダル性能を向上させる。
- 最適なビジョン-言語間の計算資源配分はタスクによって異なることが示された。
- 既存のViTとLLMのバックボーンパラメータを共有することで,効率的なスケーリングを実現している。
複数カメラにおける軌跡予測:軌跡テンソルを用いた手法 [cs.CV, cs.AI]目的:複数カメラネットワークにおける移動物体の軌跡予測
- 監視や交通監視等の応用で複数カメラ利用は一般的だが,既存手法は単一カメラに限定され,その性能が制約されていた。
- 単一カメラでは視界が限られ,長期的な軌跡予測が困難であるという課題が存在する。
- 複数カメラからの情報を統合し,より広範な視野と長期的な予測を可能にすることを目的とする。
- 提案手法は,複数カメラからの相対位置情報を同時に利用し,将来の位置を予測する「Which-When-Where」アプローチを採用している。
- 軌跡テンソルという新たな手法を導入し,複数カメラ間の軌跡と不確実性をエンコードすることで,より高精度な予測を実現している。
- 実験結果から,提案手法は既存の単一カメラ予測手法や,複数カメラ対応に改変された手法と比較して優れた性能を示すことが確認された。
CLIP-EBC:拡張ブロックワイズ分類によるCLIPの正確なカウント能力 [cs.CV, cs.AI]目的:群衆密度推定のための,CLIPベースのモデルの開発
- 画像認識技術は,様々な分野で応用されており,特にゼロショット画像分類でその有用性が示されている。
- 既存の群衆カウント手法は,カウント値の量子化や分類エラーへの偏重により,精度に限界がある。
- 本研究は,整数値のビンを使用し,密度マップに基づく回帰損失を導入することで,カウント精度の向上を目指す。
- 提案手法EBCは,既存の分類ベースの手法と比較して,UCF-QNRFデータセットで最大44.5%の改善を達成した。
- CLIP-EBCは,NWPU-Crowdテストセットにおいて,MAE 58.2,RMSE 268.5を記録し,最先端の性能を示した。
- CLIP-EBCは,STEERERと比較して,MAEで8.6%,RMSEで13.3%の改善となった。
群衆ソーシングによる多言語音声明瞭度テスト [eess.AS, cs.AI, cs.SD, eess.SP]目的:多言語音声の明瞭度評価
- 音声技術の発展に伴い,音声明瞭度の迅速な評価が重要になっている。
- 従来の実験室での評価はコストが高く,拡張性に乏しい。
- 群衆ソーシングを用いた多言語音声明瞭度テストの標準化を目指す。
- 本研究では,群衆ソーシングによる明瞭度評価アプローチを提案した。
- 多言語音声データの収集と公開を行い,テスト設計の詳細を明らかにした。
- 初期実験の結果,群衆ソーシングによる評価の可能性が示された。
クリーンな音声条件におけるニューラルオーディオコーデックの評価のための音声品質指標の評価 [eess.AS, cs.AI, cs.SD, eess.SP]目的:ニューラルオーディオコーデックの音声品質評価指標の信頼性
- 音声技術の発展に伴い,高品質な音声コーデックの評価が重要になっている。
- ニューラルコーデックの性能評価において,どの客観指標が主観評価と一致するか不明である。
- 客観指標と主観評価の相関関係を分析し,信頼性の高い指標を特定すること。
- scoreqやutmosといったニューラルベースの指標が,主観評価とのPearson相関係数で最も高い結果を示した。
- 主観品質範囲別の分析から,非侵襲的な指標は高い主観品質レベルで飽和する傾向があることが示された。
PASE:WavLMの音韻的事前知識を活用した低幻覚型生成音声強調 [eess.AS, cs.AI, cs.SD]目的:低幻覚型生成音声強調の実現
- 音声強調は,ノイズ下での音声認識やコミュニケーションにおいて不可欠な技術である。
- 従来の生成的音声強調は,特に強ノイズ下で幻覚が生じやすく,内容や話者特性に誤りをもたらす。
- WavLMの音韻的事前知識を活用し,幻覚を抑制する新しいフレームワークを提案する。
- PASEは,最先端の識別的モデルと比較して,知覚品質に優れている。
- PASEは,既存の生成的モデルと比較して,言語的および音響的な幻覚を大幅に低減する。
- WavLMを表現蒸留によりノイズ除去の専門家として適応させることで,頑健なノイズ除去と幻覚抑制を実現している。
StuPASE:幻覚の少ないスタジオ品質の生成音声強調に向けて [eess.AS, cs.AI, cs.SD]目的:生成音声強調における高知覚品質と幻覚抑制
- 音声強調は,騒音環境下での音声明瞭度向上に不可欠であり,コミュニケーションの質を大きく左右する。
- 既存手法では,幻覚の抑制と高知覚品質の両立が難しく,特に劣悪な環境下での性能向上が課題である。
- 本研究は,幻覚を抑制しつつ,スタジオレベルの高品質な音声生成を実現することを目指している。
- 提案手法StuPASEは,PASEをベースとし,ドライターゲットでのファインチューニングにより,残響除去性能を向上させている。
- さらに,GANモジュールをFlow Matchingモジュールに置換することで,強ノイズ環境下でも高品質な音声生成を可能にしている。
- 実験結果から,StuPASEは最新の音声強調手法と比較して,知覚的に高品質でありながら幻覚が少ないことが示された。
GAP-URGENet:汎用音声強調のための生成・予測融合フレームワーク [eess.AS, cs.AI, cs.SD]目的:汎用音声強調のための生成・予測融合フレームワークの開発
- 音声強調は,様々な環境下での音声の明瞭化に不可欠であり,通信,補聴器,音声アシスタント等の幅広い応用分野で重要である。
- 既存の音声強調手法は,ノイズの種類や強さ,あるいは音源の特性に依存する場合があり,汎用性に課題が残されている。
- 多様な条件に対応可能な,ロバストかつ高品質な音声強調手法の確立を目指す。
- 生成ブランチと予測ブランチを融合させることで,音声の復元とスペクトラム強調を相互補完的に行い,ロバスト性と知覚品質を向上させた。
- 提案手法は,ICASSP 2026 URGENT Challenge Track 1において,客観評価で1位となる最高性能を達成した。
- 48kHzでの音声生成とダウンサンプリングによる,より自然な音声表現を実現した。
Enfold:予測表現への世界モデルの想像の組み込みによる超効率的な具現化制御 [cs.RO, cs.CV]目的:予測的制御表現の獲得
- ロボットの自律的な行動を可能にするためには,環境を理解し予測する能力が不可欠である。
- 既存の世界モデルは計算コストが高く,リアルタイム制御には不向きな場合が多い。
- 世界モデルの内部構造を現在の情報のみから予測できる表現を獲得し,計算効率を向上させる。
- Enfoldは,世界モデルの未来生成の計算過程を現在の視覚情報と指示から予測される表現に転移させる。
- これにより,行動予測の遅延をFast--WAMと比較して最大10.1倍削減し,強力な制御を実現した。
- 表現分析の結果,不要な変動を抑制し,長期的な変化を優先的に捉えていることが示された。
ソニフィケーションとは何か:ソニフィケーションの哲学に向けて [physics.soc-ph, cs.SD]目的:ソニフィケーションの概念的曖昧さ解消と,一貫性のある学際的な実践としての確立
- 科学,芸術,デザインの分野で活用が広がる一方,その本質が不明確である。
- ソニフィケーションが音楽,科学的探求,またはそれらの混合なのか,定義が確立されていない。
- ソニフィケーションの技術的アイデンティティと実践的利用を区別し,多様性を整理する。
- ソニフィケーションを,データと音の関係性に基づく技術的に一貫した実践として捉える枠組みを提示する。
- グスタボ・ブエノの唯物論的認識論とジルベール・シモンドンの個別化の哲学を用いて,ソニフィケーションの適用性と構造的安定性を説明する。
- ソニフィケーション,音楽,美学の関係性を明確化し,研究者と実践者に哲学的な基盤を提供する。
潜在的乳房MRIバーチャル造影増強の予測的較正 [eess.IV, cs.CV]目的:乳房MRIにおけるバーチャル造影増強の性能向上
- 乳房MRIは乳がんの検出において重要な役割を担うが,造影剤の使用には課題がある。
- 既存のバーチャル造影増強技術では,MRI特有の強度スケールとの不整合が課題となっていた。
- MRIの特性に適応した較正手法により,バーチャル造影増強の精度を向上させることを目指す。
- 提案手法(PEC)は,訓練時にペアを共有座標で表現し,推論時に事前造影画像から利用できない上限値を予測する。
- MAMA100データセットを用いた評価により,PECは8つの評価指標全てにおいて性能が向上することが示された。
- 特に,MSEおよびLPIPSにおいて顕著な改善が見られ,ソースのみのVCE設定での有効性が確認された。
子宮層セグメンテーションのための教師なし敵対的ドメイン適応:ラベル付きシネMRIからラベルなし動的EPI MRIへ [eess.IV, cs.CV]目的:子宮層セグメンテーションにおけるドメイン適応手法の開発
- 月経周期における子宮蠕動運動は,子宮壁の微細構造と密接に関わる重要な生理現象である。
- 子宮運動や組織特性の変化が婦人科疾患に関与するが,従来の研究ではそれらが孤立して研究されてきた。
- ラベル付きシネMRIの知識をラベルなし動的EPI MRIに転移し,セグメンテーションの精度向上を目指す。
- 教師なし敵対的ドメイン適応フレームワークとUnet-LSTMモデル,マルチスケールドメイン識別器を実装した。
- Dice係数は0.88,Jaccard指数は0.80を達成し,良好なセグメンテーション性能が確認された。
- 子宮内膜,移行帯,筋層の平均T2*値はそれぞれ108ms,76ms,124msであった。移行帯の面積とT2*値には負の相関が見られた。
動画における顕著物体ランキングのための長期記憶と時間的注意シフトのモデル化:新たなベンチマークとの連携 [cs.SI, physics.soc-ph, cs.CV]目的:動画における顕著物体ランキングの性能向上
- 動画理解において,視覚的な注意を模倣する顕著物体検出は重要な役割を果たす。
- 既存の動画顕著物体ランキング手法は,短期的なフレームシーケンスに依存しており,長期的な変化に対応できない。
- 長期的な文脈を考慮し,時間的な注意のシフトを捉えることで,より正確なランキングを実現することを目指す。
- 提案手法LoTASは,過去の顕著性状態と時間的な注意遷移を共同でモデル化する長期記憶フレームワークである。
- Temporal Context DecoderとRank-aware Saliency State Encoderを用いることで,長期的な文脈情報を活用し,ランキングの精度を向上させている。
- 新たな大規模データセットを構築し,多様な動画タイプとシーンに対するロバスト性を検証した結果,最先端手法を上回る性能を達成した。
周波数認識型機能マップによるロバストな形状マッチング [cs.CV]目的:ロバストな形状マッチングのための周波数認識型機能マップの構築
- 3D形状解析において,形状マッチングは重要な課題であり,様々な応用分野で求められている。
- 既存の深層学習を用いた機能マップ法は,特定の形状マッチングにおいて周波数情報を十分に捉えられていない。
- 様々な形状マッチングシナリオに対応できる,周波数情報を考慮した機能マップの学習を目指す。
- 提案手法では,スペクトルフィルタ演算子の保存という制約を導入し,周波数情報を組み込んだ機能マップの学習を可能にした。
- 学習されたフィルタ関数と制約を用いて点対点マップを改良することで,よりロバストかつ正確な対応付けを実現した。
- 様々なデータセットにおける実験結果から,提案手法が既存手法を上回り,特に非等距変形やトポロジーの不整合がある場合に優れた性能を示した。
MSTAR:時系列分類のためのマルチスケールバックボーンアーキテクチャ探索 [cs.CV]目的:時系列分類における最適なアーキテクチャの発見
- 時系列データ分析は,金融,医療,環境など幅広い分野で重要性を増している。
- 既存手法は受容野と周波数に焦点を当て,時間分解能が不十分な場合がある。
- データセット固有の最適な構造を見つけるための自動化された探索手法が求められている。
- 提案手法は,周波数と時間分解能の両方を考慮した新しい探索空間を導入した。
- 本手法は,Transformerモジュールとの組み合わせにより高い性能を発揮するバックボーンとして機能する。
- 4つのデータセットで最先端の性能を達成し,各データに対して10以上の微調整されたモデルを提供した。
幾何場を用いたロバストなバイハーモニックスキニング [cs.GR, cs.LG]目的:バイハーモニックスキニングの自動化手法
- キャラクターアニメーションや形状処理において,効率的な変形手法が不可欠である。
- 既存手法は,テトラヘドラ化に依存し,形状によっては失敗する場合がある。
- オープンサーフェスや点群など,多様な形状に対するロバストなスキニングを実現する。
- 本手法は,既存の最先端手法と同等の重みを生成する。
- テトラヘドラ化を必要とせず,ハードウェアレイトレーシングを活用した新しい定式化を採用する。
- 最適化プロセス中にウェイトペイントによるアーティストの制御を統合することを可能にする。
疎な視点からのエピポーラ幾何を用いたニューラルな表面再構成 [cs.CV]目的:疎な多視点画像からの正確な表面再構成
- 3次元モデルの作成は,ロボティクスやコンピュータビジョンの基礎技術であり,様々な応用分野で重要である。
- 従来の表面再構成法は,視点の少なさや遮蔽により,幾何学的な曖昧さから正確な再構成が困難である。
- エピポーラ幾何を利用し,疎な視点からの再構成精度を向上させることで,この問題を解決することを目的とする。
- 提案手法EpiSは,エピポーラ幾何を用いて,コストボリュームの特徴からより詳細な情報を抽出する。
- EpiSは,既存の汎用的な表面再構成手法と比較して,疎な視点環境下で著しく高い性能を示す。
- 事前学習済みの単眼深度モデルに基づく幾何学的正則化により,情報損失を抑制し,汎化性能を維持している。
CollaFuse: 協調拡散モデル [cs.LG, cs.AI, cs.CV]目的:分散型協調拡散モデルの実現
- 生成AI分野における拡散モデルの重要性が高まっている。
- データ不足,計算コスト,プライバシー保護が課題となっている。
- クライアントの計算負荷を軽減し,効率的な協調学習を目指す。
- 提案手法CollaFuseは,スプリットラーニングに着想を得た分散型協調学習アプローチである。
- CelebA,CIFAR-10,Animals-with-Attributes2での実験により,性能向上と情報漏洩の抑制が確認された。
- エッジコンピューティングなど,多様な応用分野への展開が期待される。
自己教師ありVision Transformerと相乗的ドメインアライメントによる効率的な教師なしドメイン適応 [cs.CV, cs.AI, cs.LG]目的:教師なしドメイン適応の効率化
- ドメイン間の分布のずれは,機械学習の性能を大きく低下させるため,その克服が重要である。
- 既存手法は大規模モデルの微調整に依存し,計算コストが高く,リソース制約のある環境での拡張性が低い。
- 本研究は,大規模モデルの微調整を回避し,少ないパラメータで高い性能を維持する手法を提案する。
- 提案手法EUDAは,DINOv2バックボーンを固定し,軽量なボトルネックと分類ヘッドのみを更新するパラメータ効率的なフレームワークである。
- 相乗的ドメインアライメント損失(SDAL)により,識別学習とドメイン間のアライメントを促進する。
- Office-Home,Office-31,VisDA-2017,DomainNetにおける実験で,EUDAは多様なドメイン複雑度において競争力のある性能を示すとともに,学習パラメータ数を大幅に削減した。
位置的 $\mathbf{\Pi}^0_3$-完全目的 [cs.CC, cs.FL, cs.GT, cs.LO]目的:グラフ上のゼロサム,ターンベースゲームにおける目的
- ゲーム理論は,経済学,計算機科学など幅広い分野に応用され,意思決定のモデル化に不可欠である。
- 複雑なゲームの目的の計算可能性は難しく,特にボレル階層の高い目的は解析が困難である。
- $\mathbf{\Pi}^0_3$-完全な位置的ゲーム目的の存在を示すことで,その複雑性を明らかにすることを目指す。
- $\mathbf{\Pi}^0_3$-完全な位置的ゲーム目的の存在が示された。これは既知の目的よりも高い複雑性を持つ。
- この目的は,総ペイオフ目的の定性的変種であり,任意の基数を持つゲームグラフで位置戦略で勝つことが可能である。
- これまで位置戦略で勝てる目的は$\mathbf{\Sigma}^0_3$に留まっていたため,新たな知見を提供する。
ビジュアルグラウンディング:サーベイ [cs.CV]目的:ビジュアルグラウンディングの発展と課題の整理
- 視覚と言語の連携は,人間らしい知能を実現する上で不可欠である。
- ビジュアルグラウンディング研究は急速に進展しており,概念や設定の整理が求められている。
- 近年の進展を体系的に整理し,今後の研究方向性を示すことを目指す。
- 本サーベイでは,ビジュアルグラウンディングの歴史的経緯と基礎知識を概説している。
- 進展してきた概念や設定を整理し,公平な比較を可能にする標準化を提案している。
- 関連するデータセットや応用例に加え,将来の研究課題と方向性についても議論している。
MaterialFusion:拡散モデルを用いた高品質,ゼロショット,制御可能な材質転送 [cs.RO, cs.SY, eess.SY, cs.CV]目的:高品質な材質転送の実現
- AR/VR等の応用において,画像内の物体材質操作は不可欠である。
- 既存手法では,材質転送時の品質や制御性,背景との整合性に課題がある。
- 材質適用度合いを調整し,高品質かつ自然な材質転送を実現する。
- MaterialFusionは,既存手法と比較して,材質転送の品質,ユーザー制御性,背景維持において顕著な性能向上を示す。
- 本手法は,材質の適用度合いを調整することで,新しい材質特性と元のオブジェクトの特徴の最適なバランスを実現する。
- 背景の一貫性を維持し,境界アーティファクトを軽減することで,変更されたオブジェクトをシーンにシームレスに統合する。
熱帯畳み込みニューラルネットワークの複合・並列モード [cs.CV, cs.AI]目的:熱帯畳み込み演算の拡張による,計算コストとモデル精度のトレードオフの改善
- 画像認識などの分野で基礎となるCNNは,計算資源に制約があるデバイスへの展開が課題。
- 熱帯CNNは計算量を削減するが,精度低下が問題となる場合がある。
- 計算コストを抑えつつ,表現力を向上させる新しい熱帯畳み込み演算の開発。
- 提案手法である複合熱帯畳み込み(cTCNN)と並列熱帯畳み込み(pTCNN)は,標準CNNと同等の性能を維持しつつ,乗算回数を大幅に削減できる。
- 画像分類やセマンティックセグメンテーションのベンチマークテストで,その有効性が確認された。
- 熱帯畳み込みと従来の畳み込みを組み合わせたハイブリッドモデルは,精度と効率のバランスをさらに改善する。
少数の学習データを用いたシーンテキストセグメンテーションのための属性認識表現学習 [cs.CV]目的:シーンテキストセグメンテーションにおける,属性を意識した表現学習
- シーンテキストセグメンテーションは進展しているが,高品質なデータセットの不足が課題である。
- ピクセルレベルのアノテーションコストが高く,学習データが限られているという問題が存在する。
- 学習データが少ない状況でも,効果的なセグメンテーションを実現することを目指す。
- 提案手法TSALは,事前に学習済みのCLIPモデルを活用し,転移可能なテキスト属性を学習する。
- 視覚誘導ブランチと適応的プロンプト誘導ブランチの二つの構成要素で,テキストと背景の特徴を抽出する。
- 適応的特徴アライメント(AFA)モジュールにより,テキスト属性と視覚的表現を効果的に整合させる。
VLCフュージョン:ロバストな物体検出のためのビジョン・言語条件付きセンサフュージョン [cs.CV]目的:環境条件やセンサ入力の微妙な変動を考慮した,ロバストな物体検出
- 複数のセンサ情報を融合することで物体検出性能を向上させることが重要である。
- 既存手法では,環境条件やセンサ入力の変化に適応的に重みを調整することが困難である。
- 環境の変化に頑健な物体検出を実現するため,各モダリティの重みを動的に調整すること。
- VLCフュージョンは,ビジョン・言語モデルを活用し,環境の微妙な手がかりに基づいてフュージョンを制御する。
- 実世界の自動運転および軍事ターゲット検出データセットにおいて,従来のフュージョン手法を上回る検出精度を達成した。
- 未知の環境においても,VLCフュージョンは安定した性能を示すことが確認された。
SVL:3次元オープンワールド理解のためのスパイクニューラルネットワークの強化 [cs.CV]目的:スパイクニューラルネットワークにおける3次元オープンワールド理解能力の向上
- 省電力な3次元空間・時間特徴抽出において,スパイクニューラルネットワークは有望視されている。
- 既存のスパイクニューラルネットワークは,十分な事前学習戦略の欠如により,性能が人工ニューラルネットワークに劣る。
- 多様なモダリティを統合し,汎化性能を高めることで,3次元オープンワールド理解のギャップを埋める。
- 提案手法SVLは,ゼロショット3次元分類において85.4%のトップ1精度を達成し,高度な人工ニューラルネットワークモデルを上回る結果を示した。
- 3次元分類,DVS行動認識,3次元検出,3次元セグメンテーションといった様々な下流タスクにおいても,既存のスパイクニューラルネットワークを凌駕する性能を発揮した。
- SVLは,スパイクニューラルネットワークによるオープンワールド3次元質問応答を可能にし,場合によっては人工ニューラルネットワークを上回る性能を実現した。
RECにおけるコントラスト学習のための適切な埋め込み空間とは [cs.CV]目的:参照表現数推定における視覚的特徴の識別能力向上
- 参照表現数推定は,画像中の類似物体を識別する上で重要な課題である。複雑なシーンにおける対象物の正確なカウントに不可欠である。
- 既存手法は画像とテキストの正確なアライメントに依存しており,利用可能な負例の少なさが課題となっていた。
- 本研究は,視覚的埋め込み空間内でのコントラスト学習によって,この問題を解決することを目指している。
- C-REXは,同一画像内の視覚トークンを対比させることで,より豊富な負例を生成し,安定した学習を可能にした。
- その結果,微細な視覚的識別能力が向上し,複雑なオープンワールド環境での汎化性能が改善された。
- C-REXは既存のRECモデルに容易に組み込むことができ,MAEとRMSEで最先端の結果を達成した。
MLC-SLMチャレンジタスク1 Eloquenceチームの提出 [cs.SD, cs.CL, eess.AS]目的:多言語対話音声認識モデルの性能向上
- 実世界の対話データは,堅牢な音声対話システム構築に不可欠である。
- 既存の多言語音声認識モデルは,言語間や文脈依存性において課題が残る。
- コントラスト学習や拡張された対話文脈による認識の頑健性向上を目指す。
- 公式ベースラインモデルの強みと弱点を評価するため,異なる基盤モデルで2つのプロジェクター(線形およびqformer)を訓練した。
- SLAM-ASRフレームワークを利用して,カスタムの多言語線形プロジェクターを訓練し,性能を検証した。
- コントラスト学習と拡張された対話文脈が,音声認識の頑健性に与える影響を調査した。
P3P問題の容易化 [cs.CV]目的:3点対応関係からのカメラ絶対姿勢復元
- ロボットビジョンやSLAMにおいて,カメラ姿勢推定は不可欠な技術である。
- P3P問題の古典的な解法は,複雑で計算コストが高いとされてきた。
- 古典的なP3P解法を現代的な知見で再実装し,効率と精度を両立させる。
- 本研究では,P3P問題を解くための簡潔な代数ソルバーを提案した。
- 提案手法は,最先端の手法と同等の精度と実行時間を実現している。
- 古典的なP3Pの定式化は,シンプルさ,効率性,精度のバランスに優れていることが示された。
双方向衣服転送:衣服の着脱合成のための統一拡散フレームワーク [cs.CV]目的:衣服の着脱合成のための統一的なフレームワーク
- バーチャル試着技術は,衣服のデザインや販売において重要な役割を担う。
- 衣服の着脱(バーチャル試着とバーチャル脱着)は分離して扱われ,対称的な関係が無視されている。
- 着脱両方のタスクを同時に解決し,より自然な画像合成を目指す。
- 本研究では,双方向衣服転送モデル(TWGTM)を提案し,衣服の着脱合成を統一的に行うフレームワークを実現した。
- 潜在空間とピクセル空間からの双方向のガイダンスにより,着脱タスク間のスムーズな連携を可能にした。
- 段階的な学習パラダイムを用いることで,マスク依存性の非対称性を解消し,高い性能を検証した。
メッシュと拡散モデルを用いたクロスビュー一貫性のある都市シーン生成:MeSS [cs.CV]目的:都市メッシュモデルを基盤とした高品質でスタイル一貫性のある屋外シーンの生成
- 都市の3Dメッシュモデルは普及が進んでいるが,リアリティのあるテクスチャが課題となり,実用が制限されている。
- 既存の画像・動画拡散モデルは,3Dシーン生成への直接的な応用が難しく,クロスビューの一貫性確保が課題である。
- メッシュモデルの形状情報を活かしつつ,拡散モデルの性能を向上させることで,高品質な都市シーン生成を実現する。
- 提案手法MeSSは,カスケードアウトペインティングControlNetを用いて幾何学的に一貫性のある疎な視点画像を生成する。
- 生成された視点画像からAGInpaintを用いてより密な中間視点画像を伝播し,GCAlignモジュールで視覚的な不整合を解消する。
- 3D Gaussian Splattingによりシーンを再構築し,既存手法と比較して幾何学的精度と生成品質において優位性を示す。
ビデオ大規模言語モデルにおけるプロンプト誘導サンプリングのポイズニング [cs.RO, cs.CV]目的:ビデオ大規模言語モデルにおけるプロンプト誘導サンプリングの脆弱性
- 動画プラットフォームにおける安全性確保の重要性が増しており,自動モデレーションの需要が高まっている。
- 既存のフレームサンプリング手法は,単純なフレーム置換攻撃に脆弱であることが知られている。
- プロンプト誘導サンプリングの脆弱性を明らかにし,より安全なサンプリング手法の設計に貢献する。
- 本研究では,PoisonVIDと呼ばれる転移攻撃によって,プロンプト誘導サンプリングのランキングを操作し,有害なクリップが検出されないようにできることを示した。
- PoisonVIDは,ターゲットモデルの重みや勾配にアクセスすることなく,シャドウモデルと汎用言語モデルを用いて,有害な記述を抑制する損失関数を最適化する。
- 低解像度での再エンコードは,攻撃の成功率を低下させるものの,完全な防御にはならないことがわかった。
HomeSafeBench:自由探索型ホーム安全検査のための具現化された視覚言語モデル用ベンチマーク [cs.RO, cs.CV, cs.CL]目的:家庭内安全検査における視覚言語モデルの性能評価
- 家庭内事故は予防可能な負傷の主要な原因であり,安全性の確保が重要である。
- 既存のモデルは,現実世界の複雑な環境で安全上の危険を認識する能力が不十分である。
- 自由探索と一人称視点からの安全検査タスクに焦点を当て,モデルの危険認識能力向上を目指す。
- HomeSafeBenchは,5種類の家庭内の危険を網羅する1,000件の検査タスクを含む,初のベンチマークである。
- 最先端の視覚言語モデルの評価により,人間の検査員(98.0%)と比較して大きな性能差(最高F1値34.7%)が明らかになった。
- 提案手法CueBackは,データ構築により平均F1値を18.7%から45.3%に向上させ,既存モデルの性能を上回った。
胎児超音波解釈のための認識的視覚言語基盤モデル [cs.CV, cs.AI, cs.IR, cs.MM]目的:胎児超音波画像からのレポート生成と診断
- 医療画像診断の精度向上は,周産期医療の質を向上させる上で不可欠である。
- 胎児超音波画像は,多角的な視点と多様な疾患が存在するため,既存のモデルでは十分な性能を発揮できない。
- 胎児超音波画像特有の課題を克服し,診断支援の精度向上を目指す。
- FetalMindは,既存のオープンソースおよびクローズドソースの基盤モデルを全ての妊娠段階において上回る性能を示した。
- 特に重篤な疾患の検出精度において,平均+14%の改善,+61.2%の高い精度を達成した。
- 大規模データセットFetalSigma-1Mの構築により,胎児超音波分野におけるデータ不足の問題を解決した。
MIDI-LLM:大規模言語モデルの適応によるテキストからMIDIへの音楽生成の改善 [cs.SD, cs.CL, cs.MM]目的:テキストからMIDIへの音楽生成における性能向上
- 音楽生成分野は,創造性の拡張や新たな表現方法の開拓に貢献し,エンターテインメントや教育など幅広い分野で活用が期待される。
- 既存のテキストからMIDIへの変換モデルは,音楽の品質やテキスト指示への忠実さに課題があり,自然で創造的な音楽生成が困難である。
- 大規模言語モデルを活用し,MIDI生成に適応させることで,より高品質かつテキスト指示に沿った音楽生成を実現することを目指す。
- MIDI-LLMは,Llama 3.2 (1B)を基盤とし,既存のText2midiモデルよりもテキスト制御と音楽の品質において優れた性能を発揮する。
- テキストとMIDIのペアによる教師ありファインチューニングに加え,テキストとMIDIそれぞれの事前学習が,性能向上に不可欠であることが確認された。
- Hookpad Ariaユーザーを対象としたブラインドテストの結果,MIDI-LLMはテキスト制御なしのベースラインモデルと比較して,リードシート生成における受容率が最も高いことが示された。
CLIP4VI-ReID:CLIPセマンティックブリッジによる可視・赤外線人物再識別のためのモダリティ共有表現学習 [cs.CV]目的:可視・赤外線人物再識別におけるモダリティ共有表現
- 人物再識別は,監視カメラ等を用いた安全・安心な社会の実現に不可欠な技術である。
- 可視光画像と赤外線画像間には物理的特徴の差があり,再識別性能のボトルネックとなっている。
- CLIPを活用し,可視光画像と赤外線画像のセマンティックギャップを埋めることで再識別精度向上を目指す。
- 提案手法CLIP4VI-ReIDは,可視光画像からテキストセマンティクスを生成し,赤外線画像の特徴を修正することでモダリティ間の表現を共有する。
- テキストを橋渡しとして可視光画像と赤外線画像のセマンティックアライメントを間接的に行うことで,高精度な再識別を実現する。
- 実験結果から,提案手法が既存の最先端手法と比較して,複数の可視・赤外線人物再識別データセットで優れた性能を示すことが確認された。
単一静的レーダーに基づく屋内シーン理解:RISE [cs.IR, cs.CV]目的:単一静的レーダーを用いた屋内シーン理解のためのベンチマークとシステム
- 屋内環境における位置認識は,ロボット工学や拡張現実などに応用が期待され,重要性が高い。
- 従来のカメラやLiDARは,プライバシー侵害や遮蔽の影響を受けやすく,屋内での利用に課題があった。
- レーダーの低解像度という課題を克服し,高精度な屋内シーン理解を実現することを目的とする。
- 提案手法RISEは,従来のmmWaveレーダーによるレイアウト再構成のChamfer Distanceを60%削減した。
- mmWaveレーダーを用いた物体検出を初めて実現し,58%のIoUを達成した。
- RISEは,単一静的レーダーを用いた屋内シーン理解の新たな基盤を確立した。
BI-RADS適合形体学的事前知識を用いたマルチタスク学習による乳房超音波セグメンテーションの外部妥当性検証 [cs.CV, cs.AI]目的:乳房超音波画像のセグメンテーションと悪性度分類の性能向上
- 乳房超音波検査は,乳がんの早期発見に不可欠であり,診断精度向上が求められている。
- 画像取得システムや患者集団の違いによるドメインシフトが,セグメンテーションモデルの汎化性能を阻害する。
- 臨床的に妥当な形体学的制約を組み込み,ドメインシフト下でのセグメンテーションと悪性度分類の精度を向上させる。
- 提案手法は,セグメンテーション(DC: 0.764 vs. 0.740)と悪性度分類(AUC: 0.818 vs. 0.791)において,単一タスクベースラインを上回る性能を示した。
- 4つの独立データセット間でのすべての組み合わせによる外部検証を行い,安定した性能が確認された。
- 学習された形体学的重みは,全てのデータセットで一貫しており,境界の粗さが最も重要な特徴であることが示唆された。
オーディオビジュアル世界モデル:物理的基盤に基づいたマルチセンサリダイナミクスの学習 [cs.MM, cs.CV, cs.SD]目的:物理的に基づいたマルチセンサリダイナミクスの学習
- 現実世界とのインタラクションには,視覚だけでなく聴覚情報も不可欠である。
- 既存の研究では視覚情報に偏っており,聴覚情報の活用が不十分である。
- マルチセンサリ情報を統合し,環境のダイナミクスをより正確に予測すること。
- 提案手法AV-CDiTは,視覚と聴覚の両方の高精度な予測を達成した。
- AVWMを搭載することで,事前学習済みのエージェントのナビゲーション性能が大幅に向上した。
- AVW-4kは,76の室内環境における30時間のオーディオビジュアルデータを収録したベンチマークである。
