arXiv雑要約
画像・音声 - 2026/08/05 公開
AI生成音楽における味覚と音の対応に関する異文化評価 [cs.HC, cs.SD]目的:AI生成音楽における味覚と音の対応の文化間差異
- 音と味覚の関連性は,食体験や音楽における感情喚起に影響を与える重要な要素である。
- AIによる音楽生成において,味覚を音楽として表現する試みはあるものの,文化による影響は未検証であった。
- 異なる文化圏における味覚と音の対応の普遍性と差異を明らかにすること。
- アルゼンチンとイタリアでは,微調整されたMusicGenの音楽に対する好みが確認されたが,日本では確認されなかった。
- 味覚の評価において国による大きな違いが見られたが,参加者内標準化後は有意な差は消失し,味覚と記述子の対応関係は概ね不変であった。
- 探索的因子分析の結果,12の記述子は各文化圏で異なる潜在的次元に組織化されていることが示された。
単価の低いハイブリッドリザバーコンピューティングモデルによる分離型手話ビデオ認識 [cs.RO, cs.AI, cs.CV]目的:分離型手話ビデオの認識
- 聴覚者と聴覚障害者間のコミュニケーションを円滑にするため,手話認識技術は重要である。
- 深層学習は高い性能を示すが,計算コストが高く,エッジデバイスへの実装が困難である。
- 本研究は,低コストでエッジデバイスに実装可能な手話認識手法を開発する。
- 提案手法は,WLASL100データセットにおいて,上位1, 5, 10の正解率でそれぞれ61.12%,86.05%,92.56%を達成した。
- 深層学習と比較して,わずか数秒で学習が完了し,大幅な学習時間短縮を実現した。
- 計算コストが低いため,エッジデバイスへの実装可能性を示唆している。
効率と有効性の両立:明示的思考と潜在的思考の訓練不要な注意誘導による切り替え [cs.MM, cs.AI, cs.CL, cs.CV]目的:マルチモーダル大規模言語モデルにおける効率性と有効性のバランス
- マルチモーダル大規模言語モデルは,画像認識と論理的推論の両方が求められるため,様々な応用が期待されている。
- 明示的な思考は計算コストが高く,潜在的な思考は訓練コストがかかるという課題があった。
- 視覚情報と論理的不確実性を分離し,効率的な推論を可能にすることを目指す。
- 提案手法は,視覚とテキストへの注意の比率に基づいて,明示的思考と潜在的思考を動的に切り替える。
- 実験の結果,提案手法は最先端の性能を達成し,精度と推論効率を大幅に向上させた。
- 特に,自己回帰ステップ数と遅延時間を削減することで,効率的な推論を実現した。
Hi-Token:生成型視覚的接地のための階層的座標トークン化 [cs.CV]目的:生成型視覚言語モデルにおける視覚的接地性能の向上
- 視覚言語モデルは画像とテキストの情報を統合し,高度な視覚理解を実現する上で不可欠である。
- 既存モデルでは,バウンディングボックス座標が独立した記号として扱われ,数値の順序や軸の意味が考慮されていない。
- 座標の構造化表現と報酬関数を導入することで,視覚的接地における位置特定精度を高める。
- Hi-Tokenは,座標を軸ごとに桁ごとにトークン化することで,粗から細かい構造を付与し,トークンの再利用性を高める。
- Hi-GARは,ボックスの重複度と座標の精度に基づいて報酬を与え,グループ相対的方策最適化を支援する。
- 実験の結果,Hi-TokenとHi-GARは複数のVLMバックボーンとベンチマークにおいて,位置特定精度と低重複予測の削減に貢献することが示された。
MT-Web2Code:複数ターンにおける領域再構築と局所的な修正に関するコーディングエージェントのベンチマーク [cs.CV]目的:複数ターン形式でのWeb UIコード生成における,領域再構築と局所的修正の評価基準
- Web UI開発の自動化は,効率向上に不可欠であり,開発者の負担軽減に繋がる。
- 既存のベンチマークは単一ターン生成に偏り,実際の反復的な開発ワークフローを反映していない。
- 複数ターン形式で,領域再構築と局所的修正に特化した評価基準を確立し,コーディングエージェントの性能を測る。
- MT-Web2Codeは,16の分野にわたる102のタスクを含む,マルチターン形式のコーディングベンチマークである。
- 現在のコーディングエージェントは,ターゲット領域の正確な再構築と,影響を受けないコンテンツの維持に苦戦している。
- 局所的な修正において,エージェントは詳細な視覚-コード間の整合性を欠き,複数ターンにわたるエラーの連鎖が発生しやすい。
続行または再計画?ベルヌーイ継続方策による適応的ホライズン実行 [cs.RO, cs.AI, cs.CV, cs.LG]目的:適応的ホライズン実行のためのベルヌーイ継続方策
- ロボットタスクにおいて,効率的かつ柔軟な行動計画は重要である。
- 既存のVLAモデルは固定長の行動系列を用いるため,状況に応じた計画更新が困難である。
- 本研究は,タスクの進捗に応じて行動系列の継続または再計画を決定する方策を提案し,ロボットタスクの成功率向上を目指す。
- 提案手法であるベルヌーイ継続方策(BCP)は,RoboTwin 2.0環境において,13の低成功率タスクで平均成功率を11.08%向上させた。
- BCPは,ランダム化された環境への汎化性能も示し,平均成功率を4.06%向上させた。また,異なるベース方策への転移も成功している。
- 実機ロボットによる実験では,2つの操作タスクでそれぞれ成功率を74%から92%,44%から84%に向上させている。
Mambaに基づく知識蒸留による軽量3D物体検出 [cs.RO, cs.CV]目的:軽量3D物体検出手法の開発
- 自動運転やロボットナビゲーションにおいて,高精度かつ効率的な3D物体検出が不可欠である。
- 既存手法は高精度を追求するあまり,計算コストが増大し,組込みデバイスでの利用が困難である。
- Mambaを用いて計算コストを削減しつつ,高精度を維持する3D物体検出手法を確立する。
- 提案手法は,知識蒸留フレームワークにより,教師モデルから学生モデルへと効率的に知識を伝達する。
- Mambaを基盤とする教師バックボーンと,空間的に対応するボクセル特徴をアラインメントするメカニズムが,計算負荷の軽減に貢献する。
- 公開データセットと実データでの実験により,提案手法が競合手法と比較して優れた性能を発揮することが示された。
ロボット自律の原理 [cs.RO, cs.AI, cs.CV, cs.SY, eess.SY]目的:ロボット自律の基礎理論と実践
- 社会におけるロボットの活用が拡大しており,自律技術の重要性が高まっている。
- 古典的なロボット工学と最新の物理AIの統合が課題となっていた。
- 次世代の自律システム設計・分析・開発に必要な基盤を提供する。
- 本研究は,実世界での応用を重視した,自律システムの原理を包括的に解説する。
- 長年のスタンフォード大学での教育経験に基づき,自律スタックのコア要素を統一的な概念フレームワークで構築する。
- 理論的理解と実践的直感を両立させるため,Jupyter Notebookと実装演習を併用する。
マルチ解像度セルからギガピクセル全スライド画像への計算病理用基盤モデル [cs.CV]目的:計算病理における基盤モデルの構築
- 病理診断の精度向上に貢献する計算病理分野の重要性が高まっている
- 既存モデルは単一解像度での学習に偏り,様々な解像度への汎化が課題である
- 多解像度情報を活用し,より汎用的なWSI表現を獲得することを目指す
- MRPTは,細胞レベルからWSIレベルまでの多解像度情報を階層的に集約する。
- CCRA機構により,解像度に依存しない相互作用を捉え,解像度間の意味的一貫性を強化する。
- 34の多様なデータセットで,既存モデルやMLLMを上回る性能を達成した。
ラベルはいくつで十分か?:医療画像分類のための能動学習導入アドバイザー [cs.CV, cs.AI, cs.LG]目的:医療画像分類における能動学習手法選択のための導入支援
- 医療画像解析には専門家によるアノテーションが必要であり,コストと時間がかかる。
- 適切なサンプリング戦略の選択が困難であり,誤った選択はコスト増を招く可能性がある。
- 初期段階で最適な手法を選定し,必要なアノテーション数を予測することでコスト削減を目指す。
- 提案手法ALDAは,パイロットデータを用いて学習曲線モデルを構築し,目標性能達成の可能性を評価する。
- アノテーションコストの不確実性を考慮し,最も堅牢な戦略を選択することでリスクを抑制する。
- 4つの医療画像分類タスクにおいて,ALDAはアノテーションコストを最大82%削減できることを示した。
キーポイントの自己整合性による姿勢推定失敗の検出 [cs.AR, cs.CV]目的:姿勢推定における失敗検出手法
- 姿勢推定は,ロボット工学やコンピュータビジョンにおいて重要な役割を担う技術である。
- 既存手法では,キーポイント間の関係性が十分に考慮されておらず,姿勢推定の精度と信頼性に課題がある。
- キーポイントの自己整合性を評価することで,姿勢推定の失敗を識別し,信頼性を向上させることを目指す。
- 提案手法では,キーポイント間の距離や投影の一貫性などの幾何学的特徴量を活用する。
- ロジスティック回帰分類器を用いることで,姿勢推定の失敗を高精度に検出できることが示された。
- キーポイントの不確実性に依存する既存手法と比較して,より高い性能を発揮することが確認された。
GVCCTurbo:コードブック駆動型生成圧縮のためのレート-計算品質スケジューリング [cs.CV]目的:コードブック駆動型生成圧縮におけるレート-計算品質スケジューリング手法
- 超低ビットレートでの画像・動画圧縮は,帯域幅が限られた環境での高品質な通信に不可欠である。
- 既存のコーデックは,修正を事前評価に依存させるため,計算コストが高く,効率が低い。
- 本研究は,計算コストを削減しつつ,圧縮品質を維持するための効率的なスケジューリング手法を提案する。
- 提案手法GVCCTurboは,BPP(ビット/ピクセル)をスケジューリングの入力とし,事前評価の回数を削減する。
- 720pの実験結果から,GVCCTurboは,事前評価の回数を44%削減し,デコード時間を短縮できることが示された。
- また,GVCCTurboは,LPIPS(知覚的類似性指標)のわずかな低下で,PSNR(ピーク信号対雑音比)を向上させることも確認された。
MinerU.Chem:光学化学構造および反応認識のための高精度システム [cs.CV]目的:有機化学文献からの化学構造と反応の抽出
- 有機化学分野の知識ベース構築やAI活用において,構造データの機械可読化が不可欠である。
- 既存のドキュメント解析システムでは,化学構造や反応情報を正確に読み取ることが困難であった。
- 有機化学文献から高精度に化学構造と反応を抽出し,データ利活用を促進すること。
- MinerU.Chemは,化学構造認識において,SMILESの完全一致精度93.02%を達成した。
- 既存の最高性能システム(GPT-5.6-Sol)を18.15%ポイント上回る性能を示した。
- CARBON形式を用いて,視覚的なレイアウトと複雑な化学的意味を両立した構造表現を実現した。
拡散画像に対する改ざん耐性ウォーターマークのための視覚・意味的結合:IRIS [cs.AR, cs.CV]目的:拡散モデル生成画像に対する改ざん耐性を持つウォーターマーク技術
- デジタルコンテンツの保護は重要であり,生成AIの普及に伴い,その必要性は増している。
- 既存のウォーターマークは画像に依存せず,生成モデルの生成物以外に移植される可能性がある。
- 画像の内容とウォーターマークを結合することで,不正な移植を防ぎ,画像の真正性を検証する。
- IRISは,生成された画像の視覚的特徴から意味コードを読み取り,秘密鍵と組み合わせて一回限りのリングを生成する。
- 生成過程の最終段階でこのリングを埋め込むことで,改ざん検出を可能にし,高い検出精度と忠実性を実現した。
- 固定パターンや再生成による攻撃に対して耐性があり,既存技術と比較して優れた改ざん防止効果を発揮する。
病理画像の高精度超解像のための構造的意味的相乗拡散モデル S$^3$-Diff [cs.CV]目的:病理画像の高精度超解像
- デジタル病理診断は高解像度画像に依存するが,デバイスやストレージの制約が存在する。
- 既存の超解像技術は,重要な形態情報を平滑化し,診断精度を損なう可能性がある。
- 病理学的形態を維持しつつ,高精度な画像復元を実現することを目的とする。
- 提案手法S3-Diffは,SAMを用いて抽出した組織支持と勾配の差異を組み合わせた構造的アンカーを生成する。
- SSFTによりDINOv3表現を適応させ,構造的指示を用いてノイズ除去を制御し,アーチファクトを抑制する。
- 実験結果から,S3-Diffは既存手法と比較して,再構成品質と生存率解析性能の両方で優れた性能を示す。
分布シフト下における表形式データ-画像分類器に対するテスト時拡張 [cs.AR, cs.RO, cs.CV, cs.LG]目的:表形式データを画像表現に変換する手法における,分布シフト下での予測性能向上
- 表形式データ分析において,深層学習モデルの高性能を活用する新たな手法の必要性が高まっている
- 表形式データから生成された画像表現を用いた分類器の,分布シフトに対する頑健性が未解明である
- 分布シフト下での分類性能向上を目指し,テスト時拡張(TTA)の有効性を検証する
- テスト時拡張は,分布外データに対する予測性能を向上させる効果が確認された
- 特に,複合戦略と光度戦略が,頑健性と分散のバランスに優れていることが示された
- 周波数領域変換は,エンコーダの特性を変更し,性能を低下させる傾向が確認された
コンパス:欠損モダリティ下におけるマルチモーダルひび割れセグメンテーションのための軽量ニードルRWKVを用いた劣化シミュレーションによる相互学習 [cs.CV]目的:産業設備におけるマルチモーダルひび割れセグメンテーションのロバスト性向上
- 産業設備の安全性確保には,ひび割れなどの欠陥の正確な検出が不可欠である。
- 欠損モダリティがセグメンテーション性能を低下させる問題と,計算コストが高いことが課題である。
- 欠損モダリティ下でも性能を維持し,計算コストを抑えるための手法を開発する。
- 提案手法Compassは,劣化シミュレーション蒸留により,欠損モダリティに対するロバスト性を実現した。
- 軽量なニードルブロックと,エビデンシャルトポロジー保存融合により,効率的なひび割れセグメンテーションを可能にした。
- CrackDepthデータセットにおいて,90%の深度モダリティ欠損下でも,高いF1スコア(0.8216)とmIoU(0.8434)を達成した。
単純な環境スケール拡大を超えて:マルチモーダルエージェント学習のための効果的な環境分布の設計 [cs.CV]目的:マルチモーダルエージェント学習における効果的な環境分布の設計
- ロボット工学やAIにおいて,現実世界への適応能力を持つエージェントの育成が重要である。
- 既存のマルチモーダル環境分布は,多様性や難易度構造の点で限界がある。
- 多様性と難易度構造を考慮した環境分布を構築し,マルチモーダルエージェントの学習を改善する。
- 能力を考慮した環境選択(AES)により,多様な環境セットを取得できることが示された。
- 階層的難易度カリキュラム(HDC)が,学習の効率と性能を向上させることが確認された。
- AESとHDCの組み合わせは,マルチモーダルエージェントの学習を効果的に改善する。
SlimVLM:感度を考慮した動的構造化プルーニングと適応的視覚トークン選択による効率的なビジョン言語モデル [cs.CV]目的:ビジョン言語モデルの効率化
- 画像とテキストの両方を理解するビジョン言語モデルの重要性が高まっている
- モデルサイズが大きいため,リソースに制約のある環境での利用が困難である
- 冗長な視覚トークンを除去し,各モジュールの感度に応じてプルーニング率を調整する
- SlimVLMは,既存手法と比較して複数のマルチモーダルベンチマークで優れた性能を示す
- 平均的なテキスト-視覚注意スコアを活用することで,重要な視覚トークンを効率的に選択する
- プルーニングされたモジュールと元のモジュールの出力間の線形再構成誤差を計算し,安定した性能を維持する
多言語LLMベースの音声認識のための言語特化型マルチ教師オンポリシー蒸留 [cs.CL, cs.SD, eess.AS]目的:多言語音声認識における言語特化型知識の獲得と多言語能力の統合
- 現代の音声認識は多言語対応が標準であり,大規模多言語コーパスとLLMの活用が重要である。
- 異なる言語の音響・音声・語彙特性を同時に学習すると,最適化の競合が生じ,言語ごとの専門性が損なわれる。
- 言語特化型教師モデルの知識を蒸留することで,最適化競合を軽減し,より高性能な多言語音声認識を実現する。
- 提案手法LS-MOPDは,強化学習ベースラインを大幅に上回り,既存の教師モデルの性能を凌駕した。
- 言語ルーティングとトークンレベルのマルチ教師蒸留により,言語特化型知識の獲得と多言語能力の統合を効果的に行った。
- 音響プレフィックスの設定(静的・動的)が,オンポリシー蒸留の有効性に影響を与えることを確認した。
ツィオルコフスキー資料(ロシア科学アカデミー図書館第555コレクション)の機械可読カタログと,その筆跡の読みやすさの測定方法 [cs.CL, cs.CV, cs.DL]目的:ツィオルコフスキー資料の機械可読カタログの作成と,筆跡の読みやすさの測定
- 科学史研究において,一次資料へのアクセスは不可欠であり,資料の効率的な利用が求められる。
- アーカイブ資料は,多くの場合,検索性やデータ化が不十分であり,研究の障壁となっている。
- 本研究は,アーカイブ資料のデジタル化と機械可読化によって,研究の効率化を目指す。
- ツィオルコフスキーのコレクション全2,019ファイル,51,008スキャンを網羅した機械可読カタログを構築した。
- 手書きとタイプライター原稿のページレベル分類,および機械文字起こしコーパス(322ファイル,5,454スキャン)を整備した。
- 手書き文字認識の精度を測定する手法を開発し,294組のペアデータから,平均して37%の単語一致率を確認した。
3Dセマンティックシーン補完のための空間事前ガイダンス [cs.CV]目的:3Dセマンティックシーン補完における空間事前ガイダンスの有効性
- 自動運転やロボット工学において,周囲環境の正確な3Dモデル構築は不可欠である。
- オンボードカメラのみでは,遮蔽や視野角の制限により,完全な3Dシーンの理解が困難である。
- 衛星画像とOpenStreetMap情報を活用し,部分的観測からの3Dシーン補完の精度向上を目指す。
- GeoSceneは,衛星画像とOpenStreetMap情報を3Dセマンティックシーン補完のためのソフトな事前知識として活用する。
- オンボード観測と空間的ガイダンスの信頼性をボクセル単位で学習し,観測済み/未観測領域における特徴量の洗練を制御する。
- SemanticKITTIおよびSSCBench-KITTI-360での実験により,GeoSceneが大規模構造物や道路の補完において,精度向上が確認された。
SEER:制御された空間関係分類のための自己接地された証拠インターフェース [cs.CV]目的:空間関係分類における精度向上
- 視覚言語モデルの発展により,画像とテキスト間の理解が深まっている。
- 対象物と関係性の認識は可能だが,誤ったインスタンスや曖昧な全体像からの回答が課題。
- クエリ固有の証拠を明示することで,この問題を軽減し,精度向上を目指す。
- SEERは,訓練を必要としない推論時インターフェースとして,既存の視覚言語モデルに組み込むことができる。
- GQA-Train900テストにおいて,SEERはFullと比較して+3.94〜+11.79の性能向上を示した。
- クエリ固有の証拠構築が主要な介入であり,整合性確認が微細な改善に繋がる。
疎なレーダー点群からの生体力学的に妥当な人間の動作学習 [cs.CV]目的:レーダー点群からの人間姿勢推定における生体力学的な忠実性の向上
- 人間の動作解析は,リハビリテーションやスポーツ科学など,幅広い分野で重要視されている。
- 既存手法では,人体を制約のないキーポイント座標として扱うため,解釈可能性に課題があった。
- レーダー点群から生体力学的な記述子を復元し,臨床での動作解析への応用を目指す。
- 提案手法は,11名の被験者による検証で,関節位置誤差(MPJPE)6.456±1.759cmを達成した。
- 関節角度誤差(MPJAE)は8.083±0.884度,接触分類F1スコアは0.935±0.009であった。
- 本研究は,低コストレーダーセンサーによる解釈可能な生体力学的な記述子の復元の可能性を示した。
マルチモーダル推論において,より少ない視覚トークンはいつ加速するのか?意思決定箇所とハードウェアにおける損益分岐点の研究 [cs.MA, cs.CV]目的:マルチモーダル推論における視覚トークン数の削減が加速に繋がる条件の解明
- マルチモーダル推論は,画像とテキストなどの情報を統合し,高度な意思決定を可能にする重要な技術である。
- 視覚情報のトークン数を減らすことで計算量を削減できる一方,必ずしも推論の高速化に繋がるとは限らない。
- 意思決定の段階やハードウェアの違いに着目し,視覚トークン数の削減が有利となる条件を明確にすること。
- 視覚トークン数を削減しても,必ずしもエンドツーエンドの遅延が低下するとは限らないことが示された。
- A100においては,視覚処理前のルーティングが,視覚処理後のプルーニングよりも大幅なトークン削減効果をもたらした。
- RTX 3090とA100の両方において,視覚処理前の画像サイズルールは有意な高速化を示したが,厳密な統計的検定後は有意差が消失した。
病理画像の形態を考慮した暗黙的超解像ネットワーク [cs.CV]目的:病理画像の超解像による診断精度向上
- デジタル病理診断は高解像度画像に依存するが,高価なハードウェアが課題となっている。
- 既存の超解像手法では,微細な細胞構造の保持が難しく,組織の多様性に弱い。
- 細胞構造を考慮し,診断に重要な情報を高精度に復元することを目指す。
- Morph-ISRは,既存手法と比較してLPIPSとST-LPIPSを最大38.37%と39.55%削減し,優れた結果を示した。
- 細胞境界や核テクスチャといった診断上重要な情報をより良く保持していることが確認された。
- コンパクトなパラメータ数と高い処理速度により,実用的な展開に適している。
XiDepth:自己教師あり単眼深度推定のための軽量かつ効率的なネットワーク [cs.CV]目的:自己教師あり単眼深度推定のための軽量かつ効率的なネットワークの設計
- 計算資源に制約のあるデバイスでの応用を可能にする軽量かつ効果的なモデルの必要性
- 既存のモデルは計算コストが高く,組み込み環境での利用に課題がある
- XiNet演算ブロックに基づく軽量アーキテクチャにより,低計算量での高性能化を目指す
- XiDepthは,わずか0.8MのパラメータでKITTIデータセットにおいて最先端の性能を達成した。
- Raspberry Pi 4でのテストにより,実世界の組み込みアプリケーションへの適合性が確認された。
- XiDepthは,主要な手法と比較して,FLOPsを40%,消費電力を35%削減した。
針を保ち,干し草の山を剪定する:欠陥を保持するトークン剪定による効率的なゼロショット異常検知 [cs.CL, cs.DC, cs.RO, cs.SY, eess.SY, cs.CV]目的:効率的なゼロショット異常検知のためのトークン剪定手法
- 現実世界のデータには正常サンプルが圧倒的に多く,異常は局所的に限られているため,効率的な処理が求められる。
- 既存のトークン剪定は,正常トークンの冗長計算や異常トークンの除去リスクを伴い,異常検知性能を損なう可能性がある。
- 異常の証拠を保持しつつ,正常トークンを効果的に剪定することで,計算コストを削減し,検知精度を維持することを目指す。
- KeepADは,局所的な$2\times2$パッチにおけるカバレッジ維持選択と,決定論的な異常救済を組み合わせることで,初期層での剪定リスクを低減する。
- 凍結された正常・異常プロトタイプを用いて,画像適応的なトークン予算の下で剪定を誘導し,低リスクな正常トークンを積極的に除去する。
- 密から疎への自己蒸留により,初期層のトークンルーティングを監視し,追加の推論オーバーヘッドを導入しない。
パターンをピクセル以上に:マルチモーダルコード生成におけるパターン補完バイアスの測定 [cs.SE, cs.AI, cs.CV]目的:マルチモーダル大規模言語モデルにおけるパターン補完バイアスの評価
- ウェブページをコードに変換する技術は,Web開発の自動化に貢献し,効率化が期待されている。
- 視覚的なパターンが繰り返される場合,モデルが視覚的に誤りながらもパターンに一貫したコードを生成する問題がある。
- ウェブページのスクリーンショットからコードを生成する際の,パターン補完バイアスの影響を定量的に評価する。
- 最先端の5つのマルチモーダル大規模言語モデルを評価した結果,すべてが繰り返し現れるパターンに強いバイアスを持つことが明らかになった。
- カード幅の摂動では平均バイアス率が69.78%,テキストのフォントサイズの摂動では80.22%に達し,平均精度はそれぞれ21.17%と7.89%にとどまった。
- より多くの推論努力が低いバイアスと相関する一方,モデルは異常な要素を認識できても,パターンに一貫した回答で上書きすることがある。
MultiCompose:被写体属性束縛による多概念パーソナライズされた画像生成 [cs.CV]目的:複数概念と被写体属性の束縛を伴うパーソナライズ画像生成
- 画像生成技術は,多様なコンテンツ制作を可能にする重要な研究分野である。
- 複数被写体を扱う場合,個々の属性とアイデンティティの維持が困難である。
- 複数被写体と属性のパーソナライズにおいて,生成品質の低下を改善する。
- MultiComposeは,概念ごとのパーソナライズと複数被写体推論を分離するフレームワークである。
- 属性束縛を維持する正則化と,空間的に排他的なマスクを用いた推論により,高品質な画像を生成する。
- 提案手法は既存手法を凌駕し,新たなベンチマークMSP-Benchでその有効性が確認された。
Attentionはケースに敏感である [cs.CL, cs.CV, cs.CL, cs.LG]目的:大規模言語モデルにおける文字種の大文字・小文字による注意機構の変化
- 人間の視覚認知において,大文字は自然な注意喚起要素であり,そのメカニズム理解は重要である。
- 大規模言語モデルの注意機構はブラックボックスであり,その内部動作の理解が課題である。
- 文字種が注意配分に与える影響を定量的に評価し,その意味を解明すること。
- 大規模言語モデルは,小文字の文脈において大文字の文字種に注意を集中させる傾向があることが示された。
- 注意の集中が必ずしもタスクの精度向上に繋がらず,場合によっては精度を低下させる可能性も示唆された。
- 推論モデルにおいては,思考過程が文字種の影響を緩和する役割を果たすことが明らかになった。
潜在空間におけるオーディオコーデックの音楽帯域拡張の幾何学について [cs.CL, cs.SD]目的:音楽帯域拡張のための,オーディオコーデックの潜在空間における幾何学的構造の分析
- 近年,音響信号処理において,潜在的生成モデリングが重要な役割を果たしている。
- 既存手法は計算コストが高く,効率的な帯域拡張が課題となっている。
- 潜在空間の構造を利用することで,効率的な帯域拡張を目指す。
- ニューラルコーデックの潜在空間において,単純なベクトル加算が拡散モデルと同等の性能を示すことが示された。
- 一部の潜在空間は帯域情報と整合しており,複雑なモデルの利点が限定的であることが示唆された。
- 潜在空間の構造を利用した,より効率的なモデル開発の可能性が示唆された。
信頼性と再現性の高い胎児脳計測:MRIを用いた深層学習アプローチ [cs.CV]目的:胎児脳計測の自動化および精度向上
- 胎児の脳発達評価は,妊娠週数推定や発達のモニタリング,異常検出に不可欠である。
- 従来の手動計測は時間がかかり,測定者によるばらつきが生じやすいという課題がある。
- 解釈可能なランドマーク局在化を伴う,再現性の高い自動計測手法の確立を目指す。
- 提案手法は,2つの公開データセットを用いて評価した結果,既存の自動パイプラインと同等またはそれ以上の精度を達成した。
- 本手法は,効率性,解釈可能性,拡張性に優れ,臨床ワークフローへの統合を支援する。
- 3D超解像度再構成MRIから,脳セグメンテーションラベルマップを用いてランドマーク座標を回帰する3D CNNを開発した。
AIに基づく効果音生成:入力モダリティにおける生成モデルのナラティブレビュー [cs.DC, cs.SD, cs.AI]目的:効果音生成のためのAI生成モデルの現状と課題
- デジタルコンテンツにおいて,効果音は状況や感情を伝える上で不可欠であり,その重要性は高い。
- 多様性と文脈適応性が求められる一方,高品質な効果音の生成は依然として困難を伴う。
- 様々な入力モダリティを用いたAI生成モデルの効果音生成における質,制御性,文脈適合性を分析する。
- 最新のAI生成モデルは,高忠実度,意味的整合性,時間的な一貫性を持つ効果音生成において優れた性能を示している。
- 複雑な多重イベントシナリオにおける時間的同期の制限,客観的指標と人間知覚のギャップ,制御性と生成多様性のトレードオフなどが課題として残る。
- AI駆動の効果音生成は,より適応的でスケーラブル,かつ文脈を認識したシステムへと進化しつつあり,今後の音響デザインに大きな影響を与えることが期待される。
TDVR:ゼロショット3D視覚的グラウンディングのためのテキスト曖昧性解消と視点推論 [cs.NI, cs.RO, cs.IR, cs.CV]目的:ゼロショット3D視覚的グラウンディングにおけるテキスト曖昧性解消と視点推論
- 3D視覚的グラウンディングは,ロボティクスや拡張現実など,現実世界とのインタラクションにおいて重要な役割を果たす。
- 既存手法は,曖昧なテキストクエリや視点の欠如により,その効果が大きく制限されている。
- 本研究は,曖昧なクエリと視点欠如の問題を解決し,3D視覚的グラウンディングの精度向上を目指す。
- 提案手法TDVRは,訓練データを用いずに,入力テキストの曖昧性を解消し,最適な視点を推論する。
- TDVRは,3Dシーングラフと構造化されたクエリを用いて,視点推論を行い,類似オブジェクトの識別能力を高める。
- ScanReferデータセットでの実験により,既存最先端手法をAcc@0.25で15.25%,Acc@0.5で14.46%上回る性能が示された。
エージェント型探索・検証推論による動画異常理解 [cs.AR, cs.DC, cs.CV]目的:動画における異常事象の包括的な解釈
- 動画分析において,異常行動の自動検出・理解は安全保障や監視システム等で重要視されている。
- 既存手法は,特定の訓練データや限られた観察に依存し,汎化性能や証拠網羅性に課題がある。
- 複数エージェントによる探索・検証プロセスで,より柔軟かつ構造的な証拠収集を目指す。
- 提案手法AgenticVAUは,訓練データなしで高い性能を発揮し,ゼロショット推論や強化学習ベースラインを上回った。
- 異常の発見と検証を分離したマルチエージェント構成により,役割分担と証拠の連携を強化した。
- ECVA,UCF-Crime,MSADデータセットでの実験により,異常理解における複数エージェント協調の有効性を示した。
OmniPack:効率的なオムニモーダル大規模言語モデルのための統一トークン圧縮 [cs.CV]目的:オムニモーダル大規模言語モデルの効率的な展開のためのトークン圧縮
- 近年,画像と音声の両方を理解するオムニモーダルLLMが注目されている。
- 冗長な音声・画像トークン列の処理コストが高く,実用上の課題となっている。
- トークン圧縮による計算コスト削減と性能維持の両立を目指す。
- 提案手法OmniPackは,既存手法と比較して,多様な圧縮率において優れた性能と効率性のバランスを実現した。
- Qwen2.5-Omni-7Bにおいて,性能の98.0%を維持しつつ,FLOPsを16.7%に削減することに成功した。
- さらに,FLOPsを元の6.8%にまで削減しても,性能の92.9%を維持することが示された。
UHP検出:LVLMには一貫性空間における独特な幻覚パターンが存在する [cs.RO, cs.CV, cs.AI]目的:大規模ビジョン言語モデルにおける幻覚の検出
- 近年,マルチモーダル推論能力を持つ大規模言語モデルの利用が拡大している。
- これらのモデルは,視覚的証拠に基づかない幻覚を起こすことが課題となっている。
- モデルの幻覚を特徴づけるための,構造化された不確実性パターンを特定する。
- 提案手法であるUHP検出は,既存の幻覚検出手法よりも高い精度を示す。
- 特に,AUC-ROCとAUC-PRにおいて,最良の既存手法を最大+18.72%と+20.07%上回る。
- 一貫性グループの組み合わせが,幻覚の構造化されたパターンを形成し,汎化性能も高い。
FlowForm:流体物理とトポロジー整合性を融合した衛星洪水合成 [cs.RO, cs.CV, cs.AI]目的:衛星洪水合成のための新たなフレームワーク
- 災害対策において,正確な洪水予測と被害評価は不可欠である。
- 洪水に特化した画像生成のための高品質な衛星画像ペアデータが不足している。
- 既存手法における非現実的な洪水領域やシーン構造の歪みを改善する。
- FlowFormは,SWEに基づいた潜在的正則化と構造を意識した条件付けを統合し,より現実的な洪水画像を生成する。
- Flood Descriptor Module(FDM)は,拡散ボトルのネックにおける補助的な潜在フィールドの浅水方程式の残差に微分可能なペナルティを課す。
- Terrain Anchor Adapter(TAA)は,U-Netのエンコーダの4つのスケールで深度,セマンティック,エッジ特徴を注入し,生成画像の品質を向上させる。
Geo-Embed:都市理解のための統一されたマルチモーダル埋め込み [cs.CV, cs.LG]目的:都市理解のためのマルチモーダル埋め込みの統一的枠組み
- 都市の地理空間データは多様であり,それらを統合的に理解するモデルが求められている。
- 既存のモデルは汎用的な画像とテキストの照合に偏っており,地理空間タスクへの適応が不十分である。
- 多様な地理空間情報を統合し,空間関係や時間変化を考慮した都市理解を目指す。
- 本研究では,45の都市評価タスクを含む大規模なマルチモーダル埋め込みベンチマークGeoMEBを新たに構築した。
- また,異なる地理空間入力に対応する統一埋め込みモデルGeo-Embedを提案し,既存モデルを上回る性能を達成した。
- 本研究は,意味的,クロスビュー,領域レベル,時間的な対応関係を明示的に考慮した地理空間埋め込みモデルの開発を促進する。
LiteMVS:ファウンデーション蒸留とエキスパート集約による効率的な多視点ステレオ [cs.CV]目的:多視点ステレオによる効率的な深度推定と3次元再構成
- ロボティクスや拡張現実など,リアルタイムな3次元認識は重要性が増している。
- 従来の多視点ステレオ法は,テクスチャのない領域で性能が低下しやすい。
- モノキュラーモデルの知識と多視点ステレオの利点を融合し,よりロバストな3次元認識を実現する。
- LiteMVSは,軽量なセグメンテーションモデルと大規模なビジョンファウンデーションモデルからの知識を効率的に注入することで,深度推定と3次元再構成の質を向上させている。
- 提案手法は,コストボリュームをセマンティック記述子で強化し,MoE(Mixture-of-Experts)を用いて適応的な幾何学的集約を行うことで,効率性と精度を両立している。
- ScanNetv2と7-Scenesの実験により,LiteMVSが競争力のある効率性を維持しつつ,高品質な深度予測と3次元再構成を実現することが示された。
CPrefix:構造化された離散カラーマッピングのための組み合わせテンソルフレームワーク [cs.CV]目的:離散カラーマッピングの組み合わせ的観測表現
- 色彩処理において,正確なカラーマッピングは重要な課題である。表現の効率性と構造の理解が求められる。
- 従来のカラーマッピング表現は,サンプル値に依存するため,構造的な洞察が得られにくいという課題がある。
- マッピングの潜在的な構造を抽出し,より効率的かつ構造化された表現を構築することを目指す。
- CPrefixは,多項式係数に基づくテンソルを用いて,離散マッピングを組み合わせ的に表現するフレームワークである。
- このフレームワークにより,マッピングの再構成が可能であり,その構造分析が可能となる。
- ICCプロファイルを用いた検証により,忠実な観測表現と,マッピングとの適合性に関する洞察が得られた。
BanglaWild:OCRおよびVision-Languageモデルのための,実環境におけるベンガル文字シーンテキスト認識ベンチマーク [cs.CL, cs.CV, cs.CL]目的:実環境におけるベンガル文字シーンテキスト認識の評価基準
- OCR技術は,文書のデジタル化や情報へのアクセスを可能にする上で重要である。
- 既存のベンガル文字OCRデータセットは,限定的な状況下での評価に偏っている。
- 実環境におけるベンガル文字シーンテキスト認識の性能を客観的に評価すること。
- 既存のOCRシステムとVision-Languageモデルの両方を評価可能なデータセットBanglaWildを構築した。
- 大規模モデルが必ずしも小規模モデルを上回らないという結果が得られた。
- 誤認識の原因として,視覚的な誤認識が約60%を占め,連結文字に関する誤りは少ないことが示された。
MuRA: 効率的かつ効果的なテスト時Vision-Language汎化のためのマルチランク適応 [cs.CV]目的:テスト時におけるVision-Languageモデルの汎化性能向上
- Vision-Languageモデルは多様なタスクに応用可能であり,AI研究において重要な位置を占める。
- 分布シフトが発生した場合,既存のVision-Languageモデルの性能が大幅に低下する。
- トークンレベルの視覚的複雑さに応じた適応モジュールの動的な選択と融合による性能改善。
- MuRAは,マルチランク直交分解とUnified Component Fusionを組み合わせ,知識を保持しつつ効率的な適応を実現する。
- 理論的な根拠に基づき,適応メカニズムの必要性と勾配の安定性を数学的に証明している。
- 広範な実験により,MuRAが既存手法を上回り,計算・メモリコストを大幅に削減することが示された。
CARE-X:補助的監督学習,報酬整合学習,ツール拡張測定による臨床利用可能な放射線画像VLMsへ [cs.CV, cs.AI]目的:臨床的に有用な胸部X線画像システムの開発
- 医療現場における画像診断の効率化と精度向上が求められている。
- 既存のビジョン言語モデルは,画像所見の分類,局在化,計測を統合的に扱えていない。
- 放射線科医のニーズに応える,構造化予測と生成を強化するモデルの構築。
- CARE-Xは,補助的な識別的監督学習と報酬整合生成を統合することで,診断予測の精度と空間局在化性能を向上させた。
- 報告書生成,視覚的質疑応答(VQA),空間的根拠付けにおいて,最先端の性能を達成した(ReXVQAで94.0%の精度)。
- 測定依存型診断のため,Qwen3-VL-4B-Instructにツール呼び出し機能を組み込み,測定精度を大幅に向上させた(平均F1スコア+43.6pp)。
NCGR:BEV 3D物体検出におけるカメラ外乱に対するノイズ条件付きゲート付き整流 [cs.CV]目的:BEV 3D物体検出におけるカメラ外乱への対応
- 自動運転やロボティクスにおける周辺環境認識の精度向上が不可欠であり,3D物体検出はその重要な要素である。
- カメラ外乱は,BEV 3D物体検出の性能を著しく低下させる要因であり,ロバスト性の課題となっている。
- 明示的な外乱推定なしに,カメラ外乱による投影誤差を補正し,検出性能を向上させることを目指す。
- 提案手法NCGRは,シミュレーションされた外乱条件下で,既存手法BEVFormerやCAPEと比較して高いNDSスコア(39.69%)を達成した。
- NCGRは,カメラレベルのゲートを用いて投影オフセットを整流することで,外乱による影響を軽減する。
- 学習時には,外乱情報を徐々に削除することで,外乱メタデータなしでの推論を可能にする。
UniEvo-RS:代表的な事例駆動型プロトタイプ進化による,汎用プロンプトを用いた統一的なリモートセンシングセグメンテーション [cs.CV]目的:多様なリモートセンシングセグメンテーションタスクを統合的に処理するフレームワーク
- リモートセンシング技術は,地球観測や資源管理において不可欠であり,その精度向上は重要である。
- 既存モデルは,未知のシーンやカテゴリにおいて性能が低下し,柔軟なタスクルーティングに課題がある。
- 限られた事例を用いたインタラクティブな精度向上により,実運用でのセグメンテーション効率を高める。
- UniEvo-RSは,テキスト駆動および視覚駆動プロンプトを統合し,多様なリモートセンシングシナリオに対応する動的なタスクルーティング機構を確立した。
- 代表的な事例に対するフィードバックを利用した,学習不要なプロトタイプ進化メカニズムを導入し,予測誤差をプロトタイプに変換することで,LLMの検索精度を向上させた。
- 実験の結果,UniEvo-RSは多様なプロンプトタスクを統合し,多くの設定で最先端の性能を発揮し,少ないインタラクションで未知のカテゴリに対する精度を向上させることが示された。
StreamDAM:リアルタイムストリーミング動画物体セグメンテーションのためのプレゼンス認識メモリ [cs.CV]目的:リアルタイムストリーミング動画における物体セグメンテーションの性能向上
- 動画物体セグメンテーションは,自動運転やロボット工学など,多くの分野で重要な役割を担う。
- 高精度なセグメンテーションモデルは計算コストが高く,リアルタイム処理が困難である。
- ストリーミング環境下での性能劣化を抑制し,高精度を維持することを目的とする。
- 本研究で提案するStreamDAMは,モデル内部の最適化によりメモリ機構をフレームレートで動作させる。
- 学習されたプレゼンス信号によって,メモリへの書き込み,読み取り範囲,出力の抑制,再検出のタイミングを制御する。
- 4つのベンチマークと5つのベースラインにおいて,StreamDAMは最高のストリーミングトラッカーであり,オフラインモデルの精度をほぼ回復し,難しいコンテンツではオフラインモデルを上回る。
いつ,どこを見るか:効率的な長尺動画理解のための適応的視覚的証拠スケジュール [cs.CV, cs.AI]目的:効率的な長尺動画理解のための視覚的証拠スケジュール手法
- 長尺動画理解は,動画の内容を正確に把握する上で不可欠であり,様々な応用分野で重要性が増している。
- 既存手法は,固定された予算内でフレームを選択するため,動画の内容に応じて柔軟に対応できないという課題がある。
- 本研究は,動画の内容に応じてフレーム予算を動的に調整し,効率的に証拠フレームを選択することを目指す。
- 提案手法EcoFrameは,VLMsの推論フィードバックを活用し,フレーム予算の増加タイミングと追加証拠の検索場所を決定する。
- Video-MME,LongVideoBench,MLVU等のデータセットで,EcoFrameは既存手法と比較して,精度と効率性のバランスに優れることを示した。
- 特にQwen2.5-VLにおいては,BOLTを上回り,AKSやBOLTに対して1.85倍の高速化,A.I.R.に対して最大13.5倍の高速化を達成した。
低次元高影響部分空間最適化:ニューラルネットワーク量子化における全パラメータ結合学習の限界を超える [cs.CV]目的:ニューラルネットワーク量子化における精度劣化の改善
- 深層学習モデルの効率化が求められる中で,量子化技術はモデルサイズの削減に不可欠である。
- 低ビット量子化では,特にコンパクトなネットワークにおいて,精度が著しく低下する問題がある。
- 正規化affineパラメータに着目し,それらの最適化による量子化精度の改善を目指す。
- 本研究では,量子化のロバスト性を支配する低次元高影響部分空間として正規化affineパラメータを特定した。
- PTQにおいては,バックボーン重みを固定し,affineパラメータのみを微調整することで量子化対応性を向上させた。
- QATにおいては,特徴学習と数値キャリブレーションを分離するNAPスキーマを導入し,既存手法を上回る性能を達成した。
