arXiv雑要約
画像・音声 - 2026/08/05 公開
ゼロトラスト環境におけるマイクロセグメンテーション異常検知 [cs.CR, cs.CV, cs.LG, cs.NI]目的:マイクロセグメンテーションによるソフトウェア定義ネットワークにおける異常検知
- ゼロトラストアーキテクチャの普及に伴い,厳格なネットワーク分離と継続的な検証が不可欠となっている。
- 従来の粗粒度な監視では,巧妙な攻撃や水平方向への脅威の拡散を検知することが困難である。
- マイクロセグメンテーションを導入することで,侵入検知の精度向上を目指す。
- マイクロセグメンテーションは,ネットワークフローデータの異常検知精度を大幅に向上させる。
- セグメント化されたデータで学習させたモデルは,F1スコアが0.95と,未セグメント化データ(F1=0.90)よりも高い性能を示した。
- ViTベースの検出器は,1D-CNNよりもわずかに優れており,特に微細な水平方向の動きを識別する能力が高い。
dots.tts.edit:連続自己回帰モデルによる精密な音声編集 [cs.SD, cs.AI, cs.CL, eess.AS]目的:コンテンツ作成のための音声編集における精密な制御
- 音声編集は,コンテンツ制作において重要な役割を担う。表現の自由度と品質が求められる。
- 自然言語による編集指示は曖昧になりやすく,意図した操作や範囲が不明確になりがちである。
- XMLタグを用いた構造的な編集指示により,曖昧さを解消し,精密な音声編集を実現する。
- 提案手法は,テキスト,感情,プロソディ,ポーズの4つの音声制御において高い性能を示した。
- 指示の追従性,局所的な音声の保持において,既存のオープンソースシステムと同等以上の性能を達成した。
- ゼロショットTTS認識エラー率や話者類似度においても,ベースモデルとの差は無視できる程度であった。
Hunyuan3D-Buffalo 1.0:スケーラブルな3D生成,理解,編集のための統一マルチモーダルモデル [cs.CV]目的:3D理解,テキストからの3D生成,指示に基づく3D編集,およびテキストに基づいた部品生成を単一のアーキテクチャで実現する統一的なフレームワーク
- 画像生成の進歩により,理解,生成,編集を統合した統一マルチモーダルモデルの可能性が示された。
- 大規模かつ幾何学的に整合性のある編集データが不足しており,統一的な3Dモデリングは制約されている。
- 大規模な3Dマルチモーダルコーパスを構築し,統一的な3Dマルチモーダル学習の有効性を示す。
- Hunyuan3D-Buffalo 1.0は,テキストからの3D生成と3D編集のベンチマークで最先端または優れた性能を達成した。
- 理解と生成の両方が編集を改善することが示され,統一的な3Dマルチモーダル学習の有効性が確認された。
- 8700万規模の3Dマルチモーダルコーパスを構築し,スケーラブルな学習を可能にした。
世界モデルの行く先はどこか? [cs.CV, cs.AI, cs.RO]目的:エージェントの継続的な改善
- エージェントの性能向上には,環境とのインタラクションが不可欠である。しかし,実環境での試行錯誤はコストがかかる。
- 既存の世界モデルは,物理状態の予測に焦点を当てており,エージェントが求める多様なフィードバックに対応できない。
- エージェント中心のインタラクティブな世界モデルを確立し,エージェントの学習を促進すること。
- 世界モデルを,物理状態遷移からエージェントが利用可能な情報遷移へと再定義した。
- 世界モデルを,ダイナミクス,空間,実行,記憶,スキル,報酬の6つの機能形式に分類した。
- エージェントと世界モデルの共進化を促す3つのレベル(推論時ガイダンス,学習時最適化,共進化)を提示した。
4州への議席配分における定数と人口単調性の両立不能性 [cs.MA, cs.GT, eess.SP]目的:4州への議席配分における定数と人口単調性の両立不能性の証明
- 議席配分は,人口に基づき議席数を決定する重要なプロセスである。公正な配分方法の確立が求められている。
- 定数と人口単調性という2つの要件を同時に満たす配分方法が存在するか不明であった。
- 4州の場合における,定数と人口単調性の両立不能性を論理的に示す。
- 本研究により,異なる議席数で比較した場合,4州への議席配分において定数と人口単調性を同時に満たす決定論的な解は存在しないことが証明された。
- 証明は,12の補助プロファイルを用いて3ビットをエンコードし,矛盾したサイクルを発生させる有限論理ガジェットに基づいている。
- この結果は,定数制約下における格子丸めの互換性の障壁を示しており,人口の相対的な単調性にも適用できる。
ああ,シカよ,どうすればいい?野生動物の選択的アノテーションと分類のための季節的事前知識 [cs.CV]目的:野生動物の選択的アノテーションと分類における季節的影響の評価
- 航空画像における野生動物の正確な識別は,生態系のモニタリングや保護に不可欠である。
- 動物は画像中のごくわずかなピクセルを占め,視覚的特徴が季節によって変化し,データに不確実性が伴う。
- 季節的な情報を活用することで,アノテーションの質と分類精度を向上させることを目指す。
- 季節性はアノテーションの質,下流の分類,選択的予測を結びつける重要な要素であることが示された。
- RGBと熱画像の組み合わせは,単一の画像形式よりも多くのサンプルを解決し,分類精度を向上させる。
- 不確実性に基づいたアノテーションのスキップにより,精度は向上するが,カバー範囲は縮小し,特に雄に対する判断の保留が増加する。
確信はあっても信頼できない:脳MRIにおけるビジョン言語モデルの行動安全監査 [cs.CV]目的:脳MRIを用いたビジョン言語モデルの行動安全性の評価
- 医療画像診断におけるAI活用が期待される中,その安全性評価は重要である。
- AIモデルの出力に対する確信度と正答率の乖離が問題視されている。
- AIモデルが示す確信度と実際の信頼性を評価し,誤診リスクを軽減すること。
- 複数のビジョン言語モデルにおいて,回答率は高いものの,確信度と正答率の相関は低いことが示された。
- 特に,誤った回答に対する確信度は高く,高確信度の誤りが頻繁に発生している。
- 医療専門知識の追加学習は腫瘍検出の精度向上に寄与するが,確信度の信頼性向上には繋がらない可能性がある。
より良く,より強く,より速く,より広く:MLLMベースセグメンテーションのための構造化全マスク予測 [cs.CV]目的:MLLMベースセグメンテーションにおける高性能,対話能力の維持,高速推論のトレードオフを解決する手法
- MLLMは画像とテキストを統合し,指示に基づいたセグメンテーションを可能にするため,その応用範囲は広い。
- 従来のセグメンテーション手法では,高性能,対話能力,高速推論を同時に達成することが困難である。
- 本研究では,全マスク予測を構造化することにより,上記のトレードオフを解消することを目指す。
- 提案手法であるSTAMPlusは,単一のモデルで参照と推論能力を維持しつつ,セマンティック,インスタンス,リモートセンシングセグメンテーションに拡張する。
- STAMPlusは,最先端のセグメンテーション性能を達成し,マルチモーダル命令追従を維持する。
- 12カテゴリの推論遅延を,STAMPの繰り返し推論の13.50秒から5.16秒に短縮することに成功した。
PixelUp:ファインチ grained視覚タスクのためのゼロショットセマンティック特徴アップサンプリング [cs.CV]目的:ファインチ grained視覚タスクにおけるセマンティック特徴のアップサンプリング手法
- 近年の視覚モデルは多様なタスクに応用可能だが,高精度な予測には限界がある。
- 既存のアップサンプリング手法は,特定のモデルに依存したり,精度の低いアーティファクトを生じたりする。
- モデルに依存せず,セマンティック情報を活用した高精度なアップサンプリングを実現する。
- PixelUpは,様々な視覚モデルに対して高い性能を示すゼロショットアップサンプラーである。
- セマンティックセグメンテーションと深度推定において,既存手法を平均1.2 mIoUと0.25 δ_1上回る性能を達成した。
- オープンボキャブラリーセグメンテーションと教師なしセマンティックセグメンテーションにおいても性能向上を確認した。
注意に基づく生存モデルのセマンティックな説明可能性:計算病理学におけるSAGE [cs.CV, cs.AI]目的:注意に基づく多インスタンス学習モデルの説明可能性向上
- 病理画像解析は,がんの診断や予後予測において重要な役割を担う。
- 既存手法では,注意マップが局所的な情報しか提供せず,予測根拠の理解が困難。
- モデルの注意機構とヒストロジー概念を結びつけ,集団レベルでの予測根拠を解明する。
- SAGEは,既存の生存モデルから集団レベルで解釈可能な説明を抽出可能。
- 壊死などの既知の予後因子に加え,腎細胞癌における血管新生シグネチャーなど,癌種特異的な生物学的知見を発見。
- SAGEが抽出する概念は,モデルの学習された注意に依存し,予後予測情報を十分に捉えていることが示された。
DeepLesion検出,セグメンテーション,および短報告生成のための統一2次元フレームワーク [cs.CV, cs.AI]目的:DeepLesionデータセットを用いた病変検出,セグメンテーション,および放射線レポート生成の統合
- 医学画像診断における病変の早期発見と正確な診断は,患者の予後を改善するために不可欠である。
- 既存の病変解析手法は,検出,セグメンテーション,報告生成が個別に実施されることが多く,効率的ではない。
- DeepLesionデータセットを用いた,病変解析の一連の処理を統合し,より高精度な自動診断を可能にすること。
- 本研究で開発したフレームワークは,病変のバウンディングボックス検出においてmAP50で70.1%,mAP50-95で46.4%の精度を達成した。
- 病変セグメンテーションではDiceスコア62.6%を達成し,既存のnnUNetモデルと比較して28.5%の改善が見られた。
- 短報告生成では,BLEU_1で64.3%,BLEU_4で49.6%,METEORで34.7%,ROUGE_Lで60.1%のスコアを獲得した。
安全性が求められるビデオベース知覚システムに対する高速物体除去攻撃 [cs.CR, cs.CV]目的:ビデオベースの安全性が求められるシステムに対する,標的を絞った高速物体除去攻撃手法
- 自動運転などのITSは,ビデオベースの知覚システムに依存しており,その安全性確保は重要である。
- ビデオデータは改ざんされやすく,知覚システムの誤動作を引き起こし,安全性に影響を与える可能性がある。
- 本研究は,ステルス性の高い物体除去攻撃による知覚システムの脆弱性を明らかにし,対策開発に貢献する。
- 提案手法は,攻撃対象フレームとオリジナルのフレームとの類似性を高く維持し,高いPSNRとSSIMを示す。
- YOLOベースの物体検出器を用いた実験で,物体検出率を最大97.59%まで低下させ,94.48%の攻撃成功率を達成した。
- GPU上で毎秒0.074~0.172フレームの処理速度で動作し,リアルタイムでの攻撃が可能であることが示された。
視覚言語モデルにおける文脈崩壊とその緩和策 [cs.CV, cs.AI]目的:視覚言語モデルにおける文脈崩壊現象の解明と,その緩和策の開発
- 視覚言語モデルは,画像とテキストを理解し処理する能力が求められ,様々な応用分野で重要性が増している。
- 文脈学習において,学習データが増加するにつれて性能が低下する「文脈崩壊」と呼ばれる問題が存在する。
- 本研究は,文脈崩壊の原因を特定し,モデルの統合経路への介入によって性能回復を目指す。
- 多くの視覚言語モデルにおいて,文脈学習におけるデモンストレーション数増加に伴い,精度が急激に低下する「文脈崩壊」が確認された。
- 文脈崩壊は,視覚と言語の統合経路に原因があり,コネクタや早期/中期レイヤーにアダプターを導入することで改善されることが示された。
- 新たに提案する\textsc{CircA}は,一度の学習で文脈崩壊に対する耐性を獲得し,未知のタスクファミリーへ転移可能であることが確認された。
進化する評価基準を用いた音声推論のための強化学習 [cs.SD, cs.CL]目的:音声推論のための強化学習における,自己進化型かつ音声に基づいた評価基準の導入
- 音声推論は,機械が音響世界を理解する上で不可欠であり,その性能向上が求められている。
- 従来の報酬設計は,結果重視型と過程重視型に分かれ,それぞれに限界があった。結果重視型は音声への注意を促せず,過程重視型は固定された基準に依存していた。
- 本研究は,サンプルごとに適応的に変化する,微細で音声に基づいた報酬による推論過程の監督を可能にすることを目指す。
- AudioRubricsは,既存のオープンソースおよび教師あり学習ベースラインを大幅に上回る性能を示した。
- 評価基準生成器と判定器の能力向上に伴い,その改善は拡大し,安定した推論長に収束した。
- 音声認識の性能向上は,音響的証拠に基づく監督の有効性を示している。
CURV:カリキュラムに基づく視覚的根拠付き推論によるグラフ理解の向上 [cs.CV, cs.AI, cs.CL]目的:グラフ質問応答における視覚的根拠付き推論能力の向上
- グラフ理解はデータ分析において不可欠であり,迅速かつ正確な意思決定を支援する。
- 既存モデルは,正確な視覚的根拠の特定と一貫性のある推論チェーンの構築に課題を抱えている。
- 視覚的根拠と推論を連動させることで,グラフ理解の精度を向上させることを目指す。
- CURVは,グラフ質問応答を多段階の視覚的根拠付き推論として再構成するカリキュラム学習フレームワークである。
- 実験の結果,CURVはベースラインと比較して最大20.50%の性能向上を達成し,汎化性能も高いことが示された。
- この手法は,実世界のベンチマークやドメイン外のマルチモーダル推論タスクにおいても有効であることが確認された。
レンチキュラーフィルムの色再構成のための人間介入型深層学習フレームワーク [cs.RO, cs.SY, eess.SY, cs.CV]目的:レンチキュラーフィルムにおける色再構成手法
- 歴史的映像資料の保存・復元において,色情報の正確な再構成は不可欠である。
- 既存の自動処理手法では,レンチキュラーフィルム特有の構造や画質劣化に対応できない場合がある。
- 専門家の知識を活用し,困難なケースでも高品質な色再構成を実現することを目指す。
- 本研究では,レンチキュラーフィルムの色再構成に人間介入型深層学習フレームワークを導入した。
- 専門家がレンチキュラーの境界を編集可能なベクトル形式で修正することで,より正確な色抽出とデモザイク処理を可能にした。
- 提案手法は,従来の自動処理手法が失敗する困難なシーケンスにおいても,展示に適した高品質な色再構成を実現した。
局所化こそが重要,美化ではない:美容整形プレビューのための画像編集APIのクライアントサイド制御 [cs.CV]目的:美容整形プレビューにおける画像編集APIのクライアントサイド制御の可能性
- 美容整形プレビューは,患者の意思決定を支援する上で重要な役割を果たす。
- 既存の画像編集APIでは,編集範囲の制御が難しく,意図しない箇所まで変更されてしまう。
- クライアントサイドのみで編集範囲を制御し,より正確なプレビューを実現することを目指す。
- マスクと合成を用いることで,APIのモデル内部にアクセスすることなく,編集範囲の局所化が向上した。
- 6つの市販編集設定と1つのインペインティングモデルにおいて,マスクを用いた合成がプロンプトのみの場合と比較して,局所化性能が改善された。
- ただし,どのエディターも,入力画像と術後の写真のアイデンティティ埋め込み空間における距離を縮めることはできなかった。
腹腔鏡手術における点群登録のためのテスト時適応手法 [cs.CV]目的:腹腔鏡手術における点群登録のためのテスト時適応手法の評価
- 腹腔鏡手術のナビゲーション精度向上に不可欠な技術であり,患者の安全性向上に貢献する。
- 実手術データは教師データがなく,合成データで学習したモデルの汎化性能が課題となる。
- 合成データと実データ間のドメインシフトを軽減し,登録精度を向上させる。
- 既存のテスト時適応手法を点群登録に適用・改良し,実データにおける性能評価を行った。
- バックプロパゲーションを用いた手法の計算コストを考慮し,入力適応が最も有望な手法であると結論付けられた。
- 入力適応は,低い推論遅延と一貫した誤差削減を実現し,腹腔鏡手術への応用が期待される。
科学実験シーンのモデリング:データセットとモデル [cs.CV]目的:科学実験シーンにおけるシーングラフの生成
- 科学技術の発展に伴い,実験の自動解析や教育への応用が期待されている。
- 既存のシーングラフ生成ベンチマークは日常生活画像に偏っており,実験シーンに対応できていない。
- 実験シーン特有の課題に対処し,より高度なシーン理解を可能にする。
- 新たに,科学実験シーンのためのシーングラフデータセット「PhysScene」を公開した。
- 関係述語の分布の偏りや,視覚情報とテキスト情報の意味的ギャップという課題を解決するため,Cross-Modal Dual-Path Generator (CM-DPG)を提案した。
- CM-DPGは,PhysSceneおよびVG150において,複数の評価設定で優れた性能を示した。
RealWeather:運転世界モデルを用いた現実的かつシーンに忠実な天候変換 [cs.CY, cs.CV]目的:現実的かつシーンに忠実な天候変換の実現
- 自動運転システムの開発・評価には,現実的な天候環境が不可欠である。
- 異なる天候条件下のペアとなる実データ収集は困難であり,既存手法は現実感やシーンの忠実性で課題がある。
- 現実世界の動画から天候のダイナミクスを学習し,実データを用いた天候変換を実現すること。
- RealWeatherは,段階的なリアリズムブートストラップとシーン忠実性RL最適化により,既存手法を上回る視覚的リアリズムと構造的保全を実現した。
- 擬似的なクリア画像から学習を開始し,モデル自身が生成したより現実的な画像で徐々に置き換えることで,疑似データと現実データの間のギャップを埋めている。
- これにより,長尾の天候シナリオ生成や,未知の分布に対する汎化性能の向上に貢献する。
文化遺産デジタルツインにおける熱画像異常検知のための材料分割ピクセルごとの放射率補正 [cs.CV]目的:文化遺産における熱画像異常検知の精度向上
- 文化遺産保全には非破壊検査が重要であり,熱画像計測は有効な手段の一つである。
- 熱画像計測では放射率の正確な把握が不可欠だが,従来の固定放射率の仮定では誤差が生じやすい。
- 材料分割と放射率データベースを用いて,ピクセルごとの放射率を推定し,温度誤差を低減することを目指す。
- 提案手法は,合成データセットにおいて平均絶対誤差を1.97Kから0.91Kに削減することに成功した。
- 実際の文化遺産データセットでは,放射率分布によっては効果が限定的であることも示された。
- 屋外の文化遺産は,一般的に放射率が従来のデフォルト値に近いため,補正効果は限定的であるという知見が得られた。
Qwen-3D: 空間理解のための汎用3D視覚言語モデル [eess.SY, cs.SY, eess.SY, cs.SY, cs.CV]目的:空間理解のための3D視覚言語モデルの性能向上
- 画像や動画処理において,大規模言語モデルの応用が急速に進んでおり,その重要性が増している。
- 長尺の動画を扱う場合,フレーム単位での処理や限定されたコンテキストウィンドウがボトルネックとなる。
- 言語と3D幾何学的な予測を直接結びつけることで,3Dシーンの理解を深めることを目指す。
- Qwen-3Dは,Qwenバックボーンに多視点幾何学的情報を統合し,効率的な長尺動画の推論を実現した。
- 3Dロータリー位置埋め込みを用いることで,アテンション機構を3D空間上で直接動作させ,異なる視点や時間的推論を可能にした。
- 言語と幾何学を橋渡しするクエリベースのセグメンテーションデコーダにより,参照接地,インスタンスセグメンテーション,VQAを統合した。
V-FIND:ビデオ偽造検出器に暗号化された固有の偽造知識の解明 [cs.CV, cs.AI]目的:ビデオ偽造検出器に内在する潜在的な偽造識別知識の発見
- 生成動画のリアリティ向上に伴い,信頼性の高いビデオ偽造検出が重要となっている。
- 既存研究では検出器をブラックボックスとして扱い,内部知識が十分に解明されていない。
- 検出器内の疎な潜在的なフォレンジック知識を活用し,検出性能を向上させることを目指す。
- 偽造識別知識は表現空間全体に均一に分布せず,機能特化された少数のニューロンに集中していることが判明した。
- 提案手法V-FINDは,リアルと偽造動画間の差異が顕著な層を特定し,偽造識別信号を持つアンカーニューロンを発見する。
- バックボーンを固定した状態で軽量な線形分類器を学習するだけで,既存のベンチマークで高い検出性能を達成した。
臨床に基づいた階層的分類による一貫性のある胸部X線画像解釈 [cs.CV]目的:胸部X線画像の階層的な解釈
- 胸部X線画像は臨床診断において不可欠であり,その正確な解釈は患者ケアに直接影響する。
- 既存の自動システムは,階層構造を考慮せず,粗視的な予測と詳細な予測の一貫性を欠いている。
- 臨床的根拠に基づいた階層的分類フレームワークを構築し,解釈の一貫性と精度を向上させる。
- CHASEは,臨床医の解釈プロセスを模倣した3層の階層構造と,階層違反ペナルティを導入することで,予測の一貫性を高めている。
- 実験の結果,CHASEは従来のシステムよりも全てのレベルで優れた性能を示し,確率的な階層の一貫性も向上した。
- アテンションマップ解析により,CHASEの予測が解剖学的に根拠に基づいていることが確認された。
メロコーデック:高忠実度歌声表現のための旋律事前知識の活用 [cs.SD]目的:歌声表現のための旋律事前知識の活用
- LLMを用いた音声生成において,音声コーデックは重要な役割を担う。
- 周波数感受性の高い領域では,明示的な音響事前知識の統合が不十分である。
- 歌声の重要な音響情報である旋律事前知識を効果的に組み込むことを目指す。
- メロコーデックは,既存の基盤モデルと比較して歌声表現において優れた性能を示す。
- 特に,音程の一貫性が向上し,音色劣化を最小限に抑えつつ,音程の制御可能な操作が可能となる。
- Tokenize-then-Fuseパラダイムと二段階の学習戦略により,安定した学習と性能向上が実現された。
リモートセンシングにおける学習不要なオープンボキャブラリーセマンティックセグメンテーションのためのスタンドアロンDINOv3 [cs.CV, cs.AI]目的:リモートセンシング画像のセマンティックセグメンテーション
- リモートセンシングは,広範囲の土地利用状況を把握する上で不可欠である。
- ピクセルレベルのアノテーションコストが高く,セグメンテーションの効率が課題となっている。
- DINOv3を活用し,学習不要なセグメンテーションを実現することで,コスト問題を解決する。
- 提案手法DinoSplat-OVは,DINOv3をリモートセンシング画像に適合させ,追加学習を不要とした。
- テキスト情報を活用したラプラシアン伝搬モジュールにより,領域の一貫性を向上させた。
- ガウススプラッティングアップサンプリングモジュールとグローバルアンカー戦略により,大規模画像への対応を可能にした。
DDSynth-RL:強化学習を用いた離散拡散によるオーディオシンセサイザーの逆問題解決 [cs.SD]目的:オーディオシンセサイザーの逆問題解決
- シンセサイザーのパラメータを推定することで,多様な音色を生成・編集することが可能になるため。
- パラメータ空間での損失関数が音の類似性を反映しにくく,シンセサイザーが微分不可能であるという課題がある。
- 離散拡散モデルと強化学習を組み合わせ,パラメータの多義性と非微分可能性の問題を解決することを目指す。
- 離散拡散モデルは,教師あり学習において自己回帰モデルやフローマッチングと比較して競争力のある性能を示す。
- レンダリングされた音声に基づいた報酬を用いた強化学習により,未知の音域における音声の一致性能をさらに向上させた。
- 本研究は,シンセサイザーの逆問題解決に新たなアプローチを提供し,音色生成の可能性を広げる。
書道駆動型リアルタイム生成音楽パフォーマンスインターフェースCalliphony [cs.SD]目的:書道によるリアルタイム生成音楽パフォーマンスのためのインターフェース
- 音楽生成モデルは注目を集めているが,ライブパフォーマンスへの統合方法は未開拓である。
- 生成モデルの制御方法が確立されておらず,演奏表現の幅が限られている。
- 書道の動きを制御信号に変換し,音楽生成をリアルタイムに制御することを試みる。
- 書道筆の動きをセンサーで捉え,低遅延でシンボル音楽生成の制御信号にマッピングするシステムCalliphonyを開発した。
- 生成された旋律にリアルタイムでハーモニーと伴奏を追加し,DAWを通してライブパフォーマンスを実現した。
- 書道という視覚的な行為を,AI支援のオーディオビジュアルパフォーマンスへと拡張した。
CAPE-T2V:キャプションアンカー付きプロンプト強化によるテキスト-ビデオ生成における両側条件整合性の向上 [cs.CV]目的:テキスト-ビデオ生成におけるプロンプト強化とDiT(拡散Transformer)の条件整合性向上
- ビデオ生成技術は,創造的なコンテンツ制作や情報伝達において重要な役割を担っている。
- 生成されるビデオの品質は,入力プロンプトとDiTの学習データの間の不一致に影響を受けやすい。
- プロンプト強化とDiTの微調整を通じて,この不一致を軽減し,高品質なビデオ生成を実現すること。
- CAPE-T2Vは,StoryEval,VBench-2.0,T2V-CompBenchといったベンチマークにおいて,ベースラインよりも高い総合スコアを達成した。
- 提案手法は,ベースラインと比較して,プロンプト強化と学習用キャプションのギャップを縮小することを示した。
- DiTの微調整に使用するキャプションが,推論時のプロンプト強化の出力分布に近くなることが確認された。
熟練知識の蒸留による参照なしの運動技能指導のためのAIDE:自動指導 [cs.CV, cs.MM]目的:運動技能指導における自動化フレームワーク
- 運動技能の習得には熟練した指導者のフィードバックが重要だが,その人材は不足している。
- 従来の参照ベースの手法は,学習時と推論時に熟練者のデモンストレーションが必要で,実用性が限られる。
- 学習者の姿勢シーケンスのみからフィードバックを生成し,実用的な運動技能指導を目指す。
- AIDEはExpertAFデータセットにおいて,参照なしのベースラインを上回る性能を示した。
- 熟練者のデモンストレーションを学習時と推論時両方で必要とする手法と同等の性能を達成した。
- LLMによる評価も,これらの結果を支持するものである。
クロスモーダルブートストラップによるピアノアレンジのための音楽スタイルの学習 [cs.SD, cs.AI, cs.MM, eess.AS]目的:ピアノアレンジのための音楽スタイルの学習
- 音楽スタイルは音楽表現において重要な要素であり,楽曲の個性を決定する。
- 音楽スタイルは主観的な概念であり,明確な定義や数値化が困難である。
- 音楽スタイルを明示的に捉え,音楽生成に応用する手法の開発を目的とする。
- 本研究では,生オーディオと記号音楽から音楽スタイルを学習するクロスモーダルフレームワークを提案した。
- 提案手法は,参照オーディオ例に基づいたスタイルの忠実なピアノアレンジを可能にした。
- ピアノカバー生成,スタイル変換,オーディオ・トゥ・MIDI検索において,スタイル認識の精度と音楽品質の向上を実証した。
より表現豊かな音声LLMに向けて:詳細な意図ベンチマークと音響・語彙分離型ポリシー最適化 [cs.RO, cs.DC, cs.SY, eess.SY, cs.RO, cs.SD]目的:音声対話における意図表現の理解と,意味的適切性と感情表現を両立する応答生成
- 感情的な対話システムは,人間との自然なコミュニケーションにおいて不可欠であり,その重要性は増している。
- 意図が語彙と音声に複雑に絡み合い,既存のベンチマークや最適化手法では評価・制御が困難である。
- 明示的・暗示的な意図表現を区別し,テキストと音声を分離して最適化することで,感情表現の向上を目指す。
- 新しいベンチマーク「ParaIntent」を構築し,意図充足度,応答品質,感情表現を多角的に評価できるプロトコルを確立した。
- 音響・語彙分離型ポリシー最適化(ALPO)を提案し,テキストと音声それぞれの利点を独立して計算・適用することで学習効率を高めた。
- ALPOは既存手法よりも自動評価指標および主観評価において優れた結果を示し,特に感情表現の向上において顕著な効果が認められた。
PDD-RRG:研究レベルの放射線レポート生成のための事後診断決定 [cs.CV, cs.CL]目的:研究レベルの放射線レポート生成における事後診断決定の枠組み
- 放射線診断支援は,医師の負担軽減と診断精度の向上に不可欠である。
- 既存手法では,検査に関連する全ての情報が有効活用されず,誤診のリスクがある。
- 複数の視点からの診断を統合し,レポートの信頼性を高めることを目指す。
- 提案手法PDD-RRGは,既存のレポート生成モデルの臨床的有効性を向上させる。
- 入力データの部分集合を利用し,異なる視点からのレポート生成を可能にする。
- ベイズの事後確率と学習された閾値を用いて,診断結論を集約しレポートを修正する。
拡散モデルにおける時間適応ビットスパース化量子化 [cs.CV]目的:拡散モデルの量子化における計算コスト削減
- 近年の拡散モデルは高品質な画像生成が可能だが,計算資源を多く必要とする。
- 従来の量子化手法では,最も量子化に敏感なステップに合わせて精度を設定する必要があった。
- 時間的・空間的なLSBマスクを用いて,各ステップで効果的な精度を動的に調整する。
- TASQは,静的量子化と同等の品質を維持しつつ,計算量を削減することに成功した。
- Temporal-Precision Engineと組み合わせることで,静的量子化と比較して実行サイクルを25~50%削減した。
- また,単純な8ビットビットシリアル実行と比較すると,6.1~7.5倍の高速化を実現した。
RIDGE:画像編集のための内部動的ガイダンスによる再ノイズ化 [cs.CV]目的:画像編集におけるターゲット側の状態維持
- 画像編集技術は,多様な応用を可能にする重要な研究分野である。
- 既存手法では,ノイズレベルの変化と変位の一貫性が課題となっていた。
- ノイズレベルに応じた自然な変位の減少と,ターゲットへの誘導を改善する。
- RIDGEは,ターゲット側の状態を求めることなく,高画質かつ自然な画像編集を実現する。
- 内部動的ガイダンスにより,編集が必要な領域に焦点を当て,修正精度を向上させる。
- SD3 MediumおよびFLUX.1-devを用いた実験で,RIDGEの有効性が確認された。
TraceCAD:エージェントによるCAD生成のトレース誘導修正 [cs.RO, math.OC, nlin.CD, cs.DB, cs.AI, cs.GR, cs.SE]目的:エージェントによるCAD生成における修正手法
- CAD生成の自動化は,設計プロセスを効率化し,多様なデザインを迅速に実現する上で重要である。
- 既存のCAD生成エージェントは,修正の過程で要件や過去の修正履歴を失いがちである。
- TraceCADは,修正の過程で失われがちな情報を保持し,より効率的で信頼性の高いCAD生成を目指す。
- TraceCADは,要求される機能,モデリングのステップ,失敗の証拠,候補となる結果を永続的な状態として関連付けることで,CAD生成の修正を支援する。
- DeepCADベンチマークを用いた実験により,TraceCADはIoU,Chamfer距離,Hausdorff距離の点で競争力のある幾何学的品質を達成した。
- 永続的な状態の除去は回復スコアをほぼ半分に減らし,局所的な探索の除去は幾何学的回帰を増加させ,コードエージェントの呼び出し回数を二倍にした。
VLMに基づく3D室内シーン生成のための大域グラフ検証最適化 [cs.CL, cs.CV]目的:オープンボキャブラリ3D室内レイアウト生成
- 3Dコンテンツ制作において,言語による指示に基づいた自動生成の需要が高まっている。
- 既存手法では,アセット間の関係性が局所的にしか扱われず,大域的な整合性に課題がある。
- 大域的な整合性と物理的実現可能性を両立する,新たなレイアウト生成手法の開発。
- 提案手法では,シーンをグラフ表現し,ルールベース検証で意味的整合性を確保する。
- 進化探索と勾配法を組み合わせることで,非凸な空間における大域的な最適化を実現した。
- 実験の結果,セマンティック整合性と物理的妥当性の両面で,最先端の性能を達成した。
LDU-Bench:レイアウト変動する回路背景下におけるリソグラフィ欠陥理解のためのマルチモーダルLLM評価 [cs.CL, cs.CV]目的:リソグラフィ欠陥理解のためのマルチモーダルLLM評価プラットフォーム
- 半導体製造において,リソグラフィ工程における欠陥検査は歩留まり向上の鍵となる。
- 既存の欠陥検出モデルは,欠陥の有無の判定に留まり,詳細な解析が困難である。
- 本研究は,欠陥形態,位置,原因の理解を含む,リソグラフィ欠陥の多角的評価を目指す。
- LDU-Benchは,欠陥の優先度付け,形態認識,粗い位置特定,画像に基づく原因分析の4つのタスクでモデルを評価する。
- 既存のマルチモーダルLLMは,欠陥の優先度付けはある程度可能だが,その能力は下流のタスクに安定して伝播しない。
- 形態の整合性,正確な位置特定,証拠から原因へのマッピングが課題であることが示された。
CorePath:乳腺専門病理基礎モデル - 針生検診断とリスク制御レポート生成 [cs.CV, cs.AI, cs.LG, stat.AP]目的:乳腺針生検の診断と,リスク管理されたレポート生成
- 乳がん診断において,針生検は重要な役割を担うが,組織サンプルの限界や病変の多様性から正確な診断が難しい。
- 限られた組織量や病変の異質性,微細な形態的重なりにより,亜型の識別が困難となる場合がある。
- 乳腺病理に特化した基礎モデルを開発し,診断精度とレポート生成の信頼性を向上させる。
- CorePathは,既存のPRISMモデルを上回り,がん検出,浸潤評価,組織学的亜型分類において優れた性能を示した。
- レポート生成においては,乳腺以外の内容の誤りを大幅に削減し,専門領域への適合性を高めた。
- リスク制御機能を組み合わせることで,選択的なレポート公開,亜型レベルのフォールバック,判断保留を実現し,安全性を確保した。
拡散Transformerにおける表現多様性の定量化,分析,促進:DiverseDiT++ [cs.NI, cs.CV]目的:拡散Transformerにおける表現の多様性に関する分析と促進手法の開発
- 拡散Transformerは画像生成において高い性能を示すが,その内部表現の学習メカニズムは未解明な点が多い。
- 拡散Transformerのブロック間における表現の多様性が,効果的な表現学習に不可欠であるにも関わらず,その定量化が困難である。
- 拡散Transformerにおける表現多様性を定量化し,多様性を促進することで,生成品質の向上と学習の加速を目指す。
- 本研究では,ブロック間の表現の差異を測る新たな指標「Weighted Diversity Score (WDS)」を提案し,その有効性を示した。
- WDSは生成品質(FID)と強い負の相関(Pearson's r = -0.869)を示すことが明らかになり,モデル性能の指標となりうる可能性を示唆した。
- 提案手法DiverseDiT++は,多様な設定で性能向上と学習の高速化を実現し,拡散Transformerの表現学習を効果的に促進することが示された。
GSTEP:効率的な動画大規模言語モデルのためのグローバルな時空間密度駆動型ビジュアルトークンプルーニング [cs.CV, cs.CL]目的:動画大規模言語モデルにおける冗長な時空間ビジュアルトークンの削減
- 動画理解の性能向上に貢献する動画大規模言語モデルの重要性が高まっている。
- 動画の長さに伴い,冗長な視覚トークンが増加し,推論コストが増大している。
- グローバルな視点から重要なトークンを保持しつつ,計算コストを削減することを目指す。
- GSTEPは,動画を連続的な時空間情報フローとしてモデル化するプルーニングフレームワークである。
- GSTEPは,時空間密度を組み合わせ,情報密度とカバレッジのバランスを取ることで,グローバルなトークンサンプリングを行う。
- LLaVA-OneVision-7Bにおいて,75%のトークンをプルーニングしつつ,元の性能を維持し,エンドツーエンドの速度を1.17倍に向上させた。
SUV:エンドツーエンド運転のための未来シーン理解を動画生成として [cs.CV]目的:エンドツーエンド運転における未来シーン理解の実現
- 自動運転技術の発展において,周囲環境の正確な理解は不可欠である。
- 既存手法では,タスク固有の出力形式により,汎用性に課題があった。
- 動画生成モデルを活用し,未来シーンの理解と予測を統一的に行う。
- SUVは,未来の映像,意味,相対深度,インスタンスレベルの動きを動画ストリームとして予測できる。
- SUVは,単一のフロントカメラのみを用いて,高度なナビゲーション性能を実現した。
- NAVSIM-v2およびWOD-E2Eベンチマークにおいて,最先端手法を超える性能を示した。
FakeI2V-Bench:動画向けディープフェイク検出における画像レベル検出器の適用可能性の評価 [cs.CR, cs.AI, cs.CV]目的:動画向けディープフェイク検出における画像レベル検出器の性能評価
- 近年の動画生成技術の進歩により,ディープフェイクによる脅威が増大しており,その検出が重要である。
- 既存の動画向けディープフェイク検出ベンチマークは十分ではなく,画像レベル検出器の動画領域への適用可能性が体系的に評価されていない。
- 画像レベル検出器を動画に適用するためのフレームワークを提示し,より高精度なディープフェイク検出を目指す。
- FakeI2V-Benchは,97,548本の動画を含むベンチマークデータセットであり,最新の生成モデルで作成されたコンテンツを網羅している。
- 画像レベル検出器の最高性能モデルは,動画レベル検出器をわずかに上回る80.16%のAUCを達成した。
- IV-Bridgeというフレームワークにより,画像レベル検出器11種類が最先端の動画レベルアプローチを上回り,最高で93.80%のAUCを実現した。
チャネルごとの動的知識蒸留:適応的サンプル生成による行動認識 [cs.CL, cs.CV]目的:行動認識モデルの圧縮
- 大規模モデルの軽量化は,実用的な応用において重要である。計算資源の制約を克服し,効率的な推論を可能とする。
- 既存の知識蒸留法は,固定された入力サンプルに依存しており,教師モデルと生徒モデル間の特徴量の整合性が不十分である。
- 本研究は,特徴量整合性を高め,チャネルの重要度を考慮した知識蒸留手法を提案し,行動認識性能の向上を目指す。
- 提案手法では,サンプル勾配に基づいた適応的サンプル生成モジュールにより,教師モデルと生徒モデル間の特徴量整合性を改善する。
- チャネルごとの動的蒸留モジュールは,サンプル勾配と特徴量頻度をガイドとして生徒モデルを訓練し,より効率的な知識伝達を実現する。
- UCF101,Kinetics-400,Something-Something-v2等のデータセットにおける実験で,最先端の性能を達成した。
防御の強化:再学習なしで回避攻撃に対する深層知覚ハッシュの強化 [cs.CV]目的:回避攻撃に対する深層知覚ハッシュの堅牢性の向上
- 信頼性と安全性確保,出所検証,著作権保護,大規模な画像検索に不可欠な技術。
- 敵対的摂動により,類似画像がマッチングを回避する脆弱性。
- マッチング手順の改善と参照画像の事前強化による堅牢性向上。
- DualShieldは,既存の深層知覚ハッシュに再学習やモデル変更なしに組み込める防御機構。
- マッチング時のランダム化スムージングと,公開時の最適化された摂動付加を組み合わせる。
- これにより,半径約0.3の$\ell_2$半径でのマッチング回避を保証し,攻撃成功率を大幅に低減。
FaithIR:知覚的な鮮明度からタスクに関連する忠実性への赤外画像超解像の再考 [cs.CL, cs.CV]目的:赤外画像超解像における信頼性の高い機械知覚のための忠実なフレームワーク
- 赤外画像超解像は,物体検出やセマンティックセグメンテーション等の下流タスクに不可欠である。
- 既存手法は,人工的なテクスチャや過度な鮮明化により,熱構造やセマンティック情報を歪める問題がある。
- 熱構造を正確に再現し,機械知覚の信頼性を向上させることを目指す。
- FaithIRは,グローバルな熱および構造情報を捉えるパッチレベルの条件付けブランチと,構造ガイダンスの下で密なローカル再構成を行うピクセルレベルの復元ブランチで構成される。
- FLIR-IISR,M3FD,FMBの実験により,高い再構成忠実度,クロスデータセット汎化性能,および物体検出・セマンティックセグメンテーションにおける優れた性能が示された。
- 結果は,知覚的な鮮明度だけでなく,忠実な赤外構造の保存が,信頼性の高い機械知覚にとって重要であることを示唆する。
直交線走査画像融合のための統一された分解能条件付きフレームワーク [cs.CV]目的:レーザー線走査顕微鏡による異方性横解像度の問題解決
- 高速な体積イメージングを実現する技術であり,生物学,医学分野での応用が期待される。
- 従来の深層学習法では,光学構成ごとに個別のモデルが必要であり,汎用性に欠ける。
- 異なる光学構成に対応可能な単一のモデルを開発し,汎用性と性能向上を目指す。
- 本研究では,Rank Enhanced Linear Attention (RELA)に基づく統一された分解能条件付きフレームワークを提案した。
- Feature-wise Linear Modulation (FiLM)により,モデルがスリット幅の変化に適応し,高いPSNRを実現した。
- 提案手法は,未知のスリット幅構成に対しても良好に汎化し,補間アーティファクトを抑制することを示した。
3D骨格抽出と言語解析の統合による植物根の多角的表現型解析 [cs.CV, cs.RO]目的:植物根の表現型解析のための,3D骨格抽出と言語誘導推論を統合した多角的ロボットAIフレームワーク
- 地下構造の理解,作物管理の最適化,農業の持続可能性向上に不可欠な研究分野である。
- 根の複雑な構造を定量的に解析し,その機能を解明することは依然として課題である。
- 3D幾何学的知覚と大規模言語理解を統合し,根の表現型解析における説明可能性を追求する。
- 本研究では,ロボット3Dセンシングで取得した点群から高精度な骨格構造を抽出する教師なし学習ネットワークを開発した。
- 抽出された骨格グラフから,根の数,長さ,分岐角度,密度などの形態的記述子を計算し,幾何学的・トポロジ的特徴を定量化した。
- GPTをファインチューニングしたEvidence-First言語モデリングにより,数値的構造と意味的解釈を結びつけ,生物学的に妥当な説明を生成した。
ビデオ言語モデルにおける効率的な推論のための適応型二段階ビジュアルトークン剪定 [cs.CV, cs.AI]目的:ビデオ言語モデルにおける推論効率の向上
- 画像・動画理解において高性能なモデルだが,計算コストが高いことが課題である。
- 動画処理ではフレーム間の冗長性が存在し,既存手法では効率的な処理が困難である。
- 動画内容に応じて剪定率を動的に調整し,情報損失を最小限に抑えることを目指す。
- 提案手法は,動画の冗長なフレームを第一段階で剪定し,残ったフレームでトークンレベルの剪定を行う。
- トークン埋め込みの相関構造を分析し,コンテンツに応じて剪定率を適応的に決定する。
- 追加の学習やファインチューニングは不要でありながら,動画キャプション生成ベンチマークで7%の精度向上を達成した。
透過型マルチスペクトルイメージングによる牛 молокаにおける尿素混入の非破壊的定量化 [cs.CV]目的:牛 молокаにおける尿素混入の定量評価
- 牛乳は重要な食料であり,品質管理が重要であるため,不正行為の検出は不可欠である。
- 従来の尿素検出法は,高価な装置や専門知識を必要とし,迅速な日常検査には不向きである。
- 本研究は,迅速かつ低コストな尿素の定量化手法を開発し,牛乳の品質管理に貢献することを目指す。
- 透過型マルチスペクトルイメージングを用いた尿素定量が可能であることを示した。
- 多重線形回帰では検証用$R^2$が0.9599,フィードフォワードニューラルネットワークでは0.9773と高い予測性能が得られた。
- 本手法は,非破壊的かつ高精度な尿素定量法として,牛乳の品質評価に役立つ可能性がある。
