arXiv雑要約
画像・音声 - 2026/08/03 公開
TokenSwap:マルチモーダルLLMにおけるモダリティギャップのベンチマークと低減 [cs.CL, cs.CV]目的:マルチモーダルLLMにおけるモダリティギャップの評価と軽減
- マルチモーダルLLMは,様々な情報源を統合し高度な推論を実現する上で重要である。
- 異なるモダリティ間での入力に対するモデルの予測に一貫性がないという課題が存在する。
- 意味的に等価な入力に対する予測のずれ,すなわちモダリティギャップを縮小することを目指す。
- 42のMLLMを対象とした実験で,テキストのみの入力から画像挿入型入力への移行に伴い,パフォーマンスが平均19.6%低下するモダリティギャップが確認された。
- 推論能力を持つモデルは,そうでないモデルと比較して,モダリティギャップが小さく,より安定した性能を示すことが明らかになった。
- TokenSwapを学習に組み込むことで,モダリティギャップを効果的に縮小しつつ,テキストと画像認識の両方の性能を維持できることが示された。
Meshy T2:フローマッチングによる高速なネイティブメッシュ生成 [cs.GR, cs.CV]目的:高品質なメッシュ生成手法
- 3Dパイプラインにおける表面表現の標準であり,映画,ゲームなど多くの分野で不可欠である。
- 従来の自己回帰的な手法は推論速度が遅く,誤差蓄積に弱いため,インタラクティブなアセット作成には不向きである。
- フローマッチングに基づき,高速かつ高品質なメッシュ生成を実現し,インタラクティブなアセット作成を可能にする。
- Meshy T2は,頂点集合のVAEを用いてメッシュを連続的な潜在トークンにエンコードし,高精度な幾何学構造とアーティストの意図を反映したトポロジーを維持する。
- 画像に基づいたボクセルフローとメッシュフローのカスケードにより,並列合成による高速生成,フェイス数の制御,マルチパートアセットへのネイティブサポートを実現する。
- 実験の結果,Meshy T2は最先端の幾何学的精度を達成し,平均6秒で画像からメッシュを生成することに成功した。
ViSAGE:長編ビデオ理解のための自己修正型記憶の構築 [cs.AI, cs.CV]目的:長編ビデオ理解を支援するための自己修正型マルチモーダル記憶
- 長期的な環境で動作するマルチモーダルエージェントにとって,一貫性のある推論には記憶が不可欠である。
- 既存の記憶アプローチでは,詳細なエンティティ情報が失われ,誤った証拠が取り出されることがある。
- エンティティの一貫性を維持し,誤った情報を抑制する記憶システムの構築を目指す。
- ViSAGEは,クロスモーダルバインディングによりエンティティの同一性を長期にわたって固定する。
- 双方向の記憶洗練により,過去の記録を遡及的に統合し,将来の推論を改善する。
- マルチエージェントによる相互検証により,証拠の信頼性を高め,根拠のない回答を回避する。
方向選択性バイオニック網膜設計による光流センサー [cs.AR, cs.CV, cs.ET, eess.IV]目的:光流センサーの集積回路設計
- 視覚における動きの知覚と追跡は,生物や人工知能システムにとって不可欠である。
- 従来の光流計算は,高密度サンプリングとグローバル演算に依存し,遅延と消費電力が大きい。
- 並列処理と低消費電力化を実現する光流センサーを開発し,リアルタイムな視覚センシングを目指す。
- 提案する光流センサーは,FPGAを用いたDVSシステムと比較して,消費電力を303倍削減した。
- マイクロ秒レベルの低遅延を維持しながら,高い処理性能を実現している。
- 光流ベクトルを直接出力することで,出力データ量を約3.3倍削減し,超高速・低消費電力な視覚センシングへの応用が期待される。
反復的なスケジュール変更の誘導探索:鉄道牽引ユニットの運行計画に関するデザインスタディ [cs.HC, cs.GR]目的:鉄道牽引ユニットの運行計画におけるスケジュール変更の探索と最適化
- 大規模鉄道網の効率的な運行には,複雑な制約条件のもとでの最適な牽引ユニットの配置が不可欠である。
- 既存のツールは,有望な候補の特定,影響の評価,探索の管理において支援が不十分である。
- スケジュール変更候補の探索を体系的に支援し,効率的な運行計画の最適化を実現すること。
- 本研究では,スケジュール可視化,シミュレーション評価,3段階のガイダンス機構を組み合わせた対話型探索アプローチを提案する。
- 提案手法は,遅延伝播を計画コンテキスト内で直接的に可視化し,主要業績評価指標(KPI)に基づいた候補のランキングを提供する。
- 実用的なケーススタディにより,スケジュール変更の特定と評価に必要な時間と労力を大幅に削減できることが示された。
マイクログラフからの物理情報に基づく深層学習による鋼の疲労寿命予測 [cs.LG, cs.AI, cs.CV]目的:鋼の疲労寿命の予測
- 鋼構造物の安全性確保は重要であり,疲労寿命の正確な評価が不可欠である。
- 従来の疲労寿命評価は時間とコストがかかり,迅速な品質管理が困難である。
- マイクログラフ画像から疲労寿命を迅速かつ正確に予測する手法を確立すること。
- 本研究では,マイクログラフ画像から疲労寿命を予測するコンピュータビジョンフレームワークを開発した。
- ResNet-50を用いた実験では,$R^2 = 0.93$,RMSE = 0.18 log-cycles,macro-F1 = 0.91を達成した。
- Gaussian negative log-likelihood損失関数により,期待キャリブレーション誤差が大幅に低減された。
臨床シフト下における医療ビジョン・言語モデルのクラスごとのカバレッジ不足の軽減 [cs.LG, cs.CV]目的:医療ビジョン・言語モデルにおける臨床シフト時のクラスごとのカバレッジ不足の軽減
- 医療画像と自然言語処理の融合は,診断支援や医療研究において重要な役割を担う。
- 医療データは,収集プロトコルやモデル構造に依存し,特定の疾患クラスの認識精度が低下する問題がある。
- 本研究は,未知のデータに対する信頼性を高め,特定の疾患クラスにおけるカバレッジ不足を解消することを目指す。
- 提案手法CALCoDeは,既存手法と比較して,臨床シフト下において高いカバレッジを達成した。
- 特に,HAM10000からISIC 2019へのシフトにおいて,最悪クラスのカバレッジは0.970に達し,他の手法を上回った。
- CALCoDeは,信頼性の低い事例を適切に識別し,安全性を確保する。
鏡像学習 [cs.CY, cs.LG, cs.CV, cs.RO]目的:第三者視点からの模倣学習
- 人間や動物は,第三者視点からの観察を通して学習する能力を持つ。ロボットにも同様の学習能力を付与することが重要。
- 従来の模倣学習は,一人称視点での密なデータに依存しており,第三者視点からの豊富な情報を活用できていない。
- 第三者視点観察データから,効果的な行動方針を獲得し,データ収集の負担を軽減することを目的とする。
- 提案手法では,動画拡散モデルを用いて学習者の視点をデモンストレーターに合わせる変換を学習する。
- 逆ダイナミクスモデルを用いて,学習者の制御空間における行動軌跡を推論し,鏡像データを合成する。
- 実験結果から,鏡像データのみでも効果的な方針を学習でき,一人称視点データとの組み合わせでさらに性能が向上することが示された。
ReLoop-UME:汎用マルチモーダル埋め込みのための再帰的深度と学習可能な検索レジスタ [cs.CV]目的:汎用マルチモーダル埋め込みの効率化と性能向上
- 異なるモダリティの情報を統合し,共通の表現空間にマッピングすることは,様々な応用において重要である。
- 既存のモデルは計算コストが高いか,中間状態への依存性が高く,検索遅延が発生しやすいという課題がある。
- モデルの深度方向に計算を拡張しつつ,トークン数を固定することで,効率的かつ高性能な埋め込みを実現する。
- ReLoop-UMEは,早期レイヤーを一度実行し,検索特徴を形成するブロックを再帰的に再利用し,最終マッピング層を適用する。
- 学習可能な検索レジスタにより,ループ間でエビデンスを蓄積・交換し,最終的な埋め込みを生成する。
- MMEB-V2とMRMRにおいて,既存モデルと比較して検索性能が向上し,高速な処理速度を実現した。
SCMA:構造と金属を考慮したフローマッチングによるCT金属アーチファクトの低減 [cs.CV, cs.AI]目的:CT金属アーチファクトの低減手法の提案
- CT画像診断において,金属による影響は画質劣化を招き,正確な診断や定量分析を妨げるため,その低減は重要である。
- 既存手法では,残存アーチファクトや構造のぼやけ,汎化性能の不足,解剖学的に不整合な構造の生成といった問題が残る。
- サンプル固有の構造や金属による局所的な劣化を考慮し,より高精度な金属アーチファクト低減を目指す。
- SCMAは,線形補間画像と金属マスクを利用し,構造を考慮したフローマッチングによりアーチファクトを効果的に抑制する。
- 金属周辺の劣化領域に重点を置いた損失関数により,局所的な構造を保持しつつ,アーチファクトを低減する。
- シミュレーションおよび実際のCTデータを用いた実験で,既存手法よりも優れたアーチファクト抑制効果と,より自然な構造復元が確認された。
信号を待て:単純な周波数認識型フローマッチング [cs.CV, cs.AI, cs.LG, stat.ML]目的:高解像度画像生成におけるグローバルな一貫性,ローカルな詳細,テクスチャの忠実性の向上
- 画像生成モデルは高解像度化が進み,生成品質には全体的な一貫性が不可欠である。
- 従来のフローマッチングは周波数成分を均一に扱うため,高周波帯域のノイズ問題が生じやすい。
- ウェーブレット変換により,粗い構造から細かい構造を段階的に生成することでノイズを抑制する。
- WaiTは,ウェーブレット変換を用いて画像生成を粗い帯域と細かい帯域に分解する。
- ImageNet 512x512において,WaiTはピクセル空間でのFIDを1.43とし,3つの評価軸で最適解を達成した。
- 大規模モデルでは,ImageNet 512解像度においてFID 1.3を達成し,テクスチャの忠実性でも優れた性能を示した。
多視点構造学習による不確実性認識型ディープフェイク検出 [eess.SY, cs.SY, cs.CL, cs.CV]目的:ディープフェイク検出のための不確実性認識型フレームワーク
- 生体認証やフォレンジックにおいて,正確な予測と信頼性のある信頼度推定が不可欠である。
- ディープフェイク検出器は,分布外の操作に対して過信した予測を行い,実用展開が困難である。
- 異なる証拠源間の不一致を利用し,信頼性の高いディープフェイク検出を実現する。
- 本フレームワークは,視覚,意味,構造の3つのストリームを統合し,高精度な検出を可能にする。
- 提案手法は,複数の分布外ベンチマークにおいて最先端の汎化性能とキャリブレーション性能を示す。
- 異なる証拠間の不一致を考慮した不確実性モデリングが,信頼性の高いディープフェイク検出に貢献する。
医療基礎モデルはアフリカ人の脳に一般化できるか [cs.CV]目的:医療基礎モデルの脳MRIデータに対する汎化性能の評価
- 脳MRI解析における医療基礎モデルの利用が増加しており,その性能評価は重要である。
- 医療基礎モデルの評価はリッチなデータセットに偏り,アフリカ人集団への汎化は未解明である。
- アフリカ人脳MRIデータにおける医療基礎モデルの性能を検証し,バイアスの有無を明らかにする。
- 認知症分類タスクでは,医療基礎モデルによる性能向上は限定的であった(BrainIACで最高ROC-AUC 0.86)。
- 脳腫瘍セグメンテーションタスクでは,医療基礎モデルは一貫して性能を向上させ,MedSAM2で最高0.86のDiceスコアを達成した。
- アフリカ人と非アフリカ人集団間の性能差は一貫しておらず,データセットサイズの影響が大きい可能性が示唆された。
合成データは,ササゲ育種におけるAIベースの花と莢の検出の汎化限界を克服できるか? [eess.SY, cs.SY, cs.CV]目的:ササゲの花と莢の検出におけるAIの汎化能力向上
- 育種において,多様な遺伝子型や環境で安定した表現型評価が不可欠である。
- 実際の画像データだけでは,全ての遺伝子型と環境の組み合わせに対応したAIモデルの構築は困難である。
- 本研究は,合成データを用いたAIモデルの汎化性能向上を目指す。
- 合成データ単独でも事前学習を上回る性能を示したが,カメラによる画像形成の違いが課題となった。
- Wasserstein距離を用いて最適化されたカメラリアル増強戦略により,この課題を軽減することができた。
- 最適化されたHDR合成データと少量の実際の画像で,既存の実際のデータと同等またはそれ以上の性能を達成した。
FocusGS: 学習済み3Dガウスアセットの局所修復と決定論的編集のための空間デルタ層 [eess.SY, cs.SY, eess.SY, cs.SY, cs.CV]目的:学習済み3Dガウスアセットの局所的な修復と決定論的な編集手法
- 3Dガウススプラッティングは,高品質な3Dコンテンツ作成において重要な技術となっている。
- 既存手法では,学習済みの3Dアセットに対する精密な局所修正が困難であった。
- 本研究は,空間デルタ層を用いたFocusGSにより,局所修復と決定論的編集を可能にすることを目指す。
- FocusGSは,空間勾配の欠乏に対処し,局所修復におけるPSNRを7.91dB向上させた。
- 決定論的編集試験83件において,目標領域のPSNRは平均で+11.05dB改善し,21.97dBを達成した。
- FocusGS-EIFは,公的な編集ケースにおいて33.17dBのTarget-mask PSNRと0.994のTarget-delta Correlationを実現した。
高次元点埋め込みによる非等方性表面近似のための学習多様体 [cs.GR, cs.CV]目的:非構造化点群からの3次元非等方性表面近似
- 現実世界の様々な分野で高密度3Dセンサーが普及し,点群データの効率的な処理が重要になっている。
- 点群データは幾何学的に冗長であり,リアルタイム処理には計算コストが高いという課題がある。
- 点群データからコンパクトで高精度な非等方性表面表現を生成する手法を開発し,計算効率を向上させる。
- 本研究では,点群を入力とし,高次元多様体埋め込み空間へ写像する新しい学習ベースの手法を提案した。
- 提案手法HD-PEAは,等方性および適応型メッシュと比較して,より高精度で要素数が少なく,数値安定性も向上している。
- 多様なデータセットを用いた実験により,提案手法が未知の形状や用途に対しても高い汎化性能を示すことが確認された。
磁気共鳴画像による多課題3D脳腫瘍セグメンテーションのための深層学習モデルの統一的ベンチマーク [cs.CV, cs.AI]目的:深層学習モデルの多課題3D脳腫瘍セグメンテーションの比較評価
- 脳腫瘍の正確なセグメンテーションは,診断,治療計画,経過観察において不可欠である。
- 研究ごとにデータセットや評価方法が異なり,客観的な比較が困難であった。
- 公平な比較環境下で,様々な深層学習モデルの性能を評価し,最適なモデル選択を支援する。
- 5つの最先端の3Dセグメンテーションモデル(3D U-Net, SegResNet, Swin UNETR, SegMamba, SegMambaV2)を,統一された条件下で評価した。
- 評価データセットとして,髄膜腫(BraTS 2023)と治療後のグリオーマ(BraTS 2024)を用いた。
- セグメンテーション精度と計算コストのトレードオフが示され,各アーキテクチャの特性が明らかになった。
物理学に基づいた自己教師あり学習:科学画像への応用 [cs.CV]目的:科学画像における自己教師あり学習のための,物理学に整合したデータ拡張手法の設計
- 科学画像の解析は,様々な科学分野の進展に不可欠であり,その効率化が求められている。
- 自然画像向けに設計されたデータ拡張手法を科学画像に適用すると,物理法則に反する表現を学習し,性能が低下する可能性がある。
- 物理学に基づいたデータ拡張手法を確立し,科学画像における自己教師あり学習の性能向上と表現の質的改善を目指す。
- 物理学に整合したデータ拡張は,異なる視点の一貫性を必要とするタスクにおいて,下流タスクの性能を大幅に向上させる。
- 表現の幾何学的構造を改善し,現実的な取得変動(検出器ゲイン,解像度低下など)に対するロバスト性を高める。
- 提案手法は電子顕微鏡を対象とするが,医療画像やリモートセンシングなど,他の測定駆動型ドメインにも適用可能である。
演奏による感情変化の予測学習:クラシックピアノ音楽における差異 [cs.SD, cs.LG, cs.MM]目的:演奏の違いに起因する感情の差異の特定と予測
- 音楽は感情伝達の手段であり,演奏者の解釈が聴覚的な感情に影響を与える。
- 楽曲自体が感情の主要因となる場合が多く,演奏による微細な感情変化の特定が困難。
- 演奏に特有な特徴を用いて,演奏者間の感情変化を定量的に予測すること。
- 演奏に特有な特徴量を用いることで,演奏者間の感情変化に意味のある差異が認められた。
- 提案手法Delta-VAは,平均的な演奏からの感情変化を予測する際に高い方向性の一致性を示した。
- しかし,予測値の幅が小さくなる傾向があり,表現力豊かな演奏効果を過小評価している可能性が示唆された。
TORUS:統一オーディオモデルにおけるレンダリング理解の一貫性テスト [cs.IR, cs.SD, cs.AI, cs.CL]目的:統一オーディオモデルにおける自己整合性の評価
- 音声処理技術は,多様な応用分野において不可欠であり,その発展が求められている。
- 現在の統一オーディオモデルは,個々の機能を評価するものの,生成と理解の一貫性は検証されていない。
- 本研究は,統一オーディオモデルの自己整合性を評価し,今後の発展に資することを目的とする。
- 本研究で開発したTORUSは,音声,音響,音楽の各分野における自己整合性を評価するテストである。
- 評価の結果,最良の統一モデルは50.5%の正答率であり,従来の専門モデル群の63.2%を下回った。
- 特に音声編集タスクにおいてモデルの自己整合性が低いことが示され,今後の課題が明確になった。
画像分類のためのドメイン適応型深層結合ソースチャネル符号化 [cs.CL, cs.IT, cs.CV, eess.SP, math.IT]目的:画像分類におけるドメイン適応型深層結合ソースチャネル符号化の性能向上
- 画像伝送において,意味情報を効率的に伝送する手法であり,低帯域幅環境下での利用が期待されている。
- 学習データと実データ間の分布のずれにより,深層結合ソースチャネル符号化の性能が低下する可能性がある。
- 分布のずれに対応し,ターゲットドメインにおける分類精度を向上させることを目指す。
- 提案手法は,擬似ラベルに基づくクラスレベルの敵対的アライメントと,信頼度フィルタリングされたターゲットサンプルに対する教師ありコントラスティブ学習を組み合わせる。
- 実験結果から,追加の推論時間ネットワークを導入することなく,ターゲットドメインの汎化性能が向上することが示された。
- SVHN→MNISTにおいて,提案手法は10dBのCSNRで98.15%のターゲットドメイン精度を達成した。
グラフニューラルネットワークによる最適動的マッチング学習 [cs.LG, cs.GT, econ.TH]目的:動的マッチング市場における最適マッチング戦略の学習
- マッチング市場は経済活動において重要であり,資源配分の効率化に寄与する。
- 従来の市場モデルでは,時間経過に伴う変化や不確実性を考慮した動的なマッチングが困難である。
- グラフニューラルネットワークを用いて,動的な環境下で最適なマッチング戦略を学習する。
- 提案手法は,イベント発生直後にのみ行動し,次のイベントを待機する戦略が最適であることを証明した。
- 残差グラフ上の単一の継続価値関数で最適Q関数が特徴付けられ,学習対象が状態行動価値からグラフ価値へと簡略化される。
- バイナリ型ベンチマークおよび腎臓交換ベンチマークにおいて,提案手法は既存手法を大幅に上回り,適応的な動的マッチングが可能であることを示した。
グループ化された教師信号とFocal-Dice損失による長尾型屋内セマンティック占有予測 [cs.CV]目的:長尾型屋内セマンティック占有予測における性能向上
- 屋内シーン理解における3Dセマンティック占有予測の重要性が高まっている。
- 屋内シーンは多様な物体カテゴリを含み,長尾分布がモデル性能のボトルネックとなっている。
- 長尾分布の問題を解決し,特に少数クラスの物体認識精度を向上させる。
- 提案手法Group-UFD Occは,階層的なセマンティック教師信号と損失最適化により性能を向上させた。
- ファインチューニングされたセマンティックグループ化とマルチスケール予測ヘッドが,少数クラスの特徴学習を促進する。
- Unified Focal-Dice損失が,困難なサンプルに焦点を当てつつ,予測オブジェクトの幾何学的整合性を最適化する。
潜在拡散モデルを用いた顔認識に対する回避攻撃:DiffAttack [cs.CV, cs.AI]目的:顔認識システムに対する回避攻撃手法の開発
- 顔認証は生体認証の重要な要素であり,セキュリティにおいて不可欠である。
- 既存の手法では,高品質で知覚できない攻撃画像の生成が困難である。
- 異なる属性間での攻撃成功率向上を目指し,よりロバストな攻撃手法を提案する。
- 提案手法DiffAttackは,FFHQやCelebA-HQ等の標準ベンチマークにおいて高い攻撃成功率(84.86%)を達成した。
- DiffAttackは既存のノイズベース手法よりも15.28%以上,セマンティックベース手法よりも約5.21%高い転移性能を示した。
- 潜在拡散モデルを活用することで,顔認識モデルの識別境界を欺く効果的な攻撃を実現した。
STEM講義環境における学生の学習関与度をリアルタイムで測定する生体センサーネットワーク [cs.CR, cs.CV, cs.SE, eess.IV]目的:STEM教育における個々の学生の学習関与度をリアルタイムで測定・追跡すること
- STEM教育において,学生の学習関与度は学業成績や継続学習に重要な影響を与える。
- 従来の測定方法は,侵襲的,手動による負荷が高い,またはリアルタイムの教室利用に適さないという課題がある。
- 倫理的・プライバシー上の制約を維持しつつ,行動的,感情的,認知的指標を捉えることで,上記課題を解決すること。
- 本研究では,分散型センシングノードであるStudent Processing Unit (SPU) を構成する生体センサーネットワークを提案した。
- SPUは,顔検出,視線推定,感情分析を含む完全なオンデバイス処理を実現し,個人を特定できるビデオデータがデバイス外に出ないことを保証する。
- このシステムは,デバイス認証,セッションオーケストレーション,暗号化されたデータ取り込みのためのセキュアなバックエンドインフラストラクチャと統合されている。
2D/3DハイブリッドCNNを用いた胸部CTボリュームからのCOVID-19症例の自動分類法 [cs.CV]目的:COVID-19症例の胸部CTボリュームの自動分類
- COVID-19の世界的蔓延により,医療機関の人手不足が深刻化している。
- 胸部CT画像はCOVID-19診断に有用だが,読影には専門知識と時間が必要である。
- CT画像からの自動診断支援システム開発により,診断効率の向上を目指す。
- 提案手法は,2D/3DハイブリッドCNNを用いて,胸部CTボリュームの特徴量を効率的に抽出する。
- 1288件のCTボリュームを用いた評価で,平均分類精度83.3%を達成した。
- 従来の2D CNNのみを用いた手法と比較して,高い分類精度を示した。
検索駆動型学習不要AI生成動画の帰属特定 [cs.CV, cs.AI]目的:AI生成動画の生成元特定
- AI技術の発展により,現実と区別がつかない動画が生成可能となり,社会に悪影響を及ぼす可能性が懸念されている。
- 既存の画像帰属特定手法は,画像生成モデルに依存しており,大規模な動画データへの汎化が困難である。
- 生成モデルが導入するアーティファクトを捉え,動画フレーム全体で集約することで,学習なしに動画の生成元を特定することを目指す。
- 提案手法は,GenVidBenchベンチマークにおいて,AI生成動画の検出と帰属特定において高い性能を示した。
- 既存の最先端手法と比較して,Rank-1精度は20.5%向上し,平均平均精度(mAP)は16.6%を達成した。
- 直交色変換,多段階量子化残差生成,時系列・意味集約のパイプラインが,生成モデルに起因するアーティファクトを効果的に捉えている。
ビザンチンを超えて:情報非対称下における利己的な主体のための組織コンセンサスアルゴリズム [cs.GT, cs.DC, cs.MA]目的:組織における内部交渉と意思決定調整のためのメカニズム
- 組織運営において,部門間の連携は効率化と健全な意思決定に不可欠である。
- 従来のコンセンサスアルゴリズムは,現実の組織における主体(部門)の行動を捉えきれていない。
- 利己的な主体と情報非対称性を考慮した,より現実的な組織コンセンサスアルゴリズムを提案する。
- 提案アルゴリズム(OCA)は,トークンステーキング,例外発生時の異議申し立てメカニズム,信頼度に基づいたコンセンサスルールを統合する。
- シミュレーション結果から,OCAは従来のアルゴリズムと比較して,調整オーバーヘッドが低く,情報報告率が高いことが示された。
- ただし,これらの結果はシミュレーションモデルに依存するため,一般的な truthful equilibrium を保証するものではない。
効率的なプロンプトチューニングのための視覚的分布アンカリング [eess.SY, cs.SY, eess.SP, cs.CL, cs.CV, cs.LG]目的:視覚と言語モデルの少ない学習パラメータによる適応
- 画像とテキストを組み合わせたモデルは,多様なタスクに応用可能であり,AI研究において重要性が増している。
- 既存の手法では,効率性と適応性の両立が難しく,ソースクラスへの過学習や計算コストの問題がある。
- ラベルなしターゲットデータを用いて,モデルを効率的に適応させ,性能向上を目指す。
- VDAは,学習を必要としないターゲット適応フレームワークであり,ラベルなしターゲットプールからオフラインで推定されたクラスレベルの視覚的プロトタイプを用いる。
- 実験の結果,VDAはCLIP,TCP,MaPLeのゼロショット性能をそれぞれ3.22,3.39,3.35ポイント向上させた。
- 視覚的補正により,PromptKDの性能も2.79ポイント向上し,多様な設定で優れた結果が得られた。
SafeNexus: 複数モダリティにおける普遍的な安全性ニューロンの発見と制御 [cs.CV]目的:複数モダリティ大規模言語モデルにおける安全性ニューロンの特定と制御
- 大規模言語モデルの安全性確保は重要であり,特に多様なモダリティを扱うモデルではその課題が深刻化している。
- 既存の安全性対策は特定のモダリティに限定され,クロスモダリティ攻撃に対する汎用性に欠ける。
- クロスモダリティ攻撃に対応可能な普遍的な安全性ニューロンを特定し,モデルの安全性を高める。
- SafeNexusは,中間層の活性化パターンと重要度スコアを用いて,機能的に特殊なニューロンを特定するパラダイムを確立した。
- モダリティ境界安全性ニューロン(BS-Neurons)と,それらを共有する普遍的な安全性ニューロン(US-Neurons)を特定した。
- US-Neuronsの活性化増幅や選択的なキャリブレーションにより,モデルの安全性を向上させ,既存手法を上回る性能を示した。
LegoQ:スペクトル・空間状態遷移を用いた高分解能スペクトル画像の密度行列表現学習 [cs.CV]目的:高分解能スペクトル画像分類のための密度行列表現学習手法
- 高分解能スペクトル画像は多様な応用を持つが,分類は困難である。
- 混合ピクセル,スペクトル曖昧性,クラス不均衡,注釈の少なさなどが課題である。
- 密度行列表現学習により,混合や不確実性を明示的に捉え,分類精度向上を目指す。
- 提案手法LegoQは,スペクトルバンドをグループ化し,各グループを密度行列として表現する。
- スペクトル・空間・グループ間遷移を繰り返すことで状態を更新し,クラスプロトタイプとのUhlemann忠実度を比較する。
- Indian Pinesデータセットで全体精度96.20±0.70%,WHU-Hi-LongKouデータセットで最高97.52%の精度を達成した。
RAID:ビット反転画像を用いたロバストなAI生成画像検出へ [cs.CV, cs.AI]目的:AI生成画像の検出
- AI技術の発展により,画像生成が容易になり,偽画像の悪用リスクが高まっているため。
- 既存手法は,実画像と生成画像の根本的な違いに着目せず,汎化性能に課題がある。
- ビットプレーンを利用し,ビット反転画像を導入することで,ロバストな検出を目指す。
- 提案手法は,ビット反転画像の生成,勾配ベースのパッチ選択,畳み込み分類器から構成されるシンプルなパイプラインである。
- 40以上のベンチマークで既存手法を凌駕し,処理速度も大幅に向上した。
- 異なる生成モデルやデータセット間での汎化性能,ゼロショット性能においても高い有効性が確認された。
3D CNNと3D MLP-Mixerのハイブリッドモデルによる胸部CTボリュームからのCOVID-19症例分類 [cs.CV]目的:COVID-19の胸部CTボリュームの自動分類法
- COVID-19の世界的蔓延により,医療機関の人手不足が深刻化している。
- 画像診断において,局所的特徴とグローバル特徴の両方を捉えることが課題である。
- 医療現場における迅速かつ定量的な診断支援を実現し,人手不足を解消する。
- 提案手法は,3D CNNと3D MLP-Mixerを組み合わせたハイブリッドモデルである。
- 1205件のCTボリュームデータセットを用いた評価で,分類精度79.5%を達成した。
- 従来の3D CNNモデルと比較して,高い分類精度を示した。
厳格なゼロショット画像キャプション生成のための,マルチエージェントアラインメントスコアリングとコンセンサス蒸留ビームアービトレーション [cs.CV, cs.AI, cs.CL, cs.MA]目的:厳格なゼロショット画像キャプション生成における性能向上
- 画像とテキストを結びつける技術は,画像理解や検索,そして人間と機械のコミュニケーションにおいて重要である。
- 既存手法では,画像とテキストのアラインメント評価が初期段階で一度だけ行われ,その後のデコード過程で視覚的情報が失われる。
- 複数回の視覚的フィードバックを取り入れ,より正確なキャプション生成を目指す。
- 提案手法「Adjudicated Captioning」は,COCO Karpathyデータセットにおいて,CIDErスコアを117.6,SPICEスコアを21.9と,既存手法を上回る性能を達成した。
- 性能向上は,学習済みのモジュールによるアーキテクチャの介入が大きく貢献しており,学習された reranker はわずかな改善に留まっている。
- 本手法は,キャプション生成モデルの再学習なしに,Flickr30k KarpathyおよびNoCapsデータセットにおいても良好な転移学習性能を示した。
CAER:対立を意識したエビデンス経路決定と,デュアルプレフィックスエキスパートによるマルチモーダル大規模言語モデル [cs.CV]目的:マルチモーダル大規模言語モデルにおける視覚的証拠とテキストの対立検出および対立を意識した生成
- マルチモーダル大規模言語モデルは,画像とテキストの理解・生成において目覚ましい能力を示す。
- テキストと視覚的証拠が矛盾する場合,幻覚や視覚内容と一致しない応答を生じやすい。
- 視覚的証拠とテキストの対立を検出し,より信頼性の高い応答を生成すること。
- CAERは,バックボーンに依存しないフレームワークであり,視覚-言語間の対立を検出し,対立を意識した生成を実現する。
- スパンに基づくエビデンス経路決定器が,クレーム表現をソフトなテキストクエリに変換し,対応する視覚トークンから証拠を検索する。
- デュアルプレフィックスエキスパート経路決定機構により,視覚的に支持・反証される入力に対してそれぞれ異なるエキスパートを学習し,明示的なエキスパート選択を可能にする。
ST-WAM:視覚的分布シフト下におけるロバストな操作のための意味・時間的ワールドアクションモデル [cs.RO, cs.CV]目的:視覚的分布シフト下でのロバストな操作を実現する意味・時間的ワールドアクションモデルの開発
- ロボットの汎用的な行動学習において,視覚情報と行動予測を統合したモデル構築が重要である。
- 既存モデルは,ピクセル生成に基づく未来予測に依存し,視覚変化に弱いという課題がある。
- DINOv3特徴量を利用し,視覚変化に強い意味・時間的表現を獲得し,ロバスト性を向上させる。
- 提案手法ST-WAMは,DINOv3を共有表現として活用することで,視覚的分布シフト下でも安定した行動予測を可能にした。
- 実験結果から,ST-WAMは既存手法Fast-WAMと比較して,LIBERO-Plusにおけるゼロショット性能を21.3%向上させた。
- 実世界環境における成功率も25.8%から61.5%へと大幅に向上し,ロバストな操作能力を実証した。
マテリアル情報を考慮した点群からのクロスシーンラジオフィールドのための基盤モデルPoint2Radio [cs.NI, cs.AI, cs.CV, cs.LG]目的:シーンを跨いだラジオフィールドの転移学習
- 電波伝搬予測は,通信システム設計や無線環境マッピングにおいて不可欠である。
- 従来手法では,シーンごとに電波伝搬をシミュレーションまたは学習する必要があり,計算コストが高い。
- 異なる環境で共有される伝搬構造を利用し,汎用的な電波伝搬モデルを構築することを目指す。
- Point2Radioは,マテリアル情報を考慮した点群と送信機の設定から,シーン表現を生成する。
- 新しいシーンでは,点群とトランシーバのクエリのみを使用し,メッシュやパス トレーシングなしにミリ秒単位で動作する。
- 337シーンのデータセットで評価した結果,平均絶対誤差 (MAE) は0.871 dBであり,ベースラインと比較して誤差を76.7%削減した。
SULAND v2:UAV/UGVベース地雷探知のための改良型RGBデータセットおよび深層学習物体検出ベンチマーク(ドメインシフト下) [cs.RO, cs.CV]目的:地雷探知におけるRGB画像を用いた物体検出性能の評価とドメインシフトへの対応
- 地雷探知は人道的課題であり,安全確保のため効率的かつ低コストな技術が求められている。
- 既存のRGBデータセットは品質に課題があり,汎化性能の評価が困難であった。
- SULANDの注釈の修正とベンチマークの再構築により,より信頼性の高い評価環境を提供する。
- SULAND_v2は,注釈の修正により,YOLOv8のIIDテストmAP@50を14.6~19.6%向上させた。
- OODクラスIDの修正により,YOLOv8のOOD mAP@50は約25%向上し,ドメインシフトへの対応が改善された。
- YOLOv12-SmallはIID mAP@50で0.908を達成,RF-DETR-LargeはOOD性能で0.799 mAP@50,0.675 recallを示した。
一貫性のあるマルチ参照画像編集のための評価・検証報酬 [cs.CV]目的:マルチ参照画像編集における一貫性と調和の改善
- 画像編集技術の発展は目覚ましいが,複数参照間の視覚的整合性が課題。
- マルチ参照編集において,複数画像の関係性を捉えた適切な報酬モデルが存在しない。
- マルチ次元評価・検証報酬(EVR)を用いて,視覚的整合性と調和を向上させる。
- EVRは評価を複数の視覚基準に分解し,MLLMを用いて仮説を生成,検証することで信頼性の高い報酬信号を得る。
- 既存のエディタをアーキテクチャ変更なしにRLでファインチューニング可能。
- Qwen-Image-Editに対し,一貫性と調和が向上し,NanoBananaと同等以上の性能を達成。
SAM+D:深度ルーティングLoRAと深度シフトによるSAMファミリーモデルのパラメータ効率的な次元拡張 [cs.MA, cs.CL, cs.CV]目的:SAMファミリーモデルを効率的に3次元または4次元に拡張する手法
- 2Dの基礎モデルを3Dへ拡張する技術は,医療画像解析や生物学的シーケンス理解など,幅広い分野で重要性が高まっている。
- 既存手法は,スライス間のコンテキストを無視するか,大規模な再学習が必要となるため,効率性や性能に課題がある。
- 本研究は,パラメータ効率的にSAMファミリーモデルを3D/4Dに拡張し,その性能を向上させることを目指す。
- SAM+Dは,わずか約2.8%~3.7%のパラメータを調整するだけで,SAMおよびSAM2を3次元/4次元に拡張することに成功した。
- CT画像データセットおよび細胞追跡データセットにおいて,既存手法と同等以上の性能を達成し,SAMファミリーモデルへの適用性と汎用性を示した。
- Depth-Routed LoRAとDepth Shift Moduleという軽量なモジュールにより,ボリューమ్レベルのコンテキストを効率的に活用することが可能となった。
GO-PRE:予測レンダリングエントロピーに基づく目標指向型次善視点選択によるアクティブ3D再構成 [cs.CV]目的:アクティブ3D再構成のための次善視点選択
- 3D再構成は,現実世界のデジタル化に不可欠であり,様々な応用分野で重要性が増している。
- 既存手法は,パラメータ不確実性等の代替信号に依存し,再構成品質との整合性が課題となっていた。
- 予測空間における情報利得を最大化することで,再構成品質を向上させることを目指す。
- 提案手法GO-PREは,ユーザー指定のターゲット視点多様体上で平均周辺予測エントロピーの減少を最大化する。
- GO-PREは,インタラクティブな目標指定を可能にし,リアルタイムな情報利得計算を実現する。
- 実験結果から,GO-PREは既存手法と比較して再構成性能を向上させ,より信頼性の高い不確実性定量化を提供する。
ReMoE:レポート誘導混合エキスパートによる多重モードOCT/OCTA異常検出 [cs.CV]目的:多重モードOCT/OCTA画像における異常検出
- 網膜疾患の早期発見には,OCT/OCTA画像の異常検出が不可欠である。
- 既存手法は外観レベルの偏差に依存し,正常なレポートに含まれる意味的組織を活用できていない。
- 正常な医療レポートの意味的情報を画像の特徴に組み込み,異常検出の精度向上を目指す。
- ReMoEは,正常レポートの意味を画像-テキスト事前学習モデルに蒸留し,モダリティを意識した事前分布を構築する。
- レポート誘導モダリティ変調(RMM)により,混合エキスパートルーティングを通じて特徴を調整する。
- プライベートデータセットと公開データセットにおいて,最先端の性能を達成した。
検出キャリブレーションの再考:座標と方向の視点 [cs.CV]目的:検出信頼度の精度向上
- 物体検出技術は,精度だけでなく,信頼性が重要視される。
- 深層学習に基づく検出器は過信傾向があり,誤った予測に高い信頼度を付与する。
- 座標レベルでの信頼度を向上させ,より正確な物体検出を可能にすること。
- 提案手法ReDCは,座標と方向を考慮した信頼度スコアを提供し,既存手法よりも詳細な局所化精度を表現する。
- 座標ごとのアライメントとずれ方向を定義することで,信頼度の再エンコードとずれ方向推定を実現している。
- 実験により,インドメインおよびアウトドメインのシナリオで有効性が確認された。
感情的ビデオキャプション生成における感情的異種グラフ推論とマルチタスク共同学習による適応的アプローチ [cs.CL, cs.CV]目的:感情と事実の両面からビデオを記述するモデルの開発
- ビデオコンテンツの理解において,感情認識は重要な役割を果たす。これにより,より人間らしいインタラクションが可能となる。
- 既存手法は,感情情報の表現に限界があり,複雑な感情や混合感情を正確に捉えられていない。
- 感情情報の表現力を高め,より自然で正確なビデオキャプションを生成することを目指す。
- SAGMLは,感情的異種グラフを用いて感情情報を柔軟に表現し,誤った感情予測による影響を軽減する。
- カタログレベルの感情ノードと語彙レベルの感情単語ノードを含むグラフ構造により,多様な感情表現を捉える。
- 自動回帰的なキャプション生成と感情分布の学習を組み合わせたマルチタスク学習により,性能を向上させる。
スパイク点群モデルのためのパラメータ効率的なファインチューニング [cs.CV]目的:スパイク点群モデルのパラメータ効率的なファインチューニング手法
- リソース制約のあるデバイスでの点群解析において,省エネルギーな処理が求められている。
- 既存のスパイク点群モデルは,タスク適応のために全パラメータをファインチューニングする必要があり,計算コストが高い。
- 本研究では,少ないパラメータでスパイク点群モデルを効率的に適応させることを目指す。
- 提案手法SpikePEFTは,膜減衰と発火閾値を適応的に調整することで,ニューロン固有の適応を効率化する。
- 情報量の多い無活動状態からタスクに関連する情報を復元するSilent-State Disambiguation Adaptation(SSDA)を導入する。
- ModelNet40で92.4%,ScanObjectNN(PB_T50_RS)で85.6%の精度を達成し,学習パラメータの約5%のみを更新し,SNNの省エネルギー性を維持する。
逆境からの学習:敵対的摂動による意味認識型マスクの改良 [cs.CV]目的:画像セグメンテーションにおけるマスクの改良
- 画像セグメンテーション技術は,画像認識において重要な役割を担う。
- 最先端モデルでも,マスクの境界線,意味の一貫性,構造に誤りが見られる。
- 現実的なセグメンテーションエラーを模倣した改良手法の開発。
- Phoenixは,敵対的学習により意味的に意味のあるノイズパターンを生成する。
- 対照学習を用いて,セマンティック領域内の一貫性を保ちつつ,クラス間の分離を維持する。
- 多様なタスクにおいて既存手法を凌駕し,最先端セグメンテーションモデルを大幅に改善する。
MHRGait:運動エネルギーに基づく人体骨格姿勢からの歩行認識 [cs.CL, cs.CL, cs.CV]目的:歩行認識のための人体骨格姿勢表現
- 歩行は生体認証の一形態として重要であり,セキュリティや医療分野での応用が期待される。
- 従来の歩行認識は,服装や体格などの影響を受けやすく,ロバスト性に課題があった。
- 運動エネルギーに基づく人体骨格姿勢表現を用いて,よりロバストな歩行認識を実現する。
- 提案手法MHRGaitは,既存のモデルベース手法と比較して,CCPGおよびSUSTech1Kベンチマークで最高の性能を達成した。
- MHRGaitは,データセット間での転移性能にも優れ,軽量なモデルで高い認識精度を実現した。
- MHRGait++は,シルエット情報との融合により,認識精度と計算効率のバランスを改善した。
音楽基盤モデルは音高を螺旋構造に埋め込むか? [cs.CY, cs.SD]目的:音楽基盤モデルにおける音高情報の表現構造の解明
- 音楽理解の高度化には,モデル内部表現の理解が不可欠である。
- 音楽基盤モデルの内部メカニズムはブラックボックスであり,解明が求められている。
- 音高情報の表現構造を明らかにすることで,モデルの音楽理解能力向上に貢献する。
- 訓練済みの音楽基盤モデルに単音を入力し,主成分分析を行った結果,表現が螺旋構造を形成することが明らかになった。
- この螺旋構造は音高のオクターブ周期性を反映しており,モデルが音高をどのように認識しているかを示唆する。
- 螺旋構造の明確さや形状は,モデルの種類や入力信号の音響特性によって変化することが確認された。
StraightDP:整流フロー変圧器のための幾何学的認識型差分プライバシー [cs.LG, cs.CR, cs.CV]目的:テキスト条件付き生成モデルの差分プライバシー保護訓練におけるユーティリティ低下の改善
- 生成モデルは多様な応用を持つが,プライバシー保護とモデル性能の両立が課題である。
- 差分プライバシー保護訓練は,強力なプライバシー設定下でモデル性能が著しく低下する。
- 整流フローの幾何学的特性を利用し,プライバシー保護とモデル性能のトレードオフを改善する。
- MNISTデータセットにおいて,StraightDPは,従来のDP-SGDと比較して高い精度とFIDスコアを達成した。
- 特に,公開された潜在空間においては,精度0.81,FIDスコア56という結果が得られた。
- 本手法は,SD3-mediumなどの事前学習済みモデルにも適用可能であり,DP-LoRAよりも効率的にプライバシー保護を実現する。
一枚の画像からの衣服を意識したガウスアバター生成 [cs.RO, cs.IR, cs.CV]目的:一枚の画像からの衣服を意識した3次元ガウスアバターの再構成
- 仮想試着やバーチャルファッションなど,3次元アバターの需要が高まっている。
- 特に衣服など,体への追従が緩い形状の正確な再構成が困難である。
- 衣服の形状と動きをより忠実に再現できるアバター生成を目指す。
- Forwardrobeは,ガウス空間で衣服と身体を分離し,衣服層に連続性を意識した幾何学構造とスキニング初期化,姿勢に応じた非剛体変形,外観適応を導入する。
- これにより,スカートやドレスなど,衣服の再構成とアニメーション時の視覚品質が向上する。
- 分離された衣服層は独立して制御可能な3次元アセットとなり,衣服編集,転送,バーチャル試着を可能にする。
