arXiv雑要約

画像・音声 - 2026/08/04 公開

  • 軌跡生成によるピクセル空間でのインタラクション学習:Traj-VLN [cs.CV, cs.RO]目的:ピクセル空間における自律回帰的軌跡生成を通じたナビゲーションインタラクション学習
    • 視覚と言語を組み合わせたナビゲーションは,ロボット工学や拡張現実における重要な課題であり,現実世界での応用が期待される。
    • 既存のビジョン言語モデルは,RGB画像での学習が中心であり,奥行き情報や3D空間でのインタラクションが苦手である。
    • ピクセル空間での軌跡生成を通じて,VLNにおける空間的インタラクション能力を向上させることを目指す。
    • 大規模言語モデルの持つ事前知識と常識推論能力を活用し,視覚埋め込みを言語空間に投影する手法がVLN-CEにおいて主流になっている。
    • 提案手法では,VLNタスクを指示文に対応する3D空間インタラクションのサブタスクのシーケンスとして捉え,ピクセル空間での自律回帰的軌跡生成によってナビゲーションインタラクションを学習する。
    • ピクセル空間での軌跡の教師あり学習が,従来の離散行動学習やピクセル目標の教師あり学習を上回り,VLNの性能を大幅に向上させることを示した。

    Link: https://arxiv.org/abs/2607.10744

  • HyperGS:高速かつ汎用的なガウス動画表現 [eess.SY, cs.SY, cs.CV]目的:ガウス動画表現の高速化と汎用性向上
    • 動画表現は,様々な応用において重要な役割を担う。
    • 既存のガウススプラッティングは動画ごとに最適化が必要で,処理速度が遅く汎用性に課題がある。
    • 動画からのガウス表現を直接予測することで,最適化を回避し,高速化と汎用性を実現する。
    • HyperGSは,従来のガウス最適化と比較して,エンコード速度が10^4〜10^5倍向上する。
    • HyperGSは,学習データに含まれない動画に対しても高い汎用性を示す。
    • K400,SSv2,UCF101データセットにおいて,PSNRが2.9〜3.1dB向上し,動画表現サイズも小さく抑えられた。

    Link: https://arxiv.org/abs/2607.11500

  • JADE-GS:イベントアシスト3Dガウススプラッティングにおけるデブラーリング証拠の同時割当 [cs.CV]目的:イベントカメラと従来の画像を用いた3Dシーン再構成におけるデブラーリング証拠の最適な組み合わせ
    • 近年,ニューラルレンダリング技術が発展し,高画質な3Dシーンの表現が可能となった。
    • 動体ぼけは,従来のレンダリング手法の前提条件を崩し,再構成の精度を低下させる問題がある。
    • イベントカメラの情報を活用し,動体ぼけの影響を軽減することで,より高精度な3D再構成を目指す。
    • 提案手法JADE-GSは,フレームとイベントストリームから空間的な証拠割当を予測する軽量なSpatial Prior Routerを導入した。
    • これにより,既存の復元手法の弱点を補完し,より高品質な再構成を実現した。
    • ベンチマークテストにおいて,JADE-GSは知覚的な品質と再現性において優れた性能を示し,低い学習コストで高い性能を発揮した。

    Link: https://arxiv.org/abs/2607.14990

  • IoU-PD:マルチモーダル大規模言語モデルによる視覚的言及定位のためのIoUを意識した特権的知識蒸留 [cs.CV]目的:視覚的言及定位における性能向上
    • 画像とテキストを入力とし,対象物体を特定する技術であり,ロボット工学や画像検索に応用が期待される。
    • 既存手法では,学習時と評価時で評価指標にずれが生じ,性能向上が課題となっていた。
    • 学習時に正解のバウンディングボックス情報を活用し,モデルの精度とロバスト性を高めることを目指す。
    • IoU-PDは,学習時に正解のボックス情報を特権的なガイダンスとして利用することで,既存の座標生成ベースラインと比較して一貫した性能向上を示した。
    • 正解ボックスは座標ラベルとして機能するだけでなく,モデルの学習に有用な特権的ガイダンスとなり得ることを実証した。
    • 推論時には,追加のボックスオーバーレイやヒント,教師ブランチ,予測モジュールを必要としない。

    Link: https://arxiv.org/abs/2607.15732

  • ベクトル量子化のための分布一致:統一的な理論的・実験的フレームワーク [cs.CL, cs.CV]目的:ベクトル量子化における分布不一致の問題解決
    • 近年の画像表現学習や自己回帰モデルにおいて,ベクトル量子化は重要な役割を担っている。
    • 既存のベクトル量子化手法では,勾配不一致やコードブックの崩壊といった学習不安定性の問題が生じやすい。
    • 特徴ベクトルとコードベクトルの分布を一致させることで,学習の安定化と情報損失の軽減を目指す。
    • 特徴ベクトルとコードベクトルの分布間の不一致が,学習不安定性とコードブック崩壊の根本原因であることを示した。
    • 分布一致に基づくフレームワークを提案し,Wasserstein距離や最大平均不一致を用いた客観関数が有効であることを理論的・実験的に示した。
    • 提案手法は,画像トークン化のベンチマークにおいて,高い性能と安定性を示すことが確認された。

    Link: https://arxiv.org/abs/2607.15933

  • 予測された皮質はドメイン汎用的な事前知識ではない:ビデオ記憶想起のための脳エンコーディング特徴の適合コントロールによる監査 [cs.CV, cs.AI, cs.LG]目的:短編ビデオの記憶想起予測における脳エンコーディングモデルの予測応答の有用性の評価
    • 脳科学と機械学習の融合は,脳機能の理解とAIモデルの高度化に貢献する重要な分野である。
    • 脳エンコーディングモデルの予測性能は向上しているものの,その汎用性や人間行動との関連性は未解明な点が多い。
    • データセットに依存した予測性能の差を明らかにし,脳由来特徴量の有用性を検証すること。
    • Memento10kデータセットでは,脳投影を用いないV-JEPA2バックボーンの方が優れた予測性能を示した。
    • VideoMemデータセットでは,脳投影を用いた特徴量がV-JEPA2バックボーンを上回る予測性能を示した。
    • データセット間の相互作用が有意であり,脳由来の特徴量は特定のデータセットにおいてのみ有用であることが示された。

    Link: https://arxiv.org/abs/2607.16292

  • クロスブランチ衝突による保護:統一マルチモーダル画像編集における顔識別情報の保護 [cs.CV, cs.CL, cs.CR]目的:顔識別情報の不正編集からの保護
    • 画像編集技術の進歩は,個人のプライバシー侵害のリスクを高めている。
    • 既存の保護手法は,単一の視覚ブランチに焦点を当てており,効果が限定的である。
    • 複数のブランチに矛盾を導入することで,顔識別情報の復元を困難にすることを目指す。
    • 本研究では,統一マルチモーダルモデルにおける理解と生成のブランチ間の構造的合意が,画像編集の成功に密接に関連していることを示した。
    • 提案手法CCSは,ViTとVAEの両方の表現を,元の状態から遠ざけることで,信頼性の高い顔識別情報を劣化させる。
    • さらに,CCSは,ブランチ間の構造的整合性を破壊し,顔識別情報の復元を効果的に抑制することが実験的に示された。

    Link: https://arxiv.org/abs/2607.16898

  • 機械にとって地図は依然として重要か:基盤モデルにおける地図の役割の再検討 [cs.AI, cs.CV]目的:基盤モデルにおける空間理解のための地図の有効性
    • 地理情報は社会の様々な問題を解決するために不可欠であり,その理解は重要である。
    • 基盤モデルが構造化された地理データを直接処理できるようになった今,地図の有用性が低下している可能性が懸念される。
    • 基盤モデルの空間理解において,地図が依然として有効な外部表現であるかを検証する。
    • 実験により,地図は空間推論を大幅に改善することが示され,特に象徴的なデータと組み合わせて使用する場合に効果が高かった。
    • 地図の種類,色相,空間構造などの要素が,モデルの性能に影響を与えることが明らかになった。
    • データと地図を組み合わせることで,最も優れた性能が得られ,地図が基盤モデルの空間推論にとって依然として価値のあるツールであることが示された。

    Link: https://arxiv.org/abs/2607.17999

  • mmSimPrior:データ効率と汎化性能の高いリアルワールドにおけるレーダーベースの人体動作再構成のためのシミュレーション事前知識の学習 [cs.CV]目的:データ効率と汎化性能の向上
    • プライバシー保護と照明条件へのロバスト性が求められる人体動作再構成において,レーダー技術は重要な役割を果たす。
    • 実世界のレーダーデータと動作データのペアを大量に収集することはコストがかかる。
    • シミュレーションと実世界のギャップを埋め,少ない実データでも高精度な再構成を実現する。
    • mmSimPriorは,信号,動作,レーダーから動作へのマッピングに関する事前知識を分離し,学習することで汎化性能を高める。
    • 24組のペア実データのみで,既存のベースラインと比較してMPJPEを24.7〜39.0%削減する。
    • ファインチューニングなしで,ゼロショットMPJPEを8.5%削減し,高い汎化性能を示す。

    Link: https://arxiv.org/abs/2607.22973

  • OmniScope:マルチモーダル大規模言語モデルのためのモダリティ非依存型トークン圧縮 [cs.CV]目的:マルチモーダル大規模言語モデルにおけるトークン圧縮手法
    • マルチモーダルAIの発展に伴い,効率的な推論が不可欠となっている。
    • 既存手法はモダリティ間の関連性のずれを考慮せず,重要な情報を失う可能性がある。
    • クエリを共通のセマンティックアンカーとし,各モダリティの関連性を独立に評価する。
    • OmniScopeは,既存の圧縮手法と比較して,全ての圧縮設定で最も高い平均精度を達成した。
    • 全体のトークン保持率25%において,最大3.53倍のプリフィル速度向上と15%以上のGPUメモリ削減を実現した。
    • 平均精度はわずか0.35ポイントの低下にとどまり,効率性と精度の両立を示唆している。

    Link: https://arxiv.org/abs/2607.23193

  • WaveZip:ビデオトークン凝縮のためのウェーブレット駆動空間時間分離 [cs.CV]目的:長編ビデオ理解における視覚トークンの計算コスト削減
    • 大規模視覚言語モデルの発展に伴い,長編ビデオの効率的な処理が課題となっている。
    • 既存手法では,空間特徴量ドメインでのトークン圧縮に留まり,構造的文脈や意味的詳細の分離が困難である。
    • ウェーブレット変換を利用し,時間的冗長性と空間的顕著性を分離することで効率的な処理を実現する。
    • WaveZipは,離散ウェーブレット変換を用いて,時間的および空間的な信号を分離するフレームワークである。
    • 10倍の圧縮率で性能の99.6%を維持し,最先端手法を上回る結果が得られた。
    • タスク固有の学習を必要とせず,既存の大規模視覚言語モデルに容易に組み込むことができる。

    Link: https://arxiv.org/abs/2607.23265

  • 弱教師ありインスタンスレベルのグリーソンパターン推定:プライマリおよびセカンダリラベルの利用 [cs.CV]目的:グリーソンパターンのインスタンスレベル推定
    • 前立腺癌の病理診断において,グリーソンパターンは重要な指標である。
    • インスタンスレベルのグリーソンパターン注釈が不足しており,パッチレベル学習が困難である。
    • スライドレベルのラベルからインスタンスレベルのグリーソンパターンを推定する手法を開発する。
    • 提案手法は,臨床的定義に基づきインスタンス予測を集約し,グリーソンパターンの優位性を明示的にモデル化する。
    • SICAP-MILデータセットにおいて,既存のMILアプローチを上回る有効性が確認された。
    • スライドレベルラベルのみを利用したインスタンスレベル学習を効果的に行うことが示された。

    Link: https://arxiv.org/abs/2607.23594

  • GeoStereo:不一致と表面法線推定のための統一ステレオ幾何推定フレームワーク [cs.CV]目的:不一致と表面法線の同時推定
    • 3次元視覚において,ステレオマッチングと表面法線推定は基本的なタスクであり,様々な応用を可能にする。
    • 既存のステレオ法は,特に困難な領域において,強い幾何学的制約の欠如により,信頼性の高い予測が困難である。
    • 拡散事前情報を用いた統一フレームワークにより,困難な領域における不一致推定の精度向上を目指す。
    • GeoStereoは,不一致推定と表面法線推定を同時に行うことで,互いに補完し合い,性能向上を実現した。
    • 提案手法は,低照度環境や反射面,透明物体といった困難な条件下でも高い性能を示すことが実験的に確認された。
    • KITTIやNYUv2などのベンチマークにおいて,ゼロショット設定で最先端の不一致推定精度と,iBims-1やScanNetなどの屋内ベンチマークで最高水準の法線推定精度を達成した。

    Link: https://arxiv.org/abs/2607.24024

  • DreamStyle3D:デュアルアテンション分離による効率的な3D様式化アセット生成 [cs.CV]目的:効率的な3D様式化アセット生成
    • ゲーム,アニメーション,VR産業の発展に伴い,3Dアセットの効率的な生成が求められている。
    • 既存手法は,様式と幾何学の一貫性,生成効率を両立できていない。
    • 3D様式化において,様式と幾何学を明示的に分離し,効率的な生成を目指す。
    • DreamStyle3Dは,デュアルクロスアテンション機構を用いて,高忠実度で幾何学的に一貫性のある様式化された3Dアセットを10秒以内に生成できる。
    • 本手法は,様式と幾何学的特徴を分離することで,構造的一貫性を維持しながら効率的なスタイル注入を可能にする。
    • 15Kのコンテンツ・スタイル・様式化された三つ組からなるデータセットを構築し,学習と評価に活用した。

    Link: https://arxiv.org/abs/2607.24721

  • フォトグラメトリ的再構成におけるトラック・リーケージフリー ホールドアウト自己検証:プロトコル,感度,限界 [cs.CV, cs.RO]目的:フォトグラメトリ的再構成の信頼性評価手法の開発
    • 測量技術は,インフラ点検や都市モデリング等,様々な分野で不可欠である。
    • 再構成の精度は外部測量に依存しており,自動検査における客観的な評価が課題である。
    • 外部測量なしで再構成自体の信頼性を評価する手法を確立すること。
    • 提案手法は,再構成の内部幾何学的整合性を評価できることが示された。
    • 良好な再構成に対してはほぼ完璧な自己整合性スコアが得られる一方で,精度そのものを測定することはできない。
    • 一貫した歪みを含む再構成は検出されない場合があり,信頼性評価の限界が示された。

    Link: https://arxiv.org/abs/2607.24852

  • 不確実性から決定論へ:レイマッチングなしの粗精細な視覚的フロアプラン位置特定 [cs.CE, cs.RO, cs.CV]目的:視覚的フロアプラン位置特定における高精度化
    • 屋内ナビゲーションやロボティクスにおいて,正確な位置把握は不可欠な技術である。
    • 視覚情報とフロアプランの不一致や,屋内環境の反復構造が位置特定を困難にしている。
    • レイマッチングに頼らず,不確実性から決定論へと進むことで位置特定精度を向上させる。
    • 本研究では,画像に基づいた姿勢拡散モデルを用いて,複数の候補位置の可能性を効率的に絞り込む。
    • 候補位置中心のフロアプラン画像から,サブメートル単位の姿勢残差を予測する局所化されたリファイナーを提案した。
    • S3DおよびZInDのベンチマークにおいて,最先端の精度とロバスト性を実証した。

    Link: https://arxiv.org/abs/2607.26817

  • 周波数強制:スペクトル自己固定化による長尺動画の自己回帰的生成 [cs.CV]目的:長尺動画生成におけるエラー蓄積の軽減
    • 動画生成技術は,エンターテイメントやコミュニケーションにおいて重要な役割を担う。
    • 自己回帰型動画拡散モデルでは,長尺生成時にエラーが蓄積し,画質の劣化を引き起こす。
    • スペクトル自己固定化により,低周波数のエネルギー変動を抑制し,長尺動画の安定性を高める。
    • 本研究では,エラー蓄積が低周波数帯域のエネルギー変動として現れることを周波数領域から分析した。
    • 提案手法FreqForcingは,学習不要でありながら,既存手法よりも優れた性能を発揮する。
    • 5秒のクリップで事前学習したモデルを,2分間の生成に24倍拡張することに成功した。

    Link: https://arxiv.org/abs/2607.27110

  • OVEarth-Bench:オープンボキャブラリー地球観測におけるカテゴリの幅広さとクエリの多様性の評価 [cs.CV]目的:オープンボキャブラリー地球観測の評価基準
    • 地球観測は,環境変化の監視や災害対応など,社会課題解決に不可欠である。
    • 既存の評価基準は,対象カテゴリやクエリの種類が限定的で,汎用性に欠ける。
    • カテゴリの幅広さとクエリの多様性を考慮した,より現実的な評価基準を構築する。
    • 既存手法の性能は限定的であり,カテゴリの幅広さがモデルのランキング安定性に影響する。
    • 大規模言語モデル(MLLM)に基づく手法が最も優れた全体的な性能を示した。
    • 地球観測特化型手法は,汎用モデルと比較して性能が劣ることが示された。

    Link: https://arxiv.org/abs/2607.27278

  • MMOOC:マルチモーダル大規模言語モデルにおける文脈外評価のための包括的ベンチマーク [cs.CV]目的:マルチモーダル大規模言語モデルの文脈外評価に関するベンチマーク
    • 近年,マルチモーダル大規模言語モデルが発展しているが,文脈の変化に対する頑健性が課題である。
    • 既存のベンチマークは,文脈外質問か視覚的に回答不能な質問に偏っており,回答可能な文脈内質問の評価が不十分である。
    • 文脈の変化に対応できるモデルの拒否能力と堅牢な回答能力を評価するベンチマークの提供。
    • MMOOCは,41Kを超える画像と質問のペアを含む大規模なベンチマークである。
    • 実験の結果,現在のモデルは,文脈が変化した場合に,回答可能性と拒否のバランスを取るのが難しいことが示された。
    • 事後学習によって,モデルの頑健性を向上させることが可能であることが示された。

    Link: https://arxiv.org/abs/2607.27637

  • ワンパッチで十分:MLLMベースのシーンテキスト検出のための強化学習による視覚トークン接地 [cs.CL, cs.CV]目的:シーンテキスト検出における,テキスト認識と空間局在化の間の高精度なアライメント
    • シーンテキスト検出は,自動運転やロボット工学など,多様な応用分野において不可欠な技術である。
    • 既存の多パッチアプローチは,特に高密度または小規模なテキストインスタンスにおいて,冗長なノイズと局在化の曖昧さを引き起こす。
    • 単一のアンカー視覚トークンを用いてテキストをルーティングし,画像全体を精緻化することで,ノイズと曖昧さを軽減し,検出精度を向上させる。
    • 提案手法SPaTSは,最先端のクローズドソースMLLMおよびOCR MLLMと比較して,一貫して優れた性能を示すことが実証された。
    • 強化学習フレームワークSPaSOにより,オラクルラベルなしでアンカーを正確に識別することが可能となった。
    • Directional Embedding AlignmentとPatch-Enhanced Decodingにより,表現のロバスト性と局在化精度が向上した。

    Link: https://arxiv.org/abs/2607.27902

  • TARS:3Dフリー動画リシューティングのためのタイムステップ依存データスケーリング [cs.CV]目的:テキスト駆動型セマンティック視点指定による動画リシューティング
    • 動画生成において,制御可能なカメラモーションと視点変化は重要な課題である。
    • 既存手法は3D事前知識に依存するため,再構成品質や未知領域の合成に課題がある。
    • ペアデータや3D再構成を必要とせず,カメラダイナミクスと視覚表現を学習する。
    • TARSは,3D情報を利用せずに動画のリシューティングを実現する新しいパラダイムである。
    • タイムステップごとの感度分析から,カメラモーションはノイズの多い初期段階で形成されることが明らかになった。
    • 実験により,TARSは既存手法よりも正確かつ時間的に一貫性のあるカメラ制御が可能であることが示された。

    Link: https://arxiv.org/abs/2607.28261

  • ObjectStream:ストリーミングビデオ理解のための潜在オブジェクトをメモリアンカーとして [cs.DC, cs.CV, cs.AI]目的:ストリーミングビデオ理解におけるメモリアンカーとしての潜在オブジェクト
    • ビデオ理解は,AI技術の発展に伴い,様々な応用分野で重要性が増している。
    • 長時間のストリーミングビデオを効率的に処理するためには,メモリ使用量の抑制が課題となる。
    • 潜在オブジェクトをメモリアンカーとして活用することで,効率的なメモリ管理と高性能なビデオ理解を目指す。
    • ObjectStreamは,既存のVideo-LLM表現から潜在オブジェクトを抽出し,フレーム間で持続的なアンカーとしてリンクさせる。
    • OVO-Bench Real-Time Visual Perceptionにおいて,Qwen2.5-VL-7Bの性能を約10ポイント向上させ,GPUメモリ使用量とTTFTを約50%削減した。
    • オフラインの長尺ビデオベンチマークでは,82.5%のビジュアルトークンを破棄しながら,フルトークンベースラインを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.28312

  • 大規模基盤モデルの時代における手と物体の相互作用:再構成,生成,および具現化された転移 [cs.CV]目的:手と物体の相互作用に関する基盤モデルの事前知識の体系的レビュー
    • 手と物体の相互作用は,ロボット工学やコンピュータビジョンの発展に不可欠な要素である。
    • 従来の技術では,視覚的な不確実性や複雑な要素の同時推論が課題となっていた。
    • 基盤モデルの活用により,これらの課題を克服し,より汎用的なシステムを構築することを目指す。
    • 本調査では,手と物体の相互作用タスクにおける基盤モデルの事前知識を体系的に分類し,その影響を分析した。
    • 事前知識は,形状,意味,視覚の3つのファミリーに分類され,それぞれの注入方法と適応方法が検討された。
    • また,手と物体の相互作用から得られた知識が,ロボット学習におけるデータ生成やスキル転移に活用される可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28394

  • ニシモリ温度における疎グラフ上の Kohn-Sham スペクトル埋め込み:画像分類への応用 [cs.LG, cs.CV, cs.IT, math.IT]目的:画像分類のための Kohn-Sham スペクトル埋め込み(KSSE)の提案
    • 深層学習は画像認識において高い性能を示すが,大規模モデルによる計算コストが課題である。
    • 従来の畳み込みニューラルネットワークは,パラメータ数が多く,計算資源を消費する傾向がある。
    • 疎グラフを用いたスペクトル埋め込みにより,計算効率を維持しつつ高い分類精度を実現することを目指す。
    • KSSEは,ImageNet-1000データセットにおいて,88.93%のTop-1精度を達成した。
    • Swin-LやViT-H/14といった大規模モデルを凌駕しつつ,パラメータ数を大幅に削減することに成功した。
    • 理論的な枠組みを確立し,信念伝播と正則化ラプラシアンの関係性やフラストレーションの解析を行った。

    Link: https://arxiv.org/abs/2607.28428

  • SCMA:構造と金属を考慮したフローマッチングによるCT金属アーチファクト軽減 [cs.CV, cs.AI]目的:CT金属アーチファクトの軽減
    • CT画像診断において,金属によるアーチファクトは画質劣化の大きな原因となる。
    • 既存のアーチファクト軽減手法は,残存アーチファクトや解像度の低下,汎化性能の低さなどの課題がある。
    • サンプル固有の構造と金属の影響を考慮したフローマッチングにより,より高精度なアーチファクト軽減を目指す。
    • 提案手法SCMAは,シミュレーションおよび実際のCTデータにおいて,代表的なアーチファクト軽減手法よりも効果的に金属アーチファクトを抑制した。
    • SCMAは,局所的な解剖学的構造をより良く保持し,投影データと一貫性のない構造の出現を抑制した。
    • 構造条件と金属情報を考慮することで,アーチファクト軽減と解剖学的構造の保全を両立している。

    Link: https://arxiv.org/abs/2607.28759

  • K空間署名:医療用ディープフェイク検出のための周波数領域表現学習 [cs.CV]目的:医療用ディープフェイクの検出
    • 医療画像診断の信頼性確保は,患者の生命に関わるため,極めて重要である。
    • 生成モデルの悪用により,偽造された医療画像(ディープフェイク)が出現し始めている。
    • 周波数領域における特徴量を利用し,ディープフェイクを高い精度で検出することを目的とする。
    • 提案手法(KSSと3D MLP-Mixer)は,複数の生成モデルによるデータセットで99%を超える精度とROC-AUCを達成した。
    • 未知の画像取得装置からのデータに対しても,高い識別能力(精度93%まで)を示すゼロショット汎化性能を実証した。
    • 本研究の成果は,医療画像データの信頼性を高め,悪意のある改ざんから公衆衛生を守ることに貢献する。

    Link: https://arxiv.org/abs/2607.29541

  • 生体超音波コンピューテッドトモグラフィーのためのニューラルBorn級数演算子 [eess.IV, cs.CV, cs.LG]目的:生体超音波コンピューテッドトモグラフィーにおける組織特性再構成の効率化
    • 臨床画像診断において,放射線被ばくの少ない高分解能な画像取得が求められている。
    • 組織特性再構成に必要な全波形反転法は計算負荷が高く,臨床応用が限定されている。
    • ニューラルBorn級数演算子を用いて波形シミュレーションを高速化し,USCTの実用化を目指す。
    • ニューラルBorn級数演算子は,脳および乳房データセットのシミュレーションにおいて,高い精度と効率性を示した。
    • 本手法は,前方シミュレーションと画像再構成の両方で有効であることが確認された。
    • この成果は,リアルタイムに近いUSCT再構成の可能性を示し,臨床応用の実現に貢献する。

    Link: https://arxiv.org/abs/2312.15575

  • 勾配ベースによるモジュレーション効果の最適化 [math.OC, cs.SY, eess.SY, quant-ph, cs.SY, eess.SY, eess.AS, cs.LG, cs.SD]目的:モジュレーション効果の最適化手法
    • ギター等の楽器演奏において,モジュレーション効果は不可欠な要素である。
    • 既存手法は,効果の種類が限定的,または計算コストが高いという課題がある。
    • 微分可能なデジタル信号処理に基づき,低遅延なモジュレーション効果のモデル化を目指す。
    • 損失関数の低周波重み付けにより,遅延時間の学習時の局所最小値への収束が回避できる。
    • モデルからの音響出力は,アナログエフェクトユニットと聴覚的に区別できない場合がある。
    • 長遅延時間やフィードバックを持つエフェクトには,依然として課題が残る。

    Link: https://arxiv.org/abs/2601.04867

  • 厚生最大化決定の安定化:内生的な移転によるアプローチ [econ.TH, cs.GT]目的:自己利益追求型エージェントによる集団意思決定における安定性と効率性の実現
    • 多エージェントシステムにおいて,集団意思決定は不可欠であり,社会全体の効率性に大きな影響を与える。
    • 自己利益型エージェント間の利害対立により,合意形成が難しく,不安定な状態に陥る可能性がある。
    • 結果に応じた移転メカニズムを導入し,効率的な協調と安定的な意思決定を可能にすること。
    • コンセンサスルール下では,個々の合理性と強いナッシュ均衡が常に存在し,実現可能な移転を通じて厚生最大化を達成できる。
    • 匿名性,単調性,決意性を持つより一般的なルールでは,脱落インセンティブの必要条件を特定し,不安定な連合の可能性を制限する。
    • 移転可能な効用を用いることで,コアのような安定性を実現し,効率性と予算均衡を回復することができる。

    Link: https://arxiv.org/abs/2601.15563

  • 4つ以上の場所におけるより迅速な対称的待ち合わせ [math.OC, cs.GT]目的:対称的待ち合わせ問題における期待待ち合わせ時間の最小化
    • 待ち合わせ問題は,分散システムや通信ネットワークにおいて重要な課題である。
    • 従来の手法では,場所数が増えるほど待ち合わせ時間が長くなる可能性がある。
    • 場所数が4つ以上の状況下で,より効率的な待ち合わせ戦略を開発すること。
    • 場所数が4つ以上の有限のnに対して,Anderson-Weber戦略を改善する対称戦略を構成した。
    • この改善戦略は,非ホーム地点の巡回間に注意深く選択された相関を導入することにより実現される。
    • 場所数nが5以上のとき,期待改善の下限として,$\frac{483(1-\theta)^6}{(n-1)^8}$が得られた。

    Link: https://arxiv.org/abs/2604.02058

  • WanSong v1.0 技術報告 [math.CO, cs.DM, eess.AS, cs.CV]目的:長尺楽曲の生成
    • 音楽生成AIは産業界で注目されており,高品質な生成が求められている。
    • 長尺かつ制御可能な高音質音楽を効率的に生成することは困難である。
    • 高品質で制御可能な長尺楽曲を生成する手法を開発すること。
    • WanSongは,最長5分間の高品質な多言語楽曲を,ボーカルと伴奏の2つのステムで一括生成する拡散モデルである。
    • 自己回帰モデルやカスケード型パイプラインと比較して,シンプルかつ強力なアプローチを実現している。
    • ステップ蒸留により推論速度を向上させ,ファインチューニングによるカスタマイズも容易である。

    Link: https://arxiv.org/abs/2607.14749

  • 声の幾何学的限界とプロの声優におけるクローン音声の帰属問題 [eess.AS, cs.SD]目的:プロの声優の音声クローンによる不正利用の検出と対策
    • 声優の音声は重要な資産であり,AIクローン技術の進化がその保護を必要とする。
    • 既存の音声認証技術は,声優の多様な演技スタイルや音声データの飽和により,誤識別が発生しやすい。
    • 音声クローン技術の不正利用を防ぐため,よりロバストな音声帰属判定手法の開発を目指す。
    • 声優1,168名の音声データを用いて実験した結果,従来の技術では依然として高い誤識別率が残存する。
    • 特に,声優の音声データの幾何学的構造に起因する限界が,誤識別の主要因であることが明らかになった。
    • 声優の音声で学習したエンコーダを使用することで誤識別率は低下するが,完全に除去することはできない。信頼性の高いクローン音声の帰属判定には,より高度な技術が必要である。

    Link: https://arxiv.org/abs/2607.15694

  • 体積保存変形群上のヴァコノミック流体 [math-ph, cs.GR, cs.NA, math.DG, math.DS, math.MP, math.NA, physics.flu-dyn]目的:非圧縮性オイラー方程式の離散化手法
    • 流体シミュレーションは,気象予測や航空力学など,様々な科学技術分野で不可欠である。
    • 体積保存変形群を用いた離散化では,非ホロノミック制約の扱いが課題となっていた。
    • ヴァコノミックな視点を取り入れ,安定性と物理的リアリズムを向上させる。
    • 本研究では,ヴァコノミックな視点に基づき,離散化された流体軌跡が(部分)リーマン多様体上の測地線となることを示した。
    • その結果,カシミール不変量の機械精度での保存とケルビン循環定理の離散的な類似性が確認された。
    • 低解像度においても安定した挙動を示し,長期的なロバスト性と物理的リアリズムの向上に貢献する。

    Link: https://arxiv.org/abs/2607.18312

  • MoPET:統一された医療画像分類のためのパラメータ効率的な混合エキスパートモデル [eess.IV, cs.CV, cs.LG]目的:医療画像の分類における,パラメータ効率的な混合エキスパートモデルの開発
    • 医療画像は多様性が高く,正確な診断には高い性能が求められるため,深層学習の応用が重要である。
    • 限られた医療データでは過学習が起こりやすく,また,タスクごとに個別のモデルを学習すると汎化性能が低下する可能性がある。
    • 異なるドメインのデータセットを統合的に学習し,汎化性能と精度を両立させることを目指す。
    • パラメータ効率的なファインチューニング(PEFT)は,完全なネットワーク更新よりも高い精度を達成することが示された(平均精度86.50%から88.97%へ)。
    • MoPETモデルは,4つの異質なデータセットを統合し,個別のPEFTアダプターよりも高い精度を達成した(平均精度93.46%対92.83%)。
    • 補助データセットとの共同学習により,データ制約のある臨床ターゲットにおける精度が向上した(平均ターゲット精度81.58%から83.58%へ)。

    Link: https://arxiv.org/abs/2607.29462