arXiv雑要約

画像・音声 - 2026/07/31 公開

  • SPFM-Net:意味的事前知識と周波数制約を用いたMambaによる不可視ウォーターマーク攻撃 [cs.CV]目的:不可視ウォーターマークの除去
    • デジタルコンテンツの保護において,ウォーターマークは重要な役割を果たす。
    • 既存の手法では,長距離依存性の捉えにくさから,除去性能と画質のバランスが課題である。
    • 意味的事前知識と周波数制約により,長距離依存性を捉え,高精度な除去を目指す。
    • SPFM-Netは,高比率マスキングとMasked Autoencoderを用いて,ウォーターマーク信号の空間的 coherence を破壊し,意味的に一貫性のある画像を再構築する。
    • Multi-scale Residual Frequency Feature Interactionモジュールにより,ウォーターマークに関連する残差特徴を多段階で集約し,不要な領域の応答を抑制する。
    • 軽量なMambaベースのGSFMユニットは,ウォーターマーク特徴と自然画像コンテンツを分離し,残存するウォーターマーク痕跡を抑制する。実験により,優れた除去性能と知覚品質が確認された。

    Link: https://arxiv.org/abs/2607.27811

  • 逆転予約論理:スケーラブルな参入下における局所的配分における最適な保留 [cs.GT, econ.TH]目的:希少機会における意図された利用者の期待効用最大化
    • 自動化された参加者がアカウントを作成し,意図された利用者の能力を超えるコミットメントを維持する状況が重要である。
    • アカウント数が信頼できない場合,既存のスクリーニングルールでは,参入者の模倣を適切に識別できない。
    • 上尾の保留戦略により,参入を抑制しつつ,意図された利用者の余剰を最大化することを試みる。
    • 最適なルールは,低い混雑時には払い戻しと割り当てを行い,中程度の混雑時には保留と割り当てを行う。
    • 強い競合他社が存在する場合,割り当てを保留することで,参入者の模倣を抑制し,意図された利用者の利益を保護する。
    • このルールは,完全なコミットメントと参入者の不参入を伴う均衡を支持する。

    Link: https://arxiv.org/abs/2607.27817

  • ハルシネーションは接地署名を残す:検証者誘導デコーディングによる選択的オブジェクト修正 [cs.CV]目的:大規模ビジョン言語モデルにおけるハルシネーションの軽減と,正確なオブジェクト情報の保持
    • 画像とテキストを理解するAIモデルの性能向上は,様々な応用において不可欠である。
    • 既存手法では,どのオブジェクトがハルシネーションであるかを正確に診断することが難しく,過剰な修正を引き起こす可能性がある。
    • 生成時に各オブジェクト言及の信頼性を評価し,選択的にハルシネーションを軽減することで,より自然な応答を目指す。
    • 提案手法VGDは,ハルシネーションのリスクが高いオブジェクト言及のみに介入することで,ハルシネーションを効果的に削減する。
    • 実験の結果,VGDはAMBER-G CHAIRにおいてハルシネーションを43.6%削減し,CHAIR-MSCOCO CHAIR$_i$/CHAIR$_s$ではそれぞれ37.0%/30.4%削減することに成功した。
    • VGDは,正確なオブジェクト情報を保持しつつ,キャプションの短縮化を防ぐことが示された。

    Link: https://arxiv.org/abs/2607.27823

  • 手話質疑応答:手話理解のための新たなタスク,ベンチマーク,およびベースライン [cs.AI, cs.CV]目的:手話動画に対する自然言語による質問応答能力の評価
    • 手話理解技術は,手話通訳や検索など,コミュニケーション支援に不可欠である。
    • 既存の手話理解タスクは,固定的な変換に偏り,意味理解の深さを測れない。
    • 手話動画の内容をより柔軟かつ包括的に理解できる評価手法を確立する。
    • 新たなタスクである手話質疑応答(SLQA)を提案し,手話動画の意味理解能力を評価するフレームワークを構築した。
    • PHOENIX14TとCSL-Dailyを基盤とした2つのベンチマークSignQAを構築し,質問と回答のペアを自動生成した。
    • 質問条件に基づいた時系列ダウンサンプリングモジュールとドメイン知識転移戦略を導入したベースラインモデルが,既存のモデルを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27826

  • CrowdioSetとPaRIRset:ライブ音楽ソース分離に向けた2つのデータセット [cs.SD, eess.AS]目的:ライブ音楽ソース分離のためのデータセットとモデルの提案
    • 音楽ソース分離は,音楽制作や分析において重要な役割を担う技術である。
    • 既存のモデルはスタジオ録音で学習されるため,ライブ音楽の音響特性に対応できない。
    • ライブ音楽環境におけるソース分離性能の向上を目指す。
    • CrowdioSetは,Freesoundの環境音とMUSDB18/MOISESDBの合成歌声から構成され,ライブ録音のノイズ除去に有効であることが示された。
    • PaRIRsetは,40のプロのコンサート会場で収録されたステレオインパルス応答データセットであり,ソース分離モデルの性能向上に貢献する。
    • PaRIRsetのRIRを用いることで,従来の音声強調タスクのRIRのみを使用するよりも性能が向上することが確認された。

    Link: https://arxiv.org/abs/2607.27828

  • 高解像度VQAのための中間層エビデンスルーティング:一度の推論で十分 [cs.CV]目的:高解像度VQAにおけるエビデンス獲得の効率化
    • VQAは,画像と質問間の理解を深め,AIの視覚的推論能力向上に不可欠である。
    • 既存手法は,高解像度画像に対して繰り返し画像処理を行うため,計算コストが高いという課題がある。
    • 一度の画像処理で十分なエビデンスを抽出し,効率的にVQAを実現することを目指す。
    • Thinking-Onceは,追加の画像エンコーディングなしに,中間層で質問に応じた注意機構を再構築する。
    • V$^*$Bench,HRBench-4K,HRBench-8Kの平均スコアをそれぞれ+3.1,+3.0,+2.7ポイント向上させた。
    • Qwen2.5-VL-7Bを用いた場合,平均スコアを72.5から79.1に改善し,ZwZ-8Bでは82.7を達成した。

    Link: https://arxiv.org/abs/2607.27830

  • SAFViT:Vision Transformer 기반 핵セグメンテーションと分類のための空間的注意融合ゲーティング [cs.CV, cs.AI]目的:細胞核のセグメンテーションと分類における精度向上
    • デジタル病理において,定量的な組織分析は診断と治療計画に不可欠である。
    • 従来のスキップコネクションは空間的位置を平等に扱い,冗長または矛盾した情報が伝わる。
    • SAFゲーティングにより,信頼性の高い特徴抽出と少数クラスの検出精度向上を目指す。
    • SAFゲーティングは,PanNukeデータセットにおいて最高のmPQ(0.471)を達成した。
    • 特に,DeadクラスのF1スコアが14.5ポイント向上し,mPQの改善に大きく貢献した。
    • 6つのゲーティング手法と比較した結果,SAFゲーティングが最も優れた性能を示した。

    Link: https://arxiv.org/abs/2607.27835

  • FeatFix:検証済みの局所的な正確な特徴の再利用による,高速なキャッシュ拡散推論 [cs.CV, cs.LG]目的:キャッシュ拡散推論における局所的な正確な特徴の修正手法
    • 拡散モデルは高品質な画像・動画生成に広く利用されている。計算コストが課題であり,高速化が求められている。
    • 既存手法では,中間特徴の再利用や予測によりコスト削減を図るが,ドリフトの抑制に課題がある。
    • 検証時に計算される正確な特徴を再利用し,局所的な修正を行うことで推論速度を向上させる。
    • FeatFixは,選択されたレイヤー・タイムステップにおいて,完全なドラフトブロック出力を正確な出力に置き換える。
    • この手法により,トークンレベルやチャネルレベルでの部分的な置換,または完全なタイムステップの再計算を回避する。
    • 画像および動画のバックボーン4種類での実験により,FeatFixが生成を最大6.70倍に高速化し,出力品質を維持することが示された。

    Link: https://arxiv.org/abs/2607.27842

  • VCP-DCN:深度協調ネットワークによるカモフラージュ物体検出における視覚的隠蔽特性の克服 [cs.CV]目的:カモフラージュ物体検出における性能向上
    • 現実世界において,背景に溶け込むカモフラージュされた物体を検出することは重要である。
    • 既存手法はRGB-D特徴を利用するが,深度領域における隠蔽物体の特性を十分に考慮していない。
    • 深度情報を活用し,RGBと深度の多次元特徴を効果的に協調させることで,検出精度を向上させる。
    • 提案手法VCP-DCNは,RGBと深度のプロトタイプ表現を学習し,一貫性と特異性を考慮した特徴抽出を実現した。
    • Multi-modality Dual Attentionモジュールにより,RGBと深度の相互作用を強化し,特徴表現能力を高めた。
    • Depth Adaptive Injectionモジュールは,RGBと深度の特徴への貢献度を適応的に調整し,検出性能を最適化した。

    Link: https://arxiv.org/abs/2607.27843

  • 訓練中のニューラルネットワークの簡素化 [cs.AI, cs.CV]目的:過パラメータ化された深層ニューラルネットワークの訓練ダイナミクスの理解と活用
    • 深層学習の性能向上には,モデルの複雑さと計算コストのバランスが不可欠である。
    • 深層ニューラルネットワークは過パラメータ化されやすく,冗長な部分が存在する可能性がある。
    • 訓練中にネットワークを簡素化し,パラメータ数を削減することで効率化を図る。
    • Inverse Fisher Criterionを用いて表現ダイナミクスを監視し,特徴抽出と分類の境界点を特定する。
    • 簡素化が可能な段階を特定し,不要な層を軽量な分類ヘッドに置き換える。
    • MLP,VGG,ResNetアーキテクチャにおいて,パラメータ数を大幅に削減しつつ,元のモデルと同等の精度を維持できることを示した。

    Link: https://arxiv.org/abs/2607.27854

  • 少数ショット医療画像セグメンテーションにおける基盤モデルと大規模言語モデルのベンチマーク [cs.CV]目的:少数ショット医療画像セグメンテーション手法の評価基準
    • 医療画像解析は,疾患診断や治療計画において不可欠であり,高精度なセグメンテーションが求められる。
    • 少数アノテーションしかない状況でのセグメンテーションは困難であり,既存手法の性能比較が曖昧である。
    • 多様な手法の性能を公平に比較し,少数ショットセグメンテーションの課題を明確にすること。
    • 効果的な少数ショットセグメンテーションには,サポート例の直接的な視覚的適応が,プロンプトベースの手法よりも優れていることが示された。
    • サポート例の増加は,モデルが有効に活用できる場合にのみ性能向上に繋がる。
    • セマンティック転移は画像ドメイン適応よりも遥かに難しく,高い局所化能力が必ずしもターゲット不在の信頼性高い認識を意味しない。

    Link: https://arxiv.org/abs/2607.27856

  • EEG-EditBench:制御された画像編集による脳波-画像検索モデルにおける視覚情報の探求 [cs.CV, cs.AI]目的:脳波-画像検索モデルにおける視覚情報の抽出と評価
    • 脳波を用いた画像検索は進展しているが,そのメカニズムの解明が課題である。
    • 高精度な検索性能は,モデルが実際にどのような視覚情報を利用しているかを示さない。
    • 画像編集を通じて,脳波が捉える視覚情報の特徴を明らかにすることを目指す。
    • 従来の画像検索モデルの性能は,オブジェクトの変更や属性の変化に対する識別能力とは必ずしも一致しないことが示された。
    • 特に,微細な属性の変化がモデルにとって最も困難な課題であることが明らかになった。
    • EEG-EditBenchは,脳波-画像モデルが保持する視覚情報を詳細に分析するための基盤を提供する。

    Link: https://arxiv.org/abs/2607.27857

  • 頑健な3Dアバター配置によるボディランゲージの理解学習 [cs.HC, cs.CV]目的:ボディランゲージの理解学習
    • 社会的な知性を持つ航空ロボットの実現には,遠距離からの人間行動と意図の認識が不可欠である。
    • 学習用データが極めて不足しており,現実世界の環境下でのボディランゲージ認識が困難である。
    • 現実のUAV映像にアバターを配置することで,ボディランゲージの学習データを作成し,認識精度を向上させる。
    • Drones2BodyLanguageというデータセットを構築し,10種類のコミュニケーション意図を表現するアバターを,実際のドローン映像に正確に配置した。
    • アバター配置には,シーンの幾何学的モデルと,剛体不変な重みを用いたアフィンアンカー組み合わせによる配置点予測を利用した。
    • 実験結果から,配置されたデータで学習することで,実際の,リターゲティングされた,生成された動きにおいて,意図認識精度が大幅に向上することが確認された。

    Link: https://arxiv.org/abs/2607.27865

  • 継続的なAI生成画像検出における表現と決定の劣化への対処:DECODE [cs.CV]目的:AI生成画像検出器における表現劣化と決定劣化の複合的な問題への対処
    • 生成モデルの進化に伴い,AI生成画像検出の重要性が増している。偽造画像検出は社会的な信頼性を維持する上で不可欠である。
    • 既存手法は表現の安定化に焦点を当て,決定境界のドリフトという問題を無視している。それが性能低下の一因となっている。
    • 表現レベルと決定レベルの両方で劣化を軽減する新しいフレームワークを提案し,継続学習における性能維持を目指す。
    • 提案手法DECODEは,19種類の生成ドメインにおいて平均99.36%の精度を達成し,忘却率はわずか0.39%である。
    • DECODEは,未知の11種類の生成器に対しても95.36%の高い精度を示し,汎化性能も優れている。
    • 表現の多様性を維持するSubspace Diversity Regularizationと決定境界を再調整するClosed-Form Decision Alignmentが効果を発揮する。

    Link: https://arxiv.org/abs/2607.27882

  • MMHBench:長編動画におけるメンタルヘルス理解のための多角的ベンチマーク [cs.AI, cs.CV]目的:長編動画におけるメンタルヘルス理解のための多角的ベンチマーク
    • メンタルヘルスは現代社会において重要な課題であり,早期発見と適切な支援が求められている。
    • 既存のベンチマークは粗粒度の分類に留まり,モデルが心理現象を真に理解しているか判断が困難である。
    • 多角的視点からメンタルヘルス理解を評価することで,より高度なモデル開発を促進すること。
    • MMHBenchは,268本の長編動画と2,184個の質問を含む,多角的メンタルヘルス理解のための包括的なベンチマークである。
    • 評価は,観察可能な行動とマルチモーダル証拠の解釈に焦点を当てた第三者評価と,マルチモーダル証拠に基づいたメンタル状態の解釈を必要とする一人称視点を取り入れている。
    • 22の代表的なマルチモーダル大規模言語モデルの評価の結果,長編動画におけるメンタルヘルス理解は依然として困難であることが示された。

    Link: https://arxiv.org/abs/2607.27895

  • 視覚言語モデルにおける敵対的ロバスト性モデル専門家の統合 [cs.CV]目的:視覚言語モデルの敵対的ロバスト性の向上
    • 視覚言語モデルは多様な応用で活用されているため,そのセキュリティ確保は重要である。
    • 敵対的攻撃に対する脆弱性が課題であり,実用上の大きな障壁となっている。
    • 複数の専門家モデルの知識を統合し,より包括的なロバスト性を実現することを目指す。
    • 敵対的ファインチューニング戦略の異なる専門家モデルを協調的に学習するCAREを提案した。
    • 埋め込み空間の調和により,知識の共有と個々の専門性の維持を両立している。
    • 画像分類や視覚言語タスクにおいて,個別の専門家モデルを上回る性能が確認された。

    Link: https://arxiv.org/abs/2607.27897

  • CoRE-UIR:事前知識に基づく共通・残差エキスパートによる効率的な汎用リモートセンシング画像復元 [cs.CV]目的:リモートセンシング画像復元のための効率的なフレームワークの開発
    • リモートセンシング画像は,気象条件や撮影環境に左右されやすく,様々な劣化が発生する。
    • 従来の画像復元手法は,特定の劣化に特化しており,複数の劣化が同時に発生した場合に対応が困難である。
    • 汎用的な画像復元を目指し,劣化に特化したエキスパートを効率的に組み合わせることで,高品質かつ高速な復元を実現する。
    • CoRE-UIRは,共通エキスパートと残差エキスパートを組み合わせることで,劣化に依存しない復元と,劣化特有の補正を適応的に行う。
    • 提案手法は,既存の最先端手法と比較して,PSNRを1.05dB向上させ,11.83倍高速化し,ピークメモリ使用量を85.3%削減することに成功した。
    • ダウンストリームタスクや未知の劣化に対する評価においても,CoRE-UIRの汎用性の高さが確認された。

    Link: https://arxiv.org/abs/2607.27898

  • ワンパッチで十分:MLLMベースのシーンテキスト検出のための強化学習による視覚トークン接地 [cs.CE, cs.CV]目的:シーンテキスト検出におけるテキスト認識と空間局在化の高精度なアライメント
    • シーンテキスト検出は,自動運転や画像検索など幅広い分野で重要視されている。
    • 既存手法では,密集したテキストや小さいテキストの局在化精度に課題があった。
    • 単一の視覚トークンを用いたアプローチで,ノイズを削減し局在化の曖昧さを解消することを目指す。
    • 提案手法SPaTSは,最先端のMLLMやOCR MLLMと比較して,一貫して優れた性能を示すことが確認された。
    • 強化学習による視覚トークン選択手法SPaSOが,ラベルなしでアンカーを正確に識別することを可能にした。
    • 方向埋め込みアライメントDEAとパッチ強化デコーディングPEDにより,ロバスト性と局在化精度が向上した。

    Link: https://arxiv.org/abs/2607.27902

  • 表現力豊かなMIDIピアノ演奏の評価への文脈埋め込みの統合 [eess.SY, cs.SY, cs.SD, cs.LG]目的:表現力豊かなMIDIピアノ演奏の評価手法
    • 音楽表現の自動評価は,作曲や演奏支援といった分野で重要性を増している。
    • 従来の評価方法は,音符間の依存関係を無視しており,演奏の類似性を適切に評価できない場合がある。
    • 文脈埋め込みを用いて,音符間の関係性を考慮した,より知覚的な評価指標を開発すること。
    • 自己教師あり学習モデル(Aria,CLaMP3)からの文脈埋め込みが,従来の評価指標と同等の精度で人間の評価と一致することがリスニングテストで示された。
    • 文脈埋め込みに基づくカーネルオーディオ距離は,音符のアライメントを必要とせず,文脈の変化に敏感であるため,分布の類似性を効果的に測定できる。
    • 性能評価ユーティリティを提供するオープンソースライブラリPerevalを公開し,再現性を促進する。

    Link: https://arxiv.org/abs/2607.27909

  • ODEWorld:物理的時間の流れによる連続予測アーキテクチャ [cs.LG, cs.CV, cs.RO]目的:物理世界における連続的な動的モデリング
    • 現実世界は連続的な時空間で構成され,機械学習によるシミュレーションには不可欠である。
    • 既存のワールドモデルは離散時間予測に限定され,物理世界のダイナミクスを効率的に捉えられない。
    • 連続的な潜在速度場を学習し,高精度かつ効率的な予測を可能にすること。
    • ODEWorldは,常微分方程式(ODE)に基づき,圧縮された潜在空間での時間積分により予測を行う。
    • ODEの特性を適用することで,潜在ワールドモデルにおける表現崩壊の問題を解決し,長期的予測においても高品質な画像再構成を実現する。
    • 連続的な性質により,任意の時間分解能や逆方向予測が可能となり,ビデオ生成やロボット制御において優れた性能を示す。

    Link: https://arxiv.org/abs/2607.27924

  • ARD-REFSM:非対称ノイズ除去と回転不変性による反射対称性検出の強化 [cs.CV, cs.AI]目的:反射対称性検出の精度向上
    • 画像認識において,対称性は重要な特徴量であり,物体検出や画像分類に活用される。
    • 非対称領域の干渉や対称パターンの任意の方向により,反射対称性検出は困難である。
    • 非対称領域のノイズ除去と回転不変性の強化により,反射対称性検出の精度とロバスト性を向上させる。
    • 提案手法は,非対称領域のノイズ除去モジュール(ARD)と回転不変な特徴量類似性マッチングモジュール(REFSM)を導入することで,対称性の検出性能を向上させている。
    • REFSMは,回転損失を用いることで,原画像と回転画像のスコアマップの一貫性を高め,回転不変な対称軸の正確な予測を可能にしている。
    • 既存のベンチマークの限界に対応するため,多様なシナリオと干渉を含む新たなベンチマークデータセットGMSYMを新たに導入した。

    Link: https://arxiv.org/abs/2607.27927

  • ミップマップ付きSVBRDFの,共有ガウス関数によるコンパクトな表現 [cs.MA, cs.GR]目的:ミップマップ付きSVBRDFテクスチャスタックの,高品質かつ柔軟なレート-歪みトレードオフを実現するコンパクトな2次元ガウス関数ベースの表現
    • SVBRDFはコンピュータグラフィックスにおけるマテリアル表現の中核であり,リアルな画像生成に不可欠である。
    • 高解像度で多チャンネルなミップマップテクスチャは,大きな記憶容量を必要とするという課題がある。
    • 既存手法のトレードオフを克服し,リアルタイムレンダリングに適した効率的な圧縮手法を確立する。
    • 提案手法GTCは,業界標準のGPUテクスチャ圧縮フォーマットであるASTCと比較して,高い再構成品質と低いメモリ使用量を達成した。
    • GTCは,ランダムアクセスと非ニューラルデコーディングをサポートしており,リアルタイムレンダリングに適している。
    • ミップレベル間およびマテリアルマップ間の冗長性を,ガウス関数を共有することで効率的に削減する。

    Link: https://arxiv.org/abs/2607.27943

  • LAST:最終クエリトークンがエッジ-クラウド協調MLLM推論のための視覚トークンプルーニングを誘導する [cs.CV, cs.AI]目的:エッジ-クラウド協調MLLM推論における視覚トークンプルーニング手法
    • エッジデバイスとクラウドの連携による視覚的知能が発展している。
    • 視覚トークン列の増加がクラウド側の推論コストを増大させている。
    • クエリに依存した効率的な視覚トークンプルーニングを実現すること。
    • 提案手法LASTは,エッジ側のVLMを用いてクエリ依存的なプルーニングを行うことで,高い精度を維持しつつトークン数を大幅に削減できる。
    • LASTは,クラウドモデルへのアクセスや高コストな処理を必要とせず,軽量な重要度シグナルからトークン選択を行う。
    • 実験の結果,LASTは既存手法と比較して,より高い性能と低いオーバーヘッドを実現した。

    Link: https://arxiv.org/abs/2607.27952

  • FiRE:複雑な画像検索のための微細な文脈学習によるMLLMの強化 [cs.CV, cs.IR]目的:複雑な画像検索におけるMLLMの性能向上
    • 画像検索は,多様な応用分野において重要な役割を担う技術である。
    • 既存のMLLMは,複雑な検索タスクにおいて文脈の理解が不十分である。
    • 微細な文脈モデリングと段階的なファインチューニングにより,この課題を解決する。
    • 提案手法は,既存のアプローチと比較して,ゼロショットの画像検索において優れた性能を発揮する。
    • 微細な画像キャプションと修正テキストを含む包括的なCIRデータセットを自動的に構築するパイプラインを開発した。
    • 文脈推論と検索の2段階のファインチューニングにより,モデルの文脈理解とクエリ・ターゲットのアライメント能力を向上させた。

    Link: https://arxiv.org/abs/2607.27959

  • FootprintNet:状態遷移誘導動的フットプリント学習による多時間リモートセンシング変化検出 [cs.CV]目的:多時間リモートセンシング変化検出における動的フットプリントの学習
    • 都市化の進展により,リモートセンシングによる変化検出の重要性が増している。
    • 既存手法は,最終観測時点の単一の変化カテゴリで表現するため,繰り返しの変化を捉えられない。
    • 本研究は,変化の発生期間を示す動的フットプリントを学習し,変化のプロセスをより詳細に捉える。
    • FootprintNetは,潜在状態と行動間の相互作用として変化プロセスを抽象化し,状態遷移制約を導入することで,因果的に一貫性のある変化軌跡の学習を誘導する。
    • 動的フットプリント間の識別能を高め,変化境界での特徴コントラストを強化することで,変化検出の精度を向上させる。
    • 従来の評価指標では捉えきれない時間的近接性を考慮したBuilding Change Dynamics Score (BCDS)を新たに提案し,予測性能を評価する。

    Link: https://arxiv.org/abs/2607.27969

  • 脳MRIインペインティングのためのU-DiT:注目すべき健全な注意 [cs.CV]目的:T1強調MRIにおけるマスク領域の健全な脳組織の解剖学的に妥当な補完
    • 脳腫瘍の正確な診断・治療には,健全な脳組織の情報が不可欠である。解剖学的知識に基づく補完技術が重要となる。
    • 既存のインペインティング技術では,解剖学的構造を正確に再現できず,歪みが発生しやすいという課題がある。
    • 歪みを最小限に抑え,解剖学的リアリズムの高い脳MRIインペインティング手法を開発すること。
    • 提案手法は,ダウンサンプリングされたトークングリッド上で自己注意を行うU-DiT原理に基づき,長距離コンテキストと高周波ディテールを両立している。
    • 遮蔽されたトークンが健全なトークンにのみ注意を向けるように制約を加えることで,解剖学的構造からの推論を促し,歪みを抑制している。
    • 健常な半球を対称的な入力として追加することで,脳の左右対称性を利用し,構造的類似度を向上させている。BraTS-2026検証リーダーボードでSSIM 0.864を達成。

    Link: https://arxiv.org/abs/2607.27974

  • ViP-Rig:視覚プロンプトによる制御可能なリギング [cs.PF, math.PR, cs.CV]目的:視覚プロンプトを用いたリギング手法
    • アニメーション制作において,リギングは重要な工程であり,キャラクターの自然な動きを可能にする。
    • 既存手法では,リギングの制御が難しく,特定の要望に応じた調整に手間がかかる。
    • ユーザの意図を反映した,柔軟で制御性の高いリギング手法を確立すること。
    • ViP-Rigは,ユーザが描画したスケッチや編集した剛性マップをプロンプトとして利用し,リギングを行うフレームワークである。
    • 本手法は,既存のジオメトリ条件付きベースラインと比較して,ターゲットとなる骨格やスキニング重みをより正確に再現できることが示された。
    • プロンプトによる新規リギングと,結果に基づく編集の両方において,明示的かつ局所的な制御が可能であることが確認された。

    Link: https://arxiv.org/abs/2607.27982

  • カメラトラップ画像を用いた深層学習に基づく階層的な昆虫分類 [cs.CV]目的:昆虫の階層的な分類モデルの開発
    • 昆虫個体数の減少により,生物多様性のモニタリングが急務となっている。
    • 専門家による手動での昆虫識別はコストと時間がかかる点が課題である。
    • 深層学習モデルを用いて,効率的かつ正確な昆虫識別を目指す。
    • 本研究では,約100万枚の昆虫画像を収録したデータセットを構築した。
    • 階層的な分類モデルを設計し,生物分類学的な情報を活用することで,分類精度を向上させた。
    • テストデータにおいて,階層の各レベルで80-99%の精度を達成した。

    Link: https://arxiv.org/abs/2607.28005

  • 分類を超えて:有糸分裂像検出のための病理学的基盤モデルのエンコーダ [cs.CV, cs.AI]目的:有糸分裂像検出における病理学的基盤モデルの潜在空間の有効性
    • 病理画像解析は,疾患診断や予後予測において重要な役割を担う。
    • 既存の検出手法は,学習データに大きく依存し,汎化性能が課題。
    • 基盤モデルの潜在空間が,高精度な有糸分裂像検出に利用できるか検証。
    • H-optimus-0とVirchowモデルは,ResNet50ベースラインと同等の性能を示した。
    • 既存の基盤モデルの潜在空間は,有糸分裂像検出に直接利用可能であることが示された。
    • データセット外のテストケースにおいても,ある程度の頑健性が見られた。

    Link: https://arxiv.org/abs/2607.28007

  • イベント支援による学習型ビデオ圧縮のための運動補正フレームワーク ENCORE [cs.CV]目的:学習型ビデオ圧縮における運動推定の精度向上
    • ビデオ圧縮技術は,効率的なデータ伝送と保存に不可欠であり,通信・映像分野で重要。
    • 従来のビデオ圧縮はRGBフレームのみに依存し,高速運動や低照度下で運動推定が困難。
    • イベントカメラの情報を活用し,RGBフレームの運動推定を補正することで,画質を向上させる。
    • 提案手法ENCOREは,RGBとイベントデータを活用し,より正確な運動補正を実現した。
    • BS-ERGBデータセットにおいて,PSNR-RGBが最大20.80%,MS-SSIM-RGBが22.14%向上し,BDレートを削減した。
    • HQ-EVFIおよびCEDデータセットでも,一貫した性能向上を示した。

    Link: https://arxiv.org/abs/2607.28020

  • スケーリング,ロックイン,そしてプロキシコンプライアンス:責任あるAIの政治経済学 [cs.CY, cs.AI, cs.GT, econ.TH]目的:責任あるAIにおける説明責任のメカニズム
    • AI技術の社会実装が進む中で,その安全性と公正性を確保することが重要課題となっている。
    • AIシステムの導入後の監視や検証が難しく,潜在的なリスクが放置される可能性がある。
    • AIベンダーと導入者の関係性を分析し,責任あるAIの実現に向けた政策提言を行う。
    • AIベンダーは,導入者の監視に対する期待を予測し,社会的に最適な水準を下回る程度の緩和策にとどまる可能性がある。
    • 独立監査権限の付与,データの移植性,インシデント報告義務,そして結果連動型責任の導入が,AIの説明責任を高める効果を持つ。
    • 文書化や標準化評価が,実際の運用結果との乖離を生み出す原因となるメカニズムを解明した。

    Link: https://arxiv.org/abs/2607.28023

  • 多重組織画像における空間的な細胞構造の解読 [cs.AI, cs.CV]目的:多重イメージングにおける組織構造の理解
    • 組織構造の理解は,疾患の病態解明や治療効果予測に不可欠である。
    • 既存手法は,手作業による特徴量に依存し,汎用性や拡張性に課題がある。
    • 本研究は,組織構造を効率的に学習し,多様なデータセットへの適応を目指す。
    • MUL-Tは,細胞トークンを用いたマスク化された文脈予測タスクとして組織構造を捉える軽量なTransformerフレームワークである。
    • タスク固有の教師なしで文脈化された[CLS]埋め込みを学習することで,高次の細胞間相互作用を捉え,計算効率を維持する。
    • 腫瘍パターン分類,グレード評価,PD-L1陽性予測,治療反応予測などのタスクにおいて,従来のフィーチャーベース手法やViTモデルと同等の性能を示す。

    Link: https://arxiv.org/abs/2607.28030

  • 分割と駆動:リアルタイム Gaussian ヘッドアバターのための二軸分離 [cs.CV]目的:単一画像からのフォトリアリスティックなアニメーション可能なヘッドアバターの生成
    • デジタルヒューマン合成は,現実と区別のつかない人物を仮想空間に再現する上で重要である。
    • 既存手法は外部トラッキングに依存し,リアルタイム処理の妨げとなる遅延が発生する。
    • 外部トラッキングを不要とし,顔の表現力とレンダリング精度を向上させる。
    • 提案手法SpiDは,計算軸と特徴軸の二軸分離により,高速な推論と高精度なアバター生成を実現した。
    • 外部トラッキングを内部化することで,推論時の遅延を解消し,リアルタイム性を確保した。
    • 顔を幾何学的に異なる3つの Gaussian ブランチに分解することで,表現力とレンダリング品質を高めた。

    Link: https://arxiv.org/abs/2607.28032

  • 舌再演:顔再演のための幾何学的アンカー舌合成 [cs.CV]目的:顔再演における舌のダイナミクスの転送
    • 顔の表情再現は重要であり,より自然な表現を可能とする。
    • 既存手法では舌の動きが無視されており,不自然な口内構造となる。
    • 本研究は,自然な口内構造を持つ顔再演を実現することを目指す。
    • 野生環境下での舌セグメンテーションモデルを構築し,精度の高い舌の再演を可能にした。
    • 空間的制約のある潜在的マスク拡散モデルにより,現実的で滑らかな舌の合成を実現した。
    • 提案手法は,既存手法と比較して,舌の評価指標において2倍以上の改善を示した。

    Link: https://arxiv.org/abs/2607.28039

  • 時間変化型インプラシットニューラルボリュームに対するクエリ効率的なボリュームレンダリングフレームワーク [cs.CY, cs.RO, cs.GR, cs.LG]目的:時間変化型インプラシットニューラルボリュームの効率的なレンダリング
    • 科学的可視化において,ボリュームデータのコンパクトな表現が重要であり,特に動的なデータには必須である。
    • インプラシットニューラルボリュームのレンダリングは,ニューラル推論コストが高く,リアルタイム性が課題である。
    • デルタトラッキングに基づくクエリ効率的なフレームワークにより,インタラクティブなレンダリングを実現すること。
    • 提案手法は,ヘテロジニアス並列処理を活用し,GPUのレイトレーシングコアとテンソルコアを有効活用する。
    • レイトレーシングの予算管理とクエリプルーニングにより,インプラシットニューラルボリュームへのクエリ数を削減し,レンダリング性能を向上させる。
    • RTX 4090 GPU上で1024x1024解像度で~30-40 FPSを達成し,高品質な画像を生成し,インタラクティブな時間探索を可能にする。

    Link: https://arxiv.org/abs/2607.28047

  • ロールアウトエラーに基づく時間的集中化:テキストからビデオへの拡散における暗黙的嗜好最適化 [cs.IR, cs.CV]目的:ビデオ拡散モデルの視覚的品質と時間的一貫性の向上
    • 近年のビデオ生成技術の進歩は目覚ましいが,生成されたビデオの時間的欠陥が課題となっている。
    • 従来の嗜好最適化手法は,オフラインアノテーションのコストやオンライン報酬の不安定性により,時間的欠陥の修正が困難である。
    • 本研究は,推論時のエラーから得られる信号を用いて,時間的に集中した最適化によりビデオの品質を向上させることを目指す。
    • 提案手法cIPOは,ノイズ付加と復元プロセスから暗黙的嗜好信号を抽出し,時間的な欠陥箇所を特定する。
    • cIPOは,高い再構成誤差を示すセグメントに最適化を集中させることで,欠陥を起こしやすい領域の修正を可能にする。
    • 実験結果から,cIPOが複数のデータセットでビデオの信頼性と時間的一貫性を向上させることが示された。

    Link: https://arxiv.org/abs/2607.28058

  • 誘導計量を持つランドマーク形状空間 [cs.CV, math.DG]目的:ランドマーク形状空間の統一的構築
    • 形状解析は,画像認識や医療診断など,多様な分野で重要な役割を果たす。
    • 既存手法では,ランドマークの衝突や,ランドマーク数への依存性といった課題があった。
    • ランドマーク形状空間の幾何学的性質を保ちつつ,これらの課題を解決することを目指す。
    • Kendallのランドマーク形状空間と微分同相群に由来する計量を持つランドマーク構成空間を統合した新しいランドマーク形状空間を構築した。
    • この空間は,ランドマークの衝突を防ぎ,ランドマーク数に依存しない計量を持ち,剛体変換を適切に扱う。
    • スクリーンド弾性作用素を定義し,それが剛体運動の零空間を構成することを示した。

    Link: https://arxiv.org/abs/2607.28064

  • BladeYOLO:限定的なアノテーションと弱い顕著性認識による風力タービンブレード欠陥検出 [cs.CV]目的:風力タービンブレードの欠陥検出
    • 風力発電は再生可能エネルギー源として重要であり,ブレードの損傷は発電効率低下や安全性に繋がるため,早期発見が不可欠である。
    • 実際の検査では,データ不足,欠陥の微細性,背景との区別困難さから,既存の検出器の頑健性が制限されている。
    • 限られたアノテーションと微細な欠陥の検出精度の向上を目指す。
    • BladeYOLOは,DINOv3で事前学習済みのVision TransformerバックボーンをYOLOv12-Lに統合し,汎用的な視覚情報を転移させることで,限られた学習データ下での特徴表現を改善した。
    • Mambaガイドの弱欠陥強調モジュールを開発し,高周波構造的特徴の保持と高レベル意味的ガイダンスの伝播により,微細な欠陥の認識を強化した。
    • 環境関連スタイル情報をフーリエ分解で捉え,ViTの自己注意層に注入する軽量スタイルインジェクターモジュールを導入し,環境変化に対する頑健性を向上させた。WTBlade-DefectデータセットとWind Surface Defectデータセットで優位な性能を示した。

    Link: https://arxiv.org/abs/2607.28065

  • GVR-Coder: 複雑な文書および会議シナリオにおける構造化SVG生成のための視覚的フィードバックフレームワーク [cs.IR, cs.HC, cs.LG, cs.CV]目的:複雑な文書や会議のシナリオにおいて,構造化されたSVGを生成するための視覚的フィードバックフレームワーク
    • 専門的な環境や会議レビューにおいて,長文は認知負荷を高めるため,効率的な情報伝達が求められる。
    • テキストからSVGへの変換研究は,複雑な図のデータセット不足,レイアウトの事前知識の欠如,視覚的フィードバックの不足に課題がある。
    • 高品質な論理図を生成し,構造的複雑さと視覚的な美観を同時に最適化することを目指す。
    • 大規模なSVGデータセット DocMeetSVG-100K を新たに構築し,文書作成および会議レビューのシナリオに対応した。
    • カリキュラム駆動型リジェクションサンプリングを用いたファインチューニングにより,複雑な構造のモデリング能力を段階的に向上させた。
    • デュアルレンダリングフィードバックを用いた強化学習と,生成・検証・修正エージェントループにより,生成品質を改善した。

    Link: https://arxiv.org/abs/2607.28073

  • mmRadarTwin:屋内mmWaveレーダーのための計測較正シグナルレベルデジタルツインプラットフォーム [cs.CV]目的:屋内mmWaveレーダーのシグナルレベルデジタルツインプラットフォームの構築
    • 屋内環境におけるレーダーセンシングは,ロボティクスやIoTにおいて重要な役割を担う。
    • 実環境での計測は再現性が難しく,シミュレーションとの比較が困難である。
    • 実測データとシミュレーションデータを同じドメインで比較・診断する手法の確立。
    • mmRadarTwinは,実測レーダーの計測結果とUnreal Engineによるシミュレーションを連携させる。
    • 物理ベースのパスシミュレータは,計測でアクティブな領域の70.8%を再現可能であった。
    • 残差の原因は,弱いパス,位置ずれ,未サポートのアンカー,物理的メカニズムの欠如などが考えられる。

    Link: https://arxiv.org/abs/2607.28108

  • 医療画像における教師なしドメイン適応のための実用的なアルゴリズム選択 [cs.CV, cs.AI]目的:教師なしドメイン適応におけるアルゴリズムとハイパーパラメータの選択基準
    • 医療画像解析の精度向上は,疾患診断や治療効果の予測において不可欠である。
    • ラベルなしのターゲットドメインでは,アルゴリズムの性能を直接評価することが困難である。
    • ターゲットラベルを用いずに,最適なアルゴリズムとハイパーパラメータを選択すること。
    • 提案手法は,複数の選択シグナルを用いて各アルゴリズムからモデルを選定し,それらを統合して参照予測を生成する。
    • この参照予測との一致度に基づいて候補モデルを評価し,最も一致するモデルを選択する。
    • 脳MRIと胸部X線画像を用いた実験により,提案手法が既存手法よりも優れた選択性能を示すことが確認された。

    Link: https://arxiv.org/abs/2607.28125

  • 学習凸特徴埋め込みによる顔と音声のクロスモーダル関連付け [cs.CV, cs.IR]目的:顔と音声のクロスモーダル関連付けのための手法
    • 音声と映像の相互理解は,人間と機械の自然なコミュニケーション実現に不可欠である。
    • 既存手法は,異なるモダリティの特徴量の不均一性を十分に考慮できていない。
    • 同一人物の音声と顔特徴を凸包内に埋め込むことで,誤認識を低減することを目指す。
    • 提案手法は,大規模データセットVoxCelebを用いた検証,マッチング,検索タスクで,既存手法を上回る顕著な性能向上を達成した。
    • クロスモーダル凸埋め込みと注意機構を組み合わせることで,誤検出・誤認識を効果的に抑制することを示した。
    • 異なるモダリティの特徴量間の不均一性を考慮することで,クロスモーダル関連付けの精度が向上した。

    Link: https://arxiv.org/abs/2607.28129

  • 顔超解像度とロバストな人物再識別における協調的特徴集約 [cs.CV]目的:顔超解像度とロバストな人物再識別
    • 顔認識技術は,セキュリティや監視システム等,社会における利用が拡大しており重要性が高まっている。
    • 低解像度画像からの顔超解像度は,ぼやけや歪みが生じやすく,認識精度が低下するという課題がある。
    • 複数画像から協調的に特徴を集約することで,顔超解像度と人物再識別の精度向上を目指す。
    • 提案手法は,時間的または視点的に相関のある複数画像間の協調的特徴集約により,顔超解像度と人物再識別性能を向上させる。
    • Transformerベースの協調的特徴集約手法とカスケード超解像度ネットワークを用いることで,高精度な顔画像復元と人物再識別を実現した。
    • 実験結果から,提案手法が既存手法を凌駕し,一貫して高い性能を示すことが確認された。

    Link: https://arxiv.org/abs/2607.28130

  • 多視点画像からの高品質3D再構成のための畳み込みニューラルシェーディング [cs.CV]目的:多視点画像からの高品質な3D形状再構成
    • 3D再構成は,ロボット工学やコンピュータビジョン等の分野で重要な役割を担う。
    • 既存手法は点情報に依存し,詳細な局所形状の表現が不十分である。
    • ニューラルシェーディングを活用し,局所形状の正確な予測を目指す。
    • 提案手法は,暗い領域やテクスチャのない領域においても,より正確な幾何形状予測を可能にした。
    • 表面の不規則性を軽減するため,微細なディスプレイスメントネットワークを導入した。
    • 実験結果から,提案手法が最先端手法と比較して再構成形状とレンダリング画像の品質を大幅に向上させることが示された。

    Link: https://arxiv.org/abs/2607.28132

  • 深層学習が伝統中国医学の舌診に有効である理由:包括的な消去研究 [cs.CV, cs.LG]目的:伝統中国医学における深層学習による舌診の最適設計原理の特定
    • 伝統中国医学の舌診は,健康状態を把握する重要な手段であり,熟練した医師による診断が求められる。
    • 舌診の自動化は進んでいるものの,深層学習モデルの設計空間は十分に検討されていない。
    • 本研究は,深層学習モデルの構成要素を系統的に変化させ,最適な設計原理を明らかにすることを目的とする。
    • ConvNeXt-Tinyがパラメータ効率の面で最適であることが示された。
    • 二値交差エントロピー損失関数(BCE)が非対称損失関数よりも大幅に高い性能を示した(2.7%向上)。
    • 抑制された色拡張と弱グループアンサンブル,データスケーリングが性能向上に寄与することが明らかになった。

    Link: https://arxiv.org/abs/2607.28148

  • OPLD:マルチモーダル推論のためのオンポリシー潜在蒸留 [cs.DC, cs.CV, cs.AI]目的:マルチモーダル推論における潜在表現の学習
    • 視覚的推論はAIの重要な課題であり,多様な応用が期待されている。
    • 既存手法は外部定義の推論過程に依存し,柔軟な視覚的思考が困難である。
    • マルチモーダルCoTによる推論能力を潜在表現に転移し,抽象的思考を実現する。
    • OPLDは,特権的なマルチモーダルCoTによって誘導される推論能力を潜在表現に転送するシンプルなフレームワークである。
    • 多様なマルチモーダルベンチマークにおいて,既存の潜在推論手法を上回り,最先端の性能を達成した。
    • 潜在表現を推論過程レベルで監督することが,従来のフィーチャーレベルの整合よりも効果的であることが示唆された。

    Link: https://arxiv.org/abs/2607.28154

  • S-Avatar:単一画像からの拡散ガイド型ガウスヘッドアバター [cs.CV, cs.GR]目的:単一画像からのフォトリアリスティックな3Dヘッドアバター生成
    • VR/AR技術の発展において,リアルなアバターの重要性が高まっている。
    • 既存手法では,未知視点での3D一貫性を維持することが課題となっていた。
    • 単一画像から3D一貫性の高いアバターを生成し,VR/AR応用を促進すること。
    • 拡散ガイド型3Dモデル生成モジュールと3D Gaussian Splatting (3DGS)を用いた新たな手法S-Avatarを提案する。
    • S-Avatarは,従来の最先端手法と比較して,新規視点および表情生成において優れたリアリズムと一貫性を示す。
    • 本手法は,手軽なアバター作成を可能にし,幅広いVR/ARアプリケーションへの応用が期待される。

    Link: https://arxiv.org/abs/2607.28164

  • 余剰画像による思考:時空間情報利得駆動の農地セグメンテーションエージェント [cs.CV]目的:農地リモートセンシング画像セグメンテーションにおける,時空間情報利得に基づいた動的意思決定プロセス
    • 食糧安全保障の維持には,正確な農地の把握が不可欠であるため,農地セグメンテーション技術の重要性が高い。
    • 既存手法は,単一の画像のみに頼るため,農地の季節変化や空間的文脈を捉えきれず,誤ったセグメンテーションが生じやすい。
    • 本研究は,必要な時空間情報を動的に取得することで,セグメンテーションの曖昧さを解消し,より正確な農地セグメンテーションを実現する。
    • 提案手法FarmSeekerは,曖昧な領域を特定し,原因を推論,必要な時空間情報を要求することで,正確なセグメンテーションを行う。
    • GSFS-Benchというグローバル規模のベンチマークデータセットを構築し,評価を行った結果,既存手法よりも安定した性能を達成した。
    • FarmSeekerは,農地セグメンテーションにおける,より高度な情報探索と利用を可能にする。

    Link: https://arxiv.org/abs/2607.28186

  • UniCross:統一的なクロススキル手 dexterity 合成 [cs.DC, cs.CL, cs.RO, cs.CV]目的:複数の手 dexterity スキルを統合したポリシーの蒸留
    • 高度なロボット工学において,人間のような手 dexterity は不可欠である。
    • 既存手法はスキルごとにモデル化するため,長時間の連携が困難である。
    • 異なるスキル間の一貫性を捉え,汎用的な操作を可能にすること。
    • 単一のクロススキルポリシーが,すべてのスキルで高い性能を発揮する。
    • 未知の物体への汎化能力,外乱への頑健性,シームレスなスキル連携を実現した。
    • 異なる手形態への効果的な転移も確認された。

    Link: https://arxiv.org/abs/2607.28198

  • ビジョン言語モデルのスケーリングだけではバイアス軽減は不十分である [cs.HC, cs.HC, cs.CV]目的:ビジョン言語モデルにおけるバイアスの実態解明
    • マルチモーダルシステムの基盤技術であり,その信頼性確保が重要である。
    • モデルの規模拡大だけではバイアスが十分に軽減されない可能性が指摘されている。
    • 大規模なデータセットとモデルを用いて,バイアスの軽減策を検証すること。
    • モデル規模と性能の相関は,ImageNetからCelebA,UrbanCarsへと評価が進むにつれて弱まる。
    • 学習データ(規模と質)は,バイアスベンチマークにおける最悪グループの精度とより一貫した関係を示す。
    • キュレーションされたデータセットは,同程度の規模の未キュレーションデータセットと比較して,最大25%の改善をもたらす。

    Link: https://arxiv.org/abs/2607.28211