arXiv雑要約

画像・音声 - 2026/07/31 公開

  • RadHarmony:エージェントAI時代における放射線画像データの取り扱い [cs.AI, cs.CV]目的:放射線画像データの統合,標準化,拡張のための統一API
    • 深層学習モデルの精度向上には多様なデータが不可欠であり,その統合が重要である。
    • 放射線画像データは形式や構造が異なり,統合作業に手間と専門知識を要する。
    • RadHarmonyはデータ統合の自動化により,放射線画像データの利用を促進する。
    • RadHarmonyは,24の公開データセットのメタデータを単一の表形式に標準化する。
    • MONAIのデータセットをラップし,深層学習に適したデータ提供とオンディスクキャッシュを可能にする。
    • AIエージェントのスキルにより,データ統合ワークフローを効率化し,コード生成を支援する。

    Link: https://arxiv.org/abs/2607.27235

  • 法執行機関向け音声文字起こし能力の向上:BWC映像のためのWhisperのLoRAベース適応 [cs.SD, cs.AI]目的:法執行機関のBWC映像からの音声文字起こし精度の向上
    • 警察活動におけるBWC映像は重要だが,手作業での文字起こしコストが高い。
    • 既存の音声認識モデルは,警察環境特有の音響・言語的課題に弱い。
    • LoRAを用いてWhisperモデルを適応させ,低コストで高精度な文字起こしを実現する。
    • LoRAによる適応により,消費グレードのハードウェアでも高い精度を達成した。
    • ドメイン固有のオントロジーを用いた推論パイプラインにより,93.7%の語彙マッピング率を実現。
    • この研究は,手続き的正義と透明性の向上に貢献する。

    Link: https://arxiv.org/abs/2607.27245

  • 劇場パンフレット大規模調査:タイポグラフィの統計的比較分析 [cs.CV, cs.LG, eess.IV]目的:歴史的印刷物の書体の類似性定量化
    • 古文書研究において,書体情報は印刷史や様式分析に不可欠な要素である。
    • 書体の識別は専門家による視認に頼ることが多く,大規模な文献調査には限界があった。
    • 自動化された書体比較手法により,印刷史研究の効率化と新たな知見の発見を目指す。
    • 本研究で開発された手法は,17世紀スペインの劇場パンフレットの書体比較を可能にした。
    • 専門家による検証の結果,新たな印刷者帰属の特定や既存の帰属の修正に成功した。
    • この成果は,デジタル書誌学の大規模化に向けた可能性を示唆している。

    Link: https://arxiv.org/abs/2607.27266

  • EEG基礎モデルは音声認識に応用可能か:明示的および想像上の音声デコーディングのベンチマーク [cs.SD]目的:明示的および想像上の音声デコーディングに対するEEG基礎モデルの性能評価
    • 脳波(EEG)は,非侵襲的な脳・コンピュータインタフェース(BCI)の重要な情報源であり,様々な応用が期待されている。
    • 高精度な音声デコーディングは困難であり,既存のEEGベースのシステムでは性能が十分ではない。
    • 大規模EEG事前学習が音声生成に一般化するかを検証し,音声特化型基礎モデルの必要性を検討する。
    • 大規模なEEG事前学習は,音声認識タスクにおいて,16KパラメータのCNNと比較して一貫した優位性を示さなかった。
    • 現在の汎用的なEEG事前学習は,音声生成への転移には至っておらず,音声特化型基礎モデルの開発が求められる。

    Link: https://arxiv.org/abs/2607.27268

  • 加法的に分離可能なヘドニックゲームにおける強い人気度の複雑性 [cs.GT, cs.CC]目的:加法的に分離可能なヘドニックゲームにおける強い人気度を持つ分割の存在判定問題
    • ゲーム理論は,経済学,政治学,計算機科学など幅広い分野に応用されており,合理的な意思決定のモデル化に不可欠である。
    • ヘドニックゲームにおける最適な分割の計算はNP困難であり,現実的な規模の問題に対して効率的なアルゴリズムが存在しない。
    • 強い人気度を持つ分割の存在判定問題の複雑性を明らかにすることで,計算可能性の限界を理解し,近似アルゴリズムの開発に貢献する。
    • 加法的に分離可能なヘドニックゲームにおいて,強い人気度を持つ分割の存在判定問題はPCW完全であることが証明された。
    • これはBrandtとBullinger (2022)およびBullingerとGilboa (2025)によって提起された未解決問題を解決するものである。
    • PCWは,$P^{NP}$と$S_2^P$の間に位置する複雑度クラスであり,この結果は問題の計算困難性を示唆する。

    Link: https://arxiv.org/abs/2607.27277

  • OVEarth-Bench:オープンボキャブラリ地球観測におけるカテゴリの幅とクエリの多様性の評価 [cs.CV]目的:オープンボキャブラリ地球観測の評価基準
    • 地球観測は,環境問題や資源管理など,様々な分野で不可欠な役割を担う。
    • 既存の評価基準は,対象とするカテゴリやクエリの種類が限定的である。
    • カテゴリの幅とクエリの多様性を拡張し,より現実的で信頼性の高い評価を目指す。
    • 既存の方法の性能には限界が見られ,広範なカテゴリ網羅性によってモデルのランキングが安定する。
    • 大規模言語モデル(MLLM)ベースの手法が最も高い性能を示す。
    • 地球観測に特化した手法は,汎用モデルと比較して性能が劣ることが多い。

    Link: https://arxiv.org/abs/2607.27278

  • VETO:最先端AI編集から画像を保護する試み [cs.CV]目的:画像編集に対する防御策の開発
    • 画像編集技術の発展は,クリエイティブな可能性を広げる一方,悪用のリスクも増大させている。
    • 従来の防御策は,新しい画像編集モデルの仕組みに対応できず,効果が薄れている。
    • VETOは,最新モデルの画像読み込みメカニズムを妨害し,画像編集による悪用を防ぐことを目指す。
    • VETOは,既存の防御策と比較して,一貫して高い性能を示すことが確認された。
    • VETOは,画像保護と品質維持のバランスに優れた性能を発揮する。
    • 新たなベンチマークVetoBenchにより,広範な再コンテキスト化に対する防御性能も評価された。

    Link: https://arxiv.org/abs/2607.27292

  • SKY-ピアノ:マルチモーダルピアノ演奏データセット [cs.SD, cs.MM]目的:マルチモーダルピアノ演奏データセット
    • ピアノ演奏に関する音楽情報検索は,近年多様なデータと注釈を用いることが重要になっている。
    • 既存のデータセットでは,モーションデータと他の情報を統合的に扱うことが困難であった。
    • ピアノ演奏の理解を深めるための,高品質なマルチモーダルデータセットの提供。
    • 本研究では,プロおよびアマチュアのピアニストによる11時間の演奏データを収録したSKY-Pianoデータセットを公開した。
    • モーションデータ,マルチビュー動画,オーディオ,MIDI,MusicXMLスコアなど,多様なモダリティのデータを提供することで,研究の幅を広げた。
    • MIDIからモーション生成の実験を通じて,データセットの有用性を示し,応用例を提示した。

    Link: https://arxiv.org/abs/2607.27296

  • 位置が重要,来歴はそうではない:医療ビジョン言語モデルにおける推論媒介と追随性の分離 [cs.LG, cs.CV]目的:医療ビジョン言語モデルにおける推論の因果的影響の検証
    • 医療診断支援において,AIの活用が期待される中で,その推論過程の透明性と信頼性が重要である。
    • 医療VLモデルが生成する推論が,実際に予測に影響を与えているのか不明確であり,追随性(ハルシネーション)が問題となる。
    • 生成された推論の編集を通じて,推論が予測に与える影響を定量的に評価し,信頼性を高める。
    • 推論注入の方法が測定される忠実度に大きく影響することが示された。
    • 提示された文脈の位置が,医療VLモデルが生成した推論を利用するかどうかの主要な決定要因であることが明らかになった。
    • 視覚的根拠の削除は注入された推論への依存度を高め,左右の区別は最も忠実に追跡される臨床的属性ではなかった。

    Link: https://arxiv.org/abs/2607.27304

  • 文楽:一枚のイラストから編集可能なLive2Dキャラクターを生成 [cs.CV]目的:単一のイラストからLive2Dキャラクターに必要な構造化データの生成
    • Live2Dはアニメキャラクターやアバター作成の主要技術であり,幅広い分野で活用されている。
    • 従来のLive2Dモデル作成は手作業が多く,時間と労力を要する。
    • イラストから自動的にLive2Dモデルを生成し,制作プロセスを効率化することを目指す。
    • 本研究では,イラストを基に,RGBAレイヤー,変形メッシュ,キーポーズオフセットを生成するシステムを提案する。
    • 提案手法は,Live2Dに特化した階層的拡散モデルを用いてレイヤー分解を行い,隠れた領域を補完する。
    • メッシュ生成とキーポーズ予測をJointに行うことで,一貫性のあるキャラクターアニメーションを実現している。

    Link: https://arxiv.org/abs/2607.27348

  • 非ペアクロスモーダル医療分類のための共有意味コードブック蒸留 [cs.CV, eess.IV]目的:非ペアクロスモーダル医療分類における知識蒸留手法
    • 医療画像診断の精度向上は,患者ケアの質を向上させる上で極めて重要である。
    • 異なるモダリティ間のデータがペアになっていない場合,従来の知識蒸留は適用が困難である。
    • 非ペアデータ間でも効果的に知識を伝達し,診断精度を向上させることを目指す。
    • 提案手法SSCDは,共有された離散コードブックを通じて教師と生徒の表現を比較することで,非ペアクロスモーダル分類において優れた性能を発揮する。
    • OCTから眼底画像,CTから胸部X線画像という2つの異種非ペア設定において,マクロF1スコアがそれぞれ64.5%から70.2%,73.8%から76.3%に向上した。
    • SSCDは,既存の蒸留ベースラインを凌駕し,実用的な医療診断システムの構築に貢献する。

    Link: https://arxiv.org/abs/2607.27357

  • 探求的モデリング:第3の事前学習軸の解錠とエンドツーエンド生成 [eess.SY, cs.SY, cs.LG, cs.AI, cs.CL, cs.CV]目的:生成モデルにおける性能向上とエンドツーエンド生成の実現
    • 深層学習の発展は目覚ましいが,生成モデルはまだ手動設計の段階に留まっている。
    • 既存の生成モデルは多峰性分布の扱いにくさから,エンドツーエンド学習が困難である。
    • モデル生成とデータの候補を探索し,最適なものを選択することで,エンドツーエンド生成を可能にする。
    • 探求的モデリングは,パラメータやデータに加えて,探索という第3の事前学習軸を提供することで,性能を向上させる。
    • データ量やモデル規模の拡大に伴い,探索による改善効果は高まり,計算効率やサンプル効率も向上する。
    • 探求的モデリングは,拡散モデルと同等の性能を,推論ステップ数を大幅に削減して実現可能である。

    Link: https://arxiv.org/abs/2607.27372

  • PanDent:歯科放射線における包括的な歯レベル構造-言語整合性に向けて [cs.CV, cs.MM]目的:歯科パノラマX線写真におけるマルチモーダル大規模言語モデルの評価
    • 歯科医療において,放射線写真の正確な解釈は診断精度に不可欠であり,AI技術の導入が期待される。
    • 既存の評価基準は,臨床的に信頼性のある詳細なベンチマークが不足しており,専門家の解釈を反映できていない。
    • 本研究は,歯レベルでの詳細なアノテーションに基づいた,臨床的に信頼性の高いベンチマークを構築し,評価を可能とする。
    • PanDentは,9,524枚の高品質な歯科パノラマX線写真と,経験豊富な歯科医師による詳細なアノテーションで構成される。
    • 現状のMLLMは流暢なレポートを生成するものの,臨床的に整合性の高い記述には至らず,詳細な局所化と歯レベルの診断に誤りが多い。
    • PanDentでのファインチューニングは,構造-言語整合性を大幅に向上させ,AIの出力と専門家の解釈との乖離を縮小する。

    Link: https://arxiv.org/abs/2607.27378

  • VideoCoCo:物理的に整合性のとれた動画生成のためのコードを利用した思考連鎖型エージェント二重エンジンシステム [cs.CL, cs.CV, cs.AI]目的:物理的に整合性のとれた動画生成手法
    • 動画生成技術は近年飛躍的に進歩しているが,物理法則に則った自然な動きの再現が課題である。
    • 既存のテキストからの動画生成モデルは,圧縮されたテキスト情報から時間変化を推測するため,物理的な整合性が低い。
    • 実行可能なコードを思考連鎖として利用し,物理シミュレーションを通じて整合性の高い動画を生成する。
    • VideoCoCoは,Blenderコードを中間表現として利用するエージェント二重エンジンシステムである。
    • 提案手法は,PhyGenBenchとVBench-2.0の両ベンチマークで,既存手法を大幅に上回る性能を示した。
    • 実行可能なコードは,物理的に整合性のとれた動画生成のための,効果的で制御可能かつ検証可能な中間表現となり得る。

    Link: https://arxiv.org/abs/2607.27380

  • AI生成音楽検出におけるロバスト性の向上 [cs.SD]目的:AI生成音楽の検出
    • 音楽生成AIの普及に伴い,生成された音楽の真偽判定の重要性が高まっている。
    • 既存の検出器は,単純な音声操作によって容易に欺瞞されてしまう。
    • 音声操作に対する検出器のロバスト性を向上させることを目指す。
    • 提案手法は,対数周波数軸へのマッピングにより周波数スケール不変性を実現した。
    • 学習時に二値検出とアーティファクトピークの位置特定を同時に行うことで,ロバスト性を高めた。
    • 速度変化に対するロバスト性が組み込まれており,速度変化の度合いも推定可能である。

    Link: https://arxiv.org/abs/2607.27454

  • レインボーサイクル数の線形上限と近似EFX [cs.GT]目的:加法性評価値を持つ公平分割インスタンスにおける完全な羨望フリー至近(EFX)割り当ての可能性
    • 資源配分問題において,公平性は重要な評価基準であり,社会的な効率性と公正性を高める上で不可欠である。
    • 完全なEFX割り当ての存在は未解決であり,近似EFX割り当てへの緩和が研究されている。未割り当て資源の多さが課題である。
    • レインボーサイクル数$R(d)$の上限を線形にすることで,少ない未割り当て資源での近似EFX割り当てを可能にする。
    • レインボーサイクル数$R(d)$が$R(d) < ed$であることを証明し,線形上限を確立した。
    • これにより,$n$エージェントのインスタンスに対し,$O(\sqrt{n/\varepsilon})$個の未割り当て資源での部分$(1-\varepsilon)$-EFX割り当てが可能になった。
    • これは,レインボーサイクル還元から得られる未割り当て資源数に関する最適漸近保証である。

    Link: https://arxiv.org/abs/2607.27455

  • 複数プレイヤー離散入札ゲーム:決定性,均衡,複雑性 [cs.GT, cs.FL]目的:複数プレイヤー離散入札ゲームにおける決定性,均衡の存在,および計算複雑性の解析
    • グラフゲームは,リアクティブシンセシスやマルチエージェントシステムなど,様々な分野の基礎モデルとして重要である。
    • 2人ゲームの入札ゲームは研究が進んでいるが,複数プレイヤーの入札ゲームに関する研究は不足している。
    • 本研究は,複数プレイヤー入札ゲームの決定性や均衡の存在について解明し,計算複雑性を明らかにすることを目的とする。
    • 穏やかな条件下で,入札ゲームは決定性を持つことが示された。つまり,いずれかの連合が勝利戦略を持つ。
    • この決定性を用いて,平均ペイオフゲームにおける値の存在と,定性的ゲームにおける純粋ナッシュ均衡の存在が示された。
    • 到達可能性ゲームや単一表記の予算設定において,勝利連合の判定はPSPACE困難であることが示された。これは2人ゲームとは対照的である。

    Link: https://arxiv.org/abs/2607.27456

  • IGME:転移可能なセマンティックセグメンテーション攻撃のための効率的な連鎖手法アンサンブル [cs.CV]目的:転移可能なセマンティックセグメンテーション攻撃の効率化
    • セマンティックセグメンテーションは,自動運転や医療画像解析など幅広い分野で重要視されている。
    • セマンティックセグメンテーションモデルは敵対的摂動に脆弱であり,その評価には大きな計算コストがかかる。
    • 単一のソースモデルで効率的に転移攻撃を可能にし,計算コストを削減することを目的とする。
    • 提案手法IGMEは,微分可能な攻撃コンポーネントの連鎖計算により,ソースモデルの勾配計算を共有することで効率化を実現した。
    • 連鎖構成による更新の不安定性を軽減するため,積分勾配様式のパス平均化方向を導入した。
    • Pascal VOCおよびCityscapesの実験により,CNNおよびTransformerベースのセグメンテーションモデルに対する転移効率と実行時間のトレードオフが確認された。

    Link: https://arxiv.org/abs/2607.27465

  • 戦略,報酬ではない:正規形ゲームの行動埋め込み [cs.GT, cs.AI, cs.LG, cs.MA]目的:LLMにおける戦略的思考能力の転移に関する予測モデル
    • LLMの戦略的タスク学習は,直接的な学習効果を超えた能力変化をもたらすため,そのメカニズム解明が重要である。
    • LLMの戦略的思考能力の転移は予測が難しく,汎化性能が課題となっている。
    • ゲームの埋め込み表現を用いて,LLMの戦略的思考能力の変化を予測することを目指す。
    • 既存の構造的埋め込みはゲームの識別を記憶するのみで汎化性に欠けるのに対し,本研究で提案する行動埋め込みは高い予測性能を示した。
    • 行動埋め込みは,ナッシュ均衡のエントロピーと,相手の行動に対する最適反応の感度という二つの特徴量で構成される。
    • 戦略的思考能力の転移は,ゲームの報酬構造ではなく,意思決定行動の構造によって決定されることが示された。

    Link: https://arxiv.org/abs/2607.27536

  • ProgFormer:縦断的脳MRI予測のための階層的ボクセル拡散Transformer [cs.CV]目的:縦断的脳MRI予測における新規手法
    • 脳構造の変化は病気の進行を捉える上で重要であり,早期診断や治療効果の評価に不可欠である。
    • 既存手法では,微細な変化が脳全体の安定した構造に埋もれてしまい,正確な予測が困難となる場合がある。
    • ProgFormerは,脳全体の構造と微細な変化の両方を捉え,高精度な縦断的脳MRI予測を実現する。
    • ProgFormerは,粗いパスと細かいパスの二段階構造を持つボクセル空間Diffusion Transformerである。
    • 粗いパスは脳全体の構造と時間的コンテキストをモデル化し,細かいパスは粗いパスの情報に基づいてボクセルレベルでの洗練を行う。
    • ADNI,AIBL,OASISの3つのベンチマークで,最先端の手法と比較して良好な性能を示した。

    Link: https://arxiv.org/abs/2607.27537

  • 行動に沿った表現によるクロス具現化転移 [cs.RO, cs.AI, cs.CV, cs.LG]目的:ロボットの多様な具現化間での転移学習における表現の役割
    • ロボットによる複雑な操作を可能にするためには,効率的な学習が不可欠である。
    • 異なるロボット間での転移は難しく,汎用的なロボット操作の実現を妨げている。
    • 具現化に依存しない表現を用いることで,大規模なデータを統合し,転移性能を向上させる。
    • 行動に沿った表現(特にエンドエフェクタ軌跡)は,クロス具現化転移において有効であることが示された。
    • 表現の有用性は,事前学習に使用するデータセットの規模に依存する傾向がある。
    • シミュレーションで事前学習したポリシーを実機に適用することで,タスク完了率が28%向上することが確認された。

    Link: https://arxiv.org/abs/2607.27549

  • ラスター2D CAD図面からのパラメトリックCADコード生成のためのアノテーション接地:Drawing-Recode [cs.CL, cs.CV, cs.AI]目的:パラメトリックCADコードの生成
    • デジタル化以前の2D CAD図面を再利用し,部品の複製や製造プロセスの自動化に貢献する。
    • 既存研究はベクトル図面のみ処理するか,特定の分野に限られ,寸法情報を活用できない。
    • 寸法情報と幾何学的情報を結びつけ,2D CAD図面からパラメトリックCADコードを生成する。
    • Drawing-Recodeは,画像エンコーダーとテキスト認識モジュールを用いて幾何学的特徴とアノテーションを抽出する。
    • クロスアテンションと提案するアノテーション接地損失(AGL)を用いてアノテーションと幾何学的情報の関係を明示的に確立する。
    • 大規模言語モデル(LLM)に特徴を入力し,構造化パラメトリックCADコード(SPCC)形式のCADコードを生成する。

    Link: https://arxiv.org/abs/2607.27558

  • 推論時のエージェント的決定規則が,多画像医療推論における長期間の進化探索を凌駕する [cs.CV]目的:多画像医療VQAにおけるエージェント的決定戦略の比較と最適化
    • 医療分野における画像と言語の融合は,診断精度向上に不可欠であり,その自動化が求められている。
    • 多画像からの情報集約において,画像の順序依存性やノイズへの頑健性が課題となっていた。
    • 適切なエージェント的決定規則を定義することで,多画像医療推論の精度向上を目指す。
    • 最も優れた手法は,単純で頑健な集約戦略である「order-vote」ポリシーであり,最終テスト精度は57.89±0.65%であった。
    • 固定ベースライン(52.73±0.42%)や,より複雑なorder-rerank変種(55.79±0.43%)を大幅に上回る有意な改善が確認された。
    • 進化探索の予算を増やすことは,一般化性能の向上には繋がらず,最終テスト精度は低下した。

    Link: https://arxiv.org/abs/2607.27564

  • 目的指向直接回答SFTによる堅牢なマルチフレーム医療VQA [cs.CV]目的:マルチフレーム医療VQAにおける堅牢な適応手法の評価
    • 医療画像診断支援において,VQAは医師の意思決定をサポートする重要な技術である。
    • 既存のVQA手法は,データセットの変化やノイズに弱く,汎化性能が課題である。
    • 本研究は,評価条件を厳密に制御した上で,堅牢な適応手法を特定することを目的とする。
    • 最終的な正答目標に密接に整合した直接回答のみを用いたSFTが,最も堅牢な適応手法ファミリーであることが示された。
    • MedGemma-1.5-4Bにおいて,SFTは固定ベースラインと比較して,保留されたレポートの精度を大幅に向上させ,高い安定性を示した。
    • 事後キャリブレーションにより,精度を損なうことなく信頼推定を効果的に改善し,Qwen2.5-VL-3Bのような他のバックボーンにも一貫して転移可能であった。

    Link: https://arxiv.org/abs/2607.27566

  • ウェーブレット変換を用いた動物プランクトン顕微鏡画像インスタンスセグメンテーションのためのZMIS-SAM [cs.CV]目的:動物プランクトン顕微鏡画像のインスタンスセグメンテーション性能の向上
    • 海洋生態系のバランス維持において,動物プランクトンは重要な役割を担うため,その正確な識別が不可欠である。
    • 既存の汎用セグメンテーションモデルは,動物プランクトン固有の特徴に対応できず,セグメンテーション精度が課題となっている。
    • 動物プランクトンの形態や特徴を考慮し,より高精度なインスタンスセグメンテーションを実現することを目的とする。
    • 提案手法ZMIS-SAMは,動物プランクトンの形態と画像強度分布を効果的にモデル化するZM-ViTモジュールを導入した。
    • 隣接特徴集約モジュール(NFAM)は,半透明で細い付属肢の連続的なセグメンテーションを改善し,ウェーブレット変換を用いたモジュール(WM2FE)は境界の完全性を高めた。
    • 実験結果から,ZMIS-SAMが動物プランクトンデータセットにおいて最先端のセグメンテーション性能を示し,他のデータセットへの汎化性能も高いことが確認された。

    Link: https://arxiv.org/abs/2607.27585

  • MeshFM:3D形状理解に必要なのは2D特徴だけ [cs.CV, cs.GR]目的:3D形状理解のための豊かな特徴抽出
    • 3D形状理解は,ロボティクスやコンピュータビジョンにおいて重要である。現実世界の認識・操作に不可欠。
    • 3Dデータは,アノテーションコストが高く,入手が難しいという課題がある。
    • 2D画像からの情報のみで,3D形状の理解を可能にすること。
    • MeshFMは,2D特徴から3D特徴を効率的に抽出する新しいフレームワークである。
    • 3Dアノテーションなしで学習可能であり,既存の3D supervised法と同等以上の性能を示す。
    • 入力オブジェクトの極端な回転に対してもロバストなモデルである。

    Link: https://arxiv.org/abs/2607.27592

  • MPIE-Bench:解剖学的に妥当な複数人物間相互作用編集のベンチマーク [cs.CV]目的:複数人物間の相互作用編集における解剖学的妥当性の評価基準
    • 画像生成技術の発展に伴い,複数人物の自然な相互作用表現が求められている。
    • 既存の画像生成モデルでは,複数人物間の接触表現に不自然さ(肢の融合,体の一部欠損など)が見られる。
    • 解剖学的・幾何学的な誤りを定量的に評価し,より自然な相互作用表現を可能とする。
    • MPIE-Benchは,405のシーン,14の相互作用カテゴリ,4つの接触密度を含む2,500件の編集用トリプレットで構成される。
    • 提案手法MPIE-Evalは,複数人物のメッシュ再構成を用いて接触時間幾何学を評価する解剖学と相互作用の2軸で評価を行う。
    • メッシュ解剖学と相互作用のスコアはそれぞれ0.65と0.72にとどまり,既存モデルの弱点を明らかにした。

    Link: https://arxiv.org/abs/2607.27616

  • MedXplore:医療画像における信頼性と偏りのない汎化カテゴリ検出に向けて [cs.CV]目的:医療画像における汎化カテゴリ検出の信頼性と偏りを軽減すること
    • 医療画像解析は診断支援などに不可欠であり,その精度向上は医療の質に直結する。
    • 既存手法は大量のアノテーションに依存し,臨床現場の多様な状況に対応できない場合がある。
    • 未アノテーション画像から新たなカテゴリを検出し,誤検出を抑制することを目指す。
    • 提案手法MedXploreは,知覚的レベルと意思決定レベルの両方から最適化を行うことで,信頼性と偏りのない医療画像における汎化カテゴリ検出を可能にする。
    • 周波数領域に着目したFAACモジュールと,ACAMモジュールにより,病変感受性の高い表現学習と旧カテゴリバイアスの軽減を実現する。
    • 複数のベンチマークにおいて,既存の最先端手法と比較して平均8.5%の精度向上,Kvasirデータセットでは誤検出率を大幅に低減した。

    Link: https://arxiv.org/abs/2607.27620

  • 暗所画像強調のための無参照忠実度予測器 BlindPSNR [cs.CV]目的:暗所画像強調の忠実度予測における手法
    • 暗所画像強調は,可視性を向上させる重要な技術であり,様々な応用分野で利用されている。
    • 暗所画像強調のパラメータ調整は,シーンごとに最適な設定が異なり,手間と時間がかかる。
    • 本研究は,参照画像なしで暗所画像強調の忠実度を正確に予測する手法を開発し,自動的なパラメータ調整を可能とする。
    • 提案手法 BlindPSNRは,既存手法と比較して,トップ1選択精度を大幅に向上させた(54.4%から89.5%へ)。
    • BlindPSNRは,回帰誤差を0.026dBまで低減し,高い精度でPSNRを予測することを示した。
    • 本手法は,未知のデータセットに対しても高い汎化性能を発揮し,SRCCで0.61~0.67の相関を示した。

    Link: https://arxiv.org/abs/2607.27628

  • 4DHumanDiff:テキストからの4DGS生成による一貫性のある360度動的ヒューマン [cs.CV]目的:テキストプロンプトからの4D Gaussian Splatting (4DGS) で表現される動的ヒューマンの生成
    • 360度ビューの動的ヒューマンは,VR/ARなどの応用において重要な役割を担う。
    • 既存手法は,中間生成に動画を用いるため,計算コストが高く,不完全な形状や視点不整合が発生しやすい。
    • 4DGSを直接生成することで,計算コストを削減し,一貫性のある動的ヒューマン生成を実現すること。
    • 4DHumanDiffは,動画の事前生成やシーンごとの再構成を回避し,一貫性と時間的なコヒーレンスを向上させた。
    • 本手法は,1分以内で360度の動的ヒューマンを生成し,既存手法よりも10倍以上高速に推論できる。
    • 大規模なテキスト-4DGSデータセットと2D正則化,学習不要な4D補間により,レンダリング品質とモーションの滑らかさが向上した。

    Link: https://arxiv.org/abs/2607.27634

  • MMOOC:マルチモーダル大規模言語モデルにおける文脈外評価のための包括的ベンチマーク [cs.CV]目的:マルチモーダル大規模言語モデルの文脈外評価に関するベンチマーク
    • マルチモーダル大規模言語モデルは多様なタスクで性能を発揮するが,文脈の変化に弱い点が課題である。
    • 既存のベンチマークは文脈外評価に偏っており,文脈が部分的に変化した質問への対応力が測れていない。
    • 文脈の変化に対応したモデルの拒否能力と堅牢性を評価するベンチマークの提供。
    • MMOOCは,41Kを超える画像と質問のペアから構成され,文脈の変化の種類と状況を網羅的に評価する。
    • 実験の結果,既存のモデルは文脈の変化に対応した応答と拒否のバランスを取ることに課題があることが示された。
    • 事後学習により,モデルの堅牢性を向上させることが可能であることが示唆された。

    Link: https://arxiv.org/abs/2607.27637

  • カラーグレーディングの学習:写真共有なし。パーソナライズされた画像強化のための連合美的嗜好学習 [cs.CV, cs.AI, cs.DC]目的:パーソナライズされた画像強化のための美的嗜好学習
    • 画像処理技術は,写真や映像の品質向上に不可欠であり,多様な応用分野で需要が高まっている。
    • 個人の美的嗜好を反映した画像強化は難しい。プライベートな写真や評価の収集が困難であり,プライバシー保護の観点からも課題がある。
    • 中央集権的なデータ収集を伴わずに,分散された環境で個人の美的嗜好を学習し,効率的な画像変換を実現することを目指す。
    • 本研究では,Federated Aesthetic Preference Learning (FedPAIE)という新しいフレームワークを提案し,ユーザーのプライバシーを保護しながらパーソナライズされた画像強化を可能にした。
    • FedPAIEは,軽量なデュアルキュー美的スコアラーを学習し,ローカルなサポートセットでパーソナライズされたスコアラーに校正することで,自然な色の変化を実現する。
    • 実験結果から,FedPAIEはオープンワールドでのパーソナライズに有効であり,ユーザーの好みと画像の忠実度のバランスが良いことが示された。

    Link: https://arxiv.org/abs/2607.27659

  • 表現学習のためのサブモジュラー情報尺度に基づく目的関数:分散と分離の視点 [cs.LG, cs.AI, cs.CV]目的:表現学習におけるサブモジュラー情報尺度に基づく目的関数の幾何学的・統計的特性の解明
    • 表現学習は,機械学習の基盤技術であり,多様な応用分野において重要な役割を担う。
    • サブモジュラー情報尺度を用いた表現学習は成功を収めているものの,その特性は十分に理解されていない。
    • 異なるサブモジュラー情報尺度が生み出す幾何学的・統計的特性を理論的に解明し,目的関数の選択指針を提供する。
    • 総情報量(TI)目的関数はクラス内構造を特徴づけ,グラフカットTIはクラス内分散を,LogDet TIは一般化された分散と共分散量を回復する。
    • 相互情報量(MI)目的関数はクラス間構造を捉え,グラフカットMIは重心分離とFisher判別に,LogDet MIはMahalanobis距離による分離に,Facility Location MIは最近傍モード表現の重複を計測する。
    • 合成実験により,理論的解明と実験結果の一致が確認され,サブモジュラー情報尺度に基づく目的関数の設計に関する指針が得られた。

    Link: https://arxiv.org/abs/2607.27660

  • 証拠ポートフォリオ:閉じたマルチモーダル回答における単一の事前入力リスク検出 [cs.CV]目的:マルチモーダル大規模言語モデルの信頼性評価手法
    • マルチモーダルLLMの信頼性確保は,実用化において重要である。
    • 自信度スコアだけでは,視覚的根拠の信頼性を判断できない。
    • 視覚的根拠を層ごとに分析し,信頼性の高い回答を特定する。
    • 提案手法WEPは,予測された候補を支持または反駁する視覚的貢献を層ごとに推定する。
    • WEPは,質問関連の証拠の系統と符号付き証拠の集中という2つの解釈可能な経路ファミリーを要約する。
    • 3つのMLLMと4つの二値回答ベンチマークで,平均エラーAPが0.134向上した。

    Link: https://arxiv.org/abs/2607.27667

  • JigShape:VLMにおける視覚幾何学的推論の評価 - ジグソーパズルを通じて [cs.CV, cs.AI]目的:VLMにおける視覚幾何学的推論能力の評価
    • 視覚情報と言語の統合は,AIの重要な課題であり,高度な推論能力が求められる。
    • 既存のジグソーパズルベンチマークは,曖昧な正解を含むため,正確な評価が困難である。
    • 明確な正解を持つジグソーパズルベンチマークを構築し,VLMの幾何学的推論能力を検証する。
    • 既存の最先端VLMは,ジグソーパズルにおいて幾何学的推論能力が著しく低いことが示された。
    • 教師ありファインチューニングは4x4パズルで高い精度を達成するものの,より大きなグリッドでは性能が急激に低下する。
    • この「スケーリングの崖」は,現在のアーキテクチャではピース数の増加に対応した制約充足が困難であることを示唆する。

    Link: https://arxiv.org/abs/2607.27670

  • RefineSVG:画像からSVG生成のための視覚フィードバック駆動型強化学習 [cs.CV, cs.AI]目的:画像からSVG生成における高精度化
    • 画像生成技術は,デザインやデータ可視化において重要であり,その効率と品質向上が求められている。
    • 既存手法では,複雑な画像に対して幾何学的なずれや誤りが発生しやすく,視覚的な誤認を生じやすい。
    • 視覚フィードバックループを用いて,モデルが自己修正を行い,SVG生成の精度と効率を向上させる。
    • RefineSVGは,視覚フィードバックを利用することで,既存手法と比較して再構成精度,構造精度,コード効率において一貫して高い性能を示す。
    • Diff-Mapと呼ばれる多次元の視覚残差マップをReAct形式の修正信号としてモデルに提供し,ターゲットとなる画像との比較を通じて自己修正を促す。
    • SVGに特化したセマンティック語彙を導入することで,トークンシーケンスを52%以上圧縮し,効率的な処理を実現している。

    Link: https://arxiv.org/abs/2607.27699

  • VLMにおける意味的ずれに対するロバストな視覚トークン削減:推論前に較正 [cs.CV]目的:視覚言語モデルにおける意味的整合性を維持した視覚トークン削減手法
    • 大規模視覚言語モデルの利用拡大には,計算コストの削減が不可欠である。
    • 既存のトークン削減手法は,効率化に偏重し,意味的整合性の検証が不十分である。
    • 視覚トークン削減時の意味的ずれを抑制し,モデルの理解精度を維持すること。
    • 提案手法CaReは,モデルへの影響が安定した較正アンカーを特定し,信頼性の高い信号を注入する。
    • 多様なVLMアーキテクチャとベンチマークにおいて,既存手法を上回る性能を示す。
    • 94.4%のトークン削減を行いながら,元の性能の96.4%を維持し,推論速度を最大2.30倍に向上させる。

    Link: https://arxiv.org/abs/2607.27700

  • PrintAnything:3DプリンティングGコード生成のための中間表現学習 [cs.CV]目的:3D点群からの3DプリンティングGコードの直接生成
    • 3D形状の基本的な表現として点群が広く利用されている。
    • 多くの3Dプリンティングパイプラインは,点群の直接利用を妨げる防水メッシュを必要とする。
    • 点群からメッシュ再構成を経ずに,直接Gコードを生成することで問題を解決する。
    • 提案手法PrintAnythingは,点群から実行可能な3DプリンティングGコードを直接生成する。
    • スライス状点投影戦略により,点群を3Dプリンティングのスライス処理に適した2次元表現に変換する。
    • G-planマップにより,点群とGコードを繋ぐ統一的な表現を提供し,メッシュ依存性を排除する。

    Link: https://arxiv.org/abs/2607.27729

  • 委任された公正な分割 [cs.IR, cs.CL, cs.HC, eess.SY, cs.SY, math.OC, cs.GT]目的:中心主体と所属エージェント双方にとっての公正な資源配分
    • 組織や団体の資源配分は,社会全体の効率性と公平性を高める上で重要である。
    • 従来の公正分割は,組織内の階層構造やエージェントの多様な嗜好を考慮できない場合がある。
    • 中心主体とエージェントの双方にとっての公平性を両立する配分方法を確立する。
    • 本研究では,中心主体とエージェントの両方に対して,嫉妬のない配分を保証する効率的なアルゴリズムを提案した。
    • エージェントの比較対象を,全エージェントとする場合と,所属中心内のエージェントに限定する場合の二つの情報構造について検討した。
    • 慈善団体の食糧寄付配分など,組織内資源配分の実用的な応用可能性を示した。

    Link: https://arxiv.org/abs/2607.27743

  • 静止状態からの関節を持つ物体の再構成 [cs.CV, cs.RO]目的:関節を持つ物体の3次元形状と運動構造の復元
    • デジタルツイン構築には,現実世界の物体を忠実に再現する3次元モデルが不可欠である。
    • 既存手法は,複数の関節状態における運動観測を必要とし,静止状態からの再構成は困難である。
    • 運動観測なしに,形状,意味,運動に関する事前知識を用いて再構成を実現する。
    • 提案手法は,単一の閉じた構成から関節を持つ物体の再構成を可能にする。
    • 視覚・言語モデルとセグメンテーションモデルの出力を融合し,空間的に一貫性のある部品構造を生成する。
    • 動画拡散モデルを用いて関節仮説を生成し,幾何学的整合性によって検証することで,物理的に妥当な関節を推定する。

    Link: https://arxiv.org/abs/2607.27749

  • EgoGVAE:ガイダンス付き変分オートエンコーダによる一人称視点ボディメッシュ再構成 [cs.CV]目的:一人称視点からの頭部姿勢のみから全身メッシュを再構成する手法
    • 頭部装着デバイス等の普及により,頭部姿勢からの全身推定の重要性が増している
    • 頭部姿勢のみから全身の姿勢推定は,観測できない身体部位の推定が困難である
    • 拡散モデルよりも高速な推論が可能な,新しい再構成手法を提案する
    • 提案手法では,ガイダンスネットワークの潜在空間を活用し,頭部姿勢から自然な全身姿勢を効率的に再構成する
    • 潜在分布の類似性を強制することで,頭部姿勢のみから信頼性の高い全身姿勢を得る
    • 本手法は,拡散モデルと比較して50倍以上の高速化を実現し,ベンチマークデータセットで性能向上を実証した

    Link: https://arxiv.org/abs/2607.27755

  • カクテル・トーカ―:ターンアクションGRPOを用いた騒がしい社会環境における複数話者対話モデル [cs.SD, cs.CL, cs.MM, eess.AS]目的:騒がしい社会環境における複数話者対話モデリング
    • 音声対話システムは社会生活において不可欠であり,その自然さは利用者の満足度に直結する。
    • 従来のシステムは理想的な環境を想定しており,現実の騒がしい環境への対応が課題であった。
    • 複数話者が存在する複雑な状況下での,より自然で選択的な対話システムの実現を目指す。
    • 本研究では,応答,傾聴,無視の3つのアクショントークンを用いて,アシスタントの行動をモデル化する「カクテル・トーカ―」を提案する。
    • 教師ありファインチューニングと強化学習により,適切なアクショントークンと応答を生成する能力を獲得した。
    • LLMベースのデータパイプライン「カクテル・DialogGen」により,多様な社会環境における現実的な複数話者対話データを生成した。

    Link: https://arxiv.org/abs/2607.27756

  • DAS-PMVC:二重アラインメントと構造強化による部分多視点クラスタリングフレームワーク [cs.LG, cs.CV]目的:部分多視点クラスタリングのフレームワーク
    • データ分析において,多様な視点からの情報を統合することで,よりロバストで精度の高い分析が可能となる。
    • 異なる視点間のデータ不整合(部分多視点アラインメント問題)が,クラスタリング性能を低下させる。
    • 視点構造の一貫性と意味的関連性を活用し,部分多視点アラインメント問題を解決する。
    • DAS-PMVCは,アンカーグラフ構造アラインメント,構造強化特徴学習,二重アラインメント戦略の3要素から構成される。
    • アンカーポイントの関係に基づき,潜在空間の一貫性を保ったサンプル埋め込み表現を導出し,初期アラインメントを行う。
    • 様々なデータセットにおける実験結果は,DAS-PMVCが最先端手法を上回り,その有効性と優位性を示す。

    Link: https://arxiv.org/abs/2607.27761

  • ImageCLEFmedical 2026におけるDS@GT ARC: 概念検出のためのアーキテクチャ多様性と,医療画像解析におけるキャプション予測のための基礎モデルのスケーリング [cs.CV, cs.IR, cs.LG]目的:医療画像に対する概念検出とキャプション予測の性能向上
    • 医療画像解析は,疾患診断や治療計画において不可欠な役割を担うため,その精度向上が重要である。
    • 医療画像に含まれる概念の自動検出や自然言語による説明生成は依然として困難な課題である。
    • 多様なアーキテクチャとモデル規模のスケーリングを通じて,医療画像解析の性能を最大限に引き出すことを目指す。
    • 概念検出タスクにおいて,ConvNeXt-V2,BiomedCLIP,DenseNet-169のアンサンブルがF1スコア0.5790で1位となった。
    • BiomedCLIP埋め込みを用いた訓練不要なKNN検索パイプラインは,アンサンブルと同等の性能を低いコストで実現した。
    • キャプション予測タスクでは,Gemma-3 27Bモデルが0.3571で3位となり,モデル規模と学習コストの多様性を示した。

    Link: https://arxiv.org/abs/2607.27763

  • 身元分離・幾何形状保存型顔蒸留によるプライベート顔認識学習データセットの公開 [cs.CV, cs.AI]目的:プライベート顔認識学習データセットのプライバシー保護と,実用性の維持
    • 顔認識技術は,セキュリティや利便性向上に不可欠。学習データセットの重要性は高い。
    • 学習データセット公開は身元情報漏洩リスクを伴う。保護手法の精度向上が課題。
    • 身元と認識用特徴を分離し,プライバシーと実用性の両立を目指す。
    • 提案手法「Private Face Distillation」は,身元情報の分離と幾何形状の維持を両立。
    • IJB-C評価において,ベースラインと比較して認識率を3.94%向上。身元特定リスクも低減。
    • プライベート顔認識学習データセット公開において,身元分離と代理ID幾何形状の保持が重要。

    Link: https://arxiv.org/abs/2607.27764

  • VocalRender:楽曲制作のためのスコアネイティブ歌声合成 [cs.SD, cs.AI]目的:楽曲制作における歌声合成の実現
    • 歌声合成技術は,音楽制作やエンターテインメント分野において重要な役割を担う。
    • 既存の歌声合成システムは,楽曲制作のワークフローとの親和性に課題がある。
    • 楽曲のスコア情報を直接利用し,より自然で制御可能な歌声合成を目指す。
    • VocalRenderは,歌詞,音程,音符の長さ,テンポから直接歌声を合成するスコアネイティブシステムである。
    • Interleaved lyric--note表現と自己回帰拡散モデルにより,明示的な音長予測なしに連続的な音響潜在表現を生成する。
    • 2,300時間の歌唱データで学習し,高い明瞭度,メロディ制御,話者類似性を実現。自然度CMOSで最先端のベースラインを0.42ポイント上回った。

    Link: https://arxiv.org/abs/2607.27768

  • RIPPLE:位相を生成する,復元しない [cs.CL, cs.LG, cs.SD]目的:多チャンネルの位相生成
    • 音響や地震学において,チャンネル間位相関係は信号の物理的特性を表現する上で重要である。
    • 既存手法では位相を独立に復元するため,チャンネル間の位相関係が失われることがある。
    • チャンネル間位相関係を維持しつつ,より高精度な位相生成を目指す。
    • RIPPLEはGriffin-Lim法を位相の事前分布と捉え,チャンネル間構造を保持しながら位相を洗練させる。
    • 環境音響伝達実験と地震波形変換実験の両方で,既存の復元パイプラインを上回る性能を示した。
    • 地震波形変換実験では,S波偏波誤差を大幅に低減することに成功した。

    Link: https://arxiv.org/abs/2607.27775

  • CXR-Retrieve:胸部X線写真における合成的なテキスト-画像検索 [cs.CV]目的:胸部X線写真のテキスト-画像検索における構成要素の理解
    • 医療画像診断支援において,効率的な画像検索は不可欠であり,迅速な診断を可能にする。
    • 胸部X線写真の検索は,構造化された臨床注釈ではなく,フリーテキストレポートのみに依存することが多く,困難である。
    • 短い臨床検索クエリを正確に反映した画像検索を実現し,臨床的制約を満たすことが求められている。
    • CXR-Retrieveという,胸部X線写真のテキスト-画像検索のための構造化ベンチマークを構築した。
    • 提示されたラベルを意識したコントラスティブファインチューニングにより,精度が大幅に向上した。
    • 臨床的アサーションを考慮した学習が,信頼性の高い胸部X線写真検索に必要であることが示された。

    Link: https://arxiv.org/abs/2607.27779

  • FDDWAN:透かし攻撃のための周波数分離拡散ネットワーク [cs.CV]目的:透かし攻撃手法の開発
    • デジタルコンテンツの保護のため,透かし技術は不可欠である。しかし,その脆弱性も考慮する必要がある。
    • 既存の手法では,透かしの除去と画像品質の維持の両立が難しく,トレードオフの関係にある。
    • 周波数分離と残差拡散により,透かし除去と画像品質のバランスを改善することを目的とする。
    • 提案手法FDDWANは,ウェーブレット変換を用いて周波数領域で透かし攻撃を行うことで,従来法よりも効果的に透かしを除去する。
    • 特に,透かしの頑健性と知覚品質に合わせた周波数特性に基づいた攻撃戦略が有効であることが示された。
    • CelebAとImageNetを用いた実験により,FDDWANが既存手法と比較して,透かし除去性能と視覚的品質の両面で優れていることが確認された。

    Link: https://arxiv.org/abs/2607.27800

  • LoMeVQA:時系列医療VQAの包括的ベンチマーク [cs.DM, cs.CC, math.CO, cs.CV]目的:時系列医療画像分析のための視覚的質問応答ペアの包括的ベンチマーク
    • 臨床現場では,患者の病状進行や治療効果の評価に,経時的な画像データが不可欠である。
    • マルチモーダル大規模言語モデルは急速に進歩しているが,時系列医療画像に関する視覚的推論は未開拓である。
    • 既存モデルの時系列推論能力の限界を明らかにし,改善の方向性を示すことを目指す。
    • LoMeVQAは20万6千件の時系列VQAペアで構成され,病状の分類,記述,レポート生成,差分領域の特定,記述の5つのタスクを網羅する。
    • 汎用および医療領域のMLLMはLoMeVQAで低い性能を示し,時系列推論における課題を浮き彫りにした。
    • MedLong-8Bは全タスクで最先端の性能を達成し,LoMeVQAは今後の研究開発を促進する。

    Link: https://arxiv.org/abs/2607.27806