arXiv雑要約

画像・音声 - 2026/08/04 公開

  • InfiniSplat:大規模ベースライン単眼視点合成のための暗黙的ガウスデコーディング [cs.CV]目的:単眼画像からの直接的な3Dシーン表現の生成
    • 3Dシーンの再構成は,VR/ARやロボティクスなど幅広い応用において重要である。
    • 既存手法は,ピクセルにアラインされた表現に制約され,視点移動に弱い。
    • 幾何学的な誘導サンプリングと暗黙的デコーディングにより,より正確な3D表現を構築する。
    • InfiniSplatは,表面にアラインされた表現へと移行することで,シーン表面に沿ったガウス配置を実現した。
    • 固定されたピクセル中心からのガウス予測を分離し,散乱したプリミティブを削減した。
    • NVS評価において,既存の単眼ベースラインと比較して最先端の性能を達成し,ゼロショット汎化能力を示した。

    Link: https://arxiv.org/abs/2608.02437

  • 実行ノイズ下における意図推論:社会的ジレンマにおける偶然性と認識的不確実性の分離 [cs.GT, cs.LG]目的:社会的ジレンマにおける意図推論のメカニズム
    • 社会的な相互作用の理解は,協力関係の構築や維持に不可欠である。
    • 従来のモデルでは,行動のノイズと意図の解釈が区別できず,過剰な報復が生じやすい。
    • 行動のノイズを考慮し,意図を正確に推論することで,より適切な行動選択を目指す。
    • 部分観測マルコフ決定過程(POMDP)モデルを導入し,相手の意図を潜在状態として捉えることで,ノイズの影響を軽減した。
    • 反復囚人ゲームの実験により,協力関係が崩壊するノイズの閾値を特定し,学習された事前分布との関係を明らかにした。
    • 意図推論の価値は状況依存的であり,条件付き協調的な相手に対しては優位性を示す一方,ノイズが十分な場合には信念に基づいた崩壊が起こる。

    Link: https://arxiv.org/abs/2608.02440

  • ウェーブレット由来テクスチャ特徴を用いたUAVによる離岸流指標の環境モニタリング [cs.CV]目的:離岸流指標の検出
    • 沿岸域の安全確保は重要であり,離岸流はその大きな脅威となる。
    • 離岸流の兆候は微細で,照明や波の状態に左右されやすく,検出が困難である。
    • UAVと深層学習を活用し,離岸流の兆候を正確に捉える方法を開発する。
    • ウェーブレット由来テクスチャ特徴を統合することで,RGB画像のみのモデルよりも性能が向上した。
    • 二重ストリームアーキテクチャが最も高い分類性能を示し,95%を超える精度と高い再現率を実現した。
    • チャネル置換はYOLOv8の物体検出において最も効果的で,局所化のmAP@50は94%に達した。

    Link: https://arxiv.org/abs/2608.02448

  • MoRAL:エッジ指向型自律運転に向けたコンパクトなVLMのためのセンサーに基づいたBEV推論 [cs.CV, cs.RO]目的:リソース制約のある自律運転プラットフォームにおける安全性に重要な空間推論のためのVLM展開
    • 自動運転は,安全性向上と効率化に不可欠であり,その実現には高度な知能が求められる。
    • 既存のVLMはモデルサイズが大きく,エッジデバイスでの利用が困難である。
    • センサー情報を活用し,軽量なモデルで高精度な空間推論を実現すること。
    • MoRALは,物理エンコードされた鳥瞰図(BEV)表現を読み取り,運転判断のために推論する二段階のファインチューニングパイプラインである。
    • 緊急ブレーキの再現率が10.8%から47.8%に向上し,出力の劣化は94.1%から20.8%に減少した。
    • このパイプライン全体は,量子化なしで消費型8GB GPUに42 tok/sで適合し,再現可能な基盤を確立した。

    Link: https://arxiv.org/abs/2608.02449

  • PTI:階層型シンボリックカラーアドレスシステム [cs.GR]目的:デジタルカラーの階層的シンボリックアドレス表現
    • 色彩処理は,画像処理やグラフィックスにおいて基礎となる重要な技術分野である。
    • 従来の階層的カラー処理システムでは,計算後の辿り方情報が失われるという課題があった。
    • この研究は,辿り方情報を保持し,色の系統を直接的に表現可能なアドレスシステムの構築を目指す。
    • PTIは,RGBカラーキューブの再帰的二分分割に基づき,8値の数字列としてカラーを表現する。
    • PTIは,モートンコード(Z-orderコード)と構造的に等価であり,古典的なオクトリー量子化手順によって構築される。
    • PTIのアドレス構造は,色彩カタログの整理,画像処理,および色彩の体系的な探索を可能にする。

    Link: https://arxiv.org/abs/2608.02460

  • ISRS-DETR:リモートセンシングインタラクティブセグメンテーションのための検出誘導型クリック伝播 [cs.NI, cs.CV]目的:リモートセンシング画像のインタラクティブセグメンテーションにおけるクリック伝播による効率化
    • リモートセンシング画像は地理空間情報の基盤であり,その解析は様々な応用分野で重要である。
    • 高解像度画像や小規模な対象物,疎な分布がセグメンテーションの精度を低下させる。
    • 限られたクリック数で高精度なセグメンテーションを実現し,実用性を高めることを目指す。
    • 提案手法ISRS-DETRは,検出された物体間の相関関係を利用し,クリック情報を伝播させることで,必要なクリック数を大幅に削減する。
    • 標準的なリモートセンシングベンチマークにおいて,ISRS-DETRは最先端の精度を達成し,同時にNoC-I(1画像あたりのクリック数)を大幅に減少させた。
    • このフレームワークは,RF-DETRデコーダとインタラクティブセグメンテーションバックボーンを組み合わせ,物体レベルの情報を活用する。

    Link: https://arxiv.org/abs/2608.02468

  • キャリブレーションされた類似度とグラフクラスタリングによるオープンセット動物再識別 [cs.CV]目的:オープンセット動物再識別における類似度とクラスタリングのパイプライン
    • 野生動物の個体識別は,生態調査や保護活動において重要な役割を担う。
    • 未知の個体を含む環境下での再識別は,既存手法では課題が残る。
    • 種固有の特性を考慮し,類似度を正確に評価することで再識別精度を向上させる。
    • 提案手法は,WildFusionをベースに類似度をキャリブレーションし,グローバル特徴とローカル特徴を融合することで性能を向上させた。
    • ARI(Adjusted Rand Index)において,パブリックデータで0.72124,プライベートデータで0.70393という良好な結果が得られた。
    • 種に応じた前処理を行うことで,さらなる性能向上が確認された(プライベートデータで0.71087)。

    Link: https://arxiv.org/abs/2608.02469

  • 詳細な車両損傷評価のための専用セグメンテーションによるエージェント型VLMのグラウンディング [cs.CV, cs.AI]目的:詳細な車両損傷評価における,エージェント型ビジョン言語モデルの空間的グラウンディングの改善
    • 自動車の品質管理や保険査定において,正確な損傷評価は不可欠である。
    • 微細な損傷は視覚的に曖昧で,モデルが誤認識しやすく,課題となっている。
    • VLMの誤ったグラウンディングを解消し,損傷箇所の正確な特定を目指す。
    • 専用セグメンテーションモデルとVLMを組み合わせたTinyDamageを提案した。
    • セグメンテーション損失関数に着目し,コントラスティブ損失が微細な損傷の検出精度向上に貢献することを示した。
    • セグメンテーション出力に基づいたLangGraphエージェントパイプラインにより,報告書のハルシネーション率を大幅に削減した。

    Link: https://arxiv.org/abs/2608.02470

  • 行動に基づく組織アフォーダンスが,腹腔鏡手術中の外科医の認知負荷を軽減する予測的自動フレーミングを可能にする [cs.CV, cs.AI]目的:腹腔鏡手術における外科医の認知負荷軽減
    • 腹腔鏡手術は視覚的負荷が高いが,注意資源の効率的な管理が重要である。
    • 手術意図は専門的かつ暗黙的であり,高密度な空間ラベルの取得が困難である。
    • 手動アノテーションなしで,視覚的注意の誘導を可能にするアフォーダンスラベルの生成。
    • DiffeoAffordは,微分同相制約による組織追跡と器具軌跡解析を組み合わせることで,アフォーダンスホットスポットラベルを生成する。
    • アフォーダンスラベルを用いて訓練された予測モデルは,手術関連領域を予測し,自動フレーミングシステムAffordViewを可能にする。
    • 本手法は,専門家のアノテーションや術中外科医の視線追跡と一致し,認知負荷を軽減することが実証された。

    Link: https://arxiv.org/abs/2608.02471

  • EchoCache:効率的な音声駆動型動画生成のためのエネルギー誘導型クロスモーダルキャッシュ [cs.CL, cs.CV]目的:音声駆動型動画生成における効率化
    • 動画生成技術は,エンターテイメントやコミュニケーションにおいて重要な役割を担う。
    • 拡散モデルを用いた動画生成は計算コストが高く,実用上の課題となっていた。
    • クロスモーダルなアライメントを考慮したキャッシュ機構により,生成効率を改善する。
    • EchoCacheは,音声の時間周波数エネルギーを基準としたキャッシュ更新機構を導入した。
    • 動的なタイムステップ・潜在空間キャッシュ機構と量子化されたキャッシュ管理により,効率とメモリ使用量を最適化した。
    • Wan2.2-S2Vデータセットにおいて,EMTDベンチマークで2.46倍の高速化と最高の性能を達成した。

    Link: https://arxiv.org/abs/2608.02474

  • 準教師ありハイパースペクトル画像分類のためのフェルマー活性ラプラス学習 [cs.CV, stat.ML]目的:準教師ありハイパースペクトル画像分類における手法
    • 高次元データであるハイパースペクトル画像は,地表の物質を精密に識別可能であり,農業や環境監視等への応用が期待される。
    • 十分なラベル付きデータを得ることは困難であり,効率的な学習手法が求められている。
    • 密度を考慮した距離指標とラベル伝搬を組み合わせ,少ないラベル数での高精度な分類を目指す。
    • 提案手法FALLは,全データ点間のフェルマー距離に基づくアフィニティ行列を構築し,高精度な分類を実現した。
    • 手法A-FALLは,ランドマークを用いた近似計算により,大規模なハイパースペクトル画像への適用を可能にした。
    • 実験結果から,提案手法はSalinas AとPaviaのデータセットにおいて有効性が確認された。

    Link: https://arxiv.org/abs/2608.02483

  • DyFrDet:動的な周波数抑制とラベル曖昧性解消による高精度な小物体検出へ [cs.CV, cs.AI]目的:小物体検出の精度向上
    • 画像認識技術の発展に伴い,監視カメラなどから得られる小物体検出の重要性が増している。
    • 小物体は視覚的な情報が乏しく,誤検出や位置ずれが起こりやすいという課題がある。
    • 周波数領域のノイズやラベルの曖昧性を解消し,小物体検出の精度を向上させる。
    • 提案手法DyFrDetは,動的な周波数抑制により背景ノイズを除去し,小物体を正確に検出する。
    • DyFrFPNは,低周波数の冗長性と高周波数のノイズを抑制し,小物体識別に必要な特徴を保持する。
    • LDMは,ラベルの曖昧性を確率分布でモデル化し,低解像度小物体検出の精度を向上させる。

    Link: https://arxiv.org/abs/2608.02495

  • 効率的な動画生成のためのトークン半径アテンション [cs.CV]目的:効率的な動画生成手法
    • 動画生成技術は,エンターテイメントやコンテンツ制作において重要な役割を担っている。
    • 既存の動画生成モデルは計算コストが高く,実用上の制約となっている。
    • トークンごとのアテンション需要に応じた効率的なアテンション機構を構築する。
    • 提案手法であるToken Radius Attention (TRA)は,アテンション相互作用を大幅に削減し,処理速度を向上させる。
    • TRAは,クエリのエントロピーに基づいてトークン予算を決定し,時間減衰半径を適用することで,計算コストを削減する。
    • 複数のデータセットでの実験により,TRAは生成品質を維持しつつ,1.56倍から2.05倍の高速化を実現した。

    Link: https://arxiv.org/abs/2608.02504

  • 身体なき推論?科学的仮説生成における表象の基盤と推論ループ [cs.AI, cs.CV, cs.IR]目的:科学的仮説生成における推論ループのメカニズム
    • 科学的発見は,既存の知識やデータから新たな知見を生み出す上で不可欠である。
    • 従来のAI研究では,仮説生成には現実世界との継続的な相互作用が必要とされていた。
    • 本研究は,身体的な相互作用なしでも科学的な推論が可能となるメカニズムを提案する。
    • 科学的図式は,分野を超えて対称性やトポロジーなどの共通構造を部分的に標準化する規約空間を提供する。
    • 提案する推論ループは,表象生成,モチーフ抽出,規約空間での標準化,分野間検索,同一性仮説生成,敵対的検証のステップを含む。
    • 重力波メモリ輸送モデルの図形から,弱い重力レンズ宇宙論のカイザー・スクワイア質量写像複合体との等価性という仮説が生成・検証された事例が示された。

    Link: https://arxiv.org/abs/2608.02505

  • DCT圧縮画像に対するMSEからのSSIM推定 [cs.RO, cs.RO, cs.IR, cs.MM, cs.CV]目的:DCT圧縮画像におけるSSIMの推定手法
    • 画像・映像処理の品質評価は,圧縮やストリーミングにおいて不可欠である。
    • 従来,SSIM推定には局所MSEが必要であり,計算コストが高い。
    • 大域MSEから局所MSEを推定し,効率的なSSIM推定を実現する。
    • 提案手法は,参照画像のみから局所MSEを近似することで,SSIMを高精度に推定可能である。
    • KodakとXiph Subset1データセットを用いた実験で,大域MSEよりも大幅に高い精度を達成した。
    • 本手法は,同じコンテンツの複数エンコードに適用できるため,動画にも容易に拡張可能である。

    Link: https://arxiv.org/abs/2608.02549

  • ハウス・モノトーン多水準配分における定数割当のずれは対数オーダーである [cs.GT, cs.IT, eess.SP, math.IT]目的:多水準配分における定数割当のずれの限界
    • 議席配分は民主的な意思決定において不可欠であり,公平性を担保する上で重要な研究課題である。
    • ハウス・モノトーン性,定数割当の充足,といった複数の制約を満たす配分規則の存在が未解決であった。
    • ハウス・モノトーン性を満たしつつ,定数割当を両立できる配分規則が存在するかどうかを明らかにすること。
    • 完全二分コム構造において,ハウス・モノトーンな配分系列は,ある種のずれを生じさせることが示された。
    • このずれは,コム構造のサイズDに対して対数オーダーであり,最適な最悪ケースのエラーはΘ(log D)となる。
    • したがって,十分に大きな有限のDに対して,ハウス・モノトーンな定数割当規則は存在しないことが結論付けられた。

    Link: https://arxiv.org/abs/2608.02559

  • ReMiX-MAE:交感神経性疼痛評価のためのRGB臨床顔面ビデオからの欠損チャンネルクロスモーダル表現学習 [cs.CV]目的:交感神経性疼痛評価のための,RGB臨床顔面ビデオからの欠損チャンネルクロスモーダル表現
    • 臨床現場における疼痛評価は重要であり,客観的かつ効率的な評価手法が求められている。
    • RGB画像のみでは疼痛の兆候が捉えにくく,熱画像や深度画像は有用だが,実用性が課題である。
    • RGB画像のみでも効果的な表現学習を行い,限られた臨床データでも疼痛評価を可能にすること。
    • ReMiX-MAEは,RGB,熱,深度ビデオから転移可能な顔面表現を学習し,モダリティ欠損へのロバスト性を高める。
    • RGBのみのデプロイにおいても,SMPデータセットでRGBのみのMAEと比較して,一貫して性能を向上させた。
    • 外部データセットにおいても,ReMiX-MAEはよりロバストでラベル効率の良い転移学習能力を示した。

    Link: https://arxiv.org/abs/2608.02561

  • UEmbed:統一された疎・密マルチモーダル埋め込み [cs.CV, cs.AI, cs.CL, cs.IR]目的:疎・密マルチモーダル埋め込みモデルの構築
    • 現代の検索システムは,ウェブ検索から検索拡張生成まで,疎な検索に依存している。
    • 既存の疎な検索手法は,語彙的マッチングに限定され,より豊かな意味表現が課題である。
    • テキストとマルチモーダル入力を統合し,疎・密埋め込みを統一するモデルを開発する。
    • UEmbedは,テキストとマルチモーダル入力を単一の因果的フォワードパスで処理し,疎な表現と密な表現を同時に生成する。
    • UEmbed-9BはMMEB-v2で71.8(密),71.0(疎)を達成し,公開データで訓練された既存のマルチモーダル埋め込みモデルを上回る性能を示した。
    • BEIRにおいても,強力な疎・密ベースラインと同等の競争力がある。効率性,実用性,エージェントアプリケーションにおいても有用性が確認された。

    Link: https://arxiv.org/abs/2608.02583

  • CAPEval:理解と生成における分離型キャプション評価 [cs.CV]目的:キャプションの理解度と生成における評価の分離
    • 画像とテキストの理解,および画像生成において,キャプションは重要な役割を果たす。
    • 従来の評価指標はキャプションの質を一括評価するため,視覚情報の網羅性と主張の正確性を区別できない。
    • 視覚情報の網羅性と主張の正確性を分離評価することで,より詳細な分析と適切なキャプション選択を可能にする。
    • CAPEvalは,キャプションの質を「網羅性」と「正確性」に分解し,人間が作成した正解データとアトミックチェックリストを用いる。
    • 実験の結果,網羅性は画像理解の性能と相関し,正確性は画像生成の性能と相関することが示された。
    • この分離型評価は,キャプションの質の診断を詳細化し,ダウンストリームタスクに適したキャプション選択の指針を提供する。

    Link: https://arxiv.org/abs/2608.02589

  • VR3D:航空画像と地上画像間の人物再識別のための頑健な3次元表現学習 [cs.CV]目的:航空画像と地上画像間の人物再識別における,視点に依存しない3次元表現の学習
    • 人物再識別は,監視カメラやロボットなど,多様な応用において重要な技術である。
    • 航空画像と地上画像間の再識別は,視点の違いによる大幅な形状変化や遮蔽が課題となる。
    • VR3Dは,3次元空間を利用することで,視点の違いに強い表現を獲得し,再識別精度を向上させる。
    • 提案手法VR3Dは,2次元画像を3次元空間にマッピングし,視点に依存しない特徴量の相互作用を可能にする。
    • 3次元形状と意味情報を考慮したアテンション機構により,2次元パッチと3次元ボクセルの対応関係を確立する。
    • 信頼度を考慮した融合により,視点変化や再構築誤差による表現の信頼性のばらつきに対処する。CARGOデータセットでRank-1精度が5.63%向上した。

    Link: https://arxiv.org/abs/2608.02598

  • WorldExam:見かけ上の外観から固有の反応性までのワールドモデルのベンチマーク [cs.CL, cs.CV]目的:生成された動画における世界の固有の反応性の評価
    • 動画生成モデルはワールドモデルとして発展しており,その評価は重要性を増している。
    • 既存のベンチマークは主に視覚的品質や明示的な指示への対応を評価しており,世界の反応性は未評価である。
    • 入力に明示されていない結果を推論し,それらしい帰結を生成する能力,すなわち世界の反応性を評価すること。
    • WorldExamは,視覚的品質,制御の正確性,空間的一貫性,世界の反応性の4つのレベルを持つ階層的な診断ベンチマークである。
    • 評価の結果,カメラ駆動モデルはカメラ制御に優れるが動的なインタラクションは苦手であり,アクション駆動モデルは対象の制御は正確だが世界の反応は乏しいことが示された。
    • 言語駆動モデルはインタラクションに優れるが,複雑な制御への対応は不十分である。いずれのモデルも,高い視覚品質と指示への対応だけでは,固有の反応性を保証できないことが明らかになった。

    Link: https://arxiv.org/abs/2608.02603

  • 3D頸動脈MRIにおけるプラーク脆弱性自動診断のための,テキストガイダンス型変分マルチモーダル知識蒸留ネットワーク(VMD) [cs.CV, cs.LG]目的:頸動脈プラーク脆弱性の自動診断
    • 近年,多様なモダリティのデータ活用が注目され,診断精度の向上が期待されている。
    • 3D頸動脈MRI画像からのプラーク脆弱性診断は,専門医にとっても困難な課題である。
    • 限られた画像アノテーションと放射線科医の知識を活用し,診断精度を向上させる。
    • 提案するVMD戦略は,限られたデータからクロスモーダルな事前知識を効果的に活用できる。
    • 内部データセットを用いた実験により,VMD戦略の有効性が確認された。
    • 放射線科医の専門知識を組み込むことで,3D MRI画像の診断精度を向上させることができた。

    Link: https://arxiv.org/abs/2509.11924

  • 事後分散は制約マップであり,誤差マップではない:疎視点CTにおける放射ガウススプラッティングの閉形式不確実性 [cs.CV, cs.LG, eess.IV]目的:疎視点CTにおける放射ガウススプラッティングの不確実性評価方法の改善
    • CT画像再構成は医療診断に不可欠であり,より正確な不確実性評価が求められている。
    • 既存の不確実性マップは,必ずしも真の誤差を反映しているとは限らないという課題がある。
    • 事後分散を制約マップとして捉え,誤差をより正確に評価する手法を確立することを目指す。
    • 事後分散は,データ制約を示すマップであり,誤差を示すマップではないことが示された。
    • 提唱手法は,公式ベンチマークにおいて真の誤差との相関が15シーン中14シーンで確認された。
    • ポスターの温度スプレッドを削減する再パラメータ化により,シーン間の汎化性能が向上した。

    Link: https://arxiv.org/abs/2607.13682

  • 非公開の情報を持つ受信者を説得するための学習 [cs.GT, cs.LG]目的:ベイズ説得における受信者の行動への影響
    • 情報開示戦略は,経済学,政治学,マーケティングなど幅広い分野で重要である。
    • 受信者が外部の情報源も参照する場合,送信者の情報開示戦略設計は困難となる。
    • 受信者の未知のシグナリングスキームを学習し,最適な説得戦略を見つけることを目指す。
    • 本研究では,受信者のシグナリングスキームを学習するアルゴリズムを開発した。
    • このアルゴリズムは,後悔 bound が $\widetilde{O}(T^{3/4})$ を達成する。
    • 問題の本質を,一次元の変更点検出問題に帰着させることで,効率的な学習を実現した。

    Link: https://arxiv.org/abs/2607.28342

  • 光ネットワークにおけるグローバル特徴を用いた検索ベースのクロスドメイン汎化 [eess.SP, cs.CV, cs.IR, cs.LG, cs.NI]目的:光ネットワークにおけるクロスドメイン品質推定
    • ネットワークの自動化は重要であり,そのためにはロバストな品質推定が不可欠である。
    • 既存手法は,特定のドメインに依存した決定境界に頼り,汎化性能が低いという課題がある。
    • ドメイン固有の決定境界に頼らず,転移可能な特徴表現を活用することで汎化性能を高める。
    • 提案手法は,ゼロショットおよび少量ショット適応をモデルの再学習なしに実現できる。
    • クロスドメイン品質データセットでの実験により,従来の機械学習ベースラインやコントラスト学習アプローチと比較して,汎化性能が向上することが示された。
    • 検索ベースの推論が,ロバストな光ネットワーク自動化に貢献する可能性が示唆された。

    Link: https://arxiv.org/abs/2608.00044

  • 画像圧縮のための高速学習可能な多線形基底 [eess.IV, cs.CV, cs.LG, math.OC, quant-ph]目的:画像圧縮における多線形基底の探索と最適化
    • 画像・動画圧縮は,データ容量の削減と効率的な伝送に不可欠であり,その重要性は高い。
    • 従来の変換基底は固定されており,データセットに最適化されていないため,圧縮効率に限界がある。
    • データセットに合わせて最適化された多線形基底を学習することで,圧縮効率の向上を目指す。
    • 提案手法は,既存の固定変換基底と比較して,自然写真や線画の圧縮性能を改善した。
    • Quick Drawの線画圧縮において,同じ再構成品質でJPEGの8x8ブロックコサイン変換よりも約20%少ないバイト数で画像を保存可能となった。
    • 多線形基底は,パラメータ数を画像サイズに対して対数的に抑えつつ,可逆性と高速性を維持している。

    Link: https://arxiv.org/abs/2608.00053

  • FDIR:損失圧縮画像復元における忠実性と人間・機械の好みの調和 [eess.IV, cs.CV, cs.LG]目的:損失圧縮画像復元における,忠実度,人間知覚,機械の好みのトレードオフの解消
    • 画像復元技術は,画像処理の基礎であり,様々な応用分野で重要性が増している。
    • 既存手法は,忠実度,知覚,機械の好みのいずれか一方に偏り,バランスが課題である。
    • 忠実度,知覚,機械の好みの三要素を同時に最適化する新しい手法を開発すること。
    • FDIRは,潜在空間で大域的な意味構造を回復するQO-Flowと,ピクセル空間で高周波テクスチャを復元するFCDRの二段階構造を採用している。
    • 実験の結果,FDIRは既存手法よりも優れた忠実度,知覚と忠実度のバランス,機械の好みを実現した。
    • FDIRは,生成的な幻覚を抑制し,ダウンストリームタスクの精度を向上させることに貢献する。

    Link: https://arxiv.org/abs/2608.00111

  • RPL-UIE:水中画像強調のための信頼性のある事前学習 [eess.SP, cs.NI, eess.IV, cs.CV]目的:水中画像強調における信頼性のある事前学習手法
    • 水中画像は,水中の光の吸収・散乱により画質が劣化し,視覚的な認識が困難になるため,視覚的認識の精度向上が重要である。
    • 既存の生成モデルでは,情報損失が大きく,復元された画像に意味的なずれが生じる場合がある。
    • この研究では,参照画像なしで,より信頼性の高い画像強調のための指針を提供することを目指す。
    • 提案手法RPL-UIEは,教師・生徒モデルの二段階構造を採用し,信頼性の高い空間的特徴を学習する。
    • 残差事前学習拡散(RPRD)と周波数認識事前学習残差較正(FPRC)により,教師モデルと生徒モデル間の事前学習のずれを低減する。
    • 複数の水中画像強調ベンチマークにおける実験で,競争力のある復元性能と,水中物体検出・インスタンスセグメンテーションにおける有用性が示された。

    Link: https://arxiv.org/abs/2608.00137

  • 単一CMRスライスからの左室局所化と短軸面推定の自動化 [eess.IV, cs.CV]目的:左室の局所化と3次元方向推定
    • 心臓MRI画像は心機能評価に不可欠であり,正確な左室の方向推定が重要となる。
    • 従来の方向推定法は離散的な分類や複数スライスの幾何学的交差に依存し,汎用性に課題があった。
    • 単一スライスからの連続的な3次元方向推定を実現し,よりロバストな解析を目指す。
    • 提案手法であるPolar-Coupled Circular (PCC)埋め込みは,連続的かつ一意な方向表現を可能にした。
    • 構築したベンチマークデータセットを用いた実験で,平均mIoU 86.18%,角度偏差3.39度を達成した。
    • 本研究は単一スライスでの左室方向モデリングという新たな課題設定を確立し,空間情報を考慮したCMR解析の枠組みを提供する。

    Link: https://arxiv.org/abs/2608.00145

  • 正規アンカーを用いた第一階モデル非依存メタ学習によるWhisperのファインチューニング:口唇口蓋裂音声認識の公平性向上 [physics.data-an, cs.PF, physics.ins-det, eess.SP, cs.SD, eess.AS]目的:口唇口蓋裂(CLP)音声認識における公平性向上のための手法
    • 口唇口蓋裂音声認識は,医療現場でのコミュニケーション支援に不可欠であり,その精度向上が求められている。
    • CLP音声は重症度によって音響的・発音器官的特徴が異なり,既存の音声認識システムでは性能が低下しやすい。
    • 本研究は,重症度間の性能格差を縮小し,CLP音声認識のロバスト性を向上させることを目指す。
    • NA-FOMAMLを用いることで,口唇口蓋裂音声認識における重症度間での性能差を縮小できることが示された。
    • NMCPCデータセットでは,通常の音声に軽度・中等度の音声を加えた設定で,単語誤り率(WER)が4.40%に低下した。
    • 重度の口唇口蓋裂音声については,依然として高いエラー率が認められ,さらなる改善が必要であることが示唆された。

    Link: https://arxiv.org/abs/2608.00186

  • MedSAM2-Anatomy:訓練不要な推論時最適化による筋骨格セグメンテーション [eess.IV, cs.CV, cs.LG]目的:筋骨格セグメンテーションの精度向上
    • 外科手術計画において,高精度な3Dセグメンテーションが不可欠である。
    • 既存のセグメンテーションモデルは,ドメインの変化に弱く,汎用性に課題がある。
    • 推論時に最適化を行うことで,既存モデルの性能を改善し,手動での調整を不要にすること。
    • 推論時最適化により,股関節MRIのDice係数が0.71から0.92に,肩関節CTでは0.89から0.92へと向上した。
    • 股関節MRIのHD95距離は,22.0mmから5.0mmへと大幅に減少した。
    • TotalSegmentatorベンチマークにおいて,専門家モデルが依然として最良の結果を示すことから,最適な融合戦略は専門家モデルの信頼性に依存することが示唆された。

    Link: https://arxiv.org/abs/2608.00195

  • 局所的な視覚と病理学的意味の整合性を学習し,放射線レポート生成に活用する [astro-ph.IM, cs.SY, eess.SP, eess.SY, eess.IV, cs.CV]目的:放射線レポート生成における,視覚的特徴とテキスト的特徴の整合性向上
    • 放射線診断において,画像とレポート間の整合性は,正確な診断と治療に不可欠である。
    • 既存手法では,関連する病理学的意味を持つレポートを分離してしまう場合があり,整合性が損なわれる。
    • 病理学的プロトタイプを通じて視覚的特徴とテキスト的特徴を整合させ,病理概念に基づく表現学習を目指す。
    • 提案手法PALMは,共有病理プロトタイプを用いて画像とテキストの特徴を整合させ,臨床的に意味のある橋を構築する。
    • また,Masked Evidence Modelingにより,画像エンコーダーが局所的な放射線学的証拠に対する感度を高める。
    • MIMIC-CXR,IU X-Ray,MIMIC-ABNでの実験により,PALMがレポート生成と異常検出のロバスト性を一貫して向上させることが示された。

    Link: https://arxiv.org/abs/2608.00279

  • REIMU:SSLベースの音声ディープフェイク検出のための効率的な異種階層的推論 [physics.class-ph, cs.SY, eess.SY, eess.AS, cs.AI, cs.SD]目的:音声ディープフェイク検出における効率的な異種階層的推論手法
    • 近年,音声合成技術の向上により,メディアの信頼性や音声認証の安全性が脅かされている。
    • 自己教師あり学習はディープフェイク検出に有効だが,従来のバックボーンではSSL表現の活用が不十分である。
    • 異種階層的推論を用いることで,パラメータ効率の良いディープフェイク検出を実現することを目指す。
    • 再帰的階層的推論は必ずしも検出性能を向上させないが,異種演算子の組み合わせがより競争力のある構成となる。
    • 異種設計は,ベースラインと同等の性能を維持しながら,下流パラメータを10.8%削減できる。
    • この結果は,パラメータ効率の良い音声ディープフェイク検出の可能性を示す。

    Link: https://arxiv.org/abs/2608.00857

  • 非同期価格更新下におけるアルゴリズムによる共謀 [math.OC, cs.RO, econ.TH, cs.GT]目的:アルゴリズム的共謀の発生における,エージェントの更新の非同期性の影響
    • 価格設定アルゴリズムの普及に伴い,競争への影響が懸念されているため。
    • アルゴリズムが意図せず共謀的な価格設定を行う可能性が指摘されている。
    • 非同期更新がアルゴリズム的共謀に及ぼす影響を明らかにすること。
    • 非同期性は,特にステートレスなアルゴリズムにおいて,共謀を阻害する傾向がある。
    • 競争相手の過去の価格を条件とするアルゴリズムの場合,非同期性への共謀の感受性は,アクセスできる情報の種類によって異なる。
    • これらの結果は,アルゴリズム的価格設定の規制に示唆を与える。

    Link: https://arxiv.org/abs/2608.01406

  • 固定情報構造における相関均衡ペイオフ集合は閉であるとは限らない [math.CO, cs.DM, econ.TH, cs.GT, math.PR]目的:相関均衡ペイオフ集合の閉性に関する研究
    • ゲーム理論において,均衡ペイオフ集合の性質を理解することは,合理的な行動を予測する上で不可欠である。
    • 既存の研究では,固定情報構造における均衡ペイオフ集合の閉性が保証されているとは限らない点が課題となっていた。
    • 本研究は,均衡ペイオフ集合が閉であるとは限らない具体的な例を示すことで,この問題に迫る。
    • 相関均衡ペイオフ集合が閉であるとは限らない例として,符号相関が上限$\rho<1$に達する2つの公平な符号列を用いる3人ゲームが提示された。
    • このゲームでは,均衡ペイオフ集合が$(0,0,t)$の開区間($-\rho
    • 客観的な公共ランダム化装置が存在する場合でも,主観的な事前分布の違いにより,実行可能ペイオフ集合が閉にならない場合があることが示された。

    Link: https://arxiv.org/abs/2608.01515

  • 画像を用いた製品品質の測定:CLIP Q-Scoreとその不動産への応用 [econ.GN, cs.CY, q-fin.EC, econ.EM, cs.CV]目的:製品品質の客観的指標
    • 視覚情報は製品評価において重要であり,市場の動向を把握する上で不可欠である。
    • 従来の品質評価は主観的であり,再現性や効率性に課題があった。
    • 視覚データから客観的かつ効率的に品質を測定する手法を確立すること。
    • CLIP Q-Scoreは,視覚データから製品品質を客観的に測定する新規手法として有効であることが示された。
    • 不動産データへの応用により,本指標が販売および賃貸価格の強力な予測因子となることが確認された。
    • CLIP Q-Scoreが高い物件ほど流動性が高く,市場に流通するまでの時間が短いことが明らかになった。

    Link: https://arxiv.org/abs/2608.01544

  • SGAD:状態誘導型適応的決定フレームワークによるロバストな脳波ベース聴覚注意切り替えデコーディング [math.CO, cs.DM, eess.SP, cs.SD]目的:脳波に基づく聴覚注意切り替えデコーディングのロバスト性向上
    • 高度な補聴器の開発には,聴覚注意を正確に読み取る技術が不可欠である。
    • 脳波の非定常性により,連続的な意思決定が難しく,信頼性の高いデコーディングが課題である。
    • 脳波の特性変化に対応し,よりロバストな聴覚注意切り替えデコーディングを実現すること。
    • 提案手法SGADは,因果的状態検出と状態誘導型適応的ゲーティングにより,デコーディング精度と安定性を向上させた。
    • 音声,話者,被験者といった多様な条件において,低い応答遅延を維持しながら高い性能を示した。
    • 評価プロトコル間の性能変動は,データ分割に関するバイアスの存在を示唆している。

    Link: https://arxiv.org/abs/2608.01618

  • SAGE:スイッチを考慮した脳波誘導ソフトゲーティングによる話者切り替わり時のターゲット話者抽出 [eess.SP, cs.SD]目的:ターゲット話者抽出のロバスト性向上
    • 聴覚注意の切り替わりは脳活動に影響を及ぼし,音声処理において重要な課題である。
    • 従来の脳波誘導法は,話者切り替わり時にノイズや遅延の影響を受けやすく,不連続性が生じやすい。
    • 話者切り替わりを動的な選択として捉え,スムーズな融合と遷移アーティファクトの抑制を目指す。
    • SAGEは,ロバストな分離器と脳波誘導のスイッチ対応ゲーティングモジュールにより,スムーズな融合重みを生成する。
    • 遅延補正アライメントと不確実性駆動型保守的戦略により,遅延のずれと脳波の信頼性変動に対応する。
    • SAGEは,ベースラインと比較して,SI-SDRで8.67dB,STOIで88.24%を達成し,平均切り替わり遅延を2.04秒に削減した。

    Link: https://arxiv.org/abs/2608.01623

  • 変化点検出における検出器非依存な変動要因特定と有限サンプル誤り制御 [stat.ME, cs.AI, cs.CV]目的:多変量時系列データの変化点における変動要因の特定
    • 時系列分析において,変化点の検出だけでなく,どの変数が変化したかを特定することが重要である。
    • 既存手法では,特定された変動要因の信頼性保証が不十分であるか,誤り制御が限定的である。
    • 変化点検出器に依存せず,変動要因を正確に特定し,誤り制御を保証することを目的とする。
    • 提案手法ARMは,任意の検出器で特定された変化点に対し,変動要因を証明付きで特定する。
    • 座標ごとの順位統計量を用いることで,検出器の精度や推定方法に依存しない証明が可能となる。
    • シミュレーションおよび金融時系列データ分析により,ARMは高い精度と信頼性を示すことが確認された。

    Link: https://arxiv.org/abs/2608.01691

  • SwanTale:指示およびゼロショットタスクのための統一的な多話者音声・オーディオ生成 [eess.AS, cs.SD]目的:指示およびゼロショットタスクに対応する多話者音声・オーディオ生成モデルの開発
    • アニメーション,オーディオドラマ,広告など,多様なコンテンツ制作において音声・オーディオ生成技術の重要性が高まっている。
    • 既存技術では,参照音声なしでの声の設計や,自然言語による話者スタイルの制御が困難である。
    • 本研究では,指示とゼロショットの両タスクに対応し,高品質な多話者音声・オーディオ生成を実現する。
    • 提案手法SwanTaleは,ゼロショットおよび指示タスクにおいて主要な評価指標で優れた性能を示した。
    • 特に,複雑な指示生成において,多話者音声・オーディオを効果的に制御できることが確認された。
    • 高品質なオーディオ生成を可能にするSwanVAEや,報酬に基づく品質制御,Engram conditioningなどが貢献している。

    Link: https://arxiv.org/abs/2608.02023

  • ケニアにおける蜜源樹種の分布マッピング:ハイパースペクトルを用いた教師なしドメイン適応による一類分類 [eess.IV, cs.CV]目的:ケニアにおける蜜源樹種の分布マッピング
    • ケニアの農牧コミュニティにとって,養蜂業は生計の多様化に貢献しうる重要な産業である。
    • 蜜源樹種の正確な空間分布に関する知識が不足しており,養蜂業の発展が制約されている。
    • 限られたラベルデータで単一の対象種を検出する一類分類を,ドメイン適応によって汎化性能を高める。
    • 提案手法HyUDA-Oneは,ケニアのサバンナ地帯における3種類の蜜源樹種の分布マッピングにおいて有効性を実証した。
    • 教師ありデータで学習したドメインにおいて,Senegalia mellifera, Vachellia tortilis, Commiphora africanaのF1スコアはそれぞれ0.788, 0.845, 0.768であった。
    • 教師なしデータで評価したドメインでは,Senegalia melliferaとVachellia tortilisのF1スコアはそれぞれ0.756と0.884であった。

    Link: https://arxiv.org/abs/2608.02045

  • ハイパーネットワーク制御幾何学的深層学習による脳組織微細構造推定のプロトコル汎化 [eess.IV, cs.CV]目的:脳組織微細構造推定におけるプロトコル汎化の実現
    • 脳の微細構造解析は,神経疾患の診断や治療効果の評価に不可欠である。
    • 既存の機械学習モデルは,拡散MRIのプロトコル変更に弱く,再学習が必要となる。
    • 拡散値やb-ベクトルの異なるプロトコルに対しても汎化性能を持つモデルの開発。
    • 提案手法は,合成データおよび実データにおいて,従来のNODDIフィッティングとの高い一致度を示した。
    • これにより,未知の拡散値に対しても頑健性が向上し,再学習の必要性を低減できることが示された。
    • b-値とb-ベクトルの汎化,回転不変性を組み合わせることで,臨床応用への道が開かれる。

    Link: https://arxiv.org/abs/2608.02053

  • 学習ベースの手法と比較した変形画像登録のためのアクセスしやすい解法 [physics.soc-ph, cond-mat.stat-mech, cs.MA, nlin.AO, eess.IV, cs.CV]目的:変形画像登録タスクに対する,自己パラメータ自動設定可能な分析手法の実装
    • 医療画像解析において,画像登録は不可欠な要素である。厳密な物理制約を満たす必要がある。
    • 深層学習は高速化を実現する一方,解釈可能性が低いという課題がある。
    • 深層学習と同等以上の性能を持つ,解釈可能な分析手法を提示する。
    • 提案手法は,Lung250M-4Bベンチマークにおいて,最先端の結果を達成した。
    • 既存の深層学習手法や他のpTVreg変種と比較して,大幅に優れた性能を示した。
    • 実装コードは公開されており,様々な変形画像登録タスクに適用可能である。

    Link: https://arxiv.org/abs/2608.02248

  • ロバストなスケールフリーオークション [math.OC, cs.SY, eess.SY, q-fin.GN, cs.CE, q-fin.CP, econ.TH, cs.GT]目的:入札者の価値分布に関する事前知識が限定的な状況下におけるオークション設計
    • オークションは,資源配分と収益確保の効率的な手段であり,経済学における重要な研究テーマである。
    • 入札者の価値分布が不明確な場合,最適なオークション設計は困難となる。
    • スケール不変な制約下で,事前知識に依存しない最適なオークションメカニズムを特定すること。
    • 入札者の価値分布が単調ハザード率を持つ場合,第二価格オークションが最適であることが示された。
    • 2人の入札者に対しては,第二価格オークションと相対的マークアップオークションの混合メカニズムが最適となる。
    • 標準的なオークションメカニズム(最高入札者への割り当て)に制限を設けることは,収益を減少させる可能性がある。

    Link: https://arxiv.org/abs/2608.02479

  • 複数集団における選好の進化 [cs.GT]目的:複数集団環境下における選好進化
    • 経済学や生物学において,個人の選好は行動や進化の根幹をなす重要な要素である。
    • 集団間の相互作用や情報伝達が限られている状況下での選好進化のメカニズムは未解明な部分が多い。
    • 選好の観察可能性が変化する場合における安定性とロバストネスを分析し,そのメカニズムを解明する。
    • 選好が完全に観察可能な場合(p=1)と全く観察不可能な場合(p=0)における安定条件を導出した。
    • 純粋戦略の結果に対して,観察可能性のわずかな変化に対するロバストネスを検証した。
    • 安定条件は,観察可能性の変化に対してある程度耐性を持つことが示された。

    Link: https://arxiv.org/abs/1808.02451

  • 複数プレイヤーゲームにおける複数変異に対する進化的に安定な選好 [cs.GT]目的:複数変異に対する進化的に安定な選好の存在条件
    • ゲーム理論は経済学,生物学などに応用され,合理的な行動原理を解明する上で重要である。
    • 現実の選好は必ずしも物質的な報酬と一致せず,進化的な安定性を分析する上で課題となる。
    • 複数変異が生じる状況下での進化的な安定性を明確化し,効率性と安定性の関係を明らかにする。
    • 単一集団および複数集団のマッチング設定において,複数変異に対する進化的な安定性の必要条件と十分条件が示された。
    • 安定性の秩序と効率性のレベルとの間には明確な関係が存在することが明らかになった。

    Link: https://arxiv.org/abs/1810.12660

  • 部分FC:単一マシンでの1000万IDの学習 [cs.NI, cs.CV, cs.DC]目的:大規模顔認識モデルの学習におけるスケーラビリティ向上
    • 顔認識技術は,セキュリティや認証など幅広い分野で不可欠であり,その高性能化が求められている。
    • 識別対象のID数が増加すると,計算量やメモリ使用量が線形に増加し,学習が困難になるという課題がある。
    • 大規模なID空間でも効率的に学習できる手法を開発し,顔認識の精度と速度を向上させることを目指す。
    • 提案手法Partial FCは,正のクラス中心を保持しつつ,負のクラス中心をサンプリングすることで,計算量とメモリ使用量を削減する。
    • 大規模データセットを用いた実験の結果,高い認識精度を維持しつつ,学習効率を大幅に向上させることを確認した。
    • ラベルノイズやID分布の偏りといった現実的な問題に対しても,高いロバスト性を示すことがわかった。

    Link: https://arxiv.org/abs/2010.05222

  • マルチビュー画像からの直接的かつ適応的なメッシュ・ガウスシーン再構成 [cs.CV]目的:マルチビュー画像からの高精度な表面形状と外観の同時復元
    • 具現化された知能のためのリアリティのあるシミュレーション環境構築には,高精度なシーン表現が不可欠である。
    • 既存手法では,形状と外観のモデリングが分離されており,局所的な変更への対応が難しい。
    • メッシュとガウスを結合することで,形状と外観を直接的に学習し,効率的な更新を可能にする。
    • 提案手法は,従来のニューラルサーフェス再構成や3DGS-to-meshパイプラインと比較して,効率とレンダリング品質を向上させる。
    • 明示的なメッシュ構造により,メッシュベースの操作が可能になり,局所的なシーン変更への適応性が高まる。
    • この表現は,スケーラブルなシーンモデリングと,具現化されたエージェントの訓練・評価のためのリアルトシム環境の効率的な維持を支援する。

    Link: https://arxiv.org/abs/2405.06945

  • 統計的形状モデリングにおける半教師ありセグメンテーション手法の有効性について [cs.CV]目的:半教師ありセグメンテーション手法の統計的形状モデリングへの適用可能性評価
    • 医学診断や手術計画等,臨床・生物医学分野において解剖学的変異の把握は重要である。
    • 統計的形状モデル構築には専門家による手動セグメンテーションが不可欠だが,時間とコストがかかる。
    • 本研究は,手動セグメンテーションの負担を軽減する半教師ありセグメンテーションの有効性を検証する。
    • 一部の手法ではノイズの多いセグメンテーションにより統計的形状モデルの品質が低下した。
    • 他の手法では,手動セグメンテーションと同等の統計的形状モデルの品質が,60-80%の注釈量削減で実現された。
    • 半教師ありセグメンテーションは,統計的形状モデル構築において有効な代替手段となり得る場合がある。

    Link: https://arxiv.org/abs/2407.15260

  • 地球観測のためのオンボード衛星画像分類:ViTモデルの比較研究 [cs.HC, cs.CV, eess.SP]目的:地球観測用衛星画像分類モデルの性能比較
    • 地球観測は,環境変動の監視や資源管理など,多岐にわたる分野で不可欠である。
    • 衛星搭載での画像分類は,計算資源の制約や通信環境の影響を受けるため,高性能かつ効率的なモデルが求められる。
    • 本研究は,衛星搭載に適した高精度かつ省電力な画像分類モデルの特定を目指す。
    • 事前学習済みのVision Transformerが,ゼロから学習したモデルと比較して,精度と効率性の両面で優れていることが示された。
    • EfficientViT-M2は,EuroSATにおいて98.76%の精度,PatternNetで99.52%の精度を達成し,計算コスト,メモリ使用量,ロバスト性のバランスが最も優れていた。
    • EfficientViT-M2は,伝送損失に対する耐性が高く,MobileViTV2やSwin Transformerと比較して消費電力が大幅に少ないことが確認された。

    Link: https://arxiv.org/abs/2409.03901