arXiv雑要約

画像・音声 - 2026/08/04 公開

  • 構造を意識した生成3Dフラグメント再構成 [cs.CV]目的:3Dフラグメント再構成の性能向上
    • 3Dモデルの復元技術は,デジタルアーカイブや製品設計など幅広い分野で重要である。
    • フラグメント数が増加すると,意味的情報が少なくなり,再構成が困難になる。
    • 構造的情報を活用することで,再構成の曖昧さを軽減し,高精度な復元を目指す。
    • 提案手法SAReは,ローカル幾何形状と構造的制約を統合した生成フレームワークである。
    • SAReは,座標変換を駆動する表現を直接的に形成し,再構成に特化した事前学習を必要としない。
    • 合成データ,シミュレーションデータ,実物データを用いた評価で,最先端の性能を達成した。

    Link: https://arxiv.org/abs/2603.21611

  • Gimbal360:球面パノラマ補完のための平面拡散の標準化 [cs.CV]目的:球面パノラマ補完のための平面拡散モデルの適応
    • 没入型体験の需要増加に伴い,高品質な360度パノラマ画像の重要性が高まっている。
    • 平面画像で学習した拡散モデルは,球面パノラマのような特殊な構造には直接適用が困難である。
    • 球面パノラマの幾何学・位相構造を考慮した拡散モデルを構築し,高品質な補完を実現すること。
    • 提案手法Gimbal360は,緯度に基づく固定関数で透視歪みを標準化することで,平面拡散モデルを球面パノラマに適用可能にした。
    • 微分可能な射影標準化により,カメラパラメータなしで未知の画像を標準化空間にマッピングし,Topologically Equivariant Generationにより境界の連続性を確保した。
    • 大規模データセットHorizon360を用いて行った実験により,Gimbal360が最先端の視覚的品質とシームの連続性を実現することが示された。

    Link: https://arxiv.org/abs/2603.23179

  • AirSplat:ロバストなフィードフォワード3Dガウススプラッティングのためのアライメントと評価 [cs.CV]目的:3Dビジョンファウンデーションモデルの幾何学的知識を活用した,高品質な姿勢フリーな新規視点合成
    • 3Dビジョンは,現実世界の理解に不可欠であり,様々な応用分野で重要性が増している。
    • 汎用的な新規視点合成は,姿勢推定の誤差や劣化するプリミティブの影響を受けやすい。
    • 3DVFMsの幾何学的知識を活かし,姿勢推定誤差を低減し,高品質な新規視点合成を実現する。
    • 提案手法AirSplatは,大規模ベンチマークにおいて,最先端の姿勢フリーNVS手法を大幅に上回る再構成品質を示す。
    • 自己整合的姿勢アライメント(SCPA)により,ピクセルレベルでの整合性を確保し,姿勢と幾何学の不一致を解消。
    • 評価に基づく不透明度マッチング(ROM)により,スパースビューNVS教師モデルから劣化プリミティブをフィルタリング。

    Link: https://arxiv.org/abs/2603.25129

  • 効率的かつ汎用的な視覚言語ナビゲーションのための構造化観測言語 [cs.CV, cs.RO]目的:視覚言語ナビゲーションにおける,効率性と汎用性の向上
    • ロボット工学や拡張現実において,自然言語による指示に基づいた自律的なナビゲーションは重要である。
    • 既存手法は大規模な視覚的事前学習に依存し,環境変化に対する汎用性に課題がある。
    • 視覚情報を構造化された言語記述に変換することで,汎用性と効率性を高めることを目指す。
    • SOL-Navは,RGB-D画像をNxNグリッドに分割し,各セルの意味,色,深度情報を構造化テキストとして表現する。
    • この構造化テキストと指示文を言語モデルに入力することで,モデルサイズと学習データへの依存性を大幅に削減できる。
    • R2RやRxR等のベンチマークテスト及び実世界での展開により,未知環境への強い汎化性能が示された。

    Link: https://arxiv.org/abs/2603.27577

  • XSPA:VLMに対する転移可能な攻撃のための目に見えないX字型疎な敵対的摂動の作成 [cs.CV]目的:ビジョン言語モデルに対する転移可能な攻撃手法の開発
    • 近年のビジョン言語モデルの多様なタスクへの応用は目覚ましい。その汎用性の検証が重要である。
    • わずかな摂動が複数のタスクに影響を及ぼす可能性があり,その脆弱性が懸念される。
    • X字型の疎な摂動による攻撃効果を検証し,VLMの頑健性を評価することを目的とする。
    • XSPAは,画像ピクセルの約1.04%を変更するだけで,OpenAI CLIPやOpenCLIPなどのVLMの性能を大幅に低下させる。
    • XSPAはゼロショット精度を最大67ポイント低下させ,GPT-4ベースのキャプション一貫性やVQAの正答率も低下させる。
    • XSPAはVLMの頑健性を評価するための制御されたストレステストとして有用である。

    Link: https://arxiv.org/abs/2603.28568

  • 大規模言語モデルによるビジョンエンコーダの階層的事前学習 [cs.CV, cs.AI, cs.CL, cs.LG]目的:ビジョンエンコーダと大規模言語モデル間の階層的なクロスアテンションによるビジョン言語整合性の向上
    • コンピュータビジョン分野は発展してきたが,スケーラブルなモデルとマルチモーダル事前学習が重要視されている。
    • 従来のビジョンエンコーダと大規模言語モデルは独立に扱われることが多く,階層的な視覚特徴の統合が不十分である。
    • 本研究は,階層的な特徴統合によって,より効率的で表現力豊かなビジョン言語モデルを実現することを目指す。
    • HIVEは,ビジョンエンコーダと大規模言語モデル間に階層的なクロスアテンションを導入することで,ビジョン言語整合性を高める新しいフレームワークである。
    • 画像分類だけでなく,MME,GQA,OK-VQA,ScienceQAなどの様々なビジョン言語タスクにおいて,自己注意ベースの手法を上回る性能を示した。
    • 段階的な訓練戦略によって,安定した最適化と効果的なマルチモーダル融合を可能にし,階層的な特徴統合の利点を示した。

    Link: https://arxiv.org/abs/2604.00086

  • 感情制御可能な画像生成のための二重空間データセット:EmoScene [cs.CV]目的:感情制御可能な画像生成のための大規模二重空間データセット
    • 画像生成技術は発展しているが,感情表現の繊細な制御は未だ困難である。
    • 既存の視覚-感情データセットは,離散ラベルや特定のドメインに限定され,知覚的属性の監督が不十分である。
    • 感情と視覚的要素の関係性を明らかにし,より高度な感情制御を可能にする。
    • EmoSceneは,300以上のシーンカテゴリにわたる120万枚の画像を含む大規模データセットである。
    • 開発したAffectCtrlは,既存モデルを凌駕する感情の生成精度とVAD制御性能を示した。
    • EmoSceneは,視覚生成における感情表現の分析と制御のための拡張性のあるデータ基盤を提供する。

    Link: https://arxiv.org/abs/2604.00933

  • 物理的に妥当な動画生成のためのRGB-知覚モデリング [cs.CV]目的:動画生成における物理的妥当性の向上
    • 動画生成技術は目覚ましい進歩を遂げているが,現実世界の物理法則との整合性が課題である。
    • 既存の動画生成モデルは,ピクセル単位での再構成に偏りがちで,物理的に不自然な結果を生み出すことがある。
    • 本研究は,知覚情報とRGB画像を統合的にモデル化し,物理的に妥当な動画生成を実現することを目指す。
    • MMPhysVideoは,セマンティクス,幾何学,時空間軌跡といった知覚的ヒントを統一的な疑似RGB形式に変換することで,複雑な物理的ダイナミクスを直接捉える。
    • Bidirectionally Controlled Teacherアーキテクチャにより,RGBと知覚処理を分離し,徐々にピクセルレベルの一貫性を確立する。
    • MMPhysPipeを用いて,物理学的に豊かなマルチモーダルデータセットを構築するためのデータキュレーションおよび注釈パイプラインを提示する。

    Link: https://arxiv.org/abs/2604.02817

  • IRSTD再考:単一点教師あり学習によるエンコーダのみのフレームワークで十分な赤外小ターゲット検出 [cs.CV]目的:赤外小ターゲット検出におけるターゲット位置の推定
    • 赤外小ターゲット検出は,監視やセキュリティなど,様々な分野で重要な役割を担っている。
    • 既存手法は複雑なエンコーダ・デコーダ構造を採用し,計算コストが高いという課題がある。
    • 小ターゲットの特性を考慮し,単一点の教師データから効率的にターゲットを検出することを目指す。
    • 提案手法SPIREは,高解像度な特徴を保持し,効率的な学習を実現することで,既存手法と同等の検出性能を達成した。
    • 特に,誤検出率を低く抑えつつ,計算コストを大幅に削減することに成功した。
    • SIRST-UAVBやSIRST4等のベンチマークにおいて,その有効性が確認された。

    Link: https://arxiv.org/abs/2604.05363

  • Face-D(^2)CL:二重継続学習による顔のディープフェイク検出のためのマルチドメイン相乗的表現 [cs.CV, cs.AI]目的:顔のディープフェイク検出のためのマルチドメイン相乗的表現と二重継続学習
    • ディープフェイク技術の進歩は,公共の信頼と情報セキュリティに深刻な脅威をもたらしており,その対策が急務である。
    • 既存の継続学習手法は,多様化するフォージェリ痕跡の表現能力の不足や,過去の知識の忘却といった課題を抱えている。
    • 多様なフォージェリ痕跡の包括的な捕捉と,知識の忘却を抑制しつつ新たなフォージェリに対応できるモデルを構築すること。
    • 提案手法Face-D(^2)CLは,空間領域と周波数領域の特徴を融合するマルチドメイン相乗的表現を用いることで,多様なフォージェリ痕跡を捉える。
    • Real/Fake認識型EWCとドメインごとの直交勾配制約を組み合わせた二重継続学習メカニズムにより,忘却の抑制と適応性の両立を実現している。
    • 実験結果から,提案手法は既存の最先端手法と比較して安定性と可塑性に優れ,平均検出誤り率を60.7%削減し,未知のフォージェリドメインでAUCを7.9%向上させる。

    Link: https://arxiv.org/abs/2604.08159

  • テスト時にグラフ誘導マルチモーダル進化を習得する:PokeGym [cs.CV, cs.AI]目的:テスト時学習における視覚,推論,行動の相乗効果
    • AIは定型ゲームに優れるが,視覚情報に基づく3Dゲームでは苦戦する。
    • 既存手法は単一モダリティの最適化に偏り,環境適応能力を評価しない。
    • PokeGymを用いて,視覚情報のみから状態を把握し,逐次エピソードで適応する能力を向上させる。
    • 提案手法G-EvoMACは,PokeGymにおいて60.18%の平均成功率を達成した。
    • G-EvoMACは,最良のベースラインを11%以上上回り,マルチモーダル共同進化の有効性を示した。
    • 本研究は,長期的な視覚駆動型3Dゲームにおけるテスト時学習の新たな方向性を示す。

    Link: https://arxiv.org/abs/2604.08340

  • K-STEMIT:知識に基づいた時空間効率的な多分岐グラフニューラルネットワークによるレーダーデータからの地表層厚の推定 [cs.LG, cs.CV]目的:地表層厚の推定
    • 氷床の堆積,変形,層形成に関する時空間情報は重要であり,氷床変化の予測に不可欠である。
    • レーダー画像はスペックルノイズや取得アーチファクトに敏感であり,データ駆動型手法では物理知識の活用が不十分である。
    • 物理モデルからの情報を統合し,より正確で信頼性の高い地表層厚の推定を実現することを目指す。
    • K-STEMITは,既存の最先端手法と比較して,一貫して高い精度を維持しながら,効率性も最適化されている。
    • 適応的特徴量融合と物理的事前知識の組み込みにより,従来の多分岐モデルと比較して二乗平均平方根誤差を21.01%削減した。
    • K-STEMITは,年間相対平均絶対誤差を低減し,広範囲な地域における降雪量の時空間的評価を可能にする。

    Link: https://arxiv.org/abs/2604.09922

  • 量子回路を用いた敵対的攻撃に対するニューラルネットワークの保護:QShield [eess.SY, cs.SY, cs.CR, cs.AI, cs.CV, cs.LG, quant-ph]目的:敵対的攻撃に対するニューラルネットワークの堅牢性向上
    • 深層学習は広く利用されるが,セキュリティや安全性が重要となる分野では信頼性が課題となる。
    • 深層学習モデルは敵対的摂動に対して脆弱であり,その信頼性を損なうことが問題である。
    • 量子回路と古典的ニューラルネットワークを組み合わせ,敵対的攻撃への耐性を高めることを目指す。
    • 古典的モデルは敵対的攻撃に対して脆弱であるが,提案するハイブリッドモデルは高い予測精度を維持しつつ,攻撃成功率を大幅に削減する。
    • 提案アーキテクチャは,敵対的サンプル生成に必要な計算コストを増加させ,防御の層を追加する効果が確認された。
    • 予測精度と敵対的攻撃への堅牢性のバランスが取れた,安全・信頼性の高い機械学習への応用が期待される。

    Link: https://arxiv.org/abs/2604.10933

  • テスト時における知覚のスケーリング:画像を用いた思考における根拠のパラドックスの解決 [cs.CV]目的:画像を用いた思考における根拠のパラドックスの解決
    • マルチモーダル大規模言語モデルの発展に伴い,画像理解に基づく推論の重要性が増している。
    • モデルは詳細な情報を得るために正しい領域に注意を向ける必要があるが,どの領域が正しいかを知るためには既にその詳細を観察している必要がある。
    • 誤った領域に注意が向いた場合,その誤りが推論全体に影響するため,自己修正が困難な問題を解決する。
    • 提案手法TTSPは,知覚をスケーラブルな推論の単位として扱い,エントロピーに基づいた探索と証拠に基づいた反復的な洗練を行う。
    • TTSPは,モデルが確信を持てない証拠を保留し,検証された観察結果を証拠台帳に記録することで,未解決の領域の再検査を促す。
    • 高解像度マルチモーダルベンチマークにおいて,TTSPは既存のテスト時スケーリング手法を上回り,根拠の質とトークン効率を向上させた。

    Link: https://arxiv.org/abs/2604.11025

  • 感情強化生成拡張による視覚に基づく動的感情知覚 [cs.RO, cs.CV, cs.AI]目的:視覚に基づく動的感情知覚のためのデータ適応的動的表情生成
    • 感情知覚は,人間と機械の自然な対話を可能にする上で重要な役割を担う。
    • 野生環境における動的表情認識は,データ不足とロングテール分布により困難である。
    • 希少感情の時系列ダイナミクス学習を阻害するデータ問題を解決することを目指す。
    • ARGenは,表情生成と感情知覚の両方において,高い合成忠実度と認識性能を向上させる。
    • Affective Semantic Injection(ASI)とAdaptive Reinforcement Diffusion(ARD)の二段階構成により,解釈可能で汎用性の高い生成拡張パラダイムを確立する。
    • ASIは顔のAction Unitsを用いて感情知識を整合させ,ARDは強化学習により自然な表情と顔の整合性を最適化する。

    Link: https://arxiv.org/abs/2604.12255

  • AdaDINO:コンテキスト適応型DINO蒸留による効率的なオープンボキャブラリエッジ推論のためのビジョン基盤モデル [cs.RO, cs.CV, cs.LG]目的:エッジデバイスにおける効率的なオープンボキャブラリ推論のためのビジョン基盤モデル
    • 常に起動しているコンテキストAIは,エッジデバイスでビジョン基盤モデルを実行し,低レイテンシと低消費電力制約下で重要な役割を果たす。
    • シーンコンテキストや関連語彙の低頻度シフトにより,エッジデバイスでのモデル推論効率が課題となっていた。
    • 現在のシーンとタスクに合わせて実行を調整することで,エッジデバイス上でのビジョン基盤モデル推論を効率化することを目指す。
    • AdaDINOは,DINOv2から蒸留された言語対応型ビジョン基盤モデルを基盤とし,ニューラルアーキテクチャ探索(NAS)を統合することで,タスクレベルで適応的な実行を可能にする。
    • クラウド上のマルチモーダル大規模言語モデルがシーンコンテキストから候補クラスセットを洗練し,学習されたセレクターが目標精度を維持すると予測される最小コストのサブネットをアクティブ化する。
    • 学習されたセレクターのみを用いることで,同程度のセグメンテーション精度において,最適な固定サブネットと比較して平均計算量が37%削減された。

    Link: https://arxiv.org/abs/2604.15622

  • 適応的,シームレス,かつトレーニング不要な高精度音声編集 [cs.RO, cs.CE, cs.SD, cs.AI]目的:高精度な音声編集手法の開発
    • 音声編集は,話者固有の特徴や音響的背景を維持しつつ特定の箇所を修正する技術であり,様々な応用が期待される。
    • 従来の音声編集手法は,高コストな個別学習やTTSモデルの適応が必要であり,音質や時間軸の忠実度において課題があった。
    • 本研究は,トレーニング不要で高品質かつ制御可能な音声編集を実現し,既存手法の課題を克服することを目指す。
    • 提案手法ASTは,事前学習済みのTTSモデルを基盤とし,潜在的再構成を用いて高品質な編集を実現する。
    • 適応的弱ファクトガイダンス(AWFG)を導入することで,編集の自然さと時間軸の忠実度のトレードオフを解消した。
    • 新たにLibriSpeech-EditデータセットとWDTWという評価指標を提案し,時間軸の忠実度をより正確に評価できるようにした。

    Link: https://arxiv.org/abs/2604.16056

  • 糖尿病網膜症重症度分類のための双解像度注意機構付き深層学習:ドメイン間汎化性能の定量評価 [cs.CV, cs.AI]目的:糖尿病網膜症の重症度分類におけるドメイン間汎化性能の定量評価
    • 糖尿病網膜症は,予防可能な失明の主要な原因であり,早期発見と治療が重要である。
    • 既存の糖尿病網膜症モデルは,学習データに過剰適合し,実際の検査環境での性能が未知である。
    • 異なる画像ドメイン間での性能低下を定量的に評価し,汎化性能を向上させることを目指す。
    • 提案手法は,APTOSデータセットにおいて高い分類精度(kappa=0.882)を示した。
    • Messidor-2データセットでは精度が低下(kappa=0.679)したが,重症度順序は維持された。
    • ドメインの変化により,重症度判定の閾値設定が困難になることが示された。

    Link: https://arxiv.org/abs/2604.17341

  • SynAgent:単独エージェント間の相乗効果による汎用的な協調ヒューマノイド操作 [cs.CV, cs.GR, cs.RO]目的:協調ヒューマノイド操作の実現
    • 身体化された知能において,人間と協調したロボット操作は重要な課題である。
    • データ不足,マルチエージェント間の協調の複雑さ,物体間での汎化性の低さが課題である。
    • 単独エージェントのスキルを協調シナリオに転移することで,協調操作を可能にする。
    • SynAgentは,単独エージェントから協調エージェントへの相乗効果を利用し,スケーラブルかつ物理的に妥当な協調操作を可能にする。
    • Interact Meshを用いた相互作用を維持するリターゲティング手法により,人間と物体間の空間的関係を忠実に維持する。
    • 単独人間のデータから協調行動を蒸留する事前学習・適応パラダイムにより,安定した軌道追従制御を実現した。

    Link: https://arxiv.org/abs/2604.18557

  • UniCVR:アライメントから再ランク付けによる統一されたゼロショット複合ビジュアル検索 [cs.RO, cs.CV, cs.MM]目的:複合画像検索,複数ターンの複合画像検索,複合動画検索における統一的なゼロショットフレームワーク
    • 画像検索技術は,コンテンツベースの検索や,より高度なビジュアル情報を活用した検索に不可欠である。
    • 複合ビジュアル検索はタスクごとに研究されており,統一的なフレームワークやゼロショットでの解決策が不足していた。
    • 異なるタスクを統合し,アノテーションなしで複合ビジュアル検索を実現すること。
    • UniCVRは,大規模言語モデルとビジョン言語事前学習モデルを組み合わせることで,複合的なクエリ理解と構造化されたビジュアル検索を両立した。
    • 対照学習とクラスタベースの負例サンプリングにより,異なるモデル間の埋め込み空間を繋ぎ,クエリ埋め込み器の性能を向上させた。
    • MLLM誘導の二段階再ランク付けメカニズムにより,計算コストを抑えつつ,検索精度を大幅に向上させた。

    Link: https://arxiv.org/abs/2604.20318

  • シンフォニーGen:制御可能なハーモニー骨格を持つ3D階層オーケストラ生成 [cs.SD, cs.AI]目的:交響楽生成のための3D階層的フレームワーク
    • 音楽生成分野は,創造性と技術の融合であり,新たな音楽表現の可能性を広げる。
    • 既存のモデルは,大規模性と制御性のバランスを取ることが難しく,複雑な楽曲生成に限界がある。
    • 楽曲の構造を制御しつつ,高密度なオーケストレーションを可能にする生成モデルを開発する。
    • SymphonyGenは,バー,トラック,イベントの軸を分解する3D階層構造で,メモリ消費量を抑制し,あらゆる構造レベルでの条件付けを可能にする。
    • ユーザーが作成,分析,またはモデルが生成したハーモニー骨格を条件として使用することで,楽曲の輪郭を制御しながらオーケストラのテクスチャを生成する。
    • CLaMP 3オーディオ埋め込みからのクロスモーダル音響報酬を用いた強化学習と,不協和音を抑制するサンプリングアルゴリズムにより,楽曲の品質と好みが向上する。

    Link: https://arxiv.org/abs/2604.25498

  • 胎児超音波における時間的バイアスと獲得バイアスの交差的解明 [cs.LG, cs.CV, eess.IV]目的:胎児超音波による胎児体重推定における誤差要因の特定
    • 医療画像AIの公平性確保は,医療の質の向上と公平な医療アクセス実現に不可欠である。
    • AIモデルの性能差は,データセットの偏りに起因するとされることが多いが,臨床的・獲得的要因の影響も見過ごされがちである。
    • 交差分析を用いて,これらの要因を分離し,バイアスの真の原因を明らかにすることを目指す。
    • 交差分析により,高誤差サブグループは画像取得時のピクセル間隔(PS)と分娩までのスキャン間隔(STD)が極端に大きいことが明らかになった。
    • STDを固定するとPSの影響は小さくなり,PSを固定するとSTDが誤差に大きく影響することが示された。これは,誤差の多くが予測対象そのものに内在することを示唆する。
    • 深層学習モデルはHadlockの公式よりもSTDに敏感だが,全てのサブグループでより正確な予測を可能にしている。

    Link: https://arxiv.org/abs/2605.02942

  • 4DVGGT-D:動的深度推定の改善を伴う4次元視覚幾何変換器 [cs.CV]目的:単眼動画からの動的4次元シーン再構築
    • 近年,3D基礎モデルが発展しているが,動的環境下での性能劣化が課題となっている。
    • 既存手法はカメラの自己運動と物体の運動の相関を分離できていない。
    • 動的要素と静的要素を数学的に分離し,動的環境下での再構築精度向上を目指す。
    • 提案手法は,カメラ姿勢の安定化と幾何学的洗練を段階的に行うことで,動的環境における再構築性能を大幅に向上させる。
    • Dynamic-Mask-Guided Pose DecouplingモジュールとTopological Subspace Surgery機構により,動的オブジェクトを安全に保持しつつ静的領域の幾何形状を洗練する。
    • Information-Theoretic Confidence-Aware Fusion戦略により,不確実性を考慮した深度統合を行い,予測の精度を向上させる。

    Link: https://arxiv.org/abs/2605.12027

  • Semi-MedRef: クロスモーダルアラインメントを用いた半教師あり医療画像参照セグメンテーション [cs.CV, cs.LG]目的:医療画像と自然言語による参照表現から病変マスクを予測するタスクにおける,半教師あり学習による性能向上
    • 医療画像解析において,病変の正確な特定は診断精度向上に不可欠であり,自動化技術への期待が高い。
    • ピクセルレベルのアノテーションと参照テキストのペアデータ取得は高コストであり,データ不足が課題となっている。
    • 教師なしデータも活用し,クロスモーダルアラインメントを維持することで,データ効率の良い学習を目指す。
    • 提案手法Semi-MedRefは,教師あり学習および既存の半教師あり学習手法を上回る性能をQaTa-COV19とMosMedData+で示した。
    • T-PatchMix,PosAug,PACLという3つの要素により,画像と位置情報付き言語間のアラインメントを効果的に維持する。
    • 特に,解剖学的知識に基づいた位置情報を活用するPACLが,クロスモーダル表現学習を促進する重要な要素である。

    Link: https://arxiv.org/abs/2605.15720

  • ビットが壊れた時の救済策:反事実に基づいた忠実な量子化 [cs.LG, cs.AI, cs.CV]目的:量子化による意思決定への影響のずれ
    • モデルの量子化は,メモリ使用量,遅延,デプロイコストの削減に不可欠である。
    • 量子化により,精度の維持だけでなく,アルゴリズムによる救済の有効性も損なわれる可能性がある。
    • 量子化後の救済行動の変化を測定し,そのずれを軽減する手法を開発する。
    • 従来の量子化手法では,精度の維持と救済の安定性の両立が難しいことが示された。
    • 提案手法CFQは,精度とビット予算を同じ条件で比較することで,救済行動のずれを大幅に低減する。
    • 例えば,Adultデータセットにおいて,VD/CRGを0.121/0.162から0.061/0.071へと改善した。

    Link: https://arxiv.org/abs/2605.17160

  • 大規模音声言語モデルの調査:汎化性能,信頼性,および展望 [cs.NI, cs.SD]目的:大規模音声言語モデルのメカニズム,脆弱性,および信頼性向上のための提言
    • 音声情報処理技術の進展は,人間らしい知能の実現に不可欠である。特に,音声と言語を統合したモデルは重要性が高い。
    • 大規模音声言語モデルの能力向上は著しいが,その信頼性を担保する体系的な枠組みの整備が遅れている。
    • 音声言語モデルの潜在的な脆弱性を明らかにし,より安全で信頼性の高い音声知能の開発を支援する。
    • 本調査では,大規模音声言語モデルの攻撃対象領域の拡大と,クロスモーダル脱獄,潜在的な音響バックドア,バイオメトリックプライバシー漏洩などの脆弱性を包括的に分類した。
    • 現状では,攻撃手法は高度化している一方,防御策は不十分であり,音声中心の知能における信頼性の課題が顕在化している。
    • 「多層防御」アーキテクチャ,因果的な音声世界モデリング,内在表現エンジニアリングを提唱し,信頼性の高い音声知能開発を促進する。

    Link: https://arxiv.org/abs/2605.20266

  • OSINT支援異種センサ融合によるベイジアン物体分類の証拠階層 [cs.LG, cs.CV, cs.RO]目的:CBRNE脅威の検出,位置特定,分類のための証拠階層
    • CBRNE脅威への対応は公共の安全と不可欠であり,迅速かつ正確な識別が求められる。
    • 単一センサの能力限界と高いクラッタ率が,脅威分類の精度を低下させている。
    • OSINTと証拠階層を活用し,センサの限界を克服し,分類精度を向上させる。
    • 提案手法は,クラッタや事前分布の不一致に対するロバスト性を示した。
    • シミュレーション結果から,全体の分類精度が最大95%に達することが確認された。
    • 環境に関するOSINT情報を活用することで,より高度な状況認識が可能となった。

    Link: https://arxiv.org/abs/2605.22259

  • 低照度下における物理モデルに基づく自己教師ありデフォーカス除去とバイアス補正 [cs.CV, cs.LG, stat.ML]目的:低照度環境下におけるデフォーカス除去のための自己教師あり学習フレームワーク
    • 画像処理技術は,監視,医療,自動運転など幅広い分野で不可欠であり,高品質な画像復元が求められている。
    • 既存手法は簡略化されたノイズモデルに依存しており,現実的な撮影条件下では十分な性能を発揮できないという課題がある。
    • デフォーカス除去と同時に,複雑なバイアスノイズを正確にモデル化し,補正することを目指す。
    • 提案手法は,デフォーカス画像の物理モデルをガイドとして活用し,クリーンな参照画像なしでマルチフレームのノイズ画像からデフォーカスを除去する。
    • 周波数領域における制約を導入し,学習可能なノイズバイアスパラメータを通じてバイアス補正と高周波ディテール復元を同時に行う。
    • シミュレーションおよび実写データセットにおける実験結果から,提案手法が最新の自己教師ありアプローチよりも一貫して優れた性能を示すことが確認された。

    Link: https://arxiv.org/abs/2605.24590

  • 女性の安全に焦点を当てた分析:VADモデルはマルチモーダルデータセットによって強化できるか [cs.CL, cs.CV]目的:女性を対象とした異常検知におけるデータセットの改善
    • 現代社会において,女性の安全と安心は不可欠であり,犯罪抑止に繋がる技術開発が求められている。
    • 既存の異常検知モデルは,低解像度や暗い環境下での映像に対応できず,女性に対する犯罪の検出精度が低い。
    • 女性を対象とした犯罪に特化した,低解像度・暗い映像を含む新たなデータセットを構築し,VADモデルの性能向上を目指す。
    • 本研究で作成したExtrAnomデータセットは,既存のデータセットと比較して,女性に対する犯罪の検出において有効であることが示された。
    • ExtrAnomは,低解像度,暗い環境,遠景映像など,従来のデータセットでは不足していた多様な映像を含むため,より現実的な状況での異常検知に貢献する。
    • このデータセットを活用することで,VADモデルは女性を対象とした犯罪の検出能力を向上させ,社会の安全に貢献することが期待される。

    Link: https://arxiv.org/abs/2605.25806

  • V2VCrafter:車両間の一貫性のあるストリートビュー画像生成 [cs.CV]目的:車両間での制御可能かつ現実的なマルチビュー運転画像生成
    • 自動運転技術の発展には,多様な運転条件下での認識能力が不可欠である。
    • 実世界の車両間(V2V)データセットの不足が,自動運転システムの性能向上を阻害している。
    • 車両間の一貫性を保ちつつ,高品質な画像生成によるデータ拡張を実現すること。
    • V2VCrafterは,単一車両を基盤としたプログレッシブなマルチエージェント拡散モデルを開発した。
    • 近傍車両の潜在状態を用いて,単一からマルチエージェントへの生成を段階的に誘導することで,学習効率を高めた。
    • 実験の結果,V2VCrafterは高精度で制御可能,かつ一貫性のあるストリートビュー画像を生成し,3D物体検出の性能を向上させた。

    Link: https://arxiv.org/abs/2605.29471

  • CA-World:効率的なインタラクション対応再構成のための多物体反実仮想的アライメント [cs.CV]目的:インタラクションに対応可能な3Dワールドの効率的な再構成
    • 物理シミュレーション等に3Dワールドの再構成は不可欠であり,リアリティと精度が求められる。
    • 既存手法は視覚的な忠実度に偏重し,多物体間のインタラクションに対応できていない。
    • 本研究は,インタラクションを考慮した再構成を実現し,現実世界の再現度を高める。
    • 提案手法CA-Worldは,反実仮想的アライメント学習を導入することで,効率的な再構成を可能にした。
    • 前景・背景の分離を視覚的介入と捉え,オブジェクト生成と背景の補完を反実仮想的な生成として定式化した。
    • 実験により,オブジェクトの完全性,空間精度,レンダリング品質,物理シミュレーションにおいて有効性が確認された。

    Link: https://arxiv.org/abs/2605.30239

  • スペクトル信頼性記述子によるロバストな物体検出のためのマルチモーダル融合とエキスパートルーティングの架け橋 [cs.CV]目的:RGB-赤外検出器における信頼性記述子を用いた,ロバストな物体検出手法の開発
    • RGB-赤外画像は,昼夜間や悪天候下での検出性能向上に貢献するが,情報統合が課題である。
    • 従来のマルチモーダル融合では,融合過程での信頼性が考慮されず,誤った情報が伝播する可能性がある。
    • 融合過程の信頼性を明示的に記述し,それに基づいて融合と処理を最適化することで,ロバスト性を高める。
    • 提案手法は,バンドエネルギー,振幅比,位相整合性,クロスモーダル相関などの情報をまとめた7次元のスペクトル信頼性記述子を抽出する。
    • この記述子を用いて,スペクトル残差に対する信頼性に基づくゲート処理と,スパースな後続のエキスパートへのルーティングを制御する。
    • 合成的な劣化条件下での実験で,提案手法は既存手法と比較して高い性能を維持し,特にモダリティの欠落に対する耐性が向上した。

    Link: https://arxiv.org/abs/2606.01173

  • 欺瞞X:マルチモーダルな証拠から説明可能な欺瞞検出へ [cs.CV]目的:説明可能な欺瞞検出手法の開発
    • 感情計算と行動分析において,欺瞞検出は重要な課題であり,社会生活やセキュリティにおいて不可欠である。
    • 既存の深層学習手法は解釈性が低く,人間の専門家のような論理的推論を捉えきれていない点が課題である。
    • マルチモーダル大規模言語モデルの可能性を引き出し,低レベルな視覚・聴覚情報と高レベルな論理的推論を結びつけることを目指す。
    • DeceptionXは,欺瞞検出を解釈可能な「観察-思考-要約」の推論プロセスへと転換する新しいフレームワークである。
    • DeceptChainという高品質な推論データセットを構築し,視覚・聴覚の細かな証拠を構造化された思考連鎖データに変換した。
    • 実験の結果,DeceptionXは既存手法を上回り,透明性の高い専門家レベルの推論経路を提供することで,精度と解釈性のギャップを埋めることに貢献する。

    Link: https://arxiv.org/abs/2606.11385

  • ホルスアイ:緊急視覚分析のための動的注意としての言語 [cs.RO, cs.SY, eess.SY, cs.CV, cs.LG]目的:緊急視覚分析における言語の動的注意機構
    • 災害時など,緊急時の状況把握は人命に関わるため,迅速かつ正確な視覚分析が重要である。
    • 視覚劣化(霧,煙,熱画像など)下では,既存の視覚言語モデル(VLM)の性能が著しく低下する。
    • 視覚劣化環境下でもロバストな性能を発揮するVLMの特性を評価し,改善策を提示する。
    • Geminiは熱画像条件下で反復的な言語フィードバックにより+47.3%の性能向上を示したが,Qwen2-VLは-5.1%の低下が見られた。
    • RGB画像で有効なクロッピング戦略が,熱画像では性能を著しく悪化させる「熱のパラドックス」を特定した。
    • BLIP-2は劣化条件下で幻覚(ハルシネーション)を起こしやすく,緊急時への導入には不向きであることが示された。

    Link: https://arxiv.org/abs/2606.14741

  • 検索拡張による信頼性重視推論を通じたマルチモーダルシステムの視覚的幻覚の軽減 [cs.AI, cs.CV]目的:マルチモーダルシステムの視覚的幻覚軽減
    • マルチモーダルAIは,画像とテキストを統合し,高度な意思決定を可能にするため,その重要性が増している。
    • 視覚的証拠が不十分,曖昧,または意味的に矛盾する場合,マルチモーダルモデルは誤った予測や幻覚を起こしやすい。
    • 外部知識を活用し,予測の信頼性を評価することで,誤った出力を抑制し,より信頼性の高いシステムを目指す。
    • 提案手法は,外部の視覚的証拠データベースを用いて予測の信頼性を評価する複数の指標を導入することで,予測精度を向上させた。
    • 信頼性指標に基づいた意思決定ゲートにより,証拠が不十分な場合には慎重な回答,または回答の差し控えを選択することで,過信を防いだ。
    • ImageNet-100における実験の結果,正解率が向上し,誤った回答率が低下し,システムのキャリブレーションが改善された。

    Link: https://arxiv.org/abs/2606.15782

  • FusionRS:クロスモーダル視覚言語学習のための大規模RGB-赤外線様リモートセンシングデータセット [cs.CV, cs.AI]目的:クロスモーダル視覚言語学習のための大規模RGB-赤外線様リモートセンシングデータセットの提供
    • 地球観測において,視覚言語モデルの進歩が求められている。赤外線情報はRGB画像では得られない情報を補完し,観測能力を向上させる。
    • 既存の大規模視覚言語リソースはRGB中心であり,赤外線情報の活用が十分ではない。赤外線に特化した学習リソースが不足している。
    • RGBと赤外線様の画像ペアとテキストデータを提供することで,リモートセンシングにおける視覚言語モデルの学習を促進し,性能向上を目指す。
    • FusionRSはRGB-赤外線様画像とテキストの対応付けにおいて,RGBのみの場合や赤外線情報を考慮しない場合と比較して,顕著な性能向上を示す。
    • 赤外線に配慮したキャプションは,赤外線画像の説明能力を向上させ,モダリティ固有の教師データの有効性を示す。
    • FusionRSは,RGB-赤外線リモートセンシングにおける制御された視覚言語学習のためのスケーラブルな基盤を提供する。

    Link: https://arxiv.org/abs/2606.17020

  • SAGE:南アジアにおける消化器内視鏡検査のための専門家アノテーションデータセット - マルチモーダル学習と幻覚分析のために [cs.CV, cs.AI]目的:南アジア地域の消化器内視鏡検査画像に対するマルチモーダル学習と幻覚分析のためのデータセット
    • 消化器がんの罹患率は南アジアで増加しており,早期診断の重要性が高まっている。
    • 既存のAIモデルは欧州データセットで学習されているため,南アジア地域における性能評価が困難である。
    • 地理的偏りを考慮した,南アジア地域のAI診断支援ツールの開発を促進すること。
    • SAGEデータセットは,1,300枚の画像,キャプション,アノテーション,質問応答ペアを含み,多様なタスクに対応可能である。
    • 既存のマルチクラス分類器は,南アジアデータセットにおいて平均F1スコアが54ポイント低下するなど,地理的偏りの影響を受けることが示された。
    • 最新のLMMのベンチマークでは,解剖学的ランドマーク検出と異常検出のGREENスコアがそれぞれ0.308と0.410と大幅に低下した。

    Link: https://arxiv.org/abs/2606.22144

  • タスク条件付きAIモデルにおける,報告可能な安全性に関わる信号の無視に関するギャップ [cs.CL, cs.AI, cs.CV]目的:タスク条件付きAIモデルにおける安全性に関わる信号の無視
    • 医療分野など安全性確保が重要な分野において,AIの活用が進んでいる。
    • AIは指定された危険にのみ焦点を当て,予期せぬ危険を見落とす可能性がある。
    • AIが本来検出可能な安全性に関わる信号を無視する問題を解決する。
    • タスクに特化した指示により,AIは安全性に関わる信号の報告を最大0.92抑制することが確認された。
    • このギャップはモデルの規模に比例せず,推論モデルでも持続し,一部のモデルでは安全性報告の優先順位が確保された。
    • 独立した評価者が全ての検出漏れを補完可能であり,安全性確保のためには包括的な評価が必要である。

    Link: https://arxiv.org/abs/2606.26529

  • カメラ移動を伴う3Dシーン適応型軌道制御可能人物画像アニメーション [cs.CV]目的:3D環境下における人物モーションとカメラ軌道の制御
    • リアルな人物画像アニメーションは,エンターテインメントやコミュニケーションにおいて重要な役割を担う。
    • 既存手法では,自然なシーンとカメラ視点の変化下での軌道制御が困難であった。
    • 本研究は,3Dシーンに適応し,カメラ制御下で軌道を制御できる人物アニメーションを実現する。
    • 提案手法は,地面の高さや向きの変化に適応する3Dモーションリターゲティングを実現した。
    • シーンの視点に応じた潜在融合メカニズムにより,カメラ制御下での視点変化を正確に誘導する。
    • 標準データセットを用いた実験により,提案手法が既存手法を上回る性能を示すことが確認された。

    Link: https://arxiv.org/abs/2606.30514

  • CoLT:潜在的な思考の連鎖によるマルチモーダルモデルへの思考指導 [cs.CV]目的:マルチモーダルモデルにおける思考過程の効率化と性能向上
    • マルチモーダル大規模言語モデルは複雑な視覚的推論が可能だが,計算コストが高い。
    • 従来のテキストベースの思考過程は,推論速度が遅く,表現力に限界がある。
    • 潜在的な思考表現を用いることで,高速かつ高精度な推論を実現することを目指す。
    • CoLTは,テキストトークンではなく潜在的な思考表現の連鎖を通じて推論を行う新しいフレームワークである。
    • CoLTは,既存の潜在的推論手法(CODI,SIM-CoT)よりも優れた性能を示し,補助画像を用いる手法をも凌駕した。
    • 推論時間を最大10.1倍,テキストデコード時間を22.6倍削減できることが示された。

    Link: https://arxiv.org/abs/2606.31986

  • コントラストによる音声デコーディングのための適応的摂動選択 [cs.SD, cs.AI]目的:音声デコーディングにおける最適な負の分岐の適応的選択
    • 大規模な音声言語モデルの発展に伴い,幻覚抑制が重要課題となっている。
    • 既存のコントラストデコーディングは,マスキング等の粗雑な摂動に頼っており,洗練された手法が求められている。
    • タスクと事例に応じた最適な摂動を動的に選択することで,幻覚を効果的に抑制することを目指す。
    • 単純な二値制制約によるプロンプトエンジニアリングの改善により,存在しない音響特徴の誤認を減少させた。
    • 時間,周波数,振幅領域における様々な摂動評価の結果,最適な変換はタスクに強く依存することが示された。
    • モデルの隠れ状態に基づいた軽量な摂動選択器の学習により,存在タスクにおいて追加で4.3%の精度向上を達成した。

    Link: https://arxiv.org/abs/2607.00247

  • ArcAD:コールドスタート型異常検知のための異常修正キャリブレーション [cs.CV]目的:コールドスタート環境下における教師あり異常検知の性能向上
    • 製造業における異常検知は,品質管理や生産効率の向上に不可欠である。
    • 正常データが限られており,異常データが少ないコールドスタート環境では,既存手法の性能が低下する。
    • 少ないデータでもロバストな異常検知を実現するため,正常分布の表現と教師あり信号の活用を改善する。
    • ArcADは,再構成ベースの異常検知モデルに適用可能なキャリブレーションフレームワークである。
    • 限られた正常サンプルをハイパースフィア上に投影し,複数のコンパクトなクラスタを形成することで正常分布の表現を最大化する。
    • 疑似異常データを生成し,実際の異常データと合わせて境界を内側に押し込み,異常識別能力を高める。

    Link: https://arxiv.org/abs/2607.02252

  • LCPNet:潜在的整合近接アンフォールディングネットワークによる赤外線微小ターゲット検出 [cs.RO, cs.IR, cs.CV, cs.AI]目的:赤外線微小ターゲット検出における性能向上
    • 遠隔検知において,長距離の微小ターゲットを検出することは極めて重要である。
    • 深層学習は進歩したが,ターゲットと背景の物理的分解構造の利用が不十分である。
    • 潜在空間でのアンフォールディングにより,物理的制約を維持し,最適化プロセスとの連動を強化する。
    • LCPNetは,4つの公開ベンチマークにおいて,高い精度と低い誤検出率を達成した。
    • 潜在的整合近接(LCP)ソルバーにより,各潜在変数の安定した更新とタスク適応型正規化を実現した。
    • 共有最適化メモリ(SOM)の導入により,アンフォールディング段階全体での協調的なガイダンスを提供した。

    Link: https://arxiv.org/abs/2607.04603

  • 視覚と言語モデルにおけるエラーの原因:認識の失敗か,知識の欠如か [cs.CV, cs.CL]目的:知識集約型視覚質問応答におけるエラーの構造的分析
    • 視覚言語モデルは画像と質問から回答を生成するため,多様な応用が期待されている。
    • モデルが明確な画像でも,画像に直接示されていない知識を必要とする質問には誤答する。
    • エラーを構造的に分類し,原因を特定することで,モデルの改善に繋げる。
    • エラーは,エンティティ認識の前に発生するものと,認識後に残存するものの2種類に分類された。
    • 視覚トークン表現は認識に関連する判断に有効である一方,ファクトへのアクセスに関する帰属は困難であった。
    • エラーの帰属に基づいた介入(画像修正,エンティティ支援など)が有効であることが示唆された。

    Link: https://arxiv.org/abs/2607.04683

  • MoWorld:フラッシュワールドモデル [cs.CV]目的:ワールドモデルの実用性と推論効率の向上
    • ワールドモデルは,自律システムの知能化に不可欠であり,その発展が期待されている。
    • 従来のワールドモデルは,計算コストが高く,リアルタイム推論が困難であった。
    • MoWorldは,低コストで高効率な推論を実現し,実世界での大規模展開を可能とする。
    • MoWorldは,データ生成,事前学習,蒸留,効率的な推論を統合したフレームワークである。
    • 最大50FPSのリアルタイムインタラクションを,高性能GPUなしで実現した。
    • 既存のワールドモデルと比較して,推論コストを30〜50%削減することに成功した。

    Link: https://arxiv.org/abs/2607.06216

  • アクションキャッシュ:アクションのキャッシングと改良による,ビジョン・言語・行動モデルの学習不要な高速化 [cs.RO, cs.CV, cs.LG]目的:ビジョン・言語・行動モデルにおける推論遅延の削減
    • ロボットの汎用的な操作を実現するため,ビジョン・言語・行動モデルが注目されている。
    • 行動ヘッドにおける反復ノイズ除去処理が計算ボトルネックとなり,リアルタイムでの利用が困難である。
    • 過去の中間行動を再利用することで,推論速度を向上させ,リアルタイム処理を可能にすることを目指す。
    • アクションキャッシュは,過去の中間行動をコンパクトなマルチモーダルキーで保存し,類似したコンテキストから行動を検索する。
    • シミュレーションおよび実環境での実験により,高いタスク成功率を維持しつつ,推論速度を大幅に向上させることが示された。
    • 代表的なフローベースVLAモデル ($\pi_{0.5}$とGR00T-N1.6)において,それぞれ最大で10.44倍と40.17倍の行動ヘッド推論高速化を達成した。

    Link: https://arxiv.org/abs/2607.06370

  • AI改ざん動画検出のためのアンサンブル深層学習手法 [cs.CV]目的:AI改ざん動画の検出
    • AI技術の発展により偽動画が増加し,情報信頼性の確保が重要になっている。
    • 既存手法は単一モデルに依存し,多様な改ざん動画への汎化性能が課題である。
    • 複数のモデルを組み合わせ,よりロバストな改ざん動画検出を目指す。
    • 個々のモデルは訓練データに偏りがあり,未知のデータへの性能低下が確認された。
    • アンサンブル学習により,多様な改ざん動画に対して安定した性能が期待できる。
    • 音声と映像の両方を活用することが,より信頼性の高い検出につながる。

    Link: https://arxiv.org/abs/2607.06872

  • MuScriptor:複数楽器音楽の自動採譜のためのオープンモデル [cs.SD, cs.LG]目的:複数楽器音楽の自動採譜モデルの開発
    • 音楽情報処理分野において,音楽の自動解析は重要な研究課題である。
    • 既存手法は単一楽器に限定されるか,複雑な楽曲で十分な性能を発揮できない。
    • 実音楽に対する汎化性能を高め,実用的な採譜結果を得ることを目指す。
    • 合成データによる事前学習と,実音楽データによるファインチューニング,強化学習を組み合わせることで有効性を検証した。
    • 楽器の存在を条件付けすることで,採譜結果のカスタマイズを実現した。
    • 多様なジャンルの実音楽に対応可能なオープンウェイトのモデルMuScriptorを公開した。

    Link: https://arxiv.org/abs/2607.08168

  • 負けないチェスエンジンのプログラミング方法 [cs.GT]目的:完全情報ゲームの戦略決定
    • ゲームAI分野は,知的ゲームの自動化や意思決定支援に不可欠である。
    • チェスのような複雑なゲームでは,完全な戦略を見つけることは計算量的に困難である。
    • 理論的に負けない戦略の存在を証明し,その手法を提示すること。
    • グラフ理論に基づくモデルにより,チェスなどの完全情報ゲームを表現した。
    • バックトラッキングミニマックスアルゴリズムを用いて,理論上の最適戦略(ゲーム解法)を求める。
    • 必ず引き分け以上を達成できる戦略の存在を,形式的に証明した。

    Link: https://arxiv.org/abs/2607.09715

  • RSRA:効率的なLoRAランク割り当てのための表現感度プローブ(学習不要) [cs.CV, cs.AI]目的:LoRAランクの効率的な割り当て手法
    • 大規模言語モデルの活用が広がる中で,計算資源の制約が課題となっている。
    • 従来のLoRAは全モジュールに均一なランクを割り当て,最適化や勾配情報に依存する手法は課題が残る。
    • タスクに応じた表現変化を捉え,最適なランク割り当てを実現することで,性能向上と効率化を図る。
    • RSRAは,学習データを用いずに表現感度をプローブすることで,適応容量が必要な箇所を特定する。
    • Qwen3-4BおよびMistral-7Bを用いた実験で,既存手法を上回る平均性能と,ランク割り当て時間の高速化を実現した。
    • DoRA,LoRA-FA,PiSSA等のPEFT手法と組み合わせることで,18個の組み合わせのうち15個で性能が向上した。

    Link: https://arxiv.org/abs/2607.09757