arXiv雑要約

AI - 2026/08/03 公開

  • 明示的な制約下における言語モデル学習のための,前頭前皮質にインスパイアされた並列アプローチ [cs.CL, cs.AI]目的:言語モデル学習における,サンプルごとの更新強度制御
    • 言語モデルは多様なタスクで高い性能を示すが,効率的な学習手法が課題である。
    • 従来の適応方法は,サンプルごとの更新効果を考慮せず,一律に更新を行う。
    • サンプルごとの更新効果を考慮し,パラメータ更新を効率化し安定化させる。
    • PARALLELは,サンプル依存の更新強度を制御することで,効率的な学習を実現した。
    • 複数のタスクにおいて,フル適応と同等の性能を維持しつつ,更新回数を削減した。
    • 累積更新時間やGPUエネルギーが同じ場合,PARALLELはより高い精度と安定した適応軌跡を示した。

    Link: https://arxiv.org/abs/2607.28982

  • 厳格なゼロショット画像キャプション生成のための,マルチエージェントアラインメントスコアリングとコンセンサス蒸留ビームアービトレーション [cs.CV, cs.AI, cs.CL, cs.MA]目的:厳格なゼロショット画像キャプション生成における性能向上
    • 画像とテキストを結びつける技術は,画像理解や検索,そして人間と機械のコミュニケーションにおいて重要である。
    • 既存手法では,画像とテキストのアラインメント評価が初期段階で一度だけ行われ,その後のデコード過程で視覚的情報が失われる。
    • 複数回の視覚的フィードバックを取り入れ,より正確なキャプション生成を目指す。
    • 提案手法「Adjudicated Captioning」は,COCO Karpathyデータセットにおいて,CIDErスコアを117.6,SPICEスコアを21.9と,既存手法を上回る性能を達成した。
    • 性能向上は,学習済みのモジュールによるアーキテクチャの介入が大きく貢献しており,学習された reranker はわずかな改善に留まっている。
    • 本手法は,キャプション生成モデルの再学習なしに,Flickr30k KarpathyおよびNoCapsデータセットにおいても良好な転移学習性能を示した。

    Link: https://arxiv.org/abs/2607.28986

  • 動的相互作用場による構造化暗黙層とベクトルアトラクタとしてのSILVAネットワーク [cs.LG, cs.NE]目的:直接入力,近傍構造,広範な文脈を調整する表現
    • 機械学習において,入力,構造,文脈を統合した表現が重要である。
    • 暗黙ニューラル層では,これらの要素が固定点更新に集約され,各要素の役割が不明確である。
    • SILVAネットワークは,これらの要素を分離し,内部ダイナミクスを学習可能にすることで,この問題を解決する。
    • SILVAネットワークは,刺激,局所的相互作用,大域的相互作用,減衰,読み出しを一つの固定点アーキテクチャ内で分離した。
    • グラフタスクでは局所的相互作用が重要であり,MNISTでは再帰的構造による利点は限定的であった。
    • 長距離ノード分類ベンチマークでは,大域的な相互作用が明確な利点を示した。

    Link: https://arxiv.org/abs/2607.28989

  • ターンレベルの自律的強化学習のための科学的発見環境のスケーリング [cs.AI]目的:科学的発見エージェントの学習環境のスケーラビリティ
    • 科学的発見は人類の進歩に不可欠であり,効率的な手法が求められている。
    • 現実世界の科学データを用いた,プロセスが検証可能な学習環境が不足している。
    • 検証可能な分析証拠に基づくターンレベルでの学習信号を供給する環境を構築する。
    • SciDiscoは,科学的発見エージェントを訓練するためのスケーラブルなフレームワークである。
    • SciTh\`equeは,仮説,データセット,隠れた証拠グラフ,検証者をタスク環境に統合する。
    • SciDisco-14Bは,仮説に基づいた科学データ分析ベンチマークで最先端の性能を達成した。

    Link: https://arxiv.org/abs/2607.28990

  • マテリアル情報を考慮した点群からのクロスシーンラジオフィールドのための基盤モデルPoint2Radio [cs.NI, cs.AI, cs.CV, cs.LG]目的:シーンを跨いだラジオフィールドの転移学習
    • 電波伝搬予測は,通信システム設計や無線環境マッピングにおいて不可欠である。
    • 従来手法では,シーンごとに電波伝搬をシミュレーションまたは学習する必要があり,計算コストが高い。
    • 異なる環境で共有される伝搬構造を利用し,汎用的な電波伝搬モデルを構築することを目指す。
    • Point2Radioは,マテリアル情報を考慮した点群と送信機の設定から,シーン表現を生成する。
    • 新しいシーンでは,点群とトランシーバのクエリのみを使用し,メッシュやパス トレーシングなしにミリ秒単位で動作する。
    • 337シーンのデータセットで評価した結果,平均絶対誤差 (MAE) は0.871 dBであり,ベースラインと比較して誤差を76.7%削減した。

    Link: https://arxiv.org/abs/2607.28994

  • マルチモーダルCTR予測のためのプロトタイプ合成セマンティック識別子:PaletteID [cs.IR, cs.LG]目的:マルチモーダルCTR予測の精度向上と,アイテムのコールドスタートおよびロングテール問題の緩和
    • 推薦システムの精度向上には,画像やテキストなどマルチモーダル情報の活用が不可欠である。
    • 既存手法では,セマンティック識別子の生成において,詳細な情報を失ったり,表現能力に限界があったりする。
    • 本研究は,セマンティック関連性を維持し,表現能力を向上させるセマンティック識別子を提案することで,上記の問題を解決する。
    • 提案手法PaletteIDは,代表的なプロトタイプアイテムを用いて,マルチモーダルコンテンツと推薦モデルを結びつける。
    • 実験の結果,PaletteIDはCTR予測精度を向上させ,特にロングテールアイテムにおいて大きな改善が見られた。
    • また,既存手法と比較して,よりロバストな識別子割り当てと解釈しやすいトークンセマンティクスを実現した。

    Link: https://arxiv.org/abs/2607.29000

  • MMShopBench:マルチモーダル,複数ターンショッピングエージェントのための実ログベンチマーク [cs.AI]目的:マルチモーダル,複数ターンのショッピングエージェントの性能評価
    • オンラインショッピングにおけるAIアシスタントの重要性が増しており,画像と対話を用いたより自然な商品探索が求められている。
    • 既存のベンチマークはテキストのみ,または合成データに依存しており,現実の複雑なショッピングニーズを反映していない。
    • 画像と対話から商品要件を正確に推論し,適切な商品検索と検証を行うエージェントの開発を促進する。
    • MMShopBenchは,実際のショッピングログから構築された,マルチモーダル,複数ターンのショッピングエージェントのための初のベンチマークである。
    • このベンチマークを用いて,オープンソースモデルとプロプライエタリモデルの評価を行った結果,性能差が存在することが確認された。
    • オープンソースモデルをファインチューニングすることで,性能が向上し,プロプライエタリモデルとの差が縮小された。

    Link: https://arxiv.org/abs/2607.29002

  • Auto-JEPA:エンドツーエンド自律運転のための連続的意図の潜在的ワールドモデル [cs.RO, cs.AI]目的:連続的な運転意図を学習する潜在的ワールドモデル
    • 自動運転技術は,交通渋滞の緩和や交通事故の削減に貢献し,社会に大きな変革をもたらすと期待されている。
    • 既存のワールドモデルは計算コストが高く,計画に必要な情報に焦点を当てられていない場合がある。
    • 計画に必要な視覚的特徴に焦点を当て,効率的な計画を可能にするモデルの開発を目指す。
    • Auto-JEPAは,ナビゲーション環境において高い性能を示し,PDMSで91.3,EPDMSで89.1を達成した。
    • 動的エージェント領域をマスキングすると,意図の変化がランダムマスキングの2.97倍にもなり,計画に関連する視覚的特徴に焦点を当てていることが示された。
    • 将来の運転に影響を与える車両を遮蔽すると,予測される意図と選択された軌跡が大きく変化する一方,影響のない車両を遮蔽しても変化はほとんど見られなかった。

    Link: https://arxiv.org/abs/2607.29031

  • 疎なノイズ混じりのデータからの支配方程式の動力学を考慮した同定 [eess.SY, cs.SY, math.OC, cs.LG, math.DS]目的:非線形動力学の疎な同定手法
    • データから支配方程式を抽出することは,物理現象の理解や予測に不可欠である。
    • 疎なノイズ混じりの時間的測定は,微分推定の信頼性を損なう可能性がある。
    • 動力学を考慮した前処理によって,微分推定の誤差を低減することを目指す。
    • Koopmanに基づくアップサンプリングは,微分推定誤差の低減に有効な前処理ステップである。
    • 特に,Polynomial EDMDはODEの係数精度において優れた結果を示した。
    • PDEの結果はシステムに依存するが,低ランクDMDがBurgers方程式と輸送拡散方程式の同定を改善した。

    Link: https://arxiv.org/abs/2607.29036

  • DFSC:誤差制御された微分可能なミッテイ・レフラー伝播による分数次Scientific Machine Learning [cs.LG]目的:分数次Scientific Machine Learningにおける数値演算子の開発
    • 科学技術計算と機械学習の融合は,複雑な現象のモデル化・解析において重要性を増している。
    • 分数次演算子の効率的かつ高精度な数値計算は,計算コストと精度のトレードオフが課題であった。
    • ミッテイ・レフラー伝播を用いた微分可能な演算子を構築し,誤差制御を実現することで,この課題を解決する。
    • DFSCは,ミッテイ・レフラースペクトル層(MLSL)を基盤とし,既知の分数次伝播とデータ駆動型補正を分離することで,効率的な学習を可能にする。
    • 適応アルゴリズムにより,指定された許容誤差を満たすまで特殊関数の打ち切り深度やLanczos次元を自動的に調整し,誤差を制御する。
    • 実験結果から,DFSCは幅広い演算子パスに対応し,高速な計算と高精度な結果を提供することが示された。

    Link: https://arxiv.org/abs/2607.29038

  • ニューラルネットワーク検証のための先読み補題の学習 [cs.LG, cs.AI, cs.LO]目的:ニューラルネットワーク検証における性能向上
    • ニューラルネットワークの安全性確保は,自動運転や医療など,社会実装において重要である。
    • 既存の検証手法は計算コストが高く,大規模なネットワークへの適用が困難である。
    • 不安定ReLUに着目した補題を学習し,探索空間を削減することで検証効率を高める。
    • 本研究では,先読み手続きに基づく新たなフレームワークを導入し,Marabouとα-β-CROWNで検証性能を向上させた。
    • 実験の結果,既存手法と比較して,最大34%多くの事例において否定的な検証が可能となった。
    • 導入したフレームワークは,ブーリアンカットの活性化と探索空間の枝刈りに貢献している。

    Link: https://arxiv.org/abs/2607.29051

  • 局所的優位性における適合モデル比較 [cs.RO, cs.LG]目的:局所的な最適なモデルを特定するための手法
    • モデル選択は機械学習の重要な課題であり,様々な応用分野で性能に直結する。
    • 従来のモデル比較は全体的な性能評価に偏重し,局所的なモデルの優位性を捉えきれない。
    • 局所的なモデルの性能を正確に評価し,最適なモデルを適切に選択することを目指す。
    • 提案手法は,分割サンプリングを用いて局所的な最適なモデルマップを構築する。
    • 残差の不確実性を共形的に調整することで,信頼性の高い局所的な勝者を特定できる。
    • 実験結果から,提案手法は異質な勝者領域を回復し,全体的な選択よりも高い条件付き利得を得ることが示された。

    Link: https://arxiv.org/abs/2607.29053

  • モンテカルロ木探索によるマルチエージェントシステムの自律的修復 [cs.LG, cs.AI, cs.MA]目的:マルチエージェントシステムの修復手法
    • 複雑なタスク解決において,マルチエージェントシステムの活用が広がっている。
    • システムの誤り発生時,原因特定と修正には手動での介入が必要であり,負担が大きい。
    • マルチエージェントシステムの自動修復を可能にし,人的負担を軽減することを目指す。
    • 提案手法MARSは,モンテカルロ木探索を用いてマルチエージェントシステムの修復を効率的に行う。
    • StateMASという大規模なベンチマークデータセットを新たに構築し,様々な設定で実験を行った。
    • MARSは既存手法を上回り,特に分類に起因する評価と診断に基づいた展開が性能向上に貢献した。

    Link: https://arxiv.org/abs/2607.29055

  • 建設図書の証拠に基づく制約チェック [cs.AI]目的:建設図書における制約チェックのパイプライン
    • 建設プロジェクトは,テキスト,図形,ページ,改訂履歴など多様な情報を扱うため,正確な制約チェックが重要である。
    • 専門家による図書レビューは時間がかかり,人的エラーのリスクも伴う。
    • 本研究は,証拠に基づいた制約チェックパイプラインを通じて,レビューの自動化と精度向上を目指す。
    • 提案手法では,抽出された事実の正規化,4状態ルールによる決定的な実行,ソース範囲の保持,未解決事例のエスカレーションを実現した。
    • 画像予算の配分変更により,プロジェクトファミリーの標準化された決定精度が10.6%向上した(95%ブートストラップCI: 4.3~18.0)。
    • ただし,この効果はより広範なテストでは持続せず,解決策の幅と深さのトレードオフが示唆された。

    Link: https://arxiv.org/abs/2607.29058

  • 思考連鎖における忠実性のための操縦ベクトルの一般化について [cs.AI]目的:思考連鎖における忠実性を高めるための操縦手法の一般化可能性
    • 大規模言語モデルの能力向上に伴い,思考連鎖がAIの安全性確保において重要な役割を果たす。
    • モデルが推論過程における重要なステップを明示しない場合があり,思考連鎖の忠実性が損なわれる。
    • 提示された手がかりを考慮しない場合でも結論に至るモデルの不忠実性を改善することを目指す。
    • 操縦は,最も大規模なモデル(Gemma-3 12B)でのみ,手がかりの認識率を確実に向上させた。
    • 操縦が有効な場合,その効果は手がかりの種類やデータセットを問わず広範に一般化された。
    • 操縦は,手がかりの使用率を大きく変化させず,明示されない手がかりの使用を減少させる。

    Link: https://arxiv.org/abs/2607.29062

  • 警察の事故報告書を用いた大規模言語モデルの公式事故データベースコーディングに対するベンチマーク評価 [cs.LG, cs.AI]目的:警察の事故報告書から得られる事故属性コードと,公式の事故データベースの対応するフィールドとの比較
    • 交通事故データの正確な分析は,交通安全対策の改善に不可欠である。
    • 事故報告書のレビューは手作業に頼ることが多く,時間と労力がかかる。
    • 大規模言語モデルの事故コーディング能力を評価し,実用化の可能性を探る。
    • GPT-5.5 Highが最も高い合意率を示したが,単純な多数決ベースラインも高い合意率を示した。
    • キーワードルールベースラインは,最も性能の良いLLMに匹敵するマクロ平均F1スコアとCohen's kappaを達成した。
    • 属性ごとの性能評価が重要であり,透明性の高いベースラインと人間のレビューが不可欠である。

    Link: https://arxiv.org/abs/2607.29064

  • 策略の意味論:最先端の汎用モデルに対する法的欺瞞検出のベンチマーク [cs.CL, cs.CL, cs.AI]目的:法的欺瞞検出のベンチマーク
    • 法的手続き,法執行,オンラインセキュリティにおいて,欺瞞検出は重要な役割を果たす。
    • 人間の判断は正確性と拡張性に限界があり,データ駆動型アプローチが求められている。
    • 法的領域における欺瞞検出の現状を分析し,ドメイン適応の必要性を示す。
    • ファインチューニングされたモデルは,データ豊富な汎用ドメインで高い性能を示す。
    • 少数のサンプルを用いたLLMは,リソースの少ない法的環境においても競争力がある。
    • Chain-of-Thoughtプロンプティングは,直接的な分類よりも性能が劣ることが多い。

    Link: https://arxiv.org/abs/2607.29066

  • ヘテロな圧縮クライアントによる基盤モデルの連合学習微調整 [cs.DC, cs.DB, cs.LG, cs.AI]目的:ヘテロな圧縮クライアントによる基盤モデルの連合学習微調整手法
    • 基盤モデルの連合学習は,データ活用とプライバシー保護の両立に貢献し,医療や金融など様々な分野での応用が期待される。
    • 実用的な環境では,モデル規模と計算資源の制約から,全てのクライアントが大規模モデルを扱えるとは限らないという課題がある。
    • 本研究は,計算資源の限られたクライアントでも連合学習に参加できるよう,効率的なモデル圧縮と知識集約を可能にする手法を提案する。
    • 提案手法FedSLMは,SVD分解により自己完結型のクライアントモデルを生成し,低ランク部分空間を用いて構造的に適合する集約を実現する。
    • アダプターの同期とグループ間融合を組み合わせることで,IIDおよび非IIDデータセットにおいて既存手法を上回る性能を示す。
    • クライアントモデルは,フルモデルに必要なGPUメモリの約50%で動作し,実用的な効率性を実現する。

    Link: https://arxiv.org/abs/2607.29071

  • 反事実的説明に関する一般化ベイズ的視点:事後確率に基づく意思決定と評価 [eess.SY, cs.SY, cs.AR, cs.AI, stat.ML]目的:反事実的説明の理論的基盤の解明と,事後確率に基づく意思決定ルールの提案
    • 機械学習モデルの解釈可能性向上は,実用化における重要な課題である。
    • 既存の反事実的説明は,距離最小化問題として定式化されているが,その理論的根拠が明確ではない。
    • 距離に基づく事前分布を用いた一般化ベイズ枠組みで反事実的説明を再解釈し,より合理的な意思決定を可能にする。
    • 距離最小化に基づく反事実的説明が,一般化ベイズ枠組みにおけるギブス事後確率の最尤推定値と数学的に同等であることが示された。
    • 期待損失最小化やCVaR-CEといった,最尤推定値以外の意思決定ルールを統一的な枠組みで提案した。
    • 複数のモデルの事後分布を混合する手法を導入し,モデルの多様性を考慮した反事実的説明を可能にした。

    Link: https://arxiv.org/abs/2607.29077

  • DASH-OPD:ヒステリシスを用いた不一致認識によるオンポリシー蒸留 [cs.LG]目的:オンポリシー蒸留における実行者切り替え戦略
    • 強化学習において,教師ありデータの活用は効率的な学習に不可欠である。
    • オンポリシー蒸留では,生徒モデルの初期段階での誤りが学習軌道を大きく逸脱させやすい。
    • 軌道逸脱を防ぎ,生徒モデルの学習効率と性能を向上させる戦略が求められている。
    • 提案手法DASH-OPDは,行動トークンに関する2つの実行者の平均対数確率比を不一致として計算する。
    • 生徒モデルのターンでは生徒-教師間の比率をドリフト信号,教師のターンでは教師-生徒間の比率を回復信号として利用する。
    • ALFWorld環境において,既存手法を上回り,優れた学習・展開効率を示すことが確認された。

    Link: https://arxiv.org/abs/2607.29078

  • 補完性に基づいた反復協調によるLLM集合知の活用 [cs.AI]目的:LLM集合知の活用方法
    • 企業におけるLLM利用が拡大する中で,個々のLLMの能力限界が課題となる。
    • 既存手法では,LLMの組み合わせ方を固定化しており,問題解決における補完性の動的な役割が考慮されていない。
    • 本研究では,LLM間の補完性を活用し,個々の限界を克服することで,より高度な問題解決を目指す。
    • 提案手法WILCは,既存手法と比較して4つの異なるベンチマークにおいて優れた性能を示した。
    • WILCは,標準的な価格設定の下で,GPT-5.2の平均ベンチマーク性能と同等でありながら,推定されるクエリごとのコストを約7分の1に抑えることができた。
    • 本研究は,集合知理論を静的な集約から逐次的なAI補完性へと拡張し,マルチAI連携のための転移可能な設計原則を提供する。

    Link: https://arxiv.org/abs/2607.29087

  • 手術リスク層別化と予後予測における欠如するもの:エンドツーエンド機械学習アプローチのスコープレビュー [cs.CY, cs.LG]目的:手術リスク層別化と予後予測のための機械学習パイプラインの特性評価
    • 術後有害事象は世界的に大きな負担であり,早期のハイリスク患者特定が重要である。
    • 既存研究のデザインにばらつきがあり,方法論が標準化されていない。
    • 臨床的に堅牢な術後機械学習ツールの開発を支援するための方法論的ギャップを特定する。
    • 多くの研究が単一施設でプライベートデータセットを使用しており,再現性と一般化可能性が制限されている。
    • 欠損値処理,特徴選択,クラス不均衡などの重要な前処理ステップの報告が不十分である。
    • 説明可能性を取り入れた研究は全体の約3分の1に過ぎず,臨床実装への課題が残る。

    Link: https://arxiv.org/abs/2607.29090

  • 物理情報に基づいた微分劣化モデリングによるリチウムイオン電池の健全性予測 (PiDDM) [cs.LG]目的:リチウムイオン電池の健全性(SOH)予測
    • エネルギー貯蔵システムの信頼性確保には,正確な電池健全性予測が不可欠である。
    • データ駆動型モデルは,サイクリングプロトコルに依存し,長期的予測で非現実的な挙動を示す場合がある。
    • 電池劣化の物理モデルを取り入れ,より正確で信頼性の高い健全性予測を実現する。
    • PiDDMは,評価されたモデルの中で最も低い平均予測誤差を達成し,多層パーセプトロンやベースラインの物理情報ニューラルネットワークと比較して,二乗平均誤差を大幅に削減した。
    • 外挿実験では,PiDDMは加速される寿命末期の劣化を捉え,ベースラインモデルに見られた非現実的な容量回復を回避した。
    • 本研究は,ニューラルネットワーク学習に劣化物理を組み込むことで,予測精度と物理的一貫性を向上させる有望なアプローチを示す。

    Link: https://arxiv.org/abs/2607.29095

  • StraightDP:整流フロー変圧器のための幾何学的認識型差分プライバシー [cs.LG, cs.CR, cs.CV]目的:テキスト条件付き生成モデルの差分プライバシー保護訓練におけるユーティリティ低下の改善
    • 生成モデルは多様な応用を持つが,プライバシー保護とモデル性能の両立が課題である。
    • 差分プライバシー保護訓練は,強力なプライバシー設定下でモデル性能が著しく低下する。
    • 整流フローの幾何学的特性を利用し,プライバシー保護とモデル性能のトレードオフを改善する。
    • MNISTデータセットにおいて,StraightDPは,従来のDP-SGDと比較して高い精度とFIDスコアを達成した。
    • 特に,公開された潜在空間においては,精度0.81,FIDスコア56という結果が得られた。
    • 本手法は,SD3-mediumなどの事前学習済みモデルにも適用可能であり,DP-LoRAよりも効率的にプライバシー保護を実現する。

    Link: https://arxiv.org/abs/2607.29100

  • DoubleHelix:LLMを用いた音声視覚音声認識のための構造化されたクロスモーダル融合 [cs.SD, cs.AI]目的:音声と視覚のモダリティの有効な融合
    • 近年,音声と視覚情報を組み合わせることで,よりロバストな音声認識が期待されている。
    • 既存の手法では,クロスモーダル相互作用が単一ステップで処理され,反復的な改良が不足している。
    • 構造化された反復的なクロスモーダル相互作用による性能向上を目指す。
    • DoubleHelixは,LRS3データセットにおいて,クリーンな音声で0.68%のWERを達成した。
    • これは,同じバックボーン設定下で,これまでの最高結果を5.6%相対的に上回る。
    • 評価されたバブルノイズ条件下では,SNR -5dBで11.6%のWERを達成し,ロバスト性が向上した。

    Link: https://arxiv.org/abs/2607.29112

  • グラフにおける粒状ボールを用いた多粒度位置埋め込みによるリンク予測 [cs.HC, cs.SI, cs.AI]目的:リンク予測のためのグラフ多粒度位置埋め込み
    • グラフ構造は,社会ネットワークや知識グラフなど,様々な分野で重要な役割を果たす。
    • 既存研究では,単一粒度のランドマークに基づく位置情報しか利用しておらず,構造の階層性を捉えられていない。
    • グラフ構造の多粒度性と階層的な関係性を考慮した位置埋め込み手法を開発し,リンク予測の精度向上を目指す。
    • 提案手法MGLPは,適応的な粒状ボールグラフ洗練機構により,最適な粒度の同質性サブドメインを生成する。
    • サブドメインの中心ノードをランドマークとし,階層的な中心グラフを構築することで,ノードの識別力を高める。
    • 実験結果から,MGLPがリンク予測において優れた性能と競争力を示すことが確認された。

    Link: https://arxiv.org/abs/2607.29115

  • 遺伝的プログラミングによる記号回帰におけるキャッシュ戦略のメモリ・実行時間トレードオフ分析 [cs.NE]目的:遺伝的プログラミングによる記号回帰におけるキャッシュ戦略のメモリと実行時間のトレードオフ
    • 記号回帰は,データから数学的なモデルを自動的に発見する強力な手法であり,様々な分野で応用が期待されている。
    • 記号回帰の計算コストは非常に高く,特に式の評価を繰り返し行う点がボトルネックとなっている。
    • キャッシュ戦略を用いることで計算時間の短縮が期待できるが,最適な戦略とキャッシュサイズは未だ明確ではない。
    • キャッシュ戦略の比較分析の結果,複雑な戦略は一定以上のキャッシュサイズが必要であることが示された。
    • 軽量な戦略(LRU,FIFOなど)は,適合度評価の計算時間を大幅に削減できることが明らかになった。
    • 無限に大きなキャッシュを仮定した場合のキー・バリュー使用頻度の分析から,最適なキャッシュサイズの決定に役立つ知見が得られた。

    Link: https://arxiv.org/abs/2607.29116

  • カリキュラムが重要:合成データを用いたデータ効率の良い関係型PFN事前学習 [cs.LG, cs.DB]目的:関係型PFNの事前学習におけるカリキュラム設計と合成データ多様性の重要性
    • 関係データベースは様々な分野で利用され,その効率的な処理は重要課題である。
    • 従来の事前学習は大量のデータと計算資源を必要とする点が課題である。
    • 少ないデータで効果的な事前学習を実現し,計算コストを削減することを目指す。
    • 単一テーブルのカリキュラム学習により,少ないデータ量(約13,300テーブル)で高いROC-AUC(0.703)を達成した。
    • 関係データベースのみを用いたカリキュラム学習では,RDB-PFNの性能の約88%を,約220分の1のデータ量で回復した。
    • 単一テーブル学習モデルは,関係データベースのベンチマークにおいて,専用のパイプラインに匹敵する性能(0.631)を示した。

    Link: https://arxiv.org/abs/2607.29120

  • SciFigPlag-Bench:科学図版の出所を考慮した盗用検出のためのベンチマーク [cs.CV, cs.LG]目的:科学図版の盗用検出に関する評価基準
    • 科学的発見の視覚的証拠となる図版の重要性が増している。
    • 図版の盗用は,評価基準として確立された多Modalな問題として未だ十分に調査されていない。
    • 特定の出所図版からの証拠の再利用,変換方法,再利用箇所の特定を可能にする。
    • SciFigPlag-Benchは,2582組の正例と2541組の負例を含むハイブリッドベンチマークである。
    • このベンチマークは,ペア検出,出所帰属,階層的な再利用タイプ分類,再利用対応局所化の4つの診断タスクをサポートする。
    • 多様なVision-Languageモデルを用いた実験により,初期ベースラインが確立され,詳細な出所推論,再利用タイプ理解,空間的証拠の接地における課題が明らかになった。

    Link: https://arxiv.org/abs/2607.29124

  • スキーマ誘導型合成リレーショナル事前学習:PluRel-to-RDB-PFN [cs.CL, cs.LG]目的:リレーショナルファウンデーションモデルの事前学習における合成リレーショナルデータベースの活用
    • リレーショナルファウンデーションモデルは,大規模なデータセットを必要とするため,データ収集が重要である。
    • 既存手法では,データ生成とモデル学習が密接に結合されており,柔軟性に欠ける。
    • 外部合成データ生成器を活用し,効率的な事前学習を実現することを目的とする。
    • SCHEMA-GUIDED FIRSTというカリキュラム戦略を用いて,約5500のリレーショナルデータベース(約33Kタスク)のみで,RDB-PFNの性能の約88%を達成した。
    • 特に,1024-shotコンテキストでは0.6346の平均ROC-AUCを獲得し,実世界スキーマを早期に学習させることの有効性を示した。
    • 64-shotコンテキストでは,性能差はさらに縮小し,RDB-PFNの性能の94%に近づいた。

    Link: https://arxiv.org/abs/2607.29129

  • 長期予測のための履歴付きロールアウト学習:HERO [cs.LG, cs.AI]目的:長期的自己回帰予測の安定化
    • 偏微分方程式の高速な近似計算が求められており,ニューラル演算子は有力な手法である。
    • 自己回帰的なロールアウト過程で誤差が累積し,長期予測の精度が低下する課題がある。
    • モデルの最適化履歴を活用し,長期予測における誤差の累積を抑制することを目指す。
    • HEROは,従来の絶対誤差に基づく教師信号に加え,モデルの最適化履歴から得られる相対的な教師信号を用いる。
    • HEROは,過去のモデルや摂動された入力からのロールアウト誤差を比較し,最も失敗しやすい軌跡を基準として学習に活用する。
    • 実験により,HEROが長期予測の精度,安定性,分布外汎化性能を向上させることが示された。

    Link: https://arxiv.org/abs/2607.29135

  • 見覚えはあるか?行動シグナル埋め込みを用いた合成顔データセットのメンバーシップ推論 [eess.SY, cs.SY, cs.CV, cs.AI, cs.LG]目的:合成顔データセットにおけるデータセットレベルのメンバーシップ推論
    • 生体認証技術の発展に伴い,プライバシー保護とデータアクセス制限が重要となる。
    • 合成データは実データで生成されるため,元のデータ情報が漏洩するリスクが存在する。
    • 合成データのプライバシーリスクを評価し,情報漏洩対策の強化を目指す。
    • 顔認識モデルと合成データセットを用いた実験で,合成データセットの特定に100%成功した。
    • ジェネレーターの元データセットの特定率は54.5%であり,実データ由来の痕跡が残存することが示された。
    • 合成データはプライバシー保護のために,より強力な情報漏洩対策が必要であることが示唆される。

    Link: https://arxiv.org/abs/2607.29144

  • 暗黙的機械学習ポテンシャル場が分子動力学シミュレーションを加速する [cs.LG, cs.AI]目的:分子動力学シミュレーションの高速化
    • 物質の性質理解に不可欠であり,創薬や材料開発など広範な分野に応用される。
    • 高精度な計算には膨大な計算資源が必要であり,大規模系や長時間のシミュレーションが困難である。
    • 計算コストを削減し,より大規模かつ長時間のシミュレーションを可能にすること。
    • 暗黙的機械学習ポテンシャル場(I-MLFFs)を導入し,計算効率を向上させた。
    • I-MLFFsは,従来の深層ニューラルネットワークと同等の精度を保ちつつ,計算負荷を2〜5倍削減した。
    • 原子レベルの解像度と時間ステップを維持し,空間的・時間的な粗視化を回避することで,より現実的なシミュレーションを可能にした。

    Link: https://arxiv.org/abs/2607.29158

  • LLMエージェントにおけるメモリー由来の改ざん:持続的メモリーのための非増幅ファイアウォール [cs.CR, cs.AI]目的:LLMエージェントにおけるメモリー由来の改ざんの特定と,それを防ぐProvenance-Preserving Memory Firewall (PPMF)の提案
    • LLMエージェントの長期記憶は有用だが,信頼できない情報源からの影響を排除する必要がある。
    • 既存のフィルタでは,メモリーの集約後の情報源の権限増幅を防げないという課題がある。
    • メモリーの信頼性を維持し,リスクに応じたアクションの実行を制御することを目標とする。
    • メモリー集約時に,外部からの観察がユーザーの履歴やワークフローとして書き換えられる改ざん(メモリー由来の改ざん)を特定した。
    • 提案手法PPMFは,プラットフォームで管理される情報源を保持し,アクションのリスクとメモリーの権限を照合することで,権限増幅を防ぐ。
    • 評価の結果,PPMFは不正な高リスクアクションを阻止しつつ,安全なアクションや低リスクなメモリー利用を許可することが示された。

    Link: https://arxiv.org/abs/2607.29167

  • ActFovea:視覚・行動の一時空間的一貫性によるVLAポリシーの実行時保護 [cs.CL, cs.RO, cs.AI]目的:VLAポリシーの実行時における異常検知と緩和
    • ロボット操作において,視覚情報と行動の一体的な理解が重要であるため,VLAポリシーは高性能を示す。
    • VLAポリシーは,視覚情報,ロボットの状態,実行された行動の同期が崩れると,脆弱性を示すという課題がある。
    • 本研究では,視覚・行動の一時空間的一貫性を利用し,VLAポリシーの実行時保護を可能にすることを目的とする。
    • ActFoveaは,VLAポリシーの再学習や修正を必要とせず,異常を検出し緩和するプラグアンドプレイ型のフレームワークである。
    • 局所的な視覚的妨害下での成功率を49.3%から90.3%に向上させ,クリーンな環境での性能との差を93.7%まで縮小した。
    • 行動のずれや視覚的な遅延に対しても成功率を改善し,観察の再生に対する安全なフェイルセーフ機能を実装した。

    Link: https://arxiv.org/abs/2607.29169

  • CLIFT:Gemini Roboticsのオンデバイスロボットを非侵襲的閉ループ反復ファインチューニングにより人型ロボット専門家へと変える [cs.RO, cs.AI]目的:Gemini Roboticsのオンデバイスロボットを人型ロボットの専門家へと変えること
    • ロボットの基盤モデルは進化しているが,多くは閉鎖的であり,ユーザーによる適応が困難である。
    • マネージドSFT APIでは,強化学習等の内部学習信号を用いる改善が制限されている。
    • 本研究は,API制約下での閉ループ改善による人型ロボットのタスク習熟を目指す。
    • マネージドAPIによるSFTは,同等のデモンストレーションデータで訓練されたオープンウェイトVLAを大幅に上回った。
    • CLIFT(Closed-Loop Iterative Fine-Tuning)により,API互換の教師ありデータとして報酬フィードバックを活用し,モデルの内部にアクセスせずにポリシーを改善した。
    • CLIFTは,2回の反復サイクルでGRODをほぼ完璧な成功率に導き,モデルを開放することなく高度な習熟を実現した。

    Link: https://arxiv.org/abs/2607.29172

  • MBDiff:行動を考慮した拡散モデルによる確率的公共ユーティリティデータ補完 [cs.LG, cs.AI]目的:公共ユーティリティデータの欠損値補完
    • 公共ユーティリティデータは,請求の正確性,需要予測,効率的な供給管理に不可欠である。
    • 既存研究は集約データに依存し,より正確な補完に役立つユーザー行動情報を無視している。
    • 長期的,多様,不完全なデータからユーザー行動を学習し,補完を誘導することを目指す。
    • 提案手法MBDiffは,電力および水道使用量データセットにおいて,既存手法をそれぞれ7.04%,29.1%上回る性能を示した。
    • MBDiffは,多視点ユーザー行動抽出モジュールと行動を考慮した条件付き拡散モデルを組み合わせている。
    • これにより,計算効率良く欠損値補完を実現し,公共ユーティリティデータ管理の精度向上に貢献する。

    Link: https://arxiv.org/abs/2607.29177

  • MoRAE:テキストからモーション生成のための流れに優しい自己教師あり潜在表現 [cs.CV, cs.AI]目的:テキストからモーション生成における潜在表現の構築
    • モーション生成は,人間らしい自然な動きの実現に不可欠であり,様々な応用分野で重要性が増している。
    • 既存手法では,潜在空間の設計が難しく,生成されるモーションの品質や安定性に課題があった。
    • 本研究は,モーション特有の問題に対処し,安定かつ高品質なモーション生成を可能にする潜在表現を構築することを目指す。
    • 提案手法MoRAEは,既存のMotion-JEPAの潜在空間の不安定性を改善し,より安定したモーション生成を実現した。
    • MoRAEは,潜在表現の設計とモーション結合学習により,デコーダーに敏感な方向への誤差増幅を抑制した。
    • その結果,MoRAEは最先端の性能を達成し,非自己回帰的Flow-Matching DiTと組み合わせることで,優れたモーション生成を実現した。

    Link: https://arxiv.org/abs/2607.29180

  • SERUM:ユーザーモデリングのための状態抽出と洗練 [cs.LG, cs.AI, cs.CV]目的:ユーザーの意図とワークフローの構造化モデル
    • プロアクティブな対話型アシスタント実現には,ユーザー理解が不可欠である。
    • 生のスクリーンアクティビティからモデル構築は未解決の課題である。
    • 非構造化動画から解釈可能なプロセスモデルを自動生成すること。
    • 反復的なラベル洗練により,安定した状態語彙(概略的均衡)に収束することが確認された。
    • 正規化されたマルコフモデルは,頻度ベースラインと比較して,低いパープレキシティと高い行動予測を達成した。
    • 最終パスのラベルは,最初のパスのラベルよりも正確で,意味的に改善されていると評価された。

    Link: https://arxiv.org/abs/2607.29181

  • CAGE:型付きリターン不確実性下におけるツール使用エージェントの認証 [cs.CL, cs.CL, cs.AI]目的:ツール使用LLMエージェントにおける行動認証の安全性
    • LLMエージェントの活用が拡大する中で,その安全性確保は重要課題となっている。
    • リターン値のバインドミスや数値誤差による,認証の脆弱性が存在する。
    • リターン値の周辺領域における認証を保証し,誤認を低減することを目指す。
    • CAGEは,カテゴリと数値チャネルを分離して認証する手法では不十分であることを示す。
    • CAGEは,離散的な分岐を列挙し,連続的な摂動を各分岐内で認証することで,この問題を直接的に解決する。
    • 実験により,CAGEが誤認を削減しつつ,有用な意思決定の自律性を維持することが示された。

    Link: https://arxiv.org/abs/2607.29190

  • SAF-OPD:オンポリシー蒸留のための安定した優位性融合 [cs.LG, cs.AI]目的:強化学習における報酬とオンポリシー蒸留の融合による性能向上
    • 強化学習は,複雑な意思決定問題を解決するための重要な手法であり,様々な分野で応用が期待されている。
    • 従来のオンポリシー蒸留は,教師の性能に依存しやすく,探索が制限されるという課題があった。
    • 本研究は,報酬と蒸留の優位性を安定的に融合し,探索を促進することで,性能向上を目指す。
    • 提案手法SAFは,優位性の大きさの不一致と時間的な不一致という2つの問題を解決する。
    • SAFは,スパース化と圧縮,ウォームアップとアニーリングという軽量なパイプラインを用いることで,これらの問題を克服する。
    • 実験結果から,SAFは固定係数融合と比較して,数学的推論とコード生成のベンチマークにおいて0.51-2.70%の性能向上を示すことが確認された。

    Link: https://arxiv.org/abs/2607.29209

  • GALA:淘宝商家向けレコメンダーシステムにおける適応型マルチモーダル表現のための生成的なアラインメント学習 [cs.CL, cs.IR, cs.LG]目的:適応型マルチモーダル表現の生成的なアラインメント学習
    • フードデリバリー等のレコメンダーシステムにおいて,画像,テキスト,ユーザーインタラクション等のマルチモーダル信号の活用が重要となっている。
    • 異種マルチモーダル信号の効果的な融合が課題であり,マルチモーダル信号の同時モデリングや進化するユーザー意図への適応が困難である。
    • セマンティック理解とユーザー行動パターンの乖離を解消し,レコメンダーシステムの性能向上を目指す。
    • GALAは,ユーザー行動からマルチモーダル事前学習データを構築し,報酬に基づいた変換により洗練する「生成的なRLアラインメント」を中核としている。
    • オフライン評価では,最先端手法と比較して,AUCが+0.12/+0.20の一貫した改善が見られ,PCOC指標も向上した。
    • 大規模なオンラインA/Bテストでは,注文量が0.55%増加し,GALAの産業規模での有効性と多様な需要パターンに対する頑健性が確認された。

    Link: https://arxiv.org/abs/2607.29213

  • MirrorCraft:Minecraftにおける隠れたルール変更下でのペア評価 [cs.AI]目的:Minecraftにおける隠れたルール変更下でのエージェント評価のためのベンチマーク
    • 大規模言語モデルの発展に伴い,Minecraftのようなゲーム環境におけるLLMベースエージェントの能力評価が重要となっている。
    • 既存のベンチマークは固定されたゲームメカニクス下での評価が中心であり,ルール変更への適応能力を測ることができていない。
    • ルール変更に適応できるエージェントを評価するため,現実的な変化に対応可能な環境を提供する。
    • MirrorCraftは,VanillaとMirrorの世界をペアで用意し,Mirrorの世界でのみルールを隠蔽的に変更することで,エージェントの適応能力を評価する。
    • 実験の結果,ルール変更はルールスイートによってエージェントのパフォーマンスに大きく異なる影響を与えることが示された。
    • ルール説明なしではReActが最も高いスコアを達成したが,ルールを明示的に与えることで進捗と完了率がわずかに向上した。

    Link: https://arxiv.org/abs/2607.29218

  • MOSAIC:安全なAI計算のマスクアウトソーシング [cs.CR, cs.AI]目的:信頼できるが計算能力の低いクライアントから,信頼できないが強力なサーバーへのAI計算の安全かつ効率的なアウトソーシング
    • AIの発展に伴い,大規模な計算資源が不可欠となり,安全なアウトソーシングの需要が高まっている。
    • サーバーがクライアントの入力やモデル情報を漏洩させるリスクが存在し,安全なアウトソーシングが困難である。
    • クライアントのプライバシーを保護しつつ,効率的なAI計算アウトソーシングを実現すること。
    • MOSAICは,従来の技術よりも大幅に大きな行列に対応する新しい行列乗算マスキングプロトコルを基盤としている。
    • MOSAICは,ノイズの追加とエラーのスケーリングメカニズムにより,クライアントのオーバーヘッドを最適化し,高速な実行時間を実現する。
    • 大規模な70Bモデルでのperplexityは,量子化手法やBF16推論と同等であり,大規模な機密AIの実現に貢献する可能性がある。

    Link: https://arxiv.org/abs/2607.29221

  • 効率的なベイズ最適化:データとリソースが限られた探索のためのスケーラブルな代理モデル [cs.LG, physics.chem-ph, physics.comp-ph]目的:ベイズ最適化における計算コストと最適化性能の関係の評価
    • 科学技術分野において,データ効率の良い最適化手法としてベイズ最適化の重要性が高まっている。
    • ベイズ最適化の計算コストが,最適化性能と並んで考慮されることが少ないという課題がある。
    • 計算コストを抑えつつ,最適化性能を維持・向上させるための代理モデル選択の指針を示す。
    • ガウス過程に基づくベイズ最適化は,他のモデルと比較して時間とメモリのオーバーヘッドが大きく,最適化性能は同等か劣ることが示された。
    • ランダムフォレストやNGBoostなどのスケーラブルな代替モデルは,計算コストを大幅に削減しつつ,同等以上の性能を達成することが確認された。
    • データセットの特徴から最適な代理モデルを予測するフレームワークを提案し,再現性のある計算コストを考慮したベイズ最適化の基準を確立した。

    Link: https://arxiv.org/abs/2607.29225

  • 線形提案演算子と確率的探索幾何:SOMAおよび差分進化における [cs.RO, cs.NE, cs.AI]目的:SOMAと差分進化の提案幾何学的特性の分析
    • 群知能と進化アルゴリズムは最適化において重要な役割を担うが,その内部構造は解析が困難である。
    • 候補生成における非線形な選択,置換,適応が,より単純な構造を隠蔽している。
    • 提案演算子と選択の分離により,アルゴリズムの特性を明らかにし,性能向上を目指す。
    • SOMAの提案は,検索空間においてアフィンであり,拡張された状態では線形であることが示された。
    • ベルヌーイ摂動マスク下での提案の平均,共分散,ステップ長などの閉形式表現が導出された。
    • 提案レベルの演算子分析が,個体群ベースの最適化手法の解釈と設計を支援できることが実証された。

    Link: https://arxiv.org/abs/2607.29228

  • FBFM:ワールド・アクションモデル実行における訓練不要な非同期フィードバック機構 [cs.RO, cs.RO, cs.AI, cs.SY, eess.SY]目的:ワールド・アクションモデルにおけるフローマッチングのための訓練不要な非同期フィードバック機構
    • ロボットの長期間制御において,視覚的進化を予測するワールド・アクションモデルは重要である。
    • 既存モデルはチャンク単位でのフィードバックであるため,個々の時間ステップでの予測誤差の修正が困難である。
    • 本研究は,生成中のチャンク内で再接地を行うことで,よりきめ細かいオンライン修正を実現する。
    • 提案手法FBFMは,訓練不要で推論時に作用し,予測のドリフトを抑制し,予期せぬ事態への応答性を高める。
    • DreamZeroとLingBot-VAを用いた評価で,選択されたLIBEROおよびRoboTwin2.0タスクにおいて,成功率が5%以上向上した。
    • 実世界のロボット観測・予測診断により,追跡性能が著しく向上することが示された。

    Link: https://arxiv.org/abs/2607.29235

  • 十分な小ささ:LoRAアダプターによるAI編集テキストのユーザー別スタイル書き換え [cs.CL, cs.AI, cs.CY, cs.ET, cs.HC]目的:AI編集テキストの個人の文体への書き換え
    • AIによる文章生成技術の発展に伴い,個人の文体維持が重要となっている。
    • AI生成テキストは,個人の文体と異なり,非人間的になりやすいという課題がある。
    • LoRAアダプターを用いて,プライバシーを保護しつつ,個人の文体に合わせた書き換えを実現する。
    • 科学論文コーパスを用いた評価で,モデルサイズに関わらず自動合成スコアが0.69で安定した。
    • モデルサイズは品質の安定したランキングよりも,トレードオフに影響を与えることが示唆された。
    • LLMによる評価では,InMyStyleの出力は入力テキストよりもAIらしさが20%以上低く評価された。

    Link: https://arxiv.org/abs/2607.29238

  • モデルの事前知識と視覚的証拠が衝突する場合:選択的事前知識の調整による常識に基づいた幻覚の軽減 [cs.CV, cs.AI]目的:視覚言語モデルにおける常識に基づいた幻覚の軽減
    • 視覚言語モデルの性能向上には,視覚情報と常識的な知識の統合が不可欠である。
    • 常識的な事前知識が,明確な視覚的証拠よりも優先される場合,誤った推論が生じることがある。
    • 視覚的証拠と矛盾する事前知識の影響を抑制しつつ,常識的な推論能力は維持すること。
    • 提案手法である選択的事前知識の調整(SPC)は,反事実的な画像に対する精度を大幅に向上させる。
    • SPCは,常識的な画像を対象とする際の精度をほぼ維持しながら,この改善を実現している。
    • SPCの有効性は,幻覚のカテゴリーや候補応答の順列など,様々な状況下で確認された。

    Link: https://arxiv.org/abs/2607.29240

  • RecHarness:自己進化型レコメンダシステムのバンディット経路探索型エージェントハーネス [cs.IR, cs.AI, cs.CL]目的:レコメンダモデルの自動最適化
    • レコメンダシステムの性能向上は,ビジネスにおいて不可欠であり,継続的な改善が求められている。
    • レコメンダシステムの最適化には熟練のエンジニアの試行錯誤が必要であり,効率が課題となっている。
    • LLMを活用した自動最適化の不安定性を改善し,限られた実験予算で効果的な改善を目指す。
    • RecHarnessは,バンディット経路探索とLLMによる仮説生成を分離することで,安定した性能向上を実現した。
    • 停滞時には構造ジャンプ機構が作動し,長期的な探索を維持する。
    • 大規模な短尺動画広告プラットフォームでのA/Bテストで,ADVVが2.084%,Revenueが0.534%,Exposureが0.559%向上した。

    Link: https://arxiv.org/abs/2607.29241