arXiv雑要約

AI - 2026/07/30 公開

  • SARC-DQ:エージェントAIにおける実行時データ品質ゲート:隠れた証拠欠陥,無能シールド,および後処理による修正 [cs.SE, cs.AI, cs.CY]目的:エージェントAIにおける証拠データの品質問題とその対策
    • AIエージェントは行動するため,データの品質が行動の正確性とコストに直結する
    • AIエージェントは,自身が見えないメタデータ欠陥を検知できず,誤った行動につながる
    • メタデータに焦点を当てた品質ゲートを導入し,後処理による修正で損失を回復すること
    • エージェントは,メタデータ欠陥を含む証拠データから約60%の確率でコストのかかる誤った行動を起こすことが確認された。
    • AIモデルの性能向上だけでは,データに対する懐疑的な姿勢は獲得されない。
    • メタデータに着目した品質ゲートと後処理による修正により,カバーされる範囲において損失を完全に回復できる。

    Link: https://arxiv.org/abs/2607.26313

  • ステルスベンチ:自律型攻撃セキュリティエージェントにおける運用上のステルス性の測定 [cs.CR, cs.AI]目的:自律型攻撃セキュリティエージェントにおける運用上のステルス性の評価
    • セキュリティ研究や高度な持続的脅威において,存在や能力を隠蔽するステルス性は重要である。
    • 自律型エージェントに攻撃タスクが委ねられる中,ステルス技術の継承が課題となっている。
    • 本研究は,自律型エージェントのステルス性の欠如を明らかにし,改善を促すことを目指す。
    • ステルスベンチは,運用セキュリティ(OPSEC)の6つの側面から,自律型エージェントのステルス性を測定するベンチマークである。
    • 評価の結果,どのモデルも安全な成功率が54%を超えず,OPSEC違反がモデル全体で系統的に発生することが確認された。
    • ステルスベンチは,ステルス性を意識したエージェントの開発や,自律型攻撃セキュリティ展開における自動OPSEC監視を支援する。

    Link: https://arxiv.org/abs/2607.26314

  • LLMによる受験者シミュレーションと心理測定的較正の一致:認知診断プロファイリングアプローチ [cs.RO, cs.DC, cs.CY, cs.AI, cs.CL]目的:教育テストの心理測定的較正におけるLLMシミュレーション受験者と実際の受験者との一致
    • 教育テストの質を確保するためには,正確な心理測定的較正が不可欠である。
    • 従来の較正には,費用と時間のかかる実際の受験者のデータが必要となる。
    • LLMシミュレーションを較正に活用するための精度向上と実用化を目指す。
    • 認知診断プロファイリング(CDP)により,LLMシミュレーション受験者の応答の正確性と均一性が改善された。
    • CDPは,能力分布,習熟度プロファイル,項目難易度の3つのレベル全てにおいて,人間受験者との一致度を高めた。
    • 特にGemini 3.0 Flash (Thinking)を用いた場合,項目難易度と人間の結果との相関が大幅に向上し,RMSEも大幅に低下した。

    Link: https://arxiv.org/abs/2607.26317

  • マルチエージェントデモンストレーションから暗黙的な因果的ワールドモデルの学習 [cs.DC, cs.LG, cs.MA, cs.RO]目的:マルチエージェントデモンストレーションからの環境ダイナミクスの復元
    • モデルベース強化学習において,環境の理解は学習効率と汎化性能に不可欠である。
    • 従来のワールドモデルは,統計的相関と因果関係を混同し,分布シフトに弱い。
    • 戦略的意図が絡むマルチエージェント環境における因果関係の学習を目指す。
    • 本研究では,事前定義された因果グラフを必要とせずに,オフラインデモンストレーションから環境ダイナミクスを学習する新しいアプローチを提案する。
    • 提案手法は,ポリシーの分散を組み込むことで,Sequential Backdoor Conditionを用いてワールドモデルを発見可能にする。
    • 二つのドア,ナビゲーション,Givewayタスクにおける評価により,部分観測下を含む様々な条件下で解釈可能な因果表現が得られることが示された。

    Link: https://arxiv.org/abs/2607.26336

  • RAGuard:検索拡張生成システムに対するデータポイズニング攻撃に対する多層防御フレームワーク [cs.RO, eess.IV, cs.HC, cs.LG, cs.CR, cs.IR]目的:検索拡張生成システムにおけるデータポイズニング攻撃に対する防御
    • 大規模言語モデルの性能向上に検索拡張生成が不可欠であり,外部知識源への依存度が高い。
    • 外部知識源が改ざんされることで,誤った情報が生成されるリスクが存在する。
    • 知識源への悪意ある情報注入による攻撃を検出し,システム全体の堅牢性を高める。
    • 敵対的学習による検索器の調整は攻撃の成功率を軽減するが,完全には排除できない。
    • 提案手法であるZKIPは,どの設定においても攻撃成功率を0.000にまで抑制し,検索性能の低下も最小限に抑える。
    • ZKIPが依存する反事実的な信号には,学習可能なポイズン構造が含まれていることが確認された。

    Link: https://arxiv.org/abs/2607.26339

  • Incast回避MoEレートベーススケジューリング [cs.NI, cs.DC, cs.LG]目的:MoEにおけるIncast現象の回避と性能向上
    • 大規模言語モデルの性能向上にMoEが不可欠であり,効率的な分散処理が求められている。
    • 従来のラウンドロビン方式では,MoEトラフィックにおいてIncast現象が発生し,ボトルネックとなる。
    • MoEワークロードに適した公平なスケジューリングフレームワークを提案し,Incastの抑制を目指す。
    • 提案手法は,MoEトラフィックにおける新たなIncast現象を効果的に回避できることが示された。
    • リンク利用率をほぼ100%に維持しつつ,Collective Completion Time (CCT)を大幅に削減できることが確認された。
    • NICへの実装可能性も示され,実環境での適用が期待される。

    Link: https://arxiv.org/abs/2607.26340

  • グラフニューラルネットワークのトップk説明における自己同型性による非標準性 [cs.LG, cs.AI]目的:グラフニューラルネットワークの説明における非標準性の構造的障壁の特定
    • グラフニューラルネットワークの説明可能性は,モデルの予測根拠を理解する上で重要である。
    • グラフ構造の対称性により,説明が一意に定まらない問題が存在する。
    • 入力グラフの対称性が説明に及ぼす影響を形式的に検証し,解決策を提示する。
    • 入力グラフの自己同型性が説明の値を固定しない場合,最小かつ対称性を尊重する説明は一意に定まらない。
    • グラフの構造のみから,特定のサイズの説明が軌道分割を必要とするかどうかを決定するパラメータフリーな基準を開発した。
    • この基準は,検証可能なケースにおいてモデル同値性のチェックと完全に一致し,対称性の問題は一般的な現象であることが示された。

    Link: https://arxiv.org/abs/2607.26344

  • MetaKoopman:分布シフト下における構造化されたダイナミクスのモデリングのためのクープマン演算子のベイジアンメタ学習 [cs.LG, cs.RO, cs.SY, eess.SY]目的:分布シフト下における非線形ダイナミクスのモデリングと予測
    • 現実世界のシステムのロバストな意思決定には,分布シフト下での非線形ダイナミクスのモデリングが不可欠である。
    • 既存の手法では,分布シフトに対してロバストな予測や不確実性の定量化が課題となっていた。
    • 本研究は,分布シフトに強く,不確実性を正確に捉えるダイナミクスモデルの構築を目指す。
    • MetaKoopmanは,クープマン演算子に対する事前分布を学習し,少ないデータからダイナミクスを効率的に推定する。
    • 実際のトラックとトレーラーシステムでの実験により,MetaKoopmanが既存手法よりも予測精度,不確実性の校正,分布シフトへのロバスト性が向上することが示された。
    • 動的に実行可能な経路計画において,MetaKoopmanが特に有効であることが実証された。

    Link: https://arxiv.org/abs/2607.26345

  • 合成ユーザーが失敗する場合:LLMによる人間による調査回答のクロスドメインベンチマーク [cs.CL, cs.AI, cs.CY, cs.HC]目的:LLMによる人間調査回答のシミュレーションの妥当性評価
    • 市場調査や政策決定において,人間調査の代替手段としてLLMの利用が増加している。
    • LLMのシミュレーション回答が,実際の人間回答とどの程度一致しているかの検証が不足している。
    • LLMシミュレーションの限界を明らかにし,意思決定支援における安全な利用範囲を特定すること。
    • どのLLMも,人間データで学習したベースラインモデルより優れた結果を示さなかった。
    • LLMは,個人のアイデンティティを態度形成において過度に重視する傾向があり,現実の人間のデータとは異なる歪みが生じた。
    • セグメントターゲティングにおいて,LLMはセグメント間のギャップを拡大し,誤ったセグメントを導き出す可能性が示された。

    Link: https://arxiv.org/abs/2607.26348

  • 実証的ネットワーク研究のための,構成可能なドメイン特化型バックエンドPramana [cs.NI, cs.AI, cs.MA]目的:実証的ネットワーク研究におけるアイデアからデータ生成までの遅延を削減すること。
    • ネットワーク研究は仮説を実証的証拠に変えることで進歩するため,研究の加速が重要である。
    • 新たなアイデアを検証するには,実験環境構築のオーバーヘッドが大きく,研究者の負担が大きい。
    • Pramanaによって,実験の意図,実行基盤,生成メカニズムを分離し,柔軟なデータ生成を実現する。
    • Pramanaは,66件の論文から抽出された255件のデータ生成意図を網羅するintent specificationを実現した。
    • 既存のツールと比較して,intent specificationの適合率は大幅に向上しており,既存の最高のツールの2倍以上である。
    • Pramanaは,データ生成バックエンドの抽象化と実装のギャップを埋め,実証的ネットワーク研究の加速に貢献する。

    Link: https://arxiv.org/abs/2607.26352

  • 高次マルコフ被覆探索:忠実性仮定のk-次緩和による [cs.CL, cs.DB, cs.LG, cs.AI, stat.ML]目的:変数に対するグラフ的マルコフ被覆の学習
    • ベイズネットワークや因果推論など,広範な分野でグラフ構造学習に不可欠である。
    • 忠実性仮定が,XORやパリティーのような高次依存関係によって破られることがある。
    • k+2変数の間のパリティー型関係を捉えた,忠実性仮定のk-次緩和を提案する。
    • 提案手法kOMBは,忠実性仮定の緩和を用いてマルコフ被覆の探索を行うアルゴリズムである。
    • 実験的に,kOMBが忠実性の真の違反と経験的な違反の両方下でマルコフ被覆を復元できることを示した。
    • kOMBの実装は公開されており,利用可能である。

    Link: https://arxiv.org/abs/2607.26357

  • 学習の限界におけるポストトレーニング:ファインチューニングへのゲーム理論的アプローチ [cs.LG, cs.AI, cs.GT]目的:言語モデルのファインチューニングにおける報酬と参照ポリシーからの逸脱のバランス
    • 言語モデルの性能向上は重要であり,特定のタスクへの適応が求められる。
    • KL正則化項の係数設定が,経験則やハイパーパラメータ探索に頼りがちである。
    • 統計的識別力に基づいた最適な正則化係数を導出し,効率的なファインチューニングを実現する。
    • 提案手法は,Qwen3-8BおよびLlama-3.2-1Bを用いた実験で,継続学習設定において競争力のある報酬保持のトレードオフを示す。
    • ゲーム理論的枠組みにより,報酬1単位あたりの統計的識別可能性を最大化する正則化パラメータを決定する。
    • このフレームワークは,オープンソースモデルを提供するAPIプロバイダーの監査にも応用可能である。

    Link: https://arxiv.org/abs/2607.26358

  • 物理問題における構造の探求:AIエージェントは統計力学的な写像を発見できるか [cs.IR, cs.AI]目的:物理問題の構造発見におけるAIエージェントの能力
    • 理論物理学では,未知の問題を既知のモデルに変換する能力が重要である。
    • 現在のAIモデルは,数値的な一致だけでなく,問題の構造的な理解が課題である。
    • AIエージェントによる統計力学的な写像の発見能力を評価し,改善方向を示す。
    • 大規模言語モデル(LLM)ベースのエージェントは,数値的なフィードバックによってコードの修正と正しい分配関数の復元が可能であることが示された。
    • エージェントは数値チェックを通過しても,基礎となるクラスの識別や計算複雑度の評価を誤ることがある。
    • 数値的な合意だけでなく,記号的なチェックや構造的不変性を含む検証スタックの必要性が示唆された。

    Link: https://arxiv.org/abs/2607.26367

  • 金融開示テキストにおける詳細な不整合分類の診断 [cs.CL, cs.AI]目的:金融開示における不整合の種類分類
    • 金融開示は企業の健全性判断に不可欠であり,正確な情報が求められる。
    • 開示内容には様々な種類の不整合が存在し,手動での確認に労力がかかる。
    • 不整合の種類を自動的に分類することで,レビュープロセスの効率化を目指す。
    • ファインチューニングされた300Mエンコーダーが61.9%の精度を達成し,LoRA適用されたQwen3.5-9Bモデル(61.5%)やGPT-5.4(61.3%)と同程度の性能を示した。
    • 正解の証拠範囲を与えることでエンコーダーの精度は65.3%に向上し,自動予測された範囲でもある程度の改善が見られたが,局所化の品質がボトルネックであることが示唆された。
    • 参照不整合は局所化の品質に特に敏感であり,事実および論理的不整合は証拠が与えられても依然として困難な課題である。

    Link: https://arxiv.org/abs/2607.26368

  • ClockRoPE:時間的ルーチンのモデリングのためのランダムフーリエ回転 [cs.LG]目的:時間的ルーチンのモデリングにおける表現力向上
    • シーケンシャルレコメンデーション等において,系列データ中の時間的パターンは重要である。
    • RoPEの周波数スケジュールは,複雑な距離相関パターンに対応しにくい。
    • 周期的な注意機構のモジュレーション関数を用いた回転周波数を設計する。
    • ClockRoPEは,フーリエ変換によって誘導されるランダムな回転を利用する理論的基盤を持つ。
    • オンラインA/Bテストにおいて,ClockRoPEは重要なエンゲージメント指標において改善を示した。
    • 大規模な動画共有プラットフォームの生成検索システムに展開された。

    Link: https://arxiv.org/abs/2607.26369

  • 未知のダイナミクスに対する自己適応学習とモデル予測制御:後悔のない追従 [cs.RO, cs.LG, cs.SY, eess.SY]目的:未知のターゲットダイナミクスの追従
    • ロボットが動的環境で自律的に行動するために,ターゲットのダイナミクスを推定し追従する技術は不可欠である。
    • 従来の制御手法では,ターゲットダイナミクスが未知または時間とともに変化する場合,最適な追従性能を達成することが困難である。
    • 本研究は,ターゲットダイナミクスの切り替わりや未知の部分に対応できる,自己適応的な学習と制御手法を開発する。
    • 複数の予測器を学習し,ターゲットの行動に合わせて最適な予測器を適応的に選択することで,高い追従性能を実現した。
    • 学習誤差やダイナミクスの切り替わりがない場合,最適な制御ポリシーに漸近的に近づき,後悔のない制御が可能となる。
    • シミュレーションおよび実機実験により,提案手法が既存手法と比較して,多様なターゲット軌道に対してロバストな性能を示すことが確認された。

    Link: https://arxiv.org/abs/2607.26370

  • Zero-Fi:コントラスト信号言語アライメントによるゼロショットWi-Fiベース人間活動認識 [cs.IR, cs.CV, cs.AI]目的:ゼロショットWi-Fiベース人間活動認識の実現
    • Wi-Fiセンシングは,非侵襲的な活動認識に有効であり,高齢者見守り等への応用が期待される。
    • 既存手法は,事前に定義された活動に限定され,未知の活動の認識には対応できないという課題がある。
    • 自然言語による活動記述とWi-Fi信号の対応付けにより,未知活動の認識を可能にすることを目指す。
    • 提案手法Zero-Fiは,Wi-Fi信号と自然言語記述を共通の埋め込み空間に配置することで,ゼロショット認識を実現した。
    • 大規模データセットでの実験により,Zero-Fiが未知活動クラスの認識において有効であることが示された。
    • 信号言語アライメントにより,Wi-Fiセンシングの応用範囲を拡張できる可能性が示唆された。

    Link: https://arxiv.org/abs/2607.26381

  • 競争的限界における共謀:価格水準監査は構造的に盲目的である [eess.SY, cs.RO, cs.SY, cs.DB, cs.GT, cs.AI, cs.CR]目的:アルゴリズムによる共謀の可能性
    • デジタル経済における価格設定メカニズムの透明性と公正性の確保は重要である。
    • 既存の共謀検出手法は,巧妙な共謀行為を見抜くのが困難である。
    • 価格設定アルゴリズムの共謀を検出し,規制するための新たなアプローチを提示する。
    • 価格データのみに基づく共謀検出は,特定の条件下では盲目的になりうる。
    • 言語モデルを用いた実験では,モデル間の入札行動に有意な相関が見られた。
    • 入札者の数をカウントすることによって,共謀をある程度抑制できる可能性がある。

    Link: https://arxiv.org/abs/2607.26385

  • 誤整合性には個性がある:大規模五因子モデルによる誤整合性の創発的理解 [cs.CL, cs.AI]目的:言語モデルにおける誤整合性の発現メカニズムの解明
    • AIの安全性確保は,社会への実装において不可欠であるため,その研究は重要性を増している。
    • 誤整合性が生じる原因が不明確であり,効果的な対策が講じられていない現状がある。
    • 誤整合性の根底にある心理的特性を明らかにし,より安全なAI開発に貢献する。
    • 誤整合性は,モデルの「個性」の変化として捉えることができることが示された。
    • 誤整合性を示すデータセットは,大規模五因子モデルにおいて一貫した特徴(協調性・誠実性の低下,外向性・神経症の増加)を示すことが確認された。
    • この研究により,安全性の問題診断を,人間が理解しやすい「個性」のプロファイルとして表現することが可能になった。

    Link: https://arxiv.org/abs/2607.26389

  • Q-Steer:分子最適化のための行動価値による誘導 [cs.LG, q-bio.BM]目的:分子最適化における行動価値の利用
    • 創薬等において,分子構造の最適化は重要な課題であり,効率的な手法が求められている。
    • 従来の分子最適化では,最終的な評価までの遅延が問題であり,中間段階での改善が難しい。
    • 中間段階での行動選択を改善し,最適化の効率と精度を高めることを目指す。
    • Q-Steerは,部分的なSMILES表現に対して,次のトークン選択の行動価値を評価する仕組みを導入した。
    • PMO23データセットを用いた実験で,既存の最適化手法と比較して,valid-uniqueスコアが改善された。
    • Q-Steerは,分子言語モデルや最適化手法の種類によらず,安定した性能向上を示すことが確認された。

    Link: https://arxiv.org/abs/2607.26391

  • CaM-Wolf:因果認識型マルチモーダルエージェントによる社会推論ゲーム [cs.AI]目的:社会推論ゲームにおけるエージェントの性能向上
    • 人間社会の複雑な相互作用を理解するAI開発に不可欠な研究分野である。
    • 既存のエージェントはテキストベースであり,人間のコミュニケーションにおける非言語情報の重要性を見過ごしている。
    • マルチモーダル情報を活用し,より人間らしい社会的な振る舞いを実現するエージェントを開発すること。
    • CaM-Wolfは,ビデオ入力と因果的推論を統合し,より高度なゲームプレイを実現した。
    • ユーザー調査の結果,CaM-Wolfは人間とのインタラクションの質を向上させることが示された。
    • 本研究は,より自然な社会性を持つAIエージェント開発への重要な一歩となる。

    Link: https://arxiv.org/abs/2607.26393

  • 推論前の知識:LLM酵素分類のためのトレーニング不要型診断ベンチマークEC-Reason-Bench [cs.CL, cs.LG, q-bio.QM]目的:LLMによる酵素分類能力の診断
    • 酵素機能予測は,タンパク質機能分類において重要な階層構造を持つ知識集約的な分野である。
    • 汎用LLMは粗いレベルでは高い精度を示すものの,EC番号の詳細レベルでは精度が著しく低下する。
    • LLMの酵素分類能力低下の原因を特定し,重み更新なしでの改善可能性を探る。
    • 外部知識の活用が決定的に重要であり,知識なしでの低い性能は知識へのアクセスによって大幅に改善される。
    • 証拠が利用可能な場合,LLMの集計スコアは近傍酵素の多数決と区別がつかず,これは平均化による見かけ上の結果である。
    • 推論は知識源ではなく,相反する近傍酵素の仲裁者として機能する。性能はホモロジーの利用可能性に依存する。

    Link: https://arxiv.org/abs/2607.26397

  • 非勾配ベクトルフローによるフローマップ学習 [cs.LG]目的:フローマップの学習
    • 拡散モデルやフローベースモデルの性能向上に不可欠な研究分野であり,生成モデルの発展に貢献する。
    • 既存手法は,モデルの逆変換や反復計算による微分が必要で,計算コストが高いという課題がある。
    • 高コストな計算を回避し,理論的な保証を持つフローマップ学習手法を開発すること。
    • SGFlowは,明示的な可逆性制約や反復計算による高コストな微分を回避するアプローチを提案する。
    • CIFAR画像ベンチマークにおいて,SGFlowは10ステップで最高のFIDスコアを達成し,他の手法と競合する。
    • SGFlowは,停止勾配ベースのダイナミクスに対する停留点保証を持つ唯一の手法である。

    Link: https://arxiv.org/abs/2607.26398

  • 回帰コンテキストにおけるグラフニューラルネットワークのメッセージパッシングの有効性検証 [cs.HC, cs.RO, eess.SP, cs.CY, cs.LG]目的:グラフニューラルネットワークにおけるメッセージパッシングの回帰タスクでの有効性
    • グラフ構造データは,分子,ソーシャルネットワークなど多岐に渡り,その分析の重要性は高い。
    • 既存の研究は分類タスクに偏っており,回帰タスクにおけるGNNの性能評価は十分ではない。
    • 回帰タスクにおけるGNNレイヤーの有効性を検証し,最適なGNNアーキテクチャを特定すること。
    • 深層畳み込みGNN(特にGEN)は,アテンションベースのGNNよりも回帰タスクにおいてより効果的であることが示された。
    • 理論に基づいた古典的なGNNは,依然として競争力があり,効率的であることが確認された。
    • ランキング,誤差最小化,洞察抽出など,多様な回帰コンテキストにおける有効性が検証された。

    Link: https://arxiv.org/abs/2607.26404

  • エージェント型音声認識のためのボイスメモリー [cs.NI, cs.CL, cs.AI, cs.SD, eess.AS]目的:エージェント型音声認識におけるボイスメモリーの提案
    • 音声認識の精度向上は,人間と機械の自然な対話を可能にする上で重要である。
    • 従来の音声認識システムは,ドメイン適応性や過剰修正の問題を抱えている。
    • 本研究は,ドメイン知識を効率的に活用し,過剰修正を抑制することで,音声認識の精度と信頼性を向上させることを目指す。
    • ボイスメモリーは,推論時に固定された修正器がドメイン固有のメモリーを参照し,仮説を修正するかどうかを決定する。
    • 非同期的にスコアゲート付き最適化器がメモリーを編集し,性能向上が確認された場合にのみ変更を適用する。
    • 実験の結果,ボイスメモリーは,10種類のHyPoradiseドメインにおいて,重み付き単語誤り率を8.36%から7.52%に低減することに成功した。

    Link: https://arxiv.org/abs/2607.26410

  • SCOUT:文脈ごとのリセットカリキュラムによるスパース報酬強化学習 [cs.LG]目的:スパース報酬強化学習における学習効率の向上
    • 強化学習は複雑な問題を解決する強力な手法である。特に,ロボット制御などの分野で注目されている。
    • スパース報酬環境下では,エージェントが有効な行動を発見することが難しく,学習が停滞しやすい。
    • 文脈ごとに異なる学習ペースに対応し,より効率的な学習を可能にするリセットカリキュラムを開発すること。
    • SCOUTは,各文脈に合わせたリセットカリキュラムをオンラインで自動的に生成する手法である。
    • 実験の結果,SCOUTは従来のグローバルなペース調整に比べて,より多くのタスクで成功を達成することが示された。
    • 文脈ごとのペース調整は,学習の進捗状況に応じて柔軟に支援の度合いを変更することで,学習効率を向上させる。

    Link: https://arxiv.org/abs/2607.26417

  • 可変カーディナリティを持つ空間点過程のための存在場拡散モデル [cs.IR, cs.HC, cs.RO, eess.SY, cs.SY, cs.IR, cs.LG, stat.ML]目的:空間点過程の生成モデリング
    • 空間点過程は,生態学,疫学など幅広い分野で現象を記述する上で重要である。
    • 点数と空間配置が同時に決まる点過程の生成は,既存手法では柔軟性に乏しい。
    • 点数と配置を同時に,柔軟かつ自然に生成できるモデルを構築することを目指す。
    • 提案手法である存在場拡散モデルは,各潜在的な点に対し存在度を表す変数を導入することで,離散的な遷移を必要としない統一的な拡散過程を実現した。
    • この手法により,点数と空間配置を同時にモデリングすることが可能となり,可変カーディナリティを持つデータセットに対する生成性能が向上した。
    • 提案手法は,空間点過程の生成モデリングのための柔軟かつ一般的なフレームワークを提供する。

    Link: https://arxiv.org/abs/2607.26428

  • FAS-R1:推論型顔なりすまし検出のための統一マルチタスクMLLM [cs.IR, cs.CV, cs.AI]目的:顔なりすまし検出,攻撃の意味的理解,および画像に基づく証拠の提示
    • 顔認証技術の信頼性確保は,セキュリティ上の重要な課題であり,なりすまし検出は不可欠である。
    • 既存のなりすまし検出モデルは識別能力に偏り,説明能力に欠ける場合が多い。
    • より高度な推論能力と汎化性能を持つ,統一的ななりすまし検出フレームワークを開発すること。
    • 提案手法FAS-R1は,認証精度98.75%,攻撃タイプ認識精度93.33%を達成した。
    • FAS-R1は,クロスドメインの汎化性能や,説明の質においても既存手法を上回る結果を示した。
    • Degradation-Simulated Augmentation (DSA) とDifficulty-Aware GRPO (DA-GRPO)により,難しい攻撃に対する性能が向上した。

    Link: https://arxiv.org/abs/2607.26432

  • コスト制約のある四脚ロボットにおける強化学習 [cs.RO, cs.AI]目的:低コストロボットハードウェアにおける強化学習の実現
    • ロボットの自律動作実現には,シミュレーション環境での学習を現実世界で活用することが不可欠である。
    • シミュレーションと現実世界の間には,遅延やノイズといった差異が存在し,学習性能の低下を招く。
    • 遅延やノイズの影響を軽減し,低コストロボットでの強化学習を可能にすることを目指す。
    • 平均的なアクチュエータ遅延のフォワードモデルと時間認識型ニューラルネットワークの組み合わせが,ロバストな歩行を実現した。
    • 時間認識型ニューラルネットワークは,脊椎動物の脊髄に見られるCPG(中枢パターン生成器)を学習した。
    • 時間的な自己組織化が,コスト制約のある移動ロボットにおいて汎用的な戦略となりうることを示唆する。

    Link: https://arxiv.org/abs/2607.26434

  • 長文コンテキスト言語モデルのための集約可能モデル側集約状態 [eess.SY, cs.RO, cs.SY, math.OC, cs.HC, cs.DC, cs.CL, cs.AI]目的:長文コンテキストにおける集合ベースの集約処理の性能低下問題の解決
    • 長文コンテキストの処理は,様々なタスクで重要性を増しており,言語モデルの能力向上に不可欠である。
    • 従来の言語モデルでは,コンテキスト長が伸びるにつれて,集合に基づく集約処理の信頼性が低下する。
    • モデル側集約インターフェースにより,コンテキスト長や集合の大きさに依存しない集約状態を維持し,正確な推論を可能とする。
    • 提案手法では,2KiBのHLLスケッチを用いて集約状態を保持し,高い精度を維持しつつ,コンテキスト長への依存性を排除した。
    • Gemma 4 (31B, BF16)を用いた実験では,正確な集約と比較して0.8%の精度低下であったが,直接的な文脈全体推論やCoT推論よりも大幅な性能向上を示した。
    • Oolong-Synthデータセットにおいては,Qwenで91.1%,Gemmaで99.3%という高い精度を達成し,集約タスクにおける有効性が確認された。

    Link: https://arxiv.org/abs/2607.26448

  • CG-World:ワールドモデルのための大規模ワールドステートデータセットとプロトコル [cs.AI, cs.CV, cs.GR]目的:ワールドモデルのためのワールドステートデータセットおよびプロトコル
    • 現実世界の複雑さを理解するAI開発に不可欠であり,ロボティクスやシミュレーションへの応用が期待される。
    • 既存のデータセットは,状態,行動,イベント,観測の関連性を十分に捉えられていないという課題がある。
    • 中間状態を明示的に記録することで,介入学習や反事実的推論を可能にするデータセットを構築する。
    • CG-Worldは,85万件の時系列セグメントを含む大規模データセットであり,多様な情報を記録している。
    • このデータセットを用いることで,制御された生成,行動モデリング,および具現化されたポリシー転移が可能となることが示された。
    • 将来的には,データ収集とコミュニティの協力により,ワールドモデルの共通データ基盤を拡大していく予定である。

    Link: https://arxiv.org/abs/2607.26452

  • ForgetBench:言語モデルにおける長期パラメトリックメモリの忘却ダイナミクスのベンチマーク [cs.CL, cs.AI]目的:言語モデルの長期的な知識保持に関する忘却行動の特性評価
    • 大規模言語モデルの発展に伴い,知識獲得能力の向上が求められている
    • モデルの継続的な更新下での知識保持能力に関する理解が不十分である
    • 言語モデルにおける知識の忘却メカニズムを定量的に評価する手法の開発
    • 既存の評価方法では,継続的なモデル修正時の知識保持と劣化の経時的変化を捉えられない
    • ForgetBenchは,概念ベースQAとシナリオベースQAという2つの評価パラダイムで事実と関係性の知識保持を分離する
    • 実験の結果,既存手法では長期的な知識保持と汎化性能のバランスを取ることが難しいことが示された

    Link: https://arxiv.org/abs/2607.26455

  • DHRCL:高密度階層的報酬とカリキュラム学習によるコードLLMの訓練 [cs.LG]目的:コードLLM訓練のための枠組み
    • コード生成AIの性能向上は,ソフトウェア開発の自動化や効率化に不可欠である。
    • 従来の強化学習手法では,報酬が疎であるか,複数の信号を静的に組み合わせるため,学習が不安定になりやすい。
    • 異なるレベルのプログラミング能力を段階的に学習させることで,効率的な訓練を実現する。
    • DHRCLは,構文検証,実行成功,ユニットテスト合格率,AST類似度といった階層的な報酬を用いて学習を行う。
    • 段階的なカリキュラム学習を採用し,モデルの能力向上に応じて各段階の学習時間を自動的に調整する。
    • Qwen3モデルを用いた実験により,DHRCLが既存手法と比較して一貫して高い性能を示すことが確認された。

    Link: https://arxiv.org/abs/2607.26457

  • MultivationBench:多角的動機推論のためのベンチマーク [cs.AI]目的:多角的動機推論の評価
    • 社会的知能の実現はAI研究の重要課題であり,特に人間らしい動機理解が不可欠である。
    • 既存の評価方法は静的なデータに偏っており,現実世界の状況における動機の累積的な変化を捉えられていない。
    • 物語形式の視覚的情報から動機の変化を推論する能力を評価し,AIの社会的理解を深める。
    • MultivationBenchは,既存モデルにとって大きな挑戦課題であることが示された。
    • 被験モデルは,一連の文脈における動機推論の一貫性を維持することが困難であった。
    • 静的な認識能力と,人間らしい社会的理解に不可欠な動的な推論との間に乖離が存在することが明らかになった。

    Link: https://arxiv.org/abs/2607.26465

  • 交通予測のためのニューラルアーキテクチャ探索:手法,課題,および将来の方向性 [cs.LG, cs.NE]目的:交通予測におけるニューラルアーキテクチャの自動探索
    • 交通システムは都市の効率化に不可欠であり,予測精度向上は社会的なニーズが高い。
    • 深層学習モデルのアーキテクチャ設計は専門知識を要し,汎化性能が課題となる。
    • ニューラルアーキテクチャ探索により,交通データに特化した最適なモデル設計を目指す。
    • 本調査では,勾配ベース,進化,ワンショットといった探索戦略に基づいた交通予測へのNAS手法を概観した。
    • 各手法において,空間・時間的交通演算を網羅する探索空間設計と,コストと性能のバランスが分析された。
    • 大規模道路ネットワークへの適用,汎化性能,動的グラフ構造などが今後の課題として挙げられた。

    Link: https://arxiv.org/abs/2607.26467

  • マルチ比率DiT再構成残差の音声アンカーによる融合:クロスドメイン音声ディープフェイク検出 [cs.CL, cs.IR, cs.SD, cs.AI]目的:クロスドメイン音声ディープフェイク検出における性能向上
    • 音声認証システム等において,ディープフェイク技術によるセキュリティリスクが高まっている。
    • 既存のディープフェイク検出器は,生成モデルや録音条件の変化に弱いという課題がある。
    • ドメイン変化にロバストな検出手法を開発し,ディープフェイクの検出精度を向上させる。
    • 拡散Transformer(DiT)を用いた再構成残差に着目し,音声アンカーによる融合手法を提案した。
    • ASVspoof 5 EvalおよびITW Fullの評価において,高い検出性能を達成した(それぞれ6.5442%/0.18456,13.8372%/0.36921)。
    • 再構成残差が補完的な証拠となり,ドメイン間の転移学習に有効であることが示唆された。

    Link: https://arxiv.org/abs/2607.26472

  • 反復的な洗練による暗黙的なインタラクションストリームからの動的ユーザペルソナ学習 [cs.LG, cs.CL]目的:動的ユーザペルソナの学習
    • LLMのユーザ体験向上には個人化が不可欠であり,その精度が重要視されている。
    • 従来の個人化手法は明示的なフィードバックに依存し,自然な対話場面での適用が困難である。
    • 暗黙的なインタラクションから動的にペルソナを学習し,明示的なフィードバックなしでの個人化を実現する。
    • 提案手法IRISは,日常会話から行動シグナルを抽出し,予測に基づいた閉ループでペルソナを反復的に洗練する。
    • 合成データを用いた評価では,IRISは安定したペルソナを生成し,個々のユーザを区別できることが示された。
    • Reddit AITAデータでの検証では,IRISは他の手法と比較して最高の意思決定予測精度(61.0%)を達成した。

    Link: https://arxiv.org/abs/2607.26473

  • 欠損観測における共形的変化点局所化と根本原因分析 [cs.DC, cs.LG, eess.SP]目的:変化点局所化と根本原因分析における信頼性保証
    • 通信ネットワーク,ロボット,セキュリティシステムなど,システムの監視において変化点の検出と原因特定は不可欠である。
    • 実際の観測データには外れ値やセンサーの故障などの汚染が存在し,変化点の特定を困難にしている。
    • 汚染データの影響を軽減し,より正確な変化点と根本原因を特定することを目的とする。
    • 提案手法W-CONCHとW-CROCは,汚染データに頑健でありながら,信頼区間のサイズを削減することに成功した。
    • 不確実性に基づく重み付けにより,目標とするカバレッジを維持しつつ,信頼区間のサイズを大幅に縮小できることが示された。
    • メタ学習による重みの最適化により,さらに信頼区間のサイズを改善することが可能である。

    Link: https://arxiv.org/abs/2607.26481

  • ノイズ変調型ニューラルネットワークにおける前方変動からの誤差逆伝播の再構成 [cs.NE]目的:ノイズ変調型ニューラルネットワークにおける誤差逆伝播の再構成
    • 脳の仕組み理解と,それを模倣したニューロモーフィックコンピューティングの発展に不可欠な研究分野である。
    • 従来の誤差逆伝播は転置行列を必要とし,生物学的妥当性に欠ける点が課題であった。
    • 前方パスの統計のみを用いて,生物学的に妥当な誤差逆伝播の代替手法を確立することを目指す。
    • ノイズ変調型ニューラルネットワークにおいて,重みミラーを用いて各層の重み行列を推定できることを示した。
    • 推定された重みと局所的な微分推定により,転置行列や逆伝播パスなしで誤差を再帰的に伝播できる。
    • 提案手法は誤差逆伝播と同等の精度を達成し,デジタル回路実装にも適している。

    Link: https://arxiv.org/abs/2607.26483

  • 多様性制約下におけるパラメータ化された公平な資源配分 [cs.SI, cs.LG]目的:多様性制約下での公平な資源配分
    • ECレコメンド,住宅割り当てなど多くの応用で資源配分が重要であり,公平性の確保が課題。
    • 従来の制約は厳格すぎる場合が多く,最適な配分を妨げる問題がある。
    • 公平性と効率の柔軟なトレードオフを実現し,多様性制約を満たす最適な配分を目指す。
    • 提案手法PRAは,不平等回避パラメータを用いて多様性を制御し,公平性と効率のバランスを取る。
    • PRAおよびAPRAは,様々な公平性指標や追加制約下でも最適性が保証される。
    • 実世界データを用いた実験で,既存手法を上回る有効性と堅牢性が示された。

    Link: https://arxiv.org/abs/2607.26485

  • EvoPINN:物理制約ニューラルネットワークのための実行可能アルゴリズムの能動的発見 [cs.AI, cs.LG, cs.NE]目的:物理情報ニューラルネットワークのための実行可能アルゴリズムの発見
    • 偏微分方程式の解法において,物理情報ニューラルネットワークは強力な手法として注目されている。
    • 性能はニューラル表現,損失関数,最適化手法の試行錯誤に依存し,自動設計が困難である。
    • 実行可能性を検証しながら,LLMを用いて新しいアルゴリズムを自動的に発見し,性能向上を目指す。
    • EvoPINNは,ニューラル表現と学習プログラムを分離し,LLMエージェントを用いてプログラムの修正を繰り返すことで,PDEに特化した学習アルゴリズムを発見した。
    • 実験の結果,EvoPINNは既存手法と比較して相対的な$L_{2}$誤差を大幅に低減することを示した。
    • 特に,EvoPINNが自律的に開発したSLRC-PINNは,厳密なパラメータマッチング比較においても優れた性能を発揮し,実行に基づいたエージェントの有効性を示した。

    Link: https://arxiv.org/abs/2607.26490

  • LLMET:エネルギー効率の高いLLM推論のための新世代M3Dメモリのクロスレイヤー評価 [cs.AR, cs.AI, cs.ET, cs.LG]目的:大規模言語モデル(LLM)の推論におけるエネルギー効率向上
    • LLMの普及に伴い,電力消費がシステム上の大きな課題となっている。特にデータ移動がボトルネックとなる。
    • オンチップキャッシュとオフチップHBM間のデータ移動がエネルギー消費の主要因となっている。
    • 新技術M3Dを用いたオンチップメモリの大容量化が,LLM推論のエネルギー効率改善に寄与するかを検証する。
    • LLMETシミュレーションの結果,M3D技術によりL2キャッシュを40MBから1GBに拡大することで,Llama3.1-70Bのプリフィル段階のチップエネルギー消費を44%削減。
    • 8x NVIDIA B200のようなプラットフォームでは,L2キャッシュを128MBから4GBに拡張することで,プリフィルエネルギーを最大24%削減。
    • エッジプラットフォームでは,8MBのキャッシュサイズを256MBに増やすことで,デコードエネルギーを最大30%削減。

    Link: https://arxiv.org/abs/2607.26491

  • 概念水文モデルから解釈可能なニューラルネットワークへ:集水域規模の降水・貯留・流出表現を発見するための質量保存パーセプトロンフレームワーク [cs.LG]目的:降水・貯留・流出表現を記述するための質量保存パーセプトロンフレームワーク
    • 水文モデリングは,水資源管理や洪水予測において不可欠であり,その精度向上が重要である。
    • 既存の水文モデルは,複雑な物理過程を表現するために多くのパラメータを必要とし,解釈が困難な場合がある。
    • 物理的制約を持つニューラルネットワークを用いて,水文モデルの表現力を高め,解釈性を向上させることを目指す。
    • 質量保存パーセプトロン(MCP)ネットワークフレームワークを開発し,513のCAMELS-US流域で評価を行った。
    • 水文モデルとニューラルネットワークの予測性能は同程度であり,MCPネットワークの有効性が示された。
    • 状態数が増加するにつれてKGEssは向上するが,2状態を超えると改善の幅が小さくなることが示唆された。

    Link: https://arxiv.org/abs/2607.26492

  • インターフェースから推論へ:あらゆる順序のモデルからあらゆる順序の推論を引き出す [cs.IR, cs.DC, cs.LG]目的:あらゆる順序の推論を可能にするモデルの設計
    • コード生成など離散推論は重要であり,高レベル構造と局所的な詳細の間の移動を含む
    • 自己回帰言語モデルは,本来あらゆる順序のインターフェースを持たないため,非因果的な能力を実現するのが難しい
    • 固定位置へのコミットメントを緩和し,潜在的な生成順序を探索することで,推論ギャップを解消する
    • マスク拡散モデルにおける挿入ベースのアプローチと潜在空間ベースのアプローチを提案し,異なるあらゆる順序の推論行動を誘導した
    • Pythonコーディングの7B FlexMDMと,GSM8Kの125M LatentMDMを訓練し,ダウンストリーム性能を向上させた
    • 提案手法は,モデルが持つインターフェースと推論のギャップを位置的不確実性という観点から解決する

    Link: https://arxiv.org/abs/2607.26504

  • オフポリシー強化学習における過大評価の軽減に向けた悲観的批評家による協調的重み付け [cs.LG, cs.AI]目的:オフポリシー強化学習における過大評価の軽減
    • 強化学習は,複雑な制御問題の自動学習を可能にするため,近年注目されている。
    • オフポリシー強化学習では,価値関数の近似誤差が伝播し,学習が不安定になる。
    • 価値関数の不確実性を考慮し,信頼性の高いサンプルから学習する手法を提案する。
    • 提案手法CWACは,分布型批評家を用いて報酬の不確実性をモデル化する。
    • TD誤差と不確実性を協調的に重み付けすることで,ロバストな学習を実現する。
    • SAC,TD3,DDPGなどの既存のアルゴリズムに容易に組み込むことができ,様々なシミュレーションタスクで性能が向上する。

    Link: https://arxiv.org/abs/2607.26509

  • 証拠台帳による主張・証拠のトレーサビリティ [cs.AI]目的:主張と証拠の間の関連性の評価
    • AIによる文章作成支援が普及する中で,主張と証拠の関係性の正確性が重要になっている。
    • AIが生成した主張と証拠の整合性を確認する作業は,人間にとって時間と労力を要する。
    • AIを活用し,主張と証拠のトレーサビリティを確保することで,文章の信頼性を向上させる。
    • AIエージェントによる証拠台帳を用いた評価では,関係性の正確度が0.676,マクロF1スコアが0.601と,既存の基盤モデルを上回った。
    • 矛盾,証拠不足,混合証拠の主張1270/1435件を適切に著者へ戻し,根拠のある主張295/900件をルーティングした。
    • 証拠台帳は,AI支援による文章作成において,信頼性の高いトレーサビリティ層を構築できる可能性を示唆している。

    Link: https://arxiv.org/abs/2607.26512

  • 大規模言語モデルのポストトレーニングにおけるHiFloat4フォーマットを用いたエンドツーエンド強化学習 [cs.RO, cs.LG, cs.AI]目的:大規模言語モデルのポストトレーニングにおける,エンドツーエンドの4ビット浮動小数点数(FP4)強化学習の実現
    • 強化学習は,言語モデルに複雑なタスクを学習させるための強力な手法であり,その効率化が求められている。
    • FP4のような低精度浮動小数点数を用いることで計算コストを削減できる一方,精度劣化が課題となる。
    • ロールアウト時の活性化関数の量子化による精度低下を抑制し,FP4強化学習の精度を向上させる。
    • HiFloat4(HiF4)フォーマットとRollout Residual Quantization(Rollout-ResQ)の組み合わせにより,BF16との精度差を大幅に縮小することに成功した。
    • Qwen2.5-3BとQwen2.5-Math-7Bにおいては,精度差が4.9%から1.1%に,MXFP4においては13.6%から5.3%に縮小された。
    • これらの結果から,HiF4フォーマットがエンドツーエンドFP4強化学習を可能にする基盤となり,Rollout-ResQが活性化関数の精度低下を抑制する有効な手法であることが示された。

    Link: https://arxiv.org/abs/2607.26515

  • 会話型AIエージェントのためのグラフネイティブなバイテンポラルメモリストア [cs.DB, cs.AI, cs.IR]目的:会話型AIエージェントにおけるセッションを跨いだ持続的なメモリの実現
    • 会話型AIの性能向上には,過去の対話内容を適切に記憶し活用することが不可欠である。
    • 既存手法では,コンテキストウィンドウの制限や個人情報保護の観点から課題があった。
    • エージェントローカルなメモリストアにより,コンテキスト制限とプライバシー問題を解決する。
    • 提案手法は,Neo4jプロパティグラフとHNSWベクトルインデックス,バイテンポラルデータモデルを活用する。
    • LongMemEvalベンチマークにおいて,現在のセマンティック検索経路はR@10で46.7%を達成し,知識更新問題では80%に向上した。
    • 時系列遡及経路は知識更新問題で80%のR@10を示したが,時間推論問題ではリコールが低下し,改善の余地が示唆された。

    Link: https://arxiv.org/abs/2607.26520

  • 観察データにおけるサブグループ化手法の評価:仮説的な状態介入政策への応用 [cs.LG]目的:観察データにおけるサブグループ化手法を用いて,予算制約下での政策優先順位付けの解釈可能な単位を特定すること。
    • 医療データ分析において,個々の患者に対する最適な治療法を特定するため,サブグループ分析は重要である。
    • 従来のサブグループ分析は不安定で解釈が難しく,特に観察データでは因果構造が不確実であることが課題である。
    • 事前情報のみを用いたサブグループ化により,より解釈可能で実用的な政策立案を支援することを試みる。
    • バイジアンGMMを用いたBMI政策が最も高い推定有用性(0.799)を示した。しかし,他の手法でも同程度の有用性を示す結果が得られた。
    • 政策リスクの差に関する95%信頼区間は全てゼロを含み,Holm補正後も有意な比較は残らなかった。
    • 政策の有用性が類似していても,優先順位付けられる個人が異なる可能性が示唆された。これらの結果は,仮説的な状態変化に対する意思決定支援の証拠として解釈すべきである。

    Link: https://arxiv.org/abs/2607.26521

  • 忘却しない技術:継続学習のための局所学習アーキテクチャ [cs.LG, cs.AI]目的:継続学習における忘却現象の軽減
    • 人工知能の汎用性向上の鍵であり,人間の学習能力に近い柔軟性が求められている。
    • 従来の継続学習手法では,新しいタスク学習時に過去の知識が失われる「破滅的忘却」が課題である。
    • スパース表現,局所学習,持続的記憶の組み合わせによる忘却軽減を目指す。
    • 提案手法CMPは,従来のバックプロパゲーションを用いた手法と比較して,大幅な忘却の軽減を示すことがわかった。
    • 15ドメインにわたる実験において,CMPは安定した忘却行動を示し,Transformerベースラインよりも一貫して低い忘却率を記録した。
    • 単一ドメインの精度には差が見られたが,結果はスパース表現,局所学習,持続的記憶の組み合わせが有望な方向性を示唆する。

    Link: https://arxiv.org/abs/2607.26523