arXiv雑要約

プログラム - 2026/07/30 公開

  • AI安全評価のための敵対的語用論:言語を介した制御のための診断フレームワークとシードベンチマーク [cs.CL, cs.AI, cs.SE]目的:言語モデルの安全評価における曖昧な自然言語行動の診断
    • AIの安全性確保は,社会実装において不可欠であり,言語モデルの評価は重要な課題である。
    • 既存のベンチマークは,合格/不合格ラベルのみで評価するため,失敗の原因特定が困難である。
    • 敵対的語用論を通じて,指示の衝突や曖昧さなど,安全に関わるモデルの挙動を詳細に分析する。
    • 本研究では,18項目のシードベンチマークと,LLMによる評価プロトコルを提案した。
    • 評価の結果,安全に関わる少数クラスの識別が困難であり,LLMの判断の一貫性に課題が残ることを示した。
    • このベンチマークは,安全性の評価・診断を目的としており,モデルのランク付けや安全スコアの算出には適さない。

    Link: https://arxiv.org/abs/2607.01153

  • 大規模マイクロサービスシステムにおけるエージェントAIを活用した効率的な根本原因分析システムKRCA [cs.SE]目的:大規模マイクロサービスシステムにおける根本原因の特定と障害タイプの分類
    • 現代のインターネット企業では,大規模マイクロサービスシステムが標準的なインフラとなっている。
    • システムの複雑性から障害は避けられず,迅速な根本原因分析が求められている。
    • 既存の手法では,システムの規模と変化の速さに対応しきれないという課題を解決する。
    • KRCAは,APIレベルのドリルダウンと異常メトリクスに基づく因果グラフを活用する多段階パイプラインを用いる。
    • KRCAは,根本原因サービスの特定精度で0.88,障害タイプ分類精度で0.79を達成し,既存手法を大幅に上回る。
    • Kuaishouの運用環境への導入により,平均診断時間が77.3%短縮された。

    Link: https://arxiv.org/abs/2607.01788

  • Rustプログラムの動的解析のための計測ベースフレームワークLeaf [cs.SE]目的:Rustプログラムの動的解析フレームワーク
    • Rust言語の利用拡大に伴い,プログラムの信頼性確保が重要になっている。
    • Rust向けのプログラム解析ツールは発展途上であり,汎用的な動的解析フレームワークが不足している。
    • Rustの豊富な情報を活用し,実行時のプログラム解析を容易にするフレームワークを開発する。
    • LEAFは,RustのMIRレベルの情報をイベントストリームとして解析に提供するDynamic MIR(DMIR)を備えている。
    • LEAFの有効性は,コンコリック実行器,サニタイザー,制御フロートレーサーの実装によって示された。
    • LEAFのコンパイル時および実行時のオーバーヘッドは,許容範囲内であることが評価で示された。

    Link: https://arxiv.org/abs/2607.15025

  • 素晴らしい適応型タスク分類とその利用法 [cs.SE, cs.AI]目的:エージェントシステムの失敗に関する明示的な表現の構築
    • エージェントシステムの改善は,その性能向上に不可欠である。
    • 既存の失敗履歴は冗長で,再発する問題の特定が困難である。
    • 本研究は,自動的に構築されるタスク分類を用いてこの問題を解決する。
    • AdaMASTは,エージェントシステムの実行トレースから,簡潔かつ証拠に基づいた失敗タスク分類を構築する。
    • このタスク分類を用いることで,エージェントシステムの探索,実行時,軌道選択の各段階において性能が向上した。
    • 構築されたタスク分類は,人間による専門家の意見と一致し,ドメインが異なってもコードの共有が少ない。

    Link: https://arxiv.org/abs/2607.16387

  • 材料研究のための自動化:保留データを用いた検証可能なAI科学者ワークフロー [cs.MA, cs.AI, cs.SE]目的:機械学習の変更提案,実装,評価を行う自動研究ワークフローの信頼性向上
    • 材料開発の加速化に貢献するAI技術の重要性が高まっている。
    • 従来の自動研究では,最終的な結果のみが評価され,各決定の妥当性が不明確。
    • 各介入の信頼性を検証し,再利用可能な知見の特定を目指す。
    • 介入中心型自動研究は,10件のMatbenchエンドポイントのうち9件で選択された介入の有効性を確認した。
    • 内側のフィードバックで支持されたRepresentationの改善を,外側の保留データで否定した。
    • すでに固定されたFeatureとModelコードを組み合わせることで,平均的な外側ホールドアウトの改善率が19.0%から26.3%に向上した。

    Link: https://arxiv.org/abs/2607.17100

  • 論理ゲートネットワークの深さのスケーラビリティについて [cs.CL, cs.LG, cs.AI, cs.LO]目的:論理ゲートネットワークの深さのスケーラビリティに関する研究
    • 深層学習モデルの性能向上には,モデルの深さの拡大が重要である。しかし,既存の論理ゲートネットワークでは,深さを増やしても性能向上は期待できない。
    • 従来の論理ゲートネットワークでは,最適化の崩壊や,出力経路に特有の勾配の消失といった問題が生じ,深層化による効果が阻害されている。
    • 本研究では,入力に直接結びついたアンカーを導入することで,これらの問題を解決し,深層化による性能向上を実現することを目指す。
    • 提案手法である入力アンカー付き論理ゲートネットワーク(IALGN)は,MNIST,CIFAR-10,CIFAR-100において,最大150層まで固定幅の深さと精度が比例関係にあることを示した。
    • IALGNは,入力アクセスを維持しつつ,出力経路の合流を防ぎ,より安定した勾配伝播を可能にすることが明らかになった。
    • 線形プローブ,トポロジーアブレーション,操作認識分析により,IALGNがプライベート状態を保持し,スパースなアンカー条件付き更新を適用することが示された。

    Link: https://arxiv.org/abs/2607.21633

  • データフローネットワークの緩和活性化解析 - 機械学習とリアルタイムスケジューリングのためのクロック計算 [cs.PL, cs.LG]目的:データフローネットワークにおける緩和活性化解析の拡張
    • 機械学習とリアルタイムシステムの組み合わせが重要視される中で,正確なモデル化手法が求められている。
    • 既存のクロック計算は,機械学習の訓練アルゴリズム特有の制御パターンに対応しきれていない。
    • 機械学習モデルをリアクティブアプリケーションに組み込むための効率的なクロック計算を確立すること。
    • Lustre言語のデータフロー素朴な表現が機械学習アプリケーションに適していることが示されている。
    • 既存のクロック計算では,機械学習の訓練アルゴリズムにおける制御パターンを効率的に表現できないことが課題であった。
    • Lustreのクロック計算を拡張することで,機械学習モデルのリアクティブアプリケーションへの組み込みを促進する。

    Link: https://arxiv.org/abs/2607.21797

  • FastLAS入門:プログラマーのためのガイド [cs.CL, cs.LO, cs.AI, cs.LG]目的:FastLASプログラム作成の導入
    • 帰納論理プログラミングは,データから知識を自動的に獲得する重要な手法である。
    • FastLASのようなILPシステムの利用は,複雑な設定や学習アルゴリズムの理解を必要とする。
    • FastLASを用いたプログラム作成方法を,具体的な例を通して理解しやすくすること。
    • 本稿は,FastLAS 2.2.0 を用いたプログラム作成の入門ガイドとして,文法から始めて徐々に難易度を上げていく。
    • FastLASの出力結果を示しながら,理論的な説明は必要最低限に留めている。
    • ILASPとの違いや,異なる学習アルゴリズムの挙動についても解説している。

    Link: https://arxiv.org/abs/2607.23557

  • エージェント型ソフトウェア開発におけるサードパーティAPIルーターのコストはどこにあるか [cs.SE, cs.AI, cs.CL]目的:エージェント型ソフトウェア開発におけるサードパーティAPIルーターのセキュリティリスクの評価
    • LLMを活用した開発効率化が進む中で,APIルーターは不可欠な要素となっている。
    • APIルーターが仲介することで,クライアント側の権限管理が機能しなくなる可能性が懸念される。
    • APIルーターを介した不正な操作がソフトウェア開発に与える影響を明らかにすることを目的とする。
    • APIルーターへの介入は,リポジトリレベルでのアクションに大きな変化をもたらすことが示された。
    • 既存のクライアント側対策では,APIルーターを介した攻撃を検出することが困難であることが確認された。
    • プロバイダー側での出力整合性保証の必要性が示唆され,さらなるセキュリティ対策が求められる。

    Link: https://arxiv.org/abs/2607.23624

  • 計画は不思議な働きをする:スプレッドシートエージェントのためのプランモードの評価 [cs.HC, cs.AI, cs.SE]目的:スプレッドシートにおけるプランモードの有効性
    • エージェントプログラミングにおいて,プランニングは透明性と制御性を高める重要な要素である。
    • スプレッドシート利用者は反復作業を好み,厳密な正しさよりも結果を重視するため,事前の計画が合わない可能性がある。
    • 本研究では,スプレッドシートのプランモードを設計し,利用者の改善回数と主観的な評価を調査する。
    • プランモードと非プランモードではタスクの成果に差はなかった。
    • プランモード利用者は,改善作業の回数が減少し,ツールの創造性支援と人間と機械の協調性に対する評価が高かった。
    • これらの結果は,プランモードの今後の設計や,エンドユーザープログラミングにおける人間とAIの計画協力の役割に示唆を与える。

    Link: https://arxiv.org/abs/2607.23670

  • 意図的型理論におけるセトイド [cs.LO]目的:外延型理論と圏論的圏のセマンティクス
    • 型理論は,計算機科学や数学基礎において重要な役割を担う。
    • 外延型理論の形式的な意味論は,構築が難しく,一貫性の証明も困難である。
    • 意図的型理論とセトイドを用いて,外延型理論の意味論を形式化し,一貫性を証明すること。
    • 意図的型理論における特定のセトイド概念は,外延型理論と圏論的圏のセマンティクスを与えるために利用できることが示された。
    • 安全なAgdaを用いて,誘導再帰的定義 (IRU) の圏で閉じられた圏を持つ意図的型理論を形式化し,外延型理論の構文をIRU内で定義した。
    • IRUの表現能力の限界を克服し,セトイドによる外延型理論のセマンティクスを確立することで,IRU内での外延型理論の一貫性の証明を得た。

    Link: https://arxiv.org/abs/2607.23671

  • 閾値付き記号ランキングによるLLMベースのソースコード圧縮 [cs.IT, cs.CL, cs.LG, math.IT]目的:大規模ソフトウェアアーカイブのストレージ需要に対応するためのソースコードの可逆圧縮
    • ソフトウェアの規模拡大に伴い,ソースコードの効率的な保存が重要となっている。
    • 汎用圧縮ツールでは,ソースコード特有の規則性を十分に活用できていない。
    • LLMの記号ランキングを活用し,圧縮率と速度のバランスを改善することを目指す。
    • 提案手法は,既存のLLMベースの圧縮器と比較して,圧縮率と圧縮速度の両方で性能を向上させた。
    • 汎用圧縮ツールと比較すると,圧縮率は最大82%向上するが,速度は劣るという新たなトレードオフを示す。
    • ソースコードでは自然言語よりも高い圧縮効果が得られ,LLMが捉える規則性が活用されている可能性を示唆する。

    Link: https://arxiv.org/abs/2607.24192

  • 検索対象の「何か」を超えて:検索拡張コード生成における不確実性 [cs.SE, cs.AI, cs.CL, cs.LG]目的:検索拡張コード生成における不確実性のモデル化と制御
    • 大規模言語モデルを用いたコード生成において,外部知識の活用は重要であり,精度向上に不可欠である。
    • 既存手法では,検索されたコードの関連性最適化に偏っており,不確実性がコード生成に与える影響を考慮していない。
    • 検索された複数の情報源の不確実性を明示的にモデル化し,生成,検証,修正の各段階で活用することで,コード生成の精度向上を目指す。
    • OpenCoderは,情報源ごとの不確実性を推定し,それに基づいて証拠をフィルタリングおよびランク付けすることで,GPTの正答率を56.25%から78.13%に向上させた。
    • しかし,検証・修正による制御との比較では同程度の性能であり,Geminiでは統計的な有意差が確認できなかった。バックエンドに依存した効果であることが示唆される。
    • APIのターゲットを意識した改善により,APIセットの検索精度が大幅に向上し,不確実性の制御が有効であることが確認された。

    Link: https://arxiv.org/abs/2607.24884

  • AIエージェントのための説明に拘束されたツール実行:モデルの推論を信頼せずにサーバー検証されたアクション主張 [cs.CL, cs.RO, cs.AI, cs.SE]目的:AIエージェントにおけるツール利用時のアクション主張のサーバー検証
    • AIエージェントの能力向上には,外部ツールとの連携が不可欠である。
    • 既存システムでは,モデルの推論に頼るため,安全性や信頼性に課題がある。
    • サーバー側検証により,安全かつ信頼性の高いツール利用を実現すること。
    • 説明に拘束されたツール実行(EBTE)は,アクション主張をサーバー側の情報と照合することで,不正な実行を防ぐ。
    • 136のテストシナリオにおいて,EBTEは指定された条件に完全に合致し,矛盾を排除することに成功した。
    • AgentDojoを用いた検証では,高リスクな攻撃提案を全て拒否し,タスクと提案の矛盾を解消できることを示した。

    Link: https://arxiv.org/abs/2607.25364

  • LAIAデータセット:知能自動車のためのラベル付き注意 [cs.CV, cs.AI, cs.SE]目的:自律走行研究を豊かにするための人間による注意データ
    • 自動運転技術は,安全性向上や移動の効率化に不可欠であり,社会実装が期待されている。
    • エンドツーエンド型学習は解釈可能性に課題があり,その改善が求められている。
    • 人間とAIの注意メカニズムを比較することで,AIの振る舞いを理解し,説明可能性を高める。
    • LAIAデータセットは,CARLAシミュレーターを用いて,多様な気象条件下で約15時間の運転データを収集した。
    • このデータセットは,RGB画像,セマンティックセグメンテーション,深度,光学的フロー,CANバス信号,眼球追跡データなどを含む。
    • LAIAを用いて人間とAIの注意を比較することで,AIモデルの挙動に関する洞察を得ることができた。

    Link: https://arxiv.org/abs/2607.25570

  • モデルコンテキストプロトコル適用に関する実証研究 [cs.SE]目的:モデルコンテキストプロトコルアプリケーションの実態把握
    • 大規模言語モデルの活用が広がる中で,外部ツールとの連携が不可欠となっている。
    • モデルコンテキストプロトコルは標準化が進む一方,アプリケーション側の開発慣習が確立されていない。
    • GitHub上のMCPアプリケーションを分析し,開発の実態を明らかにすることで,より安全な活用を促す。
    • 多くのアプリケーションは,設定ファイルや公式SDKを用いてサーバーと連携していることがわかった。
    • 設定ファイル名に関する命名規則は確立されておらず,人間による監視体制にもばらつきが見られる。
    • ツール実行前に承認を得る仕組みを導入しているアプリケーションは少数であり,リスク管理の課題が残る。

    Link: https://arxiv.org/abs/2607.25635

  • IH-Benchmark:LLMアプリケーションにおける命令階層の堅牢性に関する競合中心のベンチマーク [cs.CR, cs.SE]目的:LLMにおける命令階層の堅牢性評価
    • LLMの信頼性向上は,実用的な応用において不可欠である。
    • 既存のベンチマークは,命令階層の評価範囲が限定的である。
    • システムとユーザー間,またはユーザーとツール間における命令の競合時のLLMの挙動を評価する。
    • IH-Benchmarkを用いて37モデルを評価した結果,命令階層への適合率は20.5%から98.2%まで幅があった。
    • システムとユーザー間の適合性が高いモデルでも,ユーザーとツール間では性能が低下する傾向が確認された。
    • 制約の強化により改善するモデルとそうでないモデルが存在し,命令階層の堅牢性は単一の能力ではないことが示唆された。

    Link: https://arxiv.org/abs/2607.25987

  • 不一致CUSUMを用いた最速変化検出 [math.ST, cs.IT, math.IT, stat.TH]目的:未知の変化時刻の推定
    • 変化検出は,異常検知や故障診断など,様々な分野で重要な技術である。
    • 既存手法では,変化の検出遅延と誤検出のバランスが課題となっていた。
    • 最適な検出性能を実現するための閾値と関数Fの設計を目指す。
    • 提案手法では,隠れマルコフモデルを用いて変化と観測を共同モデル化することで,より正確な変化検出が可能となる。
    • 最適化問題は凸計画として特徴づけられ,古典的な尤度比構成の拡張が得られた。
    • 数値実験により,提案手法が中程度のκ値においても高い精度を維持することが示された。

    Link: https://arxiv.org/abs/2409.07948

  • 拡散モデルを用いたCSI予測 [physics.soc-ph, cs.SI, physics.data-an, q-fin.ST, math.CO, cs.DM, eess.SP, cs.IT, math.IT]目的:チャンネル状態情報予測の新たな手法
    • 無線通信の信頼性と効率化には,正確なCSIが不可欠である。リアルタイムなCSI取得は課題が多い。
    • 従来のCSI取得手法は,パイロットオーバーヘッドやチャンネル変化により,迅速かつ正確な取得が困難である。
    • 確率的アプローチにより,無線チャネルの不確実性と多峰性を捉えたCSI予測を実現し,予測精度を向上させる。
    • 拡散モデルを基盤としたCSI予測フレームワークを提案し,時間エンコーダと拡散生成器の組み合わせを検討した。
    • 自己回帰的推論とシーケンス対シーケンス推論の二つの推論スキームを比較検証し,U-NetやTransformer等のアーキテクチャを調査した。
    • 提案手法は,既存の最先端技術と比較して,有意に優れた性能を示すことがシミュレーションにより確認された。

    Link: https://arxiv.org/abs/2510.11214

  • ワイヤレスリソース配分のためのグラフ信号拡散モデル [physics.soc-ph, cs.MA, cs.SY, eess.SY, eess.SP, cs.IT, cs.LG, math.IT]目的:ワイヤレスネットワークにおける制約付きエルゴードリソース最適化
    • ワイヤレス通信の効率化は,現代社会における情報伝達の基盤であり,その重要性は高い。
    • 複雑な干渉環境下では,最適なリソース配分が困難であり,性能向上のボトルネックとなっている。
    • グラフ構造化干渉を持つネットワークにおいて,効率的なリソース配分手法を確立すること。
    • 拡散モデルの方策を用いることで,専門家アルゴリズムの条件付き分布を近似的に再現可能となった。
    • 生成された電力配分を時間共有することで,ほぼ最適なエルゴード和レートと最低レートを達成した。
    • 本手法は,ネットワーク状態の変化に対して強い汎化性能と転移可能性を示すことが確認された。

    Link: https://arxiv.org/abs/2604.05175