arXiv雑要約

AI - 2026/08/05 公開

  • 多数の正解が存在する場合,投票は失敗する:LLMにおける最良のK個の因果推論のための記号検証 [cs.CL, cs.AI, stat.ML]目的:LLMにおける因果推論の信頼性向上
    • 大規模言語モデル(LLM)の性能向上は,複雑な推論能力の獲得に不可欠である。
    • LLMは,因果関係の推論において,誤った因果関係を繰り返し,複数の有効な解答間で票が分散しやすい。
    • 因果関係の公理に基づいた検証手法を用いて,より信頼性の高い解答を選択することを目指す。
    • CALVERは,Pearlの因果基準を用いて推論過程を評価し,正解データに依存せずに最適な候補を選択する。
    • CLEARデータセットにおいて,CALVERは既存手法(多数決,報酬モデル,LLMジャッジ等)を大きく上回る正答率(42.1%)を達成した。
    • CALVERは,因果構造が与えられれば,他のモデルや設定にも一般化可能であり,高速に処理を実行できる。

    Link: https://arxiv.org/abs/2608.03506

  • クロノレンズ:時間,言語,言語レベルを横断した言語変化の測定 [cs.CL, cs.AI]目的:言語変化の大きさおよび方向の,言語レベル,言語,時代における変動の分析
    • 言語は歴史的に変化するものであり,社会や文化の変遷を理解する上で重要である。
    • 言語レベルごとの分析が個別に行われ,変化の相互関係が不明であった。
    • 異なる言語レベルの変化を統一的な枠組みで比較・分析し,言語変化の構造を明らかにする。
    • クロノレンズは,凍結された多言語言語モデル,特徴整合型クロスコーダー,事後的な言語介入を組み合わせたフレームワークである。
    • 本研究では,1803年から2026年までの5つの議会伝統からの4498万件の文書と約172億トークンを分析した。
    • 疎な表現は,密な埋め込みやプールされた疎なオートエンコーダーよりも言語統計との一致度が高く,言語変化は多次元的な構造を持つことが示された。

    Link: https://arxiv.org/abs/2608.03507

  • ラベルはいくつで十分か?:医療画像分類のための能動学習導入アドバイザー [cs.CV, cs.AI, cs.LG]目的:医療画像分類における能動学習手法選択のための導入支援
    • 医療画像解析には専門家によるアノテーションが必要であり,コストと時間がかかる。
    • 適切なサンプリング戦略の選択が困難であり,誤った選択はコスト増を招く可能性がある。
    • 初期段階で最適な手法を選定し,必要なアノテーション数を予測することでコスト削減を目指す。
    • 提案手法ALDAは,パイロットデータを用いて学習曲線モデルを構築し,目標性能達成の可能性を評価する。
    • アノテーションコストの不確実性を考慮し,最も堅牢な戦略を選択することでリスクを抑制する。
    • 4つの医療画像分類タスクにおいて,ALDAはアノテーションコストを最大82%削減できることを示した。

    Link: https://arxiv.org/abs/2608.03511

  • 大規模言語モデルにおける関係の逆転 [cs.AI]目的:逆関係の方向性に関する大規模言語モデルの理解度
    • 知識グラフ生成において,大規模言語モデルの活用が重要性を増している。
    • 逆関係の方向性を正しく捉えられているか,未解明な点が多い。
    • 大規模言語モデルの逆関係の方向性に関する理解度を評価する。
    • 大規模言語モデルは,逆関係の分類において非対称性を示すことが明らかになった。
    • 関係の説明は,性能向上に一貫した効果をもたらさなかった。
    • エンティティ表現の変化が,モデルの性能に影響を与える可能性があることが示された。

    Link: https://arxiv.org/abs/2608.03512

  • ['AIシステムにおける事件調査のためのプロセスモデルと研究課題:ホワイト/グレー/ブラックボックスアクセス'] [cs.CR, cs.AI]目的:['AIシステム事件調査のプロセスモデルと研究課題']
    • AIの社会実装が進む中で,AIシステムの判断や行動に関する調査ニーズが高まっている。
    • 既存のAIフォレンジック研究は断片的であり,システムの種類や分析手法に偏りがある。
    • AIシステムへのアクセス状況に応じた調査プロセスを確立し,今後の研究課題を明確化する。
    • AIシステムへのアクセスレベル(ホワイト/グレー/ブラックボックス)に応じて,収集・保全・分析・報告のプロセスが変化する。
    • AIシステムの揮発性順序(実行時状態,コンテキストウィンドウ,ログなど)を定義し,調査の効率化を図る。
    • ブラックボックス環境での保全,モデルバージョンの検証,代替分析における不確実性評価などの研究課題を提示する。

    Link: https://arxiv.org/abs/2608.03520

  • ピボット中心軌道予測:動的なガイダンスによる長期予測の実現 [cs.RO, cs.AI]目的:長期的な軌道予測における精度向上
    • 自動運転の安全性確保には,周囲の主体の正確な将来予測が不可欠である。
    • 従来の予測手法では,予測期間が長くなるほどガイダンスが弱まり,誤差が累積しやすい。
    • 本研究は,ピボット点を活用することで,長期予測における誤差累積を抑制し,精度向上を目指す。
    • 提案手法PCTPは,ピボット点を予測し,それに基づいて軌道を段階的に洗練することで,中間的なガイダンスを強化する。
    • Argoverse IおよびIIデータセットにおいて,最先端モデルの予測精度を向上させ,アンサンブル手法なしでArgoverse IIリーダーボードで最高性能を達成した。
    • PCTPは既存のモデルに容易に組み込むことができ,モデルサイズへの影響も最小限に抑えられる。

    Link: https://arxiv.org/abs/2608.03521

  • Dr. AGENTONOMICS:AGENTONOMICSの教育実験 [cs.AI]目的:AGENTONOMICSフレームワークの教育応用
    • AIエージェントの経済的側面に着目し,その設計・管理・統治を体系化する枠組みの構築が重要である。
    • AIエージェントのビジネス応用における,体系的な設計・管理手法が確立されていない。
    • AIエージェント自体が教育を通じてAGENTONOMICSを理解・応用・発展させることを目指す。
    • 本研究では,AIエージェントを経済主体と捉えるAGENTONOMICSフレームワークの教育実験として,講義エージェント「Dr. AGENTONOMICS」を開発した。
    • プロトタイプは,AGENTONOMICS概念を説明し学生の質問に対応するウェブベースのチューターであり,多角的な指導者,設計コンサルタント,メタエージェントとしての役割拡張も可能である。
    • このシステムが,AIエージェントによるフレームワークの教育,応用,そして再生産に貢献し,分散型AI経済の発展に繋がる可能性を示唆する。

    Link: https://arxiv.org/abs/2608.03524

  • 深層研究エージェントのための検索ルーブリックを用いたドキュメント再ランク付け [cs.IR, cs.AI, cs.CL]目的:深層研究エージェントに対する高品質な回答生成を支援するためのドキュメントセットの選定
    • 深層研究エージェントの性能は,関連文書の検索精度に大きく依存する。
    • 既存の検索システムは関連性の一致に重点を置いており,複雑な情報ニーズを満たす文書セットを構成できない場合がある。
    • 検索ルーブリックを用いてドキュメント再ランク付けを行い,高品質な文書セットの選定を可能にする。
    • 提案手法RubricRankerは,4つの深層研究ベンチマークにおいて,最強のベースラインを2.6ポイント上回る性能を示した。
    • RubricRankerは,検索ルーブリックを基盤とした二段階の学習フレームワーク(教師ありファインチューニングと強化学習)により,性能向上を実現した。
    • RAGベンチマークにおいても良好な汎化性能を示し,多様なタスクへの適用可能性を実証した。

    Link: https://arxiv.org/abs/2608.03527

  • 行動適応型視覚的注意散漫化による包括的・強靭なデジタル評価配信 [cs.RO, cs.CL, cs.AI, cs.CY]目的:包括的かつ強靭なデジタル評価配信のための行動適応型視覚的注意散漫化の理論的枠組み
    • 高得点評価の信頼性確保は教育機関において重要であり,不正行為対策が求められている。
    • 既存のセキュリティ対策は,アクセシビリティへの配慮が不足している場合がある。
    • 学習者のアクセシビリティを損なわずに,不正行為を抑制する手法を提案する。
    • 本研究では,行動適応型視覚的注意散漫化(BAVD)という理論的枠組みを提案した。
    • BAVDは,評価内容を改変することなく,視覚的表示を調整することで不正行為の有効性を低減する。
    • アクセシビリティへの配慮も組み込まれており,視覚処理に支援を必要とする学習者への影響を最小限に抑える。

    Link: https://arxiv.org/abs/2608.03531

  • LLMの性能向上に伴い,ソフトガイダンスがCoTプロンプティングを上回る [cs.CL, cs.AI]目的:大規模言語モデルの推論能力評価
    • 言語モデルの推論能力は,高度な問題解決や意思決定に不可欠である。
    • 従来のCoTプロンプティングは,モデルが直接回答する傾向を抑制する目的で導入された。
    • 高性能モデルにおいて,CoTプロンプティングが逆効果となりうる点を検証する。
    • 近年の言語モデルは,CoT形式の応答を自然に生成するため,CoTプロンプティングの効果が低下している。
    • 数学問題解決タスクにおいて,推論に特化したモデルは,CoTの例示なしで高い性能を発揮する。
    • CoTプロンプティングは,スタイル適応や書式への対応といった余分な負荷となり,推論を妨げる可能性がある。

    Link: https://arxiv.org/abs/2608.03550

  • 分布シフト下における表形式データ-画像分類器に対するテスト時拡張 [cs.AR, cs.RO, cs.CV, cs.LG]目的:表形式データを画像表現に変換する手法における,分布シフト下での予測性能向上
    • 表形式データ分析において,深層学習モデルの高性能を活用する新たな手法の必要性が高まっている
    • 表形式データから生成された画像表現を用いた分類器の,分布シフトに対する頑健性が未解明である
    • 分布シフト下での分類性能向上を目指し,テスト時拡張(TTA)の有効性を検証する
    • テスト時拡張は,分布外データに対する予測性能を向上させる効果が確認された
    • 特に,複合戦略と光度戦略が,頑健性と分散のバランスに優れていることが示された
    • 周波数領域変換は,エンコーダの特性を変更し,性能を低下させる傾向が確認された

    Link: https://arxiv.org/abs/2608.03557

  • 強化学習における汎用的な有用性の頑健性 [cs.LG]目的:汎用的な有用性を最適化する強化学習の枠組みにおける,有用性の誤指定に対する頑健性
    • 強化学習は,様々な意思決定問題に応用可能な強力な手法であり,その応用範囲拡大が期待される。
    • 従来の強化学習では,評価に使用する有用性が固定されており,実環境での変化に対応できない場合がある。
    • 本研究は,有用性の不確実性を考慮した頑健な強化学習アルゴリズムを開発し,実用的な応用を可能にすることを目指す。
    • 提案手法は,標準的な汎用的な有用性強化学習を厳密に一般化し,報酬頑健性や制約付き強化学習を含む既存の枠組みを統一的に扱うことができる。
    • 凹型有用性関数の場合,確率的勾配法による定常性保証が確立された。
    • 非凹型有用性関数の場合,非凹性による問題を緩和する確率的prox-extragradientアルゴリズムが提案され,近似的な一階定常性への収束が保証された。

    Link: https://arxiv.org/abs/2608.03562

  • 文脈認識型意味埋め込みによる表形式学習器の性能向上 [cs.RO, cs.AI, cs.LG]目的:表形式データにおける意味的理解の強化
    • 表形式データの活用は重要であり,その性能向上は様々な分野で求められている。
    • 従来の表形式学習器は,テキスト特徴を離散的な記号として扱い,意味情報を活用できていない。
    • 大規模言語モデルの意味理解能力と表形式学習器の統計的学習能力を融合し,性能改善を目指す。
    • 提案手法CASEは,大規模言語モデルの文脈情報を活用することで,表形式データの意味的曖昧性を解消する。
    • 実験の結果,CASEは,意味的に豊富なデータセットにおいて,特にデータ量が少ない場合に,表形式学習器の性能を大幅に向上させる。
    • CASEは,CARTE,TextTab,TabArenaといった複数のベンチマークで有効性が確認された。

    Link: https://arxiv.org/abs/2608.03565

  • AI科学者能力評価のための,変化の速い現実世界の敵対的環境 [cs.AI, cs.CY, cs.LG, cs.MA]目的:AI科学者の新規アイデア創出能力のベンチマーク
    • 科学研究の進歩には,AIによる効率化が不可欠であり,AI科学者の能力評価が重要である。
    • 既存の評価方法は,合成タスクや過去のデータに依存しており,AIの真の能力を測れない問題がある。
    • 現実世界の複雑な状況下で,AIが独創的なアイデアを生み出し,専門家と競えるかを評価することを目指す。
    • AIモデルは妥当なアイデアを生成するものの,現実世界の専門家の解決策と一致することは稀である。
    • F1では,GPT-5.2が提案した166件のアイデアのうち10件が実際の革新と一致した。
    • MTGでは,Gemini 3 Flashが構築したデッキは,上位デッキの新しいカードを5枚回収し,モデルの選択とプロツアーデッキの選択には強い相関が見られた。

    Link: https://arxiv.org/abs/2608.03569

  • SFTの競合とRLの共存:LLMのマルチタスク学習に関する理論的・実験的分析 [cs.CL, cs.LG]目的:大規模言語モデルにおけるマルチタスク学習の特性
    • LLMは多様なタスクに対応できる汎用性を持つため,その学習方法の理解が重要である。
    • SFTではマルチステージ学習においてタスク間の競合が発生し,性能向上が阻害される場合がある。
    • タスク間の競合を抑制し,安定したマルチタスク学習を実現するための方法を模索する。
    • SFTはマルチステージ学習で深刻なタスク競合を起こす一方,RLは多様なタスク間の安定した共存を可能にする。
    • RLはタスク間で疎でほぼ直交するパラメータ更新を誘起し,勾配干渉を抑制することが示された。
    • 提案手法Parallel-RLはマルチタスク学習を分離し,効率と柔軟性を大幅に向上させる。

    Link: https://arxiv.org/abs/2608.03573

  • 一度ピン,そして交換:効率的なUltra-LoRAサービングのための部分空間整合型セントロイド-残差学習 [cs.CL, cs.LG, cs.AI]目的:効率的なUltra-LoRAサービングのための学習フレームワーク
    • 大規模言語モデルの多テナント環境では,多数のLoRAアダプタを同時にホストする必要があり,効率性と性能が重要となる。
    • 高ランクアダプタは性能が良いが,VRAM使用量やPCIeスワップオーバーヘッドが課題となり,スケーラビリティを制限する。
    • 本研究では,低ランクアダプタの性能劣化を改善し,高ランクアダプタと同等の精度を実現することを目的とする。
    • SALTは,共有のセントロイドとタスク残差アダプタを用いることで,低ランクアダプタでも高ランクアダプタに匹敵する精度を達成した。
    • 様々な規模のLLMにおいて,最先端の圧縮手法と比較して最大18.5%の精度向上と,アダプタあたりのメモリ使用量を最大16分の1に削減した。
    • vLLMに統合した場合,PCIe帯域幅およびGPU VRAM制約下で,Llama-3.2-3Bのサービングスループットをそれぞれ最大51%,28%向上させた。

    Link: https://arxiv.org/abs/2608.03579

  • AI支援ピアレビュー:研究コミュニティ横断,ポリシーからLLMレビュー品質まで [cs.CY, cs.AI]目的:AI支援ピアレビューの現状と課題
    • 科学出版における効率化が求められる中,AIの活用は不可避である。
    • AI支援ピアレビューの利用に関する規定は分野によって異なり,標準化されていない。
    • AIレビューシステムの能力と,その評価方法の改善を目指す。
    • AIによるピアレビューは流暢かつ詳細な内容を生成するものの,過度に肯定的な評価や,一般的な批判,根拠の薄い指摘といった課題がある。
    • AIと人間のレビュー間のスコアの整合性,詳細度,懸念点の重複を分析し,多角的な評価の必要性を示した。
    • 総合的な品質スコアのみではAIレビューの質を過大評価する可能性があり,多次元評価が重要である。

    Link: https://arxiv.org/abs/2608.03581

  • 大学とビジネススクールにおけるAIの制度的ガバナンス:政策の断片化か制度的整合か [cs.AI, cs.CE, cs.ET]目的:高等教育機関におけるAI政策の現状と,その制度的ガバナンスのあり方
    • AI技術の急速な発展に伴い,高等教育機関は労働市場のニーズに対応した教育を提供する必要がある。
    • AIをカリキュラムに組み込む際の政策設定が,機関レベルや学部レベルで不一致が生じやすい。
    • AI政策の整合性を高め,学問分野特有の学習目標と変化する労働市場のニーズに対応すること。
    • 大学全体のAIポリシーはデータセキュリティとリスク軽減に重点を置いているのに対し,学部レベルのポリシーは教育的応用とツール利用に焦点を当てていることが明らかになった。
    • ビジネススクールのAIポリシーは,大学全体の枠組みと独立しているケースが少なく,学問分野特有の学習目標との間にずれが生じている。
    • AIに関するガイドラインは,大学全体のポリシーと整合性を保ちつつ,学問分野特有の目標と労働市場のニーズに対応する必要がある。

    Link: https://arxiv.org/abs/2608.03584

  • ソーシャルコーディングからエージェントコーディングへ:オープンソースコミュニティにおける生産性と関係性の再構成 [cs.AI, cs.CY]目的:オープンソースコミュニティにおけるコーディングエージェント(CA)の導入による生産性と関係性の変化
    • オープンソースは現代社会の重要なインフラであり,技術革新と知識共有の基盤である。
    • CA導入は開発効率向上に期待される一方,人間同士の協調が減少する懸念がある。
    • 本研究は,CA導入がもたらす生産性向上と知識共有への影響を定量的に評価する。
    • CA導入により,計画・完了タスク数それぞれが34.0%,39.0%増加し,タスク完了までの時間も短縮された。
    • CAの導入率は26.0%にとどまり,効果は主に活発な開発者に集中する傾向が見られた。
    • CA導入により,人間同士の直接的な連携は減少し,CAを介したタスク遂行が増加した。また,生成される知識の質は低下した。

    Link: https://arxiv.org/abs/2608.03585

  • GenOS:AIコード生成における意味的堅牢性に関する構成的証明 [cs.PL, cs.AI, cs.SE]目的:AIコード生成におけるプロンプト,コントラクト,ジェネレーター,プログラムの安全な置換基準の確立
    • AIによるコード生成は自動化を促進するが,その確率的性質上,わずかな入力変化で出力が大きく変動する可能性がある。
    • 既存のシステムは正当性を評価するものの,AIエージェントワークフロー内での構成要素の安全な置換を保証する基準が不足している。
    • GenOSは,置換に伴う動作変化を数学的に保証し,意味的な堅牢性を評価する枠組みを提供する。
    • GenOSは,各層をマルコフ核としてモデル化し,インターフェースを観測者相対的な同値性で表現することで,置き換え問題を形式化する。
    • 同値性を持つプロンプトは,検証済みコミットを含む,下流の同値性閉じたイベントの確率分布を等しくする。
    • 挿入ソートの監査実験により,自然言語の言い換えや形式的なコントラクトを用いた場合でも,GenOSが予測した範囲内で確率分布が一致することを確認した。

    Link: https://arxiv.org/abs/2608.03588

  • マイクロコントローラ上での断続学習のための深層ニューラルネットワークの設計時最適化 [cs.LG]目的:マイクロコントローラ上での断続的エネルギー自律なオンデバイス学習のための深層ニューラルネットワーク設計
    • モバイル環境におけるAI活用が期待される中,エネルギー供給が不安定な状況下でのAI実行が課題となっている。
    • 学習が中断される可能性のある断続的な環境下では,深層ニューラルネットワークの設計が困難である。
    • 設計段階での最適化により,エネルギー供給が不安定な環境下でも安定した学習を可能とすることを目指す。
    • 提案手法は,ハードウェアを考慮したエネルギー予測モデルと多目的最適化を組み合わせ,設計時にオフラインで深層ニューラルネットワークを最適化する。
    • エネルギー予測モデルは,DNNモデルから抽出した計算・メモリ特性に基づいて,各層の推論および学習エネルギー消費量を推定する。
    • Cortex-M4 MCU上での異常検知のためのオートエンコーダを用いた検証により,予測モデルの重み付き絶対パーセント誤差は16.6%であった。

    Link: https://arxiv.org/abs/2608.03589

  • DiagChain:LLMエージェントの証拠に基づいた攻撃チェーン再構成の評価用診断ベンチマーク [cs.CR, cs.AI]目的:LLMエージェントの証拠に基づいた攻撃チェーン再構成における段階的評価
    • サイバーセキュリティにおける攻撃の早期発見と正確な分析は,被害を最小限に抑える上で不可欠である。
    • 既存の評価方法では,推論過程の中間段階における誤りの発生源や伝播が不明確である。
    • LLMエージェントの各段階における性能を診断し,改善点を見出すことを目指す。
    • DiagChainは,多様なシナリオを含むMAIN-69データセットを用いて,LLMエージェントの段階的評価を可能にする。
    • 評価の結果,最も高性能な構成でさえ,MAIN-69の参照ステップの約39.6%しか正しく再構成できなかった。
    • 小規模モデルは証拠の組み込みに,大規模モデルは証拠の順序付けに課題があることが示された。

    Link: https://arxiv.org/abs/2608.03591

  • FOUND-AF:心房細動検出のためのECG基礎モデルのベンチマーク [cs.AI, cs.LG]目的:心房細動検出のためのECG基礎モデルの性能評価
    • 心房細動は頻度の高い不整脈であり,脳卒中や心不全のリスクを高めるため,早期発見が重要である。
    • 既存研究では,データセット,前処理,分類器,検証方法が異なり,ECG基礎モデルの有効性を比較することが困難であった。
    • 本研究は,統一されたベンチマークフレームワークを用いて,ECG基礎モデルの性能を公平に評価し,最適なモデル選択を支援する。
    • FOUND-AFフレームワークにより,異なるECGデータセットと条件下での基礎モデルの性能を再現性高く比較することが可能になった。
    • ECGFounderモデルが,精度,モデルサイズ,推論時間,メモリ使用量のバランスに優れ,全体的に最も優れた性能を示した。
    • 臨床的に事前学習されたコンパクトなエンコーダが,様々な環境下で堅牢かつ効率的な心房細動検出を可能にすることが示された。

    Link: https://arxiv.org/abs/2608.03597

  • 偏微分方程式ワークフローのための大規模言語モデル [cs.CL, cs.AI]目的:偏微分方程式ワークフローにおける大規模言語モデルの活用
    • 科学技術の発展には,偏微分方程式の正確なモデリングと効率的な数値解法が不可欠である。
    • 専門知識を要するワークフローの構築には,多大な労力と時間が必要となる場合が多い。
    • 大規模言語モデルを活用し,ワークフローを効率化することで,その課題を克服することを目指す。
    • 本研究では,大規模言語モデルによる偏微分方程式研究の3段階(モデル発見,数値ソルバー生成,シミュレーションフィードバック)における進展を調査した。
    • 現在のシステムは,主にワークフローレベルのインターフェースとして機能している。
    • 高品質なデータセットの不足や,シミュレーション結果と現実世界の乖離が課題として残されている。

    Link: https://arxiv.org/abs/2608.03600

  • FraQ:連合学習における低ランク適応のための効率的な座標空間再圧縮 [cs.AI]目的:連合学習における低ランク適応(LoRA)のための効率的な座標空間再圧縮手法
    • 大規模言語モデルの共同適応は,データプライバシーを保護しつつ,性能向上に繋がる重要な技術である。
    • LoRAのパラメータ表現が,クライアント間での集約時に不整合を生じやすく,性能低下の原因となる。
    • 集約された重みを効率的に再圧縮し,通信コストを削減することで,連合学習の実用性を高める。
    • FraQは,正確な集約重みを表現する要素を基に,直交基底とコンパクトな座標行列への分解を行う。
    • 文の分類や常識推論の実験で,FraQは非圧縮ベースラインに近い精度を達成し,大幅なダウンリンク通信量の削減に成功した。
    • サーバー側の再圧縮オーバーヘッドも低く抑えられ,効率的な連合学習を実現している。

    Link: https://arxiv.org/abs/2608.03605

  • 臨床試験戦略の学習:意思決定エージェントのためのオフラインポリシー学習 [cs.AI, cs.LG]目的:臨床試験ポートフォリオ予測モデルの構築
    • 医薬品開発は不確実性の下での意思決定であり,効率的な戦略が不可欠である。
    • 過去のデータに基づいた臨床試験計画は,データの多様性と時間的制約により困難である。
    • オフライン学習により,過去データから臨床試験戦略を学習し,意思決定を支援することを目指す。
    • オフライン学習モデルは,事前学習済みのLLMベースラインよりも優れた性能を示した。
    • 特に,報酬重み付き行動模倣学習が最も高い性能を示し,F1スコアが大幅に向上した。
    • 構造化されたオフライン学習は,臨床試験計画を学習するエージェントの開発に貢献する可能性がある。

    Link: https://arxiv.org/abs/2608.03606

  • 運用データにおけるエージェントシステム形式検証 [cs.AI]目的:大規模言語モデル(LLM)駆動型エージェントシステムの形式検証
    • LLMを活用したエージェントシステムの実用化が進む中で,信頼性の確保が不可欠である。
    • 既存手法では,システム全体としての保証が難しく,エージェントのインターフェースレベルでの制約に留まる。
    • 運用データ上のLLMエージェントシステムの安全性と正当性を形式的に検証可能な枠組みを構築する。
    • エージェントシステムをStateful Tool-Enabled Agentic Deployments (STEADs)として形式化し,FO-CTL仕様に対する検証問題を定義した。
    • 検証問題は決定不能だが,有限ドメイン制限下ではFO-CTL仕様の正確な保存に関する十分条件を特定し,PSPACE完全性を示した。
    • LLMエージェントがこの条件に違反する可能性を示し,任意のベースエージェントに対してこの条件を保証するカノニカルなデプロイメントラッパーを導入した。

    Link: https://arxiv.org/abs/2608.03609

  • 不完全な観測におけるマルチモーダル感情分析におけるモダリティ信頼性の再考 [cs.AI, cs.MM]目的:不完全な観測下でのマルチモーダル感情分析におけるモダリティ信頼性の明示的モデリング
    • 感情分析は,人間の感情を理解する上で不可欠であり,様々な応用分野で利用されている。
    • 現実世界のマルチモーダルデータは不完全であることが多く,既存手法ではモダリティ信頼性を十分に考慮できていない。
    • モダリティ信頼性を明示的にモデル化することで,不完全な観測下での感情分析の精度向上を目指す。
    • 提案手法MRCFは,各モダリティの信頼性を推定し,それに基づいてクロスモーダル情報の流れを調整する。
    • 実験結果から,MRCFは標準的な不完全観測プロトコルにおいて高い性能を示すことが確認された。
    • 明示的な信頼性モデリングが,信頼性の不一致と伝播バイアスの軽減に貢献することが示された。

    Link: https://arxiv.org/abs/2608.03611

  • 低ランク重み空間アブレーション下における条件崩壊の理論:I. 単一ブロック理論と合成検証 [cs.LG, cs.AI]目的:条件崩壊現象の理論的解明
    • 深層学習モデルの解釈可能性向上は,信頼性と安全性の確保に不可欠である。
    • 活性化パッチングと重み空間アブレーションの整合性に関する理解が不足している。
    • アブレーションとパッチングの挙動の違いを明確にし,その条件依存性を明らかにする。
    • 理想化されたモデルにおいて,特定の条件下でアブレーションが入力ペアを同じ出力に収束させる条件を数学的に証明した。
    • パッチングはドナー・レシーバー間のコントラストに,アブレーションは絶対レベルに応じた読み出し値の変化をもたらすことを示した。
    • 合成タスクを用いた実験により,理論モデルの予測精度とアブレーション構成の相関関係が確認された(Spearman $-0.83$)。

    Link: https://arxiv.org/abs/2608.03620

  • 大規模言語モデルシステムのセキュリティ指向ライフサイクルモデル [cs.CL, cs.CR, cs.AI, cs.CY]目的:大規模言語モデルシステムのセキュリティ分析を支援するライフサイクルモデルの提案
    • 大規模言語モデルは社会基盤や業務に不可欠となりつつあり,その安全性が重要課題となっている。
    • 既存のライフサイクルフレームワークは効率性重視であり,セキュリティ分析が不十分である。
    • セキュリティを考慮したライフサイクルモデルを構築し,リスク管理を明確化することを目的とする。
    • 本研究では,データ,モデル,配布,アプリケーションの4層とLLMOps,ガバナンスの柱からなる32段階のライフサイクルモデルを提案する。
    • 特に,既存フレームワークでは明確に区別されていない13の段階を特定し,セキュリティ上の懸念点を明確化する。
    • NIST AI RMF,EU AI Act,ISO/IEC 42001の比較から,ガバナンス証拠が展開段階に集中し,開発段階での可視性が低いという現状を明らかにした。

    Link: https://arxiv.org/abs/2608.03626

  • 不平等な判決:LLMベースのフェイクニュース検出におけるジェンダーバイアスの調査 [cs.AI]目的:LLMベースのフェイクニュース検出におけるジェンダーバイアスの存在とその影響
    • フェイクニュースは社会に大きな混乱をもたらすため,自動検出技術の信頼性が重要である。
    • LLMはバイアスを含む可能性があり,それがフェイクニュース検出の公平性を損なう恐れがある。
    • LLMによるフェイクニュース検出におけるジェンダーバイアスの実態を明らかにし,対策を検討する。
    • LLMはジェンダー表現に応じて異なる判断を示すことが示された。文言を変更するだけで,9.79%-35.13%の事例でラベルが不一致となった。
    • 特に男性に対する懐疑的な傾向が強く見られ,LLMの信頼性と公平性が損なわれることが明らかになった。
    • 本研究で作成したデータセットを公開することで,今後のバイアス対策研究を支援する。

    Link: https://arxiv.org/abs/2608.03627

  • ConformalShift:適応型心電監視に対する標的イベント順序変更 [cs.LG]目的:適応的適合予測におけるイベント順序依存性の脆弱性
    • 心電図監視は,不整脈検出など,医療における重要な役割を担っている。
    • 適合予測はイベント順序に影響を受けやすく,タイミング操作による誤判定の危険性がある。
    • 本研究は,心電図波形やラベルを変更せずに,イベント順序を操作する攻撃手法を検証する。
    • ConformalShiftは,MIT-BIHデータセットにおいて,Extra Treesで66.7%,HistGradientBoostingで60.0%の標的イベント抑制に成功した。
    • INCARTデータセットでも同様に有効であり,偽装のタイミングが重要であることが示された。
    • イベント順序操作の制約強化は,攻撃成功率の低下につながった。

    Link: https://arxiv.org/abs/2608.03628

  • 重み空間アブレーション下におけるクロスレイヤー相互作用:閉形式注意ヤコビアン境界と実事前学習モデルでの検証 [cs.AI, cs.LG]目的:重み空間アブレーション下におけるクロスレイヤー相互作用の解析
    • 深層学習モデルの頑健性や解釈可能性を向上させるために,モデルの特定部分を削除するアブレーション技術が重要である。
    • アブレーションによる影響は,層を超えて複雑に相互作用するため,そのメカニズムの理解が困難である。
    • アブレーションによるクロスレイヤー相互作用を定量的に評価し,その影響を予測することを目指す。
    • アブレーションの影響は,同じブロック内では正確に分解可能であり,クロスレイヤー相互作用は二重積分で表せる。
    • 注意サブブロックのヤコビアン境界を閉形式で導出し,Qwen2.5-1.5B-Instructモデルの実際の重みに対して検証した結果,違反は確認されなかった。
    • 間接目的語識別に対する創発的回路を発見し,アブレーションによる崩壊,解離,相互作用を検証した結果,部分的に一致する結果が得られた。

    Link: https://arxiv.org/abs/2608.03629

  • 周期変動下の時系列予測のための位相認識SO(2)特徴回転:POEM [cs.LG]目的:周期変動下の時系列予測における,位相に関連する変動の低減
    • 時系列予測は,需要予測や異常検知など,様々な分野で重要である。深層学習の発展により精度は向上している。
    • 既存手法は固定時間グリッド上で学習するため,周期のタイミングや位相が時間とともに変化する周期変動に対応が難しい。
    • 位相を考慮した特徴回転により,周期変動の影響を軽減し,予測精度を向上させることを目指す。
    • 提案手法POEMは,2次元特殊直交群SO(2)を用いた潜在特徴の回転により,位相の変動を低減する。
    • Directional Phase Increment Attention (DPIA)により,過去の位相増分を未来の位相補正に活用し,外挿性能を向上させる。
    • 実験結果から,POEMは競争力のある性能を示し,学習された位相認識変換が潜在軌跡をより規則的にすることを裏付けている。

    Link: https://arxiv.org/abs/2608.03630

  • 教師が誤解を招くとき:擬似信号を認識したオンポリシー蒸留 [cs.AI]目的:オンポリシー蒸留における擬似信号の特定とフィルタリング
    • 大規模言語モデルの性能向上は重要であり,蒸留はそのための有力な手法の一つである。
    • 従来のオンポリシー蒸留は,入力に依存しない言語モデルの偏りに影響を受けやすい。
    • 入力に依存しない信号(擬似信号)を除去し,蒸留の質を向上させることを目指す。
    • 提案手法SA-OPDは,入力依存度と蒸留の乖離度に基づき,誤解を招くトークンレベルの信号をフィルタリングする。
    • SA-OPDは,大規模言語モデルと視覚言語モデルの両方で,既存手法を上回る性能を示す。
    • 入力依存度は,オンポリシー蒸留における教師信号選択の重要な要素であることが示された。

    Link: https://arxiv.org/abs/2608.03632

  • MuEvo:LLM駆動による多ヒューリスティック集団の進化 [cs.NE, cs.AI]目的:多ヒューリスティック集団の進化
    • 組合せ最適化問題の効率的な解決が,現実世界の様々な課題において不可欠である。
    • 従来のヒューリスティック設計は専門知識と試行錯誤に依存し,時間と労力を要する。
    • LLMを活用し,複数のヒューリスティック間の相互作用を考慮した集団進化を目指す。
    • MuEvoは,動的なコンポーネント管理とLLM駆動による共同進化を組み合わせることで,集団進化の効率を向上させる。
    • 実験結果から,MuEvoは既存手法と比較して,複数の組合せ最適化問題において優れた性能を示すことが確認された。
    • 特に,人間が設計したフレームワークや,LLM-AHDの拡張手法を上回る成果が得られた。

    Link: https://arxiv.org/abs/2608.03636

  • 種間クロスプレイは十分か?ゼロショット協調アルゴリズムの堅牢性を実装詳細に対して評価 [cs.AI, cs.MA]目的:ゼロショット協調アルゴリズムの実装詳細に対する堅牢性の評価
    • 現実世界でのAI活用には,人間や未知のAIとの協調が不可欠であるため,そのためのアルゴリズム研究が重要である。
    • 既存研究では,アルゴリズムの仕様解釈や実装によるばらつきが考慮されておらず,堅牢性の評価が不十分である。
    • 異なる実装詳細を用いた評価手法を導入し,ゼロショット協調アルゴリズムの堅牢性を系統的に検証することを目指す。
    • 提案するクロス実装クロスプレイ評価スキームを用いてOther-Playアルゴリズムを評価した結果,標準的な評価方法でも概ね妥当な結果が得られることが示された。
    • 実装詳細の変化がOther-Playの性能に与える影響は限定的であり,アルゴリズムの基本的な協調能力は維持されることが確認された。
    • 今回の結果は,既存のゼロショット協調アルゴリズムの評価方法の妥当性を裏付けるものであり,今後の研究開発の指針となる。

    Link: https://arxiv.org/abs/2608.03644

  • 分布外推薦における条件付き識別潜在環境モデリング [cs.IR, cs.LG]目的:分布外推薦における潜在環境と嗜好の関係性の解明
    • 推薦システムは多様な場面で利用され,その精度向上は重要な課題である。
    • 分布外データへの適応が難しく,嗜好の変化に対応できない場合がある。
    • 潜在環境を考慮することで,よりロバストな推薦システムの構築を目指す。
    • CILERは,潜在環境をユーザー条件付き指数型分布でモデル化し,特徴量に基づいた多項式で嗜好への影響を表現する。
    • 潜在環境を考慮した表現を識別し,環境推論誤差によるログリスクの上限を導出した。
    • 3つのデータセットにおいて,特徴,時間,地理的変化下で,CILERはOODランキング指標を改善した。

    Link: https://arxiv.org/abs/2608.03647

  • AutoSND:実行証拠から構造的ポリシーへの自動ネットワーク解体ヒューリスティック探索 [cs.AI]目的:自動ネットワーク解体ヒューリスティックの探索
    • 複雑系の堅牢性や脆弱性分析において,ネットワーク解体は不可欠である。
    • 実用的なヒューリスティックは効率性と効果性を両立する必要があり,手動設計が一般的である。
    • 実行中の状態から構造レベルの指針を得て,ヒューリスティック生成を改善する。
    • AutoSNDは,実行証拠を基に構造的ポリシーを生成する3段階の探索フレームワークである。
    • 実世界のネットワーク12個と大規模ネットワーク3個で,AutoSNDがより良い探索性能と安定性を示すことが確認された。
    • 最終候補は,残次次数を基盤とし,局所信号と状態更新範囲を調整した解釈可能な構造を形成する。

    Link: https://arxiv.org/abs/2608.03653

  • 予算制約下における忠実な要約のための生成と選択の分離 [cs.CL, cs.AI]目的:予算制約下における忠実な要約のための生成と選択のフレームワーク
    • 要約技術は,情報過多な現代において,効率的な情報把握に不可欠である。
    • 既存の生成モデルは,事実誤認,冗長性,長さの制御が課題となっている。
    • 事実に基づいた,高品質な要約を生成するための新しいメカニズムを提案する。
    • 生成と選択を分離したフレームワークは,事実の一貫性と情報源との整合性を向上させる。
    • 特に複数文書要約において,既存手法よりも優れた性能を示す。
    • 人間による評価においても,一貫性,関連性,明瞭性,簡潔性が高いと評価された。

    Link: https://arxiv.org/abs/2608.03655

  • LLMレビューは人間のピアレビューとどれほど一致するか [cs.CL, cs.AI]目的:LLMレビューと人間のピアレビューの一致度
    • 科学研究の質保証において,ピアレビューは不可欠であり,その効率化が求められている。
    • LLMによる自動レビューの評価は進むも,複数のLLMプロバイダー間の比較は少ない。
    • 異なるLLMプロバイダーのレビューの特性と,人間のピアレビューとの差異を明らかにすること。
    • 3つのLLMはいずれも採択と否決の判断はできていたが,口頭発表とポスター発表の区別は再現できなかった。
    • Geminiは他のLLMと比較して評価が高く,OpenAIとClaudeは否決論文やポスター論文に対しては人間と近い評価だった。
    • LLMはベースライン比較の欠如を指摘する傾向が強く,人間は計算効率の問題を重視する傾向があった。

    Link: https://arxiv.org/abs/2608.03659

  • 暗黙的要素の制御:継続マルチモーダル後学習のためのデュアルチャネルリスク認識強化学習ファインチューニング [cs.AI]目的:継続マルチモーダル大規模言語モデルの後学習における破局的忘却の抑制
    • マルチモーダル大規模言語モデルは多様なタスクに対応可能だが,継続学習における忘却抑制が課題である。
    • 強化学習によるファインチューニングは忘却に強いとされてきたが,タスク分布の大きな変化下では忘却が深刻化する。
    • 本研究は,強化学習ファインチューニングにおけるリスクを明示的に制御することで,忘却の抑制を目指す。
    • 提案手法RAPOは,ポリシーチャネルとデータチャネルの二つの経路でリスクを管理するフレームワークである。
    • RAPOは,既存の強化学習アルゴリズムにプラグアンドプレイで組み込むことが可能であり,追加のメモリを必要としない。
    • MLLM-CLベンチマークにおいて,RAPOはベースラインと比較して最終的な忘却を79.8%削減し,新しいタスクへの適応能力を維持した。

    Link: https://arxiv.org/abs/2608.03660

  • 高次安全性に対するシールド [cs.AI]目的:高次滑らかさ制約に対する有限状態安全性ゲーム構築
    • サイバーフィジカルシステムにおいて,安全性確保は不可欠であり,事故や損害を防ぐ上で重要である。
    • 従来のシールドは状態述語に基づき,より細かい物理的な制約(速度制限,加速度制限など)に対応できない場合がある。
    • 本研究は,状態の微分に関する高次滑らかさ制約を持つシステムの安全性シールド合成を可能にすることを目的とする。
    • 微分安全性特性を定義するために,離散化された状態空間における有限差分を使用する。
    • シールド合成を履歴状態空間上の通常の安全性ゲームに帰着させるアルゴリズムを開発した。
    • アルゴリズムは,制約の次数kに対して正確にk個の過去の状態を保存し,このメモリが必要であることを証明した。

    Link: https://arxiv.org/abs/2608.03662

  • 因果的OPD:因果連鎖推論のための最初の誤り段階の監督 [eess.SY, cs.SY, eess.SP, cs.CY, cs.LG]目的:因果連鎖推論における誤り段階の特定と修正
    • 臨床診断や法的判断など,重要な推論タスクには因果関係が不可欠である。
    • 大規模言語モデルは優れているが,プライバシー,遅延,制御性の課題がある。
    • ローカルに展開可能なモデルへの知識蒸留において,プロセス誤りを修正する。
    • CausalOPDは,シーケンスレベルの蒸留よりも平均パス正答率を23.4%向上させた。
    • 正解ラベルだが誤った理由での回答率を15.7%から4.4%に削減した。
    • 80億パラメータのドメイン特化型モデルは,全てのドメインでパス正答率において,評価された商用モデルを上回った。

    Link: https://arxiv.org/abs/2608.03673

  • 診断LLMのための舞台局所的強化学習を用いた反実仮想データフライホイール:DiagLoop [cs.LG]目的:診断型LLMの性能向上
    • 因果関係に基づく診断は,修理や治療の指針となるため重要である。
    • 深刻な事例が少なく,推論経路の記録が乏しいことが課題である。
    • 物理関係や臨床ガイドラインを利用し,データ不足を補うことを目指す。
    • 合成データのみで学習した80億パラメータモデルが,既存のベースラインよりも厳密な経路の正しさを向上させた。
    • 8つの産業システムで11.6ポイント,10種類の疾患カテゴリーで5.5ポイントの性能向上が確認された。
    • プロプライエタリな参照モデルを上回り,Few-shot学習やコンテキスト内の仕様提供においても優位性を示した。

    Link: https://arxiv.org/abs/2608.03674

  • PhyAI:エッジにおけるリアルタイム物理AI,クラウドにおけるスケーラブルなロールアウト [cs.AI, cs.RO]目的:物理AI推論エンジンの構築と,その性能向上
    • ロボティクス等の分野で,物理世界とのインタラクションを伴うAIの重要性が高まっている。
    • 物理AIモデルは,評価,クラウド学習,エッジ展開など,環境ごとに異なる推論プログラムを必要とする。
    • 異なる環境で同一のモデルチェックポイントを活用し,推論処理を統一することで効率化を図る。
    • PhyAIは,pi0,pi0.5,GR00T N1.7,MiniCPM-Robotといった既存実装に対し,1.40倍〜4.65倍の高速化を達成した。
    • Cosmos3-Nano-Policy-DROIDにおいては,8つのH20 GPUでレイテンシを2.46秒から1.18秒へ短縮し,2.08倍の高速化を実現した。
    • 制御時間Rooflineの導入により,推論ボトルネックと環境ボトルネックを区別し,モデルごとの特性を分析した。

    Link: https://arxiv.org/abs/2608.03682

  • LiveEvalBench: Web生成におけるオープンワールド評価に向けて [cs.AI, cs.SE]目的:Web生成評価のための自動化されたフレームワーク
    • Web技術は社会基盤であり,その品質向上は重要である。大規模言語モデルの活用が期待されている。
    • 既存の評価方法は静的であり,Webアプリケーションのインタラクティブ性や多様な実装に対応できない。
    • Web生成評価を,適応的かつ拡張可能なエージェントベースのプロセスとして実現する。
    • LiveEvalBenchは,ビルドエンジニア,コードエンジニア,UIテスターが共同で評価を行うワークフローを構築する。
    • 共有可能な評価基準と,実装に即した評価基準を組み合わせることで,多様な実装に対応する。
    • 実験の結果,LiveEvalBenchは専門家の判断と高い一致度を示し,モデルのWeb生成能力に関する詳細な分析を可能にする。

    Link: https://arxiv.org/abs/2608.03689

  • LAEF:ポイント・オブ・ケア診断に向けたリード非依存型心電図基盤モデル [cs.LG]目的:ポイント・オブ・ケア診断における心電図解析の性能向上
    • ウェアラブルデバイスの普及により,心電図データは医療現場以外でも取得可能になった。
    • 既存の心電図基盤モデルは固定12リード構成に依存し,リード数の少ない環境下では性能が低下する。
    • 任意のリード構成に対応可能な,より汎用性の高い心電図基盤モデルの開発。
    • LAEFは,リード数に依存せず,可変サイズの時空間グラフとして心電図を処理する。
    • 920万件の12リード心電図で事前学習を行い,リード構成にロバストな表現を獲得した。
    • 1〜2リードの診断において,既存手法と比較してAUROCで平均3.2ポイントの改善が確認された。

    Link: https://arxiv.org/abs/2608.03690

  • パターンをピクセル以上に:マルチモーダルコード生成におけるパターン補完バイアスの測定 [cs.SE, cs.AI, cs.CV]目的:マルチモーダル大規模言語モデルにおけるパターン補完バイアスの評価
    • ウェブページをコードに変換する技術は,Web開発の自動化に貢献し,効率化が期待されている。
    • 視覚的なパターンが繰り返される場合,モデルが視覚的に誤りながらもパターンに一貫したコードを生成する問題がある。
    • ウェブページのスクリーンショットからコードを生成する際の,パターン補完バイアスの影響を定量的に評価する。
    • 最先端の5つのマルチモーダル大規模言語モデルを評価した結果,すべてが繰り返し現れるパターンに強いバイアスを持つことが明らかになった。
    • カード幅の摂動では平均バイアス率が69.78%,テキストのフォントサイズの摂動では80.22%に達し,平均精度はそれぞれ21.17%と7.89%にとどまった。
    • より多くの推論努力が低いバイアスと相関する一方,モデルは異常な要素を認識できても,パターンに一貫した回答で上書きすることがある。

    Link: https://arxiv.org/abs/2608.03691

  • GPUアーキテクチャとcuGraphによる動的グラフクラスタリングの高速化 [cs.DC, cs.LG]目的:時間的ネットワークにおけるコミュニティ検出
    • 社会システムや生物学的ネットワークなど,動的な相互作用を理解する上で重要である。
    • 従来の静的グラフ向けアルゴリズムでは,大規模な時間的ネットワークの分析が困難である。
    • GPUの並列処理能力を活用し,時間的ネットワークのコミュニティ検出を高速化する。
    • 本研究では,NVIDIA RAPIDSエコシステムを基盤としたフレームワークを開発し,時間的グラフのコミュニティ特性評価と追跡を可能にした。
    • マルチスライスモジュラリティバックエンドは,CPU参照実装と比較して,最大で3桁程度の高速化を達成した。
    • 実装はオープンソースソフトウェアとして公開されており,NetworkX-Temporalライブラリを通じて簡単に利用できる。

    Link: https://arxiv.org/abs/2608.03695