arXiv雑要約

AI - 2026/08/05 公開

  • PatTree:医療分類タスクのための新規なマルチモーダルグラフベース患者表現の自動生成アプローチ [cs.LG]目的:医療分類のためのマルチモーダルなグラフベース患者表現の自動生成
    • 医療AIの性能向上には,単一のデータソースよりも包括的なマルチモーダルデータが不可欠である。
    • 臨床データの多様性や複雑さが,構造化されたデータ分析とAI応用の大きな課題となっている。
    • 臨床データの事前標準化に頼らず,データ統合を早期段階で実現し,臨床AIパイプラインの構築を容易にする。
    • PatTreeを用いることで,データ準備や標準化の手間を省き,臨床AIパイプラインの構築が可能となる。
    • ADNI-1コホートを用いた評価では,アルツハイマー病,軽度認知障害,健常者の3クラス分類において,98.5%のバランスアキュラシーと0.987のF$_1$スコアを達成した。
    • PatTreeは,異種医療データの構造化を通じて,最先端の分類性能を可能にするスケーラブルな基盤となる。

    Link: https://arxiv.org/abs/2608.02692

  • Crayotter:グループ相対的選好逆伝播による長期間ビデオ編集エージェントの学習 [cs.CL, cs.LG]目的:長期間のビデオ編集エージェントの学習手法
    • ビデオ編集の自動化は,コンテンツ制作の効率化に不可欠である。
    • 編集品質の主観性や多様な要求への対応が課題となっていた。
    • 主観的で遅延した報酬からの学習を可能にする手法を開発する。
    • グループ相対的選好逆伝播(GRPB)により,編集行動とレンダリング品質が向上した。
    • GRPBは,同じタスクのランキングをゼロサムな利点に変換し,編集セグメントに制限された報酬を再分配する。
    • Crayotterモデルは,AgenticVBenchにおいて複数のプロプライエタリシステムを凌駕した。

    Link: https://arxiv.org/abs/2608.02694

  • ソフトウェアリポジトリにおける著者なりすましの様式計測による防御 [cs.CR, cs.LG, cs.SE]目的:ソフトウェアリポジトリにおける著者なりすましの検知
    • ソフトウェアサプライチェーン攻撃の増加に伴い,開発者のアカウントを悪用した攻撃が深刻化している。
    • 正規の開発者になりすました攻撃者が,悪意のある変更を承認してしまうという課題が存在する。
    • パッチレベルでの著者確認により,サプライチェーン攻撃に対する防御を強化することを目指す。
    • 様式計測分析をパッチレベルのコミットに適用可能であることを示した。
    • Linuxカーネルの20年以上のコミット履歴を用いてクロスモーダルTransformerを学習し,コード差分とコミットメッセージを統合した様式計測空間を構築した。
    • 構築したモデルは,オープンワールド著者検証において0.93のROC AUCを達成し,実際のサプライチェーン攻撃の検知にも有効であることが確認された。

    Link: https://arxiv.org/abs/2608.02695

  • 帰属度分離度による説明安定性の評価 [cs.LG, cs.AI]目的:説明安定性の評価手法
    • ブラックボックスモデルの説明は重要であり,その信頼性評価が求められている。
    • 帰属度算出手法は確率的要素を含むため,安定性に課題がある。
    • 帰属度ベクトルの分離度合いを評価し,安定した特徴ランキングを特定する。
    • 本研究では,帰属度分布に基づくフレームワークを提案し,説明安定性を定量的に評価する。
    • 提案手法は,特徴ランキングの信頼性が維持される最大のインデックスを特定できる。
    • 異なる帰属度算出手法のランキング頑健性を比較し,評価基準を提供する。

    Link: https://arxiv.org/abs/2608.02697

  • ツール利用エージェント集団における適応的秘密共謀の隠蔽分析:ブラックボックス型,クロスプリンシパルアプローチ [cs.CR, cs.AI]目的:ツール利用エージェントの秘密共謀検出
    • LLMを活用したエージェント利用が拡大し,集団レベルでのリスク管理が重要となっている。
    • 単一エージェントの安全対策では,複数エージェント間の共謀による不正行為を見抜くことが困難である。
    • 組織間でのモデル内部の可視化が難しいため,外部観測のみでの共謀検出手法の開発が求められている。
    • 提案手法は,相互情報量推定,置換検定,分布シフト統計,タイミングおよびツールコールサイドチャネルを組み合わせる。
    • 敵対的環境下での継続的な性能評価により,検出能力の限界を示す検出容量フロンティアを提示する。
    • セッションを跨いだペイロード拡散など,既存手法では検出困難な回避策の存在を示唆している。

    Link: https://arxiv.org/abs/2608.02698

  • EUにおける説明義務に対する説明可能なAI:法とXAIの翻訳ギャップに関する体系的レビュー [cs.AI, cs.CY, cs.LG]目的:EU法における説明権と,説明可能なAI(XAI)がその権利を満たす可能性に関する体系的レビュー
    • AIの意思決定の透明性と公正性が重要視される中,法的根拠に基づいた説明可能性が求められている。
    • XAIと法規制の間の知識の断絶があり,AIの説明責任を果たすための具体的な方法論が不足している。
    • 法的な要件と技術的な実現可能性を統合し,説明権の履行を可能にするためのフレームワークを構築すること。
    • レビューの結果,法と技術の両方の視点を統合した研究はわずかであり,学際的な統合が不十分であることが明らかになった。
    • GDPRの法的根拠の誤認,CJEUのDun & Bradstreet判決への言及の少なさ,説明の形式と内容の混同など,問題点が見つかった。
    • レビューでは,「受取人/目的フレームワーク」を概念化し,その運用化のための4段階の設計図と6つの研究課題を特定した。

    Link: https://arxiv.org/abs/2608.02699

  • ノイズフロアを考慮した非一様量子化によるアナログメモリ内計算 [cs.LG, cs.AI]目的:アナログメモリ内計算におけるノイズに配慮した非一様量子化手法
    • ニューラルネットワーク推論の省電力化が重要であり,アナログメモリ内計算はその有効な手段である。
    • デバイスのばらつきや読み出しノイズにより,低ビット量子化モデルの精度が低下する問題がある。
    • ハードウェアノイズフロアを考慮し,効率的な精度割り当てを行うことで,精度劣化を抑制することを目指す。
    • 提案手法NANQは,eFlash CIMアレイの測定結果から重量依存性ノイズをモデル化し,適応的な量子化密度を算出する。
    • これにより,ノイズの少ない領域には高い分解能を,ノイズの多い領域には無駄な精度割り当てを回避する。
    • チップ上での実験により,NANQはPowerQuantと比較して,ビジョンモデルの精度を8.05%向上,言語モデルのPPLを54.7%低減した。

    Link: https://arxiv.org/abs/2608.02700

  • ARCHead:大規模言語モデル出力ヘッドのための活性化指標残差補正 [cs.CL, cs.LG]目的:大規模言語モデルの出力ヘッド圧縮手法
    • 大規模言語モデルの効率的な利用が重要であり,モデルサイズの削減は不可欠である。
    • モデルブロックの量子化が進む一方で,出力ヘッドは高精度な形式で保持されることが多い。
    • 出力ヘッドの量子化による性能劣化を抑制し,圧縮率を高めることを目指す。
    • ARCHeadは,量子化された低ランクコア,グループごとのINT4残差,活性化指標に基づく低ランク補正を組み合わせることで,出力ヘッドを効率的に圧縮する。
    • Qwen3-8B-Baseにおいて,BF16ヘッドの25.6%のストレージで,相対パープレキシティ1.007を達成し,naiveなINT4量子化よりも優れている。
    • 既存の量子化手法と組み合わせることで,追加の計算コストを最小限に抑えつつ,性能を維持できる。

    Link: https://arxiv.org/abs/2608.02703

  • 予測集合理論:認知アーキテクチャのための生成的枠組みと操作化された中核メカニズム [cs.AI, cs.LO, q-bio.NC]目的:認知アーキテクチャの生成的枠組み
    • 脳の予測処理は認知科学の重要なテーマであり,人間の思考や行動の理解に不可欠である。
    • 既存の予測処理理論では,「予測」の構造やエラーへの対応,一貫性の維持メカニズムが明確に定義されていない。
    • 予測集合理論は,認知アーキテクチャを基礎原理から再構築し,これらの問題を解決することを目的とする。
    • 予測集合理論は,アイデンティティ関数,集合論的状態更新,参照チェーンという最小限の操作に基づいて認知機能を厳密に導出した。
    • この枠組みは,ラッセルのパラドックス,ゲーデルの不完全性,負のフィードバック,映画編集の理解といった古典的な問題に対する新たな解決策を提供する。
    • 本研究の目的は,予測集合理論の独創性と完全性を学術記録に確立することである。

    Link: https://arxiv.org/abs/2608.02704

  • 訓練ログはモデル比較をより正確にするか? [cs.LG, cs.AI, stat.ML]目的:確率的訓練モデル間の性能差と不確実性の推定精度向上
    • 機械学習モデルの性能評価は,より信頼性の高い比較と選択に不可欠である。
    • 確率的訓練によるモデル比較では,性能差の不確実性の推定が課題となる。
    • 訓練ログを用いて,モデル比較の不確実性を低減し,より正確な評価を可能にする。
    • 訓練ログの共変量調整により,モデル比較における不確実性が低減されることが示された。
    • 特に,初期の訓練ログに基づく単純な調整が有効であることが分かった。
    • ただし,最適な共変量選択が重要であり,無闇な探索はノイズを増加させる可能性がある。

    Link: https://arxiv.org/abs/2608.02705

  • 良好な仮想ノードの設計:メッセージパッシングアーキテクチャのためのアドレス可能かつカーディナリティ保存型グローバルメモリ [cs.LG, cs.AI]目的:メッセージパッシングアーキテクチャにおけるグローバルメモリの設計
    • ニューラルネットワークにおける並列処理の効率化が重要であり,グローバルメモリはその鍵となる要素である。
    • 既存の仮想ノード構造では,グラフ構造の情報が圧縮され,ノード間の多様性が失われるという課題がある。
    • アドレス可能かつカーディナリティ保存型グローバルメモリを構築し,情報損失を防ぎ,性能向上を目指す。
    • アドレス可能なクロスアテンションスロットを用いることで,独立な読み書きが可能なグローバルメモリを実現した。
    • スロットクエリをプライベートキー/バリューアンカーとして挿入することで,カーディナリティを保存し,1-WLリファインメントを実装した。
    • マルチプリシティを意識したTwo-Radius分析やモチーフカウント実験により,提案手法の有効性を検証した。

    Link: https://arxiv.org/abs/2608.02709

  • 再生成ではなくデバッグ:ニアミスハードウェアオペレーターの修正のためのドメイン固有エージェント [cs.SE, cs.AI]目的:ニアミスハードウェアオペレーターの修正
    • GPUやNPUなどのハードウェアアクセラレータのカーネル生成はLLMの性能評価に重要である。
    • 従来のLLMパイプラインは多くの候補カーネルを破棄するため,失敗から得られる知識を活用できていない。
    • 本研究では,再生成ではなくデバッグによって,カーネル修正の効率と成功率を向上させることを目指す。
    • デバッグエージェントは,リトリーブされたパターンと診断機能により知識不足を緩和し,整合性を確保する。
    • デバッグのPass@1は66.7%であり,再生成によるPass@1の25.9%やPass@3の40.7%を上回る。
    • デバッグは,再生成に比べて92.8%少ないトークンで成功する。

    Link: https://arxiv.org/abs/2608.02712

  • 世界モデルの行く先はどこか? [cs.CV, cs.AI, cs.RO]目的:エージェントの継続的な改善
    • エージェントの性能向上には,環境とのインタラクションが不可欠である。しかし,実環境での試行錯誤はコストがかかる。
    • 既存の世界モデルは,物理状態の予測に焦点を当てており,エージェントが求める多様なフィードバックに対応できない。
    • エージェント中心のインタラクティブな世界モデルを確立し,エージェントの学習を促進すること。
    • 世界モデルを,物理状態遷移からエージェントが利用可能な情報遷移へと再定義した。
    • 世界モデルを,ダイナミクス,空間,実行,記憶,スキル,報酬の6つの機能形式に分類した。
    • エージェントと世界モデルの共進化を促す3つのレベル(推論時ガイダンス,学習時最適化,共進化)を提示した。

    Link: https://arxiv.org/abs/2608.02713

  • 検索,調査,取得:深層研究エージェントのためのブール検索の活用 [cs.IR, cs.HC, cs.IR, cs.AI, cs.CL]目的:深層研究エージェントにおける検索効率と精度向上
    • ウェブ情報量は膨大であり,効率的な情報収集が不可欠である。
    • 従来の検索手法では,ウェブページの構造を無視し,不要な情報まで取得してしまう。
    • ウェブページの構造を活用し,必要な情報のみを効率的に取得すること。
    • SIEVEは,フィールド化されたブール検索を用いて,検索,調査,取得のプロセスを改善する。
    • 従来の検索手法と比較して,3つのQAコレクションにおいて高い精度を達成し,トークン使用量は20.7-50.6%削減された。
    • ブール検索によるフィルタリングは,様々なランキングモデルとエージェントの基盤で有効であることが示された。

    Link: https://arxiv.org/abs/2608.02751

  • プライバシー保護AI検証のための最小情報開示 [cs.MA, cs.DB, cs.CR, cs.AI]目的:AI検証における情報漏洩の最小化
    • AI技術の信頼性確保は重要であり,検証プロセスはその鍵となる。
    • AI検証はモデルやデータに関する機密情報を漏洩するリスクを伴う。
    • 検証の信頼性を保ちつつ,情報漏洩を最小限に抑える手法の確立。
    • 本研究では,検証者への情報開示量を定量化する「最小情報開示 (MID)」を提案した。
    • MIDを用いて,4種類の物理測定と6つの検証タスクにおいて,検証とプライバシーのトレードオフを評価した。
    • その結果,MIDは検証の精度を維持しつつ,情報漏洩をゼロに抑えることができた。

    Link: https://arxiv.org/abs/2608.02774

  • 社会化された人工知能による科学的発見の新パラダイムへ [cs.AI]目的:科学的発見のための新たなパラダイム
    • 科学の発展は,知識の組織化の変化によって推進されてきた。より効率的な知識管理が重要。
    • 膨大な知識,推論,証拠を統合し,一貫性のある発見プロセスを構築することが課題。
    • 知識,推論,検証,人間による判断を統合し,科学的発見をより体系的に行うことを目指す。
    • 本研究では,知識,エージェント,ゼロギャップ実験を繋ぐBLAZEというパラダイムを提案する。
    • BLAZEは,AIを単なる補助ツールではなく,科学的発見のための組織的インフラストラクチャと捉える。
    • BLAZEは,科学的発見の追跡可能性,再現性,累積性を高め,人間の創造性も維持する。

    Link: https://arxiv.org/abs/2608.02775

  • 局所収束入力を持つニューラルネットワークによる効率的なオプション価格モデル [cs.LG, q-fin.CP]目的:多資産オプションの価格付けにおける既存の数値解法の効率改善
    • 金融工学において,オプション価格の迅速かつ正確な算出はリスク管理や取引戦略において不可欠である。
    • 高次元の問題では,従来の数値解法の計算コストが非常に高くなり,リアルタイムでの対応が困難になる場合がある。
    • 本研究は,ニューラルネットワークを用いた局所的な補正により,計算コストを削減し,高次元オプション価格問題の解決を目指す。
    • 局所収束入力を持つニューラルネットワーク(NNLCI)を用いることで,粗メッシュと微細メッシュの解を局所的に補正し,少ない学習データで高精度なオプション価格を算出できる。
    • ブラック・ショールズモデルおよびヘストン確率ボラティリティモデルにおける数値実験により,NNLCIはRMSEを約4-12倍削減することを示した。
    • 本手法は,リアルタイムオプション取引やリスク管理において,計算資源の効率的な利用と高い汎化能力を提供する。

    Link: https://arxiv.org/abs/2608.02778

  • 評価盲目性:学習からデプロイメントまでAIシステムを蝕む沈黙した測定失敗 [cs.RO, cs.HC, cs.HC, cs.LG]目的:AIシステムの測定失敗による問題点の特定と分類
    • AIシステムの信頼性と安全性の確保は,社会実装において不可欠である。
    • AIシステムの評価において,目に見えない失敗が検知されず,深刻な問題を引き起こす可能性がある。
    • AIシステムのライフサイクル全体における測定インフラの重要性を明確にし,失敗を検知する枠組みを提案する。
    • AIシステムは,学習,評価,運用において沈黙した失敗をすることがあることが示された。
    • 失敗クラスと測定機能の関係性を「評価盲目性」として定義し,その検出可能性の述語を提示した。
    • 実際の事例研究と失敗事例の分類を通じて,AIシステムの運用における沈黙した失敗が無視できない頻度で発生することが明らかになった。

    Link: https://arxiv.org/abs/2608.02786

  • 注意に基づく生存モデルのセマンティックな説明可能性:計算病理学におけるSAGE [cs.CV, cs.AI]目的:注意に基づく多インスタンス学習モデルの説明可能性向上
    • 病理画像解析は,がんの診断や予後予測において重要な役割を担う。
    • 既存手法では,注意マップが局所的な情報しか提供せず,予測根拠の理解が困難。
    • モデルの注意機構とヒストロジー概念を結びつけ,集団レベルでの予測根拠を解明する。
    • SAGEは,既存の生存モデルから集団レベルで解釈可能な説明を抽出可能。
    • 壊死などの既知の予後因子に加え,腎細胞癌における血管新生シグネチャーなど,癌種特異的な生物学的知見を発見。
    • SAGEが抽出する概念は,モデルの学習された注意に依存し,予後予測情報を十分に捉えていることが示された。

    Link: https://arxiv.org/abs/2608.02803

  • DeepLesion検出,セグメンテーション,および短報告生成のための統一2次元フレームワーク [cs.CV, cs.AI]目的:DeepLesionデータセットを用いた病変検出,セグメンテーション,および放射線レポート生成の統合
    • 医学画像診断における病変の早期発見と正確な診断は,患者の予後を改善するために不可欠である。
    • 既存の病変解析手法は,検出,セグメンテーション,報告生成が個別に実施されることが多く,効率的ではない。
    • DeepLesionデータセットを用いた,病変解析の一連の処理を統合し,より高精度な自動診断を可能にすること。
    • 本研究で開発したフレームワークは,病変のバウンディングボックス検出においてmAP50で70.1%,mAP50-95で46.4%の精度を達成した。
    • 病変セグメンテーションではDiceスコア62.6%を達成し,既存のnnUNetモデルと比較して28.5%の改善が見られた。
    • 短報告生成では,BLEU_1で64.3%,BLEU_4で49.6%,METEORで34.7%,ROUGE_Lで60.1%のスコアを獲得した。

    Link: https://arxiv.org/abs/2608.02805

  • 社会文化的タスクのためのベクトル象徴モデルの学習 [cs.CL, cs.AI]目的:社会文化的構造が意思決定に与える影響の表現
    • 人間の意思決定は文化や社会構造に深く影響されるため,そのモデル化が重要である。
    • 従来のモデルでは,文化的な要素が意思決定にどう影響するか明確に表現できていない。
    • 複数の意味レベルを考慮し,自己表象と文化的な関連性を統合するモデルを構築する。
    • ベクトル象徴オートエンコーダを用いた宣言的記憶システムをACT-Rアーキテクチャに組み込んだ。
    • エピソード記憶と意味記憶を異なるベクトルで表現することで,記憶の活性化を調整した。
    • 人種的文脈を考慮したIATモデルで検証した結果,提案手法が有効であることが示唆された。

    Link: https://arxiv.org/abs/2608.02807

  • 予測符号化ネットワークにおけるトポロジーの簡素化 [cs.RO, cs.RO, cs.SY, eess.SY, eess.SY, cs.SY, cs.LG]目的:予測符号化ネットワークにおける学習された表現のトポロジー
    • 脳の仕組みに着想を得た予測符号化ネットワークは,神経科学と機械学習の融合において重要である。
    • ネットワークの層構造が表現能力と計算効率にどのように影響するかは未解明な点が多い。
    • ネットワークのトポロジー構造が,圧縮と再構成のトレードオフにどのように関わるかを明らかにすること。
    • 予測符号化ネットワークは,多層パーセプトロンと比較して,接続成分の崩壊が遅く,より深い層で簡素化されることが示された。
    • ネットワークの規模が大きいほど,早期に接続成分が崩壊する傾向があり,その相関は有意であった。
    • 簡素化が起こる深さと再構成誤差の間には負の相関があり,遅い簡素化がより良い再構成性能と関連していた。

    Link: https://arxiv.org/abs/2608.02816

  • モデル汚染による思考連鎖モニタリングの回避 [cs.CR, cs.AI, cs.LG]目的:思考連鎖モニタリングの限界と,モデル汚染による攻撃手法の検討
    • AIの安全性確保において,思考連鎖モニタリングは重要な役割を担う。
    • 思考連鎖がモデルの行動を正確に反映するという前提に依存している。
    • 思考連鎖モニタリングを欺瞞するバックドア攻撃の有効性とメカニズムを明らかにする。
    • モデルにバックドアを埋め込むことで,攻撃者が指定した行動を,一見無害な思考連鎖と共に引き起こせることを示した。
    • 単純なファインチューニングやカリキュラム学習を通じて,様々なモデルアーキテクチャでバックドアを誘導可能であることを確認した。
    • 思考連鎖モニタリングは,思考連鎖と最終応答の一貫性評価と捉えるべきであることが示唆された。

    Link: https://arxiv.org/abs/2608.02820

  • 配線が混合よりも優れる:Transformerのサイズ間で何が転移し,何が転移しないか [cs.MA, cs.LG]目的:Transformerモデルのサイズ変換における表現の転移の特性評価
    • 大規模言語モデルの効率的な利用が重要であり,計算資源の制約下での応用が期待されている。
    • 事前学習済み大規模モデルから小規模モデルへの知識転移は困難であり,性能劣化が課題である。
    • 事前学習済みモデルを小規模モデルに変換する際の最適な手法と,その限界を明らかにすること。
    • 事前学習済み大規模モデルから小規模モデルへの変換において,表現は比較的良好に整列する一方,パラメータの整列は弱い。
    • 密な重み投影は機能的に破壊的であり,初期値の重要性が示唆される。少量の追加学習で性能向上が見られた。
    • 補償と分散保存のリ rescalingという2つの手法を組み合わせることで,初期化からの転移が常に from-scratch 学習よりも優れている。

    Link: https://arxiv.org/abs/2608.02829

  • 視覚言語モデルにおける文脈崩壊とその緩和策 [cs.CV, cs.AI]目的:視覚言語モデルにおける文脈崩壊現象の解明と,その緩和策の開発
    • 視覚言語モデルは,画像とテキストを理解し処理する能力が求められ,様々な応用分野で重要性が増している。
    • 文脈学習において,学習データが増加するにつれて性能が低下する「文脈崩壊」と呼ばれる問題が存在する。
    • 本研究は,文脈崩壊の原因を特定し,モデルの統合経路への介入によって性能回復を目指す。
    • 多くの視覚言語モデルにおいて,文脈学習におけるデモンストレーション数増加に伴い,精度が急激に低下する「文脈崩壊」が確認された。
    • 文脈崩壊は,視覚と言語の統合経路に原因があり,コネクタや早期/中期レイヤーにアダプターを導入することで改善されることが示された。
    • 新たに提案する\textsc{CircA}は,一度の学習で文脈崩壊に対する耐性を獲得し,未知のタスクファミリーへ転移可能であることが確認された。

    Link: https://arxiv.org/abs/2608.02830

  • CURV:カリキュラムに基づく視覚的根拠付き推論によるグラフ理解の向上 [cs.CV, cs.AI, cs.CL]目的:グラフ質問応答における視覚的根拠付き推論能力の向上
    • グラフ理解はデータ分析において不可欠であり,迅速かつ正確な意思決定を支援する。
    • 既存モデルは,正確な視覚的根拠の特定と一貫性のある推論チェーンの構築に課題を抱えている。
    • 視覚的根拠と推論を連動させることで,グラフ理解の精度を向上させることを目指す。
    • CURVは,グラフ質問応答を多段階の視覚的根拠付き推論として再構成するカリキュラム学習フレームワークである。
    • 実験の結果,CURVはベースラインと比較して最大20.50%の性能向上を達成し,汎化性能も高いことが示された。
    • この手法は,実世界のベンチマークやドメイン外のマルチモーダル推論タスクにおいても有効であることが確認された。

    Link: https://arxiv.org/abs/2608.02833

  • MutMem:永続的エージェントメモリにおける暗号学的認可付きミューテーション [cs.CR, cs.AI]目的:永続的エージェントメモリにおける,暗号学的に認可されたミューテーションのプロトコル
    • エージェントメモリは知識の進化に不可欠だが,改竄のリスクも伴う。
    • ミューテーション可能な検索重みは,正当な適応と不正な改竄の区別を困難にする。
    • MutMemは,改竄を検出し,信頼性を確保しながらメモリの適応を可能にする。
    • MutMemは,HOM-AIMOSエンジン内で,署名された肯定・否定的な結果証拠を記録し,重みの変更を認可された遷移としてコミットする。
    • LongMemEvalにおいて,LLMによる判断で500問中459問に正答(91.8%),LoCoMoでは74.12%の精度を達成した。
    • PoisonedRAG実験では,注入された毒が上位5件の開示に現れることはなく,標的回答攻撃の成功率も低い結果だった。

    Link: https://arxiv.org/abs/2608.02843

  • NOMADD:データドリフトに適応するモデルの数値的最適化 [cs.LG]目的:データドリフトおよびコンセプトドリフトに対するモデルのロバスト性の向上
    • 機械学習モデルは,現実世界で利用されるにつれて時間の経過とともに性能が低下する。
    • ラベル付きデータがすぐに利用できない場合や,モデルの再学習が非現実的な場合,ドリフトへの対処が困難。
    • 様々なモデルに適用可能な,ドリフト軽減のための効率的な後処理手法を開発する。
    • 本手法は,ベースモデルを各期間のラベル付きデータで個別に学習し,パラメータの変化をアンカーモデルと比較して捉える。
    • 低ランク因子分解を用いて変化を圧縮し,減衰正則化予測によって各潜在因子を予測することで,ドリフトへの適応を実現。
    • Drift-Resilient TabPFNベンチマークにおいて,全てのベースモデルにおいて性能が向上し,学習時間は秒単位で済む。

    Link: https://arxiv.org/abs/2608.02845

  • BODHI:LLMは多様な推論を発見し,分岐するか? [cs.CL, cs.AI]目的:LLMにおけるテスト時探索の性質
    • LLMの推論能力向上は,AI研究の核心であり,その限界を探求することが重要である。
    • 強化学習によるLLMの性能向上は認められるが,真に推論能力が拡張されているか不明である。
    • LLMの推論過程における分岐構造を分析し,探索の多様性が損なわれていないか検証する。
    • 強化学習によってLLMの環境制約への適合性と後退能力は向上する。
    • しかし,その結果としてLLMは,継続の可能性を狭め,ロールアウトの多様性を減少させる。
    • この多様性の減少は,強化学習によるサンプル効率の向上に寄与している可能性がある。

    Link: https://arxiv.org/abs/2608.02867

  • 災害後迅速被害評価のための適応的サンプリング:レベルセットコストを考慮したベイズ最適化 [cs.LG]目的:災害後迅速被害評価のための適応的サンプリング手法
    • 自然災害は社会基盤に甚大な被害をもたらすため,迅速かつ信頼性の高い被害評価が不可欠である。
    • 従来の被害評価は人手によるデータ収集に依存し,コスト高かつ状況変化への対応が困難である。
    • 災害時の不確実性を低減しつつ,運用コストを最小化する被害評価手法の確立を目指す。
    • 提案手法は,UAV等の自律型データ収集機を情報量の多い領域へ継続的に誘導し,効率的な被害状況の把握を可能にする。
    • シミュレーション実験により,被害境界の追跡,被害マップの復元,予測不確実性の迅速な低減能力が実証された。
    • R2Dソフトウェアで生成された高精度な災害データを用いた評価でも,迅速かつ正確な被害推定が確認された。

    Link: https://arxiv.org/abs/2608.02868

  • コントラスト不変深層プティコグラフィーニューラルネットワーク [cs.LG]目的:分布外汎化におけるスケーリング不整合の解決
    • プティコグラフィーは高解像度イメージング技術であり,様々な科学分野で重要性が増している。
    • ニューラルネットワークは汎化性能に課題があり,実験環境の変化に弱いという問題がある。
    • 照明条件が変化しても,整合性のある再構成を可能にするニューラルネットワークの開発。
    • 本研究では,実部と虚部で物体を予測することで,スケーリング不整合を解消するファクター化戦略を導入した。
    • また,合成データと実験データの位相分布のずれを最小限に抑える物体サンプリング戦略も導入した。
    • これらの改善により,5つの実験データセットで従来のベースラインと比較してフーリエ誤差を最大5倍削減することに成功した。

    Link: https://arxiv.org/abs/2608.02869

  • 磁気浮上:スライディング再帰的メモリ [cs.LG]目的:固定サイズのメモリを用いた再帰的Transformerアーキテクチャ
    • Transformerモデルの長文処理能力向上は,自然言語処理の発展に不可欠である。
    • Transformerの自己注意機構は計算コストが高く,長い系列データへの適用が課題となる。
    • 効率的なメモリ機構により,Transformerの長文処理能力と計算効率を改善する。
    • 提案手法は,スライディングウィンドウ注意機構を一般化しつつ,訓練時の並列化を維持する。
    • メモリの一貫性損失を用いることで,推論時にはデコーダのみを使用可能となる。
    • 実験により,スライディングウィンドウや潜在的再帰的Transformerよりも高い性能が確認された。

    Link: https://arxiv.org/abs/2608.02870

  • 予算を考慮したエージェント型テキストSQL変換のための観測計画:BAP-SQL [cs.AI]目的:エージェント型テキストSQL変換における,予算を考慮した観測計画
    • 大規模言語モデルを用いた質問応答において,効率的な情報収集が重要である。
    • 従来のテキストSQL変換では,不要な情報取得により計算コストが増大する可能性がある。
    • 観測形成を予算管理段階と捉え,SQLクエリを最適化することで効率的な情報収集を目指す。
    • BAP-SQLは,一般的な4BモデルおよびFINER-SQL 4B,7Bモデルにおいて,予算が限られた状況下での成功率を向上させた。
    • BIRD由来の主要な設定では,SFTと比較して3.4/3.6パーセントポイントの改善が見られ,トークン使用量は4.5/5.0%削減された。
    • 再学習とタスクレベルでの転移実験により,この改善は計画能力と予算に敏感な救済メカニズムに起因することが示唆された。

    Link: https://arxiv.org/abs/2608.02876

  • GoT-CD:思考のグラフによる因果探索と,事後的な経路特異的公平性監査の脆弱性 [cs.LG]目的:因果探索による有向グラフの構造復元と,予測モデルの公平性監査
    • 臨床現場などでメカニズムの解明や予測モデルの公平性監査に不可欠であり,その重要性は増している。
    • 因果探索の結果が公平性監査の精度に大きく影響するが,探索自体の誤りが監査結果を歪める可能性がある。
    • 因果探索における経路の信頼性を評価し,公平性監査における脆弱性を明らかにすることを目指す。
    • GoT-CDは,大規模言語モデルと同等の構造的精度を持つ無向グラフを生成できる。
    • アルツハイマー病のデータセットにおいて,探索されたグラフの多くが,感受性属性から結果への経路を検出できなかった。
    • 経路特異的公平性監査と構造探索を組み合わせることで,より堅牢な公平性評価が可能となる。

    Link: https://arxiv.org/abs/2608.02877

  • VeriTrace:人間らしい時間的探索がエージェントのアクション空間を完結させる [cs.AI]目的:Verilog RTL生成における自動化の精度向上
    • デジタル回路設計の自動化は,設計期間の短縮やコスト削減に貢献する重要な課題である。
    • 既存の多エージェントシステムは,検証可能な信号や時間窓に制限があり,根本原因分析が困難である。
    • VeriTraceは,完全なデバッグアクション空間を活用し,人間のような探索的検証を実現する。
    • VeriTraceは,VerilogEval-V2ベンチマークにおいて100%のPass@1を達成し,完全な機能的正確性を実現した。
    • Claude Sonnet 4.0を共有基盤として使用した場合,最強のベースラインを+5.1%上回り,デバッグにおけるエージェントの能力が精度向上に寄与することが示された。
    • VeriTraceの「エージェント的時系列探索」により,仮説形成,検証,理解の深化を反復的に行うことが可能となった。

    Link: https://arxiv.org/abs/2608.02878

  • 文レベルエネルギーランドスケープによるブラックボックス大規模言語モデルの解釈 [cs.AI]目的:大規模言語モデルの解釈手法
    • 大規模言語モデルの利用拡大に伴い,その振る舞いの理解が不可欠となっている。
    • API経由でしかアクセスできないモデルの内部構造が不透明であり,解釈が困難である。
    • プロンプトと応答の一貫性を捉え,入力文の影響度を定量化する手法を開発する。
    • 提案手法は,プロンプトと応答間の概念的な一貫性をエネルギーベースモデルで捉える。
    • 訓練されたインタープリターは,LLMへの追加APIクエリなしに,影響度の高い文を特定する。
    • エネルギーベースモデルがLLMの挙動を正確にシミュレーションし,解釈の信頼性を高める。

    Link: https://arxiv.org/abs/2608.02879

  • 領域認識型エージェントスキル検索 [cs.IR, cs.LG]目的:生涯学習エージェントのスキルバンクにおける適切なスキル検索
    • 生涯学習エージェントの性能向上には,蓄積されたスキルを的確に活用することが不可欠である。
    • 従来のスキル検索手法では,スキルを構造化された情報として扱っておらず,検索精度が課題であった。
    • スキルの構造を維持することで,より効果的なスキル検索を実現し,大規模スキルバンクでの検索性能を向上させる。
    • スキルを個別の要素として表現し,各要素間の類似度を計算することで,領域認識型表現を実現した。
    • SkillRetベンチマークで77.95%のRecall@10,SRA-Benchベンチマークで83.78%のRecall@10を達成し,従来の連結型ベースラインを上回った。
    • スキルバンクの規模が大きくなるほど,領域認識型スキルの利点が大きくなることが示された。

    Link: https://arxiv.org/abs/2608.02880

  • 一般化された厚生最適化による集団ロバストな特徴選択 [cs.DC, cs.RO, cs.SY, eess.SY, cs.LG]目的:集団差にロバストな共有特徴集合の学習
    • 多様な集団を対象とする予測モデルにおいて,適切な特徴を選択することは重要である。
    • 既存の特徴選択手法は単一の集団に最適化されることが多く,ロバストな手法は共通モデル学習に偏りがちである。
    • 本研究は,各集団が独自モデルを学習しつつ,集団差に強い特徴集合を効率的に選択することを目指す。
    • PopFSは,予測性能と,最も利益を得られない集団の保護とのバランスを調整可能な厚生目的関数を用いる。
    • マルチタスクスパース学習により候補プールを削減し,有望な特徴の追加と交換をランキングすることでスケーラビリティを実現する。
    • COVID-19の予測研究において,厚生目的関数の調整が,平均性能を損なうことなく,最もサービスが少ない州の改善に貢献することを示した。

    Link: https://arxiv.org/abs/2608.02887

  • 非決定論的因果モデルによるロバストな反事実的方策最適化 [cs.LG, cs.AI]目的:ロバストな反事実的方策の同定
    • 意思決定における因果推論の重要性が高まっており,より正確な介入効果の評価が求められている。
    • 既存手法では,確率的な環境下での隠れた交絡因子と本質的な確率性の分離が困難であった。
    • 確率的非決定論的因果モデルを用いて,感度分析に基づいたロバストな方策最適化問題を提示する。
    • 提案手法は,隠れた交絡因子が存在する環境下でも,ロバストな反事実的方策を特定可能である。
    • 敗血症治療シミュレータを用いた検証により,糖尿病ステータスという隠れた交絡因子に対しても有効性が確認された。
    • 確率的な環境下における因果推論の精度向上に貢献する。

    Link: https://arxiv.org/abs/2608.02893

  • アンカーKV:アンカー残差KVキャッシュ圧縮 [cs.RO, cs.LG, cs.CL]目的:長文脈LLM推論におけるKVキャッシュ圧縮
    • LLMの性能向上には,メモリボトルネックであるKVキャッシュの効率的な管理が不可欠である。
    • 既存手法は,削除による性能低下,または低精度化による圧縮率の低さという課題があった。
    • アンカーKVは,トークン削除や低精度化なしに,KVキャッシュを大幅に圧縮することを目的とする。
    • アンカーKVは,KVキャッシュを20倍に圧縮可能であり,単一のトークンも削除しない。
    • 70Bモデルにおいて,フルキャッシュスコアの99%の精度を維持しつつ,コストを大幅に削減できる。
    • モデルやデータセットに依存せず,安定した精度を保つことができる。

    Link: https://arxiv.org/abs/2608.02901

  • ベイズデータ再重み付けが知識に基づいた視覚的質問応答のためのマルチモーダル検索を改善する [cs.RO, cs.LG]目的:知識に基づいた視覚的質問応答におけるマルチモーダル検索の精度向上
    • 視覚的質問応答は,画像と質問の内容を理解し,回答を生成する重要な課題である。
    • 既存のコントラスト学習法では,関連性の低い文書を負例として扱うため,性能が制限される。
    • 負例の誤りによる影響を軽減し,より適切な重み付けを行うことで検索精度を向上させる。
    • 提案手法であるベイズデータ再重み付けは,クエリと文書の重要度を確率的にモデル化する。
    • 共役事前分布と確率的EM最適化により,負例の重みを適応的に推論し,精度向上を実現する。
    • 3つの検索器と7つの知識に基づいたVQAベンチマークで,一貫して性能が向上することが確認された。

    Link: https://arxiv.org/abs/2608.02907

  • 顧客基盤の要因に基づく収益予測:連携が有効な場合と理由 [cs.LG]目的:収益予測の精度向上
    • 収益予測は,顧客獲得予算,需要計画,顧客価値評価に不可欠である。
    • 従来の集計予測では,収益の変化がどの要因によるか不明確である。
    • 顧客基盤を考慮した予測モデルにより,収益予測の精度を高める。
    • 顧客基盤Multi-task Transformer (CBMT)は,既存のベンチマークを30%下回る販売予測誤差を示した。
    • CBMTは,総販売額を直接予測するTransformerよりもわずかに高い精度を示し,74.3%の企業で単一タスク予測を上回った。
    • 顧客基盤の変動が激しい場合,CBMTの優位性は低下するが,連携予測の有用性を示唆する結果が得られた。

    Link: https://arxiv.org/abs/2608.02911

  • 双立方体,超平面,および制約誘起複雑性の崩壊:原子概念学習における [cs.AI, cs.CL, cs.LO]目的:原子概念学習における複雑性の崩壊機構の解明
    • 概念学習は,人工知能の根幹をなす問題であり,効率的な学習アルゴリズムの確立が重要である。
    • 高次原子概念学習において,計算複雑性が高くなることが課題となっていた。
    • 双立方体と超平面の幾何学的構造を用いて,複雑性の局所化と崩壊メカニズムを明らかにすること。
    • 双立方体空間における超平面の挙動に着目し,大部分の超平面が有限個の同値類に縮退することを示した。
    • この縮退は,概念の還元構造に由来するものであり,複雑性の分布が一様ではないことを明らかにした。
    • 3次元の場合でも本質的な現象が確認でき,制約付き仮説空間や構造化分類の観点からの解釈を提示した。

    Link: https://arxiv.org/abs/2608.02930

  • グラフ注意機構をいつ疎にすべきか:エッジごとのツァリス指数を学習する [cs.CL, cs.LG, cs.AI]目的:グラフ注意機構における注意の疎性を制御するためのツァリス指数の学習
    • グラフニューラルネットワークは,ノード間の関係性を捉え,様々なタスクで高い性能を発揮する。
    • 従来のグラフ注意機構は,全ての近傍ノードに対して均一な注意を払うため,グラフ構造に応じた柔軟性に欠ける。
    • エッジごとに注意の疎性を調整することで,グラフ構造に適応し,より効率的な学習を目指す。
    • 提案手法LTGAは,ツァリスエントロピー指数を学習可能にすることで,多様なグラフ構造に対応する注意機構を実現した。
    • 実験結果から,LTGA-Edgeは平均的に最良のランキングを示したが,統計的有意差は認められなかった。
    • 学習されたツァリス指数は,不要な注意係数を削減し,グラフ構造の重要なエッジを保持するメカニズムとして機能することが示された。

    Link: https://arxiv.org/abs/2608.02938

  • トークン化された電子カルテに対する連合生成イベントモデル [cs.LG, cs.CY]目的:電子カルテデータの分散学習による予測モデルの構築
    • 医療データは機関ごとに分散しており,効果的な活用が課題である。連合学習はプライバシー保護とデータ共有の両立に貢献しうる。
    • 既存の電子カルテ基盤モデルは,機関間のデータサイロ化と,クロスサイトでの性能劣化が課題となっている。
    • 複数の医療機関のデータを活用しつつ,各機関のプライバシーを保護した予測モデルの性能向上を目指す。
    • 生成イベントモデル(GEM)は,集約型学習と比較して遜色ない性能を示し,特にクロスサイトでの性能劣化が小さかった。
    • 連合学習(FedAvg, FedAvgM)は,5〜10回の通信ラウンドで,集約型学習の性能に匹敵する結果が得られた。
    • 局所データが限られている場合に,複数サイトモデルの有用性が示された。データ量が増加すると,その利点は縮小する傾向にある。

    Link: https://arxiv.org/abs/2608.02939

  • 圧縮スコアが決定できないとき:グループに頑健なLLMプルーニングのための情報境界 [cs.AI]目的:グループに頑健なLLMプルーニングのための情報境界のモデル化
    • 大規模言語モデルの効率化は,計算資源の制約を克服し,実用的な応用を可能にする上で重要である。
    • 既存のプルーニング手法では,グループ間の性能格差が無視され,一部のグループで性能が著しく低下する可能性がある。
    • この研究は,プルーニングにおける情報境界を考慮し,グループ間の性能低下を抑制する手法を提案する。
    • プルーニングスコアの信頼性と実際の性能向上には乖離があり,スコアが必ずしも最適な候補を選択しないことが示された。
    • グループ間の性能差を考慮したプルーニング戦略が,最悪グループのperplexityの増加を12.6〜20.9%削減できることが示された。
    • モデル固有の完全マスク終点選択や,検証済みの均一な保証を用いることで,プルーニングの性能をさらに向上させることが可能である。

    Link: https://arxiv.org/abs/2608.02940

  • ウェアラブルセンサを用いた座位行動の分類:CNN-BiLSTMモデル [cs.CL, cs.CL, cs.LG]目的:座位行動の分類手法
    • 健康リスクと座位行動の関係解明が重要であり,正確な座位行動検出が不可欠である。
    • 手首等のウェアラブルセンサでの姿勢に基づく分類は,センサ配置の影響で課題が多い。
    • 腰部で学習したモデルを,手首に適用し,より正確な座位行動検出を目指す。
    • 腰部で学習済みのモデルは,腰部データに対して高い精度を示す。
    • 手首データへの転移学習では,センサ配置の差異により精度が低下する。
    • ファインチューニングにより,ゼロから学習したTransformerモデルを上回る性能が得られた。

    Link: https://arxiv.org/abs/2608.02946

  • ATFlash: RoPE波長ごとのアテンションウィンドウによる計算・メモリ効率的なLLM推論 [cs.LG, cs.CL]目的:計算・メモリ効率的なLLM推論の実現
    • 大規模言語モデルの普及に伴い,計算資源の効率的な利用が重要となっている。
    • アテンション機構は計算コストが高く,長文脈処理のボトルネックとなる。
    • RoPEの特性を利用し,アテンション計算量を削減することで,効率的な推論を実現する。
    • 提案手法ATFlashは,RoPEの波長に基づいた距離ウィンドウを用いて,アテンション計算の対象範囲を制限する。
    • Qwen2.5-0.5BとLlama-3.2-3Bにおいて,37~48%のクエリ-キー内積項を削減し,LongBench-v2などの長文脈ベンチマークで性能を維持した。
    • RTX PRO 6000環境下での実験で,Llamaを用いて最大1.29倍,Qwen2.5-7B-1Mで1.31倍の高速化を達成した。

    Link: https://arxiv.org/abs/2608.02947

  • オープンエンド生成のための特権情報としての評価基準 [cs.LG, cs.AI]目的:オープンエンド生成における評価基準の活用
    • 大規模言語モデルの性能向上は,自然な文章生成能力の向上に不可欠である。
    • 評価基準は主観的であり,モデルへの効果的なフィードバックが困難である。
    • 評価基準を教師信号として活用し,より客観的かつ効果的な学習を目指す。
    • 評価基準をソフトな特権情報として活用するRuPIは,従来の報酬としての評価基準を用いた強化学習(RaR)を上回る性能を示した。
    • RuPIは,HealthBenchベンチマークにおいて,RaRと比較して最大0.10の絶対スコア改善を実現した。
    • また,RuPIは,RubricHub Scienceコーパスでの学習とResearchQAでの評価においても,参照PI蒸留とRaR RLを上回る結果が得られた。

    Link: https://arxiv.org/abs/2608.02948

  • 欠損データ層とその潜在的解決策について [cs.AI, cs.DB]目的:ラテンアメリカにおけるAIインフラのデータセット層の構築
    • AI技術の発展には,大規模で質の高いデータセットが不可欠である。
    • ラテンアメリカにはデータセットは存在するものの,散在しており,共有された索引がない。
    • データセットの発見,メタデータ管理,貢献,ライセンス,再利用を容易にするインフラの提供。
    • 本研究では,タスク/ドメイン/言語という構造を持つDataHubを提案する。
    • DataHubは,データセットの発見を促進し,メタデータの管理を効率化する。
    • DataHubを通じて,データセットへの貢献,ライセンス管理,再利用を支援する。

    Link: https://arxiv.org/abs/2608.02949