arXiv雑要約
AI - 2026/08/03 公開
創造的統合:創造性の判定基準 [cs.CL, cs.AI]目的:創造的統合の判定基準
- 複雑化する現代社会において,新たな価値創造のメカニズム解明は重要である。
- 「統合」という概念は曖昧で,真の統合と単なる記述の整理を区別する基準が存在しない。
- 記述長の短縮という基準を用いて,創造的統合を明確に定義し,判定可能にすることを目指す。
- 創造的統合は,固定された記述言語下で,記述長が厳密に短縮される場合に成立する。
- 判定基準は4つの二値論理ゲートによって決定され,偽統合を排除する分類法が用いられる。
- 多様な分野のデータセットを用いて検証された結果,独立した計算確認,難問の識別,サンプル外予測,記述言語の頑健性といった4つの反証可能なテストを通過した。
大規模言語モデルに基づく生成推薦における暗黙的推論 [cs.CL, cs.AI]目的:大規模言語モデルを用いた生成推薦における暗黙的推論の有効性
- 推薦システムは,情報過多な現代において,ユーザーに適切な情報を提供する上で不可欠である。
- 大規模言語モデルを推薦システムに適用する際,学習時に存在しないアイテムIDの取り扱いが課題となる。
- 明示的な推論パイプラインの課題を克服し,より効率的かつ効果的な推薦を実現すること。
- PauseRecは,従来の明示的なCoT手法と比較して,最大6.22%高い性能を示す。
- PauseRecは,学習コストを最大65%削減し,推論速度を最大71.3%向上させる。
- PauseRecは,明示的な根拠生成の代替手段として,より軽量で効果的な大規模言語モデルに基づく生成推薦を可能にする。
SPICE:相乗効果と部分情報に基づくカリキュラム進化 [cs.LG]目的:マルチモーダル相互作用学習におけるカリキュラム進化手法
- 多様なモダリティの情報を活用し,学習性能の向上が期待される分野である。
- 既存手法は,サンプル複雑度の変化に対応できず,学習の最適化が困難である。
- モデルの進化に合わせてサンプル順序を調整し,効率的な学習を実現することを目指す。
- 提案手法SPICEは,部分情報分解(PID)理論に基づき,マルチモーダル情報を分解する。
- これにより,サンプル複雑度を動的に評価し,学習段階に応じたカリキュラムを構築する。
- 複数のベンチマークで,従来の学習法や最先端手法と比較して性能向上が確認された。
強化学習環境ファミリ開発のためのモデル駆動型アプローチ [cs.SE, cs.LG]目的:強化学習環境ファミリの開発手法
- 強化学習は現実世界の複雑な問題を解決する上で重要であり,安全かつ効率的な学習環境が求められている。
- 環境ファミリの従来の開発は,手間とエラーが多く,拡張性に乏しいという課題があった。
- 本研究は,モデル駆動型アプローチを用いて,環境ファミリ開発の自動化と効率化を目指す。
- 提案手法では,ハイブリッド遺伝的アルゴリズムを用いて環境ファミリを生成する。
- モデル変換エンジンを活用し,変異と制約をモデル変換として表現することで実現している。
- 山火事の抑制やカリキュラム学習のシナリオにおいて,本手法の有効性を実証した。
メタニムゲーム:構造的知能のための自己完結型LLMピアコミュニティベンチマーク [cs.CL, cs.AI, cs.LG]目的:大規模言語モデル(LLM)の構造的知能を測定するためのベンチマーク
- LLMの能力評価は,その実用性と信頼性を高める上で不可欠である。
- 既存のベンチマークは,事前知識の漏洩や評価基準の曖昧さといった問題を抱える場合がある。
- LLMの構造的知能を,事前知識に依存せず,客観的に評価可能なベンチマークを構築すること。
- メタニムゲームは,LLMが独自のコンテンツを生成し,互いを評価する競争的なゲームである。
- 評価者の評価行列の特異値分解により,LLMの生成能力と真偽判定能力を同時に測定することが可能になった。
- 生成能力と評価能力は必ずしも相関せず,特に評価能力は希少なスキルであることが示唆された。
SqLinear:バランスの取れた正方形分割が大規模交通予測における線形相互作用を十分にする [cs.LG, cs.AI]目的:大規模交通予測のための効率的かつ効果的なアーキテクチャ
- 交通予測は,インテリジェント交通システムや都市規模の意思決定において不可欠である。
- 既存手法は計算規模が大きいため,数千の交通センサーを持つ現実世界の環境での展開が困難である。
- 手作業によるヒューリスティックに依存した空間分割の課題を克服し,予測精度と計算効率を向上させる。
- SqLinearは,正方形分割を用いてバランスの取れた空間領域を生成し,計算コストを削減する。
- 階層的線形相互作用(HLI)モジュールにより,線形計算量で効率的に空間依存性を伝播させる。
- 大規模交通データセットにおいて,平均絶対誤差(MAE)を2.30%削減し,学習時間を13.27%--30.84%短縮した。
対話エージェントの漸進的なBDI/E軌跡評価のための認知世界モデル [eess.SY, cs.RO, cs.SY, math.OC, cs.AI]目的:対話エージェントにおけるユーザーのBDI/E状態と応答の同時モデリング
- 対話エージェントの高度化に伴い,タスク完了だけでなく,ユーザーへの影響評価が重要になっている。
- 既存の評価手法は表面的な応答や最終結果に焦点を当てており,認知プロセスの理解が不十分である。
- 本研究は,ユーザーの認知軌跡を明示的に追跡し,エージェントの改善に貢献する。
- 提案手法CogWMは,Qwen3-14Bを用いて15万件のデータで学習し,既存のユーザーシミュレーションよりも高い応答忠実性と認知状態理解を実現した。
- CogWMを活用することで,最先端のLLMを用いたエージェントの認知軌跡を比較し,特徴的なパターンを明らかにした。
- 認知の変化と行動の結果の相関関係を明らかにし,エージェントの相互作用戦略の最適化に役立つ知見を提供した。
EvalSafetyGap:LLM評価における安全性欠如のハイブリッド調査と概念的枠組み [cs.CL, cs.AI, cs.CL, cs.LG, cs.SE]目的:大規模言語モデル(LLM)評価とAI安全性の根底にある共通の測定問題
- LLMの能力向上に伴い,安全性評価の重要性が増している。社会実装には安全性の確保が不可欠である。
- 従来の評価指標では,LLMの真の能力や整合性を正確に測れない可能性がある。
- 評価指標と実際の性能・整合性の乖離を,「代理-目標乖離」問題として捉え,解決を目指す。
- 本研究は,373件の先行研究を分析し,評価の妥当性,汚染,安全性テスト等のエビデンスを体系化した。
- EvalSafetyGapという概念的枠組みを提示し,能力,ロバスト性,ガバナンス開示を分離して報告すべきことを示した。
- 動的かつ汚染に強いベンチマーク,脅威モデル,バージョン固定評価等の研究課題を提案した。
DRIFT:リズムゲート探索と成功バッファ学習を用いた自己知識蒸留の難易度ルーティング [cs.LG, cs.AI]目的:大規模言語モデルにおける,外部の専門家による監督なしでの安定的な自己改善
- 複雑な推論タスクにおいて,大規模言語モデルの自己改善は重要である。
- 既存手法では,問題レベルの学習進捗の追跡と最適化戦略の適応が困難である。
- 問題の難易度に応じた最適化と,重要な推論箇所への探索集中を目指す。
- DRIFTは,難易度ルーティングとリズムゲーティングを組み合わせることで,自己改善プロセスを制御する。
- 5つのベンチマークと3つのモデル規模で評価した結果,DRIFTはGRPOとSDPOを上回る性能を示した。
- 特にToolUseにおいて,DRIFTはGRPOとSDPOを大幅に上回り,新たな最高水準を達成した。
エージェントの曖昧性下における因子化された遷移効果からの潜在的行動 [cs.AI]目的:潜在的行動モデルの学習
- 行動理解は,ロボット工学やコンピュータビジョンにおける重要な課題である。
- 複雑なシーンでは,エージェントの動きと背景の変化が混在し,行動の解釈が困難である。
- 遷移効果の因子化により,曖昧さを解消し,行動の認識精度向上を目指す。
- 提案手法は,視覚的な外観や形態に依存しない遷移素因子の転移を実現した。
- 学習された潜在的行動は,既存の潜在的行動モデルよりも高い行動アライメントを示す。
- ダウンストリームの行動監督学習を効果的に活用し,優れたポリシー性能を達成した。
LabGuard:自然言語による実験室ルールを,組み込み型実験エージェントの実行時ガードへ変換する [cs.AI]目的:実験室における安全な作業実行を可能にする実行時制約の生成
- 科学的実験エージェントの発展に伴い,実験環境における安全性の確保が重要になっている。
- 自然言語で記述された実験室のルールを,機械で検証可能な制約に変換する中間段階が課題であった。
- 自然言語ルールを,実行可能な仕様に変換し,実行時ガードとして実装することで安全性を向上させる。
- LabGuardは,自然言語による実験室ルールを,実行可能な形式であるLabGuard-IRへ変換する。
- 実験結果から,LabGuardは未知のルールソースに対しても汎化性能を示し,タスク範囲F1スコア79.4%を達成した。
- LabGuardを適用することで,危険な事象が39.5%から23.8%に減少した。また,介入率を0.5%以下に抑え,タスク成功率を維持した。
ECHO:選択的ターンメモリを用いたエージェント型強化学習における行動と学習のトレース [cs.LG, cs.AI]目的:エージェント型強化学習における追跡可能なコンテキスト再構成
- 長期的なタスク達成には,過去の情報を効率的に活用することが不可欠である。
- コンテキストウィンドウの制限により,過去の重要な情報が失われる可能性がある。
- 行動と結果の関連性を明確にし,報酬の適切な割り当てを目指す。
- ECHOは,環境の各ターンをソースインデックス付きのコンパクトなメモリレコードに圧縮する。
- 有用なレコードを選択的に再構成することで,限られたコンテキスト内で高い性能を実現した。
- BrowseComp-Plusにおいて,ECHOは43.4%の精度を達成し,既存手法を大きく上回った。
経路空間計画:経路途上航空交通管制のためのリアルタイム人間中心計画アルゴリズム [cs.AI, cs.RO, cs.SY, eess.SY]目的:経路途上航空交通管制における,高速かつ衝突回避可能な経路計画手法の開発
- 航空交通量の増加に伴い,安全かつ効率的な航空交通管制システムの重要性が高まっている。
- 既存のアルゴリズムは,実運用での採用が限られており,管制官の理解と操作性の向上が課題である。
- 本研究は,人間中心設計に基づき,管制官が理解しやすい経路計画アルゴリズムを開発し,実用性を検証する。
- 開発した経路空間計画(SSPP)アルゴリズムは,平均3.69ミリ秒で経路を算出可能であり,リアルタイム性を実現した。
- SSPPVとSSPPEの2つのバリアントを比較した結果,SSPPVの方が約3.77倍高速に動作し,実用性が高いことが示された。
- 遅延最小化と安全確保のトレードオフを検討し,SSPPの柔軟性と最適化目標の変更可能性を実証した。
MolSight:分子画像理解のためのグラフ認識型ビジョン言語モデル [cs.CV, cs.AI, q-bio.BM]目的:分子構造と機能の統一的な理解
- 創薬や分子設計において,分子構造の理解は不可欠である。
- 既存のモデルは分子構造の視覚的表現を十分に捉えきれていない。
- 分子画像の理解における構造的アラインメントとトポロジーモデリングの課題解決。
- MolSightは,既存のVLM,分子LLM,タスク固有モデルを大幅に上回る性能を示した。
- 分子トポロジーモジュールが,視覚トークンに化学結合隣接情報を注入することで,理解を向上させている。
- 分子画像と化学記号の意味論をアラインメントする分子グラウンディングモジュールも有効である。
反変理論:困難なタスクに対する最小解の強力なアラインメント [cs.CY, cs.LG, q-bio.NC]目的:困難なタスクに対する最小限のDNN解のアラインメント
- 脳とDNNの比較研究は,AIと脳科学の融合に不可欠である。
- ネットワーク比較の指標選択が,結果に大きく影響する可能性があった。
- タスクの難易度が高い場合,指標選択の影響が小さいことを示す。
- 2つの最小限のDNN解において,アフィン変換に基づく「弱い」アラインメントが「強力な」特権軸のアラインメントを保証することを示した。
- アラインメントはネットワーク階層に沿って「ファスナー」のように上昇し,タスク最適化を通じて特権軸が出現することを示した。
- これらの結果は,反変理論を形式化し,難しいタスクでは収束進化が避けられない可能性を示唆する。
相互依存型電力・通信ネットワークにおけるコンポーネント重要度ランキングのための機械学習サロゲート [cs.RO, cs.LG]目的:電力・通信インフラ間の相互依存性によるカスケード故障に対する,コンポーネント重要度ランキングの迅速化
- 社会インフラの安定運用には,電力と通信の連携が不可欠であり,その脆弱性評価が重要である。
- 大規模な停電リスク評価には計算コストが高く,現実的な時間内での網羅的な検討が困難である。
- 機械学習を活用することで,高精度な評価を迅速に行い,効率的な対策立案に貢献する。
- 機械学習サロゲートモデルが,コンポーネント重要度ランキングにおいて高い相関を示すことが確認された。
- 特に,層間依存性に着目した特徴量が,サロゲートモデルの性能向上に大きく寄与している。
- 本手法は,従来のシミュレーションと比較して約158倍の速度で評価が可能であり,効率的なリスク評価を実現する。
テーブルトップRPGゲームデザインにおけるモンスターレベル予測への機械学習の応用 [cs.LG]目的:テーブルトップRPGのモンスターレベル予測
- ゲームバランスはプレイヤー体験に不可欠であり,対戦相手の設計はその重要な要素である。
- モンスターのレベル設定は手作業であり,時間と労力を要する作業である。
- 機械学習を用いてモンスターの属性からレベルを予測し,ゲームデザイナーの負担を軽減する。
- 決定木ベースのアンサンブルモデルが,線形モデルやニューラルネットワークよりも高い予測精度と順位付け性能を示した。
- 特徴量の重要度分析の結果,モデルの判断はゲームルールに基づいた人間の直感と一致していることが示された。
- 機械学習はデザイナーの判断を近似し,モンスターのバランス調整やゲームシステム設計を支援する有効なツールとなり得る。
BeatEdit:明示的な編集による記号音楽生成 [cs.SD, cs.AI]目的:記号音楽生成における明示的な編集操作のフレームワーク
- 音楽制作は修正の繰り返しであり,音楽生成においても同様のアプローチが求められている。
- 既存の記号音楽生成手法は,最初からシーケンスを生成するものが多く,選択的な修正が困難である。
- BEATエンコーディングの構造的特性を活用し,編集操作に基づく音楽生成を実現する。
- BeatEditは,楽譜を最初から生成するのではなく,下書きを編集することで新しいコンテンツを生成する。
- エラー修正,伴奏編集,セグメント補完といった編集密度に応じた3つのメカニズムを搭載している。
- これらのメカニズムは単一のエンコーディングと事前学習済みバックボーンを共有し,高い精度と知覚品質を実現した。
能力収束仮説:規模ではなくアクセス構造からの能力 [cs.CL, cs.AI, cs.IT, math.IT]目的:能力収束のメカニズム
- 大規模言語モデルの能力向上は目覚ましいが,その本質的な要因が未解明な点が多い。
- 表現の収束が必ずしも能力の収束を意味しないという問題意識が存在する。
- アクセス構造が能力収束に果たす役割を解明し,能力向上のための新たな指針を示す。
- モデルの規模拡大による表現の収束は,能力の収束を保証しないことが示された。
- 圧縮チャンネルと定量的索引チャンネルを併せ持つハイブリッドアーキテクチャが,能力収束の鍵となる。
- 実験により,予測された能力のギャップが確認され,ハイブリッドアーキテクチャの有効性が裏付けられた。
AuEmoChat:対話音声合成における真実性のある感情理解と表現 [cs.SD, cs.AI]目的:対話音声における,人間らしい感情表現と文脈の一貫性の実現
- 対話システムにおいて,より自然なコミュニケーションを可能にするため,感情豊かな音声合成が重要である。
- 既存手法では,感情ラベルの種類の制限や,対話履歴の冗長性により,真実味のある感情表現が困難である。
- 本研究は,大規模な感情音声からより多様で自然な感情表現を学習し,文脈理解を向上させることを目指す。
- 提案手法AuEmoChatは,NCSSD-EmCapデータセットにおいて,最先端の対話音声合成手法を上回る性能を示した。
- AuEmoCodecにより,より真実味のある感情トークン空間を学習し,感情表現の幅を広げた。
- AuEmoToMeは,対話履歴の冗長性を削減しつつ,感情に関する重要な文脈を維持する。
NeurOWL:不完全なOWLオントロジー推論のためのLLMベースのニューラル・シンボリックフレームワーク [cs.AI]目的:不完全なOWLオントロジーにおけるサブクラス関係の妥当性検証と,潜在的な欠損公理の提示
- OWLオントロジーは知識表現の標準であり,医療やバイオインフォマティクス等,様々な分野で活用が広がっている。
- 現実世界のオントロジーは不完全であることが多く,推論の妨げとなる課題が存在する。
- 本研究では,不完全なオントロジーにおけるサブクラス関係推論の精度向上を目指す。
- 提案手法NeurOWLは,大規模言語モデルとオントロジー埋め込みを活用し,検証とアブダクションを同時に実行するニューラル・シンボリックフレームワークである。
- 実世界のオントロジーを用いた評価により,NeurOWLが様々なドメインで堅牢な性能を発揮することが示された。
- サブクラス関係の検証と,欠損公理の推論を統合的に行うことで,既存手法の限界を克服している。
ビジネス分野における最先端AIのパフォーマンス:知識労働と分析的思考に関する事例に基づいたベンチマーク [cs.CL, cs.AI]目的:ビジネス分野における知識労働と分析的思考のAIパフォーマンス評価
- ビジネスにおける意思決定の高度化に伴い,AIによるサポートの重要性が増している。
- 既存のAIベンチマークでは,複雑な情報分析や判断といった高度な知識労働の評価が不十分である。
- ビジネスケースを用いたベンチマークを通じて,AIの分析能力を客観的に評価し,その進歩を測定する。
- 最先端AIモデルは,ビジネスケースの評価において高いスコアを獲得しており,その能力は急速に向上している。
- 本研究の結果は,AIがビジネス分野における分析的知識労働において既に高いパフォーマンスを発揮し,その進歩が著しいことを示唆する。
- ビジネススクールや,初級職の専門職において,AIの活用が今後の教育や業務に大きな影響を与える可能性がある。
EduPanel:教育ビデオに対する3エージェントLLM判定システム -- 信頼性,補完性,および人間による信頼性の調整 [cs.HC, cs.AI]目的:教育ビデオの教育的質に関する評価
- 教育ビデオは主要な学習手段であり,その質的評価の必要性が高まっている。
- 既存の自動評価システムは,多角的証拠や学習者への配慮が不足している。
- EduPanelは,学習者に適応した質の評価により,この課題を解決することを目指す。
- EduPanelは,人間の専門家と同程度の信頼性を実現している。
- EduPanelのフィードバックは,評価の精度を向上させる(MAE 0.87から0.73へ)。
- 専門家は,信頼できない出力を識別し,盲目的に受け入れることを避けることができる(AUC = 0.77)。
CPInj:テキスト協調プロンプト最適化におけるプロンプトインジェクションリスクの解明 [cs.CR, cs.AI]目的:テキスト協調プロンプト最適化(TCPO)におけるプロンプトインジェクションリスク
- 大規模言語モデルの性能向上には,プロンプト最適化が不可欠である。
- TCPOは分散環境下で攻撃を受けやすく,悪意のある指示が拡散する危険性がある。
- TCPOの協調最適化ループに対する新たな攻撃手法とその対策を提示する。
- 本研究では,Collaborative Prompt Injection (CPInj) 攻撃がTCPOのグローバルプロンプトを汚染し,タスク性能を低下させることを示した。
- 既存の防御手法はCPInjに対して効果がないことが判明した。
- Anchored Purification Aggregation (APAgg)という防御手法を提案したが,攻撃は依然として有効であり,更なる対策が必要である。
質的行動保証:VR OSCEにおける試験官の主張の多角的検証 [eess.SY, cs.SY, cs.AI]目的:試験官の主張検証の質的保証
- 臨床能力評価においてOSCEは標準だが,評価の客観性確保が課題である。
- 従来の評価者間信頼性評価では,誤りの原因特定や評価根拠の検証が困難である。
- 試験官の主張と実際の行動との整合性を検証し,より公正な評価を実現する。
- QAAは,VR小児OSCEにおいて,試験官の主張とイベント記録(動画,VRログ,俳優アノテーション)を比較することで検証を行う。
- 行動配置と俳優特定モデル,大規模言語モデルを組み合わせ,Actor F1で99.2%,W@16で93.4%を達成した。
- QAAは試験官の誤りを69.9%の精度,76.7%の再現率で検出し,記録の正確性を39.2%から79.2%に向上させた。
ハダマール多様体上の1-Lipschitzニューラルネットワーク [math.NA, cs.LG, cs.NA]目的:ハダマール多様体上の1-Lipschitzニューラルネットワークの構築と解析
- ニューラルネットワークの安定性や頑健性を高める上で,Lipschitz定数の制御は重要である。
- 既存の制約戦略は主にユークリッド空間向けであり,多様体上での応用が課題となっていた。
- 本研究は,ハダマール多様体上で1-Lipschitz性を保つニューラルネットワークを設計し,その有効性を示す。
- 双曲多様体や対称正定値行列多様体に対し,具体的な構成例を示した。
- ポアンカレ円盤上でのロバストな分類実験により,本ネットワークの頑健性が確認された。
- マスク付きWishart共分散再構成問題において,非膨張性デノイザーが既存手法を上回る性能を示した。
CodeRescue:予算制約下におけるコーディングエージェントのための回復ルーティング [cs.AI]目的:コーディングエージェントにおける,失敗からの回復戦略の最適化
- コーディングエージェントは実行環境でフィードバックを得ながら学習するため,効率的な失敗からの回復が重要である。
- 既存システムは,失敗をカスケードとして扱うため,安価なモデルからの回復の価値が見過ごされがちである。
- 本研究は,予算制約下で,いつ安価な計算資源を再利用し,いつより高価なモデルに移行すべきか,を決定する。
- 本研究で提案する回復ルーティングは,安価なモデルでの回復と高価なモデルへのエスカレーションを組み合わせることで,より高い成功率を達成する。
- Conformal Risk Control (CRC) 層を用いることで,モデルの再学習なしに,予算に応じた最適なコストペナルティを選択できる。
- 実験結果から,CRCで調整された戦略は,既存の固定アクションやプロンプトのみのルーティング,バイナリカスケードベースラインを上回ることが示された。
コピー量を減らし,根拠に基づかせ:根拠を意識した強化学習による長文脈推論における反復的なコピー克服 [cs.CL, cs.AI]目的:長文脈推論における反復的なコピー現象の克服
- 複雑なタスクにおいて,段階的な推論過程を出力する大規模言語モデルの性能が向上している。
- 長文脈環境下では,モデルが入力テキストを無批判にコピーする「反復的なコピー」という問題が生じやすい。
- タスクに関連する重要な根拠に焦点を当てることで,反復的なコピーを抑制し,推論精度を向上させる。
- 提案手法GEARは,正確性に対する報酬に加え,重要な根拠との重複に対する報酬と無関係な文脈との重複に対するペナルティを加えることで,学習を促進する。
- 実験結果から,GEARは標準的な強化学習よりも最大平均4.6ポイントの性能向上を示し,特に長文脈において効果が大きかった。
- 長文脈評価が単純な検索から複雑な推論へと移行するにつれても,関連する根拠への正確なグラウンディングが不可欠であることが示唆された。
入力依存性長畳み込みによるネイティブ多次元準二次演算子 [cs.LG, cs.CV, stat.ML]目的:多次元データに対する準二次演算子の実現
- Transformer等のAttention機構は強力だが,計算コストが高い。効率的な代替手法が求められている。
- 従来の畳み込みは受容野が局所的で,入力依存性も弱く,多次元データの構造を活かせない。
- 多次元データのネイティブな形状上で作用する,入力依存性の高い準二次演算子を開発する。
- HyenaNDは,多次元データのネイティブな形状上で直接作用する,入力依存性の高い準二次演算子である。
- CUDA実装nSubQにより,HyenaNDの計算効率が向上し,実用的な速度を実現した。
- ゲノミクス,画像処理,医療画像,偏微分方程式モデリングなど,幅広い分野でAttentionと同等の精度を達成した。
HijackKV:位置非依存KVキャッシュ再利用における新たな脅威 [cs.CR, cs.AI, cs.LG]目的:大規模言語モデルにおけるKVキャッシュハイジャック脆弱性の実証と対策
- 大規模言語モデルの推論速度向上には,KVキャッシュが不可欠である。
- 従来のKVキャッシュ再利用法では,キャッシュヒット率が低く効率に課題があった。
- 位置非依存KV再利用の脆弱性を悪用し,モデルの挙動を操る攻撃手法を明らかにする。
- 本研究では,KVキャッシュハイジャック攻撃の実現可能性を示すHIJACKKV攻撃フレームワークを開発した。
- HIJACKKVは,平均94%の成功率で攻撃を成功させ,現実的な条件下でも有効であることが確認された。
- また,安全なKV再利用システムを構築するための設計上の知見を提供する。
AttriMem:帰属誘導によるエージェントメモリ構築のためのプロセスフィードバック [cs.CL, cs.AI]目的:エージェントメモリ構築のためのポリシー学習
- LLMエージェントの性能向上には,効果的なメモリが不可欠である。
- 既存手法は,タスク固有のルールや粗い報酬に依存し,メモリ内容と最終的な回答の関係性が不明確である。
- トークンレベルでの貢献度に基づくプロセスフィードバックにより,メモリ構築ポリシーの学習を改善する。
- AttriMemは,最終的な回答へのトークンレベルの貢献度を考慮したローカル報酬を導入することで,RLによるメモリ構築ポリシーの学習を支援する。
- 長期間の対話型質問応答実験において,AttriMemは既存のベースライン手法を上回り,汎化性能とRL最適化の安定性を示す。
- AttriMemは,異なるベンチマークや回答モデルに対しても有効であることが示された。
ElasticTTT:ビデオ編集のための事前分布維持テスト時チューニング [cs.CV, cs.AI]目的:ビデオ編集における事前学習済み拡散モデルのテスト時チューニング手法
- ビデオ編集技術は,映像コンテンツ制作において不可欠であり,その効率化と品質向上は重要な課題である。
- 既存のテスト時チューニングは,生成モデルの特性と最適化方法の不一致により,期待される編集効果が得られない場合がある。
- 事前分布を維持し,生成の柔軟性を回復させることで,高品質なビデオ編集を実現することを目標とする。
- ElasticTTTは,ターゲット分布正則化,コントラストCFG,非同期ノイズスケジュールを導入することで,事前分布の崩壊を防ぐ。
- 理論的分析と広範な評価により,ElasticTTTがベースモデルの生成事前分布を効果的に維持することが示された。
- ワンショットビデオ編集において,最先端の性能を達成し,既存手法を上回る結果を得ている。
オフポリシー比率の解体:非同期強化学習のためのエントロピー スケール トラストリージョン [cs.AI]目的:大規模言語モデルのポストトレーニングにおける,オフポリシーデータの安定化と性能向上
- LLMのポストトレーニングにおいて,効率的な学習が求められている。
- 非同期学習では,データが古くなりやすく,最適化が不安定になる。
- エントロピーに基づいたオフポリシー比率の調整により,学習の安定化を図る。
- 提案手法ESTRは,トークンごとのエントロピーを用いてオフポリシー偏差をスケーリングする。
- BrowseComp-Plusで37.34,multi-turn GSM8Kで95.69の平均スコアを達成し,同期型GRPOと同等の性能を示す。
- ESTRは,同期型手法と比較して2.6倍の高速化を実現する。
DynaResize:大規模言語モデルの後学習における実行時GPU再割り当て [cs.DC, q-bio.NC, cs.AI]目的:大規模言語モデルの後学習における,ロールアウトと学習間のGPUリソースの動的再割り当て
- 大規模言語モデルの活用が広がる中で,効率的な学習・推論手法が求められている。
- 静的なGPU分割では,長尾のロールアウト遅延によりパイプラインのバブルが発生しやすい。
- ロールアウトと学習間のGPU割り当てを動的に調整し,実行時間を短縮することを目指す。
- DynaResizeは,GPUの動的再割り当てにより,ロールアウトと学習のステージ実行時間を均衡化させる。
- 実験結果から,DynaResizeは最適な静的構成と比較して,エンドツーエンドのスループットを66.5%向上させ,総実行時間を33%削減できることが示された。
- 役割切り替えのオーバーヘッドを27%隠蔽することが確認された。
抑制と崩壊の間:LENSによるナラティブ・アンラーニングの評価 [cs.CL, cs.AI]目的:ナラティブ再生成に対する抵抗レベルの評価プロトコル
- 大規模言語モデルの誤情報拡散リスクに対応する必要がある。
- 既存の機械アンラーニングアルゴリズムの効果が不十分である。
- ナラティブ再生成の抑制と出力品質維持の両立を目指す。
- LENSは,ナラティブ再生成を直接,帰属,対照,抽象レベルで評価する。
- 抑制効率(SCE)スコアは,ナラティブ抑制と出力品質低下のバランスを示す。
- アンラーニングによって,関連エンティティの想起が促進される場合がある。
ノイズ付き生徒を用いた自己教師あり方策勾配によるビジョン言語モデルの自己強化 [cs.AR, cs.ET, cs.SY, eess.SY, cs.LG]目的:ビジョン言語モデルの性能向上
- 人間と自然な対話が可能なモデル構築が求められており,その精度向上が重要である。
- 既存手法は外部データやモデルに依存し,自己学習による改善が困難であった。
- 外部知識を用いず,自己蒸留によってモデル性能を向上させることを目指す。
- 提案手法NOPDは,クリーンデータとノイズ付加データ間の予測のずれを利用した自己教師あり学習である。
- Geometry3Kの2.1KサンプルでQwen2.5-VL-7Bを訓練した結果,検証セットで20ポイントの性能向上が確認された。
- 様々なモデルとベンチマークにおいて,NOPDが汎用的な性能向上に貢献することが示された。
AllocBench:LLMエージェントにおけるオンラインツール割り当て能力の測定 [cs.LG]目的:LLMエージェントのオンラインツール割り当て能力
- LLMエージェントの能力向上は,多様なタスクへの適応と効率化に不可欠である。
- 既存のエージェントは,ツール作成の再利用性を考慮せず,無駄なツールを生成しがちである。
- LLMエージェントの限られた予算内で,効率的なツール割り当てを可能にすること。
- 抽象的なテキスト問題では,最先端モデルはほぼ最適なツール割り当てを示したが,コード作成タスクではその能力が転移しなかった。
- GPT-5.6 Solは,スクリプト評価が不要な場合でも選択的であったが,完全な構築段階でその能力が低下した。
- 抽象的な割り当てで訓練されたQwenモデルは,新しい語彙にも対応できるが,スクリプト割り当ての改善は見られなかった。
LLM支援型ISR群におけるミッションレベルの実行保証:検証対応型基盤上で [cs.CR, cs.AI, cs.LO, cs.RO]目的:LLM支援型自律ロボット群のミッションレベルでの実行保証
- 紛争環境下での協調的な知能,監視,偵察活動において,ロボット群の重要性が高まっている。
- 単一プラットフォームでは問題ない行動が,群全体としてミッション違反を引き起こす可能性がある。
- プラットフォーム個々の監視だけでは防げないミッションレベルの違反を検出・特定すること。
- 提案する三層構成の実行時検証フレームワークは,ミッションポリシーをプラットフォームおよびクロスエージェントの側面へと分解する。
- 検証対応型メッセージングファブリック上で,プラットフォームの検証結果を集約し,セキュリティと完全性の二軸で構成される代数を用いて融合する。
- シミュレーション実験では,プラットフォーム個々の監視では検出できない間接的なプロンプトインジェクションを組成的に検出し,違反を引き起こしたプラットフォームを特定した。
DualityCert:量子場理論における破れた双対性の主張の言語モデルによる修復(検証者によるゲート制御) [cs.CR, cs.AI, cs.LG, hep-th]目的:四次元N=1クォークゲージ理論における候補となるザイベルグ双対性の主張の検証
- 量子場理論は,素粒子物理学の基礎であり,宇宙の根源的な法則を理解する上で不可欠である。
- 双対性主張の検証は計算が複雑であり,手作業では限界がある。自動化された検証方法が求められている。
- 言語モデルを活用し,双対性主張の誤りを修正し,検証を効率化することを目指す。
- DualityCertは,'t Hooft異常の整合性,超ポテンシャルのRチャージの一貫性,中心電荷の一致などを検証する。
- 検証の結果,言語モデルによる試行錯誤的な修正において,検証者によるゲート制御が最終的な修復成功率を向上させる。
- モデルによって最適な検証活用戦略が異なり,常に安価な検証証明が有効であることが示された。
疎な車両アドホックネットワークにおける交通衝撃波のGNNベースマルチエージェント制御 [cs.NI, cs.LG, cs.NA, math.NA]目的:交通衝撃波の抑制
- 交通渋滞,燃費悪化,事故増加の主要因である交通衝撃波の軽減が重要である。
- 既存の制御戦略はグローバルな交通状態情報に依存し,VANETの初期段階での展開が困難である。
- 車両局所情報と近隣車両との相互作用を用いた協調制御ポリシーの学習を目指す。
- 提案するGNNベースMARLフレームワークは,交通衝撃波の伝播を最大80%削減できることがシミュレーションで示された。
- 接続車両が10%に満たない状況下でも,高い効果が確認された。
- 本研究は,VANET初期段階での実用的な交通制御アプローチを提供する。
RLVRからRLSVRへ:タスク変換がLLMの自己改善のための自己検証可能な報酬を誘起する [cs.AI]目的:オープンエンドなLLMの自己改善のための自己検証可能な報酬の獲得
- LLMの性能向上には,大規模な最適化が不可欠であり,そのための手法が求められている。
- 従来のRLVRは検証可能なタスクに限られ,オープンエンドなタスクへの適用が困難であった。
- タスク変換により,オープンエンドなタスクでも検証可能な報酬を生成し,自己改善を可能にすることを目指す。
- SpyRLは,社会推論ゲーム「Who Is the Spy?」に着想を得た自己プレイ強化学習手法であり,投票結果によって完全に検証可能な報酬を提供する。
- テキスト要約,創作,数学的推論などの実験で,SpyRLは既存の自己改善手法を上回り,検証可能な推論タスクでも一貫した改善が見られた。
- タスク変換は,RLVRベースの自己改善の適用範囲を,本質的に検証可能な領域を超えて拡張できる可能性を示唆している。
WorldDiT:世界と行動のモデリングのための統一拡散アーキテクチャ [cs.LG, cs.RO]目的:世界と行動のモデリングに関する統一拡散アーキテクチャ
- ロボット制御において,より高度な制御を目指す動きがあり,大規模な事前学習済みビジョン言語モデルが活用されている。
- 大規模な事前学習済みモデルに依存することで,計算コストが増大し,汎化性能が課題となる場合がある。
- 大規模な事前学習済みモデルに頼らず,少ないパラメータで高性能なロボット制御を実現することを目指す。
- WorldDiTは,行動生成と視覚的世界のモデリングを統合した統一拡散トランスフォーマーアーキテクチャである。
- 大規模な事前学習済みモデルを必要とせず,高い性能を発揮し,総モデルパラメータと平均成功率のパレート最適解上に位置する。
- 本研究は,今後のスケーリング研究のための,10億パラメータ以下の強力なベースラインを提供する。
集約リスクを超えて:LLMツール呼び出しのための役割階層型共形リスク制御 [cs.LG, cs.AI, cs.CL]目的:LLMツール呼び出しにおける役割ごとのリスク制御手法
- LLMエージェントの安全性確保は,その利用拡大において不可欠である。
- 従来の共形リスク制御は,ツール呼び出し全体を対象とするため,高リスクな引数の特定が困難であった。
- 役割ごとのリスク評価により,個々の引数に対する厳密なリスク制御を実現すること。
- 役割階層型共形リスク制御は,各役割に個別の閾値とリスク予算を割り当てることで,集約的な認証の粗さを解消する。
- 実験結果から,提案手法はモデルや攻撃の変化,検出器ノイズ,ドリフト,未知のツールスイート,適応攻撃に対して,一貫して役割固有の予算遵守性を示した。
- この結果は,構造化されたツール呼び出しはアクション全体ではなく,セマンティックな役割レベルで認証されるべきであることを示唆している。
LEX-EC:ブラックボックス環境における大規模言語モデルの性格分類のための語彙的証拠チャネル監査フレームワーク [cs.CL, cs.AI]目的:大規模言語モデルの性格分類における語彙的証拠の影響評価
- 性格特性の自動分類は,人間とAIのインタラクションの理解に不可欠である。
- 大規模言語モデルの性格分類の根拠が不明確であり,解釈可能性が課題となっている。
- 語彙的証拠の制限下でモデルがどのように性格特性を識別するかを分析し,解釈可能性を高める。
- LEX-ECフレームワークにより,テキストの種類によって性格特性の現れ方が大きく異なることが示された。
- 語彙的アブレーションにより,性格特性に関連する信号が機能語,感情的な表現,認知スタイル語彙から検出された。
- プロンプトによる言語的な誘導はモデルの説明を変えるものの,内容自体は変化しなかった。
LLMソーシャルシミュレータ監査のための理由に基づく行動モデル [cs.AI]目的:LLMソーシャルシミュレータの監査のための行動モデル
- LLMは社会シミュレーションへの応用が進んでおり,その評価手法の確立が重要である。
- 既存の評価は結果の一致に偏っており,判断根拠の妥当性検証が不足している。
- 人間とLLMの判断根拠を比較し,シミュレータの妥当性を検証するフレームワークを提案する。
- 人間の判断根拠は,購入意図の予測精度を大幅に向上させる。
- LLMによるシミュレーションは,人間のような一貫した判断根拠を再現できていない。
- 提案手法は,ソーシャルシミュレータの評価において,判断根拠の妥当性を確認する有効な手段となる。
コンフォーマルカスケード:多層LLM推論における分布フリーな精度保証 [cs.LG]目的:多層LLM推論における精度保証
- LLMの推論コスト削減は,実用的な応用において不可欠である。
- LLMの信頼度スコアは不正確であり,カスケードの閾値調整が困難である。
- 信頼性の高い精度保証付きの多層LLM推論フレームワークを提供する。
- Conformal Cascade (CC)は,コンフォーマル予測セットサイズをdeferral ruleとして使用する。
- CCは,分布フリーで有限サンプルサイズの精度保証を提供する。
- 18のベンチマークにおいて,CCは既存手法を上回り,特に推論負荷の高いタスクで改善が見られた。
FORGE:長編ビデオ理解のための関連性幾何におけるフレーム直交性 [cs.CV, cs.LG]目的:長編ビデオにおけるクエリに関連する情報の最大化
- ビデオ理解は,多様な応用において不可欠であり,その重要性は増している。
- 長編ビデオでは,関連コンテンツ密度が低下し,モデルの精度が低下しやすい。
- 推論時に選択するフレームサブセットにおいて,関連性と多様性を両立することを目指す。
- FORGEは,既存の強化学習を用いないベースラインと比較して,キーフレーム選択スコアを11.0~15.3ポイント向上させた。
- キーフレーム再現率は最大で2倍に向上(Video-MMEのK=64で0.415対0.204)。
- 質疑応答タスクにおいても,40億~320億パラメータの8つのMLLMで精度が向上し,最大8.7ポイントの改善が見られた。
A2TTA:進化する交通センサーネットワークのためのアンカーとアジャイルなテスト時適応 [cs.LG, cs.AI]目的:進化する交通センサーネットワークにおける交通予測性能の向上
- スマートシティにおける効率的な交通管理と経路計画には,正確な交通予測が不可欠である。
- 従来の交通予測モデルはセンサーグラフが固定されていることを前提としており,現実の交通ネットワークの変化に対応できない。
- センサーネットワークのトポロジー変化と時間的変動に同時に対応し,予測モデルの適応能力を高める。
- 提案手法A2TTAは,トポロジー変化による予測誤差を拡張可能な出力較正問題として捉え,時間的適応をグローバルな修正とコンテキスト固有の特殊化に分離する。
- A2TTAは,トポロジー変化と多段階の時間的変動の両方に対処することで,継続的に進化する交通環境への効率的かつロバストな適応を実現する。
- 10の現実世界の交通ネットワークにおける実験結果から,A2TTAが様々なバックボーン,データセット,予測地平線において予測性能を常に向上させることが示された。
時間中心化されたSIGRegがマルチタスクLeWorldModel学習を改善する:分析から手法へ [cs.IR, cs.CL, cs.LG, cs.RO]目的:マルチタスク環境におけるLeWorldModel学習の安定化と性能向上
- 自己教師あり学習により,ロボットが環境を効率的に学習し,汎化性能を高めることが期待されている。
- 既存のSIGRegは単一タスクでは有効だが,マルチタスク学習では性能が低下し,表現の衝突が問題となる。
- 時間中心化された残差にSIGRegを適用することで,タスク間の表現の分離を維持し,安定した学習を目指す。
- 時間中心化されたSIGRegは,LIBEROベンチマークの長期タスクスイートにおいて成功率を1.7倍に向上させた。
- 4つのスイート全体の平均成功率を53.2%から73.6%に引き上げた。
- 外部の事前学習なしで,Diffusion Policyと同等またはそれ以上の性能を発揮した。
継続的指示チューニングのための漸進的マルチモーダルアライメント [cs.CV, cs.AI]目的:マルチモーダル大規模言語モデルにおけるプロジェクターのドリフト軽減
- マルチモーダル大規模言語モデルの性能は,視覚情報と言語の意味を一致させるプロジェクターに大きく依存する。
- 継続的な指示チューニングにおいて,視覚分布や指示の意味の変化により,プロジェクターが過去の知識を忘却しやすい。
- プロジェクターのドリフトを抑制し,既存の知識を維持しながら適応することで,継続学習の性能向上を目指す。
- 提案手法PMAは,軽量な表現記述子を用いてマルチモーダル分布の変化を検出し,必要に応じてプロジェクターのエキスパートを漸進的に拡張する。
- PMAは,エキスパートの出力をマルチモーダル特徴に基づいて統合し,事前学習済みのプロジェクターを安定した基準点として保持する。
- 実験結果から,PMAを既存の継続的指示チューニング手法に組み合わせることで,一貫して性能向上が確認された。
