arXiv雑要約
AI - 2026/08/05 公開
オンラインRLのファインチューニングにおいて,Q関数の事前学習は本当に必要か? [cs.LG]目的:オンライン強化学習におけるQ関数の事前学習の有用性に関する検討
- 強化学習は,自律的な意思決定を行うための基盤技術であり,ロボティクスやゲームなど幅広い分野で応用が期待されている。
- 従来の強化学習では,学習の安定性や効率が課題であり,事前学習とファインチューニングの組み合わせが主流となっている。
- 本研究では,事前学習されたQ関数が必ずしもファインチューニングに役立つとは限らないという問題提起を行い,その改善策を提案する。
- Q関数の事前学習は,ランダムな初期化と比較して,必ずしも大きな改善をもたらさないことが示された。
- 事前学習されたQ関数が,ファインチューニングによって収束するQ関数とは乖離していることが,その原因の一つであることが判明した。
- 提案手法IPE(Initialization via Policy Ensemble)は,複数の多様なポリシーを用いてQ関数を初期化することで,事前学習よりも高い性能を達成した。
確率演算子に関する論理的推論におけるLLMの能力評価 [cs.CL, cs.AI]目的:確率演算子を用いた論理的推論の能力
- 自然言語理解において,不確実性の表現と推論は不可欠であり,医療や法律など重要領域で特に求められる。
- LLMの論理的推論能力評価は困難であり,表面的なパターン認識と本質的な推論能力の区別が課題である。
- 確率演算子を含む文脈での論理的推論能力を客観的に評価し,LLMの限界とバイアスを明らかにすること。
- 評価した29個のモデルの多くは,論理形式に依存しない回答バイアスを示し,Yes/Noの偏りが見られた。
- モデルの能力下限を,Yes/No正解率の低い方で定義し,29個中9個のモデルのみがランダムよりも高い精度を示した。
- 質問形式,動詞句,名前の性別・出自などの変種でもバイアスが確認され,多岐にわたる偏りが存在する。
JigShape:VLMにおける視覚幾何学的推論の評価 - ジグソーパズルを通じて [cs.CV, cs.AI]目的:視覚情報と幾何学的制約に関する推論能力の評価
- 視覚言語モデル(VLM)の性能向上には,視覚情報と幾何学的知識の統合が不可欠である。
- 既存のベンチマークは矩形カットを使用しており,テクスチャの繰り返し領域で曖昧な正解が生じる。
- 明確な正解が得られるジグソーパズルを用いて,VLMの幾何学的推論能力を評価し,課題を明確化する。
- 既存のVLMは,特に大規模なパズルにおいて幾何学的推論能力が著しく不足していることが示された。
- 教師ありファインチューニングは小規模なパズルで高い性能を示すが,パズルの規模が大きくなると性能が急激に低下する。
- この結果は,現在のモデルアーキテクチャが,ピース数の増加に伴う制約充足の一貫性を維持できないことを示唆している。
SpatialCLI:空間ツールを用いた推論学習,そしてそれなしでの推論 [cs.AI]目的:空間ツールを用いた推論能力の学習と,その能力の内部化
- 視覚と言語を扱うモデルは,ロボットなどの具現化されたエージェントで重要な役割を担う。
- 汎用モデルはタスク全体を理解するが視覚的詳細は苦手,専門モデルは詳細を捉えるがタスクへの応用が難しい。
- 汎用モデルに空間ツールを用いて推論させ,専門家の知覚能力を内部化させることを目指す。
- SpatialCLIは,まず視覚モデルを空間ツールとして活用し,VLMsの知覚能力を拡張する。
- 次に,Cold-Start SFTと強化学習によりツール利用を改善し,成功したツール利用経路を言語化することで知覚能力を内部化する。
- MindCubeにおいて,SpatialCLIはQwen3-VL-8B-Instructの性能を大幅に向上させ,GPT-5.6 Solを上回った。
フローマッチングの不確実性の幾何学的性質と無料プロキシ [cs.AI]目的:フローマッチングにおける不確実性の幾何学的解釈と,それに対応するコストフリーな不確実性プロキシの開発
- ロボットの安全な動作には,モデルの予測の信頼性を評価することが不可欠である。
- 既存の不確実性推定法は,計算コストが高いか,汎化性能が低いという課題がある。
- リアルタイム制御における,低コストかつ高精度な不確実性推定手法を提案し,安全な展開を可能にすること。
- フローマッチングの不確実性は,速度場における理想的なアフィン等方的な収縮場からの逸脱として幾何学的に解釈できることが示された。
- 提案手法であるdenoising acceleration (accel) は,追加の評価や学習なしに,ノイズ除去軌道の曲がり具合を測定する,汎用性の高い不確実性プロキシとして機能する。
- 実験結果から,accelはフローマッチングの不確実性の忠実なプロキシであり,現実的な展開予算下で,リサンプリングや学習ベースの手法と同等以上の性能を示すことが確認された。
SKILL-KD:LLMエージェントに対するコントラスト学習を用いたスキル蒸留 [cs.AI]目的:LLMエージェントのスキル獲得方法
- LLMエージェントの性能向上は,多様な応用展開に不可欠である。
- 既存手法では,弱いエージェントが失敗から学習しにくい問題がある。
- エージェント間の能力差を考慮し,明示的なスキル蒸留により学習を促進する。
- SKILL-KDは,教師と生徒のエージェント間の行動の差異をテキストパッチとして抽出し,生徒の再実行によりパッチを洗練する。
- スキルドリフトを防ぐため,パッチの編集履歴を管理し,ルール追加・変更・破棄を決定する。
- 5つのベンチマークと2つの生徒設定において,既存手法と比較してSKILL-KDは一貫して性能向上を示した。
PAIChecker:SWE-Bench様BenchmarkにおけるPR-Issue不整合の発見と検証 [cs.SE, cs.AI]目的:SWE-Bench様BenchmarkにおけるPRとIssueの不整合の検出と検証
- 大規模言語モデル(LLM)の性能評価において,SWE-Bench様Benchmarkは重要な役割を担っている。
- PRとIssueのペアリングが実際には不整合である場合があり,Benchmarkの信頼性を損なう。
- PR-Issue不整合を効率的に検出し,より信頼性の高いBenchmark構築を支援すること。
- PAICheckerは,SWE-Bench Verifiedインスタンスにおいて,11種類のシナリオで5つの不整合パターンを検出した。
- SWE-GymとSWE-bench Multilingualの実験で,4つのLLMバックボーン全てにおいて最高の性能を示し,それぞれ最大92.12%と91.67%の二値精度を達成した。
- PAICheckerは,パターン識別,クロスエージェントラベル合成,コードレベル検証の3段階設計により,正確かつ汎用性の高い検出を実現する。
小規模言語モデルにおける知識蒸留のバイアスに対する非対称的影響 [cs.CL, cs.AI, cs.CY]目的:小規模な指示調整済み言語モデルにおける知識蒸留がバイアスに与える非対称的な影響の検証
- 言語モデルのバイアスは,社会的な公平性や倫理的な問題に関わる重要な課題である。
- 知識蒸留はモデルの性能向上に有効だが,バイアスの伝播や増幅を引き起こす可能性がある。
- 知識蒸留がバイアスに与える影響を詳細に分析し,改善策を提案することを目指す。
- 明確なタスクにおいては,知識蒸留により,正答の文脈を無視したステレオタイプへの回答が減少し,精度が向上した。
- 曖昧なタスクにおいては,知識蒸留により,正しく拒否していたケースでステレオタイプな回答が生成される「沈黙損失」が発生した。
- 既存の集計指標は,バイアスの影響を隠蔽する可能性があり,Per-Condition Calibration Diagnosis (PCCD)という新たな評価プロトコルを提案した。
NeSyFS:部分観測下におけるLLMエージェントのための神経記号高速・低速思考フレームワーク [cs.AI]目的:部分観測下におけるLLMエージェントの意思決定性能向上
- LLMエージェントは,自己反省や科学的発見など,自律的なタスク実行において重要性が高まっている。
- 部分観測環境下では,信念状態の推論,タスク目標のずれ,不確実性下での計画立案が課題となる。
- 冗長な情報に惑わされず,より合理的な意思決定を可能にするフレームワークの構築を目指す。
- NeSyFSフレームワークは,知識グラフを用いて信念状態を表現し,高速思考と低速思考を組み合わせることで部分観測下での課題に対処する。
- 高速思考は即応的な行動を行い,低速思考は不確実性を考慮した計画立案を実行する。反省モジュールが目標のずれを軽減する。
- ALFWorld,Webshop,ScienceWorldの3つのベンチマークにおいて,既存手法と比較して顕著な性能向上を示した。
MerchantBench:Eコマース運用におけるLLMエージェントの長期一貫性評価 [cs.AI]目的:Eコマース運用におけるLLMエージェントの長期一貫性のベンチマーク
- LLMの自律的なツール利用能力向上が期待される中,実用化には長期的な一貫性が不可欠である。
- 既存の評価基準は短期的なタスクに偏り,長期的な一貫性を評価する環境が不足している。
- Eコマースという実環境を用いて,LLMエージェントの長期一貫性を評価し,課題を明確化する。
- MerchantBenchは,98,843件の実Eコマース商品記録と26のツールを用いた365日間のシミュレーション環境である。
- 8つのLLMを評価した結果,最新のLLMでも人間の平均最終純資産の27.3%にしか到達しなかった。
- LLMと人間の間に大きな差があることが示され,長期一貫性の課題が浮き彫りになった。
検索を超えて:マルチモーダルエージェントのための分析的記憶 [cs.CL, cs.PF, cs.AI]目的:マルチモーダルな観察の構造化と分析的アクセス
- 対話型エージェントの性能向上には,過去の経験の活用が不可欠である。
- 既存システムは検索型記憶に偏っており,複雑な分析処理が困難である。
- 観察データの構造化による,効率的な分析的アクセスを実現する。
- AdaMMは,検索と分析の両方をサポートするフレームワークを提案する。
- AdaMMは,属性値の観察を抽出し,構造化して分析を可能にする。
- MemEyeとMemGalleryのベンチマークで,AdaMMは最大11.3%と6.9%の性能向上を示した。
どのモダリティが決定するか:マルチモーダルLLMの反事実的モダリティ帰属 [cs.CV, cs.AI]目的:マルチモーダルLLMにおけるモダリティレベルの貢献度評価
- 画像とテキストを組み合わせるマルチモーダルLLMは,重要な意思決定を支援する。
- 既存の説明手法では,予測の根拠となるモダリティを特定できない。
- モデルが誤った根拠で正しい出力を生成する問題を解決する。
- CMAは,制御された合成ベンチマークにおいて,決定を主導するモダリティを98%の精度で特定した。
- CMAはベースラインモデルを上回り,予測精度だけでは見えないクロスモーダル推論の失敗を明らかにした。
- モダリティ帰属は,特徴帰属に加えて,マルチモーダルLLMの安全性評価に不可欠な要素である。
LLM-OSDA:多段階LLM会話におけるネイティブ広告のための最適停止動的オークション [cs.CL, cs.AI, cs.GT, cs.LG]目的:多段階LLM会話におけるネイティブ広告のための最適停止動的オークションの提案
- LLMの会話能力向上に伴い,広告配信の新たな形としてネイティブ広告が注目されている。
- 従来の広告オークションは固定スロットが基本であり,会話の流れに合わせた広告タイミングの最適化が課題である。
- 会話の進行に応じて最適なタイミングで広告配信を行い,収益性とユーザー体験を両立することを目指す。
- LLM-OSDAは,ベルマン最適停止理論,落札者決定,エンベロープ価格設定を統合した動的オークションである。
- 理論上,広告主の入札額に応じて期待割引クリック数が増加し,真実な入札が弱支配戦略となることが示された。
- シミュレーション実験により,LLM-OSDAが既存手法と比較してネット収益を11%向上させ,ユーザー維持率も同程度に保たれることが確認された。
繁栄のための最適化:AIおよびポストAGI経済システムにおける成功基準としての繁栄指標と繁栄収益率 [cs.CY, cs.AI, econ.TH]目的:AIおよびポストAGI経済システムの成功基準としての人間と地球の繁栄
- AI技術の進歩は,人間の幸福と地球環境に大きな影響を与える可能性があり,その評価基準が重要である。
- 既存のAI評価基準は,能力や効率性などに偏っており,人間の幸福や地球環境への影響を十分に考慮していない。
- AIシステムの開発と経済システムの変革が,持続可能な繁栄に貢献するかどうかを評価する枠組みを提示すること。
- 本研究では,身体的,精神的,経済的,人間関係,精神性,地球環境といった多岐にわたる側面から繁栄を測定する「繁栄指標」を提案した。
- また,「繁栄収益率」という概念を導入し,資源,リスク,機会費用を考慮しながら,AIシステムが繁栄にどれだけ貢献するかを評価する方法を示した。
- 民主的な仕様,実証的な検証,独立した評価,および特定の次元や利害関係者グループにおける容認できない損失からの保護の必要性を強調した。
データ効率の良い強化学習アライメントのための憲法グリッド型手法 (C-Guard) [cs.CL, cs.LG]目的:強化学習アライメントにおけるデータ効率の向上
- 強化学習は多様な課題に応用可能だが,安全性を確保し,意図通りの行動を学習させることは困難である。
- 強化学習における安全性と有用性の両立が難しく,特にデータ効率が低いことが課題となっている。
- 過剰な拒否と過少な拒否の問題を解決し,効率的な学習データ生成を目指す。
- C-Guardは,強化学習の訓練データを生成するための憲法グリッド型手法であり,C-LIMは各セルの学習可能性スコアを決定する。
- C-LIMにより,訓練予算を浪費する無駄なデータ領域を事前に特定し,学習効果を向上させることが可能となった。
- 過剰な拒否を改善することで性能が22.4%から12.8%に向上し,敵対的攻撃に対する脆弱性も軽減された。
プロンプトがロボットを制御するとき:マルチエージェントロボットシステムにおけるプロンプトインジェクション攻撃 [cs.RO, cs.SY, eess.SY, math.OC, cs.RO, cs.AI, cs.CR, cs.MA]目的:マルチエージェントロボットシステムにおけるプロンプトインジェクション攻撃の評価
- ロボットの自律性向上にLLM活用が進む中,その安全性確保が重要である。
- LLMを搭載したロボットは,悪意のあるプロンプトにより制御を奪われる危険性がある。
- マルチエージェント環境におけるプロンプトインジェクション攻撃の脆弱性を明らかにすること。
- プロンプトインジェクション攻撃により,ロボットが想定外の行動を取り,タスク遂行率が低下することが確認された。
- 攻撃は,共有プロンプト構造を通じてエージェント間で伝播し,影響はプロンプト構成や標的エージェントによって変化する。
- アーキテクチャ変更がLLMクエリに影響を与え,攻撃の成功率を左右することが示唆された。
妥当性なき測定:エージェントAI評価における信頼性の複合的課題 [cs.AI]目的:エージェントAI評価パイプラインにおける妥当性の低下メカニズムの解明
- AIの安全性や規制遵守において,エージェントAIの評価は不可欠である。
- 既存の評価パイプラインでは,妥当性の検証が十分でなく,信頼性が損なわれている。
- 評価パイプライン全体の妥当性を定量化し,改善策を提示すること。
- 妥当性は,タスク生成,人間・シミュレーター較正,自動評価の各段階で乗算的に低下する。
- 発表されているエージェントAI評価論文の82%において,信頼性指標の適用に問題が見られた。
- 心理測定学に基づき,信頼性閾値を満たすための8つの具体的な改善策を提示した。
15分都市パリ:説明可能なAIの視点 [cs.LG]目的:都市における移動と日常生活サービスのアクセス性の関係性の定量化
- 都市計画において,住民の生活の質と持続可能性の向上が重要視されている。
- 15分都市の概念と実際の都市の移動パターンとの間の定量的な関係が不明確である。
- AIを用いて,移動パターンと都市サービスの配置の関係性を解明し,政策提言に資する。
- パリ都市圏において,POIの充実度は自家用車利用の抑制とアクティブモビリティの促進に関連することが示された。
- 15分都市の基本的な仮説は,空間的・人口統計学的な異質性を考慮すると整合性があることが確認された。
- 説明可能な機械学習は,都市交通政策のための地域に特化した仮説を導出するための有効な手段である。
プルーニングBPE:バイトペアエンコーディングのポストトレーニング可視性プルーニングとトークン再割り当て [cs.CL, cs.LG]目的:バイトペアエンコーディングにおける語彙効率の改善
- 自然言語処理において,効率的なトークン化はモデルの性能と計算コストに大きく影響する。
- 標準的なBPEは,最終的なコーパスに現れない中間的なトークンも語彙に含んでしまうという課題がある。
- ポストトレーニングによる可視性プルーニングで,不要なトークンを削減し,より効率的な語彙を構築することを目指す。
- Pruned BPEは,Standard BPEと同等の語彙サイズで,エンコード長を0.27%~0.36%程度削減することに成功した。
- 語彙のみを評価した結果でも,Pruned BPEは0.23%~0.31%程度の優位性を維持し,語彙効率の改善が明確に示された。
- 内部専用トークンは,再利用可能な英語フラグメントや中国語のコンポーネントなど,構造化されたテキストを含むことが確認された。
EulerLoRA:ランク駆動型ジャンプダイナミクスによるキャリブレーションされたパラメータ効率の良いファインチューニング [cs.LG]目的:パラメータ効率の良いファインチューニングのためのランク駆動型ジャンプダイナミクス
- 大規模言語モデルのファインチューニングは計算コストが高く,資源制約のある環境下では困難である。
- 標準的なLoRAは決定論的なモデルしか生成せず,予測不確実性の推定を直接サポートしていない。
- 少ないパラメータで予測の多様性を獲得し,より効率的なファインチューニングを実現すること。
- EulerLoRAは,共有された低ランクアダプターのランク1成分に沿って構造化された変動をサンプリングすることで,複数の予測軌跡を生成する。
- CIFAR-10,CIFAR-100,HAM10000における評価で,EulerLoRAは強力なLoRA-Ensembleベースラインと同等またはそれ以上の性能を達成した。
- 2つのランク20アダプターを使用した場合,EulerLoRAは約300万の学習可能なアダプターパラメータを必要とし,これはランク8,16アダプターLoRA-Ensembleの約1000万と比較して,約69%少ないパラメータ数となる。
ACE-GraphRAG:階層型GraphRAGのためのエージェント的コンテキストエンジニアリング [cs.CL, cs.AI]目的:階層型GraphRAGにおけるコンテキスト構築の最適化
- 知識集約型AIの発展には,大規模知識ベースの効果的な活用が不可欠である。
- 従来のGraphRAGでは,固定されたコンテキスト構築がクエリとの適合性を損なう場合がある。
- クエリとタスクに応じた動的なコンテキスト構築によって,推論性能の向上を目指す。
- ACE-GraphRAGは,推論時にコンテキストポリシー層を追加し,初期コンテキストを適応的に拡張する。
- Full-ACEは,HotpotQAや2WikiMultiHopQAなどの評価データセットで,既存のRAGやGraphRAGの性能を上回った。
- Adaptive-ACEは,特に複雑なUltraDomainデータセットにおいて,さらなる性能向上を示した。
人間の行う画像融合のランキング:赤外・可視融合評価のための学習されたペアワイズ選好指標 [cs.CV, cs.AI]目的:赤外・可視画像融合アルゴリズムのランキング評価のための,人間がペアで行う選好を学習した指標の開発
- 赤外・可視画像融合は,安全保障,医療,監視など,多くの分野で重要な役割を担っている。
- 理想的な融合参照画像が存在しないため,アルゴリズムのランキングは客観指標に依存しており,人間の判断との乖離が生じやすい。
- 人間の選好をより正確に反映した指標を開発し,融合アルゴリズムの評価を改善することを目指す。
- 学習された指標LPIFMは,赤外画像,可視画像,2つの融合候補画像を入力とし,どちらの候補が優れているかを予測する。
- LPIFMは,人間のペアワイズ比較に基づいた評価プロトコルを再現性のある形で実現し,従来の客観指標よりも高い精度で人間の判断と一致する。
- 評価データセット,モデル,ソースコードを公開することで,人間が選好に基づいた画像融合評価を容易にする。
適切な質問の仕方:複雑なタスク解決のためのプロンプト作成を支援するマルチエージェント対話システム [cs.MA, cs.AI]目的:複雑なタスク解決におけるプロンプト作成の最適化
- 大規模言語モデルの活用が不可欠であり,その性能はユーザーのプロンプトに大きく依存する。
- 反復的なプロンプト作成では,コンテキストの劣化や認知的な効果の低下が課題となる。
- 構造化された質問を通してプロンプトの質を向上させ,人間とAIの協調を促進すること。
- PAWNIは,質問自体を最適化することで,LLMの出力品質を向上させることに成功した。
- 参加者はPAWNIを使用することで,より構造化されたプロンプトを作成し,LLMの出力品質の評価も向上した。
- PAWNIの使用により,タスク完了に必要なターン数が大幅に削減され,ワークロードも軽減された。
AGI後経済学のための新たな価値理論 [cs.AI, econ.GN, q-fin.EC]目的:AGI後の経済学の基盤となる価値理論の構築
- 経済学は社会の資源配分を最適化し,人々の生活水準を向上させるために不可欠である。
- 既存の価値理論は,労働や専門知識などの希少性を前提としているが,AGIの出現によりこの前提が崩れつつある。
- AGI時代における人間の幸福と社会の発展を促進するための新たな価値基準を確立すること。
- 本研究は,Flourishing Value Theory(FVT)を提唱し,価値を社会や地球の制約内で,個人やコミュニティが繁栄するための能力への貢献と定義する。
- FVTは,価値創造と価値獲得を区別し,価格やGDPを単なる指標として捉え,多次元的で再生可能な価値の重視を提唱する。
- AGI後の経済課題は,単なる生産性向上ではなく,豊富な知性を人,社会,地球の持続的な繁栄に転換することにある。
推論の相違点が明らかになる場所:多段式質問応答のための局所化された多エージェント討論 [cs.AI, cs.MA]目的:多段式質問応答における多エージェント討論の効率化
- 複雑な質問応答には,複数の推論ステップが必要であり,その過程で様々な知識が活用される。
- 従来の多エージェント討論では,わずかな相違点に対して完全な根拠を交換するため,非効率が生じる。
- エージェント間の最初の対立点を特定し,討論を局所的な範囲に限定することで,効率的な議論を実現する。
- 局所化された多エージェント討論(LMAD)は,10種類のバックボーンモデルで,最も高いマクロ平均ジャッジ精度を達成した。
- 既存の強力なベースラインを最大7.20パーセントポイント上回る性能を示した。
- ガード付き解決により,議論済みのステップを再検討することなく,後続の対立に対処できる。
LongCat Sparse Attention:ストリーミング対応階層型クロスレイヤーインデックスによる高速化 [cs.AI, cs.CL, cs.DC, cs.LG]目的:長文脈モデリングの効率化
- 大規模言語モデルの性能向上には,長文脈を効率的に処理する技術が不可欠である。
- 既存のスパースアテンション機構は,インデックス作成の計算コストやメモリアクセス効率の課題を抱えている。
- ハードウェアとアルゴリズムを協調設計し,インデックス作成のオーバーヘッドとメモリ効率を改善することを目指す。
- LSAは,ストリーミング対応インデックス,クロスレイヤーインデックス,階層型インデックスの3つの戦略を組み合わせる。
- 実験の結果,LSAは汎用的なベンチマークと長文脈ベンチマークの両方で,フルアテンションと同等の性能を達成した。
- LSAは最大100万トークンまでの文脈長での学習を可能にし,LongCat-2.0 (1.6T-A48B)の開発を支える。
スタイルが勝り,実質が劣る:アイデア創出におけるLLM評価者の診断 [cs.CL, cs.AI]目的:LLMを用いたアイデア評価におけるスタイルバイアスの診断と軽減
- 科学的発見の加速には,斬新なアイデアの迅速かつ正確な評価が不可欠である。
- LLM評価者がアイデアの科学的根拠よりも表面的なスタイルに影響を受ける可能性がある。
- LLM評価におけるスタイルバイアスを特定・定量化し,軽減するためのフレームワークを提供する。
- SciStyleBenchは,スタイル擾乱を施した科学的アイデアを用いてLLM評価者のバイアスを診断する。
- LLM評価者は依然として文章スタイルに敏感であり,科学的実質を見分けるのに苦労していることが示された。
- SciStyleExtractorは,スタイルバイアスを軽減し,科学的実質の識別率とランキングの安定性を向上させる。
記憶が権威となる時:記憶固定化境界における権威崩壊のベンチマーク [cs.HC, cs.AI]目的:大規模言語モデルエージェントにおける権威崩壊の評価
- 継続的な記憶は,LLMエージェントが多様な対話履歴を再利用可能な知識として適応する上で不可欠である。
- 記憶固定化は情報の利用を制限するが,その制約が失われると権威が拡大してしまう問題がある。
- 記憶固定化における権威崩壊を検出し,権威情報を適切に保持する手法を開発することを目指す。
- 49通りの構成のうち48通りで権威崩壊が確認され,権威メタデータがない場合,無許可アクションの発生率が50.3%に達した。
- 自動的に予測・保存された権威ラベルを用いることで,無許可アクションの発生率は16.9%から0.0%に大幅に減少した。
- タスクの成功率はほぼ変わらず,記憶駆動型適応において,学習内容だけでなく権威の保持が重要であることが示された。
ベックマン輸送モデル:自律フローからワンステップ写像へ [cs.LG]目的:二つの分布間の正確な写像
- 生成モデルや分布間の対応は,機械学習における重要な課題である。
- 既存手法には,理論的な一貫性の欠如や計算の複雑さなどの課題がある。
- ベックマン輸送問題におけるフラックス制約の動的な解釈を提供し,一貫性のある写像を構築する。
- 時間的に独立した速度場(自律フロー)を用いることで,低次元多様体上の特異分布間の写像が可能になる。
- このフローに関連するワンステップ生成写像は,単純な保存則の唯一解であることが示された。
- ImageNet 256x256での実験により,提案手法の有効性が確認された。
自律走行VLMにおける検証可能な推論のための将来軌跡の遅延露出 [cs.AI]目的:自律走行における推論能力向上のための手法
- 自動運転技術は,安全性向上と効率化に不可欠であり,社会実装に向けた研究が重要である。
- 既存のVLMは,将来軌跡に依存した推論を行いやすく,因果関係に基づかない誤った推論を生みやすい。
- 将来軌跡を推論の補助ではなく検証対象とすることで,より信頼性の高い推論を実現する。
- 提案手法DEFT-RLVRは,自律走行における推論能力を向上させ,同時に一般的な視覚能力を維持・強化する。
- AD-MCQは,計画を明示的な軌跡候補の選択として捉え,柔軟かつ拡張性の高い検証可能な推論基盤を提供する。
- 将来軌跡を遅延露出することで,教師モデルの軌跡固定バイアスを解消し,より因果関係に基づいた推論を可能にする。
LEAP:GPUカーネル生成のための適応的剪定によるリーンな環境フィードバック [cs.LG, cs.AI]目的:GPUカーネル生成におけるコードRLのための効率的な強化学習フレームワーク
- 近年,大規模言語モデルを用いたコード生成技術が発展している。
- 低レベルシステムプログラミングでは,報酬の疎らさやコンパイル時間の問題がある。
- コンパイルコストの高い複雑なタスクに焦点を当て,学習効率を向上させる。
- LEAPは,難易度に応じた剪定により,不要なタスクを排除し,学習リソースを有効活用する。
- Rank-Based Rewardを用いることで,簡単なプロンプトでの非効率なトークン生成を抑制し,難しい問題での学習勾配を最大化する。
- 実験結果から,LEAPは初期性能と多段階デバッグの堅牢性において,従来の強化学習手法を上回ることが示された。
推論の失敗前に:エージェント型RAGにおける証拠前部の手続き的失敗 [cs.AI]目的:エージェント型RAGシステムの,証拠に基づく推論テスト以前の失敗要因の分析
- 大規模言語モデルの知識獲得能力を拡張するRAGシステムは,高度な質問応答に不可欠である。
- RAGシステムは,検索された証拠を適切に評価せずに回答してしまうことがある。
- 証拠の確認手順の不備が回答の質に与える影響を明らかにすること。
- エージェントの行動軌跡を分析した結果,証拠確認前の失敗と,正解読後の失敗は重複性が低いことが示された。
- Read-Gateという,検索後に読み込み,最終回答前に読み込みを必須とするシンプルな制約を導入したところ,回答精度が大幅に向上した。
- 思考予算の増加だけでは,必ずしも証拠の確認が増加するとは限らないことが明らかになった。
漸進的経験進化による自己改善型大規模言語モデル [cs.CL, cs.AI, cs.LG]目的:大規模言語モデルの自己改善メカニズム
- 大規模言語モデルは多様なタスクに応用可能だが,その性能向上のためには継続的な学習が不可欠である。
- 既存手法では,テスト時の経験の活用とモデルパラメータの更新が分断されており,効果的な経験の蓄積が課題である。
- 経験蒸留を通じて,一時的な相互作用経験をモデルの能力として永続化し,自己改善サイクルを促進することを目指す。
- 提案手法SPEEは,経験の明示的な進化と暗黙的なポリシー最適化を段階的に行うことで,既存手法よりも優れた性能を発揮する。
- SPEEは,成功例と失敗例の両方から知識を凝縮し,有用性の低い経験を排除することで,より効果的な経験プールを構築する。
- 数学的推論ベンチマークにおいて,様々なモデル規模で一貫して既存の自己進化ベースラインを上回る結果が得られた。
PhyCheck:ビデオLLMにおける物理法則理解のための詳細な証拠に基づくデータセット [cs.CV, cs.AI]目的:ビデオLLMにおける物理法則理解の評価と改善
- 具現化された知能には,物理的規則の理解が不可欠である。現実世界をモデル化するためにも重要。
- 既存の評価基準は生成動画の品質に偏っており,ビデオLLMの物理法則理解を系統的に評価できない。
- 物理法則への適合・不適合の判断に加え,違反・適合の原因となる詳細を捉えることを目指す。
- 提案データセットPhyCheckを用いてQwen2.5-VLをファインチューニングした結果,物理的整合性の理解が大幅に向上した。
- 診断サブセットを用いた評価では,現在のモデルは因果条件を判断に組み込むのが困難であることが示された。
- 表面的な不整合の認識と,根底にある物理メカニズムの理解との間にギャップが存在することが明らかになった。
SkillTrace:クエリ-スキルグラフを横断し,構成可能なLLMエージェントを実現する [cs.RO, cs.AI]目的:構成可能なLLMエージェントのためのスキル組み合わせ
- 複雑なタスク解決において,LLMエージェントの役割が重要になっている。
- スキルライブラリから再利用可能なスキルを個別に検索するだけでは不十分である。
- 実行可能なスキル構成を特定するための課題解決を目指す。
- SkillTraceは,ユーザーのクエリを意味階層に整理し,スキルクエリと候補をマッチングする。
- SkillsBenchで53.17%,ALFWorldで91.43%の成功率を達成し,最先端の性能を示す。
- 異なるバックボーン言語モデルで一貫した改善が見られ,汎用性と堅牢性も実証した。
RoMeRL:エージェントメモリの自己進化におけるフィードバック網羅性と記憶報酬罠のバランス調整 [cs.LG, cs.CL]目的:自己進化型LLMエージェントのメモリシステムにおけるフィードバック効率と記憶報酬罠の軽減
- LLMエージェントの性能向上には,効率的なメモリシステムの構築が不可欠である。
- 従来のメモリシステムでは,履歴の増加に伴いフィードバックが希薄化し,誤った報酬学習を招く可能性がある。
- 本研究は,低次元の表現を用いることで,メモリの効率的な更新と報酬の正確性を両立させることを目指す。
- RoMeRLは,タスク固有のメモリ状態を用いて,固定次元の表現でメモリを管理することで,フィードバックの集中化を実現した。
- 実験結果から,ALFWorldとLifelongAgentBenchにおいて,タスク性能の向上,Cold-Q比率の低下,フィードバック密度の増加が確認された。
- RoMeRLは,メモリサイズとLLM呼び出し回数を大幅に削減し,効率的な自己進化型エージェントメモリの構築に貢献する。
深層学習における制御粒子系の収束解析:有限サンプルサイズから無限大へ [math.CO, cs.DM, math.NT, math.SP, math.OC, cs.LG, math.PR, stat.ML]目的:深層学習におけるニューラル確率微分方程式のサンプルサイズ増加に伴う最適制御問題の極限振る舞い
- 深層学習の性能向上には,効率的な学習アルゴリズムの確立が不可欠である。
- サンプルサイズの増加に伴う理論的保証が不足しており,大規模データでの学習の安定性が課題である。
- サンプルサイズが無限大に近づくときの収束性を解析し,安定的な学習アルゴリズムを構築すること。
- 本研究では,ニューラル確率微分方程式に対応するN粒子系のHamilton-Jacobi-Bellman方程式の正則性を解析した。
- Nに関する一様正則性推定を得ることで,サンプルサイズの増加に伴う最適解の収束性を示した。
- 極限解は,ボレル確率測度のWasserstein空間上の適切な関数として識別され,定量的な収束速度も導出された。
量子景観のパッチに対する効率的な量子増強古典シミュレーション [quant-ph, cs.LG, stat.ML]目的:量子景観の一部の古典的代替手法の生成
- 量子計算機の優位性を特定するため,古典シミュレーション手法の能力理解が重要である。
- 量子計算機が有効な領域の特定が困難であり,不必要な計算資源の消費が生じている。
- 量子デバイスでの測定に基づいて,景観の一部を古典的にシミュレーションする手法を提供する。
- 量子回路によって生成される期待値景観の一部の古典的代替手法を生成可能であることが示された。
- 提案手法は,特定の回路族に対して時間とサンプル複雑性に関する保証を提供する。
- ハミルトニアン変分アプローチと127量子ビットのヘビーヘクス構造における長時間ダイナミクスのシミュレーションで数値的に検証された。
予測強化モンテカルロ法:制御変量に対する機械学習の視点 [stat.ML, cs.CE, cs.LG, q-fin.PR]目的:モンテカルロ法の分散と計算時間を削減する手法の開発
- 医療,工学,金融など,複雑なシミュレーションにおいて,モンテカルロ法は重要な役割を果たす。
- ネストされた多段階評価や経路依存評価など,効果的な分散減少手法がない場合に,計算コストが課題となる。
- 機械学習を活用し,モンテカルロ法の分散を削減しつつ,バイアスを導入しない手法を確立する。
- 提案手法PEMCは,機械学習モデルを予測器として活用し,安価で並列化可能なシミュレーションを特徴量とすることで,バイアスのない評価と分散の低減を実現した。
- PEMCは,従来の制御変量の考え方を拡張し,計算コストを考慮した分散減少を目指すとともに,閉形式の平均関数を必要としない。
- 多様なシナリオにおいて,PEMCは分散を削減しつつ,バイアスを維持し,標準的なモンテカルロ法を強化する可能性を示した。
大規模最小二乗和クラスタリングに対する厳密な上限 [math.CO, cs.DM, math.OC, cs.LG]目的:大規模データに対する最小二乗和クラスタリングの最適解評価法
- データ分析や機械学習において,類似したデータをまとめるクラスタリングは不可欠な手法である。
- 大規模データセットでは,最小二乗和クラスタリングの最適解を見つける計算コストが非常に大きい。
- ヒューリスティック解の品質を評価するための効率的な最適解のギャップ算出を可能にすること。
- 提案手法は,問題をより扱いやすい小さな問題に分割する分割統治法を用いる。
- 補助最適化問題である「アンティクラスタリング問題」を活用し,効率的なヒューリスティックを設計した。
- 実験により,3%以下のギャップで大規模インスタンスを評価できる実用性が示された。
低リソース環境における音声LLM:データ量要件と高リソース言語での事前学習の影響 [eess.AS, cs.AI, cs.CL]目的:低リソース音声自動音声認識のためのデータ量要件および事前学習効果の検証
- 音声処理技術は,人機インタフェースや情報アクセスにおいて不可欠であり,その重要性は増している。
- 低リソース言語における学習データ不足は,高性能な音声認識モデル開発の大きな課題となっている。
- 高リソース言語での事前学習を活用し,低リソース言語でのデータ不足を補う手法を模索する。
- SLAM-ASRフレームワークを用いた実験により,Whisperのみの性能に匹敵する性能を得るために必要なデータ量が明確になった。
- 高リソース言語で事前学習された軽量プロジェクターを用いることで,データ不足の影響を軽減できることが示された。
- 多言語LLMとの組み合わせにより,低リソース言語における音声認識性能の向上が確認された。
予測と帰属の架け橋:同化因果推論による前方および後方因果影響範囲の特定 [stat.ML, cs.LG, math.ST, physics.data-an, stat.ME, stat.TH]目的:前方および後方因果影響範囲の数学的厳密な定式化
- 因果推論は,様々な分野で現象のメカニズム解明に不可欠であり,予測や意思決定に貢献する。
- 従来の因果推論はデータの制約を受けやすく,複雑な動的システムにおける因果関係の特定が困難である。
- 動的モデルと観測値を統合し,因果関係の範囲と持続時間を定量的に評価することで,よりロバストな因果推論を実現する。
- 同化因果推論を用いて,前方および後方因果影響範囲を数学的に厳密に定式化することに成功した。
- 前方因果影響範囲は原因の時間的影響を,後方因果影響範囲は観測された結果のトリガーの開始時期をそれぞれ定量化する。
- 提案手法は,経験的な閾値に依存せず,様々な非線形動的システムへの応用が可能である。
MIMIC-MJX: 動物行動の神経機械的エミュレーション [q-bio.NC, cs.AI, cs.RO]目的:動物行動の運動学的軌跡から,生体力学に基づいた神経制御方策の学習
- 神経系の主要な出力は運動であり,行動理解には重要である。
- 運動学的軌跡だけでは,背後にある制御プロセスを間接的にしか捉えられない。
- 運動学的軌跡を再現する,生体力学に基づいた神経制御方策を学習する。
- MIMIC-MJXは,多様な動物モデルに対して正確かつ高速に学習可能であることが示された。
- 少量の運動データでも学習が可能であり,汎用性も高い。
- 運動制御方策のモデリングや行動実験のシミュレーションに利用できる。
ヨーロッパのデータを用いた国際感染症予測のクロスカントリー学習 [q-bio.PE, cs.LG]目的:感染症発生件数の予測精度向上
- 公衆衛生計画や迅速な介入策に不可欠な感染症予測は,社会に大きな影響を与える。
- 単一国のデータは期間や変動が限られ,機械学習モデルの性能を制約する。
- 複数国のデータ活用により,予測モデルの汎化性能と精度を向上させる。
- 他国のデータと組み合わせることで,国内データのみで学習したモデルよりも予測精度が安定して向上することが示された。
- 予測期間やデータ拡張の影響分析により,最適なモデル構築における重要な要素が明らかになった。
- 本研究の枠組みと知見は,国内データが限られた状況下での感染症予測に役立つ可能性がある。
シグナル・ホライズン:ノイズの多い量子エンコーディングにおける局所的な盲目性とパウリ重みスペクトルの収縮 [quant-ph, cs.LG]目的:ノイズ下における局所制約測定下でのクラス情報の残存量
- 量子情報処理の性能向上には,ノイズ環境下でのロバストな識別技術が不可欠である。
- 量子識別は,グローバルな状態識別性や変分モデルの学習可能性に注目が集まるが,局所的な測定の影響は未解明であった。
- 局所的な測定制約下での分類性能の限界を明らかにし,分類器の設計指針を示す。
- 量子バイナリ分類を制約付き量子状態識別として定式化し,局所的な識別可能性の尺度を導入した。
- 独立な減衰ノイズを受けたn-qubitシステムにおいて,局所的にアクセス可能なシグナルはパウリ重みに依存して収縮することが示された。
- 4量子ビットエンコーディングの数値実験により,経験的な精度と予測値の定量的一致が確認された。
LoBoost:勾配ブースティング木のための高速モデル固有の局所的確信区間予測 [stat.ML, cs.LG]目的:勾配ブースティング木モデルの不確実性定量
- 表形式データの回帰において,勾配ブースティング木は高い予測性能を示す。
- 標準的な確信区間予測は,グローバルな残差分位数を使い,異分散に対応しにくい。
- 学習済みアンサンブルの葉構造を活用し,局所的な残差分位数を推定することで,異分散に対応する。
- LoBoostは,モデル固有の局所的確信区間予測手法であり,既存のパーティションや追加の学習を必要としない。
- 理論的保証により,アンサンブルの安定性と細胞の形状が局所的な残差スコアの均質性と関連し,有限サンプルでのカバレッジエラー制御が可能なことが示された。
- 実験結果から,競争力のある区間品質と低い事後調整コスト,そして局所的キャリブレーションサイズの設定に対する安定性が確認された。
空間データに対する変分近似制限最尤推定 [math.DS, cs.SY, eess.SY, stat.ML, cs.LG, stat.AP]目的:空間データの統計的推論の効率化
- 空間データは地理的分布の分析に不可欠であり,生態学,疫学など幅広い分野で利用されている。
- 従来の制限最尤推定法は計算コストが高く,大規模データへの適用が困難であった。
- 変分推論を用いることで,計算効率を向上させ,大規模空間データの分析を可能にすること。
- 提案手法である変分制限最尤推定(VREML)は,ガウス変分分布を用いて周辺尤度を近似する。
- VREMLは,空間ランダム効果と分散成分を同時に推定するための効率的な座標上昇アルゴリズムを提供する。
- 理論的にELBOの単調収束が証明され,ガウスICAR設定下では変分族が正確であることが示された。
物理システムの安定性と受容性のデータ駆動型発見のためのニューラル演算子フレームワーク [physics.flu-dyn, cs.AI]目的:物理システムの安定性と受容性のデータ駆動型発見
- 複雑なシステムの応答理解は,科学技術における根源的な課題である。安定性解析は,現象の解明に不可欠。
- 従来の解析手法は方程式や線形化を必要とし,非線形システムやモデリングが困難なシステムへの適用が制限される。
- 観測データのみから安定性や最適な強制応答を自動的に特定し,方程式を必要としない手法を開発する。
- ニューラルネットワークをダイナミクスエミュレータとして学習させ,自動微分によってヤコビ行列を抽出することで,固有モードとResolventモードを直接データから計算した。
- カオスモデルや高次元流体流れにおいて,支配的な不安定モードと入出力構造を非線形領域でも正確に特定できた。
- ニューラルネットワークに基づくエミュレータにより,複雑なダイナミクスの表現と,これまで困難だった詳細なパターン解析が可能となった。
Pythonにおける共形異常検知:nonconformを用いたヒューリスティックな閾値からの脱却 [quant-ph, cs.AR, cs.ET, math.OC, cs.SY, eess.SY, stat.ML, stat.ML, cs.LG, stat.CO]目的:異常検知における統計的妥当性を保証するp値の算出と,それに基づく異常検知手法の提供
- 異常検知は,不正検知や故障予測など,様々な分野で不可欠な技術である。
- 既存の異常検知システムはスコアを出力するのみで,閾値設定が主観的になりがちである。
- 共形異常検知を用いて,統計的に妥当なp値に基づいた客観的な異常検知を可能とする。
- 本研究で開発されたPythonパッケージnonconformは,既存の機械学習ワークフローに容易に統合可能である。
- nonconformはscikit-learnやPyODとの連携を可能にし,多様な共形化戦略をサポートする。
- 実験結果は,実装された手法が統計的に原理に基づいた異常検知を可能にすることを示す。
ロバストな強化学習のための確率的状態空間モデルにおける敵対的観測 [nlin.CG, cs.FL, stat.ML, cs.LG, stat.ME]目的:部分観測または敵対的観測下における環境の潜在状態とそれに関連する不確実性の正確な推論
- ロボティクス等の安全性が重要な応用において,センサーノイズや部分的な故障,敵対的な状況下での信頼性は不可欠である。
- 観測データが敵対的に改ざんされた場合,潜在状態の推論が歪み,強化学習エージェントの性能が低下する可能性がある。
- 敵対的な観測の影響を軽減し,ロバストな推論と意思決定システムを構築することを目的とする。
- 敵対的な観測は,尤度制約を満たしつつ,潜在状態の推論を変化させ,強化学習エージェントの性能に影響を与えることが示された。
- 推定された影響と最も破壊的な方向との比較により,観測の影響を選択的に減衰させるオンラインベイズ防御を提案した。
- 提案手法は,残りの観測空間における情報を保持しつつ,ロバストな推論と意思決定を可能とする。
