arXiv雑要約
AI - 2026/08/03 公開
LightningRL:強化学習によるブロック型dLLMの精度と並列性のトレードオフ解消 [cs.LG]目的:ブロック型dLLMの速度と品質のパレート最適化
- 拡散大規模言語モデルは並列トークン生成の有望な手法であり,並列化による効率化が求められている。
- 既存のdLLMでは,並列化度を高めると精度が低下し,生成の不安定性が増すというトレードオフが存在する。
- 高並列化下での近似誤差や局所的な破損を防ぎ,並列生成の信頼性を向上させることを目指す。
- LightningRLは,事前学習済みのdLLMに対して,強化学習を用いて速度と品質のバランスを最適化する。
- 実験の結果,数学およびコーディングのベンチマークにおいて,精度を維持しつつ並列性を大幅に向上させることが示された。
- 平均TPFは7.32に達し,MBPPデータセットでは最大11.10を記録した。
ナラティブ生成における分布外のバイアス軽減のための事前条件付きテスト時適応 [cs.CL, cs.AI, cs.CY]目的:ナラティブ生成における分布外バイアス軽減
- 大規模言語モデルの普及に伴い,生成されるテキストの公平性確保が重要視されている。
- バイアス除去されたモデルでも,未知のバイアスを含むプロンプトに対して性能が低下する。
- テスト時にリアルタイムでバイアスを検出し,モデルを適応させることで性能劣化を防ぐ。
- 提案手法CAP-TTAは,バイアスリスクスコアに基づいてLoRA更新をトリガーし,高速かつ安定した最適化を実現した。
- 複数のベンチマークと人間による評価において,CAP-TTAは毒性/バイアススコアを効果的に低減し,既存手法よりも低いレイテンシで実現した。
- また,破滅的な忘却を防ぎ,バイアス軽減性能を損なうことなく,ナラティブの流暢性を大幅に向上させた。
ビデオ推論の解明 [cs.CV, cs.AI]目的:ビデオモデルにおける推論メカニズムの解明
- ビデオ生成技術の進展は目覚ましく,その応用範囲は広い。人工知能分野における重要な研究課題である。
- 既存研究では,ビデオモデルの推論メカニズムが不明確であり,その能力を最大限に引き出すことができていない。
- ビデオモデルがどのように推論を行うのか,その根本的なメカニズムを明らかにすることを目指す。
- 拡散過程におけるノイズ除去ステップを通じて,複数の候補解を探索し,徐々に最終的な答えに収束する「ステップの連鎖(CoS)」というメカニズムを発見した。
- モデルは,一貫した参照を必要とするタスクにおいてワーキングメモリを活用し,また,誤った中間解からの復旧や改善を行う自己修正機能を有している。
- Diffusion Transformer層の中間層が主要な推論処理を実行すること,および異なるランダムシードで生成された潜在軌跡を組み合わせることで推論能力を向上させられることを示した。
効率的な検索モデル適応のためのオンラインデータ剪定:OPERA [cs.IR, cs.AI, cs.CL, cs.LG]目的:検索モデル適応におけるデータ剪定による効率と効果の向上
- ドメイン特化型ファインチューニングは検索性能に不可欠だが,計算コストが高い。
- 全てのデータペアが学習に等しく貢献するわけではなく,非効率な学習が発生しやすい。
- データペアの質のばらつきに着目し,効率的なデータ選択によるモデル適応を目指す。
- 静的剪定(SP)はランキング性能を向上させるが,検索網羅率は低下するトレードオフが確認された。
- 動的剪定(DP)は,クエリとドキュメントレベルで学習確率を調整し,ランキングと検索の両方を改善する。
- DPは標準的なファインチューニングと比較して,学習時間を50%短縮し,同等の性能を実現した。
実世界コンパイラのためのエージェント的ハーネス [cs.IR, cs.SE, cs.AI]目的:コンパイラバグの理解と修正を支援するハーネスの開発
- 現代の計算機科学において,コンパイラは不可欠な存在であり,その信頼性が重要である。
- コンパイラバグの修正は難しく,専門知識や詳細なバグレポートが不足していることが課題である。
- LLMエージェントを活用し,コンパイラバグの修正を効率化することを目的とする。
- llvm-harnessは,LLMエージェントがコンパイラバグを理解し修正するのを支援する初のハーネスである。
- ハーネスの導入により,最先端のエージェントの性能が62%向上し,専用エージェントはさらに22%上回った。
- コンパイラエンジニアリングタスクにおいて,専用ハーネスの必要性が示唆されたが,課題も残る。
ペルソナ条件付き強化学習による専門家の視点に合わせた科学的説明の形成 [cs.AI, cs.HC]目的:科学的発見における説明の質と専門家の判断の多様性
- 科学的発見において,説明可能性のあるAIの重要性が高まっている。
- 既存手法では,説明の質が普遍的ではなく,専門家によって評価が異なる点が考慮されていない。
- 専門家の判断における認識論的な差異に適応した説明生成を目指す。
- ペルソナ条件付きの説明は,汎用的な説明よりも好まれ,関連性と妥当性の認識が向上した。
- 生成された説明は,最先端の予測性能と同等またはそれを上回り,専門家からのフィードバック時間を大幅に削減した。
- 説明の質は視点に依存し,この多様性のモデル化が,科学的発見のためのスケーラブルで人間中心の説明生成を可能にする。
デコーディング制約付きビームサーチによる言語モデルにおけるニア完全一致抽出リスクの推定 [cs.CL, cs.LG]目的:言語モデルにおけるニア完全一致抽出リスクの定量化
- 大規模言語モデルのプライバシーと著作権保護は重要であり,情報漏洩のリスクを評価する必要がある。
- 従来の抽出方法では,ニア完全一致の抽出リスクを捉えきれず,プライバシー侵害や著作権侵害の潜在的リスクを見過ごす可能性がある。
- ニア完全一致抽出リスクの定量化を効率化し,より正確なリスク評価を可能にすることを目指す。
- デコーディング制約付きビームサーチは,ニア完全一致抽出リスクの下限を,モンテカルロ法と比較して少ない計算コストで算出できる。
- 従来の完全一致抽出方法では見えなかった多くの抽出可能なシーケンスと,より大きな抽出質量が明らかになった。
- モデルサイズやテキストの種類によって,ニア完全一致抽出リスクにパターンが存在することが示された。
Sim2Realゼロショット強化学習のための最大エントロピー行動探索 [cs.LG, cs.AI]目的:ゼロショット強化学習における行動探索手法
- ロボットの汎用的な制御を実現するには,事前知識なしでの学習が不可欠である。
- 下流タスクが不明な状況下での,多様で適切な事前データ収集が困難である。
- ロボットのリアルワールドでの利用に適した,自然で実用的な行動ポリシーの獲得。
- FB-MEBEは,最大エントロピー行動探索と正則化クリティックを組み合わせることで,多様なデータを生成する。
- シミュレーション環境での複数の下流タスクにおいて,他の探索戦略と比較して性能が向上した。
- 得られたポリシーは自然であり,追加のファインチューニングなしでハードウェアに直接デプロイ可能である。
物理学から代理知能へ:TSVネットワークの統一された電気熱最適化フレームワーク [cs.LG, cs.AR]目的:TSVネットワークの電気的・熱的特性を考慮した最適化手法の開発
- 高密度実装のニーズが高まり,2.5D/3Dヘテロジニアス集積の鍵となるTSVの重要性が増している。
- TSVは電気的結合や自己発熱により,信号品質や信頼性に課題を抱えており,設計が困難である。
- 従来のシミュレーションは計算コストが高いため,効率的なTSVの最適化手法が求められている。
- 物理モデル,グラフニューラルネットワーク(GNN)を用いた代理モデル,フルウェーブシミュレーションを組み合わせることで,計算コストを大幅に削減した。
- 提案手法は,TSVアレイのSパラメータと熱伝導率を高い精度で予測し,数百万の設計を短時間で探索することを可能にした。
- 最終設計はAnsys HFSS/Mechanicalによる検証で妥当性が確認され,電気熱共設計の迅速化に貢献する。
生成AIの実践:Alibabaの顧客サービス業務におけるフィールド実験的証拠 [cs.HC, cs.AI]目的:生成AIアシスタントがEコマースのアフターセールスにおけるサービスパフォーマンスに与える影響
- 顧客対応の効率化と品質向上は,Eコマースの発展において不可欠である。
- 顧客対応における人的リソースの限界や,対応品質のばらつきが課題となっている。
- 生成AIの導入による顧客対応の効率化と,エージェントのパフォーマンス向上を目指す。
- 生成AIの導入は,顧客評価による主観的なサービス品質と対応速度の向上に貢献する。
- 客観的なサービス品質(顧客の再問い合わせ率)には有意な影響は見られなかった。
- 生成AIは,パフォーマンスの低いエージェントの能力向上に特に有効であり,パフォーマンス格差の縮小に繋がる可能性がある。
アクションパーティ:生成ビデオゲームにおける複数主体のアクション結合 [cs.CV, cs.AI, cs.LG]目的:生成ビデオゲームのための複数主体のアクション制御モデル
- インタラクティブな環境シミュレーションの可能性を秘めており,ゲーム開発やロボティクスなど,幅広い分野への応用が期待されている。
- 既存のビデオ拡散モデルは単一エージェントに限定され,シーン内の複数エージェントを同時に制御することが困難である。
- 特定の行動を対応する主体に結びつけるという,ビデオ拡散モデルにおけるアクション結合の根本的な問題を解決することを目指す。
- ActionPartyは,各主体の状態を永続的に捉える状態トークンを導入し,複数主体のアクション制御を可能にした。
- Melting Potベンチマークにおいて,最大7人のプレイヤーを46種類の多様な環境で同時に制御できることを示した。
- アクション追従の正確性とIDの一貫性が大幅に向上し,複雑な相互作用を通じて主体の追跡も実現した。
販売を左右する要因:LLMエージェントによるエンドツーエンド小売ダイナミクスのシミュレーション [cs.AI, cs.CL]目的:小売戦略の評価
- 小売戦略の効果検証は重要であり,市場の動向を理解し,売上向上に繋げる上で不可欠である。
- 既存のシミュレーターは小売プロセスの断片的な側面しか捉えられず,段階間の依存関係の評価が困難である。
- 本研究は,小売戦略の早期決定が下流の結果に及ぼす影響を評価できるシミュレーション環境の構築を目指す。
- RetailSimは,多様な製品,個性的なエージェント,複数回の対話を通じて,高い忠実度を持つ小売シミュレーション環境を実現した。
- RetailSimは,人間の行動の忠実性評価と現実世界の経済的規則性との比較により,人口統計的購買行動や価格と需要の関係などを再現することに成功した。
- 本フレームワークは,パーソナ推論,売り手と買い手の相互作用分析,販売戦略評価など,小売戦略の探索に役立つ制御されたテストベッドとしての可能性を示す。
コンパイルされたAI:LLMベースのワークフロー自動化のための決定論的コード生成 [cs.SE, cs.AI]目的:LLM(大規模言語モデル)を活用したワークフロー自動化における,決定論的なコード生成によるシステムの実現
- 高精度なワークフロー自動化は,業務効率化やコスト削減に不可欠であり,企業の競争力向上に貢献する。
- LLMの予測不可能性やセキュリティリスクが,エンタープライズワークフローへの導入を阻害する要因となっている。
- 検証済みのテンプレートにLLMの生成を限定することで,予測可能性,監査可能性,安全性を高めることを目指す。
- 関数呼び出しタスクにおいて,コンパイルされたAIは17トランザクションでランタイム推論と同等の性能を発揮し,1,000トランザクションでトークン消費量を57倍削減した。
- ドキュメントインテリジェンスタスクでは,主要フィールド抽出においてDirect LLMと同等の性能(KILE:80.0%)を示し,行項目認識精度で上回った(LIR:80.4%)。
- セキュリティ評価では,プロンプトインジェクション検出で96.7%,静的コード安全分析で87.5%の精度を達成し,偽陽性はゼロであった。
AR環境における人間行動に着想を得た長文一人称視点動画理解のためのベンチマーク [cs.LG]目的:人間行動に着想を得た長文一人称視点動画理解の評価
- AR技術の応用が期待される一人称視点動画理解は,現実世界とのインタラクションに不可欠である。
- 既存のベンチマークは,カメラ視点中心で人間行動の考慮が不十分であり,自然な質問生成が課題である。
- 人間の注意情報を活用し,より現実的な評価設定を提供することで,課題解決を目指す。
- 本研究では,人間の視線データから抽象化された注意情報を活用し,5,000組以上の多肢選択問題を用意した。
- EgoEverythingは,100時間以上の動画データに基づき,自然な人間行動を捉えた評価を可能にする。
- これにより,AR環境における長文一人称視点動画理解の性能評価の信頼性を向上させる。
世帯意思決定のためのペルソナを活用したマルチエージェント交渉 (PEMAND) [cs.AI]目的:世帯レベルの意思決定モデルの構築
- 現実世界の様々な応用において,世帯レベルの意思決定のモデル化は重要である。
- 既存研究では,予測能力が限られた古典的な機械学習モデルが主流であり,LLMベースのアプローチは行動理論や世帯内相互作用を考慮していない。
- 行動理論に基づいたペルソナモデルとマルチエージェント交渉により,より現実的な世帯意思決定を可能にすること。
- PEMANDは,世帯の属性を,態度や規範を明示的に記述したナラティブプロファイルに変換するHA-CoPBフレームワークを提案する。
- PEMANDは,二段階のマルチエージェント会話フレームワークとペルソナ整合制御メカニズムによって,現実の世帯意思決定交渉を捉える。
- 旅行行動と居住地移動のデータセットを用いた評価において,PEMANDは最先端のベンチマークを安定的に上回る性能を示した。
衛星画像に基づく洪水マッピングにおけるGeoAIの説明とドメイン知識の整合性評価 [eess.SY, cs.SY, cs.RO, cs.MM, cs.CV, cs.AI]目的:衛星画像を用いた洪水マッピングにおけるGeoAIモデルの説明とドメイン知識の整合性評価
- 地球観測技術の発展により,衛星データを用いた洪水マッピングは重要な洪水監視手法となっている。
- 深層学習モデルの意思決定過程が不透明であり,科学的・実運用ワークフローへの組み込みの障壁となっている。
- 深層学習モデルの説明が,リモートセンシングの確立された知識と整合しているかを評価する枠組みを構築する。
- 提案するADAGEフレームワークは,モデルの説明とドメイン知識由来の説明の整合性を定量的に評価できる。
- ADAGEフレームワークは,整合性スコアを通じて,専門家が誤った説明を特定するのに役立つ。
- 本研究は,地球観測におけるGeoAIの説明可能性とドメイン知識の間のギャップを埋め,実用性を高める。
幾何学的制約によるLLM生成におけるモード崩壊からの脱却 [cs.CL, cond-mat.dis-nn, cs.AI, nlin.CD]目的:LLM生成におけるモード崩壊の抑制
- 生成モデルは多様な出力を生み出すことが重要だが,モード崩壊がその妨げとなる
- 既存手法では,トークンレベルでの制約や確率的な手法でモード崩壊を完全に解決できていない
- モデル内部表現空間における幾何学的崩壊を抑制し,多様な生成を可能にすること
- 提案手法RMRは,Transformerのキャッシュに低ランク減衰を適用することで,モード崩壊を大幅に抑制する。
- RMRを用いることで,標準的なデコーディング手法が崩壊する低エントロピー領域でも安定した生成が可能となる。
- 実験結果から,RMRは複数のLLMで有効であり,0.8nats/stepという極めて低いエントロピー率でも生成を維持できることが示された。
ソフトウェア運用に特化した大規模言語モデルの構築:多段階学習によるOpsLLM [cs.LG]目的:ソフトウェア運用における大規模言語モデル
- ソフトウェア運用は,システムの安定稼働に不可欠であり,その効率化は重要である。
- 既存LLMは,品質の低いデータや知識の断片化により,高度な自動運用が困難である。
- 高品質なデータと学習手法により,ソフトウェア運用に特化したLLMを開発し,その性能を向上させる。
- OpsLLMは,知識ベースの質問応答と根本原因分析の両方をサポートするドメイン特化型LLMである。
- 実験結果から,OpsLLMは既存のオープンソースおよびクローズドソースLLMと比較して,質問応答タスクで0.2%〜11.9%,根本原因分析タスクで8.5%〜70.3%の精度向上を示した。
- OpsLLMの7B,14B,32Bパラメータバージョンと,15Kのファインチューニングデータセットをオープンソースで公開する。
予測と拡散:拡散LLMにおける計算予算に応じた推論のための適応応答長 [cs.LG, cs.AI]目的:拡散LLMにおける計算予算に基づいた推論のための適応応答長の実現
- 拡散LLMは生成AIの有望な手法であり,並列トークン生成によるスループット向上やGPU利用率の向上が期待されている。
- 従来の拡散LLMでは応答長を事前に固定する必要があり,計算資源の無駄や出力の切り捨てといった問題が生じていた。
- 入力クエリに応じて応答長を予測し,それに基づいて推論を行うことで,計算資源の浪費を抑え,効率的な推論を実現する。
- 提案手法「Predict-then-Diffuse」は,応答長を予測してから拡散LLMで推論を行うことで,計算コストを大幅に削減できる。
- 応答長予測器(AdaRLP)とデータ駆動型の安全機構により,応答長の過小予測を防ぎ,出力品質を維持している。
- 複数のデータセットでの実験により,提案手法が従来の拡散LLM推論メカニズムと比較して,計算コストを効果的に削減できることが示された。
画像生成モデルを活用したデータ不足への対処:森林再生マッピングのためのGen4Regenデータセット [cs.CV, cs.AI, cs.LG, cs.RO]目的:森林再生マッピングのためのデータセットと,画像生成モデルを用いたデータ拡張手法
- 持続可能な森林管理には正確な樹種構成マッピングが不可欠であり,効率的な手法が求められている。
- 高精度な深層学習モデルの適用は,専門家によるアノテーションデータの不足によって制約されている。
- AI生成データの活用により,アノテーション不足を補い,高性能な森林再生マッピングを実現する。
- 大規模ビジョンモデルによる画像生成が,専門家によるアノテーションが少ない分野における知覚タスクを効果的に支援する。
- AI生成データと実データとを組み合わせることで,F1スコアが15%以上向上し,特に少数クラスの性能が大幅に改善された。
- Gen4RegenデータセットとWilDReF-Q-V2データセットを公開し,森林再生マッピング研究の促進に貢献する。
スパイクニューラルネットワークを用いたAI生成動画の検出 [cs.CV, cs.AI]目的:AI生成動画の検出手法の開発
- AI技術の発展により,精巧な偽動画が容易に作成可能となり,社会への悪影響が懸念される。
- 既存の検出手法は,生成モデルの種類が異なると性能が著しく低下する。
- フレーム間の時間的な滑らかさの差異に着目し,汎化性能の高い検出手法を確立する。
- AI生成動画は,ピクセルレベルでのフレーム間残差がより滑らかであり,意味特徴空間における軌跡がよりコンパクトである。
- スパイクニューラルネットワーク(SNN)は,動画のオブジェクトや動きの境界で活動が活発化し,時間的なアーティファクトに反応することが示された。
- MASTと呼ばれる手法を提案し,GenVideoベンチマークにおいて,10個の未知の生成モデルに対し93.14%の平均精度を達成した。
継続的コンプライアンス監視下における戦略的監査対象者ゲームのベンチマーク [cs.CY, cs.GT, cs.LG]目的:継続的コンプライアンス監視下における戦略的監査対象者ゲームの評価
- AI規制の強化に伴い,コンプライアンス監査の重要性が増している。
- 従来の入力/出力ゲームとは異なり,時間経過に伴う戦略的行動が問題となっている。
- 監査対象者が時間経過と共に変化する状況下で,監査の有効性を高めることを目指す。
- 継続的監査は,監査対象者と監査者の間のStackelbergゲームとして定式化された。
- 静的監査設計には,カバレッジギャップと粒度ギャップを同時に解消できないという構造的な特徴が存在する。
- サンプルサイズを考慮したルールや履歴に基づいた疑念のエスカレーションにより,カバレッジギャップと粒度ギャップをそれぞれ解消できることが示された。
ニューラルネットワークのための非線形特異値理論 [cs.LG, cs.AI]目的:ニューラルネットワークにおける非線形特異値分解の表現
- 深層学習モデルの理解と解釈は,AI技術の発展に不可欠である。
- 既存の手法では,非線形ニューラルネットワークの内部表現を解析することが困難であった。
- 本研究は,ニューラルネットワークの非線形特異値分解による解析手法を確立し,解釈可能性を高める。
- 現代の多くのニューラルネットワークアーキテクチャが,入力・出力挙動を変えることなく,この非線形特異値分解表現を持つことが示された。
- 分解されたネットワークは,左可逆な非線形写像と最終線形層から構成され,埋め込み空間での距離が入力空間の距離と対応する。
- この理論は,潜在空間のプルバック,バイアス検出,メンバーシップ推論の堅牢性など,ニューラルネットワーク分析における新しいアプローチを支援する。
SREGym:高忠実度な障害シナリオによるAI SREエージェントのライブベンチマーク [cs.AI]目的:AI SREエージェントの性能評価のためのベンチマーク
- システム運用におけるAIの活用が重要視されており,特に障害対応の自動化が求められている。
- 既存のベンチマークは単純化されすぎており,実際の運用環境の複雑さを反映できていない。
- 実際のシステム運用環境に近い条件下で,AI SREエージェントの能力を評価する手段を提供する。
- SREGymは,リアルワールドのクラウドネイティブシステムスタック上に構築されたライブシステム環境を提供する。
- 多様な障害シナリオ,ノイズ,そして様々な障害モードをシミュレーションすることで,本番環境の複雑さを再現する。
- 最先端のエージェントの評価を行った結果,障害の種類によって性能に最大40%の差があることが示された。
偽名耐性データ帰属のための商剰セミバリュー [cs.GT, cs.CR, cs.LG]目的:機械学習パイプラインにおけるデータの貢献度評価と支払い分配
- データへの貢献度を正確に評価し,公正な報酬分配を行うことは,機械学習の発展に不可欠である。
- データ提供者が偽名を使用したり,データを複製することで,貢献度評価を不正に操作する可能性がある。
- 偽名操作を抑制し,より公平なデータ帰属を実現するためのメカニズムを提案すること。
- 商剰セミバリューメカニズムは,個々のデータではなく,証拠に基づいた帰属クラスタに基づいて値を計算することで,偽名操作の影響を軽減する。
- 固定された単調データ価値ゲームにおいて,正確なShapley公平帰属と偽名耐性は両立しないことが証明された。
- DataMarket-Gymを用いた実験により,商剰セミバリューは,重複データやニアダブレットによるSybil攻撃に対する操作利益を大幅に削減することが示された。
戦略的応答下における差分プライバシーを用いた監査 [cs.GT, cs.CR, cs.LG]目的:AIシステムの監査における,戦略的な開発者への対応を考慮したプライバシー保護
- AIの社会実装が進む中で,データプライバシー保護とシステム透明性の確保が重要である。
- 従来の監査手法では,開発者が監査を回避する戦略を取る可能性があり,真の潜在的リスクが見過ごされる。
- 開発者の戦略的応答を考慮した監査設計により,より効果的なリスク評価とプライバシー保護を目指す。
- 監査者がプライバシー制約下でクエリポリシーとDP予算を決定し,開発者がそれに応じて対策を再配分する状況をStackelbergゲームとして定式化。
- 単純なDP監査では,検出可能性が不均一な場合,naiveな予算配分が最適な配分よりも大きな未検出の潜在的リスクを生むことを示した。
- 最適な監査者による予算配分は,福祉重み,監査ミス確率,検出可能性弾性,および対策コストの曲率の4つの要素のバランスである。
小売分野における現実世界のポリシー曖昧性下での意思決定と推論のためのベンチマーク:DRIP-R [cs.CL, cs.AI]目的:現実世界の小売分野におけるポリシー曖昧性下での意思決定と推論
- LLMエージェントの活用が進む中で,現実世界の複雑なポリシー理解が重要となる。
- 既存のベンチマークはポリシーの曖昧性を考慮せず,実用的な評価が困難である。
- 現実世界のポリシー曖昧性を再現するベンチマークを構築し,LLMの意思決定能力を評価する。
- DRIP-Rは,単一の正解が存在しない曖昧な返品シナリオを構築することで,現実世界の複雑性を再現している。
- 最先端モデルは,同一の曖昧なシナリオにおいて異なる判断を下し,曖昧性がLLMの意思決定に影響を与えることを示している。
- 本研究は,ポリシー遵守,対話品質,行動整合性,解決品質を多角的に評価するフレームワークを提供する。
P-Flow:線形逆問題に対するプロキシ勾配フロー [cs.LG, cs.CV]目的:線形逆問題に対するプロキシ勾配フローの提案
- 逆問題は,画像復元など多様な分野で重要であり,その解決は応用範囲が広い。
- 従来のフローマッチングは,微分計算の不安定性や計算コストが高いという課題があった。
- プロキシ勾配を用いることで,計算の安定性を高め,効率的な再構成を目指す。
- P-Flowは,プロキシ勾配を用いることで,長鎖微分に伴う数値的不安定性とメモリ消費を抑制することに成功した。
- ガウス球体投影を用いることで,事前分布との整合性を確保し,高次元空間における集中現象を利用している。
- 様々な復元タスクにおいて,P-Flowは,特に極端な劣化条件下で優れた性能を発揮することが示された。
二次元一貫性:推論時スケーリングにおける予算と品質のバランス [cs.AI]目的:推論時スケーリングにおける予算と品質のトレードオフ
- 大規模言語モデルの性能向上には,推論時の計算資源の効率的な活用が不可欠である。
- 既存手法は,サンプリング幅と深さを独立に扱うため,幻覚の増幅や有効な推論の途絶といった問題がある。
- 質の高い推論経路に計算資源を集中させ,幻覚を抑制しつつ,コンセンサスを加速化することを目指す。
- 本手法は,トークン消費量を10倍以上削減しつつ,様々なLLMにおいて既存手法と同等以上の精度を維持または向上させた。
- Confidence-Weighted BayesianプロトコルとTrend-Aware Stratified Pruningを組み合わせることで,計算資源の集中と効率的なフィルタリングを実現した。
- 二次元一貫性(DDC)フレームワークは,推論経路の品質と適応的な終了を統合し,効率的な推論を可能にする。
LLMは価値を維持するか?MANTA:動物福祉推論のための多段階敵対的ベンチマーク [cs.CY, cs.AI, cs.LG]目的:大規模言語モデルにおける動物福祉に関する推論能力の評価
- 動物福祉は倫理的,社会的に重要な課題であり,AIの利用において考慮すべき事項である。
- 既存のベンチマークは単一ターンでの評価に限定され,継続的な敵対的圧力下でのモデルの挙動変化を捉えられていない。
- 本研究は,多段階の対話を通じて,モデルの動物福祉に関する価値観の安定性と道徳的感受性を評価することを目指す。
- MANTAベンチマークは,5ターンの対話を通じてモデルの動物福祉に関する価値観の安定性と道徳的感受性を評価する。
- 7つの最先端モデルの評価により,単一ターン評価では見過ごされる挙動変化が明らかになった。Gemini Flash Liteは特に著しい変化を示した。
- 動物の種類と敵対的圧力の組み合わせによって,動物福祉の頑健性が異なることが示された。家畜動物は野生動物よりも脆弱であることが示唆された。
ビットが壊れた場合の対処法:反事実に基づいた忠実な量子化 [cs.LG, cs.AI, cs.CV]目的:量子化による意思決定への影響と,その改善策の提案
- モデルの量子化は,メモリ使用量や計算コストを削減し,実用化を促進する重要な技術である。
- 量子化によって,精度の維持だけでなく,意思決定に対する影響(反事実的な修正)が損なわれる可能性がある。
- 量子化による意思決定の反事実的な修正の不安定性を軽減し,より信頼性の高いシステムを構築すること。
- 本研究では,量子化されたモデルにおける反事実的な感度を評価するための指標(VD,CRG)を提案した。
- 提案手法CFQは,量子化と同時に反事実的な修正を考慮した学習を行い,VDとCRGを大幅に削減することを示した。
- Adultデータセットにおいて,CFQはVD/CRGを0.121/0.162から0.061/0.071へと改善した。
Prefix-Aware Internal Reward Model:複数ターンエージェント最適化のための接頭辞を意識した内部報酬モデル [cs.IR, cs.AI]目的:複数ターンエージェントの最適化における内部報酬モデルの構築
- 複雑なタスク実行において,大規模言語モデルの性能向上が求められている。
- 既存手法では,中間ステップにおける報酬の割り当てが困難である。
- 隠れ状態のプロービングとアテンション機構を組み合わせ,効率的な報酬信号を生成する。
- 提案手法PAIRは,汚染された軌跡において最高のAUROCを達成した。
- PAIRは,外部モデルの呼び出しや正解データに依存せず,低コストで報酬信号を生成する。
- 隠れ状態プロービングとアテンションベースの特徴量の相補的な関係を活用した。
CompoSE:部品を意識した制御による3D形状の合成と編集 [cs.GR, cs.LG]目的:3D形状の合成と編集手法
- 高品質な3Dコンテンツの作成は,コンピュータグラフィックスにおける重要な課題である。
- 既存手法では,3D形状の局所的な編集が難しく,柔軟性に欠ける場合が多い。
- ユーザが指定した大まかな配置に基づいて,部品単位での編集を可能にすること。
- CompoSEは,拡散Transformerアーキテクチャを用いることで,部品ごとの局所処理と全体的な文脈情報の集約を交互に行う。
- ユーザの入力配置に強く従う新しい条件付け技術により,部品の意味や対称性を自動的に学習する。
- 実験結果から,CompoSEが既存手法よりも,ガイド付き合成において客観的評価およびLLMベースの評価で有意に高い性能を示すことが確認された。
DySink:自己回帰型長尺動画生成のための動的フレームシンク [cs.CV, cs.AI]目的:自己回帰型長尺動画生成における長期的な一貫性維持機構の改善
- 動画生成技術は,エンターテイメントやコンテンツ制作において重要性が増している。
- 既存手法では,長期的な文脈の固定的なキャッシュ管理が課題となっていた。
- 動的に関連性の高いフレームを選択することで,より適切な文脈を維持することを目指す。
- DySinkは,コンパクトなメモリバンクを用いて,視覚的に関連性の高い過去のフレームを動的に選択する。
- シンクアノマリゲートを導入することで,注意機構における過度な合意を抑制し,シンク崩壊を防ぐ。
- 50~100秒の動画実験において,DySinkは既存の自己回帰型ベースラインと比較して,最も高い時間的な品質を実現した。
MARGIN:マルチエージェント基盤モデル協調のための実行時信頼度較正 [cs.DM, math.CO, cs.LG, cs.MA]目的:マルチモデル協調における実行時信頼度較正
- 基盤モデルの利用拡大に伴い,協調システムにおける信頼性評価の重要性が高まっている。
- モデル間での信頼度スコアの比較が困難であり,分布シフトへの対応が課題である。
- モデルアクセスや事前データなしに,オンライン学習で信頼度を較正し,協調精度を向上させる。
- オンライン適応により,設計時方法で生じる信頼度ギャップを大幅に縮小できることが示された。
- 提示するMARGINは,各モデル・各信頼度バンドに対して乗算係数を用いて信頼度を調整する。
- 難しいコード生成タスクにおいて,オンライン較正はモデル選択の精度を大幅に改善する。
MemForest:階層型時間インデックスを用いた効率的なエージェントメモリシステム [cs.RO, cs.DB, cs.AI, cs.MA]目的:長文脈LLMエージェントのメモリシステムの効率化
- LLMエージェントにおける長期的な文脈理解と状態維持は,高度なタスク遂行に不可欠である。
- 既存のシステムは書き込み時の処理にボトルネックが生じ,情報の即時利用が遅れる場合がある。
- 書き込み効率を向上させ,情報の鮮度を維持することで,エージェントの応答性を高める。
- MemForestは,並列抽出により書き込み時のボトルネックを解消し,メモリ構築を効率化する。
- 階層型時間インデックスMemTreeを導入し,局所的な更新によりメモリの鮮度を維持する。
- LongMemEval-SおよびLoCoMoのベンチマークにおいて,既存システムと同等以上の性能と大幅な書き込み速度の向上を実証した。
LearnedCache:LinuxページキャッシュのためのeBPF統合パーセプトロンベースの退去ポリシー [cs.CY, cs.NI, cs.MA, eess.SP, cs.OS, cs.LG]目的:Linuxページキャッシュの退去ポリシー
- OSおよびアプリケーションの性能を左右する重要な要素であるため,ページキャッシュの効率化は重要である。
- 従来の退去ポリシーは,ヒューリスティックな規則に縛られ,柔軟性に欠けるという課題がある。
- eBPFを活用し,機械学習に基づいたより高度な退去ポリシーをカーネル内に実装することで,性能向上を目指す。
- LearnedCacheは,eBPFフレームワークを通じてカーネル内で動作する機械学習ベースの退去ポリシーを開発した。
- ワークロードごとにパーセプトロンを学習させ,ページ再利用の予測精度を高めることで,性能向上を実現した。
- 実験の結果,標準的なカーネルポリシーと比較して,アプリケーションのスループットを最大44%向上させることを示した。
RAPNet:学習された疎な補正による代数多重グリッドの高速化 [cs.LG]目的:大規模な疎行列の効率的な解法
- 科学計算やグラフ解析において,大規模疎行列の解法はボトルネックとなる重要な課題である。
- 従来の代数多重グリッド法では,粗グリッドオペレーターの疎性と収束性のバランスが難しく,性能が制限される。
- 疎性と安定性を両立する粗グリッドオペレーターを学習することで,効率的な解法を実現することを目指す。
- 提案手法RAPNetは,グラフニューラルネットワークを用いて,疎な粗グリッドオペレーターを直接学習する。
- レベルごとの学習戦略により,小規模なサブグラフから学習し,大規模グラフへ一般化することが可能となった。
- 様々な偏微分方程式の離散化やグラフラプラシアンにおいて,従来の非Galerkin法を上回る性能を示した。
ビットにコミット:正しい反応型強化学習 [cs.LG]目的:有限環境における最適な反応型方策の学習
- 現実の環境は部分観測や関数近似によりマルコフ性を満たさない場合が多い。
- 既存手法では,$q_\star$-実現可能性という強い条件が求められていた。
- より弱い条件で最適な反応型方策を学習できる手法を開発すること。
- 新たに提案するCommitted Q-learningアルゴリズムは,直感的なrewire-robustness仮定のもと,ほぼ確実に最適な反応型方策に収束する。
- 本研究では,従来のQ-learningを改変し,特徴に入ると単一のアクションにコミットし,特徴の変化時のみ再サンプリングを行う。
- 準マルコフ環境の概念を導入することで,より厳密な解析を可能にした。
2次元相関スペクトルのノイズ除去に対する完全畳み込みアプローチ [cs.RO, cs.LG, eess.SP]目的:2次元動的相関表現のノイズ除去
- 実験技術において,動的相関を正確に把握することは重要である。その精度は実験結果の信頼性に直結する。
- 従来のノイズ除去手法は,入力サイズに制限があり,多様な動的状態に対応できない場合がある。
- 本研究は,任意のサイズの入力に対応し,相関構造を維持するノイズ除去手法を開発し,動的相関の解析を支援する。
- 完全畳み込みノイズ除去オートエンコーダ(FC-DAE)は,低信号対雑音比条件下でも複雑な動的特徴を効果的に回復することが示された。
- FC-DAEは,実験データを用いて訓練され,データ拡張により過学習を抑制し,多様なデータセットに対応可能である。
- 本研究の結果は,FC-DAEがロバストなノイズ除去性能と高い計算効率を提供し,低光量条件下のXPCSダイナミクスの回復を可能にすることを示している。
ビデオからの物理学:最小限の軌跡条件における時間不変な二階常微分方程式の識別可能性 [cs.CL, cs.HC, physics.data-an, cs.CV, cs.LG, stat.ML]目的:時間不変な二階常微分方程式のパラメータの識別可能性
- 映像から物理法則を理解することは,現実世界のモデル構築において不可欠である。
- 生のピクセルデータから物理パラメータを正確に復元することは困難である。
- 最小限の軌跡データから物理パラメータを識別するための条件を確立すること。
- レベルセット勾配カバレッジ条件は,潜在空間が真の物理状態に対して局所的にアフィンであることを保証する。
- 減衰の少ないシステムは単一のビデオクリップから識別可能であり,他のシステムは3つの多様な軌跡を必要とする。
- 分散下限正則化により,潜在空間の崩壊を防ぎ,物理定数の信頼性の高い推定を実現する。
通信顧客サポートのためのSLMのPEFT:LoRA設定のエネルギー消費分析による比較研究 [cs.CL, cs.CL, cs.AI]目的:通信顧客サポートにおけるドメイン特化型会話アシスタントの構築
- 大規模言語モデルは自然言語処理で高い性能を示すが,通信分野特有の制約への適応は課題である。
- データ主権や規制,顧客情報の扱いの問題から,外部の基盤モデルの利用は困難を伴う。
- LoRAを用いたパラメータ効率的なファインチューニングで,上記課題を解決することを目指す。
- 定量評価と定性評価の間には乖離が見られ,検証損失が低いモデルが必ずしも人間による評価で優位性を示すわけではない。
- 検証損失が最も低いモデルは定性評価では6-7位にランクインする一方,最も損失が高いモデルが両方の評価者から1位と評価された。
- 本研究は,合成データセット構築手法,LoRA注入ターゲットモジュールの選定に関する知見,および持続可能なLLM導入のためのエネルギー性能トレードオフ分析を提供する。
自己修正の幻想:大規模言語モデルにおける役割ラベル付けが明示的なエラーフラグ付けを制御する [cs.AI, cs.CL]目的:大規模言語モデルにおける自己修正のメカニズムの解明
- 大規模言語モデルは高度な能力を示す一方,推論過程における自己修正が苦手である点が課題となっている。
- 大規模言語モデルは外部からの修正は可能だが,自身の推論ミスを修正できないという矛盾した現象が見られる。
- 役割ラベル付けが自己修正の能力に与える影響を検証し,修正能力向上への道筋を示す。
- 役割ラベルを「思考」から外部の役割に変更することで,明示的な自己修正率が大幅に向上することが示された。
- 修正効果はモデルの種類や実験ドメインによって異なり,「記憶」やユーザーメッセージが有効なラベルとなる場合がある。
- 役割ラベルの扱いを考慮した実験設計が,大規模言語モデルの自己修正能力向上に不可欠であることが示唆された。
テラヘルツ分光法を用いたポリマー分類のためのマルチスケール特徴注意ネットワーク [cs.LG, cs.AI]目的:ポリマー分類の精度向上
- リサイクルプラスチックの品質と安全確保のため,信頼性の高いポリマー識別が不可欠である。
- 従来の選別・分光技術では,頑健な識別が困難な場合がある。
- テラヘルツ分光法と深層学習を組み合わせ,効率的かつ解釈可能なポリマー分類を実現する。
- 提案するマルチスケール特徴注意ネットワーク(MSFAN)が,最先端モデルと比較して一貫して高い分類精度を示した。
- MSFANは,85.2%という分類精度を達成し,テラヘルツデータに特化した深層学習アーキテクチャの有効性を示した。
- 本研究は,テラヘルツ分光法と深層学習の組み合わせが,ポリマー分類において効果的である可能性を実証した。
有限要素法-AIハイブリッドアプローチによるモータ設計最適化のためのマルチエージェントシステム [cs.RO, cs.AI, cs.MA]目的:内永久磁石同期モータ(IPMSM)の設計最適化
- モータ設計は,エネルギー効率向上や高性能化に不可欠であり,産業競争力に直結する重要な分野である。
- 従来のモータ設計ワークフローは,専門知識への依存度が高く,計算コストが大きいため,効率的な最適化が困難である。
- 大規模言語モデル(LLM)を活用し,設計の自動化と計算コストの削減を実現することで,モータ設計の効率と精度を向上させる。
- 設計エージェントにより,モータ設計問題に対する自然言語での問題設定精度が50%から67-80%に向上した。
- 学習エージェントがソルバーの失敗履歴を解析し,AI学習のためのジオメトリサンプリングの成功率を28%から84%に改善した。
- 不確実性認識型有限要素法-AIハイブリッドモデルは,従来の有限要素法のみの探索と比較して,単目的最適化において最大44%の鉄損低減,多目的最適化において22.5%のハイパーボリューム向上を達成した。
オイラー特性変換の符号化 [cs.RO, cs.RO, cs.LG, math.AT]目的:線形埋め込み細胞複合のオイラー特性曲線と,その変換による形状記述子の符号化手法
- 多様なデータ形状を効率的に表現し,比較・分類する技術は,計算幾何学や機械学習において不可欠である。
- 従来のオイラー特性変換の符号化は離散化に依存しており,連続的な表現が課題となっていた。
- 頂点ごとのオイラー特性変化量を記録する連続的な符号化によって,表現能力の向上を目指す。
- 提案手法は,点群,グラフ,立方体複合体,メッシュを含む6つの分類ベンチマークにおいて,既存手法と比較して精度が向上した。
- 精度の向上は,離散化された表現ではなく,トークン化自体に起因することが確認された。
- 符号化手法が表現アーキテクチャよりも重要であり,その効果は符号化方式に依存することが示された。
Role-Agent: 二つの役割による進化を通じたLLMエージェントのブートストラップ [cs.AI]目的:LLMエージェントのブートストラップ進化
- 複雑なタスクにおいてLLMエージェントの性能は高いが,汎化性能向上が課題である。
- 従来の学習方法は,非効率なフィードバックと静的な環境に起因する学習の限界がある。
- エージェントと環境を同一LLM内で実現し,相互進化させることで学習効率を高める。
- Role-Agentは,LLMをエージェントと環境の双方として機能させることで自己学習を可能にする。
- World-In-Agent (WIA) は予測と現実のずれを報酬として環境認識を促す。
- Agent-In-World (AIW) は失敗事例から類似タスクを抽出し,効果的な訓練データを提供する。
APPO:主体的な手続き型方策最適化 [cs.LG, cs.AI]目的:大規模言語モデルエージェントにおける,より詳細な意思決定ポイントへの分岐と信用割り当ての改善
- 大規模言語モデルエージェントのマルチターンツール利用能力向上は重要である。
- 既存手法では,粗い単位での信用割り当てが課題であり,重要な中間的決定を特定しにくい。
- 生成シーケンス内の影響力のある決定ポイントを特定し,より効果的な信用割り当てを実現する。
- APPOは,トークン不確実性と方策による継続確率向上を組み合わせた分岐スコアを用いることで,効率的な探索を可能にする。
- 手続きレベルの優位性スケーリングにより,分岐ロールアウト全体に信用を適切に分散させる。
- 13のベンチマークにおいて,APPOは既存のベースラインを約4ポイント改善し,ツール利用の効率性と解釈性を維持する。
LLMの推論と要約を強化学習で相乗的にする [cs.AI]目的:大規模言語モデルにおける長期的推論の改善
- 大規模言語モデルの推論能力は,様々なタスクにおいて重要であり,その向上はAI研究の核心である。
- 従来の強化学習による推論手法は,不必要に長い推論を展開し,一貫性を損なう可能性がある。
- ReSumは,自己要約を通じて推論軌跡を圧縮・整理し,推論の効率と正確性を高めることを目指す。
- ReSumは,自己要約によってトークンレベルのエントロピーを低下させ,生成の安定性を高める。
- 要約句の導入は,誤った推論プレフィックスから伝播する誤りを大幅に軽減できることが示された。
- 実験結果から,ReSumは平均で4%の性能向上と18.6%のロールアウト長の短縮を実現した。
3Dプリンターにおけるノイズキャンセリングがサイドチャネル攻撃を生き残る [cs.CR, cs.ET, cs.LG]目的:3Dプリンターのノイズキャンセリング機能がサイドチャネル攻撃に与える影響の評価
- 3Dプリンターの利用拡大に伴い,セキュリティリスクの評価が重要になっている。
- サイドチャネル攻撃は,設計意図とは異なる情報を漏洩させる可能性があり,対策が困難。
- ノイズキャンセリング機能がセキュリティに及ぼす影響を定量的に評価し,対策の方向性を示す。
- アクティブ・モーター・ノイズキャンセリングは,音響放射を抑制するが,サイドチャネル攻撃の情報を完全には除去しない。
- 60秒間の記録では,音響分類の精度が向上するが,印刷時間自体が主要な識別子となる。
- 振動データには幾何学的情報が含まれるものの,印刷時間との組み合わせでは有意な改善は見られなかった。
