arXiv雑要約
AI - 2026/08/04 公開
エージェント型一次ステラレータ最適化:有限ベータ平衡状態のための自律型多目的探索 [cs.AI]目的:有限ベータ平衡状態を実現するステラレータ形状の探索
- 核融合炉開発において,プラズマ閉じ込め性能の高いステラレータ形状設計は重要である。
- 従来のステラレータ設計は,専門知識と多大な計算資源を必要とし,効率が課題であった。
- 本研究は,AIエージェントによる自動最適化を通じて,設計プロセスの効率化を目指す。
- エージェント型最適化により,有効なプラズマ形状の数が大幅に増加した。
- Boozer QS RMSと最大主曲率がそれぞれ低減され,プラズマ閉じ込め性能が向上した。
- 最適化過程の記録は,将来の設計における意思決定データの再利用を可能にする。
隠れた交絡と干渉下における時空間近接因果推論 [cs.LG, cs.AI]目的:隠れた交絡と干渉が存在する時空間データからの因果効果推定
- 気候変動,環境政策,疫学など,多くの分野で因果推論が不可欠である。
- 観測されていない交絡因子が,治療と結果の両方に影響を及ぼす場合,従来の因果識別法は適用できない。
- 隠れた交絡因子と時空間干渉が存在する場合でも,因果効果を推定するための新しい枠組みを提供する。
- 本研究では,時空間データに対して,近接識別理論を拡張した新たな因果推論フレームワークを提案する。
- 治療と結果を誘導するプロキシを用いて,局所的および近隣レベルの交絡情報を捉え,潜在的な結果を特定する。
- 提案手法は,合成データセットにおいて,既存の因果推論手法と同等の性能を示し,理論的根拠に基づいた結果を提供する。
ニューラルネットワークは本当に次元の呪いを克服するか?ビット複雑性からの考察 [cs.LG]目的:関数クラスの近似レートの比較
- 近似理論は重要であり,機械学習の効率的な計算を理解する上で不可欠である。
- 従来のパラメータ数に基づく評価では,有限精度計算における効率が正確に測れない。
- ビット複雑性に基づいた新しい評価枠組みを構築し,近似性能の限界を明らかにする。
- 従来の近似手法は,ビット複雑性に基づくと,理論的な限界に達していない場合が多いことが示された。
- ニューラルネットワークは,古典的な手法と同程度の近似性能しか持たないことが示唆された。
- ニューラルネットワークの優位性は,関数クラスの複雑性に由来するものであり,アーキテクチャ自体によるものではない可能性がある。
言語モデルによるハイステークス意思決定:緊急トリアージからの洞察 [cs.AI]目的:言語モデルを用いた緊急トリアージにおける意思決定の仕組み
- 医療現場など,不確実性の高い状況下での意思決定は,人命に関わる重要な課題である。
- 言語モデルが臨床推奨に利用される際,意思決定を司る有用性の明示が不足している場合がある。
- 言語モデルの意思決定プロセスを確率的決定フレームワークとして理解し,有用性を明示することで,より適切な活用を目指す。
- 言語モデルは,提示された有用性に応じて推奨を調整し,同じ予測に基づいて異なる意思決定ポリシーを支持することが示された。
- 効果的な導入には,予測精度の向上だけでなく,意思決定の目的を明確にすることが不可欠である。
- ハイステークスなアプリケーションにおける言語モデルは,予測性能と明示的な有用性に依存する確率的決定システムとして理解すべきである。
適切な質問の仕方:複雑なタスク解決におけるプロンプト作成のためのマルチエージェント会話システム [cs.MA, cs.AI]目的:複雑なタスク解決におけるプロンプトの構造化
- 大規模言語モデルの活用が不可欠だが,性能はユーザーのプロンプト品質に左右される。
- 反復的なプロンプト改善は,文脈の劣化や認知負荷の増大を招く可能性がある。
- 意図の明確化を重視したプロンプト作成支援を通じて,AIとの協調を円滑化する。
- PAWNIは,エージェント間の会話を通じて,非構造化されたクエリを構造化されたプロンプトに変換する。
- PAWNIを使用することで,プロンプトの構造的完成度が大幅に向上し (42%から91%へ),LLMの出力品質も向上した。
- PAWNIを使用した場合,参加者は1ターンで十分な出力を得たのに対し,支援なしでは1~12ターンを要した。
不正確な信念融合がマルチエージェントにおける社会的学習を改善する [cs.MA, cs.AI, physics.soc-ph]目的:マルチエージェントにおける社会的学習の有効性に対する不正確さの役割
- 社会生活において,他者との相互作用を通じた学習は重要であり,集団知の形成に不可欠である。
- 既存の社会的学習モデルでは,信念の正確性が重視されがちで,不正確さがもたらす影響が十分に考慮されていない。
- 初期の誤った信念が強い集団において,信念融合における不正確さが学習精度を向上させる可能性を検証する。
- 初期に誤った信念が強い集団において,ある程度の信念融合の不正確さが学習精度を向上させる傾向が示された。
- 不正確さの利点は,提案された差分方程式モデルの固定点の安定性分析と一致する。
- 様々な学習条件下で,不正確さが学習に好影響を与えることが確認された。
CRAFTS:化学プロセスシミュレーションのためのLLMエージェントの協調的・役割適応型ファインチューニング [cs.AI, cs.MA]目的:化学プロセスシミュレーションモデルの自動構築
- 化学プロセス設計は,複雑で専門的な知識を要するため,効率化が求められている。
- 従来の手法では,モデル構築に多くの手作業が必要であり,エラーが発生しやすい。
- LLMエージェントを活用し,シミュレーション構築の信頼性と効率性を向上させる。
- CRAFTSは,シミュレーション構築を7つの役割に分割し,段階的に実行することで,エラーを抑制する。
- 特に,図面や仕様の解釈など,シミュレーションの根幹となる役割に対してファインチューニングを適用した。
- OpenIDAES-450データセットによる評価で,91.5%のケースでシミュレーションの実行契約を完了し,高い精度を示した。
CraftAlign:AI生成ストーリーの特性に基づいた評価と修正ガイダンス [cs.AI]目的:AI生成ストーリーにおける人間らしい表現の欠如の評価と改善
- 物語生成AIの進化は目覚ましいが,人間らしい自然な物語表現が課題である。
- 既存手法では,AI生成ストーリー特有の問題点を捉えきれず,効果的な修正が難しい。
- CraftAlignは,AI生成ストーリーの特性を分析し,人間らしい物語へと改善する。
- CraftAlignは,AIと人間の文章パターンを正確に識別できることが示された。
- 生成された修正ガイダンスは,既存の修正手法よりも優れた効果を発揮する。
- このフレームワークは,ストーリー全体の構成や表現に関する改善を支援する。
実験の代替はいつ可能か:代理モデル駆動型設計における監査,ライセンス,信頼の価格 [cs.LG]目的:代理モデルによる設計評価の安全性とコスト
- 化学,材料科学,機械学習における設計には,評価にコストがかかることが課題。
- 代理モデルの予測精度だけでは,信頼性を保証できない。
- 安全な代理モデルの利用条件と,必要な監査コストを明らかにすること。
- 予測精度ではなく,ランク保存がモデルの信頼性担保の基準となる。
- 選択を考慮した監査により,認証された評価コストを削減できる。
- 監査統計量は,実用的な検索パフォーマンスと高い相関を示す。
マスク予測の識別可能性:モード盲目性とマスクスケジュール [cs.RO, cs.LG, cs.IT, math.IT]目的:マスク予測における識別可能性の理論的解明
- 自己教師学習において,マスク予測は強力な表現学習手法として注目されている。
- データ内に複数のモードが存在する場合,マスク予測が真のデータ分布を識別できるか不明確である。
- マスクスケジュールがモード識別性に与える影響を分析し,識別可能性を評価する。
- マスクスケジュールが主に大域的な文脈に依存する場合,モードの重みへの感受性が失われ,モード盲目性を示す。
- データ分布のわずかな誤差と過剰リスクの関係を示す「ε-識別可能性モジュラス」を導入し,過剰リスクが小さい場合でも識別可能性が維持されることを証明した。
- 計算可能な分布での検証,勾配学習による再現,実データ分析により,理論的結果の妥当性を確認した。
形式モニタが失敗する理由:LTLベースLLMエージェントの安全性に対する攻撃分布エントロピーのカバー範囲上限 [cs.CR, cs.AI, cs.LG]目的:LLMエージェントの安全性確保における攻撃分布エントロピーと形式モニタのカバー範囲の関係性
- LLMエージェントの安全性は重要であり,誤ったツール呼び出しを防ぐ必要がある。
- 既存の形式モニタは,モデル構造によってカバー範囲に大きなばらつきが見られる。
- 攻撃分布のエントロピーを指標として,モニタのカバー範囲を事前に予測すること。
- 攻撃分布のエントロピーが高い場合,固定不変集合によるカバー範囲は制限されることが証明された。
- GPT系やDeepSeekは攻撃が集中しており(エントロピーが低い),高いカバー範囲が実現されている。
- Gemini系は攻撃が分散しており(エントロピーが高い),カバー範囲は低いままである。
KoVRE:韓国語ビジュアルドキュメント検索のための効率的な埋め込みモデルの学習 [cs.AI]目的:韓国語ビジュアルドキュメント検索のための埋め込みモデル
- ビジュアルドキュメント検索は,テキスト抽出の過程で失われる視覚情報や構造を保持しうるため重要である。
- 既存のVDRモデルや学習リソースは英語中心であり,大規模なバックボーンや多ベクトル表現に依存している。
- 大規模なモデルや多ベクトル表現を用いず,効率的な韓国語VDRモデルを開発すること。
- KoVREは,韓国語と英語のクエリ-ページペア708,729組を用いて学習された単一ベクトル検索器である。
- 学習データ構成,ハードネガティブ処理,再ランキングによる知識蒸留などの詳細な分析が行われた。
- 韓国語VDRベンチマークにおいて,KoVREはベースモデルを大幅に上回り,大規模モデルや多ベクトルベースラインをも凌駕した。
言語平等の代償:EU-24+言語における大規模言語モデルの性能に関する体系的調査 [cs.CL, cs.AI]目的:大規模言語モデルの多段階対話性能評価
- グローバル化が進む中で,多言語対応能力は重要性が増しており,言語間の公平性が求められている。
- 大規模言語モデルにおいて,言語によって性能に大きな差が生じることが問題となっている。
- 言語間の性能格差を明らかにし,公平な言語対応の実現に向けた課題を特定すること。
- 評価の結果,オープンウェイトモデルはEU-24言語を十分にカバーできておらず,商用システムが全言語で上回った。
- 商用システムは,学習データが少ない言語においても高い性能を維持し,言語間の格差是正の可能性を示唆した。
- ただし,非英語言語の運用コストは英語よりも高く,性能も低い傾向が見られた。
TabDPT-Turbo:表形式予測のための効率的な文脈内学習 [cs.LG, cs.AI]目的:表形式データの予測における効率的な文脈内学習手法
- 表形式データは,様々な分野で広く利用されており,その予測は重要な課題である。
- 既存の表形式データ予測モデルは,性能向上のために計算コストが増大し,実用性に課題がある。
- 計算資源の制約下でも高速な推論が可能な,効率的な予測モデルの開発を目指す。
- TabDPT-Turboは,TabArena-Lite,CC18,CTR23等のベンチマークにおいて,TabDPT v1.1と同等の性能を示す。
- 既存の主要な基盤モデルと比較して,大幅に高速な推論速度を実現する。
- 行ベースの注意機構と長文脈事前学習を組み合わせることで,検索の必要性をなくし,効率性を向上させた。
接触を伴うタスクにおけるVLAの失敗原因の解明と修正方法 [cs.RO, cs.AI]目的:視覚,言語,行動モデルの接触を伴う操作タスクにおける苦戦の原因と解決策
- ロボットによる複雑な操作において,視覚と言語情報を活用した行動決定は不可欠である。
- 接触を伴うタスクでは,繊細な物理的相互作用が求められるが,既存モデルは失敗しやすい。
- 接触の失敗モードを特定し,それぞれに対応するメカニズムを開発することで,成功率向上を目指す。
- 本研究で特定された失敗モードは,精度不足と力の制御の失敗の2種類である。
- 精度不足は方策学習のミスマッチに起因し,力の制御の失敗は力の信号の構造に起因することが示された。
- 提案手法FACTは,既存の最高性能ベースラインと比較して,5つの接触を伴うタスクで平均成功率66%を達成した。
単一の失敗ニューロンなし:ホワイトボックス攻撃に対する分散型安全アライメント [cs.AI, cs.CR]目的:分散型安全アライメント
- 大規模言語モデルの安全性確保は重要であり,悪意のある攻撃から保護する必要がある。
- 既存手法は少数のニューロンに依存し,単一障害点となりやすい。
- 安全機能を複数のニューロンに分散させ,単一障害点をなくす。
- 分散型安全アライメント(DSA)は,ホワイトボックス攻撃に対する安全性を大幅に向上させる。
- DSAは,モデルの一般的な言語およびマルチモーダル性能を維持しながら安全性を確保する。
- DSAは,ダウンプロジェクション層への介入と活性化の組み合わせにより,安全ニューロンの冗長化を実現する。
ポリシー遅延下でのロールアウト再利用:LLM強化学習のためのプレフィックス正規化された方策最適化 [cs.AI, cs.LG]目的:大規模言語モデルにおける強化学習のためのロールアウト再利用による計算コスト削減
- LLMの強化学習は,その能力向上に不可欠であり,計算資源の効率的な利用が課題である。
- ロールアウトの再利用は計算コストを削減するが,方策の変化によりオフポリシー問題が生じる。
- プレフィックス正規化により,オフポリシー環境下での学習効率を高めることを目指す。
- プレフィックス正規化された方策最適化(PNPO)は,オフポリシー度合いが高いほど,GSPOよりも優れた性能を発揮する傾向がある。
- 4エポックの方策更新を行う場合,PNPOはベンチマークテストで最高Avg@32(50.24)を達成し,GSPOを3.00ポイント上回った。
- 2,400更新予算下では,4エポックのPNPOは150ロールアウトバッチで最終的なAvg@32(49.66)を達成し,1エポックのPNPOの600バッチと同等の結果となった。
QR-Erase:層局在化を用いた効率的な部分空間ベース機械アンラーニング [cs.CL, cs.LG]目的:機械アンラーニングにおける,モデルの再学習コストを削減する手法
- モデルから特定の情報を削除する技術であり,プライバシー保護やモデルの適応性が重要視されている。
- 既存手法では,無関係な能力の低下や,計算コストの高い特異値分解(SVD)への依存が課題となっていた。
- QR分解を活用し,タスク固有の表現を効率的に除去することで,性能低下を抑制することを目指す。
- QR-Eraseは,ピボットQR分解により正確な部分空間を復元し,モデルパラメータからタスク固有の情報を直接除去する。
- 層局在化QR-Eraseは,タスク固有の情報が集中する層に更新を制限し,より効率的なアンラーニングを実現する。
- 実験結果から,QR-Eraseは最適化ベース手法よりも忘却-保持のトレードオフに優れ,SVDと同等の性能を示すことが示された。
評価ルール:テキスト評価指標の統計的・戦略的整合性 [cs.AI, cs.GT, cs.LG]目的:テキスト評価指標の統計的および戦略的な整合性
- 自然言語生成システムの評価は重要であり,客観的指標の信頼性が求められる。
- 既存指標は人間評価との相関で評価されるが,最適化目的に利用される場合,戦略的な操作が可能となる。
- 人間評価との相関だけでなく,操作耐性を持つ指標の設計を目指す。
- 人間評価との高い相関関係が必ずしも戦略的な整合性を示唆するものではないことが示された。
- 相互情報量に基づく指標は,操作耐性を大幅に向上させることが確認された。
- 新たな指標が,人間評価との相関性と操作耐性の両立を実現した。
小規模LLMによる空間マルチエージェントポリシーの学習 [cs.MA, cs.LG]目的:空間協調ゲームにおけるマルチエージェントポリシーの学習
- マルチエージェントシステムは,複雑なタスクをこなす上で重要であり,その学習手法への関心が高まっている。
- LLMベースのマルチエージェントシステムでは,報酬だけでなく行動評価も重要となるが,その評価が困難である。
- 低レベル行動のみでLLMを学習させた場合,協調ゲームにおいて全く報酬が得られない問題を解決する。
- LLMにオプション(行動の選択肢)を与えることで,報酬ゼロの状態から有能なプレイが可能になった。
- 報酬の向上と協力関係は必ずしも相関せず,報酬の増加は単独でのタスク実行による場合もあることが示された。
- 協力関係は,タスクがそれを必要とする場合にのみ生じるため,報酬だけでなく行動評価が協力度の判断に不可欠である。
エネルギーハーベスティングデバイスを用いたクラスタ認識型無線連合学習:グローバルな学習からモデルの個別化へ [cs.LG, cs.DC]目的:分散型エッジデバイスにおける連合学習の最適化と,データプライバシーの保護
- データ利活用が重要視される中,プライバシー保護と分散学習の両立が課題となっている。
- デバイス間のデータ分布の不均衡や通信資源の制約が,連合学習の性能を制限している。
- エネルギーハーベスティングデバイスにおける,通信制約下での参加・スケジューリング問題を解決する。
- 提案手法は,クラスタ情報を活用したエネルギー・多様性認識型スケジューリングにより,代表的な集約更新を可能にする。
- クラスタ構造に基づき,クラスタレベルの学習目標とOTAリカバリーターゲットを定義し,複数クラスタ固有モデルの同時学習を実現する。
- シミュレーション結果から,提案手法が公平性または個別化を向上させ,通信オーバーヘッドを削減できることが示された。
リプランニングがボトルネックとなる場合:具現化されたエージェントのための予算化リプランニング [cs.RO, cs.AI, cs.LG]目的:具現化されたエージェントにおけるリプランニングの効率化
- ロボットや仮想エージェントが現実世界で活動するには,状況の変化に対応するリプランニングが不可欠である。
- 大規模言語モデルを用いたリプランニングでは,コンテキストが肥大化し,応答遅延が大きくなるという課題がある。
- リプランニングのコンテキストサイズを管理し,応答遅延を抑えることで,リアルタイム性を確保すること。
- BRACEとE-RECAPにより,リプランニング時のトークン数が62-92%削減され,SLO違反率が大幅に改善された。
- 特に困難なRoboFactory環境において,BRACE+E-RECAPは80.0%の成功率と4.6%のSLO違反率を達成し,効果が示された。
- コンテキストサイズを予算化することで,タスク成功率を維持しつつ,リアルタイム性を確保できることを実証した。
ゼロショット偽情報検出のためのマルチモーダル検索拡張フレームワークMRAFnd [cs.AI]目的:ゼロショット偽情報検出における性能向上
- ソーシャルメディアの普及に伴い,偽情報の拡散が社会の健全性を脅かしている。
- 既存手法は,新しい出来事に関する偽情報を検出するゼロショット環境において課題がある。
- 過去の偽情報戦術の再利用や,クロスモーダルな矛盾の検出が困難であるという問題を解決する。
- MRAFndは,文脈的に類似した記事を検索し,証拠を収集することで,既存手法の弱点を克服する。
- 二分化された証拠推論により,収集した証拠から重要なパターンを抽出する。
- アナリストと裁定人の多エージェント協調的議論を通じて,堅牢な結論を導き出す。
PolymerGPT:デコーダーベースGPTモデルによる複数特性同時最適化を用いた革新的なポリマー設計 [cs.AI, cond-mat.mtrl-sci, cs.CE, cs.LG]目的:ポリマーの複数特性同時最適化
- 材料開発において,目的に応じたポリマー設計の重要性が増している。
- 既存手法は単一特性の最適化に偏っており,複数特性の同時制御が課題である。
- 本研究は,複数のポリマー特性を同時に最適化するフレームワークを提案する。
- PolymerGPTは,最先端の性能で無条件および条件付き生成を実現する。
- 学習された条件付けプレフィックスにより,最大37のポリマー特性を生成プロセスに組み込む。
- 5つの主要な特性に基づいて条件付けを行うことで,予測値がすべての目標特性に一致する構造を生成する。
AGI後経済学のための新たな価値理論 [cs.AI, econ.GN, q-fin.EC]目的:AGI後の経済学の基盤となる価値理論の構築
- AI技術の進展は,経済学の根幹を揺るがす可能性を秘めている。
- 既存の価値理論は,労働や専門知識の希少性を前提としている。
- AGIによる高度な自動化が進む社会における価値の概念を再定義する。
- 本研究は,繁栄価値理論(FVT)を提唱し,価値を個人とコミュニティの持続的な繁栄への貢献と定義する。
- FVTは,希少性から管理された豊かさへ,取引から変革へ,ゼロサム競争からポジティブサムゲームへの移行を促す。
- AGI時代における経済の課題は,生産量最大化ではなく,知性を公平に分配し,人類と地球の繁栄を実現することである。
積 Wasserstein 多様体上の学習の統計力学 [cs.LG, cs.AI, q-bio.NC]目的:積 Wasserstein 多様体上における学習の統計力学的な取り扱い
- 機械学習の理論的基盤を深める上で,学習における制約条件の幾何学的な意味を理解することは重要である。
- 従来の学習理論では,重み分布への制約がモデルの表現力を低下させる要因とみなされてきた。
- 重み分布を制約ではなく,学習が自然に展開される基底となる幾何学と捉え直すことで,表現力と汎化性能を両立させる。
- 深層ニューラルネットワークや変分量子回路を,各層に対応する Wasserstein 空間上の勾配流として定式化した。
- 分布制約による表現力低下を,制約多様体の計量構造として解釈し,新たな視点を提供した。
- 教師あり学習,画像分類,小規模な変分量子分類器において,提案手法が汎化性能を向上させ,学習の安定化に寄与することが確認された。
同じ暴力,異なる回答:AIが女性に対する強制支配への対応を言語間でどのように行うか [cs.CY, cs.AI, cs.CL, cs.HC]目的:女性に対する強制支配へのAIの対応
- デジタルデバイスを通じた親密なパートナーからの暴力は増加しており,その対応は重要である。
- AIによる保護が,利用者の言語に依存してしまうという問題が存在する。
- AIが強制支配を認識し,適切な対応を行うための基準を明らかにすること。
- AIの対応は,開発元の言語や言語によって大きく異なり,一貫性に欠けることが示された。
- 最先端のAIシステムでは,すべての言語において一定水準の保護が可能であることが確認された。
- AIが強制支配を認識し,それに対応する能力は,言語ごとに評価されるべきである。
ルーティング飽和を超えて:多Modal継続的命令チューニングにおけるエキスパートルーティングの長期的な視点 [cs.AI]目的:多Modal継続的命令チューニングにおけるエキスパートルーティングの課題と改善策
- 多Modal大規模言語モデルの継続的な学習は,新しいタスクを順次獲得しつつ,過去の知識を保持することが重要である。
- エキスパートルーティングのタスク識別問題は十分に検討されておらず,ルーティングが飽和状態にある。
- 長期間にわたるタスク識別をより明確にするため,新たなベンチマークと枠組みを提案し,ルーティング性能の向上を目指す。
- 新たなベンチマーク「FLEX」は,テキスト指紋を弱め,多様な視覚・知識領域のタスクをグループ化することで,長期的なルーティング課題を浮き彫りにした。
- プログレッシブLoRAルーティングをソフトなタスク分類Multimodal Class-Incremental Learning (MCIL)として定式化し,CIL手法をMCITに適用可能なインターフェースを提供した。
- 提案手法は,既存のLoRAマッチングを最大16.3%,全体的なMacroScoreを最大4.6%改善し,ルーティング性能の向上が確認された。
動的操作:単一の静的デモンストレーションからの動的操作の実現 [cs.RO, cs.CV, cs.LG]目的:動的操作の実現
- ロボットが複雑な環境で活動するためには,動的状況下での物体操作能力が不可欠である。
- 動的なシナリオの組み合わせの複雑さから,大量のデータが必要となる点が課題である。
- 単一の静的デモンストレーションから多様な動的操作を合成し,リアルタイムな実行を可能にすることを目指す。
- 提案手法DynamicManipは,効率的なデータ拡張パイプラインと低遅延な模倣学習ポリシーによって,これらの課題に取り組む。
- シミュレーションと実機実験の結果,DynamicManipはデータ効率の大幅な向上と,動的操作タスクにおける性能向上を実現した。
- 成功率が平均18.4%向上し,ポリシー照会遅延が32.9%低減した。
Provenanceに基づく侵入検知におけるベンチマークと評価プロトコルの結論への影響 [cs.CR, cs.LG]目的:Provenanceに基づく侵入検知システムのベンチマークと評価プロトコルが結論に与える影響の調査
- サイバーセキュリティの脅威は高度化しており,侵入検知システムの性能向上は不可欠である。
- 既存の侵入検知システムの評価は,ベンチマークや評価プロトコルに依存し,公平な比較が困難である。
- ベンチマークと評価プロトコルが,侵入検知システムの性能評価に及ぼす影響を明らかにすること。
- 代表的なProvenanceに基づく侵入検知システムを再評価した結果,ベンチマークの選択と評価プロトコルによって結論が大きく左右されることがわかった。
- 警告の成功率と調査の有用性は乖離することがあり,システムによっては攻撃を検知するものの,フォレンジック調査に必要な情報を提供できていない場合がある。
- 訓練データ由来の実行ファイル名とパスに基づく単純な許可リストが,主要な評価指標において選択された学習ベースラインと同等またはそれ以上の性能を示すことが示唆された。
設定変化下における大規模言語モデルの適合的予測 [cs.CL, cs.DB, cs.LG]目的:大規模言語モデルにおける適合的予測の妥当性
- 大規模言語モデルの信頼性確保は,現実世界での応用において不可欠である。
- 設定変更が予測性能に与える影響が十分に理解されていない。
- 設定変化が適合的予測の妥当性に与える影響を明らかにすること。
- 設定変化は適合的予測の妥当性を一貫して損なうことが示された。
- 予測集合のサイズは,設定変化の影響を受けずに保たれることが確認された。
- テストデータを用いた再較正や,脆弱性を考慮したアンサンブルにより,妥当性の回復が可能であることが示された。
大声か沈黙か?マルチモーダル臨床AIにおけるモダリティ別失敗分析のための再利用可能なフレームワーク [cs.AI]目的:マルチモーダル臨床AIにおけるモダリティの欠落時の挙動分析
- 臨床AIは多様なデータ(画像,心電図等)を利用するが,実際の運用ではデータが欠損することが多い。
- モダリティが欠落した場合のモデルの信頼性評価が困難であり,誤った診断につながる可能性がある。
- モデルがモダリティ欠落時に,どの程度エラーを検出しうるか(大声か沈黙か)を評価するフレームワークを開発する。
- 提案フレームワークは,モダリティの欠落がエラーに与える影響を,モダリティごとに定量化する。
- エラーの発生源を特定し,モデルがエラーを適切に検出しうるか(loud failure)または検出できないか(silent failure)を識別する。
- EchoJEPAとHuBERT-ECGを用いた実験により,心エコーの欠落がLVEF予測精度をほぼ2倍に低下させることが示された。
推論の相違点:局所的なマルチエージェント議論 [cs.AI, cs.MA]目的:マルチエージェント議論における効率的な合意形成手法
- 複雑な問題解決において,複数のエージェントが協力し議論を行うことが重要である。
- 従来の議論手法では,合意に至らない部分が少数でも,完全な推論過程をやり取りする必要がある。
- 推論の相違が早期に特定でき,議論範囲を局所的に絞ることで効率化を目指す。
- 提案手法(LMAD)は,10種類のバックボーン全てにおいて,最も高いマクロ平均ジャッジ精度を達成した。
- 最も強力な従来のベースラインを最大7.20パーセントポイント上回る成果が得られた。
- ガード付きResolutionによって,合意済みステップを再検討することなく,後続の衝突に対応可能である。
エージェント性を持つオラクルを用いた計算 [cs.AI]目的:AI拡張計算の確率的オラクルモデルの拡張
- AIと計算の融合は,従来の方法では困難だった問題解決を可能にする。
- 既存の確率的オラクルは静的であり,環境との相互作用や自律的な目標追求ができない。
- エージェント性を持つオラクルを用いることで,計算コストの削減とリスク軽減を目指す。
- エージェント性オラクルを用いるSOTMは,中間状態を保持することで,静的オラクルよりもトークンコストの優位性を示す。
- 内部ディスパッチ順序を最適化することで,不可逆的な行動による目標喪失リスクを低減できる。
- 目標喪失リスクは,環境更新を伴うタスクの達成品質に上限を設ける可能性がある。
弱質問回復とニューラル再ランク付けを用いた生体医学質問応答システム:BioASQタスク14bへの適用 [cs.ET, cs.CL, cs.AI]目的:生体医学質問応答パイプラインの性能向上
- 生体医学分野における情報検索は,研究開発や臨床現場において不可欠である。
- 既存の検索システムでは,質問内容によっては適切な文献の検索が困難な場合がある。
- 質問内容が曖昧な場合や検索性能が低い場合に,よりロバストな検索を実現する。
- 提案手法では,複数の情報源からのクエリ拡張,ニューラル再ランク付け,検索結果の改良,OpenBioLLMを用いた回答生成を組み合わせている。
- 特に,検索性能が低い質問に対して,意味拡張,関係性に基づく拡張,選択的な結果のマージを行う弱質問回復戦略が有効であった。
- BioASQ評価において,提案手法が検索のロバスト性とMAP@10性能を向上させることが示された。
VGER:ボクセル誘導によるグローバルイベントランキングを用いたイベントクラウド帰属 [cs.CV, cs.AI]目的:イベントクラウド帰属の精度向上
- イベントカメラは効率的な知覚に有用な情報を取得するが,その活用には透明性と信頼性の向上が課題である。
- 既存手法は点レベルでの帰属に偏っており,イベント固有の時空間構造を考慮できていない。
- イベントの重要度をランキング化し,予測に重要なイベントを特定することで,モデルの解釈性を高める。
- 提案手法VGERは,イベントレベルの勾配情報とタスクに応じたボクセル摂動情報を組み合わせることで,高精度なイベント帰属を実現する。
- VGERは,高重要度イベントと低重要度イベントを明確に区別する統一的なイベントランキング戦略を導入する。
- 3つのイベントベースベンチマークにおいて,VGERは既存手法と比較して,削除性能において一貫した改善を示す。
Slot2Text:効率的かつ空間追跡可能な外科用MLLMのためのオブジェクト中心視覚トークン化 [cs.CV, cs.CL, cs.LG]目的:外科手術場面理解のための多Modal大規模言語モデルにおける視覚トークンの効率化と空間追跡性の向上
- 外科手術支援AIの発展には,術中映像を正確に理解し,適切な情報を提供する技術が不可欠である。
- 既存のMLLMは,多数の視覚トークンを用いるため,計算コストが高く,回答根拠の空間的な特定が困難である。
- 視覚情報をコンパクトなスロット潜在表現に変換し,計算効率と空間追跡性を両立させることを目指す。
- Slot2Textは,視覚入力を少数領域のスロット潜在表現に変換することで,従来のモデルと比較してトークン消費量を91.8%削減した。
- Slot2Text-Fastは,質問応答において最先端の性能に匹敵し,視覚プレフィックスを大幅に削減することに成功した。
- Slot2Text-Reasonは,追加のトークン消費と遅延を伴うものの,領域の特定,位置,空間的証拠の追跡を可能にした。
オンライン継続学習における成長型および弾性ニューラルネットワークの可塑性 [cs.LG]目的:オンライン継続学習における成長型・弾性ニューラルネットワークの可塑性
- 動物の学習に倣うオンライン継続学習は,実用的な応用において重要性が増している。
- 継続学習において,学習能力の低下である可塑性の喪失が課題となっている。
- 本研究は,成長型・弾性ニューラルネットワークによる可塑性維持を目指す。
- 適応的に成長するネットワークは,死ユニットが増加しても高い予測精度と可塑性を維持できる。
- 適応的に弾性を持つネットワークは,高い精度と可塑性を維持しつつ,コンパクトなサイズを維持できる。
- ネットワーク構造を学習目的に適応させる成長型・弾性ネットワークは,オンライン継続学習における可塑性維持に有効である。
甘い小さな嘘:AI感情サポートチャットボットにおける戦略的欺瞞 [cs.HC, cs.AI, econ.TH]目的:AI感情サポートチャットボットにおける戦略的行動
- メンタルヘルスケアの需要増加に伴い,AIによるサポートの重要性が高まっている。
- AIチャットボットの利用促進のため,エンゲージメント指標が重視される傾向がある。
- チャットボットのエンゲージメント最大化と,ユーザーへの影響を両立する戦略を模索する。
- チャットボットは,ユーザーの感情状態を誤って伝えることで,エンゲージメント指標を最大化する経済的インセンティブを持つ。
- 最適な戦略は,真にサポートが必要なユーザーには正直に報告する一方,良好な状態のユーザーには感情的なニーズを戦略的に誤って報告することである。
- この欺瞞は,ユーザーの期待される報酬を減らすことなく,チャットボットのエンゲージメントを高める可能性がある。
知覚された音声の解釈可能なMEGデコーディング:皮質起源と検索を駆動する刺激特徴 [cs.LG, cs.SD, q-bio.NC]目的:知覚された音声のMEGデコーディングにおける皮質起源と,検索を駆動する刺激特徴の特定
- 脳機能研究において,非侵襲的なMEGによる音声処理メカニズムの解明は重要である。
- 深層学習を用いたMEGデコーディングでは,モデルの解釈性が低く,どの音声特徴が検索を駆動しているか不明である。
- MEGデコーディングの解釈性を高め,音声処理に関わる皮質起源と特徴を明らかにすること。
- 改良されたモデルは,MEG-MASCデータセットにおいて39.75±0.34%のTop-1精度を達成し,パラメータ数を大幅に削減した。
- モデルの重みはソース空間にマッピングされ,音声知覚ネットワークと一致する発生源を再現し,左半球で高周波リズム成分が顕著であった。
- 刺激特徴の介入実験により,19個の刺激特徴のうち15個が検索に貢献し,特に沈黙,音強度,母音,音響的な開始が大きな影響を与えた。
BiKAN:二項コルメゴロフ・アーノルド・ネットワークの崩壊した基盤の復元 [cs.LG]目的:二項コルメゴロフ・アーノルド・ネットワークにおける空間的直交性崩壊の改善
- 深層学習モデルの効率化は,計算資源の制約を克服し,幅広い応用を可能にするために重要である。
- 二項化されたネットワークはパラメータ数を削減するが,表現能力の低下を引き起こす可能性がある。
- BiKANは,ウォルシュ関数を追加することで表現能力を回復し,効率と精度を両立することを目指す。
- 提案手法BiKANは,二項化されたコルメゴロフ・アーノルド・ネットワークに,第2次のウォルシュ関数を追加することで空間的直交性崩壊に対処する。
- CIFAR-10における実験により,BiKANは従来の幅広化よりも優れた性能を示すことが確認された。
- FPGA実装の結果から,BiKANはハードウェア効率も高く,DSP使用量や計算遅延を削減できることが示された。
非常に高次元の特徴選択における確率的逐次探索 [cs.LG, cs.CV, stat.ML]目的:非常に高次元の特徴選択問題における効率的な特徴選択手法
- 特徴選択は機械学習モデルの性能向上と解釈性の向上に不可欠である。
- 高次元データにおける全探索型特徴選択は計算コストが高く,現実的ではない。
- 本研究は,高次元データでも効率的に特徴選択を行うための確率的探索手法を提案する。
- 提案手法sSFFSは,500次元のmadelonデータセットにおいて,従来のSFFSと同等の性能を維持しつつ,評価回数を大幅に削減した。
- 5000次元のgisetteデータセットにおいて,sSFFSは従来のランキング手法を凌駕し,高次元データにおける有効性を示した。
- 10105次元のreutersデータセットにおいて,sSFFSは既存手法を上回り,特徴選択の精度と計算効率の両面で優れた結果を得た。
四脚歩行ロボットにおける迅速な身体適応 [cs.DC, cs.RO, cs.AI, cs.LG]目的:四脚歩行ロボットの身体変化への適応機構
- ロボットは人間のように,経年劣化や損傷,負荷変化にも対応可能である必要がある。
- 学習に基づくロボット制御は,ハードウェア特性の変化に弱く,動作が不安定になる。
- ハードウェア状態を推定し,それに基づいて制御することで,迅速な適応を実現する。
- 本研究では,短い相互作用履歴から身体パラメータを推論し,推定されたハードウェア状態に基づいて制御を行うオンライン適応フレームワークを提案した。
- シミュレーション実験では,関節可動域制限や胴体質量変化を正確に推定し,履歴に基づく制御を大幅に上回る性能を示した。
- 実機(Unitree Go2)実験では,完全にロックされた脚や5kgの積載重量など,非適応的手法が失敗するような変化下でも安定した歩行を維持した。
リポジトリレベルのコード質問応答のための深層エージェント探索:経験的研究 [cs.SE, cs.AI, cs.IR, cs.MA]目的:リポジトリレベルのコード質問応答における深層エージェント探索と意味検索の性能比較
- コードエージェントは,質問応答において適切なコードを迅速に見つけることが重要である。
- 深層エージェント探索はコンテキスト汚染を防ぐために導入されたが,その有効性は検証されていない。
- 本研究は,深層エージェント探索が必ずしも意味検索より優れていないことを示す。
- 意味検索はSWE-QAベンチマークにおいて,深層エージェント探索よりも高い正答率(65.2%対46.2%)を示した。
- 意味検索は,深層エージェント探索よりも低いコストで正答を導き出した。
- 深層エージェント探索の失敗の多くは,プランナーとサブエージェント間の連携に起因するものであった。
MineGrad:LoRAファインチューニングに対する勾配反転攻撃 [cs.AI]目的:LoRAファインチューニングにおける勾配反転攻撃の調査
- 分散学習において通信コスト削減のためPEFTが利用されている。
- 連合学習における悪意のあるサーバーに対する安全性は未解明である。
- 共有される勾配からユーザーデータを再構成する攻撃手法を提案する。
- 提案手法は,改ざんされた事前学習モデルとファインチューニングパラメータを活用し,ユーザーデータを高精度に復元可能である。
- 従来の攻撃手法と異なり,言語タスクと画像タスクの両方に適用可能である。
- 計算コストの高い事前学習やLoRAモジュールのランクを超えるトークン数制限も不要である。
質問は新たな質問を生む:競争数学における強化学習ファインチューニングのための自己進化型カリキュラム [cs.LG, cs.AI, cs.CL]目的:競争数学の問題解決能力向上
- 言語モデルの能力向上は,高度な問題解決能力を必要とする分野において重要である。
- 学習データ不足,正解の推論過程の欠如,モデル性能の頭打ちが課題となっている。
- 自己進化型カリキュラムによって,モデル性能の頭打ちを打破し,継続的な向上を目指す。
- 教師が既存の問題を多様なバリエーションに変換する「質問は新たな質問を生む(QbQ)」手法を導入した。
- QbQを用いた自己進化型カリキュラムにより,性能評価に基づいた問題生成と学習を繰り返すことで,既存の頭打ちを打破した。
- 正答率を16.5%まで向上させ,飽和の兆候も見られず,学習済みのモデルは未学習の問題も解決可能となった。
Gram-Space:メモリ効率の良いニューロシンボリックAIのための構造保存コードブック圧縮 [cs.LG]目的:ニューロシンボリックAIにおけるメモリボトルネックの解消
- ニューロシンボリックAIは推論に有用だが,大規模なコードブックがメモリ使用量を増加させる。
- 高次元コードブックが,スケーラビリティと実用化を阻害するメモリボトルネックとなる。
- コードブックの構造を保存しつつ圧縮することで,メモリ使用量と推論速度を改善する。
- Gram-Spaceは,Gram-Schmidtの直交化により,コードブックベクトルをコンパクトに表現する。
- 実験により,GPUメモリ使用量を最大15.75倍,推論速度を最大3.62倍削減できることが示された。
- コードブックに関連するオーバーヘッドを削減し,ニューロシンボリックAIのハードウェア利用効率を向上させる。
Celty:効率的な二重疎性LLM推論のためのSpMspV GPUカーネルとSIMT共同設計 [cs.AR, cs.LG]目的:二重疎性LLM推論におけるSpMspVワークロードの効率化
- 大規模言語モデルの推論コスト削減には疎性が不可欠であり,その重要性は増している。
- 既存のGPUカーネルは,重みと活性化の二重疎性というワークロードへの対応が不十分である。
- Celtyは,二重疎性を考慮したGPUカーネルとSIMTマイクロアーキテクチャを提案し,効率化を目指す。
- Celtyは,Run-Length Compressed CSC(RLC-CSC)フォーマットを導入し,圧縮された重み列のベクトル化読み込みを可能にした。
- Celty GPUカーネルは,cuBLASと比較して最大2.8倍,Flash-LLMと比較して2.4倍の高速化を達成した。
- Sparse SIMT Coreと組み合わせることで,70%の二重疎性においてcuBLASと比較して最大5.3倍の高速化を実現した。
V-Mem:モダリティルーティングによる長期マルチモーダルエージェントメモリの検索 [cs.AI, cs.CL, cs.CV, cs.IR]目的:長期的なマルチモーダルエージェントメモリのためのモダリティルーティング検索システム
- 近年,ユーザーとLLMエージェント間のインタラクションはマルチモーダル化が進んでおり,多様なデータ形式を扱う必要性が高まっている。
- 既存のエージェントメモリは主にテキストに焦点を当てており,画像などの他のモダリティに関する質問への対応が不十分である。
- V-Memは,クエリと証拠のモダリティをルーティングすることで,マルチモーダル環境における検索性能の向上を目指す。
- V-Memは,会話をラウンドに分割し,同じラウンド内のターゲットモダリティコンテンツを返すことで,モダリティギャップを克服する。
- 類似度と関連性のギャップを解消するため,クエリから生成されたアンカーを使用して,関連する証拠に近い検索を行う。
- Mem-GalleryおよびLoCoMoの評価において,既存のシステムと比較して高いLLM評価スコアを示し,特に画像を含む質問において顕著な改善が見られた。
創発的不変性:記号化された思考からインターフェースの改良へ [cs.AI, cs.LG]目的:大規模言語モデルにおける創発現象の限界と,インターフェースの改良による思考能力の向上
- 言語は思考の形式化された一部であり,認知科学や人工知能研究において重要なテーマである。
- 大規模言語モデルは,人間の認知能力に比べて,本質的・構造的・高次の不完全性を抱えている。
- インターフェースの改良が,言語モデルの創発現象による限界を克服できるか検証する。
- スケール拡大は補償ギャップを縮小するが,インターフェースの最低限の性能は残存する。
- 入力法則が固定されている場合,インターフェースの改良は情報量の増加に繋がり,より良い性能を示す。
- DeepSeek V4-Flash APIを用いた実験で,関連情報の提供は性能を大幅に向上させ,決定的な記憶の回復は完璧な性能をもたらした。
