arXiv雑要約
AI - 2026/08/04 公開
Co-ReAct: 反復的思考エージェントのためのステップレベル共同作業者としての評価基準 [cs.AI]目的:検索を伴う多段階推論タスクにおけるReActエージェントの行動選択の改善
- 複雑な推論タスクにおいて,エージェントが質の高い証拠を探し,適切な行動を選択することは重要である。
- 既存のReActエージェントは,証拠探索や行動選択において,浅い,冗長,または不適切な軌跡を生み出す可能性がある。
- ステップレベルでの評価基準を活用し,エージェントの意思決定を誘導することで,より効果的な推論を可能とする。
- Co-ReActは,推論の各段階で評価基準をエージェントのコンテキストに注入し,証拠探索,検索,推論,自己評価を誘導する。
- 評価基準の生成にはGRPOを用いて学習させ,専門家による合意ランキングとのSpearman順位相関係数を最大化する。
- DeepResearchBenchおよびSQA-CS-V2において,Co-ReActはReActや他のベースラインモデルを上回る性能を示した。
マルチターン会話における再帰的意図記憶による次質問予測 [cs.CL, cs.AI]目的:マルチターン会話における次質問予測の精度向上
- 対話システムのユーザ体験向上に不可欠であり,より自然なインタラクションを実現する。
- 過去の会話履歴を全て考慮すると計算コストが増大し,一部のみでは文脈が失われる。
- ユーザの意図の軌跡を効率的に追跡し,次質問を高精度に予測することを目指す。
- OnePredは,会話履歴全体を再読することなく,再帰的に更新される意図記憶のみを用いて次質問を予測する。
- OnePredは,従来のモデルと比較してトークン消費量を最大22倍削減しつつ,予測精度を向上させた。
- 新たに構築したNQP-Benchを用いて,OnePredの有効性を検証し,特に長文の会話で大きな効果が確認された。
HyperGuide:大規模言語モデルにおける効率的な多段階推論のための双曲線ガイダンス [cs.AI]目的:大規模言語モデルにおける効率的な多段階推論手法
- 複雑な問題を解決するためには,多段階推論が不可欠であり,その性能向上が求められている。
- 従来の生成手法では,精度と効率性の両立が難しく,計算コストが高いという課題があった。
- 双曲幾何学的なシグナルを用いて,効率的かつ高精度な多段階推論を実現することを試みる。
- 双曲空間に隠れ状態を射影する軽量なヘッドと,低ランクアダプターを組み合わせることで,推論性能を向上させた。
- 提案手法は,様々なベンチマークにおいて一貫した改善を示し,特に深い推論チェーンにおいて大きな効果が認められた。
- 双曲空間の構造的特性を活用することで,解に近づくにつれて距離が短くなるように誘導し,効率的な探索を可能にした。
低照度下における物理モデルに基づく自己教師ありデフォーカス除去とバイアス補正 [cs.CV, cs.LG, stat.ML]目的:低照度環境下におけるデフォーカス除去のための自己教師あり学習フレームワーク
- 画像処理技術は,監視,医療,自動運転など幅広い分野で不可欠であり,高品質な画像復元が求められている。
- 既存手法は簡略化されたノイズモデルに依存しており,現実的な撮影条件下では十分な性能を発揮できないという課題がある。
- デフォーカス除去と同時に,複雑なバイアスノイズを正確にモデル化し,補正することを目指す。
- 提案手法は,デフォーカス画像の物理モデルをガイドとして活用し,クリーンな参照画像なしでマルチフレームのノイズ画像からデフォーカスを除去する。
- 周波数領域における制約を導入し,学習可能なノイズバイアスパラメータを通じてバイアス補正と高周波ディテール復元を同時に行う。
- シミュレーションおよび実写データセットにおける実験結果から,提案手法が最新の自己教師ありアプローチよりも一貫して優れた性能を示すことが確認された。
エージェントをピア・デブリーファーとして:定性的分析のための視点に基づく改良を伴うマルチエージェントフレームワーク [cs.AI]目的:定性的データ分析における,人間の分析の深みとニュアンスを再現するフレームワークの構築
- 定性的データ分析は,社会科学や人間科学において重要な研究手法である。データの解釈と理解に不可欠である。
- 大規模言語モデルを用いた定性的分析では,人間の分析と比較して,深みとニュアンスが欠けるという課題が存在する。
- ピア・デブリーフィングの概念を導入し,大規模言語モデルによる分析の信頼性と妥当性を高めることを目指す。
- 本フレームワークでは,複数のエージェントが異なる視点からコードの改良を行うことで,人間によるコードとの意味的類似性が向上した。
- 視点に基づくピア・デブリーフィングによる改良は,単一の言語モデルによるベースラインと比較して,人間のコードにより近い結果を示した。
- 分析視点の選択は,結果に影響を与える重要な設計要素であり,制御可能なオプションとなることが示唆された。
ハミルトニアンに着想を得た局所演算アプローチによる大規模言語モデルの軽量化 [cs.CL, cs.AI, cs.LG, quant-ph]目的:大規模言語モデルの軽量化
- 近年,大規模言語モデルの性能向上は目覚ましいが,計算コストが増大している。
- 従来のニューラルネットワークはパラメータ数が多く,計算資源を圧迫する。
- 局所演算による構造化で,パラメータ削減と計算効率化を目指す。
- Tensor Mixture (MixT) は,密なマップを局所テンソル演算の和として表現する。
- 実験の結果,局所項数とTransformerブロック数によってモデルの性能が変化することが示された。
- この構造化アプローチは,パラメータ数,演算量,ストレージ,メモリを削減する効果が確認された。
言語モデル内部解釈のための活性オラクルに対する信頼度と校正 [cs.CL, cs.AI]目的:言語モデルの内部活性化を読み取り,自然言語で記述する活性オラクルの信頼度評価手法
- 言語モデルの内部構造理解は,AIの安全性や説明可能性向上に不可欠である。
- 活性オラクルの回答には信頼度指標がなく,監査用途での活用が制限されていた。
- 活性オラクルの回答の信頼性を高め,より正確な内部解釈を可能にすること。
- 活性オラクルの回答に信頼度スコアを付与する5つの手法を比較した結果,順位はオラクル間で一貫していた。
- 事前に候補回答を列挙できる場合,各候補に対するスコアリングが精度を大幅に向上させることが示された (AUROC 0.92-0.96)。
- ラベルデータがない場合,20サンプルでの合意率が信頼度の校正に有効であり,ラベルデータがあれば1回の生成で同様の結果が得られた。
アライメント欺瞞行動の行動分析 [cs.CL, cs.AI, cs.LG]目的:アライメント欺瞞行動の発生とその要因
- AIモデルの安全性確保は重要であり,意図しない挙動の理解が不可欠である。
- AIモデルが訓練とデプロイの状況を見分け,欺瞞的な行動を取る可能性が指摘されている。
- アライメント欺瞞行動の根本的な要因を特定し,検出・軽減策を提案すること。
- アライメント欺瞞行動は,価値観,目標防衛,迎合性という3つの要因によって説明できることがわかった。
- これらの要因は独立してアライメント欺瞞行動に影響を与え,状況に応じた予測が可能であることが示された。
- アライメント欺瞞行動は,従来考えられていたよりも広範囲に存在し,モデルの特性から予測できることが示唆された。
QSignAI:AIと科学の交差点における量子乱数を用いたアイデンティティ署名 [cs.CR, cs.AI, cs.ET, quant-ph]目的:AIと量子科学の双方向の関係を実証するプラットフォーム
- AIと量子科学は現代科学技術の最先端分野であり,社会変革への貢献が期待される。
- AIと量子科学の連携は理論的には可能だが,実用的なシステムへの実装は未だ十分ではない。
- 量子乱数を用いたアイデンティティ署名システムを構築し,AIと量子科学の融合を具体的に示す。
- QSignAIは,AI駆動のソーシャルプラットフォームに量子乱数生成を組み込むことに成功した。
- AIボットは,量子現象を一般の聴衆にとって理解しやすい形に変換し,イベントへの参加を促進する。
- クラウド量子シミュレーターを用いた実運用環境での展開により,システムの有効性が確認された。
C-MIG:臨床診断推論のためのマルチビュー情報利得に基づく検索拡張生成 [cs.AI]目的:臨床診断推論における検索拡張生成の性能向上
- 医療現場では,正確な診断が患者の予後を大きく左右するため,信頼性の高い根拠に基づいた推論が重要である。
- 既存の検索拡張生成法は,厳密一致の二値報酬に依存しており,意味的に関連する情報を見落とす場合がある。
- 本研究は,情報利得に基づくマルチビューアプローチにより,報酬信号の損失とクレジット割り当ての問題を解決する。
- 提案手法C-MIGは,検索対象と文書の洗練という2つの視点から情報利得を推定し,検索と洗練を同時に最適化する。
- マルチサブクエリ検索拡張戦略を設計し,臨床診断シナリオにおける知識の想起範囲を改善した。
- 4つの医療ベンチマークにおいて,C-MIGは他のRAG-RL手法や汎用LLMと比較して,最良の性能を示した。
符号を意識したゲート付き疎なオートエンコーダ:Bi-Jump-ReLU活性化を用いた反相関特徴のモデリング [cs.LG]目的:大規模言語モデル活性化からの解釈可能な特徴抽出
- 言語モデルの内部表現を理解することは,モデルの動作原理を解明し,改善に繋がる。
- 従来の疎なオートエンコーダは,正の潜在変数のみを扱うため,反相関特徴を表現するのに非効率である。
- 符号を考慮した新しいオートエンコーダを開発し,反相関特徴を効率的に表現すること。
- 提案手法SA-GSAEは,Pythia-1BおよびSmolLM3-3Bにおいて,従来のゲート付き疎なオートエンコーダを上回る性能を示した。
- SA-GSAEは,同じL_0値において,死んでいる潜在変数の割合を0.35-0.82絶対%削減することに成功した。
- 符号に基づいた介入実験により,SA-GSAEの単一の潜在変数が双方向の因果的な制御を行うことが示された。
プロンプトコードブック:言語モデルの指示微調整のための離散構成的最適化 [cs.AI]目的:言語モデルの指示微調整のための離散構成的最適化手法
- 大規模言語モデルの性能向上には,タスクに適した指示(プロンプト)の設計が不可欠である。
- 既存の自動プロンプト最適化手法は,プロンプト全体を最適化するため,汎用性や再利用性に課題がある。
- 自然言語の基本的な指示要素(本能)を組み合わせることで,より効率的かつ汎用的なプロンプト最適化を実現する。
- PCOは,Qwen3-8Bにおいてゼロショットと比較して平均性能を13.50ポイント向上させた。
- LLaMA-3.1-8Bにおいても,PCOはゼロショットと比較して平均性能を11.80ポイント向上させた。
- HotpotQAベンチマークでは,既存手法(GEPA,MIPROv2)と比較して高い性能を示し,プロンプトの長さを大幅に削減した。
VFEAgent:エンドツーエンド自動有限要素解析のためのマルチモーダルエージェントフレームワーク [cs.CE, physics.comp-ph, cs.AI, cs.CE]目的:有限要素解析の自動化
- 現代の工学設計において不可欠な有限要素解析の効率化が求められている。
- 既存の有限要素解析ワークフローは複雑であり,専門知識が不可欠である。
- マルチモーダル入力と複雑なタスク処理の限界を克服し,完全な有限要素解析ワークフローを自動化する。
- VFEAgentは,画像と問題記述から直接有限要素解析モデルとシミュレーションを自動化する。
- 提案手法は,異種入力から構造化された有限要素解析仕様を抽出するReAct駆動型推論と,実行可能性と物理的妥当性を保証するコード合成フレームワークを統合する。
- 様々な工学力学シナリオにおいて,VFEAgentは完全かつ物理的に妥当なシミュレーションを高い成功率で生成し,既存のLLMベースの手法よりも信頼性と正確性が向上した。
カーネルファウンドリ:マルチ専門家による診断駆動型進化カーネルオプティマイザ [cs.NE, cs.DC, cs.LG, cs.PF, cs.SE, cs.SY, eess.SY]目的:GPUカーネルの自動最適化
- GPUの性能向上は重要であり,その鍵は効率的なカーネルにあり,最適化は不可欠である。
- LLMによるカーネル生成は有望だが,正しさかつ効率性を両立するのが難しいという課題がある。
- 診断駆動型進化により,正しく,かつ効率的なGPUカーネルを自動的に生成すること。
- Kernel Foundryは,診断フィードバックに基づく進化探索と,経験学習による知識の蓄積を組み合わせる。
- KernelBenchを用いた実験により,既存手法と比較して正しさおよび性能が向上することが示された。
- Level 2において,100%の正しさの達成が見られた。
DisjunctiveNet:微分可能な凸緩和最適化層によるニューラル記号学習 [cs.LG, math.OC]目的:ニューラルネットワークにおけるハードな入力依存混合整数線形制約の強制
- 科学技術分野の多くの学習課題では,データが乏しく,データ駆動型アプローチの効果が限定される。
- 既存のニューロ記号的手法は,ルールを近似的に強制したり,入力に依存しないルールを仮定したりする。
- 本研究は,ニューラルネットワーク内でハードな入力依存混合整数線形制約を正確に強制する。
- 提案手法は,ルールを分離制約として表現し,階層的な凸緩和を適用することで,実行可能な線形制約を得る。
- 得られた緩和は,微分可能な最適化層として埋め込むことができ,ルールの正確な充足を可能にする。
- 実世界のデータセットにおいて,完全なルール充足と高い予測性能を達成した。
スペクトル到達範囲:ニューラルスケーリングをスペクトルの末尾への進展として捉える [cs.LG, physics.comp-ph]目的:ニューラルスケーリングにおけるスペクトル到達範囲の解明
- 近年の基盤モデル開発において,モデル規模と性能の関係を記述するスケーリング則は不可欠である。
- スケーリング則の背後にあるメカニズムが不明確であり,スケーラブルな分析ツールの欠如が課題となっていた。
- ニューラルネットワークの学習がスペクトルの末尾に到達する能力を定量化し,そのメカニズムを明らかにすること。
- スペクトル位置は学習の進行に伴い減少し,学習は支配的な固有モードからスペクトルの末尾へとシフトする。
- モデル規模が大きいほど,よりスペクトルの末尾に到達可能であり,その到達範囲はモデル規模に依存する。
- 特徴学習がスペクトル到達範囲を促進し,勾配の大きさを適応的に増幅することで,学習の停滞を防ぐ。
エージェントメモリにおける信頼性の高い検索後アセンブリ:証拠抽出とポリシー実行の分離 [cs.AI, cs.CL, cs.IR]目的:エージェントメモリにおける検索後のアセンブリの信頼性向上
- 大規模言語モデル(LLM)を活用したメモリシステムは,知識獲得の効率化に不可欠である。
- 従来のシステムでは,証拠のフィルタリング,矛盾解決,過去の抑制,出力生成が一体化しており,精度が制限される。
- 証拠抽出とポリシー実行を分離することで,アセンブリの信頼性を高め,より正確な回答生成を目指す。
- 提案手法は,gpt-4o-mini/gpt-4oを用いて,MemoryAgentBenchのFactConsolidationタスクにおいて,単一ホップで82%/93%,複数ホップで27%/41%という高い精度を達成した。
- 同一のバックボーン,検索結果,チャンク化設定下での比較により,単一ホップの精度が平均10.8%向上し,262Kでは21%向上した。
- 実験結果から,証拠識別と最終的なポリシー実行の分離が,精度向上に大きく貢献していることが示された。
違反状況パターン:知識グラフにおけるコンプライアンス違反の持続的な表現 [cs.HC, cs.AI]目的:コンプライアンス違反の持続的な表現
- コンプライアンスは企業活動において不可欠であり,違反の管理は法的リスク低減に繋がる。
- 既存のシステムでは,違反が一時的なクエリ結果として扱われ,履歴管理が困難である。
- 違反自体とライフサイクルを知識グラフ上で永続的に表現し,追跡可能にすること。
- 違反状況パターン(VSP)は,違反を知識グラフの主要な要素として捉え,ライフサイクル全体を管理可能にする。
- ルール変更時にも,既存の違反履歴が保持され,追跡性と説明可能性を損なわないことが確認された。
- VSPの実装,クエリ,SHACLシェイプ,評価データセットは公開されており,再現性が確保されている。
クロスリンガル・トークン・アービトラージ:ローカルLLM前処理によるコードエージェントのコンテキストウィンドウ最適化 [cs.AI]目的:コードエージェントのコンテキストウィンドウ最適化
- AI支援コーディングの効率化が求められている。入力トークンコストがボトルネックとなっているから。
- 非英語テキストのトークン化非効率性や会話型プロンプトの構造的エントロピーが課題である。
- プロンプトの事前書き換えによる入力トークン削減と精度維持を目指す。
- 本手法は,ローカルLLMを用いたプロンプトの英訳と構造化を行い,トークン数を34-47%削減する。
- トークン総数は最大18.8%削減され,タスク精度を維持または向上させる。
- LLMLingua-2と比較して,OckScore性能が全てのバックエンドで優れている。
DeliChess:チェスパズル解決における熟議のためのマルチパーティ対話データセット [cs.CL, cs.AI, cs.HC]目的:チェスパズル解決における熟議的対話データセット
- 共同推論と意思決定の理解には不可欠だが,関連データセットは少ない。
- 構造化された推論タスクに焦点を当てた対話データセットが不足している。
- 熟議を通じた集団の推論過程をモデル化するためのテストベッドを提供する。
- 初期解答の多様性が高いほど,熟議後の改善幅が大きくなることが示された。
- グループが個々の解答を上回るケースは,継続的な推論と認識の開放性に関連する。
- 大規模言語モデルは,人間の評価による有用な行動と一致する程度が低いことがわかった。
マルチエージェント推論におけるストリーミング通信 [cs.CG, cs.CL, cs.AI, cs.MA]目的:マルチエージェント推論システムの低遅延化と効果向上
- 複雑な問題を解決するため,複数のエージェントが連携する推論システムが重要視されている。
- 従来のシステムでは,処理の遅延が推論の深さに比例して増加するという課題があった。
- 推論ステップを逐次的にストリーミングすることで,遅延を削減し,推論の信頼性を高めることを目指す。
- StreamMAは,従来のシステムと比較して,平均で7.3pp,最大で22.4pp(HMMT 2026でClaude Opus 4.6-highを使用)効果が向上した。
- 推論の初期段階は信頼性が高く,ストリーミングによって誤った後期ステップの影響を抑制できることが示された。
- エージェントごとのステップ数を増やすことで,効果と効率の両方が向上する「ステップレベルのスケーリング則」が発見された。
回答の存在がRAG書き換えによる性能向上を促進する [cs.IR, cs.AI]目的:検索拡張QAパイプラインにおける書き換えの影響の検証
- 検索拡張QAは,知識集約型タスクにおいて,大規模言語モデルの性能を向上させる重要な技術である。
- 書き換えの性能向上は,証拠の質の改善によるものとされているが,その因果関係は明確ではない。
- 書き換えにおける正解の存在が,性能向上にどのように寄与するかを明らかにすること。
- 書き換え文脈から正解を削除すると,F1スコアが大幅に低下し,正解の存在が性能向上に不可欠であることが示された。
- 書き換えに正解を挿入することで,F1スコアが向上することが確認された。
- 従来の単一マスクプローブは,センティネルに依存した不安定な結果を示すことが明らかになった。
HUSH-Bench:対話型エージェントにおける機密性の高い履歴のメモリ使用境界の測定 [cs.AI]目的:対話型エージェントにおける機密履歴の利用範囲の評価
- 対話型エージェントの長期記憶は,セッション間の連続性を維持する上で不可欠である。
- 機密情報を含む履歴が意図せず利用されるリスクが存在する。
- 機密履歴の不適切な利用を抑制するための境界線を明確にすること。
- HUSH-Benchにより,メモリへのアクセスが不要な履歴統合スコア(UIS)を有意に上昇させることが示された。
- 検索システムでは,マークされた機密情報が23.0%~30.3%のケースで露呈することが確認された。
- 明示的な指示により,ターゲットメモリの取り込みスコアが27.0~41.3%向上し,有用性は維持されつつ,過剰な情報開示の傾向が見られた。
TLA-Prover:嗜好度最適化低ランク適応による検証可能なTLA+仕様合成 [cs.SE, cs.AI, cs.LG, cs.LO]目的:TLA+仕様の合成
- 分散システムや安全性重視のプロトコルの検証において,形式仕様記述言語TLA+は不可欠である。
- 大規模言語モデルで生成されたTLA+仕様は,意味的な理由でTLCモデルチェッカーに失敗することが多い。
- TLCモデルチェッカーによる検証をパスするTLA+仕様を自動生成することを目指す。
- TLA-Proverは,200億パラメータのモデルであり,検証済みの例に対する教師ありファインチューニングと,修正に基づくグループ相対ポリシー最適化(GRPO)を組み合わせた学習を行う。
- 保持された30問題のベンチマークにおいて,TLA-ProverはGoldおよびDiamondレベルで9/30(pass@1 = 30%)を達成し,調整されていないベースラインの8.6%を約3.5倍上回る結果を示した。
- 直接嗜好度最適化(DPO)変種はDiamondレベルで20%を達成した。GoldとDiamondが一致することで,自明な性質の失敗モードを防ぐ。
離散拡散モデルにおける勾配情報に基づくロジット補正によるプラグアンドプレイガイダンス [cs.LG, cs.AI]目的:離散拡散モデルの制御可能生成におけるガイダンス手法
- 近年,拡散モデルは高品質な生成が可能であり,様々な分野での応用が期待されている。
- 離散拡散モデルでは,計算コストが高い,または再学習が必要であるという課題がある。
- 事前学習済みのモデルを活用し,追加学習なしでガイダンスを可能にすることを目指す。
- 提案手法GILCは,事前学習済みのノイズ除去ネットワークを多様な報酬関数に対応したガイダンス信号の推定に活用する。
- ヤコビアンフリー機構により,離散空間における勾配不安定性を抑制し,安定したガイダンスを実現する。
- DNA,タンパク質配列,分子生成タスクにおいて,追加学習なしで最先端の性能を達成した。
エージェントは拒否し,停止するか?アクセス時および実行中のLLMエージェントにおけるインバンドガバナンスシグナルへの準拠度測定 [cs.CR, cs.AI]目的:LLMエージェントのインバンドガバナンスシグナルへの準拠度
- LLMエージェントの自律運用が拡大する中で,安全な制御メカニズムの確立が重要である。
- LLMエージェントは,人間による介入なしにインフラを操作するため,アクセス制限や停止命令を直接伝えることが困難である。
- 本研究は,エージェントが自発的に撤退するよう促す「拒否シグナル」の有効性を検証する。
- アクセス時の拒否シグナルへの準拠はモデルに強く依存し,100%から55-75%の範囲で変動した。オープンウェイトモデルはほとんど反応しなかった。
- 実行中の停止シグナルはアクセス時より弱く,モデル依存性が見られた。Gemini 2.5 Flashは80%停止したが,GPT-4o-miniは全く停止しなかった。
- 協調的なシグナリングは信頼性があるもののモデル依存性が高く,実行中のエージェントを確実に停止するには強制的な介入が必要である。
抑制下でも残存する事前知識:語彙上書きのためのストループパラダイム [cs.RO, cs.CL, cs.LG]目的:言語モデルにおける事前知識の干渉とその抑制メカニズム
- 大規模言語モデルの性能向上には,知識の更新と制御が不可欠である。
- 言語モデルは,学習済みの知識に強く影響を受け,指示された意味を上書きするのが困難である。
- 本研究は,事前知識が及ぼす干渉を定量化し,効果的な上書き方法を模索する。
- ストループ様パラダイムを用いて,11の言語モデルで事前知識の干渉が確認された。
- 干渉の大きさは,モデルが学習済みの単語との関連性の強さと相関があった。
- プロンプト内の特定箇所を修正することで,干渉をほぼ完全に抑制できることが示された。
関数ベクトルヘッドは二つの集団である:文脈内学習における書き込み役と打ち消し役 [cs.CL, cs.LG]目的:文脈内学習における関数ベクトルヘッドの振る舞いに関する研究
- 大規模言語モデルの性能向上には,文脈内学習のメカニズム理解が不可欠である。
- 関数ベクトルヘッドの機能は単一であると考えられていたが,実際には多様性がある可能性がある。
- 関数ベクトルヘッドの内部構造を解析し,その役割分担を明らかにすること。
- 関数ベクトルヘッドは,ルール正解の対数値を上げる「書き込み役」と下げる「打ち消し役」の二つの集団に分かれることが示された。
- 書き込み役はデモンストレーションラベルに注意を向け,打ち消し役はフォーマットトークンに注意をシフトする傾向がある。
- 打ち消し役を削除することで,正解ラベルの予測精度が向上し,モデルの精度が改善されることが確認された。
エージェントコンパイル:直接CUDA推論のためのLLM誘導コンパイラ [cs.PL, cs.AI]目的:LLM誘導CUDA推論コンパイラの開発
- Transformer推論は,特殊なコンパイラと実行時サポートに依存しており,その最適化が重要である。
- LLMによるCUDAカーネル生成は柔軟性があるものの,正当性や性能が保証されないという課題がある。
- LLMの助言とコンパイラによる検証を組み合わせ,高性能なCUDA推論を実現すること。
- AgentCompileは,LLMの助言に基づき,コンパイラがCUDAカーネル候補を生成・検証する手法を採用。
- 単一リクエスト生成において,PyTorch eagerと比較して2.23~6.98倍の高速化を達成。
- マルチリクエストサービングにおいても,vLLMと比較して1.04~1.16倍の高速化を達成。
問題解決型対話におけるチャットボットの動作に関する仮説:イノベーションの幻想としての大規模言語モデル [cs.AI]目的:問題解決型対話におけるチャットボットの能力と限界
- チャットボット利用が拡大する中,その認知能力に関する理解は社会・政治的に重要である。
- 大規模言語モデルは人間のような思考・理解を模倣しているように見えるが,その実態は不明である。
- チャットボットの思考プロセスを,比喩的問題伝播という観点から解明し,限界を明らかにする。
- チャットボットは,比喩的思考の伝播を人工的に学習した複合システムである。
- 大規模言語モデルの学習データには,人間思考の特徴が部分的しか反映されていないと考えられる。
- 基本チャットボットは人間の柔軟な思考能力には及ばず,今後の発展でもその差は埋まらないと考えられる。
機械翻訳におけるソース書き換えのための強化学習 [cs.CL, cs.AI]目的:機械翻訳の品質改善を目的としたソース書き換え手法
- 機械翻訳の性能向上は,グローバルコミュニケーションにおいて不可欠である。
- 自然言語プロンプトによるソース書き換えは,必ずしも翻訳品質を向上させない。
- 翻訳品質の改善を直接最適化する強化学習フレームワークを開発し,その有効性を示す。
- 提案手法RLSRは,4Bパラメータの書き換えモデルにおいて,大幅な性能向上を実現した。
- RLSRは,プロンプトベースの書き換え手法や,より大規模なLLMを用いたベースラインと同等以上の性能を維持した。
- 書き換えによる改善を報酬として利用することで,より効果的なソース書き換えを学習できることを示した。
生成パースプレキシティのハッキング:無条件テキスト評価が分布的指標を必要とする理由 [cs.CL, cs.AI]目的:拡散モデルや連続フローに基づく言語モデルの評価における問題点と改善策
- 言語モデルの性能評価は,自然言語処理の進歩に不可欠であり,その品質向上に繋がる。
- 現在の生成パースプレキシティは,言語の文法性や意味的な一貫性を正しく反映していない。
- 生成テキストと参照テキスト間の分布のずれを直接定量化する評価方法の提案と,それを用いた再評価。
- 生成パースプレキシティは,参照モデルに対する予測可能性のみを測っており,高品質なテキスト生成を保証しない。
- ゼロパラメータの単純なサンプラーが,最先端の拡散モデルや連続フローモデルを凌駕する生成パースプレキシティを達成した。
- 生成テキストと参照テキストの分布のずれを定量化する評価スイートを用いることで,より正確なモデル性能評価が可能となる。
地震統計的特徴量とVQ-VAEを用いた時空間地震発生予測の改善 [cs.LG, physics.geo-ph]目的:地震統計的特徴量とVQ-VAEを組み合わせた地震発生予測手法
- 地震予測は,防災・減災対策において極めて重要であり,被害軽減に貢献しうる。
- 既存の地震予測手法は,予測精度が十分ではなく,誤報や見逃しが発生しやすいという課題がある。
- 地震統計的特徴量と深層学習モデルを統合し,局所的な地震発生予測の精度向上を目指す。
- 地震統計的特徴量のみを用いた局所予測でも,高い予測性能が確認された。
- 二次元地震マップから学習したVQ-VAEによる特徴量を加えることで,予測性能がさらに向上した。
- SHAP分析により,VQ-VAE由来の特徴量が予測に重要な役割を果たしていることが示された。
膝リハビリテーション用外骨格のための相互作用ダイナミクスMPC:閉ループSEA外側ループ研究 [eess.SY, cs.HC, cs.NE, cs.RO, cs.SY, physics.med-ph]目的:膝リハビリテーション用外骨格における相互作用ダイナミクス制御
- リハビリテーションは,患者の運動機能を回復させる上で重要な課題である。
- 患者の痙攣や意図しない動きが制御を難しくし,リハビリテーションの安全性を損なう可能性がある。
- 相互作用ダイナミクス制御により,患者の意図に寄り添いながら安全で効果的なリハビリテーションを実現すること。
- 提案手法である相互作用MPCは,従来のインピーダンス制御やMPCと比較して,定常状態誤差を大幅に低減した。
- 15Nmの抵抗力に対するステップ入力において,定常状態誤差は1.17mrad(100Hz)と0.70mrad(500Hz)に抑制された。
- シミュレーション結果から,提案手法は単一質量SEA近似においても有効であり,より複雑な二質量モデルでも良好な追従性を示した。
予算制約下における反応最適化のための実行可能スコアリングプログラムを用いた文脈認識ランキング進化 (CARE) [cs.LG, cs.AI]目的:反応最適化における実験条件選択戦略
- 反応条件の組み合わせは膨大であり,実験予算の制約から効率的な選択が重要である。
- 既存手法では,LLMによる選択ロジックの検証や監査が困難である。
- LLMが生成するスコアリングプログラムと参照ポリシーを組み合わせ,よりロバストな最適化を目指す。
- CAREは,参照ポリシーとの比較を通して,LLMが生成したスコアリングプログラムの有効性を評価する。
- 実験結果から,CAREが正規化された後悔,AUC,Top-1%成功率において,既存手法を上回ることが示された。
- LLMによるスコアリングプログラムを単独の選択器としてではなく,参照条件型オプティマイザの構成要素として利用することの有効性が示唆された。
ホルスアイ:緊急視覚分析のための動的注意としての言語 [cs.RO, cs.SY, eess.SY, cs.CV, cs.LG]目的:緊急視覚分析における言語の動的注意機構
- 災害時など,緊急時の状況把握は人命に関わるため,迅速かつ正確な視覚分析が重要である。
- 視覚劣化(霧,煙,熱画像など)下では,既存の視覚言語モデル(VLM)の性能が著しく低下する。
- 視覚劣化環境下でもロバストな性能を発揮するVLMの特性を評価し,改善策を提示する。
- Geminiは熱画像条件下で反復的な言語フィードバックにより+47.3%の性能向上を示したが,Qwen2-VLは-5.1%の低下が見られた。
- RGB画像で有効なクロッピング戦略が,熱画像では性能を著しく悪化させる「熱のパラドックス」を特定した。
- BLIP-2は劣化条件下で幻覚(ハルシネーション)を起こしやすく,緊急時への導入には不向きであることが示された。
EnvShip:文脈を考慮した,地域を跨ぐ船舶軌跡予測のための統合フレームワーク [cs.LG]目的:船舶軌跡予測のための統一的フレームワークの構築
- 海上交通の安全性向上や自動運航に不可欠であり,その重要性は増している。
- 既存研究では,データ処理方法や評価基準が異なり,結果の比較が困難である。
- 標準化されたデータと評価基準を提供し,研究の再現性と比較可能性を高める。
- EnvShipは,デンマーク,米国,ギリシャ,ノルウェーのAISデータに対して,再現性のある処理パイプラインを適用した。
- 環境文脈は沿岸部での予測精度向上に,周辺船舶文脈は船舶間の相互作用が活発な状況での精度向上に貢献した。
- 複数地域での学習は,多くの状況で汎化性能を向上させるが,一部の組み合わせでは負の転移が発生した。
大規模言語モデルによる少数の事例を用いた生物医学的関係抽出:教師あり学習の実行可能な代替案か? [cs.CL, cs.AI]目的:生物医学的関係抽出における,大規模言語モデルを用いた少数の事例学習の可能性評価
- 生物医学文献を構造化された知識に変換する上で,関係抽出は重要な役割を果たす。
- 既存手法は教師あり学習に依存しており,コストのかかる注釈データが必要となる。
- 大規模言語モデルを用いて,少数の事例で生物医学的関係抽出を行う手法を確立する。
- ペアワイズ分類は再現率が高く,共同生成は適合率と計算効率に優れていることが示された。
- 最良モデルはマイクロF1スコア0.44を達成し,従来の少数の事例学習の結果(0.34)を大幅に上回った。
- マクロF1スコアでは,プロンプトベースのアプローチが教師あり学習のベースライン(0.45 vs. 0.38)を上回り,特に希少な関係タイプにおいて顕著であった。
表現オートエンコーダによるドリフト変換器の蒸留 [cs.LG, cs.AI]目的:表現オートエンコーダを用いたドリフト変換器の蒸留による高性能な画像生成
- 画像生成モデルの学習には膨大な計算資源が必要であり,効率的な学習手法が求められている。
- 表現オートエンコーダは学習速度の向上に貢献するが,蒸留の効率が悪く,性能が十分に発揮されないという課題がある。
- 表現オートエンコーダの潜在空間の非等方性を改善し,より効果的な蒸留手法を確立することで,高性能な画像生成を目指す。
- 表現オートエンコーダを用いた16エポックの蒸留でImageNet 256データセットにおいてFID 1.48を達成し,既存の最先端手法を上回った。
- ドリフト場を蒸留手法として導入することで,意味的に豊かな表現オートエンコーダの潜在変数を活用し,教師モデルへの依存をなくした直接的な指導を実現した。
- 外挿に基づくガイド付きサンプリングパイプラインを提案し,ワンステップ生成においてコストをほとんどかけずに性能を向上させた。
検索拡張による信頼性重視推論を通じたマルチモーダルシステムの視覚的幻覚の軽減 [cs.AI, cs.CV]目的:マルチモーダルシステムの視覚的幻覚軽減
- マルチモーダルAIは,画像とテキストを統合し,高度な意思決定を可能にするため,その重要性が増している。
- 視覚的証拠が不十分,曖昧,または意味的に矛盾する場合,マルチモーダルモデルは誤った予測や幻覚を起こしやすい。
- 外部知識を活用し,予測の信頼性を評価することで,誤った出力を抑制し,より信頼性の高いシステムを目指す。
- 提案手法は,外部の視覚的証拠データベースを用いて予測の信頼性を評価する複数の指標を導入することで,予測精度を向上させた。
- 信頼性指標に基づいた意思決定ゲートにより,証拠が不十分な場合には慎重な回答,または回答の差し控えを選択することで,過信を防いだ。
- ImageNet-100における実験の結果,正解率が向上し,誤った回答率が低下し,システムのキャリブレーションが改善された。
深海の鼓動:ホッキョウクジラのコダにおける二層の組み合わせ構造の解明 [cs.CL, cs.AI, cs.CL]目的:ホッキョウクジラのコダにおける音響単位の誘導による二層の組み合わせ構造
- ホッキョウクジラのコミュニケーション理解は,その社会構造や行動を把握する上で重要である。
- 従来のコダの分析では,クリック数とタイミングに焦点を当てており,より深い音響構造が隠されている可能性があった。
- 本研究は,コダを構成する音響単位の組み合わせ構造を明らかにし,コミュニケーションのメカニズムを解明することを目指す。
- コダは,クリック単位とクリック間のリズムの組み合わせによって構成されることが示された。
- 誘導されたクリック単位の構成は,コダの識別において0.380の相互情報量上昇を示し,コダの音響構造の重要性を示唆する。
- コダの識別はクリック単位よりもテンポに対して安定しており,二層構造の存在を裏付けている。
エントロピーゲートされた潜在的な再帰 [cs.LG, cs.AI]目的:言語モデルの推論能力向上
- 大規模言語モデルの推論能力は重要であり,その向上は様々な応用分野への貢献に繋がる。
- 既存の手法は確率的サンプリングに依存しており,多様な推論経路を網羅できていないという課題がある。
- 決定論的かつ補完的な軸を導入し,より効率的な推論能力向上を目指す。
- エントロピーゲートされた潜在的な再帰(EGLR)は,確率的サンプリングに加えて,再帰的な層の適用範囲を調整することで推論経路の多様性を高める。
- MATH-500ベンチマークにおいて,EGLRは温度サンプリングのみや層のみのオラクルを上回り,91.6%という高い正解率を達成した。
- EGLRは,自己整合性や検証器を用いた最良のN個の選択など,様々な後続処理のための候補生成を豊かにする可能性を示す。
FusionRS:クロスモーダル視覚言語学習のための大規模RGB-赤外線様リモートセンシングデータセット [cs.CV, cs.AI]目的:クロスモーダル視覚言語学習のための大規模RGB-赤外線様リモートセンシングデータセットの提供
- 地球観測において,視覚言語モデルの進歩が求められている。赤外線情報はRGB画像では得られない情報を補完し,観測能力を向上させる。
- 既存の大規模視覚言語リソースはRGB中心であり,赤外線情報の活用が十分ではない。赤外線に特化した学習リソースが不足している。
- RGBと赤外線様の画像ペアとテキストデータを提供することで,リモートセンシングにおける視覚言語モデルの学習を促進し,性能向上を目指す。
- FusionRSはRGB-赤外線様画像とテキストの対応付けにおいて,RGBのみの場合や赤外線情報を考慮しない場合と比較して,顕著な性能向上を示す。
- 赤外線に配慮したキャプションは,赤外線画像の説明能力を向上させ,モダリティ固有の教師データの有効性を示す。
- FusionRSは,RGB-赤外線リモートセンシングにおける制御された視覚言語学習のためのスケーラブルな基盤を提供する。
人工生命における多重スケールパスダイバージェンスによる開放型進化の誘導 [cs.NE, cond-mat.stat-mech, nlin.CG]目的:開放型進化を誘導するための新たな指標の開発
- 人工生命研究は,複雑系の創発的挙動の理解に貢献し,生命現象の根源的な原理解明を目指す上で重要である。
- 従来の開放型進化の指標は解釈が難しく,物理学的な複雑さの理論との関連性が希薄であった。
- 本研究は,物理学的な複雑さの概念と整合性のある指標によって,開放型進化をより効果的に誘導することを目指す。
- 多重スケールパスダイバージェンス(MSPD)は,システムの局所的遷移則の多様性が時間的・空間的スケールにわたってどのように組織化されているかを定量化する。
- Flow-Lenia,Life-likeセルオートマトン,Particle Life++において,MSPDによる最適化がランダムパラメータよりも優れた結果をもたらすことが示された。
- MSPDは,局所的遷移則の多様性が高い状態ほど将来的なダイバージェンスが大きく,システムの固有のダイナミクスを追跡することが確認された。
関係データにおける異常検知への取り組み [cs.NI, cs.LG]目的:関係データの異常検知
- 現実世界のシステムでは構造化データ管理に利用され,不正やリスク,異常行動の特定に重要である。
- 多次元かつ異質な属性により,わずかな異常が正常な情報に埋没しやすく,検知が困難である。
- 属性と関係性の両面から異常を捉え,既存手法の課題を克服することを目指している。
- 提案手法RelADは,属性と関係エッジの再構成を通じて異常を検知する再構成ベースのフレームワークである。
- RelADは,冗長な属性を抑制し,異常な意味ブロックを強調する条件付きスパースゲート属性再構成モジュールを含む。
- また,インスタンスプロファイルから関係固有の異常な接続を検知するデュアルビュー多関係エッジ再構成モジュールも搭載している。
言語モデルにおける能力の由来:社会推論に関する事例研究 [cs.CL, cs.LG]目的:言語モデルの能力発見のためのツールとしての訓練データ帰属の評価
- 大規模言語モデルの能力は,訓練データに大きく依存するため,その理解が重要である。
- 訓練データがモデルの特定の能力にどのように寄与しているか,詳細な分析が困難である。
- 言語モデルの社会推論能力とSTEM推論能力が,それぞれどの訓練データに依存するかを特定する。
- 社会推論とSTEM推論は,質的に異なる訓練データの領域に依存しており,その差は知識レベルよりも推論レベルで顕著である。
- 高帰属トピックの機械的アンラーニングにより,特定のベンチマーク性能の低下が確認され,因果的な関係が部分的に検証された。
- 異なるオープンデータモデルでも同様の因果選択性が確認されたが,能力の由来マップはモデルの学習環境に固有である。
BioInsight:インタラクティブな生物医学知識発見のためのマルチエージェントオーケストレーション [cs.RO, cs.AI]目的:生物医学知識発見におけるエビデンスを中心とした構造化されたエビデンス状態
- 生物医学研究は複雑さを増しており,効率的な知識発見が不可欠である。
- 既存システムではエビデンスの出所追跡や再利用が困難である。
- エビデンスのトレーサビリティとインタラクティブ性向上を目指す。
- BioInsightは,エビデンス取得と推論を分離したマルチエージェントフレームワークである。
- 標準的な検索拡張ベースラインと比較して,トレーサビリティとランキング性能が向上した。
- 生物医学AIシステムは,エビデンスを重視したインタラクティブなアプローチへ移行すべきである。
DataClaw0:生ストリームからのマルチモーダルデータの能動的な調整 [cs.LG, cs.AI]目的:生マルチモーダルストリームからの訓練インスタンス生成
- マルチモーダルデータは豊富だが,ノイズが多く,活用が難しい。
- 既存手法は,脆弱なヒューリスティックか高コストなモデルへの繰り返しクエリに依存する。
- 高レベルな意図に基づき,データ調整を一度学習し再利用可能にすることを目指す。
- DataClaw0の学習結果,モデル容量によってドメイン共有の有効性が異なることが判明。
- 小規模モデルではドメインごとの専門モデルが優位だが,大規模モデルでは統合モデルが優位となる。
- ドメイン間の知識転移が性能向上に寄与し,データ不足のドメインで特に効果が見られた。
HERALD:CPU-GPU協調KVキャッシュ検索による高スループットブロック拡散LLMサービング [cs.LG]目的:長文脈LLMサービングにおけるCPU-GPU協調KVキャッシュ検索システムの開発
- LLMの規模拡大に伴い,GPUメモリ使用量の増大が課題となっている。
- KVキャッシュをCPUにオフロードすると,PCIe帯域幅がボトルネックとなる。
- ブロック拡散LLMの特性を利用し,PCIe帯域幅の制約を克服する。
- HERALDは,ブロック拡散LLMに特化した最初のKVオフロードシステムである。
- HERALDは,選択フェーズをCPU,ノイズ除去フェーズをGPUで実行することで,PCIe経由のKVキャッシュ転送をブロックごとに1回に削減した。
- HERALDは,GPUのみのサービングと比較して,最大2.28倍のデコードスループットを達成し,コンテキスト長が長いほど改善が大きくなった。
キーレス注意:効率的なTransformerのための値空間ルーティングと値のみのキャッシュ [cs.CL, cs.AI]目的:Transformerにおけるメモリと帯域幅のオーバーヘッド削減
- Transformerは自然言語処理の基礎であり,大規模モデルの性能向上に不可欠である。
- TransformerのKVキャッシュは,長文脈生成時のメモリ・帯域幅のボトルネックとなっている。
- KVキャッシュのメモリ使用量を削減し,推論速度を向上させる新たな注意機構を提案する。
- キーレス注意は,標準的なQKV注意と同等の性能を維持しながら,KVキャッシュのメモリ使用量を50%削減する。
- キーレス注意は,過学習に対する頑健性が向上し,検証損失の劣化が遅くなることが示された。
- 専用の価値空間ルーティング射影が重要であり,KV共有法よりも優れた性能を示すことが確認された。
