arXiv雑要約
AI - 2026/08/04 公開
企業内知識に対する質問応答のための段階的ポストトレーニング:Wnuan [cs.DC, cs.AI]目的:企業内知識獲得と汎用能力維持の両立
- 企業の機密情報に基づいた質問応答システムの重要性が増している。
- 既存手法では,特定の知識を獲得すると同時に汎用的な能力が低下しやすい。
- 企業固有の知識を効率的に獲得し,汎用能力の低下を抑制すること。
- WnuanBenchにおいて,32Bモデルの正答率(AAR)は適応前52.76%からSFT後80.06%,RL後91.51%に向上。
- 残差誤差サンプリングが,フルプールやサイズマッチングランダムサンプリングをそれぞれ3.11点,2.97点上回る。
- 企業内データの評価に加え,汎用ベンチマークの性能低下は5.17点であり,指示追従能力に集中。
核戦争では誰も勝者とならない:軍事的意思決定のソーシャルシミュレーション [cs.CL, cs.CL, cs.CY, cs.AI, cs.CL, cs.MA]目的:軍事的意思決定における組織の行動様式
- 国家安全保障上の重要課題であり,意思決定のメカニズム解明は不可欠である。
- 既存のシミュレーションは検証可能なルールエンジンや非公開交渉機能を欠いている。
- 検証可能なルールエンジンとエージェントによる意思決定プロセスを明確化する。
- WOPRは,組織の意思決定を研究するためのソーシャルシミュレーション環境である。
- 核戦争を題材としたウォーゲームを用いて,意思決定のプロセスを検証可能にした。
- 全ての戦略的選択をエージェントの明示的な決定として捉え,再現性と透明性を確保した。
ReasonCast: 説明可能な時系列予測のための推論 [cs.AI, cs.LG]目的:時系列予測と自己説明による解釈可能性の統合
- 時系列データは,金融,医療,環境など様々な分野で不可欠であり,その予測精度向上は重要である。
- 既存の時系列モデルは,予測または解釈のどちらかに特化しており,両方を統合したものは少ない。
- 予測と根拠となる説明を同時に生成することで,予測の信頼性と理解を深めることを目指す。
- ReasonCastは,予測精度においてLLMや従来の時系列モデルを上回る性能を示した。
- 生成される推論は検証可能であり,因果関係に基づいていることが確認された。
- ReasonTS-Benchは,時系列データの基本的なパターンを特定し,両タスクの同時評価を可能にする。
LAB-Tab:少量の表形式データ生成のためのLLM拡張ベイズネットワーク適応 [cs.LG, cs.AI]目的:少量のターゲットドメインデータと関連ドメインからの豊富なソースデータを用いた表形式データ生成手法
- データ分析や意思決定において,ターゲットドメインのデータが不足している場合でも,表形式データ生成が重要である。
- 既存の少量の表形式データ生成手法は,過学習やドメイン間の依存関係の変化に対応できていない場合がある。
- ソースドメインの知識を活用し,ターゲットドメインに適応した表形式データ生成を可能にすることを目指す。
- LAB-Tabは,ソースデータから学習したベイズネットワークにLLMを用いてターゲットドメインの構造を提案し,ネットワークを適応させる。
- 提案手法は,6つの分布シフトシナリオで最良の性能を示し,既存のベースラインと比較して全体スコアを33.8%削減した。
- JSD,WAPE,UtilityGapなどの評価指標においても最高のスコアを達成し,特徴量とラベルの関連性も維持している。
聞く,呼び出す,そして理解する:大規模オーディオ言語モデルのためのスキル呼び出しマルチモーダルエージェント [cs.RO, cs.MM, cs.AI]目的:ツール連携型オーディオ推論
- 複雑な音響問題解決には,外部ツールとの連携が不可欠であり,その重要性は増している。
- 既存モデルは,固定されたオーディオ入力からの直接回答に偏りがちで,ツール連携が不十分である。
- 多様なタスク設定とツール利用における適応的な連携を可能にするオーディオエージェントを開発する。
- SpeechAgent-Rは,軌跡ベースの教師あり学習と多段階強化学習により,構造化された対話行動を習得した。
- 構築されたHIU-Benchを用いて,タスク性能,対話品質,汎化性能を評価した結果,高い性能を示した。
- IDタスクで84.17,OODタスクで70.94を達成し,ベースモデルを15.40点,14.23点それぞれ上回った。
CARE:効率的かつ信頼性の高い時系列異常検知のためのカスケードフレームワーク [cs.LG]目的:時系列異常検知のための効率性と信頼性の向上
- 時系列データ分析は,金融,医療,製造など,多くの分野で重要な役割を果たす。
- 深層学習モデルは高性能だが,計算コストが高く,特に正常データが多い場合に非効率である。
- 高信頼度の正常データを迅速にフィルタリングすることで,異常検知の効率を向上させる。
- 提案手法CAREは,軽量な事前フィルタモデル(LPM)と高性能な複雑検知モデル(CDM)を組み合わせることで,推論速度を大幅に向上させた。
- 特に,LPMが正常データを効率的に分離し,CDMへの不要な呼び出しを削減することで,最先端手法と比較して2.7倍から4.8倍の速度向上を実現した。
- 検出精度を維持しつつ,推論速度の大幅な改善に成功した。
分散注意・FFNによる省エネLLMサービングと柔軟な周波数スケーリング [cs.DC, cs.AI]目的:LLMサービングにおけるエネルギー効率の向上
- LLMの活用が拡大する中で,その高いエネルギー消費量が課題となっている。
- 既存手法では,注意層とFFNの周波数特性の違いが考慮されておらず,最適化の余地がある。
- 注意層とFFNを分離し,動的な周波数スケーリングを行うことで,エネルギー効率を改善する。
- AFlexは,分散A/FサービングにおけるリソースプロビジョニングとGPU周波数スケーリングを共同で最適化するフレームワークである。
- 実験結果から,AFlexは最先端の分散サービングと比較して,トークンあたりのエネルギー消費量を最大49%削減することに成功した。
- また,AFlexはTTFTとTPOTのSLOを満たしつつ,周波数スケーリングシステムと比較してもエネルギー消費量を48%削減した。
脳波基礎モデルにおける低周波バイアスの理解と修正 [cs.LG]目的:脳波基礎モデルの学習における低周波バイアス
- 脳波は脳活動を直接反映し,様々な神経疾患の診断やブレイン・マシン・インターフェースに応用される重要なデータである。
- 脳波基礎モデルはデータ量やモデル規模を拡大しても,必ずしも下流タスクの性能向上に繋がらないという課題があった。
- 脳波のスペクトル特性とニューラルネットワークの学習特性に着目し,低周波成分への偏りを軽減することで表現学習の性能を向上させる。
- 脳波基礎モデルの表現学習において,低周波成分への偏りが一貫して存在することが確認された。
- FAMEと呼ばれる周波数バランス型マスクオートエンコーダを提案し,各周波数帯域の再構成を独立に標準化することで,スペクトル全体にわたる学習を促進した。
- OmniEEG-Benchにおける41のダウンストリームタスクでFAMEは最先端の性能を示し,24タスクでSOTAを達成した。
SpatioLM:視覚言語モデルにおける汎用的な物理空間知能に向けて [cs.CV, cs.CL, cs.LG]目的:視覚言語モデルの空間知能の強化
- 視覚と言語を統合したモデルは多様な応用が期待され,AI研究の重要な分野である。
- 既存モデルは常識的な推論は得意だが,視覚的な空間推論は苦手とする傾向がある。
- 追加的な情報を必要とせず,既存モデルの能力を損なわずに空間知能を向上させることを目指す。
- SpatioLMは,外部の3D情報や空間エンコーダを用いずに,モデル自体の空間知識を引き出す。
- 擬似深度とカメラ情報を用いた学習により,物理的に整合性の取れた表現を獲得する。
- VSI-Benchにおいて71.6という高いスコアを達成し,汎用的な能力の低下も抑制することを示した。
CoEvoKG:自己進化型検索エージェントによる知識グラフの共進化 [cs.AI]目的:知識グラフと自己進化型検索エージェントの共進化
- 大規模言語モデルの性能向上には,検索エージェントの強化学習が有効である。知識の継続的な蓄積が重要となる。
- 既存手法では,成功した検索で得られた知識が失われ,学習効率が低いという課題があった。
- 知識グラフを活用し,エージェントの自己進化と知識の蓄積を同時に行うことで,この課題を解決する。
- CoEvoKGは,知識グラフを訓練タスクのソースとエージェント進化の証拠メモリとして活用するフレームワークである。
- 6つのQAベンチマークにおいて,Qwen2.5およびLlama-3.1モデルで,ベースモデルと比較してマクロ平均精度が+10.1~+11.6ポイント向上した。
- 同等の学習予算下で,既存の自己対戦基盤や強化学習基盤と比較して,マクロ平均精度が+2.6~+3.7ポイント改善された。
長期的検索エージェントにおける探索行動と失敗モードの診断 [cs.AI, cs.CL, cs.IR]目的:長期的検索エージェントの探索行動および失敗モードの特性評価
- 情報探索の自動化は,人間による情報収集の負担を軽減し,より効率的な意思決定を支援する上で重要である。
- 複雑な質問に対する検索において,検索努力と回答品質が必ずしも一致せず,改善の余地がある。
- 検索エージェントの行動を詳細に分析し,失敗の原因を特定することで,より高性能な検索システムの開発を目指す。
- 検索努力と回答精度は弱く相関するものの,回収された証拠の質,特に累積回収率とより強く相関することが示された。
- 有用な証拠は探索の初期段階で現れることが多いにもかかわらず,エージェントは検索を継続する傾向があり,低収益な検索ステップが長尾を生み出す。
- より良い検索システム構築のためには,クエリの再定式化,証拠の選択,コンテキスト管理,および十分な証拠が回収されたかどうかに基づく停止基準が重要である。
割引指数型効用強化学習の有限時間解析 [cs.LG]目的:割引指数型効用強化学習における固定点アルゴリズムの収束速度の解析
- リスクを考慮した意思決定は,金融やロボット工学など,様々な分野で重要である。
- 割引指数型効用は非線形であり,強化学習における最適化が困難である。
- 既存研究の漸近的な収束結果を,有限時間での収束速度保証に置き換える。
- 非同期マルコフサンプリング下において,提案するアルゴリズムは$\tilde{O}(1/\sqrt{n})$の収束率を持つことが示された。
- ステップサイズパラメータの選択に制約がない点で,パラメータチューニングの負担を軽減している。
- 相対誤差ダイナミクスの擬似縮小性や,リャプノフ関数の構成を通じて収束性を証明した。
HarnessCompass:汎用性と効果的なエージェントハーネスに向けた自動ハーネス進化の指針 [cs.LG, cs.CL]目的:エージェントハーネスの自動進化のための新しいフレームワーク
- LLMの性能はハーネス設計に大きく左右されるため,効果的なハーネスの自動設計が重要である。
- 既存手法は進化タスクに過剰適合しやすく,軌跡データのみに依存し,コンポーネント間の干渉が生じやすい。
- 汎用性と効率性を高め,コンポーネント間の干渉を軽減したハーネス進化を実現することを目指す。
- HarnessCompassは,制約付き進化,能動的フィードバック,コンポーネントごとの最適化を特徴とする。
- SWE-bench Verifiedにおいて,Pass@1を54%から66%に向上させ,AHEよりも効果的かつ効率的であることが示された。
- 進化後のハーネスは,保持されたタスクや他のモデルにも効果的に転移し,高い汎用性を示した。
TransNRank:Transformerを用いた正確な新抗原ランキングへ [cs.CL, cs.CE, cs.AI]目的:新抗原の正確なランキング手法の開発
- 個別化医療において,がんに対する免疫応答を誘導する新抗原予測は重要である。
- 陽性サンプル不足,実験データのノイズ,クラス不均衡などが,予測精度を低下させている。
- Transformerを用いて,長距離依存性や文脈を考慮し,新抗原予測の精度向上を目指す。
- 提案手法TransNRankは,既存手法と比較して,新抗原予測の上位20件の再現率を46.9%から53.1%に向上させた。
- トレーニングに必要なエポック数を200から20に大幅に削減することに成功した。
- アンカー部位の変異やTCGA発現レベルが,新抗原予測において重要な役割を果たすことが明らかになった。
ProWorld:進捗を意識した双曲的ワールドモデルによる長視野視覚的ゴール到達 [cs.AI]目的:長視野の視覚的ゴール到達タスクにおける,進捗を考慮したワールドモデルの構築
- 視覚的ゴール計画はロボット工学において重要であり,複雑な環境での自律的な行動を可能にする。
- 既存のワールドモデルは局所的な一貫性学習に偏りがちで,長視野タスクにおいて目標からの逸脱や進捗の曖昧性が生じる。
- ゴールへの進捗度を考慮した構造化された潜在空間を学習し,長視野タスクでの成功率向上を目指す。
- ProWorldは,ゴールに応じた進捗順序に基づき,双曲幾何学を活用して潜在空間のダイナミクスを組織する。
- 双曲的学習を通じて軌跡内の方向性のある進捗を維持し,局所的に類似した状態間の進捗の曖昧性を軽減する。
- 進捗を考慮した計画目標を設計し,ゴールへの近さと中間状態における持続的な進捗の両方を考慮することで,LeWMと比較して平均9.67%の成功率向上を達成した。
リポジトリレベルのコード生成のための部分依存グラフによる効果的かつ効率的なコンテキスト検索 [cs.SE, cs.AI]目的:リポジトリレベルのコード生成におけるコンテキスト検索の効率化
- 大規模言語モデル(LLM)によるコード生成の発展に伴い,リポジトリ内のコード依存関係の理解が重要となっている。
- 従来の類似度ベースの検索では,ターゲット関数に依存するコードを十分に取得できないという課題があった。
- 部分依存グラフを活用することで,柔軟かつ低コストで関連コードを効率的に検索することを目的とする。
- 提案手法DyRetrieverは,LLMを用いてエントリポイント関数を選択し,コード依存グラフ上で多段推論を行うことでコンテキストを検索する。
- DyRetrieverは,静的なグローバルグラフの構築を避け,必要な時に部分グラフを構築・破棄することで,構築・維持コストを削減する。
- 実験結果から,DyRetrieverを統合したDyCoderは,既存のRAGベースの手法と比較して,CoderEvalおよびDevEvalでそれぞれ25.63%と59.73%のPass@1の相対的な改善を達成した。
再計算か再利用か? VLM自己反省におけるテキストによる近道の実態解明と軽減 [eess.SY, cs.SY, cs.CV, cs.AI]目的:VLMの自己反省におけるテキストによる近道の影響と,その軽減策
- VLMは画像と言語を理解し,推論を行うため,様々な応用が期待されている。
- VLMは過去の推論結果に囚われ,新たな視覚的証拠を適切に反映できない場合がある。
- VLMがテキストによる近道に頼る行動を抑制し,視覚情報の再計算を促す方法を確立する。
- 過去の推論過程における証拠となるテキストが,視覚情報の再計算を妨げる近道として機能することが示された。
- 証拠となるテキストを削除することで,過去の回答への依存度が低下し,現在の画像に基づいた回答へのシフトが確認された。
- FSAFという介入手法により,視覚情報の更新率が向上し,過去の回答への依存率が大幅に低下した。
古代ギリシア語の母音長自動注釈 [cs.CL, cs.AI, cs.LG]目的:古代ギリシア語の母音長自動注釈システム
- 古代ギリシア語研究において,正確な母音長は意味解釈や韻律分析に不可欠である。
- 既存の古代ギリシア語コーパスには,母音長が明確に区別されていないという課題がある。
- 大規模な注釈済みコーパスの作成を目的とし,汎用的な母音長注釈システムを開発する。
- 本研究で開発した母音長注釈システムは,CoNLL-U形式のアノテーションを利用して,未知語の母音長を推定する。
- このシステムが出力したデータで学習させた小規模なTransformerモデルは,ルールベースシステムと同等以上の精度を達成した。
- また,母音長注釈は,韻律解析などの下流タスクの精度向上にも貢献することが示された。
意味ネットワークを手がかりとして:意味ネットワーク構築の理論的基礎とプロセス最適化 [cs.SI, cs.AI]目的:意味ネットワーク構築プロセスにおける候補ネットワークのランキング付けのためのフレームワーク
- テキスト情報から知識を抽出する上で,意味ネットワークは重要な役割を果たす。
- 意味ネットワーク構築には様々な手法が存在し,その評価基準が明確でない場合がある。
- 構築された意味ネットワークの質を評価し,最適なプロセスを導くための枠組みを提示する。
- 意味ネットワークは現実の代替ではなく,手がかりとして機能するという点を明確にした。
- 自動キーワード抽出,エッジ重み付け,コミュニティ検出といった意味ネットワーク構築の主要な段階を分析した。
- 意味ネットワーク構築をプロセス最適化問題として再構成し,ClueNetworkという評価フレームワークを提案した。
道徳的意思決定のための契約主義的議論枠組み [cs.AI, cs.CY]目的:道徳的意思決定に関する契約主義的枠組み
- 共有環境における自律エージェントの倫理的行動は,社会生活において不可欠である。
- 利害の対立を抱える状況下での意思決定における,客観的な道徳的基準の欠如が課題である。
- スキャロンの契約主義に基づき,合理的に拒否できない原則に基づく意思決定を可能とする。
- 提案された枠組みは,価値に基づいたフィルタリングを導入することにより,各エージェントの価値観を考慮した議論を可能にする。
- ASPIC+ 議論枠組みを拡張することで,道徳的に関連する理由を形式的に表現し,比較・評価できる。
- 家庭環境における事例研究を通して,既存の価値に基づく議論アプローチとの関連性を示す。
蒸留の前に先を見よ:エージェント的オンポリシー蒸留のための教師ガイダンスの将来軌道検証 [cs.IR, cs.RO, cs.CL, cs.LG]目的:エージェント的オンポリシー蒸留における教師ガイダンスの有効性評価
- 強化学習において,より効率的な学習は重要であり,教師あり学習からの知識転移はその有効な手段の一つである。
- オンポリシー蒸留では,教師と生徒の分布のずれが課題であり,多段階タスクではずれが累積しやすい。
- 本研究は,将来の軌道を考慮した教師ガイダンスの選択により,蒸留の効率を向上させることを目指す。
- FutureBridge-OPD (FTB)は,高不一致状態において短い教師ブリッジを実行し,その後の生徒の継続を評価することで,効果的なガイダンスを選択する。
- ALFWorld,WebShop,ScienceWorldにおいて,FTBはバニラOPDやTCODと比較して平均でそれぞれ16.6点,7.6点の性能向上を示した。
- FTBは,生徒の規模や教師の設定に関わらず有効であり,汎用性も高いことが示された。
データとAIパイプラインのための自律的自己修復:オープンソースソフトウェアを用いた,手頃な価格でベンダーに依存しないアーキテクチャ [cs.ET, cs.AI, cs.DB]目的:データおよびAIパイプラインにおける自己修復機能の実現
- 現代組織はデータ活用に不可欠であり,パイプラインの信頼性が重要である。
- パイプラインはデータ品質,スキーマ変更,インフラ問題等で頻繁に障害が発生する。
- 既存のソリューションは高価,ベンダーロックイン,または導入が困難であるという課題を解決する。
- 既存のAI支援パイプライン監視ソリューションを比較し,アーキテクチャ上の課題を特定した。
- オープンソースおよび低コストツールを用いた,ベンダーに依存しない自己修復パイプラインのアーキテクチャを提案した。
- モニタリング,メタデータ,インシデント履歴,AI診断,承認ワークフローを組み合わせ,手動作業を削減する。
FAST-GS:周波数認識時空間ガウススプラッティングによるフォトリアリスティックな動的新規視点合成 [cs.CV, cs.AI]目的:フォトリアリスティックな動的新規視点合成のための手法
- 3Dシーンの再構成やリアルタイムな新規視点生成の重要性が高まっている。
- 既存手法では高周波な動きを捉えきれず,長期間にわたる安定性が課題となっていた。
- 複雑な動きの表現と長期的な安定性を実現し,高品質な動的3Dコンテンツの生成を目指す。
- 本研究では,動きを周波数に基づいた正弦波成分に分解する Fourier Motion Modeling モジュールを提案した。
- これにより,低周波の全体的な軌跡と高周波の局所的な詳細の両方を捉え,複雑な動きを正確にモデル化することを可能にした。
- 実験結果から,提案手法がN3VやGoogle Immersiveデータセットにおいて有効であることが示された。
カオスプローブ:凍結されたTransformer入力埋め込み空間に対する神経カオス的レンズ [cs.LG, cs.NE]目的:凍結されたTransformer入力埋め込み空間の応答に基づく構造の解明
- Transformerモデルの性能向上は重要だが,その内部構造の理解は十分ではない。
- Transformerの入力埋め込み空間の構造は不明であり,モデルの挙動を説明しにくい。
- 入力埋め込み空間の応答パターンを分析し,モデル間の類似性や差異を定量的に評価する。
- カオスプローブは,ニューロカオス理論に基づき,入力埋め込み空間の応答を特徴づける固定長のシグネチャを生成する。
- 実験の結果,カオスプローブはモデルの家族関係を高い精度で再現することが示された。
- この研究は,Transformer入力埋め込み空間に構造が存在することを示唆する。
TELLER:LLM推論の非侵襲的クロスレイヤー根本原因分析 [cs.HC, cs.SE, cs.CL, cs.LG, cs.PF]目的:LLM推論における根本原因分析の実現
- LLM推論は継続的に稼働するサービスとなり,その性能最適化が重要である。
- 既存のプロファイラでは,レイヤー間の実行セマンティクスやリクエスト構造が捉えにくい。
- TELLERは,LLM推論における根本原因分析を効率的に行うことを目指す。
- TELLERは,モデルバイナリを変更せずにトレースとログを収集し,リクエストごとのコールチェーンツリーを再構築する。
- 依存関係を考慮した因果コンテキストスライスと,Trace Pair Encoding (TPE)により,トレース長を大幅に圧縮しつつ,高い診断精度を維持する。
- 多ノードGPU推論ワークロードでの実験により,TELLERが実用的な根本原因分析基盤となりうることを示した。
AdaThinkV:トークン効率の良い動画推論のための適応的思考 [cs.CV, cs.AI]目的:動画に対する質問の難易度に応じた推論努力の適応
- 動画理解は,ロボット工学や自動運転など,様々な応用分野において重要である。
- 大規模言語モデルを用いた動画推論では,簡単な質問に対しても多くのトークンを消費してしまうという課題がある。
- 質問の難易度に応じて推論の深さを自動的に調整し,トークン効率を向上させることを目指す。
- AdaThinkVは,明示的な推論と直接的な回答のモードを学習し,質問ごとに適切なモードを選択する。
- 提案手法は,既存の適応的ベースラインと比較して,平均精度が向上し,トークン使用量を削減することに成功した。
- 難解な問題に対しては,Variance Recovery Policy Optimization (VRPO)により学習信号を回復し,より効果的な推論を実現している。
構造パラメータフリー親和性正則化によるフローマッチング [cs.CV, cs.AI]目的:拡散モデルの学習加速
- 画像生成の品質向上は重要であり,拡散モデルはその有力な手法である。
- 拡散モデルの学習は遅延することがあり,学習加速が課題となっている。
- 内部表現の正則化により学習を加速し,高品質な画像生成を目指す。
- 提案手法SPAREは,追加のエンコーダや学習可能な射影ヘッドを必要とせず,訓練メモリへの影響も小さい。
- SPAREは,ImageNet 256x256において,パラメータフリーな正則化手法の中で最も低いFIDスコアを達成した。
- SPAREは,既存手法REPAのFIDスコア低減効果の37~54%を再現し,REPAと組み合わせることで更なる改善を示した。
言語モデルエージェントによる長期的自律アーキテクチャ研究:行動事例研究 [cs.CE, cs.SY, eess.SY, cs.AI]目的:長期的ニューラルアーキテクチャ設計問題における言語モデルエージェントの単独研究
- AI研究開発の加速化に貢献し,人間の研究者の負担軽減が期待される分野である。
- 既存の手法では,複雑な探索空間での効率的なアーキテクチャ探索が困難である。
- 自律的な実験計画,実行,評価を通じて,新たなアーキテクチャを探索し,性能向上を目指す。
- エージェントは,非標準のVision Transformerを改善し,小規模ベンチマークで効率的なモデルを,ImageNet-1Kで実用的なモデルを開発した。
- 初期段階では急速な進歩が見られ,その後は仮説の飽和状態に陥るものの,行動空間の拡大により回復した。
- 早期の仮説が精度向上に大きく貢献し,貪欲な仮説の選択はワークフローに起因することが示された。
学習状態信号による適応的オプティマイザ切り替え:より高速な収束と汎化性能の向上 [cs.LG]目的:深層ネットワーク最適化における収束速度と汎化性能の向上
- 深層学習の性能はオプティマイザに大きく依存する。最適なオプティマイザ選択が重要。
- 単一のオプティマイザでは,学習初期と後期で最適な挙動が異なる。学習効率が阻害される。
- 学習状況に応じてオプティマイザを切り替えることで,各段階の利点を活かし問題を解決する。
- AOS-Rは,勾配空間の6つのオンライン信号を監視し,AdamW,SGD-M,Lionを状況に応じて切り替える。
- CIFAR-100/WRN-28x10において,AOS-Rは81エポックで78%のトップ1精度を達成し,AdamW,SGD-M,Lionよりも少ないエポック数で同等以上の精度を示した。
- 8つのモデル-データセットベンチマークで,AOS-Rは6つの組み合わせで最高の精度を達成し,AdamWと比較して平均で0.4ppの精度向上と0.80倍の収束速度向上を実現した。
TALSC:インフラ支援型自動運転のためのタイムリーネスを考慮した大規模・小規模VLM協調 [cs.DC, cs.AI, cs.NI]目的:インフラ支援型自動運転における大規模・小規模VLM協調の効率化
- 自動運転の高度化には,高度な知覚と推論能力が不可欠であり,VLMはその重要な要素となる。
- 車載コンピューティング能力の制約から,自動運転システムでは小規模VLMしか利用できない場合が多く,性能が制限される。
- エッジサーバー上の大規模VLMとの協調により,この制約を克服し,タイムリーネスを維持しながら性能向上を図る。
- 提案手法TALSCは,VLM推論における情報鮮度(AoI)の進化をモデル化し,AoI,トークン長,タスク性能の関連性を定量化する。
- TALSCは,オンラインスケジューリングアルゴリズムを設計し,遅延の影響やトークン数の不確実性を考慮した性能保証を実現する。
- シミュレーション結果から,TALSCは既存手法と比較して最大12.6%のMicro-F1スコアの改善を示すことが確認された。
履歴に基づく相手認識によるエージェントジャングルでの進化 [cs.DL, cs.IR, cs.AI]目的:動的なマルチエージェント環境における,真に有益なスキル改訂の特定と採用
- 汎用性と自律性を備えたLLMエージェントを実現するには,相互作用を通じた戦略適応が不可欠である。
- 既存手法は静的環境向けに設計されており,相手も戦略を更新する環境では陳腐化する。
- 相手の戦略進化を考慮し,安定かつ効率的な戦略適応を可能にすること。
- OASEは,相手戦略の履歴スナップショットを利用して候補スキルと既存スキルを比較し,収益増加が閾値を超える場合にのみ採用する。
- 第一価格オークションと私的コスト・クールノー競争の実験で,OASEはReflexionベースラインと比較して,最終的な均衡距離が小さく,スキル改訂の回数が少ないことを示した。
- OASEは,根拠に基づいた選択により,相手が継続的に進化する環境でも,安定した効率的な適応を実現する。
HALT:検索拡張型探索エージェントのための検証を意識した停止手法 [cs.AI]目的:検索拡張型探索エージェントにおける冗長な検索の削減
- 複雑な質問に答えるために検索を繰り返すエージェントの効率化が求められている。
- 必要な証拠が得られた後も検索が継続され,コストや遅延が増加する問題がある。
- 証拠の網羅性に基づいて,不要な検索を停止し,効率を向上させることを目指す。
- HALTは,エージェントを変更することなく,期待されるステップの主張を検証することで停止を判断する。
- 3つの多段階QAベンチマークにおいて,正確な回答性能を維持しつつ,冗長な検索回数を削減することを示した。
- 質問から生成された主張と,正解のサポートファクトを用いた場合で効果に差があるものの,いずれの場合も性能維持が確認された。
推論が失敗する前に:エージェント型RAGにおける証拠検証前の手続き的失敗 [cs.AI]目的:エージェント型RAGシステムにおける,証拠に基づく推論テスト以前の失敗モードの分析
- 大規模言語モデル(LLM)の知識獲得には,外部知識の利用が不可欠であり,RAGはそのための重要な手法である。
- RAGシステムは,検索された証拠を十分に検証せずに回答を生成してしまう場合があり,精度低下の原因となる。
- 証拠の検証プロセスを改善することで,RAGシステムの信頼性と精度向上を目指す。
- エージェント型RAGにおいて,回答誤りの原因は,証拠検証前の手続き的失敗と,検証後の失敗に大きく分けられることが明らかになった。
- 証拠検証を強制するRead-Gateを導入した結果,証拠検証を省略する経路においてLLMの正答率が14.9-19.9ポイント向上した。
- 思考予算を拡大しても,必ずしも証拠検証が増加するわけではなく,証拠収集は経路レベルの制御問題として扱うべきであることが示唆された。
MANGO-Grasp:幾何学指向3Dガウス分布に基づくマハラノビス場によるクロスエンボディメント精密把持 [cs.RO, cs.AI]目的:異機種の多指ロボットハンドにおける安定した把持の合成
- ロボットハンドによる把持は,多様な作業を自動化する上で不可欠である。精密な把持は特に重要。
- 既存手法では,物体の局所的な表面形状の表現が不十分,またはロボットの形態と運動学の記述が曖昧である。
- 幾何学形状に着目し,ロボットの形態・運動学を明示的に記述することで,汎用的な把持を実現する。
- MANGO-Graspは,3Dガウス分布とロボットの表面キーポイントを用いて,異機種ロボットでの把持を可能にする。
- シミュレーション実験では,最先端手法と比較して最大8.24%の性能向上を示した。
- 実機実験では86%の成功率を達成し,未知のロボットハンドへのゼロショット転移も成功している。
K-12教育におけるLLMの安全性評価フレームワーク:EduZone [cs.AI, cs.CY]目的:K-12教育におけるLLMの安全性評価
- 教育現場でのLLM利用拡大に伴い,その安全性確保が重要課題となっている。
- 既存の安全性評価は,生徒と教師間の対話における有害コンテンツに焦点を当てていない。
- K-12教育に特化した有害性の評価フレームワークを構築し,LLMの安全性を高める。
- EduZoneは,教育シナリオ,学習内容,リスクカテゴリを組み合わせた,体系的な評価フレームワークである。
- 実験の結果,教育特有のリスクや動的な多段階対話において脆弱性が高いことが明らかになった。
- 既存の安全対策では,これらのリスクに十分に対応できていないことが示された。
HPFA:大規模言語モデルの推論におけるハイパーグラフに基づくペア失敗原因特定 [cs.AI]目的:大規模言語モデルの推論における失敗原因の特定
- 大規模言語モデルの推論能力向上は,AI研究の重要な課題である。
- 既存手法では,推論ステップの依存関係を考慮せず,効率的な失敗原因特定が困難である。
- ハイパーグラフを用いたペア比較により,効率的かつ高精度な失敗原因特定を目指す。
- 本研究では,ハイパーグラフに基づくペア失敗原因特定フレームワーク(HPFA)を提案した。
- HPFAは,失敗経路と成功経路のハイパーエッジを比較することで,効率的に失敗の根本原因を特定する。
- 実験の結果,HPFAは既存手法と比較して,原因特定精度と効率が大幅に向上し,推論精度向上にも貢献することが示された。
scikit-fingerprints:scikit-learn互換の分子フィンガープリントと化学情報学のためのPythonライブラリ [cs.LG, cs.SE]目的:分子機械学習のための分子フィンガープリントと化学情報学的機能群
- 化学情報学は創薬や材料科学において重要な役割を担う。分子構造と物性の関係性を明らかにする基盤技術である。
- 既存のオープンソースフレームワークはscikit-learnとの互換性が低く,機械学習ワークフローの統合が困難であった。
- scikit-learnとの互換性を実現し,分子情報学ワークフローの効率化と再現性を向上させることを目指す。
- 本ライブラリは,scikit-learnの規約に準拠した統一的なインターフェースを提供し,分子フィンガープリント,フィルタリング,類似度計算などの機能を実装している。
- これにより,SMILES文字列からデプロイ可能なモデルまで,分子情報学のワークフローを容易に構築し,既存の機械学習ツールを活用できる。
- RDKitを基盤とするため,拡張性も高く,カスタム用途にも対応可能である。
ソフト期限を考慮したTransformer強化PPOによるLLM推論のための学習ベースの協調MEC [cs.DC, cs.LG, cs.NI]目的:ソフト期限制約下におけるLLM推論のための協調MECシステムの最適化
- LLMの利用拡大に伴い,低遅延な推論環境の提供が不可欠となっている。
- タスク間の依存関係により,一部の遅延がシステム全体に影響を及ぼす可能性がある。
- 期限超過を抑制しつつ,タスク完了率を最大化する協調MECメカニズムの構築。
- 提案手法は,従来のPPOやヒューリスティック手法と比較してタスク完了率およびシステム効率において大幅な性能向上を示した。
- Transformerによりタスク移行の意思決定が改善され,MECサーバ間の協調が効率化された。
- 拡張された期限メカニズムと柔軟性により,厳しい遅延制約下での大規模計算処理が可能となった。
DART:効率的な長文脈系列モデリングのための再帰的状態に対するデコード注意 [cs.LG]目的:長文脈系列モデリングにおける効率的な注意機構
- 自然言語処理において,長文脈を扱える高性能なモデルが求められている。
- Transformerモデルは計算コストが高く,再帰モデルは文脈の保持に課題がある。
- 再帰的状態と注意機構を組み合わせ,効率性と性能を両立することを目指す。
- DARTは,Mamba-2の再帰的状態を活用し,トークン条件付きのキーと値をデコードする。
- DARTは,従来の注意機構と比較して,推論時のキャッシュサイズを大幅に削減できる。
- DARTは,Mamba-2と比較して,関連情報の想起と検索性能を向上させ,言語モデリングの品質を維持する。
オフポリシー強化学習のための上限期待値多段階Q学習 [cs.LG]目的:オフポリシー強化学習における報酬伝播の加速
- 強化学習は,複雑な意思決定問題を解決する強力な手法であり,ロボット工学やゲームなどへの応用が期待される。
- オフポリシー強化学習では,過去のデータを利用するため,データの質が性能に大きく影響する。
- 期待値損失を用いることで,過去のデータの偏りを軽減し,より効率的な学習を目指す。
- 期待値$n$段階Q学習(ENQ)は,既存手法と比較して,同程度の性能を維持しつつ,学習速度を向上させる。
- ENQは,特定のパラメータ設定($\tau=0.8$)で,27のタスクにおいて良好な結果を示し,アンサンブル学習との相乗効果も確認された。
- ENQは,理論的に収縮写像であることを証明し,最適な行動価値関数への収束性を保証する。
凸ニューラルエネルギー要素:幾何パラメータ化されたニューラル演算子の単一有限要素アセンブリと安定性・誤差保証 [cs.LG]目的:幾何パラメータ化されたニューラル演算子を用いた単一有限要素アセンブリの実現
- 物理現象のシミュレーションにおいて,ニューラル演算子を活用する研究が盛んに行われている。
- 従来のニューラル演算子要素法では,構造的な問題が生じ,誤った解に収束することがあった。
- 本研究では,凸ニューラルエネルギー要素を導入し,安定性と誤差保証を伴うアセンブリを実現する。
- 各要素がエネルギー関数をエクスポートし,境界自由度に関してアーキテクチャ的に凸となるように設計された。
- 正則化の帰納空間原理に基づき,物理空間を帰納空間に含めることで,バイアスを排除し,安定性を確保した。
- 熱伝導や平面ひずみ弾性体の問題において,高い精度と高速な計算速度が実験的に確認された。
オブジェクト履歴における状態の局所化:語彙相対座標によるアプローチ [cs.CV, cs.LG, cs.MM]目的:オブジェクト履歴と状態記述から,各状態が成立する区間を特定すること
- 視覚的な変化を通して同一オブジェクトを追跡することは重要だが,状態(空か満たされているか,損傷しているか否か等)を特定できない
- 既存手法では,常に同じ対象が映っているため,状態を識別するのに必要な証拠が隠されてしまう問題がある
- 複数の状態記述を比較参照することで,状態を特定するための情報を明確にすることを目指す
- 代替状態記述を語彙相対座標系に変換するD\'ej\`a Cueという学習不要なフレームワークを提案した。
- 78件のVOST履歴データを用いて実験を行った結果,R@1がtIoU 0.5で10.3%から20.5%に,Top-1 tIoUが16.0%から21.5%に向上した。
- 語彙相対座標によるクエリは,有用な区間を同じ候補セット内でより上位にランク付けすることが示された。
CompanionBench:AI感情伴侶に関する理論的基盤と現実世界に基づいたベンチマーク [cs.CL, cs.AI]目的:AI感情伴侶の能力評価
- 感情伴侶AIの利用拡大に伴い,その質を客観的に評価する重要性が高まっている。
- 既存の評価方法は,人工的なシナリオやシミュレーターに依存し,評価者のバイアスを考慮していない。
- 現実世界のデータに基づき,より信頼性の高い感情伴侶AIの評価手法を確立すること。
- CompanionBenchは,現実世界のデータに基づいた対話型二言語ベンチマークである。
- 心理学やカウンセリングの理論から導出された10の能力を評価し,従来の評価では軽視されていた側面を明らかにした。
- 評価の結果,感情制御や適切な挑戦が課題であり,曖昧さの保持能力が判断に重要な要素であることが示された。
TextNCA: 階層型局所注意による言語モデリングのためのニューラルセルオートマトン [cs.IR, cs.CL, cs.AI, cs.LG]目的:言語モデリングにおけるニューラルセルオートマトンの可能性の分析
- 言語モデリングは自然言語処理の基盤であり,高性能なモデルの開発が重要である。
- Transformerモデルが主流だが,計算コストが高いという課題がある。
- 局所的な計算で言語モデリングが可能なのか,そのメカニズムを解明する。
- TextNCAは,局所的な計算によって言語モデリングが可能であることを示した。
- 階層的なウィンドウサイズと反復計算のスケジュールが性能に大きく影響することがわかった。
- 反復計算は一定の効果があるが,最適な反復回数を超えると性能が低下する。
遍在する秘密:移動予測モデルにおける記憶の監査 [cs.LG]目的:移動予測モデルにおける記憶とそのプライバシーリスクの定量化
- 都市分析やナビゲーション等,人間の移動予測モデルの利用が拡大しており,その重要性が増している。
- 移動予測モデルが学習データから機密性の高い移動経路を記憶・漏洩する可能性が指摘されている。
- 移動経路の多階層構造やユーザー行動の多様性を考慮し,記憶リスクを定量的に評価する手法を開発する。
- 移動予測モデルにおいて,個々の場所,アンカーペア,部分経路セグメントといった様々な粒度での記憶が確認された。
- モデルの記憶パターンは,ユーザーの行動の規則性と相関があり,推論時にデータ抽出のリスクを高めることが示された。
- 移動予測モデルにおけるプライバシー監査の必要性が強調された。
TBSG-Net:時系列二部シーングラフネットワークによる詳細な動画瞬間検索 [cs.CV, cs.AI]目的:詳細な動画瞬間検索のための手法
- 動画検索の精度向上は,情報検索やコンテンツ理解において重要な課題である。
- 既存のシーングラフは時間的な変化を捉えきれておらず,正確な検索が困難である。
- 時間的な関係性を明示的にモデル化し,動画の局所化精度を向上させることを目指す。
- 提案手法TBSG-Netは,動的なシーングラフを用いて,オブジェクト間の時間的相互作用を捉える。
- 新たに開発したDynamic Scene Graph Embeddingモジュールにより,時間幅と空間情報を統合的に学習する。
- 実験結果から,TBSG-Netは既存手法と比較して顕著な性能向上を示すことが確認された。
ソースフリークラスアンラーニングにおけるエンタングルメントフロンティア脱却 [cs.LG]目的:ソースデータなしでのクラスアンラーニングの性能向上
- 機械学習モデルのプライバシー保護や公平性確保において,特定のクラスの情報を削除する技術が重要である。
- 既存のクラスアンラーニング手法は,忘却したいクラスと保持したいクラスの表現が重なるため,削除時に性能劣化が生じる。
- 入力に応じて削除処理を調整することで,この性能劣化を回避し,より効果的なクラスアンラーニングを実現することを目指す。
- 提案手法SCOPEは,フロンティアの制約を回避するため,入力に応じて忘却サブスペースを抑制するゲート機構を用いる。
- SCOPEは,既存のソースフリークラスアンラーニング手法と比較して,高い性能を示すだけでなく,計算コストも大幅に削減できる。
- ベンチマークテストの結果,SCOPEは様々なデータセットとモデルにおいて,最先端の性能を達成した。
自動変調方式識別における一次保存型認知的意思決定修正のための交差適合残差有用性 [cs.AI]目的:自動変調方式識別における認知的意思決定の修正
- 無線通信の効率化には,正確な変調方式の識別が不可欠である。
- 従来の変調方式識別は識別精度に重点を置き,不確実な状況下での意思決定が課題であった。
- 信頼できる初期予測を修正する際の,証拠の重要度に基づいた意思決定メカニズムを確立する。
- 提案手法は,RMLA,RMLB,HISARのデータセットにおいて,識別精度をそれぞれ63.632%から66.332%,65.161%から66.168%,77.769%から79.867%に向上させた。
- 残差有用性の単独学習では一貫した改善は見られず,提案手法全体(証拠と行動のポリシー)の有効性が確認された。
- キャリア周波数オフセットや歪みなどの過酷な条件下でも,提案手法は安定した性能向上を示し,信頼性が確認された。
幾何学に基づくTransformerにおける層別FFN幅の割り当て [cs.LG, cs.AI, cs.CL]目的:Transformerにおける層別FFN幅の割り当て方法
- Transformerは自然言語処理の分野で重要な役割を果たしており,その性能向上が求められている。
- Transformerのパラメータ数は膨大であり,特にFFNが大部分を占める。効率的なパラメータ利用が課題である。
- FFNの幅を層ごとに最適化することで,パラメータ効率を高め,性能向上を目指す。
- Transformerの各層におけるFFNの幅を,層の挙動に基づき動的に割り当てる手法を提案した。
- 実験の結果,提案手法は既存の固定幅や手動調整された幅と比較して,検証損失を低減することに成功した。
- 特に大規模モデルにおいては,提案手法が固定幅よりも大幅に性能が向上し,幾何学的な情報が有効であることが示された。
Open-DiffLoco:展開可能な四脚歩行ロボット制御のためのオープンソース微分学習 [cs.RO, cs.LG, cs.SY, eess.SY]目的:展開可能な四脚歩行ロボットの制御方針
- ロボットの自律的な移動能力は,様々な環境での活動に不可欠であり,その実現には高度な歩行制御技術が求められる。
- 従来の強化学習は報酬設計の複雑さや学習時間の長さが課題であり,実用的な歩行制御の開発を阻害している。
- 微分可能なシミュレーションを活用し,物理ハードウェアへの展開が可能な歩行制御を,オープンソースで実現することを目指す。
- 本研究で開発されたOpen-DiffLocoフレームワークは,簡略化された報酬関数とMuJoCo XLAを用いた効率的な学習を可能にした。
- 実機(Unitree Go2)での実験により,提案手法が0.2 m/s以下のRMSEで全方向の速度指令を追従し,1 m/s以上の速度で走行可能であることが示された。
- また,提案手法は不整地や外乱に対する頑健性も示し,比較的低スペックなGPUでも短時間で学習が完了することが確認された。
