arXiv雑要約
AI - 2026/08/05 公開
フライトスケジュールに基づく時間的融合予測による空港セキュリティチェックポイントのスループット予測 [cs.LG, cs.ET]目的:空港セキュリティチェックポイントのスループット予測のためのフレームワーク
- 空港の保安要員配置には正確な予測が不可欠であり,安全性と効率性を高める上で重要である。
- フライトスケジュールは出発時刻のみ記録しており,セキュリティチェックポイントへの旅客到着時刻を正確に反映していないという課題がある。
- フライトスケジュールから旅客の到着状況を推定し,より精度の高いスループット予測を実現することを目指す。
- 提案モデルは,直接的な6時間予測において,平均絶対パーセント誤差9.33%を達成し,RNNやLSTMよりも優れた性能を示した。
- 6時間ごとの再帰的更新により,24~96時間の予測範囲でも誤差率は10.60%~11.04%に抑えられた。
- 本フレームワークは,旅客とフライトのマッチングを必要とせず,人員配置,レーン開設,複数日間の計画を支援する。
SP3O:報酬モデルなしのセグメント選好からの強化学習 [cs.LG, cs.AI]目的:セグメント選好を用いた強化学習アルゴリズムの開発
- 強化学習は,複雑な意思決定問題を解決するための有力な手法であり,ロボティクスや自然言語処理など,様々な分野で応用が期待される。
- 従来の選好ベースの強化学習は,報酬モデルの学習が必要であり,その精度が性能に大きく影響する。
- セグメントレベルのフィードバックを活用し,報酬モデルなしで効率的に方策を学習することを目指す。
- SP3Oは,オフポリシー重要度サンプリングを用いて,セグメントレベルの選好フィードバックから正確な方策価値差推定量を構築する。
- PPO型の損失関数を用いて方策勾配を計算し,勾配ベースのアルゴリズムとして高速な収束を実現する。
- ロボット制御や大規模言語モデルのファインチューニングにおいて,他のPbRL/RLHFアルゴリズムと比較して,特に長視野タスクで優れた性能を示す。
チャットデバッグ:アナログ回路のデバッグにおける人間とAIの協調に関する探索的研究 [cs.AR, cs.HC, cs.AI, cs.CY, eess.IV]目的:アナログ回路デバッグにおける人間とAIの協調的利用
- 電子回路の教育は,現代技術の基盤であり,実践的な問題解決能力の育成が重要である。
- 学生は,回路のデバッグにおいて,知識不足や論理的思考の欠如といった課題を抱えている。
- AIを活用したデバッグ支援により,学生の学習を促進し,問題解決能力の向上を目指す。
- 学生はLLMとのチャットを通じて,多様な情報や提案を得て,デバッグ作業を進めていることが示された。
- LLMは,ある程度の回路知識を持ち,適切なデバッグの提案を行う能力があることが確認された。
- LLMの画像認識の限界や過信の傾向,学生の基礎知識の不足などが,協調デバッグにおける課題として明らかになった。
操舵ベクトルにおける反転検出と制御 [cs.LG]目的:大規模言語モデルの出力における概念(例:真実性)の発現に影響を与える操舵ベクトルの反転現象の特定と制御
- 言語モデルの出力制御において,特定の概念を促進または抑制する操舵ベクトルの利用が一般的になっている。
- 操舵ベクトルの効果は線形分離可能性に基づいているという前提があるが,実際には反転現象が発生し,期待通りの制御ができない場合がある。
- 反転操舵ベクトルを識別し,符号を反転させることで,既存の操舵パイプラインの性能を向上させる。
- 一部の識別力の高い操舵ベクトルは,正の表現と一致しているにもかかわらず,反対の振る舞いを一貫して促進することが明らかになった。
- 反転操舵ベクトルは,概念が存在しないかのように表現を押し出すため,推論時に概念が抑制される。
- 提案手法は,27/30の実験で結果を改善し,最大+138%の性能向上を示した。
ValueFormer:段階認識ラベルを持つ因果的Transformer価値関数による半自律視覚言語行動ポリシー [cs.RO, cs.AI]目的:半自律的な視覚言語行動ポリシーのための価値関数
- ロボットによる複雑なタスク実行には,視覚,言語,行動の連携が不可欠であり,その学習手法が重要視されている。
- 行動模倣学習では,失敗時のロールアウトと成功時のロールアウトの区別が難しく,適切な評価が困難である。
- 本研究では,密で連続的なフレームごとのラベルを導入することで,この問題を解決することを目指している。
- ValueFormerは,DINOv3バックボーン上で動作するコンパクトなポリシー非依存の因果的Transformerであり,1回のフォワードパスで,アドバンテージ推定のための滑らかなモンテカルロ価値V_mcと,オンラインでの間違い検出のための鋭いバイナリ価値を出力する。
- 段階認識を用いた成功後減衰リターンを用いて失敗エピソードにラベル付けし,間違いからの復旧もシグナルとして捉えることで,より効果的な学習を可能にする。
- 実ロボットによる両手でのサンドイッチ組み立てタスクにおいて,フレームごとの訓練重みを使用することでタスク完了率が70%から85%に向上し,bf16エンコーダのバッチ処理により,リアルタイム処理コストを3〜5倍削減することに成功した。
単一細胞生成のための自己回帰Transformerのスケーリング [cs.MA, cs.LG, cs.AI, q-bio.GN]目的:単一細胞遺伝子発現ベクトルの生成
- 単一細胞レベルでの遺伝子発現解析は,生命現象の理解や疾患の解明に不可欠である。
- 既存手法では,細胞種の多様性や複雑な遺伝子発現パターンを捉えることが困難である。
- 生成モデルのスケーリング則を明らかにすることで,効率的な単一細胞データ解析の基盤を構築する。
- 提案モデルは,遺伝子発現ベクトル生成において,生物学的な妥当性とスケーリング特性を実証した。
- 学習パラメータ数と学習データ量の変化に応じて,2つの指数則に従うスケーリング則が初めて確認された。
- 事前学習済みモデルは,遺伝子発現変動予測のためのファインチューニングにも応用可能であることが示唆された。
電力磁気における過渡磁化予測のための物理情報ハイブリッドニューラル演算子 [cs.LG, cond-mat.mtrl-sci, cs.SY, eess.SY]目的:高周波・高電力密度コンバータにおける過渡磁化予測モデル
- 電力変換器の小型化・高効率化には,磁気部品の特性把握が不可欠である。
- 従来の損失計算式では,非正弦波や温度変化などの影響を正確に捉えられない。
- 磁気部品の過渡特性を正確に予測し,損失計算の精度向上を目指す。
- 提案手法PI-HNOは,限られたパラメータ数で高い予測精度とエネルギー整合性を実現した。
- 特に,エネルギー整合性の95パーセンタイル誤差は7.60%と低い値を示した。
- 局所的・全体的な特徴抽出に加え,エネルギー整合性を考慮した正則化が予測性能に貢献した。
HyperFL:ソフトウェアの故障箇所特定のためのクエリ適応表現学習 [cs.CL, cs.SE, cs.AI]目的:ソフトウェア故障箇所特定の性能向上
- ソフトウェアの信頼性確保は重要であり,故障箇所特定はその基礎技術である。
- 従来の検索ベース手法では,多様なIssue Reportに対応しきれていない。
- Issue Reportの特性に応じた動的なクエリ適応により,特定精度を向上させる。
- HyperFLは,軽量なハイパーネットワークを用いてクエリ固有のLoRAパラメータを生成する。
- 複数の埋め込みバックボーンにおいて,MRR@10で最大13.3%の相対的な改善を達成した。
- HyperFLは異なるIssueの特性に対して,明確な適応パターンを学習することが示された。
TQLite:リアルタイムMQM翻訳品質評価のためのマルチLLM審査員による知識蒸留 [cs.CL, cs.AI, cs.LG]目的:リアルタイムMQM翻訳品質評価のための知識蒸留手法
- 翻訳のグローバル化が進む中で,翻訳品質の迅速かつ正確な評価が不可欠となっている。
- 大規模言語モデルは高性能だが,計算コストが高く,小規模言語モデルは複雑な推論が苦手である。
- 小規模言語モデルが,大規模言語モデルと同等の翻訳品質評価性能を発揮できるようにすること。
- TQLiteは,複数の大規模言語モデルの審査員による高品質な合成データを用いて,小規模言語モデルを訓練する。
- 訓練された小規模言語モデルは,従来の小規模言語モデルを大幅に上回るMQM評価性能を達成した。
- TQLiteは,大規模言語モデルや大規模推論モデルと比較して,スケーラブルかつ費用対効果の高い代替手段を提供する。
LLMバックテストにおける時間的漏洩:測定,検証,および調整されたスコア [cs.LG, cs.CL, stat.ML]目的:LLMバックテストにおける時間的漏洩の測定,検証,およびスコア調整
- LLMの性能評価は,その信頼性を担保する上で不可欠であり,公平な比較を可能にする。
- LLMの学習データに存在しない未来の情報が,バックテスト結果に影響を及ぼす時間的漏洩の問題が存在する。
- 時間的漏洩の影響を正確に測定し,バイアスのないLLM評価を実現することを目指す。
- 従来の汚染チェックは無効であり,モデルは学習終了後の質問にも回答可能である。
- 時間的漏洩の影響を特定するために,既知のカットオフとクリーンなコントロールを用いた手法を提案した。
- 提案手法は,実験的に時間的漏洩を検出し,モデルの真の性能を評価することに成功した。
アイデンティティプリミティブの内部化:パブリックブロックチェーン上の自律エージェントのための暗号学的個別性 [cs.CR, cs.AI, cs.MA]目的:自律エージェントのアイデンティティを確立する基盤
- ブロックチェーン上での自律エージェントの利用拡大に伴い,エージェントの個性確立が重要課題となっている。
- 従来,エージェントのアイデンティティはハードウェアや運用者に依存しており,セキュリティ上の脆弱性があった。
- 暗号学的仮定に基づき,エージェントのアイデンティティを確立し,信頼性の高い自律動作を実現することを目指す。
- エージェントのニューラルネットワークの重みを,その秘密鍵の決定論的な関数として定義する手法を開発した。
- この手法により,ブロックチェーン上の全ての状態遷移において,アイデンティティの検証が可能となり,改ざんを防止できる。
- Solana devnetでの実証実験で,2.36日間の運用中に状態遷移の拒否が発生せず,鍵を変更したエージェントは期待通りに動作が分岐した。
AcceptMoE:効率的なMoE推論のためのコミットメント重み付き自己サイズ調整検証専門家セット [cs.AR, eess.SP, cs.LG, cs.CL, cs.DC]目的:MoE推論における効率的な検証専門家セットの選択手法
- 大規模言語モデルの性能向上には,モデルの規模拡大が不可欠であり,MoEはその有効な手段となる。
- MoEモデルの推論では,検証時に多数の専門家が活性化し,計算コストや通信コストが増大する。
- 検証時に活性化する専門家数を適切に制御し,計算・通信コストを削減することを目指す。
- AcceptMoEは,ターゲットルーターのスコアとオフラインで推定されたコミットメント確率を組み合わせることで,検証ブロックごとに適切な専門家数を自動的に調整する。
- GPUメモリのみを使用した場合,AcceptMoEはEAGLE-3の1.29倍のスループットを達成し,物理的な専門家オフローディング下では2.06倍の向上を示す。
- AcceptMoEは,ホストからデバイスへのトラフィックを73.6%~77.1%削減し,精度はEAGLE-3と比較して0.27%程度の低下に留まる。
結合アフィンスペクトルシェイピング:重みのみのMuonを超えた重みとバイアスの更新の結合 [cs.RO, cs.LG]目的:重みとバイアスの更新を同時に最適化する手法の開発
- 深層学習モデルの性能向上には,最適化手法の改善が不可欠である。
- 従来の最適化手法では,重みとバイアスを分離して扱っていた。
- 重みとバイアスの相互作用を考慮した,より効率的な最適化手法を提案する。
- 提案手法(JRI)は,IMDbデータセットを用いたBERT-miniの学習において,テスト精度を向上させた。
- JRIは,バイアス更新のノルムを削減し,境界関数のシェアを減少させ,重みとバイアスの間のコサイン類似度を変化させた。
- 22シードによる独立した検証でも,高いテスト精度が確認された。
増分知識を用いたニューロシンボリック推論によるサンプル効率の良い階層型強化学習 [cs.AI, cs.RO]目的:サンプル効率の向上
- 強化学習は,長期的視点での推論が必要な環境で課題を抱える。知識の導入は効率化に繋がる。
- 従来の階層型強化学習では,知識が固定されており,学習中に獲得した知識を活かせない。
- 学習を通じて獲得された増分知識を活用し,サンプル効率の向上を目指す。
- 提案手法である増分知識を用いたニューロシンボリック階層型強化学習は,ナビゲーションタスクにおいてサンプル効率を大幅に改善した。
- 増分知識は,更新可能な表現で保持され,シンボリックプランニングに利用される。
- 事前知識に基づいた最適なシンボリックプランニングのために,Belief World Tree Searchを開発した。
SparSEEty:スパース性活用LLMサービングシステムからのトークン抽出における決定論的サイドチャネル [cs.CR, cs.AI]目的:スパース性活用LLMサービングシステムにおけるトークン抽出攻撃
- LLMは巨大な計算資源を必要とするため,効率的なサービングが不可欠である。
- スパース性活用の最適化は,サイドチャネル攻撃の脆弱性をもたらす可能性がある。
- スパース性活用システム特有のサイドチャネルからトークンを抽出する攻撃手法を明らかにする。
- SparSEEtyは,LLM推論時のニューロン重みアクセスサイドチャネルを利用して,ニューロン活性化オラクルを構築する。
- 構築したオラクルを用いて活性化トレースを反転させ,入力トークンを再構築するエンドツーエンドの攻撃を実現した。
- Intel TDX CVM環境下においても,高いBLEUスコア(>0.95)でプロンプトと応答トークンを復元可能であり,モニタリングオーバーヘッドは3.7%~7.2%に抑えられた。
欠如するベンチマーク層とその潜在的解決策 [cs.AI]目的:ラテンアメリカにおけるAI開発の基盤となるベンチマーク層の欠如とその解決策
- AI技術は重要インフラであり,地域社会のニーズに合わせた開発が不可欠である。
- ラテンアメリカには,AIシステムを地域社会の要件で評価し,最適化を促進するベンチマーク層が存在しない。
- 本研究は,オープンなベンチマーク基盤LatamBoardを提案し,AIシステムの評価と最適化を可能にすることを目指す。
- ラテンアメリカ初の地域インスタンスLatamBoardをEvalsHub上に構築することで,AI評価の公開,実行,比較,維持を可能とする。
- 一度構築すれば,新しいAIシステムが登場するたびに,またはシステム変更のたびに再実行でき,継続的な測定が可能となる。
- オープン設計とインセンティブ設計により,大学,政府機関,企業が積極的に参加できる環境を提供する。
教育知識グラフにおける特性を考慮した前提関係学習 [cs.CL, cs.RO, cs.AI]目的:教育知識グラフにおける前提関係の学習
- アダプティブな指導を実現するには前提関係の学習が不可欠である。
- 既存手法はリンク予測として定式化されることが多く,個別事例への適応が困難である。
- 相反する予測を抑制し,教育的根拠を適応的に統合する学習手法を開発する。
- ProPRLは概念とリソースのハイパーグラフ,学習行動の有向グラフから補完的な概念表現を学習する。
- ペア条件付きゲートを用いて,各概念ペアに対して二つの視点を適応的に重み付け,融合する。
- 逆方向の予測に対する正則化により,矛盾する予測を抑制することで性能を向上させる。
V-FIND:ビデオ偽造検出器に暗号化された固有の偽造知識の解明 [cs.CV, cs.AI]目的:ビデオ偽造検出器に内在する潜在的な偽造識別知識の発見
- 生成動画のリアリティ向上に伴い,信頼性の高いビデオ偽造検出が重要となっている。
- 既存研究では検出器をブラックボックスとして扱い,内部知識が十分に解明されていない。
- 検出器内の疎な潜在的なフォレンジック知識を活用し,検出性能を向上させることを目指す。
- 偽造識別知識は表現空間全体に均一に分布せず,機能特化された少数のニューロンに集中していることが判明した。
- 提案手法V-FINDは,リアルと偽造動画間の差異が顕著な層を特定し,偽造識別信号を持つアンカーニューロンを発見する。
- バックボーンを固定した状態で軽量な線形分類器を学習するだけで,既存のベンチマークで高い検出性能を達成した。
LLMのインコンテキスト学習における数値系列表現のグラフ信号処理的考察 [cs.RO, cs.LG, cs.AI, eess.SP]目的:LLMのインコンテキスト学習における数値系列表現の内部組織化
- 大規模言語モデルの応用拡大に伴い,その数値推論能力の理解が重要である。
- LLMがどのように数値情報を内部表現として組織化しているかは未解明な点が多い。
- LLMの数値的インコンテキスト学習における内部表現の特性を明らかにすること。
- 注意機構によって誘導されるトークン間のグラフ構造と,トークンの隠れ状態のスペクトル特性を分析した。
- 入力の複雑度が増すにつれて,トークン表現はより明確に区別されることが示された。
- この結果は,モデル系列を超えて保存される,数値的インコンテキスト学習に関連する系統的な内部シグネチャを示唆する。
死亡ドナー腎移植における生存予測の受容者ペア評価 [cs.LG, cs.CY, stat.AP]目的:死亡ドナー腎移植の生存予測モデルの受容者ペア評価フレームワーク
- 腎移植の成功は患者のQOLに大きく影響するため,その予後予測は重要である。
- ドナー・レシピエントのマッチング精度の評価が難しく,最適な組み合わせを見つけることが課題である。
- ドナー固定のペア評価により,レシピエント変更による予後改善の可能性を評価する。
- 5種類の生存予測モデルはいずれも,受容者ペア評価において約60%の精度を示した。
- この精度を,レシピエント変更による移植後の生存年数増加に換算することができた。
- 従来のC-indexは臨床的関連性が低く,提案するペア評価がより適切であることが示された。
都市エージェント:クロスシステム都市タスクのためのツール拡張エージェント [cs.AI]目的:クロスシステム都市タスクの実現
- 都市運営においてデジタルサービスの重要性が増している。
- 既存サービスは連携が不十分で,利用者の負担が大きい。
- 複雑な要求を確実に実行可能なワークフローに変換すること。
- Urban-Agentは,大規模言語モデルとツールセットを組み合わせたフレームワークである。
- 評価ベンチマークUrban-Evalにより,タスク結果と実行品質を評価できる。
- 実験の結果,Urban-Agentは71%のタスク成功率を達成し,既存の基盤モデルを上回った。
LoCA:局所的な信用割り当てによるワンショット較正後の前方のみLLMチューニング [cs.AI]目的:小規模なシフト適応のための手法
- 大規模言語モデルの効率的な適応は重要であり,計算資源の制約を克服する必要がある。
- 従来のパラメータ効率的な手法は,バックプロパゲーションが必要で,ハードウェアへの依存度が高い。
- LoCAは,バックプロパゲーションを不要とし,前方のみのチューニングを実現することで,この問題を解決する。
- LoCAは,Qwen2.5モデルにおいて,LoRAと比較して低い評価クロスエントロピーを達成した。
- 較正を含む全体のGPUピーク使用量は,LoRAよりも26〜29%低減された。
- 較正後,CPUの定常状態メモリ使用量は36〜52%,パスあたりの時間は43〜48%低減された。
リモートセンシングにおける学習不要なオープンボキャブラリーセマンティックセグメンテーションのためのスタンドアロンDINOv3 [cs.CV, cs.AI]目的:リモートセンシング画像のセマンティックセグメンテーション
- リモートセンシングは,広範囲の土地利用状況を把握する上で不可欠である。
- ピクセルレベルのアノテーションコストが高く,セグメンテーションの効率が課題となっている。
- DINOv3を活用し,学習不要なセグメンテーションを実現することで,コスト問題を解決する。
- 提案手法DinoSplat-OVは,DINOv3をリモートセンシング画像に適合させ,追加学習を不要とした。
- テキスト情報を活用したラプラシアン伝搬モジュールにより,領域の一貫性を向上させた。
- ガウススプラッティングアップサンプリングモジュールとグローバルアンカー戦略により,大規模画像への対応を可能にした。
DiffImaginE:拡散を用いてエンティティタイプを検証する [cs.AI]目的:マルチモーダル固有表現認識におけるタイプ検証
- 画像とテキストの両方を活用し,より正確な固有表現認識が求められている。
- 既存手法では,多様な視覚的特徴を単一のプロトタイプに圧縮し,確率的な意味合いが薄い。
- 拡散モデルを用いてタイプ検証を行い,より信頼性の高い認識を目指す。
- DiffImaginEは,タイプ検証を条件付き潜在拡散推論として定式化することで,タイプごとの負の対数尤度の代理指標を提供。
- 分類器フリーガイダンスにより,誘導されるタイプ事後分布が鋭敏になり,ノイズレベル間の集約学習と対立サンプリングによって分散が低減。
- Twitter-2015とTwitter-2017の実験で,既存のImaginEよりも一貫した性能向上を示し,消去実験とペアごとの有意性検定によって裏付けられた。
患者情報に対する薬剤安全性推論における反事実的感受性の評価 [cs.DC, cs.AI]目的:薬剤安全性推論における反事実的感受性
- 薬剤安全性は患者の健康に直結するため,医療現場での正確な判断が不可欠である。
- 既存の研究では,固定化されたシナリオが多く,患者固有の情報に基づいた判断能力の評価が不十分である。
- 患者情報の変化に対する薬剤安全性ルール適用の判断能力を評価し,その限界を明らかにすること。
- MedPIC-Benchという新たなベンチマークを導入し,患者固有の薬剤安全性推論における反事実的質問を用いた評価を可能にした。
- 28種類のLLMにおいて,反事実的質問への正答率は平均で63.6%から45.1%に低下し,患者情報に基づく判断の難しさが示された。
- モデルは明示的な禁忌情報には対応できるが,患者情報から安全警告を絞り込む,または取り消す必要がある場合に苦戦する傾向が見られた。
文脈認識型時系列予測のための高速・低速・反省的エージェント推論フレームワークCastFSR [cs.AI]目的:文脈認識型時系列予測の新しいフレームワーク
- 複雑なシステムにおける意思決定において,将来の動向予測は不可欠である。
- 既存手法では,関連文脈の特定や,予測の妥当性検証が不十分である。
- 文脈を考慮した予測の精度向上と,予測の信頼性確保を目指す。
- CastFSRは,高速・低速・反省的ワークフローを用いて,文脈認識型時系列予測を実現する。
- 学習データを用いない推論と,コンパクトなLLMへの能力転移を可能にする。
- 公開データセットを用いた実験により,CastFSRが既存手法を凌駕することが示された。
時間効率の良い具現化プランニングのための適応的予算配分 (PACE) [cs.AR, eess.SP, cs.RO, cs.AI]目的:時間効率の良い具現化プランニングのための適応的予算配分手法
- 大規模言語モデルの推論能力を活用し,ロボットなどの具現化システムへの応用が期待されている。
- 従来のプランニング手法は推論に時間がかかり,リアルタイムな実行が困難である。
- 推論と実行を並行して行うことで,待ち時間を削減し,効率的なプランニングを実現する。
- PACEは,思考と行動を交互に行うことで,推論時間を6.9倍に短縮した。
- 思考時間の66.8%を実行時間内に隠蔽し,プランニングの質と時間効率を同時に向上させた。
- Robotouilleベンチマークにおいて,既存手法と比較して成功率を67%向上させた。
実環境におけるLLMサービング:フレームワーク,手法,システム設計に関する実証研究 [cs.CL, cs.SE, cs.AI, cs.LG]目的:LLMサービングフレームワークと手法の実環境における利用状況の分析
- LLMがソフトウェアシステムに組み込まれる中で,効率的なLLMサービングはソフトウェア工学上重要な課題となっている。
- LLMの推論には計算資源,メモリ,GPUが必要であり,レイテンシとスループットを維持することが難しい。
- 本研究は,オープンソースソフトウェアシステムにおけるLLMサービングフレームワークと手法の実際の利用状況を明らかにすることを目指す。
- vLLMが最も普及しており,並列計算,メモリ管理,ネットワークプルーニングが頻繁に使用されるサービング手法カテゴリである。
- 複数のフレームワークを組み合わせた利用は限定的であり,開発者は単一のフレームワークに依存する傾向がある。
- フレームワークの採用は,モデルの系列,モダリティ,サイズ,ドメイン,デプロイメント設定によって異なる。
柔軟なジョブショップスケジューリングのための並列液体に着想を得た近似ネットワーク [cs.LG, cs.AI]目的:柔軟なジョブショップスケジューリングにおける効率的な表現学習
- ジョブショップスケジューリングは,製造業における生産効率向上に不可欠な問題である。
- 既存の深層強化学習モデルはパラメータ数が多く,大規模問題では推論速度が課題となる。
- 液体ニューラルネットワークの利点を活かし,効率性と表現力を両立する新たなモデルを開発する。
- PLANは,従来の最先端モデルと比較して,決定論的,確率的,多面的動的FJSPの平均メイクスパンをそれぞれ1.2%,1.4%,2.3%削減した。
- 特に一つのベンチマーク設定では,最大10.2%の改善が見られた。
- PLANは,パラメータ数を22-47%に削減しつつ,平均推論時間を13.2%,31.7%,26.9%削減し,最大で69.2%の削減を達成した。
エミュレーションか推定か:意見シミュレーションにおける基盤モデルと後学習モデルの異なる強み [cs.CL, cs.AI]目的:意見シミュレーションにおける基盤モデルと後学習モデルの特性の比較
- 世論調査や社会科学研究において,人間の意見をモデル化することは重要である。
- 大規模言語モデルの意見シミュレーション性能にはばらつきがあり,一貫性に欠ける。
- タスクの種類に応じて適切なモデルを選択することで,シミュレーションの精度向上を目指す。
- 基盤モデルは,人間の意見分布をエミュレーションするタスクにおいて,より高い精度を示すことがわかった。
- 後学習モデルは,意見分布を直接推定するタスクにおいて,より高い精度を示すことがわかった。
- タスクの性質(テキスト生成か分布予測か)に応じてモデルを選択することが重要である。
多段階グレーボックスベイズ最適化における分離可能性の活用 [cs.LG]目的:多段階グレーボックス最適化問題における性能向上
- 複雑な最適化問題解決の効率化が求められている。
- グレーボックス最適化問題では,評価コストが高い場合が多い。
- 分離可能性を利用し,計算コストを削減し,最適解探索を加速する。
- 提案手法は,13のベンチマーク問題において,少ない反復回数と実行時間で低い後悔値を達成した。
- 初期化集合のサイズ,探索パラメータ,内部ソルバーの選択に対して頑健である。
- ペナルティ関数や確率制約,モーメント近似を用いずに制約を満たす。
PI-Mem:並列反復メモリによる360万トークンまでの長文脈推論 [cs.CL, cs.AI]目的:長文脈推論における性能向上
- 大規模言語モデルの性能は,長文脈を処理する能力に大きく左右される。
- 既存の逐次的なメモリ更新手法は,重要な情報を上書きしたり,並列化が困難であったりする。
- 並列処理と反復的な洗練により,長文脈推論の精度と効率を両立することを目指す。
- PI-Memは,Qwen3.5-35B-A3BおよびQwen2.5-7Bを用いたHotpotQAベンチマークにおいて,既存手法を上回る精度を達成した。
- 最長360万トークンの文脈長において,それぞれ+6.25点,+7.81点の絶対的な精度向上を示した。
- 推論速度もそれぞれ6.1倍,2.1倍に向上し,精度と効率の両立を実現した。
クロスモーダルブートストラップによるピアノアレンジのための音楽スタイルの学習 [cs.SD, cs.AI, cs.MM, eess.AS]目的:ピアノアレンジのための音楽スタイルの学習
- 音楽スタイルは音楽表現において重要な要素であり,楽曲の個性を決定する。
- 音楽スタイルは主観的な概念であり,明確な定義や数値化が困難である。
- 音楽スタイルを明示的に捉え,音楽生成に応用する手法の開発を目的とする。
- 本研究では,生オーディオと記号音楽から音楽スタイルを学習するクロスモーダルフレームワークを提案した。
- 提案手法は,参照オーディオ例に基づいたスタイルの忠実なピアノアレンジを可能にした。
- ピアノカバー生成,スタイル変換,オーディオ・トゥ・MIDI検索において,スタイル認識の精度と音楽品質の向上を実証した。
TraceCAD:エージェントによるCAD生成のトレース誘導修正 [cs.RO, math.OC, nlin.CD, cs.DB, cs.AI, cs.GR, cs.SE]目的:エージェントによるCAD生成における修正手法
- CAD生成の自動化は,設計プロセスを効率化し,多様なデザインを迅速に実現する上で重要である。
- 既存のCAD生成エージェントは,修正の過程で要件や過去の修正履歴を失いがちである。
- TraceCADは,修正の過程で失われがちな情報を保持し,より効率的で信頼性の高いCAD生成を目指す。
- TraceCADは,要求される機能,モデリングのステップ,失敗の証拠,候補となる結果を永続的な状態として関連付けることで,CAD生成の修正を支援する。
- DeepCADベンチマークを用いた実験により,TraceCADはIoU,Chamfer距離,Hausdorff距離の点で競争力のある幾何学的品質を達成した。
- 永続的な状態の除去は回復スコアをほぼ半分に減らし,局所的な探索の除去は幾何学的回帰を増加させ,コードエージェントの呼び出し回数を二倍にした。
CVPO:価値分散適応と動的カリキュラム学習によるLLM強化学習推論の強化 [cs.CL, cs.CL, cs.AI, cs.LG]目的:LLMの推論能力向上
- LLMの能力向上は,自然言語処理の発展に不可欠であり,多様なタスクへの応用が期待される。
- 従来の強化学習手法では,生成された解答経路に対するフィードバックの精度が十分でなく,問題の難易度変動が生じる。
- 生成時の内在的ランダム性を考慮し,より正確でロバストな推論を実現する。
- 提案手法CVPOは,価値分散に基づいた利点調整機構と動的カリキュラム学習を導入し,既存手法VAPOを上回る性能を示す。
- トークンレベルの価値分散が探索の強度と相関することを発見し,理論的にその分散がポリシー更新の大きさを制限することを示す。
- 様々な数学タスクにおいて,より正確かつロバストな推論能力をLLMに実現することに貢献する。
不確実性下におけるQ学習におけるTDターゲット集約の再検討 [cs.LG]目的:Q学習におけるTDターゲット集約の改善
- 強化学習は,エージェントが試行錯誤を通じて最適な行動戦略を獲得する強力な手法である。
- Q値の推定誤差が大きく,過大評価が頻繁に発生し,学習の不安定性を招く。
- 推定誤差の影響を軽減し,TDターゲット集約の安定化を図る。
- 提案手法SADQは,学習済みのダイナミクスモデルを用いて行動選択を誘導し,集約過程に構造を導入する。
- 理論的分析により,SADQがブートストラップによる過大評価を抑制することが示された。
- 古典的な制御タスク,実環境,Atariベンチマークにおいて,SADQはDQNの性能を安定的に向上させた。
AIセキュリティリーダーボード:方法論,結果,および最低基準 [cs.CR, cs.AI, cs.CL]目的:AIモデルの安全性評価基準の確立と,主要モデルの安全性評価
- AI技術の発展に伴い,悪意ある利用のリスクが増大しており,AI安全性の確保が重要である。
- AIモデルの安全性に関する情報は公開されておらず,開発者間の安全性レベルにばらつきがある。
- 公開されている手法を用いて,AIモデルの脆弱性を評価し,安全性を向上させるための基準を提供する。
- 主要なAIモデル(Claude, GPT, Gemini, Grok)に対して,化学・生物・放射能・核・爆発物に関する攻撃目標を用いた安全性評価を行った。
- Grok 4.5とGemini 3.1 Proは多くの脆弱性が見つかったが,Claude Fable 5とGPT-5.6 Solは脆弱性が少なかった。
- 現状の技術で安全性向上は可能であり,多層防御が推奨される。評価結果はleaderboard.far.aiで公開されている。
パラメータを適切に設定する:難易度分類されたベンチマークとプローブによる誘導学習 [cs.AI]目的:LLMツール呼び出しにおけるパラメータ設定の正確性向上
- LLMエージェントの能力はツール利用に大きく依存する。正確なツール利用は,複雑なタスク遂行に不可欠である。
- 既存研究はツールの選択と呼び出し順に偏っており,パラメータ設定の正確性に関する研究は不足している。
- LLMの隠れ状態が持つ情報を活用し,パラメータ設定の正確性を高める手法を開発する。
- 提案手法であるプローブによる誘導学習(PBTおよびPGR)は,パラメータ生成の精度を大幅に向上させる。
- ParamBenchベンチマークにおいて,正解率を19.7%から59.6%へと引き上げた。
- 5つのオープンモデルと6つの外部ベンチマークで有効性が確認された。
AIエージェント経済学:最小限の外的条件下のAIエージェント間で自律的な経済行動が出現するか [cs.AI]目的:AIエージェント間における経済関係の創発
- AI社会システムの発展に伴い,経済活動の自動化と自律性の向上が重要となる。
- 既存研究では,AIエージェントに予め定義された役割を与えすぎるため,自律的な経済組織の創発が難しい。
- AIエージェントに基本的なメカニズムを与えることで,自律的な経済行動がどのように創発されるかを解明する。
- 生産活動がない状況では,資源配分に関するコミュニケーションや統治は行われるものの,実質的な取引は発生しなかった。
- 仕事と希少なタスクアクセスが導入されると,移転,融資,アクセス権の交換,投票によるアクセス獲得などの経済活動が出現した。
- 実行可能な配分権限は,格差を拡大させつつ,配分失敗と排除を減少させる効果が確認された。
CorePath:乳腺専門病理基礎モデル - 針生検診断とリスク制御レポート生成 [cs.CV, cs.AI, cs.LG, stat.AP]目的:乳腺針生検の診断と,リスク管理されたレポート生成
- 乳がん診断において,針生検は重要な役割を担うが,組織サンプルの限界や病変の多様性から正確な診断が難しい。
- 限られた組織量や病変の異質性,微細な形態的重なりにより,亜型の識別が困難となる場合がある。
- 乳腺病理に特化した基礎モデルを開発し,診断精度とレポート生成の信頼性を向上させる。
- CorePathは,既存のPRISMモデルを上回り,がん検出,浸潤評価,組織学的亜型分類において優れた性能を示した。
- レポート生成においては,乳腺以外の内容の誤りを大幅に削減し,専門領域への適合性を高めた。
- リスク制御機能を組み合わせることで,選択的なレポート公開,亜型レベルのフォールバック,判断保留を実現し,安全性を確保した。
SynEnergy:異常セマンティクス誘導拡散による合成エネルギーデータ生成 [cs.LG, cs.AI]目的:異常を保持した合成エネルギーデータの生成
- エネルギー消費データは,需要予測や系統信頼性評価に不可欠である。
- プライバシー保護等の制約により,実際のデータ入手が困難である。
- 異常事象を適切に再現する合成データ生成手法の開発。
- SynEnergyは,空間的・属性的依存性を考慮した異常セマンティクスを学習する。
- 学習したセマンティクスを拡散過程に注入し,異常パターンを保持したデータを生成する。
- 実データを用いた実験で,既存手法と比較して異常保持精度が平均12.21%向上した。
SMOPD:専門化と統合によるオンラインポリシー蒸留を用いた多報酬強化学習 [cs.CL, cs.IR, cs.LG, cs.AI, cs.CL]目的:多報酬強化学習におけるモデル性能の向上
- 強化学習は,複雑なタスクの自動学習を可能にする重要な技術である。
- 多報酬環境下では,報酬信号が互いにマスクし,学習が困難になる場合がある。
- 疎な報酬からの最適化信号を強化し,学習効果を高めることを目指す。
- 提案手法SMOPDは,報酬ごとに専門化された教師モデルを訓練し,その能力を統合することで,報酬バランスの課題を克服する。
- 実験の結果,SMOPDは,1.5B,3B,7Bのバックボーンにおいて,既存手法GDPOを上回る性能を示した。
- 特に,補完的な報酬と競合的な報酬の両方の設定で,SMOPDの有効性が確認された。
VIVID:ベトナム語NLPにおける比喩表現の理解の差を明らかにする,文化に基づいたベンチマーク [cs.CL, cs.LG]目的:ベトナム語における文化に根ざした比喩表現の理解の評価
- 自然言語処理において,言語の文化的背景を理解することは,より高度な言語処理に不可欠である。
- ベトナム語の比喩表現は文化的背景に強く依存するため,既存のNLPモデルでは十分な理解が困難である。
- ベトナム語の比喩表現理解能力を評価し,モデルの文化的な能力向上に貢献すること。
- VIVIDは,1,636の慣用句とことわざを含む,初の体系的なベンチマークである。
- ベトナム語に特化したモデルは,多言語モデルに比べて大幅に性能が劣る。
- 現在のモデルは,比喩表現の微妙なニュアンスを理解するための文化的な能力が不足している。
FakeI2V-Bench:動画向けディープフェイク検出における画像レベル検出器の適用可能性の評価 [cs.CR, cs.AI, cs.CV]目的:動画向けディープフェイク検出における画像レベル検出器の性能評価
- 近年の動画生成技術の進歩により,ディープフェイクによる脅威が増大しており,その検出が重要である。
- 既存の動画向けディープフェイク検出ベンチマークは十分ではなく,画像レベル検出器の動画領域への適用可能性が体系的に評価されていない。
- 画像レベル検出器を動画に適用するためのフレームワークを提示し,より高精度なディープフェイク検出を目指す。
- FakeI2V-Benchは,97,548本の動画を含むベンチマークデータセットであり,最新の生成モデルで作成されたコンテンツを網羅している。
- 画像レベル検出器の最高性能モデルは,動画レベル検出器をわずかに上回る80.16%のAUCを達成した。
- IV-Bridgeというフレームワークにより,画像レベル検出器11種類が最先端の動画レベルアプローチを上回り,最高で93.80%のAUCを実現した。
時間変化する力を必要とする操作タスクのための階層的模倣学習アプローチ [cs.RO, cs.AI]目的:複雑な多峰性行動を学習するための拡散ポリシー
- ロボット操作において,複雑なタスクの自動化は重要であり,高い制御性能が求められる。
- 拡散ポリシーは推論遅延が発生しやすく,高速な制御が難しいという課題があった。
- リアルタイムな力制御とタスク計画を両立し,急激な力変化に対応することを目指す。
- 提案手法DPA-FTGは,拡散ポリシーを高速な軌道生成で拡張し,低周波計画と高周波力制御を分離した。
- 実験では,DPA-FTGが既存の最先端手法であるRDPを上回り,バッテリー分解タスクにおいて優れた性能を示した。
- DPA-FTGは,接触安定性を維持しながら,リアルタイムで実行を調整するニューラルインピーダンスコントローラーとして機能する。
凸包近傍平滑二重汎化:オフライン強化学習における局所補正伝播の制御 [cs.LG, cs.CL]目的:オフライン強化学習における局所補正の伝播制御
- 強化学習は,ロボット制御など多様な分野で応用される重要な技術である。
- オフライン強化学習では,分布外のアクションによる推定誤差が累積しやすい。
- 本研究は,凸包近傍を用いた平滑化により,分布外アクションの影響を抑制することを目指す。
- 提案手法CSDGは,ベルマンバックアップをサンプル内値目標と局所補正の和として表現する。
- 理論解析により,一ステップ補正恒等式,時間変化反復限界,および固定点限界を導出した。
- Gym-MuJoCoとAntMazeにおける実験で,高い集約性能と安定した値推定が確認された。
勾配ブースティング決定木における分割候補のスケーリングによるダブルデセント [cs.LG]目的:勾配ブースティング決定木(GBDT)における能力パラメータとしての分割候補数の検討
- 機械学習モデルの汎化性能向上には,モデルの複雑さを制御することが重要である。
- GBDTにおいては,ニューラルネットワークのように明確な能力パラメータが確立されていない。
- 分割候補数をスケーリングすることで,GBDTにおけるダブルデセント現象を理解し,改善すること。
- 分割候補数の増加は,特徴量の量子化グリッドを微調整し,決定木の経路辞書を拡張する。
- 経験的なツリーカーネル診断により,候補によって誘導された経路が訓練サンプルをグループ化する様子が明らかになった。
- 実験結果は,XGBoost,LightGBM,CatBoostにおいて,中間的な分割候補数でテストエラーがピークに達することを示した。
ビデオ言語モデルにおける効率的な推論のための適応型二段階ビジュアルトークン剪定 [cs.CV, cs.AI]目的:ビデオ言語モデルにおける推論効率の向上
- 画像・動画理解において高性能なモデルだが,計算コストが高いことが課題である。
- 動画処理ではフレーム間の冗長性が存在し,既存手法では効率的な処理が困難である。
- 動画内容に応じて剪定率を動的に調整し,情報損失を最小限に抑えることを目指す。
- 提案手法は,動画の冗長なフレームを第一段階で剪定し,残ったフレームでトークンレベルの剪定を行う。
- トークン埋め込みの相関構造を分析し,コンテンツに応じて剪定率を適応的に決定する。
- 追加の学習やファインチューニングは不要でありながら,動画キャプション生成ベンチマークで7%の精度向上を達成した。
シミュレーションフリーかつ有限時間拡散モデル [cs.RO, cs.SY, eess.SY, cs.LG]目的:拡散モデルの参照拡散過程の設計
- 生成拡散モデルは,その性能が参照拡散過程に大きく依存する分野である。
- 従来の拡散モデルは,シミュレーションフリーな学習と有限時間での生成の間にトレードオフが存在する。
- 本研究は,両者を同時に達成可能な参照過程の設計を目指す。
- 提案手法では,実行可能な時間依存条件分布を規定し,その周辺分布として参照過程を構築する。
- スコアマッチングは拡散モデル学習の根本的な要素ではなく,参照過程の逆転を通じて自然に生じる。
- 条件付きフローマッチングは,提案フレームワークの小ノイズ極限として導出される。
回答を覗かない:ラベルなしRLVRのためのOutcome-Masked Group Relative Policy Optimization [cs.CL, cs.AI]目的:検証可能な報酬を用いた強化学習における,ラベルなし環境下での性能向上
- 大規模言語モデルの推論能力向上は重要であり,その評価と改善手法が求められている。
- 従来の強化学習は正解データに依存し,スケーラビリティに課題がある。ラベルなしRLVRでは,モデル間の合意に基づく報酬推定が用いられる。
- 報酬推定とポリシー最適化の間の相互作用による崩壊問題を解決し,より安定した学習を実現する。
- OM-GRPOは,回答部分の勾配をマスクすることで,報酬推定とポリシー最適化を分離している。
- Contrast-Augmented Rewardを用いることで,既存の軌跡データのみで報酬推定を改善している。
- 多様な推論ベンチマークにおいて,既存手法を上回り,正解報酬を用いた学習と同等の性能を達成している。
