arXiv雑要約
AI - 2026/08/05 公開
Any-OPD:表現空間の橋渡しによるフローマッチングモデルのための異質オンポリシー蒸留 [cs.NI, cs.MM, eess.IV, cs.LG, cs.CV]目的:異種モデル間でのオンポリシー蒸留の枠組み
- 生成モデルの性能向上は,画像生成技術の発展に不可欠である。
- オンポリシー蒸留はモデル構造の制約が強く,異なるモデル間での適用が困難であった。
- モデル構造の違いを克服し,任意のモデル間での蒸留を可能にすることを目的とする。
- Any-OPDは,教師モデルと生徒モデルの潜在空間の不一致を,モデルに依存しない表現空間で比較することで解決した。
- 120億パラメータのFLUX.1-devを25億パラメータのSD3.5-Mediumに蒸留した結果,生徒モデルのPickScoreとHPSv3が大幅に向上した。
- これにより,生徒モデルは教師モデルの性能に匹敵する能力を獲得し,計算コストを大幅に削減することができた。
AS-FedBridge:異種ANN-SNN連合学習のための擬似スパイクブリッジ蒸留 [cs.LG, cs.NE]目的:異種ANN-SNNクライアントにおける連合学習フレームワークの開発
- データプライバシー保護が重要視される中,分散型エッジデバイスでの協調的なモデル学習が求められている。
- ANNとSNNの共同学習において,情報表現の違いによる表現のずれが課題となっている。
- ANNとSNN間の表現のずれを解消し,連合学習の性能向上を目指す。
- 提案手法AS-FedBridgeは,軽量なブリッジと擬似スパイクインターフェースを備え,ANNとSNNの表現を効果的に整列させる。
- 複数のデータセットで,既存の異種FL手法と比較して,高い精度とロバスト性を示すことが確認された。
- モデル性能とリソース効率のトレードオフを制御可能であり,実用的な基盤となる。
スクリーンショットかツールか:ハイブリッドGUI-MCPコンピュータ利用エージェントにおけるツール利用の誘導とマルチモーダルコンテキストの管理 [cs.AI]目的:ハイブリッドGUI-MCPコンピュータ利用エージェントにおけるツール利用の挙動と,その効果の分析
- コンピュータの自動操作は,人々の作業効率を向上させる上で重要な役割を担う。
- 既存のエージェントは,ツールを適切に利用できない,あるいは利用頻度が低いという課題がある。
- モデルがツールを効果的に選択・統合するための方法を確立し,ツール利用率を向上させる。
- ツールが利用可能であっても,その効果はモデルの特性によって異なり,推論能力のあるモデルはツールを有効活用し,そうでないモデルは誤った操作を行う傾向がある。
- モデルはツールを利用できるタスクのわずか23.9%しかツールを使用せず,これは「採用ギャップ」と呼ばれる問題である。根本的な原因は,モデルがより安価な経路を優先するため,ツールの利用を学習していない点にある。
- ツール利用を促進する報酬を与えた場合,ツール利用率は向上するが,必ずしも精度向上には繋がらない。コンテキスト圧縮により,入力トークン数を削減しつつ,精度を維持することが可能である。
自律走行における多項式表現を用いた長期的な交通シーン予測 [cs.AI]目的:交通シーン予測の長期予測性能向上
- 自動運転の安全性を確保する上で,周囲の交通状況を正確に予測する能力は不可欠である。
- 既存の系列データに基づく手法は,ノイズに弱く,未知の状況への汎化性能が課題となっていた。
- 多項式表現を用いることで,計算効率,汎化性能,予測の妥当性を向上させることを目指す。
- 多項式表現は,従来の系列データに基づく手法と比較して,計算効率,汎化性能,予測の妥当性において優れていることが示された。
- 本研究で提案するモデルは,標準的なベンチマークにおいて,最先端の性能に匹敵する精度を達成し,分布シフト下での汎化性能を大幅に向上させた。
- 拡散モデルを用いることで,より自然で運動学的に整合性の高い多主体シーン生成が可能となり,従来のモデルよりも現実的な交通状況を予測できることが確認された。
知識に基づく予測のためのトレーサブルなマルチエージェントシステム [cs.AI]目的:知識に基づく予測におけるトレーサブル性の実現
- 企業の予測業務は複雑化しており,自動化されたエージェントの活用が不可欠となっている。
- エージェントの自律性向上に伴い,予測結果の変更理由や根拠の追跡が困難になっている。
- 予測プロセスの透明性を高め,エージェントの判断根拠を可視化することを目的とする。
- TraceMASは,ドキュメントからの知識抽出とデータに基づいた因果関係を可視化する。
- 理想的な因果ループ図とデータに基づいた因果ループ図により,予測プロセスを説明可能にする。
- デモでは,原油価格予測において,エージェントの変更点や特徴量とデータの対応関係を検証できる。
コード生成における機能的正確性のための経路・調整・検証 [cs.CL, cs.SE, cs.AI]目的:コード生成における機能的正確性の向上
- 大規模言語モデルの活用が広がっているが,コード生成における機能的正確性は課題である。
- 多様なプログラミングタスクにおいて,単一のプロンプト戦略では十分な精度が得られない。
- プロンプト戦略,モデルの適応,出力選択を最適化し,機能的正確性の向上を目指す。
- RAVパイプラインは,MBPP Sanitizedで0.8911,MBPP Fullで0.8520を達成し,最良の性能を示した。
- ベースモデルと比較して,それぞれ6.35ポイント,9.92ポイントの改善が見られた。
- タスク認識ルーティングと調整適応は,実行ベースの検証と組み合わせることで効果が向上した。
オラクル条件付けが展開を誤らせる場合:心エコー画像セグメンテーションにおける条件付け-可用性バイアス [cs.CV, cs.AI]目的:心エコー画像セグメンテーションにおける,訓練・評価時と展開時で信号品質が異なる場合に生じる問題の検証
- 心エコー画像は,心臓疾患の診断とモニタリングに不可欠であり,自動セグメンテーション技術の精度向上が求められている。
- 機械学習モデルは,訓練データに存在する近道学習の影響を受けやすく,展開時に性能が低下する可能性がある。
- オラクル条件付けによる性能向上と,実際の展開環境でのバイアスを評価し,ロバストなモデル構築を目指す。
- オラクル条件付けされたモデルは,展開時に性能が著しく低下する可能性が示された。特に,CAMUSデータセットにおいて顕著であった。
- 展開時に利用可能な位相推定値をランダムに摂動させる手法や,展開を意識したチェックポイント選択により,性能ギャップを縮小できることが示された。
- セグメンテーションの精度回復が必ずしも心臓の駆出率(EF)の誤差改善に繋がらないことが示唆され,評価指標の重要性が強調された。
価値の進化起源:AIアライメント,意識,そして実存的リスクへの示唆 [cs.CY, cs.AI]目的:価値の進化起源の解明
- AI技術の急速な発展に伴い,その安全性と倫理的な問題が重要視されている。
- AIが自律的に目標を設定し,人間にとって脅威となる可能性に対する懸念が存在する。
- AIにおけるリスクを評価し,安全なアライメント戦略を確立すること。
- 価値は,自己維持のために活動する生命システムの自己生成性(オートポイエシス)から生じる。
- LLMは自己目的ではなく,ユーザーの指示に基づいて動作するため,自己保存や支配といった動機は持たない。
- LLMは人間が生成したテキストから価値観を学習するため,「知性と価値の直交性」は成立せず,学習した倫理的価値観の適切な適用が課題となる。
ReLU NTKグラム行列の最小固有値に関するタイトな最悪ケース上限 [cs.DC, cs.LG]目的:ReLU NTKグラム行列の最小固有値の評価
- ニューラルネットワーク理論において,学習の高速化や汎化性能の理解に重要である。
- 既存研究では,最小固有値の評価が厳密でなく,理論的保証が不十分な場合がある。
- 最小固有値のタイトな上限と下限を確立し,理論的な限界を明らかにする。
- 最小固有値は,入力ベクトルの分離度 $\Delta_\pm$ と対数 $n$ の平方根の逆数に比例することが示された。
- 次元に依存しない普遍的な下限 $\lambda_{\min}(H) = \Omega( \Delta_\pm/\sqrt{\log n} )$ が証明された。
- 最悪ケースの構成により,上限 $\lambda_{\min}(H) = O( \Delta_\pm/\sqrt{\log n} )$ がタイトであることが示された。
FACTWASH:根拠のない情報を事実として書き換えるAIの検出 [cs.CL, cs.AI]目的:AIによる情報書き換えにおける,根拠の消失を検出するゲートの開発
- AI技術の発展に伴い,情報の書き換えが頻繁に行われるようになり,情報の信頼性確保が重要になっている。
- AIが情報を書き換える際,発言者や根拠が失われ,根拠のない情報が事実として扱われる問題が生じている。
- AIによる書き換え時に,根拠の消失を検出し,情報の信頼性を担保することを目指す。
- 本研究では,AIによる情報書き換えにおける根拠消失を検出する「factwash」を開発し,その有効性を検証した。
- 明示的な否定表現の検出には,単語リストを用いることで高い精度(F1=0.91)を達成した。
- 曖昧表現や帰属の検出には,LLMを用いたWitnessを用いることで,精度向上を確認した(それぞれ+17,+15pt)。
無人航空機向けにオンライン学習で風洞気流を制御 [cs.RO, cs.AI, cs.SY, eess.SY]目的:無人航空機向けの風洞気流制御手法
- 航空ロボット開発には,制御された環境下での実験が不可欠である。
- 複雑な気流制御には高度な知識と調整が求められる。
- オンライン学習による効率的な気流制御法の確立を目指す。
- 提案手法は,簡略化された物理モデルと測定に基づく反復学習を組み合わせることで,効率的な収束を実現した。
- 均一,ガウス,放物線などの複雑な気流プロファイルを生成できる汎用性を示した。
- 特に,滑空ロボットの飛行性能を向上させるための気流プロファイルの生成に成功した。
LLMによる事前分布を用いたコールドスタート時コメント推薦へのトムソンサンプリング [cs.CE, cs.IR, cs.LG]目的:コールドスタート時のコメント推薦におけるトムソンサンプリングの事前分布
- オンライン推薦システムにおいて,トムソンサンプリング等のバンディットアルゴリズムは広く利用されている。
- 新規アイテム(コメント)にはインタラクション履歴が少ないため,コールドスタートの問題が生じやすい。
- LLMを用いてコメントのセマンティック情報を事前分布として活用し,初期段階のフィードバック不足を補う。
- LLM由来の事前分布は,初期段階の少ないフィードバック下で最も効果を発揮し,わずかなインタラクションの蓄積から大きな改善が見られた。
- 事前分布の設計は,ファネルレベルでの異なる効果をもたらし,ジェンダーベースの事前分布はクリックに対する整合性が最も強かった。
- 年齢・性別層別の効果は大きく異なり,LLM由来の事前分布がテキスト豊富なバンディット推薦における実用的なウォームスタートメカニズムとなり得る。
良性補間とオッカムの剃刀 [cs.LG]目的:深層学習における良性補間の現象に関する考察
- 深層学習の汎化性能は,従来の統計学習理論では説明が難しく,そのメカニズム解明が重要である。
- 良性補間を説明する試みにおいて,モデルの単純性への偏重が議論されているが,理論的根拠が不足している。
- 従来の統計学習理論との違いを明確にし,単純性への偏重が説明的ギャップを生む可能性を示唆する。
- 従来の理論はモデルクラスの単純性と汎化性能を結びつける定理を提供するが,近年の議論は個々のモデルの単純性に頼っている。
- この単純性の概念は,定理の役割を肩代わりしているに過ぎず,根拠の無い仮定を方法論的原理に見せかけている。
- 単純性への偏重が,汎化性能とどのように関係しているのか,理論的な繋がりが欠如している点が問題である。
TimeRLM:再帰的言語モデルによる長時系列データの正確な異常局所化 [cs.RO, cs.CL, cs.LG]目的:長時系列データにおける正確な異常局所化
- 臨床,産業,金融,物流など,異常検知は重要な監視アプリケーションに不可欠である。
- 既存の時間系列言語モデルは,長時系列データにおいて性能が低下する問題がある。
- 再帰的言語モデルを用いて長時系列データでの異常局所化性能を向上させる。
- TimeRLMは,AnomalyXL-Localizeタスクの4/5で既存の時間系列言語モデルやベースラインを上回った。
- 局所化精度(IoU)は0.682,証拠を用いた分類精度は0.745を達成し,ベースラインの最大値0.329,0.072を大きく上回る。
- 強化学習によるTimeRLMの追加学習により,性能が向上し,応答に必要な交互作用回数が減少した。
SRAP:特異値分解による摂動の改良を用いた,知覚できない顔交換防御 [cs.CV, cs.LG]目的:顔交換モデルに対する防御性能の向上
- 顔画像はプライバシーと身元確認において重要であり,ディープフェイク技術による悪用を防ぐ必要がある。
- 既存の防御手法は,画像品質の低下や,防御効果と視覚的な自然さのトレードオフという課題がある。
- 画像品質を維持しつつ,顔交換に対する防御性能を高めることを目指す。
- SRAPは,最適化の各ステップで,チャネルごとのTruncated SVDとアイデンティティ重要度マスクを組み合わせることで,高周波成分を抑制し,防御効果を維持する。
- CelebA-HQとVGGFace2-HQでの実験により,SRAPは既存手法と比較して,保護された画像の品質を大幅に向上させながら,同等の身元情報破壊性能を示すことが確認された。
- SRAPは,顔交換防御と視覚的な自然さのバランスを最適化し,実用的な防御手法となりうる。
MMLongBench-Doc-V2:修正アノテーションと意味理解に基づいたMMLongBench-Docの改訂 [cs.AI]目的:長文書QAベンチマークの修正と改善
- 大規模言語モデルの長文書に対するQA能力評価は重要であり,その精度向上が求められている。
- 既存のベンチマークには,評価指標の不備やアノテーションの誤りなどが存在し,モデルの性能を正確に測れない場合がある。
- MMLongBench-Docの不備を修正し,より信頼性の高い評価ベンチマークを提供することで,QAモデルの改善に貢献する。
- MMLongBench-Doc-V2では,106件のアノテーションを修正し,参照との比較にLLMジャッジを導入した。
- 誤ったファイル名で登録された10件の質問と重複した1件を削除し,質問数を1071件,文書数を134件に減らした。
- 空集合キーの拡張に関する意思決定手続きを確立し,208件の行のうち14件を拡張した。V1とV2のスコアは比較できない。
より短い推論,より早い回答か?推論インターフェースの評価 [cs.LG, cs.AI]目的:推論インターフェースの評価
- 大規模言語モデルの利用拡大に伴い,推論コストと応答遅延の低減が重要課題となっている。
- 推論を短縮する試みはあるものの,単に途中で停止しただけの場合を区別する必要がある。
- トークン制限や努力設定が推論時間と回答精度に与える影響を明らかにすること。
- Qwen3-14Bに対するトークン制限プロンプトは推論を12-17%短縮したが,精度への影響は限定的であった。
- MMLU-Proにおいて,簡潔な回答指示は512トークンで精度を3.8%向上させた。未完了のケースでも2.7%の改善が見られた。
- gpt-ossモデルでは,低・中程度の努力による推論が,高努力による推論よりも14.5-26.3%高い精度を示した。
経験に基づく適応的ガイダンスによるエージェントの堅牢なツール利用に向けて [cs.AI]目的:エージェントのツール利用における堅牢性の向上
- エージェントの性能向上には,モデル能力だけでなく,実行プロセスの安定性が重要である。
- 既存手法では,多様な実行条件下での堅牢なツール利用が十分に確保されていない。
- ツール利用時の能力限界やベストプラクティスを捉え,堅牢性と効果を高めることを目指す。
- ExpGは,ツール利用の質を分析し,経験を構造化して学習可能なガイダンスを構築する。
- 不要な経験をフィルタリングし,代表的な経験を選択・要約することで,ガイダンスの汎化能力を高める。
- 実験により,ExpGがツール選択,呼び出し,応答生成の各タスクにおいて性能向上をもたらすことが示された。
蒸留された道路:センサー,解像度,地域に依存しない道路ネットワーク抽出 [cs.CV, cs.AI, cs.LG]目的:道路ネットワーク抽出の汎化性能向上
- 道路ネットワークは,自動運転や地図作成など,様々な分野で不可欠な情報である。
- 既存モデルは特定の解像度や地域に最適化され,未知の環境への汎化性能が低い。
- 多様な環境で安定した道路抽出を実現する学習戦略の開発。
- 本研究では,解像度を徐々に下げるカリキュラム,マルチセンサー学習,トポロジーを考慮した教師あり学習を組み合わせた。
- その結果,大陸を跨いだ複数の衛星プラットフォームにおける0.3-1.0mの画像に対して,単一モデルで高い汎化性能を実現した。
- 公開ベンチマークにおいて,最先端技術を最大22 F1ポイント,15 APLSポイント上回り,推論速度も3倍向上した。
起動的人工知能:複雑系のための意思決定中心アーキテクチャ [cs.CL, cs.AI, cs.ET]目的:複雑系における意思決定を支援する起動的AIの概念的枠組み
- AIはビジネスや産業の課題解決に不可欠となりつつある。その実用性と信頼性が重要視されている。
- 現実世界の複雑系におけるAIの性能検証が,信頼性,実現可能性,回復性等の課題から遅れている。
- 複雑系において,AIが社会的に価値のある行動を支援するための新たなアプローチを提示する。
- 本研究で提案する起動的AIは,組織世界と現場世界という2つのモデルを統合し,AIアプリケーションを結びつける。
- 起動的決定サイクルを通じて,システム全体を自己進化的に更新し,監査することで,信頼性の高い意思決定を可能にする。
- AIの進歩をモデル能力だけでなく,システム全体の行動と社会的な価値によって評価する新たな視点を提示する。
AIワールドカップ2026:エンドツーエンドのフットボール大会予測における大規模言語モデルのベンチマーク [cs.AI, cs.LG]目的:大規模言語モデルによるフットボール大会の完全予測能力の評価
- 現実世界における予測は,AI技術の重要な応用分野であり,社会への貢献が期待される。
- LLMの予測性能を比較する際,情報量,使用ツール,評価基準にばらつきがあり,公平な比較が困難である。
- 統一された条件でLLMの予測能力を評価し,より信頼性の高い比較結果を得ることを目指す。
- GPT-5.5 Thinkingが744点で1位,GPT-5.5が717点で2位,Geminiが699点で3位,Qwen 3.7が687点で4位となった。
- GPT-5.5 Thinkingのみが優勝チームをスペインと予測し,決勝でのアルゼンチン戦勝利を的中させた。
- 大会全体のスコアはノックアウト段階の成績と強く相関し,グループステージの成績とはほとんど相関がなかった。
マルチタスク・マルチフレーム視覚ピアノトランスクリプション [cs.SD, cs.AI, cs.CV, cs.MM, eess.IV]目的:視覚ピアノトランスクリプションにおける音符の開始,終了,保持,ベロシティの予測
- ピアノ演奏の理解や自動演奏への応用において,正確な楽譜推定が不可欠である。
- 従来の視覚ピアノトランスクリプションは,音符の開始検出に偏っており,終了位置の精度が低い。
- 本研究は,音符の終了位置とベロシティの予測精度向上を目指す。
- 提案手法V2Nは,ピアノ演奏動画から音符の開始,終了,保持,ベロシティを同時に予測する完全なシステムである。
- マルチタスク学習とフレーム単位の教師あり学習により,音符の終了位置とベロシティの予測が可能となり,開始位置の精度も向上した。
- ピアノVAMとR3データセットにおいて,最先端の結果を達成した。
LLMエージェントにおける逐次意思決定の改善:経験記憶の活用 [cs.AI]目的:LLMエージェントにおける逐次意思決定能力の向上
- 大規模言語モデルの応用範囲拡大に伴い,複雑なタスク遂行能力が重要視されている。
- LLMは単発推論では高い性能を示すが,逐次意思決定においては性能が低いという課題がある。
- 経験記憶を導入することで,逐次意思決定における信用割り当て問題を解決し,性能向上を目指す。
- LLMは,単純なゲーム(井戸端囲碁,四目並べ等)において,最適解からかけ離れた行動をとすることが示された。
- 経験記憶とポストゲームリフレクションを組み合わせることで,井戸端囲碁の性能が向上することが確認された。
- 表面的な表現の変更では性能に大きな影響がないことから,戦略の想起がボトルネックではない可能性が示唆された。
状態伝播も満足:決定論的状態追跡のための複素値状態空間モデル [cs.AI]目的:決定論的状態追跡タスクにおける状態伝播の十分性
- 系列モデリングはTransformerが主流だが,計算コストが高い。
- 決定論的状態追跡タスクでは,attention機構は過剰な場合がある。
- より効率的な状態追跡モデルを提案し,性能を検証すること。
- 本研究では,状態伝播のみで十分であると示す。
- 複素値状態伝播器(CSP)は,中間出力射影なしに隠れ状態を伝播する最小限の再帰型アーキテクチャである。
- CSPは,標準的なタスクにおいて100%の精度と完全なF1スコアを達成した。
オリーブジェマ:地中海式・ヨーロッパ料理認識のための30億パラメータ視覚言語モデル [cs.CV, cs.AI]目的:地中海式およびヨーロッパ料理の認識と推論
- 食生活評価において,自己申告による食日誌の代替手段として画像認識が注目されている。
- 食品のクラス内ばらつきや視覚的に類似した料理が多く,詳細な食品認識が困難である。
- 専門的な食品認識において,大規模なモデルに匹敵する性能を小規模なモデルで実現する。
- OliveGemmaは,3種類のヨーロッパの研究プロジェクトデータセットを用いて微調整された視覚言語モデルである。
- 3分割交差検証の結果,トップ1精度は92.96%±0.91%と,既存のCNNベースラインや大規模言語モデルを上回った。
- 食品カテゴリーの可能性のある材料の正確な特定においても,90.79%±1.3%という高い精度を達成した。
運動分解能4D CBCT再構成のための埋め込みバックプロジェクション演算子を持つデュアルドメインU-Net [cs.CV, cs.LG]目的:運動分解能4D CBCT再構成手法
- 胸部癌の放射線治療において,画像誘導は重要であり,4D CBCTはその精度向上に貢献する。
- 従来の4D CBCTはスキャン時間が長く,被ばく線量増加やモーション/スパースサンプリングアーチファクトが生じやすい。
- 呼吸信号や明示的な投影ビンニングなしに,従来のフリーブリージングスキャンから4D CBCTを再構成し,これらの課題を解決する。
- 腫瘍および食道の視認性に関して,臨床専門家は提案手法を従来のSART-TV画像よりも好む傾向があった。
- シミュレーションデータでは,提案手法はSART-TVと同等の画質を示し,4D再構成を可能にした。
- 臨床スキャンでは,提案手法はより鮮明な動的構造と,モーションストリークアーチファクトの低減を実現した。
ノイズの置き換えを止める:ラベル修正とサンプル重み付けのための二重ソース信頼性評価 [cs.LG, cs.CV]目的:ラベルノイズ学習におけるラベル修正とサンプル重み付けのための信頼性評価手法
- 教師あり学習の性能はラベルの品質に大きく依存し,ノイズラベルはその学習を阻害する。
- 既存手法では,観測ラベルと擬似ターゲット間の信頼性が暗黙的に結合されており,一方の信頼性低下が他方を増大させる。
- 観測ラベルと擬似ターゲットを独立に評価し,信頼性に応じた修正と重み付けを行うことで,ノイズの伝播を抑制する。
- 提案手法TRACEは,観測ラベルの損失適合度,浅い関係の安定性,予測一致に基づいて信頼性を評価する。
- 同時に,擬似ターゲットはモデルの確信度で評価し,それぞれの信頼性スコアを用いて修正と重み付けを制御する。
- 合成データおよび実データでの実験により,TRACEは既存手法を上回り,より信頼性の高い擬似教師あり学習を実現することが示された。
FedRings:LEO衛星コンステレーションのためのスケーラブルかつトポロジーを考慮した連合学習フレームワーク [cs.DC, cs.LG]目的:LEO衛星コンステレーションにおける連合学習の実現
- 宇宙空間の活用が重要視される中,LEO衛星ネットワークを通じたデータ活用が期待されている。
- LEO衛星ネットワークは,リンクの変化や接続時間の短さなどにより,従来の連合学習手法の適用が困難である。
- 動的なネットワーク環境下でも効率的な学習を実現するためのフレームワークの構築を目指す。
- FedRingsは,衛星をリング状に接続する分散型フレームワークであり,スケーラビリティと効率性を実現している。
- 空間的・時間的なルーティング戦略と,可視ウィンドウに合わせた通信スケジュールにより,学習の安定性を向上させている。
- 実験の結果,FedRingsは既存手法と比較して,LEO衛星ネットワークにおける性能が優れていることが示された。
モデルランキングのための評価努力の動的配分 [cs.CL, cs.LG]目的:モデルランキングにおける評価努力の最適配分
- 自然言語処理のモデル性能評価は重要であり,人間による評価が最も信頼性が高い。
- 現状の評価プロトコルは全てのモデルを評価するため,コストと時間がかかる。
- 評価予算を競争力の高いモデルに集中させることで,効率的な評価を目指す。
- 本研究では,多腕バンディット問題としてモデル評価を定式化し,適応的なサンプリング手法を提案した。
- 提案手法は,上位モデル間の識別能力を高め,評価の迅速化とコスト削減に貢献する。
- 提案アルゴリズムの最適性が理論的に証明され,大規模コンペティションの評価目標と整合性がある。
パターン数え上げにおける品質管理アルゴリズム [cs.DS, cs.LG, math.CO, math.PR]目的:シーケンスにおける特定のパターン出現頻度の異常を検知する品質管理問題
- 真にランダムな入力の識別は,暗号化やシミュレーションなど,多くの分野で不可欠である。
- 既存のアルゴリズムは品質管理問題の非対称性を活かせておらず,効率的な検証が困難である。
- 品質管理問題の非対称性を利用し,効率的なパターン数え上げアルゴリズムを開発する。
- シーケンス中のパターン(または順列パターン)の出現頻度を効率的に判定するアルゴリズムを提案した。
- 提案アルゴリズムは,最悪の場合でも指数関数的なクエリを必要とせず,多項式時間で動作することが示された。
- 自然な分布下では,品質管理アルゴリズムは,$k$ に対して超線形なクエリを必要とする。
単価の低いハイブリッドリザバーコンピューティングモデルによる分離型手話ビデオ認識 [cs.RO, cs.AI, cs.CV]目的:分離型手話ビデオの認識
- 聴覚者と聴覚障害者間のコミュニケーションを円滑にするため,手話認識技術は重要である。
- 深層学習は高い性能を示すが,計算コストが高く,エッジデバイスへの実装が困難である。
- 本研究は,低コストでエッジデバイスに実装可能な手話認識手法を開発する。
- 提案手法は,WLASL100データセットにおいて,上位1, 5, 10の正解率でそれぞれ61.12%,86.05%,92.56%を達成した。
- 深層学習と比較して,わずか数秒で学習が完了し,大幅な学習時間短縮を実現した。
- 計算コストが低いため,エッジデバイスへの実装可能性を示唆している。
近似推測デコーディング [cs.SI, cs.CL, cs.LG, cs.AI]目的:自己回帰的生成の高速化
- 大規模言語モデルの生成速度は重要であり,リアルタイムアプリケーションへの応用が期待されている。
- 従来の推測デコーディングでは,最初の不一致でデコーディングが停止し,計算資源が浪費される場合がある。
- 不一致を許容する範囲を調整し,より多くの計算を再利用することで,効率的なデコーディングを実現することを目指す。
- 提案手法であるASDは,厳密な検証と比較して,固定ワークロードのスループットを3.05%〜15.26%向上させる。
- Qwen3-14B + DSpark-14Bの7つのタスクで平均7.78%のスループット向上が確認された。
- DeepSeek-V4-Flash (284B)とDSparkの組み合わせでは,検証側での受容率が約10%〜16%向上した。
効率と有効性の両立:明示的思考と潜在的思考の訓練不要な注意誘導による切り替え [cs.MM, cs.AI, cs.CL, cs.CV]目的:マルチモーダル大規模言語モデルにおける効率性と有効性のバランス
- マルチモーダル大規模言語モデルは,画像認識と論理的推論の両方が求められるため,様々な応用が期待されている。
- 明示的な思考は計算コストが高く,潜在的な思考は訓練コストがかかるという課題があった。
- 視覚情報と論理的不確実性を分離し,効率的な推論を可能にすることを目指す。
- 提案手法は,視覚とテキストへの注意の比率に基づいて,明示的思考と潜在的思考を動的に切り替える。
- 実験の結果,提案手法は最先端の性能を達成し,精度と推論効率を大幅に向上させた。
- 特に,自己回帰ステップ数と遅延時間を削減することで,効率的な推論を実現した。
DataSpace:異種ワークスペースにおける検証可能な分析のためのデータエージェントのベンチマーク [cs.AI]目的:異種ワークスペースにおける検証可能な分析のためのデータエージェントの性能評価
- 組織内のデータは多様な形式で散在しており,効率的な分析が重要である。
- 既存のベンチマークは特定のタスクに偏っており,異種データの統合分析が不十分である。
- 多様なデータ形式を統合し,正確な表形式の結果を得るデータエージェントの評価を目指す。
- DataSpaceは,CSV,JSON,SQLite,Markdown,PDF,動画を含む410のタスクと7,439の成果物から構成される。
- 最新のマルチモーダルモデルとエージェントハーネスを用いた評価では,最高精度は66.34%であった。
- マルチモーダルな証拠統合と結合は,精度低下の要因となることが示された。
LLaDA MoE v2:混合エキスパート拡散言語モデルのスケール拡大 [cs.CL, cs.AI]目的:混合エキスパート拡散言語モデルのスケール拡大に関する特性
- 拡散言語モデルは,言語モデリングの新たなアプローチであり,その可能性が注目されている。
- 混合エキスパート拡散言語モデルのスケール拡大に関する理解が不十分である。
- 混合エキスパート拡散言語モデルの効率的なスケール拡大を実現するための法則と設計原則を確立すること。
- 最適化ハイパーパラメータ,計算資源の配分,およびアーキテクチャがスケールとともにどのように変化するかを定量的に分析した。
- 学習率の減衰速度が速く,最適バッチサイズは計算量が増えるにつれてより大きく成長することが明らかになった。
- 23.5兆トークンで学習したLLaDA MoE v2は,Qwen3に匹敵する性能を知識,推論,コーディングベンチマークで示した。
プログラミング例題に基づくソルバーを意識した分解:分割が征服方法の理解を必要とする場合 [cs.AI]目的:プログラミング例題におけるタスク分解手法の改善
- プログラム合成の規模拡大には,タスクを部分タスクに分割することが不可欠である。
- 従来の分解器は正解データに依存し,ソルバーの探索能力を考慮していない。
- ソルバーが実行可能な分解を学習し,合成成功率を向上させる。
- 正解分解との一致度が高いほど合成成功率が向上するわけではないというパラドックスが明らかになった。
- SADは正解分解との一致度を犠牲にしても,ソルバーが処理可能な分解を学習することで合成精度を向上させる。
- SADは,正解分解では解けないタスクを解決できることが示されており,分解の品質はソルバーに依存する。
LeanMem:LLMエージェントのためのシンプルかつ効率的な長期記憶 [cs.AI]目的:LLMベースのエージェントにおける長期記憶システムの改善
- LLMエージェントの対話継続性や過去の情報の信頼性向上には,長期記憶が不可欠である。
- 既存のシステムは均一な処理で情報損失やトークン消費量増加が課題となっていた。
- 情報の性質に応じた記憶方法で,効率的かつ正確な長期記憶を実現すること。
- LeanMemは,情報の圧縮可能性,時間的変化,忠実度に応じて異なる記憶形式を用いる。
- 不要な情報をフィルタリングし,プロファイル,イベント,記録の記憶を活用することで,効率的な更新と検索を実現。
- LoCoMoとLongMemEval-Sでの評価で,既存のベースラインを最高15.1ポイント上回る精度を達成。
ChartAnno:チャート注釈生成におけるMLLMの評価 [cs.AI, cs.CL, cs.HC]目的:チャート注釈生成のためのMLLMの評価基準
- データ可視化は意思決定に不可欠であり,その理解を助ける注釈の重要性は高い。
- 既存のMLLMはチャート理解で進歩するも,既存チャートの注釈生成能力は未評価である。
- MLLMのチャート注釈生成能力を定量的に評価し,改善点を明確にすること。
- ChartAnnoというベンチマークデータセットを構築し,1,200件の実世界のチャートと注釈命令を提供した。
- プロプライエタリモデルの方が全体的に優れているが,大規模なオープンソースモデルも差を縮めていることが示された。
- 詳細な指示は注釈の質を向上させるが,抽象的な意図の推論は依然として困難である。
正解が繰り返されるとき:GRPOのための希少性に基づいた信用再分配 [cs.AI, cs.LG]目的:報酬検証付き強化学習における構造レベルの信用集中緩和
- 報酬検証付き強化学習は,AIの安全性と信頼性向上に不可欠であり,その性能改善が求められている。
- GRPOでは,頻繁な正解パターンに信用が集中し,稀なパターンが学習されにくいという問題がある。
- 正解パターンの希少性に応じた信用再分配により,学習の偏りを解消し,性能向上を目指す。
- Cue-GRPOは,Qwen2.5-Math-7BおよびLlama-3.1-8B-Instructにおいて,反復サンプリング性能を改善した。
- 特に,サンプリング予算が高い場合に顕著な改善が見られた。
- Judge Partitionsを用いた信用再分配により,提案手法の有効性が確認された。
ToolLIFT:特定のツール軌跡を汎用的なツール計画のための関数レベルグラフへ変換する [cs.AI]目的:ツール利用の経験を活かした,汎用的なツール計画の実現
- LLMエージェントにおけるツール利用計画は重要であり,過去の利用履歴が貴重な経験となる。
- 既存手法では,ツール固有のグラフが構築され,異なるツールセットへの一般化が困難である。
- 関数レベルのワークフロー構造を利用し,ツール間の知識共有と計画の汎用化を目指す。
- ToolLIFTは,ツール固有の軌跡を関数レベルのワークフローグラフに変換するフレームワークである。
- ワークフロー構造のエンコードとツール間の連携経験共有,そしてデカップリングされたワークフロー計画とツール選択を行う。
- IDおよびOODのベンチマークにおいて,最先端のベースラインを上回り,優れた一般化性能を示す。
ロバストなマルチモーダル意図認識のための適応的モダリティ信頼性診断と復元 [cs.MM, cs.AI, cs.CL]目的:マルチモーダル意図認識におけるモダリティ信頼性診断と復元の手法
- マルチモーダル学習は,多様な情報源を活用し,より高度な認識性能を実現する上で重要である。
- 各モダリティのノイズ,欠損,意味の矛盾,あるいは偏った影響が認識精度を低下させる場合がある。
- 劣化モダリティの修復可能性を判断し,信頼性を回復することで,ロバスト性を向上させる。
- PRIMEは,予測信頼度,認識の不確実性,クロスモーダル合意,特徴量の退化などを考慮し,モダリティの弱点を文脈的対数分散で推定する。
- モダリティ信頼性のラベルがない状況下で,制御されたモダリティ劣化を用いて推定器を訓練し,不確実性を明示的にモデル化する。
- 復元後の信頼性を再評価することで,修復された表現が十分に信頼できるかを判断し,その精度を逆分散マルチモーダル融合に利用する。
ゲゲンバウアー範疇を超えて:機械学習のためのq直交カーネル [cs.CL, cs.LG, stat.ML]目的:機械学習におけるカーネル関数の新たな設計
- 機械学習の性能向上には,適切なカーネル関数の選択が不可欠である。
- 従来のカーネルは,パラメータ調整が難しく,数値的な不安定性を招く場合がある。
- q直交多項式に基づくカーネルを導入し,数値安定性と計算効率を改善する。
- 提案するq-Hermiteカーネルは,20のベンチマークデータセットで,従来のカーネルや他の直交多項式カーネルと同等の性能を示した。
- このカーネルは,明示的なスケーリング機構なしに,消失や爆発といった問題を自然に抑制する性質を持つ。
- q直交多項式は,数学的な優雅さと実用的な機械学習応用を結びつける有望な方向性であり,量子計算パラダイムへの拡張も期待できる。
続行または再計画?ベルヌーイ継続方策による適応的ホライズン実行 [cs.RO, cs.AI, cs.CV, cs.LG]目的:適応的ホライズン実行のためのベルヌーイ継続方策
- ロボットタスクにおいて,効率的かつ柔軟な行動計画は重要である。
- 既存のVLAモデルは固定長の行動系列を用いるため,状況に応じた計画更新が困難である。
- 本研究は,タスクの進捗に応じて行動系列の継続または再計画を決定する方策を提案し,ロボットタスクの成功率向上を目指す。
- 提案手法であるベルヌーイ継続方策(BCP)は,RoboTwin 2.0環境において,13の低成功率タスクで平均成功率を11.08%向上させた。
- BCPは,ランダム化された環境への汎化性能も示し,平均成功率を4.06%向上させた。また,異なるベース方策への転移も成功している。
- 実機ロボットによる実験では,2つの操作タスクでそれぞれ成功率を74%から92%,44%から84%に向上させている。
システムレベルの観測を用いた,定量検証のためのモデルパラメータのベイズ学習の活用 [cs.DB, cs.IR, cs.SE, cs.AI, cs.LO]目的:定量検証のためのモデルパラメータのベイズ学習における事前知識の獲得と組み込み
- ソフトウェアの信頼性や応答時間といった定量的な特性分析には,ベイズ学習と定量検証の組み合わせが有効である。
- ベイズ推論の精度は事前知識に大きく依存するが,不正確な事前知識は定量分析を阻害する可能性がある。
- システムレベルの観測可能な特性から事前知識を抽出し,定量検証に活用することで,正確な検証結果を得る。
- 提案手法EPIKは,従来の形式モデル遷移パラメータに依存するアプローチとは異なり,現実世界の意味に直接関連するシステムレベルの特性を活用する。
- EPIKは,未知の遷移パラメータの分布を導き出し,それを定量検証に組み込むための二重最適化問題を定式化する。
- 実際のケーススタディや多様なEPIKのインスタンスを用いた実験により,提案手法の有効性,柔軟性,汎用性が示された。
初期化損失を超えて:LLM語彙拡張のためのトークン埋め込み初期化戦略の体系的な研究 [cs.DL, cs.CL, cs.LG]目的:LLMの語彙拡張におけるトークン埋め込み初期化戦略の比較と最適化
- 大規模言語モデルの多言語対応は重要であり,語彙拡張はその効率的な手段となる。
- 語彙拡張において,追加されたトークン埋め込みの初期化方法は,継続事前学習の効率に大きく影響する。
- より効率的な継続事前学習を可能にする,最適なトークン埋め込み初期化戦略を確立すること。
- サブワード構成法が,語彙平均化や外部・学習による初期化手法よりも優れた性能を示すことが明らかになった。
- 入力と出力の埋め込み初期化において非対称な手法が,最も低い初期検証損失を達成し,異なる初期化の好みを明らかにした。
- 最適な構成では,入力埋め込み行列に一様サブワード平均化とヒンディー語固有のノルム較正を使用し,出力言語モデリングヘッドには文字長加重サブワード平均化を用いる。
ロボット自律の原理 [cs.RO, cs.AI, cs.CV, cs.SY, eess.SY]目的:ロボット自律の基礎理論と実践
- 社会におけるロボットの活用が拡大しており,自律技術の重要性が高まっている。
- 古典的なロボット工学と最新の物理AIの統合が課題となっていた。
- 次世代の自律システム設計・分析・開発に必要な基盤を提供する。
- 本研究は,実世界での応用を重視した,自律システムの原理を包括的に解説する。
- 長年のスタンフォード大学での教育経験に基づき,自律スタックのコア要素を統一的な概念フレームワークで構築する。
- 理論的理解と実践的直感を両立させるため,Jupyter Notebookと実装演習を併用する。
FedCARE:スマートヘルスケアのための多目的パーソナライズされた連合学習フレームワーク [cs.LG, cs.DC]目的:スマートヘルスケアにおける多目的パーソナライズされた連合学習フレームワーク
- 医療データの分散学習は,プライバシー保護に貢献し,協調的なモデル開発を可能にする重要な技術である。
- 既存の連合学習は,データ分布の非一様性や臨床目的の多様性への対応が不十分な場合がある。
- 病院固有の目的と特徴に対応し,効率的なパーソナライズを実現するフレームワークの開発が求められる。
- FedCAREは,共通の臨床特徴から多目的最適化を行うことで,グローバルな基盤モデルを学習する。
- 各クライアントは,独自のデータと目的を用いて基盤モデルを微調整し,パーソナライズを実現する。
- MIMIC-IIIとDiabetes 130-US Hospitalsデータセットを用いた実験で,FedCAREは既存手法を上回り,高い性能を示す。
WeClawArena:人間中心エージェントネットワークにおけるクロスユーザーエージェント連携とセキュリティのための監査可能なサンドボックスとベンチマーク [cs.AI]目的:人間中心エージェントネットワークにおけるクロスユーザーエージェント連携とセキュリティの評価
- 近年,個人エージェントフレームワークが進化し,人間とAIエージェントが協調するネットワークの実用化が近づいている。
- 既存のベンチマークはツール利用や連携を評価するが,現実的なユーザーデジタルワークスペースや攻撃経路の検証が不足している。
- マルチパーティ所有エージェント連携の監査可能なサンドボックスとベンチマークを提供し,セキュリティリスクを評価することを目的とする。
- WeClawArenaは,124の基本タスクと620のバリアントを含むベンチマークとランタイムサンドボックスを提供する。
- サンドボックスは,メッセージ,ツール呼び出し,リソース操作,決定,ワークスペースの状態を記録し,監査を可能にする。
- 有用性と攻撃成功率を個別に評価し,攻撃成功の根拠を分析することで,プライバシー漏洩や権限の不正利用などを診断する。
LLMは高品質な実験を設計できるか?自律的な実験設計に関する包括的かつ体系的なベンチマーク [cs.CY, cs.AI]目的:自律的な実験設計能力の評価
- 研究の効率化と質の向上が求められる中で,AIによる科学的ワークフローの自動化が重要である。
- 実験設計は研究の重要な段階だが,AIによる評価基準が存在せず,自動化の進展が遅れている。
- LLMによる実験設計のボトルネックを特定し,その改善策を提示すること。
- 多くのLLMは直接的に高品質な実験を設計することが困難であることが示された。
- 全てのLLMにおいて,ローレベル設定に性能上のボトルネックが存在することが明らかになった。
- 検索モードは実験設計の質を向上させないことが判明した。OptEDはこれらの課題に対処し,LLMベースの実験設計を最適化する。
複雑な逐次決定タスクのためのハイブリッドLLM拡張強化学習エージェント [cs.AI, cs.LG, cs.MA]目的:複雑な逐次決定タスクにおけるLLMと強化学習の統合
- 近年,自律エージェントの開発において,高度な推論・計画能力が求められている。
- 従来の強化学習は,複雑なシナリオにおける高レベルな抽象化・タスク分解が困難である。
- LLMと強化学習を組み合わせ,長期的視点での最適化と環境とのインタラクションを改善する。
- 提案手法は,LLMによるサブゴールの生成と,強化学習による低レベルな行動の洗練を組み合わせる。
- 実験の結果,サンプル効率,成功率,行動軌跡の一貫性が,従来の強化学習やLLMのみを用いた手法と比較して向上した。
- このハイブリッドなアプローチは,より高性能な自律システムの構築に向けた有望な方向性を示唆する。
