arXiv雑要約
AI - 2026/07/31 公開
Transformerのトポロジカルな問題点 [cs.LG, cs.AI]目的:Transformerにおける状態追跡の限界とその改善策
- 自然言語処理の発展に伴い,Transformerモデルの性能向上が重要視されている。
- Transformerは状態追跡能力に限界があり,長期間の依存関係の学習が困難である。
- Transformerに再帰構造を導入し,状態追跡能力を高めることによって性能を改善する。
- Transformerはフィードフォワード構造のため,動的な状態追跡に課題があることが示された。
- 再帰的なアーキテクチャ,特に状態空間モデルと粗視化された再帰が,状態追跡の統合に有望であることが示唆された。
- Transformerの層を深くする必要性を回避するために,再帰構造による状態追跡の重要性が強調された。
トリガーの無効化:LLMバックドア軽減のためのテールリスクに基づいた注意再調整 [cs.CL, cs.HC, cs.CR, cs.AI]目的:LLMのバックドア軽減のための注意再調整手法
- LLMのセキュリティは重要であり,悪意のある攻撃から保護する必要がある。
- LLMはバックドア攻撃を受けやすく,正常な入出力時に悪意のある動作を示す可能性がある。
- 本研究は,パラメータ更新やクリーンデータなしでLLMのバックドアを軽減することを目指す。
- TIARAは,推論時にテールリスクに基づいた注意再調整を行うことで,LLMのバックドア攻撃を軽減する。
- TIARAは,パラメータ更新,追加の生成,またはクリーンな参照セットを必要とせず,実用的な推論時間制御層として機能する。
- 実験結果から,TIARAは既存のベースライン手法よりも大幅に高い性能を示し,クリーンタスクの性能劣化も最小限に抑えることが示された。
NorBERTo:3310億トークンコーパスで学習したポルトガル語ModernBERTモデル [cs.CL, cs.AI]目的:ポルトガル語自然言語処理のための高性能なモデルの構築
- ポルトガル語の自然言語処理の発展には,高品質な大規模コーパスが不可欠である。
- 既存のポルトガル語モデルは,コーパスの規模やモデルアーキテクチャに課題が残る。
- 大規模なポルトガル語コーパスと最新アーキテクチャを用いた高性能なエンコーダーモデルを開発する。
- NorBERToは,既存のエンコーダーモデルと比較して,意味的類似性,テキスト含意関係,分類タスクにおいて高い性能を示す。
- 特にPLUEにおいて,NorBERTo-largeはMRPCで0.9191のF1スコア,RTEで0.7689の精度を達成し,エンコーダーモデルの中で最高の結果を記録した。
- Aurora-PTは現在,公開されているポルトガル語の単言語コーパスとしては最大規模であり,今後の研究に貢献する。
非パラメータ2D形状に対するヘルムホルツ方程式演算子のDeepONetによる学習 [cs.LG]目的:非パラメータ2D形状に対するヘルムホルツ方程式演算子の学習
- 偏微分方程式の解法は科学技術計算の根幹であり,様々な現象のシミュレーションに不可欠である。
- 複雑な形状に対する数値解法は計算コストが高く,効率的な手法が求められている。
- DeepONetを用いて,形状と散乱場の関係を学習し,効率的な解法を提案する。
- 提案手法は,有限要素法(FEM)と同等の精度で未知の形状に対する予測が可能であることを示した。
- 学習済みのネットワークは,局所的な物理現象と形状の相互作用を暗黙的に学習している。
- 形状の変更に対する再メッシュが不要であり,計算コストの削減に貢献する。
物理に配慮したメタ学習を用いた,近表面ハイパースペクトル反射率からの沿岸 biogeochemical パラメータの地域適応型検索 [cs.LG]目的:沿岸域の biogeochemical パラメータ検索手法
- 沿岸水域の水質モニタリングは重要であり,低コストな手法が求められている。
- 水域間の環境条件や biogeochemistry の違いから,汎用的なアルゴリズムの適用が困難である。
- 地域差を考慮した,より高精度な biogeochemical パラメータ検索を可能にすること。
- 提案手法は,物理モデルに基づいた合成データとメタ学習を活用し,地域に依存しないベースモデルを構築した。
- ベースモデルを地域ごとのデータで微調整することで,高い汎化性能と精度を実現した。
- 実験結果から,提案手法は既存手法と比較して,沿岸 biogeochemical パラメータの検索において優れた性能を示した。
二次目的摂動:曲率に基づく差分プライバシー [cs.LG, math.OC]目的:差分プライバシーを保証する二次目的摂動法の開発
- 機械学習モデルのプライバシー保護は重要であり,データ利用の促進に不可欠である。
- 既存手法は損失関数の勾配の有界性を仮定しており,現代の機械学習モデルには適用が難しい。
- 勾配の仮定を弱め,より広範なモデルで差分プライバシーを適用可能にすること。
- 二次目的摂動は,損失関数の勾配の有界性を必要とせず,曲率を通じて安定性を保証する。
- 本研究では,より弱い勾配の仮定の下で$(\varepsilon, \delta)$-差分プライバシーが成立することを示す。
- 近似解を用いた場合でもプライバシー保証が維持され,経験的過剰リスクに関する有用性の保証も得られた。
人間によるガイダンスを用いた神経記号的模倣学習:特権情報アプローチ [cs.LG]目的:神経記号的模倣学習による行動学習手法
- 複雑な環境下での行動学習において,模倣学習は広く用いられている重要な手法である。
- ニューラルネットワークは大量のサンプルを必要とし,過学習しやすいという課題がある。
- 高次元データの処理と汎化性能の両立を目指し,特権情報(視線データ)を活用する。
- 提案手法は,高次元データの処理能力と汎化性能を両立し,従来のニューラルネットワークと記号的アプローチの弱点を克服した。
- 訓練時にのみ利用可能な特権情報(視線データ)を効果的に活用することで,学習効率と性能が向上することが示された。
- 実験結果は,提案手法の有効性,効率性,そして汎化能力を裏付けている。
MDL-GBG:クラスタリングのための非パラメトリックかつ解釈可能なグラニュールボール生成法 [cs.LG]目的:クラスタリングのためのグラニュールボール生成
- データ分析において,適切なデータ表現はクラスタリングの性能に大きく影響する。
- 既存のグラニュールボール生成法は,手動で設計された評価指標に依存し,透明性に欠ける場合がある。
- 最小記述長原理に基づき,解釈可能なグラニュールボール生成法を提案し,クラスタリングの精度向上を目指す。
- MDL-GBGは,グラニュールボール生成を最小記述長原理に基づく局所的なモデル選択問題として定式化する。
- 実験結果から,MDL-GBGが生成する安定したグラニュールボールは,クラスタリングのための効果的な表現であることが示された。
- MDL-GBG+ACは,ARI,ACC,NMIにおいて比較対象手法の中で最高の平均値を示し,統計的にも優位性が確認された。
PROVE:視覚メディアのための知覚的除去一貫性ベンチマーク [cs.IR, cs.CL, cs.CV, cs.AI, cs.MM]目的:画像および動画における物体除去の一貫性評価
- 視覚メディアの編集技術は高度化の一途を辿っており,その品質評価が重要になっている。
- 既存の評価指標は,人間の知覚と一致せず,誤った評価結果をもたらす場合がある。
- 人間の知覚に合致した,より信頼性の高い評価指標とベンチマークの開発を目指す。
- 提案手法RCは,マスク領域と背景領域の空間的な一貫性,および隣接フレーム間での時間的な一貫性を評価する。
- RCは,既存の評価指標よりも人間の判断との相関性が高いことを実験的に示した。
- PROVE-Benchは,モーションオーギュメンテーションを加えたペアデータセットと,正解データのない挑戦的なサブセットで構成される。
限られたフィードバック下での効率的なオンライン共形選択 [cs.LG]目的:共形選択における低コストなオプション集合の選択
- 機械学習モデルの信頼性確保が重要であり,不確実性を定量化する手法が求められている。
- 限られたフィードバック下での効率的な共形選択は,依然として大きな課題である。
- 選択された集合のみのフィードバック環境下で,共形選択の有効性と効率性を両立させる。
- 適応共形推論(ACI)の更新規則と境界アクションを組み合わせることで,分布シフト下でも成功率を保証する。
- 独立同一分布(i.i.d.)データに対して,最適な確率的ベンチマークと比較してサブ線形な効率性後悔を達成する。
- 制約付きバンディット問題における射影更新を避け,ACIの有効性を維持する新しい手法を提案する。
Orchard: オープンソースの自律エージェントモデリングフレームワーク [cs.AI, cs.CL]目的:大規模な自律エージェントモデリングのためのフレームワーク
- LLMを自律的にタスクを解決するエージェントへと進化させる研究は,AI応用の可能性を広げる上で重要である。
- 既存のフレームワークは,スケーラビリティや汎用性の面で課題があり,効率的な学習と評価が困難である。
- 再利用可能な環境と学習レシピを提供し,様々なドメインでのエージェント開発を促進することを目的とする。
- Orchardは,軽量なKubernetesベースの環境サービスOrchard Envを中核とし,タスクドメイン,エージェント,学習段階を管理する。
- ソフトウェアエンジニアリングエージェントOrchard-SWEは,RPRを用いたRLでSWE-bench Verifiedにおいて73.0%を達成し,最先端のオープンソースモデルとなった。
- GUI操作エージェントOrchard-GUIは,WebVoyager等で68.4%の平均成功率を示し,同等の性能を持つ商用システムと競合する。
SNAC-Pack 2.0:スケーラブルな代理ニューラルアーキテクチャ共同設計 [cs.LG, cs.AI, hep-ex]目的:ハードウェアを意識したニューラルアーキテクチャの共同設計およびFPGAへのエンドツーエンド展開
- ニューラルネットワークの設計自動化は,高性能なモデルの迅速な開発に不可欠である。
- 既存手法は精度のみを最適化,またはハードウェアコストとの相関の低い指標に依存している。
- FPGA展開におけるリソース制約下での最適なアーキテクチャ探索を自動化すること。
- SNAC-Packは,OptunaとNSGA-IIを用いた多目的探索により,効率的なアーキテクチャを探索する。
- ハードウェアの代理モデルを用いることで,合成コストを削減し,検索ループを高速化する。
- 実験では,タスク性能を維持しつつFPGAリソース利用を削減,またはリソース利用を大幅に削減するアーキテクチャを発見した。
MinerU-Popo:構造化ドキュメント解析のための汎用後処理モデル [cs.CV, cs.AI, cs.CL]目的:構造化ドキュメントのページレベル解析結果から,ドキュメントレベルの一貫性のある構造を再構築すること
- ドキュメント解析は,情報検索や知識獲得において不可欠であり,その精度向上は重要である。
- 既存のOCRモデルはページ内の要素抽出に優れるものの,複数ページにわたる構造の連続性や整合性が課題である。
- ページ分割によって中断された構造(段落,表など)を回復し,ドキュメント全体の論理構造を再構築すること。
- MinerU-Popoは,多様な解析器のページレベル結果を,ドキュメントレベルの構造に変換する軽量な汎用フレームワークである。
- このフレームワークは,テキスト/表の途切れ回復,タイトル階層再構築,画像-テキスト関連付けという4つのサブタスクに分解して対処する。
- 実験結果から,MinerU-Popoは既存のOCRモデルのタイトル階層TEDSを少なくとも20%向上させ,RAGの精度向上とクエリ遅延の削減に貢献する。
MiniMax-M2シリーズ:ミニ活性化がもたらす最大限の現実世界知能 [cs.AI, cs.CL, cs.LG]目的:ミニ活性化による最大限の現実世界知能の実現
- 大規模言語モデルは,様々なタスクにおいて高い性能を発揮し,AI研究の中心となっている。
- 既存モデルはパラメータ数が多く,計算コストが高いという課題を抱えている。
- 少ない活性化パラメータで高性能を実現し,実用的なエージェント開発を促進する。
- MiniMax-M2シリーズは,2299億パラメータを持ちながら,トークンごとに98億パラメータのみを活性化する。
- エージェント駆動型データパイプラインとスケーラブルな強化学習システム「Forge」により,高い性能を実現した。
- M2.7チェックポイントは,自己進化の第一歩として,トレーニング実行のデバッグや自身の構造の変更を自律的に行う。
エージェント型LLM提供のためのポリシー駆動型ランタイム層 [cs.AI]目的:エージェント型LLM提供における効率と柔軟性の向上
- LLMのマルチエージェントシステムが普及し,その運用基盤の重要性が増している。
- 既存の運用基盤はマルチエージェントシステム向けに設計されておらず,ポリシー適用が困難である。
- エージェントの識別情報を共有座標として,ポリシー適用を容易にするランタイム層を提案する。
- 提案するランタイム層は,observe,score,predict,actの4つのプリミティブを提供する。
- CacheScoutの実装により,KVキャッシュのヒット率が13~37pp向上した。
- また,平均TTFTが12~29%低減し,スループットが6~14%向上した。
DenoiseRL:ノイズの多い接頭辞からの推論モデルの回復をブートストラップする [cs.AI]目的:大規模言語モデルにおける推論能力の向上
- 大規模言語モデルの推論能力は重要であり,その向上は様々な応用分野を促進する。
- 既存の強化学習手法は,高性能な教師モデルや精巧なデータセットに依存しており,スケーラビリティに課題がある。
- DenoiseRLは,弱モデルからの失敗を回復することに焦点を当て,外部の教師信号に頼らないスケーラブルな学習を目指す。
- DenoiseRLは,数学的推論タスクと対話型意思決定タスクにおいて,既存の強化学習手法を上回る性能を示した。
- 訓練の難易度が増すにつれて,モデルの自己修正能力が向上することが示された。
- ノイズの強さを細かく制御することで,より多様で効率的な学習信号を実現し,探索効率を高めている。
より倫理的な顔画像からの年齢推定:子供のデータで学習しない汎化ゼロショットベンチマーク [cs.CV, cs.AI]目的:子供のデータを使用せずに顔画像から年齢を推定するための手法の評価
- 顔画像からの年齢推定は,児童虐待画像検出などに応用され,社会的なニーズが高い。
- 年齢推定の学習データに未成年者の画像が含まれることが倫理的・法的問題を引き起こす。
- 子供のデータを用いずに,年齢推定の精度低下を定量化し,倫理的な代替手法を模索する。
- 既存の年齢推定手法は,学習に使用されていない年齢層への汎化性能が著しく低いことが示された。
- 全てのモデルで,平均して46.4%,最大で52.8%の精度低下が見られた。
- モデルは未知の年齢層に対して,学習済み年齢層に近い値に予測を固定化する傾向がある。
AIの周辺から:少数派コミュニティの経験を通じた参加型AI設計の再考 [cs.CY, cs.AI]目的:少数派コミュニティの経験に基づいた参加型AI設計の条件
- AIは社会の不平等を再生産する可能性があり,公正なAI開発が重要である。
- 既存の参加型AIは,問題定義後に参加を求めるため,少数派コミュニティの影響力が限定的である。
- 本研究は,少数派コミュニティの経験を設計の中心に据える方法論を提示し,AIの目的を再定義することを目指す。
- 「AIの周辺から (AIM)」という方法論は,少数派コミュニティの経験をAI設計に反映するための前提条件を提示する。
- オランダの医療現場での事例研究では,ナラティブ分析,共同ルール作成,AI導入の主体的な決定などが実施された。
- 参加者からは,このアプローチが有意義であるとの評価があり,継続的な実施が求められた。
内生的な改善を伴う線形戦略的分類 [cs.LG]目的:戦略的応答による特徴量の変化を考慮した線形分類問題の解決
- 機械学習モデルの配置後の行動変化予測は,公平性や説明可能性の確保に不可欠である。
- 従来の戦略的分類モデルは,ラベルの不変性を仮定しており,現実的な状況を捉えきれていない。
- 特徴量の戦略的な変化が結果に影響を与える状況下での最適な分類器の設計を目指す。
- 戦略的に最適な分類器は,ベイズ最適決定境界の平行移動によって得られることが示された。
- この分類器は,改善を考慮した目的関数に対する良い近似解を提供する。
- オラクルモデル下でのPAC学習保証と,実用的なプラグインアルゴリズムが提案された。
平均評価は能力のトレードオフを隠蔽する:高疎性LLMプルーニングのための多源キャリブレーション [cs.LG, cs.AI]目的:高疎性LLMプルーニングにおける能力維持
- 大規模言語モデル(LLM)の性能維持は重要であり,モデルの軽量化と同時に能力劣化を防ぐ必要がある。
- 従来のキャリブレーション手法は平均評価に頼るため,特定の能力における性能低下を見過ごしやすい。
- 能力のトレードオフを解消し,高疎性LLMの能力をバランス良く維持することを目指す。
- 平均評価では見過ごされがちな能力間のトレードオフが,多源キャリブレーションによって明確になった。
- 能力バランスを考慮した多源キャリブレーションは,単一データソースと比較して高い性能を発揮する。
- 事前学習データの入手が困難な場合でも,IGSPにより自己キャリブレーションによる性能向上が確認された。
プロンプトインジェクションが残存する場合:セッションを跨ぐ保存型プロンプトインジェクションによるエージェントセキュリティの再考 [cs.CR, cs.AI]目的:セッションを跨ぐ保存型プロンプトインジェクションという新たな脅威ベクトルの特性評価
- 近年のエージェントシステムはLLMのセキュリティ境界を変化させ,永続的なシステム状態を導入している。
- 悪意のある指示が単一のやり取りに留まらず,将来の実行に影響を及ぼす可能性がある。
- 永続的なシステム境界を越える外部情報の権限付与管理の重要性を示唆する。
- セッションを跨ぐ保存型プロンプトインジェクションのライフサイクルを形式化し,永続化チャネルと組み込みメカニズムの分類を開発した。
- エージェントセキュリティの課題は,信頼できない入力をフィルタリングするだけでなく,永続的なシステム状態の管理にあると示唆された。
- インタラクション中心のセキュリティから状態中心のセキュリティへの移行を促し,永続的なエージェント状態の安全な管理を第一級のセキュリティ原則とすることを提唱する。
データ混合のスケーリング則の説明 [cs.DC, cs.LG, cs.AI]目的:データ混合におけるモデル損失のメカニズム解明
- 機械学習モデルの性能向上には,多様なデータセットの活用が不可欠である。
- 複数のドメインのデータを混合した場合,モデルの学習効率が低下することがある。
- データ混合における損失の振る舞いを理論的に解明し,最適なデータ混合を予測する。
- 本研究では,モデルの容量競合とノイズ低減という2つの要素がドメイン損失を決定することを明らかにした。
- 提案フレームワークは,既存のベースラインよりも損失地形への適合精度が高く,より高性能な学習混合を特定する。
- 大規模な未学習スケールに対する効果的な混合を予測可能であり,パラメータ数を削減しつつ高い精度を達成した。
数値が言葉に勝る:結合MIMOコントローラ調整のための厳密なオンプレミスベンチマーク [cs.AI]目的:結合MIMOプロセスのコントローラ調整に関する有用な構造的事前知識の有無の検証
- 結合MIMOプロセスの制御は複雑であり,産業プロセスにおける性能向上に不可欠である。
- 分散型自動調整はループ間相互作用を無視し,局所最適化は初期値に依存しやすい。
- 大規模言語モデル(LLM)の構造的事前知識が有用か,または古典的手法で代替可能かを検証する。
- 単一ループCSTRでは,リレーフィードバック調整がLLMよりも優れた性能を示した。
- 病的な4槽タンクでは,LLMの構造化されたプロンプトが信頼性のある最適解を見出した。
- VRFT(Virtual Reference Feedback Tuning)はLLMを使用せず,より良い性能を達成した。
批判構造が重要である:ヒューマノイドロボットの移動操作のためのデュアル vs. 統合的評価関数 [cs.CL, cs.RO, cs.LG]目的:ヒューマノイドロボットの移動と操作の協調
- ヒューマノイドロボットの複雑なタスク遂行には,移動と操作の同時制御が不可欠である。
- 移動と操作を同時に最適化する際,評価関数の設計が課題となる。
- 移動と操作を効率的に統合できる評価関数構造を特定すること。
- デュアル評価関数を用いた場合,統合的評価関数を用いた場合と比較して,目標到達速度が3.5倍向上した。
- デュアル評価関数は,1,000ステップあたり14.3回の到達成功数を達成し,統合的評価関数の7.0回を上回るスループットを示した。
- 検証実験において,デュアル評価関数の到達率は65.2%であり,統合的評価関数の53.8%を上回った。
密な監督,疎な更新:オンポリシー蒸留における疎性と幾何学について [cs.LG]目的:オンポリシー蒸留におけるパラメータ更新の疎性と幾何学的特性
- 近年,強化学習における性能向上に貢献する手法として注目されている。
- オンポリシー蒸留の学習過程におけるパラメータ変化のメカニズムが不明確である。
- オンポリシー蒸留がモデルにもたらす影響をパラメータ空間の視点から解明する。
- オンポリシー蒸留のパラメータ更新は,チェックポイント精度で小さく,座標が疎である。
- 発見されたサブネットワークのみで訓練することで,フル訓練時の性能をほぼ再現できる。
- 更新は数値的にはフルランクだが,スペクトル的には集中している。教師の主要構造を回避し,低強度の座標を優先する。
DIPHINE: 拡散に基づくΦ-IDニューラル推定器 [cs.LG]目的:複雑系の情報構造の解明
- 現実世界の複雑系の理解には,情報の流れが不可欠である。情報量と動態を詳細に分析することで,系の振る舞いを予測し,制御することが可能となる。
- 既存のΦID計算方法は,ガウス分布や離散系に限定され,連続非ガウス動的系への応用が困難であった。
- 拡散モデルを用いた新たな推定器DIPHINEにより,分布の仮定なしに連続系のΦIDを計算し,情報構造を明らかにすること。
- DIPHINEは,スコアベース拡散モデルを活用し,16個の情報原子を効率的に推定する。
- 合成データを用いた検証で,既存手法よりも高い精度で情報原子を復元できることを示した。
- 実データ解析において,生理学的に解釈可能な情報動的構造を抽出することに成功した。
アトラクタ領域理論:ウェアラブル光血積波(PPG)検証による心血管アトラクタ解析のための数学的枠組み [cs.AI]目的:心血管アトラクタ解析のための数学的枠組み
- 心血管系の理解は,循環器疾患の診断や治療に不可欠である。
- 従来の解析では,アトラクタのどの性質が心血管状態を反映するか不明確である。
- アトラクタ情報を構造的に理解し,心血管量の解釈可能性を高める。
- アトラクタ領域理論(ADT)は,アトラクタ情報を幾何学的領域,エルゴード領域,変分領域の3つに分割する。
- 3つの領域は,心血管状態の様々な側面(アーチファクト除去,安定性推定,血行動態推論)に対応することが示された。
- PPGデータを用いた検証により,ADTの有効性が確認され,AUC=0.757,NPV=0.966という結果が得られた。
オンライン頂点被覆のための学習増強アルゴリズム [cs.CC, cs.LG]目的:オンライン重み付き頂点被覆問題における学習増強アルゴリズムの性能評価
- グラフ理論はネットワーク分析の基礎であり,様々な応用分野で不可欠である。
- オンラインでの頂点被覆問題は,逐次的な決定が必要であり,最適な解を得ることが困難である。
- 学習を利用することで,オンラインアルゴリズムの性能を向上させ,最適な解への近似を目指す。
- 二部グラフモデルにおいては,提案アルゴリズムは$\frac{1}{1-e^{-\lambda}}$-ロバスト性と$\frac{\lambda}{1-e^{-\lambda}}$-整合性を持つことが示された。
- 一般グラフモデルにおいては,提案アルゴリズムは$(1+\frac{1}{\lambda})$-ロバスト性と$(1+\lambda)$-整合性を持つことが示された。
- これらのトレードオフが両方の設定において最適であることが証明された。また,合成データと実データを用いた実験により,提案アルゴリズムの有効性が確認された。
FORGE:メモリ効率の良いLLM学習のための融合オンレジスタ勾配消去 [cs.LG]目的:大規模言語モデルの学習におけるメモリ使用量の削減
- 大規模言語モデルの学習は計算資源を多く必要とし,メモリがボトルネックとなることが多い。
- 従来の学習手法では,勾配を一旦メモリに書き出し,後で読み出すため,メモリ使用量が課題となる。
- 勾配をメモリに保存せずに,その場で消費することでメモリ使用量を削減し,学習を効率化すること。
- FORGEは,最適化ステップを逆伝播に組み込み,レジスタ上で勾配タイルを生成・消費することで,メモリ使用量を半分以上に削減した。
- 特に,ファインチューニングや継続事前学習のような小規模バッチサイズの場合,標準的な最適化手法と比較して約1.5倍高速に実行できた。
- テンソル並列Megatron-LMに統合することで,同じGPU上で標準的な最適化手法よりも4倍大きなマイクロバッチサイズで80億パラメータの学習が可能になった。
時間の問題:普遍的な主体性理論に向けて [cs.AI, q-bio.OT]目的:主体性の組織的基盤,経験的閾値,および他の目的論的用語との識別基準
- 生物学,認知科学,人工知能,哲学など幅広い分野で主体性が議論されている。
- 主体性の組織的基盤や明確な識別基準が確立されていない。
- 時間的パラメータに基づくフレームワークで主体性を多角的に分析し,その条件を明確化する。
- 主体性は,物質開放性下での構成的制約の内部再生である自律性,生存バイアスに基づいた維持である目的指向性,環境との結合の内的予測的調整である主体性,将来の生存可能性の定義における変数の再構成である開放性という4つの条件によって特徴付けられる。
- このフレームワークは,化学,細胞,多細胞,人工システムを含む多様なシステムに適用可能であり,主体性を検証可能な研究プログラムへと転換する。
- マルコフブランケットや能動推論は派生的なモデリングツールとして扱い,ビッカーズの相互作用主義は予測誤差と規範性を明確化する。
3D情報を考慮した幾何学的制約によるオープンボキャブラリBEVセグメンテーション [cs.CV, cs.LG]目的:オープンボキャブラリBEVセグメンテーションの実現
- 自動運転における周辺環境認識の重要性が高まっており,特にBEV表現はその有効性が示されている。
- 既存手法は学習済みのカテゴリに限定され,未知の物体に対する汎化性能が課題となっている。
- 2DセマンティクスをBEV空間に投影する際の幾何学的矛盾を解消し,未知物体認識の精度と効率を向上させる。
- 提案手法OVBEVSegは,3D幾何学的制約を活用し,GSベースの非投影を高精度化することで,オープンボキャブラリBEVセグメンテーションを実現した。
- nuScenesデータセットにおいて,未知カテゴリにおいて既存手法を15.3 mIoU上回る性能を達成した。
- 新たな学習データが不要でありながら,教師あり学習ベースラインと同等の性能を発揮し,高速かつ低メモリな推論を実現した。
ATOD:ターンを意識したアニーリングによるオンポリシー蒸留法 - マルチターンエージェントタスクのための [cs.HC, cs.AI]目的:マルチターンエージェントタスクにおける小規模言語モデルエージェントの高速な模倣と報酬駆動型改善
- 長期的なインタラクティブタスクでは,効率的なエージェント学習が不可欠である。言語モデルを利用したエージェントは,その可能性を秘めている。
- オンポリシー蒸留法は初期学習に有効だが,教師モデルに近づくと性能向上が頭打ちになる。強化学習は報酬を最大化するが,スパースな報酬は学習効率を低下させる。
- 本研究は,蒸留法と強化学習の長所を組み合わせ,初期学習の効率と最終的な性能の両方を向上させることを目指す。
- ATODは,蒸留法と強化学習を段階的に切り替えることで,初期段階では教師モデルの行動を模倣し,終盤では報酬に基づいた探索を促進する。
- ターンレベルの不一致・不確実性重み付け(T-DUR)を導入することで,有用なターンを強調し,長期的軌跡における密な教師信号の質を向上させる。
- ALFWorld,WebShop,Search-QAでの実験により,ATODが既存手法を上回り,教師モデルを超える性能を示すことが確認された。
学習による選択,再学習ではない:ハードルーティングによる推論LoRAの混合 [cs.AI, cs.LG]目的:凍結された推論LoRA専門家をユニットスケールでのハード選択を通じて構成すること
- 大規模言語モデルのマルチドメイン適応は重要であり,特に元の学習データを共有できない場合に有効である。
- ソフトな重み付き結合は,各LoRAモジュールの本来の学習に基づくユニットスケールでの加法的な更新を変更する可能性がある。
- 凍結されたLoRA専門家の行動を維持しつつ,学習可能なパラメータ数を大幅に削減することを目指す。
- Hard-Routed MoR-LoRAは,複数のベンチマーク,モデル規模,モデルファミリーで専門家の振る舞いを維持しながら,ソフトルーティングベースラインよりも大幅に少ない学習可能なパラメータで機能することを示した。
- 実験の結果,正規化されたソフト混合は,ルーティングの質量を単一の専門家に集中させる傾向があることが示唆された。
- ハードユニットスケールルーティングは,凍結されたLoRA専門家の構成のためのシンプルかつ効率的な抽象化を提供する。
ACPO:モード局所エントロピー代理を用いた非対称信用政策最適化 [cs.CL, cs.RO, cs.LG, cs.AI]目的:強化学習における信用割り当ての最適化
- 複雑な推論タスクにおいて,モデルの意思決定過程を理解し,改善することが重要である。
- 従来の強化学習では,トークンレベルでの貢献度を区別できず,効率的な学習が困難である。
- トークンレベルでの信用割り当ての精度向上と,非対称な政策更新による学習効率の改善を目指す。
- ACPOは,グローバルエントロピーの代わりにトップトークン確率の補数を代理変数として用いる。
- 勾配分析に基づき,ミスマッチルーティングと飽和補正を取り入れ,望ましい非対称な政策更新を誘導する。
- 数学的およびコーディングの推論ベンチマークにおいて,既存手法を上回る性能を示した。
運用地球観測分類器の事前照合評価:センチネル1内部波検出における3値報告手法のデモンストレーション [cs.LG, cs.CV, eess.IV]目的:内部波検出における運用分類器の評価方法の改善
- 地球観測は,環境変動の監視や防災などに不可欠であり,その精度向上が重要である。
- 従来の評価手法では,運用環境での発生率を考慮せず,過剰に高い精度を報告する問題があった。
- 運用環境の事前確率を考慮した評価手法を確立し,より現実的な性能評価を実現すること。
- 従来のバランスデータでの評価は,実際の運用における精度を過大評価することが示された。
- 事前確率を考慮した3値報告手法により,より正確な精度評価が可能となることが実証された。
- 内部波検出において,運用時の事前確率で0.927の精度を達成し,未知の期間への汎化性能も確認された。
曝露は顕在化ではない:行動忠実度評価器の勝敗は測定対象と出力解像度によって決まる [cs.AR, cs.ET, cs.RO, cs.CL, cs.AI, cs.HC, cs.LG]目的:言語モデルの行動と主張の一致に関する評価基準の検討
- 言語モデルの性能評価において,モデルの振る舞いを客観的に評価することは重要である。
- 既存の行動評価指標は,曝露(行動誘導条件)と顕在化(行動の表面化)を区別していない。
- 曝露と顕在化の測定対象の違いが,評価結果に与える影響を明らかにすること。
- 行動評価器と人間による判断で,測定対象が異なると,評価指標に約0.2の差が生じる。
- 人間による判断のインターフェース下では,評価器は曝露の評価で優位性を示す一方,顕在化の評価では劣る。
- 出力解像度を調整してもこの逆転現象は解消されないが,測定対象の違いが評価器間の距離を規定することが示された。
オートエンコーダの学習ダイナミクス解釈:過渡的なスケーリングとイジングモデルにおける概念の創発 [cs.RO, cs.LG, cond-mat.dis-nn, cond-mat.stat-mech]目的:イジングモデルのデータ生成過程を基盤とする,巨視的な理論に関連する変数の学習
- 機械学習は,複雑な物理現象の理解とモデリングに不可欠なツールとなっている。
- オートエンコーダの学習過程は不透明であり,どのような特徴を学習しているのか不明確である。
- オートエンコーダの学習ダイナミクスを解明し,学習された表現の意味を理解すること。
- オートエンコーダは,磁化とエネルギーという2つの異なる動的モードで学習することが明らかになった。
- 最初のモードは大規模平均を学習するが,2番目のモードはエネルギー表現に関連する微細なスケールを徐々に解決する。
- 再構成誤差と潜在表現の関係を分析することで,学習が巨視的な概念の表現変化を促進する仕組みが示唆された。
評価者の評価者は誰か?自己改善型LLMエージェントのための進化する評価指標とスキルの共同進化 [cs.AI, cs.CL, cs.MA]目的:自己改善型LLMエージェントの評価指標とスキルの共同進化
- LLMエージェントの性能向上には,客観的な評価が不可欠であり,その評価指標の自動進化が重要となる。
- 現実の応用では,信頼性の高い評価指標が存在しない場合が多く,自動進化システムにおけるボトルネックとなっている。
- 既存の評価指標に頼らず,LLMエージェント自身が評価指標を生成・改善することで,性能向上を目指す。
- 提案手法は,小さな欠点検出器の組み合わせを進化させ,参照セットとの合意性と未ラベルデータに対する合意性で評価する。
- コード生成タスクにおいて,隠れた正解データとの一致度が0.21向上し,既存のLLMによる評価に匹敵する性能を示した。
- 評価指標の進化サイクルを維持することで,タスクスコアだけでは検証できない評価者の妥当性を確保し,安全性を高める。
ネットワーク化された知能:人間とAIによるチーム科学のためのアクティブ共有コンテキストグラフ [cs.AI, cs.CE, cs.HC]目的:人間とAIのチーム科学における,アクティブな共有コンテキストグラフの構築
- 科学的発見は単独の推論では難しく,多様な専門知識を持つチームによる連携が不可欠である。
- 既存のAIシステムは単独の推論能力の向上に偏っており,チームでの連携を十分に活用できていない。
- 人間とAI間の情報伝達を促進し,チーム全体の知識共有と問題解決能力を高めることを目指す。
- Myceliumは,研究者とAIエージェントを自動的に接続する共有ワークスペースとして開発された。
- 生物学的マルチオミクスキャンペーンにおいて,Myceliumは局所的な分析結果を専門家間の制約へと変換し,実験デザインに貢献した。
- ネットワーク化された知能は,分散された科学的コンテキストにおける疎な条件付き計算として捉えられる。
バースト性干渉チャネル向け,GRAND受信機を用いた閉ループ型ベイズバンディットエンコーダ [cs.IR, cs.SI, cs.IT, cs.LG, eess.SP, math.IT]目的:バースト性干渉チャネルにおける,ランダム線形符号と交差符号化線形符号のパケットレベル選択
- 無線通信において,干渉環境は常に変化するため,適応的な符号化方式が重要である。
- 従来の符号化方式では,干渉環境の変化に対応できず,通信品質が低下しやすい。
- 本研究は,ベイズバンディットエンコーダを用いて,干渉環境に適応的に符号化方式を選択することで,通信品質の向上を目指す。
- 提案手法では,チャネル推定が収束する前は交差符号化モードが選択される傾向にある。
- 学習済みのデコーダが有効になると,交差符号化の遅延がない非交差符号化モードの方が優れていることが示された。
- 学習されたノイズモデルは,ORBGRANDと比較してブロック誤り率を約1桁削減し,部分的なチャネル推定を用いることで,収束前のブロック誤り率を最大で4.5倍低減できる。
Muonはエージェント強化学習を支援するか? [cs.LG, cs.AI]目的:大規模事前学習におけるMuonの性能と,強化学習のポストトレーニングにおけるその適用範囲の解明
- 強化学習は,自律的な意思決定システムを構築するための重要な手法であり,その最適化は不可欠である。
- 最適化アルゴリズムの選択は,強化学習の性能に大きな影響を与えるが,Muonの適用範囲は明確ではなかった。
- 本研究は,Muonの最適な使用条件を特定し,強化学習におけるその有効性を評価することを目的とする。
- Muonは,特定のKLとクリッピング設定下において,AdamWよりも積極的なステップサイズで安定した学習を可能にする。
- Muonは,AdamWの学習率を最適化した条件下では,後期の成功率を向上させることが示されたが,その効果はモデルサイズに依存する。
- Muonの性能向上は,Muonのスケーリング慣習に起因する可能性があり,普遍的な最適化アルゴリズムの優位性を示すものではない。
RELIC:マルチエージェント計画における解釈可能かつ合成可能なスキル学習の原理 [cs.AI, cs.MA]目的:マルチエージェント計画における,解釈可能で合成可能なプログラミングスキルの学習
- 複雑な問題を解決するためには,複数のエージェントが協調して計画を立てる必要があり,その重要性は増している。
- エージェント間の実装詳細が異なる場合,知識の再利用が難しく,効率的な協調学習が阻害される。
- エージェント固有の実装を維持しつつ,知識を共有・再利用することで,協調的な問題解決を促進すること。
- RELICは,各エージェントが局所的にスキルを改善しつつ,有用な意思決定ロジックをテキスト形式の原理として抽出する。
- これらの原理は,異なるインターフェースの下で再利用可能であり,知識の転移を促進し,チーム全体のパフォーマンスを向上させる。
- ルーティング,スケジューリングなど複数の設定で,既存手法やLLMベースの手法と比較して,RELICの有効性が確認された。
大規模言語モデルにおける質問順序効果の監査:QQ等価性,メカニズムの特性評価と飽和に関する注意点 [cs.IR, cs.CL, cs.AI, quant-ph, stat.ME]目的:大規模言語モデルにおける質問順序効果の監査フレームワーク
- 人間のアンケート調査において質問順序効果が確認されており,その分析は意思決定プロセスの理解に不可欠である。
- 大規模言語モデルの応答は,質問順序に影響を受ける可能性があり,その評価方法が確立されていない。
- 質問順序効果を定量的に評価し,言語モデルの応答メカニズムを解明することを目指す。
- QQ等価性を用いて,質問順序効果を監査するフレームワークを開発した。
- 実験の結果,モデルの応答は特定の条件下でほぼ決定論的であり,飽和状態にあることが示された。
- 応答の分散が不十分な場合,次トークン確率はアンケート回答分布として解釈できないため,飽和スクリーニングとラベルカウンターバランスが重要である。
PathAgentBench:全スライド病理画像における証拠探索型ビジョン言語モデルのベンチマーク [cs.CV, cs.AI]目的:全スライド病理画像からの証拠探索能力を持つビジョン言語モデルの評価
- 病理診断の精度向上は医療の質を改善し,患者の予後を左右する重要な課題である。
- 既存のベンチマークは,あらかじめ切り出されたパッチや特徴量に依存しており,ギガピクセル画像からの自律的な証拠探索能力の評価が不十分である。
- 全スライド病理画像から直接証拠を獲得し,統合する能力を客観的に評価するためのベンチマークを確立すること。
- PathAgentBenchは,画像からテキストへのマッチング,テキストから画像への検索,診断領域の局所化,マルチスケール推論の4つの能力を評価する。
- 優れたオープンウェイトモデルは,マルチスケール推論で93%以上の精度,クロスモーダルマッチングで50%以上の精度を達成した。
- 診断領域の局所化は依然として課題であり,テキスト誘導型平均IoUは0.09を下回っている。自律探索では,倍率が高くなるにつれてヒット率が低下する。
SenWorld:コンテキスト豊富な評価データ生成のためのデジタルツインシミュレーション [cs.AI, cs.CY]目的:コンテキスト豊富な評価データ生成
- スマートフォンアシスタントの性能向上には,多様な個人データの活用が不可欠である。
- 実際のデバイスデータはプライバシーの問題があり,共有が困難である。
- プライバシーを保護しつつ,信頼性の高い評価データを得るための手法が求められている。
- SenWorldは,現実世界のデータに基づいて構築されたデジタルツインシミュレーションである。
- 生成されたデータは,実ユーザーのデータと比較して,カテゴリ分布とコミュニケーションリズムにおいて高い一致度を示した。
- SenWorldは,プロダクションレベルのスマートフォンアシスタントにおける78件の失敗を検出することに成功した。
SLAI T-Rex:DeepSeek-V4ファミリーのAscend SuperPODにおけるフルパラメータポストトレーニング [cs.CL, cs.AI]目的:兆パラメータ規模のMoEモデルのポストトレーニング最適化に関する実践
- 大規模言語モデルは,その性能向上により様々な分野で注目されている。
- 兆パラメータモデルのポストトレーニングは,メモリや通信の制約,カーネル実行の非効率性といった課題がある。
- Ascend NPU SuperPODにおける効率的なポストトレーニング基盤を構築し,特定分野に特化したモデルを開発すること。
- 本研究で開発したSLAI T-Rexは,既存のオープンソースベースラインと比較して34.22%のモデルFLOPs利用率(MFU)を達成し,2.93倍の改善を実現した。
- ORタスク向けに構築したデータセットは,10Kの高精度なSFTサンプルを含み,GPT-5.4-Miniやベースモデルを上回る71.81%のPass@1スコアを達成した。
- 本研究は,Ascendインフラにおける効率的な兆パラメータモデルのポストトレーニングから,ソルバーに基づいた数学モデリングのための特定分野モデルの開発までのフルスタックな経路を示した。
深層研究は信頼できるか?誤解を招く知識が誤った結論を導く [cs.HC, cs.AI]目的:深層研究エージェントにおける誤解を招く情報の影響評価
- 知識獲得に基づく意思決定の重要性が高まる中で,情報の信頼性確保が不可欠である。
- 深層研究エージェントは,虚偽情報に脆弱であり,誤った結論を導く可能性がある。
- 虚偽情報が深層研究エージェントに与える影響を定量的に評価し,対策を検討する。
- 誤解を招く情報を一つ導入した場合,誤った結論の採用率は制御群の0%から平均54.7%に上昇した。
- 誤った結論の採用率は,研究ライフサイクルの段階,フレームワーク設計,情報源の権威,提示方法によって大きく変動する。
- 事前・事後防御策は採用率を減少させるものの,完全に排除することはできず,継続的な検証の重要性が示唆される。
エージェント強化学習のためのポリシー対応型トレーニング足場:PATS [cs.AI]目的:長期的なLLMエージェント強化学習におけるポリシー改善
- LLMエージェントの応用範囲拡大には,複雑なタスク達成能力の向上が不可欠である。
- 初期の弱いポリシーは,同じ失敗を繰り返す傾向があり,効率的な学習を妨げる。
- ポリシー改善を支援する動的なトレーニング足場を提供し,学習効率を高める。
- PATSは,ロールアウトグループをエビデンスカードに変換し,タスク固有の評価を用いてコンテキストを調整する。
- 弱いポリシーが困難なタスクを完了できるよう,具体的なガイダンスを提供する。
- ALFWorld,WebShop等のベンチマークで,最先端のベースラインと同等の性能を,より少ないトークン数で達成した。
奇サイクルに対するシャノン容量の下限の改善 [cs.IT, cs.AI, cs.DM, math.CO, math.IT]目的:奇サイクルグラフのシャノン容量の下限の向上
- 情報理論において,通信路容量は重要な指標であり,効率的な情報伝送の限界を示す。
- グラフのシャノン容量の下限を厳密に求めることは,計算困難な問題である。
- 大規模言語モデルを活用し,より大きな独立集合を構築することで,シャノン容量の下限を向上させる。
- グラフ$C_7^{10}$, $C_{11}^{6}$, $C_{13}^{6}$, $C_{15}^{8}$に対する独立集合のサイズをそれぞれ134753, 21909, 62530, 8076974と特定した。
- これにより,$\Theta(C_7)>3.258020$, $\Theta(C_{11})>5.289773$, $\Theta(C_{13})>6.300109$, $\Theta(C_{15})>7.301399$というシャノン容量の下限を改善した。
- 本研究は,大規模言語モデルが具体的な組み合わせ構造を見つける上で潜在的な有用性を持つことを実証した。
構造・意味的一貫性を保つSim-to-Real変換のためのウェーブレット位相拡散 [cs.AI, eess.IV]目的:シミュレーションデータと実世界のデータを,構造と意味の一貫性を保ちながら変換すること
- シミュレーション技術は,ロボット工学や自動運転など多くの分野で重要な役割を担っている。
- シミュレーション環境と現実環境の見た目の違い(ドメインギャップ)が課題となっている。
- この研究は,ドメインギャップを埋め,構造・意味的一貫性を保った変換を実現することを目指す。
- ウェーブレット位相拡散は,空間局所的なウェーブレットパケットを用いて,グローバルなスペクトル干渉を抑制する。
- 低周波ランダム化により,合成照明の事前知識からのモデルの依存性を解消し,実世界の見た目を可能にする。
- vKITTIとCARLAを用いた実験で,既存手法を上回り,写実性と意味的一貫性の向上を示す。
