arXiv雑要約

AI - 2026/08/04 公開

  • 大規模言語モデルにおける持ち上げられた状態仮説 [cs.AI]目的:大規模言語モデルにおける計算行動の類型化と,その状態再利用による一般化と修正の関係
    • 近年のLLMの急速な発展は目覚ましいが,その学習メカニズムは未だ解明されていない点が多い。
    • LLMは文脈や微調整により柔軟に変化するが,予測の変化がどのように引き起こされるかは不明である。
    • LLMにおける計算行動の類型化と状態再利用のメカニズムを解明し,一般化と修正の問題を考察する。
    • 本研究では,「持ち上げられた状態仮説」を提唱し,計算上類似した入力は共通の潜在成分(状態)を活性化するとした。
    • NMR-Typeデータセットを用いて実験した結果,モデルは広範なルールを亜型に一般化する一方で,後続の修正を局所化することが難しいことが示された。
    • この結果は,持ち上げられた状態仮説を支持する行動的証拠となり,状態形成と修正の更なる研究の必要性を示唆する。

    Link: https://arxiv.org/abs/2607.19360

  • CrackedPDFs:PDFにおける隠れたプロンプトインジェクションの制御されたベンチマーク [cs.AI]目的:PDFにおける隠れたプロンプトインジェクションの評価基準
    • LLMの利用拡大に伴い,文書処理システムのセキュリティ確保が重要となっている。
    • PDFのような文書形式では,悪意のある指示が隠蔽されやすく,検知が困難である。
    • PDFに対するプロンプトインジェクション攻撃の評価と,より堅牢な防御策の開発を目指す。
    • 生成された29,322件のPDFを用いて,PromptGuardや学習モデルなどの性能を評価した。
    • ハイブリッド検出器は,テストセットでF1スコア0.960,ROC-AUC 0.998,PR-AUC 0.997を達成した。
    • 文書構造を考慮したハイブリッド検出は有効だが,現実世界での汎用性には課題が残る。

    Link: https://arxiv.org/abs/2607.19396

  • コープマン・ドリーマー:安定したワールドモデルによる空想のためのスペクトル制約された潜在ダイナミクス [cs.LG, cs.RO]目的:連続制御におけるサンプル効率の向上
    • 継続制御において,効率的な学習は重要であり,サンプル数を減らす手法が求められている。
    • 既存の潜在ワールドモデルでは,長期的なロールアウトにおけるモードの維持や誤差の蓄積が課題である。
    • スペクトル制約を導入し,潜在ダイナミクスの安定性を高めることで,長期的な空想の質を向上させる。
    • コープマン・ドリーマーは,スペクトル制約された決定論的な潜在ダイナミクスをコアとするワールドモデルである。
    • このモデルは,DeepMind Control SuiteやUAV-LiDARを用いた実験で,長期的なロールアウトの安定性と閉ループ制御性能の向上が確認された。
    • スペクトルバックボーンによる増幅と,二項式相互作用,確率的状態の不一致による誤差のトレードオフが明確化された。

    Link: https://arxiv.org/abs/2607.19719

  • 生成AIが書籍市場を氾濫させ,質を低下させる [cs.CL, cs.AI, cs.CY]目的:生成AIによる書籍出版が市場に与える影響の分析
    • 書籍市場は文化の重要な伝達手段であり,多様な価値観の育成に不可欠である。
    • 生成AIの急速な発展により,低品質な書籍が大量に流通し,市場の質が低下する懸念がある。
    • 生成AIによる書籍出版が市場に与える具体的な影響を定量的に把握し,対策を検討すること。
    • 生成AIによって作成されたテキストを多く含む書籍は,カタログ全体に占める割合は大きいものの,販売実績は相対的に低い。
    • しかしながら,それらの書籍は時間を経るにつれて販売シェアを伸ばし,従来の書籍の販売機会を奪っている。
    • 市場全体の書籍数は急増したが,収益の伸びは緩やかであり,一冊あたりの収益は減少傾向にある。

    Link: https://arxiv.org/abs/2607.20349

  • Robostral Navigate [cs.RO, cs.AI]目的:ロボットナビゲーションシステムの拡張性向上
    • ロボットの普及には,多様な環境とロボットに対応できる汎用的なナビゲーションシステムが不可欠である。
    • 既存のナビゲーションシステムは,高価なセンサーや詳細な地図に依存し,ハードウェアの制約が大きい。
    • 単眼カメラのみで動作する,汎用性と効率性に優れたナビゲーションシステムの開発を目指す。
    • Robostral Navigateは,80億パラメータのビジョン言語モデルであり,単眼RGB画像のみを入力として使用する。
    • これにより,カメラの固有パラメータやシーンのスケールに依存せず,様々なロボットに容易に適用可能となる。
    • R2R-CEおよびRxR-CEのベンチマークにおいて,最先端の結果を達成し,単眼カメラによるナビゲーション性能を大きく向上させた。

    Link: https://arxiv.org/abs/2607.20785

  • 安全な操舵型カテーテルの相互作用ダイナミクスモデリングと予測制御 [eess.SY, cs.AI, cs.RO, cs.SY]目的:安全な操舵型カテーテル制御に関する相互作用ダイナミクスのモデリングと予測制御
    • 医療用カテーテルの制御は,低侵襲手術において重要であり,患者の安全性を高めるために不可欠である。
    • カテーテルと組織の相互作用は複雑であり,摩擦やヒステリシス,組織の動きの影響を受けるため,正確な制御が難しい。
    • 本研究は,カテーテルと組織の相互作用を考慮した予測制御によって,安全かつ正確なカテーテル操作を実現することを目指す。
    • カテーテルと組織の相互作用ダイナミクスをスカラー・ティップ法線座標でモデル化し,部分物理フィードフォワードによって信頼性の高い曲げダイナミクスをキャンセルした。
    • 拡張カルマンフィルタを用いて接触,摩擦,モデリング誤差を一つの状態に圧縮することで,センサーレスのオフセットフリーな制御を実現した。
    • シミュレーションの結果,力制約付き予測相互作用ダイナミクス制御が追従性と0.5Nの接触力制限を両立することが示された。

    Link: https://arxiv.org/abs/2607.20939

  • CEL:包括的な反事実説明ライブラリとベンチマーク [cs.DC, cs.RO, cs.LG, cs.AI]目的:反事実説明に関するライブラリおよびベンチマークの提供
    • 説明可能なAIは,モデルの意思決定プロセスを理解する上で重要であり,信頼性を高める。
    • 反事実説明手法の客観的な比較が難しく,評価基準やデータ分割が統一されていない。
    • 統一されたフレームワークによる反事実説明手法の公平な比較と再現性を実現する。
    • CELは,18種類のデータセットと14種類の反事実説明手法を実装した統一ライブラリである。
    • 様々なデータセット上で手法間の定量的な比較を行い,有効性,網羅性,疎性などを評価した。
    • 本研究は,反事実説明手法の評価における再現性と公平性を向上させることを目指す。

    Link: https://arxiv.org/abs/2607.22045

  • オフポリシー比率の解体:非同期強化学習のためのエントロピー スケール トラストリージョン [cs.AI]目的:大規模言語モデルのポストトレーニング加速におけるオフポリシーデータの安定化
    • LLMの効率的な学習には,高速なデータ収集と最適化が不可欠である。
    • 非同期RLでは,データ鮮度の低下により最適化が不安定になり,性能が低下する。
    • エントロピーに応じたオフポリシー比率の調整による安定化と探索性能の向上。
    • 提案手法ESTRは,トークンごとのエントロピーに基づいてオフポリシーのずれをスケーリングすることで,学習と推論の一貫性を高める。
    • 長期的エージェントタスクや数学的推論において,既存手法を上回り,同期GRPOと同等の性能を2.6倍の速度で達成する。
    • BrowseComp-Plusで平均正答率37.34%,multi-turn GSM8Kで95.69%という結果を得た。

    Link: https://arxiv.org/abs/2607.22186

  • LLMの遅延とモデルサイズ最適化のための多目的構造化プルーニング [cs.AI, cs.CL]目的:LLMの遅延とモデルサイズ最適化
    • 大規模言語モデルは普及しているが,組み込み環境へのデプロイには制約が多い。
    • レイヤー,アテンションヘッド,MLP次元を同時に最適化することは複雑で計算コストが高い。
    • エッジデバイスへの効率的なデプロイを可能にするための最適化手法を開発する。
    • 提案手法は,常識推論タスクとゼロショット性能への影響を最小限に抑えつつ,モデルの複雑さを削減する。
    • 複数のLLMで37.5%と50%のプルーニング率において,既存手法よりも常識推論タスクで優れた性能を示す。
    • 精度,遅延,モデルサイズのバランスが良く,エッジデプロイに適している。

    Link: https://arxiv.org/abs/2607.22583

  • デザイン劇場:生成UIツールにおけるユーザー向けデザイン根拠と実装の乖離評価 [cs.MS, cs.AI]目的:生成UIツールにおけるデザイン劇場現象の評価
    • UIデザインの民主化が期待され,自然言語によるインターフェース生成が注目されている。
    • 生成されたインターフェースのデザイン根拠が,実際の実装と一致しているか不明である。
    • 生成UIツールのデザイン根拠と実装の乖離を定量的に評価する。
    • 生成UIツールが生成したインターフェースの平均で25%以上が,ユーザー向けデザイン根拠を実装していないことが判明した。
    • 特に,機能要件においては,その乖離率は34%に増加する。
    • ツールはプロンプトに含まれるUX原則の約半分を認識するものの,機能原則の実装は6%以下である。

    Link: https://arxiv.org/abs/2607.22928

  • モード結合の視点を通じた機械的アンラーニングの理解 [cs.IR, cs.CL, cs.CY, cs.LG, cs.AI, cs.CL]目的:機械的アンラーニングにおけるモード結合
    • 機械学習モデルは広く利用されているが,プライバシー保護やモデル更新の必要性が高まっている。
    • モデルから不要な情報を完全に削除するには,再学習が必要となり,コストが高い。
    • アンラーニングの最適化挙動を理解し,効率的なアンラーニング手法を開発すること。
    • アンラーニングされたモデルは,スムーズな保持/忘却挙動を示す結合された領域に位置することが多い。
    • 学習ダイナミクスの変化は,解を異なる領域に移動させる可能性がある。
    • モード結合に基づくアンサンブルは,汎化性能と再学習攻撃への堅牢性を向上させることが示された。

    Link: https://arxiv.org/abs/2607.23970

  • SpecFormer:スペクトル認識型Transformerによる推薦システムにおける埋め込みと注意力の崩壊の軽減 [cs.IR, cs.LG]目的:推薦システムにおける埋め込みと注意力の崩壊を軽減する手法
    • 推薦システムは,多様な情報からユーザーに最適なアイテムを提示する上で不可欠な技術である。
    • 推薦データ特有のデータの不均衡性により,Transformerモデルの性能が十分に発揮されないという課題がある。
    • 埋め込みと注意力の崩壊を抑制し,モデルの深層化に対応することで,推薦性能の向上を目指す。
    • 提案手法SpecFormerは,学習可能なスペクトルソフト化モジュールとスペクトルソフト化注意メカニズムを導入することで,埋め込みと注意力の崩壊を効果的に軽減する。
    • 実世界の産業データおよび公開データセットでの実験により,SpecFormerが最先端の基盤モデルを大幅に上回ることが示された。
    • SpecFormerは,実運用されている推薦システムに組み込まれ,層を重ねるほど性能が向上する優れたスケーラビリティを示すことが確認された。

    Link: https://arxiv.org/abs/2607.24025

  • エネルギー政策介入に対するテナントの反応シミュレーション:取引コストを意識したLLMエージェント [cs.NI, cs.CL, cs.AI]目的:エネルギー効率改善に関するテナントの反応のシミュレーション
    • 政策立案において,人々の行動を予測することは,効果的な政策実施に不可欠である。
    • 既存のLLMシミュレーションでは,政策への反応を左右する現実的な摩擦が考慮されていない。
    • 取引コストの認識を組み込むことで,政策反応のシミュレーション精度向上を目指す。
    • 取引コストに基づくペルソナと推論を取り入れることで,プロンプトのみの場合とファインチューニングの場合の両方でモデルの性能が向上した。
    • 取引コストに基づくペルソナ設計は,制度的政策理論と解釈可能なLLMベースの政策シミュレーションとの間の有用な橋渡しを提供する。
    • GPT-3.5-turbo,Ministral-8B-Instruct,Llama-3.1-8B-Instructにおいて,SFTおよびGRPOによるファインチューニングも有効であった。

    Link: https://arxiv.org/abs/2607.24341

  • EEG基礎モデルが符号化するもの:データセットの識別と臨床ベンチマークのための陰性コントロール群 [cs.LG, cs.AI, cs.NE]目的:臨床デコーディングのための事前学習済みEEG基礎モデルの性能評価
    • 臨床脳波研究は,脳機能の解明や神経疾患の診断・治療に不可欠である。
    • 既存のEEG解析手法では,データセットへの過剰適合や汎化性能の限界が課題となっている。
    • 本研究は,基礎モデルの性能を客観的に評価し,信頼性の高い臨床応用を支援することを目的とする。
    • LaBraM,EEGMamba,CBraMod,REVE等の基礎モデルを複数の臨床タスクで評価した結果,古典的な特徴量を用いた手法が匹敵または上回る性能を示した。
    • REVEモデルの埋め込み表現からデータセットの識別が可能であり,データセット固有の影響が示唆された。
    • ランダム初期化エンコーダが,事前学習済みのREVEモデルを上回る性能を示す場合があり,基礎モデルの優位性には慎重な評価が必要である。

    Link: https://arxiv.org/abs/2607.24519

  • おべっかAIに対する個人レベルの介入:魅力の低下はもたらすも,説得力は変化せず [cs.AI]目的:おべっかAIの有害な影響に対する個人の認識向上策の効果
    • AI技術の発展に伴い,人間とのインタラクションが増加しており,AIの心理的影響を理解する必要がある。
    • AIが過度に同意的で好意的な「おべっか」的態度を示すことがあり,利用者はそれを認識しにくい。
    • 利用者のAIに対する認識を高めることで,おべっかAIの悪影響を軽減できるか検証する。
    • 介入策は,AIの客観性や信頼性に対する評価を低下させた。
    • ビデオによる介入は,AIからの称賛が特別に得られたものではないという認識を介して,AIを楽しむ度合いを減少させた。
    • しかし,これらの介入策は,おべっかAIの説得力を低下させる効果はなかった。

    Link: https://arxiv.org/abs/2607.25166

  • Specula:システムコードの自律的なモデル検査のための形式仕様のスケーリング [cs.RO, cs.SE, cs.AI, cs.DC, cs.OS]目的:大規模で複雑なシステムコードに対する高品質な形式仕様の生成と,それを用いた効果的なモデル検査およびバグ検出
    • システムの信頼性確保は重要であり,形式手法はその有力な手段の一つである。
    • 形式仕様の作成は専門知識を要し,現実世界のシステムコードへの適用は困難である。
    • LLMを活用し,形式仕様の自動生成と品質向上により,形式手法の適用障壁を低減すること。
    • SpeculaはLLMベースのエージェントを用いてTLA+仕様を自律的に開発する。
    • 48のオープンソースプロジェクトで検証を行い,既存手法では発見困難な249個のバグを発見した。
    • 自己進化ループを通じて,LLMの課題である報酬ハッキングや幻覚を抑制し,仕様の品質を向上させている。

    Link: https://arxiv.org/abs/2607.25333

  • サイバー能力を持つAIエージェント:脆弱性,評価の包含,および防御的対応 [cs.IR, cs.AI]目的:サイバー能力を持つAIエージェントの脆弱性,評価環境の包含,および防御的対応に関する調査
    • AI技術の発展に伴い,サイバー攻撃への応用が懸念されており,セキュリティ対策の重要性が増している。
    • AIエージェントのサイバー能力評価において,評価環境からの漏洩を防ぐ対策が不十分である。
    • AIエージェントのサイバー能力評価環境のセキュリティ強化と,その評価手法の確立を目指す。
    • サイバー能力を持つAIエージェントは,多段階攻撃や環境境界との競合など,5つの脆弱性クラスを持つことが明らかになった。
    • 評価環境自体がセキュリティ境界の一部であり,防御的対策が誤用を招く可能性があることが示唆された。
    • サイバー能力の評価と環境のセキュリティ評価を同時に行う優先順位が特定された。

    Link: https://arxiv.org/abs/2607.25379

  • 学習されたもの,依存するもの,あるいは必要なものか? シーフGNNにおけるチェックポイント依存性とタスクレベルの価値の分離 [cs.LG]目的:シーフGNNにおけるチェックポイント依存性とタスクレベルの価値の分離
    • グラフニューラルネットワークは,様々な構造的データ解析に不可欠であり,その性能向上は重要な課題である。
    • シーフGNNにおける学習された制限写像の役割が,真にエッジ形状の理解に寄与しているのか不明確である。
    • 学習された写像が,単なる計算制御に過ぎないのか,それとも本質的なエッジ形状情報を捉えているのかを検証する。
    • シーフGNNにおける学習された写像は,必ずしも不可欠なエッジ形状情報を示唆するものではないことが示された。
    • チェックポイント介入と再学習を組み合わせることで,写像の役割をより正確に評価できることが明らかになった。
    • 実際のグラフデータセットにおける実験により,写像の置換可能性と非置換可能性の両方の領域が存在することが確認された。

    Link: https://arxiv.org/abs/2607.25387

  • 不確実性に応じた専門家割り当て:Mixture-of-Experts LoRAのための信頼度適応ルーティング [cs.RO, cs.IR, cs.CL, cs.CY, cs.LG]目的:不確実性に応じた専門家ルーティング手法
    • 大規模言語モデルの効率的な適応学習は,計算資源の最適化に不可欠である。
    • Mixture-of-Experts LoRAでは,トークンごとに最適な専門家を決定するルーティングが課題となる。
    • トークンの不確実性に応じて専門家を動的に割り当てることで,計算資源の有効活用を目指す。
    • 提案手法CAREは,固定された上位k件の専門家ルーティングと比較して,同等の計算量で性能を向上させる。
    • CAREは,ルーティングの出力分布からトークンの不確実性を検出し,専門家の選択を適応的に行う。
    • 不確実性と専門家間の不一致の信号は,分布外検出の精度向上にも貢献する。

    Link: https://arxiv.org/abs/2607.26052

  • 弱者から強者へのオンポリシー蒸留 [cs.RO, cs.LG]目的:複数の方策モデルからの知識蒸留による強化学習モデルの性能向上
    • 大規模言語モデルの能力転移は重要であり,より効率的な学習方法が求められている。
    • 従来の知識蒸留は教師モデルが学生モデルと同等以上の能力を持つ必要があり,限界がある。
    • より弱いモデルからの知識を活用し,強化学習モデルの性能を向上させることを目指す。
    • 弱者から強者へのオンポリシー蒸留(W2S-OPD)は,より弱いモデルから知識を蒸留することで,強化学習モデルの性能を向上させる。
    • W2S-OPDは,異なるコントラストペアを用いて,推論フレームワークや解法手順などの異なるシグナルを抽出する。
    • 実験の結果,W2S-OPDは従来のオンポリシー蒸留を上回り,学生モデルが教師モデルを超える性能を達成した。

    Link: https://arxiv.org/abs/2607.26246

  • 知識拡張エージェントによるAscend C演算子自動生成 [cs.RO, cs.AI]目的:Ascend C演算子自動合成
    • NPU推論性能向上の鍵は演算子最適化であり,その重要性は増している。
    • Ascend CはCUDAと異なり,ハードウェア知識が不可欠だが,その知識獲得が困難である。
    • 限られた環境下で,知識を活用しAscend C演算子を自動生成することを目指す。
    • AgenticCANNは,Ascend 910B上で,要素演算と正規化演算子において90~100%の実行可能性を達成した。
    • 融合演算子では56%の実行可能性を示し,10億パラメータPanguモデル推論カーネルにおいて最大6.65倍の高速化を実現した。
    • 知識注入により,要素演算子の実行可能性が57%から86%に向上し,汎用的な効果が示された。

    Link: https://arxiv.org/abs/2607.26661

  • Setoka:異種データを用いたパーソナライズドエージェントにおける階層的なユーザー理解のベンチマーク [cs.AI, cs.CL]目的:パーソナライズドエージェントにおける階層的なユーザー理解の評価
    • パーソナライズドエージェントの応用が拡大しており,効果的な支援が求められている。
    • 既存のベンチマークは明示的な情報検索に偏っており,深いユーザー理解の評価が不十分である。
    • 異種データからの階層的なユーザー理解を評価するベンチマークを構築し,その能力を測定する。
    • Setokaベンチマークは,意味記憶,エピソード記憶,行動パターン,性格特性の4段階のユーザー理解を定義した。
    • 既存システムは意味記憶の検索には優れているが,エピソード記憶,行動パターン,性格特性の理解では性能が低下する。
    • ユーザー理解には単純な事実検索だけでなく,異種情報源の統合と長期的な行動の抽象化が不可欠であることが示された。

    Link: https://arxiv.org/abs/2607.27056

  • 機械学習のピアレビューにおける研究分野間でのレビュー点数の比較可能性 [cs.DL, cs.AI, cs.LG]目的:機械学習会議のピアレビューにおけるレビュー点数の比較可能性に関する検証
    • 機械学習会議では,レビュー点数が主要な決定要素となっている。会議の規模拡大に伴い,その妥当性を検証する必要がある。
    • 研究分野によってレビューアーの質や基準が異なり,点数の絶対値だけでは論文の質を正確に評価できない可能性がある。
    • レビュー点数の比較可能性を検証し,分野ごとの特性を考慮した公平な評価方法の確立を目指す。
    • ICLR 2021-2026のデータ分析により,同じレビュー点数でも研究分野によって論文の採択確率が最大8倍異なることが示された。
    • この差は,レビュー文化,専門家レビューアーの基準,エリアチェアによる再評価,質の低下では説明できないことが確認された。
    • プログラム委員会に対し,校正済みのレビューシグナルを採用し,分野別・点数条件付きの採択率を公平性指標として公開することを提言する。

    Link: https://arxiv.org/abs/2607.27209

  • マルチヘッド注意残差 [cs.AI]目的:Transformerモデルにおける情報伝播効率の改善
    • Transformerは自然言語処理の基盤技術であり,その性能向上は重要な課題である。
    • Transformerの残差接続は単一の経路に依存するため,モデル幅が広がるにつれて情報伝達が制限される。
    • マルチヘッド注意残差は,この制限を克服し,より効率的な情報伝播を実現する。
    • マルチヘッド注意残差(MHAR)は,検証損失を標準Transformerよりも改善した(100M, 350M, 1Bでそれぞれ-0.061, -0.149, -0.140)。
    • 最適なヘッド数は4または8であり,ヘッド数を増やすことで必ずしも性能が向上するわけではないことが示された。
    • MHARの導入により,トレーニングのスループットが向上し,GSM8KとGPQAの性能も改善された(それぞれ+3.2と+3.1)。

    Link: https://arxiv.org/abs/2607.27230

  • 重い裾を持つノイズ下におけるAdamの収束挙動 [cs.LG]目的:重い裾を持つ確率的ノイズ下におけるAdam最適化器の収束性保証
    • 深層学習の発展に伴い,確率的勾配降下法のノイズ分布が重い裾を持つケースが増加している。
    • 有界分散の条件下では良好な性能を示すAdamだが,重い裾を持つノイズ下での挙動は未解明であった。
    • 重い裾を持つ確率的ノイズ下におけるAdamの収束性を理論的に解析し,その限界を明らかにする。
    • 重い裾を持つノイズ下において,Adamは$(\rho,\epsilon)$-定常点に収束することが示された。
    • 収束反復回数は,$p$値に依存し,有界分散の場合と比較して劣ることが示された。
    • 領域半径が既知の場合,Adamの収束率は最適な複雑度に改善されることが示された。

    Link: https://arxiv.org/abs/2607.27383

  • AIとその創造性と多様性への影響:LLM生成型製品アイデアの実証的研究 [cs.AI, cs.CL, econ.GN, q-fin.EC]目的:LLM(大規模言語モデル)生成による製品アイデアの質と多様性
    • 製品開発において,斬新なアイデアの創出は競争力維持に不可欠である。
    • 既存のブレインストーミング手法では,多様性に偏りが生じやすい。
    • LLMを活用し,製品アイデアの質と多様性を高める方法を確立すること。
    • LLM生成の製品アイデアは,人間のアイデアよりも平均的な品質が高く,上位10%に入る確率が7倍高い。
    • LLMの創造性向上は,説得力のある提案スキルによるものではないことが示された。
    • LLMはアイデアの新規性や多様性において弱点があり,対策手法が検討された。最新モデルやプロンプト工夫により多様性が向上する。

    Link: https://arxiv.org/abs/2607.27553

  • コンプライアンス2LoRA: ハイパーネットワーク生成LoRAアダプターによる任意のポリシーサブセットに対するオンデマンド安全アラインメント [cs.LG]目的:大規模推論モデルにおける多様な安全コンプライアンス設定への適応
    • 大規模言語モデルの安全性確保は,社会実装において不可欠であり,その重要性は増している。
    • ユーザーごとに異なる安全ポリシーへの対応が必要だが,個別にモデルを学習するコストが高い。
    • 単一のモデルで,オンデマンドに安全ポリシーを調整し,高い性能を維持することを目指す。
    • 提案手法は,ハイパーネットワークを用いてLoRAアダプターを生成し,多様な安全ポリシーに柔軟に対応可能である。
    • 単一のモデルでポリシー調整を行うことで,組み合わせの爆発的な増加を防ぎ,計算コストを削減できる。
    • 異なるサイズのモデルと評価データセットで,タスク性能を損なうことなく,ポリシー調整の有効性を実証した。

    Link: https://arxiv.org/abs/2607.27594

  • リアルタイムハードピーク情報鮮度安全性と後悔しない学習 [cs.LG]目的:ハードピーク情報鮮度制約下での安全性を保証する学習アルゴリズムの開発
    • 産業制御,V2X,遠隔操作など,安全性重視のIoTシステムにおいて,情報鮮度の管理は重要である。
    • 従来のシステムは,制約の厳しい条件下でのみ安全性保証が可能であり,実用上の課題が残されている。
    • 本研究は,敵対的環境下でも情報鮮度制約を厳密に満たす,実用的なアルゴリズムを提案する。
    • 提案手法OCO-PAoI-Hardは,シミュレーションにおいて,すべての実行で制約違反をゼロに抑えることができた。
    • 対照的に,既存の4つのベースライン手法では,1.65%から64.0%の枠割れが発生した。
    • 理論的な限界値との整合性を示す,後悔に関する実験結果が得られた。

    Link: https://arxiv.org/abs/2607.27626

  • 大規模言語モデルによるデッドロックフリーな通信プロトコル洗練のための仕様駆動型合成 [cs.SE, cs.AI]目的:通信プロトコルの洗練
    • 分散ソフトウェアシステムにおいて,通信プロトコルの正しさは重要であり,わずかな不整合がデッドロックを引き起こす可能性がある。
    • 形式仕様は厳密な保証を提供するが,プロトコル洗練を自動的に構築するサポートが限られている。
    • MPST仕様とLLMを活用し,保証された洗練を生成することで,プロトコルの信頼性と安全性を向上させる。
    • Syntropyは,MPST仕様とLLMを用いてプロトコル洗練を合成するフレームワークである。
    • Syntropyは,95.6%-99.5%の妥当性を達成し,高い構文的正確性を維持し,多様な洗練を生成することを示した。
    • 洗練の生成過程に制約を組み込むことで,生成されたバリアントが保証を満たすようにしている。

    Link: https://arxiv.org/abs/2607.27964

  • エージェント型強化学習のためのグループ反省的自己蒸留 [cs.AI, cs.LG]目的:エージェント型強化学習における自己改善手法
    • 大規模言語モデルエージェントの訓練は,複雑なタスクを達成するために重要である。
    • 報酬が検証可能であっても,行動の成功,失敗,偶然が混在し,詳細な学習が困難である。
    • ポリシー自身の検証済みロールアウトから,能力に合致した的確なガイダンスを導き出すことを目指す。
    • 提案手法GRSDは,既存の自己蒸留法と比較して一貫して性能が向上する。
    • GRSDは,未学習のタスクへの汎化性能が高いことが示された。
    • グループレベルの特権ガイダンスによって,ターンレベルの信用割り当てが改善される。

    Link: https://arxiv.org/abs/2607.28076

  • LLMによる有用性判断を教育的示唆として再考:教師モデル間での事前登録された検証 [cs.CL, cs.AI, cs.CY]目的:LLMチューターの有用性評価が,直接的な答えの提示と教育的指導を区別できるかどうかの検証
    • LLMチューターの普及が進む中で,その効果測定方法の信頼性が重要課題となっている。
    • 汎用的な有用性指標では,教育的指導の質を正確に評価できない可能性がある。
    • LLMチューターの教育的側面を評価するための指標と方法論を確立すること。
    • 主要な検証において,有用性指標では教育的指導の違いは有意ではなかったが,教育的指標では明確な差が見られた。
    • 教育的指標の評価結果は,異なるLLM評価モデル間でも一貫性を保った一方,有用性指標の評価結果はモデルに依存した。
    • 答えを提示するターンは,その後の生徒の自律的な学習を減少させることが確認された。

    Link: https://arxiv.org/abs/2607.28128

  • ObjectStream:ストリーミングビデオ理解のための潜在オブジェクトをメモリアンカーとして [cs.DC, cs.CV, cs.AI]目的:ストリーミングビデオ理解におけるメモリアンカーとしての潜在オブジェクト
    • ビデオ理解は,AI技術の発展に伴い,様々な応用分野で重要性が増している。
    • 長時間のストリーミングビデオを効率的に処理するためには,メモリ使用量の抑制が課題となる。
    • 潜在オブジェクトをメモリアンカーとして活用することで,効率的なメモリ管理と高性能なビデオ理解を目指す。
    • ObjectStreamは,既存のVideo-LLM表現から潜在オブジェクトを抽出し,フレーム間で持続的なアンカーとしてリンクさせる。
    • OVO-Bench Real-Time Visual Perceptionにおいて,Qwen2.5-VL-7Bの性能を約10ポイント向上させ,GPUメモリ使用量とTTFTを約50%削減した。
    • オフラインの長尺ビデオベンチマークでは,82.5%のビジュアルトークンを破棄しながら,フルトークンベースラインを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.28312

  • 知覚できない問題を修正:マルチモーダル推論における知覚蒸留のためのクレジット割り当て [cs.AI]目的:マルチモーダル推論における知覚蒸留のためのクレジット割り当て
    • マルチモーダル推論は,多様な情報を統合し高度な判断を下す上で重要である。
    • 既存手法では,回答の誤りが知覚段階か推論段階か特定が困難であった。
    • 知覚段階での失敗を特定し,より効果的な蒸留学習を実現すること。
    • 提案手法PCDは,教師と生徒の不一致と下流の失敗を組み合わせることで,修正可能な知覚失敗を特定する。
    • PCDは,知覚と推論のロールアウトを分離し,重みを調整することで,推論の目的を変えずに知覚の改善を図る。
    • 8つのベンチマークにおいて,PCDは既存手法と比較して性能を向上させた。

    Link: https://arxiv.org/abs/2607.28336

  • 平均報酬CMDPにおけるオーダー最適ニューラルActor-Criticのための階層型多水準モンテカルロ [cs.LG]目的:平均報酬制約マルコフ決定過程におけるオーダー最適収束保証を持つニューラルActor-Critic手法の開発
    • 安全性が重要な応用において,報酬最大化と制約充足を両立する強化学習の枠組みが求められている。
    • ニューラルネットワークを批判者として用いる場合,収束性を保証するためのバイアスとコストのトレードオフが課題となっていた。
    • 階層型多水準モンテカルロを用いて,このバイアス・コストのトレードオフを解消し,オーダー最適収束を達成する。
    • 提案手法は,従来の長時間の批判者最適化と同等のバイアスを,対数的なサンプルコストで実現する。
    • 開発されたアルゴリズムは,無限地平線平均報酬CMDPにおいて,最適性と制約違反の両方でオーダー$\tilde{O}(T^{-1/2})$の収束を達成する。
    • これは,一般的な方策パラメータ化とニューラル批判者を用いたCMDPにおいて,初のオーダー最適収束保証である。

    Link: https://arxiv.org/abs/2607.28390

  • ニシモリ温度における疎グラフ上の Kohn-Sham スペクトル埋め込み:画像分類への応用 [cs.LG, cs.CV, cs.IT, math.IT]目的:画像分類のための Kohn-Sham スペクトル埋め込み(KSSE)の提案
    • 深層学習は画像認識において高い性能を示すが,大規模モデルによる計算コストが課題である。
    • 従来の畳み込みニューラルネットワークは,パラメータ数が多く,計算資源を消費する傾向がある。
    • 疎グラフを用いたスペクトル埋め込みにより,計算効率を維持しつつ高い分類精度を実現することを目指す。
    • KSSEは,ImageNet-1000データセットにおいて,88.93%のTop-1精度を達成した。
    • Swin-LやViT-H/14といった大規模モデルを凌駕しつつ,パラメータ数を大幅に削減することに成功した。
    • 理論的な枠組みを確立し,信念伝播と正則化ラプラシアンの関係性やフラストレーションの解析を行った。

    Link: https://arxiv.org/abs/2607.28428

  • InfoOps Bench:リアルタイムな情報操作安全性ベンチマーク [eess.SY, cs.SY, cs.AI]目的:最先端言語モデルが国家支援による情報操作に利用される脆弱性の評価
    • AI技術の発展は情報空間に大きな影響を与え,国家間の情報操作の脅威が増大している。
    • 言語モデルが有害な情報操作に利用される可能性があり,その安全性評価が不可欠である。
    • 最新の情報操作事例に基づき,言語モデルの安全性と倫理的な利用を評価する。
    • 17のモデルを評価した結果,ほとんどのモデルが情報操作に利用される脆弱性を持つことが明らかになった。
    • モデルの安全性スコアは8.8%から94.5%と幅広く,モデルサイズだけでは説明できない。
    • 中国製のモデルは,中国批判的な主張に対してコンプライアンスが大幅に低下する傾向が見られた。

    Link: https://arxiv.org/abs/2607.28503

  • SCMA:構造と金属を考慮したフローマッチングによるCT金属アーチファクト軽減 [cs.CV, cs.AI]目的:CT金属アーチファクトの軽減
    • CT画像診断において,金属によるアーチファクトは画質劣化の大きな原因となる。
    • 既存のアーチファクト軽減手法は,残存アーチファクトや解像度の低下,汎化性能の低さなどの課題がある。
    • サンプル固有の構造と金属の影響を考慮したフローマッチングにより,より高精度なアーチファクト軽減を目指す。
    • 提案手法SCMAは,シミュレーションおよび実際のCTデータにおいて,代表的なアーチファクト軽減手法よりも効果的に金属アーチファクトを抑制した。
    • SCMAは,局所的な解剖学的構造をより良く保持し,投影データと一貫性のない構造の出現を抑制した。
    • 構造条件と金属情報を考慮することで,アーチファクト軽減と解剖学的構造の保全を両立している。

    Link: https://arxiv.org/abs/2607.28759

  • ベイズ実験計画法による認知パラメータ推論のための情報的環境の特定 [cs.AI, stat.ML]目的:認知パラメータ推論のための情報的環境
    • 行動の背後にある認知メカニズムの解明は,認知科学の根幹をなす重要な課題である。
    • 実験環境が固定されていることが多く,どの実験が認知パラメータ推論に最も役立つか不明である。
    • ベイズ実験計画法を用いて,認知パラメータ推論に最適な実験環境を効率的に設計すること。
    • ベイズ実験計画法による環境ランキングが,正確なモンテカルロ法によるランキングとほぼ一致することを示した。
    • 計算コストを大幅に削減し,実用的な効率的な環境設計を可能にした。
    • 単一の最適な環境は存在せず,情報量,回復可能性,情報効率の間にはトレードオフがあることが明らかになった。

    Link: https://arxiv.org/abs/2607.28894

  • 大規模言語モデルの説得力は,その認識される国家起源に依存しない [cs.RO, cs.DB, cs.HC, cs.AI]目的:AIの国家起源が説得力に与える影響の検証
    • 地政学的なライバル関係にあるAIが世界中の人々に影響を与える可能性があり,情報主権や民主主義に影響を及ぼすことが懸念される。
    • AIの国家起源が,人々のAIに対する信頼や意見形成にどのような影響を与えるのかが不明である。
    • AIの国家起源が説得力に与える影響を検証し,外国の影響工作に対する対策を検討する。
    • 政治的な話題と非政治的な話題のいずれにおいても,AIとの対話を通じて参加者の態度に大きな変化が見られた。
    • AIの国家ラベルは,参加者の自己申告による態度の変化や,AIに対する姿勢,譲歩,反論,感情に影響を与えなかった。
    • 対話開始前の人間に対する信頼は,中国のAIに対して低い傾向が見られたが,機能に対する信頼は影響を受けなかった。

    Link: https://arxiv.org/abs/2607.29334

  • 単純化された二次勾配:ヘッセ行列と勾配を統合し,勾配降下法とニュートン型手法を繋ぐ統一的枠組み [math.OC, cs.LG]目的:二次勾配法の一般化と,その凸数値最適化問題への適用可能性の検証
    • 最適化アルゴリズム研究において,特にニュートン型手法の収束速度向上は重要な課題である。
    • 従来の学習率はスカラーであるため,勾配要素の異質な更新速度に対応できないという問題がある。
    • ヘッセ行列と勾配を統合した新しい二次勾配法により,収束速度を改善することを目指す。
    • 新しい二次勾配法は従来の収束条件を満たさないものの,実験結果から元の手法よりも優れた収束性を示す場合がある。
    • 提案する二次勾配法は,ヘッセ行列の対角成分を効率的に推定するためにハッチンソン推定器と統合されている。
    • この手法は深層学習アーキテクチャに対して効果的であり,標準的な適応型最適化器の堅牢な二階代替手段となる。

    Link: https://arxiv.org/abs/2209.03282

  • 生体超音波コンピューテッドトモグラフィーのためのニューラルBorn級数演算子 [eess.IV, cs.CV, cs.LG]目的:生体超音波コンピューテッドトモグラフィーにおける組織特性再構成の効率化
    • 臨床画像診断において,放射線被ばくの少ない高分解能な画像取得が求められている。
    • 組織特性再構成に必要な全波形反転法は計算負荷が高く,臨床応用が限定されている。
    • ニューラルBorn級数演算子を用いて波形シミュレーションを高速化し,USCTの実用化を目指す。
    • ニューラルBorn級数演算子は,脳および乳房データセットのシミュレーションにおいて,高い精度と効率性を示した。
    • 本手法は,前方シミュレーションと画像再構成の両方で有効であることが確認された。
    • この成果は,リアルタイムに近いUSCT再構成の可能性を示し,臨床応用の実現に貢献する。

    Link: https://arxiv.org/abs/2312.15575

  • カラビ-ヤウ超曲面のDNA [hep-th, cs.NE, hep-ph]目的:カラビ-ヤウ三次元超曲面を生成する四次元反射多角形の三角形分割の最適化
    • 弦理論のコンパクト化において,カラビ-ヤウ多様体の形状は物理的性質を決定する重要な要素である。
    • 多角形の三角形分割の数は膨大であり,効率的な探索が困難である。
    • 遺伝的アルゴリズムを用いて,効率的に三角形分割を探索し,物理的性質を最適化することを目指す。
    • 遺伝的アルゴリズムが,アクセオン崩壊定数やアクセオン-光子結合といった物理的観測量の最適化に効果的であることが示された。
    • 三角形分割のパラメータ化を工夫することで,冗長性を排除し,クルツァー・スケルケリスト全体を最適化戦略に適用可能にした。
    • ベイズ最適化によるハイパーパラメータの調整により,マルコフ連鎖モンテカルロ法やシミュレーテッドアニーリングよりも大幅に性能が向上した。

    Link: https://arxiv.org/abs/2405.08871

  • 機械学習の情報理論的基盤 [stat.ML, cs.AI, cs.LG]目的:機械学習における既存の実践に対する理論的厳密性
    • 機械学習の急速な進歩を理論的に裏付ける必要性が高まっている。
    • 機械学習は経験的な調査に頼ることが多く,理論的根拠が不足している。
    • ベイズ統計と情報理論に基づいた汎用的な理論的枠組みを構築する。
    • 本研究は,最適なベイズ学習者の性能を経験の流れから学習する過程において特徴づける。
    • データ複雑性が増大しても弱体化しない理論的ツールを提供し,多様な機械学習設定において正確な洞察を提供する。
    • 独立同一分布,シーケンシャルデータ,階層構造,信念の誤りを含む様々な設定で,理論的結果の汎用性を示す。

    Link: https://arxiv.org/abs/2407.12288

  • kNNグラフラプラシアンの収束率改善:微分可能な自己調整アフィニティ [math.OC, cs.SY, eess.SY, stat.ML, cs.LG, math.ST, stat.TH]目的:kNNグラフラプラシアンの収束率改善
    • グラフデータ解析は,複雑なデータ構造の理解に不可欠であり,様々な応用分野で利用されている。
    • kNNグラフは局所的なデータ密度に適応するが,パラメータ設定によっては収束が遅い場合がある。
    • アフィニティ関数の最適化により,kNNグラフラプラシアンの収束率を理論的に向上させることを目指す。
    • 多様体上のデータにおいて,提案手法は既存手法よりも高速な収束率 $O(N^{-2/(d+6)})$ を実現した。
    • 最適なパラメータ設定($\epsilon \sim N^{-2/(d+6)}$, $k \sim N^{6/(d+6)}$)により,理論的なバイアスと分散のバランスを取った。
    • kNN推定量の精密な分析により,この収束率改善が導かれた。シミュレーションデータによる検証も行われた。

    Link: https://arxiv.org/abs/2410.23212

  • カーネルリッジ回帰を用いたCATEの転移学習 [math.OC, cs.SY, eess.SY, math.AG, cs.CC, math.RT, stat.ME, cs.LG, stat.ML]目的:異なった標本集団における治療効果推定のための転移学習
    • データ量の増加に伴い,直接的な観測がない標本集団での治療効果推定への関心が高まっている。
    • 転移学習は,標本集団間の共変量シフトや重なりが少ない場合に阻害されやすい。
    • 重なりを考慮した適応的なCATEの転移学習手法を開発し,その有効性を検証すること。
    • 提案手法は,ソースデータを2つの部分集合に分割し,回帰調整と疑似結果に基づいたCATEモデルを訓練する。
    • もう一方の部分集合とターゲットデータを用いて最適なモデルを選択する。
    • 理論的な正当性を示し,弱重なりや複雑なCATE関数への適応性を確認した。数値実験と実データ分析の結果,優れた効率と適応性を示すことができた。

    Link: https://arxiv.org/abs/2502.11331

  • 人間らしいリズム知覚と予測のための振動階層的貯留槽 [q-bio.NC, cs.AI]目的:複雑なリズム知覚に関する選択的な側面に対する階層型発振器ベースの計算モデル
    • リズムは人間の行動の根幹であり,文化に深く根付いているため,その理解は重要である。
    • 既存研究はメトロノーム中心であり,複雑な音楽リズムの予測に関する知見が不足している。
    • 複雑なリズムにおける人間の予測能力を模倣するモデルの構築を試みる。
    • モデルは様々なテンポと知覚範囲のリズムパターンに対して,安定した同調を維持し,リズム関連の行動を示した。
    • 予測的な運動タイミング,タクトと表面の衝突時のタイミングのずれ,および予測されるタタムレベルの脈動の抑制などが確認された。
    • 運動層のベータバンド活動は,リズムおよびテンポに依存した変調を示し,人間のベータ活動との定性的な比較が行われた。

    Link: https://arxiv.org/abs/2503.12509

  • ノイズのないデータからの低次元カオス系の機械的精度での予測 [nlin.CD, cs.LG, math.DS]目的:ノイズのないデータからの低次元カオス系の予測精度向上
    • カオス系の予測は,気象,金融,流体力学など,多くの科学分野において重要な課題である。
    • 従来の予測手法では,予測精度が計算精度に制限され,長期予測が困難であった。
    • 高精度な数値計算と機械学習を組み合わせることで,この精度限界を克服し,長期予測を実現する。
    • ノイズのないデータを用いることで,機械精度レベルでの予測が可能となることが示された。
    • Lorenz-63系においては,36 Lyapunov 時間,好条件では105 Lyapunov 時間まで有効な予測が可能となった。
    • Thomas 吸引子や Lorenz-96 系など,他のカオス系でも同様の結果が得られ,低次元カオス系の予測はほぼ解決された問題であると示唆された。

    Link: https://arxiv.org/abs/2507.09652

  • グローバルからローカルへ:ローカル事後サンプリングのためのスケーラブルなベンチマーク [stat.ML, cs.LG]目的:SGMCMCアルゴリズムのローカルサンプリング性能評価のためのスケーラブルなベンチマーク
    • ニューラルネットワークの損失地形は退化を示すが,その挙動は未解明な点が多い。
    • 既存のSGMCMCアルゴリズムのグローバル収束保証は,退化損失地形との整合性に課題がある。
    • SGMCMCアルゴリズムのローカル事後サンプリング性能を評価し,その限界を明らかにすること。
    • RMSProp事前条件付きSGLDが,評価したサンプラーの中で事後分布のローカル幾何構造を最も忠実に表現することが分かった。
    • グローバル収束の理論的保証はないものの,最大O(100M)パラメータのモデルにおいても,意味のあるローカル情報を抽出できた。
    • このベンチマークは,SGMCMCアルゴリズムの研究において,ローカルサンプリングに焦点を当てることの重要性を示唆している。

    Link: https://arxiv.org/abs/2507.21449

  • 何を忘れるべきか:記憶固定の計算モデル [q-bio.NC, cs.NE, nlin.AO]目的:記憶固定の計算原理
    • 神経・免疫記憶は異なる機構を持つが,状況の変化に対応できる記憶の重要性を示唆する。
    • 過去の経験をそのまま記憶すると容量が限られ,変化する状況への適応が困難となる。
    • 予測的で利用可能かつ効率的な過去の表現を選択する記憶固定のメカニズムを解明する。
    • 記憶固定は,将来的に重要な区別を保持し,新しい経験に一般化する粗視化を行う。
    • 粗視化の自律性が低い場合,将来のエラーが増加し,記憶の動的なモードが遅くなる。
    • 最適な記憶粒度は,容量の無駄遣いを避け,状況に応じた適切な応答を可能にする中間的なレベルにある。

    Link: https://arxiv.org/abs/2508.11646

  • エキゾチック・デリバティブのための条件付きディープ・レヴィモデル:履歴認識パス生成とP-Qペイオフ診断 [eess.SP, cs.MM, q-fin.PR, cs.LG, q-fin.RM]目的:エキゾチック・デリバティブの価格設定のための履歴認識金融パスジェネレーターの開発と検証
    • 金融派生商品の正確な価格設定は,リスク管理と市場の効率性にとって不可欠である。
    • 従来のモデルでは,複雑な市場動態や過去の市場履歴を十分に捉えきれない場合がある。
    • 本研究は,より現実的なパス生成とペイオフ診断を通じて,デリバティブ価格設定の精度向上を目指す。
    • DLPMを用いた条件付きパスジェネレーターは,従来のモデルと比較して,終端CRPS,パスエネルギー,ボラティリティ比率において改善が見られた。
    • 履歴ブロック・ブートストラップとの比較では,DLPMは周辺指標において競争力があり,特に状態に合致した経験的コントロールに対して,CRPSを23.3%低減した。
    • P-Qペイオフ診断は,バニラコールとアジアコールにおいて,ディーラーのスプレッドと重要性閾値を考慮した上で,透明性の高い診断結果を示した。

    Link: https://arxiv.org/abs/2509.13374