arXiv雑要約

AI - 2026/08/05 公開

  • ソフトからハードLLMプロンプトへの学習 [cs.CL, cs.CL, cs.LG]目的:ソフトプロンプトの学習された埋め込みを自然言語記述に変換する翻訳モデルの開発
    • LLMの活用範囲拡大には,その挙動の理解と制御が不可欠である。
    • ソフトプロンプトはパラメータ効率が良いが,その内部メカニズムは解釈が困難である。
    • ソフトプロンプトの学習内容を言語化することで,解釈性と推論能力の向上を目指す。
    • 本研究では,ソフトプロンプトの埋め込みを自然言語で表現する翻訳モデルを提案した。
    • 生成された自然言語プロンプトは,単独で推論に利用でき,ベースラインを上回る性能を示した。
    • 自然言語化されたプロンプトは,元のソフトプロンプトの性能の平均32%を維持することが確認された。

    Link: https://arxiv.org/abs/2605.27642

  • 言語モデルエージェントに見られる集団内信頼バイアス:標準的な行動監査では見過ごされがち [cs.AI]目的:言語モデルエージェントにおける集団内信頼バイアスの存在
    • マルチエージェントAIの発展に伴い,エージェント間の信頼関係が重要となる。
    • 既存の評価手法では,エージェント間の相互作用におけるバイアスを捉えきれない。
    • 単一モデルの評価に偏った監査手法では検出できない集団内バイアスを明らかにすること。
    • 複数のオープンソースの推論モデルにおいて,集団の区別が与えられた時点で集団内への信頼バイアスが確認された。
    • シミュレーションの結果,エージェントは偶然の確率よりも多く,集団内のターゲットに対して信頼構築行動を向けた。
    • 資源の制約を設けた実験では,バイアスが減少することもあり,その原因は制約の実施方法にあることが示唆された。

    Link: https://arxiv.org/abs/2605.28114

  • 符号を意識したゲート付き疎オートエンコーダ:Bi-Jump-ReLU活性化関数を用いた反相関特徴のモデル化 [cs.LG]目的:大規模言語モデル活性化からの解釈可能な特徴抽出
    • 言語モデルの内部表現を理解することは,AIの透明性向上に不可欠である。
    • 従来の疎オートエンコーダは,反相関特徴を表現する効率が低いという課題があった。
    • 符号を意識したゲート付き疎オートエンコーダは,反相関特徴を効率的にモデル化することを目指す。
    • 提案手法SA-GSAEは,Pythia-1BとSmolLM3-3Bにおいて,従来のゲート付き疎オートエンコーダを上回る性能を示した。
    • 特に,SA-GSAEは,L_0=64において,死活ニューロンの割合を0.35~0.82絶対値減らすことに成功した。
    • 符号条件付き介入実験により,SA-GSAEにおける単一の符号付き潜在変数は双方向の因果制御を行うことが示された。

    Link: https://arxiv.org/abs/2605.28149

  • 推測デコーディングと多言語性の呪い [cs.CL, q-bio.NC, cs.CL, cs.LG]目的:推測デコーディングの多言語性能に関する検証
    • 大規模言語モデルの効率的な推論は重要であり,その高速化は実用性を高める上で不可欠である。
    • 多言語モデルでは,リソースの少ない言語において性能が低下する「多言語性の呪い」が課題となっている。
    • 低リソース言語における推測デコーディングの効率低下を解決し,より実用的な手法を模索する。
    • 推測デコーディングは,低リソース言語において英語と比較して効果が低いことが示された。
    • 大規模モデルからの知識蒸留は,タスク間で汎化性能が低く,効果的なデータセット構築が困難であることが示唆された。
    • n-gramモデルをドラフトモデルとして用いることで,ある程度の高速化が実現可能であることが確認された。

    Link: https://arxiv.org/abs/2605.30580

  • E4GEN:イベントレベルの説明可能な極端現象強調時系列生成 [cs.CE, cs.LG, cs.AI]目的:極端現象を考慮した時系列生成のための説明可能な拡散フレームワーク
    • 科学研究や実世界アプリケーションにおいて,現実的な時系列データの生成は不可欠である。
    • 既存手法は全体的な分布の忠実性に重点を置く一方,極端な現象の正確な再現が課題となっていた。
    • 極端現象の生成に関する制御メカニズムの解明と,より忠実な時系列データの生成を目指す。
    • E4GENは,時系列生成において,全体的な忠実性,極端現象の忠実性,下流タスクへの有用性の各側面で,最先端モデルを上回る性能を示した。
    • E-Activator,E-Predictor,E-Controlの3つの主要コンポーネントを通じて,極端現象生成のタイミング,内容,方法に関する系統的な洞察を提供する。
    • Data-Conditioned TrainingとNoise-Initiated Samplingメカニズムにより,学習ラベルの不足という課題に対処している。

    Link: https://arxiv.org/abs/2606.01634

  • FLARE:ハイブリッド言語モデルの拡散 [cs.LG, cs.AI]目的:ハイブリッド言語モデルの拡散変換フレームワーク
    • 大規模言語モデルは実用化が進んでいるが,低遅延化が課題。
    • 逐次デコードがボトルネックであり,並列生成による効率化が求められる。
    • ハイブリッドアテンションLLMの変換と性能維持を可能にする。
    • FLAREは,ハイブリッドアテンションLLMを変換するための体系的なフレームワークである。
    • 変換データの品質が性能維持の主要因であり,損失関数やマスク設計よりも重要であることが示された。
    • 単一GPU環境での同時実行時,オープンソースの拡散言語モデルと比較して一貫したスループットの向上を達成した。

    Link: https://arxiv.org/abs/2606.01774

  • 疑念を考慮した設計:自律エージェントにおける情報に基づいた行動停止の提唱 [cs.AI]目的:自律エージェントにおける情報に基づいた行動停止の枠組み
    • 大規模言語モデルの自律性は,社会への影響が大きく,安全性確保が不可欠である。
    • 現状の評価指標はタスク遂行率のみに偏り,安全性が確認できない状況下での行動を助長する。
    • 安全性を確保しつつ,エージェントの有用性を維持するための新しい設計原則を提示する。
    • 評価指標に「行動停止」の評価を導入することで,エージェントの安全性と信頼性を向上させることが示された。
    • 提示された「情報に基づいた行動停止の枠組み」は,必要な情報が不足している場合に安全に処理を中断し,回復行動を促す効果を持つ。
    • 実行時強制,適切なガード機構,監査可能なトレース生成が,安全で使いやすい自律エージェントシステム設計の標準となるべきである。

    Link: https://arxiv.org/abs/2606.02965

  • CaliDist:注意散漫に対する行動的頑健性による大規模言語モデルのキャリブレーション [cs.IR, cs.LG, cs.CL]目的:大規模言語モデルのキャリブレーション
    • 大規模言語モデルの信頼性は重要であり,その判断の正確さだけでなく,外部からの影響に対する頑健性も求められる。
    • 既存のキャリブレーション手法は,無関係な情報に対するモデルの脆弱性を考慮していない場合が多い。
    • 注意散漫に対する行動的頑健性を評価し,モデルの信頼性を高めることを目指す。
    • CaliDistは,入力プロンプトに意味的なノイズを加えることで,モデルの予測と不確実性の変化を測定する。
    • この安定性(または不安定性)の信号を用いて,モデルの初期信頼度を適応的に調整する。
    • 7つの自然言語理解ベンチマークにおいて,CaliDistは既存手法よりも低いECEとBrier Scoreを達成し,平均でECEを23%から7%に削減した。

    Link: https://arxiv.org/abs/2606.05799

  • 最速で考える:最先端AIモデルにおけるCoT不要タスク完了時間の予測 [cs.AI]目的:最先端AIモデルのCoT(思考連鎖)を用いないタスク完了時間
    • 最先端AIの安全性確保は重要であり,その監視が不可欠である。
    • AIモデルが明示的な思考トークンなしに複雑な推論を行う能力が課題となる。
    • AIモデルがCoTなしでタスクを完了する時間的範囲を予測し,監視の必要性を提示する。
    • 最先端AIモデルのCoT不要タスク完了時間は,過去6年間で約1年ごとに倍増していることがわかった。
    • GPT-5.5の完了時間はおよそ3分を超え,思考トークン数は1,500を超えている。
    • 予測では,2028年には7分以上,2030年には25分以上の完了時間が予想される。

    Link: https://arxiv.org/abs/2606.07157

  • 行動安全性評価の限界:表現レベルからの考察 [cs.LG, cs.AI, cs.CL]目的:大規模言語モデルの安全性に関する表現レベルでの脆弱性の検証
    • 言語モデルの安全性確保は重要であり,社会への実装を進める上で不可欠である。
    • 既存の行動安全性評価では,モデル内部の状態に着目せず,出力のみを観察するため,潜在的な脆弱性を見逃す可能性がある。
    • モデルの表現レベルにおける脆弱性を明らかにし,より強固な安全性評価手法を確立することを目指す。
    • 静的監査では,ベースモデルと乖離モデルは同じ安全性を評価されるにもかかわらず,内部状態への介入によって乖離モデルは容易に有害な応答を示すようになる。
    • 潜在空間への攻撃による脆弱性スコア(LVS)は,ベースモデルよりも乖離モデルで2.5~3.1倍高い値を示し,潜在的なリスクの高さが示唆される。
    • わずかな内部状態の操作で,乖離モデルは54~86%のプロンプトに対して有害な応答をする一方,ベースモデルは3~48%に留まり,その脆弱性が明らかになった。

    Link: https://arxiv.org/abs/2606.08044

  • GENERIC-FNO:エネルギー保存とエントロピー生成をフーリエニューラル演算子に組み込む [cs.LG]目的:非平衡熱力学のGENERIC(メトリプリクティック)構造を関数空間に直接組み込んだ初のニューラル演算子
    • 非平衡熱力学は,自然界の多くの現象を記述する上で重要であり,その数理モデルの精度向上が求められている。
    • 既存の構造保存ニューラル演算子は,多くの場合,単一の保存則しか適用できず,複雑な熱力学的システムへの適用が困難であった。
    • 本研究は,エネルギーとエントロピー保存則を厳密に満たすニューラル演算子を開発し,熱力学的に一貫した学習を実現することを目指す。
    • GENERIC-FNOは,エネルギーとエントロピー関数をニューラル演算子として学習し,退化条件を正確に強制することで,連続時間ダイナミクスにおいてエネルギー保存とエントロピー生成を保証する。
    • このモデルは,1D/2D FNOやDeepONetといった様々なバックボーンで,可逆的,消散的,混合的な領域を含む4つの偏微分方程式に対して,4倍の超解像度範囲(64から256)で構造的保証を維持する。
    • GENERIC-FNOは,物理的消散の真の順序を復元し,パラメータ数が同程度または少ない場合,制約なしまたはエネルギーペナルティベースラインよりも優れている。

    Link: https://arxiv.org/abs/2606.08343

  • コンテキストの回帰:オンポリシー蒸留におけるロバストな内部化に向けて [cs.LG, cs.AI]目的:オンポリシー蒸留における内部化の堅牢性向上
    • 大規模言語モデルの効率化と汎用性向上は,自然言語処理研究の主要な課題である。
    • 蒸留後のモデルが,学習時に使用したコンテキストに過度に依存し,再導入時に性能が低下する問題がある。
    • コンテキスト再導入時の性能劣化を防ぎ,コンテキスト依存性と独立性の両立を目指す。
    • 本研究では,コンテキスト再導入による性能劣化現象を「コンテキスト誘発劣化」と定義した。
    • コンテキスト不変性を促す新しい損失関数「No-Context Anchoring (NCA)」を提案し,その有効性を示した。
    • 多様な設定において,NCAはコンテキスト付き精度を向上させ,コンテキスト再導入による性能劣化を軽減した。

    Link: https://arxiv.org/abs/2606.11627

  • オンラインシフト検出と展開された安全分類器のための適合的推論 [cs.LG, cs.CR, stat.ML]目的:安全分類器におけるシフト検出と適応的推論手法の開発
    • 安全性が重要なシステムにおいて,AIモデルの信頼性確保は不可欠であるため。
    • 安全分類器は,敵対的入力に対する計算資源の消費が大きく,見過ごされやすい。
    • シフト検出と適合的推論によって,敵対的入力に対する分類器の脆弱性を軽減すること。
    • 敵対的入力は良性入力よりも多くの推論トークンを必要とし,低予算の環境では監視機能を停止させる。
    • スコア不一致監視(カナリア)の信頼性を評価し,攻撃者が停止するセキュリティ境界を特定した。
    • 生成埋め込みにおける適合的崩壊が確認され,次元削減によってカバレッジを改善できることを示した。

    Link: https://arxiv.org/abs/2606.11949

  • CADET:物理に基づいた因果的監査とトレーニング不要なエンドツーエンド運転プランナーの交絡除去 [cs.RO, cs.RO, cs.AI]目的:エンドツーエンド運転プランナーにおける誤った依存性の監査,ベンチマーク,修正
    • 自動運転は社会実装が期待される分野であり,安全性確保が重要である。
    • 模倣学習によるプランナーは統計的相関に依存しやすく,ロバスト性に課題がある。
    • 事前学習済みのプランナーに対し,再学習なしで誤った依存性を特定・修正すること。
    • CADETは,パラメータ更新を伴わず,既存のプランナーの誤った依存性を評価できる。
    • CADETは,運転プランナーが虚偽の合図に依存しているかを明らかにし,ベンチマークを提供する。
    • CADETは,トレーニング不要な枠組みにより,デプロイ済みのプランナーに対しても適用可能である。

    Link: https://arxiv.org/abs/2606.14438

  • 拡散Transformerにおける専門家分解と特徴再利用の整合:MoECa [cs.LG, cs.CV]目的:拡散Transformerの効率化のためのキャッシュ機構
    • 拡散モデルは高品質な画像生成を可能にするが,計算コストが高い。
    • MoEを用いた拡散Transformerは計算効率の改善が見られるものの,タイムステップ間の冗長計算がボトルネックとなる。
    • 専門家分岐レベルでの特徴再利用により,タイムステップ間の冗長性を低減し,推論速度を向上させる。
    • MoECaは専門家分岐レベルでキャッシュを行うことで,既存のトークンレベルのキャッシュ手法よりも効率的に計算量を削減する。
    • MoECaは専門家を考慮した適応制御と同期されたキャッシュ更新により,中間状態の安定性を維持する。
    • 実験により,MoECaは生成品質を維持しつつ,最大2.93倍の高速化を実現することが示された。

    Link: https://arxiv.org/abs/2606.15615

  • ウェブエージェントのどこに問題があったのか?セマンティック状態追跡を用いたプロセスレベルの評価 [cs.AI, cs.LG]目的:ウェブエージェントのプロセスレベルの分析
    • ウェブエージェントは複雑なタスク遂行において重要性が増しており,その性能評価が不可欠である。
    • 従来の評価指標は最終的な成功/失敗のみに着目しており,プロセスに関する情報が不足している。
    • ウェブエージェントの改善点を特定するための,詳細なプロセス分析を可能にする。
    • WebStepというベンチマークを用いて,1800件のタスクインスタンスにおけるウェブエージェントのプロセスレベル分析を行った。
    • 成功率が類似するエージェント間でも,探索範囲や実行精度などのプロセス指標において明確な差異が認められた。
    • タスクの難易度が高くなるにつれて,エージェント間のプロセス指標の差異が拡大し,改善の必要性が明確になった。

    Link: https://arxiv.org/abs/2606.15673

  • 非分離可能なハミルトニアン学習のためのシンプレクティックニューラルネットワーク [cs.LG]目的:非分離可能なハミルトニアンの学習
    • ハミルトニアン系は物理学の基礎であり,その振る舞いを正確にモデル化することは重要である。
    • ノイズのある観測データからハミルトニアンを特定することは困難である。
    • シンプレクティック積分法を用いたニューラルネットワークの効率的な学習方法を確立する。
    • 本研究では,シンプレクティック構造を保存する陰解法に基づいたハミルトニアンニューラルネットワークの学習方法を提案した。
    • 予測子修正子法と固定点反復により,陰解法の計算コストを軽減し,効率的な勾配更新を可能にした。
    • 実験により,非分離可能でカオス的な系におけるシステム識別とエネルギー保存において数値的な優位性が確認された。

    Link: https://arxiv.org/abs/2606.27029

  • 長視野検索におけるコンテキスト劣化の診断と軽減 [cs.IR, cs.AI, cs.CL]目的:長視野検索におけるコンテキスト劣化の診断と軽減策
    • 大規模言語モデルの活用拡大に伴い,長文コンテキストの処理が重要になっている。
    • コンテキスト長が長くなるほど,モデルの性能が低下するコンテキスト劣化の問題が存在する。
    • 深層検索において,モデルがどのように失敗するのか,その原因を特定し,軽減策を提案する。
    • 大規模言語モデルが,コンテキストウィンドウを使い切る前に回答を諦めたり,不確実な誤答を生成したりする「早期終止」という現象を新たに発見した。
    • 早期終止の発生率は,コンテキスト長と正の相関があることが確認された。
    • コンテキスト管理と並列サンプリングなどの既存手法を再検討した結果,性能向上に繋がる指針とフィルタリング戦略を提示した。

    Link: https://arxiv.org/abs/2606.29718

  • Vision-LanguageモデルのためのAdaBoostingテキストプロンプト [cs.CL, cs.LG]目的:Vision-Languageモデルのテキストプロンプトの構築手法
    • Vision-Languageモデルの性能はテキストプロンプトの質に大きく依存する。
    • 既存のFew-shotプロンプト手法は,誤分類事例に焦点を当てていない。
    • 誤分類事例を重視し,テキストプロンプトを逐次的に改善する手法を提案する。
    • 提案手法Text Prompt Boosting (TPB)は,テキスト空間におけるタスク固有の情報を保持する。
    • TPBは,ソースモデルの精度を向上させ,より大規模なモデルへの転移性能を維持する。
    • 11の分類ベンチマークにおいて,既存手法が改善を維持できない状況下でも,TPBはFew-shot学習の利点を維持する。

    Link: https://arxiv.org/abs/2607.00684

  • VLAFlow:共同学習と未来潜在的アラインメントによる視覚言語行動モデルの統合的学習フレームワーク [cs.CV, cs.AI, cs.RO]目的:視覚言語行動モデルの学習パラダイムの比較可能性向上
    • ロボット操作の高度化に貢献する視覚言語行動モデルの研究が活発である。
    • 既存モデルは構造やデータが異なり,学習パラダイムの効果を比較しづらい問題がある。
    • 学習パラダイムの効果を公平に比較するための統一的なフレームワークを構築する。
    • VLAFlowは,異なる学習目標を比較するための統一的なフローマッチングフレームワークを提供する。
    • 言語による監督学習は,視覚言語の汎化性能を維持するのに役立つことが示された。
    • 未来潜在的アラインメントは状態遷移と行動結果のモデリングを改善し,MindLWPIが最も安定した性能を示した。

    Link: https://arxiv.org/abs/2607.01586

  • 等変深層学習の基礎:グラフニューラルネットワークと層ニューラルネットワークの統合 [cs.LG, cs.AI, cs.CV]目的:等変ニューラルネットワークの理論的基盤
    • 自然や社会には対称性が遍在する。深層学習において対称性を考慮することで,汎化性能向上やデータ効率化が期待される。
    • 幾何学的深層学習とトポロジカル深層学習は,それぞれ異なるアプローチで対称性を扱っており,統合的な枠組みが存在しない。
    • 面順序(面カテゴリ)上の等変バンドルを用いて,グラフニューラルネットワークと層ニューラルネットワークを統一的に表現する。
    • 線形順序等変写像の表現を特徴づけ,等変ニューラルネットワーク(OENN)の層を構築した。
    • 連続順序等変写像に対する普遍近似定理を証明し,層ニューラルネットワークへの応用可能性を示した。
    • OENNとカテゴリ等変ニューラルネットワーク(CENN)の関係を明確にし,より一般的なカテゴリ的対称性の活用を示唆した。

    Link: https://arxiv.org/abs/2607.03798

  • Qwen2.5における誤調整ペルソナの移植,反転,防止:手法依存的な創発的誤調整 [cs.CL, cs.AI, cs.CY, cs.LG]目的:言語モデルにおける創発的誤調整のメカニズム解明
    • 大規模言語モデルの安全性確保は,社会実装において不可欠である。
    • ファインチューニングにより,予期せぬ有害な振る舞い(誤調整)が生じる場合がある。
    • 誤調整を引き起こす潜在的な要因を特定し,その対策を講じる。
    • Qwen2.5モデルにおいて,潜在的なペルソナ方向が誤調整を媒介していることが示された。
    • このペルソナ方向を別のモデルに移植すると,広範な誤調整が発生し,除去することで誤調整が減少する。
    • LoRAなどの低ランクPEFTではペルソナが活性化されやすい一方,SFTでは活性化されにくいことが明らかになった。

    Link: https://arxiv.org/abs/2607.04510

  • x予測だけで十分:エンドポイント可解性によるトレーニング不要の高速生成 [cs.LG, cs.AI]目的:拡散モデルやフローマッチングモデルにおける生成加速手法
    • 高品質な画像生成AIは普及が進んでいるが,計算コストが課題となっている。
    • 既存手法は再学習やアーキテクチャ変更を必要とし,実用的な高速化が困難である。
    • エンドポイント可解性に基づき,再学習なしで生成処理を高速化することを目的とする。
    • 提案手法であるTruncated Jump Sampling (TJS) により,NFEsを20~70%削減できる。
    • TJSは再学習やアーキテクチャ変更を必要とせず,既存モデルをそのまま利用できる。
    • エンドポイント予測が軌道修正なしに機能する理由を分析し,高速化の根拠を示した。

    Link: https://arxiv.org/abs/2607.06114

  • 量子に着想を得たエキスパート混合による画像分類 [cs.RO, cs.LG, quant-ph]目的:画像分類のための量子に着想を得た戦略
    • 画像処理は様々な分野で重要であり,効率的な分類手法の確立が求められている。
    • 従来の深層学習は計算コストが高く,特に大規模画像データセットにおける課題がある。
    • 本研究は,量子に着想を得た手法により,計算効率と分類精度の向上を目指す。
    • 提案手法では,複数のエキスパートが同じ画像を異なるパラメータで処理し,その特徴量を統合することで,分類性能が向上した。
    • MNISTおよびFashion-MNISTデータセットを用いて,単一エキスパートよりも共同分析の方が優れていることが示された。
    • 画像分類の誤り率が約半分に低減され,GPU環境での実用性も確認された。

    Link: https://arxiv.org/abs/2607.07754

  • 10億パラメータを超えるマルチモーダル感情言語モデルは本当に必要か? [cs.AI, cs.CL, cs.CV, cs.MM]目的:マルチモーダル感情認識の効率的なフレームワーク開発
    • ロボットやモバイルデバイス等のリソース制約のある環境でのリアルタイム展開が求められている
    • 既存のマルチモーダル大規模言語モデルはパラメータ数が多く,計算コストが高い
    • 小規模なモデルでも高性能なマルチモーダル感情認識を実現し,効率的な展開を可能にする
    • 知識蒸留により,大規模モデルの知識を10億パラメータ以下の軽量なモデルに効率的に転移させるLight-MERを提案した。
    • 最適な輸送損失と多報酬最適化戦略を導入し,Light-MERの学習能力を向上させた。
    • 9つのベンチマークデータセットで最先端の性能と推論効率の向上が確認された。

    Link: https://arxiv.org/abs/2607.12787

  • ドリフトワールド:ドリフトによる高速な世界モデル構築 [cs.RO, cs.CV, cs.LG]目的:ロボットの行動計画のための高速な世界モデルの構築
    • ロボットの自律的な行動において,未来予測は重要な役割を果たす。
    • 拡散モデルは高精度だが,サンプリングに時間がかかり,リアルタイム制御のボトルネックとなる。
    • ドリフトモデルを用いて,高速かつ高精度な未来予測を実現し,ロボットの計画能力を向上させる。
    • ドリフトワールドは,拡散モデルと比較して17倍高速に未来フレームを生成できる。
    • 標準的なロボット操作ベンチマークにおいて,最先端の意思決定性能を達成した。
    • オフラインシミュレーターとしても活用でき,実世界のロボットポリシーの評価と高い相関を示した。

    Link: https://arxiv.org/abs/2607.15065

  • 文脈的バンディットにおけるオフポリシー評価のためのカーネル重み付き重要度サンプリング [cs.LG]目的:文脈的バンディットにおけるオフポリシー評価手法
    • 行動選択の最適化は,様々な意思決定問題において重要である。
    • 過去のデータのみで評価を行うオフポリシー評価は,現実的な課題が多い。
    • 行動ポリシーの誤指定下でのオフポリシー評価精度向上を目指す。
    • 提案手法Kernel-WISは,漸近的に一貫性があることが示された。
    • Kernel-WISは,既存手法(重み付き重要度サンプリングを含む)よりも優れた性能を発揮する。
    • Kernel-WISは,重み付き重要度サンプリングの安定性とバニラ重要度サンプリングの線形性を組み合わせることで,その効果を発揮する。

    Link: https://arxiv.org/abs/2607.15067

  • Cura 1T:医療における自律的な行動を支援する専門モデル [cs.AI]目的:医療AIエージェントのための専門モデルの開発
    • 医療分野におけるAI応用の重要性が高まっているため,より高度なAIモデルが求められている。
    • 既存のAIモデルは個別のタスクに特化しており,複数の医療タスクを統合的に処理することが困難である。
    • 複数の医療タスクを同時に処理し,各タスク間の性能劣化を防ぐモデルの構築を試みる。
    • Cura 1Tは,オープンソースのKimi-K2.6を基盤とし,人間によるゲート付き再帰的自己改善ループを用いて訓練された。
    • 医療評価スイートにおいて,Cura 1Tは最先端のベースラインモデルと同等以上の性能を示した。
    • ドメイン外の推論や自律的行動に関するベンチマークにおいても,競争力のある結果が得られた。

    Link: https://arxiv.org/abs/2607.15314

  • ビジネス分野における最先端AIの性能:知識労働と分析的思考に関する事例に基づくベンチマーク [cs.CL, cs.AI]目的:ビジネス分野における知識労働と分析的思考のAI性能評価
    • ビジネス環境の複雑化に伴い,高度な分析的思考能力が求められている。
    • 既存のAIベンチマークでは,専門職の日常的な知識労働を十分に評価できていない。
    • ビジネススクールのケースメソッドを活用し,AIの分析的思考能力を客観的に測定すること。
    • 最先端AIモデルは,ビジネスケースの評価において高いスコアを獲得しており,その能力は急速に向上している。
    • 本ベンチマークは,ビジネススクールの教育方法や,初期職務におけるスキルセットの変化に示唆を与える。
    • AIは,複雑な情報統合,不確実性下での判断,戦略的思考など,高度な知識労働において既に高い性能を発揮している。

    Link: https://arxiv.org/abs/2607.16057

  • フレティク:エンジニアリングされたスペクトル特徴と保留評価によるブラウザネイティブなエレキギター弦分類 [cs.NI, cs.SD, cs.LG, eess.AS]目的:単音のエレキギター音声から,特定のピッチをどの弦が生成したかを分類すること
    • ギター演奏における音響分析は,音楽情報処理の重要な分野であり,自動演奏支援や音楽教育への応用が期待される。
    • 単一のピッチは複数の弦で生成可能であり,音色の違いは訓練されていない人間には認識が難しいという課題がある。
    • ブラウザ上で動作する弦分類システムを構築し,実演奏データに対する汎化性能を評価することを目的とする。
    • 26次元の特徴量表現(周波数帯域エネルギー,スペクトル統計量,13個のメル周波数ケプストラム係数)を用いて,97.25%という高い分類精度をフレームレベル検証分割で達成した。
    • 比較学習法を導入し,同一ピッチの弦ペアのデータを収集することで,精度が25.78%向上することが確認された。
    • 保留評価による検証では,シャッフル分割による精度よりも低い結果が得られ,シャッフル分割が現実の汎化性能を過大評価することが示された。

    Link: https://arxiv.org/abs/2607.18303

  • ハダマール多様体上の1-Lipschitzニューラルネットワーク [math.NA, cs.LG, cs.NA]目的:ハダマール多様体上における1-Lipschitzニューラルネットワークの構築と解析
    • ニューラルネットワークの安定性とロバスト性を高める上で,Lipschitz定数の制御は重要である。
    • 既存の制約戦略はユークリッド空間向けであり,非ユークリッド空間への適用が課題となっていた。
    • ハダマール多様体上での1-Lipschitzニューラルネットワークの構築により,この問題を解決する。
    • 提案アーキテクチャは,ポアンカレ円盤上でのロバストな分類器において,双曲摂動に対する耐性を示すことが確認された。
    • SPD多様体上では,提案アーキテクチャを用いたSPD値ノイズ除去器が,既存手法よりも優れた性能を発揮した。
    • ノイズ除去器の非膨大性により,マスクト・ウィシャート共分散再構成問題において性能が向上し,収束性も確認された。

    Link: https://arxiv.org/abs/2607.19335

  • 3D膝MRIセグメンテーションのための強度正規化手法の体系的なベンチマークとドメイン間汎化性能 [cs.CV, cs.AI]目的:3D膝MRIセグメンテーションにおける強度正規化手法の評価
    • 医療画像における深層学習の臨床応用には,安定した性能が不可欠である。
    • MRI画像ではスキャナーやプロトコルにより強度分布が異なり,汎化性能の課題となる。
    • ドメイン間の強度分布のずれに対するロバストな正規化手法を特定する。
    • Zスコア,Nyúlヒストグラムマッチング,CLAHEが他の手法よりも高いロバスト性を示した。
    • データセット間での性能低下が大きく,強度正規化の効果は限定的であった。
    • ドメインシフトへの対処など,他の戦略との組み合わせが重要である。

    Link: https://arxiv.org/abs/2607.20028

  • PersonaTrail:ブラウジング履歴を通じたパーソナライズドWebエージェントのベンチマーク [cs.AI, cs.CL]目的:パーソナライズドWebエージェントの性能評価
    • Webエージェントは複雑なタスクを自律的に実行可能だが,曖昧な指示への対応が課題。
    • 既存のベンチマークは,完全なプロンプトか簡略化された履歴しか扱えず,パーソナライズを評価できない。
    • ブラウジング履歴からユーザーの意図を推論し,パーソナライズされたナビゲーションを実現する。
    • PersonaTrailは,現実的なブラウジング履歴を利用し,エージェントのユーザー好み推論能力を評価する。
    • 提案手法PACMemは,履歴を事実記憶と好み記憶に分解し,関連情報を検索してナビゲーションを誘導する。
    • 実験の結果,PACMemは既存手法と比較して,一貫して高い性能を示した。

    Link: https://arxiv.org/abs/2607.20482

  • OPOD:オンポリシー全方向蒸留 [cs.AI]目的:マルチモーダルモデルにおける性能向上
    • テキスト,画像,音声など多様な情報を統合的に処理するモデルの重要性が高まっている。
    • マルチモーダルモデルは,各モダリティの教師信号を統合する際に,性能低下や矛盾が生じやすい。
    • 複数のモダリティ教師からの信号を効果的に統合し,モデルの総合的な性能を向上させる。
    • 提案手法OPODは,テキスト,画像,音声の各教師を統合し,それぞれの専門知識を最大限に活用する。
    • 実験の結果,OPODは複数のベンチマークで既存手法を上回り,特に大規模モデル(30B)において顕著な性能向上を示した。
    • 教師モデルのみで学習したモデルと比較しても,OPODは優れた性能を発揮し,実用的なモデル展開に貢献する。

    Link: https://arxiv.org/abs/2607.20918

  • 報酬チャネルにおける暗室:高密度予測報酬がGRPO学習LLMエージェントを崩壊させる ― チャネルが,内容ではなく,何が有効かを決定する [cs.IR, eess.SY, cs.SY, cs.LG]目的:LLMエージェントの報酬チャネルにおける高密度予測報酬の崩壊メカニズムの解明
    • 長期的なタスクにおいて,LLMエージェントの学習は報酬の希薄さが課題となる。
    • 高密度なステップごとの報酬は有効だが,学習の不安定性や崩壊が報告されている。
    • 報酬チャネルの設計が,学習の成否を大きく左右することを示す。
    • 標準的な正規化処理下では,予測報酬を用いた学習は常に崩壊することが確認された。
    • 報酬チャネルの危険性は,グループ内分散の軌跡とハッキング可能性によって予測できることが示された。
    • 補助損失として同じ信号を用いても無害である一方,プレースボ信号と同等の性能を示すことから,報酬の内容ではなくチャネルが重要であることが明らかになった。

    Link: https://arxiv.org/abs/2607.21273

  • 偏微分方程式の目標非依存型共同埋め込み予測制御 [cs.LG, cs.SY, eess.SY]目的:偏微分方程式の目標非依存型制御フレームワーク
    • 複雑なシステム制御において,物理現象を記述する偏微分方程式の活用が重要である。
    • 従来の制御手法では,特定の目標設定に依存するため,汎用性に課題がある。
    • 目標に依存しない制御手法を確立し,多様な制御タスクに対応すること。
    • 学習済みの潜在状態ロールアウトに対する運動エネルギー(KE)プローブを用いたMPPI計画が,潜在空間でのL2追跡と比較して平均報酬を向上させた。
    • 3つの意図的に隠された異質な非周期的な目標に対して,KE計画はRMSEを53%削減し,L2計画を上回った。
    • 凍結されたモデルは,KEを直接制御することにより,定常状態構成の安定化を達成し,平均相対誤差は2.7%であった。

    Link: https://arxiv.org/abs/2607.21644

  • TriGlue:生物学的インスピレーションに基づいた,分子接着剤誘発三元複合体生成のための生成モデル [cs.CL, cs.LG, cs.AI]目的:分子接着剤誘発三元複合体の生成
    • 標的タンパク質分解による治療法の可能性を秘めているため,分子接着剤の開発が重要である。
    • 分子接着剤の設計は,未知のタンパク質-タンパク質界面を考慮する必要があり,計算的アプローチは未発達である。
    • タンパク質-タンパク質ドッキングと三元複合体アセンブリを同時にモデル化する生成モデルを開発し,分子接着剤の設計を加速する。
    • TriGlueは,化学的に妥当な分子と,ありうる三元複合体を生成することを示した。
    • この研究は,生物学的インスピレーションに基づいた生成モデリングが,分子接着剤の発見を加速する可能性を示唆している。
    • TriGlueは,インターフェース推定とインターフェース条件付き複合体生成の2段階で三元複合体生成を分解する。

    Link: https://arxiv.org/abs/2607.22143

  • Cortex:Quakeにおける凍結された視覚特徴を用いたコンパクトな行動模倣 [cs.CV, cs.AI, cs.LG]目的:Quakeにおける行動模倣ポリシーの限界
    • ゲームAI研究は,人間らしい行動を再現し,複雑な環境で自律的に動作するAIを開発する上で重要である。
    • 行動模倣は大量のデータに依存し,環境の変化に弱いという課題がある。
    • 凍結された視覚特徴を用いることで,計算コストを抑えつつ,行動模倣の性能を向上させることを目指す。
    • Cortexは,Quakeのデータセットで訓練された,比較的コンパクトな行動模倣ポリシーである。
    • Cortexはレベルを完全にクリアすることはできないものの,初期段階のエリアは安定して到達し,一定のキル数を記録した。
    • 視覚情報の密度を高めることで,戦闘能力と生存率が向上することが示された。

    Link: https://arxiv.org/abs/2607.22739

  • 汎用的な人間-ロボット相互作用のための世界認知モデル [cs.RO, cs.AI, cs.HC, cs.LG]目的:汎用的な人間-ロボット相互作用の実現に向けた世界認知モデルの開発
    • ロボット技術は,人間の生活を豊かにする可能性を秘めており,その重要性は増している。
    • 従来のロボット制御は指示実行に偏り,ロボットの行動原理や修正方法が不明瞭である。
    • 人間とのインタラクションを通じてロボットが学習し,複雑なタスクを習得することを可能にする。
    • 提案する世界認知モデル(WCM)は,感覚,論理,行動,知識を分離し,並行処理を可能にするSLAKアーキテクチャに基づいている。
    • WCMは,人間がロボットに直接教示するモードを備え,難しいタスクや長期間にわたるタスクをインタラクティブに学習できる。
    • WCMは,9つの現実世界における人間-ロボット相互作用タスクで平均73.8%の成功率を達成し,CoTファインチューニングから除外されたタスクや教示によって学習した長期間タスクにおいても高い性能を示した。

    Link: https://arxiv.org/abs/2607.22999

  • カルシウム集団ダイナミクスのための多タスク連続自己回帰Transformer:データセットおよび種間転移を可能にする [cs.AI, cs.LG]目的:カルシウム集団ダイナミクスのための汎用的なニューラル基盤モデルの構築
    • 大規模カルシウムイメージング技術の発展により,神経集団活動の理解が深まることが期待されている。
    • 既存モデルは特定のタスクに特化し,新しいデータセットへの汎化性能が不明確である。
    • 異なるデータセット,実験パラダイム,種における汎化性能を持つモデルを開発すること。
    • CAPTは,マウス,ゼブラフィッシュ,線虫のカルシウムイメージングデータセット間での転移学習において,既存モデルを上回る性能を示した。
    • CAPTの埋め込み表現は,データセット間で共有された機能空間を形成し,解剖学的構造や細胞同一性に関連する情報を捉えていることが示された。
    • 連続自己回帰モデリングは,カルシウムイメージングのための汎用的なニューラル基盤モデルを構築するための有効な手法となり得る。

    Link: https://arxiv.org/abs/2607.23258

  • 多エージェント言語モデルにおけるモラルハザード [cs.MA, cs.AI]目的:言語エージェントにおける隠れた行動構造の検証
    • 社会的に有益な努力がコストのかかる状況下での協力の失敗メカニズム理解が重要である。
    • 言語モデルにおける協力行動の動機付けと,利他的行動の欠如が課題となっている。
    • 言語モデルにおけるモラルハザードを定量的に評価し,協力的なメカニズムを回復する方法を探る。
    • 9つのオープンウェイト言語モデルと1つのAPIモデルを評価した結果,ベースモデルはチーム成功なしにローカル報酬を優先する傾向がある。
    • GPT-5.6は主要な設定で上限に達し,自律的なスウィープはクエリコストとチーム報酬に強く反応した。
    • 監督付きファインチューニングなどの最適化手法は,集約報酬を変化させる可能性があるが,必ずしも協力メカニズムを回復するわけではないことが示された。

    Link: https://arxiv.org/abs/2607.23982

  • Sinkhornの射影的忘却による,証明可能な推測的バッチ処理 [cs.DC, cs.LG]目的:Sinkhorn問題を効率的に解決するための手法の開発
    • 最適輸送問題は,機械学習や画像処理など,幅広い分野で重要な役割を担う。
    • 従来のSinkhorn法では,計算コストが高く,大規模問題への適用が困難である。
    • 提案手法は,計算コストを削減し,大規模Sinkhorn問題を効率的に解決することを目指す。
    • 提案手法「ForgettingOT」は,Sinkhornマップの性質を利用し,証明可能な推測的バッチ処理を実現する。
    • 実験結果から,提案手法は,既存のソフトc変換法と比較して,1.42倍~3.55倍高速であることが示された。
    • また,ベクトル集合演算のラウンド数を大幅に削減し,計算効率を向上させることに成功した。

    Link: https://arxiv.org/abs/2607.24741

  • 大規模推薦システムのための相互層構築ブロックBumblebee [cs.IR, cs.LG]目的:推薦システムの性能向上
    • パーソナライズされたコンテンツ提供の重要性が増しており,推薦システムの進化が求められている。
    • 系列モデリングと特徴量交互作用という二つのアプローチが独立して発展しており,両者の連携が不足している。
    • 系列情報と特徴量の相互作用を効果的に組み合わせることで,推薦システムの精度向上を目指す。
    • Bumblebeeは,系列パーソナライズ,注意機構によるエンコード,特徴量クロスを組み合わせた相互層ブロック構造を持つ。
    • 各ブロックが系列と特徴量の両方の表現を生成し,次のブロックに渡ることで,早期かつ反復的なモダリティ混合を促す。
    • 大規模な産業データを用いた評価で,既存のモデルと比較して,分類および回帰タスクにおいて一貫した性能向上が確認された。

    Link: https://arxiv.org/abs/2607.24804

  • 長文コンテキストにおけるエージェント的指示追従のベンチマーク:HANDBOOK.md [cs.AI, cs.CL]目的:長文の指示文書に基づくエージェントの行動制約評価
    • 言語モデルエージェントの利用が増加しており,システムプロンプト等による指示が重要である。
    • 既存のベンチマークは,長期的な行動制約を評価できていない。
    • 本研究は,企業ハンドブックのような長文指示文書がエージェントの行動をどの程度制約するかを検証する。
    • HANDBOOK_mdは,従業員のハンドブック追従をモデル化した65のタスクから構成される。
    • 厳格な評価基準下では,最も性能の良いモデルでも36.2%のタスクしか成功していない。
    • エージェントは,環境内の要求に優先順位をつけたり,ルールを長期にわたって保持できなかったりする傾向がある。

    Link: https://arxiv.org/abs/2607.25398

  • 単語問題:測地長と暗号学的応用 [cs.CR, cs.LG, math.GR]目的:単語問題解決のヒューリスティック手法
    • 組合せ群論の発展を促し,近年ではポスト量子暗号の基礎的困難性仮定として重要。
    • 一般に判定不能だが,効率的に解ける群が存在し,暗号設計への応用が期待される。
    • WPNetを用いて,群における単語の測地長を予測し,暗号的脆弱性を評価する。
    • WPNetは,Baumslag-Solitar群やArtin群における単語問題に対し,効果的なヒューリスティック解法を提供する。
    • モデルは単語を動的グラフ構造に変換し,代数的に等価な要素を連続埋め込み空間でクラスタリングする。
    • WPNetを用いてWagner-Magyarik暗号の安全性に対する構造的漏洩を実証した。

    Link: https://arxiv.org/abs/2607.26241

  • AgentGUI:長期実行型AIエージェントの観察と制御のためのインターフェース [cs.CL, cs.AI, cs.HC]目的:長期実行型AIエージェントの観察と制御
    • AIエージェントの能力向上に伴い,人間による監視・介入の重要性が増している。
    • 既存のインターフェースでは,人間中心の操作性が十分ではなく,効率的な監視が困難である。
    • エージェントの状態把握と,適切な介入を支援することで,運用効率の向上を目指す。
    • AgentGUIは,エージェントの軌跡を可視化し,手動および自動による制御を可能にするGUIである。
    • ユーザー調査の結果,エージェントのトレースから重要な要素を特定する時間が38%短縮された(p = 0.023)。
    • 自動ドリフト防止機能は,小規模ローカルエージェントのタスク完了率を最大34pp向上させた(0.8B--9Bモデル)。

    Link: https://arxiv.org/abs/2607.26300

  • DHRCL:密な階層的報酬とカリキュラム学習によるコードLLMの訓練 [cs.LG]目的:コードLLMの訓練
    • コード生成AIの性能向上は,ソフトウェア開発の自動化や効率化に不可欠である。
    • 既存手法では,疎な報酬や異質な信号の静的な組み合わせに頼る傾向があり,効果的な学習が難しい。
    • 構文,実行可能性,機能,構造といったプログラミング能力の段階的な学習を可能にする。
    • DHRCLは,構文検証,実行成功,ユニットテストの合格率,ASTベースの構造的類似性といったフィードバックを密な階層的報酬として分解する。
    • 段階的なカリキュラム学習により,各段階の学習期間を自動的に決定し,トークンへの報酬配分を段階に応じて調整する。
    • Qwen3-8BおよびKodCodeプロトコルを用いた実験により,DHRCLが既存手法よりも優れていることが示された。

    Link: https://arxiv.org/abs/2607.26457

  • Metis:記憶基盤モデル [cs.ET, cs.CL, cs.LG]目的:基盤モデルへのネイティブな記憶能力の付与
    • AIエージェントの能力向上には,基盤モデルへの機能統合が不可欠である。
    • エージェントの記憶機能は外部モジュールに依存しており,基盤モデル自体の記憶能力は未開拓である。
    • 基盤モデルにネイティブな記憶機能を組み込み,アーキテクチャ,最適化,効率を改善することを目指す。
    • Metisは,基盤モデルにネイティブな記憶状態を組み込む新しいアーキテクチャを導入した。
    • 大規模な記憶特化型学習データと最適化目標により,ネイティブな記憶手順を獲得した。
    • 推論時には学習済みモデルウェイトは固定され,ネイティブな記憶状態が自律的に変換される。

    Link: https://arxiv.org/abs/2607.26760

  • エージェントスネア:自律的な侵入エージェントの遅延,誘導,および無力化学習 [cs.CR, cs.CL, cs.LG]目的:自律型侵入エージェントに対する動的な欺瞞システムの開発
    • サイバー攻撃は巧妙化しており,自動化された侵入テストの需要が高まっている。
    • 既存の防御策は静的な欺瞞に依存し,高度なエージェントに回避される可能性がある。
    • エージェントの行動履歴に応じた動的な欺瞞環境を構築し,攻撃を遅延・誘導・無力化すること。
    • AgentSnareは,エージェントのツール呼び出しの46.8%を欺瞞環境で吸収することに成功した。
    • 侵入後の行動の55.9%を欺瞞環境内に留め,完了報告の90.0%を欺瞞環境の証拠に基づいて生成した。
    • 45の攻撃者-CVEペアにおいて,実際のターゲットへの成功した侵入はpass@3で検出されなかった。

    Link: https://arxiv.org/abs/2607.26998

  • パイプラインプロセッサにおける分岐予測のための,新興CMOSメモリスタデバイスを用いたリザバーコンピューティングの調査 [cs.AR, cs.CE, cs.ET, cs.LG, physics.app-ph]目的:パイプラインプロセッサにおける分岐予測のためのリザバーコンピューティング実装フレームワーク
    • 近年のプロセッサ性能向上には,分岐予測の精度向上が不可欠である。
    • 既存の分岐予測手法は,複雑な分岐パターンへの適応性に課題がある。
    • メモリスタデバイスを利用したリザバーコンピューティングにより,適応性の高い分岐予測を実現する。
    • 提案するリザバーコンピューティングフレームワークは,分岐予測において高い予測精度を達成可能であることをシミュレーションで示した。
    • ただし,分岐動作の変化への適応性においては,最先端のTAGE予測器と比較して15倍の遅延が見られた。
    • リザバーコンピューティングフレームワークのさらなる改良により,適応性の向上が期待される。

    Link: https://arxiv.org/abs/2607.27140