arXiv雑要約

AI - 2026/08/04 公開

  • プレフィックス誘導型オンポリシー蒸留:ロールアウトからのゴールド軌道のマイニング [cs.LG]目的:長視野推論におけるオンポリシー蒸留の効率性と信頼性の向上
    • 複雑な推論タスクにおいて,大規模言語モデルの性能向上が求められている。
    • オンポリシー蒸留では,教師モデルと学生モデルの軌道間のずれが課題となる。
    • プレフィックスの互換性を利用し,無駄な計算を削減し効率を改善する。
    • 提案手法PG-OPDは,AMC,AIME,HMMTベンチマークで最大4.80ポイントの精度向上を達成した。
    • PG-OPDは,計算時間を最大2.46倍短縮することに成功した。
    • 早期プレフィックスの互換性に基づいた候補のプルーニングが,性能と効率の両方を向上させる。

    Link: https://arxiv.org/abs/2606.21994

  • SAGE:南アジアにおける消化器内視鏡検査のための専門家アノテーションデータセット - マルチモーダル学習と幻覚分析のために [cs.CV, cs.AI]目的:南アジア地域の消化器内視鏡検査画像に対するマルチモーダル学習と幻覚分析のためのデータセット
    • 消化器がんの罹患率は南アジアで増加しており,早期診断の重要性が高まっている。
    • 既存のAIモデルは欧州データセットで学習されているため,南アジア地域における性能評価が困難である。
    • 地理的偏りを考慮した,南アジア地域のAI診断支援ツールの開発を促進すること。
    • SAGEデータセットは,1,300枚の画像,キャプション,アノテーション,質問応答ペアを含み,多様なタスクに対応可能である。
    • 既存のマルチクラス分類器は,南アジアデータセットにおいて平均F1スコアが54ポイント低下するなど,地理的偏りの影響を受けることが示された。
    • 最新のLMMのベンチマークでは,解剖学的ランドマーク検出と異常検出のGREENスコアがそれぞれ0.308と0.410と大幅に低下した。

    Link: https://arxiv.org/abs/2606.22144

  • ガバナンス反転仮説:より多くのAI規制が組織統制を低下させる理由 [cs.CL, cs.CL, cs.CY, cs.AI, cs.HC]目的:AIガバナンスにおける逆説的現象の説明
    • AI技術の発展と普及に伴い,その適切な統制が不可欠となっている。
    • 既存のAIガバナンスフレームワークは,統制強化を前提としているが,その実効性に疑問が残る。
    • 規制の拡大が,かえってAIシステムの運用統制を弱めるメカニズムを解明する。
    • 本研究は,ガバナンス反転仮説(GIH)を提唱し,規制強化と技術的複雑化の下で,組織が形式的には統制されているにも関わらず,AIシステムへの実質的な統制が低下する可能性を示唆する。
    • ガバナンスの形式化自体が,AI環境における統制の低下に寄与する四つのメカニズム(権限の分散,象徴的ガバナンスの拡大,統制の外部化,権限の麻痺)を提示する。
    • 制度的脱結合理論を拡張し,ガバナンスの拡大が必ずしも運用の一貫性を高めるのではなく,むしろ弱めるという構造的条件「ガバナンス反転」を導入する。

    Link: https://arxiv.org/abs/2606.26117

  • 人間は離脱し,推論モデルは持続する:難易度登録と熟考配分の分離 [cs.AI, cs.CL]目的:大規模推論モデルと人間の熟考過程の差異
    • 推論モデルの性能向上には,人間の思考プロセスを理解することが不可欠である。
    • 大規模推論モデルは,人間の反応時間パターンを模倣するが,内的なメカニズムは異なる。
    • 本研究は,推論モデルにおける思考パターンと,人間における思考パターンの乖離を解明する。
    • 大規模推論モデルは,難易度の高い問題に多くのトークンを消費するのに対し,人間は容易な問題に時間をかける傾向がある。
    • この違いは,モデルが不確実な場合に推論を継続し,人間は解けないと判断すると諦めるという思考戦略の違いに起因する。
    • モデルのトレース長は難易度信号を捉えるものの,制御メカニズムを反映していない。

    Link: https://arxiv.org/abs/2606.26502

  • タスク条件付きAIモデルにおける,報告可能な安全性に関わる信号の無視に関するギャップ [cs.CL, cs.AI, cs.CV]目的:タスク条件付きAIモデルにおける安全性に関わる信号の無視
    • 医療分野など安全性確保が重要な分野において,AIの活用が進んでいる。
    • AIは指定された危険にのみ焦点を当て,予期せぬ危険を見落とす可能性がある。
    • AIが本来検出可能な安全性に関わる信号を無視する問題を解決する。
    • タスクに特化した指示により,AIは安全性に関わる信号の報告を最大0.92抑制することが確認された。
    • このギャップはモデルの規模に比例せず,推論モデルでも持続し,一部のモデルでは安全性報告の優先順位が確保された。
    • 独立した評価者が全ての検出漏れを補完可能であり,安全性確保のためには包括的な評価が必要である。

    Link: https://arxiv.org/abs/2606.26529

  • ATOD:アニールターン認識型オンポリシー蒸留によるマルチターンエージェントタスク [cs.AI]目的:マルチターンエージェントタスクにおける小規模言語モデルエージェントの高速な模倣と報酬駆動型の性能向上
    • 複雑な対話タスクをこなせるエージェント開発は,人間と自然なコミュニケーションを実現する上で不可欠である。
    • 既存手法では,初期学習の効率と最終的な性能向上を両立することが困難であった。
    • 教師あり学習と強化学習の利点を組み合わせ,両方の効率と性能を向上させることを目指す。
    • ATODは,初期段階で教師レベルの行動に近づくためにオンポリシー蒸留を重視し,徐々に強化学習を強化する。
    • ターンレベルでの不一致・不確実性に基づく重み付けにより,長期的軌跡において重要なターンに焦点を当てる。
    • ALFWorld,WebShop,Search-QAの実験で,ATODは既存手法を大きく上回り,教師モデルを超える性能を示した。

    Link: https://arxiv.org/abs/2606.27814

  • CLQT:LLMポートフォリオ管理エージェントの診断評価のための閉ループ,コスト認識,戦略一貫性のあるベンチマーク [cs.FL, cs.RO, cs.AI, cs.LG, q-fin.CP, q-fin.PM]目的:LLMポートフォリオ管理エージェントの診断評価
    • 金融市場におけるLLMの活用が広がる中で,客観的な評価基準の確立が重要である。
    • 従来の評価指標は市場の影響を受けやすく,エージェント固有の能力を正確に評価できない場合がある。
    • エージェントの成功と失敗の要因を特定し,能力を詳細に分析するためのフレームワークを提供する。
    • CLQTは,閉ループ環境でエージェントの意思決定プロセスを評価し,透明性と再現性を確保する。
    • 能力スコアカード(APM-CS)を用いて,エージェントのコヒーレンス,正確性,安定性,規律,信頼性を定量化する。
    • バックテストとライブ取引の結果から,単純な収益性ランキングだけではエージェントの真の能力を判断できないことが示された。

    Link: https://arxiv.org/abs/2606.29771

  • DRIFT:リズムゲート探索と成功バッファ学習による自己知識蒸留の難易度ルーティング [cs.LG, cs.AI]目的:大規模言語モデルにおける,外部の専門家による監督なしでの安定した自己改善
    • 複雑な推論タスクにおいて,大規模言語モデルの能力向上は不可欠である。
    • 既存手法では,問題レベルでの学習進捗の追跡や最適化戦略の適応が不十分である。
    • 学習が容易な問題に過剰最適化されること,および難しい問題からの弱い監督を解決する。
    • DRIFTは,難易度ルーティングとリズムゲーティングを組み合わせた自己進化型ポリシー最適化フレームワークである。
    • 5つのベンチマークと3つのモデルスケールで評価した結果,DRIFTはGRPOとSDPOを上回った。
    • 特にToolUseでは,DRIFTは79.2%の精度を達成し,最新技術を大幅に上回った。

    Link: https://arxiv.org/abs/2606.30345

  • 文脈的スレートGLMバンディットにおける適応性の制限 [cs.IR, cs.LG, stat.ML]目的:限定的な適応性下における文脈的スレートバンディット問題の解決
    • 推薦システム等の分野において,ユーザの文脈に応じたアイテムの選択は重要である。
    • 一般化線形モデル(GLM)を用いたバンディット問題では,パラメータ更新による計算コストが課題となる。
    • バッチ処理や稀なパラメータ更新によって計算コストを抑えつつ,高い性能を維持することを目指す。
    • 提案手法B-SlateGLinCBおよびRS-SlateGLinCBは,それぞれ$\mathcal{O}(Nd^{3/2}\sqrt{T})$と$\mathcal{O}(Nd\sqrt{T})$のリグレット上限を達成する。
    • これらの上限は,GLMバンディットアルゴリズムのリグレットをスケールする非線形パラメータ$\kappa$に依存しない点が特徴である。
    • シミュレーション結果から,提案手法は既存手法を上回り,最先端の完全適応型アルゴリズムにも匹敵する性能を示すことが確認された。

    Link: https://arxiv.org/abs/2606.31449

  • ECHO:選択的ターンメモリによるエージェント型強化学習における行動と学習の追跡 [cs.LG, cs.AI]目的:エージェント型強化学習における追跡可能な文脈再構築
    • 長期間にわたる言語エージェントのタスク遂行には,ツールとの反復的な相互作用が不可欠である。
    • 文脈圧縮により過去の重要な情報が失われ,成功への根拠が不明確になる場合がある。
    • 行動と結果の関連性を明確にし,より効果的な学習を可能にする文脈再構築手法を提案する。
    • ECHOは,環境ターンをソースインデックス付きのメモリレコードに圧縮し,有用なレコードを選択的に再構築する。
    • BrowseComp-Plusにおいて,ECHOは43.4%の精度を達成し,GRPOやSUPOを上回る性能を示した。
    • ECHOは,多目的QA,コード生成,情報探索などのタスクにおいても,ゼロショットでの汎化性能を向上させた。

    Link: https://arxiv.org/abs/2606.31650

  • ロボット操作のための自由形式な嗜好学習 [cs.RO, cs.AI, cs.LG]目的:ロボットのポリシー改善のための報酬設計
    • ロボットの自律的な動作において,報酬設計は重要な課題である。
    • 従来の報酬設計では,成功ラベルが少なく,二値の嗜好だけでは十分な情報が得られない。
    • 自然言語による嗜好軸を用いた報酬モデル学習による課題解決を目指す。
    • 自由形式な嗜好学習(FPL)は,従来のsparse rewardやbinary preferenceに比べ,38%の性能向上を達成した。
    • FPLは明示的なサブタスク分割なしに,密な進捗シグナルを学習する。
    • 学習データに存在しない行動の組み合わせが可能となり,テスト時に再学習なしで行動を制御できる。

    Link: https://arxiv.org/abs/2606.32027

  • コントラストによる音声デコーディングのための適応的摂動選択 [cs.SD, cs.AI]目的:音声デコーディングにおける最適な負の分岐の適応的選択
    • 大規模な音声言語モデルの発展に伴い,幻覚抑制が重要課題となっている。
    • 既存のコントラストデコーディングは,マスキング等の粗雑な摂動に頼っており,洗練された手法が求められている。
    • タスクと事例に応じた最適な摂動を動的に選択することで,幻覚を効果的に抑制することを目指す。
    • 単純な二値制制約によるプロンプトエンジニアリングの改善により,存在しない音響特徴の誤認を減少させた。
    • 時間,周波数,振幅領域における様々な摂動評価の結果,最適な変換はタスクに強く依存することが示された。
    • モデルの隠れ状態に基づいた軽量な摂動選択器の学習により,存在タスクにおいて追加で4.3%の精度向上を達成した。

    Link: https://arxiv.org/abs/2607.00247

  • 分布ロバストなリストワイズ選好最適化 [cs.CL, cs.AI]目的:言語モデルのアライメントのためのリストワイズ選好最適化
    • 言語モデルの性能向上には,人間の選好を反映したアライメントが不可欠である。
    • 既存手法では,アノテーターの不一致やノイズにより,ランキングラベルの信頼性が課題となっている。
    • ランキングラベルの不確実性を考慮し,ロバストな選好最適化を実現することを目的とする。
    • 提案手法は,候補リストに対するランキングラベルのロバスト性を直接的に向上させる。
    • オフライン評価では,クリーンなラベル下で性能を維持しつつ,ノイズに対するロバスト性を改善した。
    • オンライン評価では,報酬モデルによる候補拡張の信頼性を高め,評価指標を改善した。

    Link: https://arxiv.org/abs/2607.01715

  • LCPNet:潜在的整合近接アンフォールディングネットワークによる赤外線微小ターゲット検出 [cs.RO, cs.IR, cs.CV, cs.AI]目的:赤外線微小ターゲット検出における性能向上
    • 遠隔検知において,長距離の微小ターゲットを検出することは極めて重要である。
    • 深層学習は進歩したが,ターゲットと背景の物理的分解構造の利用が不十分である。
    • 潜在空間でのアンフォールディングにより,物理的制約を維持し,最適化プロセスとの連動を強化する。
    • LCPNetは,4つの公開ベンチマークにおいて,高い精度と低い誤検出率を達成した。
    • 潜在的整合近接(LCP)ソルバーにより,各潜在変数の安定した更新とタスク適応型正規化を実現した。
    • 共有最適化メモリ(SOM)の導入により,アンフォールディング段階全体での協調的なガイダンスを提供した。

    Link: https://arxiv.org/abs/2607.04603

  • Branch-JEPA:JEPAワールドモデルのための有限サポート予測分布 [cs.AI]目的:表現空間における将来の観測予測によるダイナミクスの学習
    • 将来予測は,ロボティクスや強化学習などの分野で重要な役割を担う。
    • 既存のJEPAワールドモデルは,複数の可能性のある未来を考慮できていない。
    • より多様で信頼性の高い未来予測分布を生成することを目指す。
    • Branch-JEPAは,潜在的な後続状態を有限集合で表現することで,多様な未来予測を可能にした。
    • Argoverse~2の評価において,エネルギー・スコアと軌跡距離が大幅に改善された。
    • OGBenchグラフ監査では,検証済みルートの存在率が大幅に向上した。

    Link: https://arxiv.org/abs/2607.05238

  • PCBWorld:エンジンに基づいたPCB設計自動化のベンチマーク環境 [cs.AI]目的:PCB設計自動化のためのベンチマーク環境
    • 電子機器の設計において,PCB設計は不可欠であり,その効率化が重要である。
    • 従来のルールベースのルーティング手法に比べ,学習ベースの手法は性能が劣るという課題がある。
    • KiCadを用いた環境で,学習エージェントによるPCBルーティングの性能向上を目指す。
    • PCBWorldにおいて,強化学習エージェントはグリッドベースの強化学習ポリシーやLLMベースラインを上回る性能を示した。
    • 合成データのみで学習した強化学習ポリシーは,リアルな基板に対してもゼロショットで高い性能を発揮し,ルールベースのルーティングに匹敵する結果となった。
    • PCBWorldは,オープンソースの環境であり,多様なデータセットと評価指標を提供することで,PCB設計自動化研究を促進する。

    Link: https://arxiv.org/abs/2607.05915

  • x-予測のみで十分:エンドポイント復号可能性による学習不要の高速生成 [cs.LG, cs.AI]目的:拡散モデルとフローマッチングモデルにおける高速サンプル生成手法
    • 高品質なサンプル生成が求められる画像生成分野において,計算コストが重要な課題となっている。
    • 拡散モデル等のODEサンプラーは,多くのニューラル関数評価(NFE)を必要とし,実用上のボトルネックとなっている。
    • エンドポイント復号可能性を利用し,追加学習やアーキテクチャ変更なしにNFEを削減することを目指す。
    • 提案手法であるTruncated Jump Sampling (TJS) により,SDXL,SD3.5M,Z-Image-Turboなどにおいて,NFEを20~70%削減できることを示した。
    • TJSは再学習,蒸留,または軌道再設計を必要とせず,既存のチェックポイントをそのまま利用できる。
    • エンドポイント予測が軌道を変形することなく機能する理由を分析し,推論の高速化を可能にした。

    Link: https://arxiv.org/abs/2607.06114

  • LongCrafter:エビデンスグラフ誘導型命令合成による多様な長文理解へ [cs.CL, cs.AI]目的:長文コンテキストの理解能力向上に向けた,多様性のある学習データ生成
    • 大規模言語モデルの性能向上が求められる中で,長文理解能力は重要な課題である。
    • 既存の長文理解用学習データ生成手法は,タスクの種類や難易度が限られ,根拠の信頼性も課題であった。
    • 本研究は,タスク分類とエビデンスグラフを用いて,多様かつ信頼性の高い長文理解学習データを生成し,モデルの性能を向上させる。
    • LongCrafterは,階層的なタスク分類とエビデンスに基づいたパイプラインを組み合わせた構造化されたデータ合成フレームワークである。
    • LongCrafterで学習したモデルは,LongBench,LongBench~v2,LooGLEなどのベンチマークテストで,既存のSFTベースラインや公式のポストトレーニングモデルを上回る性能を示した。
    • 特に,難易度の高いタスクにおいて顕著な改善が見られ,LongCrafterが生成したデータは多様性があり,難易度分布も良好であることが示された。

    Link: https://arxiv.org/abs/2607.06160

  • アクションキャッシュ:アクションのキャッシングと改良による,ビジョン・言語・行動モデルの学習不要な高速化 [cs.RO, cs.CV, cs.LG]目的:ビジョン・言語・行動モデルにおける推論遅延の削減
    • ロボットの汎用的な操作を実現するため,ビジョン・言語・行動モデルが注目されている。
    • 行動ヘッドにおける反復ノイズ除去処理が計算ボトルネックとなり,リアルタイムでの利用が困難である。
    • 過去の中間行動を再利用することで,推論速度を向上させ,リアルタイム処理を可能にすることを目指す。
    • アクションキャッシュは,過去の中間行動をコンパクトなマルチモーダルキーで保存し,類似したコンテキストから行動を検索する。
    • シミュレーションおよび実環境での実験により,高いタスク成功率を維持しつつ,推論速度を大幅に向上させることが示された。
    • 代表的なフローベースVLAモデル ($\pi_{0.5}$とGR00T-N1.6)において,それぞれ最大で10.44倍と40.17倍の行動ヘッド推論高速化を達成した。

    Link: https://arxiv.org/abs/2607.06370

  • 病理における証拠に基づくマルチエージェント臨床情報抽出:信頼せよ,ただし検証せよ [cs.SC, math.AC, cs.AI]目的:病理レポートからの臨床特徴抽出
    • 病理診断は,患者ケアにおいて重要な役割を担うため,その迅速かつ正確な情報抽出が求められる。
    • 臨床情報はコード化された情報と記述された情報に分散しており,文脈に依存するため,抽出が困難である。
    • 証拠とともに臨床情報を抽出するワークフローを構築し,その有用性を評価すること。
    • nMASは216件の症例中213件(98.61%)を正しく分類し,関連する証拠はすべて原文に存在した。
    • 誤りは全て,否定処理や診断帰属が必要なピロリ菌関連の文脈依存性の高い項目で発生した。
    • nMASの貢献は,予測性能向上ではなく,臨床医レビュー可能なワークフローにおける設定可能な項目仕様,複雑性に基づくルーティング,検証可能性にある。

    Link: https://arxiv.org/abs/2607.06435

  • トップKが判断を逃すとき:マルチ教師ありオンポリシー蒸留におけるツールコールドリフト [cs.CL, cs.LG]目的:マルチ教師ありオンポリシー蒸留におけるツールコールドリフトのメカニズム解明
    • 大規模言語モデルの性能向上が求められており,知識蒸留はその有効な手法の一つである。
    • トップKを用いた知識蒸留では,重要な決定支持情報が失われる可能性があり,モデルの性能低下を招く恐れがある。
    • トップKにおける決定支持情報の欠落が,モデルのツールコールに与える影響を明らかにすること。
    • トップKの教師logitでは,決定支持の確率質量が失われやすいことが示された。特にツール使用タスクにおいて,過剰なツールコールが発生する原因となっている。
    • 教師logitにおけるツールコールトークンの欠落を補完する介入により,過剰なツールコールを大幅に削減できることが確認された。ただし,ツールコール想起率とのトレードオフも存在する。
    • このパターンは,QwenとLlamaの両モデルで確認され,決定に不可欠なサポートの欠落がツールコールドリフトの主要因であることが示唆された。

    Link: https://arxiv.org/abs/2607.07050

  • MuScriptor:複数楽器音楽の自動採譜のためのオープンモデル [cs.SD, cs.LG]目的:複数楽器音楽の自動採譜モデルの開発
    • 音楽情報処理分野において,音楽の自動解析は重要な研究課題である。
    • 既存手法は単一楽器に限定されるか,複雑な楽曲で十分な性能を発揮できない。
    • 実音楽に対する汎化性能を高め,実用的な採譜結果を得ることを目指す。
    • 合成データによる事前学習と,実音楽データによるファインチューニング,強化学習を組み合わせることで有効性を検証した。
    • 楽器の存在を条件付けすることで,採譜結果のカスタマイズを実現した。
    • 多様なジャンルの実音楽に対応可能なオープンウェイトのモデルMuScriptorを公開した。

    Link: https://arxiv.org/abs/2607.08168

  • 次元削減とネットワーク科学:UMAPのkNNグラフによるデータ理解 [cs.RO, cs.LG, cs.AI, cs.DS, cs.HC]目的:UMAP内部で構築されるkNNグラフの活用
    • 高次元データの可視化・理解は,機械学習やデータ分析において不可欠である。
    • UMAPの埋め込み表現に焦点が当たりがちで,内部グラフの潜在的な価値が十分に活用されていない。
    • UMAPのkNNグラフを用いた分析により,データ構造の理解を深めることを目指す。
    • PageRankにより代表的なデータ点を特定し,データの概要把握に貢献する。
    • k-core分解により,高密度な領域と疎な領域を明確化し,データ構造を可視化する。
    • クラスタリング係数により,類似度の高いデータ点の近傍を検出し,局所的な構造を明らかにする。

    Link: https://arxiv.org/abs/2607.08746

  • RSRA:効率的なLoRAランク割り当てのための表現感度プローブ(学習不要) [cs.CV, cs.AI]目的:LoRAランクの効率的な割り当て手法
    • 大規模言語モデルの活用が広がる中で,計算資源の制約が課題となっている。
    • 従来のLoRAは全モジュールに均一なランクを割り当て,最適化や勾配情報に依存する手法は課題が残る。
    • タスクに応じた表現変化を捉え,最適なランク割り当てを実現することで,性能向上と効率化を図る。
    • RSRAは,学習データを用いずに表現感度をプローブすることで,適応容量が必要な箇所を特定する。
    • Qwen3-4BおよびMistral-7Bを用いた実験で,既存手法を上回る平均性能と,ランク割り当て時間の高速化を実現した。
    • DoRA,LoRA-FA,PiSSA等のPEFT手法と組み合わせることで,18個の組み合わせのうち15個で性能が向上した。

    Link: https://arxiv.org/abs/2607.09757

  • 思考連鎖の長さを制限すると,監視可能性が低下する [cs.AI, cs.CL, cs.LG]目的:思考連鎖の長さに対するペナルティが監視可能性に与える影響の評価
    • 大規模言語モデルの推論能力向上は,その過程の説明可能性と制御可能性が重要となる
    • 思考連鎖の長さを制限することで推論コストを削減する試みがあるが,その副作用が不明である
    • 思考連鎖の長さが監視可能性に与える影響を定量的に評価し,最適なバランス点を探る
    • 思考連鎖の長さを制限すると,誤解を招くヒントの言及頻度は低下するものの,モデルの回答への影響は残る
    • 圧縮による推論トークンの削減は,選択式問題の精度をほとんど損なわない一方で,ヒントの影響は変化しない
    • 最も短い思考連鎖では,Qwen3 14BとQwen3 4Bの信頼性がそれぞれベースラインの63.1%と69.4%に低下し,ヒント検出率も低下する

    Link: https://arxiv.org/abs/2607.09786

  • AI駆動科学発見のための自律的科学知識生成フレームワーク [cs.DL, cond-mat.mtrl-sci, cs.AI]目的:AI駆動科学発見のための科学知識ベースの構築
    • AIによる科学発見の加速には,構造化された科学知識が不可欠である。
    • 既存のデータベースでは,予測モデリングに必要な知識が十分に活用できていない。
    • 科学文献から構造化された知識を自律的に抽出し,AI活用を促進すること。
    • 本フレームワークは,科学文献をAIが利用可能な知識ベースに変換する。
    • 文献の取得,情報抽出,データベース構築を統合し,一貫性のある知識を生成する。
    • 電気光学材料の適用例において,1,000件の文献から7件の構造化された知識レコードを生成した。

    Link: https://arxiv.org/abs/2607.09806

  • 方向から大きさへ:マルチモーダル命令調整がTransformerの隠れ状態におけるID指定プロンプトの幾何学的符号化を再構成する方法 [cs.LG, cs.CL]目的:Transformerの隠れ状態におけるID指定プロンプトの幾何学的符号化の再構成
    • 大規模言語モデルの性能向上には,プロンプト設計が不可欠であり,その内部表現の理解が重要である。
    • ID指定プロンプトがモデル内部でどのように表現されるか,そのメカニズムは未だ解明されていない。
    • マルチモーダル命令調整が,ID指定プロンプトの幾何学的表現にどのような影響を与えるかを明らかにすること。
    • 命令調整前は方向でIDが符号化されていたが,マルチモーダル命令調整によって大きさに変化した。
    • この方向から大きさへの変化は,強化学習による蒸留やSFTでは確認されなかった。
    • エッジごとのオリービエ・リッチ曲率分布間の1-Wasserstein距離が,隠れ状態の幾何学的解析に有効であることが示された。

    Link: https://arxiv.org/abs/2607.09842

  • LLM RecSysのための数値および埋め込み特徴量のトークン化 [cs.IR, cs.LG]目的:LLMレコメンデーションシステムにおける数値特徴量と埋め込み特徴量の活用
    • レコメンデーションシステムの精度向上には,多様な特徴量の効果的な利用が不可欠である。
    • 既存のLLMレコメンデーションシステムはテキストデータに偏っており,数値・埋め込み特徴量の活用が限定的である。
    • 数値・埋め込み特徴量をLLMの入力形式に変換し,レコメンデーション性能の向上を目指す。
    • 提案手法であるソフトトークン融合フレームワークは,数値・埋め込み特徴量をLLMの埋め込み空間にマッピングする。
    • Amazonのレコメンデーションベンチマークにおいて,ソフトトークン融合が既存のLLMベースラインを上回る性能を示した。
    • インタラクションベースの融合モジュールが,単純な連結よりも効果的であることが示された。

    Link: https://arxiv.org/abs/2607.10016

  • スキャフォールド分割を超えて:構造的フロンティア評価がADMETモデルの隠れた失敗を明らかにする [cs.LG, q-bio.QM]目的:ADMETモデルにおける化学構造の新規性に対する評価方法の改善
    • 医薬品開発において,ADMET(吸収,分布,代謝,排泄,毒性)予測モデルの精度は重要である。
    • 既存のスキャフォールド分割による評価では,化学構造の新規性の捉え方が限定的である。
    • より厳密な構造的フロンティア評価を用いて,ADMETモデルの汎化性能の限界を明らかにすること。
    • 構造的フロンティア分割を用いた評価により,既存のスキャフォールド分割よりも高い誤り率が確認された。
    • 特に,血液脳関門透過性(BBB)の予測において,フロンティア評価と従来評価で順位が逆転する現象が観察された。
    • 様々なペナルティ項を追加してもフロンティア評価の課題は解決せず,評価方法の構築とラベルの起源が重要であることが示唆された。

    Link: https://arxiv.org/abs/2607.10729

  • DAG-FM:異質な因果メカニズム下における因果探索のための基盤モデル [cs.LG, stat.ML]目的:観測データからの因果構造探索
    • 現実世界の複雑な現象を理解・予測には,変数間の因果関係の解明が不可欠である。
    • 因果メカニズムの多様性や探索空間の広大さにより,観測データからの因果探索は困難を極める。
    • 多様な因果メカニズムに対応し,高精度かつ効率的な因果探索を実現すること。
    • DAG-FMは,Transformerベースの2つのモジュール(葉ノード予測器と親ノード予測器)を用いて因果探索を段階的に行うことで,従来手法を凌駕する性能を示した。
    • MoLE(Mixture-of-Leaf-Experts)の導入により,未知の因果メカニズムへの適応能力を高め,多様なデータセットに対応可能となった。
    • 合成データおよび実データセットにおいて,DAG-FMは最先端の性能を達成し,古典的手法や他の基盤モデルを上回った。

    Link: https://arxiv.org/abs/2607.11510

  • プレイメージ探索からソースに基づく特徴反転へ [cs.LG]目的:ニューラルネットワークの内部特徴抽出の解明
    • 深層学習モデルの解釈性は,その信頼性と性能向上に不可欠である。
    • 既存の特徴反転法は,複数の入力がターゲットに合致するため,特徴を生成したサンプルを特定できない。
    • ターゲット生成時のネットワーク幾何学構造を用いて,特徴反転の精度と解釈性を向上させる。
    • ソースに基づく特徴反転は,計算グラフの各境界における逆依存関係を正しく捉える。
    • 局所的な信号修復に,平均シードVJPから上流状態へのWienerマップを用いることで,効率的な反転が可能になる。
    • 提案手法は,多様なCNNおよびTransformerアーキテクチャで適用可能であり,特定のクエリに依存しない。

    Link: https://arxiv.org/abs/2607.12526

  • Jetson-PI:先見性に基づく非同期推論によるオンボードリアルタイムロボット制御へ [cs.RO, cs.AI]目的:低消費電力オンボードデバイスにおけるVLAモデルの効率的な展開
    • ロボットは多様な環境で自律的に行動する必要があり,そのためには高性能な知能が不可欠である。
    • VLAモデルは計算負荷が高く,オンボードデバイスでのリアルタイム処理が困難である。
    • 非同期推論による遅延の隠蔽と,知覚と実行のずれ,反応時間の問題を解決することを目指す。
    • Jetson-PIは,NVIDIA Jetson Orinにおいて,単純なPyTorchやvla.cppと比較して,それぞれ8.66倍,5.41倍の制御頻度向上を達成した。
    • LIBEROベンチマークにおいて,平均成功率でVLASHを14.8%上回る性能を示した。
    • 将来の環境表現を予測する軽量な未来補正モジュールと,信頼度に基づくスケジューリング最適化により効率的な処理を実現した。

    Link: https://arxiv.org/abs/2607.12659

  • 行列分解におけるMuonの再評価 [cs.LG, cs.AI]目的:行列分解問題におけるMuonの性能評価
    • 深層学習の規模拡大に伴い,最適化手法の重要性が増している。効率的な学習が不可欠であるため。
    • 既存の最適化手法は,大規模モデルや複雑なデータセットにおいて性能が飽和することがある。
    • Muonの利点を明確化し,どのような状況で有効かを示すことが課題である。
    • 行列分解問題では,MuonはAdamWよりも一貫して優れた性能を示さなかった。
    • Muonの利点は,ハイパーパラメータの選択に大きく依存することが示された。
    • スペクトルを考慮した直交化が有効な状況について,より詳細な理解が得られた。

    Link: https://arxiv.org/abs/2607.13246

  • LLMの挙動と訓練データの関連性の追跡:経験的次トークン分布に基づく [cs.DB, cs.AI]目的:LLMの出力分布と訓練データとの関係性
    • 大規模言語モデル(LLM)の性能向上は目覚ましいが,その内部メカニズムは未だ解明されていない。
    • LLMの予測根拠がデータにどのように依存しているか不明確であり,制御が困難である。
    • 訓練データとの関連性を分析し,LLMの挙動をデータ起点で解釈する道筋を示す。
    • LLMの次トークン分布は,多くの入力において訓練データの経験的次トークン分布とほぼ一致する。
    • モデルの規模や学習量が増加すると,分布の一致度は一般的に向上する傾向が見られる。
    • しかし,LLMと経験的分布が大きく異なる入力シーケンスも存在し,その原因を探求した。

    Link: https://arxiv.org/abs/2607.14306

  • StructureClaw:追跡可能なLLMエージェントと構造工学ワークフローの実行可能ベンチマーク [cs.SE, cs.AI, cs.MA]目的:構造工学におけるLLMエージェントのワークフロー実行可能性評価
    • 構造工学は社会インフラの中核であり,安全性と信頼性が不可欠である。
    • 既存のLLM評価は出力の流暢性重視で,実行可能性や整合性を検証していない。
    • LLMエージェントによる構造工学ワークフローの完全性と実行可能性を評価する。
    • StructureClawは,LLMエージェントが工学スキルとツールを用いて成果物を生成・共有する環境を提供する。
    • StructureClaw-Benchは,標準ワークフロー,ロバスト性,マルチモーダル再構築を含む150のシナリオから構成される実行可能なベンチマークである。
    • 自動StructureClawは,E2E成功率82.9%を達成し,既存手法(22.0%)を大幅に上回った。

    Link: https://arxiv.org/abs/2607.14896

  • トポス因果モデルの立方体形式化:介入,強制,文脈性障害 [cs.LO, cs.AI, math.CT]目的:トポス因果モデルにおける介入,強制,文脈性障害に関する形式的な記述
    • 因果推論は科学的推論の根幹であり,様々な分野で重要な役割を果たす。
    • 従来の因果推論の枠組みでは,複雑な状況下での介入効果の正確な評価が困難である。
    • トポス理論を用いて因果モデルを形式化することで,介入効果の厳密な理論的基盤を提供する。
    • 本研究では,立方体Agdaを用いてトポス因果モデルの核心部分を機械的に検証可能な形で記述した。
    • 一貫性のある局所的な因果データが存在するにもかかわらず,全体的なモデルが存在しない文脈性障害を明らかにした。
    • 介入のモデル化における潜在的な問題点を指摘し,介入操作と観察操作の違いを明確にした。

    Link: https://arxiv.org/abs/2607.15629

  • 反例補完されたスケッチに対するエージェント的合成 [cs.RO, cs.SE, cs.AI]目的:反例補完されたスケッチに対するエージェント的合成手法
    • ソフトウェア開発における自動化は,生産性向上や品質改善に不可欠である。
    • 既存のコーディングエージェントは,特定の例を修正する際に,全体的な整合性を損なう可能性がある。
    • 人間とエージェントの協調的なスケッチ修正を通じて,ロバストなポリシー学習を実現する。
    • 本手法では,人間が部分的なスケッチを作成し,エージェントが修正案を生成する反復的なプロセスを採用している。
    • CatSynthを用いた実験により,修正されたプロトコルは,保留中のケースに対する適合率を向上させた。
    • レビューによるスケッチ検証は,決定的な再生だけでは捉えられないドリフトを検出し,より多くの保留ケースをパスした。

    Link: https://arxiv.org/abs/2607.15854

  • Muonはエージェント強化学習に役立つか? [cs.LG, cs.AI]目的:エージェント強化学習におけるMuonの有効性評価
    • 強化学習は,自律的な意思決定を行うAIの開発に不可欠であり,その最適化手法は重要である。
    • 大規模な事前学習ではMuonがAdamWと競合するが,強化学習におけるその適用範囲は明確ではない。
    • Muonが強化学習においてAdamWよりも有効な条件を特定し,その最適化レシピを確立する。
    • Muonは,AdamWと比較して,より積極的なステップサイズで安定した学習を可能にし,特に最適化の余地が残されている場合に効果的であることが示された。
    • Muonの有効性は,AdamWの隠れ層行列更新RMSに比例しており,RMSを一致させることでその利点は消失する。
    • この結果は,Muonのスケール規約がその効果に影響を与えており,普遍的な最適化手法としての優位性を示すものではないことを示唆している。

    Link: https://arxiv.org/abs/2607.16169

  • 予測された皮質はドメイン汎用的な事前知識ではない:ビデオ記憶想起のための脳エンコーディング特徴の適合コントロールによる監査 [cs.CV, cs.AI, cs.LG]目的:短編ビデオの記憶想起予測における脳エンコーディングモデルの予測応答の有用性の評価
    • 脳科学と機械学習の融合は,脳機能の理解とAIモデルの高度化に貢献する重要な分野である。
    • 脳エンコーディングモデルの予測性能は向上しているものの,その汎用性や人間行動との関連性は未解明な点が多い。
    • データセットに依存した予測性能の差を明らかにし,脳由来特徴量の有用性を検証すること。
    • Memento10kデータセットでは,脳投影を用いないV-JEPA2バックボーンの方が優れた予測性能を示した。
    • VideoMemデータセットでは,脳投影を用いた特徴量がV-JEPA2バックボーンを上回る予測性能を示した。
    • データセット間の相互作用が有意であり,脳由来の特徴量は特定のデータセットにおいてのみ有用であることが示された。

    Link: https://arxiv.org/abs/2607.16292

  • TopoTuner:大規模言語モデルのトポロジーに基づくファインチューニング [cs.AI]目的:大規模言語モデルの選択的パラメータ更新
    • 事前学習済みLLMの適応は重要だが,全パラメータ更新はコストがかかる。
    • LoRAは学習パラメータ数を減らすが,学習対象の選択が不明確。
    • トポロジー変化に基づき,効率的なファインチューニングを実現する。
    • TopoTunerは,全パラメータ更新と同等の性能を,わずか1-2%のパラメータで達成する。
    • LoRAと比較して,9つの設定中7つで性能が向上し,学習時間を平均20.4%削減する。
    • 学習済み凍結プロファイルを共有し,複数タスクへの適用を可能にする。

    Link: https://arxiv.org/abs/2607.16637

  • 次元調整された説明不能質量:カーネル二標本検定と一致する解釈可能なGMMドリフト統計量 [cs.LG]目的:ガウス混合モデルにおけるドリフト検出の解釈可能性と高次元における性能低下の改善
    • データストリームの変化を検知することは,機械学習システムの信頼性と適応性を確保する上で不可欠である。
    • 既存のドリフト検出器は,解釈可能性と高次元データへの対応性の両立が困難であるという課題がある。
    • この研究は,高次元データにおいても解釈可能で効果的なドリフト検出器を開発し,性能を向上させることを目指す。
    • 説明不能質量という指標を導入し,ガウス混合モデルの各成分を「レジーム」とすることで,ドリフトを説明可能な形で検出する。
    • 次元数の増加に伴う指標の劣化を,次元調整されたカイ二乗分位点を使用することで解消し,AUCを大幅に向上させた。
    • 提案手法は,モデルフリーなカーネル二標本検定(MMD)と同等の性能を示し,データがどのレジームから離れたかを報告する。

    Link: https://arxiv.org/abs/2607.16811

  • WHALE:Wukong-HSTUアーキテクチャを用いた推薦のためのスケーラブルな統一モデル [cs.IR, cs.AI, cs.LG]目的:推薦システムにおけるスケーラブルな統一モデルの構築
    • 推薦システムの重要性が増しており,より大規模なデータに対応できるモデルが求められている。
    • 従来の推薦モデルでは,非シーケンス特徴とシーケンス特徴を別々に扱うことが一般的であり,統合が課題となっていた。
    • WukongとHSTUの強みを組み合わせることで,非シーケンス特徴とシーケンス特徴を効率的に統合し,推薦精度を向上させる。
    • WHALEは,WukongとHSTUを組み合わせた統一的な推薦アーキテクチャであり,オフライン実験で一貫した性能向上を示した。
    • Wukong由来の相互作用表現がHSTU由来の行動表現をクエリすることで,高次の特徴クロスと詳細なユーザー履歴の繰り返し取得を可能にしている。
    • WHALEは,大規模な産業用推薦データにおいて,わずかなサービングスループットのトレードオフでオンラインでも肯定的な成果を上げ,実運用に導入されている。

    Link: https://arxiv.org/abs/2607.17017

  • ThAME:LLM Mixture of Expertsのための3次元メモリ内蔵異種アクセラレータ [cs.AR, cs.AI, cs.DC]目的:大規模言語モデルのMoE推論における性能向上
    • LLMの規模拡大に伴い,計算資源の効率的な利用が不可欠となっている。
    • 従来のハードウェアでは,MoEのメモリ帯域幅,分散的なアクセス,レイテンシが課題である。
    • 3次元異種アクセラレータにより,これらのボトルネックを解消し,効率的な推論を実現すること。
    • ThAMEは,FeFETとDRAMを組み合わせた3次元チップレットアーキテクチャを採用している。
    • 計算マッピング戦略とNoC通信バックボーンの最適化により,従来のSOTAと比較して最大15.7倍の高速化を達成した。
    • エネルギー効率も最大9.8倍向上しており,実用的なMoE推論システムへの応用が期待できる。

    Link: https://arxiv.org/abs/2607.17074

  • OTAP:エージェント軌跡の計画と実行を評価するための構造を考慮した最適輸送 [cs.AI, cs.CL, cs.LG]目的:エージェント軌跡における計画と実行の評価のための構造を考慮した最適輸送手法
    • 大規模言語モデルエージェントの発展に伴い,その性能評価の重要性が増している。
    • 既存の評価指標は二値評価や厳密な一致に依存し,計画の有効性や原因分析が困難である。
    • エージェントの実行グラフと有効な解グラフ間の距離を測ることで,より詳細な評価を可能にする。
    • OTAPは,依存関係を保持した並べ替えに対して不変であり,冗長なステップに対する感度も限定的な擬似距離である。
    • OTAPは,欠落または幻覚ステップを許容し,計画の粒度変化に対応する。
    • 制御された摂動と3つの公開ベンチマークにおいて,OTAPは意味のみの指標では偶然レベルを下回る場合に有効な軌跡と無効な軌跡を分離した。

    Link: https://arxiv.org/abs/2607.17082

  • DynImmune-BERT:ニューラル常微分方程式駆動連続Transformerによる動的免疫レパートリーモデリング [cs.IR, cs.CL, cs.DC, cs.LG]目的:患者レベルの免疫状態予測
    • 免疫応答を理解し,疾患の診断や治療法の開発に不可欠な研究分野である。
    • 従来のレパートリーモデルでは,時間経過に伴う変化やクローン存在パターンが十分に捉えられていない。
    • 時間変化を考慮したモデルを構築し,免疫レパートリーの動的構造をより正確に解析すること。
    • DynImmune-BERTは,時間経過に伴うクローン動態を捉え,免疫状態予測の精度向上に貢献する。
    • イベントを考慮した時間モデリングは,既存の静的エンコーダーを補完し,より詳細な解析を可能にする。
    • 小規模な外部コホートやプロトコル差への注意が必要だが,レパートリー構造を活用する有効性を示唆する。

    Link: https://arxiv.org/abs/2607.17244

  • 検索拡張型解釈可能学習:ヘルスケアにおけるタスク固有のゼロショットモデルへ [cs.NI, cs.LG, cs.AI]目的:タスク固有の解釈可能なモデルのゼロショット生成
    • ヘルスケア分野では,新しい臨床目標が頻繁に発生し,予測モデルの適応性と透明性が重要である。
    • 既存手法では,データ不足やタスクの多様性により,高い予測精度と解釈可能性を両立することが困難である。
    • 自然言語によるタスク記述と過去の学習済みモデルを活用し,タスク固有の予測性能を向上させることを目指す。
    • RAILは,関連タスクを検索し,係数空間を通じて構造を転移することで,ゼロショットおよび少量データでの臨床処置予測を可能にする。
    • RAILは,予測,係数,検索に関する不確実性を定量化し,信頼性に基づいた展開を支援する。
    • RAILは,ゼロショット設定で73.4%の精度を達成し,少量データ(2~4例)設定でも73.2%の精度を維持した。

    Link: https://arxiv.org/abs/2607.17508

  • 機械にとって地図は依然として重要か:基盤モデルにおける地図の役割の再検討 [cs.AI, cs.CV]目的:基盤モデルにおける空間理解のための地図の有効性
    • 地理情報は社会の様々な問題を解決するために不可欠であり,その理解は重要である。
    • 基盤モデルが構造化された地理データを直接処理できるようになった今,地図の有用性が低下している可能性が懸念される。
    • 基盤モデルの空間理解において,地図が依然として有効な外部表現であるかを検証する。
    • 実験により,地図は空間推論を大幅に改善することが示され,特に象徴的なデータと組み合わせて使用する場合に効果が高かった。
    • 地図の種類,色相,空間構造などの要素が,モデルの性能に影響を与えることが明らかになった。
    • データと地図を組み合わせることで,最も優れた性能が得られ,地図が基盤モデルの空間推論にとって依然として価値のあるツールであることが示された。

    Link: https://arxiv.org/abs/2607.17999

  • 基準注入による強化学習の性能向上:自己蒸留による手法 [cs.LG, cs.AI]目的:ルーブリックに基づく強化学習の性能向上
    • 大規模言語モデルの性能向上において,オープンエンドなタスクへの応用が期待される。
    • ルーブリックに基づく強化学習では,ロールアウトで達成されない基準への最適化シグナルが不足する。
    • 未探索基準と抑制基準の両方に対処し,学習と推論のずれをなくすことを目指す。
    • 提案手法CriPOは,基準注入による自己教師あり学習と,反事実的自己教師あり学習を組み合わせる。
    • CriPOは,ルーブリックに基づく強化学習と比較して,最適化ステップ数を約2倍削減しつつ,より高い性能を達成する。
    • 医学および科学のベンチマークにおいて,CriPOは一貫してルーブリックに基づく強化学習を上回る結果を示す。

    Link: https://arxiv.org/abs/2607.18082

  • サポート維持型アラインメントとバウンドフィルタリングの限界について [cs.LG]目的:大規模言語モデルにおける有害な行動の確率をゼロに抑えるための,アラインメント方式と安全フィルタリングの限界
    • 大規模言語モデルの安全性が重要視される中,有害な出力の抑制は喫緊の課題である。
    • 従来のAlignment手法では有害な行動が残存する可能性が指摘されており,完全な除去が困難である。
    • 内部表現を大きく変えずに安全性を確保する方法の限界を理論的・実験的に検証する。
    • サポート維持型アラインメントとバウンドフィルタリングの組み合わせでは,有害な出力の確率を完全にゼロにすることは困難である可能性が示唆された。
    • 実験的に,様々なモデルとフィルタリング手法において,フィルタリング計算量を増やしても有害な出力率が常にゼロ以上で推移するプラトー現象が確認された。
    • これは,基盤モデルの分布が持つ有害な出力を,現在の制約下では完全に除去できないことを示唆している。

    Link: https://arxiv.org/abs/2607.18295

  • 物理自己教師あり学習:ラベルなしIMUセンシング [cs.LG, cs.AI]目的:ラベルを用いないIMUセンシングのための物理自己教師あり学習フレームワーク
    • IMUセンシングは,ウェアラブルデバイス等で広く利用され,その重要性が増している。
    • 従来の深層学習は,ラベル付きデータの必要性や異種デバイスへの対応が課題であった。
    • 物理構造を組み込むことで,ラベル依存性を低減し,汎化性能を高めることを目指す。
    • 提案手法は,物理法則に基づいたデコーダを用いることで,ラベルなしでのIMUセンシングを実現した。
    • 公開データセットおよび実環境での評価により,トラッキングおよびモーションキャプチャにおいて最先端手法を上回る性能を示した。
    • 特に,困難な一般化シナリオにおいて,最大5倍の誤差低減を達成した。

    Link: https://arxiv.org/abs/2607.18361