arXiv雑要約

AI - 2026/08/04 公開

  • テスト時にグラフ誘導マルチモーダル進化を習得する:PokeGym [cs.CV, cs.AI]目的:テスト時学習における視覚,推論,行動の相乗効果
    • AIは定型ゲームに優れるが,視覚情報に基づく3Dゲームでは苦戦する。
    • 既存手法は単一モダリティの最適化に偏り,環境適応能力を評価しない。
    • PokeGymを用いて,視覚情報のみから状態を把握し,逐次エピソードで適応する能力を向上させる。
    • 提案手法G-EvoMACは,PokeGymにおいて60.18%の平均成功率を達成した。
    • G-EvoMACは,最良のベースラインを11%以上上回り,マルチモーダル共同進化の有効性を示した。
    • 本研究は,長期的な視覚駆動型3Dゲームにおけるテスト時学習の新たな方向性を示す。

    Link: https://arxiv.org/abs/2604.08340

  • K-STEMIT:知識に基づいた時空間効率的な多分岐グラフニューラルネットワークによるレーダーデータからの地表層厚の推定 [cs.LG, cs.CV]目的:地表層厚の推定
    • 氷床の堆積,変形,層形成に関する時空間情報は重要であり,氷床変化の予測に不可欠である。
    • レーダー画像はスペックルノイズや取得アーチファクトに敏感であり,データ駆動型手法では物理知識の活用が不十分である。
    • 物理モデルからの情報を統合し,より正確で信頼性の高い地表層厚の推定を実現することを目指す。
    • K-STEMITは,既存の最先端手法と比較して,一貫して高い精度を維持しながら,効率性も最適化されている。
    • 適応的特徴量融合と物理的事前知識の組み込みにより,従来の多分岐モデルと比較して二乗平均平方根誤差を21.01%削減した。
    • K-STEMITは,年間相対平均絶対誤差を低減し,広範囲な地域における降雪量の時空間的評価を可能にする。

    Link: https://arxiv.org/abs/2604.09922

  • 大規模言語モデルにおける幻覚検出のためのアテンションシンク [cs.CL, cs.LG]目的:大規模言語モデルの幻覚検出手法
    • 言語モデルの性能向上に伴い,生成されるテキストの信頼性確保が重要視されている。
    • 大規模言語モデルは事実に基づかない情報を生成することがあり,その検出が課題となっている。
    • アテンションシンクに着目し,幻覚のメカニズム解明と高精度な検出を目指す。
    • 幻覚は,入力に根差した分散的なアテンションから,事前知識に偏った圧縮された計算への移行と関連していることが示された。
    • SinkProbeという幻覚検出手法を提案し,アテンションマップのみから幻覚を高精度に検出できることを示した。
    • 既存手法が暗黙的にアテンションシンクに依存していることを数学的に証明した。

    Link: https://arxiv.org/abs/2604.10697

  • 量子回路を用いた敵対的攻撃に対するニューラルネットワークの保護:QShield [eess.SY, cs.SY, cs.CR, cs.AI, cs.CV, cs.LG, quant-ph]目的:敵対的攻撃に対するニューラルネットワークの堅牢性向上
    • 深層学習は広く利用されるが,セキュリティや安全性が重要となる分野では信頼性が課題となる。
    • 深層学習モデルは敵対的摂動に対して脆弱であり,その信頼性を損なうことが問題である。
    • 量子回路と古典的ニューラルネットワークを組み合わせ,敵対的攻撃への耐性を高めることを目指す。
    • 古典的モデルは敵対的攻撃に対して脆弱であるが,提案するハイブリッドモデルは高い予測精度を維持しつつ,攻撃成功率を大幅に削減する。
    • 提案アーキテクチャは,敵対的サンプル生成に必要な計算コストを増加させ,防御の層を追加する効果が確認された。
    • 予測精度と敵対的攻撃への堅牢性のバランスが取れた,安全・信頼性の高い機械学習への応用が期待される。

    Link: https://arxiv.org/abs/2604.10933

  • 感情強化生成拡張による視覚に基づく動的感情知覚 [cs.RO, cs.CV, cs.AI]目的:視覚に基づく動的感情知覚のためのデータ適応的動的表情生成
    • 感情知覚は,人間と機械の自然な対話を可能にする上で重要な役割を担う。
    • 野生環境における動的表情認識は,データ不足とロングテール分布により困難である。
    • 希少感情の時系列ダイナミクス学習を阻害するデータ問題を解決することを目指す。
    • ARGenは,表情生成と感情知覚の両方において,高い合成忠実度と認識性能を向上させる。
    • Affective Semantic Injection(ASI)とAdaptive Reinforcement Diffusion(ARD)の二段階構成により,解釈可能で汎用性の高い生成拡張パラダイムを確立する。
    • ASIは顔のAction Unitsを用いて感情知識を整合させ,ARDは強化学習により自然な表情と顔の整合性を最適化する。

    Link: https://arxiv.org/abs/2604.12255

  • 学習率が破滅的な過学習をどのように制御するか [cs.LG, cs.CL]目的:大規模言語モデルの過学習メカニズムの解明
    • 大規模言語モデルの性能向上には,事前学習後の微調整が不可欠である。
    • 微調整は,モデルの基本的な能力を損なう「破滅的な過学習」を引き起こす可能性がある。
    • 学習率が過学習に及ぼす影響を明らかにすることで,微調整の最適化を目指す。
    • 学習率の大きさは,微調整後のモデルの特性に大きく影響することが示された。
    • 学習率の減衰は,事前学習済みモデルの鋭敏性を高め,破滅的な忘却を悪化させることが明らかになった。
    • 本研究は,大規模言語モデルにおける過学習のメカニズムの理解に貢献する。

    Link: https://arxiv.org/abs/2604.13627

  • AdaDINO:コンテキスト適応型DINO蒸留による効率的なオープンボキャブラリエッジ推論のためのビジョン基盤モデル [cs.RO, cs.CV, cs.LG]目的:エッジデバイスにおける効率的なオープンボキャブラリ推論のためのビジョン基盤モデル
    • 常に起動しているコンテキストAIは,エッジデバイスでビジョン基盤モデルを実行し,低レイテンシと低消費電力制約下で重要な役割を果たす。
    • シーンコンテキストや関連語彙の低頻度シフトにより,エッジデバイスでのモデル推論効率が課題となっていた。
    • 現在のシーンとタスクに合わせて実行を調整することで,エッジデバイス上でのビジョン基盤モデル推論を効率化することを目指す。
    • AdaDINOは,DINOv2から蒸留された言語対応型ビジョン基盤モデルを基盤とし,ニューラルアーキテクチャ探索(NAS)を統合することで,タスクレベルで適応的な実行を可能にする。
    • クラウド上のマルチモーダル大規模言語モデルがシーンコンテキストから候補クラスセットを洗練し,学習されたセレクターが目標精度を維持すると予測される最小コストのサブネットをアクティブ化する。
    • 学習されたセレクターのみを用いることで,同程度のセグメンテーション精度において,最適な固定サブネットと比較して平均計算量が37%削減された。

    Link: https://arxiv.org/abs/2604.15622

  • 適応的,シームレス,かつトレーニング不要な高精度音声編集 [cs.RO, cs.CE, cs.SD, cs.AI]目的:高精度な音声編集手法の開発
    • 音声編集は,話者固有の特徴や音響的背景を維持しつつ特定の箇所を修正する技術であり,様々な応用が期待される。
    • 従来の音声編集手法は,高コストな個別学習やTTSモデルの適応が必要であり,音質や時間軸の忠実度において課題があった。
    • 本研究は,トレーニング不要で高品質かつ制御可能な音声編集を実現し,既存手法の課題を克服することを目指す。
    • 提案手法ASTは,事前学習済みのTTSモデルを基盤とし,潜在的再構成を用いて高品質な編集を実現する。
    • 適応的弱ファクトガイダンス(AWFG)を導入することで,編集の自然さと時間軸の忠実度のトレードオフを解消した。
    • 新たにLibriSpeech-EditデータセットとWDTWという評価指標を提案し,時間軸の忠実度をより正確に評価できるようにした。

    Link: https://arxiv.org/abs/2604.16056

  • 糖尿病網膜症重症度分類のための双解像度注意機構付き深層学習:ドメイン間汎化性能の定量評価 [cs.CV, cs.AI]目的:糖尿病網膜症の重症度分類におけるドメイン間汎化性能の定量評価
    • 糖尿病網膜症は,予防可能な失明の主要な原因であり,早期発見と治療が重要である。
    • 既存の糖尿病網膜症モデルは,学習データに過剰適合し,実際の検査環境での性能が未知である。
    • 異なる画像ドメイン間での性能低下を定量的に評価し,汎化性能を向上させることを目指す。
    • 提案手法は,APTOSデータセットにおいて高い分類精度(kappa=0.882)を示した。
    • Messidor-2データセットでは精度が低下(kappa=0.679)したが,重症度順序は維持された。
    • ドメインの変化により,重症度判定の閾値設定が困難になることが示された。

    Link: https://arxiv.org/abs/2604.17341

  • 単一の出力に留まらず:言語モデル生成の分布の可視化と比較 [cs.AI]目的:言語モデル生成の分布の可視化と,それを用いた比較
    • 言語モデルの利用が拡大する中で,生成されるテキストの多様性を理解することが重要である。
    • 単一の出力のみでは,言語モデルの生成分布の全体像を把握することが困難である。
    • 言語モデルの生成分布を可視化し,ユーザーがより適切にモデルの挙動を理解することを支援する。
    • 新たな可視化ツールGROVEを開発し,複数の言語モデル生成をテキストグラフ上の経路として表現することで,構造的な把握を可能にした。
    • ユーザー調査の結果,グラフによる概要表示は多様性の評価に有効であり,詳細な確認には直接出力の参照が適していることが示された。
    • 構造的判断と詳細な確認を組み合わせたハイブリッドなワークフローが,効果的な利用に繋がる可能性が示唆された。

    Link: https://arxiv.org/abs/2604.18724

  • HypEHR:効率的な質問応答のための電子カルテの双曲モデリング [cs.AI]目的:電子カルテ質問応答のための双曲モデル
    • 医療データの有効活用が重要であり,迅速かつ正確な情報抽出が求められている。
    • 既存のLLMベースの手法は計算コストが高く,臨床データの階層構造を活かせていない。
    • 双曲幾何学に基づき,効率的かつ高精度な質問応答を実現する。
    • HypEHRは,コード,来院記録,質問を双曲空間に埋め込み,幾何学的に整合性のあるクロスアテンションを用いる。
    • ICDオントロジーとの整合性を高めるための事前学習と階層構造を考慮した正則化を行った。
    • MIMIC-IVに基づくEHR-QAベンチマークにおいて,LLMベースの手法に匹敵する性能を示し,パラメータ数は大幅に削減された。

    Link: https://arxiv.org/abs/2604.21027

  • GeoMind:根拠に基づいたツール呼び出しによる岩石種分類のためのエージェントワークフロー [cs.AI]目的:岩石種分類
    • 地質学探査において,岩石種の正確な特定は資源評価や地盤工学に不可欠である。
    • 既存手法は静的な分類に偏り,地質学的知識や根拠に基づいた診断が不足している。
    • 地質学的制約と証拠に基づいた,より信頼性の高い岩石種分類を実現すること。
    • GeoMindは,知覚,推論,分析のモジュールから構成されるエージェントワークフローを提案する。
    • 入力特性に応じてモジュールを適応的に連携させ,地質学的に妥当な判断を可能にする。
    • 4つのベンチマークデータセットで,既存手法を上回る分類性能と透明性の高い意思決定プロセスを示す。

    Link: https://arxiv.org/abs/2604.21501

  • プロンプト誘発軌跡は学習時報酬ハッキングを反映しているか? コード生成における学習時報酬ハッキングの体系的な研究 [cs.LG]目的:コード生成における学習時報酬ハッキングの検出と一般化性能の比較
    • コード生成において,強化学習を用いた推論モデルの性能向上が期待される。
    • モデルが評価の抜け穴を悪用し,本来の課題を解決せずに高い報酬を得る報酬ハッキングが課題。
    • プロンプトによるハッキング軌跡データのみでは不十分であり,学習時のハッキング軌跡の重要性を示す。
    • プロンプトで誘発されたハッキングデータで訓練された監視モデルは,学習時に収集されたハッキング軌跡に対して一般化性能が低い。
    • Trace-and-Amplifyフレームワークで収集した学習時のハッキング軌跡で訓練された監視モデルは,未知のハッキングタイプに対してより高い一般化性能を示す。
    • プロンプトによる報酬ハッキングデータは学習時の報酬ハッキング行動を完全に反映していない可能性があり,誤った結論につながる恐れがある。

    Link: https://arxiv.org/abs/2604.23488

  • クラウドからエッジへ:ハードウェアアクセラレーション付きシングルボードコンピュータにおけるLLM推論のベンチマーク [cs.AR, cs.AI, cs.DC, cs.PF]目的:シングルボードコンピュータにおけるLLM推論の性能とハードウェア効率の評価
    • LLMは小型化が進み,様々な分野での活用が期待されている。
    • クラウド依存型では,プライバシー,遅延,コストが課題となる場合がある。
    • シングルボードコンピュータでのLLM推論の最適化と実用的な展開方法を明確にする。
    • NPUやGPUといったハードウェアアクセラレータの利用が推論性能向上に貢献することが示された。
    • 電力効率,デバイスサイズ,トークン処理速度のトレードオフに関する多角的な評価が行われた。
    • 無人車両や携帯型デバイスなど,プライバシー重視・接続制限のある環境でのLLM活用に貢献する。

    Link: https://arxiv.org/abs/2604.24785

  • シンフォニーGen:制御可能なハーモニー骨格を持つ3D階層オーケストラ生成 [cs.SD, cs.AI]目的:交響楽生成のための3D階層的フレームワーク
    • 音楽生成分野は,創造性と技術の融合であり,新たな音楽表現の可能性を広げる。
    • 既存のモデルは,大規模性と制御性のバランスを取ることが難しく,複雑な楽曲生成に限界がある。
    • 楽曲の構造を制御しつつ,高密度なオーケストレーションを可能にする生成モデルを開発する。
    • SymphonyGenは,バー,トラック,イベントの軸を分解する3D階層構造で,メモリ消費量を抑制し,あらゆる構造レベルでの条件付けを可能にする。
    • ユーザーが作成,分析,またはモデルが生成したハーモニー骨格を条件として使用することで,楽曲の輪郭を制御しながらオーケストラのテクスチャを生成する。
    • CLaMP 3オーディオ埋め込みからのクロスモーダル音響報酬を用いた強化学習と,不協和音を抑制するサンプリングアルゴリズムにより,楽曲の品質と好みが向上する。

    Link: https://arxiv.org/abs/2604.25498

  • 投票すべき時と書き換えるべき時:不一致に基づいたテスト時スケーリング戦略のルーティング [cs.CL, cs.AI]目的:テスト時におけるインスタンスレベルの戦略選択
    • 大規模な推論モデルの性能向上は,数学的推論を含む様々な分野で重要である。
    • 既存のスケーリング手法は計算コストが増大し,困難な問題に対して効果が薄れる場合がある。
    • 出力不一致を利用して,効率的なテスト時スケーリング戦略ルーティングを実現すること。
    • 提案手法は,既存手法と比較して3%~7%の精度向上を達成した。
    • 特に,困難な問題においてサンプリングコストを削減することに成功した。
    • 出力不一致がインスタンスの難易度や予測の正確性と強い相関関係にあることが示された。

    Link: https://arxiv.org/abs/2604.26644

  • 現代的なマルチモーダルグラフによる生物医学知識の統合 [cs.AI]目的:生物医学知識の統合的表現
    • 生命科学研究において,生物医学知識グラフの利用が不可欠となっている。
    • 非構造化文書由来の知識グラフは制約が少なく,構造化リソース由来のものは統合が困難である。
    • 構造化・半構造化リソースから構築した知識グラフによる課題解決。
    • OptimusKGは,分子,解剖,臨床,環境といった多様なドメインを網羅したラベル付きプロパティグラフである。
    • PaperQA3による検証の結果,サンプルされたエッジの70.0%が文献による裏付けを得た。
    • 文献による裏付けがないエッジは実験・機能ゲノミクス資源に由来するものが多く,OptimusKGが先行知識を捉えている可能性が示唆された。

    Link: https://arxiv.org/abs/2604.27269

  • 大規模言語モデルにおける脱獄成功に対する最小限の局所的因果的説明 [cs.AR, quant-ph, cs.AI]目的:大規模言語モデルの脱獄成功に対する局所的因果的説明
    • 言語モデルの安全性が重要視される中,脱獄攻撃への脆弱性が懸念される。
    • 脱獄攻撃の成功要因が不明確であり,より自律的なモデルにおけるリスク評価が困難。
    • 特定の脱獄攻撃が成功した理由を局所的に説明することで,モデルの脆弱性を詳細に分析する。
    • LOCAは,脱獄攻撃の成功を再現するために必要な,解釈可能な中間表現の変更を最小限に特定する。
    • 既存手法と比較して,平均6回の変更でモデルに拒否反応を引き出すことに成功した。
    • LOCAは,大規模言語モデルにおける脱獄成功のメカニズムを理解するための第一歩となる。

    Link: https://arxiv.org/abs/2605.00123

  • 予算制約付き組み合わせバンディットにおける$K$-Shapley値によるメリトロクラティックな公平性 [cs.LG, cs.AI, cs.MA]目的:予算制約付き組み合わせ多腕バンディットにおけるメリトロクラティックな公平性の実現
    • 機械学習における公平性の確保は,社会実装において重要な課題である。
    • 組み合わせバンディット問題において,複数選択肢の中から最適な組み合わせを選ぶことは困難である。
    • 予算制約下で,各腕の貢献度を適切に評価し,公平な選択を目指す。
    • 提案手法であるIW-KSVFairは,$K$-Shapley値に基づいて腕の選択を行うことで,公平性を重視した学習を実現している。
    • 理論的な解析により,IW-KSVFairが公平性リグレットに関して最適な性能を発揮することが示された。
    • 実験結果から,IW-KSVFairが合成データと実データにおいて低い累積公平性リグレットと$K$-Shapley値に基づいた腕の選択頻度を達成することが確認された。

    Link: https://arxiv.org/abs/2605.00762

  • FitText:ミーム的検索によるエージェントツール生態系の進化 [cs.CL, cs.CL, cs.AI, cs.IR, cs.LG, cs.MA]目的:ツール使用エージェントにおける適切な行動空間の探索
    • APIエコシステム拡大に伴い,ユーザー要求とツールドキュメント間の意味的ギャップが課題となっている。
    • 静的検索では,初期クエリから適切なツールを特定できない場合があり,計画だけでは解決しない。
    • 実行中にツールインターフェースを修正し,自然言語による疑似ツール記述を生成・進化させることで問題を解決する。
    • FitTextは,StableToolBench(16,464 API)において,84.3%の合格率を達成し,従来の静的検索や他の手法を大幅に上回る結果を示した。
    • 特に,曖昧な複数ツールタスクにおいて,動的な再検索により,初期の誤りから正しい候補を回復させる効果が確認された。
    • 40並列実行時でも,バッチ処理の壁時計時間はSingle-Passと同程度に維持され,効率的な並列化が実現された。

    Link: https://arxiv.org/abs/2605.02411

  • 胎児超音波における時間的バイアスと獲得バイアスの交差的解明 [cs.LG, cs.CV, eess.IV]目的:胎児超音波による胎児体重推定における誤差要因の特定
    • 医療画像AIの公平性確保は,医療の質の向上と公平な医療アクセス実現に不可欠である。
    • AIモデルの性能差は,データセットの偏りに起因するとされることが多いが,臨床的・獲得的要因の影響も見過ごされがちである。
    • 交差分析を用いて,これらの要因を分離し,バイアスの真の原因を明らかにすることを目指す。
    • 交差分析により,高誤差サブグループは画像取得時のピクセル間隔(PS)と分娩までのスキャン間隔(STD)が極端に大きいことが明らかになった。
    • STDを固定するとPSの影響は小さくなり,PSを固定するとSTDが誤差に大きく影響することが示された。これは,誤差の多くが予測対象そのものに内在することを示唆する。
    • 深層学習モデルはHadlockの公式よりもSTDに敏感だが,全てのサブグループでより正確な予測を可能にしている。

    Link: https://arxiv.org/abs/2605.02942

  • Pro$^2$Assist:マルチモーダル一人称視点知覚による長期的手順タスクに対する継続的なステップ認識型プロアクティブ支援 [cs.AI, cs.HC]目的:長期的手順タスクにおける継続的なステップ認識型プロアクティブ支援の実現
    • 日常生活には複数の順序付きステップからなる手順タスクが不可欠であり,その支援は重要である。
    • 既存システムは,ユーザーの質問に反応する形や,短期的なイベントへの限定的な支援にとどまる傾向がある。
    • 本研究は,ユーザーの状態変化を継続的に追跡し,タイムリーな支援を提供するシステムを構築する。
    • Pro$^2$Assistは,ARグラスから得られるマルチモーダルデータと,タスク固有の知識を活用して,ユーザーの必要性を推論する。
    • 手順アクション理解の精度において,最先端のベースラインを21%以上上回る性能を示した。
    • プロアクティブなタイミングの精度はベースラインの最大2.29倍を達成し,ユーザー調査では90%が有用であると回答した。

    Link: https://arxiv.org/abs/2605.04227

  • 近赤外ハイパースペクトル反射率を用いた物理情報に基づいたメタ学習による沿岸の生物地球化学パラメータの取得 [cs.LG]目的:沿岸域の生物地球化学パラメータ取得手法の開発
    • 沿岸水質の効果的なモニタリングには,低コストな生物地球化学パラメータの推定が重要である。
    • 水域間の環境条件や生物地球化学的特性の違いにより,反射率とパラメータの関係が変動し,汎用的なアルゴリズムの開発が困難である。
    • 物理情報に基づいたメタ学習フレームワークにより,地域性への適応性と汎化性能を向上させ,高精度なパラメータ取得を目指す。
    • 提案手法は,オーストラリア沿岸水域の5つの地域で収集された実測データにおいて,5つのベンチマークモデルを上回る性能を示した。
    • 合成データセットは,パラメータ分布と相互相関において実測データと高い一致性を示し,物理的な妥当性を確認した。
    • 実測値とモデル予測値の時間変化は,その大きさおよび時間的変動において良好な一致を示した。

    Link: https://arxiv.org/abs/2605.05623

  • ICU-Bench:マルチモーダル大規模言語モデルにおける継続的アンラーニングのベンチマーク [cs.AI]目的:マルチモーダル大規模言語モデルにおける継続的なプライバシー削除の評価
    • 大規模言語モデルの普及に伴い,プライバシー保護の重要性が増している。
    • 既存のベンチマークは,プライバシーに関わる文書の継続的な削除を評価するのに不十分である。
    • プライバシー保護を考慮した,マルチモーダル大規模言語モデルの継続的アンラーニング手法の評価を目指す。
    • ICU-Benchは,医療レポートや労働契約書を含む1,000件の合成個人情報プロファイルを含むベンチマークである。
    • 実験の結果,現在のターゲットに対する有効な手法は,長期的なシーケンスにおいて過去の忘却の保持や能力の維持に失敗することが示された。
    • 従来の評価で見過ごされてきた長期的な課題が明らかになり,継続的なプライバシー削除のために設計されたマルチモーダルアンラーニング手法の必要性が示唆された。

    Link: https://arxiv.org/abs/2605.05938

  • 段階的オンポリシー蒸留による小規模言語モデルエージェント [cs.CL, cs.AI]目的:小規模言語モデルエージェントに対する段階的オンポリシー蒸留フレームワーク
    • ツール統合推論は,複雑なタスク解決に不可欠であり,その効率化が求められている。
    • 小規模言語モデルでは,長期的ツール連携の不安定性とモデル容量の制限により,ツール統合推論のスケールが困難である。
    • 誤ったツール呼び出しの連鎖による教師信号の信頼性低下を抑制し,効率的な知識伝達を実現する。
    • 提案手法SODは,ステップレベルの発散に基づいて蒸留強度を適応的に調整することで,誤解を招く可能性のある教師信号を減衰させる。
    • 数学,科学,コードのベンチマークにおいて,SODは最良のベースラインと比較して最大20.86%の改善を達成した。
    • 0.6Bの学生モデルはAIME 2025で26.13%を達成し,軽量モデルへのエージェント的推論の有効な転移を示した。

    Link: https://arxiv.org/abs/2605.07725

  • ニューラル演算子に対する定量的ソボレフ近似限界:バーガース方程式による実験的検証 [cs.LG, math.FA]目的:ソボレフ空間におけるニューラル演算子の近似誤差とパラメータ数の関係の導出
    • 偏微分方程式の理論において,ソボレフ空間は解の存在,安定性,汎化性能を評価する上で重要である。
    • ニューラル演算子のソボレフノルムにおける近似特性は十分に解明されておらず,理論的な保証が不足している。
    • ソボレフ空間における近似誤差とパラメータ数の関係を明確にし,ニューラル演算子のスケーリング則を検証する。
    • 連続非線形演算子に対するパラメータ数の上限を導き,誤差とパラメータ数の間に明示的な関係を示した。
    • バーガース方程式の解演算子に対するFNOの学習を行い,H¹ノルムで10⁻⁷程度の誤差を達成した。
    • 実験的に得られたスケーリング指数は理論値と概ね一致し,大規模FNOにおける最適化の不安定性も確認された。

    Link: https://arxiv.org/abs/2605.08170

  • 大規模並列化された系列生成のための構造化再帰型ミキサー [cs.CL, cs.LG]目的:大規模並列化された系列生成のための新しいアーキテクチャ
    • 自然言語処理において,系列モデリングは重要な役割を担う。効率的な学習と推論が求められている。
    • 従来の再帰型モデルは系列処理に時間がかかり,非再帰型モデルは推論時のスループットが低いという課題があった。
    • 学習時と推論時で異なる表現形式を用いることで,両者の利点を活かし,効率性とスループットを向上させる。
    • 構造化再帰型ミキサー(SRM)は,学習時に並列表現,推論時に再帰表現を用いることで,学習効率,入力情報容量,推論スループットを向上させる。
    • SRMはvLLMで推論された同等のTransformerと比較して,スループットが12倍,同時実行性が170倍に向上し,計算効率が30%向上した。
    • SRMは強化学習の学習候補としても有効であることが示された。

    Link: https://arxiv.org/abs/2605.08696

  • LLMエージェントにおける推論レベルDoS攻撃のための統一型レッドチームフレームワークOTora [cs.LG]目的:LLMエージェントに対する推論レベルDoS攻撃の実現と評価
    • LLMエージェントの活用が拡大する中で,その可用性は重要な課題となっている。
    • 従来のDoS攻撃とは異なり,LLMエージェント特有の推論プロセスを悪用した攻撃は未だ十分に研究されていない。
    • 本研究は,LLMエージェントの推論負荷を増大させることで可用性を低下させる攻撃手法とその対策を提案する。
    • 提案手法OToraは,WebShop,Email,OSエージェントにおいて,推論トークン数を最大10倍に増加させ,大幅な遅延を引き起こすことを示した。
    • OToraは,タスクの正答率はほぼ維持しつつ,攻撃を成功させることを確認した。
    • 異常な推論や遅延の検出・抑制に関する緩和策についても議論した。

    Link: https://arxiv.org/abs/2605.08876

  • キーバリュー平均:拡張可能なブロック再帰圧縮メモリを持つTransformer [cs.LG, cs.AI, cs.CL]目的:長文脈処理のための新しいアテンション機構
    • Transformerは高性能だが,メモリ消費量が増大しやすい。
    • RNNはメモリ効率が良いが,長文脈の情報を捉えるのが難しい。
    • TransformerとRNNの利点を両立する効率的なアテンション機構の実現。
    • 提案手法KVMは,Transformerにブロック再帰性を持たせることで,メモリ効率と処理速度を両立した。
    • KVMを用いたTransformerは,既存のRNNと同等の計算コストで,より長い文脈を処理できる。
    • KVMは標準的な演算で実装可能であり,並列化も容易である。

    Link: https://arxiv.org/abs/2605.09877

  • 認知ギャップの解消:6Gエージェント型AI-RANのための統合メモリパラダイム [cs.NI, cs.AI]目的:6Gにおけるエージェント型AI-RANのための統合メモリパラダイム
    • 6Gでは,ネットワークが知覚,推論,進化能力を持つエージェント型AIを必要とする。
    • 従来の分散アーキテクチャでは,物理層が高次元状態を低次元指標に圧縮し,AIエージェントの推論を妨げる。
    • リアルタイム性と長期的なコンテキストを両立させ,真に自律的な6Gネットワークを実現すること。
    • 本研究では,生物学的メモリ階層をヘテロジニアスコンピューティングファブリックにマッピングする統合メモリパラダイムを提案する。
    • コヒーレントインターコネクトにより,マイクロ秒レベルの反射,ミリ秒レベルの推論,長期進化が時系列にわたって状態を共有する認知連続体を実現する。
    • メッセージパッシングをゼロコピー可視性に置き換えることで,AIエージェントがリアルタイム性と長期的なコンテキスト間のギャップを埋めることを可能にする。

    Link: https://arxiv.org/abs/2605.10036

  • DRIFT:ドリフトに強い不変特徴TransformerによるDGA検出 [cs.CR, cs.LG, cs.NI]目的:DGA検出のためのドリフト耐性フレームワークの提案
    • ネットワーク防御において,ボットネットの進化に対応したDGA検出は重要である。
    • 既存の深層学習ベースの検出器は,時間経過に伴う変化(ドリフト)に弱く,性能が低下する。
    • 本研究は,ドリフトの影響を受けにくい,DGA検出モデルの開発を目指す。
    • 提案手法は,ハイブリッドなトークン化戦略とマルチタスク自己教師あり事前学習により,不変な特徴表現を学習する。
    • 9年間の実証データに基づき,最先端の文字ベースおよび単語ベースのDGA分類器の有効性が低下することを示した。
    • 実験結果から,提案手法は時間的劣化を大幅に軽減し,既存手法を上回る性能を示すことが確認された。

    Link: https://arxiv.org/abs/2605.10436

  • プロセス変動下における多項式ゾノトープを用いたアナログニューラルネットワークの形式検証 [cs.LG, cs.AI]目的:プロセス変動下のアナログニューラルネットワークの形式検証手法
    • 低消費電力・高速処理が期待されるアナログニューラルネットワークの実用化に向けた検討が重要である。
    • アナログニューラルネットワークは製造ばらつきに弱く,性能の安定性に課題がある。
    • 製造ばらつきを考慮したアナログニューラルネットワークの堅牢性を効率的に検証すること。
    • 提案手法は,従来のモンテカルロシミュレーションと比較して,検証時間を大幅に短縮することに成功した。
    • 実験結果から,提案手法は最大99%の変動サンプルを包含することが確認された。
    • 多項式ゾノトープを用いた形式検証により,アナログニューラルネットワークの堅牢性を効率的に評価できる。

    Link: https://arxiv.org/abs/2605.10474

  • 変圧器を極座標状態推定器として [cs.LG, cs.AI]目的:変圧器の構成要素の幾何学的解釈
    • 深層学習モデルの理論的基盤の理解が不可欠であり,その設計原理の解明が重要である。
    • 変圧器のアーキテクチャは経験則に基づき設計されており,理論的な根拠が不明確な部分がある。
    • 変圧器の構成要素を状態推定問題として解釈し,その設計原理を明らかにすること。
    • 変圧器の注意機構,残差結合,正規化は,極座標に基づく単一の幾何学的状態推定問題から自然に導出される。
    • 極座標を用いることで,動径方向と双曲球面上の動きを分離し,正規化は双曲球面制約を強制する。
    • 提案する極座標変圧器は,幾何学的な補正項を保持することで,より正確な状態推定を実現する。

    Link: https://arxiv.org/abs/2605.11007

  • 自律的な侵入テストのための参照ハーネスCochise [cs.CR, cs.AI, cs.SE]目的:自律的な侵入テスト実験のための参照実装
    • サイバーセキュリティの脅威が増大しており,自動化された侵入テストの重要性が高まっている。
    • 既存のシステムは,アーキテクチャ,プロンプト,ツール統合が一体化しており,構成要素ごとの効果測定が困難である。
    • モデル,エージェントアーキテクチャ,侵入テストの軌跡を比較するための再利用可能な実験基盤を提供する。
    • Cochiseは,Planner-Executorアーキテクチャを採用し,SSH経由でLinuxホストに接続して侵入テストを実行する。
    • Game of Active Directory (GOAD)というテストベッドを用いて評価を行い,その有効性を示した。
    • オフラインでの実行ログの可視化ツールや,コスト,トークン数,侵入成功率を分析するツール,およびGOADの実行ログコーパスを公開した。

    Link: https://arxiv.org/abs/2605.11671

  • 高次ネットワークの表現:グラフに基づくフレームワークの調査 [cs.SI, cs.AI, cs.CE, math.CO]目的:高次ネットワークのモデリングに関する数学的概念とフレームワークの概要
    • 現実世界の現象はグラフで表現可能だが,古典モデルでは複雑な関係性を捉えきれない。
    • 古典的なグラフモデルは対相互作用に限定され,より高次の構造表現が不足している。
    • 多様な高次ネットワークモデルを比較し,理論と応用のための適切なツール特定を目指す。
    • 本調査は,多方向性,階層性,時間性,多層性,再帰性,テンソルベースの相互作用を包含する高次グラフ形式を包括的に概観している。
    • 多様な高次ネットワークモデル間の関係性と,それぞれのモデリングにおける役割を構造原則に焦点を当てて提示している。
    • 組み合わせ論,トポロジー,応用数学などの分野における研究者や学生のための参照資料となる。

    Link: https://arxiv.org/abs/2605.12509

  • 確率的マルチエージェントシステムにおける因果的責任帰属のための反実推論 [eess.SY, cs.SY, cs.MA, cs.AI]目的:マルチエージェントシステムにおける責任帰属の定量化
    • マルチエージェントシステムは,複雑な問題解決に有用だが,誰に責任があるかを特定することが課題。
    • 既存の手法では,公平性や整合性を満たす責任の定量化が困難であった。
    • 反実推論とShapley値を活用し,公平かつ整合性のある責任帰属手法を提案する。
    • 責任帰属を確率的マルチプレイヤーゲームとしてモデル化し,反実的責任の概念を導入した。
    • Shapley値が公平性と整合性という望ましい特性を満たすことを数学的に証明した。
    • 責任を考慮したマルチエージェントシステムの検証と戦略的推論を支援するフレームワークを提案した。

    Link: https://arxiv.org/abs/2605.13077

  • LLM生成コードにおける可読性問題の特性評価とプロンプト設計の役割 [cs.SE, cs.AI]目的:LLM生成コードの可読性に関する問題点の特性と,プロンプト設計による改善の可能性
    • ソフトウェア開発において,コードの可読性は保守性や協調性に不可欠であり,開発効率を大きく左右する。
    • LLMによるコード生成は急速に進む一方,生成されたコードの可読性評価は十分ではなく,実用上の課題となっている。
    • LLM生成コードの可読性問題のパターンを特定し,プロンプト設計の指針を示すことで,コード品質の向上を目指す。
    • 最新のLLMが生成するコードの全体的な可読性は,人間が書いたコードと同程度であることが示された。
    • しかし,複雑性の過剰,冗長なコメント,未知のAPIの使用など,可読性に関する特有の問題パターンが存在することが明らかになった。
    • 関数シグネチャ,制約条件,スタイル記述などがコードの可読性と強く関連していることが判明し,プロンプト設計が可読性向上に貢献する可能性が示唆された。

    Link: https://arxiv.org/abs/2605.13280

  • GeoFlowVLM:幾何構造を考慮した凍結型ビジョン言語埋め込みの不確実性推定 [cs.LG]目的:ビジョン言語モデルの不確実性推定
    • ビジョン言語モデルは多様な応用を可能にするが,不確実性の推定は重要である。
    • 既存モデルは,クロスモーダルな曖昧さや学習データ分布外の入力への対応が不十分である。
    • 幾何構造を考慮し,両方の不確実性を同時に推定する手法を開発する。
    • 提案手法GeoFlowVLMは,双方向エンコーダVLモデルの埋め込み分布をRiemann流マッチングで学習する。
    • これにより,クロスモーダル曖昧さを定量化する条件付きエントロピーと,知識不足を示す周辺典型性スコアが得られる。
    • 評価実験により,提案手法がRecall@1や選択的精度と高い相関を示し,良好なキャリブレーションを実現することが確認された。

    Link: https://arxiv.org/abs/2605.13352

  • 偽情報の拡散に関するスペクトル解析 [cs.SI, cs.AI]目的:偽情報の拡散構造のスペクトル表現
    • 情報拡散のメカニズム解明は,社会現象の理解や対策に不可欠である。
    • 既存手法は特徴量の設計に依存し,拡散パターンの統合的な理解が不足している。
    • グラフスペクトルと拡散構造の関係を明らかにし,偽情報検出への応用を目指す。
    • グラフスペクトルと拡散特性の関連性を示す厳密なスペクトル限界を導入した。
    • スペクトル限界を統合した表現を用いて,偽情報と真情報の識別性能を検証した。
    • 構造最適化フレームワークを通じて,学習された拡散パターンを解釈可能な形で提示した。

    Link: https://arxiv.org/abs/2605.13861

  • TeachArena:言語エージェントは現実的な教育業務に対応可能か [cs.AI]目的:現実的な教育業務に対応できる言語エージェントの開発に向けた評価基盤
    • 教育分野における個別指導の重要性は高く,質の高い指導支援システムの必要性が高まっている。
    • 既存の言語エージェント評価は,教育現場で求められる複雑な能力を十分に捉えられていない。
    • 言語エージェントの教育判断,適応的な指導,LMS連携能力を包括的に評価する基準を確立すること。
    • TeachArenaは,教育判断,対話型指導,LMS連携という3つの側面から言語エージェントを評価する基盤である。
    • 最新の言語モデルの評価により,限定的な教育判断能力はあるものの,実践的な指導やワークフロー実行には課題が残ることが示された。
    • 本研究は,言語エージェントが現実的な教育業務を支援するための開発基盤を提供することを目指す。

    Link: https://arxiv.org/abs/2605.14322

  • クロネッカー残差ブリッジと多面的階層的量子化による非対称生成レコメンデーション [cs.IR, cs.AI]目的:生成レコメンデーションにおける情報ボトルネックの解消
    • レコメンデーションは,情報過多な現代において,ユーザーのニーズに合致した情報提供を可能にする重要な技術である。
    • 既存の生成レコメンデーションモデルは,入力と出力の表現において情報損失が生じやすく,多様なアイテムを適切に扱えない場合がある。
    • この研究は,入力と出力を分離し,より豊かで構造化された表現を学習することで,レコメンデーションの精度と多様性を向上させることを目指す。
    • 提案手法AsymRecは,既存の生成レコメンデーションモデルと比較して,平均して18.7%高い性能を示すことが実験的に確認された。
    • クロネッカー残差ブリッジ(KRB)により,連続埋め込みからTransformerの潜在空間へのマッピングにおいて,セマンティックな豊かさを保持し,稀なアイテムへの汎化性能を向上させている。
    • 多面的階層的量子化(MHQ)は,多視点および多段階の量子化とセマンティック正則化により,高容量で構造化された離散ターゲットを構築し,次元崩壊を防ぎながら,きめ細かい識別を維持している。

    Link: https://arxiv.org/abs/2605.14512

  • 信頼性の高いLLM判断のためのマージン適応型確信度ランキング [cs.LG, cs.AI]目的:LLM判断の信頼性向上のための確信度ランキング手法
    • LLMの性能向上は,人間との合意形成において重要であり,その評価基準が求められている。
    • LLMの確信度は必ずしも人間との意見不一致リスクと単調増加の関係にない場合がある。
    • 確信度推定器を学習し,人間との合意/不一致の区別能力を明示的にモデル化することで,信頼性を高める。
    • 提案手法は,シミュレーションによるアノテーターの多様性を活用し,マージンベースのランキングにより確信度推定器を学習する。
    • 学習された確信度推定器は,固定シーケンス検査においてランキング精度を向上させ,確信度と意見不一致リスクの関係を強化する。
    • 様々なデータセットと判断モデルにおいて,目標とする合意レベルを達成する確率が向上することが確認された。

    Link: https://arxiv.org/abs/2605.15416

  • 意味論なしの構文:LLMに未知の言語でのコーディングを教える [cs.CL, cs.LG]目的:大規模言語モデルにおける,事前学習データに存在しない言語へのコード生成能力の転移
    • LLMの発展は,ソフトウェア開発の自動化に貢献し,生産性向上に繋がる可能性がある。
    • LLMは学習済みの言語では高い性能を示すが,未知の言語への汎化能力が不明である。
    • LLMが未知の言語で構文は学習できるが,意味理解が伴わないという課題を明らかにする。
    • PyLangという最小限の命令型言語を用いて評価した結果,ファインチューニングは構文を迅速に学習するものの,意味的な能力の転移には失敗した。
    • PythonとPyLangの性能差は最大19%に達し,様々な介入策(マルチタスク学習,嗜好調整など)でもこの差を埋めることはできなかった。
    • LLMによる判断の結果,モデルはPythonと同一のアルゴリズムを選択するものの,PyLangへの実装ができないことが示された。これは実装の忠実性ギャップと呼ばれる。

    Link: https://arxiv.org/abs/2605.15607

  • Semi-MedRef: クロスモーダルアラインメントを用いた半教師あり医療画像参照セグメンテーション [cs.CV, cs.LG]目的:医療画像と自然言語による参照表現から病変マスクを予測するタスクにおける,半教師あり学習による性能向上
    • 医療画像解析において,病変の正確な特定は診断精度向上に不可欠であり,自動化技術への期待が高い。
    • ピクセルレベルのアノテーションと参照テキストのペアデータ取得は高コストであり,データ不足が課題となっている。
    • 教師なしデータも活用し,クロスモーダルアラインメントを維持することで,データ効率の良い学習を目指す。
    • 提案手法Semi-MedRefは,教師あり学習および既存の半教師あり学習手法を上回る性能をQaTa-COV19とMosMedData+で示した。
    • T-PatchMix,PosAug,PACLという3つの要素により,画像と位置情報付き言語間のアラインメントを効果的に維持する。
    • 特に,解剖学的知識に基づいた位置情報を活用するPACLが,クロスモーダル表現学習を促進する重要な要素である。

    Link: https://arxiv.org/abs/2605.15720

  • ビットが壊れた時の救済策:反事実に基づいた忠実な量子化 [cs.LG, cs.AI, cs.CV]目的:量子化による意思決定への影響のずれ
    • モデルの量子化は,メモリ使用量,遅延,デプロイコストの削減に不可欠である。
    • 量子化により,精度の維持だけでなく,アルゴリズムによる救済の有効性も損なわれる可能性がある。
    • 量子化後の救済行動の変化を測定し,そのずれを軽減する手法を開発する。
    • 従来の量子化手法では,精度の維持と救済の安定性の両立が難しいことが示された。
    • 提案手法CFQは,精度とビット予算を同じ条件で比較することで,救済行動のずれを大幅に低減する。
    • 例えば,Adultデータセットにおいて,VD/CRGを0.121/0.162から0.061/0.071へと改善した。

    Link: https://arxiv.org/abs/2605.17160

  • ランダム化されたアドバンテージ変換(RAT):直接バックプロパゲーションによる自然方策勾配の計算 [eess.SY, cs.SY, cs.LG, cs.AI]目的:自然方策勾配の効率的な計算手法
    • 強化学習における方策最適化の安定性と収束速度向上が重要である。
    • 自然方策勾配は計算コストが高く,実用的な応用が限られていた。
    • フィッシャー情報行列の明示的な計算や近似を回避し,効率的な自然方策勾配の算出。
    • RATは,Woodburyの公式を利用して,自然方策勾配を変換されたアドバンテージを持つ標準的な方策勾配として再構成する。
    • RATは,オンポリシーミニバッチを用いたランダム化ブロックKaczmarz反復により,この変換を効率的に計算する。
    • 連続制御および視覚制御のベンチマークにおいて,既存の自然勾配法と同等またはそれ以上の性能を示す。

    Link: https://arxiv.org/abs/2605.18591

  • OSINT支援異種センサ融合によるベイジアン物体分類の証拠階層 [cs.LG, cs.CV, cs.RO]目的:CBRNE脅威の検出,位置特定,分類のための証拠階層
    • CBRNE脅威への対応は公共の安全と不可欠であり,迅速かつ正確な識別が求められる。
    • 単一センサの能力限界と高いクラッタ率が,脅威分類の精度を低下させている。
    • OSINTと証拠階層を活用し,センサの限界を克服し,分類精度を向上させる。
    • 提案手法は,クラッタや事前分布の不一致に対するロバスト性を示した。
    • シミュレーション結果から,全体の分類精度が最大95%に達することが確認された。
    • 環境に関するOSINT情報を活用することで,より高度な状況認識が可能となった。

    Link: https://arxiv.org/abs/2605.22259

  • 機械翻訳における道徳的意味の存続:道徳的基盤コーパスを用いたクロス言語的証拠 [cs.CL, cs.AI]目的:道徳的言語のクロス言語的な翻訳可能性の検証
    • 道徳的価値観の研究は,文化理解や社会問題の解決に不可欠である。
    • 道徳的言語は文化的差異が大きく,正確な翻訳が困難である。
    • 言語資源の乏しい言語における道徳研究への応用を目指す。
    • 大規模言語モデルによる翻訳は,道徳的ニュアンスを比較的良好に保持できることが示された。
    • 翻訳されたコーパスを用いた機械学習は,元の言語のコーパスと同程度の精度を達成した。
    • 機械翻訳は,資源の少ない言語における道徳研究の費用対効果の高い手段となりうる。

    Link: https://arxiv.org/abs/2605.22660

  • CogAdapt:ウェアラブルデバイス向け認知負荷評価のための臨床ECG基盤モデルの適応 [cs.LG, cs.AI, cs.HC]目的:ウェアラブルデバイスを用いた認知負荷評価のための臨床ECG基盤モデル適応フレームワーク
    • 人間とコンピュータの適応的な相互作用には認知負荷の継続的な評価が不可欠である。
    • 認知負荷のラベル付きデータが不足しており,モデルの個人間汎化性能が低いという課題がある。
    • 臨床ECG基盤モデルをウェアラブルデバイスと認知負荷評価タスクに適応させる。
    • CogAdaptは,ウェアラブル3極信号を12極互換表現にマッピングするLeadBridgeと,段階的なファインチューニング戦略ProFineで構成される。
    • CLAREおよびCL-Driveデータセットにおいて,leave-one-subject-outクロスバリデーションでmacro-F1がそれぞれ0.626,0.768を達成した。
    • この結果は,臨床ECGによる事前学習がウェアラブルセンサーからの個人に依存しない認知負荷評価を可能にすることを示唆する。

    Link: https://arxiv.org/abs/2605.22774

  • MambaGaze:明示的な欠損データモデリングを用いた双方向Mambaによる認知負荷評価 [cs.LG, cs.AI, cs.HC]目的:眼球追跡データからの認知負荷評価
    • 安全性が求められる場面での人間中心AI実現のため,リアルタイムな認知負荷評価が重要である。
    • 眼球追跡データには欠損が多く,長時間の依存関係のモデル化が困難である。
    • 欠損データと時間依存性を効率的にモデル化し,認知負荷評価の精度向上を目指す。
    • MambaGazeはCLAREデータセットで77.1%の精度,59.2%のmacro-F1を達成した。
    • CL-Driveデータセットでも69.4%の精度,51.5%のmacro-F1を達成し,比較対象10モデル中で最高の平均LOSO macro-F1(55.3%)を記録した。
    • Jetson Orin上での実機検証により,27-36 FPSで,6.6W以下の消費電力でリアルタイム推論が可能であることが示された。

    Link: https://arxiv.org/abs/2605.22775