arXiv雑要約

AI - 2026/07/31 公開

  • SE(3)-MeanFlow:リー群上の数ステップタンパク質バックボーン生成 [cs.MA, cs.LG, cs.AI]目的:タンパク質バックボーンの生成
    • タンパク質の構造と機能を制御した設計は,創薬やバイオテクノロジーにおいて重要である。
    • 既存手法は計算コストが高く,大量のタンパク質設計には不向きである。
    • リー群の幾何学を利用し,高速かつ効率的なバックボーン生成を目指す。
    • SE(3)-MeanFlowは,既存のフローマッチングモデルと同等以上の性能を発揮する。
    • 特に少ないステップ数での生成において,その利点が顕著になる。
    • 多様性の低下は軽微であり,効率的なタンパク質設計に貢献する。

    Link: https://arxiv.org/abs/2607.27431

  • 浅水ダムブレイク問題に対するパラメトリック物理情報ニューラルネットワークとテンソル低次元モデルの比較 [math.NA, cs.LG, cs.NA, physics.flu-dyn]目的:浅水ダムブレイク問題に対するパラメトリックデータ駆動型低次元モデル
    • 自然災害の予測精度向上は重要であり,迅速かつ正確なシミュレーションが求められている。
    • 従来の数値シミュレーションは計算コストが高く,リアルタイムでの予測には課題がある。
    • 物理情報を取り入れた低次元モデルにより,計算コストを抑えつつ高精度な予測を目指す。
    • 物理情報ニューラルネットワーク(PINN)とテンソル低次元モデル(TROM)の比較を行った結果,どちらも時間積分を必要としない直接的な解写像を学習した。
    • PINNのロバスト性を向上させるためには,衝撃波を考慮した配置が必要であることが示された。
    • サンプル外および外挿されたパラメータ値に対する詳細な比較を行い,各モデルの特性を明らかにした。

    Link: https://arxiv.org/abs/2607.27433

  • エージェント型LLMシステムにおける事前実行エラー診断のための軌跡グラフの活用 [cs.AI]目的:エージェント型LLMシステムにおける事前実行エラー診断
    • 複雑なタスク遂行において,LLMエージェントの性能向上が求められている。
    • 複雑な環境下では,初期の誤った行動が連鎖的にエラーを引き起こしやすい。
    • 行動履歴から失敗パターンを学習し,エラーを事前に警告することで改善を目指す。
    • 提案手法「Trajectory Graph Copilot」は,LLMエージェントの行動を事前に診断し,エラーを未然に防ぐ。
    • 過去の軌跡を確率グラフとしてモデル化し,Graph Neural Networkを用いて失敗しやすい行動パターンを特定する。
    • 4つのベンチマークと3つのLLMエージェントを用いた実験で,成功率が平均14.69%向上した。

    Link: https://arxiv.org/abs/2607.27443

  • ニューラルネットワーク支援型CLEAN法:低SNR環境におけるチャネルモデリング [cs.CG, cs.NI, cs.LG]目的:低SNR環境におけるチャネルモデリングのための多経路パラメータ推定の精度向上
    • 現代の無線通信システムにおいて,高精度なチャネルモデルは不可欠であり,特に低SNR環境下での性能が重要である。
    • 従来のCLEAN法は計算量が膨大であり,データ駆動型深層学習アプローチは物理的な根拠に乏しいという課題があった。
    • 本研究は,計算効率と精度を両立するハイブリッドなフレームワークを提案し,これらの課題の解決を目指す。
    • NN-CLEAN法は5dBのSNRにおいて96%を超える推定精度を達成し,従来のGrid-Search CLEAN法と同等の性能を示す。
    • 従来のCLEAN法と比較して計算量を大幅に削減し,サブ空間法や単一のニューラルネットワークよりも優れた性能を発揮する。
    • バッチサイズが増加しても実行時間とメモリ消費がほぼ一定に保たれ,リアルタイム処理に適した堅牢なチャネル推定ソリューションとなる。

    Link: https://arxiv.org/abs/2607.27450

  • VAmoSベンチ:音声エージェントシミュレーションベンチ [cs.AI]目的:音声エージェントシステムの完全な性能評価
    • 音声エージェント技術は,顧客対応の自動化に不可欠であり,その重要性は増している。
    • 既存のベンチマークは部分的な性能評価に偏っており,実際の通話処理能力を測れていない。
    • 本研究は,通話の自動解決率(コンテインメント率)を直接評価するベンチマークを確立する。
    • VAmoSベンチは,顧客サポートタスクにおいて,音声エージェントシステムをエンドツーエンドで評価するプラットフォームである。
    • シミュレーションされた顧客との対話と,実際のSQL実行ツールを利用することで,システムの正確性と安全性を検証する。
    • このベンチマークにより,音声エージェントの能力を定量的に比較し,改善を促進することが可能となる。

    Link: https://arxiv.org/abs/2607.27453

  • FADEx:次元削減の説明における特徴量帰属と歪みに基づく説明 [cs.LG, cs.HC]目的:次元削減の説明
    • 高次元データの探索や機械学習モデルの解釈に不可欠な技術であり,複雑なモデルの透明性を高める上で重要である。
    • 非線形な次元削減手法はブラックボックスになりやすく,特徴量が低次元空間でのインスタンス配置にどのように影響するか理解しづらい。
    • 既存手法の制約を克服し,次元削減手法に依存しない,ロバストな特徴量帰属と歪み分析を提供する。
    • FADExは,一次テイラー展開と特異値分解を用いて,インスタンスごとの特徴量帰属を局所的に線形近似によって算出する。
    • 既存手法と比較した評価実験において,FADExはより堅牢かつ信頼性の高い説明を提供することが示された。
    • FADExは,次元削減手法の挙動を分析するための説明と分析リソースを提供し,その有効性と汎用性が確認された。

    Link: https://arxiv.org/abs/2607.27463

  • OneShot:ニューラルスコアリングを用いた大規模検索におけるインデックス内ランキング [cs.IR, cs.LG]目的:大規模検索におけるランキング精度とインデックス効率の最適化
    • 現代の推薦システムにおいて,検索は候補アイテムを絞り込む重要な段階であり,その性能がシステム全体の効率を左右する。
    • 従来の検索システムでは,ランキングの精度とインデックスの効率が相反する課題となっており,両立が困難であった。
    • ランキングの目的とインデックス学習を統合し,ランキング精度と効率の両方を向上させることを目指す。
    • OneShotは,ランキングの目的とインデックス学習をネイティブに統合する新しい検索フレームワークである。
    • Instagramの短編動画推薦システムに導入された結果,ユーザーの利用時間,エンゲージメント,セッション数が大幅に向上した。
    • 運用時のランキングボリュームにおいてリコール率が20%向上し,同等のリコールレベルで効率が10倍改善された。

    Link: https://arxiv.org/abs/2607.27475

  • シュライアー・コセットグラフのリワイヤリング [cs.LG]目的:グラフニューラルネットワークにおける情報伝播の改善
    • グラフニューラルネットワークは,様々なタスクで高い性能を示すが,情報伝播の限界が課題。
    • 従来のグラフリワイヤリング手法は,計算コストや構造的ボトルネック,グラフの特性変化を招きやすい。
    • 特殊線形群から派生したシュライアー・コセットグラフを用いて,効率的な情報伝播経路を構築する。
    • 提案手法は,グラフのスペクトルギャップと有界有効抵抗を理論的に保証し,長距離通信の低抵抗バイパスを創出する。
    • 実証実験により,SCGRは様々な学習タスクにおいて有効抵抗を5-40%削減し,接続性のボトルネックを緩和することが示された。
    • SCGRは,高い精度を維持しながら,効果的なリワイヤリングを実現する。

    Link: https://arxiv.org/abs/2607.27479

  • ニューラルネットワークにおける潜在状態:モデル重みからのドリフトデータの時間構造の復元 [cs.LG, cs.AI, cs.CL]目的:時間ドリフトデータからモデル重みの軌跡に隠れマルコフモデル(HMM)を適合させ,潜在的な状態の復元
    • 時間とともに変化するデータストリームの分析は,様々な実世界の問題において重要である。
    • データストリームの変化が連続的ではなく,離散的な状態を経由する場合,その状態を特定することが難しい。
    • モデル重みのみから,データの時間構造を捉え,より効果的な転移学習を可能にすること。
    • 訓練窓と状態を共有する窓へのデータでの汎化性能が,状態境界を越える窓よりも優れている。
    • この状態内転移の優位性は,時間的近接性による影響を排除しても維持され,単純な等分割よりも優れている。
    • 推定された状態は,データクラス分布の変化とより強く相関しており,データ分布を超えた転移に関連する構造を捉えている。

    Link: https://arxiv.org/abs/2607.27482

  • スキル利用か,それともパフォーマンスか?スキル拡張言語エージェントにおける推論の裏側評価 [cs.AI, cs.MA]目的:スキル拡張言語エージェントにおける,明示されたスキル利用と介入によって測定される影響との間の体系的な乖離,すなわち「推論の裏側」の存在の検証
    • 言語エージェントにタスク手順を組み込むための再利用可能なスキルは,AIの能力拡張に不可欠である。
    • エージェントの自己申告や可視化された推論からのスキル利用の推測は,真のスキル影響を捉えきれない。
    • スキル利用の主張と実際の因果的依存性の乖離を明らかにし,AIの透明性と信頼性を高める。
    • スキル拡張エージェントにおいて,明示されたスキル利用は安定しているにもかかわらず,因果的依存性と効用は変動することが示された。
    • スキル利用の主張,テキスト言及,トレース類似性,LLMによる評価などの観察的検出器は,スキルの実際の依存性を特定できない。
    • マルチエージェントシステムでは,スキルの影響は情報源が失われた後も持続し,供給されなかったスキルや情報源が言及される場合もある。

    Link: https://arxiv.org/abs/2607.27484

  • INCLAIR:情報に基づいた推論による,縦断的臨床異常検知のためのInceptionに基づく手法 [cs.AI]目的:縦断的臨床プロファイルの異常検知
    • 臨床現場において,患者の状態変化を早期に把握し,適切な介入を行う上で重要である。
    • 異常を示す証拠が乏しい,患者の病歴の長さが不均一,専門家による解釈コストが高いという課題がある。
    • 限られた専門家の監督下で,臨床的に実行可能な異常検知と説明を可能にすることを目標とする。
    • INCLAIRは,複数の過去の文脈に対して各観察を評価し,プロファイルレベルで証拠を集約する。
    • 限定的な専門家の監督下で,根拠のある自然言語の説明を生成する。
    • 3つの臨床データセットにおいて,最先端のベースラインと比較して一貫して優れた性能を示した。

    Link: https://arxiv.org/abs/2607.27487

  • MedLLM:サブ10億規模のオープンな医療言語モデル [cs.AI]目的:サブ10億規模の医療言語モデルの特性解明
    • 医療分野における自然言語処理の重要性が増しており,専門知識を持つ言語モデルの需要が高い。
    • 既存の医療言語モデルは大規模なものであり,計算資源の制約下での活用が課題となっていた。
    • 計算資源が限られた環境でも高い性能を発揮できる医療言語モデルの構築を目指す。
    • MedLLMは,0.1Bパラメータという小規模ながら,特定の医療タスクにおいて7Bモデルに匹敵する性能を示す。
    • 特に,知識想起タスクでは,既存の7Bモデルやそれ以下のモデルを大きく上回る結果が得られた。
    • モデルの規模が小さくなることで,タスクの種類によって性能低下のパターンが明確になり,モデルの容量がボトルネックとなる状況が示された。

    Link: https://arxiv.org/abs/2607.27490

  • 評価付き概念的議論のデータセット [cs.AI]目的:概念的質問に対する議論の評価データセット
    • 検証可能な回答がない概念的質問の議論は,AI安全や倫理など重要な分野で進展の鍵となる。
    • 概念的質問に対する議論の評価は難しく,客観的な評価基準が確立されていない。
    • 個別議論の信頼性評価を通じて,概念的質問に対する議論の質的向上を目指す。
    • データセットは,AI安全,意思決定理論,倫理,政治など多様なトピックに関する442の立場表明と951の批判的議論を含む。
    • 6人の専門家による中心性,強さ,正確性,明瞭さの評価を1,458件収録し,議論の多角的評価を可能にする。
    • 提案するスコアリング関数とモデルのベンチマークにより,モデルの能力が一般的な性能ランキングと一致することを確認した。

    Link: https://arxiv.org/abs/2607.27499

  • マルチドメイン適応を用いた素粒子物理のための軽量な基盤モデル [cs.LG, hep-ph]目的:素粒子物理データからの事前学習を活用した,他の科学データセットにおけるドメイン外タスクへの基盤モデル
    • 物理学研究において,大規模データセットからの効率的な知識抽出は重要である。
    • 既存モデルは計算コストが高く,リアルタイム処理やエッジデバイスでの利用が困難である。
    • 軽量なモデル構造で,様々な科学分野への適用を可能にすること。
    • 提案手法NEXUSは,約300万パラメータの全結合オートエンコーダを用いて,高い性能を示す。
    • 事前学習により,少ないラベルデータでも,既存のモデルよりも高い精度を達成する。
    • 重力波,洪水予報,神経活動など,他の分野への応用可能性も示された。

    Link: https://arxiv.org/abs/2607.27501

  • ミニマリストRAGモデル:335Mパラメータ埋め込みモデルと10億パラメータ小規模言語モデル [cs.CL, cs.AI]目的:効率的なRAGアーキテクチャの構築
    • RAGは,大規模言語モデルの知識を拡張し,より正確な応答を生成するために不可欠である。
    • 従来のRAGシステムは,大規模な事前学習と明示的な知識源の指定を必要とする。
    • リソース効率の良いRAGシステムを構築し,事前学習や明示的な指示なしでも知識に基づいた応答を生成することを目指す。
    • B1ade-embedは,事前学習済みのエンコーダを融合することで,5億パラメータ以下のモデルの中で最高のMTEBスコアを達成した。
    • B1ade-1Bは,報酬関数によるRL学習によって,ソースの引用が42.4%という高い頻度で発生し,明示的な指導なしでも知識に基づいた応答が可能となった。
    • B1ade-1Bは,PopQA,PubMedQA,FEVERなどのQAベンチマークで高い性能を示し,SFTモデルと比較して平均スコアが10.8%向上した。

    Link: https://arxiv.org/abs/2607.27506

  • 行列三因子分解におけるスパース性誘導識別可能性 [cs.LG]目的:行列三因子分解におけるスパース性誘導識別可能性の理論的保証
    • 高次元データの低次元構造を捉え,データ圧縮や解釈可能な表現学習など,多様な応用を持つ重要な手法である。
    • 従来の二因子モデルと比較して柔軟性が高い三因子分解だが,理論的な保証は十分とは言えなかった。
    • スパース性が識別可能性に与える影響を厳密に解析し,復元条件を明確にすることを目的とする。
    • 本研究では,新しい分解戦略により,スパース性が識別可能性に及ぼす影響を理論的に解明した。
    • スパースな係数が復元条件,収束性,スペクトル近似誤差,構造保存にどのように影響するかを明らかにした。
    • モンテカルロ実験により,理論結果と実験結果が一致することを確認した。

    Link: https://arxiv.org/abs/2607.27507

  • エージェント型ベンチマークの欠陥検出のための自動トランスクリプト分析 [cs.RO, cs.CL, cs.MA, cs.SI, cs.AI]目的:エージェント型ベンチマークにおける欠陥の検出
    • 最先端モデルの能力評価にはエージェント型ベンチマークが用いられることが増加している。
    • ベンチマークのトランスクリプトには,評価の妥当性を損なう欠陥が存在する可能性がある。
    • 自動化されたトランスクリプト分析によって,ベンチマークの品質を効率的に検証することを目指す。
    • AIスキャナーを用いて,根拠となるデータの不正アクセス,ツールエラー,推測の脆弱性,回答形式の曖昧さといった4種類の欠陥を検出した。
    • 複数のベンチマークで,手動検査では発見が困難な品質問題が特定された。
    • スキャナーの性能はベンチマークや基準によって異なり,更なる改善が必要であることが示唆された。

    Link: https://arxiv.org/abs/2607.27518

  • 近接木とアンサンブル学習によるデータ非依存型ピボタルインスタンス選択モデルの拡張 [cs.LG, cs.AI]目的:解釈可能な予測モデル構築のためのピボットの選択
    • 意思決定が複雑化する中で,機械学習は不可欠なツールとなっている。
    • 既存の手法は解釈が難しく,人間の意思決定との乖離がある。
    • 代表的な事例であるピボットの選択を通じて,解釈性を高める。
    • 提案手法は,ピボット選択技術としても,スタンドアロンの予測モデルとしても機能する。
    • 近接木や斜め木によるピボットペア,アンサンブル学習により,汎用性と効果を高めている。
    • 様々なデータセット(表形式,テキスト,画像,時系列データ)で,既存手法や最新モデルを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27522

  • 大規模金融RAGシステムの階層的再ランキング [cs.IR, cs.AI]目的:金融RAGシステムの検索性能および生成信頼性の向上
    • 金融分析は専門知識と時間を要するが,自動化の需要は高い。
    • 既存のRAGシステムは,金融文書の複雑な構造や大規模データに対応しきれない。
    • 金融データに特化したRAGパイプラインを構築し,精度とスケーラビリティを向上させる。
    • 提案システムは,FinQA,FinanceBench,ConvFinQAなどのベンチマークで高いNDCG@20スコア(0.7918)を達成した。
    • ACM-ICAIF '24 FinanceRAG Challengeにおいて2位入賞し,その堅牢性が確認された。
    • 本研究は,自動監査報告や定量投資分析への応用に繋がる展開可能な金融RAGパイプラインを提示する。

    Link: https://arxiv.org/abs/2607.27523

  • ThreatForest:プラグ可能なTTPフレームワークマッピングによるマルチエージェント攻撃ツリー生成 [eess.SY, cs.SY, cs.CR, cs.AI, cs.CL, cs.SE]目的:クラウドネイティブアーキテクチャに対する攻撃ツリーの自動生成と,それに対応する対策の提示
    • ソフトウェアの安全な開発には脅威モデリングが不可欠であり,クラウド環境でのセキュリティ確保は重要である。
    • クラウドネイティブアーキテクチャの脅威モデリングは手動では時間がかかり,専門知識を持つ人材が不足している。
    • ソースコードから攻撃ツリーを生成し,TTPフレームワークに基づいて具体的な対策を提示することで,脅威モデリングの効率化を目指す。
    • ThreatForestは,ソースコードリポジトリから攻撃ツリーを生成し,MITRE ATT&CK等のTTPフレームワークにマッピングするマルチエージェントシステムである。
    • 脅威モデリングのプロセスを段階的なエージェントパイプラインに分解し,人間による検証ポイントを設けることで,信頼性を高めている。
    • TTPマッピングの精度がボトルネックであり,特に埋め込みエンコーダの性能が課題であることが示された。

    Link: https://arxiv.org/abs/2607.27528

  • 潜在カーネル離散フローマップによる数ステップ生成 [cs.LG]目的:少数ステップでのテキスト生成における性能向上
    • 自然言語生成において,効率的かつ高品質なテキスト生成が求められている。
    • 離散拡散モデルやフローマッチングモデルでは,計算コスト削減のため各ステップが独立して処理され,文法的な依存関係を捉えにくい。
    • 潜在カーネルを用いることで,ステップ間の相関をモデル化し,少ないステップ数で高品質なテキスト生成を実現する。
    • 提案手法LKFは,複数の因子化された成分を共有潜在変数で結びつけることで,相関のあるステップを効率的に表現する。
    • LKFは,One-Billion-WordやWikiText-103のベンチマークにおいて,従来のモデルと比較して生成Perplexityを2.1倍から3.3倍改善した。
    • 成分数Mを増やすことで性能が向上し,M=8では蒸留や修正を用いた少数ステップサンプラーを上回った。

    Link: https://arxiv.org/abs/2607.27529

  • 明示的なビュールーティングはいつ機能するか:マルチビューグラフ-テキストアライメントの制御された研究 [cs.LG]目的:マルチビューグラフ-テキストアライメントにおける明示的なビュールーティングの有効性に関する条件の検証
    • グラフとテキストの組み合わせた検索は,創薬などの分野で重要であり,多様な情報を統合する必要があるため。
    • 既存手法では,複数の側面を持つ情報を一つの埋め込みに統合するため,特定の側面に焦点を当てた検索が困難である。
    • 本研究では,制御された実験設定により,明示的なビュールーティングが有効な条件を明らかにすることを目指す。
    • BBBPおよびBACEデータセットにおいて,正しいルーティングはラベルとプロパティのnDCGを,ランダム化された学習と比較して0.305~0.685向上させた。
    • 期待されるグラフヘッドは,誤ったヘッドよりも0.303~0.453高いnDCGを示し,明示的なルーティングの有効性を示唆する。
    • 単一の結合モデルと,個別に学習された3つの専門モデルを比較した結果,結合モデルの方が高い性能を示したが,汎化性能には限界が見られた。

    Link: https://arxiv.org/abs/2607.27530

  • 戦略,報酬ではない:正規形ゲームの行動埋め込み [cs.GT, cs.AI, cs.LG, cs.MA]目的:LLMにおける戦略的思考能力の転移に関する予測モデル
    • LLMの戦略的タスク学習は,直接的な学習効果を超えた能力変化をもたらすため,そのメカニズム解明が重要である。
    • LLMの戦略的思考能力の転移は予測が難しく,汎化性能が課題となっている。
    • ゲームの埋め込み表現を用いて,LLMの戦略的思考能力の変化を予測することを目指す。
    • 既存の構造的埋め込みはゲームの識別を記憶するのみで汎化性に欠けるのに対し,本研究で提案する行動埋め込みは高い予測性能を示した。
    • 行動埋め込みは,ナッシュ均衡のエントロピーと,相手の行動に対する最適反応の感度という二つの特徴量で構成される。
    • 戦略的思考能力の転移は,ゲームの報酬構造ではなく,意思決定行動の構造によって決定されることが示された。

    Link: https://arxiv.org/abs/2607.27536

  • 減算か再現か:言語モデルの記憶からの正確な削除 [cs.LG, cs.CL]目的:言語モデルの記憶の記録表現方法に依存する正確な削除のメカニズム
    • 大規模言語モデルの性能向上には,記憶の効率的な管理が不可欠である。
    • 既存の手法では,言語モデルの記憶から特定の情報を完全に削除することが困難である。
    • 記憶表現に応じた正確な削除方法を確立し,モデルのプライバシーと安全性を高める。
    • Gemma 3モデルにおいて,サポートベクターメモリを用いることで,減算とキー保持リフィットが次のトークン予測において高い一致度を示した。
    • 48B Kimi Linearハイブリッドモデルでは,加法的な書き込みは固定減算を,対角的な減衰は修正を可能にしたが,デルタ則は記録への寄与を文脈依存にした。
    • チェックポイントを用いた巻き戻しと再現により,臨床記録を正確に削除でき,ロジットと再帰的状態をビットレベルで一致させることが確認された。

    Link: https://arxiv.org/abs/2607.27539

  • メモリ効率の良いテーブル形式のファウンデーションモデル [cs.LG]目的:テーブル形式の機械学習におけるモデルのメモリ要件の軽減
    • テーブルデータは現実世界の様々な場面で広く存在する重要なデータ形式である。
    • ファウンデーションモデルは高性能だが,メモリ消費量が大きく実用上の課題となる。
    • モデル圧縮によりメモリ消費量を削減し,実用的なデプロイメントを可能にすること。
    • モデル圧縮手法を用いることで,性能を維持しつつ最大7.6倍のメモリ削減を達成した。
    • これにより,デプロイメント要件を約87%削減できることが示された。
    • 本研究は,実用環境での効率的なモデルデプロイメントに貢献する知見を提供する。

    Link: https://arxiv.org/abs/2607.27546

  • AIリテラシー:権力知の演習 [cs.AI, cs.CY]目的:AIリテラシーの再概念化
    • 生成AIが知識生産の重要なシステムとなり,そのアクセスと形成に関わる議論が不可欠である。
    • 既存のAIリテラシーは技術的習熟や責任ある利用に偏り,主体的な知識獲得を阻害する。
    • AIシステムへの批判的評価,抵抗,ガバナンスへの参加を促すAIリテラシーの枠組みを提案する。
    • 生成AIへのアクセス格差が既存の認識的不公正を再生産することに着目した。
    • AIリテラシーを,単なるAI利用者の育成ではなく,知識の主体を育む実践と捉え直す。
    • 文脈的利用,批判的吟味,参加型ガバナンスの3要素に基づいたAIリテラシーの枠組みを提示した。

    Link: https://arxiv.org/abs/2607.27547

  • 行動に沿った表現によるクロス具現化転移 [cs.RO, cs.AI, cs.CV, cs.LG]目的:ロボットの多様な具現化間での転移学習における表現の役割
    • ロボットによる複雑な操作を可能にするためには,効率的な学習が不可欠である。
    • 異なるロボット間での転移は難しく,汎用的なロボット操作の実現を妨げている。
    • 具現化に依存しない表現を用いることで,大規模なデータを統合し,転移性能を向上させる。
    • 行動に沿った表現(特にエンドエフェクタ軌跡)は,クロス具現化転移において有効であることが示された。
    • 表現の有用性は,事前学習に使用するデータセットの規模に依存する傾向がある。
    • シミュレーションで事前学習したポリシーを実機に適用することで,タスク完了率が28%向上することが確認された。

    Link: https://arxiv.org/abs/2607.27549

  • イノベーションにおけるアイデア創出への大規模言語モデルの活用 [cs.AI, cs.CL, econ.GN, q-fin.EC]目的:新規製品アイデアの創出における大規模言語モデルの有効性
    • 新製品開発は企業の成長に不可欠であり,市場競争力を維持するための重要な活動である。
    • 既存のアイデア創出手法は,時間やコストがかかる場合があり,多様なアイデアを生み出すことが難しい。
    • 本研究は,大規模言語モデルを活用することで,効率的かつ質の高いアイデア創出が可能となるか検証する。
    • AI生成のアイデアは,平均的な購入意向において,人間が生成したアイデアを上回る結果が得られた。
    • 特に,Few-shotプロンプティングによるAI生成アイデアは,Zero-shotプロンプティングよりも高い購入意向を示した。
    • しかし,AI生成アイデアは新規性が低いと認識され,アイデア間の類似性が高い傾向が見られた。

    Link: https://arxiv.org/abs/2607.27553

  • 機能,証拠,検証によるエージェント型バイオインフォマティクスの評価 [cs.AI, cs.MA]目的:エージェント型バイオインフォマティクスの説明責任の運用化
    • バイオインフォマティクス研究の加速化に貢献する自動化ツール需要が高まっている
    • エージェント型システムのワークフローの透明性や検証が不十分である
    • ワークフローの正確性を評価基準として導入し,説明責任を担保すること
    • 機能,証拠,検証(FEV)フレームワークを導入し,109のシステムと28のリソースを評価した。
    • 計画とツール実行は進んでいるが,再現性,検証,将来的な検証が遅れていることがわかった。
    • エージェント型バイオインフォマティクスは,最終的な答えの正しさだけでなく,ワークフローの正確性で評価されるべきである。

    Link: https://arxiv.org/abs/2607.27556

  • ラスター2D CAD図面からのパラメトリックCADコード生成のためのアノテーション接地:Drawing-Recode [cs.CL, cs.CV, cs.AI]目的:パラメトリックCADコードの生成
    • デジタル化以前の2D CAD図面を再利用し,部品の複製や製造プロセスの自動化に貢献する。
    • 既存研究はベクトル図面のみ処理するか,特定の分野に限られ,寸法情報を活用できない。
    • 寸法情報と幾何学的情報を結びつけ,2D CAD図面からパラメトリックCADコードを生成する。
    • Drawing-Recodeは,画像エンコーダーとテキスト認識モジュールを用いて幾何学的特徴とアノテーションを抽出する。
    • クロスアテンションと提案するアノテーション接地損失(AGL)を用いてアノテーションと幾何学的情報の関係を明示的に確立する。
    • 大規模言語モデル(LLM)に特徴を入力し,構造化パラメトリックCADコード(SPCC)形式のCADコードを生成する。

    Link: https://arxiv.org/abs/2607.27558

  • 深層リサーチエージェントシステム [cs.CE, cs.AI]目的:深層情報検索,多段階推論,自律的研究タスク
    • 複雑な情報から知識を獲得する研究は,学術,産業界において不可欠である。
    • 既存システムは,計算コストが高く,長文脈処理の精度が課題であった。
    • 効率性と精度を両立し,複雑な研究タスクを自律的に遂行すること。
    • 本システムは,疎な活性化アーキテクチャにより,高速な推論と高い性能を実現した。
    • 128Kトークンの長文脈に対応し,既存手法を上回る精度と再現率を示した。
    • 多様なツール連携,強化学習による最適化,データ合成パイプラインにより,高い汎用性と安定性を実現した。

    Link: https://arxiv.org/abs/2607.27562

  • 複数活動環境下におけるマイルストーン駆動型スタートアップの戦略 [cs.LG, math.OC, math.PR, stat.AP, stat.ML]目的:マイルストーン達成を目指すスタートアップの戦略
    • 新規事業は,マイルストーン達成を通じて成長する必要があり,その戦略が重要である。
    • 多岐にわたる活動から最適な戦略を選択することが難しく,その判断基準が不明確である。
    • リスクとコスト効率を考慮した活動評価指標に基づき,最適な戦略を明確にすること。
    • 本研究では,最適な戦略が「効率的フロンティア曲線」によって特徴付けられることを示した。
    • この曲線は,活動のリスクとコスト効率を直感的に比較評価することを可能にする。
    • モデルパラメータによってはフロンティア曲線の種類が異なり,最適な戦略が大きく変化する。

    Link: https://arxiv.org/abs/2607.27563

  • 表面筋電図を用いたクロスユーザージェスチャー認識のためのモンタージュ非依存エンコーダ [cs.LG, cs.HC]目的:表面筋電図からのクロスユーザージェスチャー認識
    • 筋電義肢は,多くの意図されたジェスチャーに応答できる可能性を秘めている。多様な制御が求められている。
    • 個人ごとに訓練された認識器は,他の個人に転移しにくく,再キャリブレーションが必要となる場合が多い。
    • モンタージュに依存しないエンコーダを導入し,ユーザー間の汎化性能向上を目指す。
    • 提案手法は,DB1において,既存手法と比較して,保持された全ての被験者に対して0.234のmacro-F1スコアで上回った。
    • DB2においても0.108の改善が見られたが,DB5では既存手法を下回った。
    • エンコーダの主要コンポーネントは,3-shot macro F1においてそれぞれ半分以上の貢献をしていることが確認された。

    Link: https://arxiv.org/abs/2607.27565

  • 表面筋電図ジェスチャ認識におけるセッション間認識とラベルフリー適応 [cs.LG, cs.HC]目的:表面筋電図を用いたジェスチャ認識におけるセッション間認識の向上
    • 筋電信号による制御は,身体機能に困難を抱える人々の生活の質を向上させる可能性を秘めている。
    • 筋電信号は日々の変動が大きく,セッション間で認識精度が低下することが課題となっていた。
    • 本研究は,再キャリブレーションなしにセッション間の認識精度を維持することを目指している。
    • 提案手法は,ユーザーごとのLDA分類パイプラインと比較して,macro-F1スコアが0.688に対して0.540を維持した。
    • 既存手法と比較して,セッション間での性能低下を抑制し,良好な結果を得ることが示された。
    • 特徴統計量の調整により,新たなセッションへの適応が可能となり,1回のキャリブレーションに匹敵する効果が確認された。

    Link: https://arxiv.org/abs/2607.27568

  • ポリシー勾配による操舵:行動目標からの介入 [cs.LG, cs.MA]目的:モデルの行動を動的に変化させる操舵手法の開発
    • 大規模言語モデルの挙動制御は,多様なタスクへの適応に不可欠である。
    • 既存の操舵手法は,単純な環境下でも期待通りの操舵性能を示さない。
    • 行動目標に基づいた強化学習を用いて,より効果的な操舵手法を確立する。
    • 提案手法であるPGSは,一時的な行動目標の勾配を蓄積することで,取り外し可能なタスクベクトルを構築する。
    • PGSは,2ルートのグリッドワールド環境において,その較正と可逆性を示すことができた。
    • チェスのパズルや競技フットボールにおいて,特定のチーム行動の変更や,相手チームへの効果の転移を確認した。

    Link: https://arxiv.org/abs/2607.27574

  • 産業規模レコメンダーシステムにおける異種ランキング:ケーススタディ [eess.SY, cs.SY, cs.IR, cs.LG]目的:異種コンテンツを扱う産業規模のレコメンダーシステムにおけるランキング性能の向上
    • 多様な情報源からのコンテンツを提供するレコメンダーシステムは,情報アクセスを効率化し,ユーザー体験を向上させる上で不可欠である。
    • 異種コンテンツ間の特徴量密度やユーザーインタラクションパターンの違いにより,統一的なランキングモデルの構築が困難である。
    • 異種コンテンツの特性を考慮し,負の転移や多数派バイアスを回避しつつ,高いランキング性能を維持する手法を開発する。
    • HA-MoEは,異質性のコンテキストをゲートネットワークとエキスパート表現の両方に組み込んだ,異質適応型マルチゲート混合エキスパートアーキテクチャである。
    • LENSは,エキスパートの専門化の解釈可能な診断を提供し,継続的な再学習における機能的な異質性を追跡する軽量な可視化フレームワークである。
    • オフライン評価とオンラインA/Bテストの結果から,提案手法が産業規模レコメンダーシステムにおける異質性の管理に有効であることが確認された。

    Link: https://arxiv.org/abs/2607.27577

  • プロンプトをグラフとするもの:プロンプトグラフエンジニアリングの必要十分条件 [cs.AI]目的:プロンプトグラフエンジニアリングの定義と,その構成条件
    • 大規模言語モデルの応用範囲拡大に伴い,複雑な処理フローの管理が重要になっている。
    • プロンプトの連鎖や分岐といった処理を構造化する共通の概念や語彙が不足している。
    • プロンプトをノードとする実行可能なグラフ構造の明確な定義と,そのエンジニアリング手法を確立すること。
    • 本研究では,データフローグラフ等の先行研究を分析し,プロンプトグラフエンジニアリングの概念を再構築した。
    • プロンプトグラフエンジニアリングの構成条件として,明示的な構造,構造と内容の分離,実行可能な意味論,およびグラフを第一級のエンジニアリング成果物とすることの4つを提示した。
    • 提示した定義と条件を用いて,LangGraphやDSPyを含む6つの実システムに対し,包含・除外テストを実施し,整合性のある結果を得た。

    Link: https://arxiv.org/abs/2607.27578

  • 心からモデルへ:心理学とLLMの挙動の交差点 [cs.AI]目的:LLMにおける人種条件ごとの感情の違いの検証
    • LLMの意思決定は複雑で解釈が難しく,人間の認知プロセスとの類似性が指摘されている。
    • LLMの内部動作は不透明であり,潜在的な偏りや公平性の問題が懸念されている。
    • 心理学的手法を用いてLLMの挙動を評価し,潜在的なバイアスを明らかにすることを目指す。
    • ChatGPTに対し,人種条件を変えたプロンプトを提示し,感情スコアを分析した結果,わずかな人種条件による感情の主効果が認められた。
    • しかし,より厳密な分析ではこの効果は消失し,有意な差は見られなかった。
    • 感情スコアによる評価は,評価バイアスとプロンプトによって引き出される歴史的コンテンツの感情価別を区別できないという課題が示された。

    Link: https://arxiv.org/abs/2607.27579

  • MUGEN:効率的な動作理解と生成のための統合フレームワーク [cs.LG]目的:動作と言語の間の関係性に基づいた,物理AIシステムの実現
    • 人間のような行動を理解・生成するAIは,ロボット工学や人間-コンピュータ間のインタラクションにおいて不可欠である。
    • 従来の離散的な動作コードブックは,生成品質を制限しており,高品質な生成にはコストがかかる。
    • MUGENは,動作と言語を効率的に統合し,高品質な動作生成と理解を同時に実現することを目指す。
    • MUGENは,コードブックを用いず,単一の連続潜在空間表現を活用することで,従来のモデルよりも効率的な動作生成を可能にする。
    • HumanML3Dデータセットにおいて,FIDスコアが向上し,参照モーションに対する検索精度も改善された。
    • SnapMoGenデータセットでは,検索およびアライメントのすべての指標において,従来の離散トークンベースの手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27581

  • GenAIソリューションの評価より解決が優れているか? [cs.CY, cs.AI]目的:GenAIソリューションの評価と従来の課題解決の効果の比較
    • 計算教育においてGenAI活用が広がる中,教育手法の探求が重要である。
    • GenAIによる課題解決能力向上に伴い,評価・検証・批判的思考の重要性が認識されている。
    • GenAIソリューションの評価が,学生の学習成果に与える影響を明らかにすること。
    • GenAI生成ソリューションの評価と従来の課題解決において,成績に有意な差は認められなかった。
    • 課題の評価においては成績が向上したが,期末試験などの総合的な評価には繋がらなかった。
    • 学習戦略を適応させた学生は,GenAI評価課題をより有益だと評価した。

    Link: https://arxiv.org/abs/2607.27586

  • 大規模言語モデルにおける近似中間チャネル重要度を用いた学習不要なFFN活性疎性 [cs.LG, cs.CL]目的:大規模言語モデルにおけるFFN活性の疎性化
    • 大規模言語モデルの推論において,FFNはメモリトラフィックと計算量の大部分を占めるため,最適化が重要である。
    • 既存の学習不要な疎性化手法は,高い疎性化率でモデル品質が低下するという課題がある。
    • SwiGLU中間状態のチャネル選択信号を活用し,高精度な疎性化を実現することを目指す。
    • Proxは,入力疎性と量子化されたプロキシ重みを用いて共有マスクを構築する二段階フレームワークである。
    • Proxは,既存の学習不要な手法と比較して,すべての疎性化レベルで性能が向上する。
    • Proxは,70%のFFN疎性化率で最大1.99倍のデコーディング速度向上を達成し,量子化や疎な注意機構との互換性も有する。

    Link: https://arxiv.org/abs/2607.27591

  • コンプライアンス2LoRA:ハイパーネットワーク生成LoRAアダプターによる任意のポリシー部分集合に対するオンデマンドな安全性調整 [cs.LG]目的:大規模推論モデルの安全性調整に関する研究
    • 大規模言語モデルの安全性確保は,社会実装において不可欠であり,その重要性は増している。
    • ユーザーごとに異なる安全性ポリシーへの対応が求められるが,モデルを個別に学習するのは非効率である。
    • ハイパーネットワークを活用し,単一のモデルで多様なポリシーに対応する効率的な手法を提案する。
    • 提案手法は,ハイパーネットワークを用いてLoRAアダプターを生成し,指定されたポリシーに準拠した応答を可能にする。
    • 異なるサイズのモデルや評価データセットにおいても,タスク性能を損なうことなく,ポリシー調整が可能であることを示した。
    • 適応的ハイパーネットワークに基づく安全性調整は,大規模言語モデルにおいて効果的かつ実用的である。

    Link: https://arxiv.org/abs/2607.27594

  • 類似性を超えて:古典中国史におけるテクスト間相互参照の根拠に基づいたエージェント的抽出と専門家による評価 [cs.CL, cs.AI, cs.DL]目的:古典中国史におけるテクスト間相互参照の抽出と評価
    • 古典史料の解釈において,テクスト間の引用・参照関係の正確な把握は重要な課題である。
    • 既存の手法では,テキスト間の類似性を数値化するのみで,引用・参照の意図や機能が不明確である。
    • 本研究は,言語モデルを用いて,引用・参照の根拠と種類を詳細に分析し,解釈の精度向上を目指す。
    • 言語モデルによる相互参照抽出の精度は,56%から93%を示し,モデルによってコストと品質に差が見られた。
    • 専門家による評価では,テキスト表面で判読可能な要素の認識は一致率が高かったが,意図の推論を要する要素では意見が分かれた。
    • 二十四史全体を分析した結果,引用の構成は18世紀にわたって安定していたものの,逐語的な引用は減少傾向にあった。

    Link: https://arxiv.org/abs/2607.27595

  • ビジョン言語モデルを活用したUAVによるトリアージと災害対応のためのシステムエンジニアリングフレームワーク [cs.RO, cs.AI, cs.SY, eess.SY]目的:災害対応におけるUAVを用いたトリアージと災害対応のためのシステムエンジニアリングフレームワークの実現
    • 災害時における迅速な状況把握と対応は,人命救助と被害軽減に不可欠である。
    • 従来の災害対応支援システムは,主に情報提供に留まり,実効的な連携と行動に繋がりにくい。
    • ビジョン言語モデルを連携エージェントとして組み込み,人間とUAVの協調体制を強化することを目指す。
    • 提案フレームワークは,自然言語による対話,ミッションレベルでのタスク連携,シミュレーション環境での検証を通じて,人間とUAVの協調を実現した。
    • 予備的な人間工学評価では,精神的負担の軽減,AIに対する信頼性の向上,コミュニケーションの明確性に対する高い評価が得られた。
    • 本研究は,モデルベースドシステムエンジニアリング,ソフトウェアインザループテスト,人間工学評価を統合することで,高リスクな災害対応におけるスケーラブルな人間・自律エージェント連携を推進する。

    Link: https://arxiv.org/abs/2607.27597

  • 配線図の抽出と連結:3Dデータを用いたフィギュアスケートジャンプの分類に関するケーススタディ [cs.AI, cs.LG]目的:フィギュアスケートジャンプの分類
    • スポーツ科学や動作解析において,人間の複雑な動きの理解は重要である。
    • シーケンシャルデータに対するHasseクラスタリングは計算量が増大し,大規模データには適用が困難である。
    • 配線図の連結理論により,大規模データのHasseクラスタリングを効率的に行うことを目指す。
    • 配線図の連結理論は,Hasseクラスタリングの反復適用を可能にし,単一の適用と同等の結果を得る。
    • この理論は,フィギュアスケートジャンプの動画分類において検証された。
    • 実験結果は,本理論が大規模データセットへのHasseクラスタリング適用可能性を向上させることを示唆している。

    Link: https://arxiv.org/abs/2607.27598

  • ワールドアクションプランナー:行動条件付きワールドモデルによる汎化可能な意思決定 [cs.AI, cs.RO]目的:多様な応用における汎化可能なエージェントの構築
    • 多様な環境への適応が求められるロボット工学において,汎化性能は重要な課題である。
    • 模倣学習に基づく既存手法は,未知の環境やタスクへの対応が困難である。
    • 視覚言語モデルとワールドモデルを活用し,汎化性能の高いプランニングシステムを開発する。
    • 提案手法は,合成タスク,新しいレイアウト,ゼロショット汎化において,最先端のend-to-endポリシーモデルを大幅に上回る性能を示す。
    • 行動条件付きワールドモデルを用いて,計画の提案と改善を繰り返すことで,ロバストな意思決定を可能にする。
    • 視覚言語モデルの推論能力と,物理的な制約を考慮したワールドモデルの組み合わせが有効であることを示す。

    Link: https://arxiv.org/abs/2607.27599

  • 未来からの帰還:反事実的驚きによるキーバリューキャッシュ管理 [cs.LG]目的:キーバリューキャッシュ管理における圧縮と削除戦略
    • 大規模言語モデルの計算コスト削減は,効率的な推論に不可欠である。
    • キャッシュサイズがコンテキスト長に比例して増加し,GPUメモリを圧迫する。
    • 過去のトークンが将来のトークンから予測可能な場合,キャッシュから削除する。
    • 提案手法は,反事実的な注意メカニズムを用いて,キャッシュ内の冗長な情報を特定し,削除する。
    • 単層近似により計算コストを削減し,高い推論速度を維持しつつ,既存手法と同等またはそれ以上の性能を達成した。
    • この手法は追加の学習を必要とせず,実際のキャッシュ内容に直接対応している点が特徴である。

    Link: https://arxiv.org/abs/2607.27600

  • グラフに基づく交通予測における敵対的頑健性の再検討 [cs.CR, cs.AI]目的:グラフベースのAIによる交通予測の敵対的頑健性
    • 交通予測は,インテリジェント交通システムの重要な要素であり,その安全性確保が不可欠である。
    • 既存の研究では現実的でない脅威モデルや無差別な攻撃目標が用いられており,実用的な評価が不足している。
    • 限られた知識と操作可能なセンサーのみを持つ実用的な攻撃に対する防御メカニズムを確立すること。
    • 物理法則に基づいた攻撃は特定のリンクのエラーを大幅に増加させるが,ネットワーク全体への影響は小さいことが示された。
    • 敵対的学習による防御は,物理法則に基づいた攻撃に対して十分な効果を発揮せず,既存手法の限界が明らかになった。
    • 提案する検出・緩和防御は,15のモデル・データセット設定の13個で効果を発揮し,既存手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27604

  • カルマンフィルタとカリキュラム:適応型強化学習ファインチューニングのための効率的な動的プロンプト選択 [cs.AR, cs.LG]目的:強化学習による大規模言語モデルのファインチューニングにおける適切な難易度のプロンプト選択
    • 大規模言語モデルの推論能力向上に,強化学習によるファインチューニングが有効である。
    • プロンプトの難易度は学習中に変化するため,適切な難易度のプロンプト選択が課題となる。
    • プロンプト選択を動的な状態推定問題として捉え,学習の非定常性を考慮した手法を提案する。
    • 提案手法KGPSは,プロンプトの潜在的な成功率を線形ガウス状態空間モデルで表現し,ポリシーの更新に応じて不確実性を増大させる。
    • カルマンフィルタを用いて難易度の推定を行い,中間難易度のプロンプトを選択することで,学習効率と精度を向上させる。
    • 数学,計画,幾何学等の様々なベンチマークで,既存手法を上回る性能が確認された。

    Link: https://arxiv.org/abs/2607.27610

  • DualAnchor:言語事前知識の維持と手話翻訳における語彙的忠実性の向上 [cs.CL, q-fin.RM, cs.CL, cs.AI]目的:手話動画から口語テキストへの変換における言語事前知識の維持と語彙的忠実性の向上
    • 近年,手話翻訳は発展しており,聴覚障害者と健聴者のコミュニケーションを円滑にする上で重要である。
    • 既存の手話翻訳モデルは,言語モデルの能力を十分に活用できず,流暢性に欠ける翻訳が生じやすい。
    • 言語事前知識の劣化と語彙的忠実性のギャップを解消し,より自然で正確な手話翻訳を実現することを目指す。
    • 提案手法DualAnchorは,PHOENIX-2014TとCSL-Dailyの両データセットにおいて,高い翻訳性能を示した。
    • Token-level Prior Anchoring (TPA) は翻訳の流暢性を向上させ,Optimal Transport Alignment (OTA) は語彙レベルでの誤りを減少させた。
    • 両アンカーの相乗効果により,言語事前知識の維持と視覚的な忠実性を両立する翻訳が可能となった。

    Link: https://arxiv.org/abs/2607.27614