arXiv雑要約

AI - 2026/07/31 公開

  • RedFlow:フローマッチングVLAポリシーにおける失敗からの行動レベルの修正 [cs.RO, cs.AI]目的:フローマッチングVLAポリシーの行動レベルでの修正
    • ロボット操作において,視覚と言語と行動を統合するVLAポリシーの重要性が増している。
    • 実環境での展開時に,分布の変化による誤差の累積が課題となっている。
    • 失敗データを活用し,効率的にポリシーを改善することで,頑健性を高める。
    • RedFlowは,失敗経験を行動レベルの修正指示に変換するオフラインRLフレームワークである。
    • コンテキストを考慮した修正マッチングにより,失敗を引き起こす行動を特定し,代替行動を学習する。
    • 実世界での成功率が56.7%から74.7%に向上し,既存手法を上回った。

    Link: https://arxiv.org/abs/2607.27782

  • 推論コンセンサス:重み付き有向非巡回グラフ集約によるLLM推論構造のアンサンブル [cs.CL, cs.AI, cs.LG]目的:LLMの推論構造のアンサンブル
    • 大規模言語モデルの活用が,様々な分野で重要性を増している。
    • LLMの推論過程が不透明であり,根拠や代替案の評価が困難である。
    • LLMの推論構造を可視化し,より信頼性の高い結論を導くことを目指す。
    • 複数のLLMの推論構造をグラフ化し,重み付けによって統合する手法を提案した。
    • 提案手法は,6つのベンチマークにおいて,多数決ベースラインを上回る性能を示した。
    • アンサンブルの重みと,LLMによる推論品質のランキングとの間に相関関係が認められた。

    Link: https://arxiv.org/abs/2607.27783

  • LoRAスキャフォールド付き方策最適化 (LSPO): ゼロ報酬の崖プロンプトに対する勾配回復のためのサンプリング時間低ランクスキャフォールド [cs.RO, cs.LG, cs.AI]目的:数学的推論における検証可能な報酬からの強化学習における課題克服
    • 数学的推論における強化学習は,高度な問題解決能力を自動化する上で重要である。
    • 従来の強化学習は,特に「崖プロンプト」と呼ばれる全ロールアウトが失敗する問題に対して,勾配がゼロになるという問題を抱えている。
    • 本研究は,崖プロンプトにおける勾配消失問題をLoRAスキャフォールドで解決し,モデルの能力限界における学習を可能にする。
    • LSPOは,崖プロンプトを検出し,正解データによる短い教師あり学習でLoRAアダプターを適合させる。
    • 適合させたモデルで崖プロンプトを再ロールし,重要度サンプリング補正を施した結果を強化学習バッチに組み込むことで,勾配を回復する。
    • DeepMath-103Kデータセットでの実験により,LSPOはDAPOベースラインを16の評価項目全てで上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27787

  • SpecCal:赤外スペクトルに基づく分子構造再構成における曖昧性認識候補校正 [cs.AI, cs.CE]目的:赤外スペクトルに基づく分子構造再構成における候補分子の校正
    • 分子構造の推論は化学や創薬において不可欠であり,赤外スペクトルはその重要な情報源である。
    • 赤外スペクトルは情報量が限られており,類似の分子が類似のスペクトルを示すため,構造復元は曖昧になりやすい。
    • 既存モデルの生成傾向に依存した候補群の偏りを修正し,スペクトル制約を満たす構造をより網羅的に探索する。
    • SpecCalは既存のベースモデルと組み合わせて利用可能であり,モデルのパラメータ更新を必要としない。
    • 複数のベンチマークにおいて,SpecCalはSMILESおよびスキャフォールドレベルの両方で,トップk再構成の精度を向上させた。
    • スペクトル曖昧性下での候補群校正は,赤外スペクトルからの分子再構成の精度を実質的に向上させる有効な方法である。

    Link: https://arxiv.org/abs/2607.27788

  • マルチモーダル感情分析のための意味的に整合した構造的抽象化 [cs.IR, cs.CL, cs.AI]目的:マルチモーダル感情分析における構造的抽象化による感情表現の抽出と理解
    • 人間は言語と非言語の両方から感情を読み取るため,両者を統合した分析が重要である。
    • 既存手法では,非言語情報の構造的な変化や文脈的相互作用から生じる感情の意味を捉えきれない。
    • 非言語情報を意味的に豊かなトークンに変換し,LLMによる感情理解を促進することを目的とする。
    • 提案手法SentiLLMは,テキストの事前知識に基づいて感情の変化に焦点を当てながら,背景状態との関係性を捉えることで,非言語情報を意味空間に投影する。
    • SentiLLMは,わずかな学習パラメータで識別性能を大幅に向上させ,MOSI,MOSEI,CH-SIMS,CH-SIMS v2の各データセットで優れた性能を示した。
    • 構造的抽象化パラダイムが,マルチモーダル感情分析において有効であることが実証された。

    Link: https://arxiv.org/abs/2607.27790

  • 裁判手続きからの法的洞察の注釈 [cs.AI]目的:法的洞察の概念抽出
    • 法務分野において,構造化された文書表現は,単純なテキスト表現より処理能力を大幅に向上させる。
    • 既存のオントロジーがない場合,法的概念の注釈作業は困難を伴う。
    • 新たな概念を動的に定義可能な注釈システムを構築し,法的文書の概念抽出を支援する。
    • LeDAシステムを開発し,ウェブインターフェースを通じて法的概念の注釈と調整を実現した。
    • LeDAは,既存のオントロジーに依存せず,注釈者が文書を調査する中で概念を新たに定義できる。
    • インド最高裁判所の裁判手続きから法的概念名を注釈し,セマンティックな文書表現の構築に貢献した。

    Link: https://arxiv.org/abs/2607.27792

  • 基盤モデルの時代における予測型プロセス監視の再検討:系列,テーブル,LLMアプローチの比較研究 [cs.LG]目的:予測型プロセス監視における系列モデル,テーブルモデル,LLMの性能比較
    • 業務プロセスの効率化が重要視される中で,プロセスの現状を把握し,将来を予測する技術の必要性が高まっている。
    • 従来の深層学習モデルは学習に時間がかかり,新しいタスクへの適応が難しいという課題があった。
    • 基盤モデルを活用することで,より迅速かつ柔軟な予測型プロセス監視を実現し,業務改善に貢献することを目指す。
    • 次の活動予測においては,系列モデルが常に最良の性能を示した。
    • 時間に関する予測タスクにおいては,テーブル基盤モデルが競争力を持つことが示された。
    • LLMはコストが高いにも関わらず,多くの場合,他のモデルに劣る結果となった。

    Link: https://arxiv.org/abs/2607.27797

  • MemeBench:文化依存型ミームの解釈においてLVLMが見落とすもの [cs.AI]目的:文化依存型ミームの解釈における大規模視覚言語モデルの課題と改善策
    • 視覚言語モデルの性能向上は目覚ましいが,文化的知識を要するミーム解釈には限界がある。
    • 既存のミーム評価はラベルやスコアに偏り,解釈のどこで失敗しているか特定しにくい。
    • ミーム解釈の失敗箇所を特定し,知識に基づいた改善策の有効性を検証する。
    • MemeBenchは,1253件の英語・中国語ミームを用いて,視覚的要素,関連性,知識,推論メカニズムを詳細に分析する。
    • 26のLVLMにおいて,モデルは視覚的情報よりも知識に基づいた解釈で課題を抱えており,その差は22.6%に達する。
    • カルチャーベースを活用したKARは,VIKR Successを3.6-7.4%向上させたが,視覚的情報の網羅性は低下した。

    Link: https://arxiv.org/abs/2607.27798

  • 遅延を伴う線形集約における学習増強およびランダム化アルゴリズム [cs.LG, cs.CC]目的:遅延を伴う線形集約における学習増強およびランダム化アルゴリズムの性能評価
    • オンラインアルゴリズムは,逐次的にデータが到着する状況で意思決定を行う必要があり,様々な応用分野で重要である。
    • 従来のオンラインアルゴリズムは,最悪ケースの性能が限界があり,特に不利な状況下で性能が低下する。
    • 学習増強アルゴリズムは,過去のデータから学習することで,従来のアルゴリズムの性能を向上させることを目指す。
    • 提案する学習増強型バランスアルゴリズムは,$\lambda$ の値に応じて,ロバスト性と整合性が保証される。
    • ランダム化アルゴリズムは,従来の決定論的アルゴリズムよりも優れた競争率を示す。
    • 学習増強とランダム化を組み合わせたアルゴリズムは,ロバスト性と整合性の両面で改善された性能を発揮する。

    Link: https://arxiv.org/abs/2607.27807

  • 借りられた歴史を超えて:インタラクティブなロールプレイング評価のための人物に合わせたユーザーシミュレーション [cs.NI, cs.CL, cs.AI]目的:インタラクティブなロールプレイングにおける評価手法
    • 大規模言語モデルの応用範囲拡大に伴い,ロールプレイングエージェントの性能評価が重要になっている。
    • 既存の評価方法では,対話履歴に依存し,ユーザーの多様な経験や満足度を考慮できない。
    • ユーザーの個性と評価基準に合わせた,より適切なロールプレイングエージェントの評価を目指す。
    • PALATEは,300のキャラクタープロファイルを用いたユーザーシミュレーターによる大規模なロールプレイングエージェントのベンチマークである。
    • パーソナライズされた評価基準は,一般的な評価基準よりも人間の判断との一致度が高いことが示された。
    • PALATEは,特定のユーザーとロールプレイングエージェントの組み合わせに対する評価を行い,ユーザー体験に合わせた詳細な分析を可能にする。

    Link: https://arxiv.org/abs/2607.27816

  • LLMにおけるステレオタイプ性の発見:STEREODISCO [cs.AI, cs.LG]目的:LLMにおけるステレオタイプの表現と伝播のメカニズムの解明
    • LLMの発展に伴い,社会的な偏見やステレオタイプを増幅する可能性が懸念されている。
    • 既存研究は限定的な範囲の軸に焦点を当て,LLM内部のステレオタイプ表現の全貌が不明である。
    • LLM内部表現における多様なステレオタイプ軸を特定し,その特性を明らかにすること。
    • STEREODISCOにより,WordNet由来の約2,000の候補軸をLLMの活性化空間で評価した。
    • LLAMA-3-8B-INSTRUCTとMISTRAL-7B-INSTRUCTは,社会集団に関する評価において人間よりも一致度が高かった。
    • 謙虚 vs. 傲慢,偏狭 vs. 広大など,既存研究で未調査のステレオタイプ軸が発見された。

    Link: https://arxiv.org/abs/2607.27824

  • 手話質疑応答:手話理解のための新たなタスク,ベンチマーク,およびベースライン [cs.AI, cs.CV]目的:手話動画に対する自然言語による質問応答能力の評価
    • 手話理解技術は,手話通訳や検索など,コミュニケーション支援に不可欠である。
    • 既存の手話理解タスクは,固定的な変換に偏り,意味理解の深さを測れない。
    • 手話動画の内容をより柔軟かつ包括的に理解できる評価手法を確立する。
    • 新たなタスクである手話質疑応答(SLQA)を提案し,手話動画の意味理解能力を評価するフレームワークを構築した。
    • PHOENIX14TとCSL-Dailyを基盤とした2つのベンチマークSignQAを構築し,質問と回答のペアを自動生成した。
    • 質問条件に基づいた時系列ダウンサンプリングモジュールとドメイン知識転移戦略を導入したベースラインモデルが,既存のモデルを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27826

  • MemTxn:エージェントメモリにおけるソースサポート更新と完全状態復旧のためのトランザクション境界 [cs.AI, cs.CL]目的:エージェントメモリにおける信頼性のある更新と復旧のためのトランザクション境界
    • 大規模言語モデルエージェントの長期的な情報利用を可能にする持続性メモリの重要性が増している
    • 書き込み可能なメモリのエラーが永続化し,将来の動作を損なう可能性がある
    • ソースによる更新のサポート確認と状態復旧メカニズムを確立し,信頼性を向上させる
    • MemTxnは,ソースによる更新のサポート検証,競合時のバージョン選択,障害後の状態復元を実現する
    • 項目分離監査において,60件の有効な更新を受け入れ,179件の無効な更新を拒否することに成功した
    • LongMemEval-SとLoCoMoの状態において,物理的な書き込みセットを知らなくても完全な状態を復旧できた

    Link: https://arxiv.org/abs/2607.27834

  • SAFViT:Vision Transformer 기반 핵セグメンテーションと分類のための空間的注意融合ゲーティング [cs.CV, cs.AI]目的:細胞核のセグメンテーションと分類における精度向上
    • デジタル病理において,定量的な組織分析は診断と治療計画に不可欠である。
    • 従来のスキップコネクションは空間的位置を平等に扱い,冗長または矛盾した情報が伝わる。
    • SAFゲーティングにより,信頼性の高い特徴抽出と少数クラスの検出精度向上を目指す。
    • SAFゲーティングは,PanNukeデータセットにおいて最高のmPQ(0.471)を達成した。
    • 特に,DeadクラスのF1スコアが14.5ポイント向上し,mPQの改善に大きく貢献した。
    • 6つのゲーティング手法と比較した結果,SAFゲーティングが最も優れた性能を示した。

    Link: https://arxiv.org/abs/2607.27835

  • マージン崖の克服:マージン較正による再学習に強いLLMアンラーニングへ [cs.AI]目的:大規模言語モデルのアンラーニングにおける再学習攻撃への脆弱性の克服
    • 大規模言語モデルは有用だが,プライバシー保護やモデル更新において,不要な情報を効率的に削除する技術が重要である。
    • 既存のアンラーニング手法は,再学習攻撃に対して脆弱であり,削除された情報を容易に回復されてしまうという問題がある。
    • マージン較正という手法を用いて,アンラーニング時の損失関数の飽和を防ぎ,再学習攻撃に対する耐性を向上させることを目指す。
    • アンラーニング手法におけるトークンごとの回答マージンが,保持参照値付近に集中する「マージン崖」と呼ばれる現象を観察した。
    • マージン較正は,保持参照値のマージンに非飽和マージンヒンジを追加することで,アンラーニング側の圧力を回復させ,再学習攻撃に対する耐性を向上させる。
    • 様々なデータセットとモデルサイズにおいて,マージン較正は既存手法を上回り,攻撃後のROUGE-Lスコアを大幅に改善し,会員情報の漏洩リスクも低減した。

    Link: https://arxiv.org/abs/2607.27836

  • 仮想プロセスドシエ:プロセス認識型データカタログ [cs.AI]目的:ワークフローの系統とデータカタログ
    • 製造業等の複雑なプロセスでは,データの品質管理とトレーサビリティが重要である。
    • プロセスデータは分散し,どのデータがどの工程で生成されたか不明瞭になりがちである。
    • プロセスデータと系統を統合的に管理し,AI活用を促進することを目指す。
    • 仮想プロセスドシエ(VPD)は,ナレッジグラフベースのデータカタログであり,ワークフローの系統を捉える。
    • VPDは,製造業における多段階プロセスにおいて,AI最適化タスクに必要なデータセットを明確化する。
    • VPDのオントロジー,フレームワーク,ユーザーインターフェースが開発され,GitHubで公開されている。

    Link: https://arxiv.org/abs/2607.27840

  • FeatFix:検証済みの局所的な正確な特徴の再利用による,高速なキャッシュ拡散推論 [cs.CV, cs.LG]目的:キャッシュ拡散推論における局所的な正確な特徴の修正手法
    • 拡散モデルは高品質な画像・動画生成に広く利用されている。計算コストが課題であり,高速化が求められている。
    • 既存手法では,中間特徴の再利用や予測によりコスト削減を図るが,ドリフトの抑制に課題がある。
    • 検証時に計算される正確な特徴を再利用し,局所的な修正を行うことで推論速度を向上させる。
    • FeatFixは,選択されたレイヤー・タイムステップにおいて,完全なドラフトブロック出力を正確な出力に置き換える。
    • この手法により,トークンレベルやチャネルレベルでの部分的な置換,または完全なタイムステップの再計算を回避する。
    • 画像および動画のバックボーン4種類での実験により,FeatFixが生成を最大6.70倍に高速化し,出力品質を維持することが示された。

    Link: https://arxiv.org/abs/2607.27842

  • ニューロモーフィックコンピューティングのためのナノ粒子ネットワーク [cs.ET, cond-mat.mes-hall, cs.AR, cs.LG, cs.NE]目的:ニューロモーフィックコンピューティングのためのナノ粒子ネットワークの設計規則
    • エネルギー効率の良いデータ処理のため,複雑な動的システム活用が重要視されている。
    • ナノ粒子ネットワークの性能は,電気的スクリーニング長によって制限されることが課題。
    • ナノ粒子ネットワークの性能を最大化するための設計指針を確立すること。
    • 静的制御電極を用いることで,ナノ粒子ネットワークを調整可能な非線形動的システムに変えることができた。
    • カットオフ周波数付近での動作が,非線形電荷トンネルと線形容量性メモリの最適なバランスを実現する。
    • 構造的乱雑性を導入することで,スクリーニング長の制限を回避し,表現力を向上させることが示された。

    Link: https://arxiv.org/abs/2607.27844

  • 自己監督:根拠に基づく修正検証による科学的ワークフローのフィードバックループを閉じる [cs.CL, cs.AI]目的:科学的ワークフローにおけるフィードバックループの閉鎖
    • 科学研究の質向上は,社会の発展に不可欠であり,効率的な研究プロセスが求められる。
    • 査読コメントへの対応が十分であるかの客観的な評価が難しく,改善の度合いが不明確になりがちである。
    • 査読コメントと修正後の論文の対応関係を検証し,改善が根拠に基づいているかを自動的に評価すること。
    • LLMは査読コメントの特性把握に優れるが,スコアは0.754に留まる。
    • 修正内容の根拠に基づく検証がボトルネックであり,最高性能モデルでもスコアは0.501である。
    • Nature Communicationsの56,000記事と査読記録を用いてAutoSupervisionを構築した。

    Link: https://arxiv.org/abs/2607.27845

  • 安全ゲート付きエージェントによる監視制御:蒸留ベンチマーク,レジームマップ,監査可能なゲート,共同設計 [eess.SY, cs.LG, cs.SY]目的:強化学習エージェントの安全性を確保するためのゲート機構の設計と評価
    • プラント制御におけるAIの利用は,効率化や自動化に貢献するが,安全性確保が不可欠である。
    • 大規模言語モデル(LLM)を用いた制御は,制約条件の逸脱や不安定な挙動を引き起こす可能性がある。
    • ルールベースのゲート機構を導入し,LLMの提案を検証することで,安全性を向上させることを目指す。
    • 提案するゲート機構は,仕様逸脱の吸引領域を抑制し,安全な範囲内に動作を限定することに成功した。
    • 強化学習エージェントは,特定の条件下において,Pareto最適化された線形MPCよりも優れた性能を発揮した。
    • ゲート介入の多くは,安全制限上に動作仕様が存在する場合に発生しており,安全な動作を阻害する提案を抑制していることが示された。

    Link: https://arxiv.org/abs/2607.27849

  • FinanceHarness:自律的な金融ディープリサーチフレームワーク [cs.CL, cs.HC, cs.SI, eess.SY, cs.SY, math.OC, cs.CL, cs.AI, q-fin.CP]目的:金融ディープリサーチの自動化
    • 金融市場の分析は,経済成長や投資判断に不可欠である。
    • 既存のディープリサーチシステムは,金融分野特有の知識が不足している。
    • 金融市場の複雑な分析を自動化し,より精度の高い予測を可能とする。
    • FinanceHarnessは,金融ツールと専門家によるワークフローを統合し,金融ディープリサーチをエンドツーエンドで自動化する。
    • FinanceGymは,金融に関する研究課題と評価基準を提供し,情報漏洩を防ぎつつ,検証可能なベンチマークを提供する。
    • FinanceHarnessの導入により,既存のLLMやエージェントの評価スコアが向上し,金融ディープリサーチの自動化の可能性が示された。

    Link: https://arxiv.org/abs/2607.27853

  • 訓練中のニューラルネットワークの簡素化 [cs.AI, cs.CV]目的:過パラメータ化された深層ニューラルネットワークの訓練ダイナミクスの理解と活用
    • 深層学習の性能向上には,モデルの複雑さと計算コストのバランスが不可欠である。
    • 深層ニューラルネットワークは過パラメータ化されやすく,冗長な部分が存在する可能性がある。
    • 訓練中にネットワークを簡素化し,パラメータ数を削減することで効率化を図る。
    • Inverse Fisher Criterionを用いて表現ダイナミクスを監視し,特徴抽出と分類の境界点を特定する。
    • 簡素化が可能な段階を特定し,不要な層を軽量な分類ヘッドに置き換える。
    • MLP,VGG,ResNetアーキテクチャにおいて,パラメータ数を大幅に削減しつつ,元のモデルと同等の精度を維持できることを示した。

    Link: https://arxiv.org/abs/2607.27854

  • EEG-EditBench:制御された画像編集による脳波-画像検索モデルにおける視覚情報の探求 [cs.CV, cs.AI]目的:脳波-画像検索モデルにおける視覚情報の抽出と評価
    • 脳波を用いた画像検索は進展しているが,そのメカニズムの解明が課題である。
    • 高精度な検索性能は,モデルが実際にどのような視覚情報を利用しているかを示さない。
    • 画像編集を通じて,脳波が捉える視覚情報の特徴を明らかにすることを目指す。
    • 従来の画像検索モデルの性能は,オブジェクトの変更や属性の変化に対する識別能力とは必ずしも一致しないことが示された。
    • 特に,微細な属性の変化がモデルにとって最も困難な課題であることが明らかになった。
    • EEG-EditBenchは,脳波-画像モデルが保持する視覚情報を詳細に分析するための基盤を提供する。

    Link: https://arxiv.org/abs/2607.27857

  • 連続時間動的グラフにおける全エンティティランキング:サンプラー依存評価 [cs.AI]目的:連続時間動的グラフにおける次目的地予測評価におけるサンプラー依存性
    • 動的グラフは,ソーシャルネットワークや推薦システムなど,現実世界の多くのシステムをモデル化する上で重要である。
    • 次目的地予測の評価には負例サンプリングが用いられるが,サンプリング方法が結果に大きく影響する。
    • 負例サンプリングの影響を取り除き,より公平なモデル比較を可能にする評価手法の提案。
    • 負例分布が非一様である場合,ベイズ最適ランキングが変化し,有限の候補セットはモデルランキングを不安定化させる。
    • モデルの優位性やアブレーションに関する結論は,候補設定に依存する可能性があることが示された。
    • 全エンティティランキングは,負例選択の自由度とサンプリング変動を排除し,より信頼性の高い比較を可能にする。

    Link: https://arxiv.org/abs/2607.27861

  • オルカ:連続時間における因果推論のためのニューラル演算子 [cs.AI]目的:連続時間における因果推論のためのニューラル演算子フレームワーク
    • 因果推論は,介入や反事実を考える上で重要である。しかし,従来のモデルは静的な変数に限定される。
    • 多くの現実システムは時間とともに変化し,不規則な時間間隔で観測され,フィードバックループを持つため,従来のモデルでは対応が難しい。
    • 本研究では,ニューラル演算子学習を用いて,動的なシステムにおける因果推論を可能にすることを目指す。
    • オルカは,因果グラフの各ノードが時間依存関数であり,各メカニズムが関数空間間の学習された写像であるというフレームワークである。
    • 既存のニューラル演算子アーキテクチャを拡張し,時間方向性を尊重し,潜在的な外生ノイズを反事実のために推論・再利用できるようにした。
    • 提案モデルクラスを形式化し,合成された連続時間例で反事実推論を実証した。

    Link: https://arxiv.org/abs/2607.27867

  • 計算資源の配分としての探索 [cs.AI]目的:終端的な損失を最小化するための計算資源の最適配分
    • 意思決定における計算資源の効率的な利用は,複雑な問題解決において不可欠である。
    • 既存手法では,計算資源配分と意思決定の質との関係が明確に理解されていない。
    • 計算資源の価値を情報理論的に評価し,最適な配分戦略を導き出す。
    • アルゴリズムを計算資源配分問題として定式化し,ベルマン方程式を用いて最適解を特徴付けた。
    • 計算資源の価値と情報量の関係を明らかにし,ミューチュアル情報や知識勾配との関連性を示した。
    • 近似的な計算資源価値を最大化することで,重み付きA*探索が導出されることを示した。

    Link: https://arxiv.org/abs/2607.27871

  • スクラッチからのマルチエージェントコーディングにおける協調モードの経験的研究 [cs.AI]目的:マルチエージェントコーディングにおける協調モードの性能評価
    • ソフトウェア開発の加速が期待されるマルチエージェントシステムの研究は,その実用的な評価が重要である。
    • 既存のベンチマークは現実的なコストを無視し,推論とコミュニケーションを混同し,表層的な完成度しか評価しない。
    • 本研究は,現実世界のタスクを用いた厳密なマルチエージェントコーディング評価基準を確立する。
    • MSEvalベンチマークは,10の本格的なフルスタックプロジェクトを用いて,マルチエージェントコーディングの性能を定量的に評価する。
    • 協調組織のトポロジーが,モデルの能力と同程度に,速度,コスト,品質のトレードオフに影響することが明らかになった。
    • 構造化されたパイプラインは最も速く高品質な結果をもたらし,過度な管理はパフォーマンスを低下させる。

    Link: https://arxiv.org/abs/2607.27877

  • ARES:LLMエージェントを用いたPPAおよびコストを考慮したRTL最適化のための適応型推論努力制御 [cs.AR, cs.AI]目的:PPA(電力,性能,面積)およびコストを考慮したRTL最適化における適応型推論努力制御
    • RTL設計の最適化は,高性能で低消費電力な電子機器の開発に不可欠である。
    • LLMエージェントを用いた最適化では,コストと品質のバランスが課題となっていた。
    • LLMの推論努力を適応的に制御することで,コストを抑えつつ最適化性能を向上させる。
    • ARESは,LLMの呼び出しコストを正規化し,公平な比較を可能にした。
    • 長期記憶の構築は,最適化性能に大きな影響を与えないことが判明した。
    • テスト設計において,ARESは固定努力型と比較してFoMを23-27%改善し,手動最適化に近づいた。

    Link: https://arxiv.org/abs/2607.27879

  • RoboBRIDGE:ポリシーを頑健な実世界ロボットエージェントに繋ぐモジュールフレームワーク [cs.RO, cs.AI]目的:VLAモデルをロボットエージェントとして実装するためのフレームワーク
    • ロボット工学分野では,VLAモデルを用いた汎用的なロボット制御が注目されている。
    • VLAモデルは,エラーからの回復機構や,長期的なタスク実行における一貫性の欠如といった課題がある。
    • 既存のVLAモデルを,より頑健で信頼性の高いロボットエージェントへと変換すること。
    • RoboBRIDGEは,Monitor,Perceptor,Planner,Controller,Robot Interfaceの5つのモジュールで構成される。
    • このフレームワークにより,既存のVLAモデルを容易にロボットエージェントとして利用することが可能となった。
    • LIBERO,RoboCasa,実環境での実験の結果,RoboBRIDGEは既存手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27881

  • トークンは等しく評価されるべきではない:Long-CoT推論のための反事実的感度信用再配分 [cs.AI]目的:Long-CoT推論におけるトークンの貢献度の違いに基づく信用再配分手法
    • 大規模言語モデルの推論能力向上は,自然言語処理研究の重要な課題である。
    • 既存手法は,トークンへの報酬配分が一様であり,貢献度の違いを考慮していない。
    • 反事実的な感度に基づいて信用を再配分し,より効果的な学習を目指す。
    • 教師あり蒸留による学習方向は,トークンの重要度を正確に反映していないことが示された。
    • 反事実的感度は,トークンの置換可能性と関連しており,問題固有の推論内容を含むトークンは感度が低い。
    • 提案手法CSCRは,GRPOと比較して,Long-CoT数学推論ベンチマークで高い性能を発揮する。

    Link: https://arxiv.org/abs/2607.27888

  • 動的スペクトルフィルタリングによる時間グラフ学習:進化する伝播演算子の学習 [cs.RO, cs.AI, cs.LG]目的:時間グラフにおける伝播メカニズムの進化
    • グラフ構造が時間とともに変化する現実世界の現象をモデル化する上で重要である。
    • 既存手法では,伝播メカニズム自体が時間とともに変化するという点が十分に検討されていない。
    • 計算効率を重視しつつ,時間変化するスペクトル応答を進化させることで,より効果的な時間グラフ学習を目指す。
    • 提案手法DSFは,MOOC,Wikipedia,Redditのデータセットで最先端の結果を達成した。
    • DSFは,既存のDEFTと比較して,パラメータ数,GPUメモリ使用量,学習時間を大幅に削減した。
    • これらの結果は,時間変化するスペクトル応答が,計算効率が重要な時間グラフ学習において有効な誘導バイアスであることを示唆する。

    Link: https://arxiv.org/abs/2607.27891

  • MMHBench:長編動画におけるメンタルヘルス理解のための多角的ベンチマーク [cs.AI, cs.CV]目的:長編動画におけるメンタルヘルス理解のための多角的ベンチマーク
    • メンタルヘルスは現代社会において重要な課題であり,早期発見と適切な支援が求められている。
    • 既存のベンチマークは粗粒度の分類に留まり,モデルが心理現象を真に理解しているか判断が困難である。
    • 多角的視点からメンタルヘルス理解を評価することで,より高度なモデル開発を促進すること。
    • MMHBenchは,268本の長編動画と2,184個の質問を含む,多角的メンタルヘルス理解のための包括的なベンチマークである。
    • 評価は,観察可能な行動とマルチモーダル証拠の解釈に焦点を当てた第三者評価と,マルチモーダル証拠に基づいたメンタル状態の解釈を必要とする一人称視点を取り入れている。
    • 22の代表的なマルチモーダル大規模言語モデルの評価の結果,長編動画におけるメンタルヘルス理解は依然として困難であることが示された。

    Link: https://arxiv.org/abs/2607.27895

  • 対照的な概念重要度:自動抽出された概念表現を通じたペアワイズなクラス決定の説明 [cs.LG]目的:ペアワイズなクラス決定における概念の重要度
    • 複雑なモデルの判断根拠を説明する上で,人間が理解しやすい概念が重要である。
    • 従来の概念重要度は単一クラスに対する貢献度を示すため,クラス間の識別理由の説明には不十分である。
    • ターゲットクラスと対照クラスの識別において,概念が果たす役割を定量的に評価することを目指す。
    • 対照的な概念重要度(CCI)は,ターゲットクラスと対照クラス間のロジット差を概念に帰属させることで,概念がターゲットを支持するか,対照クラスを支持するかを明示する。
    • CCIは,通常の概念重要度では捉えきれないクラスペア特有のモデルの振る舞いを明らかにすることが示された。
    • 高度に対照的な概念は,意味的な上位概念構造と比較することで,広範なカテゴリの証拠ではなく,細分化された識別に関与しているかを評価できる。

    Link: https://arxiv.org/abs/2607.27904

  • 反事実的説明生成のためのクラス認識型強化学習 [cs.LG, cs.AI]目的:反事実的説明の生成
    • ブラックボックスモデルの解釈可能性向上は,AIの信頼性と実用性を高める上で重要である。
    • 既存の反事実的説明生成手法は,有効性,簡潔性,近接性といった評価指標のバランスが課題である。
    • クラス情報を強化学習の状態表現に組み込むことで,探索効率の向上と最適な方策の獲得を目指す。
    • クラス認識型強化学習は,収束速度,報酬最適化,エピソード長短縮の面で,クラス非認識型強化学習よりも優れている。
    • クラス認識型強化学習は,クラス非認識型強化学習と比較して,有意に多くの有効な反事実的説明を生成する。
    • SHAP値とLIME値の分析により,インスタンスのクラスに基づく特徴量が強化学習における行動選択において重要な予測因子であることが示された。

    Link: https://arxiv.org/abs/2607.27905

  • 表現力豊かなMIDIピアノ演奏の評価への文脈埋め込みの統合 [eess.SY, cs.SY, cs.SD, cs.LG]目的:表現力豊かなMIDIピアノ演奏の評価手法
    • 音楽表現の自動評価は,作曲や演奏支援といった分野で重要性を増している。
    • 従来の評価方法は,音符間の依存関係を無視しており,演奏の類似性を適切に評価できない場合がある。
    • 文脈埋め込みを用いて,音符間の関係性を考慮した,より知覚的な評価指標を開発すること。
    • 自己教師あり学習モデル(Aria,CLaMP3)からの文脈埋め込みが,従来の評価指標と同等の精度で人間の評価と一致することがリスニングテストで示された。
    • 文脈埋め込みに基づくカーネルオーディオ距離は,音符のアライメントを必要とせず,文脈の変化に敏感であるため,分布の類似性を効果的に測定できる。
    • 性能評価ユーティリティを提供するオープンソースライブラリPerevalを公開し,再現性を促進する。

    Link: https://arxiv.org/abs/2607.27909

  • ビジョン言語モデルにおける方向性に基づく推論時防御のクロスアーキテクチャ監査 [cs.AI]目的:ビジョン言語モデルの脱獄攻撃に対する推論時の防御手法の性能評価
    • 近年,ビジョン言語モデルの活用が拡大しており,その安全性確保が重要課題となっている。
    • ビジョン言語モデルは,巧妙なプロンプトによって意図しない出力を生成される「脱獄」攻撃に脆弱である。
    • 多様なアーキテクチャにおける防御手法の有効性を比較し,最適な防御戦略を導き出す。
    • 防御手法の性能はモデルアーキテクチャに依存し,単一の手法が常に最良の結果を示すわけではない。
    • 画像条件付けシフトは,LLaVA 1.5やPixtral 12Bで優れた性能を示し,ユーティリティ損失を最小限に抑えた。
    • テキストのみとマルチモーダルの拒否ジオメトリには関連性があり,方向性に基づく防御はアーキテクチャごとに調整する必要がある。

    Link: https://arxiv.org/abs/2607.27910

  • IFHierBench:大規模言語モデルのための階層的指示追従 [cs.AI, cs.CL]目的:大規模言語モデルにおける階層的指示追従の評価
    • 実世界アプリケーションでは,言語モデルの出力に対する制約が重要であり,その性能がシステム全体の品質を左右する。
    • 既存の評価指標は,制約を均一に適用するため,出力の特定部分に対する検証ができないという課題がある。
    • 本研究は,複雑な階層構造を持つ制約に対する追従能力を評価し,改善の方向性を示すことを目指す。
    • IFHierBenchは,制約木の深さが最大4層,制約の種類が35種類に及ぶ600個のプロンプトで構成されており,各プロンプトには検証器が付属している。
    • 評価の結果,最先端モデルでもプロンプトレベルの正答率は50%を超えられず,制約の深さが増すにつれて大幅に低下した。
    • 現在のLLMは,ネストされた制約を確実に追従することが難しく,より詳細な制約遵守を考慮した学習方法が求められる。

    Link: https://arxiv.org/abs/2607.27912

  • S-CEReBrO:継続的脳波モニタリングにおけるメモリ障壁の打破 [cs.LG]目的:継続的な脳波モニタリングのためのメモリ効率化
    • 脳波解析は医療診断やブレイン・マシン・インターフェース等の応用に不可欠であり,その重要性は高い。
    • Transformerベースのモデルはメモリ消費量が大きく,長時間の脳波データ処理が困難であるという課題がある。
    • S-CEReBrOは,固定サイズのウィンドウを用いることで,メモリ消費量を抑制し,長時間の脳波モニタリングを実現する。
    • S-CEReBrOは,従来の自己注意機構と比較して,100倍長い信号を処理可能であることが示された。
    • ローランク線形注意機構と比較して,メモリ消費量を55%削減し,推論速度を2.1倍向上させた。
    • 25,000時間以上のデータで事前学習したS-CEReBrOは,11のダウンストリームタスクのうち7つで最先端の性能を達成した。

    Link: https://arxiv.org/abs/2607.27913

  • 正確な行動価値だけでは不十分:ロールアウト検証による推論モデルのマルチゾーンVAV制御のための強化学習ファインチューニング [cs.LG, cs.SY, eess.SY]目的:マルチゾーンVAV制御における推論モデルの強化学習ファインチューニング
    • 建物内の温熱快適性,空気質,省エネを実現するため,VAV制御の高度化が重要である。
    • 従来の制御手法では,建物固有のモデル構築や学習が必要となり,汎用性に課題があった。
    • 大規模言語モデルを活用し,建物固有の学習なしで制御性能を向上させることを目指す。
    • TD3による強化学習ファインチューニングは,ガイドライン36ベースラインと比較してHVAC電力使用量を4.5%削減し,温度とCO2の適合性を向上させた。
    • GPT-5は建物固有の学習なしで最大の削減(6.2%)を達成したが,換気マージンを減少させた。
    • ロールアウト検証を用いたファインチューニングでは,持続的な性能向上は見られず,学習後の電力使用量はベースラインよりも増加した。

    Link: https://arxiv.org/abs/2607.27914

  • 単一のアンカーを全てに:LVLMのための統合された多言語・多様相安全アライメント [cs.AI]目的:大規模ビジョン言語モデルの多言語・多様相における安全アライメント
    • グローバルに展開されるLVLMにおいて,悪意のある攻撃は巧妙化しており,安全性の確保が重要である。
    • 既存手法では言語と様相の防御が分離されており,安全データ不足と微調整コストが高いという課題がある。
    • 言語と様相を統合し,限られたデータとコストで複合攻撃に対抗できる安全アライメントを目指す。
    • 提案手法は,モダリティと言語を共有する安全ニューロン(MLSニューロン)を活用することで,安全表現のギャップを埋めている。
    • 英語を意味的アンカーとして利用し,言語を超えたMLSニューロンを特定し,攻撃への耐性を高めている。
    • 共有ニューロンのみを更新することで,効率的な安全性の転移を実現し,既存手法を凌駕する性能を示した。

    Link: https://arxiv.org/abs/2607.27917

  • ODEWorld:物理的時間の流れによる連続予測アーキテクチャ [cs.LG, cs.CV, cs.RO]目的:物理世界における連続的な動的モデリング
    • 現実世界は連続的な時空間で構成され,機械学習によるシミュレーションには不可欠である。
    • 既存のワールドモデルは離散時間予測に限定され,物理世界のダイナミクスを効率的に捉えられない。
    • 連続的な潜在速度場を学習し,高精度かつ効率的な予測を可能にすること。
    • ODEWorldは,常微分方程式(ODE)に基づき,圧縮された潜在空間での時間積分により予測を行う。
    • ODEの特性を適用することで,潜在ワールドモデルにおける表現崩壊の問題を解決し,長期的予測においても高品質な画像再構成を実現する。
    • 連続的な性質により,任意の時間分解能や逆方向予測が可能となり,ビデオ生成やロボット制御において優れた性能を示す。

    Link: https://arxiv.org/abs/2607.27924

  • ARD-REFSM:非対称ノイズ除去と回転不変性による反射対称性検出の強化 [cs.CV, cs.AI]目的:反射対称性検出の精度向上
    • 画像認識において,対称性は重要な特徴量であり,物体検出や画像分類に活用される。
    • 非対称領域の干渉や対称パターンの任意の方向により,反射対称性検出は困難である。
    • 非対称領域のノイズ除去と回転不変性の強化により,反射対称性検出の精度とロバスト性を向上させる。
    • 提案手法は,非対称領域のノイズ除去モジュール(ARD)と回転不変な特徴量類似性マッチングモジュール(REFSM)を導入することで,対称性の検出性能を向上させている。
    • REFSMは,回転損失を用いることで,原画像と回転画像のスコアマップの一貫性を高め,回転不変な対称軸の正確な予測を可能にしている。
    • 既存のベンチマークの限界に対応するため,多様なシナリオと干渉を含む新たなベンチマークデータセットGMSYMを新たに導入した。

    Link: https://arxiv.org/abs/2607.27927

  • ベイズ的ドメイン再重み付けによるデータ混合の最適化可能性の活用 [cs.LG]目的:大規模言語モデルの性能向上に資するデータ混合の最適化
    • 大規模言語モデルの性能は,学習データのドメイン構成に大きく依存する。
    • 複雑なデータセットにおいて,従来の経験則ではドメイン間の相互作用を捉えきれない。
    • ベイズ的アプローチにより,安定かつ効率的なドメイン重みの学習を目指す。
    • 提案手法は,Gamma事前情報を用いたDirichlet分布からドメイン重みを推論する。
    • 既存の関数適合法と比較して,少ないデータで最適なデータ混合を特定可能である。
    • 最適化に基づいたドメイン重み付けを大規模アプリケーションに適用する可能性を広げた。

    Link: https://arxiv.org/abs/2607.27928

  • メタタスク:終端タスク合成をスケーラブルなエージェント訓練のための終端タスクへ [cs.AI]目的:スケーラブルなエージェント訓練のための終端タスク合成手法
    • エージェントの訓練には多様なタスクが必要であり,その自動生成は効率化が求められている。
    • 既存の合成手法は,生成と実行の乖離や,多様性・スケーラビリティの限界を抱えている。
    • 生成と実行の一貫性を確保し,多様でスケーラブルな終端タスクの自動合成を目指す。
    • Meta-Taskは,終端タスク合成自体を終端タスクとして定義し,エージェントがタスクを生成・実行・検証するループを構築する。
    • タスク要求を多次元的に分離し,段階的なメカニズムを用いて新規タスク仕様を動的に設計する。
    • Terminal-Bench 2.0での実験で,Meta-Task合成データのみで高いPass@1性能を達成し,既存手法を凌駕した。

    Link: https://arxiv.org/abs/2607.27929

  • フローマッチングの不確実性の幾何学的性質と無料プロキシ [cs.SI, cs.AI]目的:フローマッチングの不確実性の幾何学的解釈
    • ロボットの安全な動作には,モデルの予測に対する信頼性の評価が不可欠である。
    • 既存の不確実性推定法は,計算コストや汎化性能の課題を抱えている。
    • 本研究は,計算コストを抑えつつ,フローマッチングの不確実性を高精度に評価することを目指す。
    • フローマッチングの不確実性は,速度場における理想的なアフィン等方性収縮場からのずれとして幾何学的に解釈できる。
    • 提案手法であるdenoising acceleration (accel) は,追加の計算や学習を必要とせず,不確実性を高精度に推定できる。
    • accelは,オンラインでの異常検知において,既存手法と同等またはそれ以上の性能を示す。

    Link: https://arxiv.org/abs/2607.27933

  • 例からの形状学習:再帰的SHACLにおける形状学習の基礎 [cs.AI, cs.LO]目的:形状学習の基礎
    • 知識グラフの応用において,データ整合性確認が重要であり,自動形状学習はその鍵となる。
    • 既存手法では,正例と負例から適切な形状表現を効率的に導出することが課題である。
    • 正例は検証し,負例は検証しない形状表現を,効率的に計算することを目指す。
    • 正例と負例の集合から形状表現を導出する「fitting」アプローチを調査し,その計算可能性を検討した。
    • fitting問題と最も特異なfitting問題の計算複雑性を解析し,指数時間の上界と,特定のケースにおける多項時間上界を確立した。
    • SHACLの断片言語ELIと,well-founded,stable,supportedの3つの意味論に基づいて議論を行った。

    Link: https://arxiv.org/abs/2607.27934

  • スコアリングから行動へ:結果検証型比較自己蒸留によるLLMエージェント [cs.AI]目的:LLMエージェントの能力内包化に向けた自己蒸留手法の改善
    • LLMエージェントは,外部知識に頼らず自律的にタスクを実行できる能力が求められている。
    • 既存の自己蒸留法は,教師の選好が環境結果と検証されていない点が課題である。
    • 環境結果に基づいて教師を選好し,比較学習によってエージェントの行動改善を目指す。
    • 提案手法OVCSDは,ALFWorldとWebShopにおいて,既存の自己蒸留法を上回る成功率を達成した。
    • ALFWorldでは最大29.7%,WebShopでは最大5.4%の絶対的な成功率向上を示した。
    • 訓練時の特権的なインタラクションは3%未満の増加にとどまった。

    Link: https://arxiv.org/abs/2607.27937

  • TriShield:連合学習におけるプライバシーバックドアに対するユーティリティ損失ゼロの防御 [cs.HC, cs.LG, cs.CL]目的:プライバシーバックドアを防止するための防御手法
    • 大規模言語モデルの連合学習は,データ共有なしに協調学習を可能にするため重要である。
    • 悪意のあるパラメータサーバがモデルにプライバシーバックドアを埋め込む攻撃が存在する。
    • NeuroImprint攻撃によるデータ再構成を完全に防ぎ,ユーティリティ損失をなくすことを目指す。
    • TriShieldは,パラメータアーティファクト検出,状態Virtual Iteration,Zero-Utility Orthogonal Projectionの3層で構成される。
    • この手法により,NeuroImprint攻撃による訓練データの再構成率を0%に低減することに成功した。
    • 学習精度を維持・向上させながら,GPU計算オーバーヘッドを5%未満に抑えることができた。

    Link: https://arxiv.org/abs/2607.27940

  • 大規模言語モデル駆動生成分離による解釈可能な表現:ローカルライフサービス推薦への応用 [cs.IR, cs.AI]目的:ローカルライフサービス推薦のための解釈可能な表現の生成
    • ローカルライフサービス推薦は,多様な属性情報を考慮する必要があり,ユーザ体験向上の鍵となる。
    • 既存のSID生成手法では,属性間の意味的 entanglement があり,量子化による情報損失や衝突が発生しやすい。
    • 属性間の分離と解釈可能性を高めることで,より信頼性の高い推薦と制御を実現することを目指す。
    • LGRIDは,Encode -> Disentangle -> Align -> Quantize のパイプラインを通じて生成分離パラダイムを導入することで,SIDの品質を向上させた。
    • KuaishouとFoursquareの実験結果から,LGRIDは既存のSIDベースラインを凌駕し,最高で5.44%の相対AUC改善を達成した。
    • 粗地理フィールドの属性デコード精度は99%を超え,SIDの衝突率を大幅に削減した(LGSIDと比較して97.0%から39.9%へ)。

    Link: https://arxiv.org/abs/2607.27944

  • コピー可能なコンテキストに基づくセーフガードは,LLMの信頼できる安全性を提供できない [cs.MA, cs.DC, cs.CR, cs.AI]目的:LLMの安全性における限界と,信頼できるアクセス制御の条件
    • LLMの急速な発展に伴い,悪用リスクへの対策が急務となっている。
    • 既存のセーフガードは,文脈のコピー可能性により,攻撃者の欺瞞を許容しやすい。
    • セーフガード,有用性,公開アクセスのトレードオフを明らかにし,安全なLLM利用の条件を探る。
    • LLMのセーフガードは,回答の利用方法を事前に知ることができず,二面性の高いタスクで脆弱性を持つ。
    • コピー可能なコンテキスト下では,攻撃支援の最低限のレベルが存在し,安全性,有用性,公開アクセスが両立しないトレードオフが示された。
    • 信頼できる資格情報と既存のセーフガードの組み合わせが,実際の利用を予測する情報を提供し,安全性を高める可能性が示唆された。

    Link: https://arxiv.org/abs/2607.27951