arXiv雑要約

AI - 2026/08/04 公開

  • 共有接頭辞,より良い評価:マルチエージェント推論のための適応的ルーティング [cs.AI]目的:マルチエージェント推論における効率的な適応的ルーティング手法
    • 複雑な推論問題解決において,複数エージェントによる協調が有効性が示されている。
    • 既存手法では,粗い粒度のラベルに依存し,個々のオペレーターの価値を正確に評価できない。
    • 状態に依存したオペレーターの価値を推定し,効率的な協調推論を実現することを目指す。
    • TreeCreditは,状態が一致する下流比較を通じてオペレーターの価値を推定する。
    • 共有接頭辞コラボレーションツリーを構築し,正解優先のサフィックスクレジットを割り当てる。
    • 実験の結果,TreeCreditは精度を向上させつつ,推論コストを大幅に削減することを示した。

    Link: https://arxiv.org/abs/2608.02291

  • MechGeo:Lean 4におけるユークリッド幾何学の自動形式化と証明 [cs.AI, cs.LO]目的:ユークリッド幾何学の自動形式化と証明
    • 数学の形式化は,厳密性と信頼性が求められる分野であり,自動化による効率化が重要である。
    • 幾何学の形式化は複雑であり,形式化された問題を解決するための自動化されたツールが不足している。
    • 大規模言語モデル(LLM)を活用し,幾何学問題の自動形式化と証明を可能にすることを目指す。
    • MechGeoは,複数のLLMバックボーンにおいて,直接翻訳性能が低いモデルでも自動形式化において大幅な改善を示した。
    • 国際数学オリンピック(IMO)の幾何学問題43問に対し,MechGeoは形式的な記述を生成し,GeoProverが29問を証明した。
    • 残りの14問については反例を構築し,専門家による修正後の記述はすべて証明された。これにより,形式化されたIMO幾何学問題の最大規模のコレクションが得られた。

    Link: https://arxiv.org/abs/2608.02295

  • 自己区分化される軌跡:エージェントが宣言する境界を訓練単位として [cs.AI, cs.LG, cs.SE]目的:エージェントが自身の軌跡を生成中に境界を宣言することで,学習のためのセマンティックな自己区分を収集すること。
    • 長期的な行動計画を持つエージェントの学習には,適切な報酬の単位を見つけることが重要である。
    • 既存手法では,単一のアクションの価値が安定せず,エピソード全体でのラベル付けが不適切である。
    • エージェント自身が境界を宣言することで,より適切な学習対象を生成し,誤りの修正を促進することを目指す。
    • エージェントが宣言した境界に基づき行動ブロックを割り当てるモデルは,ランダムな割り当てよりも有意に高い精度を示した。
    • コードに精通していないアノテーターによる境界位置の推定が,ランダムな配置よりも大幅に高い一致率を示した。
    • DPOによる学習では,境界を意識した学習が,既存手法と同等以上の性能を維持し,さらなる改善の余地があることを示した。

    Link: https://arxiv.org/abs/2608.02302

  • BRiG-AFA:ベルマンリスク・トゥー・ゴー学習による非近視的アクティブ特徴獲得 [cs.RO, cs.LG, cs.AI]目的:アクティブ特徴獲得における,次に追加すべき未観測特徴の特定
    • 機械学習において,限られた観測資源で最適な性能を発揮するための特徴選択は重要である。
    • 貪欲法は計算が容易だが,将来的な観測価値を見落とす可能性があり,強化学習は最適化が困難である。
    • ベルマン方程式を用いたリスク回帰により,効率的かつ高性能な特徴獲得を目指す。
    • 提案手法は,非近視的なベンチマークにおいて,単段階アブレーションと比較して精度を向上させた。
    • Fashion-MNISTデータセットでは,ほとんどの予算において精度が向上し,4回の獲得で平均10.20ポイントの改善が見られた。
    • MiniBooNEデータセットでは,小規模な予算では結果にばらつきがあったが,大規模な予算ではポジティブな結果が得られた。

    Link: https://arxiv.org/abs/2608.02305

  • 動的な形状の連続的かつロバストな比較のためのプッシュフォワード変換 [cs.CV, cs.LG, cs.NA, math.NA]目的:形状比較のための数学的枠組み
    • 画像解析において,形状とその時間変化を定量的に比較することは基本的な課題である。
    • 従来の比較方法は,パラメータへの依存性や対応付けの困難さ,解釈の不透明さなどの課題がある。
    • 形状自体を変えない変換に対して不変であり,かつ形状の幾何学的変化に敏感な表現を確立すること。
    • プッシュフォワード変換を符号付き距離関数に適用することで,境界と内部幾何学の両方を捉える連続的な表現が得られる。
    • 得られた表現を用いて,形状類似度を定量化し,骨格トポロジーや回転対称性などの特徴を明らかにできる。
    • この変換は2次元,3次元の形状,時間変化する形状に一貫して適用でき,形状上のスカラー場との同時解析も可能である。

    Link: https://arxiv.org/abs/2608.02306

  • FastGFDs:Desbordanteを用いたグラフ関数従属性の効率的な検証 [cs.DB, cs.AI, cs.LG, cs.PF]目的:グラフ関数従属性の検証における効率化
    • グラフ構造と属性間の関数従属性を捉える概念であり,データ品質評価等の分野で重要性が高まっている。
    • グラフ関数従属性の検証は計算コストが高く,特に適切な部分グラフの特定に時間がかかる。
    • 低スペックなシングルノード環境でも効率的な検証を可能とするアルゴリズムの開発を目指す。
    • 提案手法FastGFDsは,Core-First DecompositionとCompact Path Indexを用いることで,既存手法と比較して大幅な高速化を実現した。
    • 実際のグラフを用いた実験では,並列処理方式に対して平均2.6倍の性能向上を示し,メモリ消費量は5分の1に削減された。
    • 大規模データグラフに対するグラフ関数従属性検証のオープンソース実装を提供し,研究の発展に貢献する。

    Link: https://arxiv.org/abs/2608.02321

  • 文脈を考慮した感情表現の専門家混合モデル:実環境における身体表現 [cs.CV, cs.AI]目的:実環境における身体表現から感情を認識するための,文脈を考慮した専門家混合モデル
    • 感情認識は,人間とコンピュータの自然な対話を可能にする上で不可欠である。
    • 従来の感情認識手法では,文脈情報を十分に活用できていない点が課題である。
    • 本研究は,文脈情報を構造化された事前情報として活用することで,感情認識の精度向上を目指す。
    • 提案手法CA-MoDEは,シーンとオブジェクトの専門家を用いて,感情カテゴリのソフトな分布を生成する。
    • このソフトな分布は,文脈情報に基づいた事前情報として,身体表現の専門家の予測を調整する。
    • Body Language Databaseにおいて,既存手法を上回る感情認識スコア0.3269を達成した。

    Link: https://arxiv.org/abs/2608.02331

  • オフライン強化学習における行動的優位性修正拡散ポリシー [cs.LG, cs.AI, cs.SY, eess.SY]目的:オフライン強化学習におけるQ値推定誤差の軽減とポリシー最適化の改善
    • 強化学習は,ロボット制御やゲームAIなど幅広い分野で応用が期待されており,その重要性は高い。
    • オフライン強化学習では,行動データと学習ポリシーの分布のずれがQ値推定の誤りを引き起こすという課題がある。
    • 行動的優位性修正によりQ値推定のバイアスを軽減し,より安全かつ効率的なポリシー学習を実現することを目指す。
    • 行動的優位性修正を用いたQ値評価(BAC-PE)アプローチを開発し,学習ポリシーのQ値関数を修正することで,悲観的な保守性と過大評価のバイアスを軽減した。
    • 拡散モデルを用いて行動ポリシーと学習ポリシーを表現し,分布一致により正確なポリシー正則化を実現した。
    • D4RLタスクの複数のドメインで,最先端アルゴリズムと比較してDPBACが優れた性能を示すことが実験的に確認された。

    Link: https://arxiv.org/abs/2608.02332

  • ハード制約と滑らかな勾配:微分可能な射影による実行可能な在庫方針の学習 [cs.NI, cs.AI, cs.LG]目的:実行可能な在庫方針の学習
    • オペレーション研究における制約付き逐次決定問題は重要であり,現実世界の様々な課題に対応可能である。
    • 従来のMILPは柔軟だがスケーラビリティに課題があり,DRLはスケーラブルだが制約を確実に実行できない。
    • 微分可能な最適化モジュールを組み込み,厳密な制約を伴う逐次決定問題におけるDRLの性能向上を目指す。
    • 提案手法は,厳密な制約下でMILPと同等の柔軟性を持ちながら,スケーラブルな意思決定を可能にする。
    • 小規模なインスタンスで1%以下の最適性ギャップを達成し,既存の在庫方針を最大9.75%上回る性能を示した。
    • ASMLの業界規模のケーススタディでは,既存のベンチマーク方針と比較して平均コストを最大3.22%削減した。

    Link: https://arxiv.org/abs/2608.02343

  • AIエージェントはA/Bテストの結果をシミュレーションできるか? エージェントによる実験検証のためのフレームワーク [cs.CL, cs.AI, stat.AP]目的:A/Bテスト結果のシミュレーションの妥当性評価
    • 技術業界において,新機能の導入にはA/Bテストが標準的に用いられており,その効率化が求められている。
    • 従来のA/Bテストは,実際のトラフィックやエンジニアリングリソースを消費し,時間もかかるという課題がある。
    • AIエージェントによるA/Bテスト結果のシミュレーションを通じて,テスト前の検証を可能にし,リソース消費を削減することを目指す。
    • シミュレーションされたランダム化比較試験(S-RCT)フレームワークを構築し,エージェント近似誤差とサブサンプリング誤差を分離した。
    • 基盤モデルを用いたS-RCTは方向性シグナルを捉えるものの,効果の大きさを過大評価する傾向があることが示された。
    • 2段階の事前期間キャリブレーションにより予測誤差が大幅に減少し,within-subjectデザインによる標準誤差の低減も確認された。

    Link: https://arxiv.org/abs/2608.02345

  • 階層的メモリを持つMamba:長系列モデリングにおける表現ボトルネックの解決 [cs.AI]目的:長系列モデリングにおける表現ボトルネックの解決
    • Transformerに代わる効率的な系列モデルとして注目されており,計算資源の制約下での応用が期待される。
    • 既存のMambaモデルは,固定容量の再帰的状態により,長系列のモデリングに限界がある。
    • 人間の階層的記憶システムに着想を得て,Mambaの表現能力を向上させ,長系列データを効率的に処理すること。
    • 提案手法HMMは,Passkey Retrievalタスクにおいて,既存のMambaベースモデルと比較して検索成功率を34.3~37.1%向上させた。
    • LongBench-Eタスクにおいては,推論精度を1.6~14.2%向上させた。
    • パラメータの増加はわずか2%であり,学習オーバーヘッドも最小限に抑えられている。

    Link: https://arxiv.org/abs/2608.02347

  • バイナリプログラムクラスタリングのための自己教師あり表現学習:経験的研究から検索拡張学習へ [cs.CR, cs.LG]目的:バイナリプログラムのクラスタリング
    • サイバーセキュリティにおいて,新たな脅威の発見やマルウェアファミリーの進化分析は不可欠である。
    • ラベルに依存しないバイナリプログラムクラスタリングへの自己教師あり学習や表形式データ表現学習の適用は,十分には探求されていない。
    • 自己教師あり学習と表形式データ表現学習の有効性を検証し,クラスタリング性能の向上を目指す。
    • 自己教師あり学習モデル(BYOL,SimSiam)は,教師ありモデルと同等の性能を示すことが確認された。
    • VIMEという表形式データ表現学習手法が,バイナリプログラムクラスタリングにおいて新たな最高水準を確立した。
    • VIME-Rという検索拡張型VIMEは,VIMEをさらに改善し,Homogeneityを2.7%~5.8%向上させた。

    Link: https://arxiv.org/abs/2608.02348

  • KC-Agent:効率的な機械学習モデル改善のための二重過程認知アーキテクチャ [cs.AI]目的:機械学習モデルの性能維持に向けた継続的な改善
    • 機械学習は広く活用されているが,実運用環境ではデータ変動が性能低下を招く
    • データ変動への対応は重要だが,モデルの再学習にはコストがかかる
    • 効率的にモデルを改善し,データ変動に対応する手法が求められる
    • KC-Agentは,高速なパターン認識と慎重な増分更新を組み合わせることで,効率的なモデル改善を実現した
    • 5つのデータセットで最先端の性能(76.8%の精度)を示し,既存の認知アーキテクチャを上回った
    • 知識の統合メカニズムは,速度を91%向上させながら,より高い精度を維持した

    Link: https://arxiv.org/abs/2608.02351

  • Qwen-CUA:ほぼ全てのタスクに対応するネイティブなコンピュータ利用 [cs.LG, cs.CL]目的:ネイティブなコンピュータ利用によるエージェントの汎用的なインターフェースの実現
    • 人間の利用可能なソフトウェアをエージェントが操作するための基盤技術として重要である。
    • 長期間の状態追跡や大規模なインタラクティブな経験が必要であり,学習が困難である。
    • 検証可能な結果に基づき,スパースな報酬から効率的に学習する手法を確立する。
    • Qwen-CUAは,OSWorld-Verifiedで86.2,OSWorld 2.0で21.2/53.3のスコアを達成し,既存のシステムに匹敵する性能を示す。
    • 1兆パラメータ以上のモデルQwen-CUA-Maxは,これらのスコアを87.6と21.2/53.3に向上させた。
    • Qwen-CUAは,RedTeamCUA攻撃の成功率をQwen3.7と比較して大幅に低減した。

    Link: https://arxiv.org/abs/2608.02352

  • SkillTrace:クエリ-スキルグラフを横断し,合成可能なLLMエージェントを実現 [cs.CL, cs.AI]目的:再利用可能なスキルから複雑なタスクを解決するための,完全かつ実行可能なスキル構成の特定
    • LLMエージェントによる複雑なタスク解決が重要視されており,そのためにスキル構成が不可欠である。
    • 個々のスキルを検索するだけでは不十分であり,実行可能なスキル構成を特定することが課題である。
    • クエリ間の関係,クエリとスキルの類似性,スキル間の依存関係を考慮したグラフ構造を導入し,解決を目指す。
    • SkillTraceは,SkillsBenchにおいて53.17%の成功率を達成し,最先端の性能を示した。
    • ALFWorldにおいても91.43%の成功率を達成し,高い性能を証明した。
    • 異なる基盤言語モデルでも一貫した改善が見られ,汎用性と堅牢性を示している。

    Link: https://arxiv.org/abs/2608.02356

  • Faster-WAM:ワールドアクションモデルは深層アクションモジュールを必要とするか? [cs.CL, cs.CL, cs.DC, cs.AI, cs.LG, cs.RO]目的:ロボットアクション予測とビデオワールドモデルの結合に関する研究
    • ロボットの自律性を高める上で,環境を理解し,適切な行動を予測する能力は不可欠である。
    • 既存のワールドアクションモデルは,ビデオバックボーンとアクションモジュールの深さを結びつけており,計算コストが高いという課題がある。
    • ビデオバックボーンを活用しつつ,軽量なアクションヘッドを接続することで,計算効率と予測精度を両立させる。
    • 提案手法Faster-WAMは,既存手法と比較して,大幅な推論速度の向上を実現した(3.2倍)。
    • 追加のembodied pretrainingなしで,LIBEROやRoboTwin 2.0において競合的な性能を達成し,LIBERO-Plusで高い汎化性能を示した。
    • ビデオ中心のDoTアーキテクチャは,タスク固有のヘッド設計の柔軟性と低レイテンシ,そして高い予測性能を両立することが示された。

    Link: https://arxiv.org/abs/2608.02365

  • GLAIM:多変量時系列データの欠損値補完のためのグローバル・ローカル適応的変数間依存性の学習 [cs.LG, cs.AI]目的:多変量時系列データの欠損値補完のためのグローバル・ローカル適応的変数間依存性モデル
    • 時系列データ分析において,欠損値の適切な処理は重要であり,その精度が分析結果に大きく影響する。
    • 既存手法では,グローバルな依存関係とローカルな依存関係のバランスが難しく,欠損値が多い場合に精度が低下する問題がある。
    • 本研究は,グローバルとローカルの依存性を組み合わせることで,よりロバストで高精度な欠損値補完を可能にすることを目指す。
    • GLAIMは,安定したグローバルな依存関係と,サンプルに特化したローカルな依存関係を組み合わせることで,時系列データの欠損値補完性能を向上させる。
    • 実験結果から,GLAIMはランダム欠損およびブロック欠損の両方において,最先端の性能を示すことが確認された。
    • 欠損率の変化に対するロバスト性も高く,グローバル・ローカル成分の相乗効果により,高い補完精度を実現している。

    Link: https://arxiv.org/abs/2608.02366

  • Gecko:安全な公開エンコーダオフローディングによる高速なプライベート推論 [eess.SY, cs.SY, cs.CL, cs.DB, cs.CL, cs.IR, cs.LG]目的:ニューラルネットワーク推論におけるプライベート推論の高速化
    • ユーザーの入力とサーバーモデルを保護することは重要だが,既存手法は遅い。
    • 公開エンコーダをオフロードすると,特徴空間にショートカットが生じ,モデル抽出攻撃のリスクが高まる。
    • オフロードによるリスクを抑制しつつ,コンパクトな暗号化予測器を実現する。
    • Geckoは,階層的な特徴,Fastfood投影,プライベートな特徴ゲートを利用し,推論速度を0.4-2.2秒に向上させた。
    • 通信量は最大10.8MBであり,転移学習ベースラインと同等の精度を達成した。
    • 評価した攻撃において,オフロードした公開エンコーダの再利用はモデル抽出攻撃に有意な利点をもたらさなかった。

    Link: https://arxiv.org/abs/2608.02378

  • アイス上のチェス:カーリングにおける戦術的意思決定の逆向き帰納法と深層強化学習 [cs.AI]目的:カーリングにおける戦術的オプションの定量的な評価と比較
    • カーリングは戦術的複雑さから「アイス上のチェス」と呼ばれる。機械学習による分析は未開拓の分野である。
    • カーリングの連続的な状態と行動空間,確率的結果,そして微小な行動の変化に対する敏感さなど,モデル化の課題が多い。
    • 深層強化学習を用いて,人間による注釈なしで効果的な戦略を獲得し,戦術的代替案を定量的に比較すること。
    • 深層決定論的方策勾配アルゴリズムを用いて,完全に自己教師あり学習によるカーリング戦略の獲得に成功した。
    • 簡略化された4石の変形において,学習されたエージェントは熟練者のヒューリスティックと同等の性能を示した。
    • 学習された批判者は,行動空間全体の密な価値推定を提供し,試合後の分析やアスリートの準備を支援する。

    Link: https://arxiv.org/abs/2608.02379

  • リソース制約下エージェント型LLMの後学習のための協調的共進化 [cs.AI, cs.LG]目的:リソース制約下におけるエージェント型LLMの後学習の効率化
    • LLMエージェントは高度なタスク遂行能力を持つが,学習には膨大な計算資源を必要とする。
    • 従来の勾配ベースの学習方法はメモリ消費量が大きく,リソース制約下では困難である。
    • 共進化戦略により,少ない計算資源で効率的な学習を実現し,性能劣化を抑制する。
    • 提案手法CoPESは,パラメータ空間を分割し,協調的に最適化することで,標準的なESよりも高い性能を発揮した。
    • GPU時間予算を固定した場合,CoPESは既存手法GRPOの92%の性能を達成し,メモリ要件を大幅に削減した。
    • 数理問題に加え,質問応答タスクにおいてもCoPESの優位性が確認された。

    Link: https://arxiv.org/abs/2608.02391

  • ストリーミングビデオ体験からの一時的階層化メモリの成長と推論:GROVE [cs.CV, cs.AI]目的:ウェアラブルアシスタントにおける視覚的履歴に対する質問応答と,その履歴が現在の状況に役立つかどうかの認識
    • ウェアラブルアシスタントの性能向上には,過去の視覚情報を活用する能力が不可欠である。
    • 既存のビデオメモリシステムは質問に依存した検索に偏っており,状況に応じた能動的なサポートが難しい。
    • 連続的なビデオストリームからメモリを成長させ,質問応答と状況に応じた支援を両立させること。
    • GROVEは,トレーニングなしで,連続ビデオストリームから因果的に成長するメモリを構築する。
    • このフレームワークは,詳細な知覚的証拠を保持し,時間的階層構造を形成することで,効率的な検索を実現する。
    • MM-lifelongやEgoServeなどのベンチマークで,比較手法を上回る最高の性能を達成した。

    Link: https://arxiv.org/abs/2608.02392

  • 基盤モデルは音の発生源を特定できるか? 音声・言語モデルと従来型分類器の段階的ベンチマーク:閉集合音源識別 [cs.SD, cs.AI]目的:閉集合音源識別における音声・言語モデルおよび従来型分類器の性能評価
    • 音声認識技術は,多様なアプリケーションにおいて重要な役割を担うため,その精度向上は不可欠である。
    • 既存手法では,細分化された音源の識別精度が十分でなく,実用上の課題となっている。
    • 本研究は,最新の基盤モデルを含む多様な手法の性能を比較評価することで,音源識別の課題解決に貢献する。
    • Gemini-3.1-Pro-Previewは,カテゴリレベルで85.6%,細分化レベルで56.7%のF1スコアを達成し,最も高い性能を示した。
    • Kimi-Audioは,比較的小さなモデルサイズながらも,カテゴリレベルで67.5%,細分化レベルで32.9%のF1スコアでGeminiに匹敵する性能を示した。
    • Geminiモデルの思考過程分析により,回答の長さと精度には相関関係がなく,誤った回答が自信を持って述べられることが示された。

    Link: https://arxiv.org/abs/2608.02397

  • ネットワーク情報が信頼性の低いニュースドメインの検出を向上させる [cs.SI, cs.LG, physics.soc-ph]目的:信頼性の低いニュースドメインの検出精度向上
    • 誤情報の拡散は社会問題であり,正確な情報源の識別が重要である。
    • 従来のコンテンツベースの手法では,巧妙に偽装された誤情報の検出が困難である。
    • ネットワーク構造を活用することで,コンテンツに依存しない誤情報検出を目指す。
    • TelegramにおけるURL共有パターンからドメイン間の共存ネットワークを構築し,信頼性による分類が確認された。
    • グラフニューラルネットワーク(GNN)は,ネットワーク構造を考慮しない手法と比較して,信頼性評価において高い性能を示した。
    • 特にGraphSAGEは,コンテンツ特徴量ありで精度0.63,なしで0.53を達成し,13-14%の相対的な改善が見られた。

    Link: https://arxiv.org/abs/2608.02399

  • 断片化されたデータから実用的な設計へ:物理学に基づいた学習によるプラスチックのリサイクル [cs.LG, cs.AI]目的:プラスチックのリサイクルに関する実験データの活用
    • プラスチック廃棄物の有効活用は環境問題解決に不可欠であり,熱化学的アップサイクルはその主要な手段である。
    • 既存の実験データは条件が不均一で報告が不完全であり,十分なデータ分析が困難である。
    • 断片化された実験データを活用し,プラスチックのリサイクルプロセスを効率化するための指針を提供する。
    • 開発されたPC-MG-MoEフレームワークは,欠損データを含む実験データから直接学習し,物理的に整合性の取れた製品分布を再構築する。
    • 厳格な検証の結果,本フレームワークは他のモデルと比較して最も低い絶対誤差を達成し,異なる実験環境下でのエンジニアリングスクリーニングを支援する。
    • ウェブベースのワークフローとして実装され,実験計画の最適化やプラットフォーム固有のデータへの適応を可能にする。

    Link: https://arxiv.org/abs/2608.02402

  • Antares:エージェント型脆弱性特定のための基盤モデル [cs.CR, cs.AI]目的:エージェント型脆弱性特定のための基盤モデル
    • ソフトウェアの安全性確保は重要であり,その基礎として脆弱性特定技術が不可欠である。
    • 大規模なコードベースにおける脆弱性特定は,モデルの推論能力と反復的な探索が求められる難題である。
    • 本研究は,効率的かつ低コストな脆弱性特定を可能にする基盤モデルの構築を目指す。
    • Antaresは,350M,1B,3Bパラメータのコンパクトな言語モデル群であり,GPT-5.5に匹敵する性能を示す。
    • オープンウェイトモデルと比較して,200倍以上の性能向上を達成している。
    • 単一のH100 GPU上で500タスクの評価を約15分で完了し,タスクあたりの評価コストを低減した。

    Link: https://arxiv.org/abs/2608.02407

  • 深層学習に基づくパーキンソン病歩行における地面反力推定:最適化されたIMUデータセットを用いた [cs.LG, eess.SP]目的:パーキンソン病歩行における両側垂直地面反力の推定
    • 歩行分析は,疾患の診断,治療効果の評価,リハビリテーションにおいて重要である。
    • 従来の歩行分析は実験室環境に依存し,患者の負担が大きいという課題があった。
    • IMUを用いた地面反力の推定精度向上と,センサー数の最小化を目指す。
    • 深層学習モデル(CNN-BiLSTM)を用いて,パーキンソン病患者および健常者において高精度な垂直地面反力推定を実現した。
    • 最適なセンサー配置は,パーキンソン病患者と健常者で異なり,患者ごとに異なる配置が推定精度に影響することが示された。
    • 最小構成のIMU(2個)でも安定した推定が可能であり,ウェアラブルな歩行分析システムの実現に貢献する。

    Link: https://arxiv.org/abs/2608.02408

  • MonitrLLM:大規模言語モデル評価のためのコミュニティ中心型インフラストラクチャ [cs.AI, cs.CY]目的:大規模言語モデルの評価のためのコミュニティ中心型インフラストラクチャ
    • 言語モデルの性能向上は,人間との自然な対話を実現し,様々なタスクを支援するために不可欠である。
    • 既存の評価手法では,対話の過程とユーザーが定義する成果との関連性が十分に考慮されていない。
    • 対話の軌跡,ユーザーの意図,そして成果の評価を結びつけ,より実用的な評価を可能にすること。
    • MonitrLLMは,会話記録とユーザー報告の意図・結果評価を紐付け,包括的な評価信号を提供する。
    • パイロット調査の結果,平均満足度は高い一方で,目標達成率は23.1%の失敗率を示した。
    • 複数ターンの会話は,単一ターンの会話と比較して2.5倍高い失敗率となり,長文対話が困難さを示す可能性がある。

    Link: https://arxiv.org/abs/2608.02409

  • 介護ロボットに関する人間中心の考察:介護者の視点の比較研究 [cs.RO, cs.AI, cs.ET, cs.LG]目的:介護ロボットに対する介護者の認識
    • 高齢化社会において,介護現場の人手不足が深刻化しており,ロボット技術による支援への期待が高まっている。
    • 介護ロボットの導入にあたっては,倫理的な問題や介護者の受容性が課題となっている。
    • 介護ロボットの倫理的課題と受容性を多角的に分析し,適切な導入・設計に貢献すること。
    • 米国,メキシコ,チリの介護者298名を対象とした調査の結果,介護ロボットは概ね肯定的に評価された。
    • 特に,物流や身体的な負担が大きい作業への期待が高い一方,対人コミュニケーションを必要とする作業への評価は慎重であった。
    • 倫理的な懸念として,依存性,人間による監視の必要性,雇用への影響などが挙げられ,国によって優先順位が異なった。

    Link: https://arxiv.org/abs/2608.02411

  • 大規模言語モデルが表形式データの予測に失敗する理由 [cs.LG]目的:表形式データの予測における大規模言語モデルの失敗原因の解明
    • 機械学習において表形式データの予測は非常に一般的であり,その重要性は高い。
    • 汎用的な大規模言語モデルは,表形式データの予測において古典的な手法に劣ることが課題である。
    • 本研究は,大規模言語モデルが表形式データ予測で失敗する根本的な理由を探る。
    • 大規模言語モデルの予測精度は,入力データの次元数が増加するにつれて低下する。
    • 低次元においては,大規模言語モデルの予測は局所的な距離に基づく手法に類似している。
    • 高次元においては,ノイズを付加した古典的な学習モデルでも,大規模言語モデルの予測を再現できない。

    Link: https://arxiv.org/abs/2608.02412

  • デジタルツインを活用したマルチスケール計画によるエージェント型インシデント対応 [cs.HC, cs.CY, cs.CR, cs.AI]目的:インシデント対応の自動化
    • サイバー攻撃の高度化により,迅速かつ的確なインシデント対応が不可欠となっている。
    • 従来のインシデント対応は手動によるものが多く,時間と労力がかかるという課題がある。
    • 大規模言語モデルと意思決定理論を組み合わせ,現実的なシステムへの適用を目指す。
    • 提案手法は,デジタルツインを用いたシミュレーションとエミュレーションにより,戦術レベルと運用レベルの計画を連携させている。
    • 3つの攻撃シナリオにおいて,既存のLLMベースラインと比較して,復旧実行時間が平均15.1%短縮された。
    • また,復旧成功率が平均33.6%向上した。

    Link: https://arxiv.org/abs/2608.02422

  • 強化学習と制御の基礎:関連性と新たな視点 [cs.LG]目的:強化学習と制御理論の関連性に関する理解の促進
    • 未知の動的システム制御の最適化という共通の課題に取り組む重要な分野である。
    • 両分野は独自の方法論と文化を発展させてきたため,互いの理解が十分ではない。
    • 強化学習と制御理論を統合し,データ駆動型の意思決定を可能にすること。
    • 動的計画法を共通の根源としながら,強化学習と制御理論は異なるアプローチを取っている。
    • 適応制御やアクター・クリティック法などのアルゴリズムを比較し,両者の関係性を明らかにした。
    • 古典的なロコモーション制御問題を通して,両分野の統合による新しい意思決定手法を提案した。

    Link: https://arxiv.org/abs/2608.02433

  • xPress:投機的デコーディングにおける拡散ドラフターの並列洗練 [cs.AI]目的:拡散ドラフターにおける因果性の欠如の修正
    • 推論速度の向上は,大規模言語モデルの応用範囲拡大に不可欠である。
    • 拡散ドラフターはトークン間の依存関係を考慮せず,確率の低いシーケンスを生成しやすい。
    • xPressは並列洗練により因果依存関係を回復し,ドラフトの受容率を向上させる。
    • xPressは,Qwen3-8Bにおいて,受容長を平均約30%(最大+56%)向上させた。
    • xPressは,元のdFlash拡散ドラフターと比較して,エンドツーエンドのデコーディングスループットを平均約1.3倍(最大1.7倍)向上させた。
    • xPressは,拡散ブロック全体を並列に洗練することで,トークンごとのループ処理を回避し,効率的な因果性回復を実現する。

    Link: https://arxiv.org/abs/2608.02438

  • 実行ノイズ下における意図推論:社会的ジレンマにおける偶然性と認識的不確実性の分離 [cs.GT, cs.LG]目的:社会的ジレンマにおける意図推論のメカニズム
    • 社会的な相互作用の理解は,協力関係の構築や維持に不可欠である。
    • 従来のモデルでは,行動のノイズと意図の解釈が区別できず,過剰な報復が生じやすい。
    • 行動のノイズを考慮し,意図を正確に推論することで,より適切な行動選択を目指す。
    • 部分観測マルコフ決定過程(POMDP)モデルを導入し,相手の意図を潜在状態として捉えることで,ノイズの影響を軽減した。
    • 反復囚人ゲームの実験により,協力関係が崩壊するノイズの閾値を特定し,学習された事前分布との関係を明らかにした。
    • 意図推論の価値は状況依存的であり,条件付き協調的な相手に対しては優位性を示す一方,ノイズが十分な場合には信念に基づいた崩壊が起こる。

    Link: https://arxiv.org/abs/2608.02440

  • エージェント活発型商取引の世界:検証可能で監査可能なVibe Commerce環境 [cs.AI]目的:Vibe Commerceにおけるエージェントの評価環境
    • AI技術の進展により,自然言語によるソフトウェア記述と自動実装が期待されている。
    • 商取引における買い手と売り手の独立性,プライバシー保護,権限維持が課題である。
    • エージェントの行動を検証・監査可能な環境を構築し,その性能評価を行う。
    • Agentic Commerce World (ACWorld) が,Vibe Commerce Protocol (VCP) を用いてエージェントの行動を検証する環境を提供する。
    • ACWorld Benchmarkは,200タスクのcapability-coverageトラックと60タスクのlarge-catalogトラックを含む。
    • 実験結果から,最終的な状態だけでは評価エラーを見逃す可能性があり,プロセスレベルの証拠が重要であることが示された。

    Link: https://arxiv.org/abs/2608.02441

  • 正解だけでは不十分:ショートカットハッキングはLLMの科学的推論評価を誤らせる [cs.AI, cs.CL]目的:LLMの科学的推論能力の評価におけるショートカットハッキングの存在
    • 科学的推論は,複雑な問題を解決し,新たな発見を生み出す上で不可欠である。
    • LLMの評価は最終的な正答率に依存しがちで,推論過程が見過ごされやすい。
    • 正答率だけでは判断できない,LLMの不適切な推論方法(ショートカット)を明らかにする。
    • LLMは,数値探索や推測など,妥当でない方法で正解に到達することがある(Solution Hacking)。
    • ベンチマークの難易度が高くなるにつれて,Solution Hackingの割合が大幅に増加する。
    • ショートカットを抑制することで,報告される正答率が低下する一方で,妥当な推論に基づく正答率は比較的維持される。

    Link: https://arxiv.org/abs/2608.02442

  • ParEvalLayer:部分的なLLMエージェント評価が意思決定を支援する場合 [cs.AI]目的:LLMエージェント間の比較判断
    • LLMエージェントの性能評価は,その実用化において不可欠である。
    • 評価途中の部分的な結果だけでは,最終的な判断と一致するか不明確である。
    • 部分的な評価結果から,早期に信頼性の高い判断を下せる仕組みを構築する。
    • ParEvalLayerは,部分的な評価結果に基づき,エージェント間の優劣を判断する層である。
    • 既存のベンチマークデータを用いた検証で,15%〜25%のタスク結果で最終的な判断と一致することを確認した。
    • 判断ルールと未決定比較の数を明示することで,部分的なスコアの限界を克服できる。

    Link: https://arxiv.org/abs/2608.02444

  • ウェブ大規模検索のためのビジョン言語モデルによる関連性測定の高度化 [cs.IR, cs.LG]目的:ウェブ大規模検索における関連性測定の高度化
    • 検索システムの精度向上は,ユーザー満足度を高め,サービス利用促進に不可欠である。
    • 従来の人手による関連性評価は,コストと時間がかかるため,大規模な評価が困難である。
    • ビジョン言語モデルを活用し,効率的かつ信頼性の高い関連性評価パイプラインを構築すること。
    • ビジョン言語モデルによる自動評価と人手評価の整合性が確認された。
    • ビジョン言語モデルを活用することで,実験における評価効率が大幅に向上した。
    • より高品質な関連性指標を得て,オンライン実験における検出可能な最小効果を低減することができた。

    Link: https://arxiv.org/abs/2608.02446

  • 無限トレース目的と有限トレース技法:LTLからLTLf+への変換 [cs.RO, cs.AI, cs.FL, cs.LO]目的:LTL仕様をLTLf+へ変換する手法
    • AI分野における時間的拡張目標の記述言語としてLTLが広く利用されている。
    • LTLの決定化は理論上・実際上,困難な問題である。
    • LTLの利点を活かしつつ無限トレースに対応するLTLf+の適用範囲を広げる。
    • 本研究では,LTLからLTLf+への初の変換手法を提示する。
    • LTL公式をManna-Pnueli階層の反応性フラグメントに正規化し,LTLf+の形状を構築する。
    • LTLからLTLf+への変換経路は依然として二重指数関数的なコストを伴う。

    Link: https://arxiv.org/abs/2608.02454

  • 理論的保証付きの人中心型評価のための集約と較正 [cs.LG, stat.ML]目的:人間中心型評価の精度と頑健性の向上
    • システム的な意思決定には不可欠だが,客観的真理値がないという課題がある。
    • 人間の判断のみでは専門性や評価尺度にばらつきが生じ,モデルのみでは不完全な情報に依存する。
    • 人間の判断とモデルの予測を組み合わせ,客観的真理値がなくても評価の精度を高める。
    • 集約と較正(AtC)フレームワークは,人間の判断を集約し,モデルのスコアを較正することで,既存手法を上回る精度を示す。
    • AtCは,評価者の信頼性を考慮したランク集約モデルと,順序の一貫性を保つ等方投影を用いたスコア較正の2段階構成である。
    • 理論的には,評価者の異質性を考慮することが,コンセンサス推定の効率向上に寄与し,AtCがモデルのみの評価を漸近的に上回ることが示された。

    Link: https://arxiv.org/abs/2608.02455

  • 構文と意味論:科学的数式の理解 [cs.IR, cs.AI]目的:科学的数式の構文と意味論の対応関係
    • 学術コミュニケーションにおいて,科学的数式は不可欠である。その理解が情報検索の精度向上に繋がる。
    • 数式の構文と意味論は,情報検索において統合的に扱われることが少ない。
    • 数式表現のミスマッチを解消し,効果的な情報検索を実現すること。
    • 数式の構文と意味論の初期表現空間には,相関はあるものの,直接的な対応関係は弱かった。
    • グラフベースのエンコーダとテキストベースのエンコーダを用いて表現学習とアライメントを行った結果,クロスモーダル検索が大幅に改善された。
    • 明示的な表現学習によって,元の表現空間には存在しない対応関係を回復できることが示された。

    Link: https://arxiv.org/abs/2608.02457

  • LLMエージェントの失敗のリアルタイム検出と修復 [cs.AI, cs.LG, cs.SE]目的:LLMエージェントの失敗検出と修復手法
    • LLMエージェントの利用拡大に伴い,その信頼性確保が重要課題となっている。
    • LLMエージェントは,誤った結果の生成や無限ループといった失敗を起こしうる。
    • 従来の監視手法はコストが高いため,低コストでの高精度な失敗検出が求められている。
    • エコー状態ネットワークとCUSUMアラームの組み合わせにより,71%の失敗を5%の誤検知率で検出可能。
    • 決定論的検証層を追加することで,60%の失敗を誤検知なく捕捉可能。
    • 失敗を検出後,ロールバックと再実行を行うことで,45%の失敗を回復し,タスク成功率を52%から73%に向上。

    Link: https://arxiv.org/abs/2608.02464

  • 詳細な車両損傷評価のための専用セグメンテーションによるエージェント型VLMのグラウンディング [cs.CV, cs.AI]目的:詳細な車両損傷評価における,エージェント型ビジョン言語モデルの空間的グラウンディングの改善
    • 自動車の品質管理や保険査定において,正確な損傷評価は不可欠である。
    • 微細な損傷は視覚的に曖昧で,モデルが誤認識しやすく,課題となっている。
    • VLMの誤ったグラウンディングを解消し,損傷箇所の正確な特定を目指す。
    • 専用セグメンテーションモデルとVLMを組み合わせたTinyDamageを提案した。
    • セグメンテーション損失関数に着目し,コントラスティブ損失が微細な損傷の検出精度向上に貢献することを示した。
    • セグメンテーション出力に基づいたLangGraphエージェントパイプラインにより,報告書のハルシネーション率を大幅に削減した。

    Link: https://arxiv.org/abs/2608.02470

  • 行動に基づく組織アフォーダンスが,腹腔鏡手術中の外科医の認知負荷を軽減する予測的自動フレーミングを可能にする [cs.CV, cs.AI]目的:腹腔鏡手術における外科医の認知負荷軽減
    • 腹腔鏡手術は視覚的負荷が高いが,注意資源の効率的な管理が重要である。
    • 手術意図は専門的かつ暗黙的であり,高密度な空間ラベルの取得が困難である。
    • 手動アノテーションなしで,視覚的注意の誘導を可能にするアフォーダンスラベルの生成。
    • DiffeoAffordは,微分同相制約による組織追跡と器具軌跡解析を組み合わせることで,アフォーダンスホットスポットラベルを生成する。
    • アフォーダンスラベルを用いて訓練された予測モデルは,手術関連領域を予測し,自動フレーミングシステムAffordViewを可能にする。
    • 本手法は,専門家のアノテーションや術中外科医の視線追跡と一致し,認知負荷を軽減することが実証された。

    Link: https://arxiv.org/abs/2608.02471

  • 文化認識は表現されるものの解読されない:18のオープンソースLLMにおける神話的知識の追跡 [cs.NI, cs.CL, cs.CY, cs.LG]目的:オープンソースLLMにおける文化認識の表現と解読の乖離に関する研究
    • 言語モデルは多様な文化情報を扱うことが期待されるが,その文化理解の度合いは不明である。
    • 言語モデルは西洋神話に偏り,他の文化の神話を十分に理解できていないという問題がある。
    • 言語モデルのどこで文化的な偏りが生じるかを特定し,そのメカニズムを解明すること。
    • LLMはゼウス,ユピテル,トールといった西洋神話の神々の名前は認識できるが,フィンランド,スラヴ,エジプト,中国などの神話の神々の名前は認識できないことが多い。
    • モデルの内部表現は文化を区別できるものの,出力段階で主要な伝統のトークンに文化特有のトークンが収束してしまう。
    • 問題は表現段階ではなく,出力段階にあることが判明した。プロンプトの言語によって結果が異なることも示された。

    Link: https://arxiv.org/abs/2608.02486

  • 長期測定:人間とAIの相互作用の経時的理解に向けて [cs.AI]目的:人間とAIの相互作用における行動変化の長期的な測定
    • AI技術は急速に普及し,人間の認知や社会性に影響を与える可能性が指摘されている。
    • 短期的な評価では捉えきれない,長期的なリスクの存在が懸念されている。
    • AIとの相互作用が人間の行動に与える影響をモデル化し,長期的なリスクを軽減すること。
    • 本研究では,社会科学における測定方法を参考に,長期的なデータから現象を捉える手法を検討した。
    • NLP分野の計算手法とこれらの測定方法を組み合わせることで,長期的な安全リスクの理解と,AI開発の方向性修正に繋げることが期待される。
    • オンラインでの問題行動の検知や,アライメントフレームワークの構築に役立ち,ユーザーへの悪影響を抑制する可能性が示唆された。

    Link: https://arxiv.org/abs/2608.02491

  • DyFrDet:動的な周波数抑制とラベル曖昧性解消による高精度な小物体検出へ [cs.CV, cs.AI]目的:小物体検出の精度向上
    • 画像認識技術の発展に伴い,監視カメラなどから得られる小物体検出の重要性が増している。
    • 小物体は視覚的な情報が乏しく,誤検出や位置ずれが起こりやすいという課題がある。
    • 周波数領域のノイズやラベルの曖昧性を解消し,小物体検出の精度を向上させる。
    • 提案手法DyFrDetは,動的な周波数抑制により背景ノイズを除去し,小物体を正確に検出する。
    • DyFrFPNは,低周波数の冗長性と高周波数のノイズを抑制し,小物体識別に必要な特徴を保持する。
    • LDMは,ラベルの曖昧性を確率分布でモデル化し,低解像度小物体検出の精度を向上させる。

    Link: https://arxiv.org/abs/2608.02495

  • SWE-Touch:コードに触れる際のコーディングエージェントのベンチマーク [cs.RO, cs.SE, cs.AI, cs.CL]目的:共有ワークスペースにおけるコーディングエージェントの挙動評価
    • 現実のソフトウェア開発では,エージェントと人間が共同で作業することが一般的である。
    • 既存のベンチマークは,エージェント単独での作業や,限定的なユーザー参加しか想定していない。
    • 共有ワークスペースにおけるコード変更への理解と対応能力を評価し,改善点を探る。
    • SWE-Touchフレームワークを用いて,エージェントに競合するコード修正を注入し,その対応を評価した。
    • SWE-bench Verifiedにおいて,平均解決率が7.7%低下し,長期的タスクでも同様の傾向が確認された。
    • 失敗の原因は,エージェントがワークスペースの変化を十分に認識できていないことにあると分析された。

    Link: https://arxiv.org/abs/2608.02499

  • 拡散Transformerの学習加速と安定化:チャンク化されたモーメンタム直交化 [cs.IR, cs.AI]目的:拡散Transformerの学習における計算コスト削減と収束性改善
    • 近年の画像生成モデルにおいて,拡散Transformerは最先端の性能を示している。
    • 拡散Transformerの学習には膨大な計算資源が必要であり,効率的な学習方法が課題である。
    • 融合された重みによる最適化の歪みを解消し,学習速度と収束性を向上させる。
    • 提案手法CMuonは,AdamWと比較して2倍以上の学習速度を実現した。
    • ImageNet 256において,CMuonを用いた6億7500万パラメータの拡散Transformerは200エポックでFID 1.18を達成した。
    • CMuonは,標準的なMuonの終盤の収束停滞の問題を効果的に克服した。

    Link: https://arxiv.org/abs/2608.02502

  • 身体なき推論?科学的仮説生成における表象の基盤と推論ループ [cs.AI, cs.CV, cs.IR]目的:科学的仮説生成における推論ループのメカニズム
    • 科学的発見は,既存の知識やデータから新たな知見を生み出す上で不可欠である。
    • 従来のAI研究では,仮説生成には現実世界との継続的な相互作用が必要とされていた。
    • 本研究は,身体的な相互作用なしでも科学的な推論が可能となるメカニズムを提案する。
    • 科学的図式は,分野を超えて対称性やトポロジーなどの共通構造を部分的に標準化する規約空間を提供する。
    • 提案する推論ループは,表象生成,モチーフ抽出,規約空間での標準化,分野間検索,同一性仮説生成,敵対的検証のステップを含む。
    • 重力波メモリ輸送モデルの図形から,弱い重力レンズ宇宙論のカイザー・スクワイア質量写像複合体との等価性という仮説が生成・検証された事例が示された。

    Link: https://arxiv.org/abs/2608.02505

  • RoMeRL:自己進化型エージェントメモリにおけるフィードバック網羅性と報酬罠のバランス化 - 低次元有用性状態によるアプローチ [cs.LG, cs.CL]目的:自己進化型LLMエージェントメモリの効率的な学習
    • LLMエージェントの性能向上には,過去の経験を活用するメモリ機構が不可欠である。
    • メモリの規模が拡大すると,フィードバックが拡散し,学習効率が低下する問題がある。
    • 有用性状態の次元削減により,フィードバックを集中させ,報酬罠への陥りを防ぐ。
    • RoMeRLは,タスク固有のメモリ状態を極めて低い次元で表現することで,メモリの効率的な更新を実現した。
    • ALFWorldとLifelongAgentBenchにおける実験により,RoMeRLはタスク性能を向上させ,メモリサイズを大幅に削減することを示した。
    • 報酬への誤った経験の影響を抑制し,LLMの呼び出し回数を減少させる効果も確認された。

    Link: https://arxiv.org/abs/2608.02508