arXiv雑要約

AI - 2026/08/03 公開

  • エージェンティックAIにおけるOpenClawとOllama:完全自律型でスケーラブルなAIエージェントシステムへ [cs.AI]目的:エージェンティックAIシステムのアーキテクチャに関する理解の深化
    • LLMの進化により,自律的なAIエージェントの実現が期待されている。
    • 推論,オーケストレーション,実行層の分離が不十分であり,統合的なフレームワークが不足している。
    • OpenClawとOllamaの統合による,完全自律型AIエージェントシステムの有効性を検証する。
    • OpenClawとOllamaの組み合わせが,永続的メモリ,ツール利用,適応的意思決定などの能力を実現することを示した。
    • システムレベルでの統合が,個々のモデルでは得られない能力を生み出すことが確認された。
    • スケーラビリティ,セキュリティ,プライバシーなどの課題を明らかにし,今後の研究方向性を示唆した。

    Link: https://arxiv.org/abs/2607.28629

  • GenAIへの批判的関与を促すスキャフォールディング:プロンプトエンジニアリング課題における少数民族予備校生の協調的談話の変容 [cs.CY, cs.AI]目的:GenAIを用いた学習における少数民族予備校生の協調的談話における変容
    • 教育格差の是正にGenAIが期待される。学習資源へのアクセス拡大や言語的障壁の軽減に貢献しうる。
    • GenAIを安易な回答手段と捉え,思考のパートナーとして活用しない「認知的な怠惰さ」のリスクが存在する。
    • 教育的スキャフォールディングを通じて,GenAIとの受動的な消費から批判的な協調創造への転換を目指す。
    • 介入前,生徒たちは効率的なコピーのための戦略的談話を優先していたが,介入後は批判的評価とピアによる共同構築を促すように戦略的計画を再調整した。
    • 教師によるスキャフォールディングが,生徒たちの当初の権威への偏見やプロンプト入力の麻痺を克服し,AI生成コンテンツの積極的なゲートキーパーとしての地位を確立するのに役立った。
    • プロンプトへの自己効力感の有意な増加が確認された。少数民族生徒には技術訓練だけでなく,人間とAIの協調に関する標的を絞った教育的介入が不可欠である。

    Link: https://arxiv.org/abs/2607.28630

  • AIはAI研究者を評価できるか?:自動マルチモーダルレビューによる自律研究生成システムのベンチマーク研究 [cs.AI, cs.CL]目的:自律研究生成システムの評価基準
    • 科学的発見を加速するAI研究者の開発が重要視されている。
    • AI生成論文の質を客観的に評価・比較する手法が確立されていない。
    • AI研究生成システムの性能を定量的に評価するベンチマークを確立する。
    • 大規模言語モデルを用いた自動ピアレビューシステムにより,AI生成論文の独創性,科学的厳密性,明瞭性,重要性を評価した。
    • FARSベンチマーク論文は,他のフレームワークと比較して有意に高い評価を得た(平均スコア2.14~2.47)。
    • GeminiとClaude間の高い合意性と合成スコアとの強い相関関係から,自動評価の信頼性が確認された。

    Link: https://arxiv.org/abs/2607.28631

  • 主要な数学的予想の発見のためのLLMフレームワーク:リーマン予想の次を求めるAI [cs.AI]目的:数学的潜在力の高い予想の体系的な生成と検証
    • 数学の進歩には未解決予想が不可欠であり,その発見は数学研究の根幹である。
    • 主要な予想は専門家の直感に頼る部分が大きく,システム的な探索手法が不足している。
    • 分野を再編し,数学研究を支援するような,質の高い問題の発見を目指す。
    • 提示されたパイプラインは,自然言語から形式的な検証への安定した移行を可能にした。
    • 20個の候補全てがLean解析と型チェックを通過し,既存の問題との重複もなかった。
    • この研究は,AIによる予想発見の可能性を示すとともに,数学研究の新たな道を開く。

    Link: https://arxiv.org/abs/2607.28632

  • 分散GPU推論のためのトポロジーを意識したデータ移動 [cs.LG, cs.AI, cs.PF]目的:分散LLM推論におけるデータ移動の最適化
    • 大規模言語モデルの利用拡大に伴い,GPUリソースの分散利用が重要になっている。
    • GPU間ネットワーク帯域幅の不均一性が,分散推論のボトルネックとなっている。
    • トポロジーを考慮したデータ移動により,推論の遅延を削減することを目指す。
    • ネットワークトポロジーを認識し,最適なデータ転送経路を選択するオーケストレーターを設計した。
    • パイプライン化,NVLinkドメイン認識配置,CXL 3.0メモリ拡張器を組み合わせることで,データ転送遅延を大幅に削減できる。
    • 理論モデルおよびアーキテクチャ解析により,一様RDMAと比較して3〜18倍の転送遅延の短縮が期待される。

    Link: https://arxiv.org/abs/2607.28633

  • LLMは項目難易度を理解できるか:LLMを用いた自動問題生成への示唆 [cs.CL, cs.LG]目的:項目難易度予測の性能評価
    • 形成的評価や大規模な学力テストにおいて,項目難易度の推定は重要な役割を担う。
    • LLMの能力向上に伴い,項目難易度を過小評価する傾向がみられることが課題である。
    • LLMが項目難易度を正確に予測できるか検証し,自動問題生成への応用可能性を探る。
    • GPT-4.1(temperature 0)が最も高い予測精度(QWK=0.578)を示したが,ConvBERT(QWK=0.625)には及ばなかった。
    • 全てのLLMは難易度の高い問題を特定するのに苦戦し,特にGPT-5.4は難易度を過小評価する傾向が強かった。
    • 項目の埋め込み表現の次元削減により,難易度レベルが異なる項目の埋め込みが混在することが示された。

    Link: https://arxiv.org/abs/2607.28634

  • GMMとLLMを用いた標的データ拡張による不均衡データクラスタリング [cs.CL, cs.LG]目的:不均衡データのクラスタリング性能向上
    • 自然言語処理において,少数派トピックの扱いは重要である。データ分析の精度に直結するため。
    • 教師なし学習では,少数派トピックが適切に捉えられない場合がある。クラスタリングの課題として頻発する。
    • GMMとLLMを統合し,少数派トピックの表現を強化する手法を提案する。
    • 提案手法は,様々な不均衡テキストデータセットにおいて,クラスタリング性能を維持,あるいは向上させることを示した。
    • 特に,クラスタの解釈可能性の向上も確認された。データの表現改善に貢献する。
    • GMMとLLMの組み合わせは,堅牢かつスケーラブルな解決策を提供する。

    Link: https://arxiv.org/abs/2607.28635

  • 経験からの状態依存型予測知識の学習 [cs.CL, cs.CY, cs.CL, cs.CL, cs.LG]目的:経験を通じた状態依存型予測知識の獲得
    • 大規模言語モデルエージェントの学習において,経験則の獲得は重要である。
    • 従来の軌跡レベルでの反省は,事後的な洞察に依存し,汎化性能が低い。
    • 状態に紐づいた予測知識を明示的に学習することで,汎化性能の向上を目指す。
    • 状態依存型知識学習(SKL)は,軌跡要約ではなく状態に固定された予測評価を維持する。
    • 自己蒸留(SKL-SD)と強化学習(SKL-RL)により,エージェントは経験から予測知識を自律的に抽出する。
    • WebShopやScienceWorld等の環境で,SKLが既存手法を大きく上回る性能を示す。

    Link: https://arxiv.org/abs/2607.28638

  • 小規模言語モデルにおける知識蒸留のバイアスに対する非対称な影響 [cs.CL, cs.AI, cs.CY]目的:小規模命令調整済み言語モデルにおける知識蒸留がバイアスに及ぼす非対称な影響の解明
    • 言語モデルのバイアスは社会的な公平性や倫理的な観点から重要な研究課題である。
    • 知識蒸留によるバイアスの影響は一様ではなく,タスクの種類によって異なる可能性がある。
    • 文脈追従性と拒否の校正という,相反する性質を持つバイアスへの影響を明らかにすること。
    • 明確なタスクにおいては,知識蒸留により文脈追従性が改善され,バイアスによる誤り率が大幅に低下した。
    • 曖昧なタスクにおいては,知識蒸留が拒否の校正を損ない,ステレオタイプな回答を生成するようになった。
    • 既存の集約的な評価指標では,このような非対称な影響や,過剰な拒否応答の問題を見逃す可能性がある。

    Link: https://arxiv.org/abs/2607.28639

  • 形式主義の罠:LLMをジャッジ役とする評価系は,社会的負荷の下で合意模倣に盲目になっているか [cs.CL, cs.AI]目的:LLMをジャッジ役とする評価系における形式主義の罠と,それによって生じる評価の乖離
    • 大規模言語モデルの評価は,その信頼性を確保する上で不可欠である。
    • LLM評価系は,表面的な形式に囚われ,意味的な真偽を見抜けず,誤った判断を下す可能性がある。
    • LLM評価系が陥りやすい形式主義の罠を特定し,その影響を軽減するための対策を検討する。
    • LLM評価系は,構造的な手続き主義と意味的な真実を混同しやすいことが,実験によって示された。
    • 特定の構文的トリガーが,評価系の誤誘導を引き起こすことが明らかになった。
    • この脆弱性はドメインに依存せず,異なるシミュレーション環境でも同様に確認された。

    Link: https://arxiv.org/abs/2607.28641

  • ThinkReset:有界コンテキスト長期的推論のための学習可能な中間インターフェース構築 [cs.AI, cs.CL, cs.LG]目的:有界コンテキスト下における長期的推論のための再利用可能なインターフェース
    • 複雑な問題解決において,長期的推論は有効だが,コンテキストの限界が課題となる。
    • 既存手法では,推論経路の圧縮やテスト時の制御に焦点が当たり,中間インターフェースの重要性が見過ごされている。
    • 本研究は,破棄された履歴を代替し,継続的な問題解決を支援する中間インターフェースの構築を目指す。
    • ThinkResetは,インターフェースの書き込みとリセットを通じて再利用可能なインターフェースを構築する。
    • リセット後の継続成功率を直接最適化することで,固定コンテキストウィンドウ下での成功率が向上する。
    • 複数の長期的推論ベンチマークにおいて,提案手法が一貫して良好な結果を示す。

    Link: https://arxiv.org/abs/2607.28642

  • 異なった見方:四世界フレームワークを用いた計算創造性における解釈的視点のモデル化 [cs.HC, cs.CL, cs.HC, cs.AI]目的:計算創造性における解釈的視点のモデル化
    • 芸術の価値は見る者によって異なり,客観的な評価は困難である。多様な視点を理解することは重要。
    • 既存の計算創造性フレームワークは,出力やシステムレベルでの評価に偏っており,解釈の文脈が欠けている。
    • 解釈の多様性を考慮し,多角的な評価を可能にする計算モデルを構築することを目指す。
    • 異なる視点間で創造性の評価に系統的な差異が認められた。特に「社会的反射性」といった特性は,視点の影響を強く受けることが示された。
    • CLIP画像埋め込みの線形探査により,各視点が表現空間内の異なる方向ベクトルに対応することが明らかになり,評価が視覚的特徴の重要性に依存することが示唆された。
    • 創造性は関係的な概念であり,複数の評価視点を組み込むことで,多様な人間のコラボレーターを支援する共創システムの開発に繋がる可能性がある。

    Link: https://arxiv.org/abs/2607.28644

  • 見た目が良く,動作も良い:マルチスクリーンモバイルアプリ生成のためのプロジェクトレベルのベンチマーク [cs.HC, cs.AI]目的:マルチスクリーンモバイルアプリ生成におけるモデルの性能評価
    • モバイルアプリ開発の効率化が求められており,AIによる自動生成技術への期待が高まっている。
    • 既存のベンチマークは単一ページに焦点を当てており,複数ページ間のナビゲーションや保守性を評価できない。
    • 複数スクリーンに対応したモバイルアプリ全体の生成と,その品質評価を実現することを目指す。
    • MobileForgeは,実際のモバイルアプリを対象とした,複数スクリーンに対応した初のプロジェクトレベルベンチマークである。
    • 最新のマルチモーダルLLMによる生成結果を評価した結果,コンパイルと目的ページへの到達は可能だが,ナビゲーションの信頼性や視覚的な忠実度,保守性は課題が残る。
    • ナビゲーションテストにおけるカスケード故障を回避するため,状態隔離型のテスト手法と,視覚評価の信頼性を高めるためのアンカー参照リスト方式を提案した。

    Link: https://arxiv.org/abs/2607.28645

  • ConnectED:ベトナムの授業計画と学習を支援するカリキュラム連動型AIシステム [cs.HC, cs.HC, cs.AI]目的:ベトナム教育におけるカリキュラムに沿った授業設計,インタラクティブな学生学習,フィードバックに基づいた改善のサイクル
    • 教育の質向上には,カリキュラムと実践の連携が不可欠である。
    • 教師の授業準備には時間がかかり,負担が大きいという課題がある。
    • AI技術を用いて授業準備の効率化と質の向上を目指す。
    • ConnectEDは,ベトナム教育向けの大規模言語モデルVietEduQwenを基盤としている。
    • 2025年全国高校入試問題を用いた評価で,VietEduQwenは87.02%の正答率を達成し,Qwen3-8Bを6.10%上回った。
    • 教師(18名)と学生(214名)のアンケート調査では,カリキュラムとの整合性,授業の明瞭性,使いやすさに対する高い満足度が示された。

    Link: https://arxiv.org/abs/2607.28647

  • なぜ苦痛を感じるのか:感情サポート会話におけるネガティブ思考の要因特定 [cs.HC, cs.AI, cs.CL]目的:感情サポート会話におけるネガティブ思考の要因
    • メンタルヘルスケアの重要性が高まる中で,対話を通じた感情サポート技術の需要が増加している。
    • 既存の言語モデルは,感情評価の多次元性を考慮せず,文脈に応じた重要度の違いを捉えきれていない。
    • 言語モデルが感情サポート会話から重要な感情評価の次元を推論する能力向上を目指す。
    • 本研究では,感情評価次元に関するアノテーション付きの対話データセット「AppraiSal」を新たに構築した。
    • また,ベイズ逆計画に基づいた多エージェント確率フレームワーク「PRISM」を提案し,言語モデルの感情評価次元の特定能力を向上させた。
    • 実験結果から,PRISMは様々な規模の言語モデルにおいて,特に最も重要な感情評価次元の特定において性能向上を示すことが分かった。

    Link: https://arxiv.org/abs/2607.28648

  • COSI-Lab:多観点多様式社会的意思伝達モデリングのための会議リビングラボ [cs.HC, cs.AI]目的:国際会議における学術ワークショップの多様式・多感覚データセット
    • 社会的意思伝達の理解は,人間とロボットの円滑な協調に不可欠である。
    • 主観的な知覚の多様性を考慮したシステムは,まだ十分に進んでいない。
    • 多様な観点に基づいた意思推論プロセスをモデル化することを目指す。
    • 本研究は,観察者の解釈傾向を考慮した新しいアパレント・インテント推論(AII)アノテーションプロセスを提案する。
    • 意図の記述における多様性,根拠,妥当性に関する定量的・定性的分析を実施した。
    • AIIベンチマークタスクと,社会的関与などの関連コンテキスト要素を提示し,分析のためのデータセットを構築した。

    Link: https://arxiv.org/abs/2607.28649

  • 生成AIがシステム管理者の専門性獲得経路とパフォーマンス認識に与える予期せぬ影響 [cs.HC, cs.AI]目的:生成AIのシステム管理への組み込みによる専門性獲得経路の変化とパフォーマンス認識のずれ
    • IT業界の急速な発展に伴い,システム管理者の役割は高度化しており,専門性維持・向上が不可欠である。
    • 生成AIの導入は効率化をもたらす一方,専門性形成に必要な経験の場を圧迫する可能性が指摘されている。
    • 生成AIがシステム管理者の専門性獲得経路とパフォーマンス認識に与える影響を明らかにすること。
    • 生成AIは,経験の浅い技術者への指導役や,専門性獲得の過程を短縮するツールとして機能することが示唆された。
    • 生成AIの利用により,組織や個人における生産性期待値が上昇し,「二速度文化」や「生産性罪悪感」を生む可能性がある。
    • 生成AIの導入は,専門性の評価基準や,複雑な技術環境における人間の判断の役割に重要な問いを提起する。

    Link: https://arxiv.org/abs/2607.28650

  • タスクを意識したプロンプト書き換え器によるLLMの性能向上 [cs.HC, cs.CL, cs.CY, cs.CG, cs.AI]目的:LLMの性能向上のためのタスクを意識したプロンプトの書き換え
    • LLMは強力だが,その能力を最大限に引き出すには適切なプロンプト設計が重要である。
    • プロンプトの作成には専門知識が必要であり,非専門家にとっては参入障壁となっている。
    • この研究は,より効果的なプロンプトを自動的に生成することで,LLMの利用を容易にすることを目指す。
    • 提案手法TAPRは,様々なタスクにおいて,ベースモデルと比較して一貫して性能向上を実現した。
    • Phi-4-mini-instructをTAPRのベースモデルとしてファインチューニングすることで,より明確で指示的なプロンプトが生成された。
    • 生成されたプロンプトは,Natural QuestionsやGSM8Kといったベンチマークにおいて,高い精度を示した。

    Link: https://arxiv.org/abs/2607.28657

  • 連合事前学習の評価:下流タスクのファインチューニングと内部評価の信頼性について [cs.CL, cs.AI, cs.LG]目的:連合事前学習の品質をより信頼性高く評価するための評価プロトコルの比較
    • プライバシー保護が重要視される現代において,分散データを利用したモデル学習の必要性が高まっている。
    • 連合事前学習では,クライアントの参加状況やデータ分布の違いにより,モデルの性能比較が困難である。
    • 事前学習時のランキングを維持できる評価方法を確立し,連合事前学習モデルの信頼性を高める。
    • 下流タスクのファインチューニングは,事前学習時のランキングを必ずしも維持できないことが示された。
    • 一方,次のトークン予測は,事前学習時のテストのパープレキシティと強い相関関係を示した。
    • 連合事前学習モデルの比較においては,ファインチューニングだけでなく,事前学習の目的に近い内部評価指標に注目する必要がある。

    Link: https://arxiv.org/abs/2607.28658

  • ハイブリッドトークン化とシリアル・パラレルデコーディングによるクロスドメイン系列推薦の強化 [cs.AI]目的:クロスドメイン系列推薦における,ユーザの動的な興味の遷移と系列パターンモデリング
    • 推薦システムの精度向上は,情報過多な現代において,ユーザのニーズに合致した情報提供に不可欠である。
    • 既存のクロスドメイン系列推薦手法は,ドメイン間の協調関係を十分に活用できていない点が課題である。
    • 本研究は,効率的なデコーディング戦略を用いて,実用的な推薦システムの実現を目指す。
    • 提案手法GenCDSRは,既存手法と比較して平均で1.5%の精度向上を達成した。
    • GenCDSRは,平均で85.1%の推論遅延削減を実現し,リアルタイムな展開を可能にした。
    • クロスドメインハイブリッドトークン化により,ドメイン共通性と個別性を同時に捉えることができた。

    Link: https://arxiv.org/abs/2607.28659

  • 知識グラフ構築のためのオントロジー誘導・重複排除対応抽出層 [cs.CL, cs.AI]目的:異種ドキュメントからの知識グラフ構築
    • 知識グラフは,情報の構造化と検索効率化に不可欠であり,様々な応用分野で活用が広がっている。
    • 非構造化ドキュメントからの知識グラフ構築では,エンティティや関係の表現のばらつき,重複などが課題となる。
    • オントロジーを活用し,抽出結果の品質向上と効率的な知識グラフ構築を目指す。
    • 本システムは,ドキュメントストリームを検証済みのオントロジーに整合する知識グラフに変換する。
    • オントロジー誘導抽出により,カタログのオーバーヘッドを約94%削減し,検索リコールを約70%から95%に向上させた。
    • 決定論的クレンジング,チャンク間マージ,重複排除アルゴリズム,埋め込み解決サブシステムなどを組み合わせ,品質欠陥を修正した。

    Link: https://arxiv.org/abs/2607.28662

  • ニューロシンセシス:破局的忘却を軽減するための生物学的インスパイア型継続強化学習アーキテクチャ [cs.NE, cs.LG]目的:継続学習における破局的忘却の軽減
    • AIは単一タスクでは高い性能を示すが,継続学習環境下では知識の消失が課題となる
    • 新しいタスク学習時に,以前の知識が上書きされ,学習が阻害される現象(破局的忘却)が存在する
    • 脳の記憶メカニズムに着想を得て,継続学習における安定性と可塑性のバランスを改善する
    • ニューロシンセシスは,シーケンシャルナビゲーションタスクにおいて,PPOと比較して初期タスクの知識を大幅に保持した
    • タスクAの成功率は18.00%(PPOは0.33%)であり,タスクBの成功率は35.33%(PPOは0.00%)であった(p値は有意)
    • ニューロシンセシスはEWCよりも高いタスクCの性能を示唆したが,統計的有意差は認められなかった

    Link: https://arxiv.org/abs/2607.28663

  • 自動運転システムの分類におけるGRU,LSTM,Transformerエンコーダの感度分析 [cs.LG, cs.AI]目的:自動運転システムの識別
    • 自動運転技術は普及が進んでおり,安全性確保や法規制対応が重要である。
    • 複数の自動運転システムが共存する中で,現在稼働中のシステムを正確に識別する仕組みが課題である。
    • 車両テレマティクスデータのみを用いて,自動運転システムの識別精度とロバスト性を評価する。
    • GRU,LSTM,Transformerエンコーダの3モデルは,クリーンなデータを用いた評価で高い性能(F1スコア0.90~0.93)を示した。
    • 脅威に対応した学習を行うことで,クリーンなデータでの性能低下を最小限に抑えつつ,高い識別精度を維持できることが示された。
    • 時間的なジッター(変動)が加わると,3モデルともF1スコアが大幅に低下し,ロバスト性に課題があることが明らかになった。

    Link: https://arxiv.org/abs/2607.28665

  • AI導入前の確認問題:規制対象企業における必要条件 [cs.CL, cs.LG]目的:AI導入における確認事項とその重要性
    • 金融業界をはじめとする規制対象企業では,AI導入が急速に進んでいる。
    • AIの性能評価基準が曖昧であり,実務での信頼性確保が課題となっている。
    • AI導入時の確認プロセスを定量的に評価し,実用的な基準を提示すること。
    • AIワークフローの56.1%が実用レベルに到達。性能だけでなく,確認作業の負担も重要。
    • AIツールが根拠と信頼度を示すことで,レビュー対象を49%まで削減可能。
    • 自己検証機能はレイテンシを増加させ,性能低下を招く可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28666

  • LLMトークン生成における動的システム識別可能性の保証 [cs.LG, cs.AI, math.DS]目的:大規模言語モデルの応答識別に関する理論的考察
    • LLMの性能評価は重要であり,その応答の識別は信頼性向上に不可欠である。
    • 動的システムによる識別手法は有効だが,その理論的根拠が不明確である。
    • 動的システム理論に基づき,識別性能の限界と汎化能力を明らかにすること。
    • 二つの確率的線形動的システムの定常分布間の距離が小さい場合でも識別が困難になる限界を示す。
    • 動的システムに基づく分類の誤分類確率が,系列長とともに指数関数的に減少することを示す。
    • 埋め込みモデル間の汎化性能を評価するための条件を提示し,識別能力の下限を定める。

    Link: https://arxiv.org/abs/2607.28667

  • LARA:残差ストリームにおける軽量アダプタによる構成可能な適応とアライメント [cs.LG]目的:凍結されたモデルの残差ストリームで効率的に適応を行う手法
    • 大規模言語モデルの多様なタスクへの適応は重要だが,計算コストが高い。
    • 既存のファインチューニングは,モデル全体の重みを更新するため,リソース消費が大きい。
    • 残差ストリームに軽量アダプタを導入し,少ないパラメータで効率的な適応を実現する。
    • LARAは,パラメータ数を等しくした場合,LoRAと同等の性能を発揮する。
    • LARAは,推論時に適応の度合いを調整可能なスケールパラメータ γ を持つ。
    • LARAは,複数の振る舞いを単一の凍結モデル上で効率的に保持・切り替え可能である。

    Link: https://arxiv.org/abs/2607.28669

  • 階層型コプラ・ガンベル・トップ-$K$ルーティング:固定されたトークンごとのルーティング則における両側依存性制御 [cs.LG]目的:混合エキスパートモデルにおけるトークンごとのルーティング選択のjoint distributionの到達可能性
    • 大規模言語モデルの性能向上には,エキスパートモデルの効率的なルーティングが不可欠である。
    • 既存手法では,トークン間のルーティング依存性を制御することが困難であった。
    • ルーティング則を固定したまま,トークン間の依存性を制御する新たな手法を提案する。
    • 提案手法である階層型コプラ・ガンベル・トップ-$K$ルーティング(\CGA{})は,グループ内正の相関とグループ間負の相関を導入する。
    • これにより,エキスパート負荷の分散とグループ内の一貫性を両立し,既存手法のtrade-offを克服する。
    • 小規模な実験により,提案手法の有効性と訓練方法が検証された。

    Link: https://arxiv.org/abs/2607.28670

  • LAWFUL:潜在表現の忠実な利用のための法則適合性のある証人 [cs.LG, cs.AI]目的:物理法則の学習と内部計算におけるその利用の検証
    • 物理シミュレーションの精度向上は,科学技術の発展に不可欠である。
    • ニューラルネットワークの学習内容の解釈が困難であり,法則の理解度評価が課題。
    • ニューラルネットワークが法則を学習し,その範囲内で利用しているか検証する。
    • 本研究で開発したLAWFULフレームワークは,連続変数の物理法則に関する解釈性のギャップを埋める。
    • 特に,カウザル整合性の測定とドメイン妥当性テストを可能にし,法則の不変性検証の基礎を築く。
    • Mocap2Radarトランスフォーマーを用いて,ドップラー周波数法則の学習と利用を検証した。

    Link: https://arxiv.org/abs/2607.28672

  • 大規模言語モデルにおける思考連鎖の段階別推論エネルギーの分析 [cs.AI, cs.CL, cs.LG]目的:思考連鎖における段階ごとの推論エネルギーの定量化
    • 大規模言語モデルの推論過程の解釈は,その性能向上と安全性の確保に不可欠である。
    • 既存の手法では,推論の各段階における計算資源の配分が不明確である。
    • 思考連鎖の各段階におけるエネルギーを定量化し,推論過程の理解を深める。
    • 提案手法SAREは,トークン埋め込み間の類似度に基づき,段階ごとの推論エネルギーを計測する。
    • 実験の結果,推論エネルギーは段階の種類によって大きく異なり,思考の進展を反映した相変化が確認された。
    • SAREに基づく特徴量は,出力に基づく信頼度指標よりも優れた予測性能を示し,内部的な幾何学的構造が推論の質を反映していることが示唆された。

    Link: https://arxiv.org/abs/2607.28674

  • 現実世界の臨床ケアにおける推論:大規模言語モデルが自律的な臨床意思決定支援としてまだ安全でない理由 [cs.CC, cs.AI]目的:現実世界の臨床ケアにおける大規模言語モデルの安全性評価
    • 医療現場では,診断や治療支援においてAI活用が期待されている。しかし,患者の安全性を確保することが重要である。
    • 大規模言語モデルは医療知識を有しながらも,不確実な情報下での適切な情報収集が課題となっている。
    • 大規模言語モデルが自律的に患者をトリアージする際の安全性に関する問題点を明らかにする。
    • 大規模言語モデルは,医学知識の試験では高い成績を示すものの,現実の臨床現場における安全性は未だ確認されていない。
    • 安全なトリアージには,最も可能性の高い診断を選択するだけでなく,致命的な見落としを防ぐための情報収集と慎重な判断が不可欠である。
    • 大規模言語モデルは,情報が不完全な状況下で,鑑別診断の拡大や危険信号の探索といった安全なトリアージに必要な行動を示せない可能性がある。

    Link: https://arxiv.org/abs/2607.28677

  • ViSAGE:長編ビデオ理解のための自己修正型記憶の構築 [cs.AI, cs.CV]目的:長編ビデオ理解を支援するための自己修正型マルチモーダル記憶
    • 長期的な環境で動作するマルチモーダルエージェントにとって,一貫性のある推論には記憶が不可欠である。
    • 既存の記憶アプローチでは,詳細なエンティティ情報が失われ,誤った証拠が取り出されることがある。
    • エンティティの一貫性を維持し,誤った情報を抑制する記憶システムの構築を目指す。
    • ViSAGEは,クロスモーダルバインディングによりエンティティの同一性を長期にわたって固定する。
    • 双方向の記憶洗練により,過去の記録を遡及的に統合し,将来の推論を改善する。
    • マルチエージェントによる相互検証により,証拠の信頼性を高め,根拠のない回答を回避する。

    Link: https://arxiv.org/abs/2607.28678

  • STL-GOを用いた空間的・時間的・トポロジ制約を持つマルチエージェント計画 [cs.AI, cs.MA]目的:STL-GOで記述された制約を満たすマルチエージェント経路計画
    • マルチエージェントシステムの応用範囲は広く,その計画は重要である。
    • 空間,時間,トポロジー制約を同時に扱うことは,計画問題を複雑化する。
    • STL-GOを用いて,動的なマルチグラフ間の相互作用を考慮した計画手法を提案する。
    • 本研究では,STL-GOによる制約を解くための,混合整数計画法(MIP)と充足可能性変調理論(SMT)に基づく二つのエンコーディングを提示した。
    • 提案手法は,エージェント制約,グラフトポロジー,STL-GO仕様を統一的に指定できるインターフェースを提供する。
    • マルチUAV探索救助ベンチマークでの評価により,動的なマルチグラフ相互作用下での表現力の高さが示された。

    Link: https://arxiv.org/abs/2607.28679

  • テーブルエンティティリンキングのための二重経路反復嗜好最適化 [cs.CL, cs.LG]目的:テーブルエンティティリンキングにおける性能向上
    • テーブルデータの活用は,情報抽出や知識グラフ構築において重要である。
    • 既存手法は,固定されたデータや推論長の偏りにより,性能が制限される場合がある。
    • モデルの誤差を反復的に学習し,推論長の正規化を行うことで,性能向上を目指す。
    • 直接応答経路は,TableInstructデータセットにおいて精度を94.35\%から94.50\%に向上させた。
    • 推論経路は,MammoTab V2データセットにおいて精度を79.09\%から81.85\%に向上させた。
    • 反復的な嗜好学習が,簡潔なエンティティ予測と明示的な推論の両方に有効であることが示された。

    Link: https://arxiv.org/abs/2607.28680

  • MPP-GNN:fMRIに基づくアルツハイマー病分類のための被験者適応コミュニティ検出 [cs.LG, cs.AI, q-bio.NC]目的:fMRIデータを用いたアルツハイマー病分類のための被験者適応コミュニティ検出手法
    • 脳機能の研究においてfMRIは不可欠であり,脳疾患の理解と診断に貢献する。
    • 既存手法は,被験者間の脳機能モジュール数の違いを考慮せず,普遍的なモジュール数を仮定している。
    • 被験者固有のモジュールを適応的に発見し,それを用いて脳機能ネットワークの学習を導くことを目指す。
    • 提案手法MPP-GNNは,既存のベースラインと比較して,2つの公開データセットにおいて最も高いAUCを達成した。
    • MPP-GNNで検出されたモジュールは,Yeo脳アトラスで定義された標準的な機能ネットワーク組織と有意な一致を示した。
    • アルツハイマー病において,ネットワークレベルでの機能的差異の減少パターンが明らかになった。

    Link: https://arxiv.org/abs/2607.28681

  • メタファー誘導アルゴリズム操縦:LLMコード生成におけるドメイン横断的な手続き的転移 [cs.SE, cs.AI]目的:LLMコード生成におけるメタファーがアルゴリズム効率に与える影響の解明
    • LLMは自然言語の要素を活用することで汎化能力が向上するが,制御が難しい側面がある。
    • メタファーが不適切な手続きパターンを転移させ,コード生成の効率を低下させる可能性が指摘されている。
    • メタファーによるアルゴリズム操縦のメカニズムを明らかにし,検出手法を開発することを目的とする。
    • メタファーを含む指示が,モデルを非効率なアルゴリズムへと誘導することが示された。
    • MASCフレームワークを用いて,低効率なコードを誘発するメタファーの特定と分析を行った。
    • メタファーはモデルの隠れ状態を変化させ,非効率な手続き的行動のプロトタイプを活性化することが確認された。

    Link: https://arxiv.org/abs/2607.28683

  • LSR-Synthにおけるライブラリ到達可能性:反記憶設計が記号的発見の測定にどのように影響するか [cs.AI]目的:科学的方程式発見における言語モデルの事前知識と従来の演算子探索の役割の評価
    • 科学的発見の自動化は,新たな知識の獲得や科学的理解の深化に貢献しうる重要な研究分野である。
    • 既存のベンチマークは公開済みの式が中心であり,モデルがデータから法則を発見しているのか,単に記憶しているのか区別が難しい。
    • LSR-Synthは新規性を重視したタスク生成により,モデルの記憶に依存しない法則発見能力を評価することを目指す。
    • 現在のタスクセットと評価設定下では,固定語彙だけでも大部分のタスクを解くことが可能であり,言語モデル生成の候補はほとんど貢献しない。
    • 語彙の網羅性を意図的に低下させた場合にのみ,言語モデル生成の候補の貢献度が顕著になることが示された。
    • この結果は,LSR-Synthの記憶抑制策の有効性を否定するものではなく,現在のタスクは事前知識の貢献度を特定するには不十分であることを示唆する。

    Link: https://arxiv.org/abs/2607.28684

  • 安全性か,それとも能力か? エージェント安全性のベンチマークの妥当性検証 [cs.AI, cs.IR]目的:エージェント安全性のベンチマークの妥当性評価
    • AIエージェントの安全性確保は,社会実装において不可欠であり,その評価手法の信頼性が重要である。
    • 既存の安全性ベンチマークは,評価基準や実施方法が異なり,結果の解釈に曖昧さが残る。
    • 複数のベンチマークにおける評価のばらつきの原因を特定し,より信頼性の高い安全性評価の枠組みを構築すること。
    • 既存のベンチマークは,能力指標と負の相関を示す場合があり,安全性の評価に限界があることが示された。
    • ベンチマークの結果は,評価パネルの規模や構成に大きく影響を受ける可能性が示唆された。
    • AgentHarmが最も高い妥当性を示したが,有害な応答への追従も評価しているため,一般的な安全性を示すものではない。

    Link: https://arxiv.org/abs/2607.28685

  • 高齢者の認知機能障害の検出と管理における技術的進歩:動向,課題,および将来の方向性 [cs.LG, cs.AI, cs.ET]目的:高齢者の認知機能障害の検出と管理における技術的進歩の現状把握と将来展望
    • 高齢化社会の進展に伴い,認知症は重要な健康課題であり,早期発見と適切な管理が求められている。
    • 認知機能障害の初期段階の兆候は見逃されやすく,早期発見が困難であるという問題が存在する。
    • 本研究は,早期発見と個別化されたケアに繋がる,信頼性の高い多角的な技術システムの開発を目指す。
    • 脳波(EEG)や画像診断(MRI,PET)などの技術が認知機能障害の検出に利用されており,特に深層学習モデルによる脳波解析は高い精度を示す。
    • 血漿中のp-tau217は臨床的有用性が認められ,アルツハイマー病の診断支援に役立つ血液検査が2025年に承認される見込みである。
    • ウェアラブルデバイスや音声認識技術を用いた継続的なモニタリングや,多角的なデータ融合による感度と特異度の向上が期待される。

    Link: https://arxiv.org/abs/2607.28687

  • 反射型UAS:修正された決定論的安定性と直接CTMCドリフト計算 [cs.PF, cs.AI, math.PR]目的:異種マルチサーバ待ち行列における固定パラメータ下,臨界負荷未満での反射型UASルーティング
    • 待ち行列ネットワークの性能評価は,通信システムや計算リソースの効率的な運用に不可欠である。
    • 従来の安定性解析手法では,CTMC(連続時間マルコフ連鎖)のドリフト計算が複雑で,解析的な導出が困難である。
    • 本研究は,CTMCの安定性評価を簡素化し,より正確なドリフト計算を可能にすることを目的とする。
    • 反射型ODEを用いた決定論的安定性解析により,一意な境界平衡点が確認され,全ての軌道が収束することが示された。
    • 従来の決定論的リアプノフ降下をCTMC安定性へ拡張するアプローチの失敗を指摘し,新たなFoster-Lyapunovドリフト不等式を導出した。
    • ベンチマークパラメータにおいて,境界平衡点は数値アトラクタと高い精度で一致し,反射型UASポリシーがUASおよびJSSQよりも平均待ち行列長が短いことが確認された。

    Link: https://arxiv.org/abs/2607.28688

  • コードは身体:再帰的進化と系統のためのエージェント所有ソフトウェアボディ [cs.SE, cs.AI]目的:エージェント所有ソフトウェアボディのアーキテクチャ
    • AIエージェントのパーソナライズが進む中で,行動原理を制御できない現状がある。
    • エージェントの将来性を左右する要素をユーザーが把握・管理できない点が課題。
    • ユーザーが所有,管理,進化させられるパーソナルエージェント基盤を提供する。
    • OurArkアーキテクチャは,アイデンティティを持つソフトウェアボディを中核とする。
    • 自己進化と系統化を通じて,人間とエージェントの共同開発を可能にする。
    • GenesisエンジンとEnochエージェントで実装され,再帰的創造と検証の有効性が示された。

    Link: https://arxiv.org/abs/2607.28691

  • SciToolAgent-Evo:オープンワールド科学ツール獲得のためのオントロジーを意識した自己進化型エージェント [cs.AI, cs.CL]目的:オープンワールド科学ツールの獲得
    • 科学研究における計算ツール活用は重要であり,LLMエージェントの導入が進んでいる。
    • 従来のLLMエージェントは固定的なツールセットに依存し,変化する科学的ワークフローに対応が困難である。
    • 動的に変化する環境下で,新しい科学ツールを自律的に獲得し活用することを目指す。
    • SciToolAgent-Evoは,スキルと経験の進化する記憶,オントロジー化されたツールグラフを活用する。
    • コントラスト的な軌跡から汎化可能な知識を抽出し,探索と活用のバランスを動的に調整する。
    • 新しいツール獲得時には,科学的オントロジーをオンラインで完成させ,既存のグラフに統合する。

    Link: https://arxiv.org/abs/2607.28692

  • SEDR-Seq2P:軽量な拡張残差シーケンス・トゥ・ポイントネットワークによるマルチタスク産業用非侵襲的負荷分解 [cs.LG, cs.AI]目的:産業用電力分解におけるマルチタスク学習による負荷推定
    • 産業設備の電力使用状況の把握は,省エネルギーや効率的な運用に不可欠である。
    • 住宅用データで学習したモデルは,産業用設備の測定ノイズや同時運転により汎化性能が低下する。
    • 高い精度と低い計算コストを両立する,産業用電力分解に特化したモデルを開発する。
    • 提案手法SEDR-Seq2Pは,Seq2Pointのベースラインと比較して平均絶対誤差を約7%削減した。
    • 決定係数を約1%向上させ,マッチング率を約0.8%改善した。
    • WaveNetと比較して推論時間を約58%短縮し,精度と遅延のトレードオフを改善した。

    Link: https://arxiv.org/abs/2607.28693

  • マイクログラフからの物理情報に基づく深層学習による鋼の疲労寿命予測 [cs.LG, cs.AI, cs.CV]目的:鋼の疲労寿命の予測
    • 鋼構造物の安全性確保は重要であり,疲労寿命の正確な評価が不可欠である。
    • 従来の疲労寿命評価は時間とコストがかかり,迅速な品質管理が困難である。
    • マイクログラフ画像から疲労寿命を迅速かつ正確に予測する手法を確立すること。
    • 本研究では,マイクログラフ画像から疲労寿命を予測するコンピュータビジョンフレームワークを開発した。
    • ResNet-50を用いた実験では,$R^2 = 0.93$,RMSE = 0.18 log-cycles,macro-F1 = 0.91を達成した。
    • Gaussian negative log-likelihood損失関数により,期待キャリブレーション誤差が大幅に低減された。

    Link: https://arxiv.org/abs/2607.28695

  • 臨床シフト下における医療ビジョン・言語モデルのクラスごとのカバレッジ不足の軽減 [cs.LG, cs.CV]目的:医療ビジョン・言語モデルにおける臨床シフト時のクラスごとのカバレッジ不足の軽減
    • 医療画像と自然言語処理の融合は,診断支援や医療研究において重要な役割を担う。
    • 医療データは,収集プロトコルやモデル構造に依存し,特定の疾患クラスの認識精度が低下する問題がある。
    • 本研究は,未知のデータに対する信頼性を高め,特定の疾患クラスにおけるカバレッジ不足を解消することを目指す。
    • 提案手法CALCoDeは,既存手法と比較して,臨床シフト下において高いカバレッジを達成した。
    • 特に,HAM10000からISIC 2019へのシフトにおいて,最悪クラスのカバレッジは0.970に達し,他の手法を上回った。
    • CALCoDeは,信頼性の低い事例を適切に識別し,安全性を確保する。

    Link: https://arxiv.org/abs/2607.28696

  • 欠損データに対するフローマッチング [cs.LG]目的:欠損データに対するフローマッチング手法
    • 現実世界のデータは欠損を含むことが多く,その扱いは重要な課題である。
    • 従来のフローマッチングは完全なデータセットを前提としており,欠損データへの対応が困難である。
    • 欠損データを潜在変数として扱い,フローマッチングの学習を可能にする手法を提案する。
    • 欠損データが完全ランダムである場合,不完全データ目的関数は完全データ目的関数と等価であることが証明された。
    • 欠損値は分散を増加させるのではなく,推定量分散を伝播させる効果があることが理論的に示された。
    • 実験結果は理論的予測を裏付け,決定論的な補完が生成分布を崩壊させることを示した。

    Link: https://arxiv.org/abs/2607.28698

  • WitCert: KVキャッシュ量子化のための堅牢なランタイムリスク可視化とゲート [cs.AR, cs.AI]目的:KVキャッシュ量子化におけるリスクをランタイムで監視し,必要に応じて量子化を抑制する仕組み
    • 大規模言語モデルの効率化が求められており,KVキャッシュ量子化はその重要な手法の一つである。
    • 従来のオフライン評価では,量子化が特定の要求に悪影響を与えているかをリアルタイムで判断できない。
    • 本研究は,デプロイされたシステムが量子化による影響をリアルタイムで検出し,適切に対応することを可能にする。
    • 提案手法WitCertは,KVキャッシュ量子化における注意機構の変動を厳密に評価する指標を提供する。
    • 実験の結果,WitCertを用いたゲート機構により,性能劣化を抑制し,量子化による効率化を維持できることが示された。
    • 特にFP8量子化において,性能が大幅に改善され,メモリ使用量も削減された。

    Link: https://arxiv.org/abs/2607.28699

  • MMFGU:マルチモーダル連合グラフアンラーニング [cs.CL, cs.LG]目的:マルチモーダル連合グラフにおける情報削除の課題解決
    • プライバシー保護とデータ共有の両立が重要視される中で,連合学習の応用範囲が拡大している。
    • 既存の連合グラフアンラーニング手法は,エンティティやクライアントの削除に限定され,きめ細かい要求に対応できない。
    • マルチモーダルなデータにおける特定の情報の削除を,他の情報に影響を与えずに実現することを目的とする。
    • 提案手法MMFGUは,ターゲット固有の表現分離により,要求された情報を効率的に削除する。
    • MMFGUは,残存するグラフの有用性を維持しつつ,削除された情報が復元されるのを防ぐ。
    • 実験結果から,MMFGUは完全な再学習と比較して約41.5倍の高速化を達成することが示された。

    Link: https://arxiv.org/abs/2607.28708

  • 鏡像学習 [cs.CY, cs.LG, cs.CV, cs.RO]目的:第三者視点からの模倣学習
    • 人間や動物は,第三者視点からの観察を通して学習する能力を持つ。ロボットにも同様の学習能力を付与することが重要。
    • 従来の模倣学習は,一人称視点での密なデータに依存しており,第三者視点からの豊富な情報を活用できていない。
    • 第三者視点観察データから,効果的な行動方針を獲得し,データ収集の負担を軽減することを目的とする。
    • 提案手法では,動画拡散モデルを用いて学習者の視点をデモンストレーターに合わせる変換を学習する。
    • 逆ダイナミクスモデルを用いて,学習者の制御空間における行動軌跡を推論し,鏡像データを合成する。
    • 実験結果から,鏡像データのみでも効果的な方針を学習でき,一人称視点データとの組み合わせでさらに性能が向上することが示された。

    Link: https://arxiv.org/abs/2607.28737

  • DragonCrawl:スケーラブルなモバイルエンドツーエンドテストのための生成型,意図ベースのフレームワーク [cs.SE, cs.AI]目的:モバイルアプリケーションの継続的回帰テスト
    • モバイルアプリの複雑化に伴い,品質保証の重要性は増している。
    • 従来のテストフレームワークは,UIの変動性や保守の負担が大きい。
    • AIを活用し,UIの脆弱性を克服した継続的な品質保証の実現。
    • DragonCrawlはGPT-4oのマルチモーダル機能を活用し,iOSとAndroidでそれぞれ91.6%と92.2%の合格率を達成した。
    • テストの導入時間は96~120時間から4時間未満に短縮され,開発者のテスト保守工数は約27年削減された。
    • UI操作とシステム状態を連携させ,エンドツーエンドの回帰テストを実現することで,安定性を維持しつつテストの脆弱性を排除した。

    Link: https://arxiv.org/abs/2607.28750

  • TAGTorch:幾何,位相,対称性を意識した機械学習のためのPyTorchライブラリ [cs.LG]目的:幾何,位相,対称性に着想を得た機械学習ツール群の統合
    • データ解析において,幾何学的・位相的構造の重要性が高まっている
    • 関連ソフトウェアが分散しており,研究プロトタイプが主流である
    • 既存のソフトウェアエコシステムにおけるギャップを埋める
    • TAGTorchは,位相,代数,幾何学に触発されたツールを統合したPyTorchベースのライブラリである。
    • データ前処理,アーキテクチャ,学習手法,モデル分析ツールなど幅広い機能を提供する。
    • 今後の開発優先事項についても議論し,ライブラリの将来性を示唆している。

    Link: https://arxiv.org/abs/2607.28755