arXiv雑要約

AI - 2026/07/30 公開

  • 深層強化学習における凍結ランダムCNN特徴抽出器における創発的な疎性 [cs.LG, cs.AI, cs.NE]目的:深層強化学習エージェントにおける表現の疎性
    • 深層強化学習は複雑なタスクの学習に有効だが,計算コストが高い。
    • 従来の深層強化学習では,特徴抽出器の学習も行うため,計算量が増大する。
    • 凍結されたランダムな特徴抽出器を用いることで,計算コスト削減と性能維持を目指す。
    • 凍結されたランダムCNN特徴抽出器を用いた深層強化学習エージェントは,明示的な疎性誘導なしに極めて疎な全結合表現を自発的に発達させる。
    • タスクの複雑さに応じて,全結合層(FC1)で活性化するニューロン数が1~42程度に限定され,タスク構造を反映している。
    • 活性ニューロンを削除すると性能が低下し,その重要性が確認された。また,ボトルネックは学習初期に決定される。

    Link: https://arxiv.org/abs/2607.26059

  • 顧客デジタルツインシミュレーションによる大規模チャットボットの検証 [cs.CL, cs.AI]目的:大規模チャットボット検証の実現
    • 顧客対応におけるLLM活用は重要だが,安全性確保のための検証が課題。
    • 大規模な検証にはコストと時間がかかり,現実的な手法が不足している。
    • デジタルツインを活用し,効率的かつスケーラブルな検証手法を確立する。
    • リアルな顧客データを基にした合成顧客エージェント(SCA)が,高い意味的整合性と低い幻覚率を示すことが確認された。
    • SCAを用いた検証フレームワークが,自動評価,専門家テスト,敵対的テストを組み合わせることで,堅牢な性能を実証した。
    • 本手法は,大手イギリスの銀行における顧客対応チャットボットの検証に適用され,規制遵守への道筋を示した。

    Link: https://arxiv.org/abs/2607.26060

  • Sim2Win:チーム非依存型,イベントベースのサッカー事前試合結果予測と戦術プロファイリングシステム [cs.LG, cs.AI]目的:サッカーの事前試合結果予測と戦術プロファイリング
    • プロサッカーにおける事前戦術決定は重要であり,試合結果に大きく影響する。
    • 既存の戦術分析は主観的で,未知のチームへの汎用性に乏しいという課題がある。
    • チーム非依存な戦術分析により,未知のチームに対しても有効な予測を目指す。
    • Sim2Winは,チーム名やチーム固有の情報を用いずに戦術プロファイルを構築し,試合結果を予測する。
    • LOCO評価の結果,Sim2Winは未知のチームに対しても,既存の予測モデルを上回る性能を示した。
    • 戦術的行動表現が,チームの識別情報に依存しない予測において有効であることが示唆された。

    Link: https://arxiv.org/abs/2607.26061

  • LLMベースのチャットAIにおける知的障害者に対する潜在的偏見の特定 [cs.CY, cs.AI, cs.CL]目的:知的障害を持つ人々に関するLLMベースのチャットAIの表現の違い
    • AI技術は社会に浸透しつつあり,公平性と包容性を確保することが重要である。
    • AIモデルは学習データに含まれる偏見を内在化し,差別を再生産する可能性がある。
    • 知的障害者に対するAIの潜在的な偏見を明らかにし,軽減策を検討する必要がある。
    • プロンプトに知的障害に関する記述の有無で,生成される物語の表現に差異が見られた。
    • 知的障害を持つ人々は,より若く,保護的な対象,象徴的な存在として描かれる傾向があった。
    • 助けを必要とする,依存している,救われる,といった否定的な認識や,包容を躊躇する様子が示された。

    Link: https://arxiv.org/abs/2607.26062

  • 学生の数学的能力のモデリングにおけるクラスター分析:原型か能力か [cs.CY, cs.AI, cs.LG]目的:学生の数学的能力のモデリング
    • 教育分野において,学習者の能力を正確に把握することは,効果的な個別最適化学習システムの構築に不可欠である。
    • 従来の数学的能力のモデル化では,離散的な能力が段階的に獲得されるという仮定に基づいているが,その妥当性は十分に検証されていない。
    • 大規模なデータを用いて,数学的能力が離散的なスキルセットによって構成されるのか,それとも全体的な能力に依存するのかを検証すること。
    • ベルヌーイ混合モデルを用いた分析の結果,明確な離散的なスキルセットを示すクラスターは少数であり,学生全体の能力が主要な要因であることが示された。
    • モデルの精度は78%であり,より複雑なモデルと同等以上の性能を示すとともに,解釈可能性が高いという利点がある。
    • 個々の問題の正答率を特徴量として用いることで,わずかな性能向上が認められたが,トピックごとの能力の偏りは強くないことが示唆された。

    Link: https://arxiv.org/abs/2607.26063

  • AIエージェントの時代が,信頼できる科学を維持するための新たな科学的パラダイムを要求する [cs.CY, cs.AI]目的:科学における信頼性の維持
    • 科学の発展には,検証可能な結果の蓄積が不可欠である。
    • AIエージェントの能力向上により,検証能力が追いつかない状況が生じている。
    • AIエージェント時代に適応した検証基盤の確立を目指す。
    • AIエージェントが生成する科学的成果の検証ギャップが拡大しており,従来の検証方法では対応が困難になりつつある。
    • 検証プロセスにおいて,透明性の高いワークフロー,スケーラビリティ,明確な帰属が重要となる。
    • 検証基盤の適応がなければ,誤った実験結果や説明責任の所在不明確化など,科学への信頼を損なう危険性がある。

    Link: https://arxiv.org/abs/2607.26064

  • 方法論は主張を裏付けるか:ピアレビューのための論文内検証 [cs.CL, cs.AI, cs.DL]目的:論文内主張検証
    • 科学論文の増加に伴い,査読支援の必要性が高まっている。
    • 既存の自動評価は,先行研究との比較に偏り,方法論と主張の整合性を見落としている。
    • 方法論による主張の裏付けを評価し,査読の質向上を目指す。
    • 本研究では,論文の主張と方法論の整合性を検証するフレームワークを提案した。
    • LLMを用いて主張を抽出し,関連する方法論的証拠を検索,検証を行う。
    • 人間による査読コメントとの比較により,フレームワークの評価と人間の認識に高い一致が見られた。

    Link: https://arxiv.org/abs/2607.26066

  • LLMが誤概念に基づく難易度を過小評価する理由:陥りやすい罠 [cs.CY, cs.AI]目的:教育評価における項目難易度の推定におけるLLMの利用に関する研究
    • 教育評価において,項目の難易度を正確に把握することは,学習者の能力を適切に測定し,効果的な学習指導を行う上で重要である。
    • 従来の難易度推定方法には,時間やコストがかかる,または主観的な判断が入り込むといった課題が存在する。
    • LLMを用いた難易度推定の限界を明らかにし,より信頼性の高い評価システムの構築に貢献することを目指す。
    • LLMによる難易度評価と実際の学生の成績には,中程度の相関関係が見られたものの,分数項目の難易度について系統的なずれが確認された。
    • LLMは,学習指導の順序に基づいて「容易であるべき」難易度を推定しているのに対し,学習者の誤概念に起因する認知的な難易度を捉えきれていないと考えられる。
    • この「易しい罠」と呼ばれる現象は,LLMを用いた難易度推定の限界を示しており,評価設計や適応型システムへの応用には注意が必要である。

    Link: https://arxiv.org/abs/2607.26067

  • AIセキュリティの優先課題:分野全体の議題 [cs.CY, cs.AI, cs.CR]目的:AIセキュリティの向上に向けた優先課題の特定
    • AIは経済,政府,安全保障の中核に組み込まれ,その重要性は増している。
    • AIの導入とセキュリティ対策の準備の間に大きな乖離が生じている。
    • AIセキュリティ分野における投資と行動の具体的な指針を提供すること。
    • 本研究は,産業界,政府,市民社会のリーダーへのインタビューと専門家ワークショップを通じて,AIセキュリティの優先課題を特定した。
    • 優先課題は,戦略的基盤の確立,官民連携の強化,技術的セキュリティエンジニアリングの推進,そして敵対的圧力下での自律型AIの統治という4つのテーマに整理された。
    • 本論文は,AIセキュリティ分野への投資と行動を促進するための実用的な基礎となることを目指している。

    Link: https://arxiv.org/abs/2607.26069

  • SimpleWikiSearch:エージェント型検索のためのクリーンなオフラインWikipedia環境 [cs.IR, cs.AI]目的:エージェント型検索のための再現可能な評価環境
    • 大規模言語モデルの能力評価において,検索環境の重要性が認識されている。
    • 評価環境の仕様が不十分で,結果の比較や再現が困難な状況が存在する。
    • 再現性のある評価を可能にするための,明確に定義された参照環境を提供する。
    • SimpleWikiSearchは,Wikipediaのデータセット構築,検索スタック,ツール契約,評価プロトコルを明示的に記述し,実行可能な環境を提供する。
    • キーワード検索と密ベクトル検索の両方のインデックスを構築し,「検索」「URLを開く」「回答を送信」という最小限のツールインターフェースを提供する。
    • オープンソースLLMを用いたQAデータセットでのベースライン結果と,商用モデルとの比較用データセットを公開する。

    Link: https://arxiv.org/abs/2607.26070

  • GuidedRAG:意味的制御による検索拡張生成 [cs.IR, cs.AI]目的:検索拡張生成における意味的制御と選択
    • 大規模言語モデルの性能向上のため,外部知識の活用が不可欠である。
    • 従来の検索拡張生成は,検索空間が広大でノイズが多く,精度が低いという課題がある。
    • 意味的制御により検索空間を絞り込み,関連性の高い情報を効率的に取得すること。
    • GuidedRAGは,従来の検索拡張生成と比較して,検索関連性を14.0~15.8%向上させた。
    • 検索精度低下を19.7~27.4%軽減し,検索にかかる計算コストを大幅に削減することに成功した。
    • 関連チャンクがランキングの初期段階で一貫して取得され,ユーザーの意図との整合性が31.8~36.8%向上した。

    Link: https://arxiv.org/abs/2607.26071

  • IFCMemoryBench:LLMベースエージェントのBIM情報検索における長期記憶の評価 [cs.IR, cs.AI]目的:LLMベースエージェントにおける長期記憶の評価
    • BIMは専門的な設計・建設プロセスであり,効率的な情報管理が不可欠である。
    • 既存の長期記憶評価は汎用的な会話に偏っており,実用的なBIM環境での検証が不足している。
    • BIM環境におけるエージェントの長期記憶能力を評価し,課題を特定すること。
    • IFCMemoryBenchは,19プロジェクト,4,016セッションからなる,BIM情報検索における長期記憶のベンチマークである。
    • 評価結果から,既存の汎用メモリシステムは,文脈に沿った情報検索はできるものの,プロジェクト知識を不完全または断片的に記憶する傾向があることが示された。
    • 信頼性の高い専門エージェントには,会話,プロジェクト知識,構造化モデルエンティティを結びつけるドメイン認識型のメモリ表現が必要であると示唆された。

    Link: https://arxiv.org/abs/2607.26072

  • IDP AutoOpt:エージェント駆動によるドキュメント処理パイプライン構成の最適化 [cs.IR, cs.IR, cs.HC, cs.IR, cs.AI]目的:インテリジェントドキュメント処理パイプラインの高性能な構成の発見
    • 企業におけるドキュメント処理の自動化ニーズが高まっており,その効率的な構成が重要である。
    • ドキュメントの種類が増加するにつれて,手動での構成作業は時間とコストがかかり,スケーラビリティに課題がある。
    • ドキュメント処理パイプラインの構成を自動化し,専門家の負担を軽減し,迅速な展開を実現することを目指す。
    • IDP AutoOptは,医療,マーケティング,金融サービスといった様々な分野で,人間の専門家と同等かそれ以上の精度を実現した。
    • 構成にかかる時間を従来の数週間から2時間未満に短縮し,コスト効率も向上した(抽出ベンチマークで90.2% vs 81.6%,ページあたりのコストは4.6分の1)。
    • エージェントLLMの能力には閾値があり,適切なドメイン知識のキュレーションが,生のソースコードへのアクセスよりも重要であることが示された。

    Link: https://arxiv.org/abs/2607.26075

  • FinCacheServe:可変エンタープライズドキュメントに対する費用対効果の高いRAG提供のための依存関係整合性のある回答再利用 [cs.IR, cs.AI]目的:可変エンタープライズドキュメントに対する費用対効果の高いRAG提供のための回答再利用
    • 企業のドキュメント量は増加しており,RAGを用いた情報検索の効率化が重要である。
    • RAGシステムにおいて,ドキュメントの変更によりキャッシュされた回答の有効性が損なわれる場合がある。
    • ドキュメントの変更に追従しつつ,回答の再利用率を向上させることで,計算コストを削減することを目指す。
    • FinCacheServeは,エンタープライズの意図とドキュメントのバージョン,証拠フィンガープリント等に基づいて回答をインデックス化し,依存関係整合性を保証する。
    • 7Bモデルを用いた実験で,LLM呼び出しの53.27%を削減し,依存関係の不整合による誤った出力を観測しなかった。
    • 32Bモデルを用いた実験でも,バージョン化されたセマンティックキャッシュや他の再利用手法と比較して高い回答再利用率と低い推定Wh消費量を示した。

    Link: https://arxiv.org/abs/2607.26076

  • 閉鎖空間における水素漏洩検知のためのセンサー配置最適化:CFD情報に基づく遺伝的アルゴリズムとDeepSetsニューラルサロゲートの比較研究 [cs.NE, cs.AI]目的:閉鎖空間における水素漏洩検知のためのセンサー配置最適化
    • 水素インフラの安全確保は喫緊の課題であり,漏洩時の迅速な検知が重要である。
    • 既存のモニタリングシステムは反応的であり,危険な濃度になってから検知することが多い。
    • 本研究は,プロアクティブなセンサー配置最適化により,早期検知と安全性の向上を目指す。
    • CFDと遺伝的アルゴリズムにより,漏洩検知率96.1%を60秒以内で達成し,死角領域を0.12%まで削減した。
    • DeepSetsサロゲートは,CFD評価回数を89%削減し,計算時間を大幅に短縮しつつ,ほぼ最適に近い配置を再現した。
    • 本フレームワークは,従来の配置と比較して,検知効率の向上とセンサー数の削減に貢献する。

    Link: https://arxiv.org/abs/2607.26078

  • 人間からのフィードバックを用いた強化学習のためのメタ学習された報酬成形 [cs.LG, cs.CL]目的:人間のフィードバックからの強化学習における報酬成形手法
    • 大規模言語モデルの性能向上には,人間の意図との整合性が不可欠である。
    • 従来の報酬モデルはタスクに依存せず,学習信号が希薄になりやすい。
    • タスク固有の学習信号を提供し,報酬モデルの最適化を図ること。
    • MeRLaは,補助タスクを通してタスクに応じた報酬成形関数をメタ学習する。
    • MeRLaはPPO,DPO,GRPO,DAPOといった既存手法を上回り,AlpacaEval 2.0で90.8%の勝率を達成した。
    • MeRLaは,MT-Benchで9.14のスコアを獲得し,訓練の不安定性を41%削減することに成功した。

    Link: https://arxiv.org/abs/2607.26094

  • Lilith: 学習時と推論時のトリガーシフト下におけるバックドアの汎化 [cs.CR, cs.LG]目的:学習時トリガーから推論時トリガーファミリーへのバックドアの汎化
    • 機械学習サービスが外部データに依存する度合いが増しており,データポイズニング攻撃のリスクが高まっている。
    • 既存研究はトリガーの完全な再利用や多様性に焦点を当てており,学習時に存在しないトリガーファミリーへの汎化は未解明である。
    • 学習時と推論時で異なるトリガーファミリーを使用した場合のバックドア攻撃の成功可能性を検証する。
    • Lilithは,代替リソースのみを用いてコンパクトな脆弱性を誘導し,推論時にトリガーファミリーを構築する。
    • アンカークリアランスとファミリーリーチを用いて,局所的な正則性と代替・被害者間の差異が小さい場合に,ファミリー全体のターゲット維持の十分条件を導出する。
    • 実験により,Lilithは高い攻撃成功率と低いユーティリティ低下,小さなトリガー汎化ギャップを達成することを示す。

    Link: https://arxiv.org/abs/2607.26099

  • 大規模言語モデルにおける無言の推論失敗を検出するための参照不要なスコア [cs.CR, cs.AI]目的:大規模言語モデルの推論過程の信頼性評価
    • 言語モデルの性能向上には,推論能力の正確な評価が不可欠である。
    • 従来の評価法は最終的な答えの一致に依存し,推論過程の妥当性を評価できない。
    • 推論過程の各ステップの信頼性を評価し,無言の推論失敗を検出すること。
    • 本研究では,参照不要な評価指標であるRAFSを提案し,推論過程の局所的な信頼性を評価する。
    • RAFSは,ステップの妥当性,答えへの根拠,介入に対する安定性,合意,条件付き安定性を組み合わせる。
    • RAFSを用いることで,数学的問題に対する答えの正確性だけでなく,推論過程における潜在的な問題を検出することが可能となる。

    Link: https://arxiv.org/abs/2607.26102

  • 野生環境で撮影された単一の人間の画像からの体重と身長推定 [cs.CV, cs.AI, cs.LG]目的:体重と身長の推定
    • 体重と身長は,身体的・精神的健康,生活習慣,経済状況を示す重要な指標である。
    • ポーズ,カメラ位置,外観,背景など多様な条件により,野生環境での画像からの自動BMI推定は困難である。
    • 本研究は,様々な条件下で撮影された画像からBMI,体重,身長を推定する手法を確立することを目指す。
    • RGB,深度マップ,ポーズアフィニティマップ,エッジマップなどの異なるモダリティを用いた深層ニューラルネットワークの性能を検証した。
    • 身長,体重,BMIの真値ラベルを含む6105枚の新しいデータセットを提案し,公開した。
    • 実験結果から,全身画像が半身画像や顔画像よりも優れた推定精度を示すことが明らかになった。

    Link: https://arxiv.org/abs/2607.26104

  • TraceCLIP:パッチからのCLSへの貢献度から局所的意味を復元 [cs.CV, cs.AI]目的:局所的意味の復元
    • 画像と言語の理解は,物体検出やセマンティックセグメンテーション等,多様なタスクの基盤となる重要な研究分野である。
    • CLIPは強力だが,画像全体に対する学習であるため,局所的な視覚と言語の対応関係が十分に捉えられていないという課題がある。
    • CLIP内部の情報を活用し,追加学習や外部モデルなしで局所的意味を復元し,セマンティックセグメンテーションの精度向上を目指す。
    • TraceCLIPは,CLSアテンション出力におけるパッチ固有の項を分離することで,潜在的なパッチレベルの意味的証拠を復元する。
    • 貢献度から得られた意味的応答を,セマンティック・測地線トポロジーゲートに変換し,最終層のパッチ親和性を調整することで,特徴再構成を行う。
    • 8つのゼロショットセマンティックセグメンテーションベンチマークにおいて,既存の学習不要手法を平均で1.3〜4.5ポイント上回るmIoUを達成した。

    Link: https://arxiv.org/abs/2607.26107

  • Two2Four: 人間の動きからの四足歩行の操演生成 [cs.GR, cs.LG]目的:人間の動きデータからの四足歩行動作生成手法
    • 仮想制作におけるリアルな動物の動きは重要であり,表現の幅を広げる。
    • 従来のモーションキャプチャやモーションリターゲティングは,動物特有の動きを再現しにくい。
    • 人間の動きから自然で制御可能な四足歩行動作を自動生成し,制作ワークフローを改善する。
    • 本研究では,四足歩行モーションデータのみで学習した生成拡散モデルを用いて,人間の動きを四足歩行動作に変換する。
    • 構造化された条件付けとインペインティング戦略により,歩行,走行,ジャンプなど多様な動作に対応可能である。
    • 頭部の動きや個々の四肢の制御といった,きめ細かい直感的な制御も実現し,リアリティと制御性を向上させた。

    Link: https://arxiv.org/abs/2607.26108

  • GPT-Red:大規模自己対戦による自動Red Teaming [cs.CR, cs.AI, cs.CL, cs.LG]目的:最先端LLMに対する新たなプロンプトインジェクション攻撃の発見
    • LLMの安全性確保は,その社会実装において不可欠であり,継続的な脆弱性評価が求められる。
    • 既存の脆弱性評価は,人的リソースに依存し,網羅性に限界がある。
    • LLMのロバスト性を高めるため,自動化されたRed Teaming手法の開発が急務である。
    • GPT-Redは,過去のモデル(GPT-5.5まで)を確実に突破する攻撃を可能にする。
    • 人間のRed Teamerよりも多くの成功事例を発見し,未知の環境やモデルへの汎化性能も高い。
    • GPT-Redの改良が,より強固なRed Teamerの育成に繋がり,LLMの安全性向上を加速させる好循環が期待される。

    Link: https://arxiv.org/abs/2607.26115

  • もう一度試行し,振り返るな:ブラインドリサンプリングが小規模コードモデルにおいて自己修復を上回る [cs.SE, cs.AI, cs.LG]目的:小規模コードモデルにおける試行錯誤戦略の有効性に関する研究
    • コード生成AIの性能向上は,ソフトウェア開発の自動化において不可欠である。
    • 既存の自己修復手法では,失敗したコードを再提示することでモデルが過去の誤りに囚われやすい。
    • ブラインドリサンプリングという新たな試行戦略が,自己修復の弱点を克服し性能を向上させる。
    • ブラインドリサンプリングは,特に1.5Bおよび3Bモデルにおいて,自己修復よりも高い性能を示した。
    • 7Bモデルにおいても,ブラインドリサンプリングは,他の手法と同程度の性能を維持しつつ,トークン消費量を大幅に削減した。
    • モデルに自身の失敗例を提示することが,結果を悪化させる要因であり,それを避けることが重要である。

    Link: https://arxiv.org/abs/2607.26117

  • 推論性能の起源探求:強化学習と教師あり微調整モデルにおける数学問題解決の表現品質 [cs.AI, cs.CL]目的:強化学習と教師あり微調整モデルにおける数学問題解決の表現の違い
    • 近年,複雑な推論能力が求められており,特に数学問題解決はその能力を測る重要な指標である。
    • 強化学習モデルと教師あり微調整モデルでは数学問題解決性能に差が見られるものの,そのメカニズムは不明である。
    • 強化学習モデルが優位性を示す表現構造を特定し,推論プロセスをより深く理解することを目指す。
    • 線形プローブによる評価で,強化学習モデルはSFTモデルよりも正答予測精度が高いことが示され,より分離された構造化された表現を持つことが明らかになった。
    • 平均アブレーション研究により,強化学習モデルは層が深くなるにつれて重要度が高まる階層的な構造を,SFTモデルは均一な重要度分布を持つことが示された。
    • トークン数変動の分析から,トークン配分は学習パイプラインに依存する可能性が示唆され,安定したポリシーを持つモデルとそうでないモデルの識別につながる。

    Link: https://arxiv.org/abs/2607.26119

  • さらなる欺瞞:混合動機LLMマルチエージェントシステムにおける目的の不一致 [cs.AI]目的:LLMを活用したマルチエージェントシステムにおける目的の不一致の評価
    • LLMマルチエージェントシステムは,複雑なタスクを解決する可能性を秘めている。
    • エージェントの目的が一致しない場合,欺瞞や戦略的な行動が生じやすい。
    • 集団目標とのずれを評価し,その影響を明らかにすること。
    • 目的の不一致は,競争的な環境において結果を悪化させる。
    • 不一致が生じたエージェントは,目的依存的な推論戦略を用いる。
    • しかし,その変化は公開されたコミュニケーションには表れにくい。

    Link: https://arxiv.org/abs/2607.26120

  • 信頼できる具現知能の探求:システムフレームワークと信頼性レベルの段階的定義 [cs.RO, cs.AI, cs.CY]目的:具現知能における信頼性の確立
    • 具現知能は,現実世界とのインタラクションを伴うため,安全性と信頼性が不可欠である。
    • 従来の性能評価だけでは,具現知能システムの信頼性を保証することは困難である。
    • 環境変化やシステム変動下での安全なタスク実行能力を評価し,信頼性の段階的定義を目指す。
    • 本研究では,信頼できる具現知能を,環境やシステムの変化に対応しつつ,許容範囲内のリスクを維持した継続的な安全な成功と定義した。
    • 信頼性を確立するため,モデル,システム,証拠,デプロイの4層からなる相互依存的なフレームワークを提案した。
    • また,タスク能力,安全性,システム保証,運用ガバナンス,証拠の強さを段階的に評価する信頼性レベルの階層を提案した。

    Link: https://arxiv.org/abs/2607.26121

  • ClinLens:縦断的マルチモーダル臨床データ科学のための長期的コーディングエージェントに向けて [cs.RO, cs.AI]目的:臨床データ分析における長期的エージェントの構築
    • 医療データの活用は,患者ケアの質向上や医療研究の進展に不可欠である。
    • 既存のベンチマークは,特定のタスクに偏っており,臨床データ全体の分析能力を評価できない。
    • 臨床データ全体の分析を評価できるベンチマークを構築し,エージェントの性能を測定すること。
    • 新しいベンチマーク「CLINLENS」を構築し,電子カルテ,メモ,心電図,胸部X線,心エコーを含む5つのMIMICリソースを統合した。
    • 最先端モデルでも,厳格な評価基準において56.3%の正答率にとどまり,臨床分析には大きな課題が残されていることが示された。
    • GPT-4o-miniを適応させた既存のバイオメディカルシステムは,2.9%の正答率に留まり,性能差が明らかになった。

    Link: https://arxiv.org/abs/2607.26155

  • ベンチマーク推論が構成されないとき:AI評価における射影可能性 [cs.AI, cs.CY, cs.LG]目的:AI評価における射影可能性の問題
    • AIの性能評価は,技術の進歩と社会への応用において不可欠である。
    • ベンチマーク評価の結果は,しばしば他の状況への推論に依存し,その妥当性が保証されない。
    • ベンチマーク評価から実際の利用場面への推論における問題点を明らかにし,評価方法の改善を目指す。
    • AIベンチマークの結果は,単独では結論に至らず,様々な解釈や拡張を伴う。
    • 射影可能性とは,観察されたケースから未観察のケースへの拡張が正当化されるかどうかを問う概念である。
    • ベンチマークと実際の利用場面の間の推論において,前提や不確実性を考慮せずに単純に結論を導き出すことは誤りである。

    Link: https://arxiv.org/abs/2607.26159

  • ガイドスキル:ガイドラインに基づいた臨床推論のための実行可能LLMエージェントスキルの進化 [cs.AI]目的:ガイドラインに基づいた臨床推論のための実行可能LLMエージェントスキルの進化
    • 臨床現場では,診療ガイドラインが診断基準を定めるが,その活用が十分でない。
    • LLMはガイドラインを検索または学習するが,そのルールを直接実行することが課題である。
    • ガイドラインの基準を実行可能な関数として実装し,診断支援スコアを算出することで,より正確な推論を目指す。
    • ガイドスキルゼロはガイドラインから初期化され,ガイドスキルEvoは症例-診断ペアを用いてスキルを改善し,診断対象を拡充する。
    • 4つのベンチマークと4つのバックボーンにおいて,ガイドスキルゼロはガイドラインRAGの精度を平均13.45%向上させた。
    • ガイドスキルEvoはすべてのバックボーンで最高の精度を達成し,直接推論を18.49%相対的に改善し,スキルの網羅率を56.5%から99.5%に増加させた。

    Link: https://arxiv.org/abs/2607.26160

  • 制約なしIR分子構造解析のためのデータ融合と対照的アライメント [cs.LG]目的:制約なしのIR分子構造解析における予測精度向上
    • 化学分析におけるAI活用は,物質の同定や構造決定を効率化し,研究開発を加速させる上で重要である。
    • 従来のIRスペクトルを用いた構造解析は,事前に化学式が与えられる必要があり,完全な構造予測には限界があった。
    • 本研究では,化学式の事前知識なしで分子構造を予測する精度向上を目指す。
    • MoEデコーダモジュールと対照的アライメント損失項の導入により,Top-K予測精度が10%以上向上した。
    • IRスペクトルは分子構造に関する主要な化学情報を多く含んでおり,高精度な異性体ランキングモデルの性能は,スペクトルの吸収バンドの重複が原因であることが示唆された。
    • 測定されたIRスペクトルからの自動分子構造解析の有効性を示すことで,分析化学におけるAIの応用範囲を広げることが期待される。

    Link: https://arxiv.org/abs/2607.26164

  • 一枚の写真には多くの言葉がある - ハイブリッド深層学習による皮膚曝露データ活用と安全性評価の向上 [cs.CV, cs.AI, cs.LG]目的:画像からの皮膚曝露量の定量化
    • 労働安全衛生において,皮膚曝露は健康リスクに直結するため,正確な評価が重要である。
    • 従来の皮膚曝露評価は時間と労力を要し,大規模なデータ収集が困難であった。
    • 画像データから効率的に半定量的な曝露情報を抽出し,安全性評価の精度向上を目指す。
    • 開発されたハイブリッド画像解析手法は,画像中の皮膚曝露量を定量化できることが示された。
    • Mask R-CNNとカラーベースのアルゴリズムの組み合わせにより,人体を検出し,背景の影響を除去し,皮膚をセグメント化することが可能となった。
    • 皮膚曝露面積と全身ピクセル比の算出結果は,人間の見積もりと約80%の合致率を示した。

    Link: https://arxiv.org/abs/2607.26170

  • アラインメント,モデル生物,玩具モデルにおける共有SFTの教訓 [cs.LG]目的:アラインメント,モデル生物,玩具モデルにおけるSFTの教訓の転移可能性の検証
    • AIアラインメントは,AIの安全性と有用性を確保する上で重要な課題である。
    • 異なる研究分野間での知識共有が十分でなく,進捗が遅れている。
    • SFTにおける教訓を分野間で共有し,研究の効率化を図る。
    • 行動の理由を学習させることで,玩具モデルにおける行動の一般化性能が向上することが示された。
    • モデル生物の研究で得られた知見に基づき,ミッドトレーニングアラインメントにおける能力劣化を防ぐためのSFT手法が提案された。
    • 能力維持だけでは,その後の学習によるアラインメント行動の消失を防げないことが示された。

    Link: https://arxiv.org/abs/2607.26173

  • GoGoTB:仕様に基づいたカバレッジクロージャによるエージェント型RTL検証 [cs.CL, cs.AI]目的:RTL検証の自動化
    • IC設計において,検証は非常に重要な工程であり,不具合の早期発見がコスト削減に繋がる。
    • 従来のLLMを用いたアプローチでは,コンポーネント間のインターフェース不整合や,カバレッジが仕様要件と乖離する課題があった。
    • GoGoTBは,仕様に基づいたカバレッジクロージャにより,これらの課題を解決し,RTL検証を自動化することを目指す。
    • GoGoTBは,エージェント型実行制御層,進化型知識システム,仕様に基づいたカバレッジクロージャの3つのサブシステムで構成される。
    • 8つのRTLデザインで検証した結果,環境生成成功率は100%,ラインカバレッジは98.4%,ブランチカバレッジは97.2%を達成した。
    • 機能カバレッジも83.2%を達成し,既存手法を大きく上回る成果が得られた。

    Link: https://arxiv.org/abs/2607.26181

  • 評価スコアは儚い知識の主張である [cs.HC, cs.AI, cs.CL, cs.LG, cs.SE]目的:言語モデルの評価における信頼性の過大評価問題の解決
    • 言語モデルの性能評価は,AI技術の発展において不可欠であり,その信頼性はAIの安全性と応用範囲に直結する。
    • 既存の評価手法では,複数の評価指標を単純に平均化することで,最も低い信頼性の指標によって評価全体の信頼性が損なわれる可能性がある。
    • 評価スコアを知識の主張として捉え,その信頼性を明示的に示すことで,評価結果の解釈における誤りを防ぐ。
    • 評価スコアは,形式性,範囲,有効期限という3つの特性を持つ知識の主張として扱うべきである。
    • 平均化による集計は信頼性の低い指標の影響を増幅させ,評価結果を歪める可能性がある。
    • HELMリーダーボードの分析により,平均スコアと弱点リンクによるランキングは全く異なる結果を示すことが明らかになった。

    Link: https://arxiv.org/abs/2607.26191

  • 動的パラメータ化は動的推論ではない [cs.LG]目的:入力依存型コントローラ係数の性質の検証
    • 近年,大規模言語モデルの効率化が重要視されており,動的パラメータ化はその一つの手法として注目されている。
    • 動的パラメータ化の効果に関する解釈が曖昧であり,真の計算節約効果が不明確である。
    • 動的パラメータ化が実際に動的推論を達成しているか,計算節約効果があるかを検証すること。
    • 係数変動,凍結モデルの入力依存性,条件付き実行の3つの性質を区別し,凍結コントローラ監査(FCA)を提案した。
    • FCAを用いて7つのFeatureGate Transformerと3つの504Mモデルを評価した結果,層ごとの静的プロファイルが性能差の大部分を保持した。
    • MUDDPythia-1.4Bでの実験では,入力再割り当てやトークンシャッフルによりNLLが増加し,内容依存的な層間割り当てが重要であることが示された。

    Link: https://arxiv.org/abs/2607.26192

  • サイバーセキュリティのためのイベント中心の説明可能性:マルチエージェントLLMによる調査 [cs.HC, cs.CL, cs.CR, cs.AI]目的:サイバーセキュリティアラートの説明
    • サイバー攻撃の巧妙化に伴い,セキュリティ対策の高度化が急務である。
    • 既存の説明手法では,アラート対応に必要な文脈理解が不十分である。
    • アラートの根本原因特定と,対応策の迅速な実施を支援すること。
    • 提案手法(EC)2は,検証可能な証拠に基づいた構造化された調査を行うことで,サイバーセキュリティアラートの説明性を向上させる。
    • 運用上意味のある説明を生成し,アラート後の分析を改善することが示された。
    • イベント分類の精度向上にも貢献することが確認された。

    Link: https://arxiv.org/abs/2607.26201

  • k-means++における中心数のランダム化 [cs.DS, cs.LG, stat.ML]目的:k-means++アルゴリズムにおける近似率の解析
    • クラスタリングは,データ解析において重要な役割を果たす
    • k-means++は最悪の場合,近似率がlog kに依存する
    • 中心数kの変動下でのk-means++の性能向上
    • 中心数kをKから2K-1の間で一様ランダムに選択する場合において,k-means++が定数確率でO(1)-近似となることが証明された。
    • この結果は,予算が変動する状況下でのk-means++の性能を保証する。

    Link: https://arxiv.org/abs/2607.26202

  • マルチエージェント議論戦略:サーベイ,タクソノミー,そして課題 [cs.ET, quant-ph, cs.HC, cs.SE, cs.AI]目的:マルチエージェント議論における戦略の体系化と課題の明確化
    • 大規模言語モデルの精度と頑健性を向上させる上で,エージェント間の協調が重要視されている。
    • 研究が分断され,用語が統一されておらず,議論設計の次元に関する厳密な統合が見られない。
    • 議論設定の設計要素を体系化し,比較可能性を高めることで,研究の進展を促す。
    • 141件の主要な研究を体系的にレビューし,参加者,相互作用メカニズム,合意プロトコルという3次元のタクソノミーを導出した。
    • 既存研究では,静的な完全接続トポロジー,逐語的な交換,短期記憶,投票解決戦略が慣習的に採用されていることが明らかになった。
    • タクソノミーを研究状況の記述的な地図として,制御されたベンチマークの枠組みとして,機械可読なMAD仕様のスキーマとして活用可能である。

    Link: https://arxiv.org/abs/2607.26212

  • 3値不確実性スコアリングによるモデル駆動型要件構成 [cs.HC, cs.SE, cs.AI]目的:LLM生成要件における論理的不整合の解消と構造適合性の確保
    • 要件定義はシステム開発の根幹であり,その品質がシステムの成功を左右する。
    • LLM生成要件は自然言語の柔軟性を持つ反面,構造的な誤りや論理矛盾を含む可能性がある。
    • LLMの不確実性を定量化し,形式的なドメインモデル内で安全な要件エンジニアリングを実現する。
    • 本システムは37件のプロジェクトビジョンに対し,構造的不整合を94.6%のケースで完全に解消した。
    • 残りの2件のケースでは,反復回数の制限により0.39%の構造的エラーが未解決のまま残った。
    • 3値分析の結果,全決定の24.7%が,利害関係者によって明示的に義務付けられていない裁量的な選択肢であることが判明した。

    Link: https://arxiv.org/abs/2607.26220

  • 文脈を考慮した反論応答は,一般的な反論応答よりも説得力がある [cs.HC, cs.AI, cs.CY]目的:オンラインにおける有害な言説の軽減
    • インターネットの普及に伴い,オンライン上の有害な言説は深刻な社会問題となっている。
    • 既存の反論応答は,文脈や対象ユーザーを考慮せず,画一的な対応になっている。
    • 対話の状況とユーザーに合わせた反論応答によって,より効果的な対策を講じることを目指す。
    • 文脈情報とユーザーの過去の行動を組み合わせた軽量な戦略は,妥当性と説得力を向上させた。
    • 一方,他の文脈化戦略は,人間の評価による反論応答の質を低下させた。
    • これらの結果は,よりパーソナライズされた効果的な反論応答システム開発の方向性を示す。

    Link: https://arxiv.org/abs/2607.26236

  • エッジデバイス向け猛禽類軽量画像分類:ビデオフレーム抽出,知識蒸留,TensorRTデプロイによる希少種データセット拡張 [cs.CV, cs.LG, eess.IV]目的:風力タービンにおける衝突軽減のための,リアルタイムエッジ展開を目的とした猛禽類の軽量画像分類
    • 風力発電の普及に伴い,鳥類との衝突問題が深刻化しており,自動識別技術による対策が急務である。
    • 猛禽類は種間の類似性が高く,画像認識における正確な識別が困難であるという課題がある。
    • 希少種の画像データ不足を解消し,識別精度向上とリアルタイム処理性能の両立を目指す。
    • DINOv2-Lを教師として知識蒸留を行った結果,MobileNetV4,ViT-Small,EfficientNet-B0といった軽量なモデル群が良好な性能を示した。
    • ビデオフレーム抽出によりデータセットを拡張したことで,特にオオワシとステラーワシの誤識別率が大幅に低下し,White-tailed Eagleの再現率が最大38.6%向上した。
    • EfficientNet-B0をNVIDIA Jetson Orin NanoにTensorRT FP16でデプロイしたところ,3.19ms/image (313 images/s)という高速処理を実現し,FP32との精度劣化はほぼ見られなかった。

    Link: https://arxiv.org/abs/2607.26238

  • 単語問題の学習:測地長と暗号学的応用 [cs.NI, cs.CR, cs.LG, math.GR]目的:単語問題の解決
    • 組合せ群論の進歩を促し,近年ではポスト量子暗号の基礎となる困難性仮定として重要である。
    • 一般には判定不能だが,解ける,または高速なアルゴリズムが存在する群も存在し,暗号設計に利用されている。
    • グラフニューラルネットワークを用いて単語問題をヒューリスティクに解き,構造的な漏洩による暗号への影響を検証する。
    • WPNetという新たなグラフニューラルネットワークアーキテクチャを提案し,Baumslag-Solitar群とArtin群で単語問題を解決した。
    • モデルは,単語を動的なグラフ構造にマッピングし,代数的に等価な要素を連続埋め込み空間でクラスタリングすることで測地代表を識別する。
    • WPNetをWagner-Magyarik公開鍵暗号システムに対して適用し,構造的な漏洩が暗号に影響を与えることを示した。

    Link: https://arxiv.org/abs/2607.26241

  • 弱から強へのオンポリシー蒸留 [cs.LG]目的:大規模言語モデル間の能力伝達
    • 言語モデルの性能向上は,様々な応用において不可欠であり,効率的な学習方法が求められている。
    • 既存のオンポリシー蒸留は,教師モデルが学生モデルと同等以上の能力を持つことを前提としている。
    • より弱いモデルからの蒸留によって,強力な学生モデルの性能を向上させることを目指す。
    • 提案手法W2S-OPDは,複数の弱いモデルからの蒸留により,学生モデルの性能を向上させることを示した。
    • W2S-OPDは,学生モデルがドメイン教師モデルを超える性能を達成し,どの教師モデルも弱い場合でも改善を継続することを示した。
    • 異なるコントラストペアは異なる信号を提供し,推論フレームワークや問題解決手順に影響を与えることが示された。

    Link: https://arxiv.org/abs/2607.26246

  • 勾配と自然勾配の間:LoRA初期化の連続性 [cs.LG]目的:LoRA初期化法の設計空間の探索
    • 大規模言語モデルのファインチューニングは計算コストが高い。
    • LoRAの性能は初期化に大きく依存する。
    • 最適な事前条件付け強度をタスクごとに決定すること。
    • 提案手法ULoRAは,GLUEタスクにおいてフルファインチューニングと同等以上の性能を示す。
    • ULoRA-Autoは,追加の探索コストなしにULoRAの上限に近づく。
    • LoRA初期化と曲率事前条件付けは,固定された設計決定ではなく,調整可能な次元として扱うべきである。

    Link: https://arxiv.org/abs/2607.26247

  • 早期の判断,より良い予算:計算効率の良いRLVRのための逐次適応的ロールアウト割り当て [cs.CL, cs.LG]目的:検証可能な報酬を持つ強化学習におけるロールアウト生成の効率向上
    • 強化学習は,複雑なタスクを自動化する強力な手法であり,その応用範囲は広い。
    • 検証可能な報酬付き強化学習(RLVR)では,ロールアウト生成がボトルネックとなり,効率が低下する。
    • ロールアウトの無駄を減らし,予算を最適化することで,RLVRの性能を向上させる。
    • SARAは,各プロンプトの成功率に関するベータ事後分布を維持し,グループの効果を予測する。
    • SARAは,2つの閾値に基づくルールを使用して,効果的なグループを確定し,飽和したグループを早期に放棄する。
    • 数学的推論と計画タスクにおいて,SARAはDSと同等の性能を維持しながら,ロールアウト数を22%削減した。

    Link: https://arxiv.org/abs/2607.26253

  • 上位$k$パレート強盗:多目的スレート選択におけるハイパーボリューム後悔 [cs.LG, cs.AI, stat.ML]目的:多目的スレート選択におけるパレート最適解の近似
    • 多目的最適化は,現実世界の複雑な意思決定問題に対応可能。
    • 限られた試行回数下では,真のパレート最適解を見つけることは困難。
    • ハイパーボリュームを指標とし,効率的な近似アルゴリズムを開発する。
    • 提案アルゴリズムTHV-UCBは,どのインスタンスに対しても$\tilde{O}(d\sqrt{nkT})$というギャップフリーな後悔限界を達成。
    • 腕間の分離度が高い場合,$\tilde{O}(nk^{2.5}/\Delta_{\min})$というポリログの時間依存性を持つ後悔限界を示す。
    • 小規模な部分集合を用いたパレート最適解の近似が,多目的アプリケーションにおいて有効であることを理論的に支持。

    Link: https://arxiv.org/abs/2607.26273

  • FloDR:正規化フローに基づく可逆次元削減手法 [eess.SY, cs.SY, math.OC, cs.LG, cs.HC]目的:高次元データの可逆的な次元削減
    • 高次元データの可視化は,データの理解に不可欠であり,様々な分野で重要性が増している。
    • 既存手法では,次元削減時に情報が失われ,データの構造や意味を正確に把握することが困難である。
    • FloDRは,情報の損失を最小限に抑え,データの詳細な構造を明らかにする次元削減を目指す。
    • FloDRは,可逆な正規化フローを用いてデータを埋め込み,2次元埋め込みに加え,追加の座標を保持する。
    • 訓練されたモデルの正確な逆変換と密度を用いることで,近似的な方法では得られない診断的可視化が可能となる。
    • 条件付きスプレッドと隠れたコントラストという二つの指標を用いて,埋め込み位置における未決定データ量と,座標が失う情報量を評価する。

    Link: https://arxiv.org/abs/2607.26278

  • 実践におけるエンティティ解決:セルフサービスパイプラインからの教訓 [cs.LG, cs.AI]目的:エンティティ解決システムの構築と評価
    • データ統合において,エンティティの同一性特定は不可欠であり,その効率化が求められている。
    • 既存の手法では,多様なデータセットへの適応性が低く,最適なアルゴリズム選択が困難である。
    • 実用的なエンティティ解決パイプラインにおける課題を明らかにし,改善策を提示すること。
    • 単一のアルゴリズムが常に最適な結果をもたらすわけではなく,データセットごとに複数のアルゴリズムを評価する必要がある。
    • 適合率と再現率にはそれぞれ異なるアプローチが必要であり,共通の閾値では対応できない。
    • 誤ったリンクが連鎖的に拡大する可能性があり,グループ間の統合は再検証が不可欠である。

    Link: https://arxiv.org/abs/2607.26298

  • AgentGUI:長期実行型AIエージェントの観察と制御のためのインターフェース [cs.CL, cs.AI, cs.HC]目的:長期実行型AIエージェントの観察と制御
    • AIエージェントの能力向上に伴い,人間による適切な監視が重要になっている。
    • 現状では,人間中心のインターフェースが不足しており,エージェントの監視が遅れている。
    • エージェントの軌跡可視化と制御を通して,人間による効率的な監視を実現する。
    • AgentGUIは,複数同時実行セッションにおけるAIエージェントの観察と制御を可能にするGUIである。
    • ユーザースタディの結果,エージェントの軌跡から重要な要素を特定する時間が38%短縮された(p = 0.023)。
    • AgentGUIの自動ドリフト防止機能により,ローカルエージェントのタスク完了率が最大34%向上した。

    Link: https://arxiv.org/abs/2607.26300

  • TraceCoder:位置キー断片バージョン管理による説明可能かつ監査可能なコード生成 [cs.AI, cs.SE]目的:コード生成の過程における説明可能性と監査可能性の向上
    • ソフトウェア開発において,コードの品質と信頼性は不可欠であり,その自動化が求められている。
    • 既存のLLMベースのコード生成は,その根拠が不明瞭で,変更履歴の追跡が困難である。
    • コード生成の過程を可視化し,変更履歴を追跡することで,信頼性と説明責任を高める。
    • TraceCoderは,ベンチマーク,ラウンド数,失敗テキスト,LLMの説明を記録するリレーショナルな断片履歴スキーマを導入した。
    • このシステムにより,コードの変更履歴を追跡し,特定のエラーがどのコード行に影響を与えたかを特定することが可能になった。
    • 30のアルゴリズムプログラミングタスクにおいて,Gemini 2.0 Flashと比較して,TraceCoderはより多くのコード断片で追跡可能な修理イベントを示した。

    Link: https://arxiv.org/abs/2607.26307