arXiv雑要約

AI - 2026/07/31 公開

  • 機械学習のピアレビューにおける研究分野間のレビューアスコアの比較可能性 [cs.DL, cs.DL, cs.AI, cs.LG]目的:機械学習会議のピアレビューにおける,研究分野間でのレビューアスコアの比較可能性に関する検証
    • 機械学習会議の査読プロセスにおいて,レビューアスコアは重要な判断材料となっている
    • 査読対象が急増する中で,アスコアが分野間で一貫性を持つか検証されていない
    • アスコアの比較可能性の欠如が,採択結果に与える影響を明らかにすること
    • ICLR 2021-2026のデータ分析から,同一アスコアでも,研究分野によって採択確率が最大8倍異なることが示された
    • この差は,スコアリング文化や専門家の基準,エリアチェアによる再評価といった要因では説明できない
    • プログラム委員会に対し,校正されたレビュー信号の採用と,分野別の条件付き採択率の公開を提言する

    Link: https://arxiv.org/abs/2607.27209

  • 実践におけるプロンプト連鎖:自動化された学術レポート生成の事例研究 [cs.CL, cs.AI, cs.CE, cs.DL, cs.SE]目的:学術レポートの自動生成手法
    • 学術論文の爆発的な増加に対応するため,情報統合の自動化が不可欠である。
    • 単純なプロンプトでは,複雑な情報統合タスクに必要な信頼性と品質が不足する。
    • 複数段階のプロンプト連鎖による,より信頼性の高い生成手法を確立すること。
    • 提案手法であるプロンプト連鎖は,単発プロンプトと比較して100%の成功率を達成し,信頼性で顕著な差を示した。
    • 品質評価では,ROUGE-L F1スコアで優位性を示し(0.507 vs 0.486),特に適合率の高さが貢献した。
    • 複雑な生成タスクにおいて,プロンプト連鎖は単一プロンプトよりも依存性が高く,効果的な手法である。

    Link: https://arxiv.org/abs/2607.27210

  • オープンソースソフトウェア投稿に対するAI支援事前レビュー:BOSC 2026からの経験報告 [cs.HC, cs.CL, cs.CL, cs.AI, cs.DL]目的:オープンソースソフトウェア投稿の事前レビューにおけるAIの有用性評価
    • 学会発表の質を維持するためには,適切な査読が不可欠である。近年,投稿数が増加しており,査読者の負担が大きい。
    • 生成AIの普及により,質の低い投稿が増加する可能性があり,査読プロセスに悪影響を及ぼす恐れがある。
    • AIを活用することで,査読者の負担を軽減し,効率的な査読プロセスを実現することを目指す。
    • bosc-pre-reviewとRunabillyを開発し,6つのレビュー基準についてAIによる事前評価を行った。
    • レビュー担当者への調査の結果,AIによる事前レビューは有用であると評価された。
    • ただし,AIの結果を鵜呑みにせず,担当者自身が確認することが望ましいとの意見が多数あった。

    Link: https://arxiv.org/abs/2607.27228

  • マルチヘッド注意残差 [cs.AI]目的:Transformerモデルにおける注意残差の改善
    • Transformerは自然言語処理において重要な役割を担うが,深層化に伴う情報伝達の効率化が課題である。
    • 従来の注意残差は,特徴量空間全体で単一の分布を用いて深層情報を読み取るため,空間間の不一致が大きい場合に性能が低下する。
    • マルチヘッド注意残差は,空間ごとに独立した注意機構を導入し,より効率的な情報伝達を目指す。
    • マルチヘッド注意残差(MHAR)は,100M,350M,1Bモデルにおいて,従来のTransformerよりも検証損失を改善した。
    • 検証損失の改善はモデル規模が大きくなるにつれて顕著になり,最適なヘッド数は4または8であることが示された。
    • MHARの実装に際しては,計算効率とメモリ使用量の最適化が図られ,特にdelta attention residualsを用いた変換は,大規模モデルにおいて性能向上に貢献した。

    Link: https://arxiv.org/abs/2607.27230

  • KernelGenBench:LLMベースのカーネル生成に関するマルチソース・マルチチップベンチマーク [cs.AI, cs.LG]目的:LLMベースのカーネル生成の評価
    • LLMの発展により高性能なアクセラレータカーネルの需要が高まっている。
    • カーネル開発は専門性が高く,労力もかかる課題である。
    • 多様な演算ソースとハードウェアプラットフォームにおけるLLM生成カーネルの性能評価を行う。
    • エージェントベースの手法は,単純なLLMサンプリングよりも一貫して優れた性能を示す。
    • 生成性能はハードウェアプラットフォームによって大きく異なり,最新のエージェントでもクロスプラットフォーム性能劣化が見られる。
    • 自律的なカーネル生成はコストが高く,専門的なエージェントは1演算あたり500万トークン以上消費する。

    Link: https://arxiv.org/abs/2607.27231

  • 共感的なフレーミング:社会人口学的グループ間のAIアライメントの評価 [cs.CL, cs.AI, cs.CY, cs.LG]目的:AIアライメントの評価
    • AI技術は情報消費や世界観形成に影響を及ぼすため,その倫理的な影響を評価する必要がある。
    • AIのバイアスだけでなく,テキストの表現が伝える感情的なニュアンスを理解しているかどうかが課題である。
    • LLMがニュースフレーミングをどの程度理解しているかを評価し,アライメントの差異を明らかにする。
    • LLMと人間の感情評価の相関はモデルによって異なり,GPT-5.2は0.789と非常に高く,Mistral Large 2512は0.4と中程度であった。
    • 主要モデルは,年齢,性別,教育レベル,政治的知識,紛争に対する先入観などのすべての人口統計学的サブグループで,人間の判断と概ね一致した。
    • 全体的なパフォーマンスが高い場合でも,AIアライメントは普遍的ではなく,人口統計学的特徴や文化的規範と異なる可能性があることが示された。

    Link: https://arxiv.org/abs/2607.27232

  • RadHarmony:エージェントAI時代における放射線画像データの取り扱い [cs.AI, cs.CV]目的:放射線画像データの統合,標準化,拡張のための統一API
    • 深層学習モデルの精度向上には多様なデータが不可欠であり,その統合が重要である。
    • 放射線画像データは形式や構造が異なり,統合作業に手間と専門知識を要する。
    • RadHarmonyはデータ統合の自動化により,放射線画像データの利用を促進する。
    • RadHarmonyは,24の公開データセットのメタデータを単一の表形式に標準化する。
    • MONAIのデータセットをラップし,深層学習に適したデータ提供とオンディスクキャッシュを可能にする。
    • AIエージェントのスキルにより,データ統合ワークフローを効率化し,コード生成を支援する。

    Link: https://arxiv.org/abs/2607.27235

  • モデルマージにおける非対称的な崩壊:拒否が認識を上書きするとき [cs.AI]目的:モデルマージ後の安全性に関する認識能力と拒否応答のバランス
    • 複数の安全対策を同時に備えたAIモデルの重要性が高まっている。
    • モデルマージにおいて,異なる安全対策が互いに影響し,認識能力が低下する可能性がある。
    • モデルマージにおける安全性に関する認識能力と拒否応答の非対称性を解明すること。
    • 標準的なモデルマージ手法では,攻撃に対する耐性は維持されるものの,CARESによる有害性分類の精度が大幅に低下することが示された。
    • この非対称性は,タスクベクトル間の方向性ではなく,拒否応答のファインチューニングが層ごとのタスクベクトルの大きさを一貫して大きくすることによって引き起こされる。
    • モデルマージは,安全対策間のスケール差が大きい場合,安全性認識を広範な拒否応答に崩壊させる可能性がある。

    Link: https://arxiv.org/abs/2607.27240

  • 法執行機関向け音声文字起こし能力の向上:BWC映像のためのWhisperのLoRAベース適応 [cs.SD, cs.AI]目的:法執行機関のBWC映像からの音声文字起こし精度の向上
    • 警察活動におけるBWC映像は重要だが,手作業での文字起こしコストが高い。
    • 既存の音声認識モデルは,警察環境特有の音響・言語的課題に弱い。
    • LoRAを用いてWhisperモデルを適応させ,低コストで高精度な文字起こしを実現する。
    • LoRAによる適応により,消費グレードのハードウェアでも高い精度を達成した。
    • ドメイン固有のオントロジーを用いた推論パイプラインにより,93.7%の語彙マッピング率を実現。
    • この研究は,手続き的正義と透明性の向上に貢献する。

    Link: https://arxiv.org/abs/2607.27245

  • 発散デコーディング:トレーニング不要の能力融合 [cs.AI, cs.LG]目的:多様なLLMの能力融合
    • 大規模言語モデルの発展は目覚ましいが,専門知識の不足が課題である。
    • 専門モデルは知識豊富だが,推論能力の低下やロバスト性の低下といった問題がある。
    • 汎用性と専門性を両立し,推論リスクを抑制する手法を確立すること。
    • 発散デコーディングは,汎用モデルと専門モデルの能力をトレーニングなしで融合する。
    • 推論時に,専門モデルの予測と汎用モデルの予測の分布のずれを監視し,ずれが大きい場合に汎用モデルに制御を切り替える。
    • 科学分野のベンチマークテストにおいて,既存の単一モデルを上回る性能を示した。

    Link: https://arxiv.org/abs/2607.27248

  • コンテキストファイルはコーディングエージェントに役立つか?実リポジトリにおける二エージェントアブレーションスタディ [cs.SE, cs.AI]目的:コーディングエージェントの性能に対するコンテキストファイルの有効性の検証
    • AIコーディングエージェントの活用は,ソフトウェア開発の効率化に不可欠である。
    • コンテキストファイルの有効性に関する証拠は一貫しておらず,その効果に疑問が残る。
    • エージェントがリポジトリの知識不足で失敗するのではなく,実装スキルに問題があることを明らかにすること。
    • コンテキストファイルの注入戦略は,Claude CodeおよびCodexのいずれのエージェントにおいても,正答率に有意な影響を与えなかった。
    • 失敗モードの分析から,エージェントの失敗は機能設計やパターン選択といった実装スキルに起因することが示された。
    • タスクの難易度はエージェントによって異なり,先行研究で矛盾が生じた原因として,エージェント固有の得意分野が考えられる。

    Link: https://arxiv.org/abs/2607.27250

  • 半導体デバイスの熱機械的信頼性のための再帰型Transformer [cs.LG, cs.AI]目的:半導体パッケージの熱機械的信頼性解析のための再帰型Transformerアーキテクチャの評価
    • 工学設計におけるシミュレーションコスト削減の重要性が増しており,代替手法が求められている。
    • 従来のTransformerは,小規模な工学データセットに対して過学習を起こしやすく,効率が悪い。
    • 限られた計算資源下で,予測精度,パラメータ効率,計算コストのバランスを取ることを目指す。
    • 提案手法であるDepth Recursive Transformerは,他の再帰型Transformerと比較して,高い予測性能とパラメータ効率を示した。
    • 本研究の結果は,リソース制約のあるシナリオにおいて,再帰型Transformerアーキテクチャを選択するための指針となる。
    • 再帰的な重み共有Transformerは,小規模データにおける工学代替モデルとして有効であることが示された。

    Link: https://arxiv.org/abs/2607.27251

  • マルチモーダル継続学習におけるモダリティ寄与ドリフトの正則化 [cs.LG]目的:マルチモーダル継続学習におけるモダリティ寄与ドリフトの軽減
    • 機械学習モデルの継続学習は,新たな知識を獲得しつつ,既存の知識を維持することが重要である。
    • マルチモーダルデータを用いた継続学習では,各モダリティの寄与バランスがタスク間で変動し,性能低下を招く。
    • モダリティの寄与構造を維持することで,継続学習における忘却現象を抑制することを目指す。
    • 提案手法CMCDRは,モダリティ寄与ドリフトを定量化するMCDスコアを導入し,そのドリフトを正則化する。
    • CMCDRは,リプレイあり/なし両方の環境に対応し,過去のサンプルまたは現在のサンプルを用いてモダリティ寄与を調整する。
    • マルチモーダル分類および視覚質問応答タスクにおいて,CMCDRの有効性と汎用性が実証された。

    Link: https://arxiv.org/abs/2607.27260

  • DoTime:介入および反事実時系列のための合成ベンチマーク生成器 [cs.RO, cs.LG, physics.data-an, stat.ME]目的:介入および反事実時系列推論のための合成ベンチマークデータセット
    • 時系列データにおける因果推論は,医療,政策評価,気候科学など,重要な応用分野において不可欠である。
    • 既存の時系列因果推論ベンチマークは,観測データに偏っていたり,規模が小さかったり,特定のドメインに限定されている。
    • この研究は,介入と反事実推論を評価するための,スケーラブルかつ理論的に妥当なベンチマーク生成器を提供することを目指す。
    • DoTimeは,多変量時系列構造因果モデル(TSCM)を生成し,介入と反事実を組み込んだ評価スイートを公開する。
    • 介入訓練が,同一容量の観測モデルと比較して,方向精度において測定可能な利点をもたらすことが示された。
    • 構造の一致する評価において,介入事前学習されたネットワークは,すべての構造,軌跡長,およびシードで正のギャップを示した。

    Link: https://arxiv.org/abs/2607.27263

  • プラットフォームビッド:統合広告プラットフォームの視点からの自動入札ベンチマーク [cs.LG]目的:広告プラットフォーム全体の収益最大化を目指す自動入札手法の評価基準
    • リアルタイムビディングはデジタル広告の中心であり,広告市場の効率化に不可欠である。
    • 既存の自動入札アルゴリズムは広告主側のみに焦点を当てており,プラットフォーム全体の収益を考慮していない。
    • プラットフォーム視点での評価フレームワークの欠如を解消し,自動入札研究を促進すること。
    • PlatformBidは,広告主間の競争状況(均質,異質,プロモーション)を考慮した包括的なベンチマークである。
    • 既存の自動入札手法(古典的手法,強化学習,生成モデル)の評価を行い,その性能を比較した。
    • 提案手法BidFlowは,オンライン実験でターゲットコストを0.68%改善し,オフラインとオンラインの一貫性を示した。

    Link: https://arxiv.org/abs/2607.27265

  • 劇場パンフレット大規模調査:タイポグラフィの統計的比較分析 [cs.CV, cs.LG, eess.IV]目的:歴史的印刷物の書体の類似性定量化
    • 古文書研究において,書体情報は印刷史や様式分析に不可欠な要素である。
    • 書体の識別は専門家による視認に頼ることが多く,大規模な文献調査には限界があった。
    • 自動化された書体比較手法により,印刷史研究の効率化と新たな知見の発見を目指す。
    • 本研究で開発された手法は,17世紀スペインの劇場パンフレットの書体比較を可能にした。
    • 専門家による検証の結果,新たな印刷者帰属の特定や既存の帰属の修正に成功した。
    • この成果は,デジタル書誌学の大規模化に向けた可能性を示唆している。

    Link: https://arxiv.org/abs/2607.27266

  • FAVA:証拠に基づいた権限グラフを持つ検証済みエージェントの正式な認可 [cs.CR, cs.AI]目的:エージェント実行のための権限を伴う認可フレームワーク
    • LLMエージェントの自律的な運用は高度化しており,安全な認可メカニズムが不可欠である。
    • 従来のツールレベルの権限では,動的な状況やデータフローの変化に対応できない。
    • コンテキスト依存の認可と,実行時の状態に基づいた安全性確保を目指す。
    • FAVAは,自然言語タスクを構造化された制約に変換するPermission IRを用いる。
    • このIRは,データフロー,依存関係,コンテキストラベルを追跡する権限グラフに変換される。
    • FAVAは,複数のシナリオにおいて90.5%の決定コンプライアンス率(DCR)を達成した。

    Link: https://arxiv.org/abs/2607.27267

  • KV再構成を超えて:推測デコーディングにおけるMLAドラフトモデルの機能再構成 [cs.LG]目的:MLAドラフトモデルの機能再構成
    • 長文脈LLM推論において,コンパクトな潜在状態を用いるMLAはKVキャッシュを削減し,メモリトラフィックを低減するため重要である。
    • 高性能なオープンチェックポイントはMHA/GQAを使用しており,それをMLAに変換するとキャッシュ効率が得られるが,精度低下が問題となる。
    • MHA/GQAからMLAへの変換による合意率低下を解決し,推測デコーディングの加速効果を維持することを目的とする。
    • 本研究では,MLAドラフト構築をキャッシュ圧縮ではなく機能再構成として捉え,変換後のMLAモジュールが元のMHA/GQAモジュールと同様の応答を再現するように最適化する手法を提案。
    • 提案手法は,変換後のキャッシュと推論グラフを維持し,検証器のロジットや教師信号を必要としない,変換器に依存しない後変換処理である。
    • 多様な設定での評価により,機能再構成は多くのタスクにおいて合意率を大幅に改善し,推測デコーディングの性能向上に貢献することが示された。

    Link: https://arxiv.org/abs/2607.27269

  • パフォーマンスフィードバックからの強化学習によるコード生成 (RLPF) [cs.LG, cs.SE]目的:コード生成におけるパフォーマンスの最適化
    • コード生成AIの性能向上は,ソフトウェア開発の効率化に不可欠である。
    • 既存手法では,コードの正当性のみが重視され,実行速度の最適化が課題である。
    • 実行速度を考慮した学習手法を確立し,より効率的なコード生成を実現すること。
    • RLPFは,実行結果を段階的な報酬に変換することで,効率的な学習を可能にした。
    • PerfCodeBenchデータセットでの実験により,正しく実行可能なコードの生成率が大幅に向上した。
    • 学習済みモデルは,他のオープンソースモデルと同等の性能を示し,EffiBench-Xへの応用も確認された。

    Link: https://arxiv.org/abs/2607.27271

  • SDO:効率的なLLMポストトレーニングのための構造を意識したデータ組織化 [cs.LG]目的:大規模言語モデルのポストトレーニング効率化のためのデータ組織化手法
    • 大規模言語モデルの性能向上には,ポストトレーニングが不可欠であり,そのコストが課題となっている。
    • 既存手法ではデータ組織化が静的な前処理とみなされ,最適化中のサンプル露出の変化に対応できない。
    • 表現空間の構造に基づき,サンプル露出に応じたデータ組織化により,効率的なポストトレーニングを実現する。
    • SDOは,凍結された埋め込み表現を用いて,各エポックごとにデータ組織化を行うことで,モデルのウォームアップトレーニングのオーバーヘッドを回避する。
    • 近傍探索に基づくバッチ構築と,サンプル露出の記録・調整により,冗長な更新を抑制し,学習効率を向上させる。
    • SFT,DPO,GRPOといった様々な手法で,特に学習初期から中期にかけて収束が加速し,質問タイプ間の精度バランスも改善される。

    Link: https://arxiv.org/abs/2607.27273

  • EEGに基づく疾患診断の再考:インスタンス表現学習と被験者レベルの監督学習の分離 [cs.LG, stat.ML]目的:EEGデータを用いた疾患診断におけるインスタンス表現学習の新たな手法
    • 脳波(EEG)は,非侵襲的に脳活動を計測でき,様々な神経疾患の診断に有用である。
    • 従来のEEG解析では,被験者ラベルをインスタンスに継承するため,信頼性の低いインスタンスも学習に影響する。
    • インスタンスレベルのラベル継承問題を回避し,被験者レベルの限られたデータでも効果的な表現学習を行う。
    • 提案手法BridgeMILは,3つのEEG疾患データセットで既存手法を上回り,平均精度76.57%を達成した。
    • インスタンスに疾患ラベルを付与せずに,豊富なEEGインスタンスから学習することで,被験者レベルの予測精度を向上させた。
    • 異なる被験者間で明確なクラスターを形成し,診断クラス間の分離を改善した構造化された表現空間を学習した。

    Link: https://arxiv.org/abs/2607.27274

  • フラットなスコア,増幅された失敗:量子化されたLLMエージェントにおけるエラー予算が損害を隠蔽する仕組み [cs.LG, cs.AI]目的:量子化LLMエージェントにおけるエラーの増幅と,エラー予算がその影響を隠蔽する現象の解明
    • 大規模言語モデルの効率化は,計算コスト削減と実用化促進に不可欠である。
    • 量子化はモデルサイズを縮小するが,性能劣化のリスクが常に存在する。
    • 本研究は,量子化が既存のエラーを増幅し,その影響をエラー予算が隠蔽するメカニズムを明らかにする。
    • 4ビット量子化は,従来の評価指標ではほぼ無損失と報告されているが,マルチターン,ツール呼び出しエージェントでは異なる。
    • 量子化は,既存のエラーの発生頻度を最大2.5倍に増幅するが,新たなエラーはほとんど発生させない。
    • エラー予算を縮小すると,スコアの差が明確になり,量子化によるエラー量の増加が確認された。

    Link: https://arxiv.org/abs/2607.27275

  • 訓練の速度論:言語モデルにおける創発,可塑性喪失,回路制御のための誘導核生成速度則 [cs.LG]目的:言語モデルにおける能力の創発,可塑性喪失,回路制御の速度則の解明
    • 大規模言語モデルの性能向上は,その基礎となるメカニズムの理解を不可欠とする。
    • 言語モデルの能力獲得プロセスは不透明であり,その律速段階が明確でなかった。
    • 能力創発の律速段階を特定し,そのメカニズムを数学的に記述することを目指す。
    • 言語モデルの能力は,回路内の要素が揃って初めて発現し,部分的な整合性では意味がないことが示された。
    • 欠損要素の数が増えるほど,能力獲得までの待ち時間が長くなることが実験的に確認された。
    • 特定の回路部分の再初期化によって学習能力が回復することから,そのメカニズムが解明された。

    Link: https://arxiv.org/abs/2607.27281

  • 残差のベンチマーク:マッチングされた短期タスクのパフォーマンスを超えた長期評価がもたらすもの [cs.LG, cs.AI, cs.SE]目的:長期タスクにおけるエージェントの失敗要因の分析
    • AIエージェントの複雑なタスク遂行能力評価は,実用化に向けて不可欠である。
    • 長期タスクの評価では,単純にパフォーマンスが低下するだけで,その原因が不明瞭になりがちである。
    • 短期タスクの予測と長期タスクの実際の成功率の差を「ホライズン残差」として定量化し,問題点を明確化する。
    • 長期タスクのパフォーマンス低下は,単なるエラーの積み重ねだけでなく,履歴や環境変化による影響も考慮する必要がある。
    • 「ホライズン残差」を用いることで,長期タスクの失敗が予測との乖離として明確に示され,さらなる分析を促す。
    • ベンチマークは,エージェント設定やステージ選択方法を事前に明示し,公平な比較を可能にする必要がある。

    Link: https://arxiv.org/abs/2607.27283

  • PIE-APT: 時間的計画と矛盾検出のための統一的フレームワーク - 増分直接導出アブダクションによる [cs.AI, cs.LO]目的:動的知識グラフにおける時間的計画と矛盾検出
    • 知識グラフは,現実世界の複雑な情報を表現する上で不可欠である。
    • 不完全な知識や動的な変化への対応が困難である。
    • 効率的なアブダクションと時間的推論を統合することで,その課題を克服する。
    • 本研究では,記述論理上で動作するPIE-AbducerとPIE-APTという統合的フレームワークを提案する。
    • PIE-Abducerは,従来の最小ヒット集合列挙を回避し,直接反駁の結果を利用して欠損前提を抽出する。
    • 実験結果は,提案手法が古典的プランナーよりも優れており,アブダクションによる知識拡張において,最小ヒット集合に忠実なベースラインよりも定量的に優れていることを示している。

    Link: https://arxiv.org/abs/2607.27287

  • 信頼性に基づいた条件付きモーダリティリスクによるエキスパートルーティング:生体医用分類におけるマルチモーダル融合 [cs.LG]目的:生体医用分類のためのマルチモーダル融合における信頼性に基づいたエキスパートルーティング手法
    • 複数の情報源を組み合わせることで予測精度向上が期待されるが,必ずしもそうなるわけではない。
    • 既存手法では,各モーダリティの影響度と信頼性の区別が曖昧である。
    • モーダリティのリスクを考慮し,適切なエキスパートへのルーティングを可能にすること。
    • TIER-MoEは,予測損失をモーダリティ信頼性の指標として活用する。
    • 予測性能と確率較正において,最先端手法を上回る結果が得られた。
    • Macro-F1およびBrier scoreが改善し,外部コホートに対するゼロショット汎化性能も高い。

    Link: https://arxiv.org/abs/2607.27289

  • EvoCause:因果グラフのLLM誘導進化による根本原因分析 [cs.LG]目的:根本原因分析のための因果グラフ進化手法
    • 大規模システムにおける障害発生時の迅速な復旧には,根本原因の特定が不可欠である。
    • 従来の根本原因分析は静的な因果グラフに依存し,専門家の知見を活かしにくい。
    • 専門家のラベル制約に基づき,LLMを用いて因果グラフを動的に進化させる。
    • EvoCauseは,LLMによる妥当なグラフ編集提案と,決定論的な検証を組み合わせることで,精度向上を実現した。
    • 合成データ実験では,Node F1,Case EM,Graph F1がそれぞれ向上し,nSHDが減少した。
    • 実データ分析では,アラームタイトルの情報がグラフの洗練に貢献することが示された。

    Link: https://arxiv.org/abs/2607.27290

  • THGFM:二分岐時系列異種グラフ融合モデル [cs.LG, cs.CL, stat.ML]目的:時系列異種グラフにおける効果的なグラフ表現学習
    • 現実世界の複雑な関係性を表現する上で,異種グラフとその時間的変化のモデリングは重要である。
    • 既存手法は,タイプ間の知識転移と関係性に応じた特化を両立させることが難しく,時間情報を十分に活用できていない。
    • タイプ間の効率的な知識転移と関係性に応じた特化を統合し,時間情報を効果的に組み込むことで,グラフ表現学習の性能向上を目指す。
    • 提案手法THGFMは,共有空間と関係性分割の二つの注意機構を組み合わせることで,異なるタイプのノード間の知識転移と関係性に応じた特化を両立した。
    • THGFMは,相対的な時間情報を注意スコアに直接組み込むロータリー時間注意機構を導入し,時間的ダイナミクスのモデリングを強化した。
    • 学術グラフベンチマークにおいて,THGFMは既存のグラフTransformerモデルを上回り,平均で3.25%の性能向上を達成した。

    Link: https://arxiv.org/abs/2607.27303

  • 位置が重要,来歴はそうではない:医療ビジョン言語モデルにおける推論媒介と追随性の分離 [cs.LG, cs.CV]目的:医療ビジョン言語モデルにおける推論の因果的影響の検証
    • 医療診断支援において,AIの活用が期待される中で,その推論過程の透明性と信頼性が重要である。
    • 医療VLモデルが生成する推論が,実際に予測に影響を与えているのか不明確であり,追随性(ハルシネーション)が問題となる。
    • 生成された推論の編集を通じて,推論が予測に与える影響を定量的に評価し,信頼性を高める。
    • 推論注入の方法が測定される忠実度に大きく影響することが示された。
    • 提示された文脈の位置が,医療VLモデルが生成した推論を利用するかどうかの主要な決定要因であることが明らかになった。
    • 視覚的根拠の削除は注入された推論への依存度を高め,左右の区別は最も忠実に追跡される臨床的属性ではなかった。

    Link: https://arxiv.org/abs/2607.27304

  • ZUNA1.1:ノイズ除去と超解像のための,より柔軟な脳波基礎モデル [cs.LG, q-bio.NC]目的:脳波信号の再構成
    • 脳波は,脳機能の研究や臨床診断において不可欠な情報を提供する
    • 脳波データはノイズの影響を受けやすく,欠損データも頻繁に発生する
    • 多様な脳波データに対して,ロバストかつ柔軟な再構成手法の確立
    • ZUNA1.1は,最大30秒までの可変長シーケンス,任意のチャンネル数と頭皮位置に対応可能
    • ZUNA1.1は,以前のZUNA1モデルと同等以上の性能を持ちながら,より柔軟な再構成タスクを処理可能
    • 標準的な脳波ノイズ除去・再構成手法である球面スプライン補間よりも大幅に高い性能を示す

    Link: https://arxiv.org/abs/2607.27308

  • ブロックチェーン分析における意思決定モデリング:木構造モデルとシーケンシャルモデルの漏洩を意識した評価 [cs.LG]目的:Sybilボットの識別におけるモデル性能の比較と,実用的な低遅延デプロイメントの実現
    • ブロックチェーン技術の普及に伴い,不正行為や悪意あるアクターの検出が重要となっている。
    • Sybil攻撃は,ガバナンスへの影響やエアドロップの不正取得を引き起こす深刻な問題である。
    • 高信号スマートコントラクトからの情報漏洩を抑制し,より正確なSybilボット識別を目指す。
    • 漏洩を意識した評価において,TransformerベースのシーケンシャルモデルよりもXGBoostの方が高い性能を示した。
    • XGBoostは,Transformerと比較して低遅延かつ低エネルギー消費で動作する。
    • 本研究では,漏洩を意識したEthereumアクター分類のためのフレームワークと,ウォレット行動のTransaction Grammar表現を提案した。

    Link: https://arxiv.org/abs/2607.27350

  • PAUSE:統合サービス環境におけるパーソナルAIアシスタントのユーザ中心ベンチマーク [cs.CL, cs.AI]目的:パーソナルAIアシスタントのユーザ中心的評価
    • 日々の活動を支援するAIアシスタントの重要性が増しており,その性能評価が不可欠である。
    • 既存のベンチマークは,サービス連携やユーザ状態の扱いに限界があり,実用的な評価が困難である。
    • 本研究は,実環境に近い状況でのAIアシスタントの性能評価を可能にするベンチマークの開発を目指す。
    • PAUSEは,ユーザの状態や設定を考慮し,複数のサービスを連携させる必要のあるAIアシスタントの評価に特化している。
    • 最先端のモデルであっても,状態推論や設定認識を要するタスクでは70%のタスク完了率に達していないことが示された。
    • ユーザ,環境,タスクを大規模に生成する合成パイプラインを提案し,ベンチマークの拡張性と将来の研究を支援する。

    Link: https://arxiv.org/abs/2607.27354

  • SkillMentor:LLMエージェントの盲点診断学習による自己進化 [cs.AI]目的:エージェントの盲点診断能力の学習
    • エージェントの自己進化は,AIシステムの自律性と適応性を高める上で重要である。
    • 既存研究では,エージェントが何を「知らない」かを自ら発見する能力が軽視されてきた。
    • この研究は,盲点診断を学習可能な能力として確立し,自己進化の新たな道を開く。
    • SkillMentorは,強化学習を用いて診断タスクを生成し,失敗パターンを特定,修正スキルを構築する。
    • AppWorldとBFCLv3において,実行エージェントの性能を平均44.2%向上させた。
    • この結果は,盲点診断が学習可能であり,人間の介入なしに自己進化を可能にすることを示唆する。

    Link: https://arxiv.org/abs/2607.27360

  • 圧縮に基づく行動類似性による,イーサリアムにおけるオープンワールドSybil検出 [cs.CL, cs.HC, cs.LG]目的:オープンワールド環境下におけるSybil検出のための行動類似性に基づく手法
    • ブロックチェーン技術の信頼性を担保するため,悪意ある攻撃者による不正行為の検出が重要である。
    • 既存のSybil検出手法は,資金移動の記録や教師あり学習に依存し,攻撃戦略の変化に対応できない。
    • 資金移動の記録や教師データなしで,Sybilアカウントを検出可能な枠組みを構築すること。
    • EVMトレースから取引のリズム,実行構造,機能的意図を捉えたシンボリックな取引文法を構築した。
    • Gzipに基づくNCDを用いて行動グラフを構築し,Sybil候補の検出を行った。
    • 教師あり学習によるベースラインと比較し,時間分割や合成カモフラージュストレステストで有効性を検証した。

    Link: https://arxiv.org/abs/2607.27370

  • 探求的モデリング:第3の事前学習軸の解錠とエンドツーエンド生成 [eess.SY, cs.SY, cs.LG, cs.AI, cs.CL, cs.CV]目的:生成モデルにおける性能向上とエンドツーエンド生成の実現
    • 深層学習の発展は目覚ましいが,生成モデルはまだ手動設計の段階に留まっている。
    • 既存の生成モデルは多峰性分布の扱いにくさから,エンドツーエンド学習が困難である。
    • モデル生成とデータの候補を探索し,最適なものを選択することで,エンドツーエンド生成を可能にする。
    • 探求的モデリングは,パラメータやデータに加えて,探索という第3の事前学習軸を提供することで,性能を向上させる。
    • データ量やモデル規模の拡大に伴い,探索による改善効果は高まり,計算効率やサンプル効率も向上する。
    • 探求的モデリングは,拡散モデルと同等の性能を,推論ステップ数を大幅に削減して実現可能である。

    Link: https://arxiv.org/abs/2607.27372

  • RoguePrompt:自己再構成のための二層エンコーディングによるLLMモデレーション回避 [cs.CR, cs.AI]目的:LLMモデレーション回避攻撃手法の段階ごとの成功率評価
    • LLMは広く利用される一方,安全確保が重要課題となっている。
    • プロンプト操作によるモデレーション回避が依然として困難である。
    • 多段階攻撃の失敗要因を特定し,より強固なモデレーション構築に貢献する。
    • RoguePromptは,Vigenere暗号とROT13暗号の二層エンコーディングにより,高いモデレーション回避率(93.93%)を示した。
    • プロンプトの再構成率は79.02%であり,指示の正確な伝達が確認された。
    • 最終的な実行成功率は70.18%であり,多段階攻撃における各段階のボトルネックを特定することができた。

    Link: https://arxiv.org/abs/2607.27373

  • VideoCoCo:物理的に整合性のとれた動画生成のためのコードを利用した思考連鎖型エージェント二重エンジンシステム [cs.CL, cs.CV, cs.AI]目的:物理的に整合性のとれた動画生成手法
    • 動画生成技術は近年飛躍的に進歩しているが,物理法則に則った自然な動きの再現が課題である。
    • 既存のテキストからの動画生成モデルは,圧縮されたテキスト情報から時間変化を推測するため,物理的な整合性が低い。
    • 実行可能なコードを思考連鎖として利用し,物理シミュレーションを通じて整合性の高い動画を生成する。
    • VideoCoCoは,Blenderコードを中間表現として利用するエージェント二重エンジンシステムである。
    • 提案手法は,PhyGenBenchとVBench-2.0の両ベンチマークで,既存手法を大幅に上回る性能を示した。
    • 実行可能なコードは,物理的に整合性のとれた動画生成のための,効果的で制御可能かつ検証可能な中間表現となり得る。

    Link: https://arxiv.org/abs/2607.27380

  • 重い裾を持つノイズ下におけるAdamの収束挙動 [cs.LG]目的:重い裾を持つ確率的ノイズ下でのAdamオプティマイザの収束保証
    • 深層学習の発展に伴い,勾配に裾の重いノイズが含まれるケースが増加している。
    • 有限分散を仮定した最適化手法では,裾の重いノイズに対する収束性が不明であった。
    • 裾の重いノイズ下におけるAdamの収束性を理論的に解明し,その限界を明らかにする。
    • 本研究により,Adamが重い裾を持つノイズ下で$(\rho,\epsilon)$-定常点に収束することが示された。
    • ただし,その反復回数依存性は最適ではなく,裾の重さに依存した収束となることが明らかになった。
    • ドメイン半径が既知の場合,Adamの収束速度は最適な複雑度に改善される。

    Link: https://arxiv.org/abs/2607.27383

  • 同じ事実,異なる診断:臨床言語モデルにおける物語的固定化の測定と軽減 [cs.CL, cs.AI]目的:臨床診断推論における物語的固定化の測定と軽減
    • 医療AIの精度向上は,患者ケアの質に直結する重要な課題である。
    • 言語モデルは,文体などの言語的特徴に影響を受けやすく,診断結果にばらつきが生じる可能性がある。
    • 物語的固定化の影響を定量化し,それを軽減する手法を開発すること。
    • 臨床診断において,同じ事実でも文体を変えることで診断結果が異なる「物語的固定化」という現象が確認された。
    • 既存のバイアス軽減手法は,必ずしも精度向上につながらず,状況によっては精度低下を引き起こす可能性がある。
    • 臨床事実の抽出と検証を行う「NarrativeShield」パイプラインにより,物語的固定化の影響をほぼゼロにまで軽減できることが示された。

    Link: https://arxiv.org/abs/2607.27384

  • 拡散言語モデルの双方向性の限界:堅牢性に関する再評価 [cs.AI, cs.LG]目的:拡散言語モデルと自己回帰モデルの堅牢性と校正の体系的評価
    • 自然言語処理の発展に伴い,より信頼性の高い言語モデルの構築が求められている。
    • 拡散言語モデルは新しいアプローチだが,現実世界のノイズや敵対的攻撃に対する堅牢性が不明確である。
    • 拡散言語モデルの脆弱性を特定し,その根本的な改善策を提案すること。
    • 拡散言語モデルは,勾配に基づく敵対的攻撃に対してある程度の耐性を持つが,自然なノイズに対しては脆弱であることが示された。
    • 拡散言語モデルは過信傾向があり,実用上の展開において注意が必要である。
    • モデルは入力の破損を完全に符号化するが,行動の脆弱性はデコーダーのルーティング失敗に起因することが示唆された。

    Link: https://arxiv.org/abs/2607.27386

  • FunL2O:学習最適化のためのLLM誘導特徴関数設計 [cs.LG, cs.AI]目的:学習最適化における特徴関数設計の自動化
    • 最適化問題は科学技術の根幹であり,効率的な解法が求められている。
    • 既存手法では,特徴関数の設計が手動であり,ドメイン汎用性に課題がある。
    • LLMを活用し,特徴関数設計を自動化することで,汎用性と性能向上を目指す。
    • FunL2Oは,LLMによるプログラム進化を通じて特徴関数を自動設計するフレームワークである。
    • 線形計画法,二次計画法,混合整数計画法など,様々な最適化タスクで有効性が確認された。
    • 進化した特徴量は,手動で設計された特徴量を一貫して上回り,LLM誘導の特徴進化の有効性が示された。

    Link: https://arxiv.org/abs/2607.27389

  • AHA-Memes:アラビア語ミームにおけるヘイト理解のためのきめ細かいマルチモーダルベンチマーク [cs.CL, cs.AI]目的:アラビア語のヘイトミームの理解と検出
    • オンライン上でのヘイトスピーチは深刻な問題であり,特に多言語環境での対策が急務である。
    • アラビア語のヘイトミームに関する研究は少なく,既存のリソースも粗いラベルに留まっている。
    • アラビア語のヘイトミームをきめ細かく分類し,文化的な背景を考慮した検出手法の開発を目指す。
    • 本研究では,5,000件のアラビア語ヘイトミームを,ヘイトの種類に基づいて多ラベルで注釈した大規模ベンチマークデータセットAHA-Memesを公開した。
    • テキストのみ,画像のみ,マルチモーダルモデル,Few-shot ICL,VLMなどの性能を評価し,ベースラインを確立した。
    • 文化的な背景を考慮したアラビア語ヘイトミーム検出における課題を明確にし,今後の研究を支援する。

    Link: https://arxiv.org/abs/2607.27393

  • ECG-InterpBench:マッチングスケールのスパースオートエンコーダを用いた心電図基礎モデルの解釈可能性のベンチマーク [cs.LG, cs.AI]目的:心電図基礎モデルの表現の解釈可能性を体系的に評価するベンチマーク
    • 心電図データは心疾患診断に不可欠であり,高精度な解析が求められている。
    • 既存のベンチマークは予測性能に偏重しており,モデル内部の表現の解釈性に着目した評価が不足している。
    • 心電図基礎モデルの表現が臨床的に解釈可能か,再現性があるかを定量的に評価する。
    • ECG-InterpBenchは,スパースオートエンコーダを用いて,異なるモデルの表現の解釈可能性を比較可能にする。
    • 評価の結果,心電図基礎モデルはそれぞれ異なる解釈可能性のプロファイルを持つことが明らかになった。
    • 再検証により,再構成忠実度と臨床的アクセス性は,異なる最適なモデルを特定することが示された。

    Link: https://arxiv.org/abs/2607.27404

  • 確率演算子に関する論理的推論におけるLLMの能力評価 [cs.CL, cs.AI]目的:確率演算子を伴う文に対する論理的推論能力の評価
    • 自然言語における不確実性の表現と推論は重要であり,医療や法律等の分野でも必要不可欠である。
    • LLMの論理的推論能力評価において,表面的なパターン認識と原理的な記号推論を区別することが困難である。
    • 確率演算子を含む文に対する論理的推論能力を定量的に評価し,LLMのバイアスを明らかにすること。
    • 29のモデルを評価した結果,大多数のモデルが論理形式に依存しない回答バイアス(Yes/Noの偏り)を示すことが判明した。
    • モデルのYes正答率とNo正答率の低い方をもって能力下限を定義したところ,29モデル中9モデルのみが偶然レベルを超える性能を示した。
    • 質問形式,動詞句,名前の性別や起源などを変化させた評価では,あらゆる軸においてバイアスが確認された。

    Link: https://arxiv.org/abs/2607.27405

  • SWE-NFI:非機能改善のためのコーディングエージェントの研究とベンチマーク [cs.SE, cs.AI]目的:非機能改善を行うコーディングエージェントの評価基準
    • ソフトウェア開発において,機能修正だけでなく品質向上が不可欠である。
    • 既存のベンチマークは機能要件に偏っており,品質改善の評価が困難である。
    • 非機能改善能力を定量的に評価し,エージェント開発の指針を示す。
    • SWE-NFIベンチマークは,実際のオープンソースPythonプロジェクトのプルリクエストから188のタスクを構築している。
    • 最先端のエージェントは機能要件で70.0%の正答率を達成するも,非機能改善能力では人間開発者に劣る。
    • 特に構造的改善において顕著な差が見られ,エージェントのスコアは0.0〜1.3に対し,人間のスコアは1.5である。

    Link: https://arxiv.org/abs/2607.27409

  • 推論時スケーリングとエピソード記憶の架け橋:行動中心グラフ [cs.AI]目的:推論時スケーリングとエピソード記憶の統合
    • 大規模言語モデルの高度な推論能力を活かすため,効率的なスケーリング手法が重要視されている。
    • 既存のスケーリング手法はステートレスであり,冗長な探索を繰り返す非効率性が課題である。
    • 行動中心グラフを用いて,LLMに依存しない効率的な記憶メカニズムを構築し,推論効率を向上させる。
    • 提案手法GAMERは,過去の推論履歴を行動中心グラフとしてモデル化することで,トークン/コストを削減する。
    • 時間差学習により,行動ノードの価値を推定し,意思決定を双方向で最適化する。
    • 複数のベンチマークにおいて,成功率/進捗率がベースラインと比較してそれぞれ20.81%/6.17%向上した。

    Link: https://arxiv.org/abs/2607.27415

  • 文脈情報を考慮した条件付き注意による船舶軌跡予測 [cs.LG]目的:船舶軌跡の予測精度向上
    • 海上安全や自律運航において,船舶の長期的な軌跡予測は不可欠な技術である。
    • 既存手法では,気象条件などの外部要因と船舶特性の制約が十分に考慮されていない。
    • 気象条件が船舶の動態に及ぼす物理的な依存関係を明示的にモデル化する。
    • 提案手法Conditional Informerは,環境コンテキストを条件とした軌跡予測を可能にする。
    • 条件付き注意機構により,気象情報が船舶の動態に与える影響を正確に捉える。
    • モダリティマスキングにより,センサーデータの欠損に対するロバスト性を高め,予測精度を向上させる。

    Link: https://arxiv.org/abs/2607.27418

  • HLE 多肢選択問題群における次元性と測定精度 [cs.AI, cs.CL]目的:大規模言語モデル評価指標HLEの次元性と測定精度の評価
    • 言語モデルの能力評価において,HLEは重要な指標として広く用いられている。
    • HLEの各分野のスコアが,独立した能力を反映しているか不明である。
    • HLEが,同程度の能力を持つモデルを識別できるか検証する。
    • HLEは,単一の総合的な推論能力を測定していることが示唆された。
    • 分野ラベルは,項目応答の分散のわずか3.5%しか説明しない。
    • 測定精度は,中程度の能力レベルに集中しており,高い能力レベルでは低下する。

    Link: https://arxiv.org/abs/2607.27420

  • ゼロショット意図分類のためのオープンウェイト言語モデルの選定:41モデルの体系的評価 [cs.CL, cs.AI, cs.LG]目的:オープンウェイト言語モデルの意図分類における選定基準
    • 対話システムにおいて意図分類は不可欠であり,実用的なモデル選定の指針が求められている。
    • 計算資源,遅延,ロバスト性といった制約下で,最適なモデルを選定するための体系的な評価が不足している。
    • 実用的な制約条件を満たすオープンウェイト言語モデルの選定を支援することを目的とする。
    • 30億パラメータの命令調整済みモデルが,一部の70億パラメータのベースモデルを上回る性能を示すことが確認された。
    • MASSIVEにおける主要モデル間の性能差は統計的に有意ではないことがMcNemar検定により示された。
    • SNIPSなどの既存のベンチマークは飽和しており,最新モデルの識別能力は低下していることが明らかになった。

    Link: https://arxiv.org/abs/2607.27421

  • 優れたランク付け,不適切な目的:表現力豊かな方策探索における双線形対照批判器 [cs.LG]目的:双線形対照批判器における問題点と改善策に関する研究
    • 強化学習において,効果的な行動ランク付けは,最適な方策の学習に不可欠である。
    • 対照批判器は,価値関数として利用される場合があるが,その信頼性と安全性に課題がある。
    • 双線形対照批判器の潜在的な問題を特定し,より安全で正確な行動選択を可能にする。
    • 優れた行動ランク付けだけでは,対照批判器を安全に最大化することはできないことが示された。
    • 双線形スコアの unbounded な性質が,オフサポート値の膨張を引き起こす主要因であることが明らかになった。
    • 対照批判器はナビゲーションや操作タスクにおいて有用なランク付け器として機能するものの,行動選択には価値関数による補正が必要である。

    Link: https://arxiv.org/abs/2607.27422