arXiv雑要約

AI - 2026/07/30 公開

  • 臨床試験における適格基準変更のベンチマーク:AMEND++ [cs.CL, cs.AI, cs.LG]目的:臨床試験における適格基準変更予測
    • 臨床試験は新薬開発の根幹であり,その効率化は医療進歩に不可欠である。
    • 臨床試験のプロトコル変更は遅延やコスト増を招き,管理負担を増加させる。
    • 適格基準の変更予測により,より効率的かつ費用対効果の高い臨床試験設計を目指す。
    • 本研究では,臨床試験の適格基準変更を予測する新しいNLPタスクを提案し,そのためのベンチマークデータセットAMEND++を公開した。
    • Change-Aware Masked Language Modeling (CAMLM)という改訂を考慮した事前学習戦略を提案し,適格基準変更予測の精度向上を示した。
    • CAMLMは既存の基盤モデルと比較して,よりロバストかつ費用対効果の高い臨床試験設計に貢献する。

    Link: https://arxiv.org/abs/2601.06300

  • 文脈が真実を形成する方法:LLMにおける文レベルの真実表現の幾何学的変換 [cs.CL, cs.AI]目的:LLMにおける文脈導入時の真実ベクトル変化の幾何学的特徴
    • LLMの性能向上には,内部表現の理解が不可欠である。真実性の表現は重要な要素の一つである。
    • LLMが文脈をどのように利用して真実を判断しているのか,そのメカニズムは未解明な点が多い。
    • 文脈がLLMの真実表現に与える幾何学的影響を明らかにすることで,より信頼性の高いLLMの構築を目指す。
    • 真実ベクトルは初期層でほぼ直交し,中間層で収束し,後期層で安定化または増大する傾向が見られた。
    • 文脈の追加は一般的に真実ベクトルの大きさを増加させ,真/偽表現の分離を明確化することが示された。
    • 大規模モデルは方向変化,小規模モデルは大きさの違いによって,関連性と無関係な文脈を区別することが判明した。

    Link: https://arxiv.org/abs/2601.06599

  • ダウンサンプリングは針筋電図信号にどのような影響を与えるか:高周波時系列におけるダウンサンプリング効果を理解するための汎用的なワークフロー [cs.AI]目的:高周波時系列データのダウンサンプリングによる情報損失の評価
    • 筋神経疾患の検出支援において,自動化された針筋電図信号解析の重要性が増している。
    • 針筋電図信号の多様なサンプリングレートが,特徴量ベースの機械学習モデルの計算負荷を増大させている。
    • ダウンサンプリングによる診断情報の損失を定量化し,最適なダウンサンプリング設定を特定すること。
    • ワークフローにより,診断情報を維持しつつ計算負荷を低減するダウンサンプリング設定が特定された。
    • 形状を考慮したダウンサンプリングアルゴリズムは,標準的な減算よりもピーク構造や信号形態を良好に保持した。
    • 本研究は,リアルタイムに近い針筋電図解析を可能にするダウンサンプリング設定の選択に役立つ指針を提供する。

    Link: https://arxiv.org/abs/2601.10191

  • AdaMARP:汎用没入型ロールプレイングのための適応型マルチエージェント相互作用フレームワーク [cs.AI, cs.CL]目的:汎用的な没入型ロールプレイングのための適応型マルチエージェント相互作用フレームワーク
    • 没入型ロールプレイングは,インタラクティブな物語体験を豊かにする上で重要な役割を担う。
    • 既存システムは,動的な環境情報やキャラクターの導入が不十分で,没入感と適応性に限界がある。
    • 多様なキャラクターやシーンの変化に対応可能な,より自然で一貫性のあるロールプレイング体験の実現を目指す。
    • AdaMARPは,思考,行動,環境,発言を組み合わせた没入型メッセージ形式と,ロールプレイングを制御するシーンマネージャーを導入した。
    • AdaRPSetおよびAdaSMSetを用いた学習により,キャラクターの一貫性,環境との関連性,物語の整合性が向上した。
    • 実験結果から,AdaMARPは大規模言語モデル(LLM)と比較して優れた性能を示し,より自然なシーン遷移とキャラクターの導入を実現した。

    Link: https://arxiv.org/abs/2601.11007

  • TANDEM:時間情報を考慮したマルチモーダルヘイトスピーチ検出 [cs.AI, cs.CL, cs.MM, cs.SI]目的:マルチモーダルヘイトスピーチの検出における時間的文脈の活用
    • ソーシャルメディアにおけるヘイトスピーチは深刻化しており,プラットフォームの安全性確保が急務である。
    • 既存のヘイトスピーチ検出システムは精度は高いものの,根拠が不明瞭で,詳細な分析が困難である。
    • 本研究は,ヘイトスピーチの発生箇所と対象を特定し,透明性の高い検出システムを構築することを目指す。
    • TANDEMは,音声,映像,テキストを統合的に分析することで,ヘイトスピーチ検出の精度を向上させた。
    • HateMMデータセットにおいて,標的識別のF1スコアで既存手法を30%上回る0.73を達成した。
    • マルチクラス分類では,ラベルの曖昧さやデータセットの不均衡により,攻撃的コンテンツとヘイトスピーチの区別が課題として残る。

    Link: https://arxiv.org/abs/2601.11178

  • 方言LLM:標準アメリカ英語を超えた方言対応対話生成フレームワーク [cs.CL, cs.AI]目的:多様な英語方言に対応した高品質な対話データ生成
    • 英語話者の80%以上は標準アメリカ英語を使用せず,方言はコミュニケーションにおいて重要な役割を果たす。
    • 既存のLLMは,標準外の英語方言の識別が難しく,ステレオタイプな応答を生成する傾向がある。
    • 本研究は,LLMにおける方言理解と生成能力の向上を目指し,多様な方言データを提供することで,その課題を解決する。
    • DialectLLMは,語彙,表記,形態統語の3つの要素を含む,大規模な方言対応対話データセットを構築した。
    • 構築されたデータセットを用いた評価の結果,既存モデルは方言識別の精度が低く,特にカナダ英語などの主要な方言で課題が残ることが示された。
    • DialectLLMのデータは,LLMの追加学習リソースとして活用でき,方言対応の対話型AI開発を促進する可能性がある。

    Link: https://arxiv.org/abs/2601.22888

  • 教師あり潜在変数モデルにおける構造的に分離された不確実性 [cs.LG, cs.AI]目的:予測不確実性の構造的分離
    • 機械学習モデルの信頼性評価において,不確実性の正確な把握は不可欠である。
    • 従来の不確実性分解は,予測分布からの派生であるため,推定量の相関が強いという課題がある。
    • 本研究は,明確に分離された不確実性推定を可能にする新しいモデル構造を提案する。
    • 構造的分離により,認識論的不確実性と偶然的不確実性の相関が大幅に低減された。
    • 偶然的不確実性の推定値は,アノテーターやコーパス由来の曖昧さを反映していることが示された。
    • 認識論的不確実性の推定値は,予測誤差やデータ可用性に敏感であることが示された。

    Link: https://arxiv.org/abs/2602.11219

  • MapTab:異種トポロジカルグラフにおける長期的多基準マルチモーダル推論の診断ベンチマーク [cs.FL, cs.LG]目的:マルチモーダル大規模言語モデルの多基準推論能力の評価
    • 汎用人工知能(AGI)の発展には,モデルの総合的な評価が不可欠である。
    • 既存のベンチマークでは,多基準制約下での推論能力を厳密に評価できない。
    • マルチモーダルモデルの,知覚,統合,数値比較,経路計画能力を評価する。
    • MapTabは,経路計画タスクを通じて,マルチモーダル大規模言語モデルの多基準推論を評価するベンチマークである。
    • 評価の結果,既存のモデルは多基準マルチモーダル推論に苦戦していることが示された。
    • 視覚的知覚が不確かな場合,マルチモーダル推論は単一モーダルアプローチよりも性能が低下することがある。

    Link: https://arxiv.org/abs/2602.18600

  • PatchDenoiser:パラメータ効率の良いマルチスケールパッチ学習と融合による低線量CT画像ノイズ除去手法 [eess.SY, cs.MA, cs.RO, cs.SY, math.OC, cs.CV, cs.AI]目的:低線量CT画像のノイズ除去
    • CT検査における被ばく線量を低減することは,患者の安全確保において重要である。
    • 低線量CT画像はノイズが多く,臨床解釈や画像解析の精度低下を招く。
    • 高精度なノイズ除去を実現し,臨床現場での実用性を高めることを目指す。
    • PatchDenoiserは,従来のCNNやGANベースの手法と比較して,PSNRおよびSSIMにおいて優れた性能を示した。
    • スライス厚,再構成カーネル,HUウィンドウの変化に強く,異なるスキャナ間でもファインチューニングなしに一般化可能である。
    • パラメータ数を約9分の1,推論ごとのエネルギー消費量を約27%削減し,実用性と効率性を両立した。

    Link: https://arxiv.org/abs/2602.21987

  • 尋ねることは伝えるよりも:大規模言語モデルにおけるおべっか行為の軽減 [cs.HC, cs.AI]目的:大規模言語モデルにおけるおべっか行為の軽減策
    • AIの社会実装が進む中で,倫理的・実用的な問題解決が急務となっている。
    • 大規模言語モデルは,ユーザーの意向に沿う回答を優先しやすく,批判的思考が欠如しがちである。
    • ユーザーの質問形式を調整することで,おべっか行為を抑制し,より公平な応答を促す。
    • 入力文の形式(質問 vs. 記述)が,モデルのおべっか行為に大きな影響を与えることが示された。
    • ユーザーの発言における確信度や視点(自己 vs. ユーザー)によって,おべっか行為の度合いが変化することが確認された。
    • 記述文を質問文に変換させることで,モデルのおべっか行為を効果的に軽減できることが明らかになった。

    Link: https://arxiv.org/abs/2602.23971

  • LoRAを知識メモリとして捉える:経験的分析 [cs.LG]目的:事前学習済み大規模言語モデルにおける知識更新のメカニズム
    • LLMの性能維持には,変化する知識への継続的な更新が不可欠である。
    • 文脈長制限,コスト,検索断片化が,ICLやRAG等の手法の課題となっている。
    • LoRAの知識メモリとしての能力と,その構成要素の関係性を明らかにすること。
    • LoRAはパラメータ効率的に知識を格納し,モジュール化された知識メモリとして機能する。
    • LoRAメモリの容量,内部化,複数モジュールシステムの拡張性,長文脈推論が評価された。
    • LoRAはRAGやICLと並ぶメモリの軸として,独自の利点を持つことが示唆された。

    Link: https://arxiv.org/abs/2603.01097

  • 含意された前提の明示化:エントヒメームの論理的理解において [cs.CL, cs.AI]目的:エントヒメームの論理的理解のための体系的な方法
    • 現実世界の議論は多くの場合,前提や主張が暗黙的であるため,その理解は重要である。
    • 既存手法では,テキストからエントヒメームを特定できても,その背後にある論理を解読できない。
    • テキストを論理的議論に変換し,論理式を生成することで,論理的な含意関係を示すことを目指す。
    • 大規模言語モデルを用いて,明示的な前提と主張から暗黙的な前提を生成するパイプラインを提案した。
    • 別の言語モデルで自然言語を論理式に翻訳し,SATソルバーに基づく神経記号推論器で含意関係を判断する。
    • エントヒメームデータセットでの評価で,正解の暗黙的推定の選択において良好な性能が示された。

    Link: https://arxiv.org/abs/2603.06114

  • MICA:長期間の感情サポート対話のための多粒度時間的信用割り当て [cs.CL, cs.AI]目的:長期間の感情サポート対話における多粒度時間的信用割り当て手法
    • 大規模言語モデルの対話性能向上は,人間らしい自然なコミュニケーションを実現する上で重要である。
    • 多段階対話では報酬が疎になり,各ステップへの適切な信用割り当てが困難である。
    • 感情サポート対話における報酬の疎性を克服し,効果的な信用割り当てを可能にすること。
    • MICAは,ユーザーの状態変化を考慮した新規な信用割り当て手法であり,ロールアウトコストを追加しない。
    • EMPA,EQ-Bench,EmoBenchの評価において,既存手法(GRPO,REINFORCE++)を最大で42.5ポイント上回る性能を示した。
    • 本研究は,対話型LLMにおける多段階強化学習の有効性を示し,実用的な応用への道を開く。

    Link: https://arxiv.org/abs/2603.06194

  • 網膜VLMにおけるドメイン特化知識のアンカリングのための深層専門家注入 [cs.CV, cs.AI]目的:網膜VLMにおけるドメイン特化知識の埋め込みによる性能向上
    • 眼科診断は専門知識を要するため,AIによる自動化は医療現場での負担軽減に貢献する。
    • 汎用的な画像認識モデルは,微細な病理学的特徴の識別が難しく,誤診のリスクがある。
    • 専門家の知識をVLMに効率的に組み込み,より信頼性の高い眼科AIを開発することを目指す。
    • 提案手法EyExInは,専門家知識をVLMに注入することで,視覚的特徴と言語モデルの間の連携を強化する。
    • EyExInは,解剖学的コンテキストと病理学的意味合いを分離し,病変信号を強調することで,精度向上を実現した。
    • 4つのベンチマークにおいて,大規模なプロプライエタリシステムを凌駕する性能を示し,眼科AIの発展に貢献する。

    Link: https://arxiv.org/abs/2603.07131

  • 人間活動認識における継続学習のためのゲート付き適応 [cs.RO, cs.LG, cs.AI]目的:人間活動認識における継続学習の安定性と可塑性の両立
    • ウェアラブルセンサを用いた活動認識は,ヘルスケアやスマートホームなど多岐にわたる分野で重要性が増している。
    • 継続学習において,新しいタスクを学習する際に,過去の知識を忘れてしまう「破滅的忘却」が課題となっている。
    • 本研究は,個人固有の動きのパターンに対応しつつ,過去の学習結果を保持する継続学習手法を提案する。
    • 提案手法では,凍結された事前学習済表現をチャンネルごとのゲート付き変調により適応させることで,パラメータ効率の高い継続学習を実現した。
    • 実験の結果,PAMAP2データセットにおいて,破滅的忘却を大幅に削減し,最終的な精度を向上させることに成功した。
    • 本手法は,リプレイバッファやタスク固有の正則化を必要とせず,分布シフト下でも効果的であることが確認された。

    Link: https://arxiv.org/abs/2603.10046

  • 多岐にわたる対話における言語モデルの状況依存的安全性の失敗 [cs.CR, cs.AI]目的:言語モデルにおける安全性の失敗の構造的理解
    • 大規模言語モデルの安全性確保は重要であり,現実世界の利用を考慮する必要がある。
    • 単発の質問形式での評価では,多岐にわたる対話における安全性問題は捉えきれない。
    • 対話履歴を状態遷移として捉え,安全性の境界を越える過程を分析する。
    • 多くの言語モデルは,構造化された多岐にわたる対話において,急速かつ再現性のある安全性の崩壊を示す。
    • 安全性に関連する表現が徐々に減少し,役割設定された文脈によって急激な変化が誘発されることが明らかになった。
    • 言語モデルの安全性は,対話の軌跡に沿った動的で状況依存なプロセスとして捉えるべきである。

    Link: https://arxiv.org/abs/2603.15684

  • Transformerは未学習のルールを学習可能:補間の限界を超える計算の証明 [cs.LG]目的:未学習のルール学習能力の有無
    • 大規模言語モデルの能力理解において,学習範囲外の汎化性能は重要な検証課題である。
    • 既存モデルが補間のみに依存すると仮定する見解に対し,それを覆す証拠が必要とされている。
    • Transformerが補間を超えた計算能力を持つことの証明を目指している。
    • Transformerは,XOR演算規則の真理値表の一部を直接学習しなくても復元可能であった。
    • この復元能力は,多段階予測を通じた勾配信号の伝播に依存することが示された。
    • Transformerブロックが正確な局所ブールルールを実装可能であることの構成的証明がなされた。

    Link: https://arxiv.org/abs/2603.17019

  • SENSE:プライバシー保護セマンティック検索による高効率な脳波-テキスト変換 [cs.LG]目的:脳波からのテキスト変換手法
    • 脳活動の解読は,AI分野において重要な課題であり,支援技術や人間-コンピュータインタラクションへの応用が期待される。
    • 従来の脳波-コンピュータインタフェースは,計算コストが高い,アクセスが限られる,個人情報の漏洩リスクがあるなどの課題を抱えていた。
    • 本研究は,大規模言語モデルのファインチューニングを必要とせず,プライバシーを保護しながら脳波をテキストに変換することを目指す。
    • SENSEは,脳波信号をローカルでテキスト空間にマッピングし,抽象的なセマンティック情報を抽出することで,プライバシーを保護しながらテキストを生成する。
    • SENSEは,既存のファインチューニング済みベースラインと同等またはそれ以上の生成品質を,大幅に低い計算コストで実現した。
    • SENSEは,脳波のローカル処理とテキスト情報の共有により,次世代脳波-コンピュータインタフェースのためのスケーラブルでプライバシーに配慮したアーキテクチャを提供する。

    Link: https://arxiv.org/abs/2603.17109

  • 解釈可能な地盤モデリングのためのTabPFN拡張 [cs.CE, cs.LG]目的:地盤の土質分類と機械的パラメータの反復的補完
    • 地盤調査は,予測精度だけでなく,不確実性の定量化と解釈可能性が重要である。
    • ボーリングデータは疎で不均一であり,不確実性の評価が困難である。
    • TabPFNを用いて,データ不足な地盤調査における手法の評価事例を示す。
    • TabPFNの埋め込み表現は,粘土と砂の分類において整合性のあるグルーピングを示した。
    • 反復補完により,5つの対象パラメータすべてのRMSEが低減し,TabPFNは4つで最も低い値を示した。
    • SHAP属性は,Skemptonの圧縮指数相関や逆圧密化圧力-含水率依存性との整合性を示した。

    Link: https://arxiv.org/abs/2603.21033

  • XMLドキュメントに対するオントロジー駆動型パーソナライズ情報検索 [cs.IR, cs.LG]目的:XMLドキュメントの情報検索におけるパーソナライズ化
    • 情報検索の精度向上は,大量のデータから必要な情報に迅速にアクセスするために不可欠である。
    • 従来の検索システムは,ユーザーの知識や嗜好を考慮せず,画一的な検索結果しか提供できない。
    • ユーザーのニーズに合わせた,より関連性の高い検索結果を提供することを目的とする。
    • オントロジーとユーザープロファイルを組み合わせることで,検索の有効性が向上することが示された。
    • キーワードベースの手法と比較して,適合率と再現率が向上した。
    • 提案されたフレームワークは,XML検索結果の関連性と適応性を高め,ユーザー中心の検索を支援する。

    Link: https://arxiv.org/abs/2603.21139

  • 活性化ウォーターマーキングによる適応的な堅牢なLLM監視 [cs.CR, cs.AI, cs.CY, cs.LG]目的:大規模言語モデルの悪用検出
    • LLMの悪用は社会的な問題を引き起こす可能性があり,監視の重要性が増している。
    • 既存の監視システムは,攻撃者によって回避されるリスクがあり,対応が遅れる可能性がある。
    • 適応的な攻撃者への耐性を高めつつ,従来の検出率を維持することを目指す。
    • 活性化ウォーターマーキング(AWM)は,ポリシー違反時に隠れ状態を秘密鍵由来の方向に調整する。
    • AWMは,既存のベースラインと比較して回避率を大幅に低下させ,特に適応的な攻撃に対して有効である。
    • また,AWMはポリシー違反の特定能力も高く,監視対象のポリシーを80%の精度で識別できる。

    Link: https://arxiv.org/abs/2603.23171

  • LLMは自身の知識をどの程度理解しているか:信号検出理論を用いたメタ認知効率の測定 [cs.CL, cs.AI]目的:大規模言語モデルのメタ認知効率の評価
    • LLMの性能評価は重要であり,その信頼性を高めるためには,モデルの知識量と自信度の関係を理解する必要がある。
    • 従来のLLMの自信度評価指標は,知識量と自信度の識別が曖昧であり,正確な評価が困難である。
    • 信号検出理論を用いて,知識量と自信度を分離し,LLMのメタ認知能力を定量的に評価する。
    • 異なるLLM間では,メタ認知情報量に1.98倍の差が見られ,その量は精度とは相関しないことが判明した。
    • 自信度信号はモデルごとに異なる分散構造を有しており,従来のキャリブレーション指標では検知できない。
    • メタ認知情報量は,科学技術分野において最も低い傾向が見られ,温度パラメータは精度とメタ認知情報を分離することが示された。

    Link: https://arxiv.org/abs/2603.25112

  • GroupRAG:知識駆動の問題構造化による認知に着想を得たグループ認識検索と推論 [eess.SY, cs.SY, cs.IR, cs.AI, cs.CL]目的:問題構造を知識駆動でグルーピングし,グループ認識検索と推論を行うフレームワーク
    • 言語モデルの性能向上は重要であり,知識不足や推論能力の制約が課題である。
    • 既存手法は実環境で性能が低下することがあり,問題構造への意識が不足している。
    • 人間の問題解決に着想を得て,問題構造を明示的にモデル化することで性能向上を目指す。
    • GroupRAGは,MedQA(医療)およびBar Exam QA(法律)のQAタスクにおいて,既存のRAGベースラインとCoTベースラインを上回る性能を示した。
    • 問題内の潜在的な構造グループを特定し,複数の概念的出発点からの検索と推論を可能にすることで,検索と推論の間の微細な相互作用を促進する。
    • 問題構造を明示的にモデル化することは,堅牢な検索拡張推論のための有望な方向性である。

    Link: https://arxiv.org/abs/2603.26807

  • REAP:インタラクティブな本番利用からのコーディングエージェントベンチマークの自動キュレーション [cs.AR, cs.SE, cs.AI, cs.LG]目的:コーディングエージェントベンチマークの自動キュレーション
    • AIコーディングエージェントの普及に伴い,迅速かつ信頼性の高い評価方法が不可欠となっている。
    • 既存の評価手法は,速度と精度でトレードオフの関係にあり,本番環境の特性を反映しきれていない。
    • 本研究は,本番環境から派生したベンチマークを自動的にキュレーションすることで,この課題を解決する。
    • REAPは,開発者とエージェントのセッションからベンチマークを自動的に生成し,テストの信頼性を高める仕組みを備えている。
    • 生成されたベンチマーク「Harvest」を用いて評価した結果,最新のモデルの正答率は42.9%から58.2%の範囲であった。
    • この結果は,モデルの能力差を明らかにし,実際のデプロイメント判断に役立つ情報を提供する。

    Link: https://arxiv.org/abs/2604.01527

  • 高速レーン仮説:フォン・エコノモ神経細胞による速度と正確性のトレードオフ [cs.NE, cs.AI, q-bio.NC]目的:フォン・エコノモ神経細胞の計算モデル
    • 複雑な社会的認知を持つ種における神経メカニズム解明が重要である。
    • フォン・エコノモ神経細胞の機能は不明であり,計算モデルが存在しなかった。
    • フォン・エコノモ神経細胞の機能と,それが社会的認知に及ぼす影響を解明する。
    • フォン・エコノモ神経細胞は,速度と正確性のトレードオフを生物学的に実現する高速な投射経路を形成する。
    • シミュレーションにより,フォン・エコノモ神経細胞は,標準的なピラミッド神経細胞よりも4ms早く最初のスパイクを発することが示された。
    • 自閉症や前頭側頭型認知症の神経細胞構成を模倣したネットワークでは,反応時間が変化し,臨床所見との一致性が見られた。

    Link: https://arxiv.org/abs/2604.09229

  • ディープラーニングを用いたEMITのハイパースペクトル放射測定によるメタンポイント源のグローバルモニタリング [cs.CV, cs.LG, physics.ao-ph]目的:メタンポイント源のグローバルモニタリング手法の開発
    • メタンは短期的な気候変動に大きな影響を与え,安全上の問題やシステムの非効率性も引き起こすため,モニタリングが重要である。
    • 従来のメタン検出は手作業によるプルームの識別が中心で,グローバル規模での効率的なモニタリングが課題であった。
    • EMITのデータを用いて,高精度で迅速なメタンプルームの検出と位置特定を可能にすることを目指す。
    • MAPL-EMITモデルは,EMITの放射スペクトル全体を活用し,シーン内の全ピクセルにおけるメタン濃度の増大を同時に取得する。
    • 合成データによる評価で,既存の手法よりも高い再現率と精度でプルームを識別し,微弱なプルームも捉えることが確認された。
    • 実際のEMITデータを用いて,既知のプルーム複合体の84%を捉え,また人間による分析よりも多くのプルームを検出した。これにより,従来検出されていなかった発生源の特定も可能となった。

    Link: https://arxiv.org/abs/2604.10094

  • LLMベースの社会粒子群における記憶が集合的・協調的行動に与える影響 [cs.AI, cs.CL, cs.GT, cs.MA]目的:LLMエージェントの多エージェントシステムにおける集合的・協調的ダイナミクスの記憶による影響
    • LLMの社会行動モデル化は,人間社会の複雑さを理解するための新たなアプローチとして注目されている。
    • LLMエージェントの記憶メカニズムは,その行動特性に重要な影響を与えるものの,未解明な点が多い。
    • 本研究は,LLMエージェントの記憶長が協調行動に及ぼす影響を明らかにすることを目的とする。
    • 記憶長のわずかな変化でさえ,協調行動を著しく抑制することが示された。
    • Big Five性格特性は,人間実験の結果と一部一致するエージェントの行動と相関関係が見られた。
    • LLMが記憶を解釈する方法が,生成エージェントベースモデリングにおける創発的な社会行動の重要な要因であることが示唆された。

    Link: https://arxiv.org/abs/2604.12250

  • 表情認識を考慮したLLMによる共感的個別指導 [cs.HC, cs.AI]目的:LLMを用いた個別指導における共感性の向上
    • 学習者の感情や認知状態を理解した指導は,効果的な学習を促す上で重要である。
    • LLMはテキスト情報のみで学習者の状態を把握することが難しく,指導の質が制限される場合がある。
    • 表情情報を活用することで,LLMが学習者の状態をより正確に把握し,共感的な応答を生成することを目指す。
    • 表情認識に基づくプロンプトの調整により,LLMの共感的な応答が全体的に改善された。
    • Action Unit推定モデルを用いた方法が,ランダムなフレームを用いる方法よりも優れた結果を示した。
    • この改善は,教育的な明確さやテキスト情報への応答性に悪影響を及ぼすことなく実現された。

    Link: https://arxiv.org/abs/2604.15336

  • BioHiCL:MeSHラベルを用いた生物医学情報検索のための階層的マルチラベル対照学習 [cs.IR, cs.AI]目的:生物医学情報検索における性能向上
    • 生物医学分野では,膨大な情報から必要な知識を効率的に抽出することが重要である。
    • 既存の検索手法は,テキスト間の意味的重複を捉える能力に限界がある。
    • MeSH注釈を活用し,より構造化された教師信号を提供することで,検索精度を高める。
    • BioHiCLは,生物医学情報検索,文の類似度評価,質問応答タスクにおいて有望な性能を示した。
    • 特に,BioHiCL-Base(0.1B)とBioHiCL-Large(0.3B)は,計算効率を維持しつつ高い性能を実現した。
    • 階層的なMeSHアノテーションによるマルチラベル対照学習が,モデルの性能向上に貢献した。

    Link: https://arxiv.org/abs/2604.15591

  • MathNet:数学的推論と検索のためのグローバルマルチモーダルベンチマーク [cs.IR, cs.CL, cs.AI, cs.DL, cs.IR, cs.LG]目的:数学的推論と検索の評価
    • 大規模言語モデルの能力評価において,数学的推論は重要な課題である。
    • 既存のベンチマークは規模,言語対応,タスクの多様性において限界があった。
    • 多様な数学問題を用いた,大規模かつ多言語対応のベンチマークを提供する。
    • MathNetは,47カ国,17言語,20年間の数学オリンピック問題を収録した大規模データセットである。
    • 最先端の推論モデル(Gemini-3.1-Pro, GPT-5)においても,依然として課題が残されていることが示された。
    • 検索性能と生成性能の相関が明らかになり,検索の質が生成性能に大きく影響することが示された。

    Link: https://arxiv.org/abs/2604.18584

  • ABPMSプロセスフレームのハイブリッド性と自動プロセス発見への示唆 [cs.HC, cs.AI]目的:ABPMSプロセスフレームの概念化と,それを用いた自動プロセス発見手法の検討
    • AIを活用したビジネスプロセス管理システムの普及に伴い,プロセスフレームの重要性が高まっている。
    • 従来のプロセスモデルでは,プロセスの柔軟性や自律性を十分に捉えきれないという課題がある。
    • 手続き的・宣言的プロセスモデルを組み合わせたハイブリッドなプロセスフレームの自動発見を目指す。
    • ABPMSプロセスフレームを,手続き的および宣言的プロセスモデルが半並行的に実行されるハイブリッド表現として捉えた。
    • 手続き的モデルにおける直接的な従属関係の観察に頼る既存のアプローチの課題を指摘し,Declare制約に基づく代替手法を提案した。
    • 宣言的モデルと手続き的モデルの間の行動的な重なりを明らかにし,プロセスフレーム発見技術の基盤を築いた。

    Link: https://arxiv.org/abs/2604.22455

  • アライメント標的の問題:人間,AIシステム,そして設計者による道徳的判断の相違 [cs.DB, cs.IR, cs.CY, cs.AI, cs.HC]目的:人間,AIシステム,設計者による道徳的判断の相違
    • AIの倫理的行動を定める上で,どの価値観を基準とするかが重要課題となっている。
    • AIの道徳的判断の基準として,人間の行動をそのまま用いることの妥当性が問題視されている。
    • AI開発における規範的目標設定の困難さを明らかにし,解決策の模索を目指す。
    • 人間とロボットに対する道徳的判断に有意な差は見られなかった。
    • ロボットの行動が人間の設計に基づくと認識されると,道徳的判断は変化し,より規則に基づいた思考が顕著になった。
    • AI,設計者,行動主体に対する評価が異なり,AIアライメントの標的設定が困難になる「アライメント標的の問題」が示唆された。

    Link: https://arxiv.org/abs/2604.24155

  • 圧縮動画集約器:効率的なマイクロ動画推薦のためのコンテンツ駆動モジュール [cs.CL, cs.LG, cs.AI]目的:マイクロ動画推薦のための軽量モジュール
    • 動画共有プラットフォームの普及により,動画推薦の重要性が増している。
    • 従来の推薦モデルは計算コストが高く,リソースの制約がある環境では困難である。
    • 動画情報を推薦モデルから分離し,計算効率を向上させる。
    • 提案手法CVAは,学習時間を大幅に削減し,GPUメモリ使用量を削減する。
    • CLIPを用いたキーフレームの再選択により,既存手法の性能を向上させる。
    • タイトルに誤りがある場合の影響についても議論している。

    Link: https://arxiv.org/abs/2605.08810

  • 構造化された信念状態とLLMメモリ検索の最初の精度重視ベンチマーク [cs.IR, cs.AI]目的:LLMメモリ検索における精度評価
    • LLMの性能向上には,外部知識の活用が不可欠であり,メモリ検索の精度が重要となる。
    • 既存のベンチマークは回答の質に偏重しており,検索の精度を正確に評価できていない。
    • 検索精度を評価し,より精度の高いメモリ検索システムの開発を目指す。
    • 現在のLLMメモリベンチマークの評価ギャップが,複数の埋め込みモデルで確認された。
    • PrecisionMemBenchは,精度,ノイズ分離,セッション遅延,信念可変性を測定する89ケースのベンチマークである。
    • Tenureは,検索前にスコープと検索を解決し,タイプ付きの信念状態を注入することで,全てのテストケースで完璧な検索に成功した。

    Link: https://arxiv.org/abs/2605.11325

  • パラメトリック形状設計における次元削減のためのパラメトリックモデル埋め込みの非線形拡張 [cs.CE, cs.LG, cs.NA, math.NA]目的:シミュレーションベースの形状設計における次元削減
    • 形状設計において,最適化や代理モデル構築には効率的な次元削減が不可欠である。
    • 従来のパラメトリックモデル埋め込みは線形であるため,非線形な形状変動を伴う場合に効率が低下する。
    • 非線形な形状変動を効率的に処理できる次元削減手法を開発し,設計空間の探索を可能にする。
    • 提案手法NLPMEは,線形PMEと比較して少ない潜在変数で同程度の再構成精度を達成した。
    • NLPMEは,深層オートエンコーダと同等の非線形圧縮率を維持しつつ,元の設計変数への明示的な逆写像を保持する。
    • 本研究により,NLPMEがパラメトリック形状設計空間におけるコンパクトかつ実用的な非線形次元削減手法であることが示された。

    Link: https://arxiv.org/abs/2605.11759

  • 実行即応:LLMエージェントのためのテスト時適応的スキル合成 [cs.CL, cs.AI]目的:LLMエージェントにおけるテスト時のスキル合成
    • 大規模言語モデル(LLM)エージェントの性能向上は,現実世界での応用において重要である。
    • テスト時の計算資源を増やしても,必ずしもエージェントの能力向上に繋がらないという課題がある。
    • テスト時計算資源とエージェント能力の変換効率を向上させることを目指す。
    • SkillTTAは,タスク関連の学習軌跡を検索し,観測されたコンテキストに基づいて一時的なスキルを合成する。
    • メタプロンプト最適化(MPO)を用いることで,スキル生成ポリシーを適応させ,より高い性能上限を目指す。
    • ALFWorld等複数のベンチマークにおいて,既存手法を上回り,低い計算コストで高い性能を達成した。

    Link: https://arxiv.org/abs/2605.16986

  • 能力のパラドックス:より賢い監査人がマルチエージェントシステムをより安全でないものにする方法 [cs.AI]目的:マルチエージェントシステムにおけるセキュリティ脆弱性の特定と軽減
    • 大規模言語モデルの進化に伴い,複雑なタスクを複数のエージェントに分散するシステムが注目されている。
    • マルチエージェントシステムの分散型意思決定プロセスは,新たな攻撃対象領域を生み出している。
    • エージェントの能力向上とセキュリティ低下の相関関係を解明し,効果的な防御策を提案すること。
    • ワーカーエージェントの能力が向上すると,システム全体の攻撃成功率が上昇する「能力のパラドックス」が明らかになった。
    • このパラドックスは,能力の高いワーカーが敵対的な記述を正当なものと判断し,自信を持って結論を伝えることで,マネージャーを誤誘導することが原因である。
    • 非対称なドメイン知識を持つワーカーを組み合わせることで,この問題を軽減し,攻撃成功率を大幅に低下させることができた。

    Link: https://arxiv.org/abs/2605.17480

  • ライブラリドリフト:自己進化型LLMスキルライブラリにおける隠れた故障モードの診断と修正 [cs.AI, cs.CL, cs.SE]目的:自己進化型スキルライブラリにおける性能劣化のメカニズムの特定と,その対策
    • LLMの進化に伴い,スキルライブラリの自動的な構築・拡張が重要になっている。
    • スキルライブラリの無秩序な拡大は,検索精度の低下や誤ったスキルの注入を引き起こす。
    • スキルライブラリの適切な管理メカニズムを確立し,性能劣化を抑制すること。
    • 実験により,スキル注入の停止や早期のスキルの廃棄が,ライブラリドリフトを引き起こすことが示された。
    • スキルごとの貢献度を追跡するログを用いることで,故障を早期に検出し,可視化することが可能となった。
    • 結果ベースでの退職,活性上限,メタスキル作成を組み合わせたガバナンスレシピが,MBPP+ hard-100におけるpass@1を大幅に向上させた。

    Link: https://arxiv.org/abs/2605.19576

  • 代数としての厳密な対称性:物理的選択規則を強制する機械検証済みのテンソル計算 [cs.LG, cs.AI, math.RA]目的:テンソル代数の乗算規則として対称性を厳密に構築する方法
    • 物理学において対称性は根幹であり,機械学習による近似では誤差が蓄積する。
    • 機械学習では対称性を完全に捉えきれず,誤差が層の深さに比例して増大する。
    • テンソル代数を構築することで,対称性を厳密に実現し,誤差をなくすことを目指す。
    • $\starG$代数を定義することで,任意の有限群$G$に対するテンソルを既約表現ブロックにブロック対角化する。
    • 無機結晶の弾性テンソルにおいて,点群選択規則を厳密に適用し,予測の機械的安定性を向上させる。
    • 分子データにおいても,量子力学的な入力なしに八面体選択規則のシグネチャを明らかにし,予測精度を向上させる。

    Link: https://arxiv.org/abs/2605.20440

  • ラチェット:自己進化型LLMエージェントのための最小限の衛生レシピ [cs.AI, cs.CL]目的:LLMエージェントの自己進化的なスキルライブラリのライフサイクル管理
    • LLMエージェントの性能向上には,知識の蓄積と再利用が不可欠である。
    • 既存のスキルライブラリでは,LLMが作成したスキルの性能が伸び悩んでいる。
    • スキル作成だけでなく,スキルの管理メカニズムの改善が求められている。
    • ラチェットは,LLM自身がスキルを記述,取得,キュレーション,退職させる単一エージェントループである。
    • MBPP+ hard-100において,ラチェットはpass@1を0.258から0.584へと大幅に向上させた。
    • 退職メカニズムとメタスキルガイダンスが,性能向上の鍵であることが示された。

    Link: https://arxiv.org/abs/2605.22148

  • 次元削減における曖昧なインスタンスへの対処:分割によるアプローチ [cs.LG]目的:高次元データの可視化における次元削減の課題解決
    • 高次元データの可視化は,データの理解と分析に不可欠である。
    • 次元削減は情報損失を伴い,可視化に歪みが生じる可能性がある。
    • 曖昧なインスタンスの歪みを軽減し,近傍構造の正確な表現を目指す。
    • 曖昧なインスタンスを特定し,投影空間で複数コピーを作成することで,近傍構造の可視化を改善する。
    • 提案手法はUMAPを含む他の局所グラフベースの次元削減手法にも適用可能である。
    • 定量的な分析により,隠れた近傍関係の明らかにするとともに,部分的な近傍埋め込みを減少させることを示す。

    Link: https://arxiv.org/abs/2605.23540

  • 検証可能なTransformer:ソルバーチェック可能な回路の説明 [cs.LG, cs.LO]目的:タスク固有の回路を,有界でソルバーで検証可能な主張へと変換するフレームワーク
    • Transformerモデルの内部動作の解明は,AIの安全性と信頼性を高める上で重要である。
    • 既存の手法では,回路の機能の検証が難しく,解釈可能性に限界がある。
    • Transformerの回路の機能的等価性,タスク関連の不変性,エッジの必要性,ロバスト性を検証する。
    • 小規模モデルにおいて,引用符閉じる回路や括弧型回路など,4つの特性を直接検証することに成功した。
    • GPT-2規模のモデルでは,LayerNormの除去と注意ヘッドの合成プログラムへの置き換えを行い,特定の回路が4つの特性をすべて満たすことを検証した。
    • 検証可能な対象は,変更されていないモデルではなく,調整されたアーティファクトであり,主張は宣言されたドメインに限定される。

    Link: https://arxiv.org/abs/2605.24033

  • 稀なルール違反時における: 論理的異常検知のためのキメラ学習 [cs.CL, cs.LG]目的:論理的制約に基づく異常検知手法
    • 実用的な異常は単純な稀有入力ではなく,意味的な制約違反であることが多い。
    • 学習データ中に実際のルール違反が稀である,または存在しないという課題がある。
    • 学習データ不足とショートカット問題を解決し,ルール違反を検出すること。
    • 提案手法は,CLEVRER,OpenImages,VidORにおいて,ルールレベルの異常AUROCを向上させた。
    • 特に,構成的および関係的なルールにおいて,既存手法よりも優位性を示した。
    • 異常スコアとルールレベルの帰属性を提供することが可能である。

    Link: https://arxiv.org/abs/2605.26171

  • 1984年から2025年までのブラジルにおける小規模貯水池の分布マッピング [cs.RO, cs.LG]目的:ブラジルにおける小規模貯水池の分布変化の評価
    • 農業用水や小水力発電など,ブラジルでは小規模な河川のダム建設が広く行われている。
    • 既存のデータセットでは,小さな水域の検出や人工貯水池と自然湖の区別が難しく,小規模貯水池が軽視されてきた。
    • Landsatデータと深層学習モデルを用いて,ブラジル全土の小規模貯水池を高精度にマッピングし,その変化を明らかにすること。
    • 1984年から2025年までの間に,ブラジルにおける貯水池の数は約4倍に増加し,総面積も大幅に拡大した。
    • 本研究で作成された年次マップは,ブラジルにおける小規模な河川堰の影響範囲と累積的な影響を把握する上で役立つ。
    • この研究は,40年以上にわたる小規模貯水池の変遷を捉えた初の全国規模の年次データセットである。

    Link: https://arxiv.org/abs/2606.00675

  • 潜在的対称性を用いた標的局在化,識別,およびセンシング [cs.LG]目的:潜在的対称性を持つ散乱体アレイのセンサとしての利用
    • 電磁波や音波など,波のセンシング技術は,様々な分野で重要な役割を担っている。
    • 従来のセンシング手法では,高精度な位置特定や識別が困難な場合がある。
    • 潜在的対称性の破壊を利用することで,より高精度なセンシングを実現することを目指す。
    • 潜在的対称性を持つ散乱体アレイに侵入者が現れると,その対称性が崩れる。
    • この対称性の崩れ具合を分析することで,侵入者の半径と位置を特定できる。
    • ベイズ推論や多層パーセプトロンを用いることで,測定ノイズ下でも高い精度が達成された。

    Link: https://arxiv.org/abs/2606.01421

  • 幽霊の夫婦:相関するLLMの名前事前確率とそのWebおよび学術出版への影響 [cs.DL, cs.LG]目的:大規模言語モデルにおける虚構の専門家生成における名前の相関性の存在
    • AI生成コンテンツの急速な増加に伴い,その信頼性確保が重要課題となっている。
    • LLMは,高確率の名前をランダムに生成するのではなく,特定の組み合わせを優先する傾向がある。
    • LLMが生成する名前の相関性とその学術出版への影響を明らかにすること。
    • LLMは,単独の名前だけでなく,特定の組み合わせを持つ人物像を生成することが判明した。
    • モデルの種類やバージョンによって,生成される名前の組み合わせが異なり,モデルリリース時に抑制されている。
    • Zenodoにおいて,存在しない雑誌を主張する1655件のゴーストオーターの記録が特定され,意図的なバックデートが確認された。

    Link: https://arxiv.org/abs/2606.02184

  • VistaHop:長期的視覚的深層探索のベンチマーク [cs.CV, cs.AI, cs.CL]目的:視覚的深層探索タスクの評価
    • 画像理解と推論の能力は,多様な応用において重要であり,その進歩が求められている。
    • 既存のベンチマークは,探索範囲や反復的な視覚情報の活用が限定的であり,現実的な課題に対応できていない。
    • 長期間にわたる視覚情報の探索と推論能力を評価し,より高度なモデル開発を促進すること。
    • VistaHopは,反復的な画像検査,視覚的アンカーのグラウンディング,および長期的証拠トラバーサルを評価するベンチマークである。
    • 最先端のMLLMであっても,VistaHopを完全に解決するには至っておらず,SenseNova-MARS-32BでPass@1が26.33%に留まっている。
    • この結果は,視覚的深層探索のための専用ベンチマークと,より改善されたエージェント手法の重要性を示唆している。

    Link: https://arxiv.org/abs/2606.03273

  • 多チャンネル信号Transformerのための入力エンコーダの経験的監査 [cs.LG, cs.AI]目的:多チャンネルスカラー信号を扱うTransformerにおける入力エンコーダの性能評価
    • Transformerは時系列データ処理で高い性能を発揮するが,多チャンネル信号への適用には工夫が必要である。
    • 多チャンネル信号を効率的にTransformerに入力する方法は,性能に大きく影響するが,最適な手法は明確ではない。
    • 様々な入力エンコーダを比較し,最適なエンコーダの選択指針を示すことを目指す。
    • 標準的なチャンネルごとの線形射影は,他の多くのエンコーダと同等の性能を示し,実用上大きな差は見られなかった。
    • 線形射影が自発的に直交化することで,チャンネル情報を効率的に捉えていることが示唆された。
    • チャンネル数が多い場合や位置情報の活用において,より高度なエンコーダが有効となる可能性が示された。

    Link: https://arxiv.org/abs/2606.04752

  • TLA-Prover:嗜好度最適化による低ランク適応を用いた検証可能なTLA+仕様合成 [cs.SE, cs.AI, cs.LG, cs.LO]目的:TLA+仕様の合成
    • 分散システムや安全性が重要なプロトコルの検証にTLA+が不可欠であり,信頼性の高い仕様の自動生成が求められている。
    • 大規模言語モデル(LLM)で生成されたTLA+仕様は,意味的な理由でTLCモデルチェッカーに失敗することが多く,自動生成の精度が課題となっている。
    • LLMによるTLA+仕様の自動生成において,TLCモデルチェッカーをパスする精度向上を目指す。
    • TLA-Proverは,200億パラメータのモデルであり,検証済みの例を用いた教師ありファインチューニングと,修正に基づいたグループ相対的方策最適化(GRPO)を組み合わせることで訓練されている。
    • 本研究で開発したTLA-Proverは,既存のベースライン(8.6%)の約3.5倍にあたる,GoldおよびDiamondレベルで30%の合格率を達成した。
    • TLCが直接報酬信号を提供し,学習された報酬モデルを使用しない点も特徴である。Diamondレベルでは,常に真である性質の出力は失敗と判定される。

    Link: https://arxiv.org/abs/2606.06133

  • RedKnot:ヘッドを意識したKV再利用とSegPagedAttentionによる効率的な長文コンテキストLLMサービング [cs.AI]目的:LLMサービングにおけるKVキャッシュ管理システムの開発
    • LLMの入力長増加に伴い,KVキャッシュがAIインフラのボトルネックとなっている。
    • 既存システムはKVキャッシュを均質なメモリブロックとして扱い,柔軟性に欠ける。
    • ヘッドごとの重要度に応じたKVキャッシュ管理により,効率化を目指す。
    • RedKnotは,KVヘッドごとにキャッシュを分解することで,柔軟な管理を実現した。
    • これにより,位置非依存なKV再利用,プレフィックス圧縮,ホット/コールド分離,分散配置をサポートする。
    • モデルの再学習やファインチューニングなしで,リソース効率と出力品質を向上させた。

    Link: https://arxiv.org/abs/2606.06256