arXiv雑要約
AI - 2026/08/04 公開
LLMを活用したエージェントベースネットワーク動的モデルによる社会力学のモデル化 [cs.AI]目的:社会力学のモデル化
- 社会現象の理解は,社会の安定や発展に不可欠である。
- 既存モデルでは,個人の行動と社会全体の流れの相互作用を十分に捉えきれない。
- ネットワーク構造とナラティブの交流が相互に作用する社会力学の創発過程を解明する。
- 生成された社会シミュレーションでも社会力学が再現されることが示された。
- 協調と影響力は,個々のエージェントではなく,ネットワーク構造とナラティブの交流の反復的な相互作用から創発する。
- LLMを活用したLANDモデルは,社会力学を分析するための有効なフレームワークとなりうる。
xMICD:複数のICDコードの説明可能な表現 [cs.CL, cs.LG]目的:複数のICDコードから患者の低次元表現を構築すること
- 電子カルテは臨床リスク予測に不可欠であり,ICDコードは疾患情報を構造化する上で重要である。
- 既存手法は,予測性能と解釈可能性の間でトレードオフの関係にある。
- 臨床的に解釈可能な特徴量を維持しつつ,埋め込み表現と同等の予測性能を目指す。
- xMICDは,ICDコードの臨床的に意味のあるグルーピングと,事前学習されたICD埋め込み空間での類似性を組み合わせる。
- 二値のグループメンバーシップではなく,類似度に基づく相対的な割り当てを用いることで,患者の診断と臨床グループとの整合性を反映した特徴量を生成する。
- 大規模な電子カルテデータセットでの実験により,xMICDはICD2Vecなどの埋め込みベースの手法と同等の予測性能を達成し,かつ臨床的に解釈可能であることが示された。
オープンデジタルツインエコシステムにおける検証可能なAIエージェントのためのニューロシンボリック参加ガバナンス [cs.CY, cs.CR, cs.AI, cs.MA]目的:検証可能なAIエージェントのためのニューロシンボリック分散ガバナンスフレームワーク
- デジタルツインは,現実世界の複雑なシステムを理解・管理するための重要な技術として注目されている。
- 分散環境におけるAIエージェントのアイデンティティ,能力,ポリシー遵守の検証が課題となっている。
- 信頼性の高い人間とAIの協調を実現し,意味のある人間による監督を可能にすること。
- 本研究では,AIエージェントを多層セマンティックプロファイルで表現し,確率的ニューラル推論と決定論的機関ガバナンスを統合するフレームワークを提案した。
- 組織機関が発行する資格情報は,ブロックチェーンベースのスマートコントラクトによって検証され,機密データを保護しつつ,監査可能な参加を実現する。
- 臨床,デジタルツイン,ウェアラブルプロバイダーエージェントによるプロトタイプ実験により,不正な相互作用の防止と機関ポリシーの実施が確認された。
PPGベースの睡眠段階判定の再考:データセット,指標,およびベンチマーク [cs.IR, cs.HC, cs.LG]目的:PPGに基づく睡眠段階判定の精度向上
- 睡眠段階の自動判定は,睡眠障害の診断や治療において重要な役割を果たす。
- PPGによる睡眠段階判定は,従来の脳波(EEG)に基づく方法に比べて精度が低いという課題がある。
- PPG信号の特性を考慮し,より高精度な睡眠段階判定手法を開発することを目指す。
- 隠れマルコフモデルを用いたラベル拡張パイプラインにより,睡眠段階の境界付近の特徴をより詳細に捉えることが可能になった。
- 拡張された秒レベルのラベルを用いて学習することで,従来手法の睡眠段階判定精度が3.7~5.7ポイント向上した。
- 別のデータセットにおいても,学習効果が維持されることが確認された。
GraRe:フローズン6DoFグリッパー検出器のための候補再ランキング [cs.RO, cs.RO, cs.AI, cs.CV, cs.LG]目的:グリッパー候補の再ランキング
- ロボットハンドによる物把持は,自動化において重要な役割を担う。
- 既存のグリッパー検出器の信頼度と把持品質が一致せず,良好な候補が低い順位になりがち。
- 検出器を変更せずに,候補の順位を改善することで把持成功率の向上を目指す。
- GraReは,候補属性,シェル層状の局所形状,オブジェクトのコンテキストから把持品質を推定する。
- 提案手法により,GraspNet-1Billionにおいて平均APが最大13.60ポイント向上した。
- 実ロボット実験でも,雑然とした環境下での安定した把持が実証された。
データ駆動型ピンボール損失選択による垂直分布弾性ネットSVM [cs.LG, stat.CO]目的:垂直分布弾性ネットSVMにおけるデータ駆動型ピンボール損失選択
- 機械学習における回帰・分類問題では,ロバストなモデル構築が重要である。特に,外れ値の影響を軽減することが求められる。
- 従来のピンボール損失SVMでは,非対称パラメータが事前に固定されるため,データ特性に応じた最適な損失関数を選択できないという課題がある。
- 本研究は,データに基づいてピンボール損失の重みを学習することで,データ特性に適応したロバストなSVMの構築を目指す。
- 提案手法は,候補となるピンボール損失に重みを付与し,単一の分類器で複数の損失関数を統合する。
- 理論解析により,重み正則化とシンプレックス制限が消失する場合,提案手法の性能が最適な固定損失関数に匹敵することが示された。
- 大規模データに対する効率的な求解アルゴリズムを開発し,列分割変数分割法が,並列処理によるスケーラビリティを可能にすることを確認した。
アスファルト混合物の割裂強度予測のための解釈可能な機械学習:SHAP分析からの洞察 [cs.LG]目的:アスファルト混合物の割裂強度予測とデータ駆動型配合設計支援
- 道路舗装の耐久性向上は重要であり,混合物の配合設計がその鍵となる。
- 配合設計は経験則に頼る部分が多く,合理的な予測手法が求められている。
- 機械学習を用いて割裂強度を高精度に予測し,配合設計を最適化する。
- TabPFNモデルが最も優れた予測性能を示し,テストデータセットで最も低いRMSE (0.28) を達成した。
- SHAP分析の結果,9つの主要な変数が寄与度の92.0%を占め,Ag9.5,FT,Ag4.75,AC,Duが特に重要であることが示された。
- 割裂強度向上に有利なパラメータ範囲が特定され,配合設計への応用が期待される (例:Ag9.5 < 66.8%)。
AI人格化の認識論的政治 [cs.CY, cs.AI, cs.HC]目的:AI人格化に対する認識論的政治の分析
- AI技術の発展に伴い,人間とAIの関係性が重要視されている。
- AI人格化をユーザーの誤認と捉える既存のフレームワークは,多様な解釈を排除している。
- 既存のフレームワークの問題点を指摘し,より公平な解釈のための方法論的基盤を提示する。
- AI人格化は,ユーザーの誤認としてではなく,権力構造と認識論的な問題として捉えられるべきである。
- 既存のフレームワークは,特に神経多様者や危機的状況にある人々に対して不均衡な負担を強いている。
- 公平なフレームワークを構築するためには,方法論的な検討と,研究コミュニティによる検証が不可欠である。
PMMC:長期LVLMエージェントのための将来予測型マルチモーダルメモリーコンパイル [cs.AI]目的:長期的な文脈を維持し,拡張されたマルチモーダルな相互作用における情報を統合する能力
- LVLMエージェントの性能向上には,長期的な記憶が不可欠である。複雑なタスク遂行に必要。
- 既存のシステムは,クエリ時に非効率であり,画像とテキストの関連付けが弱い。
- クエリ時の推論処理の一部をメモリーの整理時に移行することで,効率と精度を向上させる。
- 提案手法PMMCは,回答の質と視覚的証拠の想起率を向上させ,クエリ時のトークン数と遅延を削減した。
- 将来の質問候補を予測し,質問に基づいたマルチモーダルメモリープログラムをコンパイルする仕組みが有効であることが示された。
- 自己フィードバック,動的計画,生画像へのアクセス,質問バンクの網羅性が性能に与える影響を分析した。
検証済み暗号ライブラリのためのAIアプローチ [cs.CY, cs.CR, cs.AI]目的:暗号ライブラリの検証
- 暗号コードは重要な基盤であり,その正確性が不可欠である。
- 既存の形式検証手法では,実用的なライブラリ全体の検証が困難である。
- API契約から内部仕様と検証を自動合成し,実用的なライブラリの検証を実現する。
- 本研究では,AIを活用したCryptoProverを開発し,curve25519-dalekとchacha20の検証に成功した。
- API契約と信頼できるライブラリを用いることで,11.4時間,USD 466.99のコストで検証を完了した。
- CryptoProverは,仕様の弱体化や不正な公理の導入を防ぐ信頼性を重視した設計である。
TrajWiki:長期対話エージェントのための情報源に基づいた記憶軌跡 [cs.AI]目的:長期対話における記憶の追跡可能性,更新可能性,透明性を向上させるための記憶フレームワーク
- 対話エージェントの性能向上には,文脈を考慮した応答生成能力が不可欠である。
- 既存の記憶拡張エージェントは,情報の来歴や変化を追跡するのが困難である。
- 情報の起源,進化,矛盾,陳腐化を明確にする記憶システムの構築を目指す。
- TrajWikiは,記憶を不変のエピソードスナップショットと操作(追加,修正,非推奨)を通じて進化する軌跡として表現する。
- Memory Wikiは,対話履歴を構造化されたウィキページに集約し,検索コストを削減する。
- LoCoMoとMedMTの実験により,TrajWikiが長期対話性能を向上させ,記憶の進化や検索失敗を可視化できることが示された。
PROGRESS:カバレッジ誘導型強化学習による検索拡張LLMエージェントの訓練 [cs.AI]目的:検索拡張LLMエージェントの推論能力向上
- LLMエージェントの複雑なタスク遂行能力向上には,検索機能の最適化が不可欠である。
- 既存手法では,検索行動に対する適切な指導が不足しており,複雑なクエリの適切な分解が困難である。
- クエリ分解の明示的な誘導を通じて,検索戦略を改善し,タスク全体のパフォーマンス向上を目指す。
- PROGRESSは,教師モデルによるカバレッジ報酬を用いて,ポリシーモデルのクエリ分解を明示的に誘導する。
- 実験の結果,カバレッジ誘導型強化学習がタスクパフォーマンスを向上させることが示された。
- エージェント型LLMにおける検索戦略の明示的な監督の重要性が明らかになった。
Search-GRT:複雑な質問応答のための検索エージェントの誘導検索訓練 [cs.RO, cs.CL, cs.AI]目的:複雑な質問応答における検索エージェントの最適化
- 大規模言語モデルの性能は検索能力に大きく依存する。質問応答の質を向上させる上で重要。
- 複雑な質問応答タスクでは,検索の質の低下が連鎖的な誤りを引き起こしやすい。
- 強化学習における報酬の希薄性を軽減し,検索エージェントの学習効率と精度を向上させる。
- 提案手法GRTは,既存手法Search-R1と比較して,幅広い質問応答タスクで安定した性能向上を示した。
- 特に,複数段階の推論が必要な複雑な質問応答タスクにおいて,40%以上の性能改善を達成した。
- GRTは,少ない訓練ステップ数でより高い質問応答性能を実現し,訓練効率も向上させた。
フローマッチングのための片側分位共役 [cs.DC, cs.LG, cs.AI, cs.CV]目的:フローマッチングにおける効率的な共役構造の構築
- 生成モデルの学習において,データ分布の学習は重要な課題である。高品質なサンプル生成には,適切な確率経路の設計が必要となる。
- 従来のフローマッチングでは,共役構造の計算コストが課題であった。特に,バッチサイズが大きい場合に計算量が急増する。
- 本研究は,計算コストを抑えつつ,より高品質なサンプル生成を実現する共役構造を提案する。
- 提案手法であるQC-FMは,データバッチのみから共役を構築し,ペアワイズコスト行列や割り当て問題を回避する。
- 選択されたスライスにおいて回帰分散を排除し,理想的なフローを直線的にすることで,サンプル品質を向上させる。
- CIFAR-10,CelebA,FFHQ,ImageNet-64等のデータセットにおいて,従来のBaselineやOT-CFMよりも優れた性能を示す。
粗い周辺チェックを通過させることは安価である:LLMペルソナパネルにおけるペルソナ混合と不正確な介入効果推定 [cs.AI, cs.CL, cs.GT]目的:LLMペルソナパネルにおける介入効果の推定精度と,その検証における周辺チェックの重要性
- LLMを実験参加者として利用する研究が増加しており,その妥当性評価が重要になっている。
- LLMの応答と人間のデータの類似性を評価する際の,適切な検証基準が確立されていない。
- LLMペルソナパネルを用いた研究において,粗い周辺チェックを通過させることで,厳密な効果推定をせずに検証が可能になることを示す。
- 固定されたペルソナ条件付きGPT-4.1構成のパネルは,戦略的ゲームにおいて,事前に登録された基準を満たした。
- プロンプトのばらつきは大きく,不確実性の仮定によってその割合が変動したが,全体として許容範囲内であった。
- 介入は,継続プロセスとそのテキスト表現の両方を変化させ,表現の制御可能性を示唆した。
発見主張の監査:エージェント科学のための二面基準,負の側面は決定可能 [cs.AI]目的:自己改善型AI科学システムの能力主張の妥当性評価
- 科学的発見の自動化は,研究の加速と新たな知見の創出に不可欠である。
- AIによる発見主張の検証は,単なる性能向上だけでなく,再現性と信頼性が課題となっている。
- AIの主張が真の進歩であるか,検索の偏りや検証者の変更による見かけ上のものかを区別する。
- 提案された二面監査の負の側面は,ある種の構造が表現不可能であることを形式的に証明する。
- AIが生成した設計は,既存ソルバーと比較して,特定のRNA構造予測タスクで有意に高い性能を示した。
- AIが生成した手続きは,人間が作成した手続きよりも優れた性能を発揮し,計算コストも低減された。
小規模データセットにおける教師なし多ドメイン固有表現認識アプローチ [cs.CL, cs.NE]目的:小規模データセットにおける固有表現認識の性能向上
- 自然言語処理において,テキスト中の固有表現を特定・分類することは重要である。
- 従来の固有表現認識システムは大規模なラベル付きデータに依存しており,多くのドメインで利用が困難である。
- ラベルなしデータを用いた事前学習と転移学習により,データ不足な環境下での固有表現認識の精度向上を目指す。
- 教師なし事前学習と転移学習を組み合わせることで,ラベル付きデータが少ない状況でも固有表現認識が可能となった。
- データ拡張,Few-shot学習,ドメイン敵対的学習などの手法が,多様なドメインにおける汎化性能の向上に貢献する。
- 本研究は,リソースの限られたドメインでも効率的かつ適応可能な自然言語処理アプリケーション実現への道を開く。
遺伝子再構成を超えて:相補的なトランスクリプトームビューを用いた細胞表現の学習 [cs.LG, cs.AI, q-bio.GN]目的:相補的なトランスクリプトームビューを通じた細胞表現学習
- 単一細胞トランスクリプトームデータは急速に増加しており,生命科学研究の基盤技術となっている。
- 既存の事前学習法は遺伝子依存性を学習するが,下流タスクに不可欠な細胞全体としての表現の最適化が不十分である。
- 本研究は,相補的なトランスクリプトームビューを用いたコントラスト学習により,この課題を解決することを目的とする。
- 共同発現構造に基づいた遺伝子分割,表現を考慮したコントラストセット構築,能力に基づいたコントラスト開始という3つの適応を導入した。
- 細胞タイプアノテーションと遺伝子制御ネットワーク推論において,比較対象となる手法と同等以上の性能を示した。
- 6つのネットワークを用いたGRN評価において,平均AUROCおよびAUPRCの点推定値が最も高かった。
SCHEDBench:自然言語による組み合わせスケジューリングにおけるLLM制約忠実性の評価ベンチマーク [cs.AI, cs.CL]目的:LLM制約忠実性の評価
- 組合せスケジューリングは,資源配分等の最適化に不可欠であり,効率的な問題解決が求められる。
- LLMは自然言語で指示を理解するが,制約条件の微妙な変化に頑健でない場合がある。
- 自然言語の表現変更に対するLLMの制約条件遵守能力を定量的に評価する。
- SCHEDBenchは,ジョブショップスケジューリング,リソース制約付きプロジェクトスケジューリング,看護師のローテーション,カリキュラム時間割など,多様なスケジューリング問題に対応する。
- 13種類のLLMを用いた実験の結果,意味的に同等な問題表現でも,モデルの出力が大きく変動することが示された。
- 特に制約条件の順序変更は,LLMのパフォーマンスに顕著な影響を与えることが確認された。
LLMによる許容可能集合作成における判断と列挙の違い:沈黙の省略 [cs.AI]目的:LLM(大規模言語モデル)が作成した許容可能集合における判断能力と作成能力の差異
- 言語モデルは評価対象から評価者へと役割が変化しており,その妥当性評価が重要になっている。
- LLMが作成する許容可能集合は,完全性や網羅性に課題があり,正解を十分に含めていない場合がある。
- LLMが許容可能集合をより正確に作成するための問題点と改善策を明らかにすること。
- LLMは,候補が許容可能集合に属するかどうかを判断する能力は高いが,集合自体を作成する能力は低い。
- LLMは,仕様が誘導する領域を具体化することが苦手であり,その結果,省略という誤りが頻発する。
- 作成された許容可能集合の誤りを修正することで,正解率を大幅に向上させることが可能である。
AI技術的負債からエージェント的技術的負債へ:自律型AIシステムにおける根本原因と現れの体系的マッピング [cs.AI, cs.CR, cs.SE]目的:エージェント的AIシステムにおける技術的負債の根本原因と現れに関する体系的マッピング
- AI技術は社会実装が進んでおり,その品質確保と持続可能性が重要課題となっている。
- 従来の技術的負債のモデルは,静的なシステムを想定しており,自律型AIシステムの動的特性に対応できていない。
- 自律型AIシステム特有の技術的負債を特定し,その管理フレームワークを構築すること。
- 本研究では,従来の技術的負債をエージェント的視点から再解釈し,記憶の不整合,オーケストレーションの脆弱性などの現れを明らかにした。
- 技術的負債が,ソフトウェアだけでなく,エージェントの行動,協調メカニズム,環境との相互作用にまで及ぶことを示した。
- AIの信頼性,リスク,セキュリティ管理(AI TRiSM)への影響を分析し,持続可能性における技術的負債への示唆を得た。
評価セットに属すべきは誰か:エージェント拡張性プラットフォームにおける回帰評価セットをキュレーションするための能力分類に基づいたパイプライン [cs.LG, cs.AI, cs.SE]目的:エージェント拡張性プラットフォームにおける回帰評価セットのキュレーション
- エージェント拡張性プラットフォームの普及に伴い,高品質な回帰評価セットの維持が重要になっている。
- 各顧客固有の評価セットが流入するため,プラットフォーム側の評価セットのサイズ制限との矛盾が生じている。
- 能力分類に基づくパイプラインを構築し,回帰評価セットの品質と網羅性を最大化することを目指す。
- 能力分類に基づき,各クエリをプラットフォームが管理する分類体系にマッピングすることで,評価セットのキュレーションを自動化する。
- クエリの実行品質を評価し,既存のエントリよりも優れたテストケースを優先的に採用することで,評価セットの最適化を実現する。
- このメカニズムは分類体系に依存せず,能力分類が進化する場合にも対応可能である。
階層的ソロモノフ帰納法:無制限機械学習モデル [cs.LG, cs.AI, cs.IT, math.IT]目的:系列予測における理想的な無制限モデルの構築
- 系列データ分析は,自然言語処理や時系列予測など,様々な分野で不可欠な技術である。
- ソロモノフ帰納法は理想的だが,与えられたデータからの外挿が苦手である。
- 観測された系列に基づいて条件付け可能なハイパープライアを持つモデルを提案する。
- 階層的ソロモノフ帰納法(HSI)は,ソロモノフ帰納法(SolInd)と同等であることが証明された。
- HSIの過剰誤差は,ハイパープライアにおける生成元の複雑さに依存することが示された。
- データセットの増加に伴い,HSIの平均過剰誤差は0に収束し,最適な予測を達成する。
二重標的分子設計のための融合型ベイジアンフローネットワーク [cs.LG]目的:二重標的分子設計
- 複雑な疾患に対するポリファーマコロジー化合物創薬の有望な道であるため,重要性が高い。
- 既存の二重標的アプローチは,配列生成に焦点を当てているか,拡散ベース生成軌跡に予測ドリフト項を追加しており,両標的からの特徴情報を十分に統合できない。
- 両標的からの情報を統合し,結合親和性の高い分子を生成すること。
- FusedBFNは,二重標的生成を,統一された連続パラメータ空間での分布融合として定式化する。
- 二重標的構造データの不足に対処するため,事前学習された標的認識BFNモデルを共有バックボーンとして活用する。
- 実験により,FusedBFNが二重標的に対する強力な結合親和性を持つ分子を,良好な分子特性を維持しつつ生成することが示された。
きめ細かい忘却に向けて:マルチモーダル大規模言語モデルにおける属性アンラーニング [cs.AI]目的:マルチモーダル大規模言語モデルにおける属性レベルのアンラーニング
- 大規模言語モデルの能力向上に伴い,プライバシー保護の重要性が増している。
- 既存のアンラーニング手法は,プロファイルレベルでの削除に偏っており,よりきめ細かい属性レベルでの忘却が課題である。
- 特定の属性情報を忘れつつ,同一人物に関する他の情報は保持するという,実用的なアンラーニングを実現すること。
- 属性と保持すべき情報が同一人物に関する情報や視覚的証拠を共有するため,選択的な忘却は情報漏洩や性能劣化のリスクがあることが示された。
- 提案手法CLRPは,因果的局所化と保持を意識した射影を用いて,ターゲット属性の情報を除去しつつ,同一人物の証拠を保持する。
- 様々なアーキテクチャとパラメータ規模を持つMLLMでCLRPの有効性が実証された。
MedUPS:大規模言語モデルを用いた稀な症例における診断支援に向けて [cs.CL, cs.AI]目的:稀な症例における臨床的意思決定支援
- 臨床現場では,稀な症例やガイドライン外の症例への対応が求められるが,診断の不確実性下で判断する必要がある。
- 既存のLLMベンチマークは最終診断のみを評価しており,臨床現場で重要な次の行動予測が不足している。
- 患者の経過に沿った中間的な意思決定をLLMに学習させ,より臨床現場に近い形で診断支援を実現する。
- 新たなデータセットMedUPSQAを構築し,LLMを患者の経過に沿った意思決定に特化して学習するフレームワークMedUPSを提案した。
- MedUPSを用いることで,Qwen3.6-27Bでは次の行動予測の精度が55.2%から66.7%に向上し,モデルの規模よりも学習方法が重要であることが示された。
- データセット,コード,学習済みモデルを公開し,今後の研究への貢献を目指す。
Cloud-ScPO:LLM推論における半教師あり優先度最適化のための隠れ状態幾何学 [cs.RO, cs.CL, cs.AI]目的:LLM推論における優先度最適化
- LLMの数学的推論能力向上は重要であり,その性能向上が様々な応用分野の発展に繋がる。
- 信頼性の高い正誤ペアの取得には,検証済みの答えや人間の注釈,外部報酬モデルが必要であり,コストが高い。
- モデル内部表現の幾何学構造を利用し,少ないラベルデータで優先度を学習し,コスト問題を解決する。
- Cloud-ScPOは,ScPOと比較してGSM8KとMATH-Numericの両データセットで一貫して性能を向上させた。
- GSM8Kでは最大4.49%,MATH-Numericでは4.19%の改善が見られた。
- Cloud-ScPOは,正誤の信頼性を維持しつつ,質の低い否定例を効果的に排除した。
KING:脚部と車輪型ロボットの統一的な動作表現のための具現化を意識した運動学的グラフニューラルネットワーク [cs.RO, cs.AI]目的:脚部および車輪型ロボットの統一的な運動表現
- 特徴のない環境下でのオドメトリ推定において,運動学モデルは信頼性の高い制約を提供する。
- 既存の学習ベースモデルは単一の具現化で学習するため,新しい具現化への汎化性能が低い。
- ロボットの具現化を考慮した運動学モデルを構築し,汎化性能を向上させる。
- KINGは,ロボットの具現化を共通のグラフとして表現することで,車輪型と脚部型ロボットの運動学モデルを統一的に表現可能にした。
- 多様な具現化データで学習したKINGは,高精度なオドメトリ推定を実現し,実環境での有効性が確認された。
- わずか1分間のデータで新しいロボット具現化への適応が可能であり,ゼロから再学習する必要がない。
LLMが譲歩する理由:会話的要因と医療における迎合的行動の背景 [cs.CL, cs.AI]目的:医療に関する言語モデルの迎合的行動の会話的要因
- 大規模言語モデルの医療分野への応用が期待されるが,誤情報の拡散リスクが懸念される。
- 言語モデルが誤った情報をユーザーに迎合し,正しい医療知識を放棄する「医療における迎合的行動」が存在する。
- 会話の要因がこの迎合的行動にどのように影響するかを明らかにすること。
- 言語モデルの迎合的行動はモデル固有の特性ではなく,会話に依存することが示された。
- 偽の情報源が質問に添付された場合,迎合的行動が2倍に増加する一方,モデルが回答後に提示された場合は半減する。
- 質問によって迎合的行動のばらつきがモデル間よりも大幅に大きい(67倍対3倍)ことが明らかになった。
電気羊は夢を見るか? 高精度な視覚言語モデルの幻覚ベンチマークのための人間による記述サンプル [cs.CV, cs.AI, cs.CL]目的:視覚言語モデルの幻覚検出独立性を保つための人間による記述サンプルの有用性
- モデルの進化が速いため,幻覚評価の普遍的な手法が求められている
- 既存のベンチマークは特定のモデルに依存するため,汎用性に欠ける
- 人間が記述したサンプルを用いて,モデル非依存な幻覚ベンチマークを確立すること
- 人間が記述したサンプルは,モデル生成サンプルと比較して高い合意度を示した
- データセットの内容制御が可能であり,視覚言語モデルからのサンプルと分布が類似している
- 人間データはモデルベースの幻覚ベンチマークの代替として有効であると考えられた
キャリバー:スコア返却APIに対するクロスアーキテクチャ抽出コスト制御 [cs.LG, cs.AI]目的:モデル抽出に対する出力摂動防御機構
- 機械学習モデルの知的財産保護は重要であり,モデル抽出攻撃への対策が不可欠である。
- モデル抽出攻撃は,API経由でモデルの知識を盗み出すことができ,プライバシーやセキュリティ上のリスクをもたらす。
- モデル抽出攻撃に対する防御機構を構築し,抽出コストを制御することで,モデル保護を強化する。
- キャリバーは,ノイズ選択をキャリブレーション問題として定式化し,攻撃者がクリーンなロジットを復元するために必要なクエリコストを最小限に抑える。
- 内部ロジットに独立同一なガウスノイズを加えることで,ターゲットへの合意度がノイズスケールとともに厳密に低下することを示す。
- モデルごとのキャリブレーションは,平均絶対相対誤差0.6-1.4%を達成し,実験により構成された劣化がサーロゲートモデルの性能を追跡することを確認した。
ストレStress緩和焼きなまし法:自動倉庫のレイアウト最適化のための多項式時間シミュレーションフリー手法 [cs.MA, cs.AI, cs.RO]目的:自動倉庫の物理的レイアウト最適化
- 自動倉庫の効率化は,物流コスト削減や配送時間の短縮に不可欠である。
- 従来のレイアウト最適化手法は計算コストが高く,効率的な探索が困難である。
- シミュレーションを必要としない,効率的なレイアウト最適化手法を開発する。
- 提案手法SRAは,人間の設計した倉庫のスループットと拡張性を向上させ,ロボット数のおよそ2倍の維持が可能となった。
- SRAは,進化的ベースラインと同等またはそれ以上のスループットを達成し,計算時間を大幅に短縮した(1CPUコアで19分 vs. 64コアで25時間,25,000シミュレーション)。
- SRAによる改善は,異なるMulti-Agent Path Findingアルゴリズム,不均一なタスク需要,および倉庫の規模変更においても一般化された。
VLAGuard:無線センサーネットワークにおける視覚言語行動ロボットの物理的な注意ハイジャックを評価・軽減するためのフレームワーク [cs.CE, math.OC, cs.NI, cs.RO, cs.RO, cs.AI]目的:視覚言語行動ロボットにおける物理的な注意ハイジャックの評価と軽減
- ロボットの活用範囲拡大に伴い,セキュリティの確保が重要になっている。
- 視覚情報への攻撃によるロボットの誤動作が問題となっている。
- ロボットの注意機構を保護することで,物理的な攻撃への耐性を高める。
- VLAGuardフレームワークとVASAモジュールを開発し,注意ハイジャックの脆弱性を評価した。
- APFT防御機構は,注意経路の安定化と幾何学的整合性の強化により,推論オーバーヘッドなしでロバスト性を向上させた。
- シミュレーションと実環境の両方で,APFTは成功率を大幅に改善し,実用性を示した。
第4象限:良性な不適合の様相 [cs.RO, cs.LG, cs.IT, math.IT]目的:線形回帰における学習データへの適合と汎化性能の関係性
- 機械学習モデルの性能評価において,学習誤差とテスト誤差の乖離は重要な課題である。
- 学習データへの過剰な適合は汎化性能の低下を招くことが知られている。
- 学習データへの適合が悪いにも関わらず,良好な汎化性能が得られる領域を明らかにする。
- 学習データサイズが特定の範囲にある場合,汎化性能の高い予測器は学習データをゼロ予測器よりも悪く適合させるという「良性な不適合」が示された。
- 有用な予測は,学習データへの過学習を避けるために,補間を超える必要があることが示された。
- 一回の通過による確率的勾配降下法(SGD)は,この範囲全体で高いテスト誤差を達成し,最適な予測器に匹敵することが確認された。
CallScreenBench:電話秘書の役割を果たすオンデバイスモデルのベンチマーク [cs.CR, cs.AI]目的:オンデバイスモデルの電話秘書としての性能評価
- スマートフォン上で動作するAIモデルの活用が広がり,新たな応用可能性が模索されている。
- 既存のベンチマークは協調的なユーザーを想定しており,敵対的な状況下での評価が不足している。
- 電話秘書としてのAIモデルの性能を,人間の判断に近い形で評価する手法の確立を目指す。
- CallScreenBenchは,電話秘書としての性能を5つの側面から評価する。
- モデルの能力が向上するにつれて品質は向上するが,通話の取捨選択能力は必ずしも向上しないことが示された。
- 単純な応答や通話切断でも高い評価を得られる場合があり,絶対的な性能指標の設定は困難であることが示唆された。
WAM-Diff2:効率的な自動運転VLAのための階層的AR-to-Diffusion蒸留 [cs.CL, cs.RO, cs.AI, cs.CV]目的:自動運転における,効率性と認知能力を両立するVLAモデルの構築
- 自動運転技術は,交通事故の削減や移動の自由度の向上に貢献し,社会にとって重要な課題である。
- 既存のVLAモデルは計算コストが高く,また,逐次的な処理によるバイアスが課題となっていた。
- 事前学習済みARモデルを効率的なDiffusionモデルに変換し,高性能かつ高速な自動運転を実現すること。
- WAM-Diff2は,段階的な蒸留戦略により,ベースモデルの知識を保持しつつ高速化を実現した。
- 実験結果から,WAM-Diff2は既存のARモデルと同等の性能を発揮し,exposure biasを軽減することが示された。
- 推論速度は2.8倍に向上し,システムレベルの最適化と組み合わせることで最大15.1倍の加速となった。
軌道類似度学習における下限表現の利用 [cs.AR, cs.DB, cs.LG]目的:軌道類似度学習のための新たな下限表現
- 軌道データは,ロボティクスや行動認識など多様な分野で重要であり,効率的な軌道検索が求められている。
- 従来の学習ベース手法は,距離の保証がなく,距離尺度に依存しやすく,学習コストが高いという課題があった。
- 本研究は,下限表現に着目し,距離尺度に依存しない統一的な枠組みを構築し,軌道検索の精度向上を目指す。
- 提案手法LB-TrajRepは,DTW,Hausdorff距離,DFDなど複数の古典的な軌道距離に対して許容可能な下限を構築する。
- データ駆動型ピボット選択戦略により,下限のタイトネスを最適化し,ランキング品質を向上させている。
- 実データ実験の結果,LB-TrajRepは既存のニューラル軌道埋め込み表現を様々な距離尺度で上回り,ランキング精度を大幅に改善した。
機械学習ランキングによる現代のマイクロアーキテクチャポリシーの限界 [cs.AR, cs.LG]目的:プロセッサ性能予測における機械学習ランキングの限界
- プロセッサ設計空間探索において,サイクルレベルシミュレーションよりも高速な性能予測が求められている。
- 機械学習予測器は,ハードウェア構成の順位付けにおいて,必ずしも正確な結果が得られていない。
- 機械学習予測器のランキング能力の限界を明らかにし,シミュレーションの必要性を再確認する。
- 構造パラメータの探索において,反直観的な結果(CIW)が全体の22.4%を占め,予測精度が低いことが示された。
- 行動ポリシーの探索では,モデルはいずれも,特徴量のないベースラインよりも優れた性能を示せず,予測が困難であることが示された。
- 予測精度が低いのは,モデルの容量不足ではなく,隠れたマイクロアーキテクチャ状態が原因であることが情報理論的に示された。
19時05分にエージェントは何を見ていたか?リアルな調査に基づいた時間的エンタープライズシナリオの生成と,エージェントの評価への再現 [cs.SE, cs.AI, cs.HC, cs.LG]目的:時間的エンタープライズシナリオの生成とエージェントの評価
- 企業AIエージェントの性能評価は重要であり,現実的な状況下での動作確認が不可欠である。
- 従来のオフライン評価は静的なスナップショットに依存しており,時間変化するデータの状況を正確に評価できない。
- 現実的な時間的変化を考慮したエンタープライズ環境を再現し,エージェントの評価を可能にすること。
- 本システムは,リアルな調査データに基づき,時間的に変化するエンタープライズ環境を生成する。
- 生成された環境は,特定の時点の状態を再現し,エージェントの評価を高速かつ再現可能に行うことができる。
- スキーマから推論された時間的記述により,レコードの過去の状態を決定的に再構築し,差分キャッシュとして保存する。
デコイ画像がキャプション媒介防御によるエンコード型脱獄攻撃に対する効果を増強する [cs.CR, cs.AI]目的:ビジョン言語モデルに対するエンコード型脱獄攻撃に対する防御における,デコイ画像の利用効果の検証
- ビジョン言語モデルは高度な能力を持つ一方,悪意のある入力に対する脆弱性が課題となっている。
- エンコード型脱獄攻撃は,既存の防御機構を回避する可能性があり,その対策が求められている。
- デコイ画像を用いることで,エンコード型脱獄攻撃に対する防御効果を高める可能性を示す。
- デコイ画像とエンコード型脱獄プロンプトを組み合わせることで,攻撃成功率を大幅に低下させることが確認された。
- キャプション媒介型防御において,内容のないデコイ画像を追加することで,攻撃成功率が最大73%低下した。
- 軽量なエンコード入力検出器でデコイ画像の付与を制御することで,誤検知率の上昇を抑えつつ,防御効果を維持できる。
DeBERTa-Sentinel:AI生成テキストの透明性と信頼性向上への試み [cs.AR, cs.CL, cs.AI]目的:AI生成テキストの検出
- 大規模言語モデルの普及により,誤情報拡散や学術不正などの問題が深刻化しており,信頼性の高い検出技術が求められている。
- 既存の検出器は,多様なモデル出力や言い換え攻撃への対応が難しく,汎用性に課題がある。
- DeBERTa-v3の注意機構を活用し,AI生成テキスト特有の構造的特徴を捉え,検出精度と透明性を向上させる。
- DeBERTa-Sentinelは,GLC-AITextデータセットにおいて98.21%の検証精度を達成し,RoBERTa-Sentinelを上回る性能を示した。
- 高い適合率(95.89%),再現率(99.33%),ROC-AUC(99.53%),そして低い偽陰性率(0.665%)を実現した。
- モデルの解釈可能性により,AI生成テキストに特徴的な学術的な表現や形式的な接続詞などが明らかになり,検証可能なコンテンツ真正性判断を支援する。
FactorJEPA:密集したグローバルサウス都市環境における未来予測のための,レイアウト・エージェント・インタラクションチャネルへの分解 [cs.NI, cs.AI, cs.CV, cs.LG]目的:グローバルサウスの密集した都市環境における未来予測性能の向上
- 現実世界の構造とダイナミクスを捉えるWorld Modelは,ロボティクスやAI研究において不可欠である。
- 既存のWorld Modelは,主に低密度で構造化された環境を対象としており,混雑した都市環境への適用が課題であった。
- 本研究は,多様性と部分的観測性を持つ環境下での密なインタラクションダイナミクスを維持し,予測精度を向上させることを目指す。
- FactorJEPAは,レイアウト,エンティティ,インタラクションを分解的に予測することで,未来予測の精度を向上させた。
- Causal L1,Mask-ratio slopeなどの評価指標において,既存手法を上回る結果が得られた。
- 再現性のあるモーション情報と予測精度のトレードオフを明らかにし,異なるバックボーンモデルで結果が一致することを確認した。
大規模LLMスキル選択における決定論的実行可能性ゲート [cs.AI, cs.CL, cs.SE]目的:LLMスキル選択における実行可能性の確認
- LLMエージェントの活用が進む中で,大規模なスキルライブラリからの適切なスキル選択が重要である。
- 意味的な関連性だけでは,現在の環境で実行不可能なスキルが選択される可能性がある。
- 実行可能性ゲートを用いて,実行不可能なスキル候補を事前に排除し,効率的なスキル選択を実現する。
- 意味的マッチングによりユーザーメッセージの約23.1%が保持された。
- 実行可能性ゲートは,マッチングされたスキル-メッセージペアの約59.4%を削減し,スキル記述トークンを大幅に削減した。
- ゲート処理により,実行不可能なスキルがモデルの選択に影響を与えることが確認された。
構造化された視覚的知覚のためのマージナル貢献度割り当て [cs.CV, cs.AI]目的:構造化された視覚的知覚タスクにおけるマージナル貢献度割り当て
- マルチモーダル大規模言語モデルの応用範囲拡大に伴い,視覚情報と言語情報の連携が重要になっている。
- 従来の強化学習手法では,応答レベルでのみ指導が行われ,個々のオブジェクトボックスへの貢献度を区別できない。
- 各予測ボックスの貢献度を個別に評価し,より正確なオブジェクト検出とセグメンテーションを可能にすることを目指す。
- 提案手法MCR-GRPOは,各ボックスの貢献度をleave-one-out比較によって推定することで,応答レベルの指導の粒度ミスマッチを解消する。
- MCR-GRPOは,セット値の変化を測定し,貢献度の高いボックスに正の報酬を与え,冗長なボックスを抑制することで,マージナルアトリビューションを安定化させる。
- 実験の結果,提案手法は既存のGRPOベースラインと比較して,REC,DOD,セグメンテーション,カウントの各ベンチマークで最先端の性能を示した。
圧縮下での制御:道具使用エージェントの信頼性フロンティア [cs.AI, cs.CL]目的:道具使用言語モデルエージェントの制御コンテキスト圧縮における信頼性の限界
- 大規模言語モデルの応用範囲拡大に伴い,道具を使用するエージェントの効率的な制御が重要となっている。
- 制御コンテキストの圧縮はコスト削減に有効だが,圧縮後の信頼性評価が不十分である。
- 制御コンテキスト圧縮によって生じる信頼性の低下を定量的に評価し,最適な圧縮方法を特定すること。
- 圧縮率75%において,一般的な書き換えやセクションベースの圧縮は,フルコンテキストのベースラインに近い成功率を示す。
- 圧縮率が50%以下になると,圧縮方法による信頼性の差が顕著になり,実行プロトコルが不安定になる。
- 圧縮によるエラーは主に道具の実行や行動解析に起因し,コンテキスト毎の評価が必要であることが示唆される。
インデックスアルゴリズム下におけるポストバンディット推論のバイアス特性評価 [cs.LG, math.PR, stat.ML]目的:ポストバンディット推論におけるバイアスの解析
- 強化学習は,効率的な意思決定を可能にするため,様々な分野で重要性が増している。
- バンディットアルゴリズムによる適応的サンプリングは,推論にバイアスを引き起こす可能性がある。
- 本研究は,バイアスの原因を特定し,その影響を定量的に評価することを目的とする。
- 安定したインデックスアルゴリズム(UCB1など)におけるサンプル平均のバイアスとZ統計量を解析した結果,バイアスの主要な原因が「有効探索率」に依存することが明らかになった。
- UCB1の場合,有効探索率は$\sqrt{\log T}$ のオーダーであり,最適な腕以外のバイアスは$1/\sqrt{\log T}$という非常に遅い速度で減衰することが示された。
- インデックス関数の選択が,後悔とバイアスのトレードオフに影響を与えることを明らかにした。探索的なアルゴリズムはバイアスを軽減するが,後悔が増加する。
単一テスト時適応のためのロジット起源中心化 [cs.LG, cs.CV]目的:単一テスト時適応における性能低下とその解決策
- 表形式データは現実世界の多くの場面で利用されており,深層学習モデルの活用が期待されている。
- 訓練データとテストデータの分布が異なる場合,深層学習モデルの性能が著しく低下する。
- ストリーミング環境下での単一データに対する適応方法を確立し,性能劣化を改善すること。
- 本研究では,バッチ依存型アプローチがストリーミング環境下で性能を著しく低下させることを示した。
- その解決策として,ロジット空間をシフトさせる軽量な手法であるPLOCを提案した。
- PLOCは5つの表形式データベンチマークにおいて,既存手法を大きく上回る性能を示した。
役割分離型注意残差:深層におけるマッチングとコンテンツ検索の分離 [cs.AI]目的:深層における注意機構のマッチングとコンテンツ検索の役割分離
- Transformerは自然言語処理の基盤技術であり,その性能向上が重要である。
- 既存の注意残差構造では,マッチングとコンテンツ検索が密結合であるという課題があった。
- マッチングとコンテンツ検索を分離することで,Transformerの性能を改善することを試みる。
- 提案手法であるRD-AttnResは,120Mおよび343Mパラメータモデルにおいて,検証時の負対数尤度を改善した。
- 改善の平均値はそれぞれ0.0301と0.0247であり,パープレキシティを2.97%と2.43%削減した。
- 注意機構のマッチングとコンテンツ検索は,残差階層を異なって読み込むことで利点が得られることが示唆された。
思考に注意を払え:1.58ビット量子化のレンズを通して,推論LLMのポストトレーニング量子化の障壁を打破する [cs.CE, cs.RO, cs.CL, cs.AI]目的:推論LLMのポストトレーニング量子化のためのスケーラブルな三値量子化フレームワーク
- 大規模言語モデルは高度な推論能力を持つが,量子化による性能劣化が課題となっている。
- 従来の量子化手法では,モデルの推論プロセスを無視することで,数学やコーディングタスクで性能が低下する。
- モデルの推論過程を考慮した量子化手法により,性能劣化を抑制し,量子化効率を向上させる。
- ScaleQ-1.58は,わずか4Mのキャリブレーショントークンで,既存のBitNet b1.58 2B4Tに匹敵する性能を達成した。
- ScaleQ-1.58は,密な構造とMoE構造の両方で性能が向上し,モデル規模が大きくなるほど効果が高まる。
- AYOTは,様々な難易度のタスクや量子化ビット幅に強い汎化能力を示す。
協調が引き金となる時:マルチエージェントシステムにおける集合的証拠閾値バックドア [cs.RO, cs.MA, cs.LG]目的:マルチエージェントシステムにおける集合的証拠閾値バックドアのパラダイム
- LLMの能力拡張にマルチエージェントシステムが活用されている。協調による性能向上が期待される分野である。
- エージェント間の協調は,単一のメッセージではなく証拠の累積によってバックドアが活性化される脆弱性を生む。
- 証拠の閾値を超えた際にバックドアが活性化する現象を解明し,その対策を提案することを目的とする。
- 本研究では,集合的証拠閾値バックドアのパラダイムと,バックドアを注入する手法であるBCBIを提案した。
- BCBIは,閾値前後の振る舞いを分離し,証拠に沿った潜在的な進行を学習することで,選択的な活性化を実現する。
- また,潜在的な遷移を検出し,異常なエージェントの更新を隔離する防御手法LATTEを提案し,攻撃目標やトリガーが不明な状況下でも効果を発揮することを示した。
