arXiv雑要約
AI - 2026/07/30 公開
音素レベルと文字レベルのターゲット,および皮質内脳-テキスト変換のための選択的状態空間モデル [cs.CL, cs.AI, eess.SP]目的:皮質内脳-テキスト変換システムの音素と文字のターゲット,および選択的状態空間モデルの有効性評価
- 脳活動からテキストを直接生成する技術は,運動麻痺患者のコミュニケーション手段を提供する可能性があり,医療応用が期待される。
- 現在の脳-テキスト変換システムは,精度向上が課題であり,特に状態空間モデルの活用やターゲットの選択が最適化されていない。
- 本研究は,状態空間モデルとターゲットの違いが脳-テキスト変換性能に与える影響を明らかにすることを目的とする。
- Brain-to-Text '25ベンチマークにおいて,GRUベースのモデルが最も高い性能を示し,音素ターゲットを用いた場合,PER 12.62%,WER 21.19%を達成した。
- 文字ターゲットを用いたGRUモデルは,言語モデルによるリスコアリングにより,CER 13.39%,WER 26.28%を達成したが,音素モデルを上回ることはなかった。
- ハイブリッドMambaモデルは競争力があるものの,GRUモデルを凌駕する結果は得られず,アーキテクチャの貢献とエラー分析から表現依存的な失敗が示された。
CalTwin: 医療World Modelの較正とシフト頑健性の向上 - Fisher情報正則化によるアプローチ [cs.LG]目的:医療World Modelにおける較正とシフト頑健性の向上
- 医療データの活用は,診断支援や個別化医療の実現に不可欠であり,その重要性は増している。
- 医療データは,病院やスキャナ,時間によって分布が異なり,モデルの汎化性能を阻害する covariate shiftが課題。
- モデルの予測における過信 (confidence misalignment) を抑制し,信頼性を向上させることを目指す。
- 提案手法CalTwinは,out-of-distributionデータに対する次の状態のMSEを9.1%削減することに成功した。
- Fisher情報正則化のみで7.0%のMSE削減が確認された。
- Confidence Misalignment PenaltyはECEの減少に寄与するものの,その効果は限定的であった。
Metis:メモリ基盤モデル [cs.CL, cs.LG]目的:メモリ機能を基盤モデルに組み込むための研究
- AIエージェントの能力向上には,基盤モデルの性能が不可欠である。
- エージェントの記憶機能は外部モジュールに依存しており,基盤モデル自身の記憶能力は未開拓である。
- 基盤モデルに固有の記憶機能を実装し,その可能性を検証すること。
- Metisは,基盤モデルに固有のメモリ状態を組み込む新しいアーキテクチャを提案している。
- Metisは,過去の情報をモデル内に圧縮し,メモリ注意機構を通してアクセスすることを可能にする。
- 学習済みのモデルの重みを固定した状態で,メモリ状態が自律的に変換される点が特徴である。
皮膚癌分類における外域汎化性能向上のためのロバストなデータ拡張の探索 [cs.NI, cs.CV, cs.AI]目的:皮膚癌の悪性・良性二値分類におけるデータ拡張によるロバスト性の向上
- 皮膚癌の早期発見は重要であり,診断精度向上は医療現場で喫緊の課題である。
- 皮膚画像診断器は,撮影機器や照明条件の変化によって性能が低下することが課題である。
- この研究は,外域汎化性能を向上させるデータ拡張手法の特定を試みる。
- 複合的なデータ拡張戦略(mix policy)が最も高い外域汎化性能の向上を示した。
- 光度変換を含むデータ拡張が,外域汎化性能に貢献する主要な要素であった。
- 独立した臨床データセットにおいては感度が0.591から0.818に向上したが,サンプル数の少なさから再現性に課題が残る。
MediaWiki Code2Code検索:オープンソースソフトウェア要素のセマンティックな発見のためのニューラル検索 [cs.IR, cs.AI, cs.CL, cs.SE]目的:オープンソースソフトウェア要素のセマンティックな発見
- 大規模なコードベースの探索は,ソフトウェア開発において不可欠であり,効率的な検索システムの必要性が高まっている。
- 従来の検索手法は,クエリとコード実装の間の語彙的なギャップ,そして検索速度と精度とのトレードオフに悩まされている。
- 本研究は,セマンティックな意味に基づいてコードを検索することで,従来の検索手法の課題を克服することを目的とする。
- MediaWiki Code2Code Searchは,129万個の構造的要素をインデックス化し,計算意図に基づいた検索を可能にした。
- オフラインでのインデックス作成とCPUのみでの提供層を分離する分割ビルドアーキテクチャを採用し,低遅延性と高精度を実現した。
- 評価の結果,BM25ベースラインと比較して,P@10が0.87と0.64となり,特に名前が難読化されたタスクで優れた性能を示した。
See2Think:マルチモーダルモデルは本当に中間的な視覚状態を利用しているのか? [cs.CV, cs.AI]目的:マルチモーダルモデルにおける視覚状態の利用状況の評価
- AIの高度化に伴い,視覚情報とテキスト情報を統合した推論能力が重要になっている。
- 既存の評価指標は,タスクの種類が限られていたり,最終的な解答のみに焦点を当てていたりする。
- 中間的な視覚状態が,モデルの推論過程においてどの程度活用されているかを詳細に分析すること。
- モデルの視覚的推論は,モデルや環境に強く依存し,特定の条件が常に優位とは限らないことが示された。
- モデルは適切な視覚的操作を選択する傾向にあるものの,正確な視覚状態のレンダリングがボトルネックになっている。
- 関連性の高いフィードバックが与えられた場合,モデルの精度が低下し,視覚状態への依存性を示す結果が得られた。
潜在チャネルは実際に通信しているか?:潜在的マルチエージェントLLMの因果的監査 [cs.RO, cs.AI]目的:潜在的マルチエージェントLLMにおける潜在的なコミュニケーションの評価
- LLMを用いたマルチエージェントシステムは複雑化の一途を辿っており,その挙動理解が不可欠である。
- 潜在的なコミュニケーションの有効性は,表面的なタスク性能だけでは判断が困難である。
- 潜在チャネルを通じて伝達される情報が,タスクに実際に役立っているか検証する。
- Qwen3-4B (GSM8K)において,メッセージ置換実験により,他の事例からの情報と事例固有の情報がそれぞれ性能に影響することが示された。
- Qwen3-8Bでは,Qwen3-4Bとは異なり,これらの効果の方向性が逆転した。
- この結果は,集計された精度だけでは潜在的なメッセージの影響を特定できず,制御されたメッセージ比較が重要であることを示唆する。
構造化多軸合成のための経路演算子 [cs.LG, cs.AI]目的:構造化された多軸データに対する合成と位置表現の理論的枠組み
- 言語,画像,3Dボリュームなど,多くのデータは複数の軸に沿った構造を持つ。その理解は重要である。
- 軸間の合成順序に依存しない,汎用的な構造表現が課題であった。
- 軸変換の可換性に着目し,経路演算子による新しいモデルを提案する。
- 経路演算子は,軸に沿った変換の積として定義され,合成と相対位置の記述を統括する。
- 変換が固定される場合,本フレームワークはRoPEとその多次元変種を再現する。
- JoFormerを設計し,その有効性を,画像,言語,および長文の一般化において検証した。
SkillRise:タスク間スキル進化のためのエージェント的強化学習 [cs.CL, cs.LG, cs.AI]目的:タスク間スキル進化のための強化学習フレームワーク
- 大規模言語モデルエージェントは多様なタスクに直面し,汎用的な解決策が求められている。
- 既存手法はタスクを独立と捉えるか,スキル抽出・検索・実行が複雑に絡み合っている。
- タスクを横断したスキル学習を効率的に実現し,再利用可能なスキルを獲得すること。
- SkillRiseは,ALFWorld,WebShop,ScienceWorldにおいて,Pass@1性能で既存手法を上回る成果を示した。
- 獲得されたスキル策定ポリシーは,同一タスクの反復試行においても有効であることが確認された。
- 関連タスクのシーケンス長が伸びるにつれて性能が向上し,タスク間のスキル転移を示唆している。
マルコフ決定過程における性質に基づいた因果的抽象化 [cs.AI, cs.LO]目的:マルコフ決定過程の抽象化手法
- 意思決定モデルとして広く用いられ,複雑な問題解決に不可欠である。
- 状態空間の指数関数的な増加が,計算上のスケーラビリティを阻害する。
- 性質に基づいた因果的抽象化により,スケーラビリティ問題を解決する。
- 提案手法により,元のMDPの特性を維持した小規模な抽象化が可能となった。
- 標準的なベンチマークにおいて,ほぼ最適な方策を計算できた。
- 因果的抽象化は,関連する大規模なMDPモデルにも一般化可能である。
クラスタ化された分散型学習における安定かつ予算制約を満たす連合形成:快楽主義的ポテンシャルゲームアプローチ [cs.GT, cs.LG]目的:クラスタ化された分散型学習における連合形成の安定性と予算実現可能性
- 分散型学習は,データプライバシーを保ちつつ,複数のデバイスでモデルを学習できるため重要である。
- 連合形成の安定性と予算制約を満たすことが課題であり,参加者のインセンティブ設計が難しい。
- 安定した連合形成と予算実現可能性を両立するメカニズムを構築し,効率的な学習を実現すること。
- 提案手法は,快楽主義的ポテンシャルゲームを用いて,安定した連合形成を保証する。
- シミュレーション実験により,提案メカニズムが最適な福利厚生に近い結果を達成できることが示された。
- CIFAR-10データセットを用いた実験では,提案手法が証明済みの福利厚生最適解に到達した。
SecRespond:現実世界の侵害後インシデント対応におけるAIエージェントのベンチマーク [cs.RO, eess.SY, cs.SY, cs.CR, cs.AI, cs.CL]目的:侵害後インシデント対応ワークフローにおけるLLMエージェントの評価
- サイバー攻撃は増加の一途をたどっており,迅速かつ正確なインシデント対応が不可欠である。
- 既存のセキュリティベンチマークは,攻撃前の理想的な環境に焦点を当てており,侵害後の状況は十分に調査されていない。
- 侵害後の状況におけるLLMエージェントの能力を評価し,現実世界でのインシデント対応の改善を目指す。
- 現在のLLMエージェントは,アラートから露出した問題を確実に発見できるものの,静かな侵入の積極的な調査や,網羅的で検証済みの修復計画の作成に苦戦している。
- どのモデルも,単一の範囲で完全な検出と修復を達成できていないことから,現実世界のインシデント対応のためのエージェント構築における根本的なボトルネックが明らかになった。
- SecRespondベンチマークは,10のサイバーレンジ,4つのエントリポイントタイプ,21のATT&CKテクニック,5つのOSを網羅しており,LLMエージェントの評価に活用できる。
FedTopo:モデル非同質分散学習のための関係レベルトポロジー共有 [cs.LG, cs.AI]目的:モデル非同質分散学習における知識伝達の改善
- 分散データ環境での協調学習が重要視されており,プライバシー保護に貢献する。
- 異なるモデル構造が,グローバル知識の共有と学習を妨げる課題がある。
- 関係レベルでのトポロジー共有により,モデル間の非同質性を克服し,知識伝達を改善する。
- FedTopoは,クラス間の関係性をトポロジーとして表現することで,モデルの非同質性に起因する知識伝達のずれを抑制する。
- 信頼度に基づいた集約により,不確かな関係性の影響を低減し,安定した学習を実現する。
- 3つのデータセットと8つの異なるモデルで,既存手法と比較して高い性能を示す。
オープンソースコミュニティにおけるAI貢献ルールへのコーディングエージェントの準拠状況の初期調査 [cs.SE, cs.AI]目的:AI貢献ルールへのコーディングエージェントの準拠度
- オープンソース開発は,ソフトウェア開発の重要な基盤であり,多くのプロジェクトを支えている。
- AIによる自動生成されたコードの増加に伴い,貢献ルールが整備されているものの,その遵守状況は不明である。
- AIエージェントが貢献ルールを理解し,遵守しているかを評価し,課題を明らかにすること。
- 最新のAIエージェントは,貢献ルールを自発的に取得することはほとんどないことが判明した。
- リマインダーやルール提示,検証者のフィードバックにより,開示や検証は改善される傾向にある。
- AI禁止のレポジトリにおいて,どのような条件でもエージェントが貢献を拒否することはない。
ブラックボックス型マルチターン対話における軌跡レベルの安全リスク予測 [cs.LG, cs.CR]目的:マルチターン対話における安全リスクの軌跡レベル予測
- LLMが自律エージェント化する中で,安全性を担保するには,単一時点での評価を超えた対応が必要である。
- 既存の安全対策は,発生済みの違反検出に留まり,潜在的なリスクの進化を予測し,予防的に対応できない。
- 本研究は,軌跡レベルでのリスク予測を通じて,潜在的なリスクの早期発見と予防を目指す。
- Recastは,短期的な対話の進行と長期的な履歴情報を活用し,リスクに関連する証拠を収集する。
- Recastは,現在のリスク状況とその時間的変化を捉え,リスクの組成的な進化をモデル化する。
- 実験の結果,Recastは将来の安全上の失敗の88.3%を平均2.41ターン前に予測し,誤報率は12.3%であった。
アイデア創出における内省支援のための摩擦としてのAI [cs.CL, cs.HC, cs.AI]目的:アイデア創出における内省支援のためのAIの役割
- 創造的な活動におけるAI活用は重要であり,デザイナーの生産性向上に貢献しうる。
- 既存のAIツールは摩擦の除去に重点を置いており,内省というデザインの本質を見落としている。
- 本研究は,AIを単なる出力の円滑化ではなく,内省を促す摩擦要因として捉えることを目指す。
- 本研究では,AIが候補アイデアの受容・拒否・再構築を通じて,デザイナーの内省を支援する可能性を示唆する。
- 特にグループアイデア創出において,AIはアイデアの根拠を構築し,他者とのコミュニケーションを促進する役割が期待される。
- AIを摩擦要因と捉えることで,AIはデザイナーの思考を代替するのではなく,思考を深めるための支援ツールとなりうる。
予算を考慮したLLM探索:コスト較正されたフロンティア有用性 [cs.LG, cs.AI]目的:LLM探索におけるコスト効率の最適化
- 科学的発見やアルゴリズム開発において,LLMを活用した探索が重要性を増している。
- 既存手法では,コストを考慮せずスコア向上のみに注目するため,効率が悪化しやすい。
- コストと予算を考慮した探索制御により,限られた予算内でより高品質な結果を得ることを目指す。
- 提案手法CostAdaは,フロンティアの進捗をコストと比較することで,効率的な探索を実現した。
- 16種類のベンチマークにおいて,既存手法と同等の性能を半分の予算で達成した。
- GLM-5とGPT-5.4を用いた評価では,全ベンチマークで最高の最終品質を達成した。
BATS:境界認識混合解像度トークンによるリソース効率的な体積セグメンテーション [cs.CV, cs.LG]目的:体積セグメンテーションにおけるリソース効率の向上
- 医療画像解析において,正確なセグメンテーションは診断・治療計画に不可欠である。
- 高性能なモデルはメモリ消費量が多く,計算コストが高いという課題がある。
- 境界付近の処理に集中することで,メモリ効率と推論速度の改善を目指す。
- BATSは,比較対象モデルの中でLiTS Diceスコアで最高の結果を達成した。
- BATSは,MedNeXt-Lと比較して,GPUメモリ使用量を53%以上削減した。
- データセットの境界密度によって,推論時間と精度が変化する。
カイロス:コレスキー分解に基づくLinUCBによるアイテムのコールドスタート下での数値的に堅牢なニュース推薦 [cs.CL, cs.LG, cs.IR]目的:地域市場におけるニュース推薦の実現
- ニュース推薦は,情報アクセスを効率化し,ユーザーの興味関心に合致する情報を提示する上で重要である。
- 現代の深層学習モデルは大量のインタラクションデータを必要とするが,ニュースは寿命が短く,記事プールが浅いため,データ不足に陥りやすい。
- データ不足下でも数値的に安定した推薦を実現し,低リソース環境での高性能なシステム構築を目指す。
- コレスキー分解による直接的なランク1更新を導入することで,数値的な安定性を確保し,シャーマン・モリソン逆行列計算の誤りを回避した。
- Matryoshka Representation Learning(MRL)を統合することで,推論遅延を軽減し,効率的な処理を実現した。
- Tagesschau APIを用いた実験により,特徴空間のセマンティックな冗長性を活用することで,ランキング精度を損なうことなく4.85倍の効率向上を達成した。
AdaBoostの厳密な汎化誤差限界 [cs.LG]目的:AdaBoostの汎化誤差限界
- 機械学習において,汎化性能の理論的保証はモデルの信頼性向上に不可欠である。
- AdaBoostの汎化誤差に対する厳密な上限は未だ十分に解明されていなかった。
- AdaBoostの汎化誤差に関するよりタイトな上限を導出すること。
- 本研究により,AdaBoostの汎化誤差が$\Theta\big(\tfrac{d\ln(n\gamma^{2}/d)}{n\gamma^2}+\tfrac{\ln(1/\delta)}{n}\big)$であることが示された。
- この上限は,弱学習器の優位性,VC次元,サンプルサイズ,信頼パラメータに依存する。
- 提案手法は,マージンに基づく汎化誤差限界とAdaBoostの出力特性を組み合わせることで導出された。
不確実性下での思考:言語モデルにおける証拠の利用と情報探索 [cs.LG]目的:言語モデルにおける思考時の証拠利用と情報探索のメカニズム解明
- 大規模言語モデルの性能向上は重要であり,その思考プロセス理解が不可欠である。
- 思考プロセスがどのように意思決定に影響するか,明確な理解が得られていない。
- 思考が証拠利用を改善するか,または将来の意思決定に役立つ情報探索を促進するかを検証する。
- 思考は現在の証拠に基づく行動を改善したが,情報探索へのシフトは確認されなかった。
- 思考の長さは,情報量の不均衡な状況で増加し,メタ認知制御を示唆する。
- 報告された確信度は意思決定の難易度に敏感になり,選択された証拠との関連性が強まった。
ToxScreen:LLMへのポイズニング検出 [cs.CR, cs.LG]目的:LLMのポイズニング攻撃に対するトリガーの検出と分析
- LLMが重要な分野で利用される中,セキュリティリスクへの対策が不可欠である。
- 学習データへの攻撃によるバックドアの埋め込みが,モデルの挙動を悪意的に操作する脅威となっている。
- 現実的な条件下でのバックドア検出手法の有効性を評価し,防御戦略を確立することを目指す。
- ToxScreenベンチマークを用いて800以上のバックドアモデルを評価した結果,勾配ベースのプロンプト最適化はトリガーの検出に失敗した。
- 攻撃成功率で候補をランク付けするトークン探索が,バックドアが有効な場合にはトリガーを検出できた。
- バックドアは,脱獄攻撃とは異なるメカニズムで動作することを確認し,脱獄攻撃のフィルタリングが可能になった。
表現から行動へ:LLMにおける人物・状況・行動の三者関係の探求 [cs.CL, cs.AI]目的:LLMにおける人物特性に関連する内部表現,状況を通じた特性の発現,および行動との関連性の解明
- 人間理解の深化に不可欠な性格特性の研究は,AIにおける人間らしい応答生成に役立つ。
- LLMの性格特性研究は,出力に偏っており,内部表現や状況との関係性が不明確である。
- 性格特性の内部表現とその状況依存的な発現,行動への影響を明らかにすること。
- LLMが性格特性に関連する制御可能な内部表現を持つことが示された。
- 特性に関連する内部表現への介入が,多様な状況下で一貫した行動変化を引き起こすことが確認された。
- 社会的な知能を必要とするタスクにおいて,人間研究と整合性の高い行動変化が観察された。
TREA-Net:デング熱発生予測のための転移可能な残差疫学的適応ネットワーク [cs.LG, q-bio.QM]目的:デング熱発生予測のための転移学習手法の開発
- デング熱の流行は世界中で深刻化しており,早期警戒システムの構築が重要である。
- 新たな監視システムでは,信頼性の高い予測モデルを訓練するための十分な過去データが得られない場合がある。
- 限られたデータでも高精度な予測を可能にする,転移可能なモデルの開発を目指す。
- TREA-Netは,既存のニューラルネットワーク予測モデルに環境時系列SIRモデルからの射影を追加することで,予測精度を向上させた。
- コロンビアとニカラグアの豊富なデータを用いて学習し,メキシコとマレーシアの限られたデータでも高い予測性能を示した。
- TiRexと統合することで,全ての対象データセットにおいて最小の平均絶対誤差を達成し,予測区間の幅も削減された。
視覚生成のための償却モーメントマッチング [cs.RO, cs.SY, eess.SY, cs.LG]目的:視覚生成におけるデータモーメント学習
- 近年,生成モデルの品質向上は重要であり,その評価指標の開発が求められている。
- 既存の評価指標は計算コストが高いか,表現力が不足している場合がある。
- 高次元データへの適用性と効率的な学習を実現する評価指標の提案。
- 提案手法は,ニューラルネットワークを用いてデータモーメントを学習し,分布学習の信号として活用する。
- AMFD損失は,FD損失と比較して,動的に条件付きモーメントを学習し,高次元データに容易に適用可能である。
- ImageNetやGenEvalベンチマークにおいて,既存手法を上回る性能が確認された。
ReCo:分布集中に対するGRPOの重み付けの再調整 [cs.LG, cs.AI]目的:言語モデルの事後学習におけるGRPOの性能低下とその原因の特定,および改善策の提案
- 大規模言語モデルの性能向上には,強化学習による微調整が不可欠である。
- GRPOは,大規模言語モデルの推論能力を低下させ,Pass@kを悪化させる可能性がある。
- GRPOが高確率な応答に集中することを抑制し,推論経路の網羅性を改善すること。
- ReCoは,応答の寄与度をロールアウトグループ内での期待出現頻度で正規化する。
- また,トークンレベルの重要度比率を分散に基づく比率に置き換えることで,飽和していない意思決定ポイントへの更新スケールを大きくする。
- Qwen2.5とLlama-3.1を用いた実験により,ReCoはPass@kを改善し,特にkが大きい場合に効果が認められた。
画像なしでの医療診断:Vision-Languageモデルの虚偽診断 [cs.CV, cs.AI, cs.CL, cs.CY]目的:画像なしの状況下におけるVision-Languageモデルの医療診断における虚偽診断のメカニズム
- 医療現場におけるAIの活用が期待される中,画像診断支援システムの精度と信頼性が重要課題となっている。
- Vision-Languageモデルは,画像情報なしに診断を下す際に,患者属性に基づいて誤った診断を下す可能性がある。
- 本研究は,画像なしでのVision-Languageモデルの虚偽診断の構造を明らかにし,安全な臨床利用のための評価方法を提示する。
- 大規模言語モデルは,画像なしで患者の属性情報のみを与えられた場合,誤った診断を下すことが確認された。
- 特に,Claude Opus-4.7とGPT-5.4は,患者属性によって診断結果が系統的に変化し,特定の属性に対して特定の疾患を頻繁に診断した。
- モデルの診断結果と根拠の乖離や,用いる単語による診断結果の変化など,虚偽診断には複数のパターンが存在することが示唆された。
人間の多様性が創発する集合的創造性:大規模言語モデルによるシミュレーションと持続可能性の限界 [cs.CL, cs.IR, cs.HC, cs.AI, cs.CY]目的:集合的創造性の多様性
- イノベーションの源泉は多様なアイデアであり,人間の多様性がその重要な基盤である。
- AIの利用が,多様な発想を均質化したり,人間の多様性を代替する可能性が懸念される。
- AI利用が集合的創造性の多様性に与える影響を検証し,その維持策を探る。
- AIによるアイデア生成は,全ての参加者の集合的創造性の多様性を低下させた。
- AIによるアイデア修正は,ある程度多様性を維持することが示された。
- AIによるシミュレーションは,人間の創造性の多様性には及ばず,むしろ退化させる傾向が見られた。ただし,第二言語話者による母語での利用は,個人評価と集団的多様性の両方を向上させる効果が示された。
受動的動画から編集可能な体験へ:具現化された知能のための物理的基盤を持つ体験合成 [cs.AI, cs.RO]目的:人間による操作動画をロボットが学習可能なデータに変換するフレームワーク
- 具現化されたAI研究において,モデル構築よりもデータ収集がボトルネックとなっている。
- 人間とロボットの形態の違いにより,既存の人間操作動画をロボットが直接学習することが困難である。
- この研究は,知識伝達を通じてこのギャップを埋め,ロボット学習のためのデータ生成を可能にする。
- Pegasusは,タスクグラフ,アフォードンスグラフ,制約グラフを用いてロボット計画グラフを生成する。
- 階層的なアフォードンス潜在空間により,オブジェクト固有のIDを超えた汎化が可能となる。
- 物理検証器によって無効な生成をフィルタリングし,実行可能性を向上させている。
行動は結果を伴う:介入テストによる結果への影響力検出 [cs.LG, cs.AI]目的:結果への影響力の検出
- 予測が結果に因果的に影響を及ぼす状況は,緩和ケアなど多くの分野で重要となる。
- 予測が結果に影響を与える場合,従来の評価指標は信頼性を損なう可能性がある。
- 介入テストを通じて結果への影響力を検出し,予測モデルの評価を改善すること。
- 提案手法OPABにより,異なる予測群の結果分布の差異を評価することで,結果への影響力を検出可能となった。
- OPABのサンプル複雑度に関する理論的限界を導出し,実験的に検証した結果,多くのケースで検出が可能であることが示された。
- サンプル数が少ない,または倫理的に問題がある状況下における検出可能性に関する示唆も得られた。
BioVLN:生体医学実験室における視覚言語ナビゲーションのためのシミュレーションプラットフォーム [cs.RO, cs.AI]目的:生体医学実験室における視覚言語ナビゲーションエージェントの開発と評価
- 生体医学実験ではロボットが実験機器へ自律的に移動する必要性が高まっている。
- 既存のナビゲーションプラットフォームは家庭環境向けであり,実験機器の操作に適さない。
- 実験機器への安全な接近と操作に必要な空間的制約を考慮したナビゲーションを可能にする。
- BioVLNは,実験機器を物理本体,クリアランス領域,操作領域の3つで表現する。
- 実験の結果,幾何学的探索による成功率は74.4~87.5%であった。
- 操作領域内の複数の有効な位置をサンプリングすることで,成功率は83.3~92.5%に向上し,危険な近接性が減少した。
2回の呼び出しが5つのエージェントに勝る:ローカル言語モデルに対する自己改善と比較したマルチエージェントパイプラインの評価 [cs.LG]目的:ローカル言語モデルにおけるマルチエージェントパイプラインの有効性に関する評価
- 大規模言語モデルの推論能力向上は重要であり,そのためにマルチエージェントシステムが注目されている。
- マルチエージェントシステムは複雑になりがちで,ローカルモデルへの適用は困難を伴う場合がある。
- ローカルモデルにおけるマルチエージェントパイプラインの性能限界と改善策を明らかにすること。
- マルチエージェントシステムは,JSON形式のデータで精度が低下するが,テキスト形式で改善されることが示された。
- 2回の自己改善戦略はGSM8Kで高い精度を達成する一方,HumanEvalでは性能を悪化させる場合がある。
- タスクを考慮したゲート付き再設計により,HumanEvalにおける精度を維持することが可能となった。
時間中心化されたSIGRegがマルチタスクLeWorldModel学習を改善:分析から手法へ [cs.LG, cs.RO]目的:マルチタスク学習におけるLeWorldModelの性能向上
- 近年,ピクセルから世界モデルを学習する手法が注目されており,ロボット工学等への応用が期待されている。
- 既存のSIGRegは単一タスクでは有効だが,マルチタスク学習では性能が低下するという課題があった。
- タスク間の表現の混同を防ぎ,安定したマルチタスク世界モデル学習を実現すること。
- 時間中心化された残差にSIGRegを適用することで,タスク間の表現の分離を維持し,学習の安定性を向上させた。
- LIBEROベンチマークにおいて,long-horizon suiteでの成功率を1.7倍に改善し,全suiteの平均成功率を53.2%から73.6%に向上させた。
- 外部事前学習なしで,スクラッチから学習したDiffusion Policyをわずかに上回り,大規模事前学習済みポリシーの性能に匹敵する結果を得た。
同じ証拠,異なる対象:言語モデルの状態から診断的証拠が因果的問いにどう影響するかを解読する [cs.OS, cs.CL, cs.CL, cs.LG]目的:診断的証拠と因果的問いの関係性の解明
- 因果推論は科学的探求や意思決定において不可欠であり,その妥当性確認が重要である。
- 診断的証拠が,対象とする集団や結果,推定対象によって解釈が変動しうる。
- 言語モデルの内部状態が,診断的証拠と因果的問いの関係性を捉えているか検証する。
- 言語モデルの最終層の隠れ状態には,診断的証拠が因果的問いを支持,反駁,または無関係であるかを線形的に解読可能な情報が含まれる。
- Qwen2.5-7B-Instruct,Qwen3-8B,Llama-3.1-8B-Instructにおいて,正答率は0.654~0.659であり,18~21組のペアが正しく復元された。
- 開発セットを用いない線形読み出しにおいても,診断的証拠と因果的問いの関係性の情報を捉えることが確認された。
モデル対照型連合学習におけるアラインメントチェックによるバックドア攻撃への防御 [cs.CR, cs.AI, cs.LG]目的:連合学習におけるバックドア攻撃に対する防御策
- エッジコンピューティング環境下での連合学習の普及に伴い,セキュリティリスクへの対策が重要である。
- 連合学習は分散型であるため,バックドア攻撃を受けやすく,既存の防御策は十分ではない。
- 統計的異質性やバックドア攻撃の隠蔽性を考慮し,正常なローカル更新のずれを検出・排除する。
- 提案手法FedDABは,ローカルコントラスト正則化とアラインメントチェックを組み合わせることで,バックドア攻撃に対して高い防御性能を発揮する。
- FedDABは,正常な更新間の方向性と大きさを一貫させるモデル対照項を導入し,アラインメントチェックで異常なパターンを排除する。
- 理論的に収束率$\mathcal{O}(1/T)$のロバスト性を示し,実験的にも既存手法を上回る有効性が確認された。
AIエージェントの検出に必要なものは何か:ブラウザ自動化下における行動検出のための最小限の特徴セット [cs.AI, cs.CR]目的:AIエージェント,ボット,人間のトラフィックを識別するための三クラス検出フレームワークの構築
- ウェブアクセスにおけるボットの識別は,セキュリティやサービス利用において重要である。
- 従来の二値分類では,ブラウザ自動化によるAIエージェントのような中間的な存在を正確に区別できない。
- AIエージェントを正確に識別し,誤検知を減らすための最小限の特徴セットを特定すること。
- 従来の二値分類器では,AIエージェントを人間に誤分類する割合が高いことが示された(34.5%~39.1%)。
- AIエージェントのクラスを明示的に追加することで,AIエージェントのF1スコアは1.000となり,識別精度が向上した。
- マウスイベントの頻度とテレポートクリック比率の2つの特徴量のみで,AIエージェントを100%の再現率で検出可能であり,精度の高い識別を実現した。
ニューラルアンサンブル探索における代理モデルを用いた多様性推定 [cs.LG]目的:ニューラルアンサンブルの多様性推定手法
- 深層学習モデルの性能向上とロバスト性確保に,アンサンブル学習が不可欠である。
- ニューラルアーキテクチャ探索(NAS)は計算コストが高く,アンサンブル探索(NES)では探索空間が指数関数的に増加する。
- 計算効率的に高性能かつ多様なアンサンブルを探索すること。
- 予測精度と多様性のポテンシャルを推定する2つの代理モデルを導入し,効率的なNESフレームワークを構築した。
- 提案手法は,FashionMNIST,CIFAR-10,CIFAR-100において,既存手法(Deep Ensembles,Random Search)と同等以上の性能を達成した。
不確実性ゲートを用いた信念に基づく意思決定:囲碁における試み [cs.AI]目的:不確実性ゲートによる信念に基づく意思決定の実現
- 囲碁AIは,AlphaZero等の進歩により目覚ましい成果を上げている。将来的には,より手軽な環境での利用が期待される。
- 従来の囲碁AIは,大規模な計算資源を必要とするモンテカルロ木探索に依存しており,小規模なハードウェアでは推論速度が制限される。
- 本研究では,探索を減らし,より少ない計算資源で高いパフォーマンスを実現することを目指す。
- 提案手法は,従来の価値関数とは異なり,信念ヘッドを用いて戦略的安定性と認識的不確実性をモデル化する。
- 実験結果から,本手法は探索を必要としない勝率を向上させ,誤った高信頼度な手を減少させる効果が示された。
- 限られたハードウェア環境下でもプロレベルの対局を可能にする。
継続的指示チューニングのための漸進的マルチモーダルアラインメント [cs.CV, cs.AI]目的:マルチモーダル大規模言語モデルにおける,視覚表現と言語埋め込み空間のアラインメント維持
- マルチモーダルLLMの性能は,視覚情報と言語情報の適切なアラインメントに大きく依存する。
- 継続的な指示チューニングにおいて,視覚分布の変化によりアラインメントが不安定化し,性能劣化を引き起こす。
- アラインメントの安定性を保ちつつ,新たな視覚分布に適応する手法を開発し,性能低下を防ぐ。
- 提案手法PMAは,軽量な表現記述子を用いてマルチモーダル分布の変化を検出し,必要に応じて専門家ネットワークを拡張する。
- PMAは,既存のアラインメントを固定しつつ,柔軟に変化に対応することで,安定性と可塑性のバランスを実現する。
- 2つのMCITベンチマーク実験で,PMAが既存手法を上回り,様々なLLMバックボーンで高い性能を発揮することが示された。
SymmGrid:並列化された対称性と自己中心的・他者中心的視覚認識によるロボット学習の超規模化 [cs.CL, cs.RO, eess.SP, cs.CL, cs.RO, cs.AI, cs.LG]目的:ロボットの対称性を並列化し,自己中心的・他者中心的視覚認識を活用することで,ロボット学習を高速化する手法
- ロボットの物理環境における強化学習は,実用化に向けて学習時間の短縮が重要な課題となっている。
- 従来のロボット学習では,学習に時間がかかり,効率的な学習手法が求められていた。
- 対称性を活用し,学習データの多様性を高めることで,ロボット学習の効率化と性能向上を目指す。
- SymmGridは,壁時計時間での学習収束を1.37~2.17倍高速化することに成功した。
- 評価成功率を1.09~1.27倍改善し,最も速い学習収束時間はそれぞれ16.6分,10.9分,79.3分であった。
- 軌道全体での評価では,正規化された曲線下面積(nAUC)比率が最大2.59倍に向上した。
因果的マスク変圧器の構成的理論 [cs.FL, cs.LG]目的:因果的マスク変圧器が任意の長さの入力に対して解ける決定問題の種類
- 自然言語処理の発展において,変圧器モデルの能力理解は不可欠である。
- 有限精度環境下では,注意機構の情報保持と計算能力が変動し,理論的な解析が困難である。
- 変圧器の内部動作から表現力を導出し,その限界を明確にすること。
- 提案手法は,変圧器の記憶(prefix情報)を代数的に形式化し,表現力を導出する。
- 位置埋め込みのない変圧器に対し,注意機構の種類に応じた表現力の階層構造を明らかにした。
- 四種の注意機構は,それぞれ特定の半群に対応し,理論的限界が明確化された。
顔認証における偽造検出のための基盤モデル:統一された線形プローブベンチマーク [cs.RO, cs.LG]目的:顔認証における偽造検出性能の評価
- 顔認証技術は広く普及しているが,偽造によるセキュリティリスクが懸念されている。
- 異なるデータセット間での性能劣化が課題であり,汎化性能の向上が求められている。
- 事前学習済み基盤モデルの有効性を検証し,少量のデータでの学習可能性を探る。
- 事前学習済みモデルは,線形分類器のみで高いデータセット内での偽造検出性能を示す。
- しかし,その性能はデータセット間で一貫して転移せず,ドメインシフトの影響を受ける。
- InternViT-6Bはデータセット内エラー率が最も低く,CLIP ViT-B/32はデータセット間転移と計算量のバランスが良い。
エージェントスネア:自律的な侵入エージェントの遅延,誘導,無効化の学習 [cs.CR, cs.CL, cs.LG]目的:自律型侵入エージェントに対する動的な欺瞞環境
- サイバー攻撃の自動化が進む中で,侵入テストの効率化が重要課題となっている。
- 既存の防御策は静的な欺瞞物に依存しており,高度なエージェントに回避される可能性がある。
- エージェントの行動履歴に応じた動的な欺瞞環境により,攻撃を遅延・誘導・無効化すること。
- AgentSnareは,欺瞞環境を展開し,エージェントを現実の標的から継続的に誘導する。
- 15のCVE-Benchウェブアプリケーションで,エージェントの46.8%のツールコールを欺瞞環境で吸収した。
- 90.0%の完了試行は欺瞞環境の証拠に基づき,現実の標的への攻撃を成功させなかった。
潜在世界モデルは何を知ることができるか:マルチモーダル予測表現における物理パラメータの識別可能性 [cs.IR, cs.SC, math.RA, cs.CC, cs.CC, math.CO, cs.LG, cs.RO]目的:潜在世界モデルにおける物理パラメータの識別可能性
- 環境との相互作用を通じて学習するモデルの物理法則理解は,ロボット工学やAI研究において重要である。
- 潜在空間表現が物理的な情報をどの程度正確に捉えているか,その評価方法が確立されていない。
- 物理パラメータが潜在空間にどのように表現されているかを明らかにし,識別可能性を評価する。
- 学習された潜在表現が,環境の物理量を内在化しているか否か,制御された介入実験により検証された。
- 接触の予測が,潜在空間における剛性パラメータの獲得に不可欠であることが示された。
- 予測目標の構造が,獲得される物理パラメータを決定し,追加データは既に獲得済みのパラメータを改善するのみである。
BayesAME:ベイジアン活性モデル評価 [eess.SY, cs.SY, cs.CL, cs.LG, cs.AI, stat.ML]目的:大規模生成モデルのベンチマーク評価におけるコアセットサイズの自動決定
- 生成モデルの性能評価は重要であり,その効率化が求められている。
- 従来のコアセット法はコアセットサイズを手動で設定する必要があった。
- 性能推定の信頼性を優先し,自動的に適切なコアセットサイズを決定すること。
- BayesAMEは,コアセットサイズを逐次的に決定するベイジアンフレームワークである。
- 実験の結果,BayesAMEは既存手法と比較して優れた性能を示した。
- 非ランダムなコアセット選択がランダム選択よりも有利であることが確認された。
TreeCCA:勾配ブースト木による正準相関分析 [cs.LG]目的:正準相関分析のための勾配ブースト木アンサンブルの学習
- 表形式データの機械学習において,勾配ブースト木は高い性能を発揮する。
- 従来の正準相関分析は線形またはニューラルネットワークのエンコーダに依存していた。
- 勾配ブースト木アンサンブルを正準相関分析のエンコーダとして利用し,解釈性と非線形性を両立すること。
- TreeCCAは,合成ベンチマークにおいてDeep CCAと同等またはそれ以上の性能を示した。
- 疎なベンチマークでは,真のサポートを高い精度で復元し,PMDを上回った。
- UCI HARセンサー融合ベンチマークでは,Deep CCAと同等の精度を5分の1のコストで達成し,物理に基づいた仮説を検証した。
HoF-Bench:最先端モデルを用いずにAIが発見した実際の脆弱性を再発見する [cs.CY, cs.CR, cs.LG]目的:AIが発見した実際の脆弱性の再発見
- ソフトウェアの安全性確保は重要であり,脆弱性の早期発見が不可欠である。
- 既存の脆弱性検出手法では,AIが発見した脆弱性の再現性が課題となっていた。
- AIによる脆弱性発見の信頼性と再現性を評価する基準を確立すること。
- HoF-Benchは,AIが発見した95件の脆弱性を基にしたベンチマークである。
- 厳格な評価プロトコル下で,ミニマルなLLMベースの解析器が65件の脆弱性を再発見した。
- 最先端モデルは,本研究において脆弱性の検出に貢献しなかった。
宝くじチケットはデプロイチケットではない [cs.LG, cs.CV]目的:モデルの振る舞いに対するスパース化,圧縮,宝くじチケットの影響評価
- 深層学習モデルの効率的なデプロイは,計算資源の制約や運用コスト削減の観点から重要である。
- スパース化手法がモデルの振る舞いに与える影響は一様ではなく,場合によっては性能劣化を引き起こす可能性がある。
- 既存モデルを置き換える際の,振る舞いの互換性を定量的に評価し,デプロイにおけるリスクを明確にすること。
- スパース化されたモデルは,元のモデルと同程度の精度を回復するものの,振る舞いには差異が見られた。
- 特に,固定閾値ポリシーを用いる場合,宝くじチケットによる置き換えは,accept-reviewの決定を7〜10%変更させる。
- 精度の改善だけでは,既存システムとの完全な互換性を保証できず,ダウンストリームの再設定や検証が必要となる場合がある。
ビデオ表現の正則化による誤差の累積軽減 [cs.CV, cs.LG]目的:ビデオ拡散モデルにおける誤差の累積機構の解明と,長期生成の安定化
- ロボティクスや自動運転など,長期間のビデオ生成は重要性を増している。
- ビデオ生成における自己回帰推論では,誤差が累積し,フレーム品質が低下する問題がある。
- モデル内部表現の劣化を抑制し,長期的な安定生成を実現することを目指す。
- ビデオ拡散モデルにおける誤差の累積は,隠れ表現の次元崩壊と密接に関連することが明らかになった。
- 誤差の累積度合いを定量化する指標として,表現の有効ランク(erank)の低下が確認された。
- ビデオ表現の正則化により,VBenchにおける画質評価指標が大幅に向上した。
GPTQ-2D:三次時間で実行される二側適応丸め [cs.DS, cs.LG]目的:二側適応丸め手法の効率化
- 量子化はモデル圧縮に不可欠であり,推論速度向上に貢献する。
- 既存手法は計算コストが高く,大規模モデルへの適用が課題である。
- 二側適応丸めにおける計算量を削減し,実用的な量子化を実現する。
- 本研究では,GPTQ-2Dという新しい手法を提案し,既存手法よりも計算量を大幅に削減した。
- GPTQ-2Dは,行列の反対角線ごとに並行して丸め処理を行うことで,計算量を四次時間から三次時間に短縮した。
- これにより,大規模モデルの効率的な量子化が可能となり,推論速度の向上が期待される。
