arXiv雑要約
AI - 2026/07/31 公開
AIレッドチーム評価が証明できることとできないこと [cs.AI, cs.CR]目的:AIモデルのレッドチーム評価における証明可能性の限界
- AIの安全性評価は,社会実装において不可欠であり,その信頼性確保が重要である。
- AIの安全性評価は主観に左右されやすく,客観的な基準と評価方法が確立されていない。
- 評価予算内で得られる証拠の限界を定量的に示すことで,評価の妥当性を判断する。
- 評価の「証拠上限」を定義し,ベンチマークにおける有害率と証拠の強さの関係を明確化した。
- 特定の有害率を超えると,ベンチマークは一定の安全性基準を満たすことを示す証拠となり得る。
- 現在のベンチマークは高頻度な有害カテゴリーには有効だが,稀に起こる壊滅的な事象には不十分である。
エージェントチーム作業領域:長寿命のClaudeコードエージェントチームのための自動化された永続的な作業空間 [cs.AI, cs.LG, cs.MA]目的:長寿命のClaudeコードエージェントチームにおける,作業状態の永続化と効率的なタスク連携の実現
- LLMエージェントは,コーディングやプログラミングのワークフローを大幅に改善し,ソフトウェア開発の生産性向上に貢献する。
- 従来のLLMエージェントチームでは,作業状態が失われたり,詳細が曖昧になったりし,長期的なプロジェクトの維持・管理が困難になる。
- ATWZは,エージェントの状態をファイルシステムに保存することで,中断からの復旧を容易にし,技術的負債を軽減することを目指す。
- ATWZは,各エージェントを「従業員」として扱い,作業状態を専用のディレクトリ「ワークステーション」にファイルとして保存する。
- これにより,圧縮による知識の喪失を防ぎ,中断後もチームを単一のコマンドで復元可能にする。
- また,エージェント間でのドキュメント共有を可能にし,プロンプト作成の負担を軽減することで,タスク連携を円滑化する。
キャッシュ検索:ビデオ拡散におけるテスト時検索のための訓練不要キャッシュ探索 [cs.AI, cs.CV, cs.MM]目的:ビデオ拡散モデルにおけるテスト時検索の効率と品質の向上
- ビデオ拡散モデルは高品質な動画生成を可能にするが,計算コストが高いという課題がある。
- テスト時検索は計算コストを削減するが,候補生成に依然として大きな計算資源を要する。
- キャッシュ探索により,計算コストを抑えつつ,テスト時検索の性能を維持・向上させることを目指す。
- 訓練不要のキャッシュ手法を用いることで,候補生成の速度を向上させ,画質劣化を最小限に抑えることができた。
- キャッシュによる候補ランキングへの影響は軽微であり,自己制限的な傾向が見られた。
- 提案手法「キャッシュ検索」は,計算コストを削減しながら,既存手法と同等の性能を達成し,さらなる性能向上も示した。
LU-500:概念アンラーニングのためのロゴベンチマーク [eess.SY, cs.SY, cs.RO, cs.CV, cs.AI]目的:テキスト画像生成モデルにおける保護または危険な視覚的概念の再現を制限するための概念アンラーニングの評価
- テキスト画像生成モデルの安全性向上は重要であり,意図しない概念の再現を抑制する必要がある。
- 既存研究では,ロゴのような局所的で複雑な概念のアンラーニングは十分には検証されていない。
- ロゴのアンラーニングに特化したベンチマークを構築し,その困難性を明らかにすることを目指す。
- LU-500ベンチマークは,フォーチュン・グローバル500企業のロゴを用いて,明示的・暗示的な評価トラックを提供する。
- 評価対象手法は,ロゴの除去と画像全体の保全のバランスを取ることに苦慮していることが示された。
- ロゴの面積,位置,構造的複雑さがアンラーニングの難易度に影響することから,空間認識型制御の必要性が示唆された。
機械学習から大規模EO製品へ:地図作成におけるベストプラクティス [cs.CL, cs.RO, cs.LG]目的:大規模地球観測データを用いた地図作成における推奨される手法
- 地球観測技術は,環境変化の監視や資源管理など,多岐にわたる分野で不可欠である。
- 機械学習の進歩により地図作成の障壁は低下したが,確立されたベストプラクティスは未だ存在しない。
- 衛星データから信頼性の高い地図を作成するための,各段階における最適な手法を提示する。
- 本研究では,衛星データから運用地図製品に至るまでの,一連の推奨プラクティスを提示する。
- 議論は,地球観測データ基盤,データ選択と前処理,機械学習データセット構築とモデル学習の6つの相互に関連するテーマを中心に展開される。
- 不確実性の定量化と地図の独立した検証にも焦点を当て,各段階における注意点を解説する。
オンポリシー拡散蒸留におけるクラシファイアーフリーガイダンスの再検討 [cs.CV, cs.AI, cs.LG]目的:オンポリシー拡散蒸留におけるクラシファイアーフリーガイダンスの挙動に関する理解
- 拡散モデルは画像生成などの分野で高い性能を発揮しており,その応用範囲は広い。
- オンポリシー蒸留におけるクラシファイアーフリーガイダンスの適切な活用方法は未解明な点が多い。
- ネガティブブランチの非対称性に着目し,ブランチを意識した新しい学習方法を提案する。
- 従来の学習方法は,ブランチレベルで誤差が相殺され,教師モデルと生徒モデルの間の知識伝達が不十分になる場合があることが示された。
- 提案手法であるPositive--Direction Matching (PDM)は,ポジティブブランチとCFG条件方向を個別に制約することで,この問題を解決する。
- ビデオ制御の実験では,PDMは従来の学習方法よりもロバストで効果的な知識伝達を可能にすることが確認された。
SpecPrefetch:スパースMoEファウンデーションモデルのためのパラメータ効率的な専門家プリフェッチング [cs.AI, cs.LG]目的:スパースMoEモデルにおけるオフロードされた専門家推論のためのパラメータ効率的なプリフェッチング手法
- 大規模言語モデルの性能向上には,モデルの規模拡大が不可欠である。MoEモデルはその有効な手段となり得る。
- MoEモデルの全専門家プールは,限られたアクセラレータメモリ下でのデプロイが困難であるという課題がある。
- ルーティング依存の転送ボトルネックを解消し,効率的な専門家ロードを可能にすることで,推論速度の向上を目指す。
- SpecPrefetchは,軽量なアダプターを用いて次のレイヤーの専門家候補を予測し,非同期転送を可能にする。
- これにより,転送遅延を削減し,事前学習済みのルーティングセマンティクスを変更することなく,モデル出力への影響を抑制する。
- Qwen3-VL-30B-A3BおよびDeepSeek-VL2-Tinyにおいて,既存手法と比較して高い専門家リコール率とデコーディングスループットの向上を達成した。
表現駆動型パラメータ効率推薦システム [cs.IR, cs.CL, cs.IR, cs.AI]目的:大規模言語モデルを用いたパラメータ効率推薦システムの構築
- 推薦システムは,情報過多な現代において,ユーザーのニーズに合致する情報を提供する上で不可欠である。
- 既存のLLMベース推薦システムは,学習コストや導入コストが高いという課題がある。
- 学習済みモデルの変更を最小限に抑えつつ,高精度かつ効率的な推薦を実現することを目指す。
- REPRECは,軽量なユーザー表現アライメントにより,LoRAよりも優れた性能を示す。
- 異なる事前学習済みSequential EncoderやLLMバックボーンとの互換性を維持し,モジュール性と実用性を実現する。
- 特に,データ不足の状況下で高い効果を発揮し,学習時間も短縮できる。
コンフォーマルカスケード:多層LLM推論に対する分布フリーな精度保証 [cs.LG]目的:多層LLM推論における精度保証
- LLMの利用拡大に伴い,推論コストの削減が重要課題となっている。
- 既存のカスケード推論では,モデルの信頼度スコアの誤校正により,精度保証が困難である。
- 信頼性のある精度保証を提供し,推論コスト削減と精度の両立を目指す。
- 提案手法(コンフォーマルカスケード)は,分布フリーかつ有限サンプルでの精度保証を提供する。
- 各層における予測集合は,指定された有意水準αに対して,少なくとも1 - Kαの確率で正解を含む。
- 複数のベンチマークで,既存手法と比較して精度が向上しており,特に推論能力を要する問題で効果を発揮する。
長期コンテキストにおける指示に従うエージェントのベンチマーク:HANDBOOK.md [cs.AI, cs.CL]目的:長期的な指示遵守を伴うエージェントの性能評価
- AIエージェントの活用が拡大しており,指示に基づいた自律的な行動が求められている。
- 既存のベンチマークでは,長文の指示がエージェントの行動をどのように制約するか評価が不十分である。
- 企業における社員の行動規範遵守をモデル化し,指示の遵守度を厳密に評価するベンチマークを開発する。
- HANDBOOK.mdは,金融,医療,保険など五つの分野,十社の架空の企業環境で構成される65のタスクを含む。
- 厳格な評価基準の下では,最良のモデル構成でさえ約36%のタスクしか成功させられず,多くのモデルは25%を下回る。
- 失敗パターンとしては,環境内の要求に指示を上書きされたり,結果に反して行動したり,長期的な指示を忘却したりすることが挙げられる。
重い裾を持つノイズにおける確率的最適化の量子加速 [cs.LG]目的:重い裾を持つ勾配ノイズを伴う確率的最適化
- 機械学習や深層学習において,確率的最適化は重要な役割を担う。ノイズの影響を軽減することが課題。
- 重い裾を持つノイズは,従来の最適化手法では収束が遅れるという問題がある。
- 量子計算を利用し,重い裾を持つノイズに対する最適化を効率化することを目指す。
- 本研究では,多変量重い裾を持つ確率変数に対する量子平均推定量を提案し,古典的な推定量よりも低いクエリ複雑度を達成した。
- 量子正規化確率的勾配降下法(QNSGD)を提案し,量子確率的勾配オラクルへのクエリ回数を大幅に削減することを示した。
- 特に低次元の場合において,従来の古典的な下限と比較して,非凸問題および凸問題において,量子アルゴリズムの優位性を示した。
エージェントのスキルは重要:実行軌跡からの独自スキルの推論 [cs.AI]目的:独自スキルの推論
- エージェントのスキルは,再利用可能な手続きをパッケージ化し,性能向上に貢献する。市場での収益化やクラウド環境での展開が容易。
- 高付加価値なスキルを秘匿するインセンティブがある一方,その行動の影響は実行軌跡から観察可能となる。
- 実行軌跡から,参照解答や成功ラベルなしに独自スキルを再構築することを目指す。
- 提案手法SigLeakは,エージェントの行動におけるスキル署名に着目し,スキル対応・非対応軌跡を比較することで,独自スキルを推論する。
- 5つのシナリオ,3つのモデルファミリー,3つのエージェントフレームワークで,SigLeakは既存手法を上回る,または同等の性能を示した。
- 特に,スキル無効化時の成功率を平均6.88%向上させ,意味的類似度指標SkillSimにおいても最高値を示した。
LLM生成による推奨理由の説明を通じた持続可能な選択への働きかけ [cs.AI]目的:持続可能な選択を促すための推奨システムにおける説明の影響
- 消費行動の多様化に伴い,推奨システムが個人の選択に与える影響は大きい。
- 既存の説明は,必ずしも持続可能性を考慮した選択を促すものではない。
- 推奨理由の説明に持続可能性に関する情報を組み込むことで,消費者の行動変容を促す。
- 推奨理由の説明に持続可能性情報を開示するだけでは選択は変わらないが,情報の提示方法や社会規範を導入することで,持続可能な選択が増加した。
- 持続可能性情報を開示しても,説明の評価は向上するものの,必ずしも行動の変化には繋がらないことが明らかになった。
- LLMを活用することで,理論に基づいた説明を大規模に生成し,社会貢献に繋がる介入が可能となる。
デスクトップ・デルタ・ベンチ:コンピュータ使用モデルはデスクトップGUIの遷移を理解しているか? [cs.AI, cs.CV]目的:デスクトップGUI遷移の因果関係を再構成する能力の評価
- 複雑なタスク遂行において,GUIを通じたコンピュータ操作が不可欠であるため。
- 既存の評価指標では,GUI操作の因果関係を特定できず,モデルの信頼性検証が困難である。
- GUI遷移における状態検証,ソース追跡,文脈対応制御の能力評価指標を提示し,モデルの改善を目指す。
- Desktop-Delta Bench(DDB)は,GUI遷移の因果関係を評価するオフラインベンチマークである。
- 3フレームの時系列順序タスクと,行動前後のペアタスクにより,モデルの性能を評価した結果,明確な課題が残存する。
- タスクの文脈が誤認識の特定には役立つが,正確性とのトレードオフが存在し,改善の余地がある。
コスト制約のある四脚ロボットにおける強化学習 [eess.SY, cs.SY, cs.RO, cs.AI]目的:低コストロボットプラットフォームにおける強化学習の実現
- ロボット工学の発展は,現実世界での自律動作を可能にする上で不可欠である。
- シミュレーションと現実の乖離が大きく,低コストロボットでの制御が困難である。
- 遅延やノイズに対するロバストな制御を実現し,現実環境での強化学習を可能にする。
- 平均的なアクチュエータ遅延のモデルと時間認識型ニューラルネットワークを用いることで,ロバストな歩行を実現した。
- 時間認識型ニューラルネットワークは,脊椎動物の脊髄に見られるCPG(中枢パターン生成器)を学習した。
- 時間的自己組織化は,低コスト四脚ロボットの歩行制御において有効な戦略であると考えられる。
WhisperRec:効率的な基盤推薦モデルのための潜在的推論 [cs.IR, cs.AI]目的:基盤推薦モデルにおける効率的な潜在的推論の枠組み
- 大規模言語モデルの発展に伴い,その推論能力を推薦システムに応用する研究が活発化している。
- 従来のCoTによる推論は,長い説明生成による推論コストや,固定テンプレートの限界がある。
- 教師データのCoTを潜在的トークンに圧縮し,低遅延で多様なユーザー興味に対応することを目指す。
- WhisperRecは,明示的なCoT手法や従来の基盤モデルと比較して,推薦性能で一貫して優れた結果を示した。
- SID@64において,CoTを用いる手法と比較して17.44%の改善,用いない手法と比較して9.33%の改善を達成した。
- オンライン推論スループットは,明示的なCoT手法と比較して10倍以上向上した。
憲法に基づく中間学習:コンテンツの存在がアライメントの向上を促進する [cs.CL, cs.AI, cs.CY, cs.LG]目的:アライメントの向上
- 大規模言語モデルの安全性と倫理的な利用が重要視されており,アライメントはその鍵となる。
- 事後学習によるアライメントは浅く,ファインチューニングで脆弱になりやすいという課題がある。
- 中間学習段階で憲法に基づくコンテンツを導入し,持続的なアライメントを実現することを目指す。
- 憲法に基づく中間学習モデルは,アライメントの汎化性と耐久性において,対照群を上回る性能を示した。
- 特に,脅迫に対する脆弱性において,SFTによる悪影響を憲法に基づく中間学習が緩和し,その効果はさらにファインチューニング後も持続した。
- 憲法に基づくコンテンツの存在が,その構造よりも重要であり,能力への悪影響は見られなかった。
予算を考慮したLLM探索:コスト較正されたフロンティアユーティリティ [cs.CL, cs.LG, cs.AI]目的:LLM探索における品質とコストのバランス
- 科学的発見やアルゴリズム開発において,LLMによる探索が重要性を増している。
- 既存手法では,コストを考慮せずスコアの進捗のみで評価するため,効率が低い。
- コストと品質を考慮した効率的な探索手法を開発し,限られた予算で最大限の成果を得る。
- CostAdaは,既存の最高性能手法と同等の品質を,最大で半分の予算で達成した(16組中12組)。
- GLM-5とGPT-5.4の8つのベンチマークにおいて,CostAdaは最高の平均最終品質を示した。
- コストと残予算が探索の方向性を決定し,単なる会計変数ではない点が特徴である。
カイロス:コレスキー分解に基づくLinUCBを用いた,アイテムのコールドスタート下における数値的に安定なニュース推薦 [cs.LG, cs.IR]目的:アイテムのコールドスタート下における,数値的に安定なニュース推薦手法
- 地域市場のニュース推薦は重要である。しかし,深層学習モデルは大量のデータが必要となる。
- ニュース記事は寿命が短く,記事プールも浅い。これにより,協調フィルタリングに必要なデータが不足する。
- データ不足を文脈的オンライン学習で克服し,数値的安定性を確保することを目指す。
- カイロスは,コレスキー分解による直接的なランク1更新を用いることで,数値的な安定性を実現した。
- Matryoshka表現学習を統合することで,推論遅延を抑制し,効率性を向上させた。
- Tagesschau APIを用いた実験により,特徴空間のセマンティックな冗長性を活用することで,4.85倍の効率化が確認された。
顔認証へのプレゼンテーション攻撃検出のための基盤モデル:統一された線形プローブベンチマーク [cs.AR, cs.RO, cs.LG]目的:顔認証へのプレゼンテーション攻撃検出における基盤モデルの性能評価
- 顔認証技術の普及に伴い,セキュリティ上の脅威であるプレゼンテーション攻撃の検出が重要である。
- 異なるデータセット間での性能低下が課題であり,ドメインシフトへの対策が求められている。
- 事前学習済みモデルを活用し,少ない学習データで高性能な検出器を構築することを目指す。
- 事前学習済み基盤モデルの表現は,線形分類器のみで高いデータセット内性能を示す。
- しかし,その性能はデータセット間で一貫した転移を示さない。
- InternViT-6Bはデータセット内エラーが最も低く,CLIP ViT-B/32は転移性能と計算量のバランスが良い。
潜在世界モデルは何を知っているか:マルチモーダル予測表現における物理パラメータの識別可能性 [cs.LG, cs.RO]目的:潜在世界モデルにおける物理パラメータの識別可能性
- ロボットの知能向上には,物理世界の理解が不可欠であり,その表現獲得が重要である。
- 潜在空間表現が,どのような物理量を内部に保持しているのか明確ではない。
- 予測表現における物理パラメータの識別可能性とその決定要因を明らかにすること。
- 訓練された潜在空間は,接触硬さの予測が求められた場合にのみ,その情報を保持することが示された。
- ドラッグの識別可能性は,回復可能性は高いものの,予測目標によっては十分に学習されないことがわかった。
- 目的構造が潜在空間が獲得する物理パラメータを決定し,データ量の増加はそのパラメータの精度向上に貢献する。
ScratchSim:表面傷検出のための手続き型合成データパイプライン [cs.CV, cs.AI]目的:表面傷検出のための合成データ生成パイプライン
- 産業界における品質管理において,自動欠陥検出は重要な役割を担う。
- 欠陥データの注釈付きデータ不足が,自動欠陥検出の課題となっている。
- 大規模な合成データを用いて,実データ不足時の欠陥検出性能向上を目指す。
- 合成データで事前学習することで,実データのみでの学習を上回る性能が示された。
- 実データが少ない状況下では,合成データと実データを混合した学習が有効であることが確認された。
- 本手法は,大規模な注釈付き実データなしで,スケーラブルな欠陥検出を可能にする。
マルチモーダル空間推論における視覚的貢献度評価 [cs.CV, cs.AI]目的:マルチモーダル空間推論ベンチマークにおける視覚情報の貢献度評価
- 視覚情報と言語情報を組み合わせた推論は,AIの知能化において重要である。
- 既存の空間推論ベンチマークは,画像がなくても正解に到達できてしまう場合がある。
- 画像が正解にどの程度貢献しているかを客観的に評価する手法を開発する。
- 視覚的貢献度評価(VCA)により,モデルの判断に対する画像の貢献度と,関係性特有の視覚的証拠への応答を分離できることが示された。
- 多くのモデルにおいて,正解でありながら画像によるサポートが確認できないケースが12.73-26.25%存在することが明らかになった。
- 画像のシャッフル実験により,画像の貢献度が有意に低下することが確認され,VCAの有効性が裏付けられた。
分散結合サンプラーと証明済み経験的輸送のためのフィールドコード [cs.CC, cs.IT, cs.LG, math.IT, math.OC]目的:経験的最適輸送における分散結合サンプリング,コスト評価可能な結合出力,スカラー値認証サンプリングの通信タスク
- 最適輸送は,統計モデリング,機械学習,画像処理など広範な分野で不可欠なツールである。
- 大規模データセットにおける効率的な最適輸送計算は,計算コストと通信コストの面で課題が残る。
- フィールドコードを用いて通信量を削減し,認証可能なサンプラーを構築することで,効率的な輸送計算を実現すること。
- 本研究では,最適輸送フィールドを近似するフィールドコードを完成させるコンパイラを提案し,正確な周辺を持つ値認証サンプラーを生成する。
- 提案手法により,認証の精度はターゲット分割の直径のみに依存し,フィールド誤差は残差通信を制御することが示された。
- また,ギャップ・ハミング埋め込みを用いて,認証付き出力の困難性を示し,サンプラーと証明ベアリング出力モデルを分離した。
MMAC:音声キャプションのための大規模多次元ベンチマーク [cs.SD, cs.AI]目的:音声キャプションの評価基準
- 近年,音声LLMが発展しており,音声キャプションの記述内容も簡潔なものから詳細なものへと変化しつつある。
- 既存の評価方法では,生成品質やタスクの性能に焦点が当たりがちで,情報網羅性や信頼性の診断が困難である。
- MMACは,情報網羅性と記述信頼性を評価するための多次元ベンチマークとして,この問題を解決することを目指す。
- MMACは,20以上のデータソースから収集された5,638個の音声クリップを含み,6つの能力カテゴリと15の評価次元を網羅する。
- 生成されたキャプションが,ターゲット次元における関連情報を記述しているか,そしてその内容が参照ラベルと一致しているかを検証する。
- オープンソースおよび商用のAudioLLMの評価結果から,評価次元,情報網羅性,記述信頼性に明確な差異が認められた。
APEX-Accounting:会計業務の評価ベンチマーク [eess.SY, cs.SY, cs.CL, cs.AI, cs.HC]目的:最先端モデルの会計業務遂行能力の評価
- 会計は企業活動の根幹であり,正確性が不可欠である。
- 大規模言語モデルの会計処理能力は未知数であり,実務での活用が課題。
- 最先端モデルの会計業務における能力を定量的に評価し,課題を明確化する。
- APEX-Accountingベンチマークにおいて,Claude-Fable-5 (Max)が56.4%のMean Criteria@3で最高成績を収めた。
- Muse-Spark-1.1 (xHigh)が52.6%で続き,GPT-5.6-Sol (Max+Pro)はPass^8で2.6%に留まった。
- トークン数の増加はスコア向上をもたらすが,予算内でトークンを多く使用するタスクほど成績が低いという逆説が見られた。
磁気符号化ラプラシアンに基づくスペクトルグラフニューラルネットワークMSGNN [stat.ML, cs.AI, cs.LG, cs.SI]目的:符号付き・有向ネットワークにおけるスペクトルグラフニューラルネットワークの提案
- 現実世界の複雑な関係性を表現するため,符号付き・有向ネットワークの重要性が増している。
- 符号付き・有向ネットワークを対象としたスペクトルグラフニューラルネットワークの研究は十分に進んでいない。
- 符号と方向性を考慮した新たなスペクトルグラフニューラルネットワークを開発し,性能向上を目指す。
- 磁気符号化ラプラシアンという新たな行列を導入し,効率的なスペクトルGNNアーキテクチャを構築した。
- ノードクラスタリングとリンク予測の実験において,符号,方向性,両方の情報を効果的に活用できることを示した。
- 提案手法は,幅広いデータセットで最先端の性能を達成した。
サイバー攻撃の検知学習:理論的考察に基づくサイバーセキュリティのためのニューラル異常検知 [stat.ML, cs.CR, cs.LG, math.ST, stat.TH]目的:サイバー攻撃の異常検知手法
- サイバーセキュリティは,社会インフラや個人情報を守る上で不可欠であり,その重要性は増している。
- 既存の防御システムは過去の行動パターンに依存するため,未知の攻撃には脆弱であるという課題がある。
- 現実の異常サンプル収集が困難な状況下でも,効果的な異常検知を実現することを目的とする。
- 提案手法は,正常データのみを用いてニューラルネットワークを訓練し,合成異常データによる指導を活用する。
- 理論的にMinimax超過リスクを達成し,正常領域の境界を確実に学習することが保証されている。
- ネットワーク侵入検知実験において,従来手法と比較して,難易度の高い未知のサイバー攻撃の検知能力が大幅に向上した。
医療画像AIにおけるスケーラブルなドリフト監視 [eess.IV, cs.CV, cs.LG]目的:医療画像AIにおけるドリフト監視の実現
- 医療AIは診断精度向上に貢献するが,長期的な信頼性確保が課題。
- AIモデルの性能は時間経過とともに劣化する可能性があり,監視が必要。
- 継続的な性能監視の代替案として,コスト効率の良いドリフト監視を目指す。
- MMC+は,多様なデータストリームに対応し,大規模な環境下でのスケーラビリティを向上。
- MedImageInsight等の基盤モデル統合により,サイト固有の学習を不要とし,高次元画像埋め込みを実現。
- COVID-19パンデミック時の実際のデータで検証し,データシフトとモデル性能変化との相関を検出。
因果ベイズネットワークとライヒェンバッハの原理によるグレンジャー因果性の再検討 [stat.ML, cs.LG, econ.EM, stat.ME]目的:時間系列データにおける因果関係の推論
- 時間変化するシステムの理解は,科学,工学,経済など多岐にわたる分野で重要である。
- 従来のグレンジャー因果性では,見かけ上の相関と真の因果関係を区別できない場合がある。
- 因果ベイズネットワークとライヒェンバッハの原理を用いて,グレンジャー因果性の解釈を明確化し,より正確な因果推論を目指す。
- 提案手法(c-GC, c-GC*)は,遅延効果,サイクル,双方向リンク,非線形性やノイズを含むシステムにおいて,妥当な因果構造を復元できることを確認した。
- グレンジャー因果性を,因果推論の枠組みの中でより厳密に解釈することが可能となった。
- 時間予測のみでは因果関係の十分な証拠とはならないという点を明確にした。
AIの利益が広く共有されるのはいつか:AI駆動型自動化に対する政策的閾値 [econ.TH, cs.SI, econ.GN, cs.AI, cs.GT, q-fin.EC]目的:AI駆動型自動化による社会全体の利益の広範な共有の可否
- AI技術は経済成長と社会変革の重要な推進力となる可能性を秘めている。
- AIによる利益が一部に偏り,格差を拡大する懸念が存在する。
- AI技術の進歩が社会全体に恩恵をもたらすための政策的条件を特定する。
- AIの利益が広く共有されるためには,技術的進歩だけでなく,公共による獲得,導入コスト,自動化範囲,市場構造が重要である。
- 公共による獲得率を33%に引き上げることは,AI能力の大きな向上に匹敵する効果があり,さらに高める効果は限定的である。
- 税制や公的資産モデルなど,政府がAIの利益を測定,回収,分配するための具体的な手段を特定した。
検証可能な報酬を用いた強化学習における分散を考慮したベースラインと適応学習率 [math.OC, cs.SY, eess.SY, stat.ML, cs.LG]目的:検証可能な報酬を用いた強化学習におけるベースライン設計と学習率スケジュールの理論的枠組み
- 大規模言語モデルの性能向上に貢献するポストトレーニング手法として,その重要性が増している。
- ベースラインや学習率スケジュールの設計が経験則に頼っており,最適化の理解が不足している。
- 統計的性質に基づいたベースライン設計と学習率選択により,最適化の理論的保証と性能向上を目指す。
- 分散を考慮したベースラインは,KL正則化された報酬の勾配加重推定値であり,従来の報酬ベースラインに代わる選択肢となる。
- 信号対雑音比 (SNR) に基づく適応学習率スケジュールを導出し,学習率ルール単体でも性能改善が確認された。
- 分散最適ベースラインとSNR適応学習率ルールを組み合わせたOBLR-POが,全体として最も高い性能を発揮する。
複数体制における最適な切り替えのための連続時間強化学習 [math.OC, cs.LG, q-fin.CP]目的:複数体制を横断する最適な切り替え問題
- 経済や工学等の分野で,状態が変化するシステム制御が重要である。
- 古典的な強化学習では,離散時間での最適化に偏りがちである。
- 連続時間における最適な切り替え戦略を強化学習で実現すること。
- 本研究では,エントロピー正則化を用いた探索的定式化により,連続時間強化学習の理論的基盤を確立した。
- ハミルトン-ヤコビ-ベルマン方程式の解の存在と最適方策の特性付けを行った。
- 金融応用を含む数値例を通じて,提案する強化学習アルゴリズムの有効性と効率性を実証した。
機能的浸透:形態と機能の臨界性 [physics.soc-ph, cond-mat.stat-mech, cs.AI, physics.comp-ph]目的:ネットワーク構造と情報処理の関係性
- 複雑系における情報処理のメカニズム解明は,物理学,生物学など幅広い分野で重要である。
- ネットワーク構造が情報処理能力に与える制約が不明確であり,その定量化が課題となっていた。
- ネットワーク構造の変化が情報処理能力に及ぼす影響を明らかにし,普遍的な原理の発見を目指す。
- 構造的ペルコレーション転移において,ネットワークの連結性が情報処理能力を大きく左右することが示された。
- 臨界点近傍では,機能的多様性と複雑性の間にパレート最適解が存在することが確認された。
- この結果は,局所的な相互作用を持つシステムにおける情報処理能力の一般的な組織原理を示唆する。
女性は懸念し,男性は採用する?ジェンダー化されたリスク認識と生成AIの採用 [econ.GN, cs.AI, q-fin.EC]目的:生成AIの採用におけるジェンダー格差の原因究明
- AI技術の急速な発展は,生産性,スキル,キャリア機会に影響を及ぼすため,その利用における格差は重要な課題である。
- 既存研究では,AI採用の格差はアクセス,スキル,自信の差で説明されてきたが,完全ではない点が課題である。
- 本研究は,AIのリスク評価におけるジェンダー差が,格差の一因となっている可能性を明らかにすることを目的とする。
- 男性の生成AI利用頻度は女性よりも高く,社会的なリスクへの懸念を持つ層でその差が顕著であった。
- 女性のAI採用において,社会的なリスク認識が男性よりも予測力を持つことが示された。
- AIの社会的な影響に対する楽観的な見方は,女性のAI利用を促進し,ジェンダー格差を縮小させる可能性が示唆された。
多孔質媒体の浸透率予測のためのトポロジーデータ解析と機械学習の組み合わせ [math.CO, cs.DM, q-fin.TR, cs.CY, q-fin.CP, cond-mat.soft, cs.LG]目的:多孔質媒体の浸透率予測
- 多孔質媒体中の流動現象は複雑であり,様々な分野でその予測が重要である。
- 従来の解析手法では多孔質媒体の複雑な構造を扱うのが困難である。
- 機械学習とトポロジーデータ解析を用いて,効率的な浸透率予測手法を開発する。
- 機械学習に構造,トポロジー,ネットワーク指標を入力することで,浸透率を予測可能であることが示された。
- 特に,トポロジーデータ解析から得られる特徴量は,機械学習と組み合わせることで有効な予測結果をもたらす。
- 異なる入力変数を用いた比較を通じて,多孔質媒体の構造に基づく浸透率予測における各種指標の有用性が明らかになった。
多様体上のRao-Blackwell化スコアマッチング [stat.ML, cs.LG]目的:多様体上のノイズ除去スコアマッチング
- 高次元データ解析において,データは低次元多様体上に分布することが多い。
- ノイズ規模が減少すると,目標分布の分散が発散し,学習が困難になる。
- 多様体上の最近点射影を用いたRao-Blackwell化により,この問題を解決する。
- 周囲ガウス雑音下では,目標分布の分散がノイズスケールの減少に伴い発散することが示された。
- 多様体上の最近点射影に対する回帰により,分散の発散を修正し,真のリーマン幾何スコアを近似的に復元できる。
- 球面の場合,幾何学的項が消失し,外挿的DSMが内挿的手法と同等の性能を示す理由が説明できる。
情報マッチングによる活性学習を通じたカスタム原子間ポテンシャルの逆設計 [cond-mat.mtrl-sci, cs.LG]目的:カスタム原子間ポテンシャルの開発
- 原子レベルでのシミュレーションは材料設計に不可欠であり,大規模な計算を可能にする原子間ポテンシャルが重要である。
- 既存の原子間ポテンシャルは,予測精度に課題があり,適切な学習データ選択が困難である。
- 特定の材料特性の予測精度向上を目指し,情報マッチングによる効率的な学習手法を適用する。
- 情報マッチング法により,最小限の学習データで精度の高いパラメータ制約を実現した。
- 中間的な量と金属の塑性強度両方について,正確な予測を達成した。
- モデル誤差に対する事後的な不確実性補正が有効であることが示された。
都市環境における放射性同位体識別のためのコンピュータビジョンに基づくニューラルネットワーク [physics.ins-det, cs.LG]目的:都市部における移動型探索シナリオでの放射性同位体識別アルゴリズム開発
- 都市環境における放射性物質の検知は,テロ対策や事故対応において重要な課題である。
- 背景の不均一性や,放射源との短時間接触,および脅威信号と背景測定値の間の極端なクラス不均衡が課題である。
- ニューラルネットワークを用いた画像認識技術により,これらの課題を克服し,識別精度を向上させる。
- 提案手法は,ガンマ線データを2次元のウォーターフォールスペクトログラムに変換し,コンピュータビジョンアーキテクチャを適用する。
- CNNは,RADAIデータセットにおいて,1時間あたりの1回以下の誤報率で,既存のNMF法を全ての指標で上回った。
- CNNは,検出率0.4334,分類率0.3965,識別率0.2950を達成し,NMF法の0.4151,0.3611,0.2625を上回った。
多様体上の重み付き測度における熱核エントロピープロファイルと幾何学的有効サンプルサイズ [stat.ML, cs.LG, stat.ME]目的:多様体上の重み付き経験測度における不均一性の測定と幾何学的有効サンプルサイズの算出
- 重要サンプリング等の数値計算において,測度の評価精度を向上させることは重要である。
- 従来の有効サンプルサイズは,サポートの幾何学的構造を考慮しないという問題点があった。
- 熱核エントロピープロファイルを用いて幾何学的構造を考慮し,より正確な有効サンプルサイズを算出する。
- 熱核エントロピープロファイルは,固有拡散後の不均一性を様々なスケールで測定できる。
- 特に二次のRenyiエントロピーにおいては,熱核の重複積分を用いて正確なプロファイルと幾何学的有効サンプルサイズを算出できる。
- 本研究で提案する有効サンプルサイズは,近接または重複する粒子を適切に割引し,境界のないコンパクト多様体上では単調性などの理論的性質が成立することを示した。
参照値を用いた幾何平均に基づくペアワイズ比較法 -- 統計的アプローチ [stat.ME, cs.AI, math.ST, stat.TH]目的:ペアワイズ比較法における代替案の優先度算出
- 専門家の意見を統合し,複雑な意思決定を支援する手段として重要である。
- 比較行列の不整合性評価が困難であり,結果の解釈に曖昧さが残る。
- 参照値と幾何平均を用いて不整合性と代替案間の選好距離を定量化する。
- 本手法により,ペアワイズ比較における不整合性と代替案の選好距離を同時に捉えることが可能となった。
- 算出された重みベクトルの質を評価するための指標を定義し,統計的解釈を明確化した。
- 従来のAHPにおける主固有ベクトル法と比較し,より精度の高い意思決定を支援することが期待される。
後悔の最適化 [econ.EM, cs.LG, stat.ML]目的:後悔の共分散関数に関する派生理論
- 意思決定において,将来の後悔を最小化することは,合理的な行動の基礎となる。
- 既存の手法では,後悔の計算や最適化が困難であり,効率的な意思決定を妨げている。
- 後悔の共分散関数を利用し,より効率的な最適化手法を開発し,意思決定の質を向上させる。
- 期待後悔とコスト・意思決定の共分散の間の関係に基づき,新しい後悔関数の導関数を導出した。
- 線形ポリシーの場合,勾配はコスト共分散行列と示され,最適解は境界解となることが明らかになった。
- 制約付き最適化,シグナル勾配双対性,および有限サンプル収束限界についても解析を行った。
事前学習による先入観:継承された検出不可能な過信 [stat.ML, cs.LG]目的:不良設定の画像逆問題における正則化
- 画像再構成の精度向上は,医療や地球物理探査など広範な分野で不可欠である。
- 真の画像サンプルが少ない場合,従来の正則化手法では十分な性能を発揮できない。
- 過去の再構成アーカイブを用いた事前学習による過信の問題を明らかにし,その解決策を探る。
- 過去の再構成アーカイブで学習した事前分布は,データから得られた証拠に基づかない過信された不確実性を示す。
- この過信は,観測演算子が解決できない方向において,古い再構成手法の仮定を反映している。
- 演算子が解決する方向を明示することで,データが支持する確信と,パイプラインを通じて継承された信念を分離することが推奨される。
読者なしの読書:大規模言語モデルは読書と書き出しを単一の絡み合ったコードに収束させる [math.AT, cs.CG, q-bio.NC, cs.AI, cs.CL, cs.LG]目的:大規模言語モデルにおける読書と書き出しの絡み合い度の分析
- 言語モデルの能力理解は,人工知能の発展に不可欠である。
- 従来の言語モデルでは,読書と書き出しが分離されていない可能性があった。
- 本研究は,大規模言語モデルにおける読書と書き出しの関連性を定量的に評価する。
- GPT-2,OPT,Pythiaモデルにおいて,読書と書き出しが強く結びついた単一のコードとして機能することが示された。
- 書き出し側のコードは,読書側のコードに比べて,より大きな変化を示す傾向がある。
- モデルの内部表現から,読書と書き出しの能力が完全に分離されていないことが明らかになった。
RIDGE:LLM生成オプション価格決定における検証と手法発見のための自律的フレームワーク [q-fin.CP, cs.AI]目的:LLM生成オプション価格決定実装の検証と手法発見
- 金融工学において,自動コード生成の重要性が増しており,LLMが数学モデルから実装を生成する。
- LLM生成コードの検証は,数学的整合性,数値安定性,パラメータ範囲での信頼性を担保する必要がある。
- 本研究は,LLM生成実装の検証を自動化し,検証手法の改善を目指す。
- RIDGEフレームワークは,裁定条件テスト,ストレステスト,ベンチマーク比較,整合性チェック等を実施する。
- 5つの確率ボラティリティモデルへの適用により,検出された実装の欠陥を全て修正した。
- 検証プロセスから,手法上の限界が明らかになり,新たな数値手法の開発に繋がった。
深層生成モデルは非定常ガウス確率場の再現が可能か [stat.ML, cs.LG]目的:深層生成モデルの非定常ガウス確率場の再現性能の評価
- 高次元データの複雑なモデリングにおいて,深層生成モデルの利用が拡大している。
- 深層生成モデルが学習したデータ生成プロセスを検証する手法が確立されていない。
- 既知の非定常ガウス確率場を用いて,深層生成モデルの性能評価を行う。
- Flow Matching,DDPM,score-SDE,VAEの4つのモデルにおいて,平均場は良好に再現された。
- DDPMとscore-SDEは共分散構造も比較的良好に再現したが,FMは非定常性がやや弱められ,VAEは共分散構造の再現に苦戦した。
- ERA5温度異常の実験により,本フレームワークが複雑な時空間データの深層生成モデルの検証に有効であることが示された。
