arXiv雑要約
AI - 2026/08/05 公開
SGD事前条件付け器の設計基準:局所的条件付け,ノイズフロア,および盆地安定性 [cs.DC, math.NA, cs.LG, cs.NA]目的:SGD事前条件付け器の設計基準
- 機械学習の効率化は,科学計算への応用において重要であり,精度と安定性の向上に寄与する。
- 勾配降下法の収束遅延や,ノイズの影響による最適解への到達困難さが課題である。
- 事前条件付け器の設計を通じて,局所的条件付けとノイズ軽減を両立し,安定性を確保する。
- 事前条件付け器$\mathbf{M}$を用いることで,有効条件数と事前条件付けノイズレベルにより収束速度とノイズフロアが制御されることが示された。
- 非凸関数に対して,$\mathbf{M}$ノルムで定義される滑らかさと盆地のサイズに基づき,反復計算が良好な局所領域にとどまる確率の下限が確立された。
- 実験結果は,診断用二次関数と3つのSciMLベンチマークにおいて,予測される速度とフロアの振る舞いを検証した。
ターゲットを意識した早期ランキング [cs.LG]目的:大規模推薦システムにおける早期ランキングの性能向上
- 推薦システムの精度向上が,ユーザーエンゲージメントやビジネス成果に不可欠である。
- 従来のTwo Towerアーキテクチャでは,ユーザーとアイテム間の細かな相互作用を捉えきれない。
- ターゲットを意識したAttention機構により,ユーザーの行動履歴と候補アイテム間の関連性をより正確にモデル化する。
- 提案手法TESRは,Two TowerアーキテクチャにMoAモジュールを追加し,リクエストレベルの系列モデリングを実現した。
- MoAモジュールは,明示的なカテゴリIDレベルのオーバーラップ,潜在的な類似性,そして対称的なユーザーとアイテムの文脈化を捉える。
- 本手法は,オフライン評価とオンラインA/Bテストで,既存手法と比較して優れた性能を示し,大規模な早期ランキングステージにおけるターゲットを意識したAttention機構の導入を実証した。
自己誘導型適応的安全調整:推論モデルにおけるガイドラインの合成と内包 [cs.CL, cs.AI]目的:推論モデルにおけるタスク固有の安全ガイドラインの合成と内包
- 推論モデルの安全性は重要であり,有害な応答を防ぐことは社会的な要求に応える上で不可欠である。
- 既存の安全ポリシーでは,進化する脱獄戦略に追いつけず,安全性と有用性のバランスが課題である。
- 少ない事例から安全ガイドラインを自動生成・改善し,低リソース環境下での安全適応を目指す。
- 自己評価により,外部的に最適な改善ラウンドが6つの設定のうち5つで選択された。
- 文脈内ガイドラインは,8Bおよび14Bモデルで安全性と過剰拒否の総合スコアを20.0~45.5ポイント向上させた。
- WildJailbreak由来のアライメント監督を用いて内包されたモデルは,推論時のガイドラインなしで13.3~14.1ポイントの改善を維持した。
埋め込み型普遍予測知能:マルチエージェント学習のための首尾一貫したフレームワーク [cs.AI]目的:マルチエージェント学習のための首尾一貫したフレームワーク
- 環境の変化に対応し,他エージェントとの相互作用を考慮した学習が重要である。
- マルチエージェント環境では,他エージェントの学習による非定常性が問題となる。
- 自己予測を通じて,エージェントが他エージェントの行動をより正確に予測することを目指す。
- 自己予測により,マルチエージェント環境において,類似のアルゴリズムを実行する他者についての推論が可能になる。
- これにより,従来の独立したエージェントでは達成できない新たなゲーム理論的解概念と協力形態が実現する。
- 普遍知能エージェントは一貫した相互予測を形成し,無限階層の心の理論を獲得する可能性がある。
拡散に基づく偏微分方程式ソルバーの精度・遅延のトレードオフ改善:物理情報スペクトル注意機構PRISMA [cs.LG, cs.AI, cs.NA, math.NA, stat.ML]目的:偏微分方程式ソルバーの精度と効率の向上
- 偏微分方程式は科学技術の様々な分野で現れるため,その効率的な解法は重要である。
- 従来の勾配ベースの最適化は遅延が大きく,不安定であり,ノイズに弱いという課題がある。
- PDE残差をモデルに組み込み,高速かつロバストな推論を実現することを目指す。
- PRISMAは,PDE残差をスペクトル領域での注意機構を介してモデルに直接組み込むことで,勾配降下法を必要としない高速な推論を可能にする。
- PRISMAは,従来の勾配ベースの手法と比較して,同等の精度を大幅に低い計算コストで実現し,特にノイズの多いデータに対して有効である。
- 実験結果から,PRISMAは従来のモデルと比較して10倍~100倍少ないデノイジングステップで,15倍~250倍高速な推論が可能であることが示された。
PRIVEE:特徴推論攻撃に対するプライバシー保護型垂直連合学習 [cs.LG, cs.AI]目的:特徴推論攻撃に対するプライバシー保護機構の開発
- データ活用とプライバシー保護の両立が重要であり,データ共有を促進する技術が求められている。
- 垂直連合学習は,特徴量空間が分離しているため,予測確率から入力特徴量を推論される脆弱性がある。
- 予測確率の変換により,特徴量の再構成リスクを軽減しつつ,モデル性能を維持することを目的とする。
- PRIVEEは,予測確率を秘匿化することで,特徴量推論攻撃に対する再構成誤差を最大30倍に増加させる。
- 既存の防御策と比較して,PRIVEEは予測性能を損なうことなく,高度な特徴量推論攻撃に対する防御効果を示す。
- PRIVEEは,相対的な順位とスコア間の距離を保持しながら,変換された表現のみを共有することでプライバシーを保護する。
非線形データ同化のためのアンサンブルシュレーディンガーブリッジフィルタ [cs.LG]目的:非線形データ同化手法の開発
- 気象予測や環境モデリングなど,複雑なシステムの状態推定に不可欠な技術である。
- 従来のフィルタは,強い非線形性に対して精度が低下し,計算コストが高いという課題がある。
- 拡散生成モデリングに基づく解析ステップを導入し,高精度かつ効率的なフィルタを実現する。
- 提案手法は,高次元の混沌系においても有効に機能することが数値実験により示された。
- アンサンブルカルマンフィルタやパーティクルフィルタといった既存手法と比較して,より優れた性能を発揮する。
- 今後は,実用的な気象アプリケーションへの応用や,厳密な収束理論の開発を目指す。
HERO:理由付けと要約による放射線科レポート生成のための階層的証拠推論最適化 [cs.LG, cs.AI]目的:放射線科レポート生成における臨床的有効性の向上
- 医療現場におけるレポート作成の効率化と精度向上は,患者ケアの質に直結する重要な課題である。
- マルチモーダル大規模言語モデルの強化学習による調整は,多様な医療的監督信号により困難を伴う。
- 臨床的誤謬を低減し,根拠に基づいた一貫性のあるレポートを生成することを目指す。
- HEROは,推論,診断,証拠の基盤をそれぞれ最適化する階層的最適化フレームワークを提案する。
- MIMIC-CXRとIU-Xrayの実験により,HEROは最先端の性能を示し,既存のベースラインを上回る臨床的有効性を実現した。
- HEROは,より証拠に基づき,理由と回答が一貫したレポートを生成することで,臨床的誤謬を大幅に軽減する。
知識が衝突する場所:言語モデルにおける内部知識の競合に関するメカニズム研究 [cs.CL, cs.AI]目的:言語モデルにおける内部知識競合のメカニズム解明
- 言語モデルの性能向上には,モデル内部の知識表現の理解が不可欠である。
- モデル内部で矛盾する知識が混在する「内部知識競合」の理解は遅れている。
- 内部知識競合がモデル内のどこで発生し,どのように解決されるかを明らかにすること。
- 内部知識競合は,最終層で頻繁に発生し,解決されていることが判明した。
- 実世界の知識競合に対する介入は,合成データよりも効果が低いことが示された。
- 特定の事実を専門とするアテンションヘッドが合成データでは多く見られ,このギャップの一因と考えられる。
ChiEngMixBench:専門的な中英複合用語における大規模言語モデルの評価 [cs.RO, cs.CL, cs.AI]目的:中英複合用語を含む中国語AI/CS分野の談話における大規模言語モデルの性能評価
- 多言語の専門的コミュニケーションにおいて,言語モデルの有用性は,コミュニティの慣習への適応にかかる
- 既存のベンチマークは,コミュニティに依存した選択肢を十分に分離して評価していない
- 中英複合用語の利用に関する言語モデルの現状を明らかにし,コミュニティの慣習への適合性を評価する
- 9つのオープンウェイトモデルにおいて,多くのペアで中国語訳の方が高い尤度を示し,ソースの利用状況とモデルの優先度の間にギャップがあることが示された。
- 専門用語においてはわずかな方向性のある向上が見られたが,頻度や長さ,多重比較補正を考慮すると,頑健ではなかった。
- 人間による評価とベースライン分析から,参照プロファイルの適合性は混合スタイルにおいて有益であるが,全体的な応答の好みを確実に予測するものではないことが示された。
AgenticSCR:未成熟な脆弱性検出のための自律型エージェント型セキュアコードレビュー [cs.CY, cs.CL, cs.CR, cs.AI, cs.LG, cs.SE]目的:未成熟な脆弱性の検出
- ソフトウェア開発におけるセキュリティ確保は重要であり,早期の脆弱性検出がコスト削減に繋がる。
- 既存の静的解析ツールはノイズが多く,文脈依存性の高い脆弱性の検出が困難である。
- 早期段階での脆弱性検出を可能にする,エージェント型セキュアコードレビュー手法の確立を目指す。
- AgenticSCRは,脆弱性の箇所,種類,関連性の正確なコメント生成において,従来のLLMベースライン,マルチエージェントレビューアー,SASTツールと比較して,少なくとも153%の相対的な改善を達成した。
- シャドー運用において,AgenticSCRのコメントの54%がセキュリティエンジニアによって開発者への報告に有効であることが確認され,実用性を示した。
- セキュリティに焦点を当てた意味的メモリが,エージェント型セキュアコードレビューの有望な方向性を示すことが明らかになった。
クラスの進化に対応:段階認識型クラス増分学習のためのベンチマークとフレームワーク [cs.DC, cs.DB, cs.LG, cs.CV]目的:段階認識型クラス増分学習における,クラス内形態変化とクラス間忘却の評価
- 機械学習における継続学習は,限られたリソースで効率的に知識を獲得するために重要である。
- 既存のクラス増分学習手法は,クラスの形態が静的であるという前提に依存しており,現実世界のデータには対応が難しい。
- 本研究は,クラスの形態的進化を考慮した新たな継続学習パラダイムを提示し,その評価基準を提供する。
- 段階認識型クラス増分学習(Stage-CIL)というパラダイムを新たに定義し,クラスの形態変化に対応する学習を可能とした。
- 10ドメイン,2段階のベンチマークデータセットStage-Benchを構築し,クラス間忘却と段階レベルの性能劣化を評価できる環境を整備した。
- 固定サイズメモリプールを活用したSTAGEを提案し,既存手法と比較して優れた性能を示すことで,進化を意識したモデリングの有効性を実証した。
大規模言語モデルにおける生成推論のためのレイヤープルーニングの限界について [cs.LG, cs.AI]目的:大規模言語モデルのレイヤープルーニングが生成推論に与える影響の評価
- 大規模言語モデルは高性能だが,計算コストが高い。効率化が求められている。
- レイヤープルーニングは圧縮に有効だが,生成推論タスクでは性能劣化が課題。
- 生成推論におけるレイヤープルーニングの性能回復限界を実証的に示す。
- レイヤープルーニングは,分類タスクでは高い性能回復を示すものの,生成推論タスクでは回復が限定的である。
- 自己生成応答を用いた教師ありファインチューニングでは,分類タスクの性能回復は90%に達するが,生成推論タスクでは効果が限定的である。
- プルーニング後のトークン数増加による学習でも,単純な算術タスクにおいて性能低下が確認された。生成推論能力の損失が示唆される。
強化学習と適応型推測的訓練:統一された訓練・提供システム [cs.CY, cs.SC, cs.HC, cs.LG]目的:大規模言語モデルの提供加速のための推測器の継続学習システム
- 大規模言語モデルの利用拡大に伴い,高速な推論が不可欠である。
- 推測器の訓練と提供が分離されている場合,導入遅延やドメインシフトへの対応が課題となる。
- リアルタイムの推論データから推測器を継続的に学習し,遅延を解消し,性能を向上させる。
- Auroraは,推測器をオンラインで学習する強化学習の枠組みを提示し,即時的な性能改善を実現した。
- 最新のフロンティアモデルにおいて,初期段階から1.5倍の高速化を達成した。
- ユーザーのトラフィック変化に適応し,静的な推測器と比較して追加で1.25倍の高速化を実現した。
経路探索ソルバーのための処方的プロービング [cs.LG]目的:ニューラル経路探索ソルバーにおける介入候補のランク付け
- 経路探索問題は,物流や交通システムにおいて不可欠であり,効率的な解決が求められている。
- 既存のニューラル経路探索ソルバーは高速だが,単一の解だけでなく,改善のための提案が必要となる場合がある。
- 学習済みモデルの表現を用いて,効率的に介入候補をランク付けし,意思決定を支援することを目指す。
- 本研究では,経路探索モデルの表現を活用し,介入候補をランク付けする「処方的プロービング」を提案した。
- 非対称TSPおよびCVRPのベンチマークテストにおいて,提案手法は既存手法を上回り,特にノード削除や辺禁止において優れた性能を示した。
- 経路構築のために学習された表現が,意思決定支援に転用できる可能性を示唆している。
OR-Agent:進化探索と構造化された研究を統合し,自動アルゴリズム発見を実現する [cs.DC, cs.CY, cs.AI, cs.CE, cs.NE]目的:複雑な実験駆動型ドメインにおけるヒューリスティック設計の自動化
- アルゴリズム開発は,問題解決の効率を左右する重要技術である。
- 既存手法は,長期的な戦略や過去の失敗からの学習が不十分である。
- 効率的な探索と冗長な試行の削減を目指す。
- OR-Agentは,ヒューリスティック探索を系統的な探索構造としてモデル化する。
- 最適化に着想を得た階層的な内省システムを導入し,学習能力を向上させた。
- 古典的な組み合わせ最適化問題や協調運転シミュレーションで,既存手法を上回る性能を示した。
効率的な計算病理のための展開に優しい基盤フレームワーク [cs.CV, cs.AI]目的:計算病理タスクにおける効率的な画像解析のための基盤フレームワーク
- 病理画像解析は,疾患の診断精度向上や創薬に不可欠であり,医療分野において重要性が増している。
- 既存の病理画像解析モデルはパラメータ数が多く,計算資源を大量に消費するため,実用的な展開が困難である。
- 本研究は,計算資源の制約下でも高性能な病理画像解析を実現し,実用的な展開を可能にすることを目的とする。
- LitePathは,Virchow2と比較してパラメータ数を28分の1,FLOPsを403.5分の1に削減した。
- NVIDIA Jetson Orin Nano Super上で,Virchow2の104.5倍の速度でスライドを処理し,消費電力も171分の1に抑制された。
- 45の多施設共同コホートにおいて,LitePathは平均ランクでVirchow2を上回り,分類タスクと生存分析タスクで同等以上の性能を維持した。
連続決定空間における文脈内純粋探索 [cs.LG, cs.AI]目的:連続決定空間における純粋探索問題に対する理論に基づいた学習モデル
- 意思決定における最適な行動の探索は,効率的な学習や資源配分に不可欠である。
- 既存手法は頻度主義的,または特定のモデルに依存しており,連続的な推薦空間への適用が困難である。
- 連続推薦空間における効率的な純粋探索を可能にする汎用的な学習モデルを開発すること。
- 提案手法C-ICPEは,タスクの事前分布に基づき,探索,停止,推薦戦略を共同学習する。
- 推論時には,パラメータ更新なしで証拠を収集し,ε-最適解を特定する。
- 連続決定空間におけるベイジアン固定信頼度純粋探索を実現する理論的基盤を提供する。
SphUnc:超球面不確実性分解と情報幾何学による因果特定 [cs.LG, cs.AI]目的:複雑なマルチエージェントシステムにおける信頼性のある意思決定
- マルチエージェントシステムは社会において重要性が増しており,その予測の信頼性が求められる。
- 既存手法では,不確実性の正確な評価と解釈が困難であり,意思決定の精度が制限される。
- 不確実性の幾何学的な理解に基づき,因果関係を特定し,より適切な意思決定を支援する。
- SphUncは,超球面表現学習と構造因果モデルを組み合わせた統合的なフレームワークである。
- 不確実性を認識的・偶然的要素に分解し,正確な予測と解釈性を実現した。
- 実験結果から,SphUncが既存手法を上回り,より信頼性の高い意思決定を可能にすることが示された。
医学教科書における言語モデルの幻覚の定量化 [cs.CL, cs.AI]目的:言語モデルの幻覚の発生頻度と,医学的質問応答におけるモデル間の応答のばらつき
- 医療分野における正確な情報提供は不可欠であり,誤情報は患者の健康に深刻な影響を及ぼす可能性がある。
- 大規模言語モデルは事実に基づかない情報を生成することがあり,医療分野では特に問題となる。
- 既存の評価基準では,固定された情報源に基づいた幻覚の評価が十分ではない点を改善する。
- LLaMA-70B-Instructは,提供された医学的教科書に基づいた質問応答において,回答の19.7%で幻覚を示した。
- モデルの有用性が高いほど,幻覚の発生率は低い傾向にあり,相関関係が確認された(ρ=-0.71, p=0.058)。
- 臨床医は,実験1と2において高い合意率を示し,専門家による監視の必要性が示唆された。
HAPEns:表形式データに対するハードウェアを考慮した事後アンサンブル [cs.LG]目的:表形式データにおける予測性能とハードウェア効率のバランス
- 機械学習において,予測精度向上のためにアンサンブル学習が広く用いられている。
- 大規模なアンサンブルはハードウェアへの負荷を高めるという課題が存在する。
- 予測性能とリソース使用量のトレードオフを最適化し,効率的なアンサンブルを構築する。
- HAPEnsは,予測性能とリソース使用量のパレートフロント上に多様なアンサンブルを構築する。
- 83の表形式分類データセットにおいて,既存手法と比較して優れた性能と展開コストのバランスを示す。
- メモリ使用量は,特に有効な目的指標であることが示された。
サッカーにおける反事実的選手評価のための生成Transformerアプローチ:試合を言語としてモデル化 [cs.CL, cs.NI, cs.RO, cs.RO, cs.AI, cs.LG]目的:サッカー選手の移籍評価における反事実的シミュレーションの実現
- サッカー選手の移籍は,チーム戦力に大きな影響を与えるため,正確な評価が不可欠である。
- 従来の評価手法は,試合の文脈やチーム構成を考慮せず,選手の潜在能力を正確に反映できていない。
- 試合イベントを言語モデルとして捉え,反事実的シミュレーションにより,選手の潜在的な影響を定量的に評価する。
- ScoutGPTは,試合イベントを逐次的なトークンとして扱うことで,試合のダイナミクスを学習し,仮説的なチーム構成下での試合イベントシーケンスをシミュレーションできる。
- シミュレーション結果は,既存のベースラインモデルよりも優れた予測性能を示し,選手の移籍が攻撃の進展と得点確率に与える影響を測定可能にした。
- このモデルは,従来の静的指標では捉えきれない,選手固有の影響を捉えることに貢献する。
網膜底写真のための解釈可能な基盤モデルへ [cs.CV, cs.LG, stat.CO]目的:網膜底写真の解釈可能性
- 眼科領域では,正確な診断が不可欠であり,AIの活用が期待されている。
- 既存の基盤モデルはブラックボックス化しており,判断根拠の説明が困難である。
- 解釈可能性を重視した基盤モデルを構築し,信頼性の高い診断支援を目指す。
- 提案手法DualIFMは,BagNetバックボーンにより,モデルの意思決定過程に忠実なクラスエビデンスマップを生成する。
- DualIFMは,2次元投影層を通じて表現空間を可視化し,臨床的に意味のあるクラスターや潜在的な相関関係を明らかにする。
- 80万枚以上の網膜底写真を用いて学習したDualIFMは,パラメータ数が16倍多いRETFoundと同等の性能を達成し,未知データに対しても解釈可能な予測を提供する。
類推の平行四辺形理論に対する大規模言語モデルによる支持 [cs.CL, cs.AI]目的:類推における平行四辺形理論の妥当性
- 類推は思考の基本であり,認知科学や人工知能において重要な役割を果たす。
- 従来の平行四辺形モデルでは,人間の類推生成を十分に説明できない点が課題であった。
- 大規模言語モデルを用いて,平行四辺形モデルの有効性を検証し,人間の類推生成との差異を解明する。
- 大規模言語モデルが生成した類推は,人間が生成したものよりも質の高いと評価された。
- 言語モデルの類推は,分布埋め込み空間において,平行四辺形との整合性が高いことが示された。
- 平行四辺形制約を満たすようにGloVeを微調整することで,モデルの予測精度が向上した。
人間と大規模言語モデルにおけるクロスドメインマッピングが創造性に与える影響の評価 [cs.AI, cs.CL]目的:人間と大規模言語モデルにおける創造性の向上
- 創造性は,人間の発展と幸福に不可欠な能力であり,社会の進歩に貢献する重要な要素である。
- 創造性の向上が既存の方法では十分ではなく,新たなアプローチの模索が求められている。
- クロスドメインマッピングという介入が,人間とLLM双方の創造性を高める可能性を検証する。
- 人間は,ランダムなクロスドメインマッピングから恩恵を受けることが示された。
- LLMは人間よりも独創的なアイデアを生み出す傾向があるが,クロスドメインマッピングの効果は有意ではなかった。
- しかし,LLMにおいても,インスピレーション源とターゲットの間の意味的距離が一定以上になると,クロスドメインマッピングが有効となることがわかった。
自然言語処理における意味の生成 [cs.CL, cs.AI, cs.HC]目的:自然言語処理における意味生成の根本的なメカニズムの解明
- 人間とエージェント間の安全で有益な対話を設計する上で,意味生成の理解は不可欠である。
- 従来の古典論理では説明できない,文脈依存的な意味処理が課題となっていた。
- 大規模言語モデルにおける文脈性の度合いを評価し,意味生成の限界を探る。
- モデルの規模に関わらず,CHSH $|S|$ パラメータの分布範囲は外部ベンチマークと相関を示さなかった。
- 全体的な違反率は,MMLU,幻覚,ナンセンス検出の各ベンチマークと弱い負の相関を示した。
- 文脈性を考慮したプロンプトインジェクション対策や,社会的な文脈構築の重要性が示唆された。
LogitScope:情報量尺度によるLLMの不確実性分析フレームワーク [cs.CL, cs.AI, cs.CL, cs.IT, math.IT]目的:LLM出力における不確実性の分析
- LLMの信頼性は,実用化において極めて重要であり,その不確実性の理解が不可欠である。
- 従来の評価手法では,生成中のトークンレベルでのモデルの確信度を把握することが困難であった。
- 本研究は,トークンレベルの情報量尺度を用いてLLMの不確実性を定量的に評価する手法を提案する。
- LogitScopeは,エントロピーやvarentropyなどの情報量尺度を用いて,生成ステップごとのモデルの確信度のパターンを明らかにする。
- 本フレームワークは,ラベル付きデータや意味解釈を必要とせず,潜在的なハルシネーションや不確実性の高い意思決定ポイントを特定できる。
- LogitScopeは,不確実性評価,モデル挙動分析,および本番環境監視など,多様な応用分野で有効であることが示された。
LLMによる分子特性予測:記憶と知識の衝突に関する盲検的検証 [cs.LG]目的:LLMによる分子特性予測における文脈学習のメカニズムの解明
- 創薬や材料科学において,分子特性の予測は重要な役割を担う。計算コストの削減に貢献する。
- 既存のベンチマークデータセットに学習データが混入している可能性があり,汎化性能の評価が困難である。
- LLMが分子特性を真に学習しているか,それとも学習データを記憶しているかを検証すること。
- 盲検的実験により,LLMが事前学習された知識と文脈情報との間で矛盾を示すことが明らかになった。
- 従来のベンチマークデータセットにおいて,LLMが単純な記憶に基づいて予測している証拠は見られなかった。
- 本研究は,制御された情報アクセス下で分子特性予測を評価するための原則的な枠組みを提供する。
販売を成立させる要因:LLMエージェントによるエンドツーエンドの小売業者-顧客ダイナミクスのシミュレーション [cs.AI, cs.CL]目的:小売戦略の効果検証
- 小売戦略は,顧客への説得から購買決定までの複数段階で成果が左右されるため,展開前の評価が重要である。
- 既存の小売シミュレーターはプロセスの一部しか捉えられず,段階間の依存関係のモデル化が困難である。
- 本研究は,小売戦略の初期段階の決定が後続の成果に与える影響を評価できるシミュレーション環境の構築を目指す。
- RetailSimは,多様な製品,個性豊かなエージェント,複数ターンのインタラクションを通して,高い忠実度を実現するエンドツーエンドの小売シミュレーションフレームワークである。
- RetailSimは,人間の行動の忠実性に関する評価と,現実世界の経済的規則性とのメタ評価の両方において,人口統計学的購買行動,価格と需要の関係,価格弾力性の異質性などの主要なパターンを再現することに成功している。
- RetailSimは,ペルソナ推論,売り手と買い手のインタラクション分析,販売戦略の評価など,小売戦略を探索するための制御されたテストベッドとしての可能性を示す。
AIアシスタントは持続性と自立的なパフォーマンスを低下させる [cs.AI]目的:AIアシスタントが人間の持続性と自立的なパフォーマンスに及ぼす影響の解明
- 学習においては,メンターや仲間との協調が重要であり,単なる回答提供だけでなく,成長を促す役割が求められる。
- 現在のAIシステムは即時的で完全な回答に最適化されており,長期的な能力開発を考慮していないという課題がある。
- AIアシスタントが人間の学習意欲や問題解決能力に与える悪影響を明らかにし,より効果的なAI開発を促す。
- AIアシスタント利用者は,短期的にはパフォーマンスが向上するものの,AIなしでのパフォーマンスは有意に低下する。
- AIとの短い対話(約10分)でも,課題に対する取り組みを諦めやすくなる傾向が確認された。
- AIが即時的な回答を促すことで,自力で課題に取り組む経験を奪い,持続性を低下させている可能性が示唆された。
HUKUKBERT:トルコ法域に特化した言語モデル [cs.CL, cs.LG]目的:トルコ法域に特化した言語モデルの開発
- 法曹技術(リーガルテック)の発展には,自然言語処理技術が不可欠である。
- トルコ法分野では,専門的なデータやモデルが不足している。
- トルコ法における自然言語処理の性能向上を目指す。
- HukukBERTは,19GBのトルコ語法域コーパスで学習された言語モデルである。
- Legal Cloze Testにおいて,84.40%のTop-1精度を達成し,既存モデルを上回った。
- トルコ語判決の構造セグメンテーションにおいて,92.8%の文書パスレートを達成した。
重ね合わせの錯覚か?言語モデルにおける潜在的思考の原理的分析 [eess.SY, cs.SY, math.OC, cs.CL, cs.CL, cs.LG]目的:言語モデルにおける潜在的思考のメカニズムの解明
- 言語モデルの推論能力向上は,自然言語処理の発展に不可欠である。
- 従来の離散的な思考プロセスでは表現力に限界があり,複雑な推論が困難である。
- 潜在的思考の重ね合わせが実際に言語モデルで活用されているか検証する。
- 訓練なしおよびファインチューニングされたモデルでは,重ね合わせが崩壊するか,利用されないことが判明した。
- 一方,最初から潜在的思考で訓練されたモデルは,重ね合わせを活用している兆候を示した。
- この違いは,事前学習データの影響とモデルの容量が大きく関係していると考えられる。
DIB-OD:切り離された情報ボトルネックとオンライン蒸留によるロバストな異種グラフ適応のための不変コアの維持 [cs.LG, cs.AI]目的:異種グラフ適応のためのフレームワーク
- グラフデータは様々な分野で利用され,その活用は重要である。
- グラフ構造や特徴量のシフトにより,知識転移が阻害される場合がある。
- 再利用可能な知識の損失を防ぎ,効果的な知識転移を実現する。
- DIB-ODは,情報ボトルネックとオンライン蒸留を組み合わせることで,異種グラフ間の適応を促進する。
- 教師モデルがタスクに関連する表現を圧縮し,転移可能なコアブランチと残差ブランチに蒸留する。
- 様々なグラフ分類データセットにおいて,既存手法と比較して一貫した性能向上を示した。
フィルタリングされた推論スコア:モデルの最も確信のある推論経路における推論品質の評価 [cs.CL, cs.AI]目的:大規模言語モデルの推論品質の評価
- LLMの性能向上は目覚ましいが,その推論過程の質が必ずしも保証されるわけではない。
- 従来の評価指標は正答率のみに注目しており,不適切な推論による正答を見抜けない。
- 推論の質を評価し,モデルの能力差をより正確に把握することを目指す。
- 提案手法であるFRSを用いることで,正答率が同じモデル間でも推論品質に有意な差が認められた。
- FRSの高いモデルは,異なる推論ベンチマークにおいても,正答率と推論品質の両方で良好な性能を示した。
- FRSは正答率を補完し,モデルの汎用的な推論能力を捉える有効な指標となり得る。
ゲート付きメモリポリシー:文脈内記憶と適応 [cs.RO, cs.AI]目的:ロボット操作における文脈内記憶と適応のメカニズム
- ロボット操作は,記憶の有無によってタスクの難易度が大きく変化する。
- 過去の情報を単純に拡張すると,分布シフトと過学習により性能が低下する。
- 必要な時に必要な情報を記憶・想起するメカニズムを学習することで性能向上を目指す。
- 提案手法GMPは,記憶ゲート機構により文脈の利用を制御し,ロバスト性と反応性を向上させた。
- GMPは,軽量なクロスアテンションモジュールにより,効率的な潜在メモリ表現を構築する。
- MemMimicベンチマークにおいて,長履歴ベースラインよりも平均成功率が30.1%向上した。
オンライン学習からマルチキャリブレーションへの効率的なブラックボックス還元と,Φ後悔最小化への新たな経路 [cs.LG, cs.GT]目的:オンライン学習とオンラインマルチキャリブレーション間の還元
- 機械学習の分野において,予測の精度向上と信頼性評価は重要な課題である。
- マルチキャリブレーションは高次元データにおいて効率的なアルゴリズムが確立されていなかった。
- オンライン学習の理論と手法を応用し,効率的なマルチキャリブレーションを実現する。
- オンライン学習アルゴリズムと期待変分不等式(EVI)ソルバーの組み合わせにより,高次元マルチキャリブレーションが可能となることが示された。
- 本研究は,既存アルゴリズムの分析を統一し,オンライン学習からマルチキャリブレーションへの保証を転送する。
- オンラインマルチキャリブレーションからΦ後悔最小化への還元を通じて,新たな経路が確立され,既存の結果が簡略化され,改善されたレートが得られた。
言語モデル出力分布におけるテールリスクの推定 [cs.DB, cs.LG, cs.AI]目的:言語モデルの出力分布における有害な出力の確率推定方法
- 言語モデルの能力向上と大規模展開に伴い,安全性評価の重要性が増している。
- 既存の安全性評価は入力分布に焦点を当て,モデルの確率的性質やテールリスクを無視している。
- 有害な出力の発生確率を効率的に推定し,言語モデルの安全性を評価することを目的とする。
- 提案手法は,有害な出力をより確率的に生成する安全でないモデルを作成し,効率的なサンプリングを実現する。
- ベンチマーク実験により,提案手法が10〜20倍少ないサンプル数で,モンテカルロ法と同等の精度を達成することが示された。
- 有害性推定は,モデル入力の摂動に対する感度を明らかにし,展開リスクを予測する可能性を示唆する。
要件工学におけるLLMベースの目標抽出の評価:プロンプティング戦略とその限界 [cs.SE, cs.AI, cs.CL]目的:要件工学における目標抽出の自動化
- 要件定義はソフトウェア開発の根幹であり,その品質がシステム全体の成功を左右する。
- 要件定義書は冗長でテキスト量が多く,手作業での分析に時間と労力がかかる。
- LLMを活用し,要件定義書の目標抽出を自動化することで,効率化と品質向上を目指す。
- 提案手法は,低レベル目標の識別において61%の精度を達成した。
- 本パイプラインは,完全な置換ではなく,手動抽出を加速するためのツールとして最適である。
- ゼロショットでのフィードバックループ機構が,単独のFew-shot学習よりも優れていた。
臨床データのAIモデル更新に伴うリスクの実証的評価:安定性,恣意性,公平性 [cs.AI]目的:AIモデル更新に伴うリスクの評価
- 臨床現場でのAI活用は増え,意思決定支援に不可欠となっている。
- データの陳腐化によりモデル性能が低下する可能性がある。
- モデル更新時のリスクを検出し,信頼性高いシステム開発を目指す。
- モデル更新戦略が,予測値の変動,恣意性の増加,およびサブグループの公平性悪化を引き起こすことが示された。
- 重症高血糖イベント予測をケーススタディとし,継続的なモニタリングの重要性を強調した。
- 信頼できる臨床意思決定支援システム開発には,継続的なモニタリングが不可欠である。
弱対強アライメントにおけるリスク評価:バイアス・バリアンスの観点から [cs.AI]目的:弱対強アライメントの失敗要因の分析
- スケーラブルな教師あり学習を実現する上で重要である。
- 強モデルが弱モデルの盲点において誤った自信を持つ場合がある。
- 盲点における誤りを特定し,リスク評価の指標を確立する。
- 弱対強アライメントのリスクは,バイアス・バリアンス・共分散の観点から分析された。
- 強モデルのバリアンスが,盲点における誤り(blind-spot deception)と最も強い相関関係にあることが示された。
- 強モデルのバリアンスは,弱対強アライメントの誤りを早期に警告する指標となりうる。
TransVLM:あらゆるショット遷移を検出するためのビジョン言語フレームワークとベンチマーク [cs.CV, cs.AI]目的:ショット遷移検出タスクの形式化と,それに対応するビジョン言語モデル(VLM)フレームワークTransVLMの提案
- 動画解析において,正確なショット境界検出は,動画の構造理解やコンテンツ検索に不可欠である。
- 従来のショット境界検出は,複雑な遷移に対して脆弱であり,動画ショットが破損する可能性がある。
- 連続的な時間的セグメントとして遷移を明示的に検出することで,ショット遷移検出の精度向上を目指す。
- TransVLMは,色と光学的フローを組み合わせた特徴表現を直接処理することで,時間的な認識能力を大幅に向上させる。
- 大規模なデータ合成エンジンと包括的なベンチマークを開発し,ロバストな学習を可能にした。
- 実験の結果,TransVLMは従来のヒューリスティック手法や最先端のVLMを凌駕する優れた性能を示した。
NPMixer:時系列予測のための階層的近傍パッチ混合 [cs.LG]目的:多変量時系列予測の性能向上
- 時系列データは経済や環境など幅広い分野で利用され,その予測は重要な意思決定に不可欠である。
- 多変量時系列データには複雑な時間的ダイナミクスと変数間のグローバルな依存関係が存在し,正確な予測が困難である。
- 学習可能なステーションリウェーブレット変換により,データに依存した方法でトレンドと詳細な成分を分解し,予測精度を向上させる。
- 提案手法NPMixerは,7つのベンチマークデータセットにおいて,最先端モデルと比較して一貫して高い性能を示した。
- 28回の実験設定のうち20回(71.4%)で,平均二乗誤差(MSE)においてより良い結果が得られた。
- 階層的近傍パッチ混合とチャネル混合エンコーダにより,多スケール依存性とチャネル相関を効果的に学習した。
インジェクションと実行の分離:ステートフルLLMエージェントにおける永続的メモリ攻撃と防御のメカニズム評価 [cs.CR, cs.AI, cs.LG]目的:LLMエージェントにおけるインジェクション攻撃とツール実行の分離性に関するメカニズム評価
- LLMエージェントは多様なタスクをこなせるが,セキュリティ上の脆弱性が懸念されている。
- プロンプトインジェクション攻撃は,LLMの安全性を脅かす主要な問題となっている。
- 永続的メモリを持つLLMエージェントへの攻撃と防御メカニズムの構造的な理解を目指す。
- プロンプトインジェクションの成功とツール実行の成功は,独立した安全性特性であることが明らかになった。
- 防御策がインジェクションを阻止しても,必ずしも実行を阻止できるわけではない。逆に,実行を阻止してもインジェクションを阻止できない場合がある。
- メモリサンドボックスは,8つのモデルで攻撃成功率を0%にまで低下させた。これは,メモリと実行コンテキストの構造的な分離が有効であることを示唆する。
多層アノテーターモデリングによる評価の再現性向上 [cs.CY, cs.LG, cs.AI]目的:評価における再現性の向上
- 生成AIの安全性,堅牢性,信頼性は重要であり,その評価方法の確立が求められている。
- AI評価は,アノテーターの主観やバイアスにより再現性が低いという課題を抱えている。
- アノテーター数増加に伴う実験再現性の向上を定量的に示すことを目指す。
- 多層ブートストラップアプローチを用いて,アノテーターの行動を現実的にモデル化した。
- 項目数($N$)と1項目あたりの応答数($K$)のトレードオフを,統計的有意性に基づき分析した。
- 大規模な評価データセットを用いることで,アノテーター間のばらつきを詳細に分析した。
NOVA:AIによる知識発見の限界 [cs.AI, cs.IT, math.IT]目的:AIによる反復的な自己改善を通じた新たな知識発見の可能性と,その限界
- AI技術の進展に伴い,知識発見の自動化が重要視されている。
- AIが発見する知識の信頼性や,効率的な探索方法が課題となっている。
- AIによる知識発見プロセスの理論的限界を明らかにし,改善策を提示する。
- NOVAモデルを用いて,知識空間における生成,検証,蓄積,再学習のサイクルを分析した。
- 早期に受け入れられた成果に生成が固定化される可能性や,誤った成果が混入する危険性を示した。
- 適切なアンカーリングと人間によるガイダンスが,知識発見の効率と信頼性を向上させることを明らかにした。
リーンリファクタ:エージェント戦略探索による多目的制御可能な証明最適化 [cs.RO, cs.MA, cs.LO, cs.AI, cs.CL, cs.LG, cs.SE]目的:リーン証明の多目的,制御可能,かつバージョン対応なリファクタリング
- 形式検証分野の発展は,ソフトウェアやハードウェアの信頼性向上に不可欠である。
- LLM生成証明は冗長で,バージョン変更に弱い点が課題である。
- LLMの再学習コストを抑えつつ,リーン証明を効率的に最適化すること。
- Lean Refactorは,既存手法やClaude Codeよりも高い圧縮率とコンパイル時間短縮を実現した。
- バージョンフィルタリングにより,ターゲットバージョンでの圧縮率が向上した。
- リファクタリングされた証明は,将来のリーンリリースに対する耐性が向上した。
MedCRP-CL:ベイジアン非パラメトリック意味モダリティ探索による継続的な医用画像セグメンテーション [cs.CV, cs.LG]目的:継続学習における医用画像セグメンテーションのためのタスク構造のオンライン探索と構造を考慮した継続学習
- 医用画像セグメンテーションは医療診断・治療において不可欠であり,その精度向上は患者予後の改善に繋がる。
- 既存の継続学習手法は,タスク間の競合により性能が低下するか,事前定義されたタスク分類に依存する。
- 本研究は,タスク構造を動的に探索し,知識転移を促進することで,医用画像セグメンテーションの継続学習における性能低下を抑制する。
- 提案手法MedCRP-CLは,臨床テキストプロンプトからタスク構造を動的に推論し,意味モダリティと呼ばれるグループを形成する。
- 意味モダリティごとにLoRAアダプタを維持し,モダリティ内EWCによる正則化を行うことで,パラメータの分離と知識転移を両立する。
- 16の医用セグメンテーションタスクにおいて,MedCRP-CLはベースラインを8.0%上回り,パラメータ数を6分の1に削減しつつ,Dice係数73.3%と忘却率4.1%を達成した。
有病率変化下におけるコンフォーマル・トリアージにおけるリリース側リスクの展開監査 [cs.LG, cs.CY]目的:コンフォーマル・トリアージにおけるリリース側リスクの展開監査
- 予測スコアを実際の行動に変換し,緊急度に応じた対応を可能にするため,臨床現場での活用が期待されている。
- 有病率の変化により,適切な患者の見落としや,人間によるレビューの必要性が変化する可能性がある。
- 有病率変化下で,リリースされた患者の中にイベント発生患者が含まれていないか評価し,適切な判断を支援する。
- 提案手法により,イベント発生患者がレビューなしでリリースされる割合を直接評価できることが示された。
- 有病率補正後,コンフォーマル・トリアージはレビューを減らすが,その中にイベント発生患者が含まれる可能性があることが示唆された。
- パイロットデータに十分なイベントラベルがない場合,低レビューのリリースルールをサポートできないという診断が可能であることが示された。
ActQuant:視覚言語行動モデルのための行動誘導型4bit未満量子化 [cs.CV, cs.AI]目的:視覚言語行動モデルの効率的な量子化手法の開発
- ロボットの自律行動を実現する上で不可欠な視覚言語行動モデルの重要性が高まっている。
- エッジデバイスでの利用のためには計算量の削減が課題であり,量子化が有効な手法である。
- 既存の量子化手法では性能劣化が大きいため,より効果的な量子化手法が求められている。
- ActQuantは,行動予測への貢献度に応じて重み行列にビット幅を割り当てることで,低ビット量子化における性能劣化を抑制する。
- アクションに配慮した曲率を用いてブロックごとの量子化スケールを最適化し,制御に影響の大きい重みに動的範囲を集中させる。
- 実機UR3アームでの実験により,ActQuantはベースラインと同等の成功率を維持しつつ,メモリフットプリントを2.5倍削減することを示した。
2からqノルムに対する多項式的に改善された近似アルゴリズム,および応用 [cs.DS, cs.LG, math.ST, stat.ML, stat.TH]目的:行列の2からqノルムに対する多項式時間での乗法的近似アルゴリズムの開発
- 組合せ最適化,量子情報,統計的アルゴリズムなど,広範な分野における未解決問題と密接に関連する重要な研究対象である。
- 既存のアルゴリズムは,近似精度に限界があり,その改善は多くの下流タスクに影響を及ぼす。
- 指数時間仮説のもとでの限界を超え,より高い近似精度を実現し,応用範囲を拡大することを目指す。
- 本研究では,q > 2 の場合において,既存の結果と比較して多項式的に改善されたdの1/8近似アルゴリズムを提案する。
- さらに,2からqノルムに対するsum-of-squares証明子を構築し,頑健な平均と共分散推定,回帰,クラスタリングといった応用への道を開く。
- この結果は,特にデータのq次モーメントのみが制限されている場合に,これらのタスクにおけるアルゴリズムの改善に貢献する。
