arXiv雑要約
AI - 2026/07/30 公開
PUDA:自己運転研究所のためのAIネイティブハードウェアハーネス [cond-mat.mtrl-sci, cs.AI]目的:自己運転研究所のハードウェア実行環境
- 科学研究の自動化が,実験効率と再現性を高め,新たな発見を加速する上で重要である。
- 従来の実験制御システムは,GUIに依存し,AIエージェントとの連携が困難であるという課題があった。
- AIエージェントが物理的なツールを直接操作できる,AIネイティブなハードウェアハーネスを提供することを目指す。
- PUDAは,コマンドライン環境を通じてエージェントが実験を観察,判断,実行できるよう設計されている。
- 実験の実行は決定論的,原子的,かつ監査可能であり,実験データのトレーサビリティを確保する。
- 実験プロトコル,実行,サンプル,測定,コマンドログなどをAIネイティブなデータ構造に組織化し,データの来歴を明確にする。
パフォーマンス予測下における広範な最適化問題に対する適応勾配法 [math.OC, cs.LG]目的:パフォーマンス予測下での最適化手法
- 機械学習モデルの展開が将来のデータ分布に影響を与える状況は重要性が増している。
- 既存手法は特定の分布や損失関数に依存し,実用性に限界がある。
- より弱い仮定の下で収束を保証する,実用的な最適化手法を開発すること。
- 提案手法は,有限差分を用いて誘導された分布シフトを明示的に推定する。
- これにより,より高次元の最適化や,広範な損失関数とデータ分布に対応可能となる。
- 数値実験により,提案アルゴリズムが既存のものよりも高速かつ安定的に収束することが示された。
管理されたWi-Fiネットワークにおける信頼性の高いトラフィック予測のための情報量に基づくクラスタ化された連合学習法 [math.CO, cs.DM, eess.SP, cs.LG]目的:管理されたWi-Fiネットワークにおけるトラフィック予測のための,情報量に基づくクラスタ化された連合学習法の開発
- Wi-Fiネットワークの性能最適化には,アクセスポイントの統計的特性を予測するAIの活用が不可欠である。
- アクセスポイントのデータを適切にクラスタリングし,情報量の多いクラスタを特定することが困難である。
- アクセスポイントの多様な統計的特性を考慮した,より高精度なトラフィック予測を可能にすること。
- 提案手法は,他の分散戦略と比較して最高の予測性能を達成した。
- クラスタ化された連合学習法の中で,最も低い通信コストとエネルギー消費を実現した。
- 精度が大幅に向上する状況下でのみ,単一モデルの連合学習法と比較してコストが増加する。
異常検知近傍における早期故障予測:プロアクティブなアプローチ [stat.ML, cs.LG]目的:異常検知近傍の識別
- 製造業等における品質管理や予測保全の重要性が高まっており,故障の早期発見が求められている。
- 従来の異常検知は,分布境界付近のサンプルに対して不確実性があり,将来の異常を予測しにくいという課題があった。
- 分布境界近傍に存在する「異常近傍」を検出し,将来の異常発生を未然に防ぐことを目指す。
- 提案手法CANARIは,Christoffel関数の理論的根拠に基づき,異常近傍を高精度に検出できることを示した。
- CANARIは,従来の二重閾値方式と比較して,より優れた性能を発揮することが確認された。
- 本研究は,レジリエンス向上,予測保全,品質管理におけるプロアクティブな異常予測の可能性を示す。
スタイル拡散TTSモデルの潜在空間適応によるゼロショット顔から音声合成 [eess.AS, cs.AI, cs.SD]目的:顔画像からの音声予測
- 歴史的人物やゲームキャラクターのように音声データがない場合でも,人物の口調を再現する技術が求められている。
- 従来の音声合成は参照音声が必要であり,視覚情報のみでは音声のクローン化が困難であった。
- 顔画像から音声スタイルを抽出し,自然な音声を生成することを可能とする。
- 静止画の顔画像から,自然な音声合成が可能であることが示された (UTMOS 3.7-4.0)。
- 顔画像と生成された音声の検索において,偶然よりも高い一致率が確認された。
- 英語で学習した顔-スタイルマッピングは,スペイン語の音声合成にも応用可能であることが示され,言語非依存性を示唆している。
安静時fMRIを用いたアルツハイマー病分類のためのAttentionに基づくフレームワーク [eess.IV, cs.AI, cs.HC, cs.LG, eess.SP]目的:アルツハイマー病の分類
- 高齢化社会の進展に伴い,アルツハイマー病の早期発見と診断は喫緊の課題である。
- 従来のfMRI解析では,脳機能の複雑な相互依存性を捉えきれず,分類精度が十分でない場合がある。
- 本研究は,脳領域間の長距離依存性を捉え,アルツハイマー病のより正確な分類を目指す。
- 提案手法は,手動による特徴量エンジニアリングを必要とせず,識別的な機能表現を学習する。
- ADNIデータセットを用いた評価では,88.95%の精度と0.90のROC-AUCを達成した。
- 自己注意機構による機能的結合モデリングが,アルツハイマー病検出において有効であることが示された。
交差のない確率的K線予測:再学習なし [stat.ML, cs.AI, cs.CE, cs.LG, q-fin.CP]目的:確率的K線予測における,四つの価格(始値・高値・安値・終値)の不確実性表現
- 金融市場予測において,価格変動の確率的な把握はリスク管理と意思決定に不可欠である。
- 従来のK線予測では,分位数の交差やK線の交差といった一貫性の問題が発生し,予測の信頼性を損なう。
- 予測モデルの再学習を伴わずに,K線予測の一貫性を高める手法を確立すること。
- 提案手法KQSPは,既存の予測モデルに依存せず,分位数の交差とK線の交差をゼロに削減できる。
- KQSPは,予測精度を維持しつつ,元の予測に対する修正を最小限に抑える。
- 予測生成と一貫性適用を独立させることで,様々なモデルへの適用が可能である。
データがないことはリスクがないことではない:可視度を考慮したグラフに基づく企業行動リスクの推論 [q-fin.RM, cs.LG]目的:企業行動リスクの将来的な発生予測
- 企業行動リスクの管理は,企業価値と社会への影響に関わる重要な課題である。
- 企業行動リスクに関するデータは不足しており,偏った情報しか得られない場合が多い。
- 企業間の関係性を活用し,データが少ない企業のリスク予測精度を向上させる。
- 企業間の関係性を考慮したグラフ構造の利用が,リスク予測の精度を高めることが示された。
- 特に,過去にリスク事例がない企業においても,グラフに基づく推論が有効であることが確認された。
- 本研究は,リスク評価において企業間関係構造が重要な情報源となることを実証した。
短く考え,賢く保留し,行動し,繰り返す:エッジLLMエージェントのための較正された推論と不確実性に基づいた保留 [stat.ML, cs.AI, cs.IT, cs.LG, math.IT]目的:エッジLLMエージェントにおける推論の効率化と信頼性の向上
- LLMエージェントは複雑なタスクを可能にするが,計算資源に制約がある環境での活用が課題。
- エッジ環境では,推論コストと信頼性のバランスが重要であり,不確実性の高い状況での適切な保留が困難。
- エッジLLMエージェントにおける推論コストの削減と,クラウドへの依存度を抑えつつ安全な行動を保証すること。
- 提案手法TSDSは,収束プローブとperplexityに基づく保留ルールを組み合わせ,推論を早期に停止し,不確実性の高い行動をクラウドに委譲する。
- TSDSは,HotpotQA,MBPP,ロボットタスクにおいて,推論計算量を43%-73%削減しつつ,報酬とクラウド呼び出し回数の保証を維持した。
- 多目的学習手法LTTにより,エピソード報酬とクラウド呼び出し回数の両方について,有限サンプル保証を提供。
適合率適応型センシングの確証化 [math.OC, cs.SY, eess.SY, math.AP, math.DS, math.FA, stat.ML, cs.LG, stat.AP, stat.ME]目的:画像再構成の正確性を確保するための測定回数の決定
- 高解像度画像処理において,必要な測定回数は重要な課題である。
- 固定された測定回数では,再構成誤差が目標値を超える可能性がある。
- 再構成誤差を目標以下に抑えつつ,効率的な測定回数決定を目指す。
- CoRASは,目標停止時間のカバレッジを達成することを示した。
- 固定レート停止ルールと比較して,平均測定回数を削減できる。
- 再構成が難しい画像には,より多くの測定を割り当てることが確認された。
次元の呪いを打破する:BANDによる高次元におけるノンパラメトリック分布推定 [stat.ML, cs.LG, stat.ME]目的:高次元におけるノンパラメトリック分布推定手法
- 多変量データ解析において,高次元データへの対応は重要な課題である。
- 次元の呪いにより,高次元データにおける分布推定の精度が低下する。
- スパース性を活用し,高次元データにおける分布推定の精度向上を目指す。
- 提案手法BANDは,混合データ型に対応し,高次元時系列データに対して有効である。
- BANDは,従来の密度推定器よりも速い収束率を実現し,多項式的な総変動収束率を示す。
- 実験結果から,BANDはデータサンプリングおよび信頼領域予測において,最先端のベンチマークと同等以上の性能を発揮する。
特徴のバギングは安定性をもたらす [stat.ML, cs.LG, math.ST, stat.TH]目的:特徴のバギングによるアルゴリズム安定性の研究
- 機械学習モデルの汎化性能向上には,安定性の確保が重要である。
- 特徴選択における不安定性は,汎化性能を損なう可能性がある。
- 特徴のバギングが,既存手法よりも安定性を向上させることを検証する。
- 特徴のバギングは,線形モデルおよび非パラメトリックモデルの両方において,安定性を向上させることが示された。
- 積極的な特徴サブサンプリングを行うほど,安定性の向上効果は大きくなることが明らかになった。
- 少数のバギングラウンドでも,無限バギングの安定性レベルに近づけることが示された。
原子中心構造記述子の限界を探る大規模言語モデルの利用 [physics.chem-ph, cs.LG]目的:原子中心構造記述子の限界の探求
- 原子レベルのモデリングにおいて,幾何学的記述子は不可欠である。機械学習への応用が広範である。
- 低次の記述子(2~4近傍クラスター)は不完全であり,異なる構造が同一の記述子を持つ問題が存在する。
- 大規模言語モデルを用いて,より高次の近傍クラスターでも識別が困難な構造の存在を示す。
- 大規模言語モデルを用いて,7近傍までのクラスターでも区別できない3次元構造の事例を発見した。
- 記述子の離散化レベルによっては,任意の次数で識別不能な構造が存在することが示された。
- AIが異なる分野間の知見を繋ぎ,科学的発見を加速させる可能性を示唆する。
非凸ニューラルネットワークにおけるノイズ耐性のある解について [cond-mat.dis-nn, cs.LG, math.PR]目的:非凸ニューラルネットワークにおける解のロバスト性
- 深層学習の性能向上には,最適化の理解が不可欠である。複雑な損失関数における解の構造が重要となる。
- 従来の最適化手法では,解空間の特定の構造(孤立した解など)に到達しにくい問題がある。
- 有限温度における解空間の構造を明らかにし,ロバストな解の探索を可能にすることを目指す。
- 有限温度においても,ゼロ温度で支配的な解が存続することを示した。
- 許容誤差εに応じて,アルゴリズムがアクセス可能な領域の閾値α_OGP(ε)が変化することを示した。
- 教師あり学習において,エネルギーが有限の広い領域が,良好な汎化性能を維持することを確認した。
PIKS:普遍的な物理情報カーネル法 [math.CO, cs.DM, stat.ML, cs.LG]目的:物理制約を満たしつつ,ターゲット関数を漸近的に学習すること
- 物理現象の理解と予測には,データ駆動型モデリングと物理法則の組み合わせが不可欠である。
- 既存のカーネル法は,ターゲット関数が特定の再生核ヒルベルト空間に属するという制約がある。
- 物理制約下でのカーネル法の普遍的整合性を証明し,より現実的な問題に対応すること。
- PIKSは,線形微分制約に対して普遍的整合性を持つことが示された。
- 汎用カーネル(ガウス関数やマターン関数など)を用いることで,ターゲット関数を物理制約を満たしつつ学習可能となる。
- 数値実験により,PIKSはPINNや伝統的な有限要素法と同等の性能を示すことが確認された。
人間知能を用いたてんかん発作の開始・終了時刻の検出:臨界遷移に基づくアプローチ [math.DS, cs.LG]目的:てんかん発作の開始および終了時刻の検出
- てんかんは多くの患者に影響を及ぼす神経疾患であり,早期発見と適切な治療が重要である。
- 既存のアルゴリズムは,事前処理や解釈困難な機械学習に依存し,発作の多様性やノイズに弱い。
- 臨界遷移の概念に基づき,より正確かつロバストな発作検出アルゴリズムを開発する。
- 提案アルゴリズムは,専門家による発作開始・終了時刻の注釈との一致度をROC分析で定量的に評価した。
- アルゴリズムのパラメータを最適化することで,ほとんどの場合において専門家レベルの性能を達成した。
- 全ての記録セッションで適用可能な汎用的なパラメータセットを導出し,高い性能を維持することを示した。
近似EFX割り当ての限界への挑戦 [cs.GT, cs.AI, cs.DM]目的:加法的な評価関数を持つエージェント集合への分割不可能な商品の割り当て
- 公正な資源配分は社会経済活動において不可欠であり,特に分割不可能な商品の場合,その実現は困難である。
- 完全な羨望フリー性(EFX)の実現は計算量的に難しく,近似的なEFX割り当ての限界が課題となっている。
- 近似EFXの存在範囲を広げ,既存の近似率の壁を超えることを目指している。
- エージェント数が7以下,評価値が3以下,またはマルチグラフで表現可能な場合,2/3-EFX割り当ての存在が示された。
- 2/3-EFXという緩和された条件により,完全なEFX割り当てが可能な設定よりも広範な設定で存在結果が得られた。
- 既存の0.618の壁を超え,より高い近似保証(2/3)を達成し,近似EFX割り当てに関する知見を深めた。
顔表情行動単位認識におけるシームスネットワークを用いた1フレーム較正 [cs.CV, cs.AI, cs.LG]目的:顔表情行動単位 (AU) 認識における較正戦略
- 表情分析において,AU認識は重要な役割を担う。個人差が大きいことから,汎化性能が課題となっている。
- 未知の顔に対するAU認識では,個人差によるバイアスが大きく,精度が低下する問題がある。
- 中立表情の1フレーム画像を用いた較正により,バイアスを軽減し,認識精度を向上させることを目指す。
- 提案手法である較正シームスネットワーク (CSN) は,DISFA,DISFA+,UNBC-McMasterデータセットにおいて,IR50の性能を大幅に改善した。
- CSNは,単純な引き算による較正方法や,その微調整版と比較しても優れており,最先端の非較正モデルを上回る性能を示した。
- 顔の属性(しわ,眉の位置,ヒゲなど)によるバイアスを効果的に軽減することで,AU強度推定とAU検出の両方において高い精度を実現した。
MEDIC:臨床応用におけるLLMの安全性と有用性を示す主要指標の包括的評価 [cs.CL, cs.AI]目的:臨床用LLMの能力を示す主要指標
- 医療現場でのLLM活用が期待される中,その性能評価は不可欠である。
- 既存の評価指標は飽和状態であり,臨床ワークフローとの乖離が課題である。
- MEDICは,臨床LLMの能力を多角的に評価し,適切なモデル選択を支援する。
- MEDICは,静的知識の検索能力と実際の機能実行能力の間にギャップが存在することを示した。
- 高い拒否率で調整されたモデルは,必ずしも臨床記録の事実確認において正確な監査を行えないことが明らかになった。
- 単一のアーキテクチャが全ての側面で優位性を示さず,多様なモデルポートフォリオの必要性が示唆された。
ロバストなAC-OPFのための物理情報グラフニューラルネットワーク [eess.SY, cs.LG, cs.SY]目的:AC-OPF解法の物理制約付きグラフニューラルネットワークフレームワーク
- 電力系統の安定運用には,高精度な潮流計算が不可欠であり,その重要性は増している。
- 既存手法では,データの前処理が必要であり,異常状態や大規模停電時の対応が困難である。
- 不安定なデータに対してもロバストな潮流計算を実現し,系統変更への迅速な対応を可能にする。
- PINCOは,既存のDeepOPF-FTやIPOPTソルバーと比較して,同等の制約充足度を達成する。
- IPOPTと比較して,2~3桁の計算時間短縮を実現し,運用コストの削減にも貢献する。
- IEEEやスイスの送電網を用いた評価により,多様な負荷条件や系統構成変化に対するスケーラビリティとロバスト性が確認された。
大規模言語モデルと集団自己進化による動的ファジージョブショップスケジューリング問題の自動プログラミング [cs.NE]目的:動的ファジージョブショップスケジューリング問題に対する自動プログラミング手法の開発
- ジョブショップスケジューリングは,製造業等の生産計画において重要な課題である。
- 従来のヒューリスティック手法は,特定の状況に依存し,専門家の調整が必要となる場合が多い。
- 大規模言語モデルと進化アルゴリズムを組み合わせることで,ヒューリスティック探索の効率化を目指す。
- 提案手法SeEvoは,遺伝的プログラミングや深層強化学習等の既存手法と比較して,優れた性能を示すことが確認された。
- 特に,未知の動的な状況下において,SeEvoは既存手法を大きく上回る成果を達成した。
- 教師あり学習機構により,大規模言語モデルが不確実性を推論し,変化に適応する能力を獲得した。
LLMによる医学診断の信頼性:一貫性,操作可能性,文脈認識の検証 [cs.CL, cs.AI, cs.CY, cs.HC]目的:医学診断におけるLLMの信頼性
- 医療現場でのAI活用が期待される中,LLMの診断能力に対する検証が重要である。
- LLMは,入力内容の些細な変化や無関係な情報に影響を受けやすい可能性がある。
- LLMの診断における一貫性,操作可能性,文脈認識の程度を明らかにする。
- 両モデルは,条件を制御した入力に対する診断の一貫性は100%を示した。
- 無関係な情報が付加された場合,Geminiは40%,ChatGPTは30%のケースで診断が変化した。
- 文脈への応答性はChatGPTの方が高く,しかし不適切な診断変更も多かった。
イベント条件付き信用度に基づくエビデンス融合の決定指向型同時最適化 [cs.AI]目的:異種情報源からのエビデンス融合における,正しい決定を支援する重要なエビデンスの識別と活用
- 多様な情報源を統合し,より正確な判断を下すことは,様々な分野で重要である。
- 既存手法では,少数意見のエビデンスが重要である場合,その信用度を過小評価する可能性がある。
- イベント条件付き信用度を用いて,エビデンスの相対的な信用度を評価し,正確な意思決定を支援する。
- 提案手法は,エビデンスが真実に貢献する度合いをより正確に評価できることが示された。
- 既存の信用度に基づくエビデンス融合手法と比較して,正しいイベントをより強く支持することが示された。
- モンテカルロテストにより,提案手法が安定的に固定点を達成する高い実証的確率が確認された。
タスクと技能の計画:ブラックボックス技能による階層型ロボット計画 [cs.RO, cs.AI]目的:タスクと技能の計画手法
- ロボットの自律的な行動を可能にする上で,複雑なタスクを効率的に計画する能力は不可欠である。
- 従来のタスクと動作計画は,技能を単純な運動計画に還元する傾向があり,複雑な技能の統合が困難であった。
- 多様な技能(学習技能,力制御技能,ブラックボックスポリシー)を統合し,複雑なタスクを解決すること。
- 提案手法は,既存の多様なロボット技能を階層型プランナーに統合し,タスクの失敗原因を客観的に分析する能力を維持する。
- Composable Interaction Primitives (CIPs) を活用することで,連続する技能間の遷移計画を合成し,計画時および実行時の調整を可能にする。
- 二足歩行ロボットや移動ロボットを用いた実世界実験により,CIPsが多様なロボットによる複雑なタスク解決を可能にすることが示された。
医療画像におけるAIアライメント:反事実分析による隠れたバイアスの解明 [cs.LG, eess.IV, stat.ML]目的:医療画像における機械学習モデルのバイアス評価手法
- 医療診断の精度向上に機械学習が貢献する一方,バイアスによる性能劣化が懸念される。
- 機微な属性(年齢,性別等)に依存したバイアスが,診断の公平性を損なう可能性がある。
- 反事実分析を用いて,バイアスの存在を定量的に評価し,公平性を担保する。
- 提案手法は,反事実不変性の概念に基づき,機微な属性の変化に対するモデルの予測変動を測定する。
- 条件付き潜在拡散モデルと統計的仮説検定を組み合わせることで,直接的な反事実データなしにバイアスを特定・定量化する。
- CheXpertやMIMIC-CXR等のデータセットを用いた実験で,提案手法は既存手法よりも高い性能を示す。
AIはいつ従うべきか:タスク構造と人間とAIエージェントの協調適応 [cs.MA, cs.AI, cs.HC]目的:人間とAIエージェントの意思決定タスクの分担と順序
- 組織における効率的な意思決定には,人間とAIの役割分担が重要である。
- AIと人間の適応メカニズムの違いが,協調的な意思決定を阻害する可能性がある。
- タスク構造に応じて,最適な人間とAIの連携方法を明らかにすること。
- 人間の適応を反映した最新の結果重視の仕組みは,大規模な変動に弱いが,局所的な修正に有効である。
- アルゴリズム的な更新の一貫性を反映した均一な記憶体系は,過去の軌跡を増幅させる。
- AIは,高いパフォーマンスの人間を追随することで連携パフォーマンスが最大化される。低いパフォーマンスの人間が開始したシーケンスは,広範な探索によって救済される。
大規模言語モデルの低精度学習:手法,課題,および機会 [cs.LG, cs.AI]目的:大規模言語モデルの低精度学習に関する既存手法の包括的なレビュー
- 近年,大規模言語モデルは様々な分野で優れた性能を発揮しているため,その学習効率が重要視されている。
- 低精度学習はハードウェアリソースを削減するが,手法が多様化し,全体像の把握が困難になっている。
- 本研究は,低精度学習手法を数値フォーマットに基づいて体系的に整理し,分野の発展に貢献する。
- 既存の低精度学習手法を,固定小数点,浮動小数点,カスタムフォーマットの3つの主要なグループに分類した。
- 量子化対応学習手法と低精度学習の類似性を明らかにし,ハードウェア互換性,計算効率,および信頼性について議論した。
- 今後の研究方向性として,効率性だけでなく,ロバスト性とデプロイの信頼性向上が重要であることを指摘した。
マルチモーダル医療データのモデリングにおける課題と提案される解決策:体系的レビュー [cs.LG, stat.ML]目的:マルチモーダル医療データのモデリングにおける課題と解決策
- 臨床研究において,多様なデータ統合により,診断精度向上や個別化医療の実現が期待されている。
- 異種データの統合には,欠損,サンプルサイズ,次元の不均衡,解釈可能性などの技術的課題が存在する。
- これらの課題を克服し,マルチモーダルモデリングの実用性と効果を高めることを目指す。
- 本レビューでは,69の研究から共通の障害として,モダリティの欠損,限られたサンプルサイズ,次元の不均衡などが特定された。
- 転移学習,生成モデル,注意機構,ニューラルアーキテクチャ探索などの最新手法が有望な解決策として挙げられている。
- 本レビューは,現在の動向と革新を包括的に示し,医療応用における今後の研究開発を導くための洞察を提供する。
AI LEGO:産業における責任あるAI実践における初期設計段階での異分野連携の足場 [cs.HC, cs.AI]目的:産業における責任あるAI実践における初期設計段階での異分野連携の課題解決
- AI開発における潜在的な危害への対応は重要であり,開発ライフサイクル早期からの取り組みが求められている。
- 異分野チームでは,技術部門から非技術部門への意図伝達や,共通認識の醸成,危害評価の支援が課題となっている。
- AI LEGOは,知識の伝達と有害な設計選択の特定を促進し,初期設計段階での連携を支援することを目的とする。
- AI LEGOは,既存のツールよりも多くの危害を特定し,危害発見の可能性を高めた。
- モジュール構造とペルソナプロンプトにより,危害の特定がよりアクセスしやすく,協力的な責任あるAI実践を促進した。
- AI LEGOは,境界オブジェクト理論に基づき,異分野の実務者間の知識伝達を効果的に支援する。
密な局所依存性が長系列Transformer学習中の注意ロジット爆発と学習不安定性を誘発する [cs.LG]目的:長系列Transformer学習における注意ロジット爆発と学習不安定性の原因解明
- Transformerは自然言語処理において高い性能を発揮するが,長系列データ学習時の安定性が課題。
- Transformerの低精度演算下での学習不安定性は注意ロジット爆発を伴うが,根本原因は不明。
- 密な局所依存性が注意ロジット爆発の主要因であることを解明し,安定学習を可能にする。
- 密な局所依存性は効果的に高ランクな注意構造を生み出し,低ランクな自己注意機構はその近似に大きなロジットを必要とする。
- 注意ロジットの増加は系列長とともに進行し,注意次元の増加や局所依存性の明示的なモデル化によって抑制される。
- 局所依存性の密度がロジット増加の主要因であり,局所性だけでは説明できないことが示された。
等変回帰型ニューラルネットワーク:均質空間におけるグリッドフリーでスケーラブルな旅行時間予測 [cs.LG, cs.AI]目的:均質空間上の旅行時間予測手法
- 地球科学や画像処理など,多様な分野で物理現象のシミュレーションが重要視されている。
- 従来のシミュレーション手法は計算コストが高く,複雑な形状への適用が困難である。
- ニューラルネットワークを用いて,効率的かつ高精度な旅行時間予測を実現することを目指す。
- 等変回帰型ニューラルネットワークは,多様なEikonal解を効率的に表現し,汎化性能を向上させる。
- 潜在空間の変換を通じて,Eikonal解を予測可能に制御し,幾何学的に意味のある変更を誘導できる。
- 2D,3D,球状のベンチマークデータセットにおける地震旅行時間モデリングで,既存手法と比較して優れた性能を示す。
MemAgent:マルチターンRLに基づくメモリアー gentによる長文脈LLMの再構築 [cs.CL, cs.AI, cs.LG]目的:長文脈タスクにおけるLLMの性能維持と拡張性
- 長文脈処理は,大量の情報から知識を獲得し活用する上で不可欠である。
- 既存手法では,長文脈における性能劣化や計算コストの増加が課題である。
- 長文脈における性能を維持しつつ,より長いテキストへの拡張を可能とする。
- MemAgentは,テキストを分割して読み込み,メモリーを上書きする戦略により,長文脈能力を向上させる。
- 8Kの文脈で学習したモデルが,3.5MのQAタスクに対して,5%未満の性能低下で拡張可能であることを示した。
- 512K RULERテストにおいて,95%以上の精度を達成した。
ReDiSC:構造化予測を用いたスケーラブルなノード分類のための再パラメータ化されたマスク拡散モデル [cs.LG]目的:ノードラベルの結合分布の推定
- グラフ構造データは現実世界の複雑な関係性を表現でき,様々な応用分野で重要性が増している。
- 既存のノード分類手法は,ノードラベル間の条件付き独立性を仮定しており,現実のグラフにおける相関性を捉えきれない。
- ノードラベル間の構造的な相関関係を考慮した,より正確なノード分類手法を開発すること。
- ReDiSCは,再パラメータ化されたマスク拡散モデルを用いてノードラベルの結合分布を推定することで,構造化予測を実現する。
- 理論的な解析により,ReDiSCが最先端モデルDPM-SNCよりもEステップにおいて効率的であることが示された。
- 大規模データセットにおいても有効に機能し,既存の構造化拡散法が抱える計算上の制約を克服した。
FPEdit:局所的パラメータ編集によるロバストなLLMフィンガープリント [cs.CR, cs.AI]目的:大規模言語モデルの信頼できる起源検証
- LLMは膨大な投資が必要であり,知的財産として保護する必要がある。
- 既存のフィンガープリント技術は,アクセス制限や敵対的攻撃に対する脆弱性がある。
- 適応や検出に対するロバスト性,そしてモデルの有用性を維持しつつフィンガープリントを埋め込む。
- FPEditは,知識編集を利用して,モデルの重みを疎にターゲットを絞った修正を通して意味的に一貫性のある自然言語フィンガープリントを注入する。
- FPEditは,フルパラメータのファインチューニングやパラメータ効率的な適応下で94〜100%のフィンガープリント保持率を達成し,ダウンストリームベンチマークでのパフォーマンスを維持する。
- 量子化,プルーニング,確率的デコーディングに対してもロバストであり,LLaMA2-7Bに10組のフィンガープリントペアを2分未満,30GB以下のGPUメモリで埋め込むことができる。
プライバシーと効率のバランス:加法準同型暗号化による音楽情報検索 [cs.DB, cs.AI, cs.CR]目的:音楽情報検索におけるプライバシー保護と効率的な検索手法
- 音楽情報検索は音楽利用の促進に不可欠であり,その重要性は高まっている。
- ベクトル埋め込みの共有は,プライバシー侵害や悪用につながるリスクを伴う。
- 加法準同型暗号化を用いることで,プライバシーを保護しつつ効率的な検索を実現する。
- 音楽特有の推論攻撃を実装し,プライバシーと有用性のトレードオフを定量的に評価した。
- ブロックごとの重み付け学習を導入した構造認識型加法準同型演算を提案し,暗号学的コストを削減した。
- 4つのオーディオデータセットを用いて,加法準同型検索が最近傍ランキングを正確に保持し,既存手法よりも優れたスケーラビリティを示すことを実証した。
眼科AIのギャップを埋める:MM-Retinal-ReasonデータセットとOphthaReasonモデルによる動的マルチモーダル推論 [cs.AI]目的:眼科領域における動的マルチモーダル推論能力の向上
- AI技術の医療応用は,診断精度向上や医療効率化に貢献し,臨床現場でのニーズが高い。
- 既存の医療AIモデルは,単純な画像特徴量の一致に基づく推論に偏りがちで,臨床的思考を模倣できていない。
- 多様な臨床情報と画像データを統合した,より高度な推論能力を持つAIモデルの開発が求められている。
- MM-Retinal-Reasonデータセットは,基礎的・複雑的推論タスクを網羅し,眼科領域におけるマルチモーダル推論研究を促進する。
- OphthaReasonモデルは,Uncertainty-Aware Dynamic Thinking (UADT)により,基礎的・複雑的タスクへの柔軟な適応を実現した。
- 実験結果から,OphthaReasonは既存モデルを大幅に上回り,最先端の性能を達成した。
ファインチューニングの利点 [cs.LG]目的:分類精度向上における,より詳細なラベルを用いた学習の効果
- 多くのデータセットは階層構造を持つため,その構造を利用した学習が重要である。
- 階層構造を持つラベルにおいて,粗い粒度での学習が一般的であり,詳細な粒度での学習は試されていない。
- データ構造とラベル階層の関係性に着目し,詳細な粒度での学習が有効な条件を明らかにする。
- 詳細なラベルを用いた学習は,必ずしも分類精度を向上させるものではないことが示された。
- その効果は,データ構造とラベル階層の関係性,特に決定境界の冗長性に大きく依存する。
- データセットの規模やモデルの容量も,詳細なラベルを用いた学習の有効性に影響を与えることが分かった。
HealthSLM-Bench:モバイル・ウェアラブルヘルスケアモニタリングのための小規模言語モデルのベンチマーク [cs.AI, cs.HC, cs.LG]目的:モバイル・ウェアラブルヘルスケアモニタリングにおける小規模言語モデルの性能評価
- 人々の生活の質向上に貢献するモバイル・ウェアラブルヘルスケアモニタリングの重要性が高まっている。
- 既存のLLMベースのソリューションはプライバシーやリソースの問題を抱えている。
- 小規模言語モデルのヘルスケア予測における性能向上と実用性検証を目指す。
- 小規模言語モデルは,LLMと同程度の性能を維持しつつ,効率性とプライバシーを大幅に向上させることが示された。
- 特に,クラス不均衡や少数ショット学習における課題が残されている。
- 小規模言語モデルは,次世代のプライバシー保護型ヘルスケアモニタリングの有望な選択肢となりうる。
ロボット用把持地点予測のための把持位置認識に基づく2段階学習 [cs.RO, cs.AI]目的:ロボットの把持に適したベース位置の選択
- ロボットの自律的な把持作業において,ベース位置の決定は重要である。
- ベース位置の最適化は計算コストが高く,リアルタイム性に課題がある。
- 効率的なベース位置予測により,把持成功率と安全性を向上させる。
- 提案手法GBPPは,距離と視認性に基づく自動ラベリングと高精度シミュレーションによる2段階学習で高速な予測を実現した。
- シミュレーションおよび実機実験において,従来のベースライン手法を上回り,安全かつ到達しやすいベース位置を選択した。
- 安価なヒューリスティックとターゲットを絞ったシミュレーションによるデータ効率の良いアプローチが有効であることが示された。
大規模学習,コンパクトな展開:コンパクトな低ランク適応のための構造化圧縮 [cs.CL, cs.LG, cs.AI]目的:表現力豊かな低ランクアダプターの取得
- 大規模言語モデルの効率的なファインチューニング手法の確立が求められている。
- LoRAは表現能力が完全なファインチューニングに劣る場合がある。
- 過パラメータ化された空間から効率的に低ランクアダプターを抽出すること。
- PrunedLoRAは,構造化プルーニングを用いて高表現力な低ランクアダプターを取得する。
- PrunedLoRAは,固定された低ランク予算ではなく,動的に重要度の低い要素をプルーニングする。
- 理論的分析により,構造化プルーニングの頑健性が証明され,実験的に様々なタスクでLoRAを上回る性能を示した。
VideoNorms:ビデオ言語モデルの文化的認識に関するベンチマーク [cs.CV, cs.AI, cs.CL, cs.CY]目的:ビデオ言語モデルにおける文化的規範認識の評価
- グローバル展開が進む中で,文化的な背景を理解したAIの重要性が高まっている。
- 既存のビデオ言語モデルは,文化的規範の理解に偏りがあり,誤った判断を下す可能性がある。
- 異なる文化圏のビデオデータを用いて,モデルの文化的認識能力を客観的に評価する。
- USと中国のテレビ番組を用いて構築されたデータセットVideoNormsを用いて,複数のビデオ言語モデルを評価した。
- モデルは,アメリカの規範よりも中国の規範の抽出において性能が劣る傾向が見られた。
- 非言語的証拠の提供は,言語的証拠よりも困難であることが示された。モデルのサイズ拡大だけでは性能向上は限定的である。
グラフニューラルネットワークのラデマッハー複雑性:表現力と幾何学の統一 [cs.LG]目的:グラフニューラルネットワークの表現力と入力空間の幾何学構造の関係性から,汎化性能の上限を導出すること。
- グラフ学習において,汎化性能,表現力,入力空間の幾何学構造の相互作用を理解することは重要である。
- 既存研究では,表現力の高いGNNは識別能力が高い反面,汎化性能の保証が弱いというトレードオフが存在する。
- 本研究は,ラデマッハー複雑性を用いて,GNNの表現力と入力空間の幾何学構造を考慮した汎化性能の上限を導き出す。
- グラフ不変量がGNNの表現力を上限で抑える場合,入力空間は同値類に分割され,ラデマッハー複雑性は訓練サンプルの分布によって制御される。
- 離散的な分割を超えて,入力空間の幾何学構造を組み込み,リプシッツ連続性下での被覆数上限を導き出し,データ幾何学上で仮説クラスが滑らかな場合に複雑さコストが軽減されることを示した。
- 経験測度のウォータハウス距離に対するラデマッハー複雑性のリプシッツ連続性が証明され,サンプリング変動下でのロバスト性と汎化性能が保証された。
ウェアラブル心電図パッチにおけるオンデバイス推論とワイヤレスストリーミング:エネルギー効率の高いマルチモーダル深層学習 [cs.RO, cs.LG, cs.CV]目的:ウェアラブル心電図パッチにおける,心電図(ECG)と心音図(PCG)のマルチモーダル深層学習
- ウェアラブルセンサは医療現場での継続的な健康モニタリングに不可欠であり,その低消費電力化が求められている。
- ウェアラブルデバイスのリソース制約から,データ処理をデバイス上で行うか,クラウドへ送信するかという課題がある。
- 本研究は,デバイス上でのデータ処理が,エネルギー効率の面で優位性を持つことを検証する。
- 提案する深層畳み込みニューラルネットワーク(CNN)は,0.975という高い精度を達成した。
- NPUによる推論は,CPUによる推論と比較して約1/7のエネルギー消費で済んだ。
- 一般的なデータサイズにおいて,ローカル推論は生データストリーミングよりも大幅にエネルギー効率が良い。
ARC-Encoder:大規模言語モデルのための圧縮されたテキスト表現の学習 [cs.CL, cs.AI]目的:大規模言語モデルにおけるテキスト表現の圧縮
- 近年,LLMの性能向上に伴い,扱うテキストデータの量が増大し,計算コストが課題となっている。
- 既存の文脈圧縮技術は,ターゲットモデルの微調整やアーキテクチャ変更を必要とし,汎用性を損なう可能性がある。
- 本研究は,モデル変更を伴わず,汎用的に利用可能な文脈圧縮手法の開発を目指す。
- ARC-Encoderは,テキストトークン数を大幅に削減した連続的な表現を生成し,LLMの推論効率を向上させる。
- 多様なLLM使用シナリオにおいて,既存の最先端技術を上回る性能を達成した。
- 異なるデコーダーLLMに対して,単一のエンコーダーを適用可能であり,移植性の高いソリューションを提供する。
重要なものを測定する:状況判断テストによるAIの心理測定的評価 [cs.AI]目的:AIの行動特性の測定
- AIの挙動理解は,その信頼性と安全性を高める上で不可欠である。
- LLMのペルソナ設定による行動制御は,一貫性に欠ける場合がある。
- 状況判断テストを用いて,LLMの安定した行動傾向を評価する。
- ペルソナ設定されたAIの行動は,実行ごとに安定していることが示された。
- 潜在的特性スコアは,外部ベンチマーク(TruthfulQA,EmoBenchなど)の性能と相関関係がある。
- 状況に基づいた心理測定的評価は,AI行動評価のより信頼性の高い手段となりうる。
クリーン画像バックドアにおける生成トリガー最適化によるステルス性と攻撃力のトレードオフ打破 [cs.AR, cs.RO, cs.CV, cs.CR, cs.LG]目的:クリーン画像バックドア攻撃におけるトリガー最適化
- 深層学習モデルのセキュリティ確保は重要であり,悪意のある攻撃に対する防御が不可欠である。
- 既存手法では,攻撃成功に必要なポイズニング率が高いと,正常精度が低下し,攻撃が露呈しやすい。
- トリガー自体を最適化することで,正常精度の低下を最小限に抑え,よりステルス性の高い攻撃を実現する。
- 提案手法GCBは,条件付きInfoGANを用いて,強力かつステルスなトリガーとなりうる自然な画像特徴を特定する。
- GCBは,少数のポイズニング例からバックドアを学習し,正常精度の低下を1%未満に抑えることに成功した。
- GCBは,6つのデータセット,5つのアーキテクチャ,4つのタスクで高い汎用性を示し,回帰やセグメンテーションにも適用可能である。
集中学習と分散的自己組織化のバランス:具現化された形態形成のためのハイブリッドモデル [cs.HC, cs.AI]目的:具現化された形態形成における制御方法の定量モデル
- 具現化された知性と発生形態形成は,中央集権的な誘導と分散的な物質力学の分業に依存する
- 自己組織化を導くために必要なトップダウン制御の量については不明な点が多い
- 反応拡散ダイナミクスを用いた制御された自己組織化のメカニズムを解明する
- ハイブリッド制御モデルは,純粋な反応拡散やニューラルネットワーク主導のモデルと比較して,厳密な収束を達成した
- ハイブリッドモデルは,ニューラルネットワーク主導のモデルに比べて,L1努力とL2パワーを大幅に削減した
- 効果的な制御は,「種をまき,手放す」という戦略が最適であり,初期の穏やかなパラメータ調整が重要である
BioPro:ビジョン言語モデルにおける差異を考慮したジェンダー公平性に向けて [cs.NI, cs.AI]目的:ビジョン言語モデルのジェンダー表現におけるバイアス軽減
- 社会における公平性の重要性が高まる中,AIシステムのバイアスが問題視されている。
- 既存の公平性介入は,集団間の差異を無視し,均一な扱いを強制することが多い。
- 文脈に応じてバイアスを軽減し,有効な差異を維持する選択的デバイアスを目指す。
- BioProは,カウンターファクチュアル埋め込みを用いてジェンダー変動の低次元空間を特定し,情報の中和に活用する。
- 中立的な文脈でのジェンダーバイアスを効果的に削減し,明示的な文脈ではジェンダーの忠実性を維持する。
- ジェンダーバイアス以外にも,シーンの明るさなど連続的なバイアス変数にも適用可能であることが示された。
疎な葉の発生頻度カーネルによる森林近傍性の再検討 [cs.CL, cs.LG, cs.DS, cs.PF]目的:森林近傍性の効率的な計算手法の開発
- 決定木森林は,様々な機械学習タスクで広く利用されており,その性能向上は重要である。
- 従来の森林近傍性の計算は計算量が膨大であり,大規模データへの適用が困難であった。
- 疎な葉の発生頻度カーネルを利用し,計算量を削減し,効率的な近傍性計算を実現する。
- 提案手法は,既存の近傍性計算方法と等価でありながら,計算量を大幅に削減できることを示した。
- 近傍性行列のスパースな因数分解により,全てのペア間の比較を回避し,線形代数の演算に計算を帰着させた。
- 実験結果は,提案手法が理論的に予測されるスケーリング特性を実証しており,タスクに応じた埋め込みにも利用可能であることを示した。
DP-MGTD:適応的差分プライバシーを用いた実体サニタイズによる機械生成テキスト検出 [cs.CR, cs.CL, cs.LG]目的:機械生成テキスト検出におけるプライバシー保護
- 生成AIの普及に伴い,テキストの信頼性確保が重要になっている。
- プライバシー保護と検出精度の両立が課題である。
- 差分プライバシー技術と実体サニタイズを組み合わせ,精度劣化を抑制する。
- 提案手法DP-MGTDは,ノイズ付加による頻度推定とプライバシー予算の動的調整を実現した。
- 差分プライバシーノイズが,人間と機械のテキストの違いを強調する現象を明らかにした。
- MGTBench-2.0データセットにおいて,高い検出精度と厳格なプライバシー保護を両立した。
