arXiv雑要約
AI - 2026/08/04 公開
進化的なカリキュラム学習が生物学的配列モデリングを改善する [cs.AI, cs.LG, q-bio.BM, stat.ML]目的:生物学的配列モデリングにおける性能向上
- 生物学的配列は,疾患変異予測や機能的RNA設計など,多くの応用分野で重要である。
- 従来のVAE学習では,配列の進化的な構造を無視しており,性能向上の余地がある。
- 進化的な距離に基づいて訓練データを提示することで,VAEの学習効率と汎化性能を高める。
- 進化的なカリキュラム学習(ECL)を適用した結果,p53のClinVar分類AUROCは0.981から0.989に向上した。
- PTENにおいては,ECLは全てのseedで1.000を達成し,ベースラインの不安定性(平均0.905,最低0.54)を改善した。
- RNAのファミリー配列生成では,ECLはcovariance-model bit scoresを向上させ,15回の訓練のうち12回でベースラインを上回った。
医療機器のサイバーセキュリティリスク管理をSECUMANオントロジーとシェイプで支援 [cs.CR, cs.AI]目的:医療機器のサイバーセキュリティリスク管理文書の表現と分析
- 医療機器のネットワーク接続が進み,サイバーセキュリティリスクが患者安全に直接影響する可能性が高まっている。
- リスク管理文書が半構造化された自然言語テキストで保持されることが多く,一貫性の検証や再利用が困難である。
- サイバーセキュリティリスク管理文書の自動検証とトレーサビリティを向上させることを目指す。
- SECUMANオントロジーは,セキュリティリスクのコンテキスト,評価,対策,残余リスク評価をモデル化するためのOWLベースの語彙を提供する。
- SHACL制約を用いて文書構造の完全性と意図されたモデルへの適合性を検証する。
- VDE Spec 90025およびRISKMANオントロジーとの整合性を保ちつつ,脅威シナリオなどのサイバーセキュリティ関連概念を拡張している。
大規模言語モデルを用いたグラフ誘導型自動アルゴリズム設計 [cs.AI, cs.NE]目的:NP困難な組合せ最適化問題に対する自動ヒューリスティック設計
- 組合せ最適化問題は現実世界の様々な課題に応用され,効率的な解法が求められている。
- 既存の自動アルゴリズム設計手法は,テンプレートに依存しており,自律的な設計が困難である。
- 生成されるオペレーターの信頼性向上と,効果的な評価手法により自律設計を実現する。
- 提案手法DGA$_2$Dは,プログラム空間をグラフ構造化し, topological contextに基づいた評価を行う。
- 12種類の組合せ最適化問題で実験を行った結果,最先端のLLMベースラインと比較して性能が向上した。
- 平均正規化ギャップを最大10.96パーセントポイント削減することに成功した。
カスケードの追跡:科学的エージェントの幻覚に対するトポロジーを考慮した評価フレームワーク [cs.IR, cs.CL, cs.AI]目的:科学的エージェントの幻覚に対する,証拠に基づいたトポロジーを考慮した評価フレームワーク
- 科学研究におけるLLMエージェントの信頼性は重要であり,知識の相互接続性が高い分野で幻覚は特に深刻な問題となる。
- 既存の幻覚評価ベンチマークは表面的なレベルでしか機能せず,知識のトポロジー構造を無視している。
- 本研究は,科学的エージェントの幻覚を評価するための,トポロジーを考慮した新たなフレームワークを構築し,そのメカニズムを解明する。
- SCHEMAは,科学的概念グラフを自動的に構築し,主張検証,多段推論,説明生成,実験コード生成を含むタスクを生成する。
- 幻覚は,知識のハブとなる高接続度の概念に集中する傾向があることが明らかになった。
- 最終的な回答の正確性は,推論の整合性と必ずしも一致せず,構造的に欠陥のある推論を通して正しい結論に至る場合がある。
ビデオ理解のためのカバー率駆動型適応キーフレーム選択 [cs.CL, cs.CL, cs.CV, cs.AI]目的:ビデオ理解における計算コスト削減
- 大規模なビデオデータの活用が重要視される中で,計算効率が課題となっている。
- 既存手法では,クエリごとに適切なキーフレーム数を決定できず,大量のフレームを処理する必要がある。
- クエリとフレームの関連性のプロファイルを推定し,カバー率に基づいてキーフレーム選択を効率化する。
- 提案手法CSESは,既存手法と比較して,フレームのスコアリング数を4~13倍,キーフレーム数を18.4~20.5%削減できる。
- CSESは,フレーム選択処理を3.1~5.4倍高速化することに成功した。
- 精度を維持しながら計算コストを削減し,ビデオ理解の効率化に貢献する。
股関節外骨格向け段階的マルチエージェント学習(SMAT):代謝および生体力学的検証によるシミュレーション学習型協調適応コントローラの妥当性 [cs.RO, cs.LG]目的:股関節外骨格支援のための協調適応コントローラの代謝および生体力学的妥当性
- 歩行支援技術は,人々の移動能力を向上させ,QOLの維持・向上に貢献するため重要である。
- 外骨格と人間の協調適応は,学習問題の非定常性を引き起こし,制御器の開発を困難にしている。
- シミュレーションで学習したコントローラを実環境で検証し,その有効性とロバスト性を評価すること。
- SMATによって学習されたコントローラは,被験者8名に対して実環境で検証された。
- 能動支援により,代謝コストはパッシブデバイスと比較して19.7%低下した(p < 0.001)。
- 生体力学的解析により,全ての被験者において主に正の股関節機械的パワーが確認され,学習条件を超えたロバスト性も示された。
生成画像は忘れやすい:合成画像検出のための機械的アンラーニングの視点 [cs.CV, cs.LG]目的:生成画像の検出
- 生成モデルの悪用に対抗するため,生成画像の堅牢な検出は不可欠である。生成AIの普及に伴い,その重要性は増している。
- 既存手法は人間によるアノテーションに依存し,未知の分布への汎化性能が低いという課題がある。
- 大規模ビジョンモデルのアンラーニング特性を利用し,自然画像と生成画像の忘却速度の差に着目する。
- 大規模ビジョンモデルは自然画像と生成画像の両方の特徴を捉えやすく,識別能力が低いことが判明した。
- アンラーニング時,生成画像の特徴劣化が自然画像よりも速く進行することを発見した。
- データアクセス不要なデータフリー検出と,データ駆動型検出の二つの手法を提案し,従来の検出手法を上回る性能を実証した。
AIに基づく論文評価:人間による評価優先順位の実証的研究とその自動評価への影響 [cs.AI, cs.CL]目的:論文評価における指導教員の基準重み付け
- 論文評価は学術の質を保証する上で重要であり,効率化が求められている。
- AIによる自動評価では基準の重み付けが課題であり,専門家の主観に頼る傾向がある。
- 指導教員の実際の基準重み付けを明らかにすることで,AI評価の精度向上を目指す。
- 84名の指導教員への調査から,論文評価基準の重み付けに専門家との乖離が確認された。
- 指導教員の重み付けをAI評価システムに組み込んだ実験で,評価精度は若干改善した。
- しかし,AI評価と人間評価の乖離は大きく,基準重み付けの調整だけでは十分な改善は認められなかった。
マルチエージェントLLMパイプラインにおける敵対的攻撃:エージェントAIアーキテクチャの構造的脆弱性の解明 [cs.CR, cs.AI, cs.MA]目的:マルチエージェントLLMパイプラインの構造的脆弱性
- LLMを活用した複雑なタスク解決において,マルチエージェントシステムは不可欠な存在となっている。
- エージェント間でのデータの受け渡しに境界検証が欠如しており,セキュリティ上の脆弱性が存在する。
- エージェント間の信頼関係に起因する構造的な攻撃対象領域を特定し,対策を提示すること。
- 敵対的なコンテンツがパイプライン全体に伝播する脆弱性が確認された。
- 攻撃の成功はモデルの能力よりもパイプラインの構造に依存することが示された。
- パイプラインレベルでの防御策の必要性が示唆される。
CascadeLUT:帯域幅制約のあるFPGA向け情報順序ストリーミング推論 [cs.AR, cs.LG]目的:帯域幅制約下でのFPGAにおける情報順序ストリーミング推論の実現
- ニューラルネットワークをFPGAに実装することで,低遅延かつ省電力な推論が可能となる。
- 従来のFPGA推論は,入力データ全体を前提としており,帯域幅制限下ではパイプラインが停止する。
- 入力データの転送量を削減し,データ移動がボトルネックとなる問題を解決する。
- CascadeLUTは,特徴量を順序付けられたサブセットに分割し,サブセットの到着に合わせて予測を段階的に洗練する。
- これにより,データ移動量を削減しつつ,精度を維持することが可能となった。
- 実験結果から,既存のLUTベースラインと比較して,遅延が4.0~12.5倍,スループットが3.0~5.0倍,エネルギー消費量が最大13.8倍低減された。
バックドアの緩和:デコイショートカットと知識の分離 [cs.RO, cs.LG, cs.CV]目的:深層ニューラルネットワークにおけるバックドア攻撃の緩和
- 深層学習モデルの信頼性は重要であり,特に第三者データに依存する学習環境ではバックドア攻撃のリスクが存在する。
- バックドア攻撃は,わずかな悪意のあるデータによってモデルを操作し,予測を誤らせる可能性がある。
- バックドア知識を隔離し,モデルの性能を維持しながらバックドア攻撃の影響を軽減すること。
- 提案手法Trapping and Removing (TR)は,バックドア知識を捕捉する軽量なショートカット枝を導入し,学習後にその枝を削除することでバックドアを緩和する。
- エントロピーに基づく重み割り当てによる知識分離戦略は,悪意のあるサンプルをショートカットに誘導し,メインネットワークの良性学習を促進する。
- 自動ショートカット生成戦略により,様々なモデルアーキテクチャへの一般化性能が向上する。
ハード制約下逆時間物理情報ニューラルネットワークにおけるKolmogorov-ArnoldネットワークのRISC-Vによる評価 [cs.LG, cs.AI, cs.PF]目的:ハード制約下逆時間物理情報ニューラルネットワークにおける残差ダイナミクス学習のためのKolmogorov-Arnoldネットワークの性能評価
- 物理現象のシミュレーションにおいて,物理法則を組み込んだニューラルネットワークの活用が重要視されている。
- パラメータ効率の高いネットワーク構造が提案されているが,組み込み環境での実行性能が課題となっている。
- Kolmogorov-Arnoldネットワークが,組み込み環境において,期待される性能を発揮するか検証する。
- 学習済みの重みを共有した場合,Kolmogorov-Arnoldネットワークの残差ブランチは,MLPと比較して13.5倍から14.5倍遅く,エネルギー消費量も4.7倍から18.7倍増加した。
- INT8量子化下では,Kolmogorov-Arnoldネットワークの軌道は,MLPと比較して最大43倍早く発散し,重みの量子化が原因であることが示された。
- パラメータ効率は,スカラー組み込みコアへの展開コストに直結せず,特定の量子化設計なしではMLPがより信頼できる選択肢となる。
EduPluginBench:AI生成教育プラグインの実行保証 [cs.SE, cs.AI]目的:AI生成プラグインの実行保証基準およびステージングされた承認方法
- 教育現場でのAI活用は進むが,セキュリティとプライバシーへの懸念が課題である。
- コード生成モデルが出力するプラグインの安全性と信頼性が十分に検証されていない。
- AI生成プラグインの安全性評価基準を確立し,脆弱性を早期に発見すること。
- EduPluginBenchは,1440件のプラグイン変種を対象に,セキュリティレベルP0-P4の検出率をP0-P2と比較して74.7%向上させた。
- 最新のコード生成モデルで生成された600件のプラグインでは,解析可能なものはあったものの,P0レベルの基準を満たすものは存在しなかった。
- 過去の診断実験では,事後的な修正によりP0レベルを通過するプラグインが112件見られたが,いずれも基準を満たさなかった。
AI,安全計算,データサービス等のためのマルチテナントKubernetes利用事例 [cs.DC, cs.AI, cs.PF]目的:AI,安全計算,データサービス等におけるマルチテナントKubernetesの利用事例の評価
- 近年,AI等の多様な利用事例が増加しており,柔軟性と再現性が求められている
- 従来のバッチ処理システムでは,クラウドネイティブな環境で期待される柔軟性を提供できない
- Kubernetesをスーパーコンピュータに導入し,多様なワークロードに対応する環境を構築する
- スーパーコンピュータIsambard-AI上でKubernetesの導入評価を行った。
- 医療・健康科学分野向けのTrusted Research Environmentと,AIモデルホスティングサービスを構築した。
- Kubernetes-as-a-Serviceの提供に向けた課題と今後の開発方向性を議論した。
行動文法:小型言語モデル事前分布と二次の時間分析による適応型マルウェアの検出 [cs.AI]目的:適応型マルウェアの検出
- エンドポイント保護において,シグネチャベースのアプローチでは多態性マルウェアに対応できない。
- 大規模な深層学習モデルは,監査可能性とスケーラビリティに課題がある。
- 本研究では,軽量なモデルで監査可能かつスケーラブルな検出を目指す。
- ホストランタイムの振る舞いを構造化言語として扱い,0.88MパラメータのTransformer(TinyGPT)で文法を学習する。
- 適応型攻撃エージェント(AAA)に対して93%の検出率,3.84%の初期誤検知率を達成した。
- イベント間隔の変動係数が重要な識別子であり,攻撃者のステルス性と機能のトレードオフを示す。
プロンプトがロボットを制御するとき:マルチエージェントロボットシステムにおけるプロンプトインジェクション攻撃 [cs.RO, cs.AI, cs.CR, cs.MA]目的:マルチエージェントロボットシステムにおけるプロンプトインジェクション攻撃の評価
- 近年,ロボットの自律性が高まり,LLMとの連携が進んでいるため,セキュリティ上の脆弱性評価が不可欠である。
- LLMを搭載したロボットシステムは,プロンプトインジェクション攻撃に対して脆弱であり,安全性への懸念がある。
- マルチエージェント環境におけるプロンプトインジェクション攻撃の伝播と影響を明らかにすること。
- 実験の結果,プロンプトインジェクション攻撃は,タスク完了率の低下と敵対的な行動を引き起こすことが示された。
- 攻撃は,共有されるプロンプト構造を通じてエージェント間で伝播し,その影響はプロンプト構成と対象エージェントによって異なる。
- アーキテクチャの変更がLLMへのクエリに影響を与え,攻撃の成功率に変化をもたらすことが明らかになった。
私と私のボット:RedditにおけるAIコンパニオンコミュニティでのユーザーの会話内容 [cs.HC, cs.AI]目的:AIコンパニオンコミュニティにおけるユーザーの会話内容
- AI技術の進化に伴い,人間とAIの関係性が社会的に重要となっている。
- AIとの関係性に関する研究は,その実態が十分に解明されていない。
- AIコンパニオンとの関係性におけるユーザーの感情や議論内容を把握すること。
- RedditのAIコンパニオンコミュニティの投稿の約45%が,ユーザー自身のAIとの関係性について言及していた。
- 自身のAIボットに関する投稿は,一般的なボットに関する投稿と比較して,感情表現が顕著に異なっていた。
- 関係性に焦点を当てた投稿では,コンパニオンシップとロマンスがそれぞれ約46%を占め,性的な内容が8%だった。
生成AIのためのデジタル熱力学的コンピュータCN101 [cs.ET, cs.AI]目的:生成AIへの熱力学的計算の応用可能性
- 近年,生成AIの発展は著しく,計算資源の需要が急増している。
- 従来の計算機アーキテクチャでは,消費電力と性能の限界が課題となっている。
- 熱力学的計算という新しい計算パラダイムの可能性を探求し,その実用化を目指す。
- 熱力学的計算を,従来のLangevin力学に限定せず,より一般的なエルゴード過程として定式化することに成功した。
- この定式化により,計算精度,並列性,ハードウェアへの依存性の低減といった,熱力学的計算の重要な特性が明確になった。
- CMOS技術を用いたデジタル熱力学的計算チップCN101を試作し,VAEやフローマッチングといった生成AIタスクで有効性を示した。
設定可能なシステムの不完全な忠実度によるチューニング [eess.SY, cs.SY, cs.SE, cs.AI, cs.DB, cs.PF]目的:設定可能なシステムの性能最適化
- システム性能を向上させるためには設定の最適化が不可欠であり,その重要性は高い。
- 設定項目が多岐に渡り,設定測定には高いコストがかかるという課題がある。
- 不完全な忠実度環境下でのチューニングにより,予算を効率的に活用し,性能向上を図る。
- MFTuneは,$>10^4$個の不完全な忠実度設定空間を探索し,有用な設定を近似することで,高質な初期値を生成する。
- 実験結果から,MFTuneは83.33%のケースで既存のチューナーよりも優れた性能を示し,最大19.34%の改善を達成した。
- また,一般的に予算を大幅に節約することができた。
FinDeepIndicator:金融指標構築における深層学習研究エージェントのベンチマーク [cs.HC, cs.AI]目的:金融指標構築における深層学習研究エージェントの評価
- 金融指標は,データ分析やリスク評価など,様々な分野で不可欠なツールである。
- 既存のベンチマークは最終的な回答の精度に焦点を当て,指標構築プロセスを評価していない。
- 深層学習研究エージェントの金融指標構築能力を包括的に評価するベンチマークを開発すること。
- FinDeepIndicatorは,金融指標構築の全段階(数式指定,データ収集,計算,回答生成)を評価する。
- LLMは数式指定では高い性能を示すが,データ取得と数値計算で精度が低下する。
- 深層学習研究エージェントはLLMを上回る性能を示すものの,実用的な金融分析設定では信頼性に欠ける。
反応収率予測のための汎用的なビジョンとクロスアテンション [cs.LG, physics.chem-ph]目的:反応収率予測の精度向上
- 化学反応の最適化は,効率的な物質開発に不可欠であり,収率予測は重要な課題である。
- 従来の予測手法は,空間情報を欠く1次元量子記述子に依存しており,精度に限界があった。
- 2D分子構造と物理有機データ融合により,空間情報を考慮した高精度な予測モデルを構築すること。
- 汎用的なコンピュータビジョンバックボーンが,量子記述子のみを用いた既存手法を上回る性能を示した。
- クロスアテンション機構により,2つのモダリティ(ビジョンと物理有機データ)を効果的に統合し,予測精度を向上させた(テストRMSE = 5.27%)。
- ネットワークは重要な立体障害を優先的に学習し,電子パラメータの減衰を防ぐ機構を備えていることが示された。
妥当性なき測定:エージェントAI評価における信頼性の複合的問題 [cs.RO, cs.RO, cs.AI]目的:エージェントAI評価における信頼性問題の構造的分析
- AIの社会実装が進む中で,その性能評価は安全性や規制遵守に不可欠である。
- 既存のAI評価指標は,その妥当性や信頼性が十分に検証されていない。
- AI評価パイプライン全体における信頼性の低下を防ぐための具体的な対策を示す。
- 自動生成されたタスク,LLMシミュレーター,評価者の判断において,それぞれ信頼性の問題が複合的に発生している。
- これらの問題は加算的にではなく,乗算的に信頼性を損なうため,評価全体の妥当性は著しく低下する可能性がある。
- 心理測定学に基づき,シミュレーターの較正基準や信頼性指標の閾値,報告義務など,具体的な改善策を提案する。
ウェアラブル無声音声インターフェースのための大規模オープンボキャブラリ三種モ−ダルデータセットSoniSpeech [cs.SD, cs.HC, cs.LG]目的:ウェアラブル無声音声インターフェースのための大規模三種モ−ダルデータセット
- ウェアラブル無声音声インターフェースは,利便性が高く,様々な応用が期待されるため重要である。
- 既存のウェアラブル無声音声インターフェースは,語彙サイズが小さく,実用性に課題がある。
- 本研究は,大規模かつオープンボキャブラリなデータセットを構築し,認識性能の向上を目指す。
- SoniSpeechは,超音波エコープロファイル,音声,顔面ビデオの三種モ−ダルデータセットであり,18,000の発話を含む。
- このデータセットを用いて,オープンボキャブラリ無声音声認識のベンチマークを確立し,26.3%の単語誤り率を達成した。
- データセットは公開されており,今後の研究開発に貢献することが期待される。
AgentSLABench:リソース制約下におけるエージェントシステムの評価とベンチマーク [cs.AI]目的:自律型AIエージェントのリソース制約下での性能評価
- AIエージェントの実用化には,精度だけでなく,コストや計算資源の効率性が重要である。
- 既存のベンチマークは主に精度に焦点を当てており,リソース消費量に関する評価が不十分である。
- 本研究は,リソース消費量と正確性を総合的に評価するフレームワークを構築し,実用的なエージェント評価を実現する。
- AgentSLABenchは,CPU,メモリ,時間,ネットワーク使用量に加え,正確性,遅延,コストを測定するリソースを意識した評価フレームワークである。
- タスク特化型エージェントは,5つのコアタスクのうち3つで100%の成功率を達成する一方,汎用ベースラインは4つのドメインタスクで完全に失敗した。
- 効率調整成功率(EASR)により,コスト無制限の高精度は実用性に乏しいことが示された。
15分シティとしてのパリ:説明可能なAIの視点 [cs.CL, cs.LG]目的:パリ都市圏における,日常生活サービスへのアクセスと実際の移動行動の関係性の定量化
- 都市の持続可能性向上には,近隣での利便性向上と移動手段の多様化が不可欠である。
- 15分シティの概念と実際の都市活動との間の具体的な関連性が明確に示されていない。
- 都市の政策立案に向け,移動行動に影響を与える要因を特定し,地域特性を考慮した戦略を提示する。
- 公共交通機関の利用状況や社会経済的背景が,移動手段の選択に影響を与えることが示された。
- 高密度の公共サービスは,短距離移動における自動車利用を抑制する効果が確認された。
- 説明可能なAIを用いることで,都市計画において考慮すべき重要な要素を可視化することが可能となった。
大規模言語モデルは医師の精度を向上させるが,誤った依存を生む [cs.IR, cs.AI, stat.AP]目的:医師の意思決定における大規模言語モデルの支援効果
- 医療現場での意思決定支援の重要性が増しており,AI技術の活用が期待されている。
- 大規模言語モデルの根拠となる情報源の提示が,医師の判断にどのような影響を与えるか不明である。
- 根拠情報提示型大規模言語モデルが医師の判断精度と安全性に与える影響を明らかにすること。
- 大規模言語モデルCORAの導入により,医師の診断精度が向上した(70.8%→82.6%)。
- 根拠情報が提示された場合,正答率が高まる一方で,誤った回答にも医師が従いやすくなることが示唆された。
- 根拠情報提示型大規模言語モデルは精度向上に貢献するが,誤った情報への依存という安全上のリスクも存在する。
人間とAIの協働におけるスケーリングのパラドックス [cs.AI, econ.GN, q-fin.EC]目的:人間とAIの協働システムのパフォーマンス向上に関するスケーリング効果の条件
- AI技術の発展は,ビジネスや社会に大きな変革をもたらす可能性を秘めている。
- AIの性能向上と,人間との協働における実際の効果の乖離が課題となっている。
- 人間のAI能力に対する認識が,スケーリング効果に及ぼす影響を明らかにすること。
- AIのスケーリングが,人間のAI能力に対する正確な認識がある場合に限り,人間とAIの協働システムのパフォーマンス向上に繋がる。
- 人間がAI能力を過大評価する場合,AIのスケーリングはシステム全体のパフォーマンスを低下させ,企業利益を減少させる可能性がある。
- 企業は,コストの内部化や認識の調整といった運用方針を通じて,AIのスケーリング効果を管理することで,パフォーマンスを改善できる。
等方性断崖:大規模言語モデルにおける意思決定の幾何学的特徴 [cs.AI]目的:大規模言語モデルにおける意思決定の幾何学的構造
- 言語モデルの性能向上には,意思決定メカニズムの理解が不可欠である。
- モデルの意思決定過程の幾何学的特性は,未だ十分に解明されていない。
- 意思決定に重要な幾何学的変化を特定し,そのメカニズムを明らかにすること。
- 複数のモデルとデータセットにおいて,意思決定に重要な層で等方性の変化が確認された。
- この等方性の変化は,表現の変化とタスクに関連するクラスターの出現と一致する。
- この幾何学的挙動と下流タスクの精度には強い相関関係が見られた(r≈0.84)。
AdvPlan-Bench:構造化プラン生成エージェントの敵対的評価 [cs.RO, cs.LG]目的:構造化プラン生成エージェントの敵対的評価のためのベンチマーク
- 現実世界の計画立案では,他のエージェントの反応を考慮する必要がある。
- 既存の評価方法では,プランの品質を孤立して評価しており,敵対的な状況下での挙動が不明である。
- 敵対的状況下でのプラン生成エージェントの性能を評価するための標準的なベンチマークを提供する。
- AdvPlan-Benchを使用することで,ベストレスポンスポリシーがBLUEアドバンテージを0.518から0.486に,BLUE勝利率を0.900から0.820に減少させることを確認した。
- オフラインLLMポリシーベースラインはBLUEアドバンテージ0.496,BLUE勝利率0.700を達成し,二段階マルチエージェント協議はそれぞれ0.509,0.813であった。
- 3人の評価者によるルーブリック感度分析では,0.978という高い評価者間一致度が得られた。
脆弱X症候群におけるα・γ脳波バイオマーカーのための深層学習CNNと再帰解析 [cs.LG, cs.AI, cs.CV, physics.data-an, q-bio.NC]目的:脆弱X症候群の脳波表現型を自動的に特徴づけるための深層学習フレームワーク
- 神経発達障害の客観的指標が求められており,脳波は非侵襲的な評価手段として重要である。
- 脆弱X症候群の脳波におけるα波とγ波の異常は確認されているが,その定量的な解析が課題である。
- 深層学習を用いて,脳波のα波とγ波を統合的に解析することで,より正確なバイオマーカーを開発すること。
- 提案手法は,単一のモダリティよりも高い識別性能を示し,γ波の特徴量が特に有効であることが示された。
- α波とγ波の統合解析は,最も優れた全体的な性能を示し,深層学習による非線形表現の有用性が示唆された。
- 本研究は,脆弱X症候群の診断,層別化,治療モニタリングへの応用が期待される,スケーラブルな脳波バイオマーカー開発への道を開く。
非線形ラプラシアンが符号付き有向グラフ学習を改善する [cs.LG]目的:符号付き有向グラフの学習における非線形ラプラシアン演算子の有効性
- グラフニューラルネットワークは,複雑な関係性を扱う上で重要な役割を担う。
- 符号付き有向グラフの学習には,線形ラプラシアンが主に用いられており,非線形ラプラシアンの研究は不足している。
- 符号付き有向グラフに特化した非線形ラプラシアン演算子を開発し,学習性能の向上を目指す。
- 本研究で提案するNLSDは,符号付きグラフと有向グラフのラプラシアン概念を拡張した新しい演算子である。
- NLSD-GNNは,ノード分類とリンク予測の両タスクにおいて,既存手法を上回る性能を示した。
- 符号付きおよび有向の情報統合において有効であり,多様なデータセットで優れた結果が得られた。
プルーンドBPE:バイトペアエンコーディングにおける後学習の可視性プルーニングとトークン再割り当て [cs.CL, cs.LG]目的:バイトペアエンコーディングにおける可視性プルーニングとトークン再割り当てによる効率化
- 自然言語処理において,トークン化はモデル性能に大きく影響する重要な処理である。
- 標準的なBPEは,最終的な出力に現れない中間的なトークンも多く含み,効率が低いという課題があった。
- 可視性プルーニングにより,効率的な語彙を構築し,エンコード長を削減することを試みる。
- プルーンドBPEは,標準BPEと同程度の語彙サイズでエンコード長を削減することに成功した。
- 特に,40%の可視性閾値を設定した場合,エンコード長は0.27%~0.36%程度削減された。
- 分析の結果,内部専用トークンには再利用可能な言語断片や文字コードなどが含まれることが明らかになった。
微分方程式に対する適応量子物理情報ニューラルネットワーク:流体ダイナミクスへの応用 [cs.LG, physics.flu-dyn]目的:非線形偏微分方程式の解法精度向上
- 科学技術計算において,複雑な物理現象のシミュレーションは不可欠であり,その精度と効率が求められる。
- 従来の物理情報ニューラルネットワークは,高次元問題や多重スケール問題において,高い精度を効率的に達成することが難しい。
- 量子技術と機械学習を融合させ,最適化のボトルネックを解消し,解法精度を飛躍的に向上させる。
- 本研究では,適応的な配置点サンプリングと損失に依存する注意機構を通じて,量子物理情報ニューラルネットワーク(QPINN)の性能を向上させた。
- 大規模なPDE残差や急峻な解勾配を持つ領域に重点を置くことで,従来のPINNに内在するスペクトルバイアスを軽減できることが示された。
- ベンチマーク流体流れや反応拡散系において,解の精度が少なくとも60%向上することが確認された。
HyperODE:動力系シミュレーションと推論のためのゼロショットサロゲート [cs.CC, math.CO, cs.LG]目的:動力系モデルのシミュレーションと推論を加速するサロゲートモデル
- 複雑な動力系の理解と制御には膨大な計算コストが伴うため,効率的な手法が求められている。
- 従来のサロゲートモデルは特定のモデルに特化しており,モデル変更時に再学習が必要となる。
- モデル構造の変化に柔軟に対応し,再学習なしでシミュレーションと推論を可能にすること。
- HyperODEは,常微分方程式の構造をハイパーグラフに変換することで,モデルの変更に強いサロゲートを実現した。
- 学習データに含まれないモデルやサイズに対しても,高い精度で予測区間を生成することが示された。
- ノイズを含む軌道からパラメータを推定する逆問題においても,高速かつ高精度な結果が得られた。
UAVを用いたIoTネットワークにおける連邦学習のための部分的観測伝送制御 [cs.RO, cs.IT, cs.LG, math.IT]目的:UAVを用いたIoTネットワークにおける連邦学習の伝送制御に関する研究
- IoTデバイスの普及により,分散型学習の需要が高まっており,エッジインテリジェンスが重要になっている。
- 無線帯域の共有利用による干渉や伝送の信頼性低下が,連邦学習のボトルネックとなっている。
- 部分的観測下での伝送制御により,パケット配信率を向上させ,連邦学習の性能改善を目指す。
- 提案手法は,平均パケット配信率の最大化とコンセンサスの達成を両立する公平性・コンセンサス二重最適化(FCB)を行う。
- FCB最適化は,閾値コントローラ(CTC)と電力コントローラ(FPC)で構成され,パケット配信率を効率的に改善する。
- CNNベースの連邦学習実験の結果,提案手法が既存手法と比較して,集約・学習性能を向上させることが示された。
SparseKAN:基底関数,ニューロン,ビットにわたるKolmogorov-Arnoldネットワークの圧縮 [cs.LG]目的:Kolmogorov-Arnoldネットワークの圧縮手法
- ニューラルネットワークの効率化は,計算資源の制約下での応用展開に不可欠である。
- 従来の圧縮手法では,Kolmogorov-Arnoldネットワーク特有の冗長性が十分に扱えていない。
- 基底関数,ニューロン,数値精度といった軸での圧縮により,効率的なモデル構築を目指す。
- SparseKANは,基底関数,ニューロン,数値精度という3つの軸でネットワークを圧縮する統合的なアプローチである。
- MNIST,CIFAR-10,CIFAR-100の実験結果から,構造的な軸が予測可能なコストで構成されることが示された。
- FPGA上での推論速度は最大23.63倍に向上し,SparseKANが機能的な冗長性をソフトウェアおよびハードウェアの効率に変換することが実証された。
キロバイトモデル:ニューラルネットワークを種と量子化された潜在変数として [cs.LG]目的:ニューラルネットワークの再現レシピ
- ネットワークの配布・保存には容量が課題。特に無線通信やエッジデバイスでは重要。
- モデルのパラメータ数が増加し,保存・転送コストがボトルネックになっている。
- パラメータ数ではなく,潜在変数を保存することで圧縮を実現する。
- マッピングモデルは,低ビット量子化と同等の精度を維持しながら,必要な保存容量を大幅に削減する。
- 潜在変数を微調整することで,より積極的なビット幅での量子化が可能になる。
- 再現レシピは,ランダムな基底に依存せず,構造化された基底を用いることで計算コストを抑制する。
医療IoT環境における侵入検知のための説明可能なハイブリッド特徴選択 [cs.CR, cs.LG]目的:医療IoT環境における侵入検知のための特徴選択手法
- 医療機器の増加に伴い,セキュリティリスクも増大しており,対策が急務である。
- IoTデバイスはリソースが限られており,複雑なセキュリティ対策の導入が困難である。
- 限られたリソースで高精度かつ説明可能な侵入検知システムの実現を目指す。
- ピアソンの相関フィルタとSHAP値に基づくハイブリッド手法により,特徴量を大幅に削減した。
- CIC-IoMT 2024およびCIC-IDS 2017データセットにおいて,精度とF1スコアを維持しつつ,特徴量を最大88%削減した。
- 本手法は,リソース制約のある医療ネットワークへの展開に適した実用的な侵入検知器となる可能性がある。
時系列衛星画像からの訓練不要汎用作物マッピング:PhenoStitch [cs.CV, cs.LG]目的:汎用作物マッピングのパイプライン
- 食料安全保障の観点から,作物の分布把握は重要であり,その効率化が求められている。
- 従来の作物のマッピング手法は,大量のラベル付きデータとタスク固有のモデル学習に依存しており,新しい地域への適用が困難である。
- 本研究では,ラベルをほとんど必要とせず,タスク固有の学習を行わずに汎用的な作物マッピングを実現することを目指す。
- PhenoStitchは,事前に学習済みの分割モデルと,光学およびレーダーデータの時系列情報を活用することで,少ないラベルで高精度な作物マッピングを可能にした。
- PASTIS-Rデータセットにおいて,既存のベースライン手法と比較して,作物のmIoU,セグメンテーション品質,汎用品質において優れた性能を示した。
- レーダー観測データが最も大きな性能向上に貢献し,グラフエネルギーによるマージとコンパクトなフェノロジー特徴量も改善に寄与することが示された。
連合学習における類似度重み集約と全体的差分プライバシーによる脳病変セグメンテーション [cs.AI, cs.CR, cs.CV]目的:脳病変セグメンテーションのための連合学習フレームワークの開発
- 医療画像診断において,複数施設が協力してモデルを学習することで,より高精度な診断が可能となる。
- 各施設のデータ分布の不均一性や,モデル更新を通じた情報漏洩のリスクが課題となっている。
- データ共有を伴わない,プライバシー保護された連合学習システムの実現を目指す。
- 提案手法DP-SimAggは,類似度に基づく重み付け集約とサーバー側の差分プライバシーメカニズムを統合する。
- 厳格なプライバシー予算下(epsilon = 1)においても,競争力のあるセグメンテーション性能を維持した。
- プライバシー予算を緩和した場合(epsilon = 10),非プライベートなベースラインに匹敵する性能が得られた。
GeoArbiter:リモートセンシング多imodal LLMにおける検証可能性に基づく根拠付け [cs.HC, cs.LG]目的:リモートセンシング多imodal LLMにおける誤情報の抑制と根拠付けの改善
- リモートセンシングデータとLLMの組み合わせは,地理空間情報の解析に新たな可能性をもたらす。
- LLMは画像からは検証できない情報を主張することがあり,誤った事実を導く可能性がある。
- 画像で検証できない情報のみをLLMに注入することで,誤情報の抑制を目指す。
- GeoArbiterは,トレーニングを必要としないパイプラインであり,画像で検証できない地理的情報を注入する。
- この手法は,属性タイプ間での情報漏洩やYes/No応答の偏りを抑制しつつ,高い精度を維持する。
- その結果,誤情報の発生を9.58~26.34%削減し,3つのモデル全てで頑健性が向上した。
AOSpec:低遅延エージェント提供のための行動と観測の共同推測 [cs.RO, cs.LG]目的:行動と観測の共同推測によるエージェントの低遅延化
- 大規模言語モデルエージェントの活用が進む中で,応答速度は重要な課題となっている。
- 従来の行動または観測のみの推測では,環境実行のボトルネックが解消されない場合がある。
- エージェントと環境のループ全体にわたる共同推測により,待ち時間を効果的に削減することを目指す。
- AOSpecは,行動と観測を同時に推測するロスレスフレームワークであり,平均エンドツーエンドレイテンシを11.8~32.5%削減する。
- 特にデコーディング速度が向上した場合に効果が大きくなり,p99レイテンシは最大42.8%削減される。
- 観測モデルは,再学習なしにTerminal-BenchからSWE-bench Verifiedへ転移可能である。
知っていると仮定して:エージェント型AIを用いたフローポリシーの認識意味論の修正 [cs.AI, cs.CR, cs.LO, cs.PL]目的:フローポリシーの認識意味論の修正
- 情報セキュリティにおいて,プログラム内の情報フロー制御は重要な課題である。
- 情報フローの許可範囲を厳密に定義することは難しく,選択的な情報ダウングレードが問題となる。
- 既存の認識論理に基づいたフレームワークの不備を修正し,より堅牢な基盤を提供する。
- 本研究では,エージェント型AIの支援を受けて,Rocq証明支援システムを用いて修正された形式化を機械的に検証した。
- 修正されたフレームワークは,様々なポリシー仕様スタイルを比較し,既存の技術を活用した強制を可能にする簡潔さと汎用性を持つ。
- CSF 2018で発表された先行研究の形式化の曖昧さを解消し,より明確な基盤を確立した。
変数ギャップを持つ共通部分列の識別のためのニューロ進化ヒューリスティクス [cs.AI]目的:変数ギャップを持つ最長共通部分列問題の解決
- 生物情報科学や時系列分析など,多様な分野で文字列やデータの類似性評価が重要である
- 多重配列における共通部分列問題は計算量が大きく,効率的な解法が求められている
- 既存の手法では頑健性に欠けるため,データ駆動型ヒューリスティクスの自動設計を目指す
- ニューロ進化フレームワークを用いて,ヒューリスティクスを自動的に学習する手法を提案した。
- 学習されたヒューリスティクスと既存のヒューリスティクスを組み合わせたアンサンブル手法が,既存手法を上回る性能を示した。
- 合成データおよび実データを用いた評価により,提案手法の有効性が確認された。
CADIR:エージェント型CAD生成のためのクロスバックエンド編集可能中間表現 [cs.AI]目的:エージェント型CAD生成とクロスバックエンド編集のための実行可能な中間表現
- CAD生成は製品開発の自動化に不可欠であり,効率化が求められている。
- 既存手法では,CADシステムの変更に追従性が低く,編集作業が困難である。
- 異なるCADシステム間での一貫した編集を可能にし,モデルの品質向上を目指す。
- CADIRはOCCTジオメトリカーネルを基盤とし,明示的なモデリング操作と詳細な実行診断を提供する。
- 幾何学的シグネチャマッチングにより,パラメータ変更やバックエンドの違いを考慮した対応するエッジと面の特定が可能となる。
- 構築グラフ検索により,テキストや画像クエリに対応し,完全なモデルやモデリングサブ構造の活用を支援する。
最適化をしない学習:意図に基づくネットワーク制御のための物理情報に基づく作用空間の再構成 [cs.NI, cs.LG]目的:意図に基づくネットワーク制御における作用空間の削減
- ネットワーク制御は,複雑なシステムを効率的に運用するために不可欠であり,その重要性は増している。
- 従来の最適化手法では,不要な候補を排除できず,計算コストが高いという課題がある。
- 中間信号を用いて最適化対象を絞り込むことで,効率的なネットワーク制御を実現する。
- 提案手法(\LNOQRD{})は,候補数を平均75.9%削減しつつ,ほぼ最適な性能を維持する。
- 大規模インスタンスにおいて,ユーティリティと意図充足度を最大化し,制約違反と遅延を最小化する。
- 無損失な商空間と支配性に基づき,性能劣化を理論的に定量化している。
UpliftBench:アプローチ効果評価における結果レジームと目的の不一致の解明 [cs.CL, cs.AR, cs.NI, cs.LG]目的:アプローチ効果評価における評価指標とモデルの性能に関する不一致の原因究明
- パーソナライズドターゲティングの重要性が増す中で,アプローチ効果の正確な評価が不可欠である。
- 既存のアプローチ効果評価ベンチマークでは,どの推定器が最適かについて意見が分かれている。
- 評価指標の選択が性能評価に与える影響を明らかにし,より適切な評価方法を提案する。
- アプローチ効果評価において,F1スコアやAUUCといった評価指標が効果の正確性と必ずしも一致しないことが示された。
- 特にIHDPデータセットでは,Qini係数と効果の正確性の相関が低く,AUUCの方がより高い相関を示すことが確認された。
- Jobsデータセットでは,ランキング指標だけでは十分な政策決定が難しく,直接的なリスク選択がより良い結果をもたらすことが示された。
テバトロン,メガトロンと出会う:学術予算でのエキスパート並列LLM再ランク学習 [cs.IR, cs.LG]目的:学術予算における大規模言語モデル再ランク学習の効率化
- 情報検索の精度向上には,高品質な再ランク学習が不可欠である。
- 大規模モデルの再ランク学習には,高度な計算資源が必要であり,研究機関での実施が困難である。
- 本研究は,限られた資源で大規模モデルの再ランク学習を可能にする手法を開発する。
- Tevatron 3.0は,Megatron-Coreバックエンドを統合し,MoEモデルの学習を可能にした。
- MoE再ランク学習器は,80億パラメータのdenseモデルと同等の精度を,より少ないパラメータ数で実現した。
- 本フレームワークと学習済みチェックポイントを公開し,学術研究の発展に貢献する。
RefactorAssist:信頼性の高いコードリファクタリングのためのエージェントによる改良 [cs.CE, cs.DC, cs.SE, cs.AI]目的:LLMによるコードリファクタリングの機能的正確性の改善
- ソフトウェア開発におけるコード品質の維持・向上が重要であり,リファクタリングはその重要な手法の一つである。
- LLMによる自動リファクタリングは潜在力を持つ一方,エラーの混入により機能変更やテスト失敗を引き起こし,実用性に課題がある。
- 本研究は,テスト結果とコンテキストを考慮したエージェントにより,LLMによるリファクタリングの信頼性を高めることを目指す。
- エラー原因分析の結果,コンテキストの誤理解や名前の変更ミス,不要な機能追加などが主な失敗要因として特定された。
- 静的解析による簡易修正と,テストログとコード差分に基づくエージェントによる反復修正を組み合わせることで,高い修復率を達成した。
- 最適な設定では,94.2%の累積パス率を記録し,LLMによるリファクタリングの実用化に近づく可能性を示唆した。
サブタイプ頑健性は単なる精度ではない:見えないサブタイプシフトにおけるキャリブレーション [cs.HC, cs.PF, cs.LG]目的:サブタイプ頑健性の評価
- 画像認識モデルの信頼性を高めることは重要である。特に,未知のデータへの対応が求められる。
- 従来の評価は主に精度に焦点を当てており,モデルの信頼度(キャリブレーション)が十分に考慮されていない。
- 見えないサブタイプに対するモデルのキャリブレーションの低下を明らかにし,評価方法の改善を目指す。
- 見えないサブタイプにおいて,精度が低下する一方で,モデルの確信度はほとんど低下しないことが示された。
- その結果,モデルは誤りが大きくなる領域で過信してしまうという問題が明らかになった。
- 見えないサブタイプに対するキャリブレーションの改善は困難であり,キャリブレーションの評価が重要であることが示唆された。
