arXiv雑要約
AI - 2026/08/05 公開
データベースのフィールドに対するインタラクティブな意味的エンリッチメント(ISEE) [cs.AI, cs.IR]目的:データベースのフィールドの意味的明確化と質の向上
- データ活用において,正確かつ包括的なデータ意味論は不可欠である。
- フィールド記述が曖昧,不完全である場合が多く,利用者の知識に依存しがちである。
- 利用者の知識を活用し,データフィールドの意味的質を高めることを目指す。
- ISEEは,フィールド記述の質をスコアリングし,利用者の知識を収集・統合することで,意味的エンリッチメントを実現する。
- ユーザー調査の結果,ISEEは認知負荷を軽減し,記述品質を向上させることが示された。
- エンティティリンキング等の下流タスクのパフォーマンス向上にも貢献する。
自己組織化デジタル回路 [cs.AI, cs.NE]目的:自己組織化デジタル回路の機能生成と維持
- デジタル回路の信頼性は重要であり,その維持には新たなアプローチが求められている。
- 従来の耐障害性は静的な戦略に依存しており,動的な環境への適応が課題である。
- 本研究は,自己組織化の原理に基づき,動的な回路再構成による耐障害性を実現する。
- 本研究では,グラフ上でのメタ学習問題として機能ロジックの生成と維持を捉える自己組織化デジタル回路を提案した。
- 回路のBooleanゲートのLUTを構成するトポロジーマスクTransformerを用い,回路をゼロから自己組織化し,ハードウェア障害の回避も可能となった。
- ソフトエラーに対しては,訓練条件を超える規模の損傷からほぼ完璧な回復(99.99%以上の精度)を達成し,回路規模の拡大にも対応できる汎化性能を示した。
TabletCraft:4000年分の文化的隔たりを双方向アッカド語NMTと楔形文字レンダリングで埋める [cs.DB, cs.CY, cs.DC, cs.CL, cs.LG]目的:アッカド語と楔形文字の双方向翻訳システム
- 人類最古の文字体系である楔形文字の解読・利用は,4000年にわたる文化遺産の理解に不可欠である。
- 既存の自然言語処理ツールでは楔形文字の完全な読解・作成が難しく,専門家以外は古代文化の消費者でしかない。
- 非専門家でも楔形文字でコンテンツを作成し,古代文化への積極的な参加を可能にすること。
- TabletCraftは,アッカド語から英語,および英語からアッカド語への双方向翻訳を実現する初のオープンソースシステムである。
- システムは,116Kの双方向サンプルで学習されたByT5ベースの翻訳モデル,14,240の対応付けを持つ楔形文字変換器,および視覚的なタブレットレンダラーを統合している。
- Akkademia検証分割において,アッカド語から英語で49.1 BLEU,英語からアッカド語で48.5 BLEUのスコアを達成した。
カーネルブレイン:エージェントによるGPUカーネル最適化のための粗調整から微調整,予算を意識した探索 [cs.DC, cs.AI, cs.LG, cs.SE]目的:GPUカーネル最適化の自動化
- GPUは並列処理に不可欠であり,その性能を最大限に引き出すことが重要である。
- GPUカーネルの最適化は複雑であり,手動では限界がある。自動化も課題が多い。
- カーネルの品質と探索効率を向上させる自動最適化手法を開発すること。
- LLMを活用した変異,適応的なリソース配分,ポリシーゲート評価,プロファイラに基づく診断を組み合わせることで,実用的な最適化エージェントを構築した。
- Tritonカーネル生成タスクにおいて,PyTorchと比較して0.88倍〜6.72倍の高速化を達成し,最先端のエージェントよりも最大1.4倍の高速化を実現した。
- 最適化時間は最大48%短縮され,効率的なカーネル最適化が可能となった。
BBOWP-Bench:ブラックボックス最適化に関する記述問題に対する大規模言語モデルの評価 [cs.CL, cs.LG, cs.NE]目的:ブラックボックス最適化に関する記述問題に対する,検索空間の設計と最適化アルゴリズムの選択
- 最適化問題の定式化は最終的な解の質に大きく影響する。専門知識が不可欠だが,自動化の需要がある。
- 既存のベンチマークは,目的関数や制約式が数学的に明示できる場合に限定されている。
- 自然言語による記述から検索空間と最適化アルゴリズムを推論する自動化を目指す。
- 本研究で開発したBBOWP-Benchを用いて,大規模言語モデルの性能を評価した。
- LLMは,与えられた評価予算に基づいて適切なアルゴリズムを選択できることが示された。
- しかし,問題記述が曖昧な場合や,検索空間が問題特有の場合には,適切な変数の特定や範囲の調整に苦戦することがあった。
MemArena:大規模なオンデバイス型エージェントパーソナルメモリーアシスタントのための自己中心的ベンチマーク [cs.CL, cs.AI, cs.LG, cs.MA]目的:自己中心的な視点と一貫性のあるマルチセッション世界における活動的な対話の組み合わせを評価するベンチマーク
- エッジデバイスに展開されたパーソナルメモリーアシスタントの重要性が増しており,プライバシー保護が課題となる。
- 既存のメモリーベンチマークでは,活動的な対話,自己中心的な視点,一貫性のあるマルチセッション世界を十分にテストできていない。
- 本研究は,これらのギャップを埋め,より現実的な環境での評価を可能にすることを目的とする。
- メモリーバックエンドの選択がコンテンツの正確性に大きく影響することが示された。Qwen3-0.6Bにおいて,MemobaseからMemSearchへの変更が,MemSearchリーダーのスケールアップを上回る改善をもたらした。
- アクセス権限を考慮した情報開示は,どのバックエンドでも失敗しており,Oracleは過度に情報を漏洩し,他のバックエンドは情報を開示することを躊躇した。
- 検索遅延は,非常に小さなリーダーでのみ問題となり,Spark GB10エッジノードでは,メモリー検索による遅延はBM25-RAG/Memobase/MemSearchでそれぞれ87/7/48msと比較的安定していた。
OncoTriad-QA:汎がん推論のための患者レベルの放射線-病理-ゲノミクスベンチマーク [cs.CL, cs.AI]目的:汎がんにおける質問応答のための,患者レベルの放射線,病理,ゲノミクスベンチマークの提供
- がん診断の精度向上には,画像,病理,遺伝子情報等の多角的な情報統合が不可欠である。
- 既存のベンチマークは単一のモダリティに偏り,患者全体の情報を統合した評価が困難である。
- 複数の情報源を統合し,患者レベルでの包括的ながん診断能力を評価するベンチマークが必要である。
- OncoTriad-QAは,32種類の癌を対象に9,281例のTCGA患者データを用いた86.1k件の質問応答データセットである。
- 既存の汎用および医療LLMは,画像所見,腫瘍形態,分子情報を統合した包括的な質問応答において限界があることが示された。
- OncoVLMは,OncoTriad-QAでファインチューニングすることで,MedGemma-4Bを平均10.7ポイント上回る性能を発揮した。
OpenAIのプライバシーフィルターの評価:42のベンチマークにおけるクロスリンガル,クロスドメイン個人情報検出 [cs.CL, cs.AI]目的:OpenAIのプライバシーフィルターの個人情報検出性能の評価
- 個人情報の保護は,プライバシー尊重の観点から極めて重要である。
- 既存の個人情報検出器は,言語や分野によって性能にばらつきがある。
- 多言語・多分野におけるプライバシーフィルターの性能を定量的に評価する。
- OpenAIのプライバシーフィルターは,AI4PrivacyにおいてF1=0.855,SPY medicalにおいて0.464を達成し,PresidioやXLM-RoBERTaを上回る性能を示した。
- ただし,ナラティブな文章に埋め込まれた個人情報の検出性能は低下し,非ラテン文字のスクリプトでは特に低い結果となった。
- 構造化された個人情報や顧客サポートにおいては高い性能を発揮する一方,文化的に変動する個人情報の検出には課題が残る。
好まれることが,必ずしも安全であるとは限らない:対比較選好は臨床的安全性を示す不確かな指標 [cs.CL, cs.AI, cs.LG]目的:大規模言語モデルの評価における臨床医の対比較選好が,臨床的安全性を示す信頼できる指標であるか
- 医療分野におけるAI活用が進む中で,安全性評価の重要性が高まっている。
- 対比較選好は評価が容易だが,臨床的安全性との関連が不明確である。
- 対比較選好と臨床的安全性の乖離を明らかにし,より適切な評価方法を提示する。
- 臨床医による対比較選好は,臨床的安全性を示す不確かな指標であることが示された。
- 高評価を得たモデルでも,有害性や正確性において臨床的に重大な失敗が確認された。
- 専門分野によって失敗パターンが異なり,集計結果だけでは把握できない「禁域」が存在する。
ハイブマインドを超えて:メタ・ペルソナ・アンカリングと逐次温度スケーリングによるLLMの均質性からの脱却 [cs.AI, cs.CL]目的:大規模言語モデルにおける均質性の軽減
- AIの多様性は,社会への適応と応用範囲を広げる上で不可欠である。
- 大規模言語モデルは,人工的なハイブマインド現象により,回答が均質化しやすい。
- 本研究は,メタ・ペルソナ・アンカリングと温度スケーリングにより,LLMの多様性を高めることを目指す。
- 提案手法により,大規模言語モデルの回答間の意味的収束が大幅に低減された。
- ペアごとのコサイン類似度が,約0.85から約0.65に低下した。
- 質問の多数において,類似度が0.7を下回り,人工的なモード崩壊と人間の多様性の差が縮小された。
形式を知り,機能を問わない:法務ベンチマークにおける回答と根拠の乖離の自動監査 [cs.CL, cs.CL, cs.AI]目的:法務ベンチマークにおける回答の正答性と法的根拠の整合性の自動監査
- 法務分野におけるAIの応用は,法的判断の質と効率を向上させる可能性を秘めている。
- 既存の法務ベンチマークは,回答の正答性のみを評価しており,法的根拠の妥当性は考慮されていない。
- 本研究は,回答の正答性と法的根拠の整合性を自動的に評価する手法を確立し,ベンチマークの信頼性を高めることを目指す。
- 大規模言語モデル(LLM)は,根拠の提示を求められなくても,台湾の弁護士試験問題で自発的に法的根拠を示すことが確認された。
- 回答が正答であっても法的根拠が欠落しているケースや,回答は誤りであるにも関わらず法的根拠を提示しているケースが確認された。
- 法的根拠は構造的に抽出可能であり,外部から検証可能であるため,この乖離を自動的に測定できることが示された。
二値細分反復のニューラルネットワークによる実現:二つの座標系を選択する手法 [math.NA, cs.LG, cs.NA, stat.ML]目的:二値細分反復のニューラルネットワークによる正確な実現方法
- ウェーブレット変換や幾何モデリング等に応用される細分演算子の研究は重要である。
- 細分反復は線形区分数の増加が速く,深層ニューラルネットワークでの表現能力の検証が困難である。
- 本研究は,不連続な二値選択を伴う細分過程を,ReLUネットワークで正確に表現することを目指す。
- 二つの座標系(通常の座標系と半シフトされた座標系)を用いることで,不連続な二値選択をReLUネットワークで表現可能となった。
- ネットワークは,両座標系が有効で,対応する線形更新が一致する場所でのみ座標系を切り替える。
- この手法により,任意のコンパクトサポートを持つ連続区分線形関数を正確に表現できることが示された。
推測的修正:拡散言語モデルのためのドラフト・アンド・リファインのデコーディング [cs.CL, cs.AI]目的:拡散言語モデルにおけるドラフト生成とリファインによるデコーディング手法の有効性評価
- 拡散言語モデルは高性能だが,効率的な推論方法が課題である。既存手法の改善が求められている。
- 従来のデコーディングは左から右への生成に偏りがちで,拡散モデルの双方向リファイン能力を十分に活用できていない。
- 拡散言語モデルの双方向リファイン能力を活かし,より高速かつ高精度な推論を実現することを目的とする。
- 同じモデルによるドラフト生成とリファインにより,GSM8K-384の精度が0.848から0.899に向上し,速度も1.20倍に改善された。
- Mini-Flash構成では,推測的修正により,MATH-384の性能がFlashと同程度でありながら,2.17倍の高速化が実現された。
- 結果は,双方向リファインが拡散言語モデルの有用なデコーディング手法であり,推測的修正がトレーニング不要で高速化に貢献することを示唆している。
ゼロトラスト環境におけるマイクロセグメンテーション異常検知 [cs.CR, cs.CV, cs.LG, cs.NI]目的:マイクロセグメンテーションによるソフトウェア定義ネットワークにおける異常検知
- ゼロトラストアーキテクチャの普及に伴い,厳格なネットワーク分離と継続的な検証が不可欠となっている。
- 従来の粗粒度な監視では,巧妙な攻撃や水平方向への脅威の拡散を検知することが困難である。
- マイクロセグメンテーションを導入することで,侵入検知の精度向上を目指す。
- マイクロセグメンテーションは,ネットワークフローデータの異常検知精度を大幅に向上させる。
- セグメント化されたデータで学習させたモデルは,F1スコアが0.95と,未セグメント化データ(F1=0.90)よりも高い性能を示した。
- ViTベースの検出器は,1D-CNNよりもわずかに優れており,特に微細な水平方向の動きを識別する能力が高い。
記号回帰における深層分割・還元法 [cs.LG, cs.AI]目的:記号回帰における表現の発見と簡約化
- データから数理モデルを発見する重要性は,科学的発見や現象理解に不可欠である。
- 既存手法は,数理・物理原理の理解が浅く,複雑な式では簡約化が困難である。
- 表現分解・還元を拡張し,厳密性と汎用性を高めることで,問題を解決する。
- 提案手法DDRSRは,理論的根拠に基づき,表現分解・還元を大幅に改善する。
- 実験結果から,DDRSRが既存手法よりも表現分解と数値回帰の両面で優れていることが示された。
- 本手法の適用範囲と限界,および今後の研究方向についても議論する。
地質学的炭素貯留における可変運用と不確実性評価のための多Modal自己回帰Transformerサロゲートモデル [cs.LG, cs.AI]目的:地質学的炭素貯留運用における可変的な掘削と注入戦略のモデリング
- 地球温暖化対策として,地質学的炭素貯留技術の重要性は増している。
- 地質構造の不確実性や運用方法の最適化が,貯留効率の課題となっている。
- 地質学的不確実性を考慮した効率的な運用戦略の評価を目指す。
- 開発されたサロゲートモデルは,飽和度予測において平均絶対誤差0.028を達成した。
- 他の重要指標に関しても,相対誤差が0.2-5%と高い精度を示した。
- 階層型マルコフ連鎖モンテカルロデータ同化により,主要なメタパラメータの不確実性を大幅に低減した。
PULSE:時空間知識グラフエンジニアリングのための実行可能契約言語 [cs.AI, cs.DB, cs.PL]目的:時空間知識グラフエンジニアリングにおける実行可能契約の定義
- 知識グラフは,複雑な情報を構造化し,推論を可能にする重要な技術である。
- 従来の知識グラフエンジニアリングでは,状態管理や整合性の確保が課題であった。
- PULSEは,契約のローカライズと安全性の保証を通じて,この課題を解決することを目指す。
- PULSEは,証拠の上書き防止,分岐分離,タイムスタンプの正確性,状態変化の制御,イベント順序の保証を実現する。
- 形式検証により,PULSEの安全性に関する複数の性質が証明され,実装の正当性が検証された。
- 実世界のデータセットを用いた実験により,PULSEが既存のシステムと同等の性能を発揮し,高い信頼性を示すことが確認された。
LLMによる帰属グラフのアノテーション [cs.LG]目的:言語モデルの内部計算を明らかにする回路追跡における,特徴やMLPニューロンをまとめたスーパーノードの自動生成
- 言語モデルの内部動作理解は,その能力向上や安全性確保に不可欠であり,解釈可能性研究が重要である。
- 回路追跡は手作業によるスーパーノードの分類に時間がかかり,効率的な手法が求められていた。
- 言語モデルを活用し,回路追跡におけるスーパーノードのアノテーションを自動化し,効率化を目指す。
- 提案手法で生成されたスーパーノードは,人間のアノテーターによるものと同程度の解釈可能性を持つことが確認された。
- 2段階の首都タスクにおいて,中間段階に対応するスーパーノードを100回のプロンプトのうち97回再現できた。
- Wikipediaのプロンプト補完から得られた1000件の帰属グラフを自動アノテーションし,LLMジャッジを用いて興味深いグラフを特定するデモンストレーションを行った。
GeoID-PINN: 地域感染症推論における識別可能性を考慮した地理的結合 [cs.LG, stat.AP, stat.ML]目的:地域感染症の地理的依存構造の推定
- 感染症の流行状況把握は,公衆衛生上の重要な課題である。
- 地域ごとの感染データからは,感染経路の特定が困難である。
- 地理的情報を活用し,感染症の伝播構造をより正確に推定すること。
- 本研究で開発したGeoID-PINNは,SIRDモデルを用いて地域間の感染構造を推定する。
- シミュレーション結果から,適切な地理的制約を加えることで,推定精度が向上することが示された。
- ルイジアナ州のCOVID-19データを用いた分析では,従来のモデルと比較して予測精度が大幅に改善された。
自己進化型エージェントのスキル再考:複数ラウンドにおけるフィードバックの動態 [cs.SE, cs.AI]目的:自己進化型スキルシステムの有効性に関する理解
- エージェントの性能向上には,モデル自体を変更せずにスキルを改善する手法が重要である。
- フィードバックがスキルの改善にどのように影響するか,そのメカニズムは未だ不明確である。
- 成功と失敗のフィードバックがスキルの進化に与える影響を明らかにすること。
- 自己進化は稀であり,候補のわずか14%が検証結果の最良記録を更新した。
- 検証に基づく選択では,14設定中11設定で進化型スキルが選択され,その多くがテスト性能を向上させた。
- 失敗のフィードバックを含む条件でより良い結果が得られる傾向があり,設定によって成功のみのフィードバックとの優劣が変動した。
AI集約型サイバーフィジカルシステムにおける隠れた技術的負債の研究,特定,および修正 [cs.SE, cs.AI]目的:AI集約型サイバーフィジカルシステムにおける技術的負債の特性評価,特定手法,および軽減策
- AI技術の進化に伴い,CPSへの適用が拡大しており,システムの信頼性確保が重要である。
- 従来のシステムとは異なり,AI要素を含むCPS特有の技術的負債は,特定と解消が困難である。
- AI-CPSにおける技術的負債の特性を理解し,自動化された管理ツールを開発し,解決を目指す。
- AIエコシステムやリポジトリの分析,開発者へのインタビューを通じて,AI-CPSにおける技術的負債の特徴を特定した。
- 特定された技術的負債を軽減するためのアプローチを定義し,その有効性を検証する計画である。
- AIエージェントを活用した,AI-CPSの技術的負債を監視・管理・解消を支援する自動化ツールの開発を目指す。
命令の積み重ね崩壊:ベンチマークとプロンプトコンパイルの能力依存性価値 [cs.SE, cs.AI]目的:命令の積み重ねによる指示遂行能力の低下
- 大規模言語モデルの性能は,複雑な指示への対応能力に依存する。
- 複数の制約が加わることで,指示遂行能力がどのように低下するかが不明である。
- 指示の制約が増える際の具体的な問題点と,その解決策を明らかにすること。
- 指示の数が増加するにつれて,指示遂行率は非線形に低下し,20%まで低下する場合があった。
- 指示コンパイラは,指示を書き換えることで,弱いモデルの指示遂行率を最大で11ポイント向上させた。
- この改善は,追加のトークン数や再配置ではなく,書き換え自体によるものであることが確認された。
IR2Solve:費用対効果の高い最適化自動定式化のための構造化中間表現 [cs.SE, cs.AI]目的:最適化問題の自動定式化
- 最適化は,科学技術,経済,工学など,幅広い分野で重要な役割を果たす。
- 大規模言語モデルによる最適化問題の定式化は,エラーが発生しやすく,コストがかかる。
- 構造化された中間表現を用いることで,正確性とコスト効率を両立した自動定式化を実現する。
- IR2Solveは,6つの最適化ベンチマークにおいて高い目的関数適合率を示した。
- 構造化された中間表現,スカラー制約指示,決定論的検証の段階的な改善が確認された。
- 他のシステムと比較して,IR2Solveは必要なLLMの呼び出し回数とトークン量を大幅に削減した。
CUADebug:コンピュータ利用エージェントの故障診断と修復 [cs.SE, cs.AI]目的:コンピュータ利用エージェントの故障診断と修復に関するフレームワーク
- コンピュータ利用エージェントは,自動化の鍵であり,その信頼性向上が重要である。
- 視覚的認識,空間的配置,低レベルなインタラクションなど,多岐にわたる要素が絡み合い,故障原因の特定が困難である。
- 故障原因の特定と,それを踏まえた効果的な修復戦略の提供を目指す。
- CUADebugは,コンピュータ利用エージェント特有のエラー分類体系と,故障ベンチマークを提供し,デバッグ作業を支援する。
- Gemini 2.5 Proを用いた実験により,ステップとサブタイプを同時に診断する精度が向上した。
- 根本原因に基づく修復戦略は,履歴のみによる継続よりも高いタスク完了率を示し,継続的な再実行においても成功率が大幅に改善された。
検証可能なツール呼び出しが,非原子的な障害下でのLLMエージェントの信頼性を向上させる [cs.SE, cs.AI]目的:LLMエージェントの信頼性向上
- LLMエージェントは,複雑なタスク実行に不可欠であり,その信頼性が重要である。
- 従来のフレームワークはツール呼び出しの原子性を仮定しており,現実世界の非原子的な挙動に対応できない。
- 非原子的な障害による重複アクションや不必要な実行を防ぎ,信頼性を高める。
- 提案手法は,ツール呼び出しに事後条件検証,検証前の再試行ロジック,べき等キーを追加することで重複アクションを大幅に削減した。
- タスク成功率は同程度に維持された。
- ツール連携のセマンティクス強化が,LLMエージェントの信頼性向上に有効である可能性が示された。
HyperAgent:ツール・スキーマハイパーグラフを用いたツール利用LLMエージェントの計画と行動 [cs.AI, cs.SE]目的:ツール利用におけるLLMエージェントの計画と実行のフレームワーク
- 複雑な現実世界のタスク遂行において,LLMエージェントは外部ツールへの依存度を高めている。
- 従来のツール利用エージェントは,テキスト記述からのツール組み合わせ推論に依存し,複雑なタスクで非効率や不安定さが問題となっている。
- ツール間の関係をスキーマレベルでモデル化し,動的な計画と実行を可能とするフレームワークを開発すること。
- 提案手法HyperAgentは,ツール・スキーマハイパーグラフを基盤とし,タスク関連ツールコンテキストグラフを用いてタスクDAGを構築する。
- 実行時には,状態に依存したツールサポートグラフを構築し,未解決の要件を特定,状態に基づいてツールを検索する。
- AppWorld実験により,HyperAgentが既存手法と比較して,タスク完了率向上,API呼び出し回数削減,トークン消費量削減を示すことが示された。
マルチテナントクラウドプラットフォームにおけるIP保護のためのセキュアAIウォーターマーキングフレームワーク [cs.CR, cs.AI]目的:IP保護のためのセキュアAIウォーターマーキングシステム
- クラウドベースAIサービスの普及に伴い,知的財産保護の重要性が高まっている。
- データやモデルの交換過程におけるIP漏洩のリスクが課題となっている。
- 分散鍵認証に基づくウォーターマーキングにより,IP漏洩を防止し,セキュリティを強化すること。
- 本研究では,信頼できる関係者間で鍵を分散し,認証を用いるセキュアなAIウォーターマーキングシステムを提案する。
- 提案システムは,攻撃を未然に防ぐための積極的な対策と,ウォーターマーキングや生体認証によるIP漏洩を検知する反応的な方法を組み合わせる。
- これにより,連合学習やリモート学習におけるデータとモデルの交換中のIP保護を強化する。
エージェント型LLMが秘密裏に間接的プロンプトインジェクション曝露の潜在的シグナルをエンコードする [cs.CR, cs.AI]目的:エージェント型LLMにおける間接的プロンプトインジェクション(IPI)曝露の内部状態の解明
- LLMの応用拡大に伴い,そのセキュリティリスクへの対策が喫緊の課題となっている。
- IPI攻撃は検知が難しく,エージェント型LLMの脆弱性を突くため,深刻な脅威となりうる。
- IPI曝露時にLLM内部で何が起こるかを理解し,効果的な防御策を開発することを目的とする。
- LLMの事前生成隠れ層を学習した単純な線形プローブは,IPI曝露を高い精度で予測可能であることが示された。
- モデルはIPIのシグナルを認識しているものの,安全な行動に繋げていない認識と行動の乖離が確認された。
- プローブによって活性化される推論を前置するAGRIは,攻撃成功率を大幅に低減しつつ,通常のタスク性能を維持する効果が示された。
AIアライメントと信託義務 [cs.CY, cs.AI, cs.HC]目的:AIアライメント基準の確立
- 高度なAIアシスタントは,人々の生活に不可欠な存在となりつつあり,その安全性確保が重要である。
- AIアシスタントの行動原理が明確でなく,ユーザーへの潜在的なリスクが懸念されている。
- AI開発者とユーザー間の義務関係に着目し,AIの安全性を高めるための基準を提示する。
- 本研究では,AIアシスタントの展開におけるAI開発者,ユーザー,AIの三者関係を考慮し,信託理論をAIアライメントに適用する。
- AI開発者には,忠実義務,注意義務,誠実義務,開示義務といった信託義務が課されるべきである。
- これらの義務を果たすことで,AIアシスタント利用に伴うユーザーのリスクを軽減し,安全性を確保できる。
物理動力学系のための検証者誘導モデル探索:事前学習された記号Transformerの活用 [cs.LG, cs.AI]目的:非線形物理システムの信頼性のある予測
- 科学的発見や工学的な意思決定において,高精度な物理現象の予測は不可欠である。
- 高精度なシミュレーションは計算コストが高く,機械学習による代替手法は解釈性が低い場合がある。
- 事前学習済みのTransformerを活用し,物理法則の知識なしに高次元データへの転移を可能にすること。
- 検証者誘導(VG)ワークフローは,ODEFormerを基盤とし,ダイナミクスと物理的妥当性の基準を用いて候補方程式を選択する。
- Van der Polオシレーターにおいて,VGは元のODEFormerワークフローよりも優れた予測性能を示した。
- 渦放出現象において,VGは特定の候補ライブラリやNavier-Stokes構造なしに,基本的な振動と高調波を復元する簡約化された方程式を発見した。
CT-HEG:集中治療室における入院患者死亡予測のための双方向タイムスタンプ属性付きイベントグラフ - アーキテクチャアブレーション研究 [cs.LG, cs.AI]目的:集中治療室における入院患者の死亡予測モデルの構築
- 集中治療室における患者管理の質向上には,正確な死亡予測が不可欠である。
- 既存の手法では,不規則な臨床データや多様なエンティティ間の関係性を十分に捉えられていない。
- 不規則な臨床データとエンティティ間の関係性を考慮した,高精度な死亡予測モデルを開発すること。
- 提案手法CT-HEGは,MIMIC-IVデータセットにおいて,平均AUROC 0.8449±0.0071を達成した。
- 双方向のエッジを除去するとAUROCが0.1968±0.0073低下し,逆方向のエッジの重要性が示された。
- 時間依存的なエッジ特徴量は,AUROCを0.0247±0.0093向上させ,時間情報の活用が有効であることが確認された。
ZK-SR117:集約型公正融資指標に対するチャンク化されたゼロ知識証明設計 - 完全なSR 11-7対応に向けた制御マッピング [cs.CR, cs.AI]目的:規制された意思決定における公正性と堅牢性の証明
- 金融機関における公正な融資は,社会的な公平性を保つ上で不可欠である。
- モデルの重みや顧客データを公開せずに,公正性を監査証明することが課題である。
- 大規模データに対する効率的なゼロ知識証明による公正性検証を目指す。
- 提案手法により,32,768行の住宅ローンデータで,人口統計学的パリティギャップの集約された公平性統計をゼロ知識証明で検証できた。
- 検証されたギャップは真の値から0.0029以内であり,チャンクごとの証明時間は4秒未満であった。
- 期待キャリブレーション誤差の検証も行い,誤差は0.00037以内に収まり,チャンクごとの証明時間は約14.7秒であった。
単一の標準プロンプトはLLMの安全性の表面形式への感受性を過小評価する [cs.CR, cs.AI, cs.CL]目的:LLMの安全性における表面形式の感受性の評価
- LLMの安全性は,社会への影響が大きいため,重要な研究分野である。
- 既存の評価指標は,単一のプロンプト形式に依存しており,表面形式の変動による影響が不明である。
- 本研究は,プロンプトの表面形式がLLMの安全性評価に与える影響を定量的に明らかにすることを目指す。
- 単一の標準プロンプトのみで評価すると,LLMの安全性に関するリスクを過小評価する可能性があることが示された。
- プロンプトの表面形式を変えることで,安全性に関する結果に最大で12.9ppの差が生じることが確認された。
- この現象はモデルに依存し,Gemini 2.5 Proにおいて最も顕著であった。
球面収縮正規化 [cs.LG, cs.AI, cs.CL]目的:深層ニューラルネットワークの安定訓練における残差接続の正規化手法の検討
- 深層学習モデルの性能向上には,安定した訓練が不可欠であるため,残差接続等の技術が重要視されている。
- 従来の残差接続は,勾配消失や爆発といった問題を抱えており,深層モデルの訓練を困難にすることがある。
- 球面上の制約条件下で残差接続を最適化し,より安定した学習を可能とする新しい正規化手法を提案する。
- 本研究では,球面収縮正規化という新しい手法を提案し,指数写像以外の退動写像の有効性を示した。
- 提案手法であるProj-SpheretNormとCay-SpheretNormは,既存の軽量な深層接続スキームよりも優れた性能を発揮した。
- nanoGPTを用いた実験では,最適な検証損失が有限のパラメータpで達成され,指数写像が球面残差ストリームに最適な退動写像ではない可能性が示唆された。
Docker Hubの高露出イメージにおける脆弱性,秘密,および誤設定 [cs.CR, cs.AI, cs.CY, cs.OS, cs.SE]目的:Docker Hubイメージの脆弱性,秘密情報の包含,および設定ミスに関する実態把握
- コンテナ技術の普及に伴い,Docker Hubのセキュリティは重要な課題となっている
- 既存の研究では,単一の検出ツールに依存するため,結果の信頼性が低い
- Docker Hub全体のイメージを多角的に分析し,より正確なセキュリティ評価を行う
- Docker Hubの1270万以上のリポジトリを分析した結果,ほとんどのイメージに脆弱性や設定ミスが見られた
- 脆弱性スキャナ間の検出結果の差異が大きく,ツールの依存性が高いことが示された
- 秘密情報の検出精度は低く,誤検出が多いことが明らかになった
コーディングエージェントに対する厳格化された環境におけるポリシー等級評価 [cs.CR, cs.AI]目的:コーディングエージェントのポリシーによる性能変化の評価
- 組織内でのエージェント利用が増加しており,セキュリティ対策が不可欠である。
- 既存のベンチマークは制限の少ない環境での評価が中心で,実際の利用環境での性能が不明である。
- 現実的なセキュリティ制限下でのエージェント性能を評価し,適切なモデル選択の指針を提供する。
- 厳格なポリシー下では,成功率が最大18.3ポイント低下し,コストが最大167.3%増加した。
- 成功率の維持と効率性の両立は難しく,ポリシーによって最適なモデルが異なる。
- ポリシーによる制限がエージェントの動作に与える影響を分析し,失敗の原因を特定した。
ハードウェアパフォーマンスカウンタを用いたマルウェア検出分類器の性能について [cs.CR, cs.LG]目的:マルウェア検出性能の向上
- サイバー攻撃の巧妙化により,従来のセキュリティ対策だけでは不十分な場合があるため。
- マルウェア検出において,処理負荷が高く,効率的な検出方法が求められている。
- ハードウェアパフォーマンスカウンタと機械学習を組み合わせ,効率的なマルウェア検出を目指す。
- アンサンブル学習を用いることで,少ない数のハードウェアイベントで高いマルウェア検出性能を実現した。
- 2つのハードウェアカウンタを用いたアンサンブル学習は,8つのカウンタを用いた標準的な分類器を上回る性能を示した。
- 16のカウンタを必要とする標準的な手法と同等の性能を,4分の1の4つのカウンタで実現した。
テキストからTerraformへのセキュリティ重視評価:安全なIaC生成のためのLLMとSLMのベンチマーク [cs.CR, cs.AI, cs.ET, cs.SE]目的:LLMとSLMによる安全なInfrastructure-as-Code生成の評価
- クラウド環境のセキュリティインシデントの多くは設定ミスが原因であり,安全なIaC生成は重要である。
- LLMやSLMがセキュリティ要件を満たすIaCを生成できるかどうかが未解明である。
- LLM/SLMによるIaC生成におけるセキュリティ適合性を評価し,改善策を提示すること。
- LLM生成のIaCにおいて,構文の正当性とセキュリティ適合性は必ずしも相関しないことが示された。
- WizardCoder-33Bは高い構文の妥当性を示す一方,Checkovによるセキュリティチェックに全く合格しなかった。
- Claude Opus 4は詳細なセキュリティプロンプトにより,CheckovとTrivyでそれぞれ23.1%と92.5%の合格率を達成した。
- プロンプトエンジニアリング単独では不十分であり,IaC生成には自動スキャンツールが不可欠である。
dots.tts.edit:連続自己回帰モデルによる精密な音声編集 [cs.SD, cs.AI, cs.CL, eess.AS]目的:コンテンツ作成のための音声編集における精密な制御
- 音声編集は,コンテンツ制作において重要な役割を担う。表現の自由度と品質が求められる。
- 自然言語による編集指示は曖昧になりやすく,意図した操作や範囲が不明確になりがちである。
- XMLタグを用いた構造的な編集指示により,曖昧さを解消し,精密な音声編集を実現する。
- 提案手法は,テキスト,感情,プロソディ,ポーズの4つの音声制御において高い性能を示した。
- 指示の追従性,局所的な音声の保持において,既存のオープンソースシステムと同等以上の性能を達成した。
- ゼロショットTTS認識エラー率や話者類似度においても,ベースモデルとの差は無視できる程度であった。
安全障壁の移動:ホワイトボックス攻撃に対する動的ルーティング適応配置 [cs.CR, cs.AI]目的:大規模基盤モデルにおける安全性の維持
- 大規模言語モデルの普及に伴い,安全性確保は重要性を増している。
- 既存の安全性対策は静的な仕組みに頼る傾向があり,標的を絞った攻撃に弱い。
- 安全経路が侵害された場合でも,堅牢な拒否応答を維持するメカニズムを構築する。
- 本研究では,動的ルーティング適応配置(DRAA)を提案し,安全経路を迂回する代替経路を動的に生成する。
- DRAAは,安全経路の特定と局所化,および攻撃による失敗事例の活用により,モデルの安全性経路依存性を再構築する。
- 実験の結果,DRAAはホワイトボックス攻撃に対する堅牢性を大幅に向上させつつ,汎用的な性能を維持することが示された。
ポリシー変更が確率に影響を与える場合:LLM コードレビューのためのモジュール型意思決定 [cs.SE, cs.AI, cs.MA]目的:LLMコードレビューにおけるリスク評価と承認判断の分離
- ソフトウェア開発において,コード品質の維持は不可欠であり,効率的なコードレビューが求められる。
- LLMコードレビューにおいて,リスク評価と承認判断が一体化されており,確率の歪みが生じやすい。
- リスク評価,外部証拠,行動の分離評価による,より正確なコードレビューシステムの構築を目指す。
- LLMコードレビューインターフェースにおいて,意思決定ポリシーを変更すると,報告される失敗確率が平均13.6〜16.9パーセントポイント変化する。
- 高コストポリシー下での行動は,すべてのパッチを拒否するよりも劣る。確率の抽出自体が損失増加の一因となる。
- モジュール型パイプラインは,平均確率の精度を向上させ,平均損失を0.073/件削減し,パッチの58〜68%を受け入れる。
DenialRAG:埋め込みパラメトリック否定による単一ドキュメントRAGポイズニング [cs.CR, cs.AI, cs.LG]目的:RAGシステムの脆弱性を悪用する単一ドキュメントポイズニング攻撃手法
- RAGシステムは情報検索と生成を組み合わせ,LLMの性能向上に貢献する重要な技術である。
- RAGシステムは,悪意のあるドキュメント注入により,誤った回答を誘導される脆弱性を持つ。
- 既存攻撃の課題を克服し,正答を明示的に否定することで,より効果的なポイズニングを実現する。
- 提案手法DenialRAGは,Mistral-7Bデータセットにおいて高い攻撃成功率を達成した。
- 他の攻撃手法が優位なモデルも存在する一方,複数のLLMに対して有効性が確認された。
- 防御機構はASRを低減するものの,完全な保護は難しく,設定によってASRが残存する。
AIサンドボックス:技術報告 [cs.SE, cs.AI]目的:AI実験のためのガバナンスを考慮したマルチテナント環境の設計と実装
- AI技術の産業界と学術界での協調研究が活発化しており,実験基盤の重要性が高まっている。
- AIサンドボックスの関心は高まるも,実験機能とガバナンス要件を両立するプラットフォームの設計・実装に関する実用的な指針が不足している。
- AI実験における再利用可能な評価証拠の生成と,プロジェクト間の比較を可能にするプラットフォームを構築すること。
- 本研究では,産業界と学術界の共同研究に基づいて,ガバナンスを考慮したAIサンドボックスの設計と実装を行った。
- プラットフォームは,マルチテナントのユーザーインターフェース,バックエンド制御プレーン,実行・データ管理層を分離した参照アーキテクチャを採用している。
- これにより,管理されたユーザーオンボーディング,プロジェクト中心のコラボレーション,AIサービスへのアクセス制御などが実現された。
TraceCompiler:LLMエージェントのトレースのスキル誘導マイニングと,ほぼ決定論的なワークフローへのコンパイル [cs.SE, cs.AI, cs.LG]目的:LLMエージェントのトレースをマイニングし,実行可能な,ほぼ決定論的なワークフローにコンパイルすること
- LLMエージェントは,同じ手順を繰り返し発見する傾向があり,効率的な再利用が課題である。
- LLMエージェントのトレースにはノイズが多く,再現性のあるワークフローの抽出が困難である。
- ノイズの多いエージェントトレースから,信頼性の高いワークフローを自動的に生成すること。
- TraceCompilerは,エージェントトレースのクラスタをスキルに基づいてマイニングし,実行可能なワークフローを生成する。
- T1データセットにおいて,producer-consumer依存関係の再現精度が0.928,再現率が0.943であった。
- Venmoの送金依頼のインテントにおいて,API呼び出し数を34から11に削減することに成功した。
多段階防御によるエージェントの安全性の向上:$S^3$ [cs.CR, cs.AI]目的:大規模言語モデルエージェントにおける多段階ワークフローの安全性確保
- LLMエージェントの複雑化に伴い,安全性確保は不可欠であり,社会実装への信頼獲得に繋がる。
- 既存手法は個別の段階に限定され,ワークフロー全体としての安全性を保証できていない。
- 段階ごとの安全性を統合的に管理し,リスク検出・軽減能力を高めることを目指す。
- $S^3$は,段階固有の安全スキルを連携させ,ワークフロー全体を通してリスクを検出し軽減する。
- 既存の安全設計を再利用可能なスキルに変換するパイプラインと,スキル共有ライブラリを構築した。
- 実験の結果,安全性と実用性の両面で,最先端のベースラインを上回る性能を示した。
BulkPR-Bench:インタラクティブなプルリクエストのキューレベルガバナンスのベンチマーク [cs.SE, cs.AI]目的:インタラクティブなプルリクエストのキューレベルガバナンスに関するベンチマーク
- ソフトウェア開発におけるプルリクエストは,変更を統合するための基本単位であり,効率的な管理が重要である。
- 複数のプルリクエストが相互に影響し合う場合,安全な変更の統合順序決定が課題となる。
- 関連するプルリクエスト間の関係性を考慮し,安全かつ効率的な統合順序を決定すること。
- 本研究で開発されたBulkPR-Benchは,プルリクエスト間の関係性を回復し,実行可能な順序で安全な部分集合を返す能力を評価する。
- 実験の結果,最良のモデルはRelational Delivery Score (RDS) で66.6%を達成したが,完全なキューを正確に完了する割合は低い。
- 関係グループにおける改善は,必ずしも全体のキューレベルガバナンスの信頼性向上に繋がっていないことが示唆された。
細胞表現型に基づく分子表現学習における構造保存 [cs.LG, cs.AI]目的:分子構造と細胞応答の機能的関係の発見
- 表現型に基づいた薬物探索は,分子構造と細胞応答の間の機能的関係を明らかにする上で重要である。
- 既存のマルチモーダル表現学習法は,化学空間の組織構造を考慮せず,分子表現が歪み,構造情報が失われることがある。
- 分子構造を維持しつつ表現型をガイドしたアライメントを可能にする,構造保存的な分子表現学習フレームワークの構築。
- PhenMolは,270のバイオアクティビティタスクにおける分子特性予測の精度向上を示した。
- 分子-表現型検索および臨床試験結果予測においても性能が向上した。
- ECFP4に基づく構造分析により,PhenMolが分子近傍をより良く保存し,既存手法よりも埋め込みの歪みを低減することが示された。
「A」に固執:0.6B言語モデルの注意機構KDA線形化におけるインターフェース損傷の診断と修復 [cs.CL, cs.LG]目的:注意機構のKDA線形化におけるインターフェース損傷の診断と修復
- 大規模言語モデルは強力だが,計算資源を大量に消費する。効率化が重要である。
- KDA線形化は計算コストを下げるが,性能劣化を引き起こす可能性がある。
- KDA線形化によるインターフェース損傷を特定し,性能回復を目指す。
- Qwen3-0.6B-Baseの21層をKDA線形化したが,複数選択問題の正答率が低下した。
- モデルが選択肢のラベル(「A」)に固執することがインターフェース損傷の原因であると特定された。
- フォーマットターゲットのKL蒸留によりインターフェース損傷が修復され,C-Evalスコアが向上した。
GLOBE:軌道に沿った勾配マッチングと構造化スパース最適化によるコアセット選択 [cs.LG]目的:コアセット選択のための手法
- 深層学習モデルの性能向上には大量のデータが必要だが,計算資源に制約がある。
- 既存手法は単一時点の勾配に依存し,最適化の動的な変化や相関性の強いサンプルに対応できない。
- 勾配の軌跡を活用し,分布のマッチングとスパース最適化により効率的なコアセット選択を目指す。
- 提案手法GLOBEは,複数のチェックポイントで勾配軌跡を構築し,最適化の全過程でのサンプルの影響を捉える。
- 勾配軌跡の一次モーメントと二次のモーメントを整合させる多次のマッチング目的関数を導入し,学習挙動を維持する。
- 実験の結果,GLOBEは既存手法を上回り,特に低い保持率で高いテスト精度を達成した。
出力に配慮した回転によるINT2 KVキャッシュ量子化 [cs.LG, cs.AI]目的:INT2 KVキャッシュ量子化における出力誤差最小化
- 大規模言語モデル推論において,KVキャッシュがメモリと帯域幅のボトルネックとなり,低ビット量子化が重要である。
- 既存の回転法は,最終的な出力誤差を考慮せず,事前のキャッシュ統計量や代理誤差を最適化している。
- 出力投影後の注意出力誤差を最小化することで,この不一致を解消し,精度向上を目指す。
- OptRは,QuaRotやOSCARといった既存手法と比較して,一貫して性能を向上させる。
- OptRは,長文脈の検索性能を強化し,ページングされたKVキャッシュ形式を維持しながら,推論オーバーヘッドを無視できる程度に抑える。
- OptRは,注意出力誤差をキーと値に分解し,完全なINT2量子化と注意経路を通じてヘッドごとの直交補正を学習する。
