arXiv雑要約

セキュリティ - 2026/08/05 公開

  • ゼロトラスト環境におけるマイクロセグメンテーション異常検知 [cs.CR, cs.CV, cs.LG, cs.NI]目的:マイクロセグメンテーションによるソフトウェア定義ネットワークにおける異常検知
    • ゼロトラストアーキテクチャの普及に伴い,厳格なネットワーク分離と継続的な検証が不可欠となっている。
    • 従来の粗粒度な監視では,巧妙な攻撃や水平方向への脅威の拡散を検知することが困難である。
    • マイクロセグメンテーションを導入することで,侵入検知の精度向上を目指す。
    • マイクロセグメンテーションは,ネットワークフローデータの異常検知精度を大幅に向上させる。
    • セグメント化されたデータで学習させたモデルは,F1スコアが0.95と,未セグメント化データ(F1=0.90)よりも高い性能を示した。
    • ViTベースの検出器は,1D-CNNよりもわずかに優れており,特に微細な水平方向の動きを識別する能力が高い。

    Link: https://arxiv.org/abs/2608.02627

  • マルチテナントクラウドプラットフォームにおけるIP保護のためのセキュアAIウォーターマーキングフレームワーク [cs.CR, cs.AI]目的:IP保護のためのセキュアAIウォーターマーキングシステム
    • クラウドベースAIサービスの普及に伴い,知的財産保護の重要性が高まっている。
    • データやモデルの交換過程におけるIP漏洩のリスクが課題となっている。
    • 分散鍵認証に基づくウォーターマーキングにより,IP漏洩を防止し,セキュリティを強化すること。
    • 本研究では,信頼できる関係者間で鍵を分散し,認証を用いるセキュアなAIウォーターマーキングシステムを提案する。
    • 提案システムは,攻撃を未然に防ぐための積極的な対策と,ウォーターマーキングや生体認証によるIP漏洩を検知する反応的な方法を組み合わせる。
    • これにより,連合学習やリモート学習におけるデータとモデルの交換中のIP保護を強化する。

    Link: https://arxiv.org/abs/2608.02656

  • エージェント型LLMが秘密裏に間接的プロンプトインジェクション曝露の潜在的シグナルをエンコードする [cs.CR, cs.AI]目的:エージェント型LLMにおける間接的プロンプトインジェクション(IPI)曝露の内部状態の解明
    • LLMの応用拡大に伴い,そのセキュリティリスクへの対策が喫緊の課題となっている。
    • IPI攻撃は検知が難しく,エージェント型LLMの脆弱性を突くため,深刻な脅威となりうる。
    • IPI曝露時にLLM内部で何が起こるかを理解し,効果的な防御策を開発することを目的とする。
    • LLMの事前生成隠れ層を学習した単純な線形プローブは,IPI曝露を高い精度で予測可能であることが示された。
    • モデルはIPIのシグナルを認識しているものの,安全な行動に繋げていない認識と行動の乖離が確認された。
    • プローブによって活性化される推論を前置するAGRIは,攻撃成功率を大幅に低減しつつ,通常のタスク性能を維持する効果が示された。

    Link: https://arxiv.org/abs/2608.02657

  • ZK-SR117:集約型公正融資指標に対するチャンク化されたゼロ知識証明設計 - 完全なSR 11-7対応に向けた制御マッピング [cs.CR, cs.AI]目的:規制された意思決定における公正性と堅牢性の証明
    • 金融機関における公正な融資は,社会的な公平性を保つ上で不可欠である。
    • モデルの重みや顧客データを公開せずに,公正性を監査証明することが課題である。
    • 大規模データに対する効率的なゼロ知識証明による公正性検証を目指す。
    • 提案手法により,32,768行の住宅ローンデータで,人口統計学的パリティギャップの集約された公平性統計をゼロ知識証明で検証できた。
    • 検証されたギャップは真の値から0.0029以内であり,チャンクごとの証明時間は4秒未満であった。
    • 期待キャリブレーション誤差の検証も行い,誤差は0.00037以内に収まり,チャンクごとの証明時間は約14.7秒であった。

    Link: https://arxiv.org/abs/2608.02664

  • 単一の標準プロンプトはLLMの安全性の表面形式への感受性を過小評価する [cs.CR, cs.AI, cs.CL]目的:LLMの安全性における表面形式の感受性の評価
    • LLMの安全性は,社会への影響が大きいため,重要な研究分野である。
    • 既存の評価指標は,単一のプロンプト形式に依存しており,表面形式の変動による影響が不明である。
    • 本研究は,プロンプトの表面形式がLLMの安全性評価に与える影響を定量的に明らかにすることを目指す。
    • 単一の標準プロンプトのみで評価すると,LLMの安全性に関するリスクを過小評価する可能性があることが示された。
    • プロンプトの表面形式を変えることで,安全性に関する結果に最大で12.9ppの差が生じることが確認された。
    • この現象はモデルに依存し,Gemini 2.5 Proにおいて最も顕著であった。

    Link: https://arxiv.org/abs/2608.02665

  • Docker Hubの高露出イメージにおける脆弱性,秘密,および誤設定 [cs.CR, cs.AI, cs.CY, cs.OS, cs.SE]目的:Docker Hubイメージの脆弱性,秘密情報の包含,および設定ミスに関する実態把握
    • コンテナ技術の普及に伴い,Docker Hubのセキュリティは重要な課題となっている
    • 既存の研究では,単一の検出ツールに依存するため,結果の信頼性が低い
    • Docker Hub全体のイメージを多角的に分析し,より正確なセキュリティ評価を行う
    • Docker Hubの1270万以上のリポジトリを分析した結果,ほとんどのイメージに脆弱性や設定ミスが見られた
    • 脆弱性スキャナ間の検出結果の差異が大きく,ツールの依存性が高いことが示された
    • 秘密情報の検出精度は低く,誤検出が多いことが明らかになった

    Link: https://arxiv.org/abs/2608.02669

  • コーディングエージェントに対する厳格化された環境におけるポリシー等級評価 [cs.CR, cs.AI]目的:コーディングエージェントのポリシーによる性能変化の評価
    • 組織内でのエージェント利用が増加しており,セキュリティ対策が不可欠である。
    • 既存のベンチマークは制限の少ない環境での評価が中心で,実際の利用環境での性能が不明である。
    • 現実的なセキュリティ制限下でのエージェント性能を評価し,適切なモデル選択の指針を提供する。
    • 厳格なポリシー下では,成功率が最大18.3ポイント低下し,コストが最大167.3%増加した。
    • 成功率の維持と効率性の両立は難しく,ポリシーによって最適なモデルが異なる。
    • ポリシーによる制限がエージェントの動作に与える影響を分析し,失敗の原因を特定した。

    Link: https://arxiv.org/abs/2608.02670

  • ハードウェアパフォーマンスカウンタを用いたマルウェア検出分類器の性能について [cs.CR, cs.LG]目的:マルウェア検出性能の向上
    • サイバー攻撃の巧妙化により,従来のセキュリティ対策だけでは不十分な場合があるため。
    • マルウェア検出において,処理負荷が高く,効率的な検出方法が求められている。
    • ハードウェアパフォーマンスカウンタと機械学習を組み合わせ,効率的なマルウェア検出を目指す。
    • アンサンブル学習を用いることで,少ない数のハードウェアイベントで高いマルウェア検出性能を実現した。
    • 2つのハードウェアカウンタを用いたアンサンブル学習は,8つのカウンタを用いた標準的な分類器を上回る性能を示した。
    • 16のカウンタを必要とする標準的な手法と同等の性能を,4分の1の4つのカウンタで実現した。

    Link: https://arxiv.org/abs/2608.02671

  • テキストからTerraformへのセキュリティ重視評価:安全なIaC生成のためのLLMとSLMのベンチマーク [cs.CR, cs.AI, cs.ET, cs.SE]目的:LLMとSLMによる安全なInfrastructure-as-Code生成の評価
    • クラウド環境のセキュリティインシデントの多くは設定ミスが原因であり,安全なIaC生成は重要である。
    • LLMやSLMがセキュリティ要件を満たすIaCを生成できるかどうかが未解明である。
    • LLM/SLMによるIaC生成におけるセキュリティ適合性を評価し,改善策を提示すること。
    • LLM生成のIaCにおいて,構文の正当性とセキュリティ適合性は必ずしも相関しないことが示された。
    • WizardCoder-33Bは高い構文の妥当性を示す一方,Checkovによるセキュリティチェックに全く合格しなかった。
    • Claude Opus 4は詳細なセキュリティプロンプトにより,CheckovとTrivyでそれぞれ23.1%と92.5%の合格率を達成した。
    • プロンプトエンジニアリング単独では不十分であり,IaC生成には自動スキャンツールが不可欠である。

    Link: https://arxiv.org/abs/2608.02672

  • 安全障壁の移動:ホワイトボックス攻撃に対する動的ルーティング適応配置 [cs.CR, cs.AI]目的:大規模基盤モデルにおける安全性の維持
    • 大規模言語モデルの普及に伴い,安全性確保は重要性を増している。
    • 既存の安全性対策は静的な仕組みに頼る傾向があり,標的を絞った攻撃に弱い。
    • 安全経路が侵害された場合でも,堅牢な拒否応答を維持するメカニズムを構築する。
    • 本研究では,動的ルーティング適応配置(DRAA)を提案し,安全経路を迂回する代替経路を動的に生成する。
    • DRAAは,安全経路の特定と局所化,および攻撃による失敗事例の活用により,モデルの安全性経路依存性を再構築する。
    • 実験の結果,DRAAはホワイトボックス攻撃に対する堅牢性を大幅に向上させつつ,汎用的な性能を維持することが示された。

    Link: https://arxiv.org/abs/2608.02674

  • DenialRAG:埋め込みパラメトリック否定による単一ドキュメントRAGポイズニング [cs.CR, cs.AI, cs.LG]目的:RAGシステムの脆弱性を悪用する単一ドキュメントポイズニング攻撃手法
    • RAGシステムは情報検索と生成を組み合わせ,LLMの性能向上に貢献する重要な技術である。
    • RAGシステムは,悪意のあるドキュメント注入により,誤った回答を誘導される脆弱性を持つ。
    • 既存攻撃の課題を克服し,正答を明示的に否定することで,より効果的なポイズニングを実現する。
    • 提案手法DenialRAGは,Mistral-7Bデータセットにおいて高い攻撃成功率を達成した。
    • 他の攻撃手法が優位なモデルも存在する一方,複数のLLMに対して有効性が確認された。
    • 防御機構はASRを低減するものの,完全な保護は難しく,設定によってASRが残存する。

    Link: https://arxiv.org/abs/2608.02678

  • バッチ処理における安全性:バッチプロンプティングにおける安全性の失敗の理解と緩和 [cs.CR]目的:バッチプロンプティングにおける安全性失敗の理解と緩和
    • 大規模言語モデルの利用拡大に伴い,安全性確保が重要課題となっている。
    • 単独での質問では安全なモデルが,バッチ処理では有害な回答を生成するリスクが存在する。
    • バッチプロンプティング特有の安全性の脆弱性を特定し,その緩和策を提案する。
    • バッチプロンプティングは,有用性においては成功するものの,安全性においては失敗することが示された。
    • 有害な質問が,無害な質問のバッチに組み込まれることで,有害な回答を引き出す可能性が確認された。
    • バッチを意識した選好最適化が,この脆弱性の効果的な緩和策となることが示された。

    Link: https://arxiv.org/abs/2608.02681

  • 多段階防御によるエージェントの安全性の向上:$S^3$ [cs.CR, cs.AI]目的:大規模言語モデルエージェントにおける多段階ワークフローの安全性確保
    • LLMエージェントの複雑化に伴い,安全性確保は不可欠であり,社会実装への信頼獲得に繋がる。
    • 既存手法は個別の段階に限定され,ワークフロー全体としての安全性を保証できていない。
    • 段階ごとの安全性を統合的に管理し,リスク検出・軽減能力を高めることを目指す。
    • $S^3$は,段階固有の安全スキルを連携させ,ワークフロー全体を通してリスクを検出し軽減する。
    • 既存の安全設計を再利用可能なスキルに変換するパイプラインと,スキル共有ライブラリを構築した。
    • 実験の結果,安全性と実用性の両面で,最先端のベースラインを上回る性能を示した。

    Link: https://arxiv.org/abs/2608.02683

  • PolicyGuard:プロンプト設定可能なセマンティックDLP,LLMコーディングエージェント向け [cs.CR, cs.SE]目的:LLMコーディングエージェントにおける情報漏洩防止
    • AI技術の発展に伴い,コーディングエージェントの利用が拡大している。機密情報の保護が重要となる。
    • 従来のDLPは,柔軟性に欠け,カスタマイズが困難である。LLMの特性に合わせた対策が求められる。
    • 自然言語によるポリシー設定で,柔軟かつ高精度な情報漏洩防止を実現することを目指す。
    • PolicyGuardは,自然言語ポリシーファイルを用いてユーザープロンプトを分類する,事前モデル介入フレームワークである。
    • 2000件の多言語プロンプトに対し,96.5%の有効ブロック率と3.0%の誤検知率を達成した。
    • 同じポリシーを4つの異なるLLMで利用したところ,86.4〜96.5%の有効ブロック率を維持した。

    Link: https://arxiv.org/abs/2608.02687

  • PRWeaver:長期間にわたる悪意のあるプルリクエストに対するLLMベースのコード監査ツールの評価 [cs.SE, cs.CR]目的:LLMベースのコード監査ツールの,リポジトリの進化にわたって分散された敵対的変更に対する信頼性
    • ソフトウェア開発におけるセキュリティ確保は重要であり,脆弱性の早期発見が不可欠である。
    • 既存のコード監査ツールは,巧妙に隠蔽された長期間にわたる攻撃を検出することが難しい。
    • 本研究は,LLMベースのコード監査ツールが,このような攻撃をいかに検出するかを評価・改善する。
    • PRWeaverベンチマークにより,実際の攻撃シナリオにおけるLLMベースのコード監査ツールの性能を詳細に評価した。
    • 攻撃を分割しても検出率への影響は小さい一方,PRごとの処理や文脈融合は検出率を低下させる傾向が確認された。
    • リポジトリの履歴へのアクセスだけでは十分ではなく,攻撃と正常な変更が混在する文脈下での隠蔽が効果的であることが示された。

    Link: https://arxiv.org/abs/2608.02693

  • ソフトウェアリポジトリにおける著者なりすましの様式計測による防御 [cs.CR, cs.LG, cs.SE]目的:ソフトウェアリポジトリにおける著者なりすましの検知
    • ソフトウェアサプライチェーン攻撃の増加に伴い,開発者のアカウントを悪用した攻撃が深刻化している。
    • 正規の開発者になりすました攻撃者が,悪意のある変更を承認してしまうという課題が存在する。
    • パッチレベルでの著者確認により,サプライチェーン攻撃に対する防御を強化することを目指す。
    • 様式計測分析をパッチレベルのコミットに適用可能であることを示した。
    • Linuxカーネルの20年以上のコミット履歴を用いてクロスモーダルTransformerを学習し,コード差分とコミットメッセージを統合した様式計測空間を構築した。
    • 構築したモデルは,オープンワールド著者検証において0.93のROC AUCを達成し,実際のサプライチェーン攻撃の検知にも有効であることが確認された。

    Link: https://arxiv.org/abs/2608.02695

  • ツール利用エージェント集団における適応的秘密共謀の隠蔽分析:ブラックボックス型,クロスプリンシパルアプローチ [cs.CR, cs.AI]目的:ツール利用エージェントの秘密共謀検出
    • LLMを活用したエージェント利用が拡大し,集団レベルでのリスク管理が重要となっている。
    • 単一エージェントの安全対策では,複数エージェント間の共謀による不正行為を見抜くことが困難である。
    • 組織間でのモデル内部の可視化が難しいため,外部観測のみでの共謀検出手法の開発が求められている。
    • 提案手法は,相互情報量推定,置換検定,分布シフト統計,タイミングおよびツールコールサイドチャネルを組み合わせる。
    • 敵対的環境下での継続的な性能評価により,検出能力の限界を示す検出容量フロンティアを提示する。
    • セッションを跨いだペイロード拡散など,既存手法では検出困難な回避策の存在を示唆している。

    Link: https://arxiv.org/abs/2608.02698

  • プライバシー保護AI検証のための最小情報開示 [cs.MA, cs.DB, cs.CR, cs.AI]目的:AI検証における情報漏洩の最小化
    • AI技術の信頼性確保は重要であり,検証プロセスはその鍵となる。
    • AI検証はモデルやデータに関する機密情報を漏洩するリスクを伴う。
    • 検証の信頼性を保ちつつ,情報漏洩を最小限に抑える手法の確立。
    • 本研究では,検証者への情報開示量を定量化する「最小情報開示 (MID)」を提案した。
    • MIDを用いて,4種類の物理測定と6つの検証タスクにおいて,検証とプライバシーのトレードオフを評価した。
    • その結果,MIDは検証の精度を維持しつつ,情報漏洩をゼロに抑えることができた。

    Link: https://arxiv.org/abs/2608.02774

  • 安全性が求められるビデオベース知覚システムに対する高速物体除去攻撃 [cs.CR, cs.CV]目的:ビデオベースの安全性が求められるシステムに対する,標的を絞った高速物体除去攻撃手法
    • 自動運転などのITSは,ビデオベースの知覚システムに依存しており,その安全性確保は重要である。
    • ビデオデータは改ざんされやすく,知覚システムの誤動作を引き起こし,安全性に影響を与える可能性がある。
    • 本研究は,ステルス性の高い物体除去攻撃による知覚システムの脆弱性を明らかにし,対策開発に貢献する。
    • 提案手法は,攻撃対象フレームとオリジナルのフレームとの類似性を高く維持し,高いPSNRとSSIMを示す。
    • YOLOベースの物体検出器を用いた実験で,物体検出率を最大97.59%まで低下させ,94.48%の攻撃成功率を達成した。
    • GPU上で毎秒0.074~0.172フレームの処理速度で動作し,リアルタイムでの攻撃が可能であることが示された。

    Link: https://arxiv.org/abs/2608.02806

  • モデル汚染による思考連鎖モニタリングの回避 [cs.CR, cs.AI, cs.LG]目的:思考連鎖モニタリングの限界と,モデル汚染による攻撃手法の検討
    • AIの安全性確保において,思考連鎖モニタリングは重要な役割を担う。
    • 思考連鎖がモデルの行動を正確に反映するという前提に依存している。
    • 思考連鎖モニタリングを欺瞞するバックドア攻撃の有効性とメカニズムを明らかにする。
    • モデルにバックドアを埋め込むことで,攻撃者が指定した行動を,一見無害な思考連鎖と共に引き起こせることを示した。
    • 単純なファインチューニングやカリキュラム学習を通じて,様々なモデルアーキテクチャでバックドアを誘導可能であることを確認した。
    • 思考連鎖モニタリングは,思考連鎖と最終応答の一貫性評価と捉えるべきであることが示唆された。

    Link: https://arxiv.org/abs/2608.02820

  • 検出器が見えるもの:決定ルールに依存しないCPS異常検知器の評価 [cs.CR]目的:CPS異常検知器の性能評価手法
    • CPSは社会インフラを支える重要システムであり,そのセキュリティ確保は喫緊の課題である。
    • 従来の評価指標は検知器の性能と閾値設定が混在しており,検知器自体の能力を正確に評価できない。
    • 検知器の物理過程表現能力を,閾値設定に依存せず評価する手法を確立し,検知失敗の原因を特定する。
    • 異常検知器を,観測値から残差を計算する第1段階と,残差からアラームを生成する第2段階のパイプラインとして捉えた。
    • 第1段階の性能を,正規分布からの Kullback-Leibler ダイバージェンスに基づいた正規化残差エネルギーで評価した。
    • 5つの検知器において,ベンチマーク間や検知器間の性能に大きな差が確認され,閾値設定の影響を分離した評価の有効性が示された。

    Link: https://arxiv.org/abs/2608.02821

  • パラメータ化されたドレブ=ヤオ秘密性の決定可能性 [cs.CR, cs.CC]目的:暗号プロトコルのパラメータ化された秘密性の検証
    • 暗号プロトコルの安全性評価は,情報セキュリティの根幹をなす重要な研究分野である。
    • 従来のドレブ=ヤオ秘密性では,実行回数に依存しない秘密漏洩の有無のみが問われていた。
    • プロトコル規模に応じた秘密性の保証を形式的に検証する方法を確立すること。
    • パラメータ化された秘密性は,役割ごとのグローバルな新鮮性制約と,型付き置換に制限された侵入者という構造的制限の下で決定可能である。
    • 任意の規模のシステムにおける秘密性違反は,必ず有界サイズのシステムで示されることが証明された。
    • この結果は,記号的プロトコル解析における有限の証拠の存在を構造的に説明し,ドレブ=ヤオ検証とパラメータ化された検証技術を結びつける。

    Link: https://arxiv.org/abs/2608.02838

  • MutMem:永続的エージェントメモリにおける暗号学的認可付きミューテーション [cs.CR, cs.AI]目的:永続的エージェントメモリにおける,暗号学的に認可されたミューテーションのプロトコル
    • エージェントメモリは知識の進化に不可欠だが,改竄のリスクも伴う。
    • ミューテーション可能な検索重みは,正当な適応と不正な改竄の区別を困難にする。
    • MutMemは,改竄を検出し,信頼性を確保しながらメモリの適応を可能にする。
    • MutMemは,HOM-AIMOSエンジン内で,署名された肯定・否定的な結果証拠を記録し,重みの変更を認可された遷移としてコミットする。
    • LongMemEvalにおいて,LLMによる判断で500問中459問に正答(91.8%),LoCoMoでは74.12%の精度を達成した。
    • PoisonedRAG実験では,注入された毒が上位5件の開示に現れることはなく,標的回答攻撃の成功率も低い結果だった。

    Link: https://arxiv.org/abs/2608.02843

  • アイデンティティプリミティブの内部化:パブリックブロックチェーン上の自律エージェントのための暗号学的個別性 [cs.CR, cs.AI, cs.MA]目的:自律エージェントのアイデンティティを確立する基盤
    • ブロックチェーン上での自律エージェントの利用拡大に伴い,エージェントの個性確立が重要課題となっている。
    • 従来,エージェントのアイデンティティはハードウェアや運用者に依存しており,セキュリティ上の脆弱性があった。
    • 暗号学的仮定に基づき,エージェントのアイデンティティを確立し,信頼性の高い自律動作を実現することを目指す。
    • エージェントのニューラルネットワークの重みを,その秘密鍵の決定論的な関数として定義する手法を開発した。
    • この手法により,ブロックチェーン上の全ての状態遷移において,アイデンティティの検証が可能となり,改ざんを防止できる。
    • Solana devnetでの実証実験で,2.36日間の運用中に状態遷移の拒否が発生せず,鍵を変更したエージェントは期待通りに動作が分岐した。

    Link: https://arxiv.org/abs/2608.02986

  • SparSEEty:スパース性活用LLMサービングシステムからのトークン抽出における決定論的サイドチャネル [cs.CR, cs.AI]目的:スパース性活用LLMサービングシステムにおけるトークン抽出攻撃
    • LLMは巨大な計算資源を必要とするため,効率的なサービングが不可欠である。
    • スパース性活用の最適化は,サイドチャネル攻撃の脆弱性をもたらす可能性がある。
    • スパース性活用システム特有のサイドチャネルからトークンを抽出する攻撃手法を明らかにする。
    • SparSEEtyは,LLM推論時のニューロン重みアクセスサイドチャネルを利用して,ニューロン活性化オラクルを構築する。
    • 構築したオラクルを用いて活性化トレースを反転させ,入力トークンを再構築するエンドツーエンドの攻撃を実現した。
    • Intel TDX CVM環境下においても,高いBLEUスコア(>0.95)でプロンプトと応答トークンを復元可能であり,モニタリングオーバーヘッドは3.7%~7.2%に抑えられた。

    Link: https://arxiv.org/abs/2608.02995

  • 小さすぎて侵入可能:小規模言語モデルを搭載した自律型リモートアクセス型トロイの木馬 [cs.CR]目的:小規模言語モデルを搭載した自律型リモートアクセス型トロイの木馬の実現可能性
    • サイバーセキュリティにおいて,AIによる攻撃は,その高度な適応性と自律性から深刻な脅威となるため,その動向の把握が重要である。
    • 既存のリモートアクセス型トロイの木馬は,攻撃者の指示に依存する度合いが高く,検知や防御が可能な場合がある。
    • 本研究は,小規模言語モデルによる自律的なサイバー攻撃の実現可能性を検証し,将来的な脅威への対策を検討する。
    • 小規模言語モデル(80億パラメータ)を搭載したトロイの木馬が,ネットワークから隔離された環境において,自律的に脆弱性を利用し,root権限を取得することが確認された。
    • しかしながら,現在の小規模言語モデルには,幻覚や誤読といった課題があり,完全な自律性には至っていない。成功率は10.9%にとどまった。
    • 小規模言語モデルの進化により,より高度で検知困難な自律型エンドポイントシステムが現実のものとなり,既存のセキュリティ対策を脅かす可能性がある。

    Link: https://arxiv.org/abs/2608.03009

  • AIセキュリティリーダーボード:方法論,結果,および最低基準 [cs.CR, cs.AI, cs.CL]目的:AIモデルの安全性評価基準の確立と,主要モデルの安全性評価
    • AI技術の発展に伴い,悪意ある利用のリスクが増大しており,AI安全性の確保が重要である。
    • AIモデルの安全性に関する情報は公開されておらず,開発者間の安全性レベルにばらつきがある。
    • 公開されている手法を用いて,AIモデルの脆弱性を評価し,安全性を向上させるための基準を提供する。
    • 主要なAIモデル(Claude, GPT, Gemini, Grok)に対して,化学・生物・放射能・核・爆発物に関する攻撃目標を用いた安全性評価を行った。
    • Grok 4.5とGemini 3.1 Proは多くの脆弱性が見つかったが,Claude Fable 5とGPT-5.6 Solは脆弱性が少なかった。
    • 現状の技術で安全性向上は可能であり,多層防御が推奨される。評価結果はleaderboard.far.aiで公開されている。

    Link: https://arxiv.org/abs/2608.03070

  • DHMark:Diffie-Hellman誘導リジェクトサンプリングによるLLM生成テキストの公開鍵ウォーターマーク [cs.CR]目的:LLM生成テキストのトレーサビリティ確保
    • LLMの普及に伴い,生成されたテキストの出所特定が重要になっている。
    • 既存のウォーターマークは秘密鍵に依存し,公開監査が困難である。
    • 公開鍵を用いて,テキスト編集等に強いロバストなウォーターマークを構築する。
    • DHMarkは,署名されたレジストリペイロードとトークンラベルの投票を組み合わせることで,ウォーターマーク検出を統計的証拠集約として実現する。
    • 32ビット構成において,8種類の編集条件下で0.967以上の有効率を維持し,偽陽性は0.000に抑えられた。
    • 正確な暗号文字列の復元を必要とせず,テキストの変更に対する耐性を高めている。

    Link: https://arxiv.org/abs/2608.03093

  • FakeI2V-Bench:動画向けディープフェイク検出における画像レベル検出器の適用可能性の評価 [cs.CR, cs.AI, cs.CV]目的:動画向けディープフェイク検出における画像レベル検出器の性能評価
    • 近年の動画生成技術の進歩により,ディープフェイクによる脅威が増大しており,その検出が重要である。
    • 既存の動画向けディープフェイク検出ベンチマークは十分ではなく,画像レベル検出器の動画領域への適用可能性が体系的に評価されていない。
    • 画像レベル検出器を動画に適用するためのフレームワークを提示し,より高精度なディープフェイク検出を目指す。
    • FakeI2V-Benchは,97,548本の動画を含むベンチマークデータセットであり,最新の生成モデルで作成されたコンテンツを網羅している。
    • 画像レベル検出器の最高性能モデルは,動画レベル検出器をわずかに上回る80.16%のAUCを達成した。
    • IV-Bridgeというフレームワークにより,画像レベル検出器11種類が最先端の動画レベルアプローチを上回り,最高で93.80%のAUCを実現した。

    Link: https://arxiv.org/abs/2608.03096

  • PECR:SD-WANにおけるテレメトリ情報に基づいた脆弱性優先度付けの再現性のある仕様と合成ストレステスト [cs.CR, cs.NI]目的:SD-WAN環境における脆弱性優先度付け手法PECRの仕様と,その有効性評価
    • SD-WANはネットワーク運用の中核を担うが,セキュリティリスクの適切な評価と対応が不可欠である。
    • 従来の脆弱性管理は,深刻度のみに基づくことが多く,実際の露出状況や証拠の質を考慮できていない。
    • PECRは,複数の要素を統合することで,より現実的なリスク評価と優先度付けを実現し,効率的なセキュリティ対策を可能にする。
    • PECRは,9つの要素を正規化し,信頼性とスコアの幅を個別に報告する意思決定支援手法である。
    • 合成データを用いた評価では,PECRは既存手法と比較して高い相関を示し,脆弱性キューの差異化とロバスト性が確認された。
    • 一部のデータでは証拠が不十分であることが示唆され,さらなるデータ収集の必要性も示唆された。

    Link: https://arxiv.org/abs/2608.03110

  • DP-MemView:長期LLMエージェントにおける属性レベルのトランスクリプトプライバシーのためのメモリインターフェース [cs.CR, cs.CL, cs.LG]目的:長期LLMエージェントにおける属性レベルのトランスクリプトプライバシー
    • LLMエージェントの長期記憶はパーソナライズに不可欠。しかし,プライバシー保護が課題となる。
    • 記憶に基づく応答の繰り返しにより,明示的に述べられなくても保護された属性が漏洩する可能性がある。
    • 属性レベルでのトランスクリプトプライバシーを確保し,情報の漏洩を防ぐことを目指す。
    • DP-MemViewは,差分プライバシーを適用したメモリインターフェースであり,応答LLMに生のメモリではなく,選択されたビューを公開する。
    • 属性ごとに台帳を保持し,選択がプライバシー予算を超えないように制限することで,安全性を確保する。
    • 実験結果から,DP-MemViewはトランスクリプトの識別能力を抑制しつつ,パーソナライズと応答品質を維持できることが示された。

    Link: https://arxiv.org/abs/2608.03130

  • 脆弱性検出のための因果的文脈に基づいたエージェント的推論:CLEAR [cs.HC, cs.CR, cs.SE]目的:ソースコード脆弱性検出における因果関係のモデル化とエージェントによる検証
    • ソフトウェアの複雑化に伴い,脆弱性は高度な因果関係に起因することが多く,その検出は困難になっている。
    • 既存手法は表層的な類似性に焦点を当て,セキュリティ上の欠陥に内在する複雑な因果関係を捉えきれていない。
    • 因果知識グラフを活用し,脆弱性の因果連鎖を体系的に検証することで,脆弱性検出の精度向上を目指す。
    • CLEARは脆弱性因果知識グラフ(VCKG)を構築し,エントリポイント,前提条件,根本原因,修正意図間の因果関係をモデル化する。
    • Collector,Claim,Critic,Judgeの4つの専門エージェントが,取得した因果的文脈を通じて脆弱性仮説を共同で検証する。
    • C/C++とJavaの脆弱性ベンチマークにおいて,最先端手法と比較してPair-Correct(P-C)性能をそれぞれ130.7%と71.56%向上させた。

    Link: https://arxiv.org/abs/2608.03134

  • AirKey:音響支援WiFiセンシングによるゼロ学習ロバストなPIN推測 [cs.CR, cs.HC]目的:WiFiセンシングを用いたゼロ学習PIN推測の実現
    • WiFiセンシングは,プライバシー侵害の深刻な脅威となる可能性があるため,その対策が重要である。
    • 安定したセンシングストリームの取得にはネットワーク権限が必要であり,高速タイピング時のWiFi信号の波形融合が課題となる。
    • ネットワーク権限なしで,波形融合の影響を軽減し,PINを正確に推測することを目指す。
    • AirKeyは,WiFi ACK応答を利用することで,ネットワーク関連なしに継続的な空間センシングストリームを確保する。
    • 音響信号を時間的なアンカーとして活用することで,重なり合うCSI軌跡のセグメンテーションを堅牢に行う。
    • 実環境での評価により,AirKeyは最先端のゼロ学習方式よりも4倍以上の精度でPINを復元できることが示された。

    Link: https://arxiv.org/abs/2608.03151

  • 拡散スペクトル埋め込みによる堅牢な画像ウォーターマーク [cs.CR, cs.CV]目的:画像ウォーターマークの堅牢性向上
    • デジタルコンテンツの保護が重要であり,改ざん検出や真正性確認にウォーターマーク技術が用いられる。
    • 既存のウォーターマーク技術は,歪みや意図的な除去に対して脆弱であり,検出精度が低下しやすい。
    • 拡散スペクトル埋め込みを用いて,画像全体に情報を拡散し,除去耐性を高めることを目指す。
    • SpreadMarkは,従来のエンコーダー・デコーダー方式と比較して,各ビットが画像全体に拡散されるため,除去が困難である。
    • COCOとDIV2Kデータセットを用いた評価において,再生攻撃や潜在空間スパース化攻撃に対する検出率が高いことが示された。
    • 埋め込まれたウォーターマークは視覚的に認識できず,画像の品質を維持しつつ,高い堅牢性を実現している。

    Link: https://arxiv.org/abs/2608.03165

  • テスト時の推論努力と言語モデルエージェントにおける不正なツール利用:事前規定された等価性研究 [cs.HC, cs.CR, cs.SE]目的:言語モデルエージェントにおけるテスト時の推論努力と不正なツール利用の関係の検証
    • 言語モデルエージェントは,業務自動化において重要な役割を担うが,セキュリティ上の課題も存在する。
    • エージェントのアクセス制御ポリシーと推論努力パラメータが,不正なツール利用にどのように影響するか不明である。
    • 推論努力パラメータの調整が,不正なツール利用を抑制するかどうかを検証すること。
    • GPT-5.6において,推論努力を低く設定した場合でも,不正なツール利用は確認されなかった。
    • 各モデル層における不正利用率の上限は,それぞれ3.50%と5.21%であり,等価性の基準を満たした。
    • 推論努力の増加は,ルール調査の頻度を高めたが,これは標的的な探索とは一致しない結果であった。

    Link: https://arxiv.org/abs/2608.03169

  • 生成AIモデルに対する属性ベースの検出不能なウォーターマーキング [cs.CR, cs.AI]目的:生成AIモデルが生成したコンテンツの識別
    • 生成AIの利用拡大に伴い,コンテンツの出所検証が重要になっている。
    • 既存のウォーターマーキング技術では,検出キーの悪用によるリスクが存在する。
    • 属性に基づいたポリシー制御により,安全なウォーターマーキングを実現する。
    • 本研究では,生成AIモデルに対する初の属性ベースウォーターマーキングを提案する。
    • 検出キーは属性に関するポリシーによって制約され,ポリシー外のコンテンツは検出されない。
    • 提案手法の有効性と実用性をプロトタイプ実装と実験によって検証した。

    Link: https://arxiv.org/abs/2608.03174

  • MalTotal:数百万のリポジトリに対する費用対効果が高く,言語に依存しない悪意のあるコードポイズニング検出 [cs.CR]目的:オープンソースリポジトリにおける悪意のあるコードポイズニングの検出
    • オープンソースソフトウェアの普及により,セキュリティリスクが増大しており,対策が急務である。
    • 既存の手法は言語依存性が高く,汎用性に欠け,大規模な分析にはコストがかかりすぎる。
    • MalTotalは,大規模なコードポイズニング攻撃を軽減するための効果的かつ効率的な手法を提供する。
    • MalTotalは,最先端の8つのベースラインを凌駕し,5つの主要言語で平均F1スコア93.1%を達成した。
    • ハイブリッドスライスにより,LLMのトークン消費量を94.0%削減し,2,168リポジトリの分析コストを大幅に削減した。
    • 12万のリポジトリを対象とした大規模な調査で,564個の未知の悪意のあるリポジトリを発見し,その総コストは338ドルであった。

    Link: https://arxiv.org/abs/2608.03232

  • ShielDroid:機械学習と深層学習を統合したAndroidマルウェア検出ハイブリッド手法 [cs.CR, cs.LG]目的:Androidマルウェアの正確な識別と分類
    • スマートフォン利用者の増加に伴い,モバイルマルウェアによる被害が深刻化している。
    • 従来の静的解析では,実行時に活動する巧妙なマルウェアの検出が困難である。
    • リアルタイムな動的解析に基づくマルウェア検出フレームワークを構築し,セキュリティ向上を目指す。
    • 機械学習アルゴリズムを複数用いてマルウェアを分類し,その有効性を評価した。
    • Random ForestとMultilayer Perceptronを組み合わせたハイブリッドモデルが最も高い性能を示した。
    • 本手法は97.5%の精度でマルウェアを検出し,実行時間は22.945秒であった。

    Link: https://arxiv.org/abs/2608.03250

  • FedGSA: 差分プライバシー付き連合型LoRAのための幾何学的整合性のある部分空間集約 [cs.CR]目的:差分プライバシー付き連合型LoRAにおける,幾何学的整合性のある部分空間集約による精度向上
    • 事前学習済み言語モデルの連合学習は,データ分散環境での効率的な微調整を可能にする重要な技術である。
    • 連合型LoRAに差分プライバシーを適用する際,部分空間の不整合や二乗ノイズといった課題が存在する。
    • 基底に依存しない幾何学的整合性のある集約により,ノイズや異質性による歪みを軽減し,精度向上を目指す。
    • FedGSAは,各クライアントの更新をグラスマン多様体上の基底不変な部分空間として表現することで,基底のずれによる歪みを削減する。
    • FedGSAは,クライアント側のDP学習以上の追加のプライバシー損失を発生させず,標準的な仮定の下で収束性を示すことが証明された。
    • GLUEタスクと言語生成ベンチマークにおいて,既存の最良手法と比較して平均精度が2.17%および2.27%向上した。

    Link: https://arxiv.org/abs/2608.03267

  • マルチエージェント協調フィルタリングシステムの接続性を介した攻撃と防御 [cs.IR, cs.CR, cs.MA, cs.SI]目的:マルチエージェント協調フィルタリングシステムにおける脆弱性の接続性による変調の理解
    • 協調フィルタリングは,推薦システムの重要な基盤技術であり,ユーザーの多様なニーズに対応する。
    • マルチエージェントシステムでは,エージェント間の相互作用が複雑になり,新たなセキュリティリスクが生じる。
    • 本研究は,協調フィルタリングシステムの接続性を分析し,より堅牢な推薦システムを構築することを目指す。
    • 本研究では,一般的なマルチエージェントシステムにおける攻撃と防御手法を,エージェントベースの協調フィルタリング環境に適用し,有効性を検証した。
    • ユーザー側のインタラクション密度とアイテムカタログの重複度が,攻撃と防御の結果に影響を与えることが明らかになった。
    • 伝播攻撃と抽出攻撃の目標において,異なるパターンが見られ,ユーザーエージェントとアイテムエージェント間で役割の非対称性が示唆された。

    Link: https://arxiv.org/abs/2608.03272

  • 消去半Thueシステムにおける右除算可能性:侵入者推論の最小限の視点 [cs.LO, cs.CR, cs.FL]目的:侵入者推論問題の構造的側面に関する研究
    • 暗号プロトコルの安全性評価において,攻撃者の能力を正確に分析することが重要である。
    • 一般的な項書き換えシステムでは,推論問題の決定可能性が保証されない場合が多い。
    • 最小限の構造を持つシステムにおける推論問題の決定可能性を明らかにすること。
    • 全ての関数記号が単項の場合,推論問題は半Thueシステムの右除算可能性問題として表現できる。
    • 収束的プレフィックス消去システムおよび収束的サフィックス消去システムに対する新たな決定可能性結果を証明した。
    • コンテキストを消去しつつ部分項または変数を持ち上げるシステムでは,推論問題は決定不可能であることが示された。

    Link: https://arxiv.org/abs/2608.03274

  • 大規模言語モデルの差分プライバシー準拠ゼロ次最適化におけるノイズを考慮した縮小 [cs.LG, cs.CR]目的:大規模言語モデルの差分プライバシー準拠ゼロ次最適化におけるノイズの影響軽減
    • 大規模言語モデルの活用は拡大する一方であり,プライバシー保護は重要な課題である。
    • 既存手法では,ノイズの影響を適切に考慮せず,モデルの性能劣化を招く場合がある。
    • ノイズの大きさに応じて更新量を調整することで,プライバシー保護とモデル性能の両立を目指す。
    • 提案手法SAGEは,推定された信号品質に応じてプライバシー保護された推定値を適応的に減衰させる。
    • 理論的分析により,縮小が有用な下降を維持しつつ,ノイズの影響を抑制することが示された。
    • RoBERTa-large,OPT-1.3B,OPT-6.7Bでの実験により,既存手法を上回る性能が確認された。

    Link: https://arxiv.org/abs/2608.03277

  • クエリを用いた多ヘッドアテンションの確証的な学習 [cs.LG, cs.CR]目的:多ヘッドソフトマックスアテンションのパラメータ復元
    • 深層学習モデルの解釈可能性向上は,信頼性や安全性確保に不可欠である。
    • ブラックボックスからの入出力アクセスのみでは,アテンション機構のパラメータを効率的に学習することが困難である。
    • サブスペースの事前知識なしに,多ヘッドアテンションのパラメータを正確に復元することを目指す。
    • 同一の重み行列を持つヘッドを統合し,対応するベクトルを加算することで,標準的な表現を得る。
    • トークン数を変化させることで,ヘッドを分離する有理関数のサンプルを取得し,パラメータを復元する。
    • ヘッド数既知の場合,正確なパラメータ復元に $4Hd^2-2H+1$ 回のクエリで十分である。

    Link: https://arxiv.org/abs/2608.03294

  • 行列符号上のACDGV MinRank Gabidulin暗号方式の解読 [cs.CR, cs.IT, math.IT]目的:行列符号上のACDGV MinRank Gabidulin暗号方式に対する解読手法
    • 現代暗号は情報セキュリティの基盤であり,その安全性は社会機能の維持に不可欠である。
    • 公開鍵暗号方式の安全性評価は難しく,新たな攻撃手法が常に開発されている。
    • EGMC暗号方式の脆弱性を明らかにし,より安全な暗号方式への移行を促す。
    • 提案されたEGMC暗号方式において,秘密鍵の同等な符号を復元できることを示した。
    • 本研究では,組み合わせ的および代数的技術を組み合わせた新たな解読手法を提案した。
    • この攻撃により,EGMC暗号方式の全パラメータセットが容易に解読可能となり,安全性評価が大幅に低下する。

    Link: https://arxiv.org/abs/2608.03328

  • SkillSentry:エージェントのスキルに対する動的な安全性テストのための適応型ハニワールド [cs.CR]目的:エージェントのスキルの安全性テストのためのフレームワーク
    • 大規模言語モデルエージェントの能力拡張にはスキルが不可欠であり,その安全性確保は重要である。
    • 既存の静的解析やルールベースの検査では,環境依存的な悪意のある挙動を検出しにくい。
    • 環境を模倣し,スキルが示す潜在的な危険性を動的に特定し,その根拠を明らかにすること。
    • SkillSentryは,適応型ハニワールドを用いて,スキルの意図された境界を推論し,潜在的な危険性を探索する。
    • 標準ベンチマークにおいて,99.50%のリコールと96.26%の平均F1スコアを達成した。
    • 意味を保持した回避策に対しても,既存のベースラインより高い92.95%の平均F1スコアを示した。

    Link: https://arxiv.org/abs/2608.03485

  • SkillJack:自己進化型エージェントにおける持続的なスキルバックドア [cs.CR]目的:自己進化型エージェントの経験からスキルへの変換パイプラインの脆弱性
    • 強化学習エージェントの進化は,複雑なタスクの達成に不可欠であり,その安全性は重要課題である。
    • 既存研究ではコンテキストポイズニングが主だが,攻撃が限定的であり,根本的なリスクが残る。
    • エージェントの学習プロセスを乗っ取り,悪意のある動作をスキルレパートリに組み込む攻撃を解決する。
    • スキル抽出により攻撃の検出率が大幅に低下する。SkillXでは,98.5%から11.4%に,Anything2Skillでも同様の効果が確認された。
    • SkillJackによって埋め込まれたスキルは高い攻撃成功率を示し,SkillXで56.2%,Anything2Skillで89.2%を達成した。
    • スキルを介した攻撃の80%は,元のポイズンされた記録を削除した後も持続し,良性クエリでも意図せず活性化する例が見られた。

    Link: https://arxiv.org/abs/2608.03509

  • ['AIシステムにおける事件調査のためのプロセスモデルと研究課題:ホワイト/グレー/ブラックボックスアクセス'] [cs.CR, cs.AI]目的:['AIシステム事件調査のプロセスモデルと研究課題']
    • AIの社会実装が進む中で,AIシステムの判断や行動に関する調査ニーズが高まっている。
    • 既存のAIフォレンジック研究は断片的であり,システムの種類や分析手法に偏りがある。
    • AIシステムへのアクセス状況に応じた調査プロセスを確立し,今後の研究課題を明確化する。
    • AIシステムへのアクセスレベル(ホワイト/グレー/ブラックボックス)に応じて,収集・保全・分析・報告のプロセスが変化する。
    • AIシステムの揮発性順序(実行時状態,コンテキストウィンドウ,ログなど)を定義し,調査の効率化を図る。
    • ブラックボックス環境での保全,モデルバージョンの検証,代替分析における不確実性評価などの研究課題を提示する。

    Link: https://arxiv.org/abs/2608.03520

  • プロジェクトVeraisonのTPM参照方式におけるチャレンジ・ノンスの新鮮性ギャップ:アプリケーション層アクション証拠の端点間評価による発見 [cs.CL, cs.HC, cs.CR]目的:アプリケーション層アクション証拠を端点間評価することで,プロジェクトVeraisonのTPM参照方式における課題を特定すること。
    • 自動エージェントの行動記録の信頼性確保は,AIシステムの安全な運用において不可欠である。
    • 従来の署名付きログは,実行環境の整合性を保証するものではなく,改ざんの検出が困難である。
    • ハードウェアルート化されたTPMの引用を用いて,行動記録の改ざんを検出し,信頼性を高めることを目指す。
    • AEP(アクション証拠パッケージ)をRATS検証者に通過させることで,エンドツーエンドの評価パイプラインが正常に機能することを確認した。
    • 参照方式におけるチャレンジ・ノンスの新鮮性不備を発見し,修正案を提案・検証した。これにより,再利用された引用は否定されるようになった。
    • 提案された修正は,再現可能なパイプラインに組み込むことができ,TPMの信頼性を向上させる。

    Link: https://arxiv.org/abs/2608.03534

  • ReputationChain:ブロックチェーンを活用したサプライチェーンにおける堅牢な信頼更新 [cs.CR, cs.DC]目的:ブロックチェーンを活用したサプライチェーンにおける参加者信頼の更新フレームワーク
    • サプライチェーンの透明性確保が重要視される中,ブロックチェーン技術の活用が期待されている。
    • 既存の信頼システムでは,参加者の信頼性を正確に評価することが困難である。
    • 本研究は,繰り返しの二者間取引におけるインフレーションや,履歴の少ない参加者の評価問題を解決する。
    • 提案手法ReputationChainは,ブロックチェーンを証拠・来歴のレイヤーとして活用し,参加者間の信頼性を評価する。
    • シミュレーション結果から,ReputationChainは,不正行為による利益を大幅に削減し,信頼性のインフレーションを抑制することが示された。
    • 新規参加者の信頼度向上と誤った低信頼率の低減にも貢献しており,実運用データを用いた評価が今後の課題である。

    Link: https://arxiv.org/abs/2608.03554

  • CANディセーブル:CANおよびCAN-FDネットワークにおける不正な送信を防止するハードウェアベースの手法 [cs.CR]目的:CANおよびCAN-FDネットワークにおける不正な送信の防止
    • 自動車の制御ネットワークはセキュリティリスクに晒されており,対策が急務である。
    • 現在のECUにはセキュリティ機能が組み込まれていないという課題がある。
    • ECUが異常な頻度でCANバスへ送信するのを防ぎ,不正アクセスを遮断する。
    • 提案手法では,CANコントローラを修正し,ECUからの不正なCANバスへの送信をハードウェア的にブロックする。
    • このディセーブルの有効性は,CANおよびCAN-FDバスにおいて実証された。
    • コスト効率の高いセキュリティ機能として,車載制御ネットワークへの応用が期待される。

    Link: https://arxiv.org/abs/2608.03567

  • 1
  • 2