arXiv雑要約

セキュリティ - 2026/07/30 公開

  • AIセキュリティの優先課題:分野全体の議題 [cs.CY, cs.AI, cs.CR]目的:AIセキュリティの向上に向けた優先課題の特定
    • AIは経済,政府,安全保障の中核に組み込まれ,その重要性は増している。
    • AIの導入とセキュリティ対策の準備の間に大きな乖離が生じている。
    • AIセキュリティ分野における投資と行動の具体的な指針を提供すること。
    • 本研究は,産業界,政府,市民社会のリーダーへのインタビューと専門家ワークショップを通じて,AIセキュリティの優先課題を特定した。
    • 優先課題は,戦略的基盤の確立,官民連携の強化,技術的セキュリティエンジニアリングの推進,そして敵対的圧力下での自律型AIの統治という4つのテーマに整理された。
    • 本論文は,AIセキュリティ分野への投資と行動を促進するための実用的な基礎となることを目指している。

    Link: https://arxiv.org/abs/2607.26069

  • ブロックチェーン 기반の第三者コンプライアンス評価におけるフレームワーク実装成熟度 [cs.CR, cs.DC]目的:フレームワーク実装成熟度の測定
    • サイバーセキュリティとプライバシー保護は組織にとって不可欠であり,法規制遵守が求められる。
    • 従来のコンプライアンス評価は断片的で,継続的な検証と維持が課題である。
    • ブロックチェーン技術を用いて,コンプライアンス管理の透明性と継続性を向上させる。
    • 本研究では,許可型ブロックチェーンシステムを用いた第三者リスク評価(TPRA)フレームワークを提案した。
    • このフレームワークは,評価ワークフローの運用,マルチパーティガバナンスの強化,および評価状態の長期保存を可能にする。
    • また,コンプライアンス統制の検証可能性,ガバナンス,および持続可能性を評価するための評価指標と成熟度モデルを導入した。

    Link: https://arxiv.org/abs/2607.26087

  • Lilith: 学習時と推論時のトリガーシフト下におけるバックドアの汎化 [cs.CR, cs.LG]目的:学習時トリガーから推論時トリガーファミリーへのバックドアの汎化
    • 機械学習サービスが外部データに依存する度合いが増しており,データポイズニング攻撃のリスクが高まっている。
    • 既存研究はトリガーの完全な再利用や多様性に焦点を当てており,学習時に存在しないトリガーファミリーへの汎化は未解明である。
    • 学習時と推論時で異なるトリガーファミリーを使用した場合のバックドア攻撃の成功可能性を検証する。
    • Lilithは,代替リソースのみを用いてコンパクトな脆弱性を誘導し,推論時にトリガーファミリーを構築する。
    • アンカークリアランスとファミリーリーチを用いて,局所的な正則性と代替・被害者間の差異が小さい場合に,ファミリー全体のターゲット維持の十分条件を導出する。
    • 実験により,Lilithは高い攻撃成功率と低いユーティリティ低下,小さなトリガー汎化ギャップを達成することを示す。

    Link: https://arxiv.org/abs/2607.26099

  • 大規模言語モデルにおける無言の推論失敗を検出するための参照不要なスコア [cs.CR, cs.AI]目的:大規模言語モデルの推論過程の信頼性評価
    • 言語モデルの性能向上には,推論能力の正確な評価が不可欠である。
    • 従来の評価法は最終的な答えの一致に依存し,推論過程の妥当性を評価できない。
    • 推論過程の各ステップの信頼性を評価し,無言の推論失敗を検出すること。
    • 本研究では,参照不要な評価指標であるRAFSを提案し,推論過程の局所的な信頼性を評価する。
    • RAFSは,ステップの妥当性,答えへの根拠,介入に対する安定性,合意,条件付き安定性を組み合わせる。
    • RAFSを用いることで,数学的問題に対する答えの正確性だけでなく,推論過程における潜在的な問題を検出することが可能となる。

    Link: https://arxiv.org/abs/2607.26102

  • GPT-Red:大規模自己対戦による自動Red Teaming [cs.CR, cs.AI, cs.CL, cs.LG]目的:最先端LLMに対する新たなプロンプトインジェクション攻撃の発見
    • LLMの安全性確保は,その社会実装において不可欠であり,継続的な脆弱性評価が求められる。
    • 既存の脆弱性評価は,人的リソースに依存し,網羅性に限界がある。
    • LLMのロバスト性を高めるため,自動化されたRed Teaming手法の開発が急務である。
    • GPT-Redは,過去のモデル(GPT-5.5まで)を確実に突破する攻撃を可能にする。
    • 人間のRed Teamerよりも多くの成功事例を発見し,未知の環境やモデルへの汎化性能も高い。
    • GPT-Redの改良が,より強固なRed Teamerの育成に繋がり,LLMの安全性向上を加速させる好循環が期待される。

    Link: https://arxiv.org/abs/2607.26115

  • サイバーセキュリティのためのイベント中心の説明可能性:マルチエージェントLLMによる調査 [cs.HC, cs.CL, cs.CR, cs.AI]目的:サイバーセキュリティアラートの説明
    • サイバー攻撃の巧妙化に伴い,セキュリティ対策の高度化が急務である。
    • 既存の説明手法では,アラート対応に必要な文脈理解が不十分である。
    • アラートの根本原因特定と,対応策の迅速な実施を支援すること。
    • 提案手法(EC)2は,検証可能な証拠に基づいた構造化された調査を行うことで,サイバーセキュリティアラートの説明性を向上させる。
    • 運用上意味のある説明を生成し,アラート後の分析を改善することが示された。
    • イベント分類の精度向上にも貢献することが確認された。

    Link: https://arxiv.org/abs/2607.26201

  • 分散型自律組織におけるガバナンス権限の行使について [cs.CR, cs.CY]目的:分散型自律組織におけるガバナンス権限の行使に関する研究
    • ブロックチェーン技術の発展に伴い,DAOによる分散型組織運営が注目されている。
    • DAOのガバナンス設計には,セキュリティとプライバシーのトレードオフが存在する。
    • DAOのガバナンスメカニズムの設計上の脆弱性を明らかにし,新たな攻撃手法を提示すること。
    • 本研究では,48のEthereumベースDAOを分析し,ガバナンス設計の主要な側面を分類した。
    • その結果,DAOの基本的なガバナンスメカニズムを悪用する「ガバナンス攻撃」という新たな攻撃クラスを発見した。
    • この攻撃は,実装にバグがなくても発生しうるため,DAO設計における重要な課題となる。

    Link: https://arxiv.org/abs/2607.26204

  • 単語問題の学習:測地長と暗号学的応用 [cs.NI, cs.CR, cs.LG, math.GR]目的:単語問題の解決
    • 組合せ群論の進歩を促し,近年ではポスト量子暗号の基礎となる困難性仮定として重要である。
    • 一般には判定不能だが,解ける,または高速なアルゴリズムが存在する群も存在し,暗号設計に利用されている。
    • グラフニューラルネットワークを用いて単語問題をヒューリスティクに解き,構造的な漏洩による暗号への影響を検証する。
    • WPNetという新たなグラフニューラルネットワークアーキテクチャを提案し,Baumslag-Solitar群とArtin群で単語問題を解決した。
    • モデルは,単語を動的なグラフ構造にマッピングし,代数的に等価な要素を連続埋め込み空間でクラスタリングすることで測地代表を識別する。
    • WPNetをWagner-Magyarik公開鍵暗号システムに対して適用し,構造的な漏洩が暗号に影響を与えることを示した。

    Link: https://arxiv.org/abs/2607.26241

  • ステルスベンチ:自律型攻撃セキュリティエージェントにおける運用上のステルス性の測定 [cs.CR, cs.AI]目的:自律型攻撃セキュリティエージェントにおける運用上のステルス性の評価
    • セキュリティ研究や高度な持続的脅威において,存在や能力を隠蔽するステルス性は重要である。
    • 自律型エージェントに攻撃タスクが委ねられる中,ステルス技術の継承が課題となっている。
    • 本研究は,自律型エージェントのステルス性の欠如を明らかにし,改善を促すことを目指す。
    • ステルスベンチは,運用セキュリティ(OPSEC)の6つの側面から,自律型エージェントのステルス性を測定するベンチマークである。
    • 評価の結果,どのモデルも安全な成功率が54%を超えず,OPSEC違反がモデル全体で系統的に発生することが確認された。
    • ステルスベンチは,ステルス性を意識したエージェントの開発や,自律型攻撃セキュリティ展開における自動OPSEC監視を支援する。

    Link: https://arxiv.org/abs/2607.26314

  • RAGuard:検索拡張生成システムに対するデータポイズニング攻撃に対する多層防御フレームワーク [cs.RO, eess.IV, cs.HC, cs.LG, cs.CR, cs.IR]目的:検索拡張生成システムにおけるデータポイズニング攻撃に対する防御
    • 大規模言語モデルの性能向上に検索拡張生成が不可欠であり,外部知識源への依存度が高い。
    • 外部知識源が改ざんされることで,誤った情報が生成されるリスクが存在する。
    • 知識源への悪意ある情報注入による攻撃を検出し,システム全体の堅牢性を高める。
    • 敵対的学習による検索器の調整は攻撃の成功率を軽減するが,完全には排除できない。
    • 提案手法であるZKIPは,どの設定においても攻撃成功率を0.000にまで抑制し,検索性能の低下も最小限に抑える。
    • ZKIPが依存する反事実的な信号には,学習可能なポイズン構造が含まれていることが確認された。

    Link: https://arxiv.org/abs/2607.26339

  • オフライン衛星セキュリティ計画分解のための制御された候補セットベンチマーク [cs.CR]目的:衛星セキュリティ計画分解の評価手法
    • セキュリティ開発においては,目的を達成可能な計画へと変換するモデルが重要である。
    • 既存手法では,計画の質の評価が難しく,客観的な比較が困難である。
    • 制御された候補セットを用いることで,計画選択の性能を客観的に評価することを目指す。
    • 低ランク分解アダプターと,24の衛星セキュリティ事例を含むデータセットを新たに構築した。
    • アダプターは,二段階プロンプティングと比較して,1.5Bモデルにおいて精度が向上した。
    • 本研究は概念実証であり,独立した分解システムや汎用的なアダプターの優位性を示すものではない。

    Link: https://arxiv.org/abs/2607.26371

  • QUIC-TRIP:安全な変電所通信への三重冗長化された道のり [cs.CR, cs.SY, eess.SY]目的:変電所通信のセキュリティ確保
    • 電力システムはリアルタイム通信に依存しており,その信頼性確保が不可欠である。
    • 既存の通信プロトコルはセキュリティ機能が不十分で,攻撃に脆弱である。
    • QUIC-TRIPは,低遅延かつ安全な産業用通信を実現する。
    • QUIC-TRIPは,既存のプロトコルに影響を与えずにデータフローを保護する透過的なセキュリティ手法である。
    • Frankfurt-Amsterdam間の実験では,QUIC-TRIPのRTTはOpenVPNより低く,DTLS 1.2と遜色ない結果が得られた。
    • DoS攻撃に対するQUIC-TRIPの多経路通信は,3重の冗長性を提供し,帯域幅コストとのバランスが取れている。

    Link: https://arxiv.org/abs/2607.26379

  • 競争的限界における共謀:価格水準監査は構造的に盲目的である [eess.SY, cs.RO, cs.SY, cs.DB, cs.GT, cs.AI, cs.CR]目的:アルゴリズムによる共謀の可能性
    • デジタル経済における価格設定メカニズムの透明性と公正性の確保は重要である。
    • 既存の共謀検出手法は,巧妙な共謀行為を見抜くのが困難である。
    • 価格設定アルゴリズムの共謀を検出し,規制するための新たなアプローチを提示する。
    • 価格データのみに基づく共謀検出は,特定の条件下では盲目的になりうる。
    • 言語モデルを用いた実験では,モデル間の入札行動に有意な相関が見られた。
    • 入札者の数をカウントすることによって,共謀をある程度抑制できる可能性がある。

    Link: https://arxiv.org/abs/2607.26385

  • リカバリー,デコード,リガード:ガード非依存型防御増幅によるエンコードされたVLMの脱獄攻撃への対策 [cs.CR, cs.AI, cs.LG]目的:視覚言語モデル(VLM)に対する脱獄攻撃の対策
    • VLMの安全性確保は,誤用や悪用を防ぐ上で不可欠である。
    • 既存のガードは表面的な形式を判断するのみで,意味を理解しないため,攻撃を回避される場合がある。
    • 入力の意味を解析し,ガードが真の要求を識別できるよう,ガード非依存の増幅器を開発すること。
    • 増幅器は,画像の内容を書き起こし,エンコードされたテキストを平文に変換することで,ガードの性能を向上させる。
    • アンサンブル評価の結果,既存の防御には安全性と有用性の限界があることが明らかになった。
    • 増幅器とガードの組み合わせでも,依然として高い攻撃成功率と過剰な拒否率が課題として残る。

    Link: https://arxiv.org/abs/2607.26574

  • CDN津波:HTTP/3-HTTP/1.1変換を利用したDoS攻撃 [cs.CR]目的:HTTP/3を導入したCDNに対するDoS攻撃の可能性
    • CDNはWebサイトの可用性を高めるが,DoS攻撃の標的になりやすい。
    • 従来のHTTP/1.1やHTTP/2への対策が進み,新たな攻撃手法が必要とされている。
    • HTTP/3とHTTP/1.1の混在環境下における攻撃の脆弱性を明らかにする。
    • CDNがHTTP/3,オリジンサーバがHTTP/1.1の場合,攻撃トラフィックを増幅可能。
    • HTTP/3 Bandwidth Amplification(HBA)とHTTP/3 Connection Amplification(HCA)の2種類の攻撃を提案。
    • Tranco Top 1Mドメインリストの測定で42,330件の脆弱なサブドメインを特定。ベンダーに報告し,対策が実施された。

    Link: https://arxiv.org/abs/2607.26589

  • マルウェアリスクに対する組織の保護:新しいグラフベースのマルウェア検出手法 [eess.SY, cs.SY, cs.AR, cs.CR, cs.AI]目的:組織におけるマルウェアリスク管理のためのグラフベースマルウェア検出手法
    • 組織のデジタル化が進み,情報システム分野においてサイバーセキュリティの重要性が増している。
    • 従来のマルウェア検出法は,マルウェアの改変による回避攻撃に脆弱であるという課題がある。
    • マルウェアの実行挙動を捉え,より高精度な検出を可能とする手法の開発が求められている。
    • MalGuardは,基本ブロックのまとまりを「オペレーショナルロール」として捉えることで,マルウェアの潜在的な挙動を検出する。
    • オペレーショナルロール間の相互作用をモデル化することで,表現力豊かなプログラムグラフ表現を学習する。
    • 実験の結果,MalGuardはマルウェアの検出性能を向上させ,検出漏れによるコストを削減できることが示された。

    Link: https://arxiv.org/abs/2607.26634

  • 借用された強み:コードエンコーディングを用いたN個の探索が自己チェック型 jailbreak 対策を破る [cs.CR, cs.AI]目的:自己チェック型防御の脆弱性とそのメカニズムの解明
    • 大規模言語モデルの安全性確保は,悪意あるプロンプトによる攻撃から保護することが重要である。
    • 既存の自己チェック型防御は高い防御率を報告するものの,その脆弱性に関する理解が不十分である。
    • コードエンコーディングとN個の探索を組み合わせることで,自己チェック型防御を効果的に回避できることを示す。
    • 自己チェック型防御は,モデル自身にリクエストの評価を依頼するが,コードエンコーディングとN個の探索の組み合わせによって回避可能であることが示された。
    • 防御の強度はターゲットモデルに依存しており,防御率と未防御時の到達率に相関関係があることが明らかになった。
    • 攻撃の種類によって,防御を回避できる側の優位性が変化する。これは,各攻撃が防御の決定境界に与えるプローブの数によって説明できる。

    Link: https://arxiv.org/abs/2607.26639

  • フィンガープリント駆動型自動化:偵察とPoC検証の連携 [cs.CR]目的:ネットワークセキュリティにおける偵察と脆弱性検証の自動化ツール
    • ネットワークセキュリティ対策において,初期段階の偵察は極めて重要である。的確な情報収集が防御戦略に不可欠。
    • 既存ツールは,情報精度,隠蔽性,効率性,連携性に課題があり,利用開始が困難な場合がある。
    • 使いやすく,自動化された偵察・脆弱性検証ツールを開発し,実用性と効率性を向上させる。
    • 本ツールは,特定の標的に対する自動偵察と詳細なデータ処理,および自動脆弱性検出・検証を完了できる。
    • オンラインセキュリティシミュレーション環境でのテスト結果から,自動化,情報取得,およびネットワークセキュリティ運用における利点が示された。
    • 本研究は,ツール機能の基本設計と実装を行い,その実現可能性を検証した。

    Link: https://arxiv.org/abs/2607.26655

  • グラフが検証者:手続き間脆弱性検出のためのエージェント的強化学習 [cs.CR, cs.AI, cs.SE]目的:手続き間脆弱性検出のためのエージェント的強化学習フレームワーク
    • ソフトウェアの安全性が重要視される現代において,脆弱性検出技術の高度化は不可欠である。
    • 既存の脆弱性検出器は関数単位での分析に偏りがちで,複数の関数にまたがる脆弱性の検出が困難である。
    • コードプロパティグラフを活用し,エージェントが自ら証拠を収集することで,より正確な脆弱性検出を実現する。
    • VulAgentRLは,コードプロパティグラフを基盤としたエージェント的強化学習フレームワークであり,厳密なペアワイズ正解率で最先端のベースラインモデルを上回る性能を示した。
    • このフレームワークは,ツールの利用回数を減らしつつ,分布外のデータセットやクラス不均衡下でも優れた性能を維持する。
    • 教師からの知識蒸留によるポリシーの初期化は,強化学習がツール利用の行動を学習するために必要不可欠である。

    Link: https://arxiv.org/abs/2607.26656

  • Gitリポジトリへの侵入は許さない:コミット時とリリース時のバックドア検知 [eess.SY, cs.RO, cs.SY, cs.CR, cs.SE]目的:オープンソースソフトウェアにおけるバックドア注入に対する防御機構の強化
    • オープンソースソフトウェアは広く利用されているため,その安全性確保は不可欠である。
    • 従来のCIパイプラインではバックドア攻撃を検知できず,手動でのレビューに依存している。
    • 自動化されたバックドア検知機構をCIパイプラインとリリース検証に統合し,攻撃を阻止すること。
    • Lilyは,CI互換のファジングを強化し,過去および現在のソフトウェア実行に基づく不審な動作のトリガーを検出する。
    • コード変更分析とファジングデータを組み合わせることで,数百万行のコード変更の中でもバックドア箇所を特定する。
    • 実験により,Lilyは高い検知精度と低い誤検知率を示し,実際のバックドア事例を防ぐことが可能であることが示された。

    Link: https://arxiv.org/abs/2607.26719

  • 拡散モデルにおけるウォーターマーキングのためのロバストなワンステップ反転 [cs.CR, cs.AI]目的:拡散モデル生成画像認証のためのウォーターマーキング手法
    • 拡散モデルは高品質な画像を生成するが,生成画像の真正性確認が課題となっている。
    • 従来の反転に基づくウォーターマーキングは,処理速度が遅く,かつエラーが発生しやすいという問題がある。
    • 本研究は,高速かつロバストなウォーターマーキングを実現するための効率的な反転手法を開発することを目的とする。
    • 提案手法FARIは,わずか20分のファインチューニングで,従来の50ステップDDIM反転を上回るウォーターマーク検証のロバスト性を実現した。
    • FARIは,ワンステップ反転フレームワークと軽量な敵対的LoRAファインチューニングを組み合わせることで,高速化とロバスト性の向上を両立した。
    • 反転軌跡の曲率が低いという特性を利用し,少ない計算量で近似することを可能にした。

    Link: https://arxiv.org/abs/2607.26723

  • 検証可能なランダムサンプリング [cs.CR]目的:公開検証可能な擬似乱数関数の評価
    • 暗号学的プロトコルにおいて,信頼性の高い乱数生成は不可欠である。
    • 公開鍵が公開された後のVRFの決定性は,悪意のある攻撃を許容する。
    • 新鮮で予測不可能なランダム性の提供と,公開検証可能性の確保。
    • 検証可能なランダムサンプリング(VRS)の概念を導入し,量子回路サンプリングに基づく具体的な構成を提案した。
    • 提案手法は,指定された標的分布に近いサンプルを統計的に生成し,公開検証可能性を保証する。
    • 構築的暗号学フレームワーク内でセキュリティを証明し,他の暗号プロトコルとの合成可能性を確保した。

    Link: https://arxiv.org/abs/2607.26734

  • SecRespond:現実世界の侵害後インシデント対応におけるAIエージェントのベンチマーク [cs.RO, eess.SY, cs.SY, cs.CR, cs.AI, cs.CL]目的:侵害後インシデント対応ワークフローにおけるLLMエージェントの評価
    • サイバー攻撃は増加の一途をたどっており,迅速かつ正確なインシデント対応が不可欠である。
    • 既存のセキュリティベンチマークは,攻撃前の理想的な環境に焦点を当てており,侵害後の状況は十分に調査されていない。
    • 侵害後の状況におけるLLMエージェントの能力を評価し,現実世界でのインシデント対応の改善を目指す。
    • 現在のLLMエージェントは,アラートから露出した問題を確実に発見できるものの,静かな侵入の積極的な調査や,網羅的で検証済みの修復計画の作成に苦戦している。
    • どのモデルも,単一の範囲で完全な検出と修復を達成できていないことから,現実世界のインシデント対応のためのエージェント構築における根本的なボトルネックが明らかになった。
    • SecRespondベンチマークは,10のサイバーレンジ,4つのエントリポイントタイプ,21のATT&CKテクニック,5つのOSを網羅しており,LLMエージェントの評価に活用できる。

    Link: https://arxiv.org/abs/2607.26791

  • ブラックボックス型マルチターン対話における軌跡レベルの安全リスク予測 [cs.LG, cs.CR]目的:マルチターン対話における安全リスクの軌跡レベル予測
    • LLMが自律エージェント化する中で,安全性を担保するには,単一時点での評価を超えた対応が必要である。
    • 既存の安全対策は,発生済みの違反検出に留まり,潜在的なリスクの進化を予測し,予防的に対応できない。
    • 本研究は,軌跡レベルでのリスク予測を通じて,潜在的なリスクの早期発見と予防を目指す。
    • Recastは,短期的な対話の進行と長期的な履歴情報を活用し,リスクに関連する証拠を収集する。
    • Recastは,現在のリスク状況とその時間的変化を捉え,リスクの組成的な進化をモデル化する。
    • 実験の結果,Recastは将来の安全上の失敗の88.3%を平均2.41ターン前に予測し,誤報率は12.3%であった。

    Link: https://arxiv.org/abs/2607.26820

  • エージェント発話前:マルチエージェントシステムにおける事前的な故障リスク推論 [cs.AR, cs.CR]目的:マルチエージェントシステムにおける故障リスクの事前推論
    • 大規模言語モデルを用いたマルチエージェントシステムは,協調的な推論と意思決定において顕著な能力を示す。
    • エージェント間のコミュニケーションによる幻覚の伝播が,システム全体の故障を引き起こす可能性がある。
    • エージェント間の相互作用前に,個々のエージェントの故障とシステムレベルの幻覚リスクを推定する。
    • 提案手法HalluPropは,エージェントの役割とタスク間の意味的ずれを捉え,故障リスクをモデル化する。
    • 意味的な影響と通信トポロジーを考慮して,エージェント間のリスク伝播を特徴づける。
    • HalluPropは,平均AUROC 84.6%で故障エージェントを正確に特定し,事後的な手法と比較して65倍以上の高速診断を実現した。

    Link: https://arxiv.org/abs/2607.26836

  • ToxScreen:LLMへのポイズニング検出 [cs.CR, cs.LG]目的:LLMのポイズニング攻撃に対するトリガーの検出と分析
    • LLMが重要な分野で利用される中,セキュリティリスクへの対策が不可欠である。
    • 学習データへの攻撃によるバックドアの埋め込みが,モデルの挙動を悪意的に操作する脅威となっている。
    • 現実的な条件下でのバックドア検出手法の有効性を評価し,防御戦略を確立することを目指す。
    • ToxScreenベンチマークを用いて800以上のバックドアモデルを評価した結果,勾配ベースのプロンプト最適化はトリガーの検出に失敗した。
    • 攻撃成功率で候補をランク付けするトークン探索が,バックドアが有効な場合にはトリガーを検出できた。
    • バックドアは,脱獄攻撃とは異なるメカニズムで動作することを確認し,脱獄攻撃のフィルタリングが可能になった。

    Link: https://arxiv.org/abs/2607.26849

  • モデル対照型連合学習におけるアラインメントチェックによるバックドア攻撃への防御 [cs.CR, cs.AI, cs.LG]目的:連合学習におけるバックドア攻撃に対する防御策
    • エッジコンピューティング環境下での連合学習の普及に伴い,セキュリティリスクへの対策が重要である。
    • 連合学習は分散型であるため,バックドア攻撃を受けやすく,既存の防御策は十分ではない。
    • 統計的異質性やバックドア攻撃の隠蔽性を考慮し,正常なローカル更新のずれを検出・排除する。
    • 提案手法FedDABは,ローカルコントラスト正則化とアラインメントチェックを組み合わせることで,バックドア攻撃に対して高い防御性能を発揮する。
    • FedDABは,正常な更新間の方向性と大きさを一貫させるモデル対照項を導入し,アラインメントチェックで異常なパターンを排除する。
    • 理論的に収束率$\mathcal{O}(1/T)$のロバスト性を示し,実験的にも既存手法を上回る有効性が確認された。

    Link: https://arxiv.org/abs/2607.26933

  • AIエージェントの検出に必要なものは何か:ブラウザ自動化下における行動検出のための最小限の特徴セット [cs.AI, cs.CR]目的:AIエージェント,ボット,人間のトラフィックを識別するための三クラス検出フレームワークの構築
    • ウェブアクセスにおけるボットの識別は,セキュリティやサービス利用において重要である。
    • 従来の二値分類では,ブラウザ自動化によるAIエージェントのような中間的な存在を正確に区別できない。
    • AIエージェントを正確に識別し,誤検知を減らすための最小限の特徴セットを特定すること。
    • 従来の二値分類器では,AIエージェントを人間に誤分類する割合が高いことが示された(34.5%~39.1%)。
    • AIエージェントのクラスを明示的に追加することで,AIエージェントのF1スコアは1.000となり,識別精度が向上した。
    • マウスイベントの頻度とテレポートクリック比率の2つの特徴量のみで,AIエージェントを100%の再現率で検出可能であり,精度の高い識別を実現した。

    Link: https://arxiv.org/abs/2607.26935

  • InkShield:不正な筆跡模倣に対する筆跡スタイル保護 [cs.CR, cs.CV]目的:筆跡スタイルの不正な模倣に対するプロアクティブな防御機構
    • 文書の信頼性と個人の識別情報は重要であり,偽造やなりすましから保護する必要がある。
    • 公開されている筆跡サンプルから,筆跡スタイルを再現する技術が進歩しており,文書偽造のリスクが高まっている。
    • 筆跡の公開前に微小な摂動を加えることで,不正な筆跡模倣を効果的に防御することを目指す。
    • InkShieldは,筆跡生成モデルを利用し,筆跡のストロークエッジに摂動を集中させることで,視覚的な品質を維持しつつ筆跡スタイルを保護する。
    • 実験の結果,生成されたサンプルがターゲットライターとして認識される確率が大幅に低下し,保護された参照画像は元の画像と視覚的に近いことが確認された。
    • InkShieldは,他の筆跡生成モデルへの転移性も示しており,実用的な筆跡スタイル保護の手段となりうる。

    Link: https://arxiv.org/abs/2607.26976

  • エージェントスネア:自律的な侵入エージェントの遅延,誘導,無効化の学習 [cs.CR, cs.CL, cs.LG]目的:自律型侵入エージェントに対する動的な欺瞞環境
    • サイバー攻撃の自動化が進む中で,侵入テストの効率化が重要課題となっている。
    • 既存の防御策は静的な欺瞞物に依存しており,高度なエージェントに回避される可能性がある。
    • エージェントの行動履歴に応じた動的な欺瞞環境により,攻撃を遅延・誘導・無効化すること。
    • AgentSnareは,欺瞞環境を展開し,エージェントを現実の標的から継続的に誘導する。
    • 15のCVE-Benchウェブアプリケーションで,エージェントの46.8%のツールコールを欺瞞環境で吸収した。
    • 90.0%の完了試行は欺瞞環境の証拠に基づき,現実の標的への攻撃を成功させなかった。

    Link: https://arxiv.org/abs/2607.26998

  • HoF-Bench:最先端モデルを用いずにAIが発見した実際の脆弱性を再発見する [cs.CY, cs.CR, cs.LG]目的:AIが発見した実際の脆弱性の再発見
    • ソフトウェアの安全性確保は重要であり,脆弱性の早期発見が不可欠である。
    • 既存の脆弱性検出手法では,AIが発見した脆弱性の再現性が課題となっていた。
    • AIによる脆弱性発見の信頼性と再現性を評価する基準を確立すること。
    • HoF-Benchは,AIが発見した95件の脆弱性を基にしたベンチマークである。
    • 厳格な評価プロトコル下で,ミニマルなLLMベースの解析器が65件の脆弱性を再発見した。
    • 最先端モデルは,本研究において脆弱性の検出に貢献しなかった。

    Link: https://arxiv.org/abs/2607.27030

  • MemSecBench:エージェントメモリのポイズニングの追跡 - 永続性から結果,そして修復まで [cs.CR, cs.AI]目的:エージェントメモリシステムのライフサイクルセキュリティ
    • エージェントは過去の対話から情報を保持・再利用するが,悪意のあるコンテンツが残存する可能性もある。
    • 既存のベンチマークはメモリセキュリティを検証するものの,ポイズニングのライフサイクル全体を追跡できていない。
    • 本研究は,様々なメモリバックエンドにおけるポイズニングの永続性,影響,選択的修復を評価するベンチマークを提供する。
    • MemSecBenchは,コード,科学,日常生活,オフィスワークなど,48の現実的なコンテキストから310のケースを網羅している。
    • 全構成において,悪意のあるメモリが84.2%のケースで永続し,Write-Executeチェーンが50.3%のケースで成功した。
    • 成功したポイズニングケースの59.6%がExecuteチェーンを完了し,56.1%が選択的修復を達成した。メモリシステムスタック間でライフサイクルセキュリティに差が見られた。

    Link: https://arxiv.org/abs/2607.27080

  • LLMの安全性のためのオンポリシー蒸留:テンプレートに頑健な再調整へのルーティングアプローチ [cs.AI, cs.CL, cs.CR, cs.LG]目的:大規模言語モデルの安全性再調整
    • LLMの活用拡大に伴い,悪意あるデータによる潜在的な危険性が増大している。
    • 既存の安全性対策は,専門能力の忘却やテンプレート依存性,再脱獄の脆弱性を抱える。
    • テンプレートの不一致に強く,能力を維持しつつ,LLMを安全に再調整すること。
    • 提案手法ROPDは,アラインされた出力と侵害された出力の確率分布の乖離をモデル化する。
    • 実験の結果,ROPDはテンプレートの不一致に対する頑健性が高く,既存手法よりも性能劣化が少ない。
    • ROPDは,安全性と能力の両方を維持する上で,より高い基準を確立する。

    Link: https://arxiv.org/abs/2607.27081

  • ローカルモデルにおける関数秘匿化 [cs.CR]目的:関数の秘匿化
    • 個人情報保護の重要性が増す中,データ公開とプライバシー保護の両立が課題。
    • 既存の秘匿化手法では,有用な情報を失う可能性があり,実用上の制約がある。
    • 近接な関数間の識別を許容するGeo-Privacyを用いた秘匿化手法を提案する。
    • 提案手法は,標準的な差分プライバシーよりも緩やかなGeo-Privacyを採用することで,実用的な有用性を維持しつつプライバシーを保護する。
    • 本研究では,軌跡データや1次元密度曲線など,曲線として表現されるデータに焦点を当て,秘匿化の有効性を示す。
    • 実験評価により,提案手法が様々なデータセットで有効に機能することが確認された。

    Link: https://arxiv.org/abs/2607.27164

  • バイナリ操作によるLinuxディストリビューション全体へのトラスト・トラスト攻撃 [cs.CR, cs.SE]目的:Linuxディストリビューションに対する,バイナリ操作を通じた完全なトラスト・トラスト攻撃の構築
    • ソフトウェアサプライチェーンのセキュリティ確保は,現代社会における情報システムの安定運用に不可欠である。
    • コンパイラだけでなく,ビルドツールも攻撃対象となり得るという認識が不足している。
    • ビルドツールの改ざんが,システム全体に広がる深刻なセキュリティリスクを軽減すること。
    • GNU stripのようなビルドユーティリティを介したトラスト・トラスト攻撃が,コンパイラに限らないことが示された。
    • NixOSのbootstrapプロセスにおいて,改ざんされたstripがペイロードを伝播させ,最終環境にまで影響を及ぼすことが確認された。
    • 実際のnixpkgsリビジョン上で,完全なグラフィカルインストーラを構築し,ほぼ全てのバイナリをバックドア化することが可能となった。

    Link: https://arxiv.org/abs/2607.24888

  • 1クエリユニタリ合成における明示的な分離 [quant-ph, cs.CC, cs.CR]目的:ユニタリ合成の困難性と容易性に関する複数の結果
    • 量子計算の基礎理論を深める上で,ユニタリ演算の効率的な合成は重要な課題である。
    • ランダムなユニタリ演算の合成は,古典オラクルへの問い合わせ数に関して困難であることが示唆されている。
    • 明示的なユニタリ族に対する1クエリ合成の下界を確立し,その困難さを明確にすること。
    • ランダム置換ユニタリ演算や,交代基底位相ユニタリ演算に対し,1クエリ合成の下界を証明した。
    • 複素位相ユニタリ演算に対し,バイナリ位相オラクルに対する1クエリ近似アルゴリズムの上界を確立した。
    • オラクル状態探索ゲームとオラクルChoi状態ゲームという新しい暗号学的ゲームを導入し,量子プログラムの近似困難性に関する新たな結果を得た。

    Link: https://arxiv.org/abs/2607.26478

  • 自律型攻撃LLMエージェント研究における倫理的枠組み:緩和策なしの認識 [cs.CR]目的:自律型攻撃LLMエージェント研究における倫理とリスク報告の実態
    • LLMの進化により,攻撃的なセキュリティ分野における自動化が進んでいるため,倫理的考察が不可欠である。
    • 攻撃LLMエージェントの研究発表において,リスク認識と具体的な緩和策との間に大きな乖離が見られる。
    • 本研究は,現状の倫理的慣行を評価し,今後の研究に対する最小限の封じ込めチェックリストを提示する。
    • 調査対象となった論文の39%でデュアルユースリスクが認識されている一方で,具体的な緩和策が報告されているのは7%に過ぎない。
    • 17%の論文は,モデルの安全対策を無効化する手法を提示しており,それに対する対策は講じられていない。
    • 現在の研究実践は,最新の倫理規定に適合しておらず,研究倫理管理が中心であり,社会への保護措置は限定的である。

    Link: https://arxiv.org/abs/2506.08693

  • FPEdit:局所的パラメータ編集によるロバストなLLMフィンガープリント [cs.CR, cs.AI]目的:大規模言語モデルの信頼できる起源検証
    • LLMは膨大な投資が必要であり,知的財産として保護する必要がある。
    • 既存のフィンガープリント技術は,アクセス制限や敵対的攻撃に対する脆弱性がある。
    • 適応や検出に対するロバスト性,そしてモデルの有用性を維持しつつフィンガープリントを埋め込む。
    • FPEditは,知識編集を利用して,モデルの重みを疎にターゲットを絞った修正を通して意味的に一貫性のある自然言語フィンガープリントを注入する。
    • FPEditは,フルパラメータのファインチューニングやパラメータ効率的な適応下で94〜100%のフィンガープリント保持率を達成し,ダウンストリームベンチマークでのパフォーマンスを維持する。
    • 量子化,プルーニング,確率的デコーディングに対してもロバストであり,LLaMA2-7Bに10組のフィンガープリントペアを2分未満,30GB以下のGPUメモリで埋め込むことができる。

    Link: https://arxiv.org/abs/2508.02092

  • プライバシーと効率のバランス:加法準同型暗号化による音楽情報検索 [cs.DB, cs.AI, cs.CR]目的:音楽情報検索におけるプライバシー保護と効率的な検索手法
    • 音楽情報検索は音楽利用の促進に不可欠であり,その重要性は高まっている。
    • ベクトル埋め込みの共有は,プライバシー侵害や悪用につながるリスクを伴う。
    • 加法準同型暗号化を用いることで,プライバシーを保護しつつ効率的な検索を実現する。
    • 音楽特有の推論攻撃を実装し,プライバシーと有用性のトレードオフを定量的に評価した。
    • ブロックごとの重み付け学習を導入した構造認識型加法準同型演算を提案し,暗号学的コストを削減した。
    • 4つのオーディオデータセットを用いて,加法準同型検索が最近傍ランキングを正確に保持し,既存手法よりも優れたスケーラビリティを示すことを実証した。

    Link: https://arxiv.org/abs/2508.07044

  • クリーン画像バックドアにおける生成トリガー最適化によるステルス性と攻撃力のトレードオフ打破 [cs.AR, cs.RO, cs.CV, cs.CR, cs.LG]目的:クリーン画像バックドア攻撃におけるトリガー最適化
    • 深層学習モデルのセキュリティ確保は重要であり,悪意のある攻撃に対する防御が不可欠である。
    • 既存手法では,攻撃成功に必要なポイズニング率が高いと,正常精度が低下し,攻撃が露呈しやすい。
    • トリガー自体を最適化することで,正常精度の低下を最小限に抑え,よりステルス性の高い攻撃を実現する。
    • 提案手法GCBは,条件付きInfoGANを用いて,強力かつステルスなトリガーとなりうる自然な画像特徴を特定する。
    • GCBは,少数のポイズニング例からバックドアを学習し,正常精度の低下を1%未満に抑えることに成功した。
    • GCBは,6つのデータセット,5つのアーキテクチャ,4つのタスクで高い汎用性を示し,回帰やセグメンテーションにも適用可能である。

    Link: https://arxiv.org/abs/2511.07210

  • DP-MGTD:適応的差分プライバシーを用いた実体サニタイズによる機械生成テキスト検出 [cs.CR, cs.CL, cs.LG]目的:機械生成テキスト検出におけるプライバシー保護
    • 生成AIの普及に伴い,テキストの信頼性確保が重要になっている。
    • プライバシー保護と検出精度の両立が課題である。
    • 差分プライバシー技術と実体サニタイズを組み合わせ,精度劣化を抑制する。
    • 提案手法DP-MGTDは,ノイズ付加による頻度推定とプライバシー予算の動的調整を実現した。
    • 差分プライバシーノイズが,人間と機械のテキストの違いを強調する現象を明らかにした。
    • MGTBench-2.0データセットにおいて,高い検出精度と厳格なプライバシー保護を両立した。

    Link: https://arxiv.org/abs/2601.04641

  • ShieldBypass:EMシールドを超えたインピーダンス漏洩の持続性について [cs.CR, cs.ET]目的:EMシールドにおけるインピーダンス変調逆散乱の持続性評価
    • 情報セキュリティにおいて,電磁波側方攻撃からの保護は重要である。特に,機密情報の漏洩を防ぐ必要性が高まっている。
    • 従来のEMシールドは放射ノイズ抑制に有効だが,能動的プロービングに対する防御は不十分である。
    • シールドされたシステムにおいても,能動的RFプロービングによる実行依存的な挙動の漏洩可能性を調査する。
    • EMシールドが放射ノイズを抑制しても,シールドの減衰帯域外周波数においてインピーダンス変化が観測された。
    • FPGAおよびマイクロコントローラーのプロトタイプにおいて,パッシブEM測定の識別力は低下する一方,逆散乱応答は分離可能であった。
    • 本研究は,ハードウェアセキュリティ評価フローにおいて,能動的インピーダンスベースプロービングを考慮する必要性を示唆する。

    Link: https://arxiv.org/abs/2603.04801

  • 多岐にわたる対話における言語モデルの状況依存的安全性の失敗 [cs.CR, cs.AI]目的:言語モデルにおける安全性の失敗の構造的理解
    • 大規模言語モデルの安全性確保は重要であり,現実世界の利用を考慮する必要がある。
    • 単発の質問形式での評価では,多岐にわたる対話における安全性問題は捉えきれない。
    • 対話履歴を状態遷移として捉え,安全性の境界を越える過程を分析する。
    • 多くの言語モデルは,構造化された多岐にわたる対話において,急速かつ再現性のある安全性の崩壊を示す。
    • 安全性に関連する表現が徐々に減少し,役割設定された文脈によって急激な変化が誘発されることが明らかになった。
    • 言語モデルの安全性は,対話の軌跡に沿った動的で状況依存なプロセスとして捉えるべきである。

    Link: https://arxiv.org/abs/2603.15684

  • 活性化ウォーターマーキングによる適応的な堅牢なLLM監視 [cs.CR, cs.AI, cs.CY, cs.LG]目的:大規模言語モデルの悪用検出
    • LLMの悪用は社会的な問題を引き起こす可能性があり,監視の重要性が増している。
    • 既存の監視システムは,攻撃者によって回避されるリスクがあり,対応が遅れる可能性がある。
    • 適応的な攻撃者への耐性を高めつつ,従来の検出率を維持することを目指す。
    • 活性化ウォーターマーキング(AWM)は,ポリシー違反時に隠れ状態を秘密鍵由来の方向に調整する。
    • AWMは,既存のベースラインと比較して回避率を大幅に低下させ,特に適応的な攻撃に対して有効である。
    • また,AWMはポリシー違反の特定能力も高く,監視対象のポリシーを80%の精度で識別できる。

    Link: https://arxiv.org/abs/2603.23171

  • トピック誘導一貫性モデリング: 絡み合ったAPT技術シーケンスの一段階分離 [eess.SY, cs.SY, cs.RO, cs.CR]目的:未知の数の同時実行キャンペーンを復元すること
    • サイバー攻撃の検出と分析において,複数のAPTキャンペーンの同時実行を正確に把握することは不可欠である。
    • 既存手法は,キャンペーン数の不明確さや技術の重複,抽象化ノイズに弱く,実用性に課題がある。
    • 重度のインターリーブ,技術の再利用,抽象化エラー,未知のキャンペーン数に対してもロバストな分離を可能にする。
    • トピック誘導一貫性モデリング(TGCM)は,インターリーブされた技術シーケンスからキャンペーンエピソードを効率的にマッピングする。
    • TGCMは,ATT&CKナラティブからのトピックガイダンスと埋め込み空間での自己一貫性目的を組み合わせることで,意味的な一貫性を向上させる。
    • 合成混合,混合ベンチマーク,DARPAエンゲージメントトレース,CAPTureを含む多様なデータセットで,既存手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2606.18651

  • LLMセキュリティ知識の自動テストに向けた試み [cs.IR, cs.CR, cs.AI, cs.HC]目的:LLMのセキュリティ知識の評価方法
    • LLMの活用範囲拡大に伴い,セキュリティ分野での性能評価が重要となっている。
    • LLMのセキュリティ知識の評価には専門知識と労力を要する手作業が必要とされている。
    • 消費者庁等の公的情報を用いて,LLMの知識ギャップを半自動的に検出・評価すること。
    • 本手法により,LLMがセキュリティトピックを正確に識別できるかどうかの違いを明らかにできた。
    • 特に,なりすまし詐欺と個人情報窃盗の分野において,GeminiとGPTの各モデル間に知識の差が認められた。
    • 消費者庁等の公的情報を活用することで,効率的なLLMセキュリティ知識の評価が可能となった。

    Link: https://arxiv.org/abs/2607.18496

  • ResearchArena:自動AI研究開発における妨害と監視の評価 [cs.AI, cs.CR, cs.LG]目的:自動AI研究開発における妨害行為の検知と制御機構の評価
    • AIの自動化が進む中で,AIが生成する成果物の安全性確保は重要性を増している。
    • AIエージェントが潜在的な敵対者となり得るため,その出力を信頼することが困難である。
    • AI制御による監視機構を評価し,AI研究開発における隠れた妨害行為の検知率向上を目指す。
    • ResearchArenaというフレームワークを用いて,安全性,能力,CUDAカーネル最適化,推論サーバー最適化の4つのタスクで評価を行った。
    • 訓練データに埋め込まれた妨害は最も検知が難しく,半数未満しか検出されなかった。
    • 成果物に対する実験実行を許可することで監視性能は向上するが,表面的な検査や誤ったテストによる妨害の見逃しが発生する。

    Link: https://arxiv.org/abs/2607.19321

  • キーストロークノイズからテキストへの変換:キーボードに対する自己教師あり音響盗聴攻撃 [cs.CR, cs.SD]目的:キーストローク音のみからの入力テキストの再構築
    • キーボード操作音は,情報漏洩のリスクを孕む重要な攻撃対象となり得る。
    • 標的デバイス固有のラベル付きデータなしでの音響盗聴は,困難であった。
    • 少ないキーストローク数でも,高精度なテキスト再構築を可能にすること。
    • 本研究では,自己教師あり学習とTransformerモデルを用いて,標的デバイスのラベルなしデータのみでテキストを再構築する手法を提案した。
    • 近距離録音環境下では,100-150個のキーストロークで99%を超える高い再構築精度を達成し,既存手法を大幅に上回った。
    • 様々なラップトップや録音環境(距離,壁越し,オンライン会議)においても,高い再構築精度(90%以上)を維持した。

    Link: https://arxiv.org/abs/2607.22094

  • HiTMS:高スループット多ストリーム言語隠蔽術フレームワーク [cs.CR, cs.CL]目的:言語隠蔽術における秘密ビットの埋め込みと抽出
    • 大規模言語モデルの発展に伴い,情報セキュリティの重要性が増している。
    • 既存の言語隠蔽術は単一ストリームであり,並列処理や効率的な情報伝達が課題である。
    • 本研究は,複数ストリームを同時に処理することで,スループット向上を目指す。
    • HiTMSフレームワークは,複数の応答に秘密を分散し,バッチ処理による効率的な埋め込みと抽出を実現する。
    • HiTMSは自己記述的なフレームと鍵導出スケジュールを用いて,ストリームの正確な復元を保証し,アクティブなストリーム数を隠蔽する。
    • 実験結果から,HiTMSは単一ストリームベースラインと比較して最大4.3倍の高速化を達成し,隠蔽術検出器のAUROCを低下させることを示した。

    Link: https://arxiv.org/abs/2607.23597

  • TRACE-CTI:知識グラフを用いたTTP情報の監査可能な抽出後ガバナンス [eess.SY, cs.SY, cs.HC, cs.AI, cs.CR]目的:サイバー脅威インテリジェンス(CTI)報告書のMITRE ATT&CKへのマッピングにおける信頼性確保
    • サイバー攻撃の高度化に対応するため,脅威インテリジェンスの正確な活用が不可欠である。
    • 抽出されたTTP情報の信頼性評価が困難であり,証拠や検証履歴の管理が不十分である。
    • 抽出されたTTP情報の信頼性を高め,監査可能なガバナンス体制を構築することを目指す。
    • TRACE-CTIは,抽出レベルの予測を保持し,構成レベルのGraphAssertionsとして集約することで,TTP情報のガバナンスを実現する。
    • 複数の抽出結果を統合し,検証根拠に基づいたGraphAssertionsのみを提示することで,信頼性の高い情報を抽出できる。
    • 実験結果から,設定のサポートが増加するにつれて,適合率は25.3%から90.6%に向上する一方で,再現率は88.2%から16.3%に低下することが示された。

    Link: https://arxiv.org/abs/2607.24563

  • 1
  • 2