arXiv雑要約
プログラム - 2026/08/05 公開
Globエコシステムの経験的分析 [cs.SE, cs.PL]目的:Globエコシステムにおける課題の定量化と,堅牢な解決策への道筋の提示
- 現代のソフトウェア開発において,文字列マッチングのためのドメイン特化言語であるGlobパターンは不可欠である。
- 標準化の欠如により,挙動の不整合,セキュリティ脆弱性,ユーザビリティの問題が蔓延している。
- Globの実装間のセマンティックな曖昧さを解消し,開発者の要件を満たすことを目指す。
- オープンソースプロジェクト,GitHub issue,CVEレポート,StackOverflow投稿の分析により,Globの機能サポートと実用的な使用状況をマッピングした。
- 様々なGlob実装と開発者の採用の間には大きな隔たりがあり,移植性や信頼性を阻害する不整合が存在することが明らかになった。
- セキュリティ脆弱性が開発者議論の大部分を占めており,セキュリティが主要な懸念事項であることが示された。GlobSpecという標準化された仕様を提案した。
カーネルブレイン:エージェントによるGPUカーネル最適化のための粗調整から微調整,予算を意識した探索 [cs.DC, cs.AI, cs.LG, cs.SE]目的:GPUカーネル最適化の自動化
- GPUは並列処理に不可欠であり,その性能を最大限に引き出すことが重要である。
- GPUカーネルの最適化は複雑であり,手動では限界がある。自動化も課題が多い。
- カーネルの品質と探索効率を向上させる自動最適化手法を開発すること。
- LLMを活用した変異,適応的なリソース配分,ポリシーゲート評価,プロファイラに基づく診断を組み合わせることで,実用的な最適化エージェントを構築した。
- Tritonカーネル生成タスクにおいて,PyTorchと比較して0.88倍〜6.72倍の高速化を達成し,最先端のエージェントよりも最大1.4倍の高速化を実現した。
- 最適化時間は最大48%短縮され,効率的なカーネル最適化が可能となった。
構造的に疎なグラフにおける最大クリーク列挙のためのほぼ最適アルゴリズム [cs.DS, math.CO]目的:構造的に疎なグラフにおける最大クリークの正確な列挙
- グラフ理論は,ネットワーク分析,データベース,最適化問題など,幅広い分野に応用されている。
- 疎なグラフにおける最大クリークの列挙は,計算量が指数関数的に増加するため,困難な問題である。
- 排除されたクリークマイナーや排除されたクリークイマージョンによって定義されるグラフクラスにおいて,より効率的な列挙アルゴリズムを開発する。
- K_t-マイナーフリーグラフに対するアルゴリズムの時間計算量を,既存の結果よりも大幅に改善した。
- K_t-イマージョンフリーグラフに対するアルゴリズムを,イマージョン数によってパラメータ化して初めて正確な列挙を実現した。
- アルゴリズムの指数関数の底が漸近的に最適であることを,構成を用いて証明した。
スティグマーギックシステムにおける公理的共有媒体協調 [cs.DC, cs.LO, cs.MA, math.OC]目的:スティグマーギックシステムの共有媒体協調に関する抽象的な枠組み
- 分散システムの実現には,エージェント間の協調が不可欠である。
- 既存の研究では,媒体依存的な形式化が多く,汎用性に欠ける。
- 媒体に依存しない比較層を確立し,協調の理論的基盤を強化する。
- 抽象的な応答署名を比較対象とし,媒体非依存な比較層を定式化した。
- メタデータ精緻化において,応答適合性の条件と修正に関する定理を証明した。
- 結果をタプル空間や仮想スティグマーギックデータ空間に適用し,枠組みの有効性を示した。
PULSE:時空間知識グラフエンジニアリングのための実行可能契約言語 [cs.AI, cs.DB, cs.PL]目的:時空間知識グラフエンジニアリングにおける実行可能契約の定義
- 知識グラフは,複雑な情報を構造化し,推論を可能にする重要な技術である。
- 従来の知識グラフエンジニアリングでは,状態管理や整合性の確保が課題であった。
- PULSEは,契約のローカライズと安全性の保証を通じて,この課題を解決することを目指す。
- PULSEは,証拠の上書き防止,分岐分離,タイムスタンプの正確性,状態変化の制御,イベント順序の保証を実現する。
- 形式検証により,PULSEの安全性に関する複数の性質が証明され,実装の正当性が検証された。
- 実世界のデータセットを用いた実験により,PULSEが既存のシステムと同等の性能を発揮し,高い信頼性を示すことが確認された。
自己進化型エージェントのスキル再考:複数ラウンドにおけるフィードバックの動態 [cs.SE, cs.AI]目的:自己進化型スキルシステムの有効性に関する理解
- エージェントの性能向上には,モデル自体を変更せずにスキルを改善する手法が重要である。
- フィードバックがスキルの改善にどのように影響するか,そのメカニズムは未だ不明確である。
- 成功と失敗のフィードバックがスキルの進化に与える影響を明らかにすること。
- 自己進化は稀であり,候補のわずか14%が検証結果の最良記録を更新した。
- 検証に基づく選択では,14設定中11設定で進化型スキルが選択され,その多くがテスト性能を向上させた。
- 失敗のフィードバックを含む条件でより良い結果が得られる傾向があり,設定によって成功のみのフィードバックとの優劣が変動した。
AI集約型サイバーフィジカルシステムにおける隠れた技術的負債の研究,特定,および修正 [cs.SE, cs.AI]目的:AI集約型サイバーフィジカルシステムにおける技術的負債の特性評価,特定手法,および軽減策
- AI技術の進化に伴い,CPSへの適用が拡大しており,システムの信頼性確保が重要である。
- 従来のシステムとは異なり,AI要素を含むCPS特有の技術的負債は,特定と解消が困難である。
- AI-CPSにおける技術的負債の特性を理解し,自動化された管理ツールを開発し,解決を目指す。
- AIエコシステムやリポジトリの分析,開発者へのインタビューを通じて,AI-CPSにおける技術的負債の特徴を特定した。
- 特定された技術的負債を軽減するためのアプローチを定義し,その有効性を検証する計画である。
- AIエージェントを活用した,AI-CPSの技術的負債を監視・管理・解消を支援する自動化ツールの開発を目指す。
命令の積み重ね崩壊:ベンチマークとプロンプトコンパイルの能力依存性価値 [cs.SE, cs.AI]目的:命令の積み重ねによる指示遂行能力の低下
- 大規模言語モデルの性能は,複雑な指示への対応能力に依存する。
- 複数の制約が加わることで,指示遂行能力がどのように低下するかが不明である。
- 指示の制約が増える際の具体的な問題点と,その解決策を明らかにすること。
- 指示の数が増加するにつれて,指示遂行率は非線形に低下し,20%まで低下する場合があった。
- 指示コンパイラは,指示を書き換えることで,弱いモデルの指示遂行率を最大で11ポイント向上させた。
- この改善は,追加のトークン数や再配置ではなく,書き換え自体によるものであることが確認された。
IR2Solve:費用対効果の高い最適化自動定式化のための構造化中間表現 [cs.SE, cs.AI]目的:最適化問題の自動定式化
- 最適化は,科学技術,経済,工学など,幅広い分野で重要な役割を果たす。
- 大規模言語モデルによる最適化問題の定式化は,エラーが発生しやすく,コストがかかる。
- 構造化された中間表現を用いることで,正確性とコスト効率を両立した自動定式化を実現する。
- IR2Solveは,6つの最適化ベンチマークにおいて高い目的関数適合率を示した。
- 構造化された中間表現,スカラー制約指示,決定論的検証の段階的な改善が確認された。
- 他のシステムと比較して,IR2Solveは必要なLLMの呼び出し回数とトークン量を大幅に削減した。
CUADebug:コンピュータ利用エージェントの故障診断と修復 [cs.SE, cs.AI]目的:コンピュータ利用エージェントの故障診断と修復に関するフレームワーク
- コンピュータ利用エージェントは,自動化の鍵であり,その信頼性向上が重要である。
- 視覚的認識,空間的配置,低レベルなインタラクションなど,多岐にわたる要素が絡み合い,故障原因の特定が困難である。
- 故障原因の特定と,それを踏まえた効果的な修復戦略の提供を目指す。
- CUADebugは,コンピュータ利用エージェント特有のエラー分類体系と,故障ベンチマークを提供し,デバッグ作業を支援する。
- Gemini 2.5 Proを用いた実験により,ステップとサブタイプを同時に診断する精度が向上した。
- 根本原因に基づく修復戦略は,履歴のみによる継続よりも高いタスク完了率を示し,継続的な再実行においても成功率が大幅に改善された。
マイクロサービス特定とリファクタリングのための統一的な特徴モデル [cs.SE]目的:マイクロサービス特定とリファクタリングツールを分析・設計するための特徴モデル
- モノリスからマイクロサービスへの移行は,システムの柔軟性と拡張性を高める上で重要である。
- 既存手法間の比較実験が難しく,最適な手法の特定が困難である。
- 既存手法の比較・統合を可能にし,より良いマイクロサービス設計を支援する。
- 提案された特徴モデルは,既存手法の主要なバリエーションを捉え,分析と設計の基盤を提供する。
- 分析対象のツールは,モデルのごく一部しか網羅していないが,全体としてほぼ全てのバリエーションをカバーしている。
- 既存ツールはそれぞれ異なる特性を持ち,相互に補完関係にあることが明らかになった。
検証可能なツール呼び出しが,非原子的な障害下でのLLMエージェントの信頼性を向上させる [cs.SE, cs.AI]目的:LLMエージェントの信頼性向上
- LLMエージェントは,複雑なタスク実行に不可欠であり,その信頼性が重要である。
- 従来のフレームワークはツール呼び出しの原子性を仮定しており,現実世界の非原子的な挙動に対応できない。
- 非原子的な障害による重複アクションや不必要な実行を防ぎ,信頼性を高める。
- 提案手法は,ツール呼び出しに事後条件検証,検証前の再試行ロジック,べき等キーを追加することで重複アクションを大幅に削減した。
- タスク成功率は同程度に維持された。
- ツール連携のセマンティクス強化が,LLMエージェントの信頼性向上に有効である可能性が示された。
アサーション駆動実行と検査可能な中間表現による意図レベル量子プログラミング [cs.SE, cs.PL, quant-ph]目的:量子プログラムの検証可能性向上
- 量子計算は発展途上であり,実用的な応用には信頼性の高いプログラムが必要不可欠である。
- 既存の量子プログラムは検証が難しく,移植性にも課題がある。
- 意図と実行の分離により,検証と移植性を容易にすることを目指す。
- 本研究で開発したQDSLは,アルゴリズム構造を検証可能なオブジェクトとして表現し,バックエンド固有の回路に変換する。
- アサーション駆動の実行モード推論により,ユーザーの介入なしに適切な実行モードを自動選択できる。
- フォールト注入実験で,誤り検出器はすべての評価ショット予算で注入された誤りを特定し,高い真陽性率を示した。
HyperAgent:ツール・スキーマハイパーグラフを用いたツール利用LLMエージェントの計画と行動 [cs.AI, cs.SE]目的:ツール利用におけるLLMエージェントの計画と実行のフレームワーク
- 複雑な現実世界のタスク遂行において,LLMエージェントは外部ツールへの依存度を高めている。
- 従来のツール利用エージェントは,テキスト記述からのツール組み合わせ推論に依存し,複雑なタスクで非効率や不安定さが問題となっている。
- ツール間の関係をスキーマレベルでモデル化し,動的な計画と実行を可能とするフレームワークを開発すること。
- 提案手法HyperAgentは,ツール・スキーマハイパーグラフを基盤とし,タスク関連ツールコンテキストグラフを用いてタスクDAGを構築する。
- 実行時には,状態に依存したツールサポートグラフを構築し,未解決の要件を特定,状態に基づいてツールを検索する。
- AppWorld実験により,HyperAgentが既存手法と比較して,タスク完了率向上,API呼び出し回数削減,トークン消費量削減を示すことが示された。
自動化された証明論的意味論に向けて:3次元K3とLPのための推論行動意味論 [cs.RO, cs.LO, math.LO]目的:3次元K3とLPの推論行動意味論
- 論理学における接続詞の意味を形式的に定義し,異なる論理体系間での関係性を明確化することが重要である。
- 既存の接続詞の意味論は,多次元論理への拡張が困難であり,自動化された生成が課題となっている。
- 多次元論理に対する推論行動意味論を自動生成する基盤を構築し,証明論的意味論の計算機化に貢献すること。
- K3とLPの接続詞は同じ意味を有することが示された。
- これらの意味は,古典論理LKの接続詞の意味を保守的に拡張する。
- MUltlogとの統合により,多値論理に対する推論行動意味論の自動生成を目指す。
不変辞書を超えて:フィルタ付き拡張動的モード分解によるデータ駆動型クープマンスペクトル復元 [math.NA, cs.IT, cs.NA, math.DS, math.IT]目的:非線形動的システムの解析のためのクープマン演算子のスペクトル特性を利用するデータ駆動型手法の開発
- 非線形動的システムの解析は,物理学,工学,生物学など,広範な分野において不可欠である。
- 拡張動的モード分解(EDMD)では,不適切な辞書選択により誤った固有値が生じ,解析精度が低下する。
- 提示手法は,表現されたクープマン固有ペアを正確に保持しつつ,スペクトル汚染を低減する。
- 提案手法である射影クープマン演算子近似フレームワークは,不変でなくてもよい許容可能な辞書部分空間への射影を行う。
- 座標直交射影と関数空間直交射影の2つの射影形状を分析し,EDMDや既存のサブ空間選択法との関係を明らかにした。
- 数値実験により,本手法がスペクトル汚染を低減し,特にVan der Pol振動器において良好な結果が得られることを示した。
Docker Hubの高露出イメージにおける脆弱性,秘密,および誤設定 [cs.CR, cs.AI, cs.CY, cs.OS, cs.SE]目的:Docker Hubイメージの脆弱性,秘密情報の包含,および設定ミスに関する実態把握
- コンテナ技術の普及に伴い,Docker Hubのセキュリティは重要な課題となっている
- 既存の研究では,単一の検出ツールに依存するため,結果の信頼性が低い
- Docker Hub全体のイメージを多角的に分析し,より正確なセキュリティ評価を行う
- Docker Hubの1270万以上のリポジトリを分析した結果,ほとんどのイメージに脆弱性や設定ミスが見られた
- 脆弱性スキャナ間の検出結果の差異が大きく,ツールの依存性が高いことが示された
- 秘密情報の検出精度は低く,誤検出が多いことが明らかになった
テキストからTerraformへのセキュリティ重視評価:安全なIaC生成のためのLLMとSLMのベンチマーク [cs.CR, cs.AI, cs.ET, cs.SE]目的:LLMとSLMによる安全なInfrastructure-as-Code生成の評価
- クラウド環境のセキュリティインシデントの多くは設定ミスが原因であり,安全なIaC生成は重要である。
- LLMやSLMがセキュリティ要件を満たすIaCを生成できるかどうかが未解明である。
- LLM/SLMによるIaC生成におけるセキュリティ適合性を評価し,改善策を提示すること。
- LLM生成のIaCにおいて,構文の正当性とセキュリティ適合性は必ずしも相関しないことが示された。
- WizardCoder-33Bは高い構文の妥当性を示す一方,Checkovによるセキュリティチェックに全く合格しなかった。
- Claude Opus 4は詳細なセキュリティプロンプトにより,CheckovとTrivyでそれぞれ23.1%と92.5%の合格率を達成した。
- プロンプトエンジニアリング単独では不十分であり,IaC生成には自動スキャンツールが不可欠である。
ポリシー変更が確率に影響を与える場合:LLM コードレビューのためのモジュール型意思決定 [cs.SE, cs.AI, cs.MA]目的:LLMコードレビューにおけるリスク評価と承認判断の分離
- ソフトウェア開発において,コード品質の維持は不可欠であり,効率的なコードレビューが求められる。
- LLMコードレビューにおいて,リスク評価と承認判断が一体化されており,確率の歪みが生じやすい。
- リスク評価,外部証拠,行動の分離評価による,より正確なコードレビューシステムの構築を目指す。
- LLMコードレビューインターフェースにおいて,意思決定ポリシーを変更すると,報告される失敗確率が平均13.6〜16.9パーセントポイント変化する。
- 高コストポリシー下での行動は,すべてのパッチを拒否するよりも劣る。確率の抽出自体が損失増加の一因となる。
- モジュール型パイプラインは,平均確率の精度を向上させ,平均損失を0.073/件削減し,パッチの58〜68%を受け入れる。
AIサンドボックス:技術報告 [cs.SE, cs.AI]目的:AI実験のためのガバナンスを考慮したマルチテナント環境の設計と実装
- AI技術の産業界と学術界での協調研究が活発化しており,実験基盤の重要性が高まっている。
- AIサンドボックスの関心は高まるも,実験機能とガバナンス要件を両立するプラットフォームの設計・実装に関する実用的な指針が不足している。
- AI実験における再利用可能な評価証拠の生成と,プロジェクト間の比較を可能にするプラットフォームを構築すること。
- 本研究では,産業界と学術界の共同研究に基づいて,ガバナンスを考慮したAIサンドボックスの設計と実装を行った。
- プラットフォームは,マルチテナントのユーザーインターフェース,バックエンド制御プレーン,実行・データ管理層を分離した参照アーキテクチャを採用している。
- これにより,管理されたユーザーオンボーディング,プロジェクト中心のコラボレーション,AIサービスへのアクセス制御などが実現された。
TraceCompiler:LLMエージェントのトレースのスキル誘導マイニングと,ほぼ決定論的なワークフローへのコンパイル [cs.SE, cs.AI, cs.LG]目的:LLMエージェントのトレースをマイニングし,実行可能な,ほぼ決定論的なワークフローにコンパイルすること
- LLMエージェントは,同じ手順を繰り返し発見する傾向があり,効率的な再利用が課題である。
- LLMエージェントのトレースにはノイズが多く,再現性のあるワークフローの抽出が困難である。
- ノイズの多いエージェントトレースから,信頼性の高いワークフローを自動的に生成すること。
- TraceCompilerは,エージェントトレースのクラスタをスキルに基づいてマイニングし,実行可能なワークフローを生成する。
- T1データセットにおいて,producer-consumer依存関係の再現精度が0.928,再現率が0.943であった。
- Venmoの送金依頼のインテントにおいて,API呼び出し数を34から11に削減することに成功した。
CIレコメンデーションシステムに関する開発者の認識の調査 [cs.SE]目的:開発者のCIサービス選択における動機と認識
- 現代のソフトウェア開発においてCIは不可欠だが,適切なCIサービスの選択は課題である。
- CIの導入障壁は特定されているものの,選択の根拠や社会的影響の程度は不明である。
- CIサービス選択の動機と,レコメンデーションシステムへの期待を明らかにすること。
- 調査の結果,CI導入・選択は,プロジェクトの必要性だけでなく,社会的影響も受けていることが示された。
- 開発者はCIを常に必要とは考えておらず,状況に応じて導入の是非を判断している。
- 自動CIレコメンデーションシステムに対する開発者の認識を把握し,今後の開発に役立てる。
BulkPR-Bench:インタラクティブなプルリクエストのキューレベルガバナンスのベンチマーク [cs.SE, cs.AI]目的:インタラクティブなプルリクエストのキューレベルガバナンスに関するベンチマーク
- ソフトウェア開発におけるプルリクエストは,変更を統合するための基本単位であり,効率的な管理が重要である。
- 複数のプルリクエストが相互に影響し合う場合,安全な変更の統合順序決定が課題となる。
- 関連するプルリクエスト間の関係性を考慮し,安全かつ効率的な統合順序を決定すること。
- 本研究で開発されたBulkPR-Benchは,プルリクエスト間の関係性を回復し,実行可能な順序で安全な部分集合を返す能力を評価する。
- 実験の結果,最良のモデルはRelational Delivery Score (RDS) で66.6%を達成したが,完全なキューを正確に完了する割合は低い。
- 関係グループにおける改善は,必ずしも全体のキューレベルガバナンスの信頼性向上に繋がっていないことが示唆された。
PolicyGuard:プロンプト設定可能なセマンティックDLP,LLMコーディングエージェント向け [cs.CR, cs.SE]目的:LLMコーディングエージェントにおける情報漏洩防止
- AI技術の発展に伴い,コーディングエージェントの利用が拡大している。機密情報の保護が重要となる。
- 従来のDLPは,柔軟性に欠け,カスタマイズが困難である。LLMの特性に合わせた対策が求められる。
- 自然言語によるポリシー設定で,柔軟かつ高精度な情報漏洩防止を実現することを目指す。
- PolicyGuardは,自然言語ポリシーファイルを用いてユーザープロンプトを分類する,事前モデル介入フレームワークである。
- 2000件の多言語プロンプトに対し,96.5%の有効ブロック率と3.0%の誤検知率を達成した。
- 同じポリシーを4つの異なるLLMで利用したところ,86.4〜96.5%の有効ブロック率を維持した。
PRWeaver:長期間にわたる悪意のあるプルリクエストに対するLLMベースのコード監査ツールの評価 [cs.SE, cs.CR]目的:LLMベースのコード監査ツールの,リポジトリの進化にわたって分散された敵対的変更に対する信頼性
- ソフトウェア開発におけるセキュリティ確保は重要であり,脆弱性の早期発見が不可欠である。
- 既存のコード監査ツールは,巧妙に隠蔽された長期間にわたる攻撃を検出することが難しい。
- 本研究は,LLMベースのコード監査ツールが,このような攻撃をいかに検出するかを評価・改善する。
- PRWeaverベンチマークにより,実際の攻撃シナリオにおけるLLMベースのコード監査ツールの性能を詳細に評価した。
- 攻撃を分割しても検出率への影響は小さい一方,PRごとの処理や文脈融合は検出率を低下させる傾向が確認された。
- リポジトリの履歴へのアクセスだけでは十分ではなく,攻撃と正常な変更が混在する文脈下での隠蔽が効果的であることが示された。
ソフトウェアリポジトリにおける著者なりすましの様式計測による防御 [cs.CR, cs.LG, cs.SE]目的:ソフトウェアリポジトリにおける著者なりすましの検知
- ソフトウェアサプライチェーン攻撃の増加に伴い,開発者のアカウントを悪用した攻撃が深刻化している。
- 正規の開発者になりすました攻撃者が,悪意のある変更を承認してしまうという課題が存在する。
- パッチレベルでの著者確認により,サプライチェーン攻撃に対する防御を強化することを目指す。
- 様式計測分析をパッチレベルのコミットに適用可能であることを示した。
- Linuxカーネルの20年以上のコミット履歴を用いてクロスモーダルTransformerを学習し,コード差分とコミットメッセージを統合した様式計測空間を構築した。
- 構築したモデルは,オープンワールド著者検証において0.93のROC AUCを達成し,実際のサプライチェーン攻撃の検知にも有効であることが確認された。
予測集合理論:認知アーキテクチャのための生成的枠組みと操作化された中核メカニズム [cs.AI, cs.LO, q-bio.NC]目的:認知アーキテクチャの生成的枠組み
- 脳の予測処理は認知科学の重要なテーマであり,人間の思考や行動の理解に不可欠である。
- 既存の予測処理理論では,「予測」の構造やエラーへの対応,一貫性の維持メカニズムが明確に定義されていない。
- 予測集合理論は,認知アーキテクチャを基礎原理から再構築し,これらの問題を解決することを目的とする。
- 予測集合理論は,アイデンティティ関数,集合論的状態更新,参照チェーンという最小限の操作に基づいて認知機能を厳密に導出した。
- この枠組みは,ラッセルのパラドックス,ゲーデルの不完全性,負のフィードバック,映画編集の理解といった古典的な問題に対する新たな解決策を提供する。
- 本研究の目的は,予測集合理論の独創性と完全性を学術記録に確立することである。
再生成ではなくデバッグ:ニアミスハードウェアオペレーターの修正のためのドメイン固有エージェント [cs.SE, cs.AI]目的:ニアミスハードウェアオペレーターの修正
- GPUやNPUなどのハードウェアアクセラレータのカーネル生成はLLMの性能評価に重要である。
- 従来のLLMパイプラインは多くの候補カーネルを破棄するため,失敗から得られる知識を活用できていない。
- 本研究では,再生成ではなくデバッグによって,カーネル修正の効率と成功率を向上させることを目指す。
- デバッグエージェントは,リトリーブされたパターンと診断機能により知識不足を緩和し,整合性を確保する。
- デバッグのPass@1は66.7%であり,再生成によるPass@1の25.9%やPass@3の40.7%を上回る。
- デバッグは,再生成に比べて92.8%少ないトークンで成功する。
極性符号の推測的逐次キャンセル復号 [cs.IT, eess.SP, math.IT]目的:極性符号復号における効率化
- 通信効率の向上は重要であり,極性符号は理論的な限界に近づけることができる。
- 従来の逐次キャンセル復号は逐次処理のため,高速な処理が求められる用途には不向きである。
- 推測的逐次キャンセル復号は,並列処理を可能にし,復号速度を向上させることを目指す。
- 推測的逐次キャンセル復号は,従来の逐次キャンセル復号と同等のビット誤り率とフレーム誤り率を達成する。
- 長さN=4096の極性符号において,平均して順方向に探索されるノード数を最大69%削減する。
- 特殊ノードアプローチのみでは達成できないアルゴリズムレベルの並列処理を実現し,ハードウェア実装への道を開く。
ブロードキャストモデルにおけるコイン問題の情報計算量の厳密性 [cs.IT, cs.CC, math.IT, math.ST, stat.ML, stat.TH]目的:ブロードキャストモデルにおけるBer(α)とBer(β)の識別テスト
- 分散計算において,効率的な通信は重要な課題であり,情報理論的な限界が求められている。
- 既存研究では,通信量と識別精度のトレードオフが十分に解明されていない場合がある。
- 本研究は,ブロードキャストモデルにおける識別テストの情報計算量の正確な上限と下限を確立することを目指す。
- 定数程度の識別力を持つプロトコルにおいて,あらゆるα>βに対して,仮説ごとの情報計算量を普遍定数因子まで特定した。
- 情報コストが大きく異なる3つのパラメータ領域を明らかにし,それぞれの領域に最適なプロトコルを提示した。
- 離散分布の識別テストに関する情報計算量も,チャネル最適化問題として特徴付け,2値出力チャネルで十分であることを示した。
ほぼ公平な彩色を実現する分散アルゴリズム [cs.DC, cs.DS]目的:グラフのほぼ公平な彩色法の開発
- グラフ彩色問題は,計算機科学,組合せ最適化,オペレーションズリサーチ等の分野で基盤技術として重要である。
- 分散ネットワーク上での効率的な彩色アルゴリズムは,通信コストや計算時間の制約から困難である。
- 彩色パレットサイズと色の頻度のバランスを取り,高速かつ実用的な分散彩色アルゴリズムを設計する。
- 本研究では,分散ラウンド数を抑えつつ,ほぼ公平な彩色を実現する複数のランダム化分散アルゴリズムを提案した。
- 提案アルゴリズム群は,彩色パレットサイズと色の頻度の間のトレードオフを考慮しており,その特性を分析した。
- Sequential, CONGEST, Congested Clique (CC) モデルにおける時間計算量を評価し,アルゴリズムの性能を明らかにした。
LACE:大規模言語モデルを活用したアジャイルなRISC-V命令拡張のためのマルチエージェントフレームワーク [cs.AR, cs.CL, cs.SE]目的:RISC-V命令拡張の実装と検証の効率化
- RISC-Vは柔軟性が高く,多様な分野での利用が拡大している。
- 命令拡張の実装はコアごとに異なり,変更時の検証に手間がかかる。
- 自然言語による指示から自動的に命令拡張を生成し,検証を容易にすること。
- LACEは,自然言語による命令拡張の意図をコンパクトなIRに変換する。
- 4つのRISC-Vコアにおいて,命令拡張の生成成功率をほぼ0%から72.8%に向上させた。
- コードの特定と統合作業の修正時間を削減した。
グラフ彩色における直径非依存分散型周波数制御 [cs.CL, cs.DC, cs.DS]目的:グラフ彩色における周波数制御手法
- グラフ彩色は,ネットワーク設計やスケジューリングなど,様々な分野で重要な役割を果たす。
- 大規模グラフにおける高速な彩色アルゴリズムは課題であり,特に分散環境での効率的な彩色手法が求められる。
- ネットワーク直径に依存しない,周波数制御付きの分散型彩色アルゴリズムを開発し,その性能を評価する。
- 提案アルゴリズムは,CONGESTモデルにおいて,ネットワーク直径に依存しない彩色が可能である。
- アルゴリズムは,指定された失敗指数に対して,色数と色の出現頻度の偏差を有界に保つ保証を提供する。
- 特に,palette slackを活用することで,より効率的な周波数制御が可能となる。
双立方体,超平面,および制約誘起複雑性の崩壊:原子概念学習における [cs.AI, cs.CL, cs.LO]目的:原子概念学習における複雑性の崩壊機構の解明
- 概念学習は,人工知能の根幹をなす問題であり,効率的な学習アルゴリズムの確立が重要である。
- 高次原子概念学習において,計算複雑性が高くなることが課題となっていた。
- 双立方体と超平面の幾何学的構造を用いて,複雑性の局所化と崩壊メカニズムを明らかにすること。
- 双立方体空間における超平面の挙動に着目し,大部分の超平面が有限個の同値類に縮退することを示した。
- この縮退は,概念の還元構造に由来するものであり,複雑性の分布が一様ではないことを明らかにした。
- 3次元の場合でも本質的な現象が確認でき,制約付き仮説空間や構造化分類の観点からの解釈を提示した。
HyperFL:ソフトウェアの故障箇所特定のためのクエリ適応表現学習 [cs.CL, cs.SE, cs.AI]目的:ソフトウェア故障箇所特定の性能向上
- ソフトウェアの信頼性確保は重要であり,故障箇所特定はその基礎技術である。
- 従来の検索ベース手法では,多様なIssue Reportに対応しきれていない。
- Issue Reportの特性に応じた動的なクエリ適応により,特定精度を向上させる。
- HyperFLは,軽量なハイパーネットワークを用いてクエリ固有のLoRAパラメータを生成する。
- 複数の埋め込みバックボーンにおいて,MRR@10で最大13.3%の相対的な改善を達成した。
- HyperFLは異なるIssueの特性に対して,明確な適応パターンを学習することが示された。
階層的ガイド付きLLM推論による説明可能な並行故障局所化ConFL [cs.IR, cs.CL, cs.SE]目的:並行バグの局所化
- ソフトウェアの信頼性確保は重要であり,特に並行処理環境では複雑な相互作用によりバグ発見が困難である。
- バグレポートの情報不足や誤解を招くプログラム要素の言及,スレッド間相互作用の複雑さが問題となっている。
- 構造化された並行処理知識を用いてLLMの推論を補強し,バグ局所化の精度と説明可能性の向上を目指す。
- ConFLは,ソースコードから並行知識ベースを構築し,LLMによる階層的な検索を通じて調査範囲を絞り込む。
- スレッド間相互作用を明示的に記述するDSLを使用することで,深いコールチェーンをたどることなく集中的な推論を可能にする。
- 大規模なJavaプロジェクトにおける実験の結果,ConFLは最先端の手法と比較して大幅に性能が向上し,MRR 0.503,MAP 0.486を達成した。
ソフトウェア計測の基盤:変遷に対する考察 [cs.SE]目的:ソフトウェア計測の基盤となる前提条件の変遷とその影響の検証
- ソフトウェア開発の品質向上には,客観的な計測が不可欠であり,その重要性は増している。
- 従来の計測手法は手作業に頼るため,データ収集の限界があり,分析の進展を阻害していた。
- 現代のデータ生成環境下で既存研究の妥当性を検証し,計測手法の再構築を目指す。
- バージョン管理ツール等の利用状況の変化が,従来のソフトウェア計測研究の前提を揺るがしていることが示された。
- AIエージェントによるツール利用の普及により,データの生成主体が人間ではなくなるという新たな課題が浮上している。
- 現代データに対する再現実験と,一貫した結果が得られる手法の開発が,ソフトウェア計測研究の意義を維持する上で重要である。
実環境におけるLLMサービング:フレームワーク,手法,システム設計に関する実証研究 [cs.CL, cs.SE, cs.AI, cs.LG]目的:LLMサービングフレームワークと手法の実環境における利用状況の分析
- LLMがソフトウェアシステムに組み込まれる中で,効率的なLLMサービングはソフトウェア工学上重要な課題となっている。
- LLMの推論には計算資源,メモリ,GPUが必要であり,レイテンシとスループットを維持することが難しい。
- 本研究は,オープンソースソフトウェアシステムにおけるLLMサービングフレームワークと手法の実際の利用状況を明らかにすることを目指す。
- vLLMが最も普及しており,並列計算,メモリ管理,ネットワークプルーニングが頻繁に使用されるサービング手法カテゴリである。
- 複数のフレームワークを組み合わせた利用は限定的であり,開発者は単一のフレームワークに依存する傾向がある。
- フレームワークの採用は,モデルの系列,モダリティ,サイズ,ドメイン,デプロイメント設定によって異なる。
オープンソースSSIフレームワークにおける統合の障壁:開発者体験の探索的調査 [cs.CL, stat.AP, cs.SE, cs.HC]目的:オープンソースSSIツールにおける開発者体験の調査
- デジタルアイデンティティの自己主権化は重要だが,実現には技術的課題が多い。
- SSIツールは複雑で,ツールが未成熟なため,統合が困難である。
- SSIエコシステムにおける構造的な統合障壁を特定し,解決策を提案すること。
- 受動的な操作は比較的成熟しているが,スキーマのカスタマイズなど,積極的な構築作業において大きな摩擦が生じていることが判明した。
- 障壁の根本原因は,不十分なAPI抽象化,不安定な環境設定,および最新の状況を反映していないドキュメントにある。
- ウェブベースのサンドボックス,AI支援スキーマジェネレーター,実行可能なドキュメント戦略という3つのアーキテクチャの変更を提案する。
TraceCAD:エージェントによるCAD生成のトレース誘導修正 [cs.RO, math.OC, nlin.CD, cs.DB, cs.AI, cs.GR, cs.SE]目的:エージェントによるCAD生成における修正手法
- CAD生成の自動化は,設計プロセスを効率化し,多様なデザインを迅速に実現する上で重要である。
- 既存のCAD生成エージェントは,修正の過程で要件や過去の修正履歴を失いがちである。
- TraceCADは,修正の過程で失われがちな情報を保持し,より効率的で信頼性の高いCAD生成を目指す。
- TraceCADは,要求される機能,モデリングのステップ,失敗の証拠,候補となる結果を永続的な状態として関連付けることで,CAD生成の修正を支援する。
- DeepCADベンチマークを用いた実験により,TraceCADはIoU,Chamfer距離,Hausdorff距離の点で競争力のある幾何学的品質を達成した。
- 永続的な状態の除去は回復スコアをほぼ半分に減らし,局所的な探索の除去は幾何学的回帰を増加させ,コードエージェントの呼び出し回数を二倍にした。
パーサースタック分類による効率的な文法制約デコーディング [cs.SE]目的:文法制約デコーディングの効率化
- LLMの構造化出力の利用拡大に伴い,文法適合性の保証が重要となっている。
- 既存の文法制約デコーディング法は語彙サイズに比例して計算コストが増大し,処理速度がボトルネックとなっている。
- 語彙サイズに依存しない高速な文法制約デコーディング手法を開発し,LLMの処理能力を向上させる。
- 提案手法PSCは,パーサースタックの分類により,既存手法よりも最大700倍高速にマスク計算が可能である。
- JSONスキーマへの適合性を考慮したデコーディングにおいて,最大30倍の高速化を実現している。
- PSCを用いたLLMの処理速度は,制約なしデコーディングに匹敵する性能を示す。
有限評価近似可能構造:確率的冪領域におけるJung-Tix問題への解決策 [cs.LO]目的:有限評価近似可能領域の圏
- ドメイン理論は,計算の数学的基礎を確立する上で重要である。
- 確率的冪領域の構成可能性は,長年の未解決問題であった。
- 有限評価近似可能領域の圏を定義し,その閉性を証明することで解決を目指す。
- 有限評価近似可能領域の圏\(\FVA\)が,デカルト閉かつ,部分確率および確率的評価冪領域に関して閉じることが証明された。
- 評価モノイド\(\Vsub\)と\(\Vone\)が\(\FVA\)に制限され,Jung-Tix問題の一般化された形に対する肯定的な答えが得られた。
- 有限ポセット\(P\)に対する\(\Vsub(P)\)上の増加するFS近似恒等性が構成され,\(\Vsub(P)\)が可算基底FS-ドメインであることが示された。
脆弱性検出のための因果的文脈に基づいたエージェント的推論:CLEAR [cs.HC, cs.CR, cs.SE]目的:ソースコード脆弱性検出における因果関係のモデル化とエージェントによる検証
- ソフトウェアの複雑化に伴い,脆弱性は高度な因果関係に起因することが多く,その検出は困難になっている。
- 既存手法は表層的な類似性に焦点を当て,セキュリティ上の欠陥に内在する複雑な因果関係を捉えきれていない。
- 因果知識グラフを活用し,脆弱性の因果連鎖を体系的に検証することで,脆弱性検出の精度向上を目指す。
- CLEARは脆弱性因果知識グラフ(VCKG)を構築し,エントリポイント,前提条件,根本原因,修正意図間の因果関係をモデル化する。
- Collector,Claim,Critic,Judgeの4つの専門エージェントが,取得した因果的文脈を通じて脆弱性仮説を共同で検証する。
- C/C++とJavaの脆弱性ベンチマークにおいて,最先端手法と比較してPair-Correct(P-C)性能をそれぞれ130.7%と71.56%向上させた。
CMSO を不壊グラフへ還元することは計算不可能である [cs.DM, cs.CC, cs.LO, math.CO]目的:CMSO 論理式の不壊グラフへの還元可能性
- グラフ上の CMSO 論理式の検証は計算複雑性において重要な問題である。
- CMSO 論理式の検証は,一般にNP困難であり,効率的なアルゴリズムは知られていない。
- 還元可能性のパラメータqが計算可能かどうか,その限界を明らかにすること。
- Lokshtanovらの還元定理は非構成的であり,パラメータqの計算可能性が問題視されていた。
- 本研究により,パラメータqは論理式$\phi$の関数として計算不可能であることが証明された。
- これは,非構成的な還元定理が根本的な限界であることを示唆している。
先読みを用いた正規表現から有限状態オートマトンの変換 [cs.FL, cs.PL]目的:先読みを含む正規表現の有限状態オートマトンへの変換
- 正規表現はテキスト処理において不可欠であり,その効率的な実装が求められている。
- バックトラッキングに基づく既存の実装は,最悪の場合に速度が低下する課題がある。
- 先読みを含む正規表現に対し,効率的なマッチングアルゴリズムを提供すること。
- 先読みを含む正規表現(REwLA)を,状態数が$\mr{O}(2^{2^m})$の決定性有限オートマトンに変換する方法を提案した。
- 部分文字列の特定を可能にする重み付き正規表現に対しても,状態数が$\mr{O}(2^{2^m})$の非決定性有限オートマトンへの変換を提案した。
テスト時の推論努力と言語モデルエージェントにおける不正なツール利用:事前規定された等価性研究 [cs.HC, cs.CR, cs.SE]目的:言語モデルエージェントにおけるテスト時の推論努力と不正なツール利用の関係の検証
- 言語モデルエージェントは,業務自動化において重要な役割を担うが,セキュリティ上の課題も存在する。
- エージェントのアクセス制御ポリシーと推論努力パラメータが,不正なツール利用にどのように影響するか不明である。
- 推論努力パラメータの調整が,不正なツール利用を抑制するかどうかを検証すること。
- GPT-5.6において,推論努力を低く設定した場合でも,不正なツール利用は確認されなかった。
- 各モデル層における不正利用率の上限は,それぞれ3.50%と5.21%であり,等価性の基準を満たした。
- 推論努力の増加は,ルール調査の頻度を高めたが,これは標的的な探索とは一致しない結果であった。
量子ソフトウェアにおけるクロスエコシステムなバグ分類 [cs.SE]目的:量子ソフトウェアにおけるバグの分布
- 量子ソフトウェア開発は古典と量子コンポーネントの相互作用により特異な課題を抱えるため,品質保証が重要である。
- 量子ソフトウェアのバグパターンは複雑で理解が難しく,効果的なテストやデバッグが困難である。
- 複数の量子ソフトウェアエコシステムにおけるバグの傾向を比較し,品質向上に貢献すること。
- 古典的なバグが全体の約67%を占め,量子特有のバグは27-30%を占めることが示された。
- Qiskitでは互換性関連のバグが多く,他のエコシステムでは構文エラーや量子特有のバグが多い傾向が見られた。
- ゲートや回路関連のバグが量子特有のバグの大部分を占めるが,非Qiskitプロジェクトではより多様な問題も確認された。
ネットワークMDS符号における最小体積に関する研究 - 一般化結合ネットワークを対象として [cs.IT, math.IT]目的:ネットワークMDS符号に必要な最小体積の決定
- ネットワーク符号は,データ伝送の信頼性を高める上で不可欠であり,その効率性は重要。
- ネットワークMDS符号の体積は計算量に影響し,最小化が課題であった。
- 一般化結合ネットワークとZosin Khullerネットワークにおける最小体積を評価し,新たな上限と下限を示す。
- 一般化結合ネットワークにおけるスカラー符号に対し,ネットワーク符号の距離と古典線形符号の距離の同値性が示された。
- ベクトルネットワーク符号においても同様の同値性が成立し,Grassmannian符号を用いた存在条件が導かれた。
- 特定のパラメータ領域では,ベクトル符号がスカラー符号に対して体積の利点を持たないことが明らかになった。
離散ガウスサンプルの生成:$2^{n/2+o(n)}$時間での1サンプル [cs.DS]目的:離散ガウス分布からの1サンプルの生成
- 格子問題は,暗号理論や符号理論など,幅広い分野で重要な役割を担う。
- 格子問題の効率的な解法は未だ十分ではなく,計算量の削減が求められている。
- 本研究は,離散ガウス分布からの1サンプルの効率的な生成アルゴリズムを開発する。
- 本研究では,任意のランクnの格子とパラメータs^2に対して,$2^{n/2+o(n)}$時間で離散ガウス分布からの1サンプルを生成するアルゴリズムを提示した。
- 提案アルゴリズムは,統計的距離$\exp(-\Omega(n^3))$内で動作し,空間計算量は$2^{n/2+o(n)}$である。
- また,固定された$\alpha<1.4697$に対して,CVPやSVPに対するsub-$2^n$アルゴリズムも導出した。
迅速な失敗検知と再起動:SWEエージェントにおけるタスク処理 [cs.SE, cs.AI]目的:ソフトウェアエンジニアリングエージェントのタスクにおける,早期の失敗予測と効率的な再起動戦略
- ソフトウェア開発の自動化が求められる中,エージェントの効率的なタスク遂行が重要である。
- エージェントの実行が長くなるほどコストが増大し,無駄な探索やループが発生しやすいという課題がある。
- タスクの早期失敗検知と,中断された作業の有効活用による再起動メカニズムを確立し,効率改善を図る。
- FailFast-RestartSmartは,実行中のタスクを監視し,早期に失敗を予測することで,無駄な計算リソースの消費を抑制する。
- 実験結果から,この手法は複数のモデルで有効であり,実行に必要なトークン数を14.6%-20.4%削減できることが示された。
- また,再起動戦略RestartSmartは,Qwen3.6-27Bモデルのタスク解決率を66.6%から71.8%に向上させることに成功した。
