arXiv雑要約
プログラム - 2026/08/04 公開
SVRepair:自動プログラム修復のための構造化視覚的推論 [cs.SE, cs.AI, cs.CV]目的:自動プログラム修復における構造化視覚的推論の活用
- ソフトウェアの品質向上は,現代社会におけるシステム信頼性の維持に不可欠である。
- 既存の自動プログラム修復技術は,視覚的な情報(スクリーンショットや制御フローグラフ)の活用が不十分である。
- 視覚的情報の構造化により,プログラムの誤りの正確な特定と修正を可能にすることを目指す。
- SVRepairは,異種視覚情報をセマンティックシーングラフに変換することで,GUI要素と構造の関係を捉える。
- SWE-Bench Mインスタンスにおいて,517件中186件(約36%)を解決し,OmniGIRLインスタンスでは,19件中4件(約21%)を解決した。
- MMCodeやCodeVisionといったマルチモーダルコード推論ベンチマークにおいても高い性能を示した。
学習可能な活性化関数を持つニューラルネットワークの最適化された区分線形抽象化 [cs.CL, cs.LG, cs.AI, cs.LO]目的:ニューラルネットワークの範囲検証
- AIの安全性確保は重要であり,ニューラルネットワークの動作範囲を保証することが不可欠である。
- 非線形活性化関数を持つニューラルネットワークの正確な範囲検証は計算コストが高いという課題がある。
- 活性化関数を区分線形関数で近似することで,効率的な範囲検証を可能にすることを目指す。
- 提案手法では,動的計画法を用いて,活性化関数の最適化された区分線形抽象化を計算する。
- この手法により,既存手法よりもタイトな出力範囲を得ることが可能となる。
- Kolmogorov-Arnold Networks (KANs) のベンチマーク実験で,その有効性が確認された。
自然言語によるSQLクエリとREST API呼び出し生成のためのRAG戦略 [cs.SE, cs.AI, cs.CL]目的:自然言語によるSQLクエリとREST API呼び出しの生成
- 企業システムはデータベースとAPIで機能公開しており,専門知識が不可欠である。
- LLMは企業固有のスキーマやドキュメントの知識が不足し,信頼性が低い。
- RAGを用いて外部ドキュメントを参照し,構造化されたコード生成の精度向上を目指す。
- 検索拡張生成(RAG)は,企業固有の構造化生成において不可欠であり,大幅な性能向上を示した。
- SQLクエリとREST API呼び出しの組み合わせにおいて,CoRAGが最も高い精度を達成した。
- 混合ドキュメント環境下では,検索戦略が構造化生成の性能に大きく影響することが示された。
有界ランダム性を持つメトリック投票の歪み [cs.CL, cs.GT, cs.DM, cs.DS]目的:メトリック歪み枠組みにおける投票ルールの設計
- 公正な集団意思決定において,投票ルールの歪みは重要な評価指標である。
- 決定論的ルールは歪みが少なくとも3となることが知られており,改善の余地がある。
- 有界のランダム性のみを用いて,歪み3の障壁を打ち破る投票ルールを提案する。
- 提案ルールは,絶対定数ε>0に対して,歪みを最大で3-εに抑える。
- ルールは,決定論的に特定された定数サイズのリストから勝者を一様ランダムに選択する。
- 最大確率ロタリーと安定ロタリーの歪みと近似に関する新たな構造的結果に基づいている。
起業アイデアの反復的創出を支援するマルチエージェント足場システム:非線形ビジネスプラン作成を通じて [cs.HC, cs.SE]目的:起業家精神教育におけるアイデアの構築,評価,反復的な洗練
- 起業家教育において,ビジネスプラン作成は重要な役割を担う分野である。
- 従来のビジネスプラン作成は線形的なプロセスであり,アイデア創出の動的な性質と合致しない。
- 本研究は,反復的なアイデア創出を促す非線形なツールを提供し,その課題を解決する。
- Meflexシステムは,ビジネスプラン作成の足場と非線形アイデアキャンバスを統合し,反復的な思考を支援する。
- 実験の結果,Meflexはビジネスプラン作成を効果的に支援し,発散的思考を促進することが示された。
- さらに,Meflexはメタ認知的な意識を高め,複雑なアイデア開発における認知負荷を軽減する。
超モジュラー制約下における部分モジュラー最大化:貪欲法の保証 [cs.DS, cs.CC]目的:超モジュラーコスト制約下における部分モジュラー関数の最大化
- データマイニングや機械学習の広範な応用において重要であり,効率的な最適化手法が求められている。
- カルディナリティ制約やマトロイド制約とは異なり,超モジュラー制約下における貪欲法の保証は未解明な部分が多い。
- より緩やかな超モジュラーカーバチャの定義に基づき,貪欲法による近似率の向上を目指す。
- 提案する貪欲法は,目的関数と制約関数の比を最大化する要素を反復的に追加し,$\left(1 - e^{-(1-\gamma)}\right)$-近似率を達成する。
- 目的関数の部分モジュラーカーバチャ$c$が存在する場合,近似率は$\left(1 - (1- (1-c)(1-\gamma))^{1/(1-c)}\right)$に改善される。
- 貪欲比率周辺法と二分探索を組み合わせることで,双対問題に対するバイクリテリア近似が得られる。
Eグラフ:持続的なコンパイラ抽象化 [cs.PL]目的:プログラム最適化における等価性飽和の応用
- プログラム最適化は,計算資源の効率的な利用に不可欠であり,高性能なソフトウェア開発の鍵となる。
- 従来の最適化手法は,最適化順序依存性という問題を抱え,最適な結果を得ることが困難であった。
- Eグラフをコンパイラに統合することで,等価性飽和をより広範かつ柔軟に適用し,最適化性能を向上させる。
- 提案手法Tamagoyakiの実装により,ソフトウェアのケーススタディにおいて平均1.18倍の性能向上が確認された。
- ハードウェアのケーススタディでは,従来の等価性飽和と比較して,回路遅延を最大11%削減することに成功した。
- 再利用可能なコンパイラ基盤を活用することで,等価性飽和の適用範囲を拡大し,他の解析・変換との連携を可能にした。
モデルコンテキストプロトコル (MCP) ソフトウェアにおける実フォールト:包括的な分類 [cs.SE]目的:MCPソフトウェアにおける実フォールトの分類
- 大規模言語モデルの普及によりソフトウェア能力が向上する一方,信頼性やセキュリティ課題が顕在化している。
- MCPの導入が進むも,実際のMCPソフトウェアにおけるフォールトの体系的な理解が不足している。
- 実証的な証拠に基づきMCPサーバーのフォールトを分類し,より堅牢なシステム開発に貢献する。
- MCPサーバーにおける5つの高レベルなフォールトカテゴリを特定した。
- 実務家への調査により,全てのフォールトカテゴリが実際に発生していることが確認された。
- MCP特有のフォールトとそうでないフォールトの違いが明らかになった。
異分散性ノイズを持つ分子ISIチャネルにおける信念適応MAP検出 [cs.RO, cs.IT, cs.ET, math.IT]目的:異分散性ノイズを持つ分子ISIチャネルのMAP検出手法
- 分子通信は,ナノデバイス間の情報伝達を可能にする技術であり,医療や環境モニタリングへの応用が期待される。
- 従来の検出器設計では,ISI状態に依存するノイズ分散が十分に考慮されていなかった。
- 本研究は,状態依存の分子数を考慮し,より高精度な検出を実現する。
- 提案手法である信念適応MAP検出(BA-MAP)およびソフトBA-MAPは,受信側の現在の状態信念に基づいて適応的なMAP閾値を導出する。
- シミュレーションと解析の結果,提案手法は従来の等化や固定閾値法を上回り,理想的なMAP検出に匹敵する性能を示すことが確認された。
- ソフトBA-MAPは,可能なすべてのISI状態を重み付けした混合対数尤度比を計算することで性能向上を実現する。
ユニットギャップ:ブール回路における共有の仕組み [cs.CC, cs.DM, cs.LO]目的:ブール回路と木構造回路のサイズの差
- デジタル回路設計において,回路の小型化は消費電力削減や性能向上に不可欠である。
- 従来の回路最適化手法では,共有構造の最適性が十分に解明されていなかった。
- ブール回路と木構造回路のサイズ差の理論的な限界を明らかにすること。
- ブール回路と木構造回路のサイズの差は常に0または1であることが証明された(ユニットギャップ定理)。
- 共有構造は,最適化された回路に必要な変数の数を決定する(閾値定理)。
- 最適化された回路のサイズが小さい場合(opt(f) <= 3)には,共有構造は不要である(木定理)。
平均分散の不確実性を持つ付加雑音路に対する検出器の理論的解析 [cs.IT, math.IT, math.PR]目的:平均分散の不確実性下における付加雑音路の検出器
- 通信システムの信頼性向上には,雑音環境に対するロバストな検出手法が不可欠である。
- 従来の理論では,雑音の確率モデルが既知であることを前提としており,不確実な状況への対応が課題である。
- 非線形期待値理論を用いて,確率モデルの不確実性を考慮した最適な検出器の設計を目指す。
- 平均の不確実性は最適な検出器の形に大きな影響を与えるが,分散の不確実性は影響を与えないことが示された。
- 提案手法は,従来の決定論的な確率モデルを仮定する検出器よりも,不確実な確率モデル下で優れた性能を示すことが実験により確認された。
- 雑音パラメータの推定方法も提案され,理論的解析とシミュレーションにより有効性が検証された。
No-Clash Teaching DimensionはVC次元によって上限される [cs.IT, cs.LG, math.IT]目的:No-Clash Teaching Dimensionの上限
- 機械学習理論において,教師あり学習の効率的な学習手法の複雑性を評価する上で重要である。
- No-Clash Teaching DimensionがVC次元によって上限されるかどうか不明であり,理論的な限界が未解決であった。
- 有限概念クラスに対するNo-Clash Teaching DimensionのVC次元による上限を証明することを目的とする。
- 有限概念クラスに対して,VC次元に等しいサイズのフラグメントを構築し,概念を識別できることを示した。
- 構築されたフラグメントは,教師データとして利用可能であり,非衝突条件を満たすことを確認した。
- これにより,有限概念クラスにおけるNo-Clash Teaching DimensionがVC次元によって上限されることが証明された。
ARMOR:欠損モダリティ下におけるマイクロサービスの根本原因分析のためのロバストな自己教師ありフレームワーク [cs.LG, cs.SE]目的:マイクロサービスにおける根本原因分析のためのロバストなフレームワーク
- マイクロサービスアーキテクチャの普及に伴い,システムの信頼性確保が重要になっている。
- 実際の運用環境では,ネットワーク障害やエージェントの故障により,データが欠損することが多い。
- 欠損データに強く,高精度な根本原因分析を可能にする手法が求められている。
- 提案手法ARMORは,異なるモダリティ間の分布の差異を分離する非対称エンコーダを採用している。
- 欠損モダリティに配慮したゲート付き融合機構により,不完全な入力からの干渉を防ぎ,ロバスト性を高めている。
- 自己教師あり学習とマスクガイダンスによる再構成により,異常検知,故障分類,根本原因特定を同時に最適化している。
ユーザフィードバック駆動型要件優先度決定の高度化 [cs.SE]目的:ユーザフィードバックに基づく要件優先度決定の改善
- ソフトウェア開発において,限られたリソースで価値の高い機能を提供するため,要件の優先度決定は重要である。
- 従来の要件優先度決定は,要件を独立して扱うため,要件間の関連性を考慮できていない場合がある。
- 本研究では,要件間の関連性を考慮することで,より効果的な優先度決定を目指す。
- 94の要件優先度決定インスタンスを用いた実験の結果,提案手法はReFeedを上回る性能を示した。
- 要件間の関連性を組み込むことで,検索ベースのソリューションの性能が向上することが示された。
- 要件の関連性は,ユーザフィードバック駆動型要件優先度決定を改善し,追加の「requires」関係を明らかにするとともに,検索ベースのリリース計画を強化する。
ReLog:LLM指向デバッグのための実行を意識したログ記録とランタイムフィードバック [cs.SE]目的:LLMを活用したデバッグを支援するためのログ生成手法
- ソフトウェアのデバッグと保守において,ログは不可欠な要素である。効率的なデバッグには適切なログが重要となる。
- 従来の自動ログ生成は静的解析に依存し,実行時の振る舞いを考慮しないため,十分な品質のログを提供できない場合がある。
- LLMによる利用も考慮し,ランタイムフィードバックに基づいた,より実用的なログ生成を目指す。
- ReLogは,LLMを活用してログを生成,実行,評価,改善する反復的なフレームワークである。
- Defects4Jに基づく実験の結果,直接デバッグ設定においてF1スコア0.520,97件の欠陥を修正する性能を示した。
- 間接デバッグ設定においても,既存手法を上回るF1スコア0.408を達成し,汎用性と有効性を確認した。
ソフトウェアリポジトリマイニングにおける言語モデルの台頭:調査 [cs.SE]目的:ソフトウェアリポジトリマイニングにおける言語モデルの利用状況
- ソフトウェア開発の効率化や品質向上に貢献するため,ソフトウェアリポジトリの分析が重要である。
- 大規模かつ多様なリポジトリデータの分析には,高度な技術が求められていた。
- 言語モデルの活用状況を整理し,今後の研究方向性を示すことを目指す。
- 本調査では177件の論文を分析し,言語モデルがMSRタスクにどのように応用されているかを網羅的に調査した。
- 分析結果に基づき,言語モデルのMSRにおける応用に関する分類体系を提案し,主要なトレンドを特定した。
- 未解決の課題と将来の研究の方向性についても議論した。
有益な学習経験:ブラジルにおけるソフトウェアエンジニアリングの企業研修に関する質的研究 [cs.SE]目的:ブラジル人ソフトウェアエンジニアが最も有益だと認識する学習経験の種類と,その有益性の定義
- ソフトウェア開発の進歩は速く,エンジニアの継続的なスキルアップが不可欠である。
- 研修の質を測る量的研究では,専門家が真に有益だと感じる学習経験を捉えきれない場合がある。
- ブラジル人ソフトウェアエンジニアにとっての有益な学習経験を明らかにすることで,効果的な研修設計に貢献する。
- 学習経験は「継続的な技術アップデート」「実践的・応用的な学習」「正式な学術教育」「社会的学習とネットワーキング」「リーダーシップ開発とソフトスキル」の5つのテーマに分類された。
- 技術のアップデートと実践的な応用が,専門家の語る内容の中で最も重要視されている。
- 有益性は,日々の業務への適合性と即時的な適用可能性に強く結びついていることが示された。
OSSからオープンソースAIへ:協調開発パラダイムの相違に関する探索的研究 [cs.SE, cs.HC]目的:オープンソースソフトウェア(OSS)とオープンソースAIモデル(OSM)の協調開発パラダイムの相違の定量化と特徴付け
- AI開発におけるオープンソース化の重要性が増しているが,ソフトウェアとの根本的な違いが課題となっている。
- AIモデル特有の性質から,従来のOSSとは異なる協調開発のあり方が生じている可能性が指摘されている。
- OSSとOSMの協調開発パラダイムの違いを明らかにすることで,AI開発における協調手法の改善に貢献する。
- OSSと比較して,OSMの協調開発の強度は有意に低いことが示された。
- 直接的な貢献に関する協調の開放性は低い一方,知識交換は比較的オープンであるという特徴が見られた。
- OSMは,協調的な改善よりも適応的な利用によるユーザーイノベーションに傾倒する傾向があることが明らかになった。
意味論駆動型ユニットテスト生成によるビジネスロジックバグの発見 [cs.SE]目的:ビジネスロジックバグの検出
- エンタープライズソフトウェアにおいて,ビジネスロジックバグは頻発し,品質確保が重要である。
- 既存のユニットテスト生成技術はコード中心であり,ビジネスロジックバグの検出が困難である。
- 要件定義書から意味知識ベースを構築し,LLMを活用してビジネスロジックバグを効率的に検出する。
- SeGaは,4つのGoプロジェクトにおいて,既存のLLMベースの手法よりも22~25個多くのバグを検出した。
- SeGaは,従来のLLM手法と比較して,検出精度を26.9%~34.3%向上させた。
- 6つの実運用リポジトリへの適用により,開発者が確認・修正した16個の未知のビジネスロジックバグを発見した。
中性原子コンパイラの公平な比較と評価のための実用的な考察 [cs.ET, cs.PL]目的:中性原子コンパイラの性能評価に関する統一的かつ再現可能な枠組み
- 大規模量子計算実現に向け,中性原子量子コンピュータは有望なプラットフォームの一つである。
- 既存のコンパイラ評価は,評価指標や前提条件が異なり,公平な比較が困難である。
- 評価の一貫性を高め,コンパイラの性能をより正確に比較することを目的とする。
- 本研究では,ルーティングとスケジュール情報を表現するRSQASMを導入し,評価の標準化を試みた。
- 既存のコンパイラ出力と中間成果物をRSQASMに変換するアダプタスクリプトも提供する。
- HybridMapper, DasAtom, Enolaの比較により,以前報告された性能差が縮小または再現されない場合があることを示した。
KVerus:Rustコードの堅牢かつスケーラブルな形式検証証明生成 [cs.SE, cs.CR]目的:Rustコードに対する形式検証証明の生成におけるスケーラビリティと堅牢性の向上
- ソフトウェアの信頼性・安全性の確保が重要であり,形式検証はその最高水準の保証を提供する。
- 大規模かつ変化するシステムへの適用が困難であり,既存のLLMは複雑な依存関係に対応できない。
- LLMの持つ意味的パターンと形式検証の構造的依存性のギャップを埋め,持続可能な証明生成を目指す。
- KVerusは,コードメタデータ,補題の意味,ツールチェーンの情報を動的に管理する知識ベースを構築する。
- 依存関係を考慮したプログラム解析と意味的補題インデックス,エラー駆動型自己改善により,複雑な依存関係を解決し証明を合成・修復する。
- Asterinas Rust OSカーネルにおいて,メモリ管理モジュールの23個の未検証関数(証明コードの21.0%)を検証し,upstreamに採用された。
自律的な侵入テストのための参照ハーネスCochise [cs.CR, cs.AI, cs.SE]目的:自律的な侵入テスト実験のための参照実装
- サイバーセキュリティの脅威が増大しており,自動化された侵入テストの重要性が高まっている。
- 既存のシステムは,アーキテクチャ,プロンプト,ツール統合が一体化しており,構成要素ごとの効果測定が困難である。
- モデル,エージェントアーキテクチャ,侵入テストの軌跡を比較するための再利用可能な実験基盤を提供する。
- Cochiseは,Planner-Executorアーキテクチャを採用し,SSH経由でLinuxホストに接続して侵入テストを実行する。
- Game of Active Directory (GOAD)というテストベッドを用いて評価を行い,その有効性を示した。
- オフラインでの実行ログの可視化ツールや,コスト,トークン数,侵入成功率を分析するツール,およびGOADの実行ログコーパスを公開した。
LLM生成コードにおける可読性問題の特性評価とプロンプト設計の役割 [cs.SE, cs.AI]目的:LLM生成コードの可読性に関する問題点の特性と,プロンプト設計による改善の可能性
- ソフトウェア開発において,コードの可読性は保守性や協調性に不可欠であり,開発効率を大きく左右する。
- LLMによるコード生成は急速に進む一方,生成されたコードの可読性評価は十分ではなく,実用上の課題となっている。
- LLM生成コードの可読性問題のパターンを特定し,プロンプト設計の指針を示すことで,コード品質の向上を目指す。
- 最新のLLMが生成するコードの全体的な可読性は,人間が書いたコードと同程度であることが示された。
- しかし,複雑性の過剰,冗長なコメント,未知のAPIの使用など,可読性に関する特有の問題パターンが存在することが明らかになった。
- 関数シグネチャ,制約条件,スタイル記述などがコードの可読性と強く関連していることが判明し,プロンプト設計が可読性向上に貢献する可能性が示唆された。
小規模メッセージを用いた高速ゴシップ型噂の拡散 [cs.DC, cs.DS]目的:噂の拡散に関するゴシップアルゴリズムの性能向上
- ネットワークにおける情報伝達効率は,様々な応用において重要である。
- 従来のゴシップアルゴリズムは,大規模なメッセージサイズが課題となっていた。
- 小規模メッセージで高速な噂の拡散を実現することを目指している。
- 本研究では,ノード数$n$の対数オーダーのメッセージサイズで噂を拡散する2つのアルゴリズムを提案した。
- 提案アルゴリズムの一つは,$O(c \log n / \Phi_c)$ラウンドで動作し,弱コンダクタンスに関する最適解に近い性能を示す。
- もう一つのアルゴリズムは,ネットワーク直径$D$に依存し,$\tilde{O}(D+\sqrt{n})$ラウンドで噂を拡散可能である。さらに,最小全域木も同等のラウンド数で出力できる。
PITMuS: ソースレベルの変異体再構成による自動バグデータセット生成ツール [cs.SE]目的:ソースレベルの変異体再構成を通じた,再利用可能な変異ベースのバグデータセットの生成
- ソフトウェアテストや実証的ソフトウェア工学において,制御された障害を生成する手法として変異テストが重要である。
- 既存の変異テストツールは,バイトコードレベルで変異体を生成するため,検査や再利用が困難である。
- バイトコードレベルの変異テスト結果をソースレベルのバグデータセットに変換し,ソフトウェアテスト等の活用を促進する。
- PITMuSは,PITの変異テスト報告書とJavaソースコードから,99.96%の変異体ペアをソースレベルで再構成できた。
- これにより,変異テスト報告書から検査可能な,コンテキストに富むソースコードの成果物を作成できる。
- 本研究成果は,ソフトウェアテスト,プログラム修復,学習ベースのソフトウェア工学への応用が期待される。
カーネルファウンドリ:マルチ専門家による診断駆動型進化カーネルオプティマイザ [cs.NE, cs.DC, cs.LG, cs.PF, cs.SE, cs.SY, eess.SY]目的:GPUカーネルの自動最適化
- GPUの性能向上は重要であり,その鍵は効率的なカーネルにあり,最適化は不可欠である。
- LLMによるカーネル生成は有望だが,正しさかつ効率性を両立するのが難しいという課題がある。
- 診断駆動型進化により,正しく,かつ効率的なGPUカーネルを自動的に生成すること。
- Kernel Foundryは,診断フィードバックに基づく進化探索と,経験学習による知識の蓄積を組み合わせる。
- KernelBenchを用いた実験により,既存手法と比較して正しさおよび性能が向上することが示された。
- Level 2において,100%の正しさの達成が見られた。
Sakura:自然言語によるテスト記述から複雑なテストを生成するアプローチ [cs.CY, cs.CL, cs.SE]目的:自然言語によるテスト記述から,構造的に複雑なテストの生成
- ソフトウェアの品質向上には,テスト自動化が不可欠であり,効率的なテスト生成手法が求められている。
- 既存のテスト自動化手法は,単一のメソッドやAPIに焦点を当てたものが多く,複雑なシナリオを網羅できない。
- 開発者が記述するような,複数のクラスやメソッドを跨ぐ複雑なテストケースを自動生成することを目指す。
- Sakuraは,自然言語によるテスト記述を構造化されたブロックに分解し,複数のエージェントによるシステムでテストコードを生成する。
- Sakuraは,既存のLLMを活用したテスト生成ツールと比較して,テストのコンパイル成功率とテストカバレッジにおいて大幅な性能向上を達成した。
- 小規模なオープンソースモデルと組み合わせることで,大規模なプロプライエタリモデルを凌駕する性能を発揮し,コスト削減にも貢献する。
TLA-Prover:嗜好度最適化低ランク適応による検証可能なTLA+仕様合成 [cs.SE, cs.AI, cs.LG, cs.LO]目的:TLA+仕様の合成
- 分散システムや安全性重視のプロトコルの検証において,形式仕様記述言語TLA+は不可欠である。
- 大規模言語モデルで生成されたTLA+仕様は,意味的な理由でTLCモデルチェッカーに失敗することが多い。
- TLCモデルチェッカーによる検証をパスするTLA+仕様を自動生成することを目指す。
- TLA-Proverは,200億パラメータのモデルであり,検証済みの例に対する教師ありファインチューニングと,修正に基づくグループ相対ポリシー最適化(GRPO)を組み合わせた学習を行う。
- 保持された30問題のベンチマークにおいて,TLA-ProverはGoldおよびDiamondレベルで9/30(pass@1 = 30%)を達成し,調整されていないベースラインの8.6%を約3.5倍上回る結果を示した。
- 直接嗜好度最適化(DPO)変種はDiamondレベルで20%を達成した。GoldとDiamondが一致することで,自明な性質の失敗モードを防ぐ。
エージェントコンパイル:直接CUDA推論のためのLLM誘導コンパイラ [cs.PL, cs.AI]目的:LLM誘導CUDA推論コンパイラの開発
- Transformer推論は,特殊なコンパイラと実行時サポートに依存しており,その最適化が重要である。
- LLMによるCUDAカーネル生成は柔軟性があるものの,正当性や性能が保証されないという課題がある。
- LLMの助言とコンパイラによる検証を組み合わせ,高性能なCUDA推論を実現すること。
- AgentCompileは,LLMの助言に基づき,コンパイラがCUDAカーネル候補を生成・検証する手法を採用。
- 単一リクエスト生成において,PyTorch eagerと比較して2.23~6.98倍の高速化を達成。
- マルチリクエストサービングにおいても,vLLMと比較して1.04~1.16倍の高速化を達成。
動的分割,コア誘導剪定,バックボーン検出による並列SMTソルビング [cs.LO, cs.DC]目的:並列SMTソルビングのためのフレームワーク
- 現代のCPUアーキテクチャの並列性を活用し,SMTソルバーの最適化は長年の課題である。
- 既存の並列化手法では,効率的なリソース活用とスケーラビリティが不十分である。
- アクティブな探索からのフィードバックを活用し,探索空間を効率的に分割・剪定する。
- 提案手法は,探索空間を動的に二分分割する木構造を構築し,コアベースの剪定で効率的に削減する。
- バックボーン検出とオンデマンド終了機構により,ワーカーの負荷を軽減し,計算資源を有効活用する。
- Z3 SMTソルバーへの実装により,SMT-COMP 2025 Parallel Trackの難易度の高いベンチマークにおいて優れた性能を示す。
LLMエージェントはコードリポジトリを認識できる [cs.CL, cs.SE]目的:コードリポジトリレベルの問題解決における視覚的表現の有効性
- ソフトウェア開発の効率化には,大規模コードベースの理解が不可欠である。
- 従来のLLMエージェントはテキスト情報のみを利用し,リポジトリの構造を十分に活用できていない。
- 視覚的表現を取り入れることで,エージェントの効率性と精度を向上させることを目指す。
- 視覚情報のみの利用では精度が低下し,トークン消費量が増加する傾向が見られた。
- テキストとリポジトリ構造の視覚グラフを組み合わせることで,トークン消費量を削減しつつ,問題解決の精度を維持・向上させることができた。
- 特に,故障箇所特定や探索深度の自動制御において,視覚化が有効であることが示された。
反強磁性ポッツモデルの無一意性領域における計数とサンプリング [cs.DS, math.PR]目的:反強磁性多状態ポッツモデルの分配関数の近似
- 統計物理学における基本的なモデルであり,相転移現象の研究に不可欠である。
- 相転移に伴う計算複雑性に関する問題が未解決である。
- ランダムな規則二部グラフ上で,分配関数の効率的な近似アルゴリズムを開発する。
- 低温において,単一サイトのGlauber力学が指数関数的に遅い混合時間を有することが示された。
- 抽象ポリマーモデルの枠組みを用いた決定論的アルゴリズムにより,分配関数の近似が可能となった。
- ランダムな規則二部グラフが,分配関数近似に適した構造を持つことが確認された。
グローバル分割領域における局所的に修復可能な変換符号の帯域幅下限と最適構成 [cs.DB, cs.IT, math.IT]目的:グローバル分割領域における局所的に修復可能な変換符号の帯域幅下限とその最適構成
- 分散ストレージシステムにおいて,データの耐障害性は重要であり,そのためにイレイジャーコーディング技術が不可欠である。
- ストレージシステムの進化に伴い,既存のイレイジャーコードのパラメータを調整する必要が生じる場合がある。
- 効率的な符号変換によって,パラメータ調整時のデータ転送量を最小化することを目指す。
- 情報理論的なアプローチにより,安定な最適距離局所的に修復可能な変換符号の読込帯域幅の下限を導出した。
- MDS配列符号に基づいた構成を開発し,初期および最終のグローバルパリティノード数に応じて異なる場合分けを行った。
- 全てのパラメータ範囲において,安定な最適距離局所的に修復可能な変換符号の最適な読込帯域幅を完全に特徴付けた。
閾値グループ検査のためのアルゴリズム [cs.IT, math.IT]目的:スパースな二値ベクトルを,可能な限り少ない検査回数で正確に復元すること
- グループ検査は,効率的な欠陥検出に役立つ。大規模なデータセットへの応用が期待される。
- 既存手法では,正確な復元に必要な検査回数の理論的限界に達していない場合がある。
- 理論限界に到達する効率的な推論アルゴリズムを開発し,性能向上を目指す。
- 本研究では,空間結合型テスト設計に基づく効率的な推論アルゴリズムを開発した。
- 提案アルゴリズムは,定数カラム型テスト設計において,情報理論的な限界に一致する検査回数で正確な復元を高い確率で達成する。
- 従来の二値グループ検査手法とは異なり,複雑な加重和の解析に依存しないため,解析が簡略化されている。
安全性の錯覚:AIと人間が記述したC++コードの多層検証 [cs.SE]目的:AI生成C++コードと人間が記述したC++コードの安全性比較
- システムプログラミングにおけるLLMの利用拡大に伴い,セキュリティ確保が重要課題となっている。
- 従来のセキュリティ評価は静的解析に偏っており,実行時エラーや未テストパスの検証が不十分である。
- AI生成コードの安全性を多層検証により定量的に評価し,人間のコードとの比較を行う。
- AI生成C++コードは,人間のコードと比較して実行時違反を引き起こす確率が約2倍高いことが判明した。
- 静的解析では両者の安全性は同程度に見えるが,これはコード長に起因する誤解であり,実際の安全性は異なる。
- 各検証層は異なる種類の違反を検出し,単一の層だけでは十分な評価ができないことが示された。
大規模マイクロサービスシステムにおけるエージェント型AIを活用した効率的な根本原因分析システムKRCA [cs.SE]目的:大規模マイクロサービスシステムにおける根本原因の特定と障害種類の分類
- 大規模インターネット企業では,マイクロサービスシステムが標準的なインフラとなっている。
- 既存の根本原因分析手法は,このようなシステムの規模と変化の速さに対応が難しい。
- 本研究は,大規模マイクロサービスシステムにおける効率的かつ正確な根本原因分析を可能にすることを目指す。
- KRCAは,APIレベルのドリルダウンと因果グラフ,そしてマルチエージェントフレームワークを組み合わせることで,高精度かつ効率的な根本原因分析を実現した。
- 実験結果では,根本原因サービス特定と障害種類の分類において,最良のベースラインを少なくとも31%上回るAC@1スコアを達成した。
- Kuaishouの運用環境への導入により,平均診断時間が77.3%短縮された。
次元削減とネットワーク科学:UMAPのkNNグラフによるデータ理解 [cs.RO, cs.LG, cs.AI, cs.DS, cs.HC]目的:UMAP内部で構築されるkNNグラフの活用
- 高次元データの可視化・理解は,機械学習やデータ分析において不可欠である。
- UMAPの埋め込み表現に焦点が当たりがちで,内部グラフの潜在的な価値が十分に活用されていない。
- UMAPのkNNグラフを用いた分析により,データ構造の理解を深めることを目指す。
- PageRankにより代表的なデータ点を特定し,データの概要把握に貢献する。
- k-core分解により,高密度な領域と疎な領域を明確化し,データ構造を可視化する。
- クラスタリング係数により,類似度の高いデータ点の近傍を検出し,局所的な構造を明らかにする。
ソフトウェア工学研究におけるインタビュー調査のサンプルサイズと飽和度に関する予備的知見 [cs.CE, cs.CL, cs.SE]目的:ソフトウェア工学研究におけるインタビュー調査のサンプルサイズと飽和度の運用方法
- ソフトウェア工学における人間,組織,社会技術現象の理解には,インタビュー調査が不可欠である。
- インタビュー調査のサンプルサイズや飽和度に関する議論が一貫しておらず,研究の信頼性を損なう可能性がある。
- インタビュー調査のサンプルサイズと飽和度に関する現状を把握し,より質の高い研究を促進すること。
- 主要なソフトウェア工学会議で発表された論文を分析した結果,サンプルサイズには大きなばらつきが見られた。
- 12人未満のインタビュー調査も多く,特定の産業分野や組織へのアクセス制限が理由として挙げられた。
- 13~24人のサンプルサイズが最も一般的であり,飽和度やサンプルサイズの妥当性に関する議論は,暗黙的または文脈的な推論に頼ることが多いことが示唆された。
低高度UAV飛行のためのネットワーク型ISACにおける安全を考慮した前方検知 [cs.IT, math.IT]目的:低高度無線ネットワークにおける安全なUAV飛行を支援するためのネットワーク型統合センシング・通信(ISAC)における前方検知設計
- 低高度空域の利用拡大に伴い,UAVの安全な運用を確保する技術が重要になっている。
- 既存研究では,通信の強化や標的パラメータ推定に焦点が当たり,UAV前方領域における非協調標的の検知信頼性が不十分である。
- 本研究は,UAV前方領域における非協調標的の検知信頼性を向上させ,UAVの安全性を高めることを目指す。
- 提案設計は,ベースラインと比較して平均見逃し確率を17.05%削減し,センシング誘発衝突リスクを低減する。
- 状態推定性能の低下は限定的であり,平均CRLBは14.82%増加に留まる。
- 複数の基地局が協調することで,UAVの状態推定CRLBと前方ROIの見逃し確率が改善されることが示された。
StructureClaw:追跡可能なLLMエージェントと構造工学ワークフローの実行可能ベンチマーク [cs.SE, cs.AI, cs.MA]目的:構造工学におけるLLMエージェントのワークフロー実行可能性評価
- 構造工学は社会インフラの中核であり,安全性と信頼性が不可欠である。
- 既存のLLM評価は出力の流暢性重視で,実行可能性や整合性を検証していない。
- LLMエージェントによる構造工学ワークフローの完全性と実行可能性を評価する。
- StructureClawは,LLMエージェントが工学スキルとツールを用いて成果物を生成・共有する環境を提供する。
- StructureClaw-Benchは,標準ワークフロー,ロバスト性,マルチモーダル再構築を含む150のシナリオから構成される実行可能なベンチマークである。
- 自動StructureClawは,E2E成功率82.9%を達成し,既存手法(22.0%)を大幅に上回った。
トポス因果モデルの立方体形式化:介入,強制,文脈性障害 [cs.LO, cs.AI, math.CT]目的:トポス因果モデルにおける介入,強制,文脈性障害に関する形式的な記述
- 因果推論は科学的推論の根幹であり,様々な分野で重要な役割を果たす。
- 従来の因果推論の枠組みでは,複雑な状況下での介入効果の正確な評価が困難である。
- トポス理論を用いて因果モデルを形式化することで,介入効果の厳密な理論的基盤を提供する。
- 本研究では,立方体Agdaを用いてトポス因果モデルの核心部分を機械的に検証可能な形で記述した。
- 一貫性のある局所的な因果データが存在するにもかかわらず,全体的なモデルが存在しない文脈性障害を明らかにした。
- 介入のモデル化における潜在的な問題点を指摘し,介入操作と観察操作の違いを明確にした。
反例補完されたスケッチに対するエージェント的合成 [cs.RO, cs.SE, cs.AI]目的:反例補完されたスケッチに対するエージェント的合成手法
- ソフトウェア開発における自動化は,生産性向上や品質改善に不可欠である。
- 既存のコーディングエージェントは,特定の例を修正する際に,全体的な整合性を損なう可能性がある。
- 人間とエージェントの協調的なスケッチ修正を通じて,ロバストなポリシー学習を実現する。
- 本手法では,人間が部分的なスケッチを作成し,エージェントが修正案を生成する反復的なプロセスを採用している。
- CatSynthを用いた実験により,修正されたプロトコルは,保留中のケースに対する適合率を向上させた。
- レビューによるスケッチ検証は,決定的な再生だけでは捉えられないドリフトを検出し,より多くの保留ケースをパスした。
コーディングエージェントにおけるコンテキスト劣化の発生時期と方法:コード監査におけるエージェントの能力に関するホワイトボックス研究 [cs.SE]目的:コード監査におけるエージェントの能力の劣化状況の分類
- ソフトウェア開発において,コードの品質維持は不可欠であり,自動化されたコード監査の重要性が高まっている。
- 大規模言語モデルを搭載したコーディングエージェントは,コンテキスト長に依存して性能が変動し,長期的なタスク実行で能力が低下する可能性がある。
- コンテキスト劣化がいつ,どのように発生するかを詳細に分析し,エージェントの信頼性向上に貢献すること。
- Codexとgpt-5.4-miniを用いてコード監査を行った結果,クリーンなコンテキストでは高い成功率を示したが,長いコンテキストでは成功率が大幅に低下した。
- ただし,要件の網羅率は高い水準を維持しており,一部の要件の抜け漏れが監査結果に大きな影響を与えることが示唆された。
- 外部チェックリストを用いることで自己チェックよりも高い成功率が得られたが,コンテキスト長に対する明確な閾値は確認されなかった。
純粋DP統計的問い合わせ解放:推測される平方根レートで [cs.DS, cs.CR]目的:k個の統計的問い合わせの,サイズTの宇宙における純粋差分プライバシー下での解放
- データプライバシー保護は,個人情報を保護しつつデータ利用を可能にするため重要である。
- プライバシー保護とデータ有用性の両立が難しく,特に高次元データでは課題が大きい。
- 差分プライバシーにおける統計的問い合わせ解放の限界を理論的に確立すること。
- 本研究は,NikolovとUllmanが提唱した,平方根レートでの上限を証明した。
- 提案メカニズムは,データベースサイズnとプライバシーパラメータεに対して,期待される誤差が$O(\min\{1,\sqrt{\log(2T)\log(2k)/(\varepsilon n)}\})$となる。
- この誤差は,既存の下限との一致を示し,パラメータ条件なしに有効な上限を確立した。
Lean 4におけるKannan-Bachem Smith標準形の機械検証による算術ビット複雑性 [cs.DB, cs.LO, cs.DS, cs.SC]目的:非特異な正方整数行列に対するKannan-Bachem Smith標準形アルゴリズムの形式化
- 線形代数の計算において,数値計算の正確性と効率性は不可欠である。
- アルゴリズムの正確性を保証するためには,形式的な検証が必要不可欠である。
- アルゴリズムの算術ビット複雑性を機械的に検証し,計算資源の限界を明確にすること。
- Lean 4を用いて,Kannan-Bachem Smith標準形アルゴリズムを形式的に検証した。
- アルゴリズムが$S,U,U^{-1},V,V^{-1}$を返し,$UAV=S$, $U^{-1}SV^{-1}=A$などの関係を証明することを示した。
- アルゴリズムの計算コストと出力行列の符号化長に関する固定された多項式の上界を導出した。
LLMベースのテストケースの抽出とアサーション生成の実践(経験論文) [cs.SE]目的:マイクロサービスシステムの回帰テスト自動化
- マイクロサービスアーキテクチャの普及により,システムテストの複雑化と自動化の必要性が高まっている。
- 既存のテストケース作成は,ドキュメント不足やトラフィックからのシナリオ復元に手間がかかる。
- 実トラフィックに基づいたテストケース生成の自動化による,テスト工数削減を目指す。
- NL2Testは,自然言語によるシナリオ記述とトラフィックキャプチャから,実行可能なAPI回帰テストを生成する。
- 51の産業用回帰シナリオにおいて,完全一致率は82.4%(42/51),わずかな修正で利用可能なドラフトの生成率は98.0%(50/51)を達成した。
- 9ヶ月間の実稼働環境での導入により,3,196件のテストケースが生成され,コードの採用率は85.4%となった。
巡回符号と巡回被覆部分空間 [cs.IT, math.CO, math.IT, math.NT]目的:巡回被覆部分空間の最大余次元
- 符号理論において,誤り訂正能力の評価や効率的な符号構成に重要である。
- 巡回被覆部分空間の余次元に関する知見が十分でなく,その性質解明が課題である。
- 素数pに対し,2がpの原始根である場合のh_2(2p)の値を決定し,余次元の評価を行う。
- 素数pが2を法として原始根であるとき,h_2(2p) = 2 が成り立つことが示された。
- h_q(n) = 0 かつ gcd(n,q-1) = 1 の場合,h_q((q-1)n) = 0 であることが示された。
- サポート重数分布の概念を用いて,h_q(n) の下界を導出し,h_q(n) = 0 となるnの族を提示した。
Specula:システムコードの自律的なモデル検査のための形式仕様のスケーリング [cs.RO, cs.SE, cs.AI, cs.DC, cs.OS]目的:大規模で複雑なシステムコードに対する高品質な形式仕様の生成と,それを用いた効果的なモデル検査およびバグ検出
- システムの信頼性確保は重要であり,形式手法はその有力な手段の一つである。
- 形式仕様の作成は専門知識を要し,現実世界のシステムコードへの適用は困難である。
- LLMを活用し,形式仕様の自動生成と品質向上により,形式手法の適用障壁を低減すること。
- SpeculaはLLMベースのエージェントを用いてTLA+仕様を自律的に開発する。
- 48のオープンソースプロジェクトで検証を行い,既存手法では発見困難な249個のバグを発見した。
- 自己進化ループを通じて,LLMの課題である報酬ハッキングや幻覚を抑制し,仕様の品質を向上させている。
多項式的に改善されたトリファレント符号の下限:局所的に疎な3-均一超グラフによる [cs.IT, math.IT]目的:トリファレント符号のサイズ下限の向上
- 符号理論は,情報伝送やデータ圧縮における信頼性を確保する上で重要である。
- トリファレント符号の最大サイズに関する既存の下限は十分な改善が見られない。
- 超グラフの構造を利用し,よりタイトなサイズ下限を導くことを目指す。
- トリファレント符号のサイズ $T(n)$ について,$T(n) \ge c\sqrt{n}(9/5)^{n/4}$ という,多項式的に改善された下限が示された。
- Körner-Marton構成の外側符号化段階を洗練し,ランダムに頂点集合を希釈し,次数が高い頂点やBergeサイクルを除去した。
- 得られた局所的に疎な超グラフに対し,VerstraeteとWilsonの定理を適用し,大きな独立集合を得ることで,追加の$\sqrt{n}$因子を実現した。
大規模言語モデルによるデッドロックフリーな通信プロトコル洗練のための仕様駆動型合成 [cs.SE, cs.AI]目的:通信プロトコルの洗練
- 分散ソフトウェアシステムにおいて,通信プロトコルの正しさは重要であり,わずかな不整合がデッドロックを引き起こす可能性がある。
- 形式仕様は厳密な保証を提供するが,プロトコル洗練を自動的に構築するサポートが限られている。
- MPST仕様とLLMを活用し,保証された洗練を生成することで,プロトコルの信頼性と安全性を向上させる。
- Syntropyは,MPST仕様とLLMを用いてプロトコル洗練を合成するフレームワークである。
- Syntropyは,95.6%-99.5%の妥当性を達成し,高い構文的正確性を維持し,多様な洗練を生成することを示した。
- 洗練の生成過程に制約を組み込むことで,生成されたバリアントが保証を満たすようにしている。
