arXiv雑要約
プログラム - 2026/07/30 公開
クロスモデル,クロス言語AIコーディングエージェントの性能:並列CLRSアルゴリズムの精度と速度 [cs.CE, cs.SE]目的:AIコーディングエージェントの並列コード生成能力の評価
- ソフトウェア開発におけるAIの活用が拡大しており,その性能評価が重要である。
- 並列プログラミング能力は,シリアルプログラミング能力に比べて遅れている可能性が指摘されている。
- AIコーディングエージェントの並列コード生成における言語・アルゴリズム依存性を明らかにすること。
- AIコーディングエージェントは,比較的少ないプロンプトで正しい並列実装を生成できる。
- 有意な速度向上は,アルゴリズムと言語に大きく依存する。
- Sonnet 4.6が最も優れた性能向上を示し,C++はグラフアルゴリズム,PythonとJuliaは探索アルゴリズムにおいて速度向上を達成した。
ソフトウェアエンジニアリング図における大規模言語モデル:UMLおよびERモデリングに関する系統的レビュー [cs.SE]目的:ソフトウェアエンジニアリング図,特にUMLとER図における大規模言語モデルの応用に関する研究の体系的分析
- ソフトウェア開発における可視化の重要性が増しており,図によるモデル化はその不可欠な要素である。
- 大規模言語モデルの応用は進むものの,その効果や限界に関する体系的な議論が不足している。
- UML/ER図モデリングにおける大規模言語モデルの現状を把握し,今後の課題を明確にすること。
- UMLベースのソフトウェアモデリングが中心であり,特にクラス図への注目度が高い一方で,振る舞い図やデータモデリングは十分ではない。
- 自然言語からの図の生成が主な焦点であり,変換,品質保証,整合性チェックに関する研究は限定的である。
- GPTベースのモデルが主流であり,再現性やベンダー依存性に関する懸念が生じている。標準化されたベンチマークの必要性が示唆された。
ソフトウェア設計とアーキテクチャの近年の進歩に関する文献レビュー [cs.CC, cs.SE]目的:ソフトウェア設計とアーキテクチャにおける近年の動向,課題,および将来の方向性
- 現代のソフトウェアシステムは複雑化の一途を辿っており,適切なアーキテクチャ設計が不可欠である。
- クラウド,マイクロサービス,AIといった技術の進化に対応したアーキテクチャ設計手法が不足している。
- 継続的なアーキテクチャガバナンスやインテリジェントな意思決定支援を実現する設計手法を確立する。
- 近年の研究では,従来の構造設計に加え,継続的なガバナンス,利害関係者との連携,ランタイムの可視化などが重要視されている。
- 複数のアーキテクチャ視点,継続的な監視,ドメイン駆動設計,AI支援設計技術が,拡張性,保守性,適応性,持続可能性の向上に貢献する。
- 提案手法の経験的検証の不足,セキュリティとプライバシーの統合不足,エッジコンピューティングなどの新パラダイムの探求不足といった課題が残されている。
ETCSデータのB形式言語による検証:産業パイプラインとLLM統合の設計 [cs.SE]目的:ETCSデータの検証手法
- 鉄道システムにおける安全性確保は不可欠であり,ETCSはその重要な要素である。
- ETCSデータにはエラーが含まれる可能性があり,システム全体に影響を及ぼす恐れがある。
- LLMを活用しつつ,ETCSデータの安全性を担保する検証方法を確立すること。
- 大規模言語モデル(LLM)によるETCSデータ生成・検証の可能性を,安全性認証の観点から検討した。
- B形式言語によるルールが真実の源泉であり,LLMは支援者として機能するアーキテクチャを提案した。
- 既存のツールとLLMを組み合わせた検証パイプラインを構築し,その有効性を検証している。
NISPO:オープンソースIUPAC名生成ツール [cs.SE]目的:IUPAC名の生成
- 化学構造の正確な伝達に不可欠であり,文献やデータベースでの標準的な命名法である。
- 既存のツールでは,複雑な分子構造に対する正確なIUPAC名生成が困難な場合がある。
- 高精度かつ効率的なIUPAC名生成ツールを開発し,化学情報の共有を促進すること。
- NISPOは,RDKitを基盤としたPythonパッケージであり,OpenAIのCodex(GPT-5.5モデル)を用いた自己改善ループで開発された。
- SureChEMBLの268万分子を用いて学習し,PubChemの1億300万分子のテストセットで98.1%のラウンドトリップ精度を達成した。
- NISPOはオープンソースで公開されており,誰でも自由に利用可能である(https://github.com/oxpig/nispo)。
もう一度試行し,振り返るな:ブラインドリサンプリングが小規模コードモデルにおいて自己修復を上回る [cs.SE, cs.AI, cs.LG]目的:小規模コードモデルにおける試行錯誤戦略の有効性に関する研究
- コード生成AIの性能向上は,ソフトウェア開発の自動化において不可欠である。
- 既存の自己修復手法では,失敗したコードを再提示することでモデルが過去の誤りに囚われやすい。
- ブラインドリサンプリングという新たな試行戦略が,自己修復の弱点を克服し性能を向上させる。
- ブラインドリサンプリングは,特に1.5Bおよび3Bモデルにおいて,自己修復よりも高い性能を示した。
- 7Bモデルにおいても,ブラインドリサンプリングは,他の手法と同程度の性能を維持しつつ,トークン消費量を大幅に削減した。
- モデルに自身の失敗例を提示することが,結果を悪化させる要因であり,それを避けることが重要である。
評価スコアは儚い知識の主張である [cs.HC, cs.AI, cs.CL, cs.LG, cs.SE]目的:言語モデルの評価における信頼性の過大評価問題の解決
- 言語モデルの性能評価は,AI技術の発展において不可欠であり,その信頼性はAIの安全性と応用範囲に直結する。
- 既存の評価手法では,複数の評価指標を単純に平均化することで,最も低い信頼性の指標によって評価全体の信頼性が損なわれる可能性がある。
- 評価スコアを知識の主張として捉え,その信頼性を明示的に示すことで,評価結果の解釈における誤りを防ぐ。
- 評価スコアは,形式性,範囲,有効期限という3つの特性を持つ知識の主張として扱うべきである。
- 平均化による集計は信頼性の低い指標の影響を増幅させ,評価結果を歪める可能性がある。
- HELMリーダーボードの分析により,平均スコアと弱点リンクによるランキングは全く異なる結果を示すことが明らかになった。
k-means++における中心数のランダム化 [cs.DS, cs.LG, stat.ML]目的:k-means++アルゴリズムにおける近似率の解析
- クラスタリングは,データ解析において重要な役割を果たす
- k-means++は最悪の場合,近似率がlog kに依存する
- 中心数kの変動下でのk-means++の性能向上
- 中心数kをKから2K-1の間で一様ランダムに選択する場合において,k-means++が定数確率でO(1)-近似となることが証明された。
- この結果は,予算が変動する状況下でのk-means++の性能を保証する。
数学計算のためのジェネリクスのベンチマークの進歩 [cs.PL, cs.MS, cs.SE]目的:数学計算におけるジェネリクスのコスト測定
- 科学技術計算において,ジェネリクスはコードの再利用性と保守性を高める重要な技術である。
- ジェネリクスの実装戦略は多様化しており,パフォーマンスへの影響が明確になっていない。
- 現代の言語におけるジェネリクスの性能特性を評価し,最適化の方向性を示す。
- ジェネリクスのコストは抽象化そのものに起因するのではなく,型情報の解決時期,数値表現,およびコンパイラの最適化能力に強く依存する。
- AOT(Ahead-of-Time)モノモーフィズムは,数値計算においてジェネリックコードを専門化されたコードに近づける。
- 型消去やオブジェクトベースのジェネリック演算は,特に算術演算やメモリ割り当てが多いコードにおいて,大きなオーバーヘッドをもたらす可能性がある。
マルチエージェント議論戦略:サーベイ,タクソノミー,そして課題 [cs.ET, quant-ph, cs.HC, cs.SE, cs.AI]目的:マルチエージェント議論における戦略の体系化と課題の明確化
- 大規模言語モデルの精度と頑健性を向上させる上で,エージェント間の協調が重要視されている。
- 研究が分断され,用語が統一されておらず,議論設計の次元に関する厳密な統合が見られない。
- 議論設定の設計要素を体系化し,比較可能性を高めることで,研究の進展を促す。
- 141件の主要な研究を体系的にレビューし,参加者,相互作用メカニズム,合意プロトコルという3次元のタクソノミーを導出した。
- 既存研究では,静的な完全接続トポロジー,逐語的な交換,短期記憶,投票解決戦略が慣習的に採用されていることが明らかになった。
- タクソノミーを研究状況の記述的な地図として,制御されたベンチマークの枠組みとして,機械可読なMAD仕様のスキーマとして活用可能である。
3値不確実性スコアリングによるモデル駆動型要件構成 [cs.HC, cs.SE, cs.AI]目的:LLM生成要件における論理的不整合の解消と構造適合性の確保
- 要件定義はシステム開発の根幹であり,その品質がシステムの成功を左右する。
- LLM生成要件は自然言語の柔軟性を持つ反面,構造的な誤りや論理矛盾を含む可能性がある。
- LLMの不確実性を定量化し,形式的なドメインモデル内で安全な要件エンジニアリングを実現する。
- 本システムは37件のプロジェクトビジョンに対し,構造的不整合を94.6%のケースで完全に解消した。
- 残りの2件のケースでは,反復回数の制限により0.39%の構造的エラーが未解決のまま残った。
- 3値分析の結果,全決定の24.7%が,利害関係者によって明示的に義務付けられていない裁量的な選択肢であることが判明した。
数体の不変量の形式的証明 [cs.CL, cs.DB, cs.CL, cs.LO, math.NT]目的:数体の不変量の検証
- 数体は数論の基礎であり,その性質を計算で検証することは重要である。
- 既存の検証手法では,高次数体の不変量の検証が困難であった。
- 数体のより広範な不変量の形式的検証を可能にすること。
- 数体の整数環に加え,signature,単位群,類群などの検証を形式化した。
- 判別式の検証を改善し,より高次な数体への適用を可能にした。
- LMFDBデータベースの数百件のエントリを検証し,その正当性を確認した。
コード言語モデルはテストを利用するか?テスト駆動型コード生成に関する行動的・表現的研究 [cs.SE]目的:テスト駆動型コード生成における大規模言語モデルのテストの利用状況の解明
- コード生成AIの性能向上は,ソフトウェア開発の効率化に不可欠である。
- 既存の言語モデルがテストを仕様として捉えているか,単なる文脈として扱っているか不明である。
- テストがコード生成モデルに与える影響を,行動と表現の観点から明らかにすること。
- Qwen2.5はMBPP+においてテストの利用効果が認められたが,HumanEval+とLiveCodeBenchでは効果が限定的であった。
- Qwen3.6はLiveCodeBenchにおいてテストの影響が小さく,テストの追加では精度向上が見られなかった。
- テストは表現変化を引き起こすが,それが必ずしも正確性の向上に繋がらないことが示された。
コード歪み問題 [cs.IT, cs.CC, cs.DS, math.IT, math.MG]目的:コード間の歪みを最小化する写像の発見
- 誤り訂正符号は,通信やデータストレージにおける信頼性を担保する上で重要である。
- 線形符号間の同値性判定は暗号理論に応用されるが,より一般的な類似度評価が課題である。
- 2つのコード間の歪みを定量化し,その最小歪み写像を効率的に求めることを目指す。
- 決定版コード歪み問題は,定数因子近似さえNP困難であることが示された。
- 入力コードの次元kに対して,単一指数時間でk^2近似アルゴリズムが提案された。
- 特殊なケースに対しては,(2k+1/3)^2近似アルゴリズムが提案され,その解析的限界が示された。
デプロイ済みバイトコードに対する基礎的な改良証明:トークンコストを伴って [cs.PL]目的:デプロイ済みバイトコードと高水準仕様間の改良証明の生成
- 低レベルコードと高水準振る舞いの関連性は,長年にわたりプログラミング言語研究の中心課題である。
- 従来の形式検証は,堅牢性とのトレードオフを強いられる場合がある。自動化は完全性や一般性を損なう。
- 本研究は,大規模言語モデルを用いて,デプロイ済みバイトコードの形式的な証明を現実的なコストで実現する。
- 大規模言語モデルを用いて,Ethereum Virtual Machine (EVM) 上で実行される実世界のスマートコントラクトの改良証明を生成した。
- 構築したEquiVMフレームワーク内で,MakerDAOなどの複雑なコントラクト群に対して,最小限の人間の介入で証明を完成させた。
- 基礎的な機械検証可能な証明が,トークンコストで購入可能になったという結論を得た。これにより,検証フレームワークのアーキテクチャが変化する可能性がある。
TraceCoder:位置キー断片バージョン管理による説明可能かつ監査可能なコード生成 [cs.AI, cs.SE]目的:コード生成の過程における説明可能性と監査可能性の向上
- ソフトウェア開発において,コードの品質と信頼性は不可欠であり,その自動化が求められている。
- 既存のLLMベースのコード生成は,その根拠が不明瞭で,変更履歴の追跡が困難である。
- コード生成の過程を可視化し,変更履歴を追跡することで,信頼性と説明責任を高める。
- TraceCoderは,ベンチマーク,ラウンド数,失敗テキスト,LLMの説明を記録するリレーショナルな断片履歴スキーマを導入した。
- このシステムにより,コードの変更履歴を追跡し,特定のエラーがどのコード行に影響を与えたかを特定することが可能になった。
- 30のアルゴリズムプログラミングタスクにおいて,Gemini 2.0 Flashと比較して,TraceCoderはより多くのコード断片で追跡可能な修理イベントを示した。
SARC-DQ:エージェントAIにおける実行時データ品質ゲート:隠れた証拠欠陥,無能シールド,および後処理による修正 [cs.SE, cs.AI, cs.CY]目的:エージェントAIにおける証拠データの品質問題とその対策
- AIエージェントは行動するため,データの品質が行動の正確性とコストに直結する
- AIエージェントは,自身が見えないメタデータ欠陥を検知できず,誤った行動につながる
- メタデータに焦点を当てた品質ゲートを導入し,後処理による修正で損失を回復すること
- エージェントは,メタデータ欠陥を含む証拠データから約60%の確率でコストのかかる誤った行動を起こすことが確認された。
- AIモデルの性能向上だけでは,データに対する懐疑的な姿勢は獲得されない。
- メタデータに着目した品質ゲートと後処理による修正により,カバーされる範囲において損失を完全に回復できる。
局所疎な3一様超グラフを用いたトリファレント符号の下界の多項式的改善 [cs.CL, cs.HC, cs.IT, math.IT]目的:トリファレント符号のサイズの下界の向上
- 符号理論は,情報伝送やデータ圧縮において重要な役割を果たす。誤り訂正符号はその中でも特に重要である。
- トリファレント符号のサイズの下界は,既存の結果では指数関数的な増加に留まっている。
- 本研究は,既存のKörner-Marton構成を改良し,より強い多項式的な因子を加えることで下界を向上させる。
- 本研究では,トリファレント符号の最大サイズT(n)に対し,T(n)≥c√n(9/5)^(n/4)という多項式的な下界を証明した。
- この証明では,3一様超グラフの頂点集合をランダムに希釈し,次数が高い頂点や Bergeサイクルを除去することで,局所疎な超グラフを得ている。
- 得られた超グラフはVerstraete-Wilsonの定理により大きな独立集合を持ち,それが符号サイズの向上に繋がっている。
ビットベクトル関係に対する最良帰納ループ不変式の新たな合成手法 [cs.PL]目的:ビットベクトルプログラムに対する最良帰納ループ不変式の合成
- プログラム解析と検証において不変式の自動合成は不可欠であり,プログラムの正確性を保証する上で重要な役割を果たす。
- 既存の合成手法は効率性に課題があり,複雑なプログラムに対して適用が困難な場合がある。
- 数学的最適化の観点から問題を再構築し,効率的なアルゴリズムを開発することで,より多くの問題を解決することを目指す。
- 本研究では,ビットベクトルプログラム向けに,格子構造を活用した戦略的な線形探索と,上位ビットから下位ビットへ貪欲法による2つの新規アルゴリズムを提案した。
- 実験結果から,提案手法は従来の抽象化やカオス的反復に基づく手法と比較して,最大で86%多くのベンチマーク問題を解決できることが示された。
- 特に,ビット幅が高い場合やk-帰納法と統合した場合に,ソルバー呼び出し回数のスケーリングが改善し,検証効果が向上した。
3以下の歪みを持つ距離的投票における感度と差分プライバシー [cs.CY, cs.GT, cs.DS]目的:距離的投票における,感度と差分プライバシーのトレードオフに関する研究
- 投票ルールは集団的意思決定の基礎であり,公平性やプライバシー保護が重要である。
- 既存の投票ルールでは,感度とプライバシー保護の両立が困難であった。
- 歪みを3以下に抑えつつ,感度と差分プライバシーを両立するルールを構築すること。
- 歪みを$3-\varepsilon$以下に抑えつつ,最悪ケースの感度を$O((\log m+1)/n)$に制限するランダム化ルールを提案した。
- 単一の当選者をサンプリングするメカニズムにおいて,歪みを$3-\varepsilon$以下に抑え,($O((\log m+\log(1/\delta)+1)/n),\delta$)-差分プライバシーを保証するルールを構築した。
- 両方の構成は,温度パラメータのみが異なる,定数サイズの候補リストに対するギブス分布を使用している。
LLMネイティブIDEにおけるセキュリティとプライバシー問題の解明 [cs.SE]目的:LLMネイティブIDEにおけるセキュリティとプライバシー問題の分類
- ソフトウェア開発効率化にLLM活用が不可欠となる中,その基盤であるIDEの安全性が重要視される。
- LLMネイティブIDEは新技術であり,セキュリティ・プライバシーに関する脆弱性が指摘される。
- 開発者が報告する問題を分析し,安全なIDE設計の指針を提示する。
- 開発者が報告する問題の多くは,LLM自体ではなく,システムレベルのデザインに起因する。
- ユーザーデータへのアクセス,無制限な自動実行などが主な問題点として特定された。
- 開発者はIDEへの不信感から,サンドボックスや手動レビューといった対策を講じている。
幾何学的な最小Kochen-Specker界限に関する証明可能な証明書 [cs.LO, quant-ph]目的:最小Kochen-Speckerベクトル系の幾何学的な非埋め込み可能性の証明可能性
- 量子力学の基礎問題解決に繋がりうるKochen-Specker定理の検証は重要である。
- 既存の証明はZ3によるもので,検証可能な証明オブジェクトを提供していない。
- 幾何学的な非埋め込み可能性を,検証可能な形で証明することを試みる。
- 実数の非埋め込み可能性に対する,多項式因数分解と有理数の和の二乗分解に基づく厳密な証明書を導入した。
- 導入した証明書は,PythonとLean 4で実装された独立したチェッカーによって検証可能である。
- 形式化の結果,既存の検証パイプラインにおける問題点(射影性条件,WLOGのケース,再現性の問題)が明らかになった。
ExplainBench:エージェントによるコードの説明の評価 [cs.SE]目的:コードエージェントが生成する説明の信頼性評価
- ソフトウェア開発におけるLLMエージェント活用が急速に進んでおり,その品質保証が重要になっている。
- 大規模なコード変更に対する手動レビューが困難なため,説明による理解が求められているが,評価基準が確立されていない。
- コードの説明の品質を定量的に比較評価するためのベンチマークを構築し,エージェントの説明の信頼性を向上させる。
- ExplainBenchは,LLMが質問に正答できるかどうかを評価することで,説明の質を数値的に比較する。
- 実験の結果,ExplainBenchはSWE-bench Verifiedとは異なるエージェントのランク付けを行い,説明の品質が重要な評価軸であることが示された。
- 説明監査エージェントを実装した結果,既存のエージェントの説明を改善でき,説明の信頼性を自動的に高められることが確認された。
ほぼ線形時間で山のプロミネンスを計算する効率的なアルゴリズム [cs.DS, cs.PF]目的:地球上の全ピークの山のプロミネンス計算
- 地形や登山において重要な指標であるプロミネンスの計算需要が増加している。
- 地球規模のDEMデータ量が増大しており,プロミネンス計算の効率化が課題となっている。
- 大規模DEMデータを用いたプロミネンス計算の高速化を実現すること。
- 提案アルゴリズムは,古典的なアルゴリズムを改良し,遠方の山の影響を考慮することで効率化を実現した。
- SRTMデータを用いた実験により,ほぼ線形時間での計算が可能であることを示した。
- 地球マッピングの精度向上に伴い,アルゴリズムの重要性が増している。
ハッシュテーブルバケットのツリー化時期:Cによるリスト,ハイブリッド,赤黒木のチェーニングの再現性のある研究 [cs.DS]目的:ハッシュテーブルのバケットが長くなった際の,リスト,ハイブリッド,赤黒木によるチェーニングの性能比較
- ハッシュテーブルは,高速なデータ検索を実現する基盤技術であり,幅広い応用分野で利用されている。
- ハッシュテーブルの性能は,バケット長に大きく依存し,長大なバケットは検索効率を低下させる。
- バケットの長さに応じて適切なチェーニング方式を選択することで,ハッシュテーブルの性能を向上させることが期待される。
- バケットが長くなると,ハイブリッド・バッチ方式よりもハイブリッド・インクリメンタル方式や常にツリー方式の方が優れた性能を示す。
- ハイブリッド・インクリメンタル方式は,JavaのHashMapの変換タイミングに近似しており,オーバーロードされたバケットに適している。
- メモリ使用量に関しては,ツリー構造のバケットはリスト構造のバケットよりも約1.7倍大きくなる。
トークンからワット時へ:最新GPUにおけるLLM推論のエネルギー推定分析 [cs.RO, cs.SY, eess.SY, cs.LG, cs.SE]目的:LLM推論のエネルギー消費量推定手法
- AIシステムの環境負荷低減は喫緊の課題であり,LLM推論時のエネルギー消費量の把握が重要である。
- 直接的なエネルギー計測は,特殊な機器や環境を必要とし,比較研究や初期設計を阻害する。
- 直接計測に頼らず,LLM推論のエネルギー消費量を分析的に推定し,比較評価を可能にすること。
- 提案手法は,パラメータスケーリング,メモリトラフィック,ハードウェア係数に基づき,NVIDIA H100 GPU上でLLM推論のエネルギー消費量を推定する。
- プロンプト処理と自己回帰デコーディングを分離し,入力トークン,出力トークン,推論リクエストごとのエネルギー推定を可能にする。
- 推定結果は,モデルサイズ,コンテキスト長,生成トークン数に応じたエネルギー消費のスケーリング特性を分析するための透明性の高い近似値を提供する。
オンライン共形予測における同時カバレッジと効率保証 [cs.LG, cs.DS]目的:オンライン共形予測における絶対的なカバレッジ違反の制御と予測集合効率の保証
- 分布シフト下での予測において,信頼性の高い予測が不可欠であるため。
- 従来のオンライン共形予測は,カバレッジ誤差や予測集合のサイズに関して問題があった。
- 動的に変化する基準線に対して,カバレッジと効率を同時に保証することを目指す。
- 本研究では,絶対的なカバレッジ違反を制御しつつ,予測集合効率を保証する統一的なオンライン学習フレームワークを提案した。
- 特に,完全な敵対的設定において,単調なリプシッツ効率目的関数に対する同時保証を導出した。
- 確率的設定や共変量依存確率的設定においても,最適なアルゴリズムを開発し,保証を示した。
一様長ジョブに対するユニークマシン優先順序スケジューリングの近似困難性 [cs.DS, cs.CC]目的:一様長ジョブに対するユニークマシン優先順序スケジューリング問題の近似困難性
- ジョブショップスケジューリングの一般化として重要であり,現実的なスケジューリング問題への応用が期待される。
- 既存のスケジューリング手法では,自明な近似しか得られず,近似アルゴリズムの限界が不明確であった。
- この研究は,一様長ジョブに対するユニークマシン優先順序スケジューリングの近似下限を厳密に定めることを目指す。
- 一様長ジョブに対するユニークマシン優先順序スケジューリングは,任意の定数因子近似がNP困難であることが証明された。
- NPが準多項式時間内に解けないと仮定すると,一様長ジョブに対するユニークマシン優先順序スケジューリングは,ある定数γ>0に対して,多対数$(\log n)^\gamma$近似も不可能である。
- これらの近似困難性は,既知の還元を用いて,対応する通信遅延スケジューリングモデルにも適用される。
MultiFixer:コーディネーター提案型マルチエージェントフレームワークによる複数箇所修正バグの修正 [cs.SE]目的:複数箇所にまたがるバグの修正
- ソフトウェアの品質向上は不可欠であり,自動プログラム修正はその効率化に貢献する。
- 既存の自動プログラム修正技術は,複数箇所を同時に修正する必要があるバグへの対応が困難である。
- 複数箇所修正バグに対応するため,大規模言語モデルを活用した新しいフレームワークを提案する。
- MultiFixerは,Defects4Jにおいて326個のバグを修正し,既存の基盤と比較して優れた性能を示した。
- 特に,マルチメソッドおよびマルチファイルにまたがるバグの修正において高い効果を発揮した。
- さらに,Claude-3.5-Sonnetと組み合わせることで,Defects4Jにおいて最高水準の修正率を達成した。
グラフk彩色における平均的な劣線形時間 [cs.DS, cs.CC, math.CO]目的:グラフk彩色問題の平均時間計算量
- グラフk彩色問題はNP困難な古典的問題であり,様々な応用分野で重要である。
- 既存研究では,平均時間計算量が$O(n^2)$が長らく最良の結果であった。
- 本研究は,グラフk彩色問題の真の平均時間計算量を明らかにすることを目指す。
- 本研究により,平均時間計算量が$k \leq n^{c'}$に対して$\Theta(nk)$となることが示された。
- 特に$k=O(1)$の場合,平均時間計算量は$n$に対して線形であり,劣線形性を示す。
- また,提案アルゴリズムの平均時間計算量が最適であることも証明された。
DAGに対するサブ二次クエリ到達可能性 [cs.DS]目的:有向非巡回グラフにおける到達可能性判定
- グラフ構造の解析は,ネットワーク分析やデータ処理など広範な分野で不可欠である。
- 有向グラフにおけるカットクエリモデルでの到達可能性問題は未解決の課題が多い。
- 有向非巡回グラフにおける到達可能性を効率的に判定するアルゴリズムを開発する。
- 本研究では,有向非巡回グラフに対して,$O(n \sqrt{n \log n})$ クエリで単一始点到達可能性を判定する決定論的アルゴリズムを提案した。
- 提案手法はトポロジカルソートに基づいている。
- また,単一始点最短経路問題にも応用可能である。
グラフが検証者:手続き間脆弱性検出のためのエージェント的強化学習 [cs.CR, cs.AI, cs.SE]目的:手続き間脆弱性検出のためのエージェント的強化学習フレームワーク
- ソフトウェアの安全性が重要視される現代において,脆弱性検出技術の高度化は不可欠である。
- 既存の脆弱性検出器は関数単位での分析に偏りがちで,複数の関数にまたがる脆弱性の検出が困難である。
- コードプロパティグラフを活用し,エージェントが自ら証拠を収集することで,より正確な脆弱性検出を実現する。
- VulAgentRLは,コードプロパティグラフを基盤としたエージェント的強化学習フレームワークであり,厳密なペアワイズ正解率で最先端のベースラインモデルを上回る性能を示した。
- このフレームワークは,ツールの利用回数を減らしつつ,分布外のデータセットやクラス不均衡下でも優れた性能を維持する。
- 教師からの知識蒸留によるポリシーの初期化は,強化学習がツール利用の行動を学習するために必要不可欠である。
準MDS符号の長さに関する上限 [cs.IT, math.IT]目的:準MDS符号の長さの上限
- 符号理論は,デジタル情報の信頼性ある伝送・保存に不可欠な分野である。
- 準MDS符号の長さの上限は,効率的な符号設計における重要な課題である。
- 本研究は,準MDS符号の長さをより厳密に評価することを目指す。
- 準MDS符号と部分空間族の対応関係を利用し,長さの問題を1-部分空間充填の上限問題に帰着した。
- 部分空間充填を部分スプレッドに帰着させることで,有限幾何学からの鋭い上限を適用することができた。
- BallらのGriesmer型の長さ上限を再導出し,特定のパラメータ領域においてよりタイトな上限を得た。
Gitリポジトリへの侵入は許さない:コミット時とリリース時のバックドア検知 [eess.SY, cs.RO, cs.SY, cs.CR, cs.SE]目的:オープンソースソフトウェアにおけるバックドア注入に対する防御機構の強化
- オープンソースソフトウェアは広く利用されているため,その安全性確保は不可欠である。
- 従来のCIパイプラインではバックドア攻撃を検知できず,手動でのレビューに依存している。
- 自動化されたバックドア検知機構をCIパイプラインとリリース検証に統合し,攻撃を阻止すること。
- Lilyは,CI互換のファジングを強化し,過去および現在のソフトウェア実行に基づく不審な動作のトリガーを検出する。
- コード変更分析とファジングデータを組み合わせることで,数百万行のコード変更の中でもバックドア箇所を特定する。
- 実験により,Lilyは高い検知精度と低い誤検知率を示し,実際のバックドア事例を防ぐことが可能であることが示された。
プルリクエストの複雑化:マージ済みのプルリクエストからコミットほどきデータセットを構築 [cs.SE]目的:複合コミットのほどきに関する学習データセットの構築
- ソフトウェア開発において,コード理解と保守性は重要であり,複雑なコミットはその阻害要因となる。
- 複合コミットはコードの理解を困難にし,適切なほどきを行うための学習データが不足している。
- オープンソースリポジトリのプルリクエストを利用し,低コストで大規模なほどきデータセットを構築する。
- 提案手法により,理想的なプルリクエストの割合が9.5%から55%へと大幅に増加した。
- 構築されたデータセットは,既存のヒューリスティックに基づくデータセットの5.7倍以上の規模である。
- 新たなデータセットは,既存の手法と統計的に異なり,学習ベースのアプローチへの影響が示唆された。
MediaWiki Code2Code検索:オープンソースソフトウェア要素のセマンティックな発見のためのニューラル検索 [cs.IR, cs.AI, cs.CL, cs.SE]目的:オープンソースソフトウェア要素のセマンティックな発見
- 大規模なコードベースの探索は,ソフトウェア開発において不可欠であり,効率的な検索システムの必要性が高まっている。
- 従来の検索手法は,クエリとコード実装の間の語彙的なギャップ,そして検索速度と精度とのトレードオフに悩まされている。
- 本研究は,セマンティックな意味に基づいてコードを検索することで,従来の検索手法の課題を克服することを目的とする。
- MediaWiki Code2Code Searchは,129万個の構造的要素をインデックス化し,計算意図に基づいた検索を可能にした。
- オフラインでのインデックス作成とCPUのみでの提供層を分離する分割ビルドアーキテクチャを採用し,低遅延性と高精度を実現した。
- 評価の結果,BM25ベースラインと比較して,P@10が0.87と0.64となり,特に名前が難読化されたタスクで優れた性能を示した。
CodeSpec:エージェントによる長期的な機能開発のための二重実行可能仕様 [cs.SE]目的:長期的な機能開発のための二重実行可能仕様
- ソフトウェア開発において,大規模なコードベースに対する自動化は生産性向上に不可欠である。
- 既存のエージェントは,複雑な機能設計において信頼性に欠け,一貫性の維持が困難である。
- 設計と実装の一貫性を保ちながら,信頼性の高い機能チェーンを構築することを目指す。
- CodeSpecは,サブ要件の意味とリポジトリのアーキテクチャを関連付けることで,信頼性の高い機能チェーンを構築する。
- アーキテクチャと動作の仕様を生成し,機能チェーンの完全性と正確性を検証することで,設計と実装の一貫性を維持する。
- FeatureBenchにおいて,DeepSeek-V4-Pro上で70.7%,55.0%,49.9%の合格率を達成し,既存のベースラインを上回る性能を示した。
マルコフ決定過程における性質に基づいた因果的抽象化 [cs.AI, cs.LO]目的:マルコフ決定過程の抽象化手法
- 意思決定モデルとして広く用いられ,複雑な問題解決に不可欠である。
- 状態空間の指数関数的な増加が,計算上のスケーラビリティを阻害する。
- 性質に基づいた因果的抽象化により,スケーラビリティ問題を解決する。
- 提案手法により,元のMDPの特性を維持した小規模な抽象化が可能となった。
- 標準的なベンチマークにおいて,ほぼ最適な方策を計算できた。
- 因果的抽象化は,関連する大規模なMDPモデルにも一般化可能である。
リポジトリレベルのコード生成のための効率的なコンテキスト選択アプローチ:MRCoder [cs.RO, cs.SE]目的:リポジトリレベルのコード生成におけるコンテキスト選択の効率化と質の向上
- 大規模言語モデルのコード生成能力は高いが,リポジトリ全体を考慮した生成は課題である。
- 既存手法では,コンテキストの冗長性や選択・圧縮の効率と質のバランスが課題となっている。
- MRCoderは,効率的かつ質の高いコンテキスト選択により,リポジトリレベルのコード生成を改善することを目指す。
- MRCoderは,Map-Reduceパラダイムを採用し,APIの一貫性と論理的類似性に基づいてコンテキストを選択する。
- CoderEvalとDevEvalのベンチマークにおいて,MRCoderは既存手法よりもコード生成の精度を向上させ,トークン消費量を30〜50%削減,推論時間を最大52%短縮した。
- 構造化されたドラフト誘導型コンテキスト選択戦略が,リポジトリレベルのコード生成の質と効率を向上させる上で重要であることが示された。
オープンソースコミュニティにおけるAI貢献ルールへのコーディングエージェントの準拠状況の初期調査 [cs.SE, cs.AI]目的:AI貢献ルールへのコーディングエージェントの準拠度
- オープンソース開発は,ソフトウェア開発の重要な基盤であり,多くのプロジェクトを支えている。
- AIによる自動生成されたコードの増加に伴い,貢献ルールが整備されているものの,その遵守状況は不明である。
- AIエージェントが貢献ルールを理解し,遵守しているかを評価し,課題を明らかにすること。
- 最新のAIエージェントは,貢献ルールを自発的に取得することはほとんどないことが判明した。
- リマインダーやルール提示,検証者のフィードバックにより,開示や検証は改善される傾向にある。
- AI禁止のレポジトリにおいて,どのような条件でもエージェントが貢献を拒否することはない。
有限体上の自己双対二重巡回符号 [cs.DC, cs.IT, math.CO, math.IT]目的:有限体上の自己双対二重巡回符号の構造と存在条件
- 符号理論は,通信や情報セキュリティにおいて誤り検出・訂正に不可欠な技術である。
- 二重巡回符号の構造解析は複雑であり,特に自己双対性の条件は不明な点が多い。
- 有限体上の自己双対二重巡回符号の存在条件を明らかにし,具体的な構成方法を提示する。
- 生成多項式の性質から,自己双対符号を生成するための必要十分条件を導出した。
- 長さ(r,r), (r,2r), (2r,r), (r,s) (gcd(r,s)=1) の場合に,自己双対二重巡回符号の構成法を提示した。
- 自己双対二重巡回符号と他の自己双対符号との関連性についても考察した。
脳腫瘍における説明可能な機械学習パイプラインのためのスケーラブルなAI駆動システム [cs.SE]目的:脳腫瘍研究における説明可能な機械学習パイプラインの構築
- AIとラディオミクスの活用が重要視される中,臨床応用の遅れが課題となっている。
- ワークフローの断片化,透明性の欠如,ユーザーニーズとの乖離が課題である。
- AIのトレーサビリティ,解釈可能性,責任ある利用を促進するプラットフォームの構築。
- 本システムは,臨床データ管理,ラディオミクス特徴抽出,機械学習推論を統合したウェブベースのプラットフォームである。
- 中間成果物の明示的な提示により,AIの透明性と解釈可能性を向上させている。
- 移植性,検証可能性,簡便な導入により,臨床応用を促進する基盤を提供する。
知識が変化する際に:RAGシステムの変態テストとミューテーション [cs.SE]目的:RAGシステムの知識変化に対する一貫性評価
- LLMの性能は外部知識に依存し,その知識は常に変化する可能性があり,信頼性確保が重要である。
- 既存の評価手法は静的なデータスナップショットに依存しており,知識変化による故障検出が困難である。
- 知識変化に対するRAGシステムの脆弱性を評価し,改善策の指針を提供すること。
- 提案手法は,11種類のミューテーションオペレーターを用いて,RAGシステムの知識変化に対する挙動を評価する。
- 実験の結果,ミューテーション違反率が4.9-10.2%に達し,知識変化に対する脆弱性が確認された。
- 提案手法のメタ評価ではF1スコアが0.927-1.000を達成し,既存のRAGAS指標(0.570)を上回った。
エクストリームスケールデータ処理のためのハイブリッドワークフロー構成:HL-LHCにおけるケーススタディ [cs.DC, cs.SE]目的:エクストリームスケールデータ処理におけるワークフロー構成の最適化
- ペタバイト級データ処理の効率化が求められる中で,計算資源の効率的な利用が重要である。
- ワークフロー構成戦略が不十分な場合,実行オーバーヘッドが大きくなり,資源利用率が低下する。
- タスクセットの粒度とシステム制約の相互作用を解析し,最適なワークフロー構成を導く。
- ハイブリッド構成戦略は,タスクセットの独立性と実行グルーピングを動的にバランスさせることで,スループットを最大3.8倍に向上させる。
- ネットワークオーバーヘッドを最大14.9倍に削減することが示された。
- スループット,I/Oコスト,CPU効率の間でトレードオフを可能にする多目的最適化関数を提案した。
外 k-平面グラフ上の問題のパラメータ複雑性 [cs.DS, cs.CC, cs.CG]目的:外 k-平面グラフ上の様々なグラフ問題のパラメータ複雑性
- グラフ理論は,ネットワーク分析や最適化問題など,様々な分野で基盤となる重要な研究領域である。
- 多くのグラフ問題は,パラメータとしてのグラフの構造(例えば,木幅)を用いると計算が困難となる場合がある。
- 外 k-平面グラフという特殊なグラフ構造において,どの問題が効率的に解けるかを明らかにすること。
- 外 k-平面グラフ上では,二項制約充足問題や散在集合問題などの一部の問題は依然として計算困難である。
- しかし,リスト彩色,容量付き支配集合,容量付き頂点被覆など,多くの問題は固定パラメータ実行可能となることが示された。
- また,外 k-平面グラフのmim-幅やカット幅などの構造的性質に関する新たな知見が得られた。
VITAL-RAG:コーディングエージェントにおける文脈割り当ての不変性競争 [cs.SE]目的:コーディングエージェントにおける文脈割り当ての効率化
- コード生成AIの発展に伴い,大規模コードリポジトリの活用が重要になっている。
- 従来のRAG手法では,冗長なコード片が文脈を圧迫し,性能低下の原因となっていた。
- 冗長性と局所情報のバランスを取り,より効果的な文脈割り当てを目指す。
- VITAL-RAGは,コードオブジェクトを正準化することで冗長性を削減し,文脈の利用効率を向上させた。
- RepoBenchにおいて,Recall@4Kを39.59%から63.67%に改善し,エビデンストークンを35.63%削減した。
- RepoClassBenchとRepoExecにおいて,最新のベースラインを上回る性能を示した。
ローカルLLMが生成・評価したコードツアーによる,未知のコードベースのデバッグにおける開発者の経験 [cs.SE]目的:未知のコードベースのデバッグにおける,ローカルLLMが生成・評価したコードツアーを通じた開発者の経験
- ソフトウェア開発において,コードの理解と修正は不可欠であり,その効率化は生産性向上に繋がる。
- 大規模なコードベースでは,開発者はコードの構造を理解するのに苦労し,デバッグに時間がかかる。
- LLMを活用したコードツアー生成によって,開発者のコード理解を支援し,デバッグ効率を改善すること。
- 開発者は,コード長に合わせた詳細度,コードの言い換え回避,視認性の高さ,指導的なトーンを好む傾向にあった。
- 開発者は,人間が書いたように見える説明を,AI生成の説明よりも信頼する傾向があった。
- オープンウェイトLLMによるツアー品質の評価には,迎合,創作,不整合といった問題が散見された。
ストリーミングモデルにおける集合の和集合のサイズの推定 [cs.DS, cs.CG]目的:集合の和集合のサイズ推定手法
- ビッグデータ処理において,データ全体をメモリに載せられない状況で,効率的な統計量の推定が重要である。
- ストリーミングデータに対する集合演算(和集合のサイズなど)の正確かつ高速な推定は困難である。
- ストリーミング環境下で,Delphic集合の和集合サイズの近似解を効率的に計算するアルゴリズムを提案する。
- 提案手法は,空間計算量が$O(R\log|\Omega|)$,更新時間が$O(R\log R\cdot\log(M/\delta)\cdot\log|\Omega|)$であるサンプリングに基づくアルゴリズムである。
- このアルゴリズムは,Kleeの測度問題や組み合わせテストのテストカバレッジ推定,DNF形式のモデルカウント問題に適用可能である。
- テストカバレッジ推定においては,時間と空間のトレードオフが存在し,空間を最適化することで,更新処理を$\mathrm{P}^{\mathrm{NP}}$で実行できる。
その場ソートにおける最小移動回数に関する上限 [cs.DS]目的:その場ソートの計算量の上限
- 効率的なソートアルゴリズムは,情報処理の基礎であり,様々な応用分野で不可欠である。
- 従来のその場ソートアルゴリズムは,比較回数と移動回数の両方において,情報理論的な下界に迫る性能が課題であった。
- 比較回数と移動回数を最小化する,新たなその場ソートアルゴリズムを開発し,理論的な限界に近づける。
- 提案アルゴリズムは,$n$個の要素をソートする際に,$n\lg n + O(n)$回の比較と,$O(n)$回の移動を,指数的に高い確率で実現する。
- 最悪の場合においても,$n\lg n + O(n\lg^{(t)}n)$回の比較と,$O(tn)$回の移動を達成し,従来のアルゴリズムよりも優れている。
- この進歩は,最適な探索性能を持つ新たな順序集合構造に大きく依存している。
GPTQ-2D:三次時間で実行される二側適応丸め [cs.DS, cs.LG]目的:二側適応丸め手法の効率化
- 量子化はモデル圧縮に不可欠であり,推論速度向上に貢献する。
- 既存手法は計算コストが高く,大規模モデルへの適用が課題である。
- 二側適応丸めにおける計算量を削減し,実用的な量子化を実現する。
- 本研究では,GPTQ-2Dという新しい手法を提案し,既存手法よりも計算量を大幅に削減した。
- GPTQ-2Dは,行列の反対角線ごとに並行して丸め処理を行うことで,計算量を四次時間から三次時間に短縮した。
- これにより,大規模モデルの効率的な量子化が可能となり,推論速度の向上が期待される。
