arXiv雑要約
プログラム - 2026/08/04 公開
論文からのコード復元:HCI成果物の再実装 [cs.HC, cs.SE]目的:HCI研究成果物の再実装可能性の評価
- HCI研究の進展には,先行研究の成果の活用が不可欠である。
- 多くのHCI研究成果物のソフトウェアが公開されておらず,検証や再利用が困難である。
- 研究論文から直接ソフトウェアを再実装し,検証可能な基盤を提供する。
- 新しいAI技術を用いて,UIST論文の成果物を再実装する試みは,実現可能性を示唆した。
- 再実装されたコードは,強力な基盤として活用できる可能性が確認された。
- 本研究は,HCI研究における成果物の作成,利用,評価方法に変化をもたらす可能性がある。
ロバストな多項式Freiman-Ruzsa推論:破損した集合観測に対するシャープな持続的サブ集合BSGコンパイラ [cs.DS]目的:破損した集合観測からの構造推論
- 組み合わせ的構造の解析は,情報理論,計算複雑性,およびその他の分野で不可欠である。
- 集合の破損は,構造推論における重要な課題であり,既存手法の精度を低下させる。
- 破損にロバストな構造推論手法を開発し,正確な結果を保証すること。
- シャープな持続的サブ集合BSGコンパイラを構築し,サンプルとクエリアクセスを通じて集合の構造を推論する。
- このコンパイラは,高確率で成功し,かつ有効な出力を保証する。
- $\eta=O(K^{-1/2})$の場合,ランダム化されたFPT形式アルゴリズムが得られ,隠れた集合の近似解を効率的に出力する。
十分支持ナッシュ均衡に対する支持縮小 [cs.GT, cs.DS]目的:双行列ゲームにおける十分支持ナッシュ均衡(WSNE)を計算するための構造的手続き
- ゲーム理論は,経済学,政治学,生物学など,多様な分野で意思決定の分析に不可欠である。
- ナッシュ均衡の計算は,特に大規模ゲームにおいては計算量が膨大になる場合がある。
- WSNEを効率的に計算することで,現実的なゲーム状況における均衡点の特定を可能にする。
- 支持縮小手続きは,行プレイヤーのマキシミン戦略と列プレイヤーのマキシミン戦略の支持を交互に保持することでWSNEを求める。
- この手続きは,合理的な双行列ゲームにおいて,1/2-WSNEを決定論的な多項式時間で計算するアルゴリズムを提供する。
- さらに,この手続きは,WSNEを求めるための問い合わせアルゴリズムの効率を改善する。
機械検証によるコミットログからのデュアルライトリカバリ [cs.RO, cs.DB, cs.DC, cs.LO]目的:デュアルライトリカバリの正確な条件と保証
- 分散システムにおいて,データの整合性は重要であり,特に障害発生時のリカバリは不可欠である。
- 従来のリカバリ手法は,保証の正確な根拠や有効期限が明確でなかった。
- 障害発生時のデータ整合性を機械的に検証可能な理論として確立すること。
- 本研究では,Isabelle/HOLを用いて,リカバリ決定がいつ機能するかを厳密に記述した理論を構築した。
- 到達可能な事後状態が,クラッシュした側が永続的に知っていることに関して合意しても,シンクが受け入れた内容は異なる可能性があることが示された。
- シンクの受け入れ記録を参照することで,この制約から脱却可能であり,フェンシングのコストとその寿命が定理として証明された。
ノイズのあるサンプリングにおける周波数符号化 [cs.CL, cs.IT, math.IT]目的:メッセージを符号化するための周波数ベクトルの利用可能性
- DNA分子は極めて小さいため,情報の符号化に周波数ベクトルを用いることが考えられる。
- DNA配列のサンプリング数やシーケンサーのノイズが,正確な情報復元を妨げる。
- シーケンシングノイズ下においても,効率的な符号化方式を開発し,情報伝達レートを最大化する。
- 周波数ベクトルを用いた符号化において,文字列ごとの読出回数Rを用いて$\log_4 R$ビットの情報伝達が可能である。
- 低複雑度な符号化方式により,追加の条件なしで$\log_4 R$ビットを実現できることを示した。
- シーケンシングノイズは,情報伝達レートを$\log_2 \det W$で低下させるが,実用的な複雑度とのトレードオフでこれを抑制する。
AiFlow:ストリーミングLLMアプリケーションのためのバウンドバックプレッシャーを持つトークンネイティブなリアクティブオーケストレーション [cs.SE, cs.AI]目的:ストリーミングLLMアプリケーションにおけるリアクティブオーケストレーションモデル
- LLMの活用範囲拡大に伴い,複雑なワークフローの効率的な管理が不可欠となっている。
- 既存のフレームワークでは,生成処理が粗いリクエスト応答として扱われ,キュー管理やバックプレッシャー制御が不十分である。
- AiFlowは,トークンレベルでのイベント伝播とバウンドバックプレッシャーにより,ワークフローの安定性と効率性を向上させる。
- AiFlowは,LLMプロバイダー側のTTFT(Time To First Token)を変化させずに,アプリケーション全体のTTFPT(Time To First Packet Token)を70.9-94.7%削減した。
- AiFlowは,宣言された範囲内でキューの深さを維持し,アンバウンドポリシーと比較して最大キュー深さを93.7-96.5%削減した。
- 型安全性,状態の並行性,注入互換性に関する静的検証を提供し,信頼性の高いワークフロー構築を支援する。
ヤガー確率分布否定に対する情報理論的考察 [cs.IT, cs.AI, math.IT, math.PR]目的:ヤガー確率分布否定とその一般化に関する情報理論的分析
- 確率分布の否定は,不確実性や曖昧性を取り扱う上で重要な概念である。
- 既存の確率分布否定の定義は,理論的な根拠が十分でない場合がある。
- ヤガーの否定が,情報理論的な基準において最も自然で原理的な定義であることを示す。
- 本研究では,情報理論および主要化理論のツールを用いて,ヤガーの否定の様々な性質を統一的に説明した。
- ヤガーの否定が,既存の定義を拡張し,強化するものであることを理論的に示した。
- ヤガーの否定が,様々な情報理論的基準の下で,確率分布否定の最も適切な定義であることの強力な理論的根拠を提供した。
シンプレクティック・バーンズ=ウォールGKP符号:決定論的O(N log^2 N)デコーディングと対数レートスケーリング [cs.AR, cs.MM, cs.CY, cs.RO, cs.SY, eess.SY, math.OC, cs.IT, math.IT, quant-ph]目的:バーンズ=ウォール格子を用いた多モードGKP符号の構成
- 量子情報処理において,量子エラー訂正は信頼性の高い量子計算実現の鍵である。
- GKP符号は強力だが,効率的なデコーディングアルゴリズムとレートスケーリングが課題であった。
- 決定論的かつ効率的なデコーディングと,対数レートのスケーリングを実現すること。
- シンプレクティックな実現により,符号レートR = (1/2)log₂Nを持つGKP符号族を構築した。
- O(N log² N)の決定論的デコーダーが実現可能であり,効率的なエラー訂正を可能にする。
- 非局所的なモジュラ接続をサポートするプラットフォームにおけるGKPエラー訂正のパラダイムを提供する。
ビジネス間会議スケジュールにおけるコンパクトなSAT/MaxSATエンコーディングとアイドル時間バランス [cs.RO, cs.LO]目的:ビジネス間会議スケジュールの効率的なエンコーディング手法
- ビジネス会議の効率的なスケジュールは,生産性向上に不可欠であり,複雑な制約条件を満たす必要がある。
- 従来のSAT/MaxSATエンコーディングは,変数数や節数が多く,計算コストが高いという課題がある。
- 本研究は,よりコンパクトなエンコーディングにより,大規模なインスタンスでも効率的に解ける手法を提案する。
- 提案手法は,既存のMaxSATエンコーディングと比較して,節数の中央値で40.3%減,ピークメモリ使用量で55.9%減を実現した。
- ドメインフィルタリングのみでも,変数の数と節数をそれぞれ24.1%,16.2%削減できることが示された。
- SATおよびMaxSAT手法は,商用ソルバーGurobiよりも低い中央値の総実行時間で,全ての公式インスタンスを解くことができた。
コードの理解度に対するパープレキシティは認知的な指標となり得るか [cs.SE]目的:コードの理解度に関する認知的な指標としてのパープレキシティの可能性
- コードの理解性は,ソフトウェア開発における重要な課題であり,開発効率や保守性に大きく影響する。
- コードの理解度を自動的に評価する手法は確立されておらず,主観的な判断に頼ることが多い。
- 大規模言語モデルのパープレキシティを活用し,客観的なコード理解度の指標を確立することを目指す。
- 単純な集計方法(平均,中央値,ピーク)では,パープレキシティと人間の理解度との間に信頼できる相関関係は見られなかった。
- パープレキシティはコード構造全体で偏りが大きく,意味のある箇所だけでなく,識別子や記号などからも高い値を示すことが原因の一つである。
- 人間の理解度ラベルに合意がない場合も多く,コード全体の難易度を正確に評価することが困難であることが示された。
P4-SpecTec:P4仕様への言語機械化フレームワークの統合 [cs.HC, cs.RO, cs.RO, cs.PL]目的:P4プログラミング言語に対する言語機械化フレームワーク
- プログラミング言語の正確な定義は,実装や形式化との一貫性を保ち,誤解を防ぐ上で不可欠である。
- 言語仕様の曖昧さや不整合は,実装との乖離を生み,言語エコシステムの信頼性を損なう可能性がある。
- P4言語仕様への機械化フレームワークの適用を通して,他の言語仕様への拡張可能性を探求する。
- P4-SpecTecを開発し,P4の型システムの機械化実行を可能にするアルゴリズム推論規則を導入した。
- P4の最新仕様を機械化し,実行可能性を活用することで,公式仕様と参照コンパイラに24個のバグを発見した。
- P4-SpecTecは,P4開発者向けの仕様ドキュメントを生成し,公式のP4仕様作成ツールチェーンとして採用されている。
Linuxにおけるオンライン故障予測の理解:補完的なマルチビュー説明可能性を通じて [cs.MA, cs.DB, cs.SE, cs.AI]目的:Linux OSにおけるオンライン故障予測パイプラインの構築と評価
- システム運用において,障害の早期発見と迅速な対応は,可用性と信頼性を維持する上で不可欠である。
- 高精度な故障予測は可能でも,その根拠が不明確な場合,運用者の信頼を得られず,実用化が難しい。
- 予測の信頼性を高め,適切な対応を支援するために,故障予測の解釈可能性を高めることを目指す。
- 厳格なクロスワークロード条件下で,再学習なしに91-94%の検出率を達成し,誤報率は1%以下に抑えられた。
- 故障モードの診断はワークロードの変化に敏感であり,特定の故障タイプに対しては診断メカニズムの効果が限定的であった。
- 故障の検出はワークロードの変化に対してより頑健であるが,未知の故障モードの診断は困難であることが示された。
実用において信頼できないのか? LLM生成コードのエラーに関する包括的研究 [cs.SE]目的:LLM生成コードにおけるエラーの分類と分析
- ソフトウェア品質向上には,人間が書いたコードのエラーモード理解が不可欠であり,同様にLLM生成コードのエラー特性把握が重要である。
- 既存研究は範囲が限定的で,特定の言語や問題,モデルに偏りがあり,エラーの普遍的な傾向が不明確である。
- LLM生成コードの品質を深く理解し,現実的な期待値を設定し,エラー軽減策を設計することを目的とする。
- エラータイプは言語やモデルによって大きく異なるものの,大規模モデルでも単純なミスを頻繁に犯すことが示された。
- 生成されたコードは,基本的な入力検証やメモリ安全性チェックを省略していることが多く,オーバーフローやセキュリティ問題のリスクがあることが確認された。
- モデル,言語,問題の難易度によるエラーの発生頻度を測定するためのラベル付きデータセットが作成された。
Vul4Py:Pythonにおける脆弱性自動修復のベンチマーク – ペア化されたエクスプロイトと機能テストによる比較 [cs.NI, cs.SE]目的:Pythonにおける脆弱性自動修復手法の比較
- PythonはWeb,データ,機械学習の基盤であり,そのセキュリティ確保は重要である。
- 既存のPythonベンチマークは,エクスプロイトまたは機能テストのみに依存し,機能回帰を見逃す可能性がある。
- エクスプロイトと機能テストの両方で検証可能なベンチマークを提供し,信頼性の高い評価を目指す。
- Vul4Pyは,60のオープンソースプロジェクトから収集された100件の実際の脆弱性を含むベンチマークである。
- ソフトウェアエージェント(OpenHands)が最も優れた結果を示し,100件の脆弱性中41件を修復した。
- ペア化されたオラクルは,エクスプロイトのみのオラクルが受け入れる119件のパッチのうち15件を却下し,信頼性を高めている。
EduPluginBench:AI生成教育プラグインの実行保証 [cs.SE, cs.AI]目的:AI生成プラグインの実行保証基準およびステージングされた承認方法
- 教育現場でのAI活用は進むが,セキュリティとプライバシーへの懸念が課題である。
- コード生成モデルが出力するプラグインの安全性と信頼性が十分に検証されていない。
- AI生成プラグインの安全性評価基準を確立し,脆弱性を早期に発見すること。
- EduPluginBenchは,1440件のプラグイン変種を対象に,セキュリティレベルP0-P4の検出率をP0-P2と比較して74.7%向上させた。
- 最新のコード生成モデルで生成された600件のプラグインでは,解析可能なものはあったものの,P0レベルの基準を満たすものは存在しなかった。
- 過去の診断実験では,事後的な修正によりP0レベルを通過するプラグインが112件見られたが,いずれも基準を満たさなかった。
設定可能なシステムの不完全な忠実度によるチューニング [eess.SY, cs.SY, cs.SE, cs.AI, cs.DB, cs.PF]目的:設定可能なシステムの性能最適化
- システム性能を向上させるためには設定の最適化が不可欠であり,その重要性は高い。
- 設定項目が多岐に渡り,設定測定には高いコストがかかるという課題がある。
- 不完全な忠実度環境下でのチューニングにより,予算を効率的に活用し,性能向上を図る。
- MFTuneは,$>10^4$個の不完全な忠実度設定空間を探索し,有用な設定を近似することで,高質な初期値を生成する。
- 実験結果から,MFTuneは83.33%のケースで既存のチューナーよりも優れた性能を示し,最大19.34%の改善を達成した。
- また,一般的に予算を大幅に節約することができた。
ハッシュテーブルに対するブレントの挿入法の解析 [cs.DS]目的:ハッシュテーブルのブレント挿入法の厳密な解析
- ハッシュテーブルは,高速なデータ検索に不可欠なデータ構造である。
- ブレント法はシンプルだが,その性能保証は形式的に分析されていなかった。
- 乱数の偏り(spoiled randomness)の問題を解決し,ブレント法の理論的な根拠を確立する。
- ブレント法では,ハッシュテーブルが100%満杯でも,ランダムなキーの検索時間の期待値はO(1)である。
- 過去に探索済みのキーに対してハッシュ関数を適用する際に生じる乱数の偏りを考慮した解析を行った。
- この解析は,確率的アルゴリズムにおける微妙な問題への対処法の好例となる。
探索空間の制御:ヒトリとビナイロパズルの解法と生成 [cs.LO]目的:ヒトリとビナイロパズルに対する解法と生成手法
- 論理パズルは,推論能力や問題解決能力の評価に利用され,AI分野における問題解決のベンチマークとして重要である。
- パズルの複雑さが増すにつれて,探索空間が指数関数的に増加し,効率的な解法を見つけることが困難となる。
- 効率的な解法と,検証可能なパズルを生成する手法を確立し,パズル解決AIの性能向上を目指す。
- 制約伝播は,バックトラッキング探索における最も効果的な最適化であり,実質的な分岐係数,探索木サイズ,および実行時間を大幅に削減する。
- ビナイロにおいては,SATベースのアプローチが,最適化されたバックトラッキング探索が解決に失敗する困難なパズルインスタンスを,低時間内で解決する。
- ヒトリにおいては,制約伝播に基づくバックトラッキング探索が最良の結果を示し,SATベースのアプローチは接続性チェックに時間を費やす。
最小 Steiner 点木に対する正確なアルゴリズム [cs.CG, cs.DS]目的:最小 Steiner 点数を伴う木構造の最適解の算出
- ネットワーク設計や配置問題において,重要な最適化問題である。
- Steiner 点の数が多くなると計算量が指数関数的に増加する。
- Steiner 点数を最小化する効率的なアルゴリズムを開発する。
- 異なる距離尺度において,最適解を $n^{O(n)}$ 時間で算出する正確なアルゴリズムを提案した。
- 各 Steiner 木のトポロジー,分岐座標,およびセグメント数を明確に表現する手法を示した。
- 連続緩和とフラットネス再帰を用いることで,計算量の上限を $n^{O(n)}$ または $k^{O(k)}n^{O(1)}$ に制限した。
相互作用履歴を実行状態へ:長期的コーディングエージェントのためのランタイム層 [cs.SE]目的:長期的コーディングエージェントにおける実行状態の明示化
- ソフトウェア開発の自動化は,生産性向上に不可欠であり,そのためのエージェント技術が注目されている。
- 長期的なタスク実行において,エージェントは過去の情報を正確に把握し,現在の状態を推論する必要がある。
- エージェントが自身の実行状態を明示的に把握することで,無駄な処理の削減と効率化を目指す。
- Ledgerというランタイム層を導入することで,SWE-bench VerifiedインスタンスにおけるPass@1スコアがGPT-5 miniで56.2%から64.2%,MiniMax M2.5で75.8%から81.0%に向上した。
- Ledgerは,モデルへの追加呼び出しなしに,コストを28.9%と31.8%削減することに成功した。
- 実験結果から,エージェントが不足しているのは履歴の短縮化ではなく,自身の実行状態に関する明示的な記録であることが示唆された。
リード・ミューラー符号のサービスレート領域の特徴付けに関する新結果 [cs.IT, math.IT]目的:分散ストレージシステムの同時サービス能力の評価指標であるサービスレート領域の特性
- 分散ストレージシステムにおけるデータ可用性と効率的なデータアクセスは,現代のデータ管理において重要である。
- 高次のリード・ミューラー符号に対するサービスレート領域の完全な決定は困難であり,既存研究では近似解に留まっている。
- 高次のリード・ミューラー符号のサービスレート領域を正確に特徴付け,既存の近似解との差を埋めることを目指す。
- 本研究において,高次のリード・ミューラー符号に対する回復集合の交差パターンを明示的に解析した。
- m=r+1の場合に対して,サービスレート領域を正確に導出した。
- 既存の近似解よりも厳密な制約を新たに提示し,正確なサービスレート領域の多角体とのギャップを縮小した。
構造を意識したセマンティックチャンキング:タイトルチェーンプレフィックスによる1600クエリ評価とテキスト変換アブレーションにおける測定の罠 [cs.SE]目的:検索拡張生成(RAG)におけるチャンキング手法の改善
- RAGは,情報検索と自然言語生成を組み合わせた強力な手法であり,その性能はチャンキングの質に大きく左右される。
- 従来のチャンキング手法では,適切なチャンク境界の決定が難しく,検索精度が低下することがある。
- ドキュメントのヘッダー構造を活用することで,LLMの追加呼び出しなしにセマンティックチャンキングの精度を向上させる。
- 提示されたチャンキングパイプラインは,本番環境のMarkdownナレッジベースにおける1600クエリの評価で,MRR@5を大幅に向上させた。
- 特に,回答可能なサブセット(n=563)では,MRR@5が0.828から0.925へと11.7%の改善が見られた。
- タイトルチェーンプレフィックスを削除すると,アノテーター間の合意度が大幅に低下し,文脈が曖昧さの解消に不可欠であることが示された。
列サンプリングによる準線形時間固有ベクトル近似 [cs.CY, cs.HC, cs.DS, cs.NA, math.NA]目的:大規模行列の主要な固有ベクトルの近似手法
- 行列計算は,機械学習,データ分析など広範な分野で不可欠である。
- 大規模行列の固有ベクトル計算は,計算コストが高く課題となる。
- 列サンプリングにより計算量を削減し,効率的な固有ベクトル近似を実現する。
- 本研究では,対称行列から$\tilde{O}(\log n/\epsilon^4)$個の列をサンプリングするアルゴリズムを提案した。
- 提案アルゴリズムは,絶対誤差$\epsilon n$の範囲内で固有ベクトルを近似できる。
- 特に最大固有値に対応する固有ベクトルの近似では,サンプリング数を$\tilde{O}(\log n/\epsilon^2)$に削減可能である。
ロバスト最適化のための整合性・堅牢性フレームワーク:予測をロバストスケジューリングに統合 [cs.DS]目的:予測を取り入れたロバスト最適化手法の開発
- 不確実性下での意思決定において,最悪ケースを想定するロバスト最適化は重要な手法である。
- 予測情報が利用可能な場合,ロバスト最適化は過度に保守的な解となる可能性がある。
- 予測の精度とロバスト性のバランスを取り,より現実的な解を求めることを目指す。
- 提案フレームワークは,予測シナリオに対する最適解と最悪ケースに対する最適解のトレードオフを可能にする。
- 区間不確実性においては,制限付き割当や関連機械に対して$(1+1/\lambda,1+\lambda)$の整合性・堅牢性トレードオフが得られる。
- 不関連機械や予算不確実性においては,一定のトレードオフが存在しない場合があることが示された。
UAVを用いたIoTネットワークにおける連邦学習のための部分的観測伝送制御 [cs.RO, cs.IT, cs.LG, math.IT]目的:UAVを用いたIoTネットワークにおける連邦学習の伝送制御に関する研究
- IoTデバイスの普及により,分散型学習の需要が高まっており,エッジインテリジェンスが重要になっている。
- 無線帯域の共有利用による干渉や伝送の信頼性低下が,連邦学習のボトルネックとなっている。
- 部分的観測下での伝送制御により,パケット配信率を向上させ,連邦学習の性能改善を目指す。
- 提案手法は,平均パケット配信率の最大化とコンセンサスの達成を両立する公平性・コンセンサス二重最適化(FCB)を行う。
- FCB最適化は,閾値コントローラ(CTC)と電力コントローラ(FPC)で構成され,パケット配信率を効率的に改善する。
- CNNベースの連邦学習実験の結果,提案手法が既存手法と比較して,集約・学習性能を向上させることが示された。
ニューロシンボリック推論のための目標指向型論理ベース意味通信:自動運転への応用 [cs.IT, math.IT]目的:自動運転ネットワークにおけるニューロシンボリック意思決定のための,論理ベース意味通信
- 自動運転の安全性向上には,周辺環境の正確な理解と協調的な意思決定が不可欠である。
- センサー情報の伝送量には制限があり,効率的な情報伝達が課題となっている。
- 交通ルールに基づいた安全な運転判断に必要な情報のみを選択的に伝達すること。
- 提案手法は,交通ルール評価に必要な情報を優先的に送信することで,通信効率を高める。
- シミュレーション実験の結果,提案手法は安全性を確保しつつ,従来の方式では発生する衝突を回避した。
- 本研究は,カルナップとヒンティッカの理論を統計的に再解釈し,目標指向型意味情報ボトルネックを導出した。
知っていると仮定して:エージェント型AIを用いたフローポリシーの認識意味論の修正 [cs.AI, cs.CR, cs.LO, cs.PL]目的:フローポリシーの認識意味論の修正
- 情報セキュリティにおいて,プログラム内の情報フロー制御は重要な課題である。
- 情報フローの許可範囲を厳密に定義することは難しく,選択的な情報ダウングレードが問題となる。
- 既存の認識論理に基づいたフレームワークの不備を修正し,より堅牢な基盤を提供する。
- 本研究では,エージェント型AIの支援を受けて,Rocq証明支援システムを用いて修正された形式化を機械的に検証した。
- 修正されたフレームワークは,様々なポリシー仕様スタイルを比較し,既存の技術を活用した強制を可能にする簡潔さと汎用性を持つ。
- CSF 2018で発表された先行研究の形式化の曖昧さを解消し,より明確な基盤を確立した。
ドキュメント対コードパターン:LLMベースの例外オラクル生成を駆動するものは何か [eess.SY, cs.SY, cs.SE]目的:LLMベースの例外オラクル生成における予測の根拠の特定
- テスト自動化の効率化が求められており,テストオラクル生成はその重要な要素である。
- 既存のテストオラクル生成手法は,必ずしも例外処理の仕組みを正確に理解しているとは限らない。
- LLMが例外に関する情報をどのように活用しているかを明らかにすることで,より堅牢なテストオラクル生成を目指す。
- 大規模な介入実験の結果,Javadocの@throws句を削除しても精度はほとんど変化しなかった。
- モデルは,例外処理に関する構造化されたドキュメントよりも,テスト,コード,ドキュメント内のパターンに依存している可能性が示唆された。
- 一部のモデルは少数の構造的トークンに過敏に反応し,他のモデルは多くの語彙的手がかりに依存するなど,予測の根拠はモデルによって異なっていた。
人間 headcount と確率的 AI リソース容量の同時最適化 [cs.SE, econ.GN, math.OC, q-fin.EC]目的:人間 headcount と生成 AI のトークン容量の同時最適配分
- 生成 AI の導入は生産性を向上させるが,コストの不安定さが企業の財務に影響を与える。
- 従来の計画手法では,トークンの消費量の変動や AI 出力の監査コストが考慮されていない。
- 認知的な摩擦を調整した生産関数と確率的予算制約を用いて,最適配分を導くことを目指す。
- 最適な headcount と一人当たりのトークン使用量の関係が解析的に導出された。
- トークンの変動性が高まると,一人当たりのトークン使用量は増加し,headcount は減少する傾向にある。
- トークン使用量のばらつきが平均使用量に比例する場合,headcount とトークンの関係が逆転する可能性が示された。
RefactorAssist:信頼性の高いコードリファクタリングのためのエージェントによる改良 [cs.CE, cs.DC, cs.SE, cs.AI]目的:LLMによるコードリファクタリングの機能的正確性の改善
- ソフトウェア開発におけるコード品質の維持・向上が重要であり,リファクタリングはその重要な手法の一つである。
- LLMによる自動リファクタリングは潜在力を持つ一方,エラーの混入により機能変更やテスト失敗を引き起こし,実用性に課題がある。
- 本研究は,テスト結果とコンテキストを考慮したエージェントにより,LLMによるリファクタリングの信頼性を高めることを目指す。
- エラー原因分析の結果,コンテキストの誤理解や名前の変更ミス,不要な機能追加などが主な失敗要因として特定された。
- 静的解析による簡易修正と,テストログとコード差分に基づくエージェントによる反復修正を組み合わせることで,高い修復率を達成した。
- 最適な設定では,94.2%の累積パス率を記録し,LLMによるリファクタリングの実用化に近づく可能性を示唆した。
クレームプレーン:並列コーディングエージェントのための信頼性向上と選択的並行性の限界 - 30ペア,3シードによる決定論的プリライト承認の確証研究 [cs.SE]目的:並列コーディングエージェントにおける信頼性向上策の評価
- ソフトウェア開発における並列処理は,開発効率の向上が期待される重要な技術である。
- 並列処理では,複数の変更が競合し,統合に失敗する問題が発生しやすい。
- 決定論的プリライト承認によって信頼性を向上させ,並列処理の有効性を検証する。
- 静的クレームプレーンは,ペアのパス率を23.3%から50.0%に向上させた。
- しかし,静的承認は実行の96.7%をシリアル化し,信頼性の向上は主に逐次実行への移行によるものであった。
- 動的承認はより選択的であったが,未宣言のスコープによる失敗が多く,ペアのパス率は22.2%に低下した。
構文が見えないもの:動的構文不変原理と同一の隠れた仮定のいくつかの事例,そして矛盾 [cs.CR, cs.LO]目的:静的に受け入れられた結果に暗黙裡に仮定されているものを変数化し,それを削除した場合の結果を証明する方法
- 形式言語理論は,計算可能性や複雑性の理解に不可欠であり,様々な分野に応用される。
- 従来の理論では,暗黙的な仮定を見落とすことがあり,それが理論の限界となりうる。
- この研究は,暗黙的な仮定を明確にし,それらを削除することで,理論の適用範囲を広げることを目指す。
- 動的構文不変原理により,時間の経過とともに変化するシステムにおいても,静的なアクセス不能の結果が維持されることが示された。
- この手法は,暗号化,特殊相対性理論,物理法則の形式的理論,計算可能な出力など,多様な分野で有効であることが確認された。
- SAT問題への適用により,P≠NPという矛盾が導き出され,標準的な理論から導出された。
AIコーディングエージェントの行動特性からの帰属判定 [cs.SE]目的:AIコーディングエージェントによる変更の帰属
- ソフトウェア開発におけるAI利用拡大に伴い,AIエージェントの貢献度を正確に把握する必要性が高まっている。
- AIエージェントが開発者のアカウントを用いてPRを作成することで,変更の実際の作成者を特定することが困難になっている。
- 未知のエージェントを含む環境下で,AIエージェントによる変更を正確に特定する手法を確立すること。
- 提案手法AgenTagは,テキスト,行動,コードベースの特徴量を組み合わせることで,AIエージェントの帰属判定を高い精度で行うことが示された。
- PRの説明とコミットメッセージが帰属判定の主要な情報源であり,コード差分は貢献度が低いことが明らかになった。
- 自己開示マーカーを除去しても行動特性は維持され,AIエージェントの帰属判定が潜在的なスタイル特性に基づいていることが示唆された。
完全クォーテット一貫性の検証:適応的再構成,ランダム検証,および定数クエリ検証可能性 [cs.DS]目的:n個の分類群における,完全なクォーテットトポロジーシステムの,系統樹によって誘導されるか,または系統樹によって誘導されるシステムからε-遠いかを判定すること。
- 系統解析は生物学における進化関係の解明に不可欠であり,大規模データセットでの効率的な検証手法が求められている。
- 既存のクォーテットシステムの検証手法は,計算量が多く,データサイズが大きくなると現実的でなかった。
- 本研究は,効率的なクォーテットシステムの検証手法を開発し,計算量を削減することを目指す。
- 本研究では,適応的なワンサイドエラーテスターを開発し,O(n log n + ε⁻¹ log(1/δ)) のクエリ数で検証を完了できることを示した。
- キャッシュアンカー型の非適応的テスターも提案され,より多くのクエリ数が必要だが,実用的な改善をもたらすことが示された。
- 理論的な下限も導き出し,提案手法が最適に近い計算量であることを証明した。
レジストリ記述は不均一に陳腐化する:モデルコンテキストプロトコルにおけるドリフトの89日間の測定,そしてドリフト順位付け再監査がそれを覆い隠す理由 [cs.SE, cs.CR]目的:モデルコンテキストプロトコルのレジストリ記述の鮮度とドリフトの測定
- モデルコンテキストプロトコルは,セキュリティ監査において重要な役割を担う。
- レジストリ記述の鮮度を考慮したセキュリティ監査が不足している。
- ドリフト順位付け再監査の効果の限界と,より効果的な監査手法を提示する。
- レジストリ記述の陳腐化は不均一であり,ドリフトの大きいサーバーを再監査しても,記述レベルの発見を最新に保つことは困難である。
- 上位5%の再監査予算では,過去に変化したサーバーの約20%しか捉えられないのに対し,全体的な記述ドリフトでは約27%を捉えることができる。
- 記述のハッシュ値が変化した時点で再検証し,定期的なカタログ全体のスキャンを実施することが有効である。
AI技術的負債からエージェント的技術的負債へ:自律型AIシステムにおける根本原因と現れの体系的マッピング [cs.AI, cs.CR, cs.SE]目的:エージェント的AIシステムにおける技術的負債の根本原因と現れに関する体系的マッピング
- AI技術は社会実装が進んでおり,その品質確保と持続可能性が重要課題となっている。
- 従来の技術的負債のモデルは,静的なシステムを想定しており,自律型AIシステムの動的特性に対応できていない。
- 自律型AIシステム特有の技術的負債を特定し,その管理フレームワークを構築すること。
- 本研究では,従来の技術的負債をエージェント的視点から再解釈し,記憶の不整合,オーケストレーションの脆弱性などの現れを明らかにした。
- 技術的負債が,ソフトウェアだけでなく,エージェントの行動,協調メカニズム,環境との相互作用にまで及ぶことを示した。
- AIの信頼性,リスク,セキュリティ管理(AI TRiSM)への影響を分析し,持続可能性における技術的負債への示唆を得た。
評価セットに属すべきは誰か:エージェント拡張性プラットフォームにおける回帰評価セットをキュレーションするための能力分類に基づいたパイプライン [cs.LG, cs.AI, cs.SE]目的:エージェント拡張性プラットフォームにおける回帰評価セットのキュレーション
- エージェント拡張性プラットフォームの普及に伴い,高品質な回帰評価セットの維持が重要になっている。
- 各顧客固有の評価セットが流入するため,プラットフォーム側の評価セットのサイズ制限との矛盾が生じている。
- 能力分類に基づくパイプラインを構築し,回帰評価セットの品質と網羅性を最大化することを目指す。
- 能力分類に基づき,各クエリをプラットフォームが管理する分類体系にマッピングすることで,評価セットのキュレーションを自動化する。
- クエリの実行品質を評価し,既存のエントリよりも優れたテストケースを優先的に採用することで,評価セットの最適化を実現する。
- このメカニズムは分類体系に依存せず,能力分類が進化する場合にも対応可能である。
階層的ソロモノフ帰納法:無制限機械学習モデル [cs.LG, cs.AI, cs.IT, math.IT]目的:系列予測における理想的な無制限モデルの構築
- 系列データ分析は,自然言語処理や時系列予測など,様々な分野で不可欠な技術である。
- ソロモノフ帰納法は理想的だが,与えられたデータからの外挿が苦手である。
- 観測された系列に基づいて条件付け可能なハイパープライアを持つモデルを提案する。
- 階層的ソロモノフ帰納法(HSI)は,ソロモノフ帰納法(SolInd)と同等であることが証明された。
- HSIの過剰誤差は,ハイパープライアにおける生成元の複雑さに依存することが示された。
- データセットの増加に伴い,HSIの平均過剰誤差は0に収束し,最適な予測を達成する。
ステータス更新システムにおける年齢分散と高次 AoI [cs.IT, math.IT]目的:ステータス更新システムにおける時間的一貫性の尺度
- 情報鮮度を重視するシステムにおいて,情報の遅延は重要な課題である。
- 従来の AoI は最新情報に偏りがちで,情報のばらつきを捉えきれない。
- 年齢分散を用いて,情報の時間的一貫性をより正確に評価する。
- 年齢分散は,最新の2つの更新間の年齢差として定義され,その高次拡張により,より詳細な情報の一貫性を捉える。
- M/G/1/1 キューイングシステムにおいて年齢分散の特性を分析した結果,理論的な知見を得た。
- 高次年齢分散と高次 AoI の間に密接な関係があることを明らかにした。
第4象限:良性な不適合の様相 [cs.RO, cs.LG, cs.IT, math.IT]目的:線形回帰における学習データへの適合と汎化性能の関係性
- 機械学習モデルの性能評価において,学習誤差とテスト誤差の乖離は重要な課題である。
- 学習データへの過剰な適合は汎化性能の低下を招くことが知られている。
- 学習データへの適合が悪いにも関わらず,良好な汎化性能が得られる領域を明らかにする。
- 学習データサイズが特定の範囲にある場合,汎化性能の高い予測器は学習データをゼロ予測器よりも悪く適合させるという「良性な不適合」が示された。
- 有用な予測は,学習データへの過学習を避けるために,補間を超える必要があることが示された。
- 一回の通過による確率的勾配降下法(SGD)は,この範囲全体で高いテスト誤差を達成し,最適な予測器に匹敵することが確認された。
19時05分にエージェントは何を見ていたか?リアルな調査に基づいた時間的エンタープライズシナリオの生成と,エージェントの評価への再現 [cs.SE, cs.AI, cs.HC, cs.LG]目的:時間的エンタープライズシナリオの生成とエージェントの評価
- 企業AIエージェントの性能評価は重要であり,現実的な状況下での動作確認が不可欠である。
- 従来のオフライン評価は静的なスナップショットに依存しており,時間変化するデータの状況を正確に評価できない。
- 現実的な時間的変化を考慮したエンタープライズ環境を再現し,エージェントの評価を可能にすること。
- 本システムは,リアルな調査データに基づき,時間的に変化するエンタープライズ環境を生成する。
- 生成された環境は,特定の時点の状態を再現し,エージェントの評価を高速かつ再現可能に行うことができる。
- スキーマから推論された時間的記述により,レコードの過去の状態を決定的に再構築し,差分キャッシュとして保存する。
大規模LLMスキル選択における決定論的実行可能性ゲート [cs.AI, cs.CL, cs.SE]目的:LLMスキル選択における実行可能性の確認
- LLMエージェントの活用が進む中で,大規模なスキルライブラリからの適切なスキル選択が重要である。
- 意味的な関連性だけでは,現在の環境で実行不可能なスキルが選択される可能性がある。
- 実行可能性ゲートを用いて,実行不可能なスキル候補を事前に排除し,効率的なスキル選択を実現する。
- 意味的マッチングによりユーザーメッセージの約23.1%が保持された。
- 実行可能性ゲートは,マッチングされたスキル-メッセージペアの約59.4%を削減し,スキル記述トークンを大幅に削減した。
- ゲート処理により,実行不可能なスキルがモデルの選択に影響を与えることが確認された。
無線エッジLLM推論のための空間的プレフィックスキャッシュ:確率幾何と待ち行列フレームワーク [cs.IT, math.IT]目的:無線エッジ環境におけるLLM推論の高速化
- LLMの普及に伴い,エッジ環境での高速な推論が不可欠となっている。
- 地理的に分散したGPUノード間でのキャッシュ共有は遅延の増加を招く。
- 空間的な通信・キャッシュ・計算のトレードオフを最適化し,TTFTを最小化する。
- 最適なノードは必ずしも最も近いノードではなく,キャッシュプレフィックスの深さによってTTFTが非単調になる場合がある。
- 確率幾何と待ち行列理論を組み合わせたフレームワークにより,空間的特性と待ち行列の影響を分析的に評価した。
- 負荷を考慮した関連付けポリシーとキャッシュプロファイル分布の最適化により,TTFTの改善が可能となる。
q進ハミング空間における2次不一致の正確な最小化者としての完全符号 [cs.IT, math.CO, math.IT]目的:q進ハミング空間における完全符号の性質
- 符号理論は,情報伝送やデータ圧縮において不可欠であり,誤り訂正能力が重要である。
- 完全符号は,誤り訂正能力の限界に迫る理想的な符号だが,その存在条件は限られている。
- 本研究は,完全符号が2次不一致を最小化することを示すことで,完全符号の存在判定に貢献する。
- Stolarskyの不変原理に基づき,2次不一致をエネルギー最小化問題として捉えている。
- 固定されたハミング空間と位数において完全符号が存在する場合,それらは正確に不一致の最小化者である。
- 完全符号の存在が,明示的な変分ターゲットの達成と同値であることが示された。
Themis:機械を所有するファイルシステムモデルチェッカー [cs.OS, cs.SE]目的:ファイルシステムにおけるバグ検出
- ファイルシステムはOSの中核であり,その安定性はシステム全体の信頼性に不可欠である。
- 既存のファイルシステムテストは網羅性に欠け,潜在的なバグを見落とす可能性がある。
- Themisは高速な状態スナップショットと正確な時間制御により,従来法では検出困難なバグを発見する。
- Themisは,ベアメタルハイパーバイザー上で動作し,仮想ブロックデバイスと仮想クロックを制御することで,高速な状態コピーを実現した。
- 実機ext2環境において,書き込み処理を9マイクロ秒で完全にロールバックできることを実証した。
- Themisを用いて,Y2038問題に関連する128バイトinodeクランプのバグを検出した。
主イデアル符号におけるMDS軌道のSchur-Plucker幾何 [cs.IT, math.IT, math.NT]目的:主イデアル符号に対するMDS軌道のSchur-Plucker幾何
- 符号理論は,情報伝送やデータ保存における信頼性を確保する上で重要である。
- MDS符号の構成や性質は十分に理解されているとは言えず,効率的な符号化・復号が課題である。
- MDS軌道の幾何学的構造を明らかにし,符号の性能向上に貢献することを目指す。
- 本研究により,正規化された最大Plucker座標が,Schur多項式と定数係数の積として表現されることが示された。
- 普遍的なMDS多項式 \(D_{n,r}\) が,Schur多項式の積として明示的に与えられ,その次数や有限体上での振る舞いが評価された。
- 閉体上では,最初の故障層の稠密な開集合が非GRS locusを持つことが示された。
自律的なモデルデプロイのための信念駆動型二重エージェント協調 [cs.SE]目的:モデルの自動デプロイ
- LLMエージェントの能力拡張には外部ツール連携が不可欠であり,多様なAIモデル活用が求められている。
- 研究成果として公開されるAIモデルをAPIとして利用可能にするにはコストと労力がかかる。
- モデル資源とツール利用可能性のギャップを埋め,自動デプロイを実現する。
- 本研究で開発したMADEは,モデルをAPIとしてデプロイする成功率が68.85%に達した。
- 既存のSWE-agentやOpenHandsと比較して,それぞれ13.93%p,44.26%p高い結果を示した。
- M2ABenchという,モデルをAPIに変換するためのベンチマークを新たに公開した。
未知リンク関数を持つ単一指数モデルに対する活性回帰 [cs.DS, cs.LG]目的:単一指数モデルにおける活性回帰の近似解法
- 機械学習や統計モデリングにおいて,高次元データへの適用が重要視されている。
- リンク関数が未知の場合,従来の活性回帰手法では性能が低下する問題がある。
- 未知のリンク関数を持つ単一指数モデルにおける活性回帰の効率的な解法を開発する。
- 提案手法は,$(1+\epsilon)$-近似解を $O(d^{p/2\vee 1}/\epsilon^{p\vee 2}\operatorname{poly}\log(n/\epsilon))$ クエリで実現する。
- 特に,$p>2$ の場合における理論的な下限も確立され,近似精度がほぼ最適であることが示された。
- 本研究は,単一指数モデルにおける活性 $\ell_p$-回帰の未解決問題を大幅に解消する。
密な言語生成の単純化:決定論的,ランダム化,および多次のアルゴリズム [cs.DS, cs.AI, cs.CL, cs.DM, cs.LG]目的:言語生成における下限密度保証の最適化
- 言語生成は,正例から有効な文字列を学習する理論的枠組みであり,AIの発展に不可欠である。
- 既存手法では,下限密度保証の分析が複雑で,多様な重要度への対応が困難であった。
- 決定論的・ランダム化アルゴリズムによる最適化と,多次元的な重要度への対応を目指す。
- 本研究では,決定論的アルゴリズムによる最適下限密度保証を,以前の研究よりも簡潔な分析で実現した。
- ランダム化を用いることで,無知な敵に対して最適な保証を1-1/eまで向上させることが示された。
- 有限個の順序集合に対して,決定論的およびランダム化保証を同時に達成できることを示した。
文脈圧縮理論 [cs.DS, cs.AI]目的:大規模言語モデルにおける文脈圧縮の形式的分析
- AIエージェントの性能向上には,限られた文脈窓を効率的に利用する技術が不可欠である。
- 文脈圧縮は広く用いられているが,形式的な分析はほとんど行われていない。
- 文脈圧縮の理論的な限界を明らかにし,その性能評価の基準を確立すること。
- 文脈圧縮アルゴリズムを,文脈選択ゲームと文脈生成ゲームという2つのゲームとして定式化した。
- 文脈生成ゲームと一方向通信複雑度の等価性を証明し,通信複雑度の知見を文脈圧縮に応用した。
- 文脈選択ゲームが特定の一方向通信プロトコルに対応することを示し,生成と選択の効率差を明らかにした。
