arXiv雑要約

プログラム - 2026/08/03 公開

  • メタファー誘導アルゴリズム操縦:LLMコード生成におけるドメイン横断的な手続き的転移 [cs.SE, cs.AI]目的:LLMコード生成におけるメタファーがアルゴリズム効率に与える影響の解明
    • LLMは自然言語の要素を活用することで汎化能力が向上するが,制御が難しい側面がある。
    • メタファーが不適切な手続きパターンを転移させ,コード生成の効率を低下させる可能性が指摘されている。
    • メタファーによるアルゴリズム操縦のメカニズムを明らかにし,検出手法を開発することを目的とする。
    • メタファーを含む指示が,モデルを非効率なアルゴリズムへと誘導することが示された。
    • MASCフレームワークを用いて,低効率なコードを誘発するメタファーの特定と分析を行った。
    • メタファーはモデルの隠れ状態を変化させ,非効率な手続き的行動のプロトタイプを活性化することが確認された。

    Link: https://arxiv.org/abs/2607.28683

  • コードは身体:再帰的進化と系統のためのエージェント所有ソフトウェアボディ [cs.SE, cs.AI]目的:エージェント所有ソフトウェアボディのアーキテクチャ
    • AIエージェントのパーソナライズが進む中で,行動原理を制御できない現状がある。
    • エージェントの将来性を左右する要素をユーザーが把握・管理できない点が課題。
    • ユーザーが所有,管理,進化させられるパーソナルエージェント基盤を提供する。
    • OurArkアーキテクチャは,アイデンティティを持つソフトウェアボディを中核とする。
    • 自己進化と系統化を通じて,人間とエージェントの共同開発を可能にする。
    • GenesisエンジンとEnochエージェントで実装され,再帰的創造と検証の有効性が示された。

    Link: https://arxiv.org/abs/2607.28691

  • 純DP連続カウントのための任意の実行列分解のコスト [cs.CR, cs.DS, math.FA]目的:純DP(差分プライバシー)の行列メカニズムにおける誤差コストの理論的限界
    • プライバシー保護技術は,データ利用と個人のプライバシー保護の両立を可能にするため重要である。
    • 既存研究では,実数値の行列分解コストの厳密な上限・下限が未確立であった。
    • 任意の有限次元の実行列分解におけるコストを評価し,最適な誤差範囲を明らかにする。
    • 実行列分解コストは,\(n\)(データサイズ)に対して\(\Theta((\log(n+1))^{3/2})\)のオーダーで増加することが証明された。
    • 純\(\eps\)-DP行列メカニズムにおける最適化された最大二乗誤差と平均二乗誤差は,共に\(\Theta(\eps^{-2}\log^{3}(n+1))\)である。
    • 低ランク範囲において,列幅の推定値\(D_k(T_n)\)がハーモニックに変化し,ホルダーの不等式を通じて分解コストに影響を与えることが示された。

    Link: https://arxiv.org/abs/2607.28703

  • CharpinのBCHコードに関する反例 [cs.IT, math.IT]目的:BCHコードの正確な最小距離の決定
    • 誤り訂正符号は,通信やデータ保存における信頼性を高める上で不可欠である。
    • BCHコードの最小距離を正確に求めることは長年の難題であり,計算量が多く実用的ではない。
    • 最小距離とBose距離の差がCharpinの予想を覆す反例を構成し,その性質を明らかにする。
    • 原始狭義BCHコードにおいて,最小距離がBose距離を厳密に上回る無限族を構築した。
    • 特に二進BCHコードにおいて,最小距離とBose距離の差がコード長の立方根として少なくとも成長することを示した。
    • これにより,Charpinの予想が誤りであることが証明された。

    Link: https://arxiv.org/abs/2607.28741

  • DragonCrawl:スケーラブルなモバイルエンドツーエンドテストのための生成型,意図ベースのフレームワーク [cs.SE, cs.AI]目的:モバイルアプリケーションの継続的回帰テスト
    • モバイルアプリの複雑化に伴い,品質保証の重要性は増している。
    • 従来のテストフレームワークは,UIの変動性や保守の負担が大きい。
    • AIを活用し,UIの脆弱性を克服した継続的な品質保証の実現。
    • DragonCrawlはGPT-4oのマルチモーダル機能を活用し,iOSとAndroidでそれぞれ91.6%と92.2%の合格率を達成した。
    • テストの導入時間は96~120時間から4時間未満に短縮され,開発者のテスト保守工数は約27年削減された。
    • UI操作とシステム状態を連携させ,エンドツーエンドの回帰テストを実現することで,安定性を維持しつつテストの脆弱性を排除した。

    Link: https://arxiv.org/abs/2607.28750

  • 大規模言語モデルを用いた拡張現実アプリケーションのためのリポジトリ認識型メタモルフィック関係生成 [cs.SE]目的:拡張現実アプリケーションのテストにおけるメタモルフィック関係の生成と改善
    • 拡張現実技術は多様な分野で活用が広がっているため,その品質保証が重要である。
    • 拡張現実アプリケーションのテストでは,動的な環境と仮想コンテンツの相互作用により,テストオラクルが定義しにくい。
    • リポジトリ情報を活用し,メタモルフィック関係を自動生成することで,テスト設計の負担を軽減することを目指す。
    • リポジトリレベルのコンテキストと推論オーケストレーションを用いることで,14,916件のメタモルフィック関係候補を生成した。
    • 階層的なコンテキスト構成が最も広いカバレッジを示し,競合する候補の調整により,信頼性の高い関係を選択した。
    • 生成されたメタモルフィック関係は論理的に妥当であり,テストアサーションに変換可能であり,実際のコードの非同値な変異を検出できることが示された。

    Link: https://arxiv.org/abs/2607.28775

  • RDFルールにおける層状否定:正しいアプローチ(拡張版) [cs.CL, cs.LO, cs.AI, cs.DB]目的:RDFルールにおける否定の適切な意味論の保証
    • RDFは,セマンティックウェブにおけるデータ表現の基盤であり,様々な応用が期待されている。
    • RDFルールとデフォルト否定を組み合わせる際,否定の順序依存性や曖昧性が問題となる場合がある。
    • 既存の方法では,RDFルールの否定を適切に処理できず,一意な推論結果を得ることが難しいという課題を解決する。
    • 本研究では,チェーン層状化という新たな条件を提案し,否定を含むRDFルールの意味論の健全性を保証する。
    • チェーン層状化は,多段階推論の解析と整合性制約の活用により,矛盾のない推論を可能にする。
    • 提案手法は,ルール適用順序に依存せず,一意で簡潔なRDFグラフを生成し,否定失敗のセマンティクスを維持する。

    Link: https://arxiv.org/abs/2607.28778

  • デジタルツインサービスのためのモデル駆動型データコントラクト [cs.SE]目的:デジタルツインにおけるデータ品質管理
    • デジタルツインは多様なデータ統合の基盤であり,その活用が重要である。
    • モデルレベルでのデータ要件の明確化が不足しており,データ品質が課題である。
    • データコントラクトによる品質管理で,信頼性の高いデジタルツインサービスを実現する。
    • データコントラクトの理論を形式的に定義し,デジタルツインアーキテクチャに組み込んだ。
    • データコントラクトを記述するためのドメイン固有言語を提案した。
    • 継続的なデータ品質監視を可能にし,デジタルツインサービスの信頼性と品質を向上させる。

    Link: https://arxiv.org/abs/2607.28803

  • エビデンス条件付き実行層によるコーディングエージェントの早すぎる確定の防止 [cs.SE]目的:コーディングエージェントにおける早すぎる確定の防止
    • ソフトウェア開発の自動化が求められる中で,コーディングエージェントの信頼性が重要となる。
    • LLMベースのコーディングエージェントは,十分な根拠なくコード変更を試みる場合がある。
    • エビデンス条件付き実行層を導入し,根拠に基づいた行動を促すことで,エージェントの性能向上を目指す。
    • ECLoopをSWE-bench Verifiedの500インスタンスで評価した結果,Pass@1が4.8〜11.8%向上した。
    • ECLoopの3つの機能がそれぞれ異なる価値を提供し,構造化されたエビデンス条件が自然言語による要約よりも優れていることが示された。
    • ECLoopは推論コストを追加せず,エージェントが無根拠な行動を回避することで,トークン消費量を最大12.1%削減した。

    Link: https://arxiv.org/abs/2607.28815

  • ターンスタイルストリーミングにおける行列分解アプローチ [cs.DS]目的:データストリームにおけるM点クエリ問題に対する解法
    • データストリーム処理は,大量のデータをリアルタイムに分析する上で不可欠である。
    • 行列分解を利用したストリーミングアルゴリズムのメモリ使用量は依然として課題である。
    • 行列分解を用いて,メモリ効率の良いストリーミングアルゴリズムを開発する。
    • 行列MがAとBへの分解を持つ場合,O(ε⁻¹||A||₂→∞||B||₁→₁ + (ε⁻¹||A||∞→∞||B||₁→₁)²/³)ワードのメモリでストリーミングアルゴリズムが実現可能である。
    • 本研究は,コルモードとムトゥクリシュナン(2005)のダイアディックアプローチを一般化し,Wangら(2013)とLuoら(2016)のCountSketchアルゴリズムの分析を簡略化・改善する。
    • 削除を伴う分位数のメモリ下限をΩ(ε⁻¹log U)ワードと示し,行列分解のノルムに関する新たな下限を確立した。

    Link: https://arxiv.org/abs/2607.28819

  • エージェントAIを用いたプロセスモデリングツール構築:PM4Py-UCMに関する経験報告 [eess.SY, cs.SY, cs.AR, cs.DC, cs.PF, cs.SE]目的:PM4Py-UCMの開発記録の分析
    • 企業モデリングは業務理解に不可欠だが,ツールが複雑で拡張が困難な場合が多い。
    • 既存の企業モデリングツールでは,ユーザーが必要とする機能が不足している場合がある。
    • AIを活用して新たな機能やツールを開発し,その信頼性を検証することを目指す。
    • AIエージェント(Claude Code)を用いて,イベントログからUCMモデルをマイニングするPM4Py-UCMを開発した。
    • 開発記録の分析から,修正作業が機能追加の2.3倍を占め,エージェントの誤りを修正するターンが約18%を占めることが判明した。
    • モデル変換の機械的な検証と,AIによるツールエンジニアリングにおける検証戦略の重要性が示された。

    Link: https://arxiv.org/abs/2607.28825

  • Cから慣用的なRustへ:シーザーの船のパラダイムに基づくエージェント翻訳 [cs.SE, cs.OS, cs.PL]目的:CからRustへの移行手法
    • C言語はシステム基盤技術として不可欠であり,性能と安定性が求められる。
    • C言語はメモリ安全性の責任が開発者にあり,バグや脆弱性の温床となりやすい。
    • 安全なRustコードへの移行を,構造化されたワークフローとして実現すること。
    • まず意味を保持したRustのベースラインを生成し,その後エージェントAIを用いて徐々に慣用的なRustに書き換える。
    • 移行の各ステップはコンパイルと振る舞いテストによって検証される。
    • iodine (12.5k SLOC)への適用により,CからRustへの信頼性のある移行が構造化された変換ワークフローであると示された。

    Link: https://arxiv.org/abs/2607.28835

  • ベンチマークは検証ではない:金融LLMアプリケーションのシステムレベルの視点 [cs.ET, cs.MA, cs.NI, cs.CL, cs.SE]目的:金融LLMアプリケーションのシステムレベル検証
    • 金融分野でのLLM活用は急速に進むが,その信頼性と安全性確保が重要課題となっている。
    • 既存の評価方法はモデル中心であり,実際のシステム運用における課題を捉えきれていない。
    • 金融LLMシステムの信頼性を確保するための,システム全体にわたる検証フレームワークを提案する。
    • 従来のベンチマーク評価のみでは,金融LLMアプリケーションの運用に適しているとは言えない。
    • データ,モデル設計,検索・生成性能,エージェントの挙動,ガバナンスなど,システム全体での検証が不可欠である。
    • 継続的なシステムレベルでの検証が,信頼性の高い金融LLMアプリケーション開発に繋がる。

    Link: https://arxiv.org/abs/2607.28840

  • CyberNeuro:プライバシー保護型エージェントワークベンチ,コホート規模の神経画像および臨床データ解析へ [cs.MA, cs.SE]目的:大規模神経画像および臨床データ解析のための,プライバシー保護型エージェントワークベンチの構築
    • 神経画像解析は精神疾患の理解と臨床応用に不可欠だが,大規模データ処理に課題がある。
    • データ準備には手作業が多く,人材や計算資源の少ない研究室では解析が困難である。
    • CyberNeuroは,自然言語による操作とプライバシー保護により,データ解析を民主化する。
    • CyberNeuroは,NeuroBenchのドメイン精度を40%から69%に向上させた。
    • WandaMindの使用により,トークン消費量をNeuroclawと比較して約10.6%に削減できた。
    • プラットフォームは,人間による検証パネルを統合し,厳格な生物医学的品質管理を可能にする。

    Link: https://arxiv.org/abs/2607.28841

  • LLM修正エージェントにおける検証証拠:合格したテストが実際にバグをテストしている割合は? [cs.CY, cs.HC, cs.SE, cs.AI]目的:LLM修正エージェントによるテスト合格時の証拠の妥当性評価
    • ソフトウェア品質向上において,自動修正技術は開発効率を飛躍的に高める可能性を秘めている。
    • LLM修正エージェントはテストに合格するが,バグを特定できていない場合がある。
    • テスト合格時の証拠の質を評価し,よりバグを特定できる修正エージェントを目指す。
    • バグを含むコード,修正候補,正解修正に対してテストを再実行し,検証証拠の役割を分類した。
    • 全イベントの約46%はバグを識別する情報を含んでおらず,ベースラインロールアウトの24%は質の低い証拠のみで修正を完了した。
    • バグコントラストフィードバックにより,質の低い証拠での完了が7.8%減少し,バグ識別証拠が7.4%増加したが,実用的な規模は不明である。

    Link: https://arxiv.org/abs/2607.28871

  • オープンソースLLM駆動型形式検証:RTL修正のためのマルチエージェントパイプライン [cs.AR, cs.LG, cs.SE]目的:RTL修正のためのマルチエージェントパイプラインの実現
    • チップ設計において検証は主要な工程であり,その効率化は重要である。
    • 形式検証ツールは高価であり,ライセンス制限も存在し,利用が制限されている。
    • オープンソースツールチェーンによる形式検証とLLMの組み合わせによるRTL修正を目指す。
    • 提案パイプラインは,ALUのケーススタディにおいて,実際の機能的なバグを検出し,形式的に修正に成功した。
    • 6つのベンチマークスイートにおいて,1つの設計は確実に修正され,4つの異なる失敗モードが特定された。
    • 本研究は実現可能性の検討であり,詳細な失敗分析とYosysのbindディレクティブに関する実用的な制限も報告する。

    Link: https://arxiv.org/abs/2607.28877

  • YazSes:オフライン,プライバシー重視,クロスプラットフォームの「話して入力」音声入力システム [cs.CR, cs.HC, cs.SE]目的:オフライン環境でのプライバシーを保護した音声入力システム
    • 音声入力技術は,情報処理の効率化に不可欠であり,様々な分野で利用が拡大している。
    • クラウド型音声入力サービスはプライバシー侵害の懸念があり,オフライン環境での利用は限定的である。
    • プライバシーを保護しつつ,オフライン環境でも利用可能な音声入力システムの実現を目指す。
    • YazSesは,Linux,macOS,Windowsで動作するオープンソースの音声入力システムである。
    • faster-whisperを用いてローカルで音声認識を行い,認識結果をアプリケーションに送信する。
    • LibriSpeechのテストで,Word Error Rateは2.59%~4.82%で,リアルタイムより高速に処理が可能である。

    Link: https://arxiv.org/abs/2607.28878

  • 機械を追加することは機械であり,削除することは人間である:LLMコード編集における削除回避の測定と軽減 [cs.CG, cs.CG, cs.SE, cs.AI, cs.LG]目的:LLMコード編集における削除回避の測定と軽減
    • 大規模言語モデルのコード生成・修正の利用が拡大する中で,保守性の低下が懸念されている。
    • LLMが生成する修正コードは,テストは通過するものの,コードベースの保守性を損なう傾向がある。
    • LLMが修正時に削除すべきコードを残してしまう「削除回避」の問題を定量化し,その対策を探る。
    • LLMは,開発者の修正と比較して,削除の再現率が最大71.7%に留まることが示された。
    • オリジナルのテストでは削除が確認されないため,LLMは削除せずにガードやフォールバックを追加する傾向が強い(Guard-and-Go)。
    • 削除を必須とするテストを追加すると,LLMの成功率が大幅に低下し,追加トレーニングによって削除回避を軽減できる可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28887

  • GPUにおけるブロック代数多重グリッド法のガレルキン積におけるデータ移動の削減 [cs.SE]目的:GPUを用いたブロック代数多重グリッド法におけるガレルキン積のデータ移動量削減
    • 偏微分方程式系を解く際,AMGは重要な役割を担う。効率的なAMG手法は計算コスト削減に繋がる。
    • AMGの計算コストはガレルキン積に支配される。特にブロック構造を持つ問題では,既存のライブラリでは効率が悪い。
    • GPU環境において,データ移動量を最小化するガレルキン積の計算手法を開発し,AMGの性能向上を目指す。
    • データ移動量を予測するモデルを構築し,その指針に基づいた共有メモリタイル化カーネルを実装した結果,可搬性のあるKokkosカーネルと比較して大幅な高速化とデータ移動量削減が確認された。
    • プロロンゲーターフィルタリングという新しい手法を導入することで,ガレルキン積のデータ移動量,粗オペレーターのフィルイン,メモリ使用量を削減し,計算時間を短縮した。
    • PETScを用いた完全GPU常駐のブロックパイプラインを構築し,スカラー展開やデバイス-ホスト間のデータ転送を排除することで,効率的なAMG計算を実現した。

    Link: https://arxiv.org/abs/2607.28891

  • 簡潔かつ高速な小型ポインタハッシュテーブル [cs.DS]目的:小型ポインタハッシュテーブルの設計と性能評価
    • ハッシュテーブルは多くのシステムの中核をなすため,効率的な実装が不可欠である。
    • 従来,高速な処理と低いメモリ消費量はトレードオフの関係にあった。
    • 本研究では,理論的な手法を応用し,メモリ使用量を削減しつつ高性能なハッシュテーブルを実現する。
    • 提案手法であるTiny Pointer Hash Tables (TPHT)は,ポインタを1バイトに圧縮し,キーをコンパクトに表現することで,高い省メモリ性と高速な処理を両立した。
    • Chained-TPHTはデータサイズ以下のフットプリントを達成し,Flattened-TPHTは単一キャッシュミス以内で処理を完結することで低遅延を実現した。
    • YCSBおよびマイクロベンチマークにおいて,既存手法と比較してメモリ使用量の削減とスループットの向上が確認された。

    Link: https://arxiv.org/abs/2607.28892

  • FutharkにおけるGPU向け高精度整数演算 [cs.SC, cs.DC, cs.PL]目的:GPUにおける中規模整数演算のブロックレベル加算,減算,乗算,除算の実装
    • GPUを用いた数値計算は科学技術計算において不可欠であり,その高速化は重要な課題である。
    • GPUの性能を最大限に引き出すためには,効率的なメモリ配置や並列化が求められる。
    • 高レベル言語で記述されたコードの性能を向上させ,GPUアーキテクチャへの最適化を支援する。
    • Futharkで記述された高レベルコードは,特定のコンパイラ改善により,C++/CUDA版やCGBNに匹敵する性能に近づくことが示された。
    • GPUレジスタメモリへの配列自動配置が,性能向上に不可欠であることが明らかになった。
    • 関数型言語の構成要素がどのようにコンパイルされるかの知見が得られ,メモリ配置や逐次化の有効性が確認された。

    Link: https://arxiv.org/abs/2607.28897

  • 画像分類のためのドメイン適応型深層結合ソースチャネル符号化 [cs.CL, cs.IT, cs.CV, eess.SP, math.IT]目的:画像分類におけるドメイン適応型深層結合ソースチャネル符号化の性能向上
    • 画像伝送において,意味情報を効率的に伝送する手法であり,低帯域幅環境下での利用が期待されている。
    • 学習データと実データ間の分布のずれにより,深層結合ソースチャネル符号化の性能が低下する可能性がある。
    • 分布のずれに対応し,ターゲットドメインにおける分類精度を向上させることを目指す。
    • 提案手法は,擬似ラベルに基づくクラスレベルの敵対的アライメントと,信頼度フィルタリングされたターゲットサンプルに対する教師ありコントラスティブ学習を組み合わせる。
    • 実験結果から,追加の推論時間ネットワークを導入することなく,ターゲットドメインの汎化性能が向上することが示された。
    • SVHN→MNISTにおいて,提案手法は10dBのCSNRで98.15%のターゲットドメイン精度を達成した。

    Link: https://arxiv.org/abs/2607.28907

  • コーディングエージェント生成検証済みコンパイラの自動テストと修正 [eess.SY, cs.SY, cs.SE]目的:検証済みコンパイラの自動テストと修正システム
    • コンパイラはソフトウェアの根幹であり,その信頼性は極めて重要である。
    • コンパイラの検証は困難であり,バグの発見と修正に多大な労力が必要となる。
    • コーディングエージェントを活用し,コンパイラのテストと修正を自動化することで効率化を図る。
    • 検証済み,チェック済み,未検証コード,仕様を含むコンパイラに特化した欠陥検出技術を開発した。
    • 欠陥が検出されると,システムはコーディングエージェントを起動して修正を行い,その妥当性を検証する。
    • Axonコンパイラを用いた評価では,報酬ハッキングの兆候は見られず,テストと修正の有効性が確認された。

    Link: https://arxiv.org/abs/2607.28928

  • STEM講義環境における学生の学習関与度をリアルタイムで測定する生体センサーネットワーク [cs.CR, cs.CV, cs.SE, eess.IV]目的:STEM教育における個々の学生の学習関与度をリアルタイムで測定・追跡すること
    • STEM教育において,学生の学習関与度は学業成績や継続学習に重要な影響を与える。
    • 従来の測定方法は,侵襲的,手動による負荷が高い,またはリアルタイムの教室利用に適さないという課題がある。
    • 倫理的・プライバシー上の制約を維持しつつ,行動的,感情的,認知的指標を捉えることで,上記課題を解決すること。
    • 本研究では,分散型センシングノードであるStudent Processing Unit (SPU) を構成する生体センサーネットワークを提案した。
    • SPUは,顔検出,視線推定,感情分析を含む完全なオンデバイス処理を実現し,個人を特定できるビデオデータがデバイス外に出ないことを保証する。
    • このシステムは,デバイス認証,セッションオーケストレーション,暗号化されたデータ取り込みのためのセキュアなバックエンドインフラストラクチャと統合されている。

    Link: https://arxiv.org/abs/2607.28944

  • チャネル知識なしの普遍的ノイズ除去 [cs.IT, eess.SP, math.IT]目的:普遍的ノイズ除去スキームの提案
    • 通信システムにおいて,ノイズは信号伝送の信頼性を大きく損なうため,効果的なノイズ除去が不可欠である。
    • 従来のノイズ除去手法は,チャネル特性の正確な知識を必要とし,その推定誤差が性能低下の原因となる。
    • チャネル知識に依存せず,信号分布の族に対して普遍的に適用可能なノイズ除去スキームを開発し,性能限界を明らかにすること。
    • 提案スキームは,信号生成源とノイズチャネルの確率分布族に対して普遍的に機能し,ベイズ包絡線との性能差の上限を導出した。
    • 信号が独立同一分布に従う可算族の場合,スキームが系列長が無限大に近づくにつれてベイズ包絡線に近づくための整合性条件を特定した。
    • 整合性条件を満たさない場合,普遍的ノイズ除去スキームがベイズ包絡線に近づくことは一般的に不可能であることを示した。

    Link: https://arxiv.org/abs/2607.28948

  • ニューラルネットワーク検証のための判定境界のマイニング [eess.SY, cs.SY, cs.RO, eess.SY, cs.SY, cs.LG, cs.LO, cs.SE]目的:ニューラルネットワークの完全検証
    • 深層学習の安全性確保が重要視される中で,ネットワークの正確な検証手法が求められている。
    • 既存の検証手法は計算コストが高く,大規模ネットワークへの適用が困難である。
    • 効率的な判定境界探索により,検証コストを削減し,大規模ネットワーク検証を可能にする。
    • 提案手法は,活性化関数を同時に分割することで,逐次的な処理の非効率性を改善する。
    • 経路の単調性を利用した効率的な探索により,検証に関係のない部分問題をスキップする。
    • 定量的な情報に基づいた境界位置の推定により,探索性能をさらに向上させている。

    Link: https://arxiv.org/abs/2607.28954

  • 手書きUMLからPlantUMLへの生成のための形式意識型報酬ループ [cs.SE]目的:手書きUML図からPlantUMLコードの生成
    • ソフトウェア設計初期段階では手書きUMLが広く利用されているが,それを解析可能な形式に変換するには手間がかかる。
    • 既存のビジョン言語モデルは,PlantUML生成を画像からテキストへの変換と捉え,構造化されたモデル生成には不向きである。
    • 解析可能なモデル表現に基づいた形式意識型報酬を用いて,モデル生成の精度向上を目指す。
    • 形式意識型報酬を用いたモデルは,従来のモデルや商用ベースラインと比較して,PlantUMLのコンパイル可能性と変換品質を向上させた。
    • クラス図においては,より強力な商用ベースラインと同等の性能を示した。
    • モデルの受容性を完全に捉えられていない現状から,モデル分析と人間による評価を組み合わせた報酬設計の必要性を示唆している。

    Link: https://arxiv.org/abs/2607.28987

  • 独立集合に対する非線形交換ダイナミクス [cs.RO, cs.IR, cs.RO, cs.DS]目的:独立集合における非線形交換ダイナミクスの理論的基礎
    • スピン系のサンプリングにおいて,運動論に基づく非線形ダイナミクスが注目されている。
    • 非線形ダイナミクスに関する基本的な理論的枠組みが不足している。
    • ハードコアモデルにおける非線形ダイナミクスの収束性とエントロピー減衰を解析する。
    • 平均場ダイナミクスと単一サイトダイナミクスが,ある程度の低密度下でほぼ線形収束することを示した。
    • 平均場ダイナミクスは臨界密度まで指数関数的に相対エントロピーが減衰することを証明した。
    • 指定された密度または周辺ベクトルを持つハードコア分布からのサンプリングのための新しいアルゴリズムを設計した。

    Link: https://arxiv.org/abs/2607.29016

  • エントロピー和積現象 [cs.IT, math.CO, math.IT, math.PR]目的:有限のシャノンエントロピーを持つ独立同一分布の離散実数値確率変数の和と積のエントロピーに関する研究
    • 情報理論において,確率変数の和と積のエントロピーは重要な研究対象であり,情報量の限界や効率を理解する上で不可欠である。
    • 和積現象の研究では,エントロピーの下限を厳密に評価することが難しく,既存の研究では十分な係数を導出できていなかった。
    • 本研究は,確率変数の和と積のエントロピーの下限をより正確に評価し,和積現象の係数を改善することを目的とする。
    • 確率変数XとX'が独立同一分布であるとき,max{H(X+X'), H(XX')} ≧ (8/7)H(X) - O(log H(X))が成り立つことが証明された。
    • この結果は,従来の知見を覆し,和積現象における係数が1より大きいことを明確に示すものである。
    • 確率変数の分布を均一化する手法を用いることで,ミニエントロピーがシャノンエントロピーより大幅に小さい場合の課題を克服し,係数を(8/7)まで向上させた。

    Link: https://arxiv.org/abs/2607.29042

  • ニューラルネットワーク検証のための先読み補題の学習 [cs.LG, cs.AI, cs.LO]目的:ニューラルネットワーク検証における性能向上
    • ニューラルネットワークの安全性確保は,自動運転や医療など,社会実装において重要である。
    • 既存の検証手法は計算コストが高く,大規模なネットワークへの適用が困難である。
    • 不安定ReLUに着目した補題を学習し,探索空間を削減することで検証効率を高める。
    • 本研究では,先読み手続きに基づく新たなフレームワークを導入し,Marabouとα-β-CROWNで検証性能を向上させた。
    • 実験の結果,既存手法と比較して,最大34%多くの事例において否定的な検証が可能となった。
    • 導入したフレームワークは,ブーリアンカットの活性化と探索空間の枝刈りに貢献している。

    Link: https://arxiv.org/abs/2607.29051

  • 幾何学的最大カバレッジ問題に対する近似アルゴリズム [eess.SY, cs.SY, cs.CG, cs.CC, cs.DS]目的:幾何学的集合系における最大カバレッジ問題の近似解法
    • 組合せ最適化問題の現実世界への応用範囲は広く,効率的な解法が求められている。
    • 最大カバレッジ問題はNP困難であり,大規模な問題に対して厳密解を求めることは困難である。
    • 幾何学的形状を扱う最大カバレッジ問題に対する高性能な近似アルゴリズムを開発する。
    • 線形2-浅いセル複雑性を持つ集合系に対し,1-1/eより良い近似率を持つ多項式時間近似アルゴリズムを提案した。
    • 定数VC次元を持つ集合系に対し,小さいkにおける(1-ε)-近似アルゴリズムを改良し,計算時間も改善した。
    • 幾何学的形状の和集合の体積を最大化する連続問題に対し,特定の形状においてより良い近似アルゴリズムを提示した。

    Link: https://arxiv.org/abs/2607.29160

  • LLMエージェントのための実行優先型合成ツール利用トレース生成 [cs.DB, cs.SE]目的:ツール拡張エージェントの学習のための大規模な教師データ生成
    • エージェント型ソフトウェア開発は,コード生成に加えてツール利用が重要であり,現実的なワークフローを学習させる必要性がある。
    • 従来のクエリ優先型データ合成では,妥当なリクエストが有効なツールシーケンスに対応しない場合があり,学習データの品質が課題となる。
    • 実行可能性を保証する形で教師データを生成し,ツール利用エージェントの性能向上を目指す。
    • 提案手法SyntheticAgentTraceQAは,ワークフロー構造の構築から実行検証までの一連の流れで,スケーラブルな教師データを生成する。
    • 生成されたデータを用いてQwenモデルをファインチューニングした結果,ツール実行の正確性,参照トレースとの一致度,回答生成性能が向上した。
    • 推論アノテーションの有無による学習方法の比較から,最終回答の質を優先する場合は推論アノテーションを除外する方が有効であることが示された。

    Link: https://arxiv.org/abs/2607.29175

  • ハッカソンにおける生成AIの利用:迅速な構築と慎重な検証 [cs.SE]目的:ハッカソンにおける生成AIの利用目的と,利用されない理由の解明
    • ソフトウェア開発の加速化が求められる現代において,ハッカソンはその有効な手段である。
    • 生成AIは開発効率向上に寄与するが,その利用状況と限界は十分に理解されていない。
    • 生成AIの利用実態を把握し,効果的な活用方法を探る。
    • 参加者は,コーディング以外にも学習,ブレインストーミング,ドキュメント作成など,多様な目的で生成AIを活用していた。
    • タスクに応じて生成AIと従来のツールを組み合わせる傾向がみられた。
    • 参加者は生成AIの出力結果を検証する習慣を持っていたが,時間制約や知識不足により,十分な検証が困難であった。

    Link: https://arxiv.org/abs/2607.29178

  • トランスパイラに対する変異的テスト:プログラムの変異一貫性による検証 [cs.SE]目的:トランスパイラのテスト手法
    • 近年,DSL利用の増加に伴い,トランスパイラはソフトウェア開発において重要な役割を担っている。
    • 既存のコンパイラテスト手法はトランスパイラには適用が難しく,テストの実施が困難である。
    • トランスパイラが出力するソースコードの変異一貫性に着目し,新たなテスト手法を提案することで,より効果的なテストを実現する。
    • 提案手法では,入力DSLプログラムに対する変異が,生成された出力コードに予測可能な構造的な変化をもたらすことを検証する。
    • 開発したツールMCP-Testerを用いてケーススタディを実施した結果,ファジングだけでは検出困難な欠陥を効果的に発見できることが示された。
    • 本研究は,トランスパイラの信頼性向上に貢献する。

    Link: https://arxiv.org/abs/2607.29247

  • Wi-Fi 8に着想を得たダウンリンクMU-MIMOのためのデータ駆動型バッテリレスチャネルサウンディング [cs.IT, cs.SY, eess.SY, math.IT]目的:Wi-Fi 8/IEEE 802.11bnに着想を得たダウンリンクMU-MIMOシステムにおけるチャネルサウンディングの最適化
    • Wi-Fi技術は現代社会の通信基盤であり,その性能向上は重要な課題である。
    • 従来のチャネルサウンディングは消費電力が高く,バッテリー駆動デバイスには不向きである。
    • バッテリレスオーバーレイを活用し,低消費電力で高信頼性のMU-MIMOシステムを実現すること。
    • パッシブリンクの追加スループットは,Wi-Fi信頼性の低下を補償する場合としない場合があり,最適な間隔が変化する。
    • パッシブオーバーレイは,従来のサウンディングのトレードオフを再構築し,システム設計の指針を提供する。
    • サイクル平均スループットを最大化するため,サウンディング間隔を最適化するクロスレイヤーモデルを提案した。

    Link: https://arxiv.org/abs/2607.29288

  • F2上の行列乗算問題に対するSAT証明:10個の`Expected-UNSAT`インスタンスは全て充足可能であり,タイプ3フリーのランク23スキーム [cs.SC, cs.LO]目的:行列乗算SATベンチマークにおける充足可能なランク23公式の解,非充足性の証明,および$\mathbb{F}_2$上のランク23スキームの構築
    • SATソルバーの性能評価において,大規模な公式を扱うことが重要であるため,ベンチマーク問題の開発が不可欠である。
    • 既存のベンチマーク問題の中には,実際には充足可能であるにも関わらず非充足であると予想されているものがあり,誤った評価につながる可能性がある。
    • この研究は,既存の`Expected-UNSAT`インスタンスが実際に充足可能であること,および新しいスキームを構築することで,ベンチマークの正確性と効率性を向上させる。
    • 10個のChallenge-2公式が全て充足可能であることが示された。これは,これまでに予想されていたものとは異なる結果である。
    • $\mathrm{GL}(3,2)^3$の等方性作用,巡回トレース対称性,および変換された加数を制約されたスロットに完全にマッチングさせることで,10個のファイルの証明を構築した。
    • Challenge 3においては,ロックされた意味的修復と$\mathbb{F}_2$上の二項恒等式を組み合わせることで,タイプ3の数がゼロである特別な加数を得た。

    Link: https://arxiv.org/abs/2607.29291

  • BRHC:静的型付けKotlin DSLによるバックエンド駆動リアクティブハイパーメディアコントロール [cs.SE]目的:バックエンド駆動リアクティブハイパーメディアコントロールの実現
    • AI支援コーディングツール普及により,Webアプリケーション開発が加速する。
    • バックエンドとフロントエンドのモデルの異質性が,複雑性と保守性の問題となる。
    • バックエンド中心のリアクティブなアーキテクチャでJavaScriptを削減し,型安全性を向上させる。
    • 提案手法により,JavaScriptの使用量をほぼゼロに抑えられた。
    • 型安全性と,フロントエンド・バックエンド間の均一なプログラミングモデルが維持された。
    • バックエンド駆動のリアクティブで信号中心のアーキテクチャが実現可能となった。

    Link: https://arxiv.org/abs/2607.29338

  • HDFSログデータ分析におけるブロック異常検知の探求 [cs.CY, econ.GN, q-fin.EC, cs.LG, cs.DC, cs.SE]目的:HDFSログデータのブロック異常検知手法
    • ビッグデータ技術の発展によりHDFS利用が増加し,分散ファイルシステムの維持管理が重要課題となっている。
    • HDFSログは非構造化データが多く,手動での異常特定は煩雑かつ時間がかかる。
    • 機械学習と自然言語処理を活用し,HDFSブロックの異常を迅速かつ正確に検知することを目指す。
    • 本研究では,過去ログの並列処理とLLM-BiLSTMハイブリッド深層学習モデルを構築し,HDFSの異常ブロック検知を実現した。
    • Kafkaを用いたストリーミングログパイプラインを構築し,リアルタイムなHDFSログブロック異常検知ソリューションを提案した。
    • このワークフローは,システム管理者による迅速な問題特定と解決を支援する。

    Link: https://arxiv.org/abs/2607.29383

  • 大規模言語モデルを用いた流体システム向けシミュレーションコード生成:モデルとプロンプティング戦略のベンチマーク [cs.LG, cs.SE]目的:流体システムのグラフ表現からシミュレーション実行コードへの自動変換
    • モデルベースの設計は,複雑なシステムの効率的な開発・分析に不可欠である。
    • 従来のコード生成手法は,専門知識や手作業による調整が必要であり,時間と労力がかかる。
    • 大規模言語モデルを活用し,流体システムのシミュレーションコード生成を自動化し,設計効率を向上させる。
    • 大規模言語モデルのコード生成能力を検証し,10個のモデルと6つのプロンプティング戦略を比較した。
    • 生成されたコードの品質評価指標と,ベンチマークシナリオを用いたシミュレーションの忠実性を分析した。
    • 最適な構成では許容可能な構文品質が得られたが,シミュレーションの忠実度には依然として課題が残る。

    Link: https://arxiv.org/abs/2607.29389

  • コンポーネントテストを超えて:自律型AIシステムの検証 [cs.IR, cs.CL, cs.AI, cs.MA, cs.SE]目的:自律型AIシステムの検証問題の特性評価
    • AI技術の発展に伴い,社会への実装が加速している。安全性や信頼性の確保が重要課題となっている。
    • 従来のコンポーネントテストでは,複雑なAIシステムの長期的な振る舞いや状況変化への対応を評価できない。
    • 自律型AIシステムの信頼性を確保するための検証手法の確立を目指す。
    • 本調査では,257の論文を分析し,行動,安全性,時間的側面,規制,多主体間の5つの次元から検証問題を体系化した。
    • 行動評価は比較的進んでいる一方,時間的妥当性,ランタイム証拠の維持,規制対応,多主体システム保証は未発達であることが示された。
    • 医療,産業,スマートモビリティの事例研究を通して,安全性確保における5つの次元の重要性を具体的に示した。

    Link: https://arxiv.org/abs/2607.29405

  • AgenticRepair: エージェント型脆弱性修復のための多面的プログラムコンテキストエンジニアリング [cs.SE, cs.AI, cs.CR]目的:脆弱性修復における多面的プログラムコンテキストエンジニアリング
    • サイバーセキュリティの重要性が増す中,脆弱性への迅速な対応が求められている。
    • 既存のエージェント型アプローチでは,セキュリティエンジニアが日常的に利用する十分なプログラムコンテキストを構築できていない。
    • コード構造,実行時情報,コミット履歴という3つのコンテキストを統合し,脆弱性修復の精度向上を目指す。
    • AgenticRepairは,3種類のLLMサブエージェントを連携させ,多面的プログラムコンテキストをエンジニアリングする。
    • SEC-Benchデータセットを用いた評価で,73%の成功率を達成し,既存の最良手法を29%上回った。
    • 3つのコンテキスト要素は互いに補完し合い,マルチエージェント構造と大規模言語モデルの能力が重要であることが確認された。

    Link: https://arxiv.org/abs/2607.29422

  • コードレビューからコード批判へ:大規模AI生成差分に対する意図,ずれ,注目点 [cs.RO, cs.SE, cs.AI]目的:AI生成コード差分における意図予測,ずれ検出,注目点特定
    • AIによるコーディングが普及し,従来のレビュー体制では対応が困難になっている。
    • 既存のAIレビューツールは,表面的な指摘に偏り,重要な問題を見落とす可能性がある。
    • AIを活用し,開発者の意図とずれを検出し,人間のレビュー効率を向上させる。
    • ARCTICは,会話ログから変更の意図を予測し,バック翻訳によって意図と出力のずれを測定する。
    • オフライン評価で,意図予測のF1スコアは0.86,ずれ検出のQWKは0.907と高い精度を示した。
    • 実験的導入の結果,ずれスコアがコードの不整合を減らし,レビュー効率が向上した。

    Link: https://arxiv.org/abs/2607.29516

  • LLM時代における学生の学習方法とスキル:「苦労を外注してスキルが得られるわけがない」 [cs.RO, cs.HC, cs.SE]目的:LLM時代における学生の研究スキル獲得に関する現状分析
    • 研究の質を維持するためには,新しい技術を適切に活用できる人材育成が不可欠である。
    • LLM等の生成AIツール利用下での学生のスキル不足が懸念されている。
    • 学生がLLMを効果的に活用し,研究スキルを習得するための教育課題を明確化すること。
    • 本研究では,研究関連のsubredditにおける1,383件の投稿を分析した結果,学生が研究スキル開発に必要な認知的な努力をAIに外注する傾向が確認された。
    • その結果,期待される成果が得られず,必要な能力も身につかない状況が明らかになった。
    • この分析は,学生がLLMと協働しながら研究を進められるよう,カリキュラム改善の第一歩となる。

    Link: https://arxiv.org/abs/2607.29519

  • AuditCoder: 監査可能なコード生成と範囲限定された修正のための責任を保持するタスクグラフ [cs.SE]目的:監査可能なコード生成と修正のためのタスクグラフ
    • コード生成の信頼性向上は,ソフトウェア開発における重要な課題である。
    • 既存のコード生成システムは,生成過程の記録を保持せず,問題箇所特定が困難である。
    • 生成過程の記録を保持し,問題箇所を特定し,修正範囲を限定することを目的とする。
    • AuditCoderは,プログラムと監査可能な生成トレースを共同で出力する。
    • APPSベンチマークにおいて,82.5~83.0%のpass@1を達成し,AgentCoderに次ぐ性能を示した。
    • 200件のAPPS記録の監査では,タスクマクロ決定とコードトレースのカバレッジが0.9725に達し,60件の失敗のうち26件で証拠に基づいたノードまたはブランチを特定し,そのうち17件の修正が成功した。

    Link: https://arxiv.org/abs/2607.29529

  • 概念モデルの理解度向上:抽象的な表記工学による改善 [cs.SE]目的:概念モデルの理解度向上のための抽象的な表記工学
    • 複雑なシステム設計において,概念モデルは不可欠であり,その設計,分析,コミュニケーションを支援する。
    • 概念モデルは,セマンティックな一貫性を保つために低レベルな構成要素に依存し,理解が困難になる場合がある。
    • 低レベルな構成要素の組み合わせを,より高レベルで意味的に透明性の高い構成要素に置き換えることを目指す。
    • 抽象的な表記工学の手法により,動的条件応答(DCR)グラフの複雑なワークフローパターンを簡潔な抽象化表現に置き換えるDeCleaRを開発した。
    • 実証的な検証の結果,DeCleaRは標準的なDCRグラフと比較して,知覚的な品質,実用的な品質,およびユーザーの好みを向上させた。
    • この研究は,個々の構成要素ではなく,構成要素の反復的な配置に着目することで,概念モデルの理解度向上に貢献する。

    Link: https://arxiv.org/abs/2607.29552

  • NLP分類器のバージョン間における行動回帰テストのためのツールAlteron [cs.SE]目的:NLPモデルのバージョン間における行動回帰の検出
    • NLPモデルの信頼性確保は,その進化と改良に伴い重要性を増している。
    • 既存の評価指標では,モデルのバージョン間での行動変化を十分に捉えきれない。
    • 継続的インテグレーションにおけるバージョン間の行動回帰を検出することを目的とする。
    • Alteronは,ラベル付きデータからテストコーパスを生成し,メタモフィック変換された入力を用いてモデルのバージョンを比較する。
    • 10種類のメタモフィック関係,4つのモデルバージョン,3回のモデル更新において,16件の行動回帰を検出した。
    • そのうち11件はリリースをブロックする重大な問題であった。従来の評価指標では検出できない変化も明らかになった。

    Link: https://arxiv.org/abs/2607.29557

  • エージェンティックエンジニアの育成:AI時代におけるカリキュラム,協調,継続学習 [cs.SE]目的:エージェンティックエンジニア育成のための教育的アーキテクチャ
    • AI技術の進化は,ソフトウェア・システム工学のあり方を大きく変えつつある。
    • AIの導入によって,エンジニアの役割が変化し,新たなスキルセットが求められている。
    • AIを活用するエンジニアの判断力や倫理観を育成するための体系的な教育の必要性。
    • 本研究では,ACCELフレームワークを提案し,エージェンティックエンジニアに求められる5つのコンピテンシー領域を提示する。
    • AI支援プログラミングの研究に基づき,人間の判断とAIの協調を促す教育方法論を提案する。
    • 自動化バイアスやスキル低下といったリスクを考慮し,システム全体の変革が必要であることを強調する。

    Link: https://arxiv.org/abs/2607.29610

  • CodeShrink:効率的なマルチモーダルコード理解のための適応的視覚圧縮 [cs.CV, cs.SE]目的:マルチモーダル大規模言語モデルにおける効率的なコード理解のための視覚圧縮手法
    • 近年の大規模言語モデルの発展に伴い,コード理解へのマルチモーダル入力の活用が注目されている。
    • コードを画像として扱う場合,画質の調整が重要だが,固定的な圧縮率では最適化が難しい。
    • 入力,タスク,モデルに応じて最適な圧縮設定を自動的に決定し,効率的なコード理解を目指す。
    • CodeShrinkは,空白領域の削減,適応的な圧縮設定,およびタスク関連性のないトークンの除去により,視覚トークンの使用量を最大71.2%削減した。
    • その結果,テキストのみの入力と同等またはそれ以上の性能を達成し,既存のテキストベースおよび視覚圧縮手法を上回った。
    • 本研究は,レイアウトの圧縮,適応的設定,および命令認識によるプルーニングの組み合わせが,マルチモーダルコード理解の効率化に貢献することを示した。

    Link: https://arxiv.org/abs/2607.29637

  • 距離の修正によるメトリック化の構造的扱いやすさの限界 [cs.RO, cs.CL, cs.HC, cs.DS]目的:メトリックとなるための辺の距離の最小修正数
    • ネットワーク分析や最適化問題において,距離に基づくグラフの構造は重要である。
    • 一般的なグラフでは,メトリック化問題はNP困難であり,効率的な解法が求められている。
    • グラフの構造的性質がメトリック化を扱いやすくする条件を明らかにすること。
    • 系列並列グラフや,有界なツリー幅を持つグラフに対して,擬多項式時間アルゴリズムが開発された。
    • この結果から,新たな長さ制限付きマルチカット問題のアルゴリズムが導き出された。
    • パス幅6以下のグラフでも,メトリック化は弱NP困難であることが示された。平面グラフも同様に困難である。

    Link: https://arxiv.org/abs/2607.29649

  • 階層的軌跡抽象化による過去の修正の再利用:コーディングエージェントへの応用 [cs.SE]目的:過去の修正履歴の再利用による,コーディングエージェントの性能向上
    • ソフトウェア開発におけるバグ修正は不可欠であり,その効率化は生産性向上に繋がる。
    • 既存の修正エージェントは各問題を独立に扱い,過去の経験を活かせないという課題がある。
    • 過去の修正履歴を再利用可能な形で抽象化し,新たな修正に活用することを目指す。
    • STAIRフレームワークを導入することで,SWE-bench Verifiedにおいて高いPass@1スコア(81.2% - MiniMax M2.5,79.2% - GPT-5)を達成した。
    • 生成された修正計画は,異なる構造のエージェント(mini-SWE-agent v2)の性能も向上させ,汎用性を示した。
    • 複数の抽象化レベルを組み合わせることで,単一レベルよりも効果が高く,抽象化されていない生の軌跡よりも優れた転移学習効果が得られた。

    Link: https://arxiv.org/abs/2607.29658

  • 1
  • 2