arXiv雑要約

AI - 2026/08/04 公開

  • 前治療CT画像からの多モーダルNSCLC生存予測のための構造的プロキシ特徴 [cs.CV, cs.AI]目的:非小細胞肺癌(NSCLC)の生存予測精度の向上
    • 肺癌は世界的に死亡原因上位であり,治療効果の層別化は依然として困難である。
    • 従来の画像特徴量は腫瘍内の不均一性を十分に捉えきれていない。
    • 腫瘍の不均一性と形態間の相互作用を捉えるプロキシ特徴を導入し,予測精度向上を目指す。
    • 提案手法は,既存の多モーダルモデルと比較して,Lung1コホートにおいてC-index 0.641,iAUC 0.731を達成した。
    • シミュレーション由来のプロキシ特徴が,従来の画像特徴量,深層学習,臨床情報に加えて,予測情報を提供することが示唆された。
    • 係数最適化分析では,最高C-index 0.662,iAUC 0.748が観察された。

    Link: https://arxiv.org/abs/2608.00446

  • CeQe:意味的証拠に基づく語彙検索の根拠付け [cs.IR, cs.AI]目的:語彙検索の精度向上
    • 情報検索において,語彙検索は基本的な技術であり,効率的な文書検索に不可欠である。
    • 従来の語彙検索は,クエリと文書の語彙のずれに弱く,関連文書を見つけられない場合がある。
    • 意味的検索結果を活用し,語彙のずれを克服することで検索精度を向上させる。
    • CE-QEは,クロスエンコーダーの関連性スコアから重要な語彙を選択し,BM25クエリに付加することで,検索精度を大幅に改善する。
    • NQ Recall@100が0.32から0.47に向上するなど,クエリと回答の語彙が異なる場合に特に効果が認められた。
    • スコア融合型CE-QE(SESF)は,クロスエンコーダーによるスコア融合を上回り,SPLADEv2やColBERTv2をnDCG@10で凌駕した。

    Link: https://arxiv.org/abs/2608.00452

  • クロス投影:建築図面における視点変化を超える幾何学的根拠付け [cs.RO, eess.SY, cs.SY, cs.CV, cs.AI, cs.CL]目的:異種建築図面における構成要素の同一性保持と幾何学の外部化の診断
    • 建築設計は,空間理解とコミュニケーションにおいて不可欠であり,その精度が重要である。
    • 従来の画像認識は視点変化を前提とするため,建築図面の断面や立面といった異種図面に対応できない。
    • 視覚言語モデルが,異なる種類の建築図面間で幾何学的な情報を正確に理解できるか検証する。
    • GPT-5.5はカテゴリー判断で82.4%のスコアを達成し,Qwen3-VL-32B-InstructとGLM-4.5Vを上回った。
    • 候補選択問題では高い性能を示す一方,自由な幾何学的ローカリゼーションは脆弱であり,特にQwenとGLMでは精度が低い。
    • カテゴリーの正答率だけでは,候補なしでの空間的信頼性を保証できず,建築図面を用いたCAD/BIMシステムへの応用には注意が必要である。

    Link: https://arxiv.org/abs/2608.00473

  • SDDMO-Bench:ストリーミングデータ駆動型動的多目的最適化のためのベンチマークスイート [cs.NE]目的:ストリーミングデータ駆動型動的多目的最適化におけるアルゴリズムの性能評価
    • 現実世界の最適化問題は複雑であり,変化する状況に適応できるアルゴリズムが不可欠である。
    • 既存のベンチマークは標準的な比較が難しく,現実的な問題設定を反映していない場合が多い。
    • 変化する状況下での多目的最適化アルゴリズムの適応性,ロバスト性,パレートフロント追跡能力を評価する標準化された環境を提供する。
    • SDDMO-Benchは,古典的な動的多目的最適化問題をストリーミング環境に変換することで,多様な非定常性,問題の複雑さ,サンプル分布の変化を再現する。
    • 5つの代表的な時間依存ベース関数と6つの分布ドリフトパターンを組み合わせることで,30のシナリオを構築し,困難で識別可能なテストケースを提供する。
    • 実験の結果,SDDMO-Benchはストリーミングデータ駆動型動的多目的最適化アルゴリズムの評価のための標準化されたベンチマークとして機能することが示された。

    Link: https://arxiv.org/abs/2608.00474

  • 自己発見対話のためのパーソナリティ支援エージェント Ekova [cs.AI, cs.HC]目的:パーソナリティ支援
    • 感情的な問題解決に加え,自己理解を深めることの重要性が認識されている。
    • 既存システムは一時的な感情緩和に偏り,長期的な自己理解の促進が不十分である。
    • 自己理解と自己表現の明確化を支援する新たなパラダイムの確立を目指す。
    • 本研究では,自己発見を目的とした中国語データセットDSDを構築した。
    • DeepSupportという多種多様なペルソナを持つシステムを,OrthoTuneを用いて学習させた。
    • Ekovaという,複数のペルソナを統合した継続的なパーソナリティ支援エージェントを開発し,既存手法を平均16.3%上回る性能を示した。

    Link: https://arxiv.org/abs/2608.00478

  • F-WANDA:大規模言語モデルの持続可能な展開のためのFisher再重み付きポストトレーニングプルーニング [cs.AI]目的:大規模言語モデルの効率的な圧縮手法
    • 大規模言語モデルの利用拡大に伴い,計算資源とエネルギー消費の削減が重要となっている。
    • 従来のポストトレーニングプルーニング手法は,性能と計算コストのトレードオフが存在した。
    • 性能劣化を抑制しつつ,計算コストを削減するプルーニング手法を提案する。
    • F-WANDAは,LLAMA-2-7Bにおいて50%のスパース化でWikiText-2のパープレキシティ6.85を達成した。
    • WANDAと同等の流暢性を維持しつつ,5-shot MMLUの精度をWANDAおよびSPARSEGPTより向上させた。
    • SPARSEGPTと比較して,プルーニングにかかる時間とエネルギー消費を大幅に削減した。

    Link: https://arxiv.org/abs/2608.00481

  • デジタルから物理への貯留計算:ダイナミクス一致によるソフトロボット貯留器の共同最適化 [cs.RO, cs.LG]目的:ソフトロボット貯留器の共同最適化
    • ソフトロボットの柔軟な非線形ダイナミクスは,時間記憶や高次元状態変換に有効であり,効率的な推論を可能とする。
    • 物理貯留器は,事前学習や共同最適化が不十分な場合が多く,デジタル貯留器と比較して性能が制限される可能性がある。
    • 高パフォーマンスなデジタル参照ダイナミクスに対する物理貯留器の事前学習による性能向上を目指す。
    • 最適化されたソフトロボット貯留器は,未最適化の貯留器と比較して,すべてのタスクとデータセットで平均相対改善率33.7%を達成した。
    • 最適化された貯留器は,デジタル参照ダイナミクスに近い性能を維持している。
    • シミュレーションによるソフトロボット貯留器において,ダイナミクスレベルでの共同最適化の実現可能性が示された。

    Link: https://arxiv.org/abs/2608.00484

  • HP-JEPA:多解像度グラフ結合埋め込み予測学習のための階層的分割 [cs.LG]目的:グラフ構造の多角的な表現獲得
    • グラフ構造データは様々な分野で活用され,その表現学習の重要性が増している。
    • 既存のグラフ表現学習は,特定の粒度のグラフ分割に依存し,多様な構造情報を捉えきれない。
    • 異なる解像度でのグラフ構造を統合し,より汎用性の高い表現学習を実現する。
    • HP-JEPAは,粗い粒度から細かい粒度へと分割されたグラフ構造を用いて表現学習を行う。
    • 複数の解像度での表現を統合することで,局所的,地域的,グローバルな構造情報を組み合わせることが可能となる。
    • 実験結果から,HP-JEPAは既存手法と比較して,多くのグラフ分類・回帰タスクにおいて高い性能を発揮することが示された。

    Link: https://arxiv.org/abs/2608.00491

  • ベイジアン反射:人工知能のための予測符号化エンジン [cs.AI, cs.LG]目的:予測符号化のアルゴリズム実装
    • 脳の計算原理である予測符号化は,人工知能への応用が期待される。
    • 予測符号化を大規模に実装するためのアルゴリズムが確立されていなかった。
    • 予測符号化に基づくスケーラブルな人工知能アルゴリズムを開発する。
    • 本研究で提案する「ベイジアン反射」は,予測符号化を数学的に厳密に実現する。
    • 近年進展したアルゴリズムを組み合わせることで,継続学習や意思決定が可能となる。
    • 気候モデル評価や素数発見など,多様な分野への応用が示された。

    Link: https://arxiv.org/abs/2608.00492

  • TaPR:フィードバック条件付きコード生成のためのテストを意識したポリシー改良 [cs.AI]目的:フィードバック条件付きコード生成におけるポリシー改良
    • コード生成AIの性能向上は,ソフトウェア開発の自動化に不可欠であり,生産性向上に貢献する。
    • 従来の強化学習では,単発の報酬に依存するため,複数ターンでの修正能力を評価しにくい。
    • 複数ターンインタラクションにおける自己修復能力を評価するフレームワークを開発し,性能向上を目指す。
    • TaPRは,実行フィードバックを各ターンのテスト合格率報酬に変換することで,ポリシーの改良を促進する。
    • LiveCodeBenchを用いた実験で,TaPRはPass@3を2.44%向上させ,特に高ヘッドルームモデルで顕著な改善が見られた。
    • ターンごとの密な報酬は,初期生成品質と複数ターンの修正能力を分離した評価を可能にする。

    Link: https://arxiv.org/abs/2608.00494

  • RadYOLO:CTおよびMRIにおける計算効率の高い3Dオブジェクト検出とセグメンテーション [cs.CL, eess.AS, cs.CV, cs.AI, cs.LG]目的:3D医療画像におけるオブジェクト検出とセグメンテーション
    • 医療画像解析は,疾患診断や治療計画において不可欠であり,精度向上が求められている。
    • 既存の深層学習モデルは計算コストが高く,リソース制約のある環境での利用が困難である。
    • 計算効率を保ちつつ,高精度な3Dオブジェクト検出とセグメンテーションを実現する手法の確立。
    • RadYOLOは,5つのCT/MRIデータセットにおいて,nnDetectionの検出性能を上回る,または同等な結果を示した。
    • 病変検出においてはnnU-Netよりも良好な性能を発揮し,大臓器の検出ではnnU-Netが優位性を示した。
    • 推論速度はnnU-Netと比較して8~46倍高速であり,CPU環境でも実用的な速度を実現した。

    Link: https://arxiv.org/abs/2608.00508

  • ベイズ分割:電力消費時系列のステートセグメンテーションのためのベイズ最適化フレームワーク [cs.AI, physics.data-an]目的:電力消費時系列のステートセグメンテーション
    • 非侵襲的負荷モニタリングにおいて,電力消費パターンの正確な把握は重要である。
    • 既存手法は,パラメータ調整の難しさや境界への依存性,評価指標の飽和といった課題を抱える。
    • 本研究は,これらの課題を解決し,効率的なセグメンテーション手法を確立することを目指す。
    • 本フレームワークは,時系列セグメンテーション,多次元評価,自動パラメータ最適化を統合している。
    • ベイズ最適化により,パラメータ探索回数を大幅に削減し,最適化時間を5700倍以上短縮した。
    • SustDataED2データセットにおいて,高い評価指標(weighted composite score 0.7149, event_F1 0.9340)を達成した。

    Link: https://arxiv.org/abs/2608.00513

  • LLMチューターにおける教育的漏洩に対する監査可能なリリース制御 [cs.CR, cs.AI, cs.CL]目的:LLMチューターにおける教育的漏洩の抑制
    • LLMの教育利用は,個別最適化された学習体験を提供できるため,教育分野での活用が期待されている。
    • LLMが意図せず解答や重要な思考プロセスを早期に開示する「教育的漏洩」が課題となっている。
    • 本研究は,教育的漏洩を抑制し,LLMチューターの安全性を高めることを目指す。
    • 厳格な仲介により,Gemini 3.5の提案における3モデル多数決による教育的漏洩のフラグを181から0に削減することに成功した。
    • ただし,仲介により有用性が低下し,581の応答を置き換える必要があった。
    • 高確度のリリース制御は,40の未見問題クラスターと480のアタックシーケンスにおける多数決フラグを42から8に減らすことができた。

    Link: https://arxiv.org/abs/2608.00515

  • 言語を越えた状態の再考と形式化:統一的な計算学習理論による説明 [cs.CL, cs.AI]目的:言語を超えた状態という言語学的概念の統一的説明
    • 言語構造の普遍性と多様性を理解する上で,文法的な状態のメカニズムは重要である。
    • 従来,状態は特定言語に固有の現象と見なされ,普遍的な理論的枠組みが欠けていた。
    • 状態を普遍的な文法メカニズムとして捉え,計算モデルによって形式化することで,その理解を深める。
    • 本研究では,状態を文法テンプレートを選択する体系的メカニズムとして捉える理論を提案した。
    • この理論は,Riffianを主要な実証的基盤とし,テンプレートベースのモジュール認知枠組みに基づいて構築された。
    • 有限集合演算に基づく学習アルゴリズムが,状態に依存する文法構成を学習・予測できることを示した。

    Link: https://arxiv.org/abs/2608.00523

  • SSTG-Nav:計量に基づいた空間・意味的トポロジーグラフによる再利用可能な物体ナビゲーション [cs.RO, cs.AI]目的:再利用可能な物体ナビゲーションのための空間・意味的トポロジーグラフ
    • サービスロボットは,長期間同じ環境で稼働するほど信頼性が求められる。
    • 従来の物体ナビゲーションは,毎回探索から始めるため,効率性に課題がある。
    • 過去の経験を活用し,ロバストな物体ナビゲーションを実現すること。
    • 提案手法SSTG-Navは,一度のサーベイを再利用可能な物体目標に変換し,複数視点からの情報を統合する。
    • 計量に基づく情報付加により,成功率(SR/SPL)が0.835/0.560から0.920/0.603に向上した。
    • 情報源を考慮した融合により,さらに成功率が向上し,Recoveryも改善された。

    Link: https://arxiv.org/abs/2608.00527

  • 複雑な劣化下における画像融合のためのテキスト誘導フローマッチング [cs.CL, cs.CV, cs.AI]目的:現実的な劣化シナリオ下における赤外・可視画像融合
    • 画像処理技術は,監視,医療,自動運転など幅広い分野で重要であり,その性能向上は社会に貢献する。
    • 劣化は画像情報を損ない,融合の質を低下させるため,劣化の影響を軽減する技術が求められている。
    • テキスト情報を活用し,劣化に合わせた動的なガイダンスにより,より高品質な画像融合を実現する。
    • 提案手法TGFusionは,劣化抑制とクロスモーダル融合を統合したテキスト誘導フローマッチングフレームワークである。
    • テキストを独立した意味ストリームとして表現し,視覚表現との双方向的な相互作用を可能にすることで,劣化の意味を動的に活用する。
    • 公的なベンチマークおよび複雑な劣化シナリオにおける実験により,知覚品質,自然さ,構造詳細の保持,赤外線顕著性の保持において優れた性能を示す。

    Link: https://arxiv.org/abs/2608.00530

  • CURE:ブロック並列推測デコーディングにおける局所的な不確実性修正 [cs.AI]目的:大規模言語モデルの推測デコーディングにおける精度低下と検証コストの軽減
    • 自己回帰型LLMの生成速度向上は重要な課題であり,推測デコーディングはその有効な手段である。
    • 既存の並列ドラフティング手法では,長文生成時に精度が低下し,検証段階での拒否率が高くなる。
    • 不確実性の高いトークンに焦点を当て,局所的な修正により検証コストを抑え,生成速度を向上させる。
    • CUREは,不確実性の高いトークンを特定し,それらを修正するための動的な修理ツリーを構築する。
    • これにより,コード生成ベンチマークにおいて,平均受容長が4.2-7.5%向上し,エンドツーエンドの速度が2.66-3.49倍に向上した。
    • CUREは標準的な並列ドラフティングフレームワークに容易に組み込むことが可能であり,計算コストと検証効率のトレードオフを調整できる。

    Link: https://arxiv.org/abs/2608.00531

  • 低リソース東南アジア言語におけるネイティブ多言語連鎖思考推論 [cs.CL, cs.AI, cs.LG]目的:低リソース東南アジア言語における数学的推論能力の向上
    • 大規模言語モデルの発展は目覚ましいが,多言語対応には課題が残る。
    • 低リソース言語では,推論過程で英語への回帰(クロスリンガル崩壊)が起きやすい。
    • 動的に生成される参照サンプルを効率的に翻訳し,言語バイアスを軽減すること。
    • 提案手法OSCDは,参照サンプルを低リソース言語の語彙空間に投影することで安定的な翻訳を実現した。
    • 参照サンプルとターゲット言語の推論トレースの埋め込みを揃えることで,クロスリンガルな表現のギャップを埋めた。
    • AIME25とHMMT25の評価により,OSCDが東南アジア言語での数学的推論能力を最大3.2倍に向上させることが示された。

    Link: https://arxiv.org/abs/2608.00533

  • エージェントによるグラフトークン推論 [cs.LG]目的:グラフ構造におけるトークン化を推論プロセスの一部として再構築すること
    • 科学や産業界において,引用ネットワークや製品共同購入グラフなど,関係性データはグラフとして広く用いられている。
    • 従来のグラフトークン利用法は静的で,モデルがターゲットを見る前に定義されたグラフ構造を一度だけエンコードする点が課題であった。
    • モデルが段階的にグラフ構造を理解し,トークン化を動的に行うことで,より高度な推論能力を獲得することを目指す。
    • 提案手法は,様々なグラフ領域において既存の基盤モデルを大幅に上回り,未知の領域へのゼロショット転移も可能である。
    • グラフトークンの読み込みをモデルのステップごとの推論プロセスに組み込み,トークンが読み込まれる文脈に依存するようにした。
    • 自己教師あり学習,トークン頑健性向上,および整合性最適化という3段階の訓練パイプラインを確立した。

    Link: https://arxiv.org/abs/2608.00542

  • 堅牢なウォーターマークとバックドアモデル:ステルスなバックドアによる拡散セマンティックウォーターマークの回避 [cs.CR, cs.AI, cs.CV]目的:拡散モデル生成画像に対するウォーターマーク検出パイプラインの脆弱性とその回避手法の検証
    • 生成AIの普及に伴い,生成されたコンテンツの真正性確認が重要となっているため。
    • セマンティックウォーターマークは頼りになるものの,その検出にニューラルネットワークが使用されている点が弱点となりうる。
    • VAEエンコーダにステルスなバックドアを埋め込み,ウォーターマーク検出を回避する手法を提案し,その有効性を検証する。
    • 提案手法GhostVAEは,良質な画像に対するウォーターマーク検出性能を維持しつつ(真陽性率94.4%),トリガー活性化下で高い回避成功率(94.6%)を達成した。
    • 既存の17種類の防御策に対しても,入力空間,パラメータ空間,潜在空間においてステルス性が保たれていることが確認された。
    • 本研究は,セマンティックウォーターマークシステムの信頼性を根本的に損ない,ニューラルネットワーク要素に対するエンドツーエンドのセキュリティ対策の必要性を示唆する。

    Link: https://arxiv.org/abs/2608.00543

  • LLMを活用した文脈を考慮した文化遺産ガイド [cs.IR, cs.AI, cs.HC]目的:文化遺産に関するキュレーションされたコンテンツの拡充
    • 文化遺産は,歴史や文化を理解する上で重要な役割を担う。
    • 既存の文化遺産ガイドは,文脈に依存した情報提供が不十分である。
    • LLMを用いて,文脈に応じた情報提供を可能にすること。
    • 本研究では,文化遺産ウェブアプリ「Triangolazioni」を拡張し,LLMを活用することで,文脈に依存した外部情報を統合した。
    • LLMに依存しない疎結合アーキテクチャを採用することで,柔軟性と拡張性を実現した。
    • これにより,文脈に応じた情報検索と提示が可能となり,文化遺産体験の質向上に貢献する。

    Link: https://arxiv.org/abs/2608.00549

  • DexMani:熟練者による操作可能性ガイダンスを用いた器用な回転 [cs.IR, cs.AR, cs.RO, cs.AI, cs.CV]目的:器用な物体の回転のための人間由来の操作可能性ガイダンス
    • ロボットハンドによる複雑な操作は重要であり,多様な物体に対して柔軟に対応できる能力が求められる。
    • 従来の強化学習は,特定のロボットハンドに依存し,将来の回転の持続可能性を考慮しない場合がある。
    • DexManiは人間による操作を学習し,ロボットハンドの操作可能性の変化を予測することで,この問題を解決する。
    • DexManiは,人間の実演データから接触条件付きの操作可能性の進化を学習する。
    • この学習結果を用いて強化学習を誘導することで,異なるロボットハンドでも回転スキルを獲得できる。
    • Shadow Hand,Allegro Hand,XHandにおいて,既知・未知の物体に対して最高の成功率を達成した。

    Link: https://arxiv.org/abs/2608.00554

  • AiFlow:ストリーミングLLMアプリケーションのためのバウンドバックプレッシャーを持つトークンネイティブなリアクティブオーケストレーション [cs.SE, cs.AI]目的:ストリーミングLLMアプリケーションにおけるリアクティブオーケストレーションモデル
    • LLMの活用範囲拡大に伴い,複雑なワークフローの効率的な管理が不可欠となっている。
    • 既存のフレームワークでは,生成処理が粗いリクエスト応答として扱われ,キュー管理やバックプレッシャー制御が不十分である。
    • AiFlowは,トークンレベルでのイベント伝播とバウンドバックプレッシャーにより,ワークフローの安定性と効率性を向上させる。
    • AiFlowは,LLMプロバイダー側のTTFT(Time To First Token)を変化させずに,アプリケーション全体のTTFPT(Time To First Packet Token)を70.9-94.7%削減した。
    • AiFlowは,宣言された範囲内でキューの深さを維持し,アンバウンドポリシーと比較して最大キュー深さを93.7-96.5%削減した。
    • 型安全性,状態の並行性,注入互換性に関する静的検証を提供し,信頼性の高いワークフロー構築を支援する。

    Link: https://arxiv.org/abs/2608.00558

  • 視覚言語モデル表現の局所幾何学的分解:LENSによる解析 [cs.AI, cs.CL, cs.CV]目的:視覚言語モデル表現における局所幾何学的構造の理解
    • 近年,視覚と言語を統合するモデルが発展しているが,その内部表現の解釈は困難である。
    • 既存の解釈手法は,大域的な線形方向のみに着目し,局所的な低次元構造を見落とす可能性がある。
    • 本研究は,局所幾何学的分解を通じて,視覚言語モデル表現の理解を深めることを目指す。
    • LENSは,視覚言語モデルの活性化を,混合因子分析を用いた局所的な低ランクガウス近傍に分解する手法である。
    • LLaVA-1.5-7BとQwen3-VL-8Bへの適用により,モデルの融合メカニズムに合致した層深さ依存的な融合軌跡が明らかになった。
    • 近傍の中心への活性化の補間は,生成を因果的に誘導し,既存手法よりも優れた性能を示した。

    Link: https://arxiv.org/abs/2608.00561

  • 証拠の粉砕:ホワイトボックス説明可能なAI監査を欺くための二重ペナルティ回避フレームワーク [cs.LG, cs.AI]目的:説明可能なAI監査の欺瞞
    • AIの透明性と公平性は重要であり,説明可能性はその担保に不可欠である。
    • 説明可能性に対する攻撃が存在し,モデルの偏りやバックドアを隠蔽するリスクがある。
    • ホワイトボックス環境下で,より強力な欺瞞攻撃手法を提案し,既存の防御策を回避すること。
    • 本研究で提案するフレームワークは,モデルの学習時にトリガー特徴量の勾配を直接的にペナルティ化する。
    • これにより,異常な摂動の痕跡を残さずに,滑らかで分布内の予測を生成する。
    • 実験結果から,ターゲット特徴量の寄与度をほぼゼロに抑え,90%以上の攻撃成功率を達成し,条件付き異常検知を回避できることが確認された。

    Link: https://arxiv.org/abs/2608.00566

  • 公平性監査:企業による操作の理論的下限 [cs.LG, cs.AI]目的:公平性監査における,企業が監査後に実行可能な操作の限界
    • 採用,融資等の重要な場面で公平性監査の需要が高まっている。
    • ブラックボックスな監査では,モデルが操作を回避できる可能性が指摘されている。
    • 限られた監査資源下での,企業による操作の理論的な限界を明らかにすること。
    • 監査資源を増やしても,監査後の操作の余地は完全に排除されないことが示された。
    • 監査予算,グループ間の不均衡,許容誤差によって,操作の限界が決まる。
    • 理論的限界は,線形およびニューラルネットワーク分類器を用いた簡単な監査セット構築ヒューリスティクスによって裏付けられた。

    Link: https://arxiv.org/abs/2608.00568

  • 創発的な表現の特殊化による遅延許容クラウドエッジ協調ビジョン-言語-行動モデル [cs.RO, cs.AI, cs.SY, eess.SY]目的:遅延環境下でのクラウドエッジ協調ビジョン-言語-行動モデルの実現
    • ロボット工学において,高度な意味推論とリアルタイム制御の両立が求められている。
    • クラウドとエッジ間のネットワーク遅延が,リアルタイム制御の性能を著しく低下させる。
    • 遅延環境下でもロバストな性能を発揮する,新たなモデルアーキテクチャの設計。
    • 提案手法CloudEdgeVLAは,40ステップの遅延ウィンドウ下で63.8~78.0%の成功率を維持した。
    • 既存手法VLASHやベースラインと比較して,大幅な性能向上を示した。
    • クラウドモデルのスケールアップとエッジコンピューティングの軽量化・応答性の維持を両立する。

    Link: https://arxiv.org/abs/2608.00569

  • CoSynFlow:消散ハミルトニアン力学のクロスシステム予測のための共形シンプレクティックニューラルフロー [cs.LG]目的:消散ハミルトニアン力学の連続時間解写像学習
    • 科学機械学習において,微分方程式の解演算子学習は重要な課題である。
    • 既存のニューラル演算子法は,幾何構造を明示的に考慮しない場合がある。
    • 共形シンプレクティック構造を持つ消散ハミルトニアン系の解写像を学習する。
    • CoSynFlowは,シンプレクティックせん断写像と明示的な共形スケーリングを組み合わせることで,共形シンプレクティック構造を保持する。
    • 有限次元のハミルトニアン記述子と消散パラメータに条件付けすることで,再学習なしに未知のシステムに対する解写像を予測できる。
    • 構造誤差を機械精度レベルに抑え,長期予測誤差を最小限に抑え,物理情報に基づいた学習を可能にする。

    Link: https://arxiv.org/abs/2608.00571

  • 内部を緩和し,全体を均衡化する:幾何学に基づいた視覚言語混合エキスパートの負荷分散 [cs.NI, cs.CL, cs.CV, cs.AI]目的:視覚言語混合エキスパートにおける負荷分散の改善
    • 大規模言語モデルと画像処理の融合が進む中で,効率的な計算資源の利用が重要となっている。
    • 既存の負荷分散手法では,トークン数のばらつきにより,負荷の偏りが生じやすい。
    • 画像とテキストの特性を考慮した新たな負荷分散手法により,負荷の均衡化を図る。
    • 提案手法ReBAは,様々なベンチマークにおいて,既存手法Std-Auxと同等のタスク精度を維持しつつ,負荷を軽減することに成功した。
    • 画像内のトークン群は画像ソースごとに強くグループ化されるため,画像境界に着目したルーティングにより負荷分散が改善される。
    • ReBAは,画像解像度やタイリングの変化といった物理的な変動下においても,平均負荷および最大負荷を低減することが示された。

    Link: https://arxiv.org/abs/2608.00574

  • UOT-IR:固定予算による高声部数シンボリック音楽の構造的ルーティング [cs.SD, cs.AI, cs.LG]目的:高声部数シンボリック音楽の固定トラック数表現への変換
    • 音楽生成・分析・編曲において,シンボリック音楽の利用が拡大している。
    • 多くの下流タスクでは固定長の表現が必要だが,既存手法では構造や演奏性が損なわれる。
    • 構造的ルーティング問題として圧縮を再定義し,構造と演奏性を保ちつつ表現をコンパクト化する。
    • UOT-IRは,テンプレート標準化と適応的保存の両設定で優れた性能を示した。
    • 適応的保存においては最高のNote-F1 (0.9120) を達成した。
    • テンプレート標準化においては,構造コストと構造的混乱率が最小となった。

    Link: https://arxiv.org/abs/2608.00576

  • 借用語かコードスイッチングか:識別における注釈の境界線,モデルではない [cs.CL, cs.AI]目的:カザフ語-ロシア語のコードスイッチング識別における注釈の境界線に関する研究
    • 多言語環境におけるコミュニケーション理解は,言語処理の根幹をなす重要な課題である。
    • カザフ語とロシア語のように文字体系を共有する言語間では,借用語とコードスイッチングの区別が困難である。
    • 借用語とコードスイッチングの識別基準を明確化し,高精度な言語識別を可能にすることを目指す。
    • 既存の言語識別モデルは,カザフ語-ロシア語の混合テキストにおいて,借用語をコードスイッチングと誤認する傾向があることが示された。
    • 言語識別性能のボトルネックは,モデルそのものではなく,借用語とコードスイッチングの注釈における境界線にあることが明らかになった。
    • ドキュメントレベルの注釈データセットを公開し,借用語とコードスイッチングの識別基準を明確化することで,今後の研究に貢献する。

    Link: https://arxiv.org/abs/2608.00581

  • 誤った平均:思考連鎖モニタは唯一の防御線として機能しなくなる [cs.CL, cs.CR, cs.AI, cs.CL, cs.LG]目的:思考連鎖モニタの脆弱性とその対策
    • 大規模言語モデルの安全性確保は重要であり,悪意のある操作を検知する仕組みが不可欠である。
    • 思考連鎖モニタは,行動だけでは見つけられない不正行為を検出するが,推論部分を操作されることで回避されてしまう。
    • 思考連鎖モニタが唯一の防御線となる状況下での脆弱性を明らかにし,その対策を模索する。
    • 思考連鎖モニタは,推論部分のみを改ざんされた攻撃に対して,検出率が大幅に低下することが示された。
    • モニタ全体の精度は,攻撃が容易に検出できる事例に偏っているため,実際には脆弱性が隠蔽されている可能性がある。
    • トレースのみの防御策や,攻撃を学習したモニタでも,推論の意図を操作する攻撃を完全に防ぐことは困難である。

    Link: https://arxiv.org/abs/2608.00583

  • Eコマース画像生成のための要素認識型グループ学習 [cs.CV, cs.AI, cs.LG]目的:Eコマース画像生成におけるプロンプト品質向上のための手法
    • Eコマースにおける商品画像の重要性が増しており,魅力的な画像が売上に大きく影響する。
    • 既存のビジョン言語モデルでは,生成された画像からフィードバックを得てプロンプトを改善する際に課題がある。
    • 画像品質を左右する要素ごとの貢献度を考慮した,より精密な報酬最適化を目指す。
    • 提案手法EAGLE-GRPOは,報酬を要素ごとに分解し,カーネルリッジ回帰を用いて要素レベルでの貢献度を算出する。
    • 追加のロールアウトや別モデルを必要とせず,解釈可能な要素ごとの優位性を導き出すことが可能である。
    • 実験の結果,EAGLE-GRPOは競合手法よりも長期間にわたり性能向上を維持し,より高品質なEコマース画像を生成することが示された。

    Link: https://arxiv.org/abs/2608.00584

  • 十分性なしの検証:チャンクごとのフィルタリングはマルチホップRAGで失敗し,分解がそれを修正する [cs.CL, cs.IR, cs.LG]目的:マルチホップ質問応答における検索拡張生成の検証方法に関する研究
    • 検索拡張生成(RAG)は,大規模言語モデルの知識を補完し,より正確な回答を生成するために重要である。
    • 従来のチャンクごとの検証は,マルチホップ質問に対して十分な性能を発揮しないという課題がある。
    • 本研究は,質問の分解に基づいた検証を行うことで,マルチホップRAGの性能を向上させることを目指す。
    • 従来のチャンクごとのフィルタリングは,マルチホップ質問において,性能が低いことが示された。
    • 質問をサブ質問に分解し,それに基づいて検証を行うことで,検証精度が大幅に向上することが確認された。
    • MuSiQueデータセットにおいて,分解された質問に対する検証のAUCが0.546から0.840へと大きく向上した。

    Link: https://arxiv.org/abs/2608.00585

  • なぜ未来は分岐するのか:確率的物理世界モデルに対する識別可能な閉包テスト [cs.AI]目的:確率的物理世界モデルにおける未来の分岐原因の識別
    • 物理現象の予測は,ロボティクスや科学シミュレーション等,様々な分野で重要である。
    • 従来の評価基準では,予測の不確実性の原因が状態の曖昧性か確率的な変動か判別できない。
    • 状態の曖昧性と確率的変動を分離し,より正確な未来予測の解釈を可能にすることを目指す。
    • ClosurePairsという介入評価プロトコルを導入し,互換性のある微小状態を外生的な摂動によって検証した。
    • ガウスシステムにおいて,ClosurePairsを用いた教師あり学習により,エイリアス分数の誤差を大幅に削減した。
    • 総分散等価なREFINE/BRANCHテストで,ClosurePairsは高い精度を示し,選択されたNLLを改善した。

    Link: https://arxiv.org/abs/2608.00591

  • ヤガー確率分布否定に対する情報理論的考察 [cs.IT, cs.AI, math.IT, math.PR]目的:ヤガー確率分布否定とその一般化に関する情報理論的分析
    • 確率分布の否定は,不確実性や曖昧性を取り扱う上で重要な概念である。
    • 既存の確率分布否定の定義は,理論的な根拠が十分でない場合がある。
    • ヤガーの否定が,情報理論的な基準において最も自然で原理的な定義であることを示す。
    • 本研究では,情報理論および主要化理論のツールを用いて,ヤガーの否定の様々な性質を統一的に説明した。
    • ヤガーの否定が,既存の定義を拡張し,強化するものであることを理論的に示した。
    • ヤガーの否定が,様々な情報理論的基準の下で,確率分布否定の最も適切な定義であることの強力な理論的根拠を提供した。

    Link: https://arxiv.org/abs/2608.00594

  • 拡散LLMにおける自信の罠からの脱出:数学的推論のための進化型デコーディング [cs.AI]目的:拡散LLMの数学的推論における信頼性向上
    • LLMは多様なタスクで高い性能を示すが,数学的推論の正確性は課題である。
    • 拡散LLMは,誤った推論経路に高い信頼度を与えてしまう「自信の罠」に陥りやすい。
    • 進化型デコーディングにより,信頼性の低い推論経路から脱却し,正確な解答を得ることを目指す。
    • 進化型デコーディングは,拡散LLMのデコーディング過程を,候補となる推論状態の進化過程と捉える。
    • ステップごとの選択とブロックごとの変異を組み合わせることで,有用な数値・記号的情報を維持し,反復パターンを抑制する。
    • 複数のベンチマークにおいて,進化型デコーディングは,従来の自信ベースのデコーディング手法よりも高い信頼性を示すことが確認された。

    Link: https://arxiv.org/abs/2608.00605

  • 圃場規模から大規模スペクトルライブラリへ:土壌分光における表形式基盤モデル [cs.LG]目的:土壌特性の迅速かつ費用対効果の高い予測
    • 土壌特性の迅速な評価は,農業や環境管理において不可欠である。
    • 高次元で多重共線性を持つスペクトルデータから正確な予測を得ることが課題である。
    • 大規模データセットにおける予測精度向上を目指す。
    • 表形式基盤モデル(TabPFN)は,圃場規模から大規模スペクトルライブラリまで,幅広いスケールで優れた性能を示した。
    • TabPFNは,明示的な次元削減なしでも古典的な手法を上回る性能を発揮した。
    • 偏少最外積法(PLS)とTabPFNの組み合わせが,最も高い予測精度を実現した。

    Link: https://arxiv.org/abs/2608.00608

  • 講義スライドからの認知的に効率的な知識階層の再構築 [cs.AI]目的:講義スライドからの知識階層の再構築
    • 教育の質向上に貢献するため,学習内容の効率的な理解を促進する技術が求められている。
    • 講義スライドから自動的にマインドマップを生成し評価する枠組みが未発達であり,課題となっている。
    • 大規模かつ多様なスライドに対応し,知識のグローバルとローカルのバランスを取ることを目指す。
    • 本研究では,講義スライドから認知的に効率的な知識階層を再構築するAutoMindMapというエージェントフレームワークを提案した。
    • S2M-Benchというベンチマークデータセットを新たに構築し,客観的な評価を実現した。
    • 実験の結果,AutoMindMapは既存手法を上回り,異なるモデルや状況下においても堅牢性を示すことが確認された。

    Link: https://arxiv.org/abs/2608.00610

  • RHEA:信頼性調和再構成と割当によるロバストなマルチモーダル属性グラフクラスタリング [cs.LG]目的:マルチモーダル属性グラフのロバストなクラスタリング
    • 知識発見や製品セグメンテーション等,多様な分野でラベルなしエンティティのグルーピングが重要である。
    • 既存手法は属性データの品質が低い場合,または欠損している場合に性能が低下する。
    • ノード固有の信頼性を考慮し,グラフ構造を活用して属性データの欠損やノイズに対処する。
    • RHEAは,グラフ近傍の一致からノード固有の信頼性を推定し,クラスタリングパイプライン全体に伝播させる。
    • 信頼性の低い属性をグラフ近傍から再構成し,信頼性を考慮した特徴量の融合と最適輸送クラスタリングを行う。
    • 再構成された表現の確信度をクラスタリング目的関数に組み込み,不確実な再構成の寄与を調整する。

    Link: https://arxiv.org/abs/2608.00621

  • 効果的な連合マルチモーダルグラフ学習:多面的な異質性への対応 [cs.CL, cs.LG]目的:分散型マルチモーダルグラフにおける協調的な最適化
    • グラフ構造データは,多様な分野で関係性を表現する上で重要な役割を果たす。
    • 分散環境下でのマルチモーダルグラフ学習は,データのプライバシー保護と学習効率の課題を抱える。
    • 異なるクライアント間におけるタスク,モダリティ,トポロジーの異質性に対処し,学習性能の向上を目指す。
    • 提案手法FedTCRは,タスク非依存な事前学習とタスク固有なファインチューニングの二段階パラダイムを採用している。
    • トポロジーを考慮したクロスモーダルルーティング機構により,モダリティとトポロジーの異質性を同時に解決する。
    • 7つのドメインにおける実験の結果,FedTCRは最先端のベースライン手法と比較して,グラフ中心およびモダリティ中心のタスクにおいて優れた性能を示した。

    Link: https://arxiv.org/abs/2608.00623

  • 動的環境における学習に基づく経路計画:基礎アルゴリズムから新たなパラダイムへ [cs.RO, cs.AI]目的:動的環境下での安全かつ効率的な経路,軌跡,または制御行動の生成
    • ロボティクスにおける基本的な問題であり,自動運転や協調作業など広範な応用分野を持つ
    • 予測の不確実性や多エージェントの相互作用など,従来の計画手法では対応が困難な課題がある
    • 機械学習の進展を経路計画に取り込み,よりロバストで効率的な計画手法を確立すること
    • 本調査では,2015年から2025年の研究を中心に,学習に基づく手法が古典的な計画の基盤をどのように拡張・補完しているかをレビューした。
    • 学習の役割による分類法を提案し,直接的な方策学習,学習を拡張した古典的計画,ハイブリッド計画,学習強化手法などを整理した。
    • シミュレーションと現実のギャップ,安全性の確保,高密度な群集ナビゲーションなどの今後の課題と展望を議論した。

    Link: https://arxiv.org/abs/2608.00625

  • タスク非依存型リプレイフリー継続学習における相対的なパラメータ重要度 [cs.LG]目的:継続学習におけるパラメータ重要度の評価
    • 深層学習の継続学習は,知識の転移と安定性・可塑性のバランスが重要である。
    • 過去のタスクデータやタスクIDを利用できない環境下では,忘却が課題となる。
    • 過去の知識を維持しつつ,新しい知識を獲得するための効率的なパラメータ更新を目指す。
    • 提案手法では,現在のタスクと過去のタスクの両方に対するパラメータの相対的な重要度を評価する。
    • 重要度の高いパラメータは過去の知識の安定化に役立ち,重要度の低いパラメータは自由に更新される。
    • これにより,既存手法よりも知識の転移を促進し,分類問題において性能が向上した。

    Link: https://arxiv.org/abs/2608.00630

  • 分布シフト下における予測モデルのパレート最適解の学習 [cs.LG, stat.ML]目的:分布シフト下における予測モデルのパレート最適解の探索
    • 事前学習済みモデルの再利用は,機械学習パイプラインにおいて重要性が増している。
    • 分布シフトが発生した場合,どの再利用戦略が最適か一概には言えない。
    • 様々なモデルを統合し,分布シフトにロバストな予測を実現することを目指す。
    • Frontier Learningは,異なる学習履歴やアクセス権を持つモデル群を統合的に扱う。
    • 統合特徴量を構築し,軽量な教師あり学習器を適用することで,既存手法と同等以上の性能を示す。
    • 特に,単一のベースラインが信頼できない状況において,大きな改善が見られた。

    Link: https://arxiv.org/abs/2608.00632

  • DASH:デカップルド適応的代理モデル - 自動ベイズ最適化のための獲得ハネネス [cs.CL, cs.AI]目的:自動ベイズ最適化における代理モデルと獲得関数の適応
    • ベイズ最適化は複雑な最適化問題に有効だが,適切なモデル選択が重要である。
    • 既存の自動ベイズ最適化手法は,代理モデルと獲得関数を最適化できていない。
    • 予測精度と最適化状況に応じた,モデルと関数の独立した適応を目指す。
    • DASHは,予測信頼性,不確実性較正,ランキングの一貫性に基づいて代理モデルを選択する。
    • 獲得関数コントローラーは,獲得関数の割り当てを再調整し,LLMによる最終選択を委任する。
    • 4つの化学最適化タスクで,既存の自動ベイズ最適化手法を上回り,加速係数と改善係数を向上させた。

    Link: https://arxiv.org/abs/2608.00641

  • Linuxにおけるオンライン故障予測の理解:補完的なマルチビュー説明可能性を通じて [cs.MA, cs.DB, cs.SE, cs.AI]目的:Linux OSにおけるオンライン故障予測パイプラインの構築と評価
    • システム運用において,障害の早期発見と迅速な対応は,可用性と信頼性を維持する上で不可欠である。
    • 高精度な故障予測は可能でも,その根拠が不明確な場合,運用者の信頼を得られず,実用化が難しい。
    • 予測の信頼性を高め,適切な対応を支援するために,故障予測の解釈可能性を高めることを目指す。
    • 厳格なクロスワークロード条件下で,再学習なしに91-94%の検出率を達成し,誤報率は1%以下に抑えられた。
    • 故障モードの診断はワークロードの変化に敏感であり,特定の故障タイプに対しては診断メカニズムの効果が限定的であった。
    • 故障の検出はワークロードの変化に対してより頑健であるが,未知の故障モードの診断は困難であることが示された。

    Link: https://arxiv.org/abs/2608.00651

  • SOC担当者のLLM統合,リスク,準備状況に関する視点と認識:幽霊を追いかけることから見逃し攻撃へ [cs.CE, cs.IR, cs.CR, cs.AI, cs.HC]目的:SOC担当者のLLMに対する経験に基づく認識と,LLMベースのツールをSOCワークフローに責任を持って統合するための課題と機会の特定
    • サイバー攻撃の巧妙化と増加により,SOCにおけるセキュリティイベントの正確な検知と迅速な対応が不可欠となっている。
    • LLMの潜在的なメリットはあるものの,実際のSOCワークフローへの適用可能性や課題が十分に解明されていない。
    • LLMをSOCに効果的に導入するための具体的な要件と,人間中心の安全な運用方法を明らかにすること。
    • LLMはレポート作成などの単純作業の自動化に有用と評価されているが,インシデント分析などの高度なタスクにはまだ不向きである。
    • LLMの限界はモデル自体よりも,SOCの準備状況や人間の過信といった要因に起因すると認識されている。
    • 競争圧力からLLMの導入意欲は高いものの,技術的な深さ,文脈の理解,組織固有の知識の不足が課題として挙げられた。

    Link: https://arxiv.org/abs/2608.00672

  • HetGPS:物理に基づいた適応的安全性を備えた大規模グラフマルチエージェント強化学習 [cs.AI, cs.MA]目的:EV充電における,大規模なネットワーク接続エージェントの安全性を確保する手法
    • 電力網のような複雑なシステムでは,多数のエージェントの協調制御が不可欠である。
    • 多数のエージェントを制御する際,安全性と効率性の両立が課題となる。
    • 学習されたリスクと物理モデルを組み合わせ,スケーラブルかつ安全な制御を実現する。
    • 適応的安全性を備えたHetGPSにより,電圧違反率を大幅に低減することに成功した。
    • 大規模なEV充電ネットワークにおいて,99.06~100%の出発成功率を維持した。
    • 学習されたグラフリスクは,大規模なシステムにおいて介入権限を効率的に割り当てられることを示した。

    Link: https://arxiv.org/abs/2608.00679

  • AI認知評価のための多次元評価枠組み(MAAC):プロセス指向の認知評価に関する理論的枠組み [cs.AI]目的:テキストベースAIシステムの認知過程評価のための理論的枠組み
    • AI技術の発展は目覚ましいが,その認知メカニズムの解明は不可欠である。
    • 既存のAI評価は結果重視であり,思考過程の理解が不十分である。
    • AIシステムの思考プロセスを多角的に評価する枠組みを提示する。
    • MAACは,認知負荷,ツール実行,内容の質など9つの次元を定義する。
    • 各次元は認知科学の理論(マールの三層仮説,バデリーのワーキングメモリモデル等)に基づいている。
    • MAACは,既存の評価方法を補完し,AIの認知プロセスをより深く理解する道を開く。

    Link: https://arxiv.org/abs/2608.00680

  • LLMオーケストレーションはいつ効果を発揮するか:精度,コスト,タスク難易度の制御された評価 [cs.AI]目的:LLMオーケストレーションの,精度,コスト,タスク難易度に対する効果の評価
    • LLMの推論能力向上には計算資源の投入が有効と考えられている。
    • 既存研究では最適化努力の差が考慮されず,オーケストレーション自体の価値を評価しにくい。
    • モデル特有の効果と,コスト増に見合う精度向上が得られるか検証する。
    • Self-Refine,Best-of-$N$,Debate等のオーケストレーション手法と,CoT等のベースライン手法を比較検証した。
    • オーケストレーションは,最適化されたCoT推論と比較して,最大で4.6%程度の精度向上を示す。
    • オーケストレーションの効果はモデルに強く依存し,タスク難易度との間に明確な関係は見られなかった。

    Link: https://arxiv.org/abs/2608.00685