arXiv雑要約
AI - 2026/08/04 公開
テストスイート監査人としてのコーディングエージェント:公式スイートが見逃すものを発見し,捕捉できるものに近づく [cs.SE, cs.AI]目的:コード評価におけるテストスイートの弱点の発見と,その改善
- コード生成AIの性能評価には,オンラインジャッジのデータセットが広く利用されている
- 既存のテストスイートには,バグを含むコードを許容してしまう問題がある
- コーディングエージェントを用いて,既存スイートの不備を検出し,新たなテストスイートを構築する
- コーディングエージェントは,AtCoderの提出されたコード中から589件のバグを含むコードを特定した
- 複数のエージェントを用いることで,合計906件のバグを含むコードが確認された
- 既存のテストスイートの範囲内で,エージェントは公式スイートと同程度のバグ検出率を維持し,テストスイートが存在しない問題でも高い性能を示した
拡散言語モデルにおける強化学習のための外部ポリシーロールアウトの統合 [cs.LG]目的:拡散言語モデルにおける強化学習の性能向上
- 大規模言語モデルの能力向上には,強化学習が不可欠である。
- 自己生成ロールアウトのみに頼ると,報酬が少なく学習が進まない場合がある。
- 外部ポリシーのロールアウトを統合することで,学習の安定化と性能向上を目指す。
- ERILSは,Sudoku, Countdown, MATH500のゼロショット評価で性能を向上させた。
- 特にSudokuでは,ERILSはベースラインと比較して98.4%の正答率を達成した。
- ロールアウト長の制御と報酬処理の分離が,学習の安定化に貢献することが示された。
LaCache:LLMサービングのための堅牢な意味的キャッシュ [cs.AI]目的:LLMサービングにおける意味的キャッシュの脆弱性対策
- LLMの推論コストが高いため,高速化とコスト削減が重要課題である。
- 既存の意味的キャッシュは,悪意のあるクエリによるキャッシュ汚染攻撃に脆弱である。
- キャッシュ汚染攻撃に対する耐性を持ち,応答の関連性を高めること。
- LaCacheは,クエリだけでなく,生成されたトークンもキャッシュヒット確認することで,攻撃への耐性を実現する。
- 理論的に,悪意のある応答と良性クエリのキャッシュヒットを同時に発生させることは不可能であると証明された。
- 多様なLLMとベンチマークを用いた実験により,LaCacheの安全性と効率性が確認された。
MNC:プライベートLLMエージェント通信のための範囲限定セマンティック脱分類 [cs.CR, cs.AI]目的:LLMエージェント間通信におけるプライバシー保護のためのセマンティック脱分類プロトコル
- LLMエージェントシステムは高度な自律性を持つため,情報漏洩のリスクが伴う。
- 既存のプライバシー保護手法は表面的な対策に留まり,適切な情報開示の範囲を特定できない。
- 必要最小限の情報を開示し,その利用範囲を厳密に制御することで,プライバシーを保護する。
- MNCは,タスク遂行に必要な情報のみを選択的に開示するセマンティック脱分類プロトコルである。
- MNCは,受信者,目的,転送,有効期限,ログ,メモリの範囲を明示的に定義し,それを強制する参照モニターを備えている。
- 実験により,MNCは権限のある情報伝達を維持しつつ,不正な転送,記録,長期保存,検索を効果的に阻止することが示された。
極度の暗闇とモーションブラーが交わる時:統一的なRAW復元のためのMeanFlow [cs.CV, cs.AI]目的:極低照度RAW画像の復元
- 近年,暗所での画像撮影が増加しており,RAWデータの高画質化が重要となっている。
- 既存手法は照明とノイズに焦点を当て,実用的な低照度撮影におけるモーションブラーへの対応が課題であった。
- 現実的なモーションブラーを考慮した,極低照度RAW画像の復元手法を確立することを目指す。
- 提案手法では,モーションブラーを付加した新しいデータセットSIDEDを構築し,学習に利用した。
- ドメイン条件付き表現キャリブレーションを備えた統一的なRAWトークナイザーとMeanFlowを用いることで,高画質化を実現した。
- 物理に基づいたリファインメントモデルにより,照明・反射率の一貫性,ピクセル忠実度,色再現性を向上させた。
TIDES:多者間ソーシャルダイナミクスモデリングのための長期間二言語データセット [cs.CL, cs.AI, cs.HC]目的:多者間ソーシャルダイナミクスのモデリング
- 人間が協働する上で会話は不可欠であり,その理解はAIの発展に重要である。
- 既存の会話データセットは短期間の実験的設定に限定され,現実世界のチームの長期的なダイナミクスを捉えられていない。
- 現実世界のチームの長期的なダイナミクスを捉えたデータセットを提供し,多者間対話のモデリング能力を向上させる。
- TIDESは,12の大学プロジェクトチームを1学期にわたって追跡した高解像度な長期間データセットである。
- TIDESでファインチューニングすることで,次の発話者予測の精度が13.8%向上し,商用モデルと同等の性能が得られた。
- ただし,発話者予測の向上は必ずしも自然な発話につながらず,人間の評価ではファインチューニングされたモデルよりも元のモデルが好まれた。
CENTILE:意思決定を駆動する指標によって評価されたテレメトリ基盤モデル [cs.NI, cs.LG]目的:ネットワークおよびシステムテレメトリのための生成基盤モデル
- 現代の計算・ネットワークインフラは継続的にテレメトリを生成する。効率的な運用が重要となる。
- タスク,エンティティ,予測範囲ごとに個別の予測モデルが必要となり,運用が煩雑である。
- テレメトリデータから直接意思決定を支援する汎用的なモデルを開発し,運用効率を向上させる。
- 提案手法CENTILEは,異種テレメトリをイベント駆動型のエンティティストリームとして扱うことで,柔軟な予測を可能にする。
- CENTILEは,HPCスケジューリングとネットワークプロビジョニングの両方において,リプレイ評価で意思決定を改善する初の事前学習済みテレメトリモデルである。
- HPCジョブログとネットワークトラフィックの実験により,CENTILEがバックフィリングの平均遅延を最大77%削減し,デプロイされたルールの違反率を約半分に抑えることが確認された。
X-KGRank:パターンマイニングとLLM再ランキングによる説明可能な推薦のための知識グラフRAGフレームワーク [cs.IR, cs.IR, cs.AI]目的:説明可能な推薦を実現するための知識グラフRAGフレームワーク
- 推薦システムは,ユーザーの意思決定に重要な役割を果たしており,その精度向上が求められている。
- 従来の推薦システムは,推薦理由が不明瞭であり,ユーザーの信頼を得にくいという課題があった。
- 知識グラフとLLMを組み合わせることで,推薦の根拠を明確にし,説明可能性を高めることを目指す。
- X-KGRankは,構造的協調フィルタリングとLLMベースの説明を統合した知識グラフRAGフレームワークである。
- MovieLens-1Mデータセットにおいて,X-KGRankは,NDCG@10で0.2956,Recall@10で0.5371を達成し,人気ベースラインを両メトリックで17.1%上回った。
- 小規模なLLM(1.5Bパラメータ)でも,大規模なLLM(7Bパラメータ)と同程度の説明品質が得られることが示されたが,虚偽の情報を生成しやすい傾向があることが示唆された。
LLMによる分子摂動応答予測のための検索 [cs.RO, cs.LG]目的:分子摂動応答予測における検索手法の改良
- 創薬において,薬剤と細胞の組み合わせのトランスクリプトーム応答予測は重要である。
- 全ての薬剤と細胞の組み合わせを網羅的にプロファイリングすることは現実的ではない。
- LLMを用いて関連化合物の応答を検索し,未知の薬剤の応答を予測する。
- LLMによる検索(LGR)は,未観測薬剤,未観測細胞株,オープンワールド環境下で既存手法を上回る性能を示した。
- 特に未観測細胞株に対する汎化性能において,LGRは相関係数を高め,誤差を低減した。
- LGRは遺伝子発現の方向性予測精度を向上させ,生物学的に意味のある摂動効果の再現に貢献した。
DAPD:デュアルアンカーポリシー蒸留 [cs.AI]目的:言語モデルのポストトレーニングにおける性能劣化の原因解明と改善策の提案
- 言語モデルの性能向上は,様々な自然言語処理タスクの基盤であり重要である。
- オンポリシー蒸留は性能向上に寄与するが,特権情報への過度な依存による性能劣化が課題である。
- 特権情報と推論時の情報の非対称性を解消し,よりロバストな蒸留を実現する。
- DAPDは,特権情報への依存を軽減し,推論時の性能低下を防ぐ効果が確認された。
- Qwen3-4Bを用いた実験では,DAPDはOPSDと比較して平均で2.00ポイントの性能向上を示した。
- 性能向上はモデル規模に依存せず,4Bでは+2.69,32Bでは+2.78という結果が得られた。
CoEvo-Mem:LLMエージェントにおける検索ポリシーとメモリバンクの共進化 [cs.IR, cs.AI]目的:LLMエージェントの検索ポリシーとメモリバンクの共進化
- LLMエージェントの長期的な性能向上には,タスク間での知識蓄積と継続的な学習が不可欠である。
- 従来の技術では,検索とメモリの進化が分離されており,両者の相互作用が十分に考慮されていない。
- 検索とメモリの進化を同時に最適化することで,LLMエージェントの性能を最大限に引き出すことを目指す。
- 提案手法CoEvo-Memは,検索ポリシーとメモリバンクを閉ループで共進化させるフレームワークである。
- LLMの経路固有のクエリ書き換えとルーティング事前確率に基づき,軽量な残差ルーターでオンライン修正を行う。
- 7つの多様なベンチマークにおいて,最先端の性能を達成し,検索とメモリの共進化の重要性を示す。
拡散特徴予測のループを閉じる:加速のための反転 [cs.LG, cs.AI]目的:拡散サンプリングの加速化
- 画像生成AIの効率向上は,計算コスト削減に不可欠である。
- 既存手法では,予測誤差がステップ間で大きく変動し,予測への過信が加速化を阻害する。
- 予測の信頼度に基づいた制御により,予測誤差を抑制し,安定した加速化を実現する。
- 本研究では,キャッシュからの情報に基づき予測の信頼性を評価し,信頼性の低い予測を抑制する手法RACERを提案した。
- RACERは,不確実性の高いステップで特徴を更新し,後続の評価を省略することで,計算コストを削減する。
- 実験結果から,RACERは既存のオープンループベースラインと比較して,高品質な画像をより高速に生成できることが示された。
MemSIF:構造化されたインタラクションからLLMエージェントのためのデュアルトラックファクトメモリへ [cs.AI, cs.CL]目的:長期的なインタラクションにおけるLLMエージェントのための記憶システムの改善
- LLMエージェントの長期的なタスク遂行において,長期記憶は不可欠である。
- 既存の記憶システムは,時間的構造のずれや,有用性の遅延といった問題に直面している。
- 時間的構造のずれと有用性の遅延を解消し,長期的なインタラクションにおけるLLMエージェントの性能向上を目指す。
- MemSIFは,構造化されたインタラクションとファクトメモリを組み合わせることで,既存の記憶システムが抱える問題を軽減することを示した。
- LoCoMoとLongMemEval-Sの実験結果から,MemSIFは5つのLLMにおいて,既存の最高性能モデルを2.29%-8.79%,2.87%-6.15%上回るTotal ACCを達成した。
- この結果は,MemSIFの構造化されたインタラクションメモリとデュアルトラックファクトメモリの有効性を裏付けている。
LLM強化学習における能力維持のための可塑性を保つKL正則化 [cs.LG, cs.CL]目的:LLM強化学習における能力劣化の軽減と,新たなタスク学習とのバランスの最適化
- LLMの性能向上には,事前学習後の強化学習が不可欠である。その過程で既存能力の維持が課題となる。
- 従来のKL正則化は,応答分布全体を制約するため,探索やタスク学習を阻害する可能性がある。
- CoKLは,正答に条件付けたKL正則化により,能力維持と学習の干渉を最小限に抑えることを目指す。
- CoKLは,正答に条件付けた応答分布に正則化制約を絞ることで,既存能力を維持しながら新たなタスクの学習を促進する。
- CoKLは,正答の確率分配を調整することで,参照モデルでサポートされた正答の相対的な確率配分を正則化し,誤った出力や総正答率に直接的な影響を与えない。
- 実験の結果,CoKLは既存手法と比較して,タスク改善と事前能力維持のバランスが優れていることが示された。
RL-Lock: interlocking アセンブリ生成のための強化学習 [cs.AI, cs.GR]目的: interlocking アセンブリの生成
- 構造的安定性から,様々な実用的な応用例が存在する。
- 既存手法は,複雑な形状に対して時間がかかったり,解を見つけられない場合がある。
- 強化学習を用いて,効率的に interlocking アセンブリを生成すること。
- 本研究では,強化学習フレームワークRL-Lockを提案し,既存手法に頼っていた手動探索ヒューリスティクスを排除した。
- 構造化された行動チャンキングとMCTSガイド付きの方策価値学習を組み合わせることで,探索空間を効率的にナビゲートできる。
- 実験により,RL-Lockは interlocking アセンブリの生成において有効であり,特に困難なケースで有効性が示された。
有限期間制約下における無線リソース管理のための異種マルチエージェント強化学習 [cs.LG]目的:高密度無線ネットワークにおけるスループット最大化と比例公平性の実現
- 無線通信技術は現代社会の基盤であり,効率的なリソース管理が不可欠である。
- エネルギーやハンドオーバーといった制約下でのリソース管理は複雑であり,最適化が困難である。
- 有限期間の制約を考慮したリソース管理における,スループットと公平性の両立を目指す。
- 提案手法HeLyMARLは,仮想キューを用いたドリフトプラスペナルティ分解により,期間制約を各タイムスロットの報酬に組み込んだ。
- HeLyMARLは,他の手法と比較して,訓練エピソード全体を通してスループットと公平性のバランスを維持し,予算超過を防ぐことができた。
- 本研究により,制約付き有限期間問題が制約なしの強化学習問題に変換され,効率的なリソース管理が可能となった。
SPECTRA:バンドルーティング埋め込みと段階的LoRAによる地理空間基盤モデルのクロスセンサー微調整 [cs.CV, cs.AI]目的:地理空間基盤モデルのクロスセンサー微調整手法
- 地理空間データは,地球観測,気候,気象など多岐にわたり,その活用が重要である。
- 事前学習済みモデルを実用的なデータセットに適応する際,スペクトルミスマッチや微調整コストが課題となる。
- スペクトルミスマッチの解消と微調整コストの削減を両立し,モデルの性能向上を目指す。
- SPECTRAは,Band-Routed Embedding(BRE)により,ダウンストリームセンサーの全てのバンドを活用し,性能向上を実現した。
- Stage-wise Transferability-aware LoRA(ST-LoRA)は,転移可能性の高い段階に学習パラメータを集中させ,微調整コストを削減した。
- 実験結果から,SPECTRAは既存手法と比較して,より少ないパラメータで高い性能を発揮することが示された。
ビジョン言語モデルによる都市の荒廃状況の把握:デトロイトの事例研究 [cs.CL, cs.CV, cs.AI]目的:都市の荒廃状況の評価手法
- 都市計画,再開発,公衆衛生の維持において,都市の荒廃状況を把握することは不可欠である。
- 従来の荒廃状況調査は,人的コストと時間がかかるため,大規模な継続的な実施が困難である。
- オープンソースのビジョン言語モデルを活用し,低コストで継続的な荒廃状況の追跡・管理を可能にすること。
- 複数のストリートビュー画像を用いることで,評価精度が向上することが示された。
- 大規模なビジョン言語モデルは,推論においてそれぞれ異なる強みを持つことが明らかになった。
- アンサンブル学習器は,個々のベースモデルを上回り,あらゆる住宅状況や荒廃状況の評価において頑健性が向上した。
自律運転VLMにおける検証可能な推論のための将来軌跡の遅延露出 [cs.AI]目的:自律運転VLMにおける推論の検証可能性向上
- 自動運転は社会実装に向けて重要であり,高い安全性と信頼性が求められる。
- 既存のCoT学習パイプラインは,将来の軌跡を教師モデルに直接与えることで,因果関係に基づかない推論を引き起こす。
- 将来軌跡を検証目標として扱うことで,推論の信頼性を高め,幻覚を抑制することを目指す。
- 提案手法DEFT-RLVRは,自律運転の推論能力を向上させ,汎用的な視覚能力を維持または強化する。
- AD-MCQは,明示的な軌跡候補からの選択という形で計画を定式化し,検証可能な推論のための柔軟な基盤を提供する。
- 将来軌跡を事後検証ターゲットとすることで,早期の軌跡固定によるバイアスを回避できる。
EntailLLM: 論理プログラミングによるドメイン知識を用いたLLM生成の脆弱性発見経路の検証 [cs.CR, cs.AI, cs.LO, cs.SE]目的:LLM生成の脆弱性発見経路の妥当性検証
- ソフトウェアの安全性確保は重要であり,医療機器など安全性が求められる分野では特に不可欠である。
- LLMは知識に反する推論を行う可能性があり,その信頼性が課題となっていた。
- LLMの推論経路をドメイン知識と照合し,その妥当性を検証することで信頼性を向上させる。
- EntailLLMは,LLMが提案する解析経路を,バイナリの関数呼び出しグラフとドメイン知識グラフを用いて検証する。
- 検証の結果,ドメイン知識を用いることで,検証成功率が78%から98%に向上した。
- 実医療機器バイナリにおいても98%の検証成功率を達成し,LLMの出力に対する論理的な検証が可能となった。
疎なデータ条件下におけるAIを活用したきめ細かい食品安全リスク予測 [cs.AI]目的:食品安全リスクのきめ細かい予測
- 食の安全確保は公衆衛生上の重要な課題であり,資源が限られている状況下では特に重要である。
- 検査資源の制約や地域ごとのサンプルデータ不足が,リスク予測の精度を低下させている。
- 本研究は,データが不足している状況下でも食品安全リスクを高精度に予測することを目指す。
- 提案手法は,1100万件以上の検査記録と統計年鑑からの情報を統合し,都市レベルでの食品安全リスクを予測する。
- ウィルソン区間を活用した事前学習と半教師ありラベル洗練により,サンプルサイズが少ない地域でも有効に学習できる。
- 浙江省の市場監督管理局との実証実験で,従来の計画よりも高い検出率と効率的な検査資源の配分が確認された。
FRAMES:ポリシー統制下の企業ワークフローにおけるエージェントの保護と二目的スキル進化 [cs.AI]目的:ポリシー統制下の企業ワークフローにおけるエージェントのスキル進化
- 企業ワークフローの自動化は効率化に不可欠であり,LLMエージェントの活用が期待される。
- 既存のLLMエージェントは,ルールの一貫性,根拠の説明,監査可能性に課題がある。
- スパースなフィードバックと副作用を防ぎつつ,精度とコストのバランスを改善すること。
- FRAMESは,既存のアセットからスキルを初期化し,合意に基づく変異とパレート選択により進化させる。
- 本フレームワークは,精度とコストのトレードオフを最適化し,回帰を防ぐ保証を提供する。
- 内部システムでの展開により,既存手法を上回る精度とコスト効率が確認された。
管理された沿岸システムにおける複合洪水予測のためのマルチソース動的グラフ学習 [cs.LG, cs.AI]目的:複合洪水予測のためのマルチソース動的グラフ学習手法
- 沿岸域の洪水は甚大な被害をもたらすため,高精度な予測が不可欠である。
- 既存モデルは,長期的な高水位の再現性に課題があり,早期警戒に繋がりにくい。
- 複数地点の情報を活用し,高水位の予測精度向上と早期警戒の実現を目指す。
- 提案手法は,地点間の関係性を動的に調整することで,高水位の予測精度を向上させる。
- 従来の評価指標に加え,高水位プロセスの時間的整合性を評価することで,予測性能を詳細に分析した。
- マルチステーションの動的条件を統合することで,通常の河象時における予測精度を維持しつつ,持続的な高水位の予測信頼性を向上させた。
パレート最適サーロゲートモデルのアンサンブルによる進化アルゴリズム [cs.NE]目的:サーロゲートモデルのアンサンブルによる進化アルゴリズムの性能向上
- 最適化問題において,関数評価にコストがかかる場合,効率的な探索が重要である。
- サーロゲートモデルの精度やロバスト性が不十分な場合,探索性能が低下する可能性がある。
- サーロゲートモデルの平滑度を適切に調整し,過学習や学習不足を抑制すること。
- 提案手法は,RBFネットワークのパラメータを最適化することで,精度と複雑性のバランスが取れたアンサンブルモデルを構築する。
- 異なる平滑度のサーロゲートモデルを組み合わせることで,過学習や学習不足を抑制し,探索性能を向上させる。
- ベンチマーク問題と実問題において,既存のSAEAと比較して統計的に優れていることが示された。
物語画像生成における社会バイアスの調査 [cs.CV, cs.AI]目的:テキスト画像生成モデルにおける社会バイアスの発現様式
- 画像生成技術はコンテンツ作成や教育に利用され,社会への影響力が大きいため,公平性の検証が重要である。
- 既存の研究では写真生成に偏った評価が多く,物語性のある画像におけるバイアスの現れ方は不明であった。
- 写真,ストーリーボード,コミックの生成においてバイアスの度合いを比較し,バイアスの可視化メカニズムを解明する。
- プロプライエタリモデルでは,写真生成で平均25.9%のバイアスが認められ,ストーリーボードとコミック生成でそれぞれ9.6ppと18.2pp増加した。
- 写真は微妙な視覚的要素でバイアスを表現する一方,ストーリーボードとコミックはイベントの順序やキャラクター配置などを通してより明示的にバイアスを表現する。
- 写真生成では見えにくいバイアスが,物語性のある画像形式では表面化する可能性があり,多様な形式での評価の重要性を示唆する。
REFLEX:拡散言語モデルにおけるMoE推論を,精緻化を考慮した計算資源配分として再考する [cs.AI, cs.CL]目的:拡散言語モデルにおけるMoE推論における計算資源配分最適化
- 大規模言語モデルの性能向上には,モデルのパラメータ数を増やすことが重要であり,MoEはその有効な手法の一つである。
- 拡散言語モデルでは,トークンごとの精緻化の度合いが異なるにも関わらず,固定的な計算資源配分が行われており,効率が悪い。
- トークンの精緻化状態に応じて,MoEにおける専門家への計算資源配分を動的に調整し,効率的な推論を実現することを目指す。
- REFLEXは,既存のルーティング機構を変更することなく,専門家への計算資源配分を調整することで,計算量を平均15%削減した。
- その結果,ほとんどのベンチマークにおいて,生成品質を維持または向上させることができた。
- 他の可変専門家ルーティング手法と比較して,より一貫した品質と計算量のトレードオフを実現した。
自律的なファクター発見に向けた進化計算の視点 [cs.DC, cs.NE]目的:ファクター発見の自動化
- 金融市場において,安定的に利益を上げる要因(アルファ)の発見は,投資戦略の根幹である。
- 従来のアルファ発見手法は,ノイズの多いデータや市場の変動に対応しきれていない。
- 既存手法の体系化と評価基準の確立により,より信頼性の高い自動アルファ発見システムの開発を目指す。
- 本研究は,アルファ発見をノイズが多く,動的で,多目的の記号的進化最適化問題として捉え,統一的な進化計算の視点を提供する。
- 表現,変異,適応度評価,選択,記憶,適応という6つの要素からなる分析フレームワークを開発し,既存手法の特性を分類した。
- また,探索効率,適応度信頼性,アルファ品質,経済的多様性などを含む8次元の評価フレームワークを提案し,自動アルファ発見システムの評価基準を確立した。
PICopilot:光集積回路設計を支援するLLMベースのエージェントフレームワーク [cs.ET, cs.AI]目的:光集積回路設計におけるスクリプト生成を通じた支援
- 光集積回路の急速な発展に伴い,設計手法はGUIからスクリプトベースへ移行している。
- スクリプトベース設計には,APIやプログラミングの知識が必要であり,GUIより手間と時間がかかる。
- 設計ニーズと手動スクリプト作成能力の差を埋めるため,LLMを用いた自動スクリプト生成を目指す。
- PICopilotは,自然言語指示から設計スクリプトを自動生成する初のLLMベースのエージェントフレームワークである。
- 多エージェントアーキテクチャとフィードバック機構,RAGパイプラインにより,高い成功率と信頼性を実現した。
- 多様なスクリプトタスクのベンチマークにおいて,48タスク全てを成功させ,GPT-5よりも21タスク多く解決した。
信頼できる自信は存在するのか?ドキュメント抽出における視覚言語モデルのためのConfBench [cs.AI, cs.CL]目的:視覚言語モデルにおけるドキュメント抽出の信頼性評価
- 文書処理の自動化は重要であり,そのためにはモデルの自信度を適切に評価する必要がある。
- 既存のベンチマークは高品質なデータに偏っており,精度の低い領域の評価が不十分である。
- 自信度の評価に特化したベンチマークを構築し,信頼性の高い文書処理を実現することを目指す。
- OCRと画像入力が,より正確な自信度推定につながることが示された。
- モデルの能力が自信度の質に大きく影響し,パラメータ数は信頼性の指標とならないことが明らかになった。
- モデル間の自信度の質にばらつきがあり,事後修正により閾値ベースのルーティングが可能になることが示された。
ReFP-AD:エネルギーベース異常検知のための修正フロー事前条件付け [cs.LG]目的:異常サンプルにアクセスできない状況下での,異質な正常データのモデリング
- 異常検知は,製造やセキュリティなど幅広い分野で不可欠であり,その精度向上が求められている。
- 高次元な特徴空間におけるエネルギーベースモデルの学習は,不安定になりやすく,正確な異常検知を妨げる。
- 本研究は,幾何学的再パラメータ化を通じて,高次元空間での安定した学習と高精度な異常検知を実現する。
- 提案手法ReFP-ADは,最適輸送と修正フローを組み合わせることで,高次元な埋め込み空間を良好な条件の潜在空間に変換する。
- MVTec-ADおよびVisAデータセットにおける実験結果から,既存のエネルギーベースモデルと比較して,Image AUROCで最大+10.8%の性能向上を達成した。
- 幾何学的再パラメータ化が,高次元空間におけるMCMCサンプリングと正確な異常局在化にとって重要であることが示された。
ユニバーサルマルチモーダル埋め込みにおける視覚的アイデンティティの解明 [cs.CV, cs.AI, cs.CL]目的:視覚的アイデンティティ識別能力の向上
- マルチモーダルな情報処理は,画像やテキストなど多様なデータを統合し,より高度なAIシステムの実現に不可欠である。
- 既存のユニバーサルマルチモーダル埋め込み手法では,インスタンス検索や再識別のようなタスクで重要な視覚的アイデンティティ識別が十分でない。
- 視覚的アイデンティティ識別を強化し,より包括的なユニバーサルマルチモーダル埋め込みの構築を目指す。
- 本研究では,視覚的アイデンティティ識別に関する大規模ベンチマークであるMVEBを提案し,評価と学習を支援する。
- アイデンティティを考慮したサンプリングメカニズムを用いた学習フレームワークを提示し,汎用的なマルチモーダル性能を維持しつつ,視覚的アイデンティティ識別能力を向上させた。
- 実験結果から,提案手法がユニバーサルマルチモーダル埋め込みに強力な視覚的アイデンティティ識別能力を付与できることが示された。
CoNav-UAV:スタッケルベルグ学習による双高度航空機協調ナビゲーション [cs.RO, cs.SY, eess.SY, cs.AI, cs.RO]目的:航空機を用いた視覚言語ナビゲーションにおける協調双高度ナビゲーションの実現
- 災害救助やインフラ点検など,航空機を用いたナビゲーション技術の重要性が高まっている。
- 単一の主体では,広範囲の探索と衝突回避を両立させることが難しいという課題がある。
- 高度な協調学習により,効率的な探索と精密な接近を同時に実現することを目指す。
- CoNav-UAVは,高高度リーダーと低高度フォロワー間のスタッケルベルグゲームとしてナビゲーションをモデル化する。
- 反復スタッケルベルグ学習により,リーダーの推論能力とフォロワーの運動制御能力を同時に向上させる。
- AerialVLNベンチマークにおいて,既存手法を大幅に上回り,少ないデータで高い性能を発揮した。
LEAP:GPUカーネル生成のための適応的プルーニングによるリーンな環境フィードバック [cs.LG, cs.AI]目的:GPUカーネル生成におけるコード強化学習のための,効率的な多段階強化学習フレームワーク
- GPUなどのハードウェアアクセラレータの性能を引き出すには,低レベルなコード最適化が不可欠である。
- 従来の強化学習では,コンパイル遅延や報酬の希薄性により,低レベルなシステムプログラミングへの応用が困難であった。
- 複雑なタスクに焦点を当て,コンパイルコストを削減し,学習効率を向上させることで,この問題を解決する。
- LEAPは,難易度に応じたプルーニングにより,不要なタスクを排除し,計算資源を複雑なタスクに集中させる。
- ランキングに基づく報酬関数により,単純なプロンプトでのトークン効率の悪さを抑制し,難しい問題での学習勾配を最大化する。
- 実験結果から,LEAPは初期性能と多段階デバッグの堅牢性において,既存手法を上回り,高速な収束を実現することが示された。
CockpitHAT:依存グラフ駆動による組み込みマルチエージェントコックピットの階層的帰属 [cs.AI]目的:LLMマルチエージェントコックピットにおける誤りの帰属に関するフレームワーク
- 安全性確保が求められる自動運転等の分野において,LLMの利用が拡大している。
- LLMは一見正しく見える応答の裏に,プロセスレベルでの深刻な失敗を隠蔽することがある。
- 安全性に配慮した,より正確な誤り原因の特定を目指す。
- CockpitHATは,相互作用DAGからの依存距離閾値を用いて,従来のテキストのみの帰属方法の課題を克服した。
- 公開ベンチマークにおいて,既存の最先端手法を最大17.6/16.7ポイント上回る精度を達成した。
- 新たに構築したCockpitBenchにおいても高い精度を示し,実用的なLLMマルチエージェントシステムの信頼性向上に貢献する。
予測保全:戦闘機エンジン向け深層学習による残存寿命予測 [cs.CL, cs.CC, cs.CL, cs.LG, cs.AI, cs.SY, eess.SY]目的:戦闘機エンジンの残存有用寿命(RUL)の正確な推定
- 戦闘機の稼働率向上と維持費削減は,防衛力強化において重要である。
- 従来の保守は,変化する任務プロファイルに対応しきれない場合がある。
- マルチバリアブルセンサデータから劣化特徴を自動抽出するモデルを構築する。
- 提案モデルは,NASA C-MAPSS FD001データセットでR2=0.8901,RMSE=13.28を達成した。
- FD004データセットにおいても,RMSE=15.71で高い汎化性能を示した。
- 確立された保守プロトコルは,30サイクルという重要な閾値でAUC=0.9973を達成し,高い信頼性を示した。
PPGに基づく非侵襲血糖値推定の実現可能性の再評価 [cs.HC, cs.LG]目的:PPGに基づく非侵襲血糖値推定法の評価パイプラインの構築と再評価
- ウェアラブルヘルスモニタリングの発展において,非侵襲的な血糖値測定は重要性が高い。
- 既存研究間でのデータセット,データ漏洩,評価指標の不統一により,結果の比較が困難である。
- データ分割プロトコルを厳格化し,PPGに基づく血糖値推定の汎化性能を正確に評価すること。
- ランダム分割による評価では良好な結果が得られたが,参加者単位での分割や一部参加者除外分割では,ほとんどのモデルの性能が著しく低下した。
- 多くのモデルでR$^2$値がほぼゼロまたは負となり,平均予測ベースラインと同等の性能となった。
- しかし,すべてのモデルと分割において,90%以上の予測が臨床的に許容可能な範囲内に収まったことが判明した。これにより,臨床ゾーン指標がモデルの失敗を隠蔽している可能性が示唆された。
拡散ビジョン言語モデルにおけるノイズ除去を考慮した視覚的証拠軌跡割り当て [cs.CV, cs.LG]目的:拡散ビジョン言語モデルの推論コスト削減
- ビジョン言語モデルは,視覚情報を活用することで高度な理解が可能となる。
- 拡散モデルでは,各ノイズ除去ステップで視覚情報を参照するため,計算コストが高い。
- ノイズ除去ステップごとの視覚情報需要に応じて割り当てを最適化し,コストを削減する。
- DAVETは,生成状態に応じて視覚的証拠の割り当てを調整する,学習不要なフレームワークである。
- LLaDA-VおよびLaViDaを用いた評価で,平均1.55倍の高速化を達成した。
- 性能低下は平均1.86%であり,生成品質を維持しつつ推論コストを削減できることを示した。
SearchMaster:検索エージェントのための根拠に基づいた自己対戦学習と制御 [cs.AI]目的:検索エージェントの学習データ
- 情報検索の分野は,大量のデータから必要な情報を効率的に抽出するために不可欠である。
- 高品質な検索データの取得が困難であり,人間の作成や高度な教師モデルに依存しがちである。
- 自己対戦学習を通じて,人間のラベルや専門家のデモンストレーションなしに学習データを生成する。
- SearchMasterは,LLMベースの検索エージェントを自己対戦学習によって訓練するフレームワークである。
- エビデンスチェーン生成器,検索深度報酬,過剰なドキュメント開放ペナルティの3つの制御メカニズムによって,学習データの質を向上させている。
- 6つの深層検索ベンチマークにおいて,Qwen3.5-9Bの平均精度を38.19%から51.52%に向上させ,BrowseComp-Plusで30.1ポイントの改善を達成した。
PartMat:単一のグローバル潜在変数を用いた材質を考慮した3D部品分解 [cs.RO, cs.CV, cs.AI, cs.GR]目的:材質境界に基づいた3D部品分解
- 3Dアセット生成において,構造化された編集可能なデータが求められている。
- 既存手法は機能的な意味に基づいて分解するため,実用的な材質境界を考慮していない。
- 部品数に応じて計算コストが増大する問題を解決する。
- PartMatは,単一のグローバル潜在変数で多部品形状を表現し,部品分解の効率化を実現した。
- 提案手法は,材質境界に沿った部品分解において,既存手法を大きく上回る精度を達成した。
- 拡散モデルと強化学習を組み合わせることで,正確な材質割り当てとオーバーラップ抑制を実現した。
DeepVoyager-VL:視覚をループに組み込んだ探索による,長期的マルチモーダルエージェントの促進 [cs.RO, cs.CV, cs.AI]目的:長期的マルチモーダルエージェントのための視覚をループに組み込んだ探索フレームワーク
- 大規模言語モデルの発展により視覚理解が進んだが,知識集約型問題への対応が課題。
- 既存手法では,視覚が入力・出力段階に限られ,中間的な推論における役割が不十分である。
- 視覚的証拠に基づいた継続的な探索を可能にし,推論の深さと相互作用の深さを向上させる。
- DeepVoyager-VLは,マルチモーダルイベントグラフを用いてデータ合成を行い,視覚的依存関係のある問題を生成する。
- エージェントフレームワークにより,能動的な視覚獲得とオンデマンド画像読み込みを実現している。
- 合成データを用いてモデルをファインチューニングすることで,強化学習なしに効果を確認した。
書き換えか,あるいは重み付けか?言語モデルにおける幾何学的考察 [cs.RO, cs.AI]目的:言語モデルの行動変化に対する,書き換えと重み付けの幾何学的解明
- 言語モデルの挙動理解は,AI技術の発展と応用において不可欠である。
- ポストトレーニングがモデルに与える影響のメカニズムが不明確である。
- ポストトレーニングにおける行動変化の根本的な違いを明らかにすること。
- 行動多様体解析により,モデルの行動固有の幾何学的構造を抽出することに成功した。
- SFTは既存の幾何学的構造を書き換える傾向がある一方,報酬最適化はそれを再重み付けする傾向が強い。
- 活性化空間と貢献空間における多様体解析を通じて,モデルアーキテクチャに頑健な共通基盤と,家族固有の構造を明らかにした。
エージェント強化学習における自己蒸留のための持続的な一貫性 [cs.AI]目的:エージェント強化学習における自己蒸留の安定性と性能向上
- 複雑な対話型タスクにおいて,大規模言語モデルエージェントの活用が期待されている。
- 強化学習において,報酬が疎であるため学習が困難になる場合がある。
- 教師信号の信頼性を考慮し,ノイズに強く,位置による変動を捉えた学習を目指す。
- 提案手法PCSDは,教師信号の持続的な一貫性に着目し,トークンレベルの蒸留重みを算出する。
- PCSDは,適応的ウィンドウと指数減衰集約を組み合わせ,相対的な教師の支持を捉える。
- ALFWorld全体の結果において,既存手法を上回り,特にGRPOと比較して15.6点,13.3点の改善が見られた。
頭蓋内超音波デジタルツインのための演算子学習 [cs.LG, cs.NA, math.NA]目的:経頭蓋集束超音波(tFUS)における頭蓋内音場推定の高速化
- tFUSは治療効果と安全性が重要であり,正確な音場推定が不可欠である。
- 従来の数値シミュレーションは計算コストが高く,リアルタイムなデジタルツイン化の妨げとなっている。
- 本研究は,演算子学習を用いてtFUSの音場推定を高速化し,デジタルツインの実現を目指す。
- 提案手法tFUSOperatorは,音場シミュレーションを演算子学習問題として捉え,高い精度で頭蓋内音場を予測する。
- 未知の頭蓋に対しても高いダイス係数(約72%)を示し,MRI画像からの予測精度もCT画像と同程度である。
- 従来の数値シミュレーションに比べて約5.6万倍高速に動作し,患者特異的なtFUS治療のための安全かつ実用的なデジタルツインの実現に貢献する。
拡散ワールドモデルにおけるリスク制御型潜在的ダイナミクス近似:WorldDynCache [cs.LG, cs.CV]目的:拡散ワールドモデルの潜在的ダイナミクスの近似手法
- 将来予測の質を向上させる拡散ワールドモデルは,ロボット工学やシミュレーションなど幅広い分野で重要である。
- Transformerの繰り返し評価により推論速度が遅く,実用上の課題となっている。
- 近似による潜在的遷移欠陥や,条件依存的な潜在的進化方向の変化を抑制し,高速化を図る。
- WorldDynCacheは,HunyuanVoyager-13Bで4.92倍,Aether-5Bで2.15倍の速度向上を達成した。
- WorldScore,PSNR,SSIM,LPIPSといった評価指標において,比較対象のキャッシュ手法の中で最高の生成品質を達成した。
- 潜在的遷移リスク推定器と条件・位相を考慮した潜在的サーロゲートによって,リスク制御された近似を実現している。
FP4最適化:結合緩和とデュアル粒度スケーリングによる手法 [cs.IR, cs.AI]目的:FP4量子化における精度維持と最適化
- 大規模言語モデルの利用拡大には,計算コストの削減が不可欠である。
- FP4量子化は有効だが,低精度化による精度低下が課題である。
- 量子化/逆量子化スケールの最適化空間を拡大し,精度向上を目指す。
- 提案手法FOCUSは,既存のFP4量子化手法を上回る精度をMXFP4とNVFP4の両フォーマットで達成した。
- 結合緩和スケーリング(CRS)により,量子化スケールの制約を緩和し,最適化を促進した。
- デュアル粒度スケーリング(DGS)により,局所的な重み分布に適応した,より精密なスケーリングを実現した。
学習されていないマルチモーダル大規模言語モデルにおける知識の穴の探索と埋め合わせ [cs.AI]目的:マルチモーダル大規模言語モデルにおける知識の穴の特定と改善
- 大規模言語モデルの安全性を確保するためには,有害なコンテンツの削除が不可欠である。
- 既存の機械アンラーニング評価は,削除対象との関連性が低いベンチマークを使用している。
- 汎化パターンを保護し,エンティティ抽象化による強化を行うことで知識の穴を埋める。
- 提案手法SPARは,標準的なベースラインと比較して,応答品質を98%以上回復することを示した。
- SPARは攻撃成功率を0.00%に抑え,競合するモデルの有用性を維持した。
- 本研究は,信頼性の高いMLLMアンラーニングのためには,より詳細な評価が必要であることを示唆している。
複雑固有振動数同定と基底状態ITGブランチのモード構造再構成のための物理情報ニューラルネットワーク [cs.AI]目的:複雑固有振動数同定とモード構造再構成
- 高閉じ込めモードトカマクの安定性や輸送現象を理解する上で,ペデスタル領域の解析は重要である。
- ITGドリフト波の解析には,複雑な固有振動数の特定と2次元モード場の再構成が求められるが困難を伴う。
- 物理情報ニューラルネットワークを用いて,ITGドリフト波の固有振動数とモード場を高精度に復元することを試みる。
- 提案手法は,物理的制約と疎観測下で,基底状態ITGブランチの複雑な固有振動数と2次元モード場を精度良く復元できる。
- 従来の物理情報ニューラルネットワークと比較して,提案手法は高い性能を示すことが実験的に確認された。
- 本研究は,高次モードや多分岐ドリフト波モードの解析への基盤を提供する。
重みかスキルか?ロボット学習技術の調査:行動予測の重みから,自律的にスキルを記述するロボットまで [cs.RO, cs.AI]目的:ロボット学習技術の分類と分析
- ロボットの自律性は重要であり,学習技術の進歩が不可欠である。
- ロボット学習における「スキル」の定義が曖昧で,汎用性に欠ける。
- 重みとスキルの軸で技術を整理し,自己改善メカニズムを明確化する。
- ロボット学習は,重みに能力を組み込む手法と,コードとしてスキルを記述・改良する手法の二つの方向に分かれている。
- 自己改善の度合いによってコードベースのポリシー手法を分類し,現状では限られたシステムのみが継続的な自己改善ループを実現している。
- スキルマーケットプレイスは普及しているが,適応性,移植性,安全性などの課題が残されている。
拡散言語モデルEchoChange:二重パス再マスキングによる災害変化キャプション生成 [cs.RO, cs.SY, eess.SY, cs.AI]目的:災害前後の衛星画像から変化箇所を特定し,その変化を正確かつ一貫性のある文章で記述すること。
- 災害発生時の状況把握には,衛星画像を用いた変化検出と,その変化内容を文章で記述することが不可欠である。
- 従来のキャプション生成手法は,誤った解釈が後続の文章に影響し,事実誤認が拡大するという問題があった。
- 本研究では,反復的なマスキングとノイズ除去に基づく拡散言語モデルを用いて,この問題の解決を目指す。
- 提案手法EchoChangeは,画像のペアを条件としてキャプション全体を繰り返し修正することで,不確実な内容を再検討し,誤りを修正する。
- ドラフトを意識した二重パス学習,段階的なマスキング,信頼度に基づいた再マスキングにより,学習と推論の整合性を高めた。
- RSCCベンチマークにおける実験結果から,EchoChangeが既存手法を大きく上回る性能を示すことが確認された。
大きさ・形状を超えて:方向を考慮した時系列予測損失関数 [cs.LG, cs.AI]目的:時系列予測における方向性の予測精度向上
- リスク管理や金融予測など,変化の方向が絶対値と同様に重要な応用例が多い。
- 既存の予測損失関数は点推定の大きさや形状に最適化するが,変化の方向を明示的に考慮していない。
- 変化の方向の予測精度を向上させ,特に小幅な変動における予測性能を改善すること。
- 提案手法CosDirは,予測値と正解値の差ベクトルのコサイン類似度に基づいて方向性を評価し,学習信号を再注入する。
- CosDirは軽量で,既存のアーキテクチャを変更することなく追加可能である。
- さらに,データセットごとに最適な混合比を学習するCosDir-UWを提案し,ハイパーパラメータ調整の負担を軽減する。
