arXiv雑要約
AI - 2026/07/31 公開
LAST:最終クエリトークンがエッジ-クラウド協調MLLM推論のための視覚トークンプルーニングを誘導する [cs.CV, cs.AI]目的:エッジ-クラウド協調MLLM推論における視覚トークンプルーニング手法
- エッジデバイスとクラウドの連携による視覚的知能が発展している。
- 視覚トークン列の増加がクラウド側の推論コストを増大させている。
- クエリに依存した効率的な視覚トークンプルーニングを実現すること。
- 提案手法LASTは,エッジ側のVLMを用いてクエリ依存的なプルーニングを行うことで,高い精度を維持しつつトークン数を大幅に削減できる。
- LASTは,クラウドモデルへのアクセスや高コストな処理を必要とせず,軽量な重要度シグナルからトークン選択を行う。
- 実験の結果,LASTは既存手法と比較して,より高い性能と低いオーバーヘッドを実現した。
AutoPref:ニューラル組合せ最適化のためのタスク固有の選好目的の自動発見 [cs.LG]目的:ニューラル組合せ最適化における自動選好目的発見
- 組合せ最適化問題は現実世界の意思決定の基盤であり,効率的な解法が求められている。
- 既存の選好ベースNCOは,手動で設計された選好目的関数に依存し,汎用性に課題がある。
- AutoPrefはLLMを活用し,NCOのための選好目的関数を自動的に探索・発見する。
- AutoPrefは,ペアワイズ損失プログラムと集合認識型重み付けプログラムを組み合わせて,柔軟な目的関数空間を構築する。
- 提案手法は,TSP,CVRP,FFSP,JSSPなどの問題において,既存の設計手法を安定して上回る性能を示す。
- AutoPrefは,NCOにおける自動目的関数発見の有用性とスケーラビリティを実証する。
SciSchema.org:構造化された科学的プロセス記述のための学際的なスキーマ集 [cs.DL, cs.AI, cs.CL, cs.IR]目的:科学的プロセスの構造化記述を可能にするスキーマのコレクション
- 科学研究の比較,再現性,再利用,自動化には,プロセス情報の標準化が不可欠である。
- 科学論文におけるプロセス記述は多様であり,必要な情報が分散しているため,解析が困難である。
- 科学プロセス記述の標準化を図り,情報の抽出と知識グラフの構築を支援することを目的とする。
- SciSchema.orgは,生物学,材料科学,物理学,心理学など,多様な分野を網羅する16のスキーマを提供する。
- 各スキーマは,入力,出力,材料,機器,パラメータ,手順,測定,来歴などの情報を記述するための再利用可能なフィールドを定義する。
- 大規模言語モデルと専門家の協調によりスキーマが開発され,構造,開発履歴,専門家レビューなどの技術的検証も実施された。
Σ-Mem:LLMベースのマルチエージェントシステムのためのオンライン信頼性メモリ [cs.MA, cs.AI]目的:LLMベースのマルチエージェントシステムにおける個々のエージェントおよびエージェント間の信頼性に関する履歴証拠の記録と維持
- LLMエージェントの長期間行動において,メモリは重要な役割を果たす。信頼性のモデリングは,協調的な問題解決に不可欠である。
- 既存のメモリシステムは対話内容の保存に偏っており,エージェントの信頼性や状況に応じた信頼度を考慮していない。
- エージェントの信頼性を評価し,その情報を活用することで,より適応的な協調行動を実現することを目的とする。
- Σ-Memは,個々のエージェントとエージェント間の関係に関する信頼性証拠をオンラインで記録し,安定した適応を可能にする。
- 実験結果から,Σ-Memは反事実的な信頼性の変化に適応し,未知のエージェントやタスクドメインに一般化することが示された。
- メモリからの直接的な読み出しは,多数決や固定されたエージェントよりも優れた性能を示し,信頼性メモリがLLMベースのマルチエージェントシステムの適応的な協調の基盤となることが確認された。
大規模言語モデルを用いたデッドロックフリーな通信プロトコル改善の仕様駆動型合成 [cs.SE, cs.AI]目的:通信プロトコルのデッドロックフリーな改善手法
- 分散ソフトウェアシステムにおいて,通信プロトコルの正当性は重要であり,わずかな不整合がデッドロックを引き起こす可能性がある。
- 形式仕様は厳密な保証を提供するものの,プロトコル改善を自動的に構築する支援は限られていた。
- 大規模言語モデルのコード生成能力と形式仕様の厳密性を組み合わせ,安全なプロトコル改善を自動化すること。
- 提案手法Syntropyは,MPST仕様と大規模言語モデルを組み合わせることで,デッドロックフリーなプロトコル改善を可能にする。
- Syntropyは,95.6%-99.5%の有効性と高い構文的正確性を達成し,多様な改善案を生成する。
- 改善制約を生成プロセスに直接組み込むことで,生成されたプロトコルが保証を満たすことを確実にする。
グラフを統一するとは何か:グラフ基盤モデルのための原理と生成スライディングウィンドウTransformer [cs.LG]目的:グラフドメインおよび下流タスク間での知識の再利用可能性
- グラフデータは多様な分野に存在し,その活用が求められている
- ノード特徴量の異質性が,グラフ学習における大きな課題となっている
- 異質なノード特徴量を統一し,ドメインを超えた知識転移を可能とする
- 本研究では,グラフ特徴量の統一に関する4つの要件を提示した
- SliGFMを提案し,トポロジーを考慮したスライディングウィンドウエンコーディングと生成再構築を用いた
- SliGFMは,特徴量間の関係性を捉え,情報保持を促すことで知識転移を可能とする
MARS-RA:具現化されたマルチエージェント協調における貢献度評価のためのランク集約 [cs.AI]目的:協力型マルチエージェント強化学習における貢献度評価
- 協調行動を促すため,エージェントの貢献度を適切に評価することは重要である。
- 報酬が遅延したり,エージェント数が変動すると,貢献度評価が困難になる。
- マルチモーダルモデルによるペアワイズ比較を用いて,ノイズに強く動的な状況に対応する貢献度評価手法を開発する。
- MARS-RAは,貢献度に基づいたペアワイズ比較によるランク集約問題として貢献度評価を再構成する。
- この手法は,絶対的な推定から相対的な推定にシフトすることで,ノイズに対するロバスト性とエージェント数の変動への対応を実現する。
- 実験結果は,MARS-RAがエージェントを効果的な協調行動へと導くことを示している。
二値報酬を超えて:強化学習アンラーニングのための報酬設計の比較研究 [cs.LG]目的:強化学習アンラーニングにおける報酬設計の影響
- プライバシー規制の高まりに伴い,モデルの再学習なしに特定の知識を選択的に削除する技術が重要である。
- 既存手法は疎な二値報酬に依存しており,学習信号が少なく,収束速度が制限されている。
- 報酬設計を改善し,効率的なアンラーニングを実現することを目指す。
- 提案する報酬関数は,二値報酬設定と比較して,一貫して優れたアンラーニング効率を示す。
- 類似の忘却性能を最大3倍の速さで達成し,一般的なモデルの有用性を維持する。
- 報酬設計がアンラーニング効率の重要な要因であり,スケーラブルかつ効率的な機械アンラーニングへの道を提供する。
LLMエージェントのための遷移を意識した方策最適化 [cs.ET, cs.NI, cs.LG, cs.AI]目的:LLMエージェントの方策最適化における性能向上
- LLMエージェントの能力向上は,複雑なタスクの自動化に不可欠である。
- 既存手法は疎な報酬に依存し,環境からの密なフィードバックを活用できていない。
- 環境遷移の予測と方策最適化を同時に行うことで性能改善を目指す。
- TAPOは,既存の強化学習アルゴリズムに容易に組み込むことが可能である。
- WebShopとALFWorldにおける実験により,TAPOが純粋な方策最適化よりも一貫して高い性能を示すことが確認された。
- TAPOは,モデルの環境遷移に対する感受性を高め,方策を最適化する。
Transformer学習とWasserstein分布ロバスト性に対する最適制御の一般化限界 [cs.LG, math.OC]目的:Transformer学習における一般化限界の導出
- 近年,Transformerは自然言語処理をはじめ,様々な分野で高性能を発揮している。
- Transformerの性能はデータに大きく依存し,未知のデータに対する汎化性能が課題である。
- 動的計画法に基づく学習における一般化限界を理論的に解析し,汎化性能向上に寄与する。
- Transformerの学習問題を有限ホライズンマルコフ制御問題として捉え,量子化モデルに対する一般化限界を導出した。
- 得られた限界は,状態,行動,測度空間の量子化誤差を考慮することで,元のモデルへ適用可能である。
- 本手法は,Transformerの汎化性能をWasserstein分布ロバスト最適化と関連付け,新たな視点を提供する。
判断者を共有し,保留を学習する:専門知識がLLM評価に役立つ場所 [cs.AI]目的:LLM評価における専門知識の活用方法
- LLMの能力向上には,客観的で信頼性の高い評価が不可欠である。
- 評価者の判断の質が,LLM全体の性能に大きく影響する。
- 評価における専門知識の導入方法が,性能向上に重要となる。
- 評価者の専門性を判断自体に組み込むよりも,判断の信頼性を決定する保留ルールに組み込む方が効果的である。
- 複数の専門分野に特化した評価者を訓練すると,評価精度が低下し,評価範囲も狭まることが示された。
- 専門知識を保留メカニズムに適用することで,評価精度が向上し,計算効率も高まることが確認された。
ベクトルの寄せ集め:テンソル演算の普遍的な記法 einx [cs.LG]目的:テンソル演算の普遍的な記法
- 現代科学計算の基盤であり,効率的な計算処理に不可欠である。
- 既存の記法は読みにくく,形状エラーが起こりやすいという課題がある。
- ベクトルの寄せ集めに着目し,テンソル演算の普遍的な記法を確立する。
- einxは,テンソル演算を簡潔かつ可読性の高い形式で表現できる。
- 既存のフレームワークの複雑なAPIを,より少ない基本操作に統合する。
- 一貫したルールを適用することで,形状エラーを削減し,コードの記述性を向上させる。
SNNにおける推論エネルギー増加:サンプルごとおよび普遍的なスポンジ攻撃 [cs.CR, cs.AI, cs.LG]目的:SNNの推論時のエネルギー消費量を増加させる攻撃手法の検討
- SNNは低消費電力で動作するため,常に起動状態のバッテリー駆動エッジシステムへの応用が期待されている。
- SNNの効率性は,セキュリティ上の脆弱性にもつながりうる。特に検知が困難な攻撃が課題である。
- 入力空間の効率性攻撃によるエネルギー消費量の増加を,イベントベースSNNに特化して検証し,対策を検討する。
- 提案手法であるサンプルごとのスポンジ攻撃は,NMNIST, SHD, IBM DVS Gestureデータセットにおいて,推論時のSynOpsを1.5~2.6倍に増加させた。
- 初めてとなる普遍的なスポンジ攻撃を提案し,すべてのデータセットでSynOpsを1.09~1.24倍増加させることを確認した。
- SynOps増加をLoihi-1のエネルギー消費量に換算した結果,推論ごとのオーバーヘッドは14μJ~13.24mJに達した。
SKIMIX:スキル混合を用いた動的ハーネスエンジニアリングのためのマルチエージェントハーネス時間スケーリング [cs.AI]目的:スキルライブラリの選択,組み合わせ,維持に関する課題解決
- AIエージェントは大規模なスキルライブラリに依存しており,その重要性は増している。
- スキルの選択,組み合わせ,維持は依然として困難な課題である。
- マルチエージェントによる協調を通じて,スキル活用を効率化することを目指す。
- SKIMIXは,埋め込みベースのスキル検索,サブモジュールアンチディリュートルーティング,適応的スキル進化を組み合わせている。
- 6つの推論ベンチマークにおいて,マルチエージェント協調はオープンエンドな数学的推論を大幅に改善する一方で,多肢選択問題では限定的またはマイナスの効果にとどまる。
- エージェント数のスケーリングは非単調であり,大部分の改善は最初の洗練ラウンドで生じる。
MMLDSum-LLM:視覚的アラインメントとキーワード認識を用いたマルチモーダル長文書要約 [cs.AI]目的:マルチモーダル長文書の要約における,重要な情報の網羅性とクロスモーダル一貫性の向上
- 専門知識の重要な伝達手段であるマルチモーダル長文書の活用が不可欠である。
- マルチモーダルLLMによる要約において,キー情報の欠落やクロスモーダルな幻覚が生じやすい。
- 長距離依存性のモデル化と,異なるモダリティ間のアラインメントの課題を克服することを目指す。
- MMLDSum-Benchという高品質なマルチモーダル長文書要約ベンチマークを新たに構築した。
- MMLDSum-LLMという,視覚的アラインメントとキーワード認識を重視した二段階の学習フレームワークを提案した。
- 提案手法は,主要なモデルと比較して,キー情報の網羅性とクロスモーダル一貫性を大幅に向上させた。
分類を超えて:有糸分裂像検出のための病理学的基盤モデルのエンコーダ [cs.CV, cs.AI]目的:有糸分裂像検出における病理学的基盤モデルの潜在空間の有効性
- 病理画像解析は,疾患診断や予後予測において重要な役割を担う。
- 既存の検出手法は,学習データに大きく依存し,汎化性能が課題。
- 基盤モデルの潜在空間が,高精度な有糸分裂像検出に利用できるか検証。
- H-optimus-0とVirchowモデルは,ResNet50ベースラインと同等の性能を示した。
- 既存の基盤モデルの潜在空間は,有糸分裂像検出に直接利用可能であることが示された。
- データセット外のテストケースにおいても,ある程度の頑健性が見られた。
RepBench:大規模言語モデルの能力表現をベンチマークに集約する [cs.CL, cs.AI]目的:大規模言語モデルの能力表現に関するベンチマーク集約のデータ層
- 大規模言語モデルの能力を理解・制御することは,AI研究において重要な課題である。
- 既存の研究では,特定の論文に依存したデータで評価されるため,比較や再現が困難である。
- 複数のベンチマークを利用することで,より信頼性の高い能力評価を目指す。
- RepBenchは,13,427件の論文から182の能力クラスターを抽出し,353のデータセットから46,149のプローブテキストを収集した。
- テキストベクトルは自然なクラスターを示さなかったが,ベンチマークで集約した能力ベクトルは最適なクラスター構造を示した。
- 評価手法や集約基準がモデル性能に影響を与えることが示された。差の平均値は多くのモデルで最高の性能を示し,ロジスティック回帰は最も多くの能力・モデルの組み合わせで優位性を示した。
オープンウェブのためのユーザー基盤モデルの構築 [cs.LG]目的:オープンウェブにおけるユーザー行動の表現学習
- ウェブ広告におけるユーザー理解は,広告効果の最大化に不可欠である。
- オープンウェブでは,ユーザーIDが断片的で履歴データが不足するため,効果的なユーザーモデリングが困難である。
- ユーザーの閲覧履歴から自己教師あり学習により表現を学習し,その有効性を検証すること。
- Transformerエンコーダーを用いた事前学習により,ユーザーの閲覧履歴から有用な表現を学習できた。
- 学習された表現は,入札単価モデルとCTRランキングモデルの両方において性能向上を示し,実環境A/BテストでCTRが2.13%改善された。
- LLMを活用した学習パイプラインの最適化により,工業的な設定でLLMをオプティマイザーとして活用することの実現性を示した。
Flux-OPD:進化するコンテキストを用いたオンポリシー蒸留 [cs.LG, cs.AI]目的:オープンエンドな領域における言語モデルの学習におけるタスク選好の捕捉
- 大規模言語モデルは多様なタスクに応用可能だが,報酬が明確でないため学習が難しい。
- コンテキストはタスク選好を示唆するが,蒸留後の追加的な学習効果は限定的である。
- 進化するコンテキストを用いることで,学習の安定性を保ちつつタスク選好を効果的に学習する。
- Flux-OPDは,コンテキスト条件付き教師モデルとコンテキストフリー教師モデルの差をコンテキスト差分信号として利用する。
- コンテキスト差分信号をコンテキストフリー教師モデルに注入し,競合項を用いてその強度を調整する。
- オープンエンドなタスクにおける実験で,既存の蒸留パラダイムと比較してFlux-OPDが優れた性能を示す。
スケーリング,ロックイン,そしてプロキシコンプライアンス:責任あるAIの政治経済学 [cs.CY, cs.AI, cs.GT, econ.TH]目的:責任あるAIにおける説明責任のメカニズム
- AI技術の社会実装が進む中で,その安全性と公正性を確保することが重要課題となっている。
- AIシステムの導入後の監視や検証が難しく,潜在的なリスクが放置される可能性がある。
- AIベンダーと導入者の関係性を分析し,責任あるAIの実現に向けた政策提言を行う。
- AIベンダーは,導入者の監視に対する期待を予測し,社会的に最適な水準を下回る程度の緩和策にとどまる可能性がある。
- 独立監査権限の付与,データの移植性,インシデント報告義務,そして結果連動型責任の導入が,AIの説明責任を高める効果を持つ。
- 文書化や標準化評価が,実際の運用結果との乖離を生み出す原因となるメカニズムを解明した。
特権的自己蒸留によるコントラスト強化学習 [cs.LG]目的:多段階エージェント環境における強化学習の安定性と汎化性能の向上
- 大規模言語モデルの性能向上には,強化学習が不可欠であり,その報酬設計が重要な課題となっている。
- 自己蒸留は有用だが,特権情報に起因するバイアスにより,探索が制約され,最適化の方向性が失われる。
- コントラスト学習の視点を取り入れ,バイアスを抑制し,安定した最適化信号を維持することを目指す。
- 提案手法CRPOは,予測エントロピーを用いて探索とバイアスを識別し,コントラスト学習によって最適化信号を保持する。
- 13のベンチマーク評価において,CRPOは既存の強化学習や自己蒸留手法を凌駕し,安定した学習を実現した。
- 特に,長期的相互作用において,汎化性能が大幅に向上することが示された。
エージェントベースシミュレーションモデルの機械的可再現性のための構造化記述プロトコルVISA [cs.MA, cs.AI, cs.CE]目的:エージェントベースシミュレーションモデルの記述と再現性向上
- 社会現象や複雑系の理解に不可欠なエージェントベースシミュレーションの重要性が増している。
- モデル記述が散漫で,再現性が低いことが課題となっている。
- モデルの構造を形式化し,機械的な検証とコード生成を可能にすること。
- VISAプロトコルは,モデルを8つのテーブルで構造化し,最小限かつ完全な記述を可能にする。
- これにより,モデルの妥当性を検証可能なルールとして定義し,LLMを活用した自動化を促進する。
- NetLogoとPython間のモデル再現や,AnyLogicモデルの記述を通して,VISAの有効性が確認された。
多重組織画像における空間的な細胞構造の解読 [cs.AI, cs.CV]目的:多重イメージングにおける組織構造の理解
- 組織構造の理解は,疾患の病態解明や治療効果予測に不可欠である。
- 既存手法は,手作業による特徴量に依存し,汎用性や拡張性に課題がある。
- 本研究は,組織構造を効率的に学習し,多様なデータセットへの適応を目指す。
- MUL-Tは,細胞トークンを用いたマスク化された文脈予測タスクとして組織構造を捉える軽量なTransformerフレームワークである。
- タスク固有の教師なしで文脈化された[CLS]埋め込みを学習することで,高次の細胞間相互作用を捉え,計算効率を維持する。
- 腫瘍パターン分類,グレード評価,PD-L1陽性予測,治療反応予測などのタスクにおいて,従来のフィーチャーベース手法やViTモデルと同等の性能を示す。
DataClawEval:実世界のデータエンジニアリングにおけるエージェントのベンチマーク [cs.AI]目的:データエンジニアリングエージェントのタスク遂行能力の評価
- データ管理は,ビジネスにおける意思決定や効率化に不可欠であり,その重要性は増している。
- 既存のベンチマークは単純化されたタスクに偏っており,実用的なデータエンジニアリングの評価が不足している。
- 実世界のデータエンジニアリングシナリオにおける自律エージェントの能力を総合的に評価するベンチマークを提供する。
- DataClawEvalは,PySpark,MySQL,HiveSQLなど5つの実行エンジンに対応した100件の実用的なデータエンジニアリングタスクで構成される。
- 評価された16の最先端エージェントは全体で74.9%のスコアに留まり,単一のモデルがすべてのエンジンで優位性を示すことはなかった。
- この結果は,データエンジニアリングにおける自律エージェントの汎用性がまだ限られており,専門性が求められることを示唆している。
不規則時間系列予測の連続時間モデリングフレームワークによる改善 [cs.LG]目的:不規則時間系列予測における性能向上
- 医療モニタリング等,不規則な多変量時系列データは広く存在する。
- 不規則な観測間隔や欠測が,予測精度を低下させる要因となる。
- 連続時間モデリングの計算コストと,離散化による情報損失を解決する。
- 提案手法WrapFlowは,連続時間トークン化により,観測イベントと間隔を直接エンコードする。
- WrapFlowは,標準的なTransformerアーキテクチャを用いて長期依存性を捉える。
- シミュレーションフリーな訓練パラダイムにより,高速かつ高品質な予測を実現した。
ニュートンのアルゴリズムからの特徴量学習:非線形パラメータ化偏微分方程式ソルバーの高速化 [cs.LG, cs.NA, math.AP, math.NA]目的:非線形パラメータ化偏微分方程式ソルバーの高速化のための手法
- 偏微分方程式は自然科学,工学の様々な分野で現象を記述する上で不可欠である。
- 非線形偏微分方程式の求解は計算コストが高く,効率的なソルバーの開発が課題である。
- ニュートンのアルゴリズムの初期推測を改善することで,求解プロセスを加速することを目指す。
- パラメータ空間のサンプリングと事前計算された解のデータベースから特徴量を学習し,二段階のニュートン初期推測戦略を提案した。
- これにより,従来のサーロゲート初期化と比較して,計算時間の短縮が確認された。
- 本手法は,大規模な非線形問題に広く適用可能である。
ClawTrack:実世界における自律エージェントのトレースレベル評価と改善に向けて [cs.LG]目的:LLMベースエージェントの評価方法
- 複雑なタスク遂行能力を持つ自律エージェントの性能評価は,実用化において不可欠である。
- 既存の評価方法は最終結果のみを評価するため,成功の要因や失敗の原因を特定できない。
- エージェントの思考過程を詳細に評価し,改善点を見つけるためのフレームワークを提案する。
- ClawTrackは,タスクの成果(Task Score)と達成方法(Process Score)を同時に評価する。
- Process Scoreは,目標への適合性,効率性,情報利用,結果検証の4つの側面から思考過程を評価する。
- Process Scoreに基づいた軌跡フィルタリングは,モデルの規模に関わらず性能向上に繋がる。
時間変化型インプラシットニューラルボリュームに対するクエリ効率的なボリュームレンダリングフレームワーク [cs.CY, cs.RO, cs.GR, cs.LG]目的:時間変化型インプラシットニューラルボリュームの効率的なレンダリング
- 科学的可視化において,ボリュームデータのコンパクトな表現が重要であり,特に動的なデータには必須である。
- インプラシットニューラルボリュームのレンダリングは,ニューラル推論コストが高く,リアルタイム性が課題である。
- デルタトラッキングに基づくクエリ効率的なフレームワークにより,インタラクティブなレンダリングを実現すること。
- 提案手法は,ヘテロジニアス並列処理を活用し,GPUのレイトレーシングコアとテンソルコアを有効活用する。
- レイトレーシングの予算管理とクエリプルーニングにより,インプラシットニューラルボリュームへのクエリ数を削減し,レンダリング性能を向上させる。
- RTX 4090 GPU上で1024x1024解像度で~30-40 FPSを達成し,高品質な画像を生成し,インタラクティブな時間探索を可能にする。
SKILL-KD:LLMエージェントのためのコントラスト学習によるスキル蒸留 [cs.AI]目的:LLMエージェントのスキル獲得と改善
- LLMエージェントの性能向上は,多様なタスクへの適応能力に依存し,スキル獲得はその鍵となる。
- 既存のスキル獲得手法は,弱体なエージェントにとって,失敗から学習するための十分な情報を提供できない場合がある。
- SKILL-KDは,教師と生徒のエージェント間の能力差を考慮し,明示的なスキル蒸留を通じてこの問題を解決する。
- SKILL-KDは,教師と生徒の行動の差異をテキスト形式のスキルパッチとして抽出し,生徒の性能を反復的に改善する。
- スキルパッチの編集履歴を追跡し,スキルドリフトを防ぐためのドリフト認識スキル統合メカニズムを導入する。
- 5つのベンチマークと2つの生徒設定において,固定モデル適応と比較して,一貫して改善効果が確認された。
IndustryForge-27B: 産業CADのためのドメイン強化マルチモーダル基盤モデル [cs.AI]目的:産業CAD設計・製造におけるマルチモーダル基盤モデルの性能向上
- 産業界における設計・製造自動化の重要性が増しており,高度なAIモデルが求められている。
- 汎用マルチモーダルモデルは,エンジニアリング図面やCADコードの処理において十分な性能を発揮できない。
- 産業CAD特化型モデルを開発し,多様なタスクに対応できる基盤を確立することを目指す。
- IndustryForge-27Bは,既存モデルQwen3.5-VL-27Bに対し,CADドメインのベンチマークで平均33.65%の性能向上を達成した。
- GPT-5.4を含む他の強豪モデルを凌駕し,汎用的な能力においても性能を維持・向上させている。
- 本モデルは,CAD設計からソフトウェア操作までを網羅する産業用エージェント開発の共通基盤として活用できる。
SemPIC:意味に基づいた位置非依存KVキャッシュの学習 [cs.AI]目的:長文脈検索とエージェント型ワークロードにおけるKVキャッシュの性能向上
- 大規模言語モデルの性能は,文脈長と効率的な情報検索に依存する
- 従来のキャッシュ手法では,文脈の変化やドキュメントの再利用が十分に考慮されていない
- ドキュメント表現自体を適応させることで,キャッシュの再利用性と精度を向上させる
- SemPICは,LoRAを活用したWriterを用いて,各層のドキュメントKVを学習的にコンパイルする。
- これにより,KVキャッシュの平均マイクロF1スコアを0.53から0.60に向上させ,フル再計算に近づけた。
- また,KV Gradient Checkpointingにより,学習時のメモリ使用量を削減することに成功した。
GVR-Coder: 複雑な文書および会議シナリオにおける構造化SVG生成のための視覚的フィードバックフレームワーク [cs.IR, cs.HC, cs.LG, cs.CV]目的:複雑な文書や会議のシナリオにおいて,構造化されたSVGを生成するための視覚的フィードバックフレームワーク
- 専門的な環境や会議レビューにおいて,長文は認知負荷を高めるため,効率的な情報伝達が求められる。
- テキストからSVGへの変換研究は,複雑な図のデータセット不足,レイアウトの事前知識の欠如,視覚的フィードバックの不足に課題がある。
- 高品質な論理図を生成し,構造的複雑さと視覚的な美観を同時に最適化することを目指す。
- 大規模なSVGデータセット DocMeetSVG-100K を新たに構築し,文書作成および会議レビューのシナリオに対応した。
- カリキュラム駆動型リジェクションサンプリングを用いたファインチューニングにより,複雑な構造のモデリング能力を段階的に向上させた。
- デュアルレンダリングフィードバックを用いた強化学習と,生成・検証・修正エージェントループにより,生成品質を改善した。
大規模なコンピュータ利用エージェント訓練のための,深層で進化する環境:Echoverse [cs.AI, cs.LG]目的:コンピュータ利用エージェントの訓練環境の構築と,その有効性の検証
- コンピュータ利用エージェントの開発は,自動化や効率化に不可欠であり,その性能向上が求められている。
- 既存の訓練環境は,現実世界の複雑さを捉えきれておらず,エージェントの汎化性能が低いという課題がある。
- より現実的で,エージェントの学習に合わせて進化する環境を構築することで,性能向上を目指す。
- Echoverseは,仕様に基づいてステートフルなアプリケーションを生成し,そのアプリケーション自身のデータベースを用いてタスクを評価する。
- 12個の環境で訓練した90億パラメータのモデルは,14個の評価分割において,36.5%から67.1%へと精度が向上し,より大規模なモデルに匹敵する性能を示した。
- 環境の深さ,対象となるインタラクション,環境の改善が,性能向上に重要な要素であることが示された。
時間的ポイズニング:SNNにおけるイベント再分配によるクリーンラベルバックドア [cs.CR, cs.AI]目的:SNNに対するクリーンラベルの時間的ポイズニング攻撃
- ニューロモーフィックコンピューティングの発展に伴い,SNNのセキュリティが重要になっている。
- SNNに対するバックドア攻撃は,汚染されたラベルを用いるものが主流であり,クリーンラベル攻撃は未検討だった。
- 時間軸の変換による,ラベルを改変しないクリーンラベルバックドア攻撃の有効性を示す。
- 提案手法は,3つのニューロモーフィックデータセットにおいて,攻撃成功率1.00を達成した。
- 時間軸を潰す防御は攻撃を検知できず,特徴空間での検出は限定的な状況下でのみ有効である。
- ステップごとのイベント質量に基づくモデルフリー検出器は,評価された時間的変換を検出できた。
エージェント型強化学習のためのグループ反射的自己蒸留 [cs.AI, cs.LG]目的:検証可能な報酬を用いた強化学習におけるエージェントの性能向上
- 大規模言語モデルエージェントの訓練において,報酬の検証可能性は重要である。複雑なタスク遂行能力の獲得に不可欠。
- 従来の報酬は最終的な結果のみを提供するため,成功要因と失敗要因の区別が困難である。詳細な行動レベルでの学習が課題。
- 自身の検証済みロールアウトから,能力に合致し,結果を識別可能なガイダンスを生成することで,この問題を解決する。
- 提案手法GRSDは,強化学習エージェントの自己教師あり学習を改善し,より詳細な行動レベルでの報酬信号を生成する。
- GRSDは,成功例と失敗例の反射を対比させ,グループレベルでの学習ガイダンスを構築することで,より効果的な学習を実現する。
- 複数の環境とモデル規模において,GRSDは既存手法を上回り,未知のタスクへの汎化性能も高いことを示した。
Chem World:信頼性の高い化学的性質予測のための大規模ベンチマークと物理情報に基づくフレームワーク [cs.CL, cs.LG, cs.AI]目的:化学的性質予測のベンチマークと,物理情報を組み込んだ予測フレームワーク
- 化学,材料科学,医薬品開発における科学的発見の加速に,化学的性質予測は不可欠である。
- 既存のベンチマークは,タスクの多様性やデータの一貫性に課題があり,AIモデルの信頼性評価が困難である。
- AIモデルの信頼性と汎化性能を系統的に評価できる基盤を確立し,科学的発見を促進すること。
- Chem Worldは,80万以上の分子サンプルを含む17の多様な化学データセットを統合した大規模ベンチマークである。
- 提案手法であるMixture-PINNは,化学の事前知識を組み込むことで,予測精度,ロバスト性,信頼性を向上させる。
- Chem Worldを用いた実験により,既存手法と比較して提案手法の有効性が確認された。
大規模言語モデルからのアンサーセットプログラミング理論の蒸留 [cs.CL, cs.NI, cs.AI]目的:大規模言語モデルからのアンサーセットプログラミング理論の抽出
- 知識表現と推論の自動化は,AIの発展に不可欠であり,そのための手法が求められている。
- アンサーセットプログラミング理論の作成は専門知識を要し,時間と労力がかかる。
- 大規模言語モデルを活用し,自動的に正確なアンサーセットプログラミング理論を生成することを目指す。
- 最先端モデル4種中3種が,CLEVRベンチマークで100%,GQAで92.8~98.8%の正答率を達成した。
- CLEVRERベンチマークでは,Sonnet,Opus,DeepSeek V4 Proが92.7~95.3%のスコアを示したが,GPT-5は性能が低下した。
- 他のデータセットからの参照理論の追加は,GPT-5の精度を低下させた。
AIによる均質化に対抗する,多様な個別研究アイデア創出 [cs.AI]目的:個別研究アイデア創出における多様性の確保
- 科学的発見の加速が求められ,AI支援の研究アイデア創出が注目されている。
- 既存システムはアイデアを個別最適化するため,研究者の専門性やコミュニティの偏りが課題となる。
- 研究者固有の視点を取り入れ,コミュニティ全体のアイデアの均質化を防ぐことを目指す。
- 提案手法DivAlignは,研究者プロファイルを詳細に抽出し,研究者固有のアイデア候補を生成する。
- 実行可能性,理解度,成長可能性の3つの側面からアイデアを評価し,研究者とアイデアの適合性を維持しつつ,冗長性を低減する。
- AI研究者95名からの実験結果,コミュニティレベルの冗長性が減少し,研究者とアイデアの適合性は維持された。
PerturbMap:単一細胞摂動応答の交差コンテキスト転移 [cs.AI]目的:単一細胞摂動アトラスにおける,コンテキスト間の摂動応答予測手法
- 単一細胞レベルでの遺伝子機能解析は,疾患メカニズムの理解に不可欠である。
- 全ての細胞コンテキストで全ての摂動を測定することは,実験的コストの面で困難である。
- 測定された応答を他のコンテキストへ適切に転移し,予測精度を向上させることを目指す。
- PerturbMapは,受信コンテキスト固有の低ランク基盤と,ソースコンテキストからの摂動応答転移を組み合わせる。
- Perturb-CITE-seqメラノーマコホートにおいて,従来のモデルと比較して,平均二乗誤差を4.1%改善した。
- 中央集権型参照データと比較しても,遜色ない精度を達成し,コンテキスト固有性の識別においても改善が見られた。
AIガバナンス提案を評価するツール:大規模なAI政策分析 [cs.AI]目的:AIガバナンス提案の体系的かつ透明性のある評価のための枠組み
- AI技術の発展は社会に大きな影響を与えており,適切なガバナンスが不可欠である。
- AI政策議論は二分化しやすく,根本的なトレードオフや規範的仮定が曖昧になりがちである。
- 政策分析における分析的仮定の明示化と,優先順位の明確化を支援する。
- 本研究では,複数の政策属性に基づく評価枠組みを提示し,専門家の知見と計算テキスト分析を組み合わせた透明性の高い手法を採用した。
- その結果,政策目標の相対的な重要度を定量化し,比較的可視化を通して政策間の比較を容易にした。
- 汎用LLMとドメイン特化型モデルの性能を比較することで,政策分析におけるLLMの利用可能性を評価した。
専門家削減から行動の乖離へ:スパースMoE推論を通じた数値状態の追跡 [cs.LG]目的:スパースMoE推論における数値状態の変動とその原因の特定
- 大規模言語モデルの効率化は,計算資源の制約下で重要な課題である。
- MoEモデルでは,専門家選択の順序が結果に影響を与える可能性が指摘されている。
- 推論における数値状態の変動を制御し,再現性を高めるための条件を明確化する。
- 数学的に等価な専門家削減順序が,異なるMoE実行を生み出すことが確認された。
- Bモードの順序選択では,多様な継続パスが観察され,数値状態の乖離が示唆された。
- MoEにおける専門家変換,精度,削減順序は,数値的な互換性契約の一部であると結論付けられた。
SciDataSailor:深層科学データ探索 [cs.AI, cs.CL]目的:科学データの階層構造の探索,統合,分析
- 科学研究の進展には,大量の科学データの効率的な利用が不可欠である。
- 科学データは複雑な構造を持ち,専門知識なしには分析が困難である。
- LLMエージェントを活用し,科学データの探索・分析を自動化する。
- SciDataSailorは,科学データリポジトリ内の探索と分析を自動化するフレームワークである。
- モンテカルロ木探索を用いて,探索の幅広さと目標指向性のバランスを取っている。
- 627件のメタ情報要約タスクと586件の科学的な質問応答タスクを用いて評価された。
意図を考慮した情報ボトルネックによるLLMエージェントのための軽量かつ効果的なメモリ注入防御:MIND [cs.NI, cs.CL, cs.DC, cs.AI]目的:メモリ注入攻撃に対する防御機構
- LLMエージェントの性能向上には,外部メモリからの知識活用が不可欠である。
- メモリに悪意のある情報を注入されることで,エージェントの行動が歪められる脆弱性が存在する。
- 既存防御策の計算コストや多岐にわたる文脈での情報冗長性を解消し,軽量かつ効果的な防御を実現する。
- MINDは,初期意図と行動の関係性の違いを利用し,意図を考慮した情報ボトルネックを導入することで,攻撃信号を保持しつつ不要な情報を削減する。
- その結果,MINDはタスク精度や推論効率を維持しつつ,攻撃成功率を大幅に低減することに成功した。
- ReAct-StrategyQAにおいて,MINDはASR-rとASR-aをそれぞれ55.4%と55.3%削減し,防御なしのエージェントと同等の精度と遅延性を実現した。
言い換えを超えて:書籍レベルの構成が,Mid-Trainingにおける合成教科書データの質を向上させる [cs.AI]目的:合成教科書データを用いた言語モデルの事前学習における性能向上
- 言語モデルの性能は,学習データに大きく依存し,大規模な高品質なデータセットが求められている。
- 既存の合成データ生成手法は,コンテンツの質や局所的な書き換えに焦点を当て,文書全体の構造に着目した研究が不足していた。
- 書籍レベルの構成が,合成データ生成における性能向上に寄与するかどうかを検証し,より効果的なデータセットを構築すること。
- 合成教科書データが,既存の自然な書籍データに代わる学習データとして有効であり,平均で1.09の性能向上が確認された。
- 書籍レベルの構成(章立て,トピックのクラスタリング)が,単にテキストを結合するよりも,高い効果をもたらすことが示された。
- Llama3-8Bを用いた実験でも,合成データが自然な書籍データを上回り,書籍レベルの構成の有効性が確認された。
ブループリント修理:失敗したLean証明ブループリントに対する型付きローカル編集 [cs.AI]目的:Lean証明のブループリント(形式的命題の依存グラフ)の修理手法
- 形式的証明支援は,ソフトウェアやハードウェアの検証において不可欠であり,信頼性の高いシステム構築に貢献する。
- 大規模言語モデル(LLM)を用いた証明支援システムでは,証明の複雑性による失敗が課題となっている。
- ブループリントの局所的な編集を通じて,LLMが失敗した証明を効率的に修正することを目指す。
- 型付き編集インターフェース「BlueprintRepair」を開発し,10種類のスキーマチェック済みのローカル操作を導入した。
- DeepSeek-V4-Flashを用いた実験で,型付き編集は他のインターフェースと比較してコストが最も安く,高いカバレッジを達成した。
- Qwen3.6-Flashでも同様の結果が得られ,型付き編集の有効性が確認された。
忠実な時系列予測の説明のための情報ボトルネック学習 [cs.NI, cs.CL, cs.SI, eess.SY, cs.SY, cs.LG, cs.AI]目的:時系列予測の説明の忠実性向上
- エネルギー,交通,医療など,予測が意思決定を左右する場面が増加しており,予測の根拠理解が重要である。
- 既存の解釈可能な予測モデルは,その構造が予測の根拠を正確に反映している保証がない。
- 予測精度を維持しつつ,予測の根拠を忠実に説明できるモデルを開発すること。
- 提案手法IB-Forecastは,予測誤差において最先端のブラックボックスモデルと同等の性能を示す。
- IB-Forecastは,追加の推論コストなしに,忠実な説明を提供する。
- 他の説明手法と比較して,IB-Forecastのネイティブな説明は一貫して高い忠実度を示す。
医療画像における教師なしドメイン適応のための実用的なアルゴリズム選択 [cs.CV, cs.AI]目的:教師なしドメイン適応におけるアルゴリズムとハイパーパラメータの選択基準
- 医療画像解析の精度向上は,疾患診断や治療効果の予測において不可欠である。
- ラベルなしのターゲットドメインでは,アルゴリズムの性能を直接評価することが困難である。
- ターゲットラベルを用いずに,最適なアルゴリズムとハイパーパラメータを選択すること。
- 提案手法は,複数の選択シグナルを用いて各アルゴリズムからモデルを選定し,それらを統合して参照予測を生成する。
- この参照予測との一致度に基づいて候補モデルを評価し,最も一致するモデルを選択する。
- 脳MRIと胸部X線画像を用いた実験により,提案手法が既存手法よりも優れた選択性能を示すことが確認された。
ConMem:長期間の製造検査ログに対する貢献度を考慮したメモリ [cs.AI]目的:長期間の製造設備検査ログの解析における,貢献度を意識したメモリの構築
- 設備の安定稼働には,過去の検査記録を有効活用し,潜在的なリスクを早期に発見することが重要である。
- 従来のシステムでは,検査ログを静的なデータとして扱い,診断価値の低い情報も保持してしまうため,早期リスクの検出が困難であった。
- 本研究では,検査ログの重要度を評価し,必要な情報のみを効率的に保持することで,早期リスクの特定を支援することを目的とする。
- 提案手法ConMemは,実世界のデータセットにおいて,QAタスクで76.0%の精度を達成し,既存の最良のベースラインを上回った。
- ConMemは,入力トークン数を平均88.2%削減し,応答時間を86.6%短縮することに成功した。
- 機能役割を考慮したセグメンテーションと貢献度に基づいた評価が,早期の劣化信号の優先度付けに貢献することが示された。
FinSMART:市場連動型強化学習による金融感情分析とアルゴリズム取引 [cs.CL, cs.LG, q-fin.ST, q-fin.TR]目的:金融感情分析における市場連動型強化学習フレームワークの提案
- 金融市場において,感情分析は投資判断に重要な影響を与えるため,その精度向上は不可欠である。
- 既存の感情分析手法は,静的なデータセットに依存し,変化する市場環境への適応が困難である。
- 市場の変化に追従し,より安定的な取引を可能にする感情分析手法の開発を目指す。
- FinSMARTは,市場の実現結果を用いて感情シグナルを直接最適化する初の市場連動型強化学習フレームワークである。
- 実験結果から,FinSMARTは既存の最先端手法と比較して,収益性,リスク調整後のパフォーマンス,感情シグナルの品質において大幅な改善が見られた。
- FinSMARTは,市場を意識した再学習を可能にし,手動アノテーションのコストを削減しながら,常に変化する市場ダイナミクスに適応する。
LLMによる有用性判断を教育シグナルとして再考:チューターモデルにおける事前登録された監査 [cs.CL, cs.AI, cs.CY]目的:LLMチューターの有用性評価における問題点と,教育的ガイダンスの識別能力に関する検証
- LLMチューターは教育分野に革新をもたらす可能性があるが,その評価方法には課題が残る。
- 汎用的な有用性指標では,直接的な解答提供と教育的ガイダンスを区別できない可能性がある。
- 本研究は,教育的ガイダンスを評価するためのより信頼性の高い指標を特定することを目的とする。
- 有用性評価はチューターモデル間で一貫性がないのに対し,教育的ガイダンスの評価はモデル間で明確に差が見られた。
- 解答を示唆するターンは,その後の生徒の自律的な学習を減少させることが確認された。
- 本研究の結果から,汎用的な有用性指標は信頼できる教育的ガイダンスの指標とは言えない。
