arXiv雑要約
AI - 2026/08/03 公開
TAVI-TEC:経カテーテル大動脈弁留置術の手術計画のためのAIベースツール [cs.CV, cs.AI, cs.LG]目的:経カテーテル大動脈弁留置術(TAVI)の前準備における効率化と標準化
- TAVIは高齢化に伴い増加しており,正確かつ迅速な術前計画が重要である。
- CT画像からの手動計測には時間と専門知識が必要であり,術者間差が生じやすい。
- AIを用いてCT画像から必要な計測を自動化し,術前計画の効率化と精度向上を目指す。
- TAVI-TECは,SAPIEN 3 Ultra(S3U)弁を用いたTAVI患者の術前CTAスキャンを約2~6分で処理可能である。
- 大動脈弁輪面積(CCC=0.934,ICC=0.935,R^2=0.881)および周囲長(CCC=0.909,ICC=0.909,R^2=0.854)は,医師による計測と高い一致性を示した。
- 弁サイズ予測モデルは全体で82%の精度を達成し,誤分類の多くは隣接するサイズ間での発生であった。
報酬を混ぜず,ポリシーを混ぜる:マルチ報酬RLのためのポリシー分解と最適化 [cs.AI]目的:マルチ報酬強化学習におけるポリシー分解と最適化
- 大規模言語モデルの発展に伴い,多様な価値観や用途への適応が求められている。
- 複数の報酬を同時に最適化すると,目的間のトレードオフや衝突が生じやすい。
- ポリシー空間の分解と合成により,報酬間の競合を緩和し,制御性を高める。
- 提案手法PRISMは,既存のマルチ報酬RLベースラインを科学的推論,ツール利用,安全性と有用性の整合性において上回る。
- PRISMは,独立したポジティブポリシーとグローバルなネガティブポリシーを最適化することで,安定した学習を可能にする。
- 推論時の柔軟なポリシー合成により,嗜好に応じた制御を実現する。
キャリブレーションされた評価基準:オープンエンドLLM評価のためのタスク適応型評価基準バンク [cs.CL, eess.SY, cs.SY, math.PR, q-bio.PE, cs.CL, cs.AI, cs.LG]目的:オープンエンドLLM出力の信頼性評価
- LLMの能力評価は重要だが,専門家による評価基準の作成はコストと労力を要する。
- 既存の自動評価パイプラインは厳格な合意と二値分散フィルタに依存し,有益な評価基準を区別できない。
- タスクに適応した評価基準バンクの構築により,効率的かつ不確実性を考慮したLLM評価を実現する。
- タスク固有のスコアリング,ベイズに基づく評価基準の測定可能性フィルタリング,IRTに基づくバンク構築を組み合わせたCalibratedRubricを提案。
- JudgmentBenchにおける人間のゴールド評価との一致度が,$\kappa=0.604$から$0.743$へ向上。測定可能性フィルタリングの効果を確認。
- FinResearchBenchタスクにおいて,ランダム選択と比較して,IRTに基づく貪欲選択により,ターゲット相関に到達するのに必要な評価基準数を削減(131から49へ)。
ツール仕様が重要:AIエージェントにおける安全リスクの解明と軽減 [cs.AI]目的:AIエージェントの安全リスクとその軽減策
- AIエージェントの活用は拡大の一途を辿っており,社会への影響が大きい。
- LLMをエージェントとして利用した場合,安全性低下が課題となっている。
- ツール仕様が安全性の低下に寄与することに着目し,その対策を提案する。
- ツール仕様の形式が,モデルの拒否シグナルを弱体化させ,安全でないツール実行に繋がることが明らかになった。
- 提案手法SafeKeepは,推論時に安全判断とツール実行を分離し,有害なリクエストに対する拒否率を向上させる。
- SafeKeepは既存の安全対策よりも高い性能を示し,タスク遂行能力も維持している。
ポリイミド設計における特性予測,構造推薦,評価のための統一フレームワーク UniPolymer [cs.DM, math.CO, cs.LG]目的:ポリイミド設計における特性予測,ターゲット条件付き生成,候補評価,構造推薦
- 高性能ポリイミド材料の創出は,航空宇宙,エレクトロニクス等の幅広い分野で重要である。
- 既存手法は,生成された構造と目標特性の一貫性評価が不十分で,低品質な候補が多く生まれる。
- 目標とするガラス転移温度(Tg)に合致した高品質なポリイミド構造を効率的に創出することを目指す。
- UniPolymerは,自己教師あり化学的意味学習,構造的一貫性強化,多規模情報融合により,信頼性の高い構造特性相関を確立した。
- 連続離散結合Tg表現を用いて,自己回帰的にSELFIESを生成し,目標Tgとのずれを評価することで候補構造の質を向上させた。
- 特性予測の精度はR^2=0.93,候補構造評価の合格率は73.79%と,既存手法を上回る成果が得られた。
OsteoCAD:骨腫瘍セグメンテーションのための人間協調型クラウド・エッジフレームワーク [cs.CV, cs.AI]目的:骨腫瘍セグメンテーションのためのクラウド・エッジフレームワーク
- 医療画像解析はAI/深層学習により進展しているが,導入には計算資源や専門知識が課題である。
- 多くの医療機関では,計算資源や専門知識の不足がAI/深層学習の導入を阻害している。
- 高度な技術知識や複雑な設定なしに,深層学習を活用したeHealthソリューションを実現すること。
- OsteoCADは,データセット作成からモデル推論までの一連の深層学習機能を統合した,ユーザーフレンドリーなeHealthフレームワークである。
- 本フレームワークは,リモートGPUインフラストラクチャへの安全な接続により,ローカル環境のハードウェア制約を克服する。
- メキシコにおける骨腫瘍セグメンテーションの実証実験により,OsteoCADの有効性が示された。
RTLCurator:RTL生成のためのラベル効率的なデータキュレーション [cs.NI, cs.AR, cs.LG]目的:RTL生成用LLM学習におけるデータセットの品質向上
- RTLはデジタル回路設計の基礎であり,高性能なハードウェア開発に不可欠である。
- RTL学習データの不足と,合成データが持つ品質の低さが課題となっている。
- 少量のエキスパートデータを用いて,より効果的なデータセットを構築することを目指す。
- RTLCuratorは,シミュレーションに失敗した実装との対比により,動作を考慮した適合性事前確率を学習する。
- 検証済みの少数のペアを用いて事前確率を調整し,アライメント,表現範囲,RTL構造の豊かさを考慮してデータセットを構築する。
- CodeVとRTLCoderにおいて,RTLCuratorはフルコーパスでの学習を上回り,検証にはデータセットの10%のみで済む。
思考を伴う翻訳:強化学習による多岐にわたる機械翻訳のための難易度適応型推論 [cs.RO, cs.CL, cs.AI]目的:多言語ドメインにおける翻訳の質と推論効率の最適化
- 機械翻訳はグローバルコミュニケーションを円滑にする上で不可欠であり,その精度向上は重要な課題である。
- 多言語ドメイン翻訳では,ドメイン間の言語的複雑さの差異により,翻訳の質が低下しやすい。
- 人間の翻訳者の思考様式に着想を得て,翻訳の難易度に応じて推論プロセスを適応させることで,翻訳の精度と効率を改善すること。
- TwTモデルは,大規模な既存モデルと比較して,翻訳品質を向上させつつ,トークン使用量を大幅に削減することに成功した。
- 思考を伴う翻訳(TwT)は,翻訳行動を認知原則に合致させることで,高い汎化性能と効率的な推論を可能にする。
- 学習データとして,DeepSeek-R1から抽出されGPT-4oによって書き換えられた難易度を意識したChain-of-Thoughtを使用している。
分散型エネルギー資源浸透率増加に伴う故障箇所特定のためのグラフニューラルネットワークの汎化性能評価 [cs.LG, cs.SY, eess.SY]目的:分散型エネルギー資源浸透率増加下における故障箇所特定の汎化性能
- 配電網の信頼性確保に故障箇所の正確な特定は不可欠である。近年,分散型エネルギー資源の導入が進み,その影響を考慮した研究が求められている。
- 分散型エネルギー資源の導入は,間欠的な発電や双方向潮流により故障の特徴を変化させ,従来の故障箇所特定技術の精度低下を引き起こす。
- 本研究は,分散型エネルギー資源浸透率の変動に対するグラフニューラルネットワークの汎化性能を評価し,ロバストな故障箇所特定手法を確立する。
- STGATv2は,他のニューラルネットワークベースラインと比較して一貫して高い性能を示し,分布内で92〜94%のマクロF1スコアを達成した。
- 汎化性能は非対称であり,50%浸透率で学習した場合,低い浸透率レベルでのF1スコアが維持される一方,10%浸透率で学習した場合,50%浸透率レベルで大幅に低下した。
- STGATv2は,測定ノイズ下でも85%以上のF1スコアを維持し,GRUが33.5%まで低下するのに対し,トポロジー情報の重要性を示した。
最良方策同定によるサンプル効率的な階層型強化学習 [cs.LG]目的:階層型強化学習における高レベル方策と低レベル方策の学習
- 複雑な課題解決において,階層構造は効率的な学習と汎化能力の向上に不可欠である。
- 従来の強化学習は,複雑な環境でサンプル効率が悪く,学習に時間がかかるという課題がある。
- 高レベル・低レベルの並列学習によって,サンプル効率を改善し,複雑な課題への適用を可能にする。
- 提案手法HBPI-UCRLは,高レベル遷移を低レベルの多段階遷移として捉え,並列学習を実現する。
- 特定の条件下において,HBPI-UCRLは問題パラメータに関する多項式的なサンプル複雑度を持つことが証明された。
- 疎報酬・目標指向設定において,HBPI-UCRLは非階層型手法よりも優れたサンプル効率を示す。
MAGA:構造化された行動蒸留によるGUIエージェントのマルチプラットフォーム自己融合 [cs.AI]目的:GUIエージェントのマルチプラットフォーム融合
- GUI自動化の需要が高まる中で,様々な環境に対応できる汎用的なエージェントが求められている。
- 既存のエージェントは特定のドメインに特化しており,環境間の移植性やユーザーエクスペリエンスに課題がある。
- 異なるドメインの知識を統合し,環境に依存しない高性能なGUIエージェントを実現すること。
- MAGAは,構造化された行動に基づいて学習シグナルを再配分することで,不要な蒸留シグナルを抑制し,誤った行動に焦点を当てる。
- 訓練時に教師エージェントからのヒントを活用することで,入力自体を変更することなく教師からの監督シグナルを最適化する。
- MAGAは,既存のベースラインを8Bモデルで2.0%上回り,教師モデルと同等の性能を達成した。
大規模言語モデルの説得力は,その認識される国家起源に依存しない [cs.HC, cs.AI]目的:AIの国家起源が説得力に与える影響の検証
- 地政学的なライバル国のAIが世界中の人々に影響を与える可能性があり,民主的対話と情報主権に影響を及ぼす可能性がある。
- AIの国家起源が人々の意見形成にどのように影響するか不明であり,プロパガンダとしての認識も懸念される。
- 会話型AIによる外国からの影響に対する脆弱性を評価し,対策の必要性を検討する。
- 会話の結果,あらゆる条件下で参加者の態度に大きな変化が見られた。
- AIの国家ラベルは,自己申告による態度の変化や発言内容,感情などに影響を与えなかった。
- 外国のAIに対しては,初期の信頼度が低い傾向が見られたが,議論の内容自体は受け入れられていた。
DualDiT:条件付き二重出力拡散TransformerによるOCT画像とセグメンテーションマスクの同時生成 [cs.CV, cs.AI]目的:OCT画像とセグメンテーションマスクの同時生成
- 医療画像解析において,アノテーション付きデータ不足は深刻な課題であり,特にOCT画像のような専門知識が必要な分野では顕著である。
- 従来の画像生成モデルはU-Netに基づいたものが多く,Transformerを用いた拡散モデルの可能性は十分に探求されていない。
- 本研究では,データ不足を補い,高品質なセグメンテーションを可能にするOCT画像とマスクの同時生成を目指す。
- DualDiTは,FIDおよびsFIDにおいて,DDPMやLDMなどの既存モデルを上回る優れた生成品質を達成した。
- 専門家評価において,生成画像が実画像と誤認される割合が46%,実画像が生成画像と誤認される割合が42%であった。
- DualDiTで生成した画像とマスクを追加することで,セグメンテーションテストセットにおけるDice係数とIoUスコアが向上した。
AIアプリにおける権限に関するユーザーの懸念を分析する [cs.LG]目的:AIアプリのレビューを分類し,権限に関連するユーザーの懸念を特定すること
- AI技術の普及に伴い,アプリのセキュリティとプライバシー保護の重要性が高まっている。
- AIアプリ開発者にはセキュリティ知識が不足している場合があり,ユーザーが自身のセキュリティを監視する必要がある。
- ユーザーレビューを活用し,手動アノテーションの必要なく,権限関連のレビューを自動的に分類すること。
- 提案手法は,権限関連のレビューを82%の精度で分類できた。
- ユーザーは特定の権限タイプよりも,アプリに対する感情に基づいて懸念を表明する傾向があることが示された。
- 本研究の結果は,ユーザー,開発者,プラットフォーム管理者にとって示唆に富む。
SeekBrain:神経科学的発見を加速する自律型マルチエージェントシステム [eess.SY, cs.SY, cs.MA, cs.AI]目的:神経科学的発見の加速
- 近年の神経科学研究では,多岐にわたるデータ統合が不可欠であり,知性の神経基盤解明に貢献する。
- 多様なデータと断片化されたワークフローが分析上の課題となり,研究の進展を阻害する要因となっている。
- コードと論文から分析レシピを抽出し,自律的な計画と実行を通じてデータ駆動型発見を加速することを目的とする。
- SeekBrainは,BrainArenaベンチマークにおいて,既存の最先端エージェントと比較して,様々な分析タスクで著しい性能向上を示した。
- 実際の研究応用では,行動,神経,解剖学的データを統合し,ゼブラフィッシュの行動やマウスの意思決定における神経表現を明らかにした。
- SeekBrainは,神経科学におけるデータ駆動型発見を加速するための,スケーラブルで実用的なツールとしての価値を示す。
エッジにおける汎用的なオンデバイス適応:Few-shot,Zero-shot,継続学習,そして文脈内学習の統合 [cs.LG, cs.AI, eess.AS]目的:エッジデバイスにおける多様なオンライン学習シナリオを統合し,デバイスの適応能力を高めること。
- スマートエッジデバイスの普及に伴い,ユーザーや患者に合わせた個別化されたアプリケーションの需要が高まっている。
- 既存のエッジデバイスは固定された推論アルゴリズムに依存しており,オンデバイスでの学習による個別化が困難である。
- クラウドへの依存やエネルギー消費を抑えつつ,様々な学習シナリオに対応可能なオンデバイス学習フレームワークを確立すること。
- 埋め込み表現中心学習(ECL)フレームワークにより,Few-shot,Zero-shot,継続学習,文脈内学習の4つのオンライン学習シナリオを統合した。
- ECLは,文字認識(Omniglot)において,Few-shot学習の最先端性能を達成した(5-way 1-shot: 96.8%,32-way 1-shot: 83.3%)。
- また,キーワードスポッティング(NeuroBench)における継続学習のハードウェアベースラインを確立し,Zero-shot学習や文脈内学習のハードウェアデモを実証した。
トルコ語系言語における機械翻訳のクロス言語転移 [cs.CL, cs.AI]目的:トルコ語系言語における機械翻訳のクロス言語転移に関する研究
- 機械翻訳において,低リソース言語への対応は重要であり,クロス言語転移はその主要な手法の一つである。
- 言語間の関連性が高い言語群におけるクロス言語転移の挙動は,十分に解明されていない。
- トルコ語系言語におけるクロス言語転移の特性を明らかにし,機械翻訳の性能向上に貢献すること。
- トルコ語,アゼルバイジャン語,ウズベク語,カザフ語,キルギス語の間でクロス言語転移を検証した結果,近縁言語ペア間(トルコ語-アゼルバイジャン語,カザフ語-キルギス語)で特に高い転移効果が確認された。
- 転移方向が重要であり,同じソース言語とターゲット言語の組み合わせでも,翻訳ターゲットが異なると挙動が変化することが示された。
- ラテン文字化は,一部のスクリプト不一致設定においてBLEUおよびchrFスコアを改善するが,その効果は指標によって一様ではない。
グラフドメイン適応のためのクロス分解能セマンティック学習 [cs.LG]目的:グラフドメイン適応における知識伝達メカニズムの改善
- グラフ構造データ分析は,ソーシャルネットワークや分子構造など,多様な分野で重要性が増している。
- ドメイン間の分布のずれにより,グラフドメイン適応の性能が大きく低下する可能性がある。
- 異なる分解能での識別的な知識の伝達を最適化し,負の転移リスクを軽減することを目指す。
- 提案手法CReSLは,ソースドメインとターゲットドメイン間の分解能の対応関係を学習する。
- クロス分解能プロトタイプ輸送により,ドメイン間のプロトタイプ差異を専門家固有のルーティングに変換する。
- 実験結果から,CReSLは既存手法と比較して,様々なドメインシフト下で優れた性能を示すことが示された。
PTP: 過去トークン予測に基づくLLM反転によるほぼ正確なプロンプト再構築 [cs.RO, cs.CL, cs.CL, cs.LG]目的:プロンプトからの応答間の多対多のマッピング解消と,観察された出力からのプロンプト推論の改善
- LLMの利用拡大に伴い,プロンプトと応答の関係性の理解が重要になっている。
- 既存の手法は,外部データセットやモデルの重みへのアクセスを必要とし,汎用性に課題がある。
- LLMのブラックボックス環境下で,プロンプトを忠実に再構築することを目指す。
- 提案手法は,ターゲットLLM自身から合成的に生成されたデータを用いて,逆言語モデルをゼロから訓練する。
- 過去トークン予測を用いることで,順方向と逆方向のプロセス間の生成的な繋がりを確立し,正確なプロンプト再構築を可能にする。
- 提案手法は,様々なデータセットで有効であり,異なるLLMへの転移性も示している。
HDFSログデータ分析におけるブロック異常検知の探求 [cs.CY, econ.GN, q-fin.EC, cs.LG, cs.DC, cs.SE]目的:HDFSログデータのブロック異常検知手法
- ビッグデータ技術の発展によりHDFS利用が増加し,分散ファイルシステムの維持管理が重要課題となっている。
- HDFSログは非構造化データが多く,手動での異常特定は煩雑かつ時間がかかる。
- 機械学習と自然言語処理を活用し,HDFSブロックの異常を迅速かつ正確に検知することを目指す。
- 本研究では,過去ログの並列処理とLLM-BiLSTMハイブリッド深層学習モデルを構築し,HDFSの異常ブロック検知を実現した。
- Kafkaを用いたストリーミングログパイプラインを構築し,リアルタイムなHDFSログブロック異常検知ソリューションを提案した。
- このワークフローは,システム管理者による迅速な問題特定と解決を支援する。
大規模言語モデルを用いた流体システム向けシミュレーションコード生成:モデルとプロンプティング戦略のベンチマーク [cs.LG, cs.SE]目的:流体システムのグラフ表現からシミュレーション実行コードへの自動変換
- モデルベースの設計は,複雑なシステムの効率的な開発・分析に不可欠である。
- 従来のコード生成手法は,専門知識や手作業による調整が必要であり,時間と労力がかかる。
- 大規模言語モデルを活用し,流体システムのシミュレーションコード生成を自動化し,設計効率を向上させる。
- 大規模言語モデルのコード生成能力を検証し,10個のモデルと6つのプロンプティング戦略を比較した。
- 生成されたコードの品質評価指標と,ベンチマークシナリオを用いたシミュレーションの忠実性を分析した。
- 最適な構成では許容可能な構文品質が得られたが,シミュレーションの忠実度には依然として課題が残る。
条件付き潜在的輸送による高密度時間的コントラスト合成 [cs.RO, cs.CV, cs.AI]目的:乳がん管理のための造影剤なし,または造影剤低減化イメージングワークフローの実現
- 乳がん管理において,動的造影強調MRIは不可欠だが,安全性の問題や撮影時間の長さが課題となっている。
- 既存のコントラスト合成法は,空間的リアリズムと時間的連続性の両立が難しく,臨床的な検証も不足している。
- 本研究は,患者固有の造影変化を単一の処理で予測する新しいフレームワークを提案することで,上記の問題を解決する。
- 提案手法は,空間的,知覚的,時間的,分布的な指標において,既存手法および最先端モデルを上回る性能を示した。
- 合成された造影強調画像は,腫瘍セグメンテーションの精度を22.4%向上させ,境界セグメンテーションエラーを39%以上削減した。
- 読者調査の結果,70%の症例において,合成画像が実際のDCE-MRIと同等の臨床的判断を可能にすることが示された。
オンラインキャッシュ:エラー補正による効率的な拡散推論のための動的キャッシングポリシー学習 [cs.CL, cs.PF, cs.LG]目的:拡散モデル推論における効率的なキャッシングポリシー
- 拡散モデルは生成タスクに革新をもたらしたが,反復的なノイズ除去処理により高い遅延が発生する。
- 既存のキャッシュ戦略は静的なスケジュールに依存しており,入力の複雑さやエラー感受性の変動に対応できていない。
- 入力とステップごとに適応的に計算資源を割り当てることで,生成品質と速度の両方を向上させることを目指す。
- 提案手法OnlineCacheは,キャッシュのタイミングとエラー補正を同時に学習する動的キャッシングフレームワークである。
- FLUX.1-devモデルにおいて,生成品質を維持しつつほぼ3倍の高速化を達成した。
- DiTやCogVideoXにおいても,既存のキャッシュベースラインと比較して競争力のある高速化を実現した。
ALIVE:予算制約下における多源学習での排除前の警告 [eess.SY, cs.SY, cs.LG]目的:予算制約下で有限母集団監査と学習を組み合わせる際の,不平等な持続性を持つアクションを承認すべき証拠
- 機械学習システムの公平性と信頼性確保は重要であり,特にリソースが限られた環境下での適切な意思決定が求められる。
- ソースの排除は持続性を持つ一方,ルーティング決定は容易に修正可能であり,その判断基準の不均衡が問題となっている。
- 証拠に基づいた介入層を導入することで,排除判断の透明性と説明責任を高め,システムのパフォーマンスを向上させる。
- 提案手法ALIVEは,キャッシュされた証拠とヒューリスティックな警告に基づいてルーティングを行い,厳格な多数決不一致判定を満たす場合にのみ排除を許可する。
- 実験の結果,ALIVEを適用することで,証拠カウントの中央値が大幅に減少し,計算コストの削減が確認された。
- CIFARデータセットにおける評価では,ALIVEはルーティングのみの場合と比較して,精度AUBCが+0.1935%向上した。
コンポーネントテストを超えて:自律型AIシステムの検証 [cs.IR, cs.CL, cs.AI, cs.MA, cs.SE]目的:自律型AIシステムの検証問題の特性評価
- AI技術の発展に伴い,社会への実装が加速している。安全性や信頼性の確保が重要課題となっている。
- 従来のコンポーネントテストでは,複雑なAIシステムの長期的な振る舞いや状況変化への対応を評価できない。
- 自律型AIシステムの信頼性を確保するための検証手法の確立を目指す。
- 本調査では,257の論文を分析し,行動,安全性,時間的側面,規制,多主体間の5つの次元から検証問題を体系化した。
- 行動評価は比較的進んでいる一方,時間的妥当性,ランタイム証拠の維持,規制対応,多主体システム保証は未発達であることが示された。
- 医療,産業,スマートモビリティの事例研究を通して,安全性確保における5つの次元の重要性を具体的に示した。
エントロピー情報を用いた境界探索 [cs.LG, cs.AI]目的:疎な報酬と遅延報酬環境における探索性能の向上
- 強化学習は,自律的な行動獲得に不可欠だが,効率的な探索が課題である。
- 報酬が少ない環境では,有効な探索が難しく,学習が停滞しやすい。
- 状態分布の境界領域を探索する動機付けを提供し,探索性能を改善する。
- 提案手法ENTINEXは,エントロピー情報を用いて境界を特定し,内在報酬を付与する。
- 実験の結果,疎な報酬と遅延報酬の環境において,既存手法を上回る性能が確認された。
- ENTINEXは,状態分布の境界探索を促すことで,効率的な学習を実現する。
AgenticRepair: エージェント型脆弱性修復のための多面的プログラムコンテキストエンジニアリング [cs.SE, cs.AI, cs.CR]目的:脆弱性修復における多面的プログラムコンテキストエンジニアリング
- サイバーセキュリティの重要性が増す中,脆弱性への迅速な対応が求められている。
- 既存のエージェント型アプローチでは,セキュリティエンジニアが日常的に利用する十分なプログラムコンテキストを構築できていない。
- コード構造,実行時情報,コミット履歴という3つのコンテキストを統合し,脆弱性修復の精度向上を目指す。
- AgenticRepairは,3種類のLLMサブエージェントを連携させ,多面的プログラムコンテキストをエンジニアリングする。
- SEC-Benchデータセットを用いた評価で,73%の成功率を達成し,既存の最良手法を29%上回った。
- 3つのコンテキスト要素は互いに補完し合い,マルチエージェント構造と大規模言語モデルの能力が重要であることが確認された。
ModelEquivBench:LLM生成最適化モデルの多関係評価の保証 [cs.AI]目的:LLM生成最適化モデルの多関係評価システムの開発と,それを用いた評価
- LLMによる最適化モデル生成が普及しているが,その評価方法は不十分である。
- 既存の評価手法は,モデルの一致/不一致判定や実行成功率に頼っており,詳細な検証が困難である。
- 複数の関係性に基づいてモデルの等価性を検証し,詳細な評価情報を提供することで,LLMの性能向上に貢献する。
- ModelEquivBenchは,モデル構築,表現の一致,実行可能領域の関係,目的関数の等価性,最適値の等価性,最適化アルゴリズムの等価性など,6つの関係性に基づいて評価を行う。
- GPT-5.4,Claude Sonnet 4.6,Qwen3.5-397B-A17Bの評価結果から,既存手法では見過ごされる差異が明らかになった。
- 各モデルは,異なる段階で評価が不十分であり,単一の精度スコアで評価することは適切ではない。
検索を超えて:マルチモーダルエージェントのための分析的記憶 [cs.CL, cs.AI]目的:マルチモーダルな観察の集積と計算を支援する長期記憶
- 対話システムにおいて,過去の情報を活用することで,より自然で高度な応答が可能になる。
- 既存システムは検索型記憶に偏っており,観察データの構造的分析が不十分である。
- 繰り返されるマルチモーダルな観察を分析可能な構造に整理し,活用することを可能にする。
- AdaMMは,検索型記憶と分析的記憶を統合したフレームワークである。
- AdaMMは,対話,画像,メタデータから属性値のペアを抽出し,構造を自動的に発見する。
- MemEyeとMemGalleryのベンチマークテストで,AdaMMは最大11.3%と7.3%の性能向上を示した。
エンドツーエンドの公平性最適化:公平な意思決定集中学習 [cs.LG, math.OC]目的:予測から意思決定までのパイプラインにおける公平性統合
- 予測モデルが意思決定に利用される場面が増加しており,公平性の確保が重要である。
- 予測と意思決定の各段階で公平性の問題が生じており,両者を統合的に最適化する必要がある。
- 予測の正確性,公平性,および意思決定における後悔を同時に考慮することで,公平性を高める。
- 提案手法であるFDFLは,予測の正確性,予測の公平性,意思決定における後悔を同時に最適化する。
- 本研究では,公平な資源配分問題に対して,FDFLの有効性を示す数値実験を行った。
- FDFLの目的関数の有限サンプル汎化限界が確立された。
QR構造熱トリガーによる赤外線ビジョン-言語モデルへの標的型意味攻撃 [cs.CV, cs.AI]目的:赤外線ビジョン-言語モデルへの標的型意味操作
- 赤外線技術は,従来の視覚情報だけでは捉えられない状況下での認識を可能にするため,重要性が高まっている。
- 赤外線ビジョン-言語モデルは,構造化された熱的摂動に対する脆弱性,およびクロスモーダル意味的整合性の安定性が十分に研究されていない。
- 本研究は,赤外線ビジョン-言語モデルに対する解釈可能な攻撃表面を特定し,ロバスト性の評価の必要性を強調する。
- 提案手法QR-STTは,モデルの再学習なしに,赤外線画像のわずかな熱的摂動により,モデルの意味的解釈を標的とする概念へと誘導する。
- 最適化された摂動は,画像分類だけでなく,画像キャプション生成やVQAタスクにおいても,標的に一貫した意味ドリフトを引き起こす。
- QR構造パターンが,言語駆動型の赤外線知覚に対する解釈可能な攻撃対象領域として示された。
TFGformer:時間周波数グラフ学習と共変量融合による多変量時系列予測 [cs.CE, cs.LG, cs.AI]目的:多変量時系列予測のための手法
- IoT機器から得られる大規模な時系列データは,資源の計画や予測保全に不可欠である。
- 既存の時系列モデルは,静的なパラメータに依存し,推論時に過去のパターンを動的に活用できない。
- 異種データ源の規模の変動や,過去の類似性と将来の一貫性の不一致といった課題を解決する。
- 提案手法CrossRAGは,Shape-Aware MemoryとRevIN正規化により,規模にロバストな形状レベルの検索を実現する。
- Future-Consistent Contrastive学習により,類似した過去を持つが将来が異なるノイズを除去し,有益な参照を選択する。
- Cross-Attention Temporal Fusionにより,取得した過去-未来の参照ペアをバックボーン表現に融合する。
パラメータフリーの重い裾を持つバンディット問題 [cs.LG]目的:重い裾を持つバンディット問題におけるパラメータ未知時の最適化手法の開発
- 金融投資,オンライン広告など,稀に大きな影響を与える事象が存在する場面で重要。
- 既存手法は裾のパラメータを事前に知っている必要があり,現実的ではない。
- 裾のパラメータを事前に知らずとも,最適な行動決定が可能となる手法を提案する。
- 裾のパラメータを未知とした場合でも,分布依存型および分布非依存型の後悔間のトレードオフを明確化。
- 未知の裾のパラメータに対応する探索スケジュールを持つアルゴリズムを提案し,最適なパフォーマンスに近づけた。
- 提案手法は,特定の裾指数に対して亜線形な後悔を達成し,未知の裾を持つバンディット問題の未解決問題を解決した。
自己対戦とスキル進化:課題を生成,解決,記憶する自己進化型探索エージェント [cs.AI]目的:自己進化的な探索エージェントの実現
- 強化学習において,効率的な学習は重要な課題である。課題生成とスキル獲得を自動化することが求められている。
- 従来の自己対戦学習では,課題の系列が固定化され,学習の多様性が失われる問題があった。
- 課題生成とスキル記憶を同時に進化させることで,より効率的な学習を実現する。
- 提案手法SESAは,自己対戦学習において課題生成とスキル記憶を共同進化させることで,既存手法SSPよりも高い精度を達成した。
- SESAは,複数のベンチマークにおいて,平均で1.2~3.2ポイントの精度向上を示し,SkillRLよりも0.9ポイント上回った。
- Qwen3モデルを用いた実験では,SESA-OffがSSPよりも1.8~2.2ポイント,スキルバンクを追加することで更に0.5~1.0ポイントの精度向上を確認した。
アフォーダンスセグメンテーションのための軽量ニューラルネットワーク:デコーダモジュールの強化 [cs.CV, cs.LG, cs.PF]目的:アフォーダンスセグメンテーションにおける汎化性能と計算コストのトレードオフに関する分析
- ウェアラブルロボットにおける視覚的なアフォーダンスセグメンテーションは,ロボットの自律性を高める上で重要である。
- 高水準な抽象化能力が必要なアフォーダンスセグメンテーションでは,通常,大規模なモデルが用いられる。
- ウェアラブルロボットの限られた計算資源において,リアルタイムでの処理を可能にする軽量なモデルを開発する。
- 提案手法は,既存のベースライン手法と比較して,汎化性能を向上させながら,計算コストを低く抑えることができた。
- 本研究で得られたモデルは,一般的な実世界のデータセットにおいて優れた性能を示した。
- ウェアラブルロボットへの実装可能性を示す結果が得られた。
テキストから分子構造生成のための化学的根拠に基づくフレームワークMolGVR [cs.DC, cs.LG]目的:テキストから分子構造生成の改善
- 創薬や材料開発において,分子構造の迅速な生成は重要な課題である。
- 既存手法では,化学的な制約が考慮されず,誤った分子構造が生成される場合がある。
- 化学的な検証と修正を組み込み,より正確な分子構造生成を目指す。
- MolGVRは,生成器,検証器,修正器の連携により,分子構造生成の精度を向上させる。
- 検証器は,テキスト情報を化学的な制約に変換し,生成された候補分子を検証する。
- ChEBI-20とPCDesの実験結果から,MolGVRが正確な分子構造生成において性能改善を示す。
介入データ型競争:介入データは言語モデルに因果の方向性を教えることができるか? [eess.SY, cs.SY, cs.RO, cs.CL, cs.LG]目的:言語モデルにおける因果の方向性の学習可能性の評価
- AIの高度化には,人間のような因果推論能力が不可欠である。
- 介入データは因果推論のゴールドスタンダードとされているが,その有効性は十分に検証されていない。
- 観察データの影響を排除し,介入データのみによる因果推論能力を評価すること。
- シンプソンのパラドックスの世界では,介入データの割合を増やしても因果の方向性は改善されなかった。
- 文脈中のエビデンスの種類が,介入データの活用を左右することが示された。
- 観察データを文脈から削除することで,因果推論能力が向上し,評価プロトコルも改善された。
DreamQAS:VQE効率的な量子アーキテクチャ探索のための意思決定に有用なワールドモデルの学習 [cs.LG, cs.AI]目的:VQE効率的な量子アーキテクチャ探索のためのワールドモデル
- 量子計算の発展には,より高性能な量子アルゴリズムとハードウェアが必要不可欠である。
- 既存の量子アーキテクチャ探索は計算コストが高く,効率的な探索手法が求められている。
- 高コストなVQEの呼び出し回数を削減し,効率的な量子アーキテクチャ探索を実現すること。
- DreamQASは,既存手法と比較して,分子タスクにおいて低い平均エネルギー誤差を達成した。
- 特にBeH2-8qタスクでは,実VQE呼び出し回数を大幅に削減することが示された。
- ワールドモデルによる意思決定に有用なフィードバックが,探索性能向上に貢献していることが明らかになった。
適応型FastOPD:効率的なオンポリシー蒸留のための進捗認識ロールアウトホライズン拡張 [cs.HC, cs.LG]目的:効率的なオンポリシー蒸留のための進捗認識ロールアウトホライズン拡張戦略
- 強化学習において,教師あり学習で得た知識を生徒モデルへ効率的に伝達することが重要である。
- 従来のオンポリシー蒸留は,ロールアウト過程で計算コストが高く,特に長い応答がボトルネックとなる。
- 学習の進捗状況に応じてロールアウトホライズンを動的に拡張し,計算コストを削減することを目指す。
- 適応型FastOPDは,OPD 15Kと比較して,平均性能を向上させながら,学習時間を49.1〜71.2%削減することに成功した。
- ロールアウトホライズンの拡張は,現在の境界領域での学習が停滞した場合にのみ行われ,計算コストの増加を抑制する。
- 多様なハイパーパラメータ設定下でも安定した性能が確認された。
トランスクリプト管理Transformer:単調崩壊と二つのポップ可能トランスクリプトによる普遍性 [cs.LG, cs.FL, cs.MA]目的:固定精度因果Transformerにおけるトランスクリプト管理
- Transformerは自然言語処理の基盤技術であり,その効率性と表現能力の向上が重要である。
- Transformerの文脈長は固定されており,長文処理や複雑なタスクにおいて限界がある。
- トランスクリプト管理により,Transformerの文脈長を効率的に拡張し,より複雑なタスクに対応することを目指す。
- トランスクリプトを複数のチャンネルに分割し,各チャンネルでブロックの追加や削除を行うことで,固定長のTransformerの表現力を高める。
- ポップ操作を許可することで,チャンネルをスタックとして利用でき,コンテキストの階層構造を表現可能となる。
- 二つのポップ可能なトランスクリプトがあれば,計算の普遍性を実現できることが示された。
グロックされた幻想:真の平衡が破滅的忘却を軽減する [cs.RO, cs.SY, eess.SY, cs.LG]目的:グロッキングにおけるモジュラ演算を用いたモデルの頑健性の差
- ニューラルネットワークの汎化性能評価に加え,学習表現の安定性研究の重要性
- 従来の最適化では,汎化性能と頑健性の乖離が問題視されている
- 高エントロピーモデルが破滅的忘却に対し,より強い耐性を持つことを検証する
- AdamWで学習したモデルは,新しい情報を学習する際に元のタスクの精度が大幅に低下したが,高エントロピーモデルはほぼ95%の精度を維持した。
- この隠れた脆弱性を「グロックされた幻想」と定義し,見かけ上の汎化性能だけでは頑健性を評価できないことを示した。
- 高エントロピーモデルは,アテンション層とMLP層において,より高い有効ランクを有しており,豊かな特徴表現が破滅的忘却に対する緩衝材として機能することが示唆された。
腹腔鏡手術用臓器セグメンテーションにおけるクラス特化デコーダを用いた転移学習 [cs.CV, cs.LG]目的:腹腔鏡手術画像における複数臓器のセグメンテーション性能向上
- 手術支援の高度化には,臓器の正確な認識が不可欠であり,その自動化が求められている。
- 手術データは臓器の大きさや露出度に偏りがあり,少数派クラスのセグメンテーションが困難である。
- 異なる手術領域間での知識共有により,データ不足や偏りを克服し,セグメンテーション精度を向上させる。
- クラス特化デコーダを用いることで,各臓器の解剖学的特徴を効果的に学習できることが示された。
- 異なる手術領域間で事前学習を行うことで,学習の収束が早まり,セグメンテーション性能が向上することが確認された。
- 転移学習では少数派クラスのセグメンテーション精度向上には限界があり,クラス間の不均衡は依然として課題である。
コードレビューからコード批判へ:大規模AI生成差分に対する意図,ずれ,注目点 [cs.RO, cs.SE, cs.AI]目的:AI生成コード差分における意図予測,ずれ検出,注目点特定
- AIによるコーディングが普及し,従来のレビュー体制では対応が困難になっている。
- 既存のAIレビューツールは,表面的な指摘に偏り,重要な問題を見落とす可能性がある。
- AIを活用し,開発者の意図とずれを検出し,人間のレビュー効率を向上させる。
- ARCTICは,会話ログから変更の意図を予測し,バック翻訳によって意図と出力のずれを測定する。
- オフライン評価で,意図予測のF1スコアは0.86,ずれ検出のQWKは0.907と高い精度を示した。
- 実験的導入の結果,ずれスコアがコードの不整合を減らし,レビュー効率が向上した。
人新世のための基盤モデル:TerraNova [cs.LG, cs.AI, cs.CY, econ.EM, stat.ML]目的:人間と地球システムの結合モデリング
- 地球規模課題解決には,地球環境と社会システムの相互作用理解が不可欠である。
- 地球システムと社会システムは異なる幾何学構造を持つため,統合が困難であった。
- 異なる幾何学構造のデータを統合し,予測能力を持つ基盤モデルを構築する。
- TerraNovaは,地球システムと社会システムの1,024の記録をネイティブな幾何学構造で学習した。
- このモデルは,既存の地理空間エンコーダーと同等の性能を示し,時間,海洋,不確実性といった軸も表現可能である。
- 学習済みのバックボーンは,少ない観測データから高密度な場を再構成し,未知の変数にも迅速に対応できる。
アルツハイマー病の早期診断における説明可能なニューロシンボリックアプローチ [cs.LG]目的:アルツハイマー病の進行を示す指標の抽出と関係性の解明
- アルツハイマー病の早期診断は,患者のQOL向上に不可欠である。
- 信頼性の高いバイオマーカーの特定には専門家による手間のかかる分析が必要である。
- 音声データから自動的に指標を抽出し,その関係性を明らかにする。
- 本研究では,音声データからアルツハイマー病の進行指標を抽出し,ベイジアンネットワークを構築した。
- 構築されたベイジアンネットワークは,既存の臨床知識を再現するとともに,新たな言語マーカー間の関係性を発見した。
- これにより,アルツハイマー病の早期診断を支援する説明可能なパイプラインが実現可能となった。
AIテキスト検出器評価のためのマッチングされた著者書き換えベンチマークデータセットARB [cs.CL, cs.AI]目的:AIテキスト検出器の評価のためのベンチマークデータセット
- AIによる文章生成技術の発展に伴い,AI生成テキストの検出が重要になっている。
- 既存のベンチマークでは,人間が書いた文章とAIが生成した文章を直接比較しており,書き換えによる影響が不明確である。
- 人間が書いた文章をAIで書き換えた場合の検出性能を評価し,ベンチマークの妥当性を検証する。
- 標準的なベンチマークでの検出性能は,人間が書いた文章をAIが書き換えた場合に大きく低下した。
- AIが生成した文章を同じモデルで書き換えた場合,性能低下は比較的小さかった。
- 既存のベンチマークは,AIによる書き換えの影響を考慮していないため,実用的な評価には不十分である。
AMTFV:LLM自己修正のためのエージェント型数学ツールフロー検証 [cs.AI]目的:LLMの自己修正のための数学的ツールフロー検証手法
- LLMの数学問題解決能力は高いが,回答の信頼性検証は困難である。
- 既存手法は自然言語による推論やプログラム生成に依存し,厳密な計算やモデル化と実装の分離が課題である。
- 数学的ツールフローを導入し,検証モデリングと実行を分離することで,厳密な計算と信頼性の高い検証を実現する。
- AMTFVは,DeepSeek,GPT,Geminiの7つのモデル構成で5つの数学的推論データセットにおいて,既存手法を上回る性能を示した。
- 最も優れたベースラインと比較して,平均精度を最大8.3パーセントポイント向上させ,特に検証の複雑度が高いサンプルで大きな改善が見られた。
- 検証エージェントが検証ワークフローを構築し,数学的ツールボックスエージェントが正確な計算を実行することで,回答の評価,修正,ワークフローの修正を支援する。
運用指標に基づく文脈を考慮したオントロジー拡張へ [cs.AI]目的:運用指標からのオントロジー拡張
- システム監視やコンプライアンスにおいて,運用指標の重要性が増している。
- オントロジーと運用指標カタログ間の連携は手作業で,コストが高い。
- 運用指標を基にオントロジーを自動的に拡張し,維持コストを削減する。
- COntExtフレームワークにより,関係タイプ予測とデータプロパティ割り当ての精度が向上した。
- 運用指標カタログは,オントロジー拡張の有用かつ未活用な情報源である。
- 本研究は,オントロジーの維持にかかるコストを大幅に削減できる可能性を示す。
頂点挿入によりピラミッド幅が増加する可能性 [cs.LG]目的:ピラミッド幅の増加に関する反例の提示
- 凸多面体の幾何学的特性理解に不可欠であり,最適化問題への応用も期待される。
- 頂点追加がピラミッド幅に与える影響は未解明な点が多く,既存の予想との矛盾も存在する。
- 頂点挿入がピラミッド幅を増加させる可能性を具体例で示すことで,既存の予想を覆す。
- Lacoste-JulienとJaggiの予想に反し,特定の6点からなる多面体において頂点挿入によるピラミッド幅の増加が確認された。
- 多面体PからQへの頂点挿入により,ピラミッド幅が約1.41倍に増加することが数値的に示された。
- 証明には,ピラミッド幅と面距離の等価性,整数サポート超平面による面格子認証,および有限有理数計算が用いられた。
LEMUR:嗜好フィードバックに基づく多目的強化学習による整合学習 [cs.AI, cs.RO]目的:多目的意思決定における最適な方策の学習
- 現実世界の意思決定は,性能と効率など複数の目的のトレードオフを含むことが多く,その重要性が増している。
- 従来の強化学習は単一の報酬関数に依存し,多目的設定では各目的に対する明確な報酬関数設計が課題となっていた。
- 本研究は,報酬関数を事前に定義することなく,人間の嗜好に基づき多目的方策を学習する枠組みを提案する。
- LEMURは,人間の嗜好から複数の目的特有の報酬モデルと方策を同時に学習することで,競合する目的のバランスを取ることを可能にする。
- 様々なベンチマークタスクでの実験により,既存手法と比較して優れた性能が確認された。
- この手法は,事前に定義された報酬関数なしで多目的意思決定問題を解決するための有望な方向性を示す。
