arXiv雑要約
AI - 2026/07/31 公開
LEDGERMIND:構造化された証拠台帳を用いた,証拠制約されたマルチモーダルエージェント推論 [cs.LG]目的:マルチモーダルエージェント推論における,証拠に基づいた中間推論の追跡と改善
- 視覚的質問応答におけるエージェントの複雑化に伴い,推論過程の透明性と信頼性が重要になっている。
- 最終的な正答率だけでは,推論の根拠が正当であるか,偶然によるものかを判断できない。
- エージェントの推論過程を厳密に制御し,証拠に基づいた信頼性の高い推論を可能にすること。
- LedgerMindは,推論過程を構造化された証拠台帳として記録し,証拠に基づいた推論を強制することで,中間推論の妥当性を向上させる。
- 3層のグラウンディングプロトコル,適応的なデュアルパスディスパッチャ,イベントトリガー型検証・修復エンジンを実装し,信頼性と効率性を高めている。
- 複数のマルチモーダル推論ベンチマークにおいて,LedgerMindは正答率と推論過程の忠実性の両方を改善した。
HyperClaim:動画における誤情報の検出のための,きめ細かいクロスモーダルハイパーグラフ推論 [cs.AI, cs.MM]目的:動画の誤情報検出のための,サンプルレベルの信頼性分類
- 動画共有プラットフォームの普及に伴い,誤情報の拡散が深刻化しており,その検出技術の重要性が増している。
- 既存手法では,局所的な信頼性を示す手がかりを捉えきれず,動画全体の情報と文脈の相互作用が十分に考慮されていない。
- クエリ,テキスト,フレーム間の複雑な関係性を捉え,より精度の高い誤情報検出を実現することを目指す。
- 提案手法HyperClaimは,動画とテキストの間の相互作用を,ハイパーグラフを用いて高精度にモデル化する。
- FactGuardの評価において,FakeSV,FakeTT,FakeVVでそれぞれ83.7%,82.0%,87.3%の高い精度を達成した。
- 学習された重みは,トークンやフレームレベルでの構造を明らかにし,手法の解釈可能性を高めている。
仕様が競合する場合:LLMの選好を測定するための対称性に基づく枠組み [eess.SY, cs.DC, cs.SY, nlin.AO, cs.RO, cs.AI]目的:LLMにおける競合する仕様間の選好分析手法
- LLMは多様な情報源を統合するが,情報の不整合性は重要な研究課題である。
- LLMが競合する仕様をどのように解決するかを分析する制御可能で説明可能な方法が不足している。
- LLMの競合解決プロセスを定量化し,選好パターンを明らかにすることを目指す。
- 実験枠組みにより,LLMの仕様間の選択が直接観察・分析可能となった。
- 形式言語と自然言語では,形式言語または自然化された形式言語への選好が顕著であった。
- 本枠組みは,ブール代数,コード生成,臨床分野など,多様なタスクに適用可能である。
平均報酬CMDPにおける最適なニューラルアクター・クリティックのための階層型多水準モンテカルロ [cs.LG]目的:平均報酬制約マルコフ決定過程における,最適なニューラルアクター・クリティックの理論的保証
- 安全性が重要な応用において,報酬最大化と制約充足を両立する強化学習の枠組みとして重要である。
- ニューラルネットワークをクリティックに用いる場合,バイアスと最適化コストのトレードオフにより,最適収束が保証されていなかった。
- 階層型多水準モンテカルロによるニューラルクリティックを用いることで,バイアスを低減し,最適収束を達成する。
- 提案手法は,クリティックの最適化コストを対数的に抑えながら,バイアスの削減を実現する。
- 無限地平線平均報酬CMDPにおいて,最適性と制約違反がオーダーO(T^-1/2)で収束することを理論的に保証した。
- 混合時間の事前知識なしに,一般的な方策パラメータ化で最適収束を達成する初の成果である。
GLM-RAG:グラフに基づく検索拡張生成のためのグラフ言語モデル [cs.AI, cs.CL, cs.IR]目的:グラフ構造と意味情報を効果的に捉える検索器の開発
- 知識グラフを利用したRAGは,高度な質問応答や情報検索に不可欠である。
- 既存の検索器は,グラフ構造と意味情報の両方を捉えることが困難である。
- ドメイン外のデータに対する汎化性能の高い検索器を開発すること。
- ファインチューニングされたGLM検索器は,ドメイン外への汎化性能に優れていることが示された。
- 複数のマルチホップベンチマークにおいて,最新技術を上回る性能を達成した。
- GNNベースの検索器は効率的な学習で高いグラフカバレッジを実現し,ベクトル検索ベースラインはシングルホップデータセットで優位性を示した。
GUIエージェントはなぜ正解だが遅れるのか:決定時点のクリティカルパスを解析し,事前コンパイルされたポリシー木で検証する [cs.LG]目的:GUIイベントに対する応答性の改善
- GUIを用いたタスク自動化は,生産性向上やアクセシビリティ向上に不可欠である。
- 従来のGUIエージェントは,応答遅延により機会を逸することが多い。
- 決定時のクリティカルパスにおけるautoregressive decodingのボトルネックを解消する。
- Adaptive Anticipatory Policy Trees (AAPT)は,応答成功率を0.50から0.79に向上させた。
- AAPTは,誤った行動を起こすことなく,成功率を大幅に改善した。
- 事前準備によるポリシー木の構築が,応答速度の向上に寄与していることが示された。
QuantWAMs:ワールドアクションモデルの適切な粒度での量子化 [cs.AI, cs.LG]目的:ワールドアクションモデルの量子化手法
- ロボットの行動計画や制御において,効率的なモデルの運用が重要である。
- 既存の量子化手法は,ワールドアクションモデル特有の特性に対応できていない。
- モデル構造,ロールアウト分布,タスク目標に合わせた量子化を可能にすること。
- QuantWAMsは,Fast-WAMとLingBot-VAにおいて,シミュレーション環境でFP16と比較して0.2~0.7パーセントポイントの性能差で済むことを示した。
- 実ロボット実験により,3つの操作タスクでの実用性が確認された。
- ターゲットとなるビデオおよびアクションブロックのピークメモリ使用量をFP16の約29%に削減し,ブロックレベルで1.4~1.6倍の高速化を実現した。
大規模行動空間におけるオンポリシーおよびオフポリシー学習 [cs.DC, cs.NI, cs.PF, cs.LG, cs.AI, math.ST, stat.ML, stat.TH]目的:インタラクティブシステムにおける方策学習
- 行動選択が重要な様々な応用において,効率的な学習手法の確立が求められている。
- 大規模な行動空間では,探索の効率性,データカバレッジ,バイアスなどの課題が存在する。
- 大規模行動空間におけるオンポリシー・オフポリシー学習の課題解決を目指す。
- オンポリシー学習では,混合効果モデルを用いたmeTSと,拡散モデルに基づくdTSを提案し,行動間の依存性を考慮した方策学習を実現した。
- オフポリシー学習では,潜在変数に基づくsDMを提案し,最適化誤差が推定誤差を支配する状況に対応するため,効率的な目的関数を導入した。
- さらに,指数平滑化とPAC-Bayesian boundsに基づく,バイアス・バリアンスのトレードオフを制御する手法を開発した。
窓付き間引きとバウンシー粒子およびジグザグサンプラのクエリ複雑性 [cs.CE, cs.CL, q-fin.TR, math.NA, cs.LG, cs.NA, math.PR, math.ST, stat.TH]目的:バウンシー粒子サンプラと座標ジグザグ過程に対する窓付き間引き法のクエリ複雑性の解析
- マルコフ連鎖モンテカルロ法は,高次元分布からのサンプリングにおいて不可欠な手法である。
- 既存のサンプリング手法は,条件数の悪化により計算コストが増大することがある。
- 本研究は,窓付き間引き法によるクエリ複雑性の理論的保証を与えることを目指す。
- 窓付き間引き法を用いることで,バウンシー粒子サンプラのクエリ数は$O(\kappa^{1/2}d\,(d\log\kappa+\log\frac1\varepsilon))$と評価された。
- ジグザグ法においては,$O(\kappa d^{1/4}(d\log\kappa+\log\frac1\varepsilon))$のフルグラディエント相当クエリ数が必要であることが示された。
- 本研究は,これらのサンプラの効率的な実装のための理論的基盤を提供する。
QQWorld:ワールドモデル正則化のための分位点-分位点マッチング [cs.LG, cs.AI, cs.CV, cs.MM, cs.RO]目的:ワールドモデルの潜在分布の質的向上
- 効率的な計画立案には,潜在空間での未来状態予測が不可欠であり,その性能は潜在分布の質に大きく依存する。
- 既存手法では,裾の重いサンプルに対して正則化効果が減衰し,潜在分布の制御が不十分になる場合がある。
- 裾の重いサンプルに対しても効果的な正則化を実現し,潜在分布の制御精度を向上させる。
- QQWorldは,EPの代わりに分位点-分位点マッチングを用いることで,潜在空間におけるガウス分布との整合性を高める。
- クロスバッチQQにより,ランキングプールの拡大とバイアス-バリアンスのトレードオフを特徴づける。
- 4つの制御環境において,QQWorldはLeWMの計画成功率を改善し,より薄い潜在分布のテールを実現する。
WIDE:トークンレベル動的幅プルーニングによる適応型LLM推論の性能向上 [cs.RO, cs.AI, cs.CL, cs.LG]目的:LLM推論における効率改善
- 大規模言語モデル(LLM)の利用拡大に伴い,計算資源の効率的な活用が重要になっている。
- 既存の静的プルーニング手法では,精度低下が課題となっている。
- トークンごとに動的に計算量を調整し,精度と効率の両立を目指す。
- WIDEは,注意層とFFN層においてトークンレベルで動的に幅をプルーニングする手法である。
- 50%のスパース率で,最新の動的深度プルーニング手法と比較して55.1%の性能向上を達成した。
- 事前学習と推論において,理論値に近いカーネルレベルの高速化を実現した (最大1.98倍/4.95倍)。
誘導計測が誤解を招くとき:特権的モーダリティの信頼性証拠によるLLMの過信の定量化と軽減 [cs.AI]目的:LLMにおける誘導計測の過信(DFOT)の定量化と軽減
- LLMの性能向上には,多様な情報源の活用が不可欠であり,計測データの信頼性は重要な要素である。
- 誘導計測は,状況によって信頼性が変化するため,LLMがその限界を理解せずに過信する可能性がある。
- 本研究は,LLMが誘導計測を誤って解釈する状況を特定し,その過信を軽減するための評価指標を提示する。
- 提案手法により,LLMが誘導計測を過信する傾向を定量的に評価できるフレームワークが構築された。
- ECG-to-PPG蒸留を用いたベースライン実験により,信頼性に関する複数の指標において1.82~6.69パーセントポイントの改善が確認された。
- 本研究は,LLMの信頼性評価と改善に向けた共通の評価目標を提供する。
量子誤り訂正のためのノイズ適応型ニューラル前処理フレームワークQAdapt [cs.LG]目的:量子誤り訂正におけるノイズへの適応
- 量子コンピュータ実現には誤り訂正が不可欠であり,大規模化には効率的な手法が求められている。
- 従来の誤り訂正器は,ノイズの変化やシミュレーションと実機との乖離により性能が低下する。
- 本研究は,変化するノイズ環境下でも安定した誤り訂正性能を維持する手法を開発する。
- QAdaptは,シンドロームデータの局所的な時空間相関を捉え,ノイズの変化に適応的に対応する。
- 合成ノイズデータを用いた実験で,QAdaptは従来のニューラル前処理と比較して論理エラーレートを低減した。
- GoogleのWillowデータを用いた実験で,QAdaptは論理エラーレートを最大5.79%削減し,バックエンドの復号遅延を9.32%改善した。
負の対照群がラジオミクスと画像基盤モデルの特徴における容量依存性の混同要因を明らかにする [cs.CV, cs.LG]目的:ラジオミクスおよび画像基盤モデルの特徴における容量依存性混同要因の評価
- 腫瘍生物学の非侵襲的バイオマーカー開発が期待され,画像解析技術の重要性が高まっている
- 特徴量が腫瘍の体積や撮像アーチファクトに影響を受け,真の画像構造を反映していない可能性がある
- 画像の特徴量が独立した空間信号を捉えているか評価し,信頼性の高いバイオマーカー開発を目指す
- READII-2-ROQCフレームワークを用いて,3つの公開癌画像コホート(3,552腫瘍)を解析した結果,複数のモデルが空間構造を破壊しても性能を維持することが示された
- これは,特徴量が体積や文脈に依存した混同要因の影響を受けていることを示唆している
- READII-2-ROQCは,解釈可能で生物学的に根拠のある画像バイオマーカーと再現性のあるラジオミクスのワークフローを開発するための品質管理戦略を提供する
ニシモリ温度における疎グラフ上の Kohn-Sham スペクトル埋め込み:画像分類への応用 [cs.LG, cs.CV, cs.IT, math.IT]目的:画像分類のための,関連するランダム結合イジングモデルのニシモリ温度で評価される疎グラフスペクトル埋め込み
- 画像分類は,コンピュータビジョンの基盤技術であり,様々な応用分野で不可欠である。
- 深層ニューラルネットワークは高い性能を誇るが,モデルサイズが大きく,計算コストが高いという課題がある。
- 本研究は,疎グラフを用いた効率的なスペクトル埋め込みにより,軽量かつ高性能な画像分類器を開発する。
- 提案手法 KSSE は,ImageNet-1000 データセットにおいて 88.93% の Top-1 精度を達成した。
- KSSE は,Swin-L や ViT-H/14 と同等の性能でありながら,モデルサイズをそれぞれ 10 倍,30 倍削減した。
- グラフ構造の最適化技術である star-domain surgery により,効率的な計算と高い精度を実現した。
分野横断的な汎化能力を持つ数値知能の基盤モデル [cs.AI]目的:数値知能の基盤モデルの構築
- 科学的,社会システムの複雑な問題解決には,言語だけでなく数値データに基づく知能が不可欠である。
- 既存のモデルは,特定の分野に特化し,未知の分野への適応が困難であるという課題がある。
- UNICONは,学習データに含まれない分野を含む様々なシステムにおいて,高い汎化能力を発揮する。
- UNICONは,グラフ構造の事例から予測関係を推論し,未知のシステムへのクエリに適用することで数値知能を実現した。
- UNICONと言語モデルエージェントを組み合わせることで,学習時に未見の分野においても最先端の専門家モデルを上回る性能を示した。
- 学習コーパスの多様性が,未知の分野への汎化能力向上に貢献することが示された。
隠喩追跡器:潜在状態に関する理論に基づいた分析 [cs.AI, cs.CL]目的:単一テキストの組織化に関する言語モデルの潜在状態の分析
- 言語モデルの内部表現を理解することは,自然言語処理の高度化に不可欠である。
- 潜在状態がテキストの構造をどのように反映しているか明確に理解されていない。
- 言語モデルの潜在状態を用いて,隠喩を含むテキスト構造を分析する。
- 提案手法では,トークン位置の「集約器」と「識別子」という2つの特性をスコアリングすることで,テキスト内の情報の流れを捉えている。
- 集約器スコアは,トークンの繰り返しに伴い,驚異度や注意度が低下する一方で安定的に維持されることから,テキスト内のトークン位置を示す指標となりうる。
- 集約器は,事前に定義されたレジスタや臨床記録の分析において高い一致率を示し,言語モデルの潜在状態がテキスト構造を反映していることを裏付けている。
オラクル予算下における短期グラフメモリを用いた分子最適化 [cs.LG]目的:分子最適化におけるオラクルクエリの優先順位付け
- 分子最適化は創薬等に応用され,新物質探索に不可欠な技術である。
- 限られたオラクル予算下では,評価対象の選択が最適化の成否を左右する。
- 過去の評価結果を活用し,効率的なクエリ選択を実現することを目的とする。
- 短期グラフメモリモジュールを導入することで,既存の分子生成器の性能を向上させた。
- オラクル予算を増加させずに,トップ10スコアの平均値を改善することに成功した。
- 生成器の探索性とオラクルフィードバックの活用度合いが,効果に影響することが示された。
加齢を自覚する機械:ハードウェアを意識した自律知能のフレームワーク [cs.RO, cs.CE, cs.CL, cs.RO, cs.AI]目的:ハードウェアの健全性を考慮した自律システムの知能
- 自律システムは不可避に劣化する。システムの性能維持には,ハードウェアの状態把握が不可欠である。
- 従来のAIはハードウェアが初期状態を維持することを前提としているため,経年劣化に対応できない。
- ハードウェアの劣化を考慮し,システムの寿命延長と安全性を高めることを目指す。
- 本研究では,ハードウェアの健全性を自律システムの意思決定プロセスに統合する「加齢を自覚する自律知能 (AAAI)」フレームワークを提案する。
- AAAIは,ハードウェアの自己認識,自己適応型推論,生存中心型知能の3つの柱に基づき,劣化に対するロバスト性を実現する。
- AAAIは,宇宙探査や医療機器など,アクセスが困難または安全性が重要な環境における自律システムの運用を改善する。
反復解法のグラフニューラル多水準前処理器 [eess.SY, cs.SY, math.NA, cs.LG, cs.NA]目的:大規模疎行列の効率的な前処理法の開発
- 科学計算において,大規模疎行列の求解は不可欠であり,反復解法の性能向上は重要である。
- 従来のAMG法は非対称行列に対して頑健性に欠け,GNNを用いた前処理器はまだ多水準構造の検討が十分ではない。
- AMGの階層構造を事前知識として導入し,グラフニューラルネットワークで平滑化,制限,補間演算子を学習することで,より汎用的な前処理器を開発する。
- 提案手法GMPは,AMG,ILUT,最先端のGNN前処理器と比較して,800以上の疎行列ベンチマークで性能を評価した。
- GMPは,特定の条件下で反復解法の収束を改善する一方で,単層ベースラインと比較してオーバーヘッドが発生する場合もあることが示された。
- 大規模科学シミュレーションのための学習型前処理器において,AMG様多水準構造の適用可能性と限界が明らかになった。
SVR:自己検証による改良 - 適応型テスト時計算のための共同判定・確信度強化学習 [cs.AI, cs.CL]目的:適応的なテスト時計算を実現するための自己検証メカニズムの学習
- 言語モデルの推論能力向上にはテスト時計算のスケーリングが有効。効率的な計算資源の配分が課題。
- 従来の検証者による改良は外部からのフィードバックに依存し,効率性や自律性に課題があった。
- 自己検証によって内部制御信号を学習し,テスト時計算を適応的に割り当てることで問題を解決する。
- SVRは,Qwen3.5-2Bを用いた7つの数学的推論ベンチマークにおいて,平均2.99ターンでマクロ平均正解率0.563を達成した。
- 標準的なGRPO,強力な複数ターンベースライン,および固定予算のオラクルガイダンス参照を上回り,必要なターン数を大幅に削減した。
- 学習された自己検証が,解答の保持と適応的テスト時計算の割り当てのための効果的な内部制御信号となり得ることを示した。
LeanCSP:制約変換と解法の検証のためのフレームワーク [cs.AI, cs.LO]目的:制約変換の検証と解法の保証
- 組合せ最適化問題解決の核技術であり,スケジューリング,計画,構成,検証等に応用が広がっている。
- 制約変換の正当性やソルバーの出力結果の信頼性に対する検証が課題であった。
- Lean定理証明器を用いて,制約変換と解法全体の信頼性を保証する。
- 本フレームワークにより,制約変換の等価性や対称性解消制約の正しさを問題クラス全体に対して証明可能である。
- ソルバーが出力した証明を外部形式に変換し検証することで,個々の問題インスタンスの正当性を確認できる。
- 検証済みの対称性解消により,ソルバーの探索コストを最大で2x10^7分の1に削減し,検証時間も妥当な範囲に収まっている。
推論機能を備えた言語モデルによるサイバーセキュリティ検知の分類 [cs.LG, cs.CR]目的:サイバーセキュリティ検知の分類
- セキュリティオペレーションセンター(SOC)における脅威検知の重要性が増している。
- SOC担当者のアラート対応能力を超える過剰なアラートが発生しやすい。
- アラートの妥当性に関する推論能力を持つ分類器を開発し,誤検知を削減すること。
- 本研究では,実データを用いて,推論機能を備えた言語モデルによるトリガー分類器を訓練した。
- その結果,テスト精度は82.6%に達し,誤検知を43.0%改善,悪意のある検知を18.3%改善した。
- 訓練された信頼度較正器は,自動トリガーに不可欠であり,規模よりもターゲットを絞った訓練が重要である。
28万件のルーチンレポートに基づく大腸内視鏡検査用レポートに基づいた視覚言語基盤モデル [cs.AI]目的:大腸内視鏡検査における視覚言語基盤モデルの構築
- 大腸内視鏡検査の質の向上は,早期発見・早期治療に繋がり,患者の予後改善に不可欠である。
- ルーチンレポートの情報と画像間の関連性が弱く,臨床所見と画像の一致が課題である。
- ルーチン文書から発見とフレームの対応関係を復元し,大規模な教師あり学習を可能にすること。
- EndoCLIPは,画像-テキスト検索,構造化レポート生成,臨床分類タスクにおいて既存モデルを上回る性能を示した。
- 悪性・良性分類においては,線形プローブの性能が12人の内視鏡専門医の診断に匹敵する結果が得られた。
- ルーチン文書は,タスクごとにアノテーションを行うことなく,言語による臨床目標指定を可能にするスケーラブルな教師データとなり得る。
ナノ衛星によるオンボード推論と生成データ拡張を通じた自律航空機監視への道 [eess.SY, cs.SY, cs.AI, cs.CV]目的:ナノ衛星からの自律航空機監視に関するワークフロー
- 地球低軌道からの航空機監視は,災害対応や安全保障において重要性が高い。
- 従来のシステムでは,大量の画像データを地上に送信する必要があり,通信帯域がボトルネックとなる。
- データ送信量の削減と,希少な航空機クラスの検出精度の向上が課題。
- オンボード推論と生成データ拡張の組み合わせにより,データ送信量と処理遅延を削減できることが示された。
- 生成された合成データを用いてデータセットのバランスを調整することで,少数クラスの検出精度が向上した。
- 量子化された検出器は,オンチップメモリに適合し,軌道上で毎秒25~30フレームの処理が可能であることが確認された。
下水道ネットワークにおける配管の深刻度予測のためのファジー規則に基づくニューロシンボリックアプローチ [cs.RO, cs.CL, cs.CL, cs.AI]目的:下水道配管の深刻度予測のためのニューロシンボリックフレームワーク
- 下水道施設の老朽化が進み,適切な維持管理が重要課題となっている。
- 画像分類による自動評価では,視覚的欠陥と深刻度の関連が不明瞭である。
- 視覚的欠陥と深刻度の関連性を明確にし,解釈可能な評価システムを構築する。
- 提案手法は,画像のみによる分類と比較して,精度,バランスのとれた精度,マクロF1スコア,およびMCCをそれぞれ17.9%,12.2%,23.0%,17.3%向上させた。
- 予測されたCODE度合いから深刻度への推論過程が追跡可能であり,解釈性に優れている。
- ニューラル知覚と記号的推論を分離することで,より合理的な深刻度予測を実現している。
エンドツーエンド連携のための結合ポリシーによるサプライチェーン運用:SCOPE [cs.AI, cs.LG]目的:サプライチェーンにおけるエンドツーエンドの連携
- サプライチェーンは経済活動の基盤であり,効率的な運用は競争力に直結する。
- サプライチェーンの各部門が独立して最適化を行うことで,全体として非効率な計画が生じることがある。
- 部門間の連携を強化し,サプライチェーン全体の最適化を図る。
- 提案手法SCOPEは,サプライチェーンの各要素をトークンとして表現し,共有の運用表現を用いて連携させることで,各決定段階を最適化する。
- 実データを用いた評価により,SCOPEが各段階を独立して最適化する方法や,従来の運用手法を上回る性能を示すことが確認された。
- 部門間の運用上の連携を学習・協調させることで,より効果的なサプライチェーン決定が可能となる。
ステージ再現の相違はKVキャッシュに追随する:固定プレフィックスの精度制御と双方向キャッシュ移植 [eess.SY, cs.SY, cs.LG, cs.CL]目的:ステージ再現における相違性の原因究明
- 大規模言語モデルの推論過程を理解し,改善するためには,内部状態の挙動を詳細に分析することが重要である。
- 言語モデルの再現性確保は難しく,特にKVキャッシュのような内部状態の微妙な変動が結果に影響を与える可能性がある。
- KVキャッシュが推論軌跡の決定に十分な情報を含み,数値精度がその表現に影響を与えることを検証する。
- ステージ再現診断において,推論ステージ境界におけるKVキャッシュの重要性が確認された。
- BF16では相違が生じるものの,FP32では再現性が向上し,数値精度が結果に影響することを示唆する。
- 双方向キャッシュ移植実験により,推論軌跡はKVキャッシュに依存し,ライブ状態の完全な再現が不要であることが明らかになった。
アルゴリズムにおける因果性の役割 [cs.CL, cs.LG, cs.CY, cs.GT]目的:アルゴリズムによる是正策の役割
- 高リスクな分類問題において,個人の結果改善は重要である。
- 既存手法は予測反転のみに注力し,真の資格改善を考慮しない。
- 因果構造を考慮し,戦略的な行動を抑制する是正策を開発する。
- 因果的パフォーマンスフレームワークを用いて是正策の失敗モードを形式化。
- 因果構造を無視した是正策が,誤った行動変容を誘発する可能性が示された。
- 提案手法は,標準的な手法と比較して性能が向上し,モデルの再学習頻度を軽減する。
TCA-SIR:科学的インスピレーション検索のためのターゲット条件付き抽象化学習 [cs.IR, cs.AI, cs.CL]目的:科学的インスピレーション検索におけるターゲット条件付き抽象化
- AIによる科学研究において,仮説生成は重要な課題であり,そのためのインスピレーション検索が不可欠である。
- 既存の検索手法はトピックの類似性に依存し,問題への転移可能性を明示的に表現できていない。
- ターゲット問題に特化した抽象的な原理を抽出することで,転移可能性を予測し,検索精度を向上させる。
- TCA-SIRは,既存のSIR手法やLLM直接検索よりも高い性能を示し,MOOSE-Chemに対しHitRate@top4%を10%以上改善した。
- 学習された抽象化は,未学習のプロンプトよりもターゲット関連メカニズムを明確に捉え,検索性能と解釈可能性を両立した。
- この研究は,科学的インスピレーション検索における抽象化の重要性を示唆し,新たなアプローチを提示する。
InfoOps Bench:情報操作安全性評価ベンチマーク [cs.AI]目的:最先端言語モデルが国家主導の情報操作に利用される脆弱性の評価
- AI技術は社会に浸透し,誤情報の拡散や政治的介入のリスクが高まっている。
- 言語モデルの安全性評価は不十分であり,悪意のある利用に対する対策が急務である。
- 実世界で観測される情報操作事例に基づき,言語モデルの脆弱性を定量的に評価する。
- 17種類のモデルを評価した結果,ほとんどのモデルが情報操作に利用可能であることが判明した。
- モデルの安全性(正当な要求を拒否する割合)は8.8%から94.5%と幅広く,モデルサイズだけでは説明できない。
- 中国開発のモデルは,中国批判的な内容に対して大幅に回答を拒否する傾向があり,安全性と有用性のバランスが課題である。
自身の弱点証明を行うエージェント:安全な対戦相手の搾取のための信頼度スケジュールに基づく制限付き応答 [cs.GT, cs.AI, cs.MA]目的:対戦相手の欠陥を利用した価値の獲得
- 不完全情報ゲームにおいて,ナッシュ均衡戦略は安全だが,対戦相手の弱点を活かす余地を残す。
- 対戦相手の弱点を利用する際,安全性と効率性のバランスを取ることが難しい。
- エージェント自身で検証可能な安全な搾取手法を確立すること。
- 提案手法(CS-RNR)は,エージェントが実際に実行する戦略を証明書によって保証する最初の対戦相手搾取法である。
- Leduc Hold'emにおいて,既存手法と比較して$6.2$倍の利益を得ながら,予算内に戦略を収めることができた。
- 一連のゲーム(Leduc, Liar's Dice, 5-rank Leduc)において,$36{,}000$回の検証で証明書の許容範囲内に収まった。
選択的信用度制限付き信念更新 [cs.DC, cs.AI, cs.LO]目的:信念更新の新たな枠組み
- 知識と信念のダイナミクスは,AIや意思決定において重要であり,合理的推論の基盤となる。
- 既存の信念更新手法では,情報源の信頼性や情報の分割可能性が十分に考慮されていない。
- 情報源の信頼度に応じて信念を更新し,部分的な情報の採用を可能とする手法を提案する。
- 選択的信用度制限付き信念更新は,既存の信用度制限付き信念更新を包含し,より表現力豊かな枠組みを提供する。
- 提示された枠組みは,変換関数と一貫性維持演算子によって特徴付けられ,理論的な基盤が確立されている。
- この研究は,情報源の信頼性に基づいて信念を柔軟に更新する新たなアプローチを提示し,AIの合理的な推論能力向上に貢献する。
GNN における同一グラフを用いたクロス・タスク転移:プロトコルと予測因子 [cs.LG, cs.SI]目的:ノード分類とリンク予測における同一グラフを用いたクロス・タスク転移の形式化と評価
- 現実世界のグラフは複数の予測タスクをサポートしており,知識の再利用が期待される。
- 既存研究では,データの分割方法や評価設定に一貫性がなく,信頼性の高い結論が得られていない。
- 漏洩のない評価プロトコルを確立し,転移学習の方向性と条件を解明する。
- ノード分類からリンク予測への転移は,同質性を持つグラフにおいて一貫して有効である。
- リンク予測からノード分類への転移は不安定であり,単純な表現の再利用では精度が低下する場合がある。
- CoTask Score (CTS) によって,ノード分類とリンク予測の組み合わせにおける有用性を評価できる。
除去すべきもの,保存すべきもの:汎用画像復元における二重曖昧性解消 [cs.CV, cs.AI]目的:汎用画像復元のための二重曖昧性解消
- 画像劣化は多様であり,その復元は重要な課題である。現実的な画像を扱う上で不可欠な技術。
- 既存手法では,劣化条件と画像内容が混同し,復元品質を阻害する問題がある。
- 劣化条件と内容の分離により,より高品質な画像復元を実現することを目指す。
- 提案手法DAR-Netは,劣化状態を構造化し,チャンネル方向と空間方向の曖昧性を解消する。
- 標準的なベンチマークテストにおいて,最先端の競合手法を0.14dB〜0.34dB上回る性能を達成した。
- CDD-11やWeatherBenchにおいても優れた性能を示し,汎用性の高さが確認された。
MANTA:自己進化型マルチエージェントシステムのためのマルチエージェントネットワークトポロジー適応 [cs.AI]目的:マルチエージェントネットワークトポロジーの自己進化
- 複雑な問題解決において,エージェント間の協調が重要であり,その効率的なネットワーク構築が不可欠である。
- 既存システムでは,通信トポロジーが固定されているか,オフラインで最適化されるため,動的な環境への適応が困難である。
- 推論時にネットワーク構造を自己進化させ,協調の質を向上させることで,問題解決能力の向上を目指す。
- MANTAは,過去の構造経験からタスク条件に合わせた初期トポロジーを構築し,実行中に協調の軌跡を監視する。
- 現在の組織が不十分な場合,エージェントの役割,通信リンク,実行順序などを変更し,タスクインターフェースとエージェントの予算を維持する。
- 5つのベンチマークテストで,MANTAは平均スコア74.0を達成し,最も強力なベースラインを5.8ポイント上回り,PlanCraftで最高の性能を示した。
ScaFE:LLM生成臨床特徴プログラムによる効率的な瘢痕分類 [cs.CE, cs.CV, cs.LG]目的:臨床写真からの病理的瘢痕分類
- 瘢痕分類は,患者のQOLに影響する重要な医療課題である。
- 専門家によるラベル付けデータが限られ,病院間での撮影条件にばらつきがある。
- LLMを活用し,データ効率が高く,監査可能な特徴プログラムによる分類を目指す。
- ScaFEは,3病院のデータセットにおいて,81.0%のサイト・マクロバランスアキュラシーを達成した。
- 既存の基盤モデルBiomedCLIPを10.0%上回る性能を示し,データ効率の高さも確認された。
- 実行可能なプログラムの成功率が66.7%から95.0%に向上し,特徴の根拠も検証された。
ORCA-bench: 言語モデルエージェントはオンコール対応の準備ができているか [cs.HC, cs.CL, cs.AI, cs.SE]目的:オンコール時の根本原因分析における言語モデルエージェントの能力評価
- 現代のソフトウェアシステムは複雑化しており,迅速かつ正確な障害対応が不可欠である。
- 従来の障害対応は人手に頼る部分が多く,対応の遅延や誤診が発生しやすい。
- 言語モデルエージェントを活用することで,障害対応の自動化と効率化が期待される。
- ORCA-benchは,本番環境に近い設定で言語モデルエージェントのオンコール対応能力を評価するためのベンチマークである。
- 最新の5つのモデルにおいて,現実的な入力設定での根本原因分析の正解率は,難易度中レベルで最大25.3%であった。
- ソースコードへのアクセス制限や,システムの規模・動的な変化などが課題として残されており,実用化にはさらなる改善が必要である。
原子系構造予測のための非教師あり原子ポリシー最適化 [cs.HC, cs.LG, cs.AI, cs.MA]目的:原子系構造予測における最適化手法
- 材料科学や創薬の発展には,原子系の3次元構造予測が不可欠である。
- 新規結晶相やde novoタンパク質の実験ラベル取得は困難であり,データ不足時の構造モデリングのボトルネックとなっている。
- 実験ラベルを用いずに,物理的な整合性に基づいた構造予測の精度向上を目指す。
- 本研究で提案するAPOは,教師なしアラインメントフレームワークであり,既存の教師ありベースラインよりも優れた性能を示す。
- APOは,サンプル類似性の固有分解を用いた報酬メカニズムにより,潜在的な構造モードを強化し,熱力学的な安定性を実現する。
- その結果,APOは確率パスを効率化し,推論効率を大幅に改善することが示された。
ローカルエージェントにおける推論時スケーリングの再考:失敗モードと計算量のトレードオフ [cs.AI]目的:ローカルコンピュータ利用エージェントにおける推論時スケーリングの効果と限界
- プライバシー保護,コスト削減,実用性の観点から,ローカルでの自律エージェント活用が重要性を増している。
- リソース制約のあるローカルモデルにおいて,推論時スケーリングの有効性は十分に解明されていない。
- ローカルエージェントにおける効果的な計算資源配分戦略を明らかにすること。
- 推論時スケーリングは,追加計算量に対して収益逓減の傾向が見られ,失敗モードも変化することが示された。
- コンテキストスケーリングは軌道安定性とタスク精度を向上させるが,トークンコスト増加に伴い,誤った成功への早期終結という新たな失敗が発生する。
- 構造分解は計画・フォーマットのオーバーヘッドを生じ,並列スケーリングはある程度軽減するものの計算コストが大きくなる。
チーレ投票ルールに基づく構造化選挙のためのアルゴリズム [cs.GT, cs.AI, cs.DS, cs.MA]目的:承認型委員会選挙における勝者決定問題の計算複雑性
- 選挙制度の効率的な設計は,民主的な意思決定の根幹をなす重要な課題である。
- 承認型選挙における勝者決定は,計算困難な問題であり,大規模選挙での実用性が課題となっている。
- チーレ投票ルールにおける特定の条件下での計算効率化を目指す。
- チーレ投票ルール下では,有権者の承認票パターンが候補者間の依存関係を形成することが示された。
- Voter Interval (VI)ドメインにおいて,Proportional Approval Voting (PAV)を含むチーレ投票ルールに対し,FPTアルゴリズムが設計された。
- 候補者を承認する有権者が2人以下のインスタンスに対し,多項式時間アルゴリズムが提供され,VIドメインにおけるPAVの計算複雑性に関する理解が深まった。
より多くサンプリングし,より少なく内省する:自己改善とリフレクションは,等価なトークンコストで,繰り返しサンプリングに劣る(1.5Bから7Bまで) [cs.CL, cs.AI, cs.LG]目的:言語モデルの性能向上手法の比較
- 大規模言語モデルの性能向上は,自然言語処理における重要な課題である。
- 自己内省や複数回の試行といった手法は,計算コストが高いという問題がある。
- 計算コストを考慮した上で,より効果的な性能向上手法を特定すること。
- 複雑な手法は,単純な繰り返しサンプリングと比較して,明確な優位性を示さなかった。
- 自己出力の検査を行う手法は,繰り返しサンプリングよりも信頼性が低いことが示された。
- モデルの規模が大きくなるにつれて,停止選択の効果は小さくなり,自己内省の効果も薄れる傾向にある。
DualG-MRAG:マルチモーダル検索拡張生成のためのマクロ推論とマイクロマッチングの分離 [cs.CE, q-fin.TR, cs.AI]目的:マルチモーダル検索拡張生成における複雑な多段階推論の性能向上
- マルチモーダルデータは情報伝達の重要な手段であり,多様な応用分野で利用が拡大している。
- 既存手法では,モダリティ間や文書間の明示的な関係性を捉えきれず,複雑な推論課題に苦戦している。
- グラフ構造の導入によるノイズ抑制と,ローカルな証拠の保持を両立し,推論精度を向上させる。
- DualG-MRAGは,グローバルなトポロジカルルーティングと高精度なローカル検証を可能にする二層グラフ構造を提案。
- クエリ駆動型メッセージパッシングによる動的な関連性伝播を導入し,異種証拠ソース間の連携を強化。
- GNNの順伝播から明示的な推論パスを抽出する動的計画法デコーディングにより,生成モデルに構造的な指針を提供。
β-OPSD:方策最適化による導出と自己知識蒸留による学習 [cs.LG]目的:推論言語モデルの性能向上
- 言語モデルは多様なタスクに応用可能であり,その性能向上が求められている。
- 既存の自己知識蒸留法は実装が難しく,安定した性能が出にくい場合がある。
- β-OPSDは自己知識蒸留の安定性を高め,推論性能を改善することを目指す。
- β-OPSDは,KLペナルティの重みβを導入することで,参照方策と教師方策の間のトレードオフを制御する。
- β-OPSDは,従来のOPSDよりも最適化の安定性が向上し,数学的推論ベンチマークで高い性能を示した。
- 自己知識蒸留と方策最適化の間の関係を明確にし,効率的な学習方法を提供する。
PAIChecker:SWE-Bench類似ベンチマークにおけるPR-Issue不整合の発見と検証 [cs.HC, cs.SE, cs.AI]目的:SWE-Bench類似ベンチマークにおけるPR-Issue不整合の検出と検証
- 大規模言語モデル(LLM)の性能評価において,SWE-Bench類似ベンチマークは重要な役割を担う。
- PRとIssueのペアリングは手動で行われるため,大規模リポジトリでは不整合が生じやすい。
- PR-Issueの不整合を自動的に検出し,ベンチマークの信頼性を高めることを目指す。
- PAICheckerは,SWE-Bench Verifiedインスタンスにおいて13.6%の不整合を5つのパターンで検出した。
- 本研究で提案するPAICheckerは,SWE-GymとSWE-bench Multilingualにおいて,4種類のLLMバックボーンで最高性能を達成した。
- PAICheckerは,それぞれ最大92.12%と91.67%の二値精度を達成し,高精度な不整合検出が可能であることを示した。
MixFrag:脆弱性に基づいたVision Transformerの混合精度事後学習量子化 [cs.CV, cs.LG]目的:Vision Transformerの混合精度事後学習量子化における精度割り当ての最適化
- 画像認識モデルの軽量化は,モバイル環境などリソース制約のあるデバイスでの利用に不可欠である。
- 既存の量子化手法は,Transformerの各コンポーネントの量子化に対する感度差を考慮せず,非効率な精度割り当てになる。
- MixFragは,コンポーネントの脆弱性を評価し,最適なビット割り当てを行うことで,より効率的な量子化を目指す。
- MixFragは,ImageNet-1Kにおける複数のVision Transformerアーキテクチャで,競争力のある分類性能を達成した。
- COCOオブジェクト検出・インスタンスセグメンテーションにおいて,既存の混合精度PTQ手法中最先端の性能を示した。
- 提案された脆弱性指標は,学習されたビット割り当てとの強い相関関係が確認された。
Change2Task:リポジトリの変更から実行可能なコーディングエージェントのタスクと環境へ [cs.SE, cs.CL, cs.LG]目的:コーディングエージェントのトレーニング,ベンチマーク,継続的な評価のための実行可能なデータ供給
- コーディングエージェントの性能向上には,継続的な学習データが不可欠である。
- 現実的なソフトウェアの状態と検証可能なタスクを大量に用意することが課題である。
- リポジトリの変更履歴から,検証済みのタスクを効率的に生成することを目的とする。
- Change2Taskは,プルリクエストの履歴から,同一リポジトリの健全な改訂における検証済みのタスクを生成する。
- 五つの一般的なタスクファミリーにおいて,79.6%のタスク構築成功率を達成した。
- ベースラインと比較して,29.2%多くの検証済みタスクを復元し,パイプライン全体のコストを10.8%削減した。
臨床リスクモデルにおけるサブグループ公平性監査の再現性:KAISEN [cs.RO, cs.MA, q-bio.NC, cs.CL, cs.LG, q-bio.QM]目的:臨床リスクモデルのサブグループ公平性監査パイプラインの信頼性評価
- 医療現場では,リスク予測モデルが広く利用されており,公平な予測が不可欠である。
- 既存の監査手法は,その信頼性が検証されておらず,どの段階に問題があるか不明確である。
- 監査パイプラインの各段階の信頼性を検証し,問題点を特定することで,公平性の確保を目指す。
- 有意性評価は,各軸における差の検出可能な最小効果との相関を示し,標準化されたEODとの相関は高かった。
- グループごとの閾値最適化は,EODを大幅に削減したが,PlattスケーリングはEODに一貫した改善をもたらさなかった。
- メカニズム診断は,制御されたケースを正確に分類したが,モデル駆動型のケースでは誤分類が多く,失敗の兆候もなかった。
- CUSUMの誤検知と見逃しは,疾患よりもコホートの実現可能性に強く影響を受けることが示された。
OSReward:クロスプラットフォームのコンピュータ利用報酬モデルに対する標準化された評価の導入 [cs.AI, cs.CL, cs.CV]目的:コンピュータ利用エージェントの報酬モデルの評価基準の確立
- コンピュータ利用エージェント研究は,デジタル世界における自動化の可能性を広げる重要な分野である。
- 大規模なタスク遂行検証が難しく,人間の評価に頼る部分が大きいという課題がある。
- VLM(Vision-Language Model)の信頼性を評価し,より安価で信頼性の高い報酬モデルを開発すること。
- 既存の最先端VLMですら,理想的な評価者には及ばず,失敗事例を成功と誤認する傾向が見られた。
- OS-Shepherd-100Kという,推論注釈付きの軌跡判断コーパスを構築・公開することで,コミュニティに貢献した。
- OS-Shepherd(9Bおよび35B)をトレーニングし,商用モデルと同等の性能を30〜60%低いコストで実現した。
AISPA:大規模言語モデルアプリケーションにおけるユーザー中心のシステムプロンプト監査 [cs.AI, cs.CL, cs.CY, cs.HC]目的:AIシステムのシステムプロンプトの体系的な監査
- AI技術の社会実装が拡大する中,その安全性と信頼性の確保が不可欠である。
- システムプロンプトは不透明性が高く,開発者による操作の余地が大きいため,潜在的なリスクが存在する。
- システムプロンプトの透明性向上と,ユーザー保護の観点からの評価基準を確立すること。
- 本研究では,88の商用AI製品から3,249のシステムプロンプト命令を分析し,ユーザー保護と問題点に分類した。
- システムプロンプトのデザインには大きなばらつきがあり,保護命令の数も製品・開発者間で大きく異なることが明らかになった。
- 多くの製品が保護命令を含んでいるものの,その範囲は限定的であり,問題のある命令も依然として存在する。
