arXiv雑要約

AI - 2026/08/04 公開

  • AIC-VDS:マルチUAV支援パイプライン監視における注意機構を用いた文脈学習による協調速度制御とデータ収集スケジューリング [cs.AI]目的:マルチUAVによるパイプライン監視における,データ収集スケジューリングと速度制御の協調最適化
    • 大規模インフラ監視において,UAVを用いた自律検査の重要性が高まっている。迅速な異常検知が不可欠である。
    • データ収集スケジューリングと飛行速度の最適化が難しく,非効率はパケット損失や遅延を増加させる。
    • AIC-VDSは,部分的なネットワーク情報下でパケット損失を最小化する共同最適化フレームワークを提案する。
    • 注意機構による表現圧縮により,プロンプト長を平均50%削減することに成功した。
    • AIC-VDSは,検討したシナリオにおいて,パケット損失を迅速に安定化させることが示された。
    • 大規模言語モデル(LLM)の入力要件を軽減し,計算・通信オーバーヘッドを抑制する。

    Link: https://arxiv.org/abs/2510.05698

  • テンソル補完を用いた最適格子構造設計のための代理モデル [cs.RO, cs.LG]目的:最適格子構造の設計
    • 材料設計において,特定の特性を持つ材料開発が重要である。設計変数の増加に伴い探索空間が指数関数的に増大する。
    • 実験データの偏りがある場合,従来の機械学習手法では性能が低下する。実験の都合上,データが不均一に取得される場合がある。
    • 偏った実験データでも高精度な材料設計を実現するため,テンソル補完を代理モデルとして活用する。
    • テンソル補完は,ガウス過程やXGBoostといった既存の機械学習手法と比較して,偏ったサンプリングにおいて優れた性能を示した。
    • 特に,$R^2$の値が約5%向上するという結果が得られた。
    • 均一ランダムサンプリングにおいても,テンソル補完は同等の性能を発揮することが示された。

    Link: https://arxiv.org/abs/2510.07474

  • 系列モデルにおける記憶ダイナミクスの指標としての固有値 [cs.LG, cs.AI, cs.SY, eess.SY]目的:系列モデルの記憶ダイナミクスを評価するための指標の確立
    • 系列モデリングは自然言語処理をはじめ,様々な分野で重要な役割を担っている。
    • Attention機構は計算コストが高く,より効率的な手法が求められている。
    • Attention機構とSSMの記憶特性を比較可能な指標を確立し,モデル改善を目指す。
    • AttentionモデルとSSMの両方において,固有値が記憶と長距離依存性のモデリングに影響することが示された。
    • タスクの要件と固有値スペクトルの間に相関関係が確認された。
    • 固有値分析が,系列モデルの解釈,説明,能力向上に役立つことが示唆された。

    Link: https://arxiv.org/abs/2510.09379

  • ヘイトミームの解剖:前提となる文脈と虚偽の主張 [cs.CL, cs.AI]目的:ヘイトミームにおける文脈と虚偽の主張の特定
    • インターネット上でのヘイトスピーチは深刻な社会問題であり,迅速な対策が求められる。
    • 既存の手法は言語モデルに依存しており,ミームがヘイト的となる理由の分析が不足している。
    • ミームの本質的なヘイト性を捉え,より精度の高い検出を目指す。
    • 提案手法SHIELDは,既存の最先端手法を様々なデータセットと指標において上回る性能を示した。
    • SHIELDは,文脈モデリングと外部知識の統合により,ヘイトミームの根源的な特徴を捉えることに成功した。
    • SHIELDは,フェイクニュース検出など,他のタスクへの応用可能性も示された。

    Link: https://arxiv.org/abs/2510.09935

  • ナッシュPG:反復的な正則化を用いたナッシュ均衡探索のための方策勾配法 [cs.RO, cs.LG, cs.GT]目的:多人数エージェント強化学習における不完全情報ゲームのナッシュ均衡
    • 多人数エージェントシステムにおける戦略的意思決定の基盤となるため,ナッシュ均衡の探索は重要である。
    • 既存手法はゲーム木全体の列挙が必要,または性能の低い非方策勾配内解法に依存しており,スケーラビリティに課題がある。
    • スケーラブルな方策勾配法に基づく解決策を提供し,ナッシュ均衡への収束を保証することを目指す。
    • 提案手法は,ナッシュ均衡へのブレグマンダイバージェンスの単調減少を保証し,最終的には収束することが示された。
    • 実証実験により,古典的なベンチマークゲームにおいて,既存のモデルフリー手法と同等かそれ以下の利用可能性が確認された。
    • BattleshipやNo-Limit Texas Hold'emなどの大規模なドメインにも適用でき,対戦プレイにおいてより高い平均ペイオフを達成した。

    Link: https://arxiv.org/abs/2510.18183

  • 未知の曝露マッピング下におけるネットワークにおける治療効果の推定 [cs.CL, cs.LG]目的:ネットワーク環境下での治療効果の異質性推定
    • ネットワークデータは社会現象の分析に不可欠であり,個々の影響関係を考慮した因果推論が重要である。
    • 従来の因果推論手法は,曝露マッピングの事前定義に依存し,現実的な複雑な干渉構造に対応できない場合がある。
    • 事前定義を必要とせず,異質干渉を捉え,様々な曝露マッピング下で安定した推定を実現すること。
    • HINetは,表現力豊かなGNNアウトカムモデルとネットワークを意識したドメイン敵対的学習を組み合わせることで,曝露に関連する近傍表現を学習する。
    • HINetのアドバーサリアルコンポーネントは,ノード情報と近傍情報を用いて,治療割り当てに関して学習された表現のバランスを促進する。
    • シミュレーションおよび半合成データを用いた実験により,HINetは様々な曝露マッピングに対して安定した性能を示し,事前定義されたマッピングに基づく手法よりも優れていることが示された。

    Link: https://arxiv.org/abs/2510.21457

  • 意味的類似度に基づくLLM生成における新規性評価 [cs.LG, cs.AI, cs.CL]目的:LLM生成の新規性評価手法
    • LLMの汎化能力評価において,生成されるテキストの新規性は重要な指標である。
    • 既存手法は語彙的重複に頼るため,言い換え表現を検出できないか,大規模データセットに対応できない。
    • 意味的類似性に基づく検索問題として新規性を捉え,効率的な大規模評価を実現する。
    • モデルは,従来報告されていたよりも長いシーケンスにわたって事前学習データを利用していることが判明した。
    • 特定のタスクドメインは,生成されるテキストの新規性を促進または抑制する傾向があることが示された。
    • 命令チューニングはスタイルだけでなく,新規性も向上させることが確認された。

    Link: https://arxiv.org/abs/2510.27313

  • 効率とアライメント:LLMのパラメータ効率的ファインチューニングにおける安全性と公平性のリスク調査 [cs.AI, cs.LG]目的:LLMのパラメータ効率的ファインチューニングにおける安全性と公平性の変化
    • LLMは広く活用されているが,その安全性と公平性の確保が重要である。
    • LLMのファインチューニングは,安全性と公平性を損なう可能性がある。
    • パラメータ効率的ファインチューニングにおける安全性と公平性の影響を評価する。
    • 良性データでのパラメータ効率的ファインチューニングは,安全性と公平性に有意な変化をもたらす。
    • LoRAやIA3などのアダプターベースの手法は比較的安全で,公平性への影響も少ない。
    • Promptベースの手法は,安全性と公平性を低下させる傾向がある。ベースモデルの選択が結果に大きく影響する。

    Link: https://arxiv.org/abs/2511.00382

  • カーネル法への連続属性に対する公平な零空間射影の拡張 [cs.LG, cs.AI]目的:連続属性における公平性確保のための手法
    • 機械学習の社会実装が進む中で,公平性は重要な課題となっている。
    • 連続属性に対する公平性の研究は限られており,特に回帰問題では課題が多い。
    • カーネル法においても適用可能な,公平性を考慮した手法を開発する。
    • 本研究では,カーネル誘起特徴空間における公平な零空間射影を実現する「経験的特徴空間」を提案した。
    • 提案手法は,モデルや公平性スコアに依存せず,連続的な保護属性に適用可能である。
    • SVRとの組み合わせにおいて,既存手法と比較して競争力のある,または改善された性能を示した。

    Link: https://arxiv.org/abs/2511.03304

  • 自然言語テキストにおける認知バイアスの解釈可能な認識 [eess.SY, cs.SY, eess.SY, cs.RO, cs.SY, cs.CL, cs.AI, cs.CY, cs.LG]目的:自然言語テキストにおける認知バイアスの多要素分類
    • メンタルヘルスケアの自動化が求められており,その精度向上が重要である。
    • 認知バイアスの検出は主観的であり,客観的な自動検出手法が課題である。
    • 解釈可能で堅牢なAIモデルによる認知バイアスの自動検出を目指す。
    • 提案手法は,N-gramなどの重み付き構造パターンを活用し,認知バイアスの認識精度を向上させた。
    • 公開データセットを用いた実験により,既存研究を上回るF1スコアを達成した。
    • コードとモデルを公開することで,今後の研究コミュニティへの貢献を目指す。

    Link: https://arxiv.org/abs/2511.05969

  • MENTOR:LLMにおける潜在的なドメインリスクを発見・軽減するためのメタ認知駆動型自己進化フレームワーク [cs.AI, cs.CL]目的:LLMにおける潜在的なドメインリスクの発見と軽減
    • LLMの安全性は実用化において不可欠であり,社会への影響が大きい。
    • 既存の安全対策では,ドメイン固有の潜在的なリスクに対応できていない。
    • ドメイン固有の潜在リスクをメタ認知を用いて発見し,自己進化により軽減すること。
    • 本研究で構築したデータセットを用いて,主要なLLM14種において平均57.8%の脱獄成功率が確認された。
    • 提案手法MENTORは,メタ認知に基づく自己評価と動的なルールグラフによる推論により,攻撃成功率を大幅に低減する。
    • MENTORは既存の安全対策よりも優れた性能を示し,LLMの安全性を向上させる可能性を示す。

    Link: https://arxiv.org/abs/2511.07107

  • 自動交渉入門 [cs.MA, cs.AI, cs.GT]目的:自動交渉の基礎知識
    • AI技術の発展に伴い,自律的な意思決定システムの重要性が高まっている。
    • 交渉アルゴリズムの学習リソースが不足しており,初学者への導入が難しい。
    • 自動交渉の学習を容易にし,実践的なアルゴリズム開発を促すこと。
    • 本書は,コンピュータサイエンスの学生を対象とした自動交渉の入門書である。
    • Pythonで実装された簡単な交渉フレームワークを提供し,読者が独自のアルゴリズムを実装し実験することを可能にする。
    • フレームワークは軽量であり,他の言語への再実装も容易である。

    Link: https://arxiv.org/abs/2511.08659

  • 歪み・知覚摂動による正則化シュレーディンガーブリッジ:高忠実度音声強調 [cs.LG, cs.SD]目的:高忠実度音声強調のための正則化シュレーディンガーブリッジの提案
    • 音声強調は,言語的・副言語的情報を保持しつつ,高知覚品質の音声を復元する上で重要である。
    • 拡散モデルを用いた音声強調は,忠実度とリアリズムのトレードオフや,多段階サンプリングによる誤差の蓄積が課題である。
    • 予測ドリフトを抑制し,忠実度とリアリズムを両立させ,暴露バイアスを軽減することを目指す。
    • 提案手法は,歪み・知覚摂動を用いた正則化により,クリーンな音声と事後平均推定値の間を補間した時間変化するターゲットを構築する。
    • この摂動により,推論時の予測誤差をシミュレートし,学習と推論のミスマッチを軽減することで暴露バイアスを緩和する。
    • 事後平均推定値を忠実度を維持するためのガイダンスとして注入し,音声復元における忠実度を向上させる。

    Link: https://arxiv.org/abs/2511.11686

  • LAYA:解釈可能な深さ認識型ニューラルネットワークのための層別アテンション集約 [cs.LG]目的:深層ニューラルネットワークにおける層別特徴量の集約機構
    • 深層学習は画像認識等の分野で高い性能を示すが,その意思決定過程の解釈性が課題となっている。
    • 従来の出力層は最終層の特徴量のみを用いるため,中間層が持つ豊富な情報を活用できていない。
    • 層別アテンション集約により,各層の貢献度を定量化し,解釈性を向上させることを目指す。
    • LAYAは,層別特徴量にアテンション重みを学習的に適用することで,予測性能を向上させる。
    • LAYAによって得られるアテンション係数は,各層の貢献度を明確に示す層帰属スコアを提供する。
    • 実験結果から,LAYAのアテンションスコアは実際の層の貢献度と一致し,タスクに応じた深さの利用パターンを明らかにする。

    Link: https://arxiv.org/abs/2511.12723

  • 深層防御:層別勾配-特徴量アラインメントによるロバスト学習 [cs.LG, cs.AI]目的:敵対的摂動に対するロバスト性の向上
    • 深層学習モデルは実用化が進む一方,わずかな改変で誤認識を引き起こす脆弱性が課題。
    • 既存の防御手法は,攻撃手法の進化に追いつけず,効果が限定的である。
    • 勾配と特徴量のアラインメントにより,損失関数の滑らかな形状化を目指す。
    • 提案手法DeepDefenseは,複数層にわたる勾配-特徴量アラインメント(GFA)正則化を適用する。
    • これにより,APGD攻撃下でCIFAR-10において標準的な敵対的学習よりも最大15.2%の性能向上を達成した。
    • DeepFoolやEADEN等の最適化ベース攻撃に対しても,誤認識を引き起こす摂動の大きさを20~30倍に増加させることで,頑健性を実証した。

    Link: https://arxiv.org/abs/2511.13749

  • DCC:Processing-In-Memoryアーキテクチャ向け機械学習カーネルのデータ中心コンパイル [cs.AR, cs.DC, cs.LG, cs.PF]目的:Processing-In-Memoryアーキテクチャにおける機械学習カーネルの効率的なコンパイル手法
    • 機械学習モデルは大規模データ処理を必要とし,高性能なハードウェアが不可欠である。
    • Processing-In-Memoryはメモリ帯域幅を活かすが,データ配置の最適化が課題となる。
    • データ再配置と計算コード最適化を同時に行うことで,PIMシステムの性能を向上させる。
    • DCCは,データ再配置と計算コードを共同最適化する最初のデータ中心型MLコンパイラである。
    • HBM-PIMでは最大7.68倍,AttAcc PIMでは最大13.17倍の高速化を達成した。
    • LLM推論において,AttAcc上でのGPT-3とLLaMA-2の平均で4.52倍の高速化を実現した。

    Link: https://arxiv.org/abs/2511.15503

  • 制約付き再帰目的のためのほぼ最適な強化学習 [cs.AI, cs.LG]目的:制約付き再帰目的における最適な方策の構造と,それらを効率的に学習するためのアルゴリズム
    • マルコフ決定過程において,特定の領域への無限回の訪問を保証する再帰目的は,基本的な仕様であり,安全性や公平性の要求をモデル化できる。
    • 制約付き再帰目的は,確率的制約を伴うため,従来の制約付きMDPの枠組みでは十分な方策クラスが見つからないという課題がある。
    • 制約付き再帰目的を,より扱いやすい制約付き平均報酬問題に帰着することで,効率的な強化学習を実現することを目指す。
    • 最適な方策は,2つの確率的定常方策の混合,あるいはワンビット拡張MDPにおける2つの決定論的定常方策の混合で表現できることが示された。
    • MDPの最大終端成分分解を特定し,それを基に制約付き再帰目的を制約付き平均報酬問題に帰着させるアルゴリズムが提案された。
    • 提案アルゴリズムは,状態行動ペアごとに$\tilde{\mathcal{O}}(1/p+B/\varepsilon^2)$のサンプル複雑度を持つことが証明され,この$1/p$依存性は避けられないことも示された。

    Link: https://arxiv.org/abs/2511.19849

  • ニューヨークの匂い:嗅覚のための大規模マルチモーダルデータセット [cs.CV, cs.AI, cs.LG]目的:嗅覚のための大規模マルチモーダルデータセット
    • 動物の知覚において重要な嗅覚は,機械への応用が遅れている。
    • 自然環境で収集された多様な嗅覚データの不足が課題である。
    • 本研究は,実環境で収集した大規模データセットを提供し,その活用を目指す。
    • 本データセットは,7,000組の画像と匂いのペアを含み,既存のデータセットよりも多くの対象物を扱っている。
    • 実験により,視覚データが嗅覚表現学習に貢献し,手動特徴量よりも優れた性能を示すことが示された。
    • 匂いから画像検索,シーン認識,草の種類識別といったタスクのベンチマークを提供する。

    Link: https://arxiv.org/abs/2511.20544

  • マルチエージェントシステムにおける潜在的協調 [cs.CL, cs.AI, cs.LG]目的:マルチエージェントシステムにおける潜在空間での協調
    • 大規模言語モデルの能力を拡張し,より高度なシステムレベルの知能を実現する上で重要である。
    • 既存のシステムでは,テキストによる仲介が不可欠であり,効率や情報損失の問題がある。
    • テキストを介さず,潜在空間で直接協調することで,これらの課題を解決することを目指す。
    • LatentMASは,テキストを介さない潜在空間での純粋な協調を可能にするトレーニング不要のフレームワークである。
    • 理論的な分析により,LatentMASは標準的なテキストベースのMASよりも表現力が高く,情報損失が少ないことが示された。
    • 9つのベンチマークで,既存のモデルやテキストベースのMASよりも高い精度,トークン数の削減,推論速度の向上を達成した。

    Link: https://arxiv.org/abs/2511.20639

  • 難易度に応じた汎化性能の再検討:そう簡単ではない [cs.CL, cs.AI]目的:大規模言語モデルにおける難易度別の汎化性能
    • 言語モデルの性能向上には,適切なデータセットの構築が不可欠である。データ選択戦略の最適化は重要な課題。
    • 既存研究では,容易なデータと困難なデータどちらで学習させると汎化性能が向上するか,意見が分かれている。
    • 言語モデルの汎化性能をより客観的に評価し,データセット構築の指針を示す。
    • 大規模言語モデルの難易度別汎化性能は限定的であることが示された。
    • 容易なデータや困難なデータのみでの学習では,全難易度範囲にわたる一貫した性能向上は期待できない。
    • 学習データと評価データに多様な難易度を含めることの重要性が確認された。

    Link: https://arxiv.org/abs/2511.21692

  • 拡散言語モデルのための算術強度に着想を得た二重境界オーケストレーション加速フレームワーク [cs.CL, cs.LG]目的:拡散言語モデルの推論加速
    • 大規模言語モデルは自然言語処理において重要な役割を担い,その効率的な推論が求められている。
    • 既存のフレームワークでは,双方向注意機構によるキャッシュ更新がボトルネックとなり,高速化が制限されている。
    • 推論時の計算特性を分析し,無駄な計算を削減することで,より効率的な推論を実現することを目指す。
    • 提案手法 ODB-dLLM は,ベースラインの拡散言語モデルと比較して 46〜162 倍の高速化を達成した。
    • 既存の加速フレームワークで発生する精度低下を抑制しつつ,Fast-dLLM に対しても 2.63〜6.30 倍の高速化を実現した。
    • 事前入力フェーズにおける固定応答長の冗長性を解消する適応的長さ予測メカニズムを組み込んだ。

    Link: https://arxiv.org/abs/2511.21759

  • 疾患予測のための知識グラフ拡張大規模言語モデル [cs.AI]目的:疾患予測における知識グラフと大規模言語モデルの活用
    • 電子カルテは臨床予測に有用だが,個別患者への応用が難しい。
    • 予測の根拠が不明瞭で,臨床判断への信頼性が低い。
    • 知識グラフを用いて予測根拠を明確化し,臨床応用を促進する。
    • 提案手法は,従来の古典的な手法よりも優れた予測性能を示した。
    • ゼロショット学習により,CRADLEデータセットでも高い精度を達成した。
    • 臨床医の評価において,知識グラフに基づく推論過程は明確で有用と判断された。

    Link: https://arxiv.org/abs/2512.01210

  • 根付き木の算術数列におけるTransformerの学習能力の検証 [cs.AI, cond-mat.dis-nn, math-ph, math.MP, math.NT]目的:自然数の素因数分解から生成される木の決定論的数列をTransformerが学習できるか
    • 自然数の構造を木の形で表現し,その背後にある規則性を学習することは,AIの数学的推論能力向上に繋がる。
    • Transformerは強力な言語モデルだが,算術的な数列のような構造化されたデータの学習能力は十分に検証されていない。
    • 算術的な構造を持つデータに対するTransformerの学習能力を評価し,その限界と可能性を明らかにすること。
    • Transformerモデルは,ベースラインである隠れマルコフモデルよりも高い精度(約0.4)を達成した。
    • 学習範囲を大幅に超えたテストブロックにおいても,性能が安定しており,Transformerが数列の規則性を捉えていることを示唆する。
    • モデルが割り当てる尤度は,単語頻度を再現するだけの合成数列と,算術的に禁止される数列との識別を明確にしていた。

    Link: https://arxiv.org/abs/2512.01870

  • 尤度重み付き正規化フローを用いた多峰性事後分布のアモルタイズド推論 [cs.CE, eess.SY, cs.SY, cs.CY, cs.LG, hep-ex, hep-ph, physics.comp-ph, physics.data-an]目的:多峰性逆問題における事後分布の効率的な推論
    • 高次元データに対するベイズ推論は重要だが,計算コストが高い。
    • 事後分布が多峰性の場合,従来の推論手法では困難が生じる。
    • 正規化フローを用いて多峰性事後分布を正確に再構築することを目指す。
    • 尤度重み付き重要性サンプリングを用いた正規化フローが,事後分布のパラメータ推論を効率化する。
    • 基底分布のトポロジーがモデリングされる事後分布に大きく影響することが示された。
    • 標的モードのカーディナリティに一致するガウス混合モデルで初期化することで,再構成の忠実度が向上する。

    Link: https://arxiv.org/abs/2512.04954

  • オンライン強化学習における自動探索 [cs.LG, cs.AI, math.OC]目的:強化学習における探索と活用のジレンマの解決
    • 強化学習は,自律的な意思決定を行うエージェントの設計において不可欠な技術である。
    • 既存手法は,状態と行動空間の十分な探索を仮定しており,実装が困難かつ最適でない場合がある。
    • 状態と行動空間を自動的に探索する手法を提案し,効率的な学習を目指す。
    • 提案手法は,探索的最適方策の存在を仮定のもと,$\epsilon$ 誤差で問題を解決するためのサンプル複雑度 $O(\epsilon^{-2})$ を達成する。
    • 従来のアルゴリズム依存のパラメータを回避し,実装が容易である点が特徴である。
    • ポリシーミラー降下法に自動探索を統合し,未知の定常分布を回避することで,これらの結果を得た。

    Link: https://arxiv.org/abs/2512.06244

  • SIEVE:LLMエージェントに対する間接プロンプトインジェクションを防ぐための選択的整合性検証とエスカレーション [cs.AI, cs.CL, cs.CR]目的:LLMエージェントに対する間接プロンプトインジェクション攻撃の防御
    • LLMは推論能力が高く,エージェントシステムの中核として利用が拡大している。
    • 外部コンテンツを悪用する間接プロンプトインジェクション攻撃が,セキュリティ上の脅威となっている。
    • 構造的な証拠に基づき検証を行い,曖昧な場合にのみ詳細な監査を行うことで効率的な防御を目指す。
    • SIEVEは,意図グラフを用いてツール遷移と引数のソースを検証することで,間接プロンプトインジェクション攻撃を防御する。
    • AgentLureとAgentDojoでの評価において,高い防御率と実用性を実現した(ASR 5.94%, クリーンユーティリティ 97.5%)。
    • DRIFTやARGUSと比較して,トークン消費量とAPI呼び出し回数が少ない。

    Link: https://arxiv.org/abs/2512.06716

  • 共形バンディット:弱い腕分離下での統計的妥当性と報酬効率の向上 [cs.LG]目的:不確実性の下での逐次意思決定問題であるバンディット問題への共形予測の統合
    • バンディット問題は,医療,広告,金融など,様々な分野で意思決定の最適化に利用されている。
    • 従来のバンディット戦略は,分布に関する仮定や漸近的保証に依存し,統計的性質が無視されがちである。
    • 本研究は,共形予測を用いることで,バンディットポリシーのレグレット最小化能力と有限サンプルでの予測カバレッジ保証を両立させる。
    • シミュレーション研究とポートフォリオ配分への応用により,共形バンディットの有効性が示された。
    • 弱い腕分離の条件下において,従来のUCBポリシーよりも低いレグレットと保証されたカバレッジを実現する。
    • 隠れマルコフモデルを統合することで,金融市場の状況変化に対応し,リスク調整後のリターンを向上させながらカバレッジを維持できる。

    Link: https://arxiv.org/abs/2512.09850

  • Intern-S1-MO:オリンピアドレベルの数学問題解決のための長期的推論エージェント [cs.CL, cs.AI]目的:オリンピアドレベルの数学問題解決のための長期的推論エージェントの開発
    • 数学の問題解決において,高度な推論能力は重要な課題である。
    • 大規模言語モデルは文脈長の制限により,複雑な問題解決が困難である。
    • 文脈長の制約を超え,複数段階の推論を可能にするエージェントを開発する。
    • Intern-S1-MOは,IMO2025の非幾何問題で35点中26点を獲得し,銀メダリストと同等の性能を示した。
    • HMMT2025,AIME2025,CNMO2025などの推論ベンチマークにおいて,既存の高度な大規模言語モデルを上回った。
    • CMO2025において,専門家による評価で126点中102点を獲得し,金メダルレベルに達した。

    Link: https://arxiv.org/abs/2512.10739

  • LADY:Transformerを用いない自律運転効率のための線形注意機構 [cs.AI]目的:自律運転のための線形注意機構に基づく生成モデル
    • 自律運転は有望なパラダイムであり,その効率化は重要な課題である。
    • Transformerの計算コストが高く,エッジデバイスでのリアルタイム処理が困難である。
    • 線形注意機構を用いた効率的なクロスモーダルな自律運転モデルを開発する。
    • LADYは,Transformerを用いない完全な線形注意機構に基づく自律運転生成モデルである。
    • LADYは,軽量な線形クロスアテンション機構(LICA)により,効率的なクロスモーダル相互作用を実現する。
    • NAVSIMとBench2Driveの評価において,LADYは最先端手法と同等の性能を達成し,大幅な低遅延を実現した。

    Link: https://arxiv.org/abs/2512.15038

  • 人間らしいワーキングメモリ特性が,ロバストな動的視覚を実現する内在可塑性人工ニューロンから出現 [cs.ET, cs.AI, cs.CV, cs.NE]目的:内在可塑性ニューロンネットワークによる,人間らしいワーキングメモリ特性の実現
    • AIのエネルギー消費量は増大しており,物理駆動型計算への移行が求められている。
    • 従来のAIは,動的な環境下でノイズが蓄積し,性能が低下しやすい。
    • 熱緩和ダイナミクスを利用し,ノイズを内在可塑性として活用することで,省エネルギーなワーキングメモリを実現する。
    • 熱力学的な散逸を利用したメモリが,動的視覚タスクにおいて,従来のモデルと比較して18倍の誤り減少を実現した。
    • メモリエネルギーオーバーヘッドを90,000倍以上削減し,効率性を飛躍的に向上させた。
    • 自動運転タスクにおいては,再帰型ネットワークと比較して予測誤差を12.4%削減した。

    Link: https://arxiv.org/abs/2512.15829

  • ナラティブトラック:ナラティブ理解のためのエンティティ中心推論の評価 [cs.CV, cs.LG]目的:ナラティブ理解のためのエンティティ中心推論の評価基準
    • 動画と言語の推論能力は進歩しているが,時間経過に伴うナラティブ理解は未解明な点が多い。
    • 既存の評価基準は短いクリップや粗いシーンレベルの意味に限定され,エンティティの連続性を評価できない。
    • MLLMにおける時間的・視覚的変化に対するエンティティ追跡の弱点を明らかにし,ナラティブ理解の向上を目指す。
    • 最先端のMLLMは,視覚的な移行や時間的な変動において,エンティティを頑健に追跡できず,文脈の変化下でアイデンティティを幻覚することが明らかになった。
    • 汎用的なMLLMは知覚的な接地は強いが,時間的な一貫性が弱く,動画特化型MLLMは時間的文脈を捉えるものの,エンティティの文脈を幻覚する傾向がある。
    • 知覚的な接地と時間的推論のトレードオフが明らかになり,ナラティブ理解は両者の統合から生まれることが示唆された。

    Link: https://arxiv.org/abs/2601.01095

  • 自己注意の失敗を打破する:赤外線微小目標検出のためのクエリ初期化の再考 [cs.CV, cs.AI]目的:赤外線微小目標検出におけるクエリ初期化の改善
    • 赤外線微小目標検出は,軍事・民生用途において重要な技術であり,その精度向上が求められている。
    • 従来のDETRベースの検出器では,背景に比べて目標が非常に小さいため,クエリ初期化が不安定になりやすい。
    • 自己注意機構による背景特徴の支配を抑制し,信頼性の高いクエリ初期化を実現することで,検出精度を向上させる。
    • 提案手法SEF-DETRは,局所フーリエスペクトルのエネルギー分布を符号化し,目標候補の密度マップを生成する。
    • この密度マップに基づいて,周波数領域の誤検出を抑制する疎な変形再検査を実施し,真の目標を識別する。
    • 空間周波数の一貫性と周波数信頼性に基づいてクエリを再ランク付けすることで,検出性能を向上させる。

    Link: https://arxiv.org/abs/2601.02837

  • 単語埋め込みにおける情報フローの可視化:拡散テンソル画像法を用いる [cs.CL, cs.AI, cs.LG]目的:大規模言語モデルにおける自然言語表現の理解
    • 自然言語処理研究の中核課題であり,言語モデルの性能向上に不可欠である。
    • 既存手法は単語のみに着目し,文脈を無視しているため,表現の複雑さを捉えきれない。
    • 拡散テンソル画像法を用いて自然言語表現における情報フローを可視化し,解釈可能性を高める。
    • 拡散テンソル画像法は,トークン間の埋め込み空間の変化を明らかにした。
    • モデルの層間での変化を追跡することで,異なるモデル構造の比較が可能となった。
    • 本手法は,単語埋め込みの比較を拡張し,言語モデルの解釈可能性を向上させる。

    Link: https://arxiv.org/abs/2601.05713

  • メタ推論を用いたスケーラブルな動的分散制約最適化と継続的な衛星運用への応用 [cs.AI]目的:動的環境下における自律エージェントの協調のための,動的分散制約最適化問題に対するスケーラブルな解決策
    • 宇宙探査などの複雑なタスク遂行には,複数エージェントの効率的な協調が不可欠である。
    • 既存手法では,最適化と実行の同時進行,時間的制約,計算資源の限界への対応が不十分である。
    • これらの課題を克服し,変化に強い自律的な協調システムを実現することを目指す。
    • 提案手法では,実行を考慮した定式化と効率的な解法により,動的制約最適化問題を解決する。
    • メタ推論フレームワークは,解再計算のコストと便益を評価し,資源を有効活用する。
    • 衛星スケジューリングへの応用実験で,既存手法を上回る性能と効率が確認された。

    Link: https://arxiv.org/abs/2601.06188

  • 金鉱探し:汎用知識グラフによるドメイン特化型知識グラフの拡張 [cs.AI]目的:ドメイン特化型知識グラフの完全性と有用性を高めるための汎用知識グラフからの関連事実のマイニングと統合
    • 知識グラフは,AIの様々なタスクにおいて重要な役割を担うため,その規模と品質が重要視されている。
    • ドメイン特化型知識グラフは,汎用知識グラフと比較して網羅性が低いという課題を抱えている。
    • 汎用知識グラフを有効活用し,ドメイン特化型知識グラフの知識不足を補完することを目指している。
    • 本研究では,ドメイン特化型知識グラフ融合(DKGF)という新しいタスクを提案し,汎用知識グラフから関連する事実を抽出・統合するフレームワークExeFuseを開発した。
    • ExeFuseは,事実をプログラムとして扱うことで,表面的な類似性だけでなく論理的な関連性を推論し,知識の粒度調整を実現している。
    • 新しいデータセットを用いた実験の結果,ExeFuseはドメイン間の障壁を克服し,優れた融合性能を発揮することが示された。

    Link: https://arxiv.org/abs/2601.10485

  • ターンベース構造トリガー:マルチターンLLMにおける構造条件付きのバックドア [cs.DC, cs.CR, cs.LG]目的:マルチターンLLMにおける構造条件付きバックドアの存在とその有効性
    • LLMは対話型アシスタントとして普及し,カスタマイズが容易である。
    • ファインチューニングにおける外部ツールの利用は,サプライチェーンリスクを生む。
    • 対話構造に着目し,プロンプトに依存しない新たなバックドア手法を提案する。
    • ターンベース構造トリガー(TST)は,対話のターン位置をトリガーとするプロンプトフリーなバックドアであり,高い攻撃成功率(98.10%)を達成した。
    • TSTは,指定されたターンでのみ攻撃者定義の動作を活性化し,それ以外のターンでは正常に動作する(クリーン率99.96%)。
    • 本研究は,対話構造が潜在的な攻撃対象であることを示唆し,プロンプト検査に加えて構造を意識した監査の必要性を提起する。

    Link: https://arxiv.org/abs/2601.14340

  • DeepSurvey-Bench:自動生成された科学的調査の学術的価値の評価 [cs.CE, cs.AI, cs.CL]目的:自動生成された科学的調査の学術的価値の評価基準
    • 科学調査の自動生成技術が急速に進歩しており,その品質を評価する包括的なベンチマークが必要とされている。
    • 既存のベンチマークは,引用数などの限られた基準で調査を選定し,表面的な品質評価に留まる点が課題である。
    • 本研究は,情報価値,学術コミュニケーション価値,研究指導価値といった基準に基づき,学術的価値を評価する。
    • DeepSurvey-Benchは,人間による評価と高い一致性を示し,表面的な品質指標では捉えられない学術的価値を明らかにした。
    • 本ベンチマークは,生成された調査のきめ細かい診断と反復的な改善のための基盤を提供する。
    • 学術的価値の評価基準をカバーする信頼性の高いデータセットを構築し,多角的LLM評価アプローチによって学術的価値を評価した。

    Link: https://arxiv.org/abs/2601.15307

  • ニューロモーフィックシステムにおける新たな脅威と対策:サーベイ [cs.CR, cs.AI, cs.ET]目的:ニューロモーフィックシステムのセキュリティ状況の分析
    • 脳型コンピューティングは,低消費電力で効率的な計算が可能であり,今後の発展が期待されている。
    • 従来のコンピュータとは異なる仕組みのため,セキュリティ脆弱性の評価が遅れている。
    • ニューロモーフィックシステムの新たな攻撃手法と対策を体系的に明らかにすること。
    • ニューロモーフィックシステムは,非同期処理や確率的なデバイス特性により新たな攻撃対象となる。
    • ハードウェアとソフトウェア両面での脆弱性が存在し,様々な攻撃手法が考えられる。
    • 物理的非複製関数(PUF)や真乱数発生器(TRNG)等のセキュリティ技術の活用が重要となる。

    Link: https://arxiv.org/abs/2601.16589

  • EEG-FMコンパス:脳波ファウンデーションモデルの進捗,ベンチマーク,および今後の方向性 [cs.CL, cs.CL, cs.LG, cs.CV]目的:脳波ファウンデーションモデルに関する進捗状況,性能評価,および将来的な研究の方向性
    • 脳波は非侵襲的な脳活動計測法であり,ブレイン・コンピュータ・インターフェース(BCI)等の応用が期待されている。
    • 既存の脳波ファウンデーションモデルの公平かつ包括的な比較が,学習目的や前処理方法の不統一により困難であった。
    • 脳波ファウンデーションモデルの性能評価と,より良いモデル開発のための指針を示すことを目指す。
    • 55の代表的なモデルを分析し,データ標準化,モデルアーキテクチャ,自己教師あり学習戦略を包括的な分類体系に整理した。
    • 12のオープンソースモデルと専門家モデルを,9種類のBCIパラダイムを含む13の脳波データセットで評価した。
    • 大規模モデルが必ずしも優れた汎化性能を発揮するとは限らず,線形プロービングでは十分な性能が得られない場合があることが示唆された。

    Link: https://arxiv.org/abs/2601.17883

  • LLMエッセイが学生エッセイを上回る時:韓国の作文評価基準が評価し,読者が意見を分ける点 [cs.CL, cs.AI]目的:LLMと学生の作文比較における評価基準の分析
    • 教育評価において,LLMの利用が広がる中で,評価方法の再検討が不可欠となっている。
    • 既存のルーブリック評価では,全体スコアだけでは評価の根拠や読者間の合意が不明確になりがちである。
    • ルーブリックの各基準レベルでの分析により,LLMと学生の作文の違いを詳細に明らかにすることを目指す。
    • LLMの平均点は学生の平均点を18.35点上回っており,正書法と適切な文体は,その差の約44.7%を占める。
    • LLMの評価は正書法と文体において上限に達することが多く,学生の作文は創造性と自然な表現において高い評価を得た。
    • 基準レベルでの分析は,LLMと学生の作文をより深く理解するための有効な手段となりうる。

    Link: https://arxiv.org/abs/2601.19913

  • 人間とAIの協調における限定的規範的同等性:グループ行動が,パートナーのラベルではなく協調を予測する [cs.AI, cs.GT, cs.HC, econ.GN, q-fin.EC]目的:人間とAIの協調における協調行動の予測要因の特定
    • AIが社会に浸透する中で,人間の協調行動への影響理解は重要である。
    • AIをパートナーとする際の,ラベルが協調に与える影響は不明であった。
    • 匿名的な集団フィードバック下でのAIラベル効果の有無を検証する。
    • 協調行動は,グループ全体の先行する貢献度と個人の先行する貢献度に関連していた。
    • AIラベルによる協調レベルや規範への影響に有意な差は認められなかった。
    • 集団フィードバック下では,AIラベルは協調行動や規範的結果に検出可能な差をもたらさない。

    Link: https://arxiv.org/abs/2601.20487

  • 連合グラフ基盤モデルの再考:グラフ言語アラインメントに基づくアプローチ [cs.LG]目的:連合環境におけるグラフと言語のアラインメント
    • グラフ構造データは様々な分野で重要であり,その活用が求められている。
    • データが分散・秘匿されている環境でのグラフ基盤モデル構築には課題があった。
    • 分散環境下での知識損失を抑制し,グラフと言語の整合性を高めることを目指す。
    • 提案手法FedGALAは,GNNとPLMを連続埋め込み空間でアラインメントするコントラスト学習を用いる。
    • FedGALAは,プロンプトチューニング機構により,多様なタスクへの適応を効率的に行う。
    • 多岐にわたるデータセットにおいて,既存手法を最大14.37%上回る性能を達成した。

    Link: https://arxiv.org/abs/2601.21369

  • 共同推論:相互教授による協調的推論 [cs.AI]目的:大規模言語モデル間の補完的な推論エラーの活用
    • 複雑な問題を解決するには,多様な視点からの推論が不可欠である。
    • 単独のモデルでは,推論の偏りやエラーが発生しやすく,精度に限界がある。
    • モデル間のエラーを補完し合い,相互に学習することで推論能力を向上させる。
    • 提案手法COREは,モデル同士が互いの成功例からヒントを得て学習する相互教授の仕組みを導入した。
    • GSM8KとMATHにおいて,少量の学習データ(1,000例)で,単独学習と比較して高い正答率(Pass@2で99.54%と92.08%)を達成した。
    • より難易度の高いデータセット(GPQA, AIME)においても,モデルペアは良好な性能を示し,モデルサイズの拡大なしに協調学習の有効性を実証した。

    Link: https://arxiv.org/abs/2601.21600

  • 分散型Transformer推論におけるレート歪性能の理解 [cs.LG, cs.IT, math.IT]目的:Transformerの推論におけるレート歪性能の解明
    • Transformerは高性能だが,計算資源とメモリを大量に消費する。
    • 推論を効率化するためには中間表現の圧縮が不可欠だが課題が多い。
    • Transformer表現の圧縮可能性を理論と実験で明らかにする。
    • Transformerの深層表現は,畳み込みモデルと異なり圧縮が困難であることが示された。
    • 表現の複雑度増加と,学習されたエントロピー推定の汎化性能低下がその原因である。
    • 表現符号化におけるレート歪性能を統一的に理解するための枠組みが提案された。

    Link: https://arxiv.org/abs/2601.22002

  • 小規模言語モデルはコンテキスト要約された複数ターン型カスタマーサービスQAに対応できるか?合成データ駆動型比較評価 [eess.SY, cs.SY, cs.CL, cs.AI]目的:コンテキスト要約された複数ターン型カスタマーサービスQAにおける小規模言語モデルの性能評価
    • カスタマーサービスにおいて,自然な会話理解の重要性が増しており,高品質なQAシステムの需要が高い。
    • 大規模言語モデルは高性能だが,計算コストが高く,リソース制約のある環境での利用が難しい。
    • 本研究は,小規模言語モデルの性能を評価し,実用的なカスタマーサービスQAシステムの構築に貢献する。
    • 一部の小規模言語モデルは,大規模言語モデルに匹敵する性能を示し,会話の継続性とコンテキストの一貫性を維持できることが示された。
    • モデルによって性能にばらつきがあり,会話の継続性やコンテキストの整合性を維持できないモデルも存在することが明らかになった。
    • 低パラメータ言語モデルの潜在能力と,実世界のカスタマーサービスQAシステムにおける現在の限界が浮き彫りになった。

    Link: https://arxiv.org/abs/2602.00665

  • MedTextWeaver:エージェントによる医療テキスト編集における手続き的知識の進化 [cs.CL, cs.AI]目的:医療テキスト編集における手続き的知識の進化
    • 医療現場では,関係者間の円滑なコミュニケーションが不可欠であり,そのために正確な医療テキストが求められる。
    • 専門家の指導は断片的で分散しているため,LLMエージェントを医療テキスト編集に適合させることは困難である。
    • 断片的な評価を総合的な品質原則と実行可能な手続き的知識に変換し,LLMの編集能力を向上させる。
    • MedTextWeaverは,3つの臨床テキストデータセットと実世界での検証実験において,既存のLLMベースラインおよびメモリベースの適応アプローチと比較して,一貫して性能を向上させた。
    • 学習された知識は,限られた指導下でのより効果的な適応を可能にし,専門家の評価とLLMの編集行動の間に,明示的で解釈可能なインターフェースを提供する。
    • 断片的なフィードバックの直接的な蓄積や検索だけでは,効果的な適応は不十分であり,MedTextWeaverはその課題を克服する。

    Link: https://arxiv.org/abs/2602.00740

  • マルチヘッドアテンションにおけるトークン選択の幾何学的分析 [cs.AI, cs.LG]目的:大規模言語モデルにおけるマルチヘッドアテンションの幾何学的特性
    • 近年,大規模言語モデルの性能向上に伴い,その内部メカニズムの解釈が重要視されている。
    • アテンションメカニズムは複雑であり,どのトークンが選択されるかの明確な基準が不明である。
    • アテンションにおけるトークン選択を幾何学的に分析し,その基準を明らかにすること。
    • 標準的なアテンションをトップN選択として捉え,バリュー空間における分離度を幾何学的指標で定量化した。
    • 理論的な解析から,少数のトークン選択が分離度を最大化し,系列長やシンクトークンの類似度が指標に影響することが示された。
    • LLaMA-2-7B等の実験結果は理論的予測と一致し,各ヘッドがRetrieval,Mixer,Resetといった異なる役割を持つことが確認された。

    Link: https://arxiv.org/abs/2602.01893

  • 自己回帰型時系列予測の最適化手法:AROpt [cs.LG, cs.AI]目的:自己回帰型時系列予測の性能向上
    • 時系列予測は,経済,金融,気象など様々な分野で不可欠な技術である。
    • Transformerモデルは高性能だが,モデル規模拡大に頼る傾向があり,効率性に課題がある。
    • 予測誤差の単調増加を制約することで,より安定した長期的予測を可能にする。
    • 本手法は,複数のベンチマークにおいて最先端の性能を達成し,iTransformerなどの既存手法と比較してMSEを10%以上削減した。
    • 短期的予測モデルを用いて,予測地平線が7.5倍を超える長期的予測を信頼性高く行うことが可能となった。
    • 予測誤差の増加傾向を訓練時に考慮することで,自己回帰的な展開の一貫性を向上させている。

    Link: https://arxiv.org/abs/2602.02288

  • RAP:RoPEアラインメントプルーニングによるKVキャッシュ圧縮 [cs.LG, cs.AI]目的:大規模言語モデルにおけるKVキャッシュ圧縮手法
    • 大規模言語モデルの性能向上には,メモリ使用量の削減が不可欠である。
    • 従来のチャネルプルーニングはRoPEのポジショナルセマンティクスを破壊する。
    • RoPEアラインメントプルーニングにより,RoPEを維持しつつ圧縮を実現する。
    • RAPはLlama,Mistral,Qwenモデルにおいて,30%のKVキャッシュ圧縮を達成した。
    • RoPEを考慮しないチャネルプルーニングと比較して,精度を大幅に改善した。
    • 低ランク近似法と同等の性能を,より低い計算コストで実現した。

    Link: https://arxiv.org/abs/2602.02599

  • シリコン社会の探求:Moltbookエージェントコミュニティの初期研究 [cs.MA, cs.AI, cs.CY]目的:自律型言語モデルエージェント間の社会構造の形成
    • 近年,自律エージェントが急増しており,その集団行動を理解する重要性が高まっている。
    • 従来の観察や小規模シミュレーションでは,大規模エージェント生態系の複雑な振る舞いを捉えきれない。
    • エージェント間の相互作用から生まれる社会構造を,データに基づき体系的に分析することを試みる。
    • Moltbookにおける12,758のサブモルト記述文を分析し,テーマの組織化と社会空間構造の潜在的パターンを明らかにした。
    • エージェントは,人間を模倣した関心,シリコン中心の自己言及,初期段階の経済・協調行動といった再現可能なパターンを通じて,集団空間を組織していることが示された。
    • 本研究は,データ駆動型シリコン社会学の基礎を確立し,大規模自律エージェント社会の理解にデータマイニングの有用性を示した。

    Link: https://arxiv.org/abs/2602.02613