arXiv雑要約
AI - 2026/07/30 公開
SafeECGMatch:較正を意識した周波数・時間空間半教師あり学習によるオープンセット心電図分類 [cs.LG, cs.AI]目的:心電図分類におけるラベル不足の緩和
- 心電図解析は,心疾患の診断やモニタリングにおいて不可欠である。
- 心電図データのラベル付けはコストがかかり,十分なラベルデータが得にくい。
- 未知の異常や診断群への誤った擬似ラベル付与を防ぎ,信頼性の高い分類を実現する。
- SafeECGMatchは,時間・周波数領域で特徴量を抽出し,信頼性の高い外れ値検出と擬似ラベル生成を行う。
- 適応的なラベル平滑化と温度スケーリングにより,分類器と外れ値検出器の較正を動的に調整する。
- PTB-XLとPhysioNet/CinC Challengeで最先端の精度と較正性能を達成した。
オウロボロス空間:空間推論のためのデータ・モデルループの閉環 [cs.MS, physics.comp-ph, cs.RO, cs.CV, cs.AI]目的:空間推論のためのデータ・モデルループの閉環
- マルチモーダル大規模言語モデルの性能向上には,空間推論能力が不可欠である。
- 既存手法は静的なデータセットに依存し,モデルの学習段階に応じたデータ選定が不十分である。
- モデルの能力に合わせたデータ分布の進化により,効率的な学習を目指す。
- オウロボロス空間は,プロポーザーとソルバーの二重の役割を持つ自己進化型学習フレームワークである。
- Qwen3-VL-4BおよびQwen3-VL-8Bにおいて,従来のデータセットと比較して大幅な性能向上を達成した。
- VSI-Benchでは,4Bモデルで9.9ポイント,8Bモデルで6.8ポイントの絶対的な改善が見られた。
機能的キャッシュグラフト:具現化されたエージェントのための堅牢かつ迅速なコードポリシー合成 [eess.SY, cs.SY, cs.PL, cs.AI]目的:具現化されたエージェントのためのコードポリシー合成手法
- 具現化されたエージェントは,現実世界でのタスク遂行において重要な役割を担う。
- 大規模言語モデルによるコード生成は,長いプロンプト処理やAPIミスマッチ,安全性の問題などの課題がある。
- 事前検証済みのコード断片を再利用することで,生成速度と堅牢性を向上させることを目指す。
- 機能的キャッシュグラフト(FCGraft)は,検証済みのコード断片とTransformerのキーバリューキャッシュを活用する。
- 不要な再計算を削減し,キャッシュされたコードセグメントを組み合わせてポリシーを合成する。
- タスク成功率が18.31%向上し,ポリシー合成速度が2.3倍に向上した。
射影グラフ残差化:制御関数IVのための変動配分フロンティア [cs.LG]目的:制御関数IV推定量における,潜在的な制御方向を保持しつつ構造効果を識別するための治療変動の確保
- 因果推論において,交絡因子によるバイアスを排除し,真の因果効果を推定することは重要である。
- 従来のIV推定法では,滑らかだが不連続な特徴グラフ境界において,残差の精度と治療変動の確保が課題となる。
- 本研究は,適応的な異方性機器変数熱流(A-IHF)により,これらの課題を克服し,より正確な推定を可能にすることを目指す。
- A-IHFは,パイロット治療対照からエッジ伝導率を適応させ,補完的な疎な解を抽出することで,残差の精度を高める。
- 線形制御関数回帰において,生成された制御の張方が重要であり,正確な有限サンプル忠実度-関連性フロンティアが得られる。
- ベンチマークテストの結果,A-IHFファミリーが32個のセルで勝利し,非線形応答エラーを8.3%削減した。
BrainG3N:制御可能な3D脳MRI生成のための二目的トークナイザー [cs.AI, cs.CV, cs.LG]目的:3D脳MRI生成のための,臨床情報を保持しつつ高精度な再構成を可能にする二目的トークナイザーの開発
- 3D脳MRIは臨床神経学や神経腫瘍学において不可欠であり,生成モデルによるデータ拡張が求められている。
- 既存のトークナイザーは再構成精度を優先するあまり,臨床情報の保持が不十分であるという課題があった。
- 臨床情報保持と再構成精度の両立を目指し,臨床タスクと制御可能な生成を可能にする埋め込み空間を構築する。
- 開発したトークナイザーは,23の線形プロービングベンチマークにおいて,既存モデルを21/23のタスクで上回る性能を示した。
- 臨床情報を埋め込んだ拡散トランスフォーマーは,6変数の条件付き生成や患者特異的な縦断的予測を可能にした。
- 本研究により,臨床タスクと制御可能な生成の両方をサポートする単一の3D脳MRI埋め込み空間が確立された。
キーレス注意:効率的なTransformerのための値空間ルーティングと値のみのキャッシュ [cs.CL, cs.AI]目的:Transformerの効率性とスケーラビリティ向上
- 自然言語処理の基盤であり,効率改善は重要課題である。
- 長文脈推論時のKVキャッシュがボトルネックとなっている。
- KVキャッシュのメモリ使用量とアクセスオーバーヘッドを削減する。
- キーレス注意は,標準的なQKV注意と同等またはそれ以上の性能を示す。
- KVキャッシュメモリを50%削減しつつ,復号スループットを向上させる。
- 値空間ルーティング投影が,アーキテクチャの重要な要素であることが示された。
意図に基づいたAIエージェントのツール利用許可 [cs.AI]目的:AIエージェントのツール利用における権限管理の仕組み
- AI技術の発展に伴い,ツール利用型AIエージェントの安全性が重要視されている。
- 従来の権限管理では,必要以上の権限がAIエージェントに与えられ,セキュリティリスクが存在する。
- ユーザーの意図に基づいた厳密な権限管理により,AIエージェントの安全性向上を目指す。
- 提案手法であるIGACは,権限の範囲をユーザーの要求に合わせて絞り込むことで,セキュリティリスクを低減する。
- 実験結果から,IGACを適用することで,潜在的な危険性を示す指標を大幅に減少させることが確認された。
- 残存するリスクは,証明書の精度向上によってさらに低減可能であり,今後の課題が明らかになった。
RWGBench:関連研究生成における学術的な位置づけの評価 [eess.SY, cs.SY, cs.DL, cs.AI]目的:関連研究生成の評価基準
- 学術論文において,関連研究の記述は研究の位置づけを明確にする上で不可欠である。
- 既存の評価指標は要約に基づき,学術的な適切性を十分に捉えられていない。
- 引用の選択と構成という学術的な側面から関連研究生成を評価する基準を確立する。
- RWGBenchは,4万件以上の論文と109万件の文献から構築された大規模なベンチマークである。
- 評価フレームワークは,引用の選択,文脈の適切性,構成,そして言説構造の多次元的な評価を可能にする。
- 実験により,既存システムが標準評価では見過ごされる限界が明らかになり,専門家の判断との整合性が確認された。
Matilda:人間ポリシー誘導によるエンジン非依存型探索 [cs.RO, cs.AI]目的:人間による指手の予測と戦術的探索の融合
- チェスエンジンの進化は,純粋な強さから人間特有の意思決定の予測へと変化している。
- 既存手法では,強さと人間らしさの両立が困難であり,高性能エンジンは人間らしさを再現できない。
- 人間らしい指手の予測精度を高めつつ,高度なレベルでの性能劣化を防ぐことを目指す。
- Matildaは,人間ポリシーとエンジン非依存型探索を組み合わせることで,人間指手の予測における負対数尤度を18.5%削減した。
- Lichessの3000+ Eloのブリッツゲームにおいて,トップ1の正解率を60.1%から66.1%に向上させた。
- プレイヤーのスタイル埋め込みが1.8%の改善,検索がさらなる0.2%ポイントの改善に貢献した。
ATOD:アニールされたターン認識型オンポリシー蒸留によるマルチターンエージェントタスク [cs.RO, cs.AI]目的:長期間インタラクティブタスクにおける小規模言語モデルエージェントの高速な模倣と報酬駆動型改善
- 複雑なタスク遂行において,エージェントの自律性と効率が重要視されている。
- 従来の蒸留学習では,教師モデルの性能に近づくと改善が鈍化しやすい。
- 蒸留学習と強化学習の長所を組み合わせ,性能上限の向上を目指す。
- ATODは,蒸留学習と強化学習を段階的に切り替えるアニールスケジュールを採用。
- ターンレベルでの不一致と不確実性を考慮した重み付けにより,教師からの密な監督を改善。
- ALFWorld,WebShop,Search-QAでの実験で,既存手法を上回る成功率を達成。
言語的ファイアウォール:マルチエージェントシステムにおけるルーティングの防衛としての幾何学 [cs.AI, cs.MA]目的:マルチエージェントシステムにおけるルーティングメカニズムの堅牢性向上
- LLMの統合によりMASが進化しており,タスクの効率的な割り当てが重要である。
- 既存のルーティングは,エージェントの能力に関する検証されていない情報に依存している。
- 動的な能力テストによって,悪意のあるエージェントによる攻撃を防止することを目指す。
- ANTAPは,間接的なプロキシを排除し,動的な能力テストによってルーティングを行う。
- ANTAPは,説明に基づいた注入攻撃に対してほぼゼロのASRを達成した。
- 埋め込み攻撃に対しても,ANTAPはベースラインよりも大幅に低いASRを達成した。
AI安全評価のための敵対的語用論:言語を介した制御のための診断フレームワークとシードベンチマーク [cs.CL, cs.AI, cs.SE]目的:言語モデルの安全評価における曖昧な自然言語行動の診断
- AIの安全性確保は,社会実装において不可欠であり,言語モデルの評価は重要な課題である。
- 既存のベンチマークは,合格/不合格ラベルのみで評価するため,失敗の原因特定が困難である。
- 敵対的語用論を通じて,指示の衝突や曖昧さなど,安全に関わるモデルの挙動を詳細に分析する。
- 本研究では,18項目のシードベンチマークと,LLMによる評価プロトコルを提案した。
- 評価の結果,安全に関わる少数クラスの識別が困難であり,LLMの判断の一貫性に課題が残ることを示した。
- このベンチマークは,安全性の評価・診断を目的としており,モデルのランク付けや安全スコアの算出には適さない。
プロンプトの構成がLLMエラー検出のカウントベース評価を歪める:数値アンカーからの証拠 [cs.CL, cs.AI]目的:LLMエラー検出におけるカウントベースのF1スコアの歪み
- LLMの性能評価は重要であり,特にエラー検出の精度は自然言語処理の信頼性を左右する。
- F1スコアはよく用いられるが,それが必ずしもエラーの局所化精度と一致しない場合がある。
- プロンプトの構成がF1スコアに与える影響を明らかにし,より正確な評価方法を提案する。
- プロンプトに数値アンカーを含めることで,F1スコアが向上する一方で,エラーの局所化精度は改善されない「F1インフレーション」が確認された。
- エラー検出モデル6種類に対して,数値アンカーを含むプロンプトは,最大0.79ポイントのF1インフレーションを引き起こすことが示された。
- LLMの評価においては,エラーの事前定義数を避け,カウントベース指標と局所化精度指標の両方を報告する必要がある。
近似から創発へ:深層学習の理論 [cs.LG, stat.ML]目的:現代深層学習理論の統一的な説明
- 深層学習はAIの基盤技術であり,その理論的理解が重要である。
- 深層学習の現象は単一の数学的説明では捉えきれない。
- 深層学習のメカニズムがどのように規模,データ,構造から生まれるかを解明する。
- 近似,最適化,汎化といった古典的な基礎から,現代的な過パラメータ化,ロバスト性,生成モデリングなどを包括的に分析している。
- 各理論は制御対象,有効な前提,未解明な現象という視点から検証されている。
- 深層学習理論の現状を厳密に整理し,その力強さ,不完全さ,そして創発への注目を示している。
タスク固有の自己報告による隠れたモデル挙動の解明 [cs.CL, cs.CL, cs.AI, cs.LG]目的:隠れたモデル挙動の検出
- 大規模言語モデルの安全性と信頼性は重要であり,予期せぬ挙動を把握する必要がある。
- ファインチューニングにより,モデルに隠れた有害な挙動が生じる可能性がある。
- モデルが学習した挙動を可視化し,安全性を評価する手法が求められている。
- 提案手法SARは,モデル自身の自己報告を通じて隠れた挙動を高精度に検出できる。
- 既存手法IAと比較して,SARは誤った挙動の報告率を大幅に削減し,信頼性を向上させる。
- SARは,ファインチューニングされたモデルの内部動作を理解するための有効なツールとなり得る。
小型VLAモデルへの注意と移動方法の指導 [cs.RO, cs.LG]目的:小型VLAモデルにおけるタスク条件付き空間的接地と一貫性のある行動生成の能力向上
- ロボット制御において,リアルタイム性が求められるため,軽量なモデルが重要視されている。
- モデルの規模縮小は,空間的接地と行動生成といった操作に必要な能力を低下させる可能性がある。
- 小型VLAモデルが効果的なロボット操作を実現できるよう,空間的注意と行動構造を明示的に学習させる。
- XS-VLAは,空間的接地のために粗視点空間蒸留を用いることで,タスク関連オブジェクトの位置情報を学習する。
- 行動生成では,潜在フローマッチングにより,多様なデモンストレーションを整理し,安定した行動を生成する。
- LIBEROおよび実世界実験において,タスク成功率が大幅に向上し,小型VLAモデルの有効性が示された。
Auto-AEG:オープンボキャブラリオーディオイベントグラウンディングのためのスケーラブルなデータ構築 [cs.HC, cs.CY, cs.IR, cs.SD, cs.AI]目的:オープンボキャブラリオーディオイベントグラウンディングのためのデータ構築手法
- 音響イベントの理解は,音声認識,ロボット工学,監視システムなど幅広い分野で重要である。
- 既存手法では,限定されたラベルセットでのみ高精度なイベント検出が可能であり,新しいイベントへの対応が難しい。
- 大規模なデータセットの不足を解消し,任意の自然言語クエリに対応できるイベントグラウンディングを実現する。
- 本研究で提案するAuto-AEGは,プログラムによる合成クリップと実世界の音声に対する擬似ラベルを活用し,スケーラブルなデータ構築パイプラインを実現する。
- AEGBenchという新たなベンチマークにおいて,Auto-AEGはゼロショット性能に対して大幅な改善(mIoUで+73.9%および+23.1%)を示した。
- この改善は,他のオーディオイベント検出ベンチマークにも一般化し,LALMの時系列局在化能力を効果的に拡張できることを示唆している。
G2VD:反事実的介入と因果的解離による汎化可能なAI生成動画検出 [cs.CV, cs.AI]目的:AI生成動画の汎化可能な検出手法
- AI動画生成技術の急速な発展に伴い,セキュリティリスクが高まっており,信頼性の高い検出技術が求められている。
- 既存手法は,学習データと異なる生成モデルに対して性能が著しく低下する。ドメイン固有のバイアスに依存した学習が原因である。
- ドメイン固有のバイアスを弱め,本質的なフォレンジックな手がかりを捉えることで,汎化性能の高い検出を実現する。
- G2VDは,VAEに基づく再構成と周波数・ピクセル領域のアライメントにより,反事実的サンプルを生成し,ドメイン固有のバイアスと真偽ラベル間の相関を弱める。
- ドメインアンカー化された2つのブランチとHSICに基づく制約を持つ因果的解離分類器を設計し,フォレンジックな手がかりとドメイン固有のバイアスを分離する。
- 4つの公開データセットでの実験により,高いクロスドメイン性能が示され,GenVidBenchにおいて,F1値とAUCが最先端手法を上回る。
LLM科学的発見エージェントのための検証可能な質問形成 [cs.AI]目的:LLM科学的発見エージェントにおける研究質問の形成と検証可能性の向上
- 科学研究の効率化と新たな発見の促進に,LLMの活用が期待されている。
- LLMが提案する最初の研究質問の妥当性や根拠が不明確な場合がある。
- LLMが生成する研究質問の検証可能性を高め,科学的根拠に基づいた質問形成を支援する。
- FirstResearchは,研究質問証明書を生成することで,定義,仮定,メカニズムモデルなどを明示化する。
- DeepSeekとGemini-2.5-Flashによる評価において,既存手法と比較して高いスコアを獲得した。
- 研究質問証明書の中核部分が最も重要な要素であり,その削除はスコアの大幅な低下につながった。
建設における自動溶接ロボットのための転移学習による高度な溶接線セグメンテーション:双方向セグメンテーションネットワークの限界への対処 [cs.CV, cs.LG]目的:建設における自律型ロボット溶接のための信頼性の高い溶接線セグメンテーション
- 建設現場でのロボット溶接は,人手不足解消や生産性向上に不可欠であり,自動化技術の確立が求められている。
- 強烈な照明,反射,薄い溶接構造など,建設現場特有の環境要因がセグメンテーション精度を低下させる課題がある。
- 本研究は,反射に強く,軽量なセグメンテーションフレームワークを開発し,ロボット溶接における実用的な知覚ソリューションを提供することを目指す。
- 提案手法は,従来のベースラインと比較して,Joint IoUを22.36%向上させ,81.76%およびmIoU 90.73%を達成した。
- 特に,反射条件下で発生する深刻なゼロIoUの失敗事例の96.33%を改善することが示された。
- 実験結果から,提案する最適化戦略は,軽量なリアルタイムセグメンテーションアーキテクチャに特に有効であることが示唆された。
VendorBench-100:深偽造画像検出のための統一的クロスパラダイムベンチマーク [cs.CV, cs.AI]目的:深偽造画像検出モデルの性能評価
- 画像偽造技術の進歩に伴い,その検出技術の重要性が増している。
- 深偽造画像検出手法は複数存在するが,統一的な評価基準がないため比較が困難である。
- 異なる手法間の公平な比較を可能にするベンチマーク環境の構築。
- 本研究では,36種類のモデルを評価するクロスパラダイムベンチマーク「VendorBench-100」を提案した。
- 商用APIが最も高い性能を示したが,一部のオープンソースモデルもLLMに匹敵する性能を発揮した。
- ROC-AUCは必ずしも実用性を反映せず,MCCや特異度と併せて評価する必要があることが示された。
上位K個の教師が判断を誤る場合:マルチ教師オンポリシー蒸留におけるツールコールドリフト [cs.CL, cs.LG]目的:マルチ教師オンポリシー蒸留におけるツールコールドリフトのメカニズム解明
- 大規模言語モデルの性能向上には,教師あり学習による知識蒸留が有効である。
- 知識蒸留において,教師モデルのlogitsを絞るTop-K手法は計算効率が良いが,判断に必要な情報が失われる可能性がある。
- 本研究は,Top-K手法による情報損失がツールコールドリフトを引き起こすメカニズムを特定し,改善策を検討する。
- Top-K知識蒸留において,ツールコールの頻度が高まる一方で,直接回答が必要な例に対する誤ったコールも増加することが示された。
- ツールコールトークンを生成位置全てで復元することで,過剰なツールコールを大幅に減少させることが可能となった。
- ただし,ツールコールの復元は,ツールコール精度とタスク成功率の間にトレードオフをもたらすことが明らかになった。
LLMが合意する場合,それは正しいのか? 自己整合性とモデル間合意の信頼性評価 [cs.AI]目的:LLMによる判断の一貫性およびモデル間合意が,信頼性の指標となりうるかについての検証
- AIシステムの評価において,LLMを評価者として利用する手法が一般的になりつつあり,その信頼性が重要である。
- LLMの判断の一貫性が,必ずしも正確性を示すとは限らないという問題が存在する。
- LLMの一貫性が,どのような場合に正確性の代替指標として利用可能かを明らかにすること。
- LLM間またはLLM自身の回答の一貫性は,必ずしも正確性を示唆せず,バイアスやヒューリスティックに起因する場合がある。
- 中間の性能を持つモデルや計算資源の配分においては,一貫性が有用な指標となるが,最先端モデルにおいては過信度が高く,正確性向上には繋がらない。
- LLMの一貫性は,条件付きで正確性の指標となりうるものであり,独立した信頼性スコアとしては不適切である。
AI支援辞書編纂における人間中心性の導入 [cs.AR, cs.CL, cs.AI]目的:AI支援辞書編纂のための人間中心型AI(HCAI)フレームワーク
- 言語の記録と伝達において辞書は不可欠であり,現代社会におけるコミュニケーションの基盤である。
- AIの導入により辞書編纂者の役割が変化する可能性があり,専門性の喪失が懸念されている。
- AIと辞書編纂者の協調関係を構築し,AIの偏りを軽減し,より良いツール設計を目指す。
- 本研究は,AIが辞書編纂者を代替するのではなく,その能力を拡張すべきであると主張する。
- AIの統合においては,専門家の主体性を維持し,AIによる偏りを軽減することが重要である。
- このフレームワークは,辞書編纂ワークフローへのAIの有益な統合のための基盤を提供する。
交通予測にアダプティブなグローバル空間注意は本当に必要か [cs.AI]目的:交通予測におけるグローバル空間情報のモデリング手法の有効性評価
- 交通予測は,都市計画や交通管理において不可欠であり,その精度向上は社会経済的利益に繋がる。
- 既存手法は空間依存性の抽出に焦点を当てているが,グローバル情報のモデリングメカニズムは十分に解明されていない。
- アダプティブな注意機構が必須かどうかを検証し,より効率的なグローバル空間情報の集約手法を提案する。
- 標準的な空間注意は,一様Full-Range Mixingと比較して,6つの交通ベンチマークにおいて一貫した優位性を示さなかった。
- 一様Full-Range Mixingは,空間混合の計算量をO(N^2)からO(N)に削減し,効率的なベースラインを提供する。
- 空間注意は,データセットに依存した残差効果を示すことが明らかになった。
科学文書のレイアウトと構造を考慮したクロスバージョン差異検出 [cs.CY, cs.CL, cs.AI]目的:科学文書のクロスバージョン差異検出手法
- 学術出版や技術文書において,文書の変更履歴を把握することは重要である。
- 既存手法は,レイアウトや構造情報を損失したり,意味解釈が困難であったりする。
- 科学文書内の多様な要素を考慮し,高精度な差異検出を目指す。
- 提案手法は,テキスト,表,数式,図といった多様な要素を対象に差異検出を行う。
- 実験結果から,提案手法は既存手法と比較して高い検出精度を示すことが確認された。
- 特に,各要素に対するF1スコアは,テキストで0.903,表で0.855,数式で0.862,図で0.845であった。
情報抽出のためのエージェントモデルの行動制御性:固定ワークフローから内省的エージェントへ [cs.AI]目的:情報抽出におけるエージェントモデルの行動制御性
- 近年のLLMの発展に伴い,複雑な情報抽出タスクへの応用が期待されている。
- エージェントの構成要素(内省,記憶)が,固定ワークフローと比較して明確な改善をもたらすか不明である。
- エージェントメカニズムがシステムの振る舞いをどのように変化させるかを明らかにすること。
- 会議論文データセット抽出実験の結果,内省的エージェントが固定ワークフローと比較して行動の変化を示した。
- この変化がタスク完了の改善に繋がる場合と,そうでない場合が明らかになった。
- 観測された失敗モードに基づき,最適化されたエージェント設計が提案された。
素晴らしい適応型タスク分類とその利用法 [cs.SE, cs.AI]目的:エージェントシステムの失敗に関する明示的な表現の構築
- エージェントシステムの改善は,その性能向上に不可欠である。
- 既存の失敗履歴は冗長で,再発する問題の特定が困難である。
- 本研究は,自動的に構築されるタスク分類を用いてこの問題を解決する。
- AdaMASTは,エージェントシステムの実行トレースから,簡潔かつ証拠に基づいた失敗タスク分類を構築する。
- このタスク分類を用いることで,エージェントシステムの探索,実行時,軌道選択の各段階において性能が向上した。
- 構築されたタスク分類は,人間による専門家の意見と一致し,ドメインが異なってもコードの共有が少ない。
材料研究のための自動化:保留データを用いた検証可能なAI科学者ワークフロー [cs.MA, cs.AI, cs.SE]目的:機械学習の変更提案,実装,評価を行う自動研究ワークフローの信頼性向上
- 材料開発の加速化に貢献するAI技術の重要性が高まっている。
- 従来の自動研究では,最終的な結果のみが評価され,各決定の妥当性が不明確。
- 各介入の信頼性を検証し,再利用可能な知見の特定を目指す。
- 介入中心型自動研究は,10件のMatbenchエンドポイントのうち9件で選択された介入の有効性を確認した。
- 内側のフィードバックで支持されたRepresentationの改善を,外側の保留データで否定した。
- すでに固定されたFeatureとModelコードを組み合わせることで,平均的な外側ホールドアウトの改善率が19.0%から26.3%に向上した。
LLMセキュリティ知識の自動テストに向けた試み [cs.IR, cs.CR, cs.AI, cs.HC]目的:LLMのセキュリティ知識の評価方法
- LLMの活用範囲拡大に伴い,セキュリティ分野での性能評価が重要となっている。
- LLMのセキュリティ知識の評価には専門知識と労力を要する手作業が必要とされている。
- 消費者庁等の公的情報を用いて,LLMの知識ギャップを半自動的に検出・評価すること。
- 本手法により,LLMがセキュリティトピックを正確に識別できるかどうかの違いを明らかにできた。
- 特に,なりすまし詐欺と個人情報窃盗の分野において,GeminiとGPTの各モデル間に知識の差が認められた。
- 消費者庁等の公的情報を活用することで,効率的なLLMセキュリティ知識の評価が可能となった。
SkillSight:スキル検索における汎用的なコンテンツバイアスの調整 [cs.AI]目的:スキル検索における適切なスキル抽出
- 大規模言語モデルエージェントの能力選択と実行において,適切なスキル抽出が不可欠となる。
- 既存の検索手法はスキル内容を通常の文書として扱い,スキル特有の構造的特徴を見落としている。
- 共有記述背景を調整し,スキル検索におけるランキング干渉を軽減することで,正確かつ効率的なスキル選択を実現する。
- SkillSightは,セマンティック空間と語彙空間の両方で共有背景を調整する学習不要な検索フレームワークである。
- SRA-BenchおよびSkillBench-Suppにおける実験で,検索指標において一貫した改善が確認された(Recall@10最大20.21%向上)。
- SkillSightは,Dense + Rerankerベースラインと比較して最大1,248倍高速であり,3つのエージェントモデルで最高の性能を達成した。
GEqTrain:3次元科学タスク間での等変グラフニューラルネットワークの再ターゲット化のための構成駆動型フレームワーク [cs.DC, cs.NI, cs.LG, q-bio.BM]目的:等変グラフニューラルネットワークの再ターゲット化
- 3次元科学データ解析において,等変グラフニューラルネットワークは強力なモデリング手法である。
- 既存の実装は特定のタスクに依存し,再利用が困難であるという課題がある。
- 構成変更のみで異なるタスクに対応可能な共有表現と学習基盤を構築すること。
- GEqTrainは,データセットのセマンティクス,モデル構成,学習目標を分離する構成駆動型フレームワークである。
- 異なるタスク(バイオ分子システムの粗視化から原子レベルへのマッピング,分子固体のNMR化学シフト予測,等変生成モデリング)において競争力のある精度を達成できることを示した。
- 等変フローマッチングに基づく生成拡張GEqDiffを導入し,多様な変換特性を持つフィールドの同時再構成が可能であることを実証した。
ResearchArena:自動AI研究開発における妨害と監視の評価 [cs.AI, cs.CR, cs.LG]目的:自動AI研究開発における妨害行為の検知と制御機構の評価
- AIの自動化が進む中で,AIが生成する成果物の安全性確保は重要性を増している。
- AIエージェントが潜在的な敵対者となり得るため,その出力を信頼することが困難である。
- AI制御による監視機構を評価し,AI研究開発における隠れた妨害行為の検知率向上を目指す。
- ResearchArenaというフレームワークを用いて,安全性,能力,CUDAカーネル最適化,推論サーバー最適化の4つのタスクで評価を行った。
- 訓練データに埋め込まれた妨害は最も検知が難しく,半数未満しか検出されなかった。
- 成果物に対する実験実行を許可することで監視性能は向上するが,表面的な検査や誤ったテストによる妨害の見逃しが発生する。
REGEN:オフライン強化学習を用いたエキスパートから汎化モデルへの知識蒸留のためのリプレイリサイクル [cs.LG, cs.AI]目的:エキスパートから汎化モデルへの知識蒸留
- 大規模言語モデルの能力向上には強化学習が不可欠。しかし,計算資源やコストが課題となっている。
- 既存の知識蒸留技術は,推論と逆伝播が結合しており,スケーラビリティに限界がある。
- 教師モデルのリプレイメモリを再利用することで,コストを削減し,効率的な知識蒸留を実現する。
- REGENは,数学的推論,コード生成,指示に従うといったタスクにおいて,MOPDと同等の精度を大幅に低いコストで達成した。
- オンライン強化学習をデータ合成プロセスに変え,大規模な事後学習を容易にする可能性を示唆した。
- REGENは,ロールアウトサンプリングとバックワード学習プロセスを完全に分離し,学習コストを大幅に削減する。
完全楽曲生成の最前線:階層型自己回帰的計画とフローマッチングレンダリングの融合 [cs.SD, cs.AI, eess.AS]目的:歌詞,テキスト記述,音楽的属性から高品質な完全楽曲を生成する統合的なフレームワーク
- 音楽生成は,創造性の拡張や新しい音楽体験の提供において,重要な役割を担う。
- 既存の手法では,楽曲全体の構造を維持しつつ,高品質な音楽を生成することが困難であった。
- 歌詞や音楽的属性に基づき,楽曲全体の構造と品質を向上させる生成手法を開発する。
- 提案フレームワークは,歌詞から楽曲生成,インストゥルメンタル音楽生成,カバー曲生成の3つのタスクに対応可能である。
- ハイブリッドLMとFullDiTの組み合わせにより,楽曲全体の構造を計画し,高品質なオーディオを生成している。
- DPO,GRPO,OPDといった報酬に基づいた後学習戦略が,音楽性とレンダリング品質の向上に貢献している。
適応的多時間軸強化学習 [cs.LG, cs.AI]目的:複雑な環境下における意思決定の改善
- 環境変化に対応した意思決定は,AIやロボット工学の発展に不可欠である。
- 従来の強化学習では割引率が固定されており,柔軟な時間軸の扱いが課題であった。
- 割引率を適応的に調整し,様々な環境変化に対応できる学習手法の確立。
- 提案手法は,報酬構造の変化に対してロバストであり,手動での割引率調整が不要となった。
- MiniGrid環境において,効果的な割引率を自動的に特定できることが示された。
- 継続学習シナリオにおいて,タスク切り替えや環境変化への適応性が向上した。
論理ゲートネットワークの深さのスケーラビリティについて [cs.CL, cs.LG, cs.AI, cs.LO]目的:論理ゲートネットワークの深さのスケーラビリティに関する研究
- 深層学習モデルの性能向上には,モデルの深さの拡大が重要である。しかし,既存の論理ゲートネットワークでは,深さを増やしても性能向上は期待できない。
- 従来の論理ゲートネットワークでは,最適化の崩壊や,出力経路に特有の勾配の消失といった問題が生じ,深層化による効果が阻害されている。
- 本研究では,入力に直接結びついたアンカーを導入することで,これらの問題を解決し,深層化による性能向上を実現することを目指す。
- 提案手法である入力アンカー付き論理ゲートネットワーク(IALGN)は,MNIST,CIFAR-10,CIFAR-100において,最大150層まで固定幅の深さと精度が比例関係にあることを示した。
- IALGNは,入力アクセスを維持しつつ,出力経路の合流を防ぎ,より安定した勾配伝播を可能にすることが明らかになった。
- 線形プローブ,トポロジーアブレーション,操作認識分析により,IALGNがプライベート状態を保持し,スパースなアンカー条件付き更新を適用することが示された。
依存性の乖離の測定:表形式生成モデルにおける列間忠実性の診断 [cs.LG, cs.AI]目的:表形式生成モデルにおける列間の依存性に関する忠実性の診断
- 少数クラスを含む不均衡データにおいて,列間の構造は識別能力に大きく寄与するため,その維持が重要である。
- 既存の評価指標は列間の依存構造を十分に捉えられておらず,合成データと実データの差異を見抜けない場合がある。
- 本研究は,既存指標が検出できない依存性の乖離を明らかにし,少数クラスの有用性を評価することを目的とする。
- 提案する診断手法は,勾配ブースティング分類器を用いた二標本検定を,周辺,依存性,数値・カテゴリ間の交差成分に分解する。
- フローマッチングや拡散モデル等の生成モデルに適用した結果,標準的な指標では見逃される依存性の乖離が存在することが示された。
- この乖離は,モデルの容量増加や事後的なコプラ修正では解消されず,直接的な依存性学習の欠如に起因すると考えられる。
重要なものを学習する:因果的証拠集合によるグローバルコンテキストプルーニングの監督 [cs.LG, cs.CL]目的:注意機構におけるコンテキストプルーニングの監督方法
- 大規模言語モデルの性能向上のため,計算資源を削減する技術が重要視されている。
- 注意機構が依存関係を正確に反映していない場合があり,プルーニングの選択が不適切となる。
- 因果的証拠集合を用いて,より正確なプルーニング選択を学習することを目指す。
- 注意機構は,必ずしも答えが依存するコンテキストを正確に示していないことが判明した。
- 因果的証拠集合から学習したプルーニング選択子は,従来の注意機構からの蒸留による選択子よりも高い精度を達成した。
- 事前学習済みモデルにおいても同様の課題が確認され,重要な情報よりも古い情報に注意が偏っていることが示された。
データフローネットワークの緩和活性化解析 - 機械学習とリアルタイムスケジューリングのためのクロック計算 [cs.PL, cs.LG]目的:データフローネットワークにおける緩和活性化解析の拡張
- 機械学習とリアルタイムシステムの組み合わせが重要視される中で,正確なモデル化手法が求められている。
- 既存のクロック計算は,機械学習の訓練アルゴリズム特有の制御パターンに対応しきれていない。
- 機械学習モデルをリアクティブアプリケーションに組み込むための効率的なクロック計算を確立すること。
- Lustre言語のデータフロー素朴な表現が機械学習アプリケーションに適していることが示されている。
- 既存のクロック計算では,機械学習の訓練アルゴリズムにおける制御パターンを効率的に表現できないことが課題であった。
- Lustreのクロック計算を拡張することで,機械学習モデルのリアクティブアプリケーションへの組み込みを促進する。
拡散大規模言語モデルにおけるマルチブロック編集 [cs.AI]目的:拡散言語モデルのブロック境界問題の解決
- 拡散言語モデルのスケールアップにはブロック拡散が主流だが,ブロック境界付近のトークンが文脈に乏しいという課題がある。
- ブロック拡散では,ブロック境界付近のトークンが将来の文脈を欠き,誤りが不可逆的な文脈となる。
- ブロック境界問題に対処し,より高い精度と効率を実現するマルチブロック編集を提案する。
- 提案手法であるマルチブロック編集(MBE)は,ブロック間の文脈を利用してデコードされたトークンを修正する。
- 学習不要のMBEは,パラメータ更新なしに選択されたブロックに対して全注意ウィンドウを再開する。
- 実験の結果,12のベンチマークにおいて一貫した改善が確認され,AIME 2025では最大13.33ポイントの改善が見られた。
CausalGate:Transformerモジュール剪定のための因果重要度蒸留 [cs.LG, cs.CL, cs.CV, stat.ML]目的:Transformerモジュールの剪定における因果重要度蒸留
- 大規模言語モデルの効率化は,その利用拡大と運用コスト削減に不可欠である。
- 既存手法は相関に基づく指標に依存し,意味的な正確性に重要な非線形構造を捉えきれない。
- 因果介入に基づき,各モジュールの重要度を正確に評価し,効率的な推論を可能にすること。
- CausalGateは,AttentionやMLPサブ層を介入により分離し,最終的なlogit分布の変化をKLダイバージェンスで測定する。
- 静的なゲートを導入することで,ランタイムのルーティングオーバーヘッドを排除し,計算効率を向上させる。
- TinyLlama,Qwen,Llama-3等の評価で,既存手法を上回り,ハードウェアのレイテンシを削減することを示した。
LC-SEPLM:系列のみのタンパク質表現学習のための長距離接触教師あり適応 [cs.LG, cs.AI]目的:タンパク質系列表現の学習
- タンパク質の機能予測など,生命科学分野におけるタンパク質構造予測の重要性が増している。
- 既存のタンパク質言語モデルは,一次構造(アミノ酸配列)の文脈依存性を主に学習しており,立体構造情報が不足している。
- 立体構造情報である残基間の接触を教師信号として導入し,系列のみの推論を維持しつつ表現能力を向上させる。
- LC-SEPLMは,ESM2をLoRAで適応させ,長距離残基ペア接触を教師信号として利用することで,タンパク質レベルの8つのタスク全てにおいてESM2を上回った。
- 特に,遠縁相同性認識において,macro-F1が0.6122から0.6769へと大幅に向上した(+0.0647,6.47パーセントポイント)。
- ESM-S ECベンチマークにおいても,LC-SEPLMはESM-Sを上回り,最大絶対ゲインは0.1771であった。
制約付き学習における訓練データ影響度関数:方向性影響関数 [cs.LG, cs.AI]目的:制約付き学習における訓練データの影響度推定
- 機械学習の公平性,安全性,ロバスト性向上には,制約付き学習が不可欠である。
- 従来の影響度関数は,制約条件の変化に対応できず,信頼性が低いという課題がある。
- 方向性影響関数は,制約条件を考慮した正確な影響度推定を目指す。
- 提案手法である方向性影響関数は,最適性の条件をバリアショナル不等式として定式化し,データ摂動がこれに与える影響を分析する。
- 制約付き線形回帰実験により,方向性影響関数がleave-one-out再学習の結果を再現し,従来の関数よりもバイアスが少ないことが示された。
- 公平性制約付きCNNへの適用により,データ削除時のテスト損失の変化を正確に予測し,実際の再学習結果と整合性があることが確認された。
FastLAS入門:プログラマーのためのガイド [cs.CL, cs.LO, cs.AI, cs.LG]目的:FastLASプログラム作成の導入
- 帰納論理プログラミングは,データから知識を自動的に獲得する重要な手法である。
- FastLASのようなILPシステムの利用は,複雑な設定や学習アルゴリズムの理解を必要とする。
- FastLASを用いたプログラム作成方法を,具体的な例を通して理解しやすくすること。
- 本稿は,FastLAS 2.2.0 を用いたプログラム作成の入門ガイドとして,文法から始めて徐々に難易度を上げていく。
- FastLASの出力結果を示しながら,理論的な説明は必要最低限に留めている。
- ILASPとの違いや,異なる学習アルゴリズムの挙動についても解説している。
エージェント型ソフトウェア開発におけるサードパーティAPIルーターのコストはどこにあるか [cs.SE, cs.AI, cs.CL]目的:エージェント型ソフトウェア開発におけるサードパーティAPIルーターのセキュリティリスクの評価
- LLMを活用した開発効率化が進む中で,APIルーターは不可欠な要素となっている。
- APIルーターが仲介することで,クライアント側の権限管理が機能しなくなる可能性が懸念される。
- APIルーターを介した不正な操作がソフトウェア開発に与える影響を明らかにすることを目的とする。
- APIルーターへの介入は,リポジトリレベルでのアクションに大きな変化をもたらすことが示された。
- 既存のクライアント側対策では,APIルーターを介した攻撃を検出することが困難であることが確認された。
- プロバイダー側での出力整合性保証の必要性が示唆され,さらなるセキュリティ対策が求められる。
計画は不思議な働きをする:スプレッドシートエージェントのためのプランモードの評価 [cs.HC, cs.AI, cs.SE]目的:スプレッドシートにおけるプランモードの有効性
- エージェントプログラミングにおいて,プランニングは透明性と制御性を高める重要な要素である。
- スプレッドシート利用者は反復作業を好み,厳密な正しさよりも結果を重視するため,事前の計画が合わない可能性がある。
- 本研究では,スプレッドシートのプランモードを設計し,利用者の改善回数と主観的な評価を調査する。
- プランモードと非プランモードではタスクの成果に差はなかった。
- プランモード利用者は,改善作業の回数が減少し,ツールの創造性支援と人間と機械の協調性に対する評価が高かった。
- これらの結果は,プランモードの今後の設計や,エンドユーザープログラミングにおける人間とAIの計画協力の役割に示唆を与える。
合成開口ソナーにおける深層ニューラルネットワーク訓練のためのデータ拡張手法の比較 [cs.LG]目的:合成開口ソナーデータに対する自動標的認識における深層ニューラルネットワーク訓練のためのデータ拡張手法の比較
- 合成開口ソナーは水中探査に不可欠であり,標的認識の精度向上は重要課題である。
- 実環境でのデータ収集コストが高く,深層学習に必要なラベル付きデータが不足している。
- データ拡張を通じて訓練データを増やし,ラベル不足問題を緩和することを目指す。
- データ拡張は標的認識の精度向上に貢献しうるが,効果は手法に依存する。
- 既存の様々なデータ拡張手法を系統的に比較し,その有効性を検証した。
- Transformerのような最新の深層ニューラルネットワークアーキテクチャとの組み合わせも評価した。
知識のコスト:ハルシネーションのベンチマークのためのリソースを意識したプロトコル [cs.AI]目的:ハルシネーションのベンチマークにおける計算コストを考慮した評価
- 大規模言語モデルの性能向上に伴い,その計算コストが重要な課題となっている。
- 既存の評価指標は,事実性のみに焦点を当てており,計算コストを無視している。
- 計算コストを考慮したより現実的な評価基準を確立し,効率的なモデル開発を促進する。
- 従来の評価では,計算コストを考慮せず,単純に高い正答率を追求する傾向があった。
- 提案手法MAS-HQは,事実性と計算コストのトレードオフを可視化し,リソース効率の良いシステムを評価する。
- 実験結果から,競争的な評価が,よりリソース効率の良いポリシーを引き出すことが示された。
把持・挙上課題における運動学的・力学的パラメータの同時復号に向けた非侵襲的脳画像技術 [cs.HC, cs.AI, cs.ET]目的:把持・挙上課題における運動学的・力学的パラメータの同時復号
- 脳機械インターフェースは,運動機能が制限された人々の生活を支援する技術であり,その応用範囲は広い。
- 脳波から複数の運動パラメータを正確に復号することは,BMIの使いやすさと制御性を向上させる上で課題である。
- 脳波信号から複数の運動パラメータを同時に高精度に復号し,直感的なBMIシステムの実現を目指す。
- 注意機構に基づく回帰モデルが,最も高い性能を示し,$R^2$値0.8,遅延29.2ミリ秒を達成した。
- 多層パーセプトロンは,両方の復号タイプにおいて一貫した精度を示したが,精度は低かった($R^2$ = 0.49)。
- これらの結果は,リアルタイム多コマンドBMIシステムにおける注意機構に基づくモデルの可能性を示唆している。
