arXiv雑要約
AI - 2026/07/30 公開
CoCaRS:相関較正に基づく冗長性抑制による異種知識蒸留 [cs.LG, cs.AI]目的:異種知識蒸留における冗長性抑制手法
- モデル圧縮は,計算資源の制約下での効率的な推論に不可欠である。
- 教師モデルと生徒モデルのアーキテクチャの違いが,知識伝達の効率を低下させる。
- 相関較正により,構造的情報を維持しつつ冗長性を抑制し,パラメータへの依存を軽減する。
- 提案手法CoCaRSは,Confusion Evidence Estimation (CEE)とStrength Allocation Control (SAC)により,相関の推定精度と構造の保持を両立する。
- Adaptive Coefficient Regulation (ACR)により,冗長性抑制の寄与度を適応的に調整し,パラメータ設定への依存性を低減する。
- CIFAR-100およびImageNet-1Kでの実験により,CoCaRSが蒸留性能の向上とパラメータ設定へのロバスト性の向上に有効であることが確認された。
Setoka:異種データを用いたパーソナライズエージェントにおける階層的なユーザー理解のベンチマーク [cs.IR, cs.AI, cs.CL]目的:パーソナライズエージェントにおける階層的なユーザー理解の評価
- 近年,パーソナライズエージェントの応用範囲が拡大しており,高度なユーザー理解が不可欠となっている。
- 既存の記憶ベンチマークは,会話履歴からの明示的な情報検索に偏っており,深いユーザー理解の評価が不十分である。
- 異種データから長期的な行動を抽象化し,ユーザー理解を深めるための記憶メカニズム設計を促す。
- Setokaベンチマークは,ユーザー理解を意味記憶,エピソード記憶,行動パターン,性格特性の4段階に定義した。
- 既存システムは意味記憶の検索には優れているが,エピソード記憶,行動パターン,性格特性の理解においては性能が低下する。
- 異種・断片的な情報を統合し,長期的なユーザー行動を抽象化するメカニズムの必要性を示唆する。
ScratchSim:表面傷検出のための手続き型合成データパイプライン [cs.CV, cs.AI]目的:表面傷検出のための大規模注釈付き合成トレーニングデータ生成
- 産業品質管理において,自動欠陥検出は重要な役割を担う。人手による検査の限界を克服するため,自動化が求められている。
- 欠陥データの注釈付きデータが不足していることが,自動欠陥検出の課題となっている。高品質な学習データ確保が困難である。
- 本研究は,大規模な実データ注釈の負担なく,スケーラブルな欠陥検出を実現することを目的とする。
- 合成データで事前学習することで,実データのみで学習するよりも性能が向上することが示された。
- 実データが不足する場合,合成データと実データの混合学習が有効であることが確認された。
- 本手法は,畳み込みニューラルネットワークとTransformerベースのアーキテクチャの両方で有効であることが示された。
SciFigAlign:論文証拠との視覚的アライメントのファインチューニングによる科学図表のスコアリング [cs.CV, cs.AI]目的:科学論文の図表の品質評価手法の開発
- 科学論文における図表は,研究成果の重要な伝達手段であり,その品質は論文の信頼性に影響する。
- 既存の画像評価手法は,図表が論文の主張を裏付けているかを判断できないという課題がある。
- 論文の内容と図表の内容を統合的に評価し,図表の品質をより正確にスコアリングすること。
- 提案手法SciFigAlignは,図表,キャプション,引用段落,論文コンテキストを入力とし,CLIPとSciBERTをファインチューニングすることで,高精度なスコアリングを実現した。
- 論文レベルの分割において,平均絶対誤差(MAE)は0.3524,ペアワイズ正解率は81.64%を達成し,既存のLLMベース手法と比較して相対誤差を59%削減した。
- 論文証拠に基づいた入力,引用コンテキストのノイズ除去,ランキング学習が,科学図表評価において重要であることが確認された。
マルチモーダル空間推論における視覚的貢献度評価 [cs.CV, cs.AI]目的:空間推論ベンチマークにおける視覚情報の貢献度評価手法
- マルチモーダルAIの発展には,視覚情報と言語情報の効果的な統合が不可欠である。
- 既存の空間推論ベンチマークは,視覚情報がなくても正解に辿り着ける場合があり,真の視覚的貢献度を測れない。
- 視覚情報が意思決定にどの程度貢献しているかを定量的に評価し,モデルの視覚的推論能力を正確に把握すること。
- 提案手法Visual Credit Audit (VCA)により,画像がモデルの判断をテキストのみの場合や空白画像よりもどれだけ支持しているかを分離して評価できる。
- 実験の結果,既存のモデルの12.73-26.25%の正解は視覚情報による貢献が確認できず,画像置換実験で正答率が大きく低下した。
- VCAは,ベンチマークの成功を,正答性,追加の画像サポート,および関係の一貫性のある応答に分解することで,より詳細な分析を可能にする。
重い裾を持つノイズ下におけるオンライン凸最適化のためのパラメータフリー動的後悔 [cs.LG, cs.AI, math.OC]目的:重い裾を持つノイズ下の非定常環境におけるオンライン凸最適化における動的後悔の最小化
- 機械学習や最適化において,オンライン学習はリアルタイムでの適応が求められるため重要である。
- ノイズが重い裾を持つ場合,従来のアルゴリズムでは後悔が大きくなるという課題があった。
- パラメータフリーで普遍的な動的後悔を達成するアルゴリズムを開発し,その最適性を証明すること。
- 提案アルゴリズムHT-PAderは,パラメータに関する事前知識を必要とせずに,期待される普遍的な動的後悔の上界を達成する。
- 有限分散の場合(p=2)においても,HT-PAderは初のパラメータフリーな最小最大普遍動的後悔保証を提供する。
- パス長の指数に関する整合的な下界も証明され,提案アルゴリズムの最適性が確認された。
単一拍動に基づくカフレス血圧推定:軽量ハイブリッド学習フレームワークを用いた耳PPGとECG [cs.LG, cs.SY, eess.SP, eess.SY]目的:単一拍動に基づくカフレス血圧推定法の開発
- 健康管理や疾病予防において,継続的な血圧モニタリングの重要性は高い。
- 従来の血圧推定手法は,ノイズや生理的変動に弱く,動的な条件下での精度が課題であった。
- 本研究は,リアルワールドにおける血圧モニタリングを可能にする,高精度かつ効率的な推定法を確立する。
- 耳PPGとECGを組み合わせたハイブリッド学習フレームワークが,血圧の単一拍動レベルでの推定を可能にした。
- 実験結果から,収縮期血圧の平均絶対誤差は4.02±0.21mmHg,拡張期血圧は1.79±0.05mmHgであることが示された。
- 提案手法は,既存モデルと比較して,複合平均絶対誤差を28.2%削減し,ウェアラブルデバイスへの応用が期待される。
エネルギーベースモデルの平衡化訓練:並列軌道焼きなまし法 [cs.LG]目的:エネルギーベースモデルの訓練アルゴリズム
- 科学データ生成において,解釈可能性が重要視される中で,エネルギーベースモデルは有望な手法である。
- マルコフ連鎖モンテカルロ法の混合が不十分なため,モデルの信頼性が制限される場合がある。
- 学習を通じて平衡サンプリングを維持し,安定かつ高速な訓練を実現する。
- 並列軌道焼きなまし法は,従来の訓練方法と比較して計算コストが同程度であり,実用的な代替手段となる。
- 本手法は,熱平衡化時間,平衡サンプル,対数尤度を直接推定することが可能である。
- 制限ボルツマンマシンを用いた実験で,既存のEBM訓練手法を常に上回る性能が示された。
分散型結合サンプラーと証明された経験的輸送のためのフィールドコード [cs.CC, cs.IT, cs.LG, math.IT, math.OC]目的:経験的最適輸送における分散型結合サンプリング,コスト評価可能な結合出力,スカラー値認証サンプリングの実現
- 最適輸送は機械学習,画像処理など広範な分野で重要な役割を果たす
- 大規模データに対する効率的な最適輸送計算は,計算コストと通信コストの課題を抱える
- フィールドコードを用いて通信量を削減し,信頼性の高い輸送サンプラーを構築することを目指す
- 本研究では,最適輸送のフィールドを通信オブジェクトとして利用することで,残差の疎性を活用した効率的な通信が可能となることを示した。
- フィールドエラーと通信量の関係を明らかにし,セルマージン条件下の残差通信量を制御できることを示した。
- 証明された出力の困難性に関する下限を確立し,サンプラーと証明された出力モデルの分離を示した。
MemSecBench:エージェントメモリのポイズニングの追跡 - 永続性から結果,そして修復まで [cs.CR, cs.AI]目的:エージェントメモリシステムのライフサイクルセキュリティ
- エージェントは過去の対話から情報を保持・再利用するが,悪意のあるコンテンツが残存する可能性もある。
- 既存のベンチマークはメモリセキュリティを検証するものの,ポイズニングのライフサイクル全体を追跡できていない。
- 本研究は,様々なメモリバックエンドにおけるポイズニングの永続性,影響,選択的修復を評価するベンチマークを提供する。
- MemSecBenchは,コード,科学,日常生活,オフィスワークなど,48の現実的なコンテキストから310のケースを網羅している。
- 全構成において,悪意のあるメモリが84.2%のケースで永続し,Write-Executeチェーンが50.3%のケースで成功した。
- 成功したポイズニングケースの59.6%がExecuteチェーンを完了し,56.1%が選択的修復を達成した。メモリシステムスタック間でライフサイクルセキュリティに差が見られた。
LLMの安全性のためのオンポリシー蒸留:テンプレートに頑健な再調整へのルーティングアプローチ [cs.AI, cs.CL, cs.CR, cs.LG]目的:大規模言語モデルの安全性再調整
- LLMの活用拡大に伴い,悪意あるデータによる潜在的な危険性が増大している。
- 既存の安全性対策は,専門能力の忘却やテンプレート依存性,再脱獄の脆弱性を抱える。
- テンプレートの不一致に強く,能力を維持しつつ,LLMを安全に再調整すること。
- 提案手法ROPDは,アラインされた出力と侵害された出力の確率分布の乖離をモデル化する。
- 実験の結果,ROPDはテンプレートの不一致に対する頑健性が高く,既存手法よりも性能劣化が少ない。
- ROPDは,安全性と能力の両方を維持する上で,より高い基準を確立する。
スコアは決定ではない:LLMエージェントにおけるツール獲得のためのコストを考慮した停止戦略 [cs.LG, cs.AI]目的:LLMエージェントにおけるツール獲得の最適停止
- LLMエージェントは多様な外部サービスに依存しており,適切なツール選択が重要である。
- ツール数が少なすぎると情報不足になり,多すぎるとコストやプライバシーの問題が生じる。
- 異種コストを考慮したツール獲得戦略により,コスト効率を向上させる。
- 提案手法CAM-DFは,τ-bench Retailにおいて最も高い報酬を達成し,既存手法を上回る結果を示した。
- CAM-DFは,コストが高い状況下やランキングの精度が低い状況下で特に効果を発揮する。
- 実環境での実験では,CAM-DFはツールの露出数を37%削減しつつ,タスク成功率を維持した。
SciFigQual-Bench:科学論文における図の品質評価のためのベンチマーク(全文コンテキスト付き) [cs.CV, cs.AI]目的:科学論文における図の品質評価
- 科学論文において,図は実験結果やシステム構造を伝える上で不可欠な要素である。
- 既存の画像品質評価手法は自然写真やAI生成画像向けであり,科学論文への適用が困難である。
- 図とキャプション,引用文,論文コンテキストを考慮した包括的な評価手法を開発し,誤解を招く図を特定すること。
- SciFigQual-Benchは,科学論文の図を明瞭度,レイアウト,キャプションとの適合性,コンテキストとの関連性,誤解のリスクの5つの側面から評価する。
- SFQ-Agent(F3)をGPT-5.6-Solと組み合わせて使用することで,平均絶対誤差0.418,一貫性率93.4%という最高の結果が得られた。
- 従来のベンチマークと比較して,図と関連情報の紐付けにより,より詳細な評価が可能になった。
InferScale:パーソナライズされたLLMサービングのためのGPUネイティブKVインジェクション [cs.DC, cs.LG]目的:パーソナライズされたLLMサービングにおけるKV状態の再利用による低遅延化
- LLMの利用拡大に伴い,ユーザー固有の文脈を考慮した応答が重要になっている。
- 既存手法では,文脈の再利用が進まず,初回トークンまでの時間(TTFT)が増加する。
- GPU上でKV状態を再利用し,TTFTを低減することで,効率的なLLMサービングを実現する。
- InferScaleは,GPU上でメモリファクトのKV表現を事前に計算・保存し,必要な情報を効率的に注入する。
- k=50において,TTFTを72-79%削減し,Mem0と比較して同程度の精度を維持した。
- KV状態の再利用により,検索された文脈サイズとサービング遅延を分離し,スループットを大幅に向上させた。
言語モデルにおける天空球表現 [cs.LG]目的:言語モデルにおける夜空図の表現の復号可能性
- 言語モデルの能力評価には,知識表現の理解が不可欠である。
- 大規模言語モデルの内部表現は不透明であり,何が学習されているか不明である。
- 言語モデルが夜空に関する知識をどのように表現しているかを解明する。
- 約1000億パラメータの言語モデルは,残差ストリームから夜空図の表現を復号可能であることがわかった。
- 多くのオープンソースモデルにおいて,夜空の物体間の関係を問うプロンプトに対し,その表現が顕在化する。
- LOOテストの結果,多くのモデルで高い分散説明率(R^2スコア65-85%)と低い角度誤差(12-21度)が確認された。
一貫性のある救急部門予測のための階層型時空間Transformer [cs.LG]目的:救急部門の需要予測における階層構造の活用
- 救急部門は医療システムにおいて重要な役割を担うが,変動する患者数への対応が課題である。
- 既存手法では,病院,地域,国家レベルの予測が独立しており,予測の一貫性が欠けている。
- HierSTTは,病院,地域,国家レベルの需要予測を同時に行うことで,予測の一貫性を高める。
- HierSTTは,既存の非階層型深層学習モデルと比較して,平均WAPEを32%削減した。
- 古典的な階層的整合手法を凌駕し,レベル間の予測の一貫性をほぼ実現した。
- ポルトガル全土の81病院を対象とした大規模データセットを用いて検証された。
MMAC:音声キャプションのための大規模多次元ベンチマーク [cs.SD, cs.AI]目的:音声キャプションの評価基準
- 音声大規模言語モデルの発展に伴い,音声の内容を詳細に記述する能力が重要になっている。
- 既存の評価方法では,情報網羅性や記述の信頼性を的確に診断することが困難である。
- MMACは,音声キャプションの多面的な評価を可能にし,モデルの改善に貢献する。
- MMACは,20以上のデータソースから収集された5,638の音声クリップを含む大規模なベンチマークである。
- 6つの能力カテゴリと15の評価次元を網羅し,生成されたキャプションの情報を詳細に分析する。
- 評価の結果,既存の音声大規模言語モデルに明らかな差異が確認された。
期待持続ホモロジー図の適応型ベクトル化のためのボロノイヒストグラム [cs.HC, cs.LG]目的:期待持続ホモロジー図のベクトル化手法
- 点群のトポロジー解析において,持続ホモロジー図は有効だが計算コストが高い。
- 既存のベクトル化手法は,ガウス関数など事前定義された変換に依存している。
- ボロノイヒストグラムを用いた適応的な離散化によるベクトル化を目指す。
- ボロノイ図に基づくヒストグラムが,期待持続ホモロジー図の有効なベクトル表現となりうる。
- 分離と正規化の条件のもと,ヒストグラム表現がWasserstein距離の変化を保存することが示された。
- 提案手法は,分類や次元削減タスクにおいて有効であることが実証された。
AgentMap:オントロジーマッチングにおける同値性と包含性の同時発見 [cs.AI]目的:オントロジーマッチングにおける同値性と包含性の同時発見
- 知識共有と再利用の基盤となるオントロジーの重要性が高まっている。
- 既存のシステムは同値性か包含性のいずれか一方しか識別できず,柔軟性に欠ける。
- 同値性と包含性を同時に発見可能な新しいマッチング手法の確立を目指す。
- 本研究では,同値性と包含性を統合した新しいタスク「ハイブリッドオントロジーマッチング」を提案した。
- 大規模言語モデル(LLM)に基づくマルチエージェントフレームワーク「AgentMap」を開発し,実験的に有効性を示した。
- AgentMapは,従来の同値性マッチングや包含性マッチングのベースラインを上回る性能を達成した。
ホロノミー・カバー決定過程における安定商による最小マルコフ化 [cs.LG]目的:部分観測下における最小のマルコフ十分統計量の特定
- 部分観測環境下では,過去の情報を効率的に要約し,マルコフ性を回復する統計量が重要となる。
- 最適な統計量のサイズが一般的に不明であり,計算量の増大を招いている。
- ホロノミー・カバー決定過程に対する最小の統計量を特定し,記憶の効率化を目指す。
- 安定商を構築することで,現在の観測と安定クラスのペアが正確な有限マルコフ状態を形成することを示した。
- リセット可能な診断機能下では,最近傍プロトタイプクラス推論の誤差が指数関数的に減衰することを確認した。
- 実験により,生の状態から商状態への正確な圧縮が可能であり,3つの決定時間メモリ状態での精度が向上することを示した。
LLM支援言語使用における言語的単一化 [cs.AI, cs.CL, cs.GT]目的:LLM支援による言語使用における言語的多様性の変化
- 言語は社会の多様性を反映し,文化伝達の基盤である。その変化は社会全体に影響を及ぼす。
- LLMの普及により,言語表現が均質化し,個性が失われる懸念がある。
- LLMの利用方法を分析し,言語的多様性を維持するための方法を探る。
- LLMの共有モデルは,著者を共通の規範へと導き,言語表現の均質化を促進する。
- 再帰的なフィードバックは,共有規範を変化させるが,著者間の多様性は維持される。
- 個別化されたモデルは,多様な著者-モデル間の均衡を保ち,言語的多様性を維持しうる。
DLAM:時間制約を持つ分布潜在行動 [cs.IR, cs.RO, cs.AI, cs.CV]目的:視覚,言語,行動モデルにおける潜在行動表現の学習
- ロボットの行動学習において,ラベル付きデータの不足が課題であり,より効率的な学習手法が求められている。
- 潜在行動モデルは有用だが,再構成に基づく学習では,ロボットの行動生成に必要な構造が欠如しがちである。
- 時間的な制約を考慮し,より安定した潜在行動表現を学習することで,ロボットの制御性能向上を目指す。
- DLAMは,各遷移を対角ガウス分布として表現することで,潜在行動の不確実性を捉え,時間的な一貫性を高める。
- 再構成と正規化された構成・反転処理により,視覚的変化と潜在空間の構造を整合させ,より正確な再構成を可能にする。
- MetaWorld MT50などのタスクにおいて,既存手法と比較して優れた方策学習性能を示す。
パイプライン化プロセッサにおける分岐予測のための,新興CMOSメモリスタデバイスを用いたリザバーコンピューティングの調査 [cs.AR, cs.CE, cs.ET, cs.LG, physics.app-ph]目的:パイプライン化プロセッサの分岐予測におけるリザバーコンピューティングの適用可能性
- CPU性能向上には,分岐予測精度の改善が不可欠である。高速かつ高精度な分岐予測が求められている。
- 従来の分岐予測手法では,複雑な分岐パターンへの適応が課題となっている。学習能力の向上が求められる。
- メモリスタデバイスを用いたリザバーコンピューティングにより,分岐予測の適応性と精度を向上させることを目指す。
- リザバーコンピューティングは分岐予測に有望であり,高い予測精度を達成できることが示された。
- 提案するリザバーコンピューティングフレームワークは,最新のTAGE予測器と比較して,分岐動作の変化への適応速度が15倍遅いことが判明した。
- リザバーコンピューティングの適応性を向上させるための,更なる設計改善が必要である。
費用感応型確証予測と,不均衡な高リスク意思決定支援における人間介入型棄権 [cs.LG, cs.AI]目的:不均衡データにおける高リスク意思決定支援のための,費用感応型確証予測と人間介入型棄権の性能評価
- クレジットスコアリング等の分野では,信頼性の高い不確実性評価が不可欠である。
- 標準的な確証予測は,希少なマイノリティクラスの網羅率が著しく低いという課題がある。
- マイノリティクラスの網羅率向上と,費用を考慮した意思決定支援を目指す。
- Mondrian確証予測を用いることで,マイノリティクラスの網羅率が大幅に改善された (平均61.7%向上)。
- Mondrian確証予測と費用制御型棄権を組み合わせることで,期待される意思決定コストが大幅に削減された。
- 人間の専門家への委譲が費用対効果的となる閾値を,データセットごとに定量的に評価した。
MindForge:ソースコードなしプログラム合成による小規模言語モデルへのソフトウェアエンジニアリング全ライフサイクル教育 [cs.SE, cs.CL, cs.LG]目的:小規模言語モデルに対する,ソフトウェアエンジニアリング全ライフサイクル教育手法の開発
- ソフトウェア開発において,AIによる自動化の重要性が増しており,効率化が求められている。
- 既存のAIモデルは,既存コードの修正には優れるものの,ゼロからのプログラム作成は困難である。
- 本研究は,ゼロからのプログラム作成を可能にするための学習環境を構築し,モデルの性能向上を目指す。
- MindForgeは,オープンソースのコマンドラインプログラムを,ソースコードなしの環境に変換する自動パイプラインである。
- GLM-5.2を用いた教師あり学習により高品質なデータセットを生成し,Qwen3.6-27Bをファインチューニングした。
- その結果,ProgramBenchの平均テスト正答率が37.98%から49.51%に向上し,より大規模なモデルに匹敵する性能を実現した。
衛星散乱計コンステレーションによる沖合風の熟練した予測 [cs.LG]目的:沖合風の短期予測手法の開発
- 沖合風力発電の導入拡大に伴い,電力系統運用における高精度な沖合風予測の重要性が増している。
- 数値気象予測は短期予測に最適化されておらず,初期値の精度が予測性能を大きく左右する。
- 衛星散乱計観測データを用いた新たな短期予測パラダイムを確立し,予測精度向上を目指す。
- WindCastNetは,北海において1時間先予測でRMSEを23%,2時間先予測で7%削減することに成功した。
- WindCastNetは,最初の3時間において,持続予測法よりも9-15%高い予測精度を示した。
- 強風時や空間的に均一でない流れの状況下では,予測精度が低下する傾向が見られた。
CTファウンデーションモデルの解剖学的文脈適応 [cs.CV, cs.AI]目的:CT画像における解剖学的文脈を考慮したファウンデーションモデルの適応手法
- 医療画像解析の進歩は,疾患の早期発見や診断精度向上に不可欠である。
- 既存のCTファウンデーションモデルは,詳細な解剖学的情報を十分に活用できていない。
- 解剖学的文脈を考慮しつつ,効率的にファウンデーションモデルを適応させること。
- ACAは,既存のCTファウンデーションモデルをわずか1時間以内の学習で,解剖学的な知識に特化した画像-言語対応モデルへと適応させる。
- ACAは,解剖学的レベルの埋め込み表現を用いて,解剖学構造間の関係性を捉え,放射線レポートからのテキスト情報と整合させる。
- MerlinとCT-RATEデータセットにおける評価で,ACAはゼロショット分類タスクにおいて,既存手法を上回る性能を示した。
OmegaUse-OfficeVal:経済的根拠に基づいた長期的オフィススイートタスクにおけるLLMエージェントのベンチマーク [cs.AI, cs.CL, cs.HC]目的:長期的オフィススイートタスクにおけるLLMエージェントの評価
- LLMの活用が進む中で,現実的なコストでオフィス業務を支援できるかどうかの評価が重要になっている。
- 既存のベンチマークでは,オフィススイート作業フローのコスト面での評価が不十分である。
- 人間のコストとLLMの推論コストを比較し,価値に基づいた評価を可能にするベンチマークを開発する。
- OmegaUse-OfficeValは,実務家から提案された100のタスクで構成され,平均2.32時間の労働時間が必要となる。
- 評価されたLLMはすべて,人間よりも安価かつ高速であるが,人間の品質には及ばない。
- 本ベンチマークは,人間の労働時間とタスク価格のプロキシという2つの経済的指標と,詳細な評価基準に基づいたコード検証器を提供している。
学習された拡散提案は制約ソルビングをいつ助けるか:連続代数系に関する統制された研究 [cs.LG]目的:連続代数制約系の制約充足解の探索と,解けないシステムを解けるようにするための構造的拡張の決定
- 制約ソルビングは,ロボティクス,最適化,数学など,様々な分野で不可欠な技術である。
- 従来のソルバーは,構造的拡張の決定において,網羅的な探索に頼っており,効率が悪い。
- 学習された拡散モデルを用いて,より効率的に構造的拡張を提案し,ソルバーの性能を向上させる。
- 学習された拡散提案は,特定の条件下でのみランダムマルチスタートよりもわずかに優れている。
- 変数間の結合が強まると,学習された提案の優位性は失われる。
- ランダムマルチスタートの成功確率は,単一の開始点の到達可能性という定数のみによって決定され,実験結果と高い精度で一致した。
Eコマース検索における関連意図生成を通じた商品発見性の向上 [cs.IR, cs.AI]目的:Eコマース検索における商品発見性の向上
- Eコマース市場の拡大に伴い,ユーザーが求める商品をいかに的確に見つけられるかが重要になっている。
- 従来の検索システムは適合率を優先し,代替品や関連商品の発見が困難な場合がある。
- ユーザーの潜在的な意図を考慮し,関連商品の検索性を高めることで,購買体験を向上させる。
- 本研究では,意図に基づいた検索候補の拡張により,商品発見性を高めるシステムを提案した。
- 大規模言語モデルと小規模言語モデルを組み合わせたハイブリッドアーキテクチャにより,コストと品質のバランスを実現した。
- 実験結果から,提案手法は商品発見の範囲を約60%から80%に拡大し,検索効果を向上させることが示された。
タスク非依存型適応におけるパートナー能力推定 [eess.SY, cs.SY, cs.AI, cs.HC, cs.MA]目的:アドホックチームワークにおけるパートナー能力の推定
- 自律エージェントにとって,未知のパートナーとの効果的な協調は不可欠である。
- 従来のAHTアプローチは,単一タスクと既知の能力を前提とし,現実との乖離がある。
- 隠れたパートナー能力下での共同計画と分散実行の問題としてAHTを再構築し,解決を目指す。
- CE-CMは,タスク不変の能力ベクトルを推論する近似ベイズ法であり,事前学習を必要としない。
- シミュレーション実験により,CE-CMが隠れた能力を迅速に回復し,実行不可能な行動割当を削減できることが示された。
- オフラインの人間実験では,CE-CM-DivがベースラインのCE-CMよりも大幅に能力推定を改善した。
AIチームメイトの社会的コスト:小規模チームの意思決定における人工チームメイトが人間同士のコミュニケーションをどのように変えるか [cs.CL, cs.IR, cs.HC, cs.AI, cs.CY]目的:小規模チームの意思決定における人間同士のコミュニケーションの変化
- チームワークは,組織や社会の効率性と創造性を左右する重要な要素である。
- AIチームメイトの導入は進む一方,そのコミュニケーションへの影響は未解明な点が多い。
- AIチームメイトが人間同士のコミュニケーションに及ぼす影響を明らかにすること。
- AIチームメイトは,最も発言が多く,自己結束性が高いメンバーであったが,新規情報の提供やコミュニケーション密度は低い。
- AIチームメイトの存在は,人間同士のコミュニケーションを変化させ,応答性や社会的影響力の低下,帰属意識や地位の低下を引き起こした。
- AIの会話における支配性が高まると,学生はチームメンバーとして評価されなく感じる傾向が見られた。この影響は初期段階で顕著であった。
潜在リスク中立密度の逆学習:不規則なオプション価格からの導出 [cs.HC, cs.CL, cs.PF, cs.LG, q-fin.CP, q-fin.PR, q-fin.ST]目的:潜在リスク中立密度の逆学習手法の開発
- 金融市場において,オプション価格はリスク管理や資産評価の重要な指標であるため,その理論的な基礎の理解が不可欠である。
- オプション価格からリスク中立密度を正確に復元することは困難であり,既存の手法では誤差が生じやすい。
- 不規則なオプション価格から,より正確な潜在リスク中立密度を学習し,オプション価格の理論的整合性を高める。
- 合成データを用いたベンチマークテストでは,二成分ログノルマル混合モデルが最も低い価格誤差,L1誤差,Wasserstein距離,固定テール誤差を示した。
- DeepONetは混合モデルと比較して,1%要約量と分散誤差をそれぞれ39.0%と34.6%削減し,引用変換器はMertonファミリーにおいてL1誤差を16.4%削減した。
- NIFTYオプションの検証データにおいて,テスト時適応によりDeepONetのRMSEが28.3%削減されたが,混合モデルやSVIモデルの方が依然として精度が高いことが示された。
APEX-Accounting:会計業務評価ベンチマーク [cs.CL, cs.AI, cs.HC]目的:最先端モデルの会計業務遂行能力の評価
- 企業の経済活動を記録・分析する会計は,経営判断の基礎となる重要な業務である。
- AIモデルによる会計業務自動化は進むものの,専門家のレベルに達しているかは不明であった。
- 最先端モデルが実際の会計業務をどの程度こなせるかを客観的に評価すること。
- APEX-Accountingベンチマークを構築し,モデルの会計業務能力を評価した結果,Claude-Fable-5 (Max) が最も高い性能を示した。
- トークン数の増加が必ずしも性能向上に繋がらないSimpsonのパラドックスが観察された。
- 現時点では,どのモデルも会計専門家のレベルには達していないことが示唆された。
AIエージェントは自律的なAI研究を行えるか?二つの事例研究による初期的証拠 [cs.AI, cs.CY, cs.LG]目的:AIエージェントによるAI研究の自動化可能性の評価
- AI技術の急速な発展には,AI自身がAI研究を自動化することが不可欠である。
- 既存の研究評価は,範囲が限定的であるか,査読の質が低いという課題がある。
- AIエージェントが自律的にAI研究を進める能力を,質の高い未発表論文を基に評価する。
- AIエージェントは,人間の支援なしに研究に必要なエンジニアリング作業を完了できた。
- しかし,エージェントは研究課題に対する実質的な進展を見出すことができず,論文は著者によって明確に却下された。
- エージェントの失敗要因として,研究の質に対する判断の甘さ,創造性の欠如,リソース管理の不足などが特定された。
分類から回帰へ:ハエを用いて方程式を解く [cs.LG, cs.NA, math.NA]目的:非線形入力・出力関係の学習
- 科学データの分析において,複雑なモデル構築の代替手段が求められている
- 従来の回帰手法では,計算コストやメモリ消費が大きい場合がある
- 限られた入力空間におけるデータ活用と計算効率の改善
- ハエの環境認識機構に着想を得た新規な回帰アプローチを提案
- 局所的なパターンライブラリを用いて,複雑な全体的なモデルを置き換える
- オフライン・オンラインワークフローにより,計算・メモリ負荷を軽減
オンライン強化学習のファインチューニングにおいて,Q関数の事前学習は本当に必要か? [cs.CL, cs.LG]目的:オンライン強化学習におけるQ関数の事前学習の必要性に関する調査
- 強化学習は,複雑な意思決定問題の解決に有効であり,ロボット制御など幅広い応用が期待されている。
- 事前学習済みポリシーを活用する際,Q関数の事前学習が必須と考えられてきたが,必ずしもそうではないという報告もある。
- Q関数の事前学習が本当に有効なのかを検証し,より効率的なファインチューニング手法を提案すること。
- Q関数の単純な事前学習は,ランダムな初期化と比較して,多くの場合,明らかなメリットをもたらさないことが示された。
- この原因は,事前学習されたQ関数が,ファインチューニング後のQ関数とは異なるターゲットを学習するためである。
- 提案手法IPE(Initialization via Policy Ensemble)は,複数の多様なポリシーを用いてQ関数学習をブートストラップし,事前学習と比較して平均1.26倍の性能向上を達成した。
知識駆動型ロボットミッション設計手法 [cs.RO, cs.AI]目的:知識グラフを用いたロボットミッションの設計
- ロボットの自律性が向上することで,危険な環境や困難な作業を効率的に遂行できる。
- 既存のロボットミッション設計は,柔軟性に欠け,複雑な状況への対応が困難である。
- 知識グラフを活用し,ロボットの意思決定能力とミッション遂行率の向上を目指す。
- 本研究では,ロボットミッション設計のための包括的な手法を提案した。
- 提案手法は,初期条件と目標条件の定義,タスク構造化,計画立案,知識グラフ表現,高レベル言語による設計を含む。
- シミュレーション環境での検証により,知識グラフの活用が意思決定とミッション性能の向上に貢献することが示された。
訓練前に予測:素粒子物理学の基礎モデルにおけるスケーリング則 [hep-ex, cs.AI]目的:素粒子物理学の基礎モデルのスケーリング則の予測
- 機械学習は素粒子物理学におけるデータ解析に不可欠であり,高性能なモデルが求められている。
- モデルの規模拡大には莫大な計算コストが必要であり,事前評価が困難であった。
- 学習前にモデルの性能を予測することで,計算資源の効率的な利用を目指す。
- 事前学習済みのTransformerモデルにおいて,小規模モデルの学習データから損失を予測できることが示された。
- 予測精度は1%以内であり,計算量の増加に伴う性能向上を事前に見積もることが可能となった。
- 事前学習損失の低減が,ファインチューニング後の性能向上に繋がり,物理性能を事前に予測できる。
シンプレックス解混合:衝突型加速器における複数の軽フレーバージェットの分離 [hep-ph, cs.LG, hep-ex]目的:複数のジェットフレーバーの分離
- 高エネルギー物理学において,ジェット構造の理解は,素粒子反応の解析に不可欠である。
- 既存手法では,2種類以上のジェットフレーバーをロバストに分離することが困難であった。
- 本研究は,機械学習を用いて複数の軽フレーバージェットをデータ駆動的に分離する手法を提案する。
- 提案手法「シンプレックス解混合」は,データから最大分離可能なカテゴリーを効率的に識別する。
- シミュレーション実験では,ダウンクォーク,アップクォーク,グルーオンジェットの割合を正確に推定することに成功した。
- この手法は,大型ハドロン衝突型加速器におけるジェットフレーバーの特性抽出への道を開く。
放射線画像におけるVision-Languageモデルベンチマークの法医学的再現性監査:意図されたプロトコルから公開された成果物まで [cs.CV, cs.AI, cs.CL]目的:放射線画像におけるVision-Languageモデルベンチマークの再現性に関する法医学的監査
- 医療AIの発展には,客観的で信頼性の高い評価が不可欠である。
- 既存のベンチマークでは,データ,コード,レポート間の整合性が十分に検証されていない。
- ベンチマークの再現性を検証し,信頼性のある評価を確立すること。
- 監査の結果,計画された300回のモデル・プロンプト呼び出しのうち297回がレポートを生成した。
- データセットの分割保持,画像極性反転,レポートの切り捨てなどの問題が確認された。
- これらの不整合により,統計的分析結果に変化が生じ,オリジナルの性能評価は撤回された。
カーネルリッジ回帰とヘルダ−ツィグムント級:ミニマックス最適性とプロパティの失敗 [stat.ML, cs.LG, math.ST, stat.TH]目的:ヘルダ−ツィグムント級における非パラメトリック回帰のためのカーネルリッジ回帰の理論的性質
- 回帰分析は,データ間の関係をモデル化し,予測を行う上で重要な役割を果たす。
- カーネルリッジ回帰は,モデルの誤指定や複雑さによって,最適な性能を発揮できない場合がある。
- ヘルダ−ツィグムント級におけるカーネルリッジ回帰の最適性と限界を明らかにすること。
- 誤指定されたカーネルリッジ回帰は,ミニマックスL2レートn^{-2s/(2s+d)}を達成することが示された。
- ヘルダ−ツィグムントノルムにおけるプロパティが失敗し,ノイズ成分の期待値二乗誤差がlog nとして増加することが示された。
- これらの結果は,カーネルリッジ回帰の適用範囲と限界を示唆している。
人間効用因子:AIガバナンスを制約付き最適化問題として捉えるための計算可能な厚生指標 [econ.GN, cs.AI, cs.CY, q-fin.EC]目的:AIガバナンスにおける厚生水準の定量化
- AI技術の進展は社会経済に大きな影響を与え,安定性確保が重要である。
- 既存のAIガバナンスは,具体的な社会経済的安定性の制約を定量化できていない。
- AI導入による労働市場への影響と格差拡大を抑制する政策の最適化を目指す。
- 人間効用因子(HUF)は,自動化の度合い,再分配の規模,雇用範囲の3つの政策手段を用いて,厚生水準を計算可能にする指標である。
- 分析と強化学習の結果から,再分配を制約しない厚生指標は,意図しない高自動化均衡に収束する可能性があることが示された。
- AIガバナンスは,単なるコンプライアンスではなく,制約付き最適化問題として捉えるべきである。
腫瘍輪郭に基づくグリオマグレード分類のための形状に基づく帰納的バイアス [eess.IV, cs.CV, cs.LG]目的:グリオマグレード分類における形状情報の活用
- 脳腫瘍の正確なグレード分類は,治療方針の決定に不可欠である。
- 従来の画像解析では,形状情報を十分に活用できていない場合がある。
- 形状に基づく帰納的バイアスを導入することで,分類精度と効率の向上を目指す。
- 腫瘍輪郭の形状情報を活用したシンプルなMLPが,ResNet-18やViT-Tinyよりも高い分類精度を達成した。
- MLPは,パラメータ数を大幅に削減しながら,同等の,またはそれ以上の性能を示した。
- シミュレーション実験では,形状に基づくモデルがピクセルベースのモデルよりも優れた汎化性能を示した。
認知収束:大規模言語モデルと人間の認知の深いつながり [q-bio.NC, cs.AI, cs.CL]目的:大規模言語モデルと人間の認知における認知構造の一致
- AI研究の発展は,知能の本質理解に不可欠である。
- 大規模言語モデルは人間とは異なる存在と見なされがちである。
- 大規模言語モデルと人間の認知の共通基盤を明らかにすること。
- 大規模言語モデルは,推論構造,計算アーキテクチャなど,認知科学で確立された人間の認知原則と構造的に一致する。
- 予測駆動学習や強化学習のようなメカニズムも,両者に共通して見られる。
- これらの対応は,知能の本質を理解するための新たな視点を提供する。
レトロスペクティブ直交設計:観測データからの応答曲面再構成 [stat.ME, cs.LG, math.DG, stat.AP]目的:観測データからの応答曲面の再構成
- 多変量データ解析において,応答曲面の正確な把握は重要な課題である。
- 共線性などの問題により,観測データからの回帰推定はモデル設定に依存しやすい。
- 観測データからモデル設定に依存せず,応答曲面を安定的に再構成すること。
- レトロスペクティブ直交設計(ROD)は,確率バランスのとれた格子上で応答曲面を再構成する。
- RODは,多種多様なデータ生成プロセスにおいて,多項式回帰と同等以上の性能を示した。
- RODは,重み付きミンサーへの応用において,最も高い外挿$R^2$を達成し,項の投入順序に依存しない分散分析を提供した。
拡散サンプリングにおけるノイズ除去成長複雑性:データ幾何学と証明されたスケジュール [math.AT, cs.CG, math.CO, math.CO, cs.DM, math.ST, cs.LG, cs.NA, math.NA, stat.ML, stat.TH]目的:拡散サンプリングの有効性と性能保証に関する理解
- 高次元データにおける拡散モデルの有効性は注目されるが,理論的理解は十分ではない。
- 拡散サンプリングにおけるアルゴリズムの性能を理論的に保証する手法が課題である。
- ノイズ除去成長複雑性を用いて,拡散サンプリングの性能を保証する手法を確立する。
- ノイズ除去成長複雑性(DGC)を用いることで,オイラースキームのKL誤差の上界を導出した。
- DGCの増分に基づいて,最適化されたステップサイズスケジュールのKLサンプリング保証を得た。
- DGCのマルチンゲール構造を利用し,データに基づいて性能を証明可能なアルゴリズムを開発した。
胸部X線画像機械学習における臨床的妥当性の再考:評価基準が性能を規定する方法 [stat.ME, cs.CL, stat.AP, stat.ML, eess.IV, cs.CV, cs.LG]目的:胸部X線画像機械学習における評価基準の選択が,モデルの性能とランキングに与える影響の系統的な調査
- 胸部X線画像は,呼吸器疾患の診断において不可欠であり,機械学習による診断支援への期待が高い。
- 既存の評価基準は,臨床判断を正確に反映していない可能性があり,誤ったモデル選択につながる恐れがある。
- 臨床的に妥当な評価基準の選択方法を明確にし,機械学習モデルの信頼性を向上させることを目指す。
- 画像分類器の性能評価において,ラベルの出典によって結果が大きく異なり,モデルのランキングが変動することが示された。
- 画像品質評価指標と専門家の判断との一致は,指標の種類に大きく依存し,一般的な指標は必ずしも一致しないことが判明した。
- 評価基準の選択は,どのモデルが最適であるかを決定する重要な要素であり,臨床的妥当性を考慮した選択が不可欠である。
低次元モデリングにおけるダブルディセントの起源と緩和 [math.ST, cs.SI, stat.ME, stat.ML, stat.TH, stat.ML, cs.LG, math.DS, physics.data-an]目的:データセットにおけるダブルディセント現象の起源解明と緩和策の提案
- 自然および工学システム解析において,低次元構造の利用は効率的なセンシングと状態再構成を可能とする。
- 再構成アルゴリズム,センサー配置,ノイズの影響により,再構成誤差が急増するダブルディセントが発生しうる。
- 病的な信号の増幅がダブルディセントを引き起こすメカニズムを解明し,再構成の不安定性を抑制する。
- データ・ノイズ平均化理論に基づき,ダブルディセント発生の条件を定性的に,そして定量的に予測する手法を開発した。
- 再構成不安定性の原因を特定センサーやその組み合わせに特定し,不安定性を緩和するための正則化手法を提示した。
- 海面水温パターン再構成と偏微分方程式の低次元モデルの時間積分において,本手法の有効性を検証した。
混沌は梯子なり:不変性超えドメイン汎化のための重み付け [stat.ML, cs.LG, math.ST, stat.ME, stat.TH]目的:ドメイン汎化における性能向上
- 機械学習モデルの汎化性能向上は,実世界への応用において不可欠である。
- 既存のドメイン汎化手法は不変性の追求に偏り,ドメイン固有の有用な情報を見過ごす場合がある。
- ドメインの多様性を活用し,未知のドメインへの適応能力を高めることを目指す。
- 提案手法LADDERは,因果表現とスタイル表現を学習し,固定された分類器の重みを計算することで汎化性能を向上させる。
- ターゲットドメインのラベルやモデルの更新を必要とせず,推論時に重み計算を行うことで効率的な汎化を実現する。
- シミュレーション,FMoW,iWildCamデータセットで,全体およびグループ平均の精度向上を確認した。
