arXiv雑要約
画像・音声 - 2026/08/03 公開
マルチモーダル拡散Transformerにおける概念省略の診断と修正 [cs.CV]目的:マルチモーダル拡散Transformerにおける概念省略の診断と修正
- 画像生成技術は,芸術,デザイン,コミュニケーションなど多岐にわたる分野で応用が拡大している。
- テキストから画像を生成する際,指定された概念が画像に反映されない「概念省略」の問題が存在する。
- 生成画像における概念省略を軽減し,より忠実な画像生成を実現することを目指す。
- テキストトークンへの線形プローブにより,対象概念の不在を示す「省略シグナル」を識別できることを示した。
- この知見に基づき,省略シグナルを増幅することで,欠落した概念の生成を促進する「OSI」を提案した。
- FLUX.1-DevとSD3.5-Mediumでの実験により,OSIが極端なケースでも概念省略を大幅に軽減することが確認された。
MI-CXR:多間隔胸部X線画像における縦断的推論のためのベンチマーク [cs.CV]目的:多間隔胸部X線画像系列に対する縦断的推論の標準的な評価
- 医学画像診断の精度向上は,患者ケアの質に直結する重要な課題である。
- 既存のVQAベンチマークは単一画像に偏っており,時間経過に伴う変化の推論が困難である。
- 本研究は,複数回の胸部X線画像を用いて疾患の進行を正確に評価する手段を提供する。
- 現在の最先端のビジョン言語モデル14個を評価した結果,平均正答率は29.3%と低い。
- モデルは局所的には妥当な記述を生成するものの,時間的な制約を遵守したり,証拠を統合して一貫性のある判断を下すことが難しい。
- MI-CXRは,現在のモデルの限界を明らかにし,縦断的な医学的推論のための標準的なベンチマークとして機能する。
ビットが壊れた場合の対処法:反事実に基づいた忠実な量子化 [cs.LG, cs.AI, cs.CV]目的:量子化による意思決定への影響と,その改善策の提案
- モデルの量子化は,メモリ使用量や計算コストを削減し,実用化を促進する重要な技術である。
- 量子化によって,精度の維持だけでなく,意思決定に対する影響(反事実的な修正)が損なわれる可能性がある。
- 量子化による意思決定の反事実的な修正の不安定性を軽減し,より信頼性の高いシステムを構築すること。
- 本研究では,量子化されたモデルにおける反事実的な感度を評価するための指標(VD,CRG)を提案した。
- 提案手法CFQは,量子化と同時に反事実的な修正を考慮した学習を行い,VDとCRGを大幅に削減することを示した。
- Adultデータセットにおいて,CFQはVD/CRGを0.121/0.162から0.061/0.071へと改善した。
CompoSE:部品を意識した制御による3D形状の合成と編集 [cs.GR, cs.LG]目的:3D形状の合成と編集手法
- 高品質な3Dコンテンツの作成は,コンピュータグラフィックスにおける重要な課題である。
- 既存手法では,3D形状の局所的な編集が難しく,柔軟性に欠ける場合が多い。
- ユーザが指定した大まかな配置に基づいて,部品単位での編集を可能にすること。
- CompoSEは,拡散Transformerアーキテクチャを用いることで,部品ごとの局所処理と全体的な文脈情報の集約を交互に行う。
- ユーザの入力配置に強く従う新しい条件付け技術により,部品の意味や対称性を自動的に学習する。
- 実験結果から,CompoSEが既存手法よりも,ガイド付き合成において客観的評価およびLLMベースの評価で有意に高い性能を示すことが確認された。
DySink:自己回帰型長尺動画生成のための動的フレームシンク [cs.CV, cs.AI]目的:自己回帰型長尺動画生成における長期的な一貫性維持機構の改善
- 動画生成技術は,エンターテイメントやコンテンツ制作において重要性が増している。
- 既存手法では,長期的な文脈の固定的なキャッシュ管理が課題となっていた。
- 動的に関連性の高いフレームを選択することで,より適切な文脈を維持することを目指す。
- DySinkは,コンパクトなメモリバンクを用いて,視覚的に関連性の高い過去のフレームを動的に選択する。
- シンクアノマリゲートを導入することで,注意機構における過度な合意を抑制し,シンク崩壊を防ぐ。
- 50~100秒の動画実験において,DySinkは既存の自己回帰型ベースラインと比較して,最も高い時間的な品質を実現した。
PixIE:プロンプトによるピクセル空間低照度画像強調 [cs.CV]目的:低照度画像強調の性能向上
- 低照度画像はノイズが多く,コントラストが低いため,実用上の問題が多い。
- 既存手法では,ノイズ除去と詳細復元の両立が難しく,鮮明な画像を得ることが困難。
- ファウンデーションモデルを活用し,より自然で高画質な低照度画像強調を実現する。
- PixIEは,まずクロススケールノイズ除去を行い,構造を維持しつつノイズを抑制する。
- 次に,Prompted Pixel Blocks (PPBs)を用いて詳細を洗練させ,より鮮明なテクスチャを再現する。
- LOLv2-Realベンチマークにおいて,PSNR,SSIM,LPIPSの全てで最高性能を達成した。
ビデオ生成モデルに記憶を促す:視界外の状態変化に対する動的メモリの誘発 [cs.CV]目的:ビデオ世界のモデルにおける状態変化の記憶
- ビデオ生成モデルは,現実世界の理解と再現に不可欠であり,その性能向上が求められている。
- 既存のモデルは,視界外の状態変化を適切に扱えず,状態が固定されてしまうという課題がある。
- 中断された状態から過去の状態を想起し,動的にメモリを活用することで,この課題を解決することを目指す。
- ReMindフレームワークは,動的メモリ行動を誘発するためのデータ,訓練,キャッシュ適応戦略を提供する。
- STEVO-Benchおよびリカバリータスクにおいて,ReMindは最高の結果を達成した。
- 画像からビデオへの評価においても,ReMindのカリキュラムが破局的な忘却を防ぐことが確認された。
ビデオからの物理学:最小限の軌跡条件における時間不変な二階常微分方程式の識別可能性 [cs.CL, cs.HC, physics.data-an, cs.CV, cs.LG, stat.ML]目的:時間不変な二階常微分方程式のパラメータの識別可能性
- 映像から物理法則を理解することは,現実世界のモデル構築において不可欠である。
- 生のピクセルデータから物理パラメータを正確に復元することは困難である。
- 最小限の軌跡データから物理パラメータを識別するための条件を確立すること。
- レベルセット勾配カバレッジ条件は,潜在空間が真の物理状態に対して局所的にアフィンであることを保証する。
- 減衰の少ないシステムは単一のビデオクリップから識別可能であり,他のシステムは3つの多様な軌跡を必要とする。
- 分散下限正則化により,潜在空間の崩壊を防ぎ,物理定数の信頼性の高い推定を実現する。
FlexPath:学習された接続性ガイダンスを経路選好に適合させる [cs.CV]目的:経路探索における接続性ガイダンスの学習と,その目的関数への適合
- ロボットの自律的な経路計画は,効率的かつ安全な移動に不可欠であり,その性能向上は重要な課題である。
- 既存の学習に基づく経路計画手法は,特定の最適化目標(最短経路など)に限定され,柔軟性に欠けるという課題がある。
- 本研究は,異なる経路選好(安全性,ウェイポイント追従など)に容易に適応可能な経路計画手法を開発することを目的とする。
- FlexPathは,最短経路計画の性能を向上させ,TMPにおいて最適な経路の発見率を75.0%から88.6%に改善した。
- FlexPathは,探索回数を13.8%削減し,経路探索の効率性を高めた。
- 本手法は,最短経路以外の目標(障害物回避距離,クラス条件付き回避距離,ウェイポイント追従)への適応も可能であり,高い成功率を示した。
拡散画像編集のための二重専門家軌跡:DuET [cs.CV]目的:拡散モデルによる画像編集における軌跡の制御手法
- 画像編集技術は,創造的な表現や実用的な応用において重要であり,その品質向上は求められている。
- 既存の拡散編集では,原画像への強い依存が編集の自由度や自然さを制限する可能性がある。
- DuETは,一時的に原画像への依存を弱めることで,より自然で高品質な編集を実現することを目指す。
- DuETは,モデルの重みを変更したり,サンプリングコストを増加させたりすることなく,編集の関連性,意味の忠実性,知覚的な品質を向上させる。
- 固定された切り替えスケジュールによって,DuETは原画像の保存度をわずかに犠牲にしながら,上記の改善を実現する。この犠牲は本質的なものではないことが示されている。
- 編集ごとに軌跡を制御するSelective DuETは,軽量な注意プローブ信号を利用することで,忠実度,自然さ,アーティファクトのスコアを向上させ,原画像の保存度を維持する。
現実に基づいたアンカリング:メイクアップ転送における疑似ターゲット上限の打破 [cs.CV]目的:メイクアップ転送における高精度なスタイル適用
- 顔画像処理技術は,美容関連分野での応用が期待され,その重要性が増している。
- 現実のペアデータ不足が課題であり,既存手法は弱い事前情報や合成データに依存している。
- 現実の参照画像に基づき,詳細なメイクアップを高品質に転送することを目指す。
- 提案手法ARTは,疑似ターゲットから現実の参照画像へ supervision を移行する二段階構造を採用した。
- ARTは,詳細なディテールを維持し,合成的なアーティファクトや ID のずれを抑制することに成功した。
- 高解像度データセット MakeupFaces2K (MF2K) を新たに構築し,その有効性を示した。
分割不可能なアイテムの公平な割り当て学習:限定的なフィードバックからのアプローチ [cs.GT]目的:分割不可能なアイテムの公平な割り当て
- 資源配分は,社会経済活動における重要な課題であり,公正性の確保が不可欠である。
- 評価情報を事前に得られない状況下では,公平な割り当てを効率的に見つけることが困難である。
- 限定的なフィードバックから学習し,効率的に公平な割り当てを達成することを目指す。
- 評価が加法的な場合,EF1またはPROP1を満たす割り当てを多項式時間で発見できることが示された。
- 候補となる評価の多面体を維持するフレームワークと,楕円体法の模倣により実現される。
- 評価が単調な場合,EF1を満たす割り当てを多項式回数の反復で見つけるアルゴリズムが提示された。
アンチプロンプト:テキスト誘導画像-動画生成に対する画像保護 [cs.CL, cs.CV]目的:画像保護手法の開発
- 画像から動画を生成する技術が発展し,プライバシー侵害や著作権侵害のリスクが高まっている。
- 既存の手法では,生成された動画の品質を維持しつつ,画像を効果的に保護することが困難である。
- テキスト誘導型画像-動画生成モデルにおけるテキスト依存性を悪用し,画像保護を実現する。
- 提案手法「アンチプロンプト」は,画像に知覚できない摂動を加えることで,生成される動画に目に見える不整合を引き起こし,構造的な失敗を誘発する。
- テキスト誘導を除去すると,現代の画像-動画生成モデルの品質が大幅に低下することに着目し,その弱点を突くことで画像保護を実現する。
- 2つの代表的な画像-動画生成アーキテクチャにおいて,高い保護性能,効率性,およびモデル間の転移性を実証した。
MolSight:分子画像理解のためのグラフ認識型ビジョン言語モデル [cs.CV, cs.AI, q-bio.BM]目的:分子構造と機能の統一的な理解
- 創薬や分子設計において,分子構造の理解は不可欠である。
- 既存のモデルは分子構造の視覚的表現を十分に捉えきれていない。
- 分子画像の理解における構造的アラインメントとトポロジーモデリングの課題解決。
- MolSightは,既存のVLM,分子LLM,タスク固有モデルを大幅に上回る性能を示した。
- 分子トポロジーモジュールが,視覚トークンに化学結合隣接情報を注入することで,理解を向上させている。
- 分子画像と化学記号の意味論をアラインメントする分子グラウンディングモジュールも有効である。
BeatEdit:明示的な編集による記号音楽生成 [cs.SD, cs.AI]目的:記号音楽生成における明示的な編集操作のフレームワーク
- 音楽制作は修正の繰り返しであり,音楽生成においても同様のアプローチが求められている。
- 既存の記号音楽生成手法は,最初からシーケンスを生成するものが多く,選択的な修正が困難である。
- BEATエンコーディングの構造的特性を活用し,編集操作に基づく音楽生成を実現する。
- BeatEditは,楽譜を最初から生成するのではなく,下書きを編集することで新しいコンテンツを生成する。
- エラー修正,伴奏編集,セグメント補完といった編集密度に応じた3つのメカニズムを搭載している。
- これらのメカニズムは単一のエンコーディングと事前学習済みバックボーンを共有し,高い精度と知覚品質を実現した。
事後分散は制約マップであり,誤差マップではない:疎視点CTにおける放射ガウススプラッティングの閉形式不確実性 [eess.SY, cs.SY, cs.CE, cs.CV]目的:疎視点CTにおける放射ガウススプラッティングの不確実性評価方法の改善
- CT画像再構成は医療診断において不可欠であり,高品質な再構成と不確実性評価が求められる。
- 従来の不確実性評価は誤差を正確に反映せず,臨床的判断を誤らせる可能性がある。
- 事後分散を制約マップとして捉え,より正確な不確実性評価を実現することを目指す。
- 事後分散は,データ制約を示すマップであり,誤差を示すマップではないことが示された。
- 物体内部における誤差の大部分は,再学習でも再現されるバイアスであり,モデル間の不一致では捉えられない。
- 事後分布の再パラメータ化により,シーン間の温度ばらつきを大幅に縮小し,未知のシーンへの転移が可能となった。
AuEmoChat:対話音声合成における真実性のある感情理解と表現 [cs.SD, cs.AI]目的:対話音声における,人間らしい感情表現と文脈の一貫性の実現
- 対話システムにおいて,より自然なコミュニケーションを可能にするため,感情豊かな音声合成が重要である。
- 既存手法では,感情ラベルの種類の制限や,対話履歴の冗長性により,真実味のある感情表現が困難である。
- 本研究は,大規模な感情音声からより多様で自然な感情表現を学習し,文脈理解を向上させることを目指す。
- 提案手法AuEmoChatは,NCSSD-EmCapデータセットにおいて,最先端の対話音声合成手法を上回る性能を示した。
- AuEmoCodecにより,より真実味のある感情トークン空間を学習し,感情表現の幅を広げた。
- AuEmoToMeは,対話履歴の冗長性を削減しつつ,感情に関する重要な文脈を維持する。
入力依存性長畳み込みによるネイティブ多次元準二次演算子 [cs.LG, cs.CV, stat.ML]目的:多次元データに対する準二次演算子の実現
- Transformer等のAttention機構は強力だが,計算コストが高い。効率的な代替手法が求められている。
- 従来の畳み込みは受容野が局所的で,入力依存性も弱く,多次元データの構造を活かせない。
- 多次元データのネイティブな形状上で作用する,入力依存性の高い準二次演算子を開発する。
- HyenaNDは,多次元データのネイティブな形状上で直接作用する,入力依存性の高い準二次演算子である。
- CUDA実装nSubQにより,HyenaNDの計算効率が向上し,実用的な速度を実現した。
- ゲノミクス,画像処理,医療画像,偏微分方程式モデリングなど,幅広い分野でAttentionと同等の精度を達成した。
ElasticTTT:ビデオ編集のための事前分布維持テスト時チューニング [cs.CV, cs.AI]目的:ビデオ編集における事前学習済み拡散モデルのテスト時チューニング手法
- ビデオ編集技術は,映像コンテンツ制作において不可欠であり,その効率化と品質向上は重要な課題である。
- 既存のテスト時チューニングは,生成モデルの特性と最適化方法の不一致により,期待される編集効果が得られない場合がある。
- 事前分布を維持し,生成の柔軟性を回復させることで,高品質なビデオ編集を実現することを目標とする。
- ElasticTTTは,ターゲット分布正則化,コントラストCFG,非同期ノイズスケジュールを導入することで,事前分布の崩壊を防ぐ。
- 理論的分析と広範な評価により,ElasticTTTがベースモデルの生成事前分布を効果的に維持することが示された。
- ワンショットビデオ編集において,最先端の性能を達成し,既存手法を上回る結果を得ている。
OmniVAE:クロスモーダルアラインメントを用いた音声・映像同時生成のための変分オートエンコーダ [cs.SD, cs.CV]目的:音声と映像の同時生成における,細粒度のクロスモーダル対応
- 近年,音声や映像の単独生成から,同期した音声と映像の同時生成へと研究が進んでいる。
- 既存手法では,音声と映像の潜在空間がアラインメントされておらず,クロスモーダル同期学習が困難である。
- 音声と映像の潜在表現間の意味的なアラインメントを学習し,クロスモーダル同期の精度向上を目指す。
- OmniVAEは,音声と映像を同時に学習する変分オートエンコーダであり,潜在空間間のアラインメントを実現する。
- セグメントレベルでの音声・映像コントラスト学習により,時間的・意味的な対応関係を捉え,潜在空間をアラインメントする。
- 事前学習済みのモダリティ特有のセマンティックエンコーダからの特徴蒸留により,潜在空間の学習性を向上させている。
FORGE:長編ビデオ理解のための関連性幾何におけるフレーム直交性 [cs.CV, cs.LG]目的:長編ビデオにおけるクエリに関連する情報の最大化
- ビデオ理解は,多様な応用において不可欠であり,その重要性は増している。
- 長編ビデオでは,関連コンテンツ密度が低下し,モデルの精度が低下しやすい。
- 推論時に選択するフレームサブセットにおいて,関連性と多様性を両立することを目指す。
- FORGEは,既存の強化学習を用いないベースラインと比較して,キーフレーム選択スコアを11.0~15.3ポイント向上させた。
- キーフレーム再現率は最大で2倍に向上(Video-MMEのK=64で0.415対0.204)。
- 質疑応答タスクにおいても,40億~320億パラメータの8つのMLLMで精度が向上し,最大8.7ポイントの改善が見られた。
顕著性駆動プロトタイプアラインメントに基づくデータセット蒸留 [cs.CV]目的:コンパクトなデータセットの合成
- データセットの規模縮小は計算コストとストレージコストの大幅な削減に貢献する。
- 拡散モデルを用いた蒸留法では,構造的な整合性や汎化性能の維持が課題となる。
- クラス識別領域とのアラインメントが弱いプロトタイプの問題を解決する。
- 本研究では,顕著性に基づく蒸留フレームワークを提案し,クラス識別的な潜在プロトタイプを構築することで表現性と汎化性能を向上させた。
- Grad-CAM++を用いてクラス識別領域を強調したプロトタイプを構築し,その後にハードプロトタイプによる洗練を行うことで,識別性と多様性を高めた。
- 拡散モデル自体は固定し,顕著性抽出のための軽量な分類器のみを学習することで効率的な学習を実現した。複数のベンチマークで既存手法を上回る性能を実証した。
3以下の歪みを持つ距離的投票における感度と差分プライバシー [cs.GT, cs.DS]目的:距離的投票における感度と差分プライバシーのトレードオフに関する研究
- 投票ルールは集団的意思決定の基礎であり,公平性やプライバシー保護が重要となる。
- 既存の投票ルールは,歪み,感度,プライバシーのバランスが課題であった。
- 歪みを3以下に保ちつつ,感度と差分プライバシーを両立するルールを構築すること。
- 歪み3-εを達成するランダム化ルールを提案し,感度をO((\log m+1)/n)に抑えた。
- 差分プライバシー(O((\log m+\log(1/\delta)+1)/n),\delta)を満たすルールを構築した。
- 両方の構成は,温度パラメータのみが異なるギブス分布を用いる。
継続的指示チューニングのための漸進的マルチモーダルアライメント [cs.CV, cs.AI]目的:マルチモーダル大規模言語モデルにおけるプロジェクターのドリフト軽減
- マルチモーダル大規模言語モデルの性能は,視覚情報と言語の意味を一致させるプロジェクターに大きく依存する。
- 継続的な指示チューニングにおいて,視覚分布や指示の意味の変化により,プロジェクターが過去の知識を忘却しやすい。
- プロジェクターのドリフトを抑制し,既存の知識を維持しながら適応することで,継続学習の性能向上を目指す。
- 提案手法PMAは,軽量な表現記述子を用いてマルチモーダル分布の変化を検出し,必要に応じてプロジェクターのエキスパートを漸進的に拡張する。
- PMAは,エキスパートの出力をマルチモーダル特徴に基づいて統合し,事前学習済みのプロジェクターを安定した基準点として保持する。
- 実験結果から,PMAを既存の継続的指示チューニング手法に組み合わせることで,一貫して性能向上が確認された。
InkShield:不正な筆跡模倣に対する筆跡スタイル保護 [cs.CR, cs.CV]目的:筆跡スタイルの不正な模倣に対する防御策の開発
- 筆跡は個人識別情報であり,重要な法的証拠となりうるため,その保護は不可欠である。
- 公開された筆跡サンプルからスタイルを再現する技術が進歩し,文書偽造のリスクが高まっている。
- 公開前に筆跡画像を改変することで,不正なスタイル模倣を防止することを目指す。
- InkShieldは,デコイライターを利用し,筆跡生成モデルを用いて,筆跡の縁部に沿って微小な摂動を加える。
- その結果,生成されたサンプルが元の筆跡と誤認される確率を大幅に低下させることが確認された。
- 保護された筆跡画像は元の画像と視覚的にほぼ同等であり,テキストの可読性も維持されている。
DINOv3特徴のステップ注意洗練による効率的な前眼部セグメンテーション [cs.CV]目的:前眼部セグメンテーションのロバスト性と汎化性能の向上
- 眼計測や臨床画像解析において,前眼部セグメンテーションは不可欠な技術である。
- 医療現場では,多様な画像取得条件や注釈の少なさから,既存手法の汎化性能が課題となっている。
- 事前学習済みモデルDINOv3を効率的に活用し,セグメンテーションタスクに適応させることを目指す。
- 提案手法は,臨床画像333枚を用いた実験で,既存手法を上回る最高の性能(mIoU 85.55%)を達成した。
- 特に,4つの公開データセットを用いた評価において,ドメインシフトに対する高いロバスト性を示した。
- 本研究は,臨床環境における前眼部セグメンテーションの強力なベースラインを確立し,事前学習済みモデルの活用におけるデコーダ設計の重要性を示唆する。
AI生成音楽検出の堅牢性の向上 [cs.SD]目的:AI生成音楽の検出における堅牢性向上
- 音楽制作におけるAI活用が拡大する中で,生成された音楽の真偽判定は重要性を増している。
- 既存の検出器は単純な音声操作によって容易に回避可能であり,実用上の課題となっていた。
- 音声操作に対する耐性を設計段階から組み込み,より実用的な検出手法を開発する。
- 提案手法では,対数周波数軸へのマッピングと交差相関フィルタを組み合わせることで,周波数スケーリングに対する不変性を実現した。
- バイナリ検出とアーティファクトピークの局在化を共同で学習するハイブリッド損失関数を用いることで,検出精度と堅牢性を両立した。
- 速度変化に対する耐性を設計に組み込んだことで,検出結果と速度変化係数の推定を同時に行うことが可能となった。
RIPPLE:位相を生成する,復元しない [cs.LG, cs.SD]目的:多チャンネル波形の位相生成手法
- 空間音響や地震波など,多チャンネル信号の物理的情報は位相関係に内在する。
- 既存手法はチャンネルごとに位相を復元するため,チャンネル間位相の情報を損失する。
- チャンネル間位相関係を考慮した位相生成により,信号の品質向上を目指す。
- RIPPLEはGriffin-Lim法を位相事前分布として再解釈し,チャンネル間構造を保存する。
- 空間音響と地震波の分野で,既存の復元手法と比較して一貫して高い性能を示した。
- 地震波におけるS波偏波誤差を,ランダムな水準から大幅に低減することに成功した。
話者埋め込みガイダンスによる拡散モデルを用いた教師なし単一チャンネル音声分離 [eess.AS, cs.SD]目的:教師なし単一チャンネル音声分離の実現
- 音声処理の基礎課題であり,多様な応用への貢献が期待される。
- 実環境の音声データに対する汎化性能が課題となっていた。
- 話者の一貫性を保ちつつ分離性能を向上させることを目指す。
- 話者埋め込みガイダンスにより,分離音声における話者の一貫性が向上した。
- 分離に特化したソルバーを用いることで,分離性能が大幅に改善された。
- 提案手法は,教師なし音声分離において優れた性能を示した。
長方形部屋における一般的な表面インピーダンス壁での音響グリーン関数評価 [eess.AS, cs.CE, cs.SD]目的:長方形部屋における音響グリーン関数の計算手法
- 音響設計や騒音制御において,部屋の音響特性を正確に把握することは重要である。
- 壁面吸収が無視できない場合,既存の解析手法では音響グリーン関数を正確に算出することが困難である。
- 壁面吸収を考慮した,より一般的な境界条件に対応できる音響グリーン関数の計算手法を開発する。
- 本研究では,柔らかい壁面の一次漸近近似を導入することで,既存の研究を拡張した。
- 効率的かつ信頼性の高い半解析的手法を提案し,数値試験によってその有効性を検証した。
- 十分な切断次数を用いることで誤差が急速に減少するため,数値シミュレーションのベンチマークとして利用可能である。
TimeRFT:強化学習による時間系列予測モデルの汎化性能向上 [math.OC, cs.SY, eess.SP, eess.SY, math.OC, cs.SY, eess.SY, eess.SP, cs.AI, cs.CV, cs.LG]目的:時間系列予測モデルの汎化性能向上
- 時間系列データは多様な分野で重要であり,正確な予測は意思決定に不可欠である。
- 既存の時間系列予測モデルは,データ分布の変化やデータ量の制約により汎化性能が低い場合がある。
- 本研究は,強化学習を用いて時間系列予測モデルの汎化性能を向上させることを目指す。
- TimeRFTは,予測ステップごとの貢献度を評価する報酬メカニズムと,汎化性能の高いデータを選択する戦略を導入する。
- 多様な実データによる実験の結果,TimeRFTは既存の教師ありファインチューニング法を上回り,高い予測精度と汎化性能を示すことが確認された。
- TimeRFTは,未知のデータ分布に対するロバスト性も向上しており,実用的な時間系列予測に貢献できると考えられる。
