arXiv雑要約

画像・音声 - 2026/08/05 公開

  • ノイズに頑健な条件付きフローマッチング:ノイズの多いデータセットからのクリーンなサンプルの生成 [cs.CV]目的:ノイズの多いデータセットからのクリーンなサンプル生成手法
    • 生成モデルの性能は学習データの質に依存する。高品質な生成にはクリーンで代表的なデータセットが不可欠である。
    • 科学的画像処理において,ノイズの多いデータしか得られない場合が多く,クリーンな参照データの収集は困難である。
    • ノイズの多いデータから直接クリーンなデータ分布を学習し,高品質な画像生成を可能にすることを目指す。
    • 提案手法NR-CFMは,加法性ホワイトガウスノイズに対して閉形式のクリーンエンドポイント補正を提供する。
    • NR-CFMは,より複雑な共分散構造を持つ一般的なガウス腐敗に対して,データ駆動型の補正を学習する。
    • 低いSNR(0.001)の科学的データにおいても,NR-CFMは現実的な粒子画像を生成することが示された。

    Link: https://arxiv.org/abs/2608.00064

  • K空間ガウス表現による並列MRI [cs.CV]目的:K空間信号の連続的な表現
    • MRIは医療診断において不可欠であり,高速化は臨床的有用性を高める上で重要である。
    • 従来のK空間再構成は離散的な格子に基づき,連続信号の性質を十分に考慮できていない。
    • K空間の連続的な表現を通して,より正確な信号再構成を実現することを目的とする。
    • 提案手法KGRは,K空間信号をガウス関数で表現することで,連続的な信号モデルを導入した。
    • 低ランク多様体への射影により,多コイル信号の位相特性や相関性を適切に保持した。
    • 様々なデータセットで,既存手法と比較して定量評価および視覚的品質において改善が確認された。

    Link: https://arxiv.org/abs/2608.00075

  • どのモダリティが決定するか:マルチモーダルLLMの反事実的モダリティ帰属 [cs.CV, cs.AI]目的:マルチモーダルLLMにおけるモダリティレベルの貢献度評価
    • 画像とテキストを組み合わせるマルチモーダルLLMは,重要な意思決定を支援する。
    • 既存の説明手法では,予測の根拠となるモダリティを特定できない。
    • モデルが誤った根拠で正しい出力を生成する問題を解決する。
    • CMAは,制御された合成ベンチマークにおいて,決定を主導するモダリティを98%の精度で特定した。
    • CMAはベースラインモデルを上回り,予測精度だけでは見えないクロスモーダル推論の失敗を明らかにした。
    • モダリティ帰属は,特徴帰属に加えて,マルチモーダルLLMの安全性評価に不可欠な要素である。

    Link: https://arxiv.org/abs/2608.00076

  • 精度を超えて:OCR 重要な MLLM 推論のための視覚トークンプルーニングにおける空間的起源の監査 [cs.CV]目的:視覚トークンプルーニングにおける空間的起源の監査
    • マルチモーダル大規模言語モデルは画像とテキストを処理するため,その性能向上は重要な課題である。
    • 従来の評価指標では,OCR領域との関連性に着目せず,正答率のみに注力することがある。
    • 視覚トークンをプルーニングする際に,OCR領域との関連性を考慮し,リスクを評価する手法を提案する。
    • 視覚トークンプルーニングにおいて,Qwen Target は 30% の保持率で高い精度を維持し,Fullモデルと同等の性能を示した。
    • しかし,同じ保持率でも,Target,Random,Gridでは正答を支持する空間的範囲に大きな差が見られた。
    • 視覚トークンプルーニングは,精度だけでなく,空間的起源とコストを報告する必要があることが示された。

    Link: https://arxiv.org/abs/2608.00077

  • ビデオモデルをネイティブな4Dレンダラーとして:アニメーションメッシュからのワールドグラウンデッドな条件付け [cs.CV]目的:4D生成レンダリングにおける画像形式の条件付け
    • ビデオ生成技術は,現実世界の描写に不可欠であり,その高品質化が求められている。
    • 既存手法では,カメラの動きとシーン内部のアニメーションを両立したレンダリングが困難であった。
    • アニメーションメッシュを活用し,カメラと幾何学情報を統合することで,より自然なレンダリングを実現する。
    • 提案手法DARは,LoRAによる微調整でPSNR 23.22,SSIM 0.895,LPIPS 0.134を達成し,Wan2.2-Depthよりも1.54dB PSNRが向上した。
    • フルファインチューニングでは,PSNR 25.36,SSIM 0.917に達し,レンダリング品質がさらに向上した。
    • ワールドポジションを深度に置き換えるとPSNRが低下し,トラッキングとワールドポジションの対応が有効であることが示された。

    Link: https://arxiv.org/abs/2608.00094

  • LLM-OSDA:多段階LLM会話におけるネイティブ広告のための最適停止動的オークション [cs.CL, cs.AI, cs.GT, cs.LG]目的:多段階LLM会話におけるネイティブ広告のための最適停止動的オークションの提案
    • LLMの会話能力向上に伴い,広告配信の新たな形としてネイティブ広告が注目されている。
    • 従来の広告オークションは固定スロットが基本であり,会話の流れに合わせた広告タイミングの最適化が課題である。
    • 会話の進行に応じて最適なタイミングで広告配信を行い,収益性とユーザー体験を両立することを目指す。
    • LLM-OSDAは,ベルマン最適停止理論,落札者決定,エンベロープ価格設定を統合した動的オークションである。
    • 理論上,広告主の入札額に応じて期待割引クリック数が増加し,真実な入札が弱支配戦略となることが示された。
    • シミュレーション実験により,LLM-OSDAが既存手法と比較してネット収益を11%向上させ,ユーザー維持率も同程度に保たれることが確認された。

    Link: https://arxiv.org/abs/2608.00123

  • アクセシブルな学習のための数学画像記述データセット:MIDAL [cs.CV, cs.HC]目的:アクセシブルな学習を支援するための数学画像記述データセット
    • STEM教育における教材へのアクセス性は重要であり,特に視覚障害者への配慮が不可欠である。
    • 数学などの分野では,複雑な数式や記号が多く,適切な画像記述が困難である。
    • 数学画像の自動記述を通じて,STEM教材のアクセシビリティ向上を目指す。
    • 2020枚の数学画像からなるデータセットMIDALを構築し,視覚言語モデルの学習に活用する。
    • このデータセットは,数学的推論能力や問題解決能力の向上にも寄与する可能性がある。
    • MIDALは,高等教育におけるSTEMコンテンツのアクセシビリティに関する議論と革新を促進する貴重な資源となる。

    Link: https://arxiv.org/abs/2608.00868

  • MiniWorld:ビデオワールドモデルのゼロからの訓練の民主化 [cs.IR, cs.CL, cs.NI, cs.CV]目的:ビデオワールドモデルのゼロからの訓練のための再現可能なフレームワーク
    • 近年,環境との相互作用を伴うAI研究が盛んであり,そのためのシミュレーション技術の重要性が増している。
    • 既存のビデオ生成モデルは,計算資源を必要とし,双方向学習と因果ストリーミング推論のミスマッチが課題である。
    • 軽量かつ再現性のある基盤を提供し,ビデオワールドモデリング研究を促進することを目指す。
    • MiniWorldは,ブロック因果Video Diffusion TransformerとFlow Matchingを組み合わせたフレームワークである。
    • Diffusion Forcingを用いたノイズスケジュールと二段階の継続学習により,時間モデリングと安定性を向上させている。
    • 単一の8-GPUサーバーで数日以内に訓練可能であり,コードと事前学習済みチェックポイントを公開している。

    Link: https://arxiv.org/abs/2608.01127

  • 森林から未来の首都へ:PlanetScope画像によるイブ・コタ・ヌサンタラ(IKN)の土地被覆変化の追跡(2021年~2026年) [cs.CV]目的:イブ・コタ・ヌサンタラの土地利用と植生被覆の変化の評価
    • 都市開発は環境に大きな影響を与えるため,そのモニタリングは重要である。
    • 大規模開発における森林減少や炭素蓄積量の変化の正確な把握が課題である。
    • IKNにおける土地被覆変化を定量的に把握し,環境影響評価に貢献すること。
    • 2021年から2026年の間に,IKNの中心政府エリア(KIPP)において著しい環境変化が確認された。
    • NDVI(植生指標)は平均17.1%減少し,炭素蓄積量は0.28%減少,開発地は672%増加,植生は18.1%減少した。
    • 2023年から2024年の間に植生損失が最も顕著であり,造成工事のペース低下により一時的な回復が見られた。

    Link: https://arxiv.org/abs/2608.01230

  • 人間の行う画像融合のランキング:赤外・可視融合評価のための学習されたペアワイズ選好指標 [cs.CV, cs.AI]目的:赤外・可視画像融合アルゴリズムのランキング評価のための,人間がペアで行う選好を学習した指標の開発
    • 赤外・可視画像融合は,安全保障,医療,監視など,多くの分野で重要な役割を担っている。
    • 理想的な融合参照画像が存在しないため,アルゴリズムのランキングは客観指標に依存しており,人間の判断との乖離が生じやすい。
    • 人間の選好をより正確に反映した指標を開発し,融合アルゴリズムの評価を改善することを目指す。
    • 学習された指標LPIFMは,赤外画像,可視画像,2つの融合候補画像を入力とし,どちらの候補が優れているかを予測する。
    • LPIFMは,人間のペアワイズ比較に基づいた評価プロトコルを再現性のある形で実現し,従来の客観指標よりも高い精度で人間の判断と一致する。
    • 評価データセット,モデル,ソースコードを公開することで,人間が選好に基づいた画像融合評価を容易にする。

    Link: https://arxiv.org/abs/2608.01301

  • 平均報酬保証付き交代時間テンポラルロジック [cs.LO, cs.GT, cs.MA]目的:戦略的・定量的な推論の組み合わせ可能性
    • 多重エージェントシステムにおける協調行動や資源配分を検証する上で重要である。
    • 長期的な報酬を考慮した検証は計算量が膨大になり,実用性に課題がある。
    • 平均報酬の制約を満たしつつ,時間的な目的を達成する戦略の存在性を検証する。
    • 本研究で導入されたATL*_mpは,既存のATL*に定量的な制約を加えたものであり,より複雑なシステムの検証が可能となる。
    • 1次元制約下では,ATL*と同等の複雑度である2EXPTIME完全であることが示された。多次元制約下でも,有限メモリ下で同等の複雑度を維持する。
    • 記憶容量と閾値の関係に線形的な上限と下限が導出され,記憶容量の効率的な使用が可能となることが示された。

    Link: https://arxiv.org/abs/2608.01499

  • 形態を超えた運動:抽象的な運動表現からのクロスカテゴリー運動伝達のブートストラップ [cs.CV]目的:異なる形態の物体間における運動伝達
    • 動画の運動伝達は,現実世界での物理シミュレーションやアニメーション制作に応用が期待される重要な技術である。
    • 従来の技術では,参照対象と生成対象の形状が大きく異なる場合,運動の伝達が困難となる問題があった。
    • 本研究は,形状に依存しない抽象的な運動表現を用いることで,この問題を解決することを目的とする。
    • 抽象的な運動表現を学習し,多様な形態の物体間で運動を伝達するためのデータセットとベンチマークを新たに開発した。
    • 提案手法は,既存手法と比較して,運動の再現性と生成対象の形状維持において優れた性能を示した。
    • 明示的な運動抽出を必要とせず,参照動画に直接依存した運動生成が可能となった。

    Link: https://arxiv.org/abs/2608.01628

  • デジタル描画画像からの画家検証:IDraw [cs.CV]目的:デジタル描画における作者性検証の精度向上
    • デジタルアートの普及に伴い,作者の権利保護と紛争解決が重要になっている。
    • 完成した描画のみでは,画家の筆圧や速度といった特徴を捉えにくい。
    • 描画内容の影響を抑制し,画家の行動パターンから作者性を検証する。
    • IDrawは,他の画家データで学習することで,検証対象の描画から画家の行動を推測する。
    • 描画内容に共通する情報を抑制することで,作者性に関わる特徴をより明確にする。
    • 検証エラーを最大40%削減し,従来の画像ベースの手法を上回る性能を示した。

    Link: https://arxiv.org/abs/2608.01737

  • 信頼性の高い粗スケールに基づく自己回帰型超解像における詳細補完 [cs.CV]目的:生成型超解像におけるハルシネーションの軽減
    • 画像生成技術の発展に伴い,より高画質な画像生成が求められている。
    • 生成型超解像では,低解像度画像から詳細を復元する際に,誤った情報を生成するハルシネーションが課題となっている。
    • 粗スケール情報を信頼性の高いものとして扱い,詳細なスケールを自己回帰的に補完することで,ハルシネーションを抑制する。
    • 提案手法K2Nは,既存のVARSRベースラインと同等の標準的な超解像度指標を達成する。
    • ハルシネーションに焦点を当てた評価において,K2Nはより明確な優位性を示す。
    • スケールごとの生成パスを明示的に再考することが,生成型超解像の信頼性向上に繋がる可能性を示唆する。

    Link: https://arxiv.org/abs/2608.01823

  • P-MUSE:プロンプト・MIDIオプションによる統一的な楽器音楽合成・編集モデル [cs.CL, cs.SD]目的:楽器音楽の合成と編集に関する統一的なフレームワーク
    • 音楽生成技術は,作曲支援や新たな音楽体験の創出に不可欠である。
    • 既存システムは,プロンプトの形式によって性能が左右され,柔軟性に欠ける。
    • MIDIの有無にかかわらず,高品質な音楽生成と編集を可能にする手法の確立。
    • P-MUSEは,プロンプトMIDIの有無を問わず,2つのパラダイムを統合するマルチステージのカリキュラム学習に基づくフレームワークである。
    • 理論的分析と実験的検証に基づき,転写からオーディオへのシステムのための位相認識分類器フリーガイダンススケジューリング原理とTail-Drop戦略を提案している。
    • ピアノ,ギター,ベース,ドラムを含む様々なプロンプトモード,生成/編集タスクを網羅した包括的なベンチマークを確立した。

    Link: https://arxiv.org/abs/2608.01920

  • RSVideo:あなたのビジョン言語モデルはリモートセンシング動画に対応できているか? [cs.CV]目的:リモートセンシング動画におけるビジョン言語モデルの理解度評価
    • リモートセンシング技術は,環境監視や災害対応など,社会課題の解決に不可欠である。
    • 既存モデルは静止画や長期間の離散的な時間観察に偏っており,連続動画の理解が課題である。
    • 連続的なリモートセンシング動画の理解を評価するための統一的なベンチマークを構築すること。
    • RSVideo-10Kデータセットを構築し,10,773インスタンス,147万フレームを含むリモートセンシング動画を提供した。
    • RSVideo-Benchにより,知覚と推論の2側面からモデルの性能を評価できるベンチマークを確立した。
    • 提案手法RSVideoは,InternVL3.5-14Bで最大9.01%の改善,Qwen3.6-27Bで最高40.63%の精度を達成した。

    Link: https://arxiv.org/abs/2608.02039

  • HiResNets:フォービアル残差ストリームによるネイティブなフルHD動画認識 [cs.CV, cs.PF]目的:フルHD動画認識における手法
    • 画像・動画認識技術の発展は目覚ましいが,メモリ消費量の増大が課題となっている。
    • 従来の畳み込みニューラルネットワークは,解像度増加に伴い計算量とメモリ使用量が急増する。
    • 残差ストリームを活用し,解像度の制約を克服する新たなネットワークアーキテクチャを提案する。
    • 提案手法HiResNetsは,残差ストリームを高品質バッファとして利用し,高解像度動画を効率的に処理する。
    • HiResNetsは,人間の視覚システムにおける眼球運動のように,フレーム内の特定領域に焦点を当てて学習する。
    • 特に,小物体や細かい識別が必要なエゴセントリック動画認識において,既存手法を上回る性能を示す。

    Link: https://arxiv.org/abs/2608.02140

  • PhyCheck:ビデオLLMにおける物理法則理解のための詳細な証拠に基づくデータセット [cs.CV, cs.AI]目的:ビデオLLMにおける物理法則理解の評価と改善
    • 具現化された知能には,物理的規則の理解が不可欠である。現実世界をモデル化するためにも重要。
    • 既存の評価基準は生成動画の品質に偏っており,ビデオLLMの物理法則理解を系統的に評価できない。
    • 物理法則への適合・不適合の判断に加え,違反・適合の原因となる詳細を捉えることを目指す。
    • 提案データセットPhyCheckを用いてQwen2.5-VLをファインチューニングした結果,物理的整合性の理解が大幅に向上した。
    • 診断サブセットを用いた評価では,現在のモデルは因果条件を判断に組み込むのが困難であることが示された。
    • 表面的な不整合の認識と,根底にある物理メカニズムの理解との間にギャップが存在することが明らかになった。

    Link: https://arxiv.org/abs/2608.02150

  • 制約付き三重周期最小曲面生成のためのフーリエ潜在拡散 [cs.GR]目的:三重周期最小曲面構造の制御可能な生成
    • 材料設計において,周期的な構造の最適化は軽量化や機能性向上に不可欠である。
    • 既存手法では,生成できるTPMSのバリエーションが限られ,厳密な最小曲面からの逸脱が生じやすい。
    • ユーザー指定の制約を満たす多様なTPMS候補を効率的に生成することを目指す。
    • 本研究では,大規模TPMSデータセットを構築し,フーリエ潜在空間に投影することで,周期性と対称性を明示的に考慮した生成フレームワークを構築した。
    • Transformerベースの拡散モデルを潜在空間で学習することで,無条件サンプリング,決定論的変換,局所編集,および条件付き生成を実現した。
    • 実験により,本モデルが多様で低曲率のTPMS候補を生成し,幾何学的制約や弾性特性の目標値を満たすことが示された。

    Link: https://arxiv.org/abs/2608.02151

  • InfiniSplat:大規模ベースライン単眼ビュー合成のための暗黙的ガウス分解 [cs.CV]目的:単眼画像からの直接的な3Dシーン表現生成
    • 3Dシーンの再構築は,VR/ARなどの多様な応用において不可欠である。
    • 既存手法は,ピクセルアライメントに制約され,視点変化に弱い。
    • 幾何学的な誘導サンプリングと暗黙的デコーダにより,高品質な3Dシーンを生成する。
    • InfiniSplatは,ピクセルアライメントからサーフェスアライメントへの移行を実現した。
    • 提案手法は,既存の単眼画像ベースラインと比較して,最先端の性能を達成した。
    • Hypersimからのゼロショット汎化により,複雑な実世界シーンでも良好な結果が得られた。

    Link: https://arxiv.org/abs/2608.02437

  • 予測者に学習を促すインセンティブ:要約された助言対自由な助言 [econ.TH, cs.GT]目的:予測者が時間経過とともに最も多くの情報を獲得するためのインセンティブ設計
    • 予測市場や専門家への相談は,意思決定の質を向上させる上で重要である。
    • 学習の過程において,予測者が十分な情報を獲得するための適切なインセンティブ設計が課題である。
    • 予測者の学習ダイナミクスを考慮した,最適なインセンティブ契約の構造を明らかにすること。
    • 最終的な助言を要約することで情報獲得が最大化されるのは,情報が結果を完全に明らかにする場合や,予測可能な内容の場合である。
    • それ以外の場合,より詳細な報告能力が必要となる可能性がある。
    • 本研究は,学習ダイナミクスが努力を最大化する契約の質的特性にどのように影響するかを示すことで,相談や予測のためのインセンティブ設計に新たな知見をもたらす。

    Link: https://arxiv.org/abs/2310.19147

  • 長尾分布環境における音響イベント定位・検出のためのMAGENTA:振幅と幾何学を強化した学習手法 [quant-ph, cond-mat.str-el, cs.CC, eess.AS, cs.SD]目的:長尾分布環境における音響イベント定位・検出の性能向上
    • 現実世界の音響環境はイベントの発生頻度に偏りがあり,多様な音を正確に捉えることが重要である。
    • 従来の深層学習は頻度の高いイベントに偏った学習となり,珍しいイベントの認識精度が低いという課題がある。
    • MAGENTAは,学習過程でイベントの難易度に応じて重みを調整し,珍しいイベントの検出率を高めることを目指す。
    • MAGENTAは,回帰誤差を活動と定位の幾何学的成分に分解する損失関数を提案し,学習の偏りを軽減する。
    • STARSS23データセットを用いた評価により,MAGENTAはSELDエラーを20.5%削減し,長尾分布環境下での性能向上を実証した。
    • MAGENTAは,頻度の高いイベントの精度を損なうことなく,珍しいイベントの検出率を効果的に改善する。

    Link: https://arxiv.org/abs/2509.15599

  • 完全な戦略空間が協力への隠れた経路を明らかにする [q-bio.PE, cs.GT]目的:協力の創発と維持機構の解明
    • 進化ゲーム理論において,協力の起源は重要な課題である。社会生物学や経済学への応用が期待される。
    • 既存の研究では,戦略空間が限定されており,重要な行動経路を見落とす可能性がある。
    • 完全な戦略空間を考慮することで,協力の進化経路をより正確に把握することを目指す。
    • 完全な戦略空間を考慮することで,協力はより安定かつ多様な様相を示すことが明らかになった。
    • 特に,猜疑的な協力が協力を維持する環状ダイナミクスを触媒するメカニズムが新たに発見された。
    • 偏ったモデルにおける戦略的裏切りの役割は脆弱であり,進化的な引力源としては機能しない。

    Link: https://arxiv.org/abs/2511.17794

  • VCSELにおける偏光ロックの強化 [physics.optics, cs.CV]目的:VCSELの偏光ロック現象の改善と,そのメカニズム解明
    • 光コンピューティングへの応用が期待される偏光制御技術の重要性が高まっている。
    • VCSELの偏光特性の制約が,偏光演算などの応用展開の妨げとなっている。
    • VCSELの構造設計と電流調整により,偏光ロックの効率と範囲を拡大すること。
    • 設計された酸化アパーチャVCSELと電流調整により,偏光ロックに必要な注入電力は3.6μWまで低減された。
    • 偏光ロック範囲の拡大が実験的に確認された。
    • スピン反転モデルによる解析が,実験結果と高い一致を示し,偏光ロックメカニズムの理解を深めた。

    Link: https://arxiv.org/abs/2604.01857

  • アンカー付き汎化楽観的法による加速と安定した収束 [math.OC, cs.GT, cs.LG]目的:単調変分不等式に対する一次元法の研究
    • 機械学習の最適化問題において,効率的な解法が求められているため。
    • 既存手法は,勾配クエリの回数が多く,オンライン学習や確率的設定での適用が困難である。
    • アンカー付き汎化楽観的法(GOMA)を用いて,計算効率と収束性の両立を目指す。
    • 決定論的設定において,GOMAは二乗勾配ノルムに関して最適な加速レート$O(1/k^2)$を達成する。
    • 分散が無限大の確率的設定において,GOMAの簡略化版は二乗勾配ノルムに関して$O(1/\sqrt{k})$の収束レートを達成する。
    • 制約なし単調Lipschitz変分不等式に対する,分散削減やバッチサイズ増加なしの初の実証である。

    Link: https://arxiv.org/abs/2606.21528

  • MalariAI:アノテーションに依存しない細胞セグメンテーションと説明可能な病期分類のための,ラベルに強い分離フレームワーク(濃厚マラリア血液塗抹標本において) [eess.IV, cs.AI, cs.CV]目的:濃厚マラリア血液塗抹標本における細胞セグメンテーションと病期分類の自動化
    • マラリア診断は世界的な健康課題であり,専門家の不足が診断のボトルネックとなっている。
    • 既存の深層学習システムは,アノテーションされていない細胞を背景として扱い,セグメンテーション精度が低い。
    • アノテーションに依存せず,より正確な細胞セグメンテーションと病期分類を実現する。
    • 提案手法MalariAIは,アノテーションなしで全細胞の75.95%を検出可能であり,従来のシステムよりも高い精度を達成した。
    • 病期分類においては,EfficientNet-B0を用いた微調整により,98.36%の分類精度を達成し,特に稀な病期(シゾント,配偶子体)の識別性能が向上した。
    • Grad-CAM++ヒートマップにより,各細胞の空間的な根拠が提供され,臨床監査における透明性と信頼性を高めている。

    Link: https://arxiv.org/abs/2607.00385

  • SwanTale:指示およびゼロショットタスクのための統一的な多話者音声およびオーディオ生成 [eess.AS, cs.SD]目的:多話者音声およびオーディオ生成の技術
    • アニメーション,映画,ゲームなど幅広いコンテンツ制作において,音声や効果音は不可欠な要素である。
    • 既存手法では,参照音声なしでの音声設計や,自然言語による話し方制御が難しい場合がある。
    • 指示や参照音声に基づき,多様な話し方や音響効果を生成できるモデルの開発を目指す。
    • SwanTaleは,ゼロショットおよび指示タスクにおいて,主要な評価指標で優れた性能を示した。
    • 本モデルは,多話者音声とオーディオを含む複雑な指示生成を可能にする。
    • SwanData-CaptionとSwanVAEの導入により,高品質な多音響生成を実現した。

    Link: https://arxiv.org/abs/2608.02023