arXiv雑要約
画像・音声 - 2026/08/04 公開
DeGS:非同期ワークロード解析と再構成によるスケーラブルな3DGSアーキテクチャ [cs.AR, cs.AI, cs.CV]目的:リアルタイムな新規視点合成のための3D Gaussian Splatting (3DGS) アーキテクチャのスケーラビリティ向上
- 3DGSはリアルタイムな視点合成において優れた技術だが,アーキテクチャのスケーラビリティが課題である。
- 従来の3DGSアクセラレータは,PE数増加に伴い性能向上幅が小さく,PEの利用効率が低い。
- 「チェックとブレンド」のデータフローを分離し,ワークロードを再構成することでPE利用効率を高める。
- 提案手法DeGSは,ワークロードを解析,再構成,ブレンドの段階に分割することで冗長性を排除し,PE利用率を向上させる。
- 28nm技術で実装したDeGSは,既存の3DGSアクセラレータと比較して,スループット,速度,エネルギー効率で大幅な改善を達成した。
- DeGSは,PE数を16から1024にスケールしても高いPE利用率を維持し,既存アクセラレータを大きく上回る。
動物行動分類のための不確実性を考慮したクロスモーダル融合 [cs.CL, cs.SD, cs.AI]目的:動物行動の分類
- 動物の音声モニタリングは,福祉評価や生態研究に貢献し,人手による観察より効率的である。
- 環境ノイズや録音状態の悪さにより,動物音声の自動分類は依然として困難である。
- 異なる音声表現の弱点を補い,よりロバストな分類を目指す。
- 提案手法(UAF)は,各表現の不確実性を推定し,信頼度に応じた重み付けを行うことで,分類精度を向上させた。
- SoundWelのデータセットで,従来の融合手法と比較して,相対マクロF1値でそれぞれ15.7%と20.4%の改善が認められた。
- 不確実性に基づいた融合が,時間的な特徴よりも性能向上に大きく貢献することが示された。
同一の意味,異なる経路:ビジョン・テキスト圧縮のための自己改善アライメント [cs.CV]目的:ビジョン・テキスト圧縮における,画像表現とネイティブテキスト表現の乖離を解消すること
- ビジョン・テキスト圧縮は,長文を画像に変換することでテキスト情報を効率的に圧縮する技術である。
- 既存のビジョンエンコーダは自然画像で事前学習されているため,言語の意味ではなく視覚的属性に偏る。
- モデル自身のテキストパスの挙動を利用して,画像表現をネイティブテキスト表現に近づける。
- SPIRALは,VTCBenchにおいてQwen3-VL-8Bのスコアを35.10から54.02へと大幅に改善した。
- トークンレベルの知識蒸留とシーケンスレベルの最適化が,それぞれ検索と推論で強みを発揮する。
- SPIRALは,ドメイン外のベンチマークでも有効であり,効果的なVTCには表現のアライメントが不可欠である。
HAFI-VLM:視覚言語モデルにおける視覚知覚の診断と強化のための周波数的視点 [cs.CE, cs.DC, cs.CL, cs.CV, cs.CL]目的:視覚言語モデルの視覚知覚に関する周波数特性の分析と改善
- 視覚言語モデルは,画像とテキストの理解において重要な役割を果たしており,その性能向上が求められている。
- 既存モデルは,詳細な視覚的根拠を必要とする予測において信頼性が低いという課題がある。
- この研究は,タスクに応じた周波数パスウェイを導入し,視覚知覚能力の改善を目指す。
- 本研究で提案するHAFI-VLMは,LLaVA-1.5とQwen2.5-VLにおいて,一般的なVQA,テキスト理解,および幻覚への耐性において性能向上を示した。
- HAFIは,タスク依存的な周波数分配を回復させつつ,意味的注意を維持することで,視覚言語モデルの知覚能力を効果的に向上させる。
- これにより,従来の解像度やクロッピングに基づく手法,および表現レベルの強化手法を上回る成果が得られた。
プロンプト適応型計算経路:文脈内学習のための [cs.CV]目的:文脈内学習における計算レベルの適応
- 近年,大規模言語モデルの応用範囲が拡大しており,少ない事例からの学習が求められている。
- 従来の文脈内学習は,プロンプトを文脈情報として利用するのみで,計算プロセス自体は変化しないという課題があった。
- プロンプトに基づいて計算経路を動的に変化させ,タスク特化性と解釈可能性を高めることを目指す。
- PromptPathは,プロンプト駆動のルーティングメカニズムにより,軽量な低ランクエキスパートを選択的に活性化・組み合わせる。
- これにより,タスク固有の計算経路を形成し,モデルの計算を動的に再構成することで,タスクへの適応を強化する。
- 3D点群と2D画像認識のベンチマークにおいて,最先端の文脈内学習手法と比較して優れた性能と汎化能力を示すことが示された。
メッセージではなくトークン:忠実なVLM圧縮のためのグラウンデッドコアセット [cs.CV]目的:忠実なVLM圧縮のためのコアセット構築
- 近年,高解像度画像を扱うVLMの利用が増加しており,計算コストの削減が重要となっている。
- 既存の圧縮手法では,トークンの重要度を個別に評価するため,情報の重複や欠落が生じやすい。
- クエリに根差したメッセージコアセットを構築し,VLMの圧縮率と性能を両立させることを目指す。
- 提案手法GMCは,クエリ,外観,座標情報を考慮してサポートを割り当て,情報を効率的に圧縮する。
- GMC-H2はQwen2.5-VL-7Bにおいて,視覚トークン数を80.2%削減しながら,性能の97.78%を維持した。
- GMC-L16は100.36%の性能に達し,集団サポートと情報実現が性能向上に寄与することが確認された。
裏表一体:ビジョン言語モデルに対するクロス・タスク攻撃の共進化探索 [cs.CV]目的:ビジョン言語モデルに対するクロス・タスク攻撃手法の開発
- ビジョン言語モデルは多様なタスクで高い汎化能力を示すが,セキュリティ上の脆弱性が課題となっている。
- 既存の攻撃手法は単一の最適化経路に依存し,探索範囲が限定され,タスク間の転移性が低い。
- テキストと視覚の両空間を効率的に探索する攻撃フレームワークを構築し,クロス・タスク攻撃の成功率を高める。
- 提案手法は,テキスト側で意味埋め込みを進化させ,視覚側で物体領域の摂動を維持・組み合わせることで,多様な攻撃経路を探索する。
- 理論的分析により,共進化探索が摂動の実行可能性を維持し,最適な解の劣化を防ぎ,高マージンな敵対領域に到達する確率を高めることが示された。
- Florence-2, OFA, UnifiedIO-2を用いた実験により,画像キャプション生成,物体検出,領域分類,物体位置特定など,複数のタスクで高い攻撃性能が確認された。
HiResNets: 焦点的残差ストリームによるフルHD動画認識 [cs.CV, cs.PF]目的:高解像度動画認識における性能向上
- 画像・動画認識技術は,監視カメラや自動運転など,様々な分野で重要性を増している。
- 高解像度化に伴い,メモリ消費量と計算コストが二次関数的に増加する点が課題である。
- 残差ストリームを活用し,計算コストの増加を抑制することで高解像度動画認識を実現する。
- 提案手法HiResNetsは,人間の視覚のように,シーン内の特定箇所に焦点を当てて学習することが示された。
- 特に,小さな物体や細かい識別が必要な状況下でのエゴセントリック動画認識において,高い性能を発揮する。
- 残差ストリームの解像度依存性を理論的に解消し,効率的な高解像度動画処理を可能にした。
四元数テンソルモデルを用いたカラー偏光モザイク復元 [cs.CV]目的:カラー偏光モザイク画像の復元手法
- 偏光カメラは,色と偏光情報を同時に取得可能であり,様々な分野での応用が期待されている。
- 偏光データのサンプリングが疎であるため,高品質な復元が困難であるという課題がある。
- 偏光チャネル間の相関と物理制約を考慮し,より高精度な復元を実現することを目指す。
- 提案手法では,四元数テンソルを用いてカラー偏光画像を表現し,低ランク性を仮定することで,効率的な復元を可能にした。
- ストークス領域での全変動正則化を導入し,強度,偏光,残差の変化を分離することで,エネルギー整合性を維持した。
- 実験結果から,提案手法が既存手法よりも優れた復元性能を発揮することが示された。
UniqueSplat:視点条件付き3Dガウススプラッティングによる汎用的な3D再構成 [cs.CV, cs.AI]目的:視点に応じたカスタマイズされた3Dラディアンスフィールドの再構成
- 3D再構成は,仮想現実,拡張現実,ロボティクスなど,幅広い分野で重要である。
- 既存手法では,全ての視点に対して固定されたガウス分布を生成するため,特定の視点への適応が難しい。
- 視点条件情報を事前知識として学習し,ガウス分布を動的に調整することで,再構成精度と汎化性能の向上を目指す。
- UniqueSplatは,RealEstate10K,ACID,DTUといった広範なデータセットにおいて,最先端手法を上回る性能を示した。
- 特に,クロスデータセット評価において既存手法を大きく上回り,優れた汎化能力を有することを示唆している。
- 視点条件付きハイパーネットワークを用いて,視点に依存しない埋め込みと視点固有の知識を同時に学習する。
Douyinマルチモーダル埋め込みモデル技術報告 [cs.IR, cs.CL, cs.CV]目的:マルチモーダル表現学習の性能向上
- 現代AIの基盤であり,検索や推薦,エージェントの実現に不可欠である。
- 大規模コンテンツプラットフォームでは,効率性と識別能力の両立が課題となっている。
- 両立が難しい既存モデルの課題を,二段階学習で解決する。
- DMEは,2Bと9BモデルでMMEB-v2において最先端の結果を達成した。
- 特に,動画とビジュアルドキュメントタスクにおいて高い性能を示した。
- Douyinのオフライン評価で2.92%の改善,オンラインA/Bテストで0.1%のLT向上を実現した。
PhyCheck:ビデオLLMにおける物理法則理解のための詳細な証拠に基づくデータセット [cs.CV, cs.AI]目的:ビデオLLMにおける物理法則理解の評価と改善
- 具現化された知能の実現には,物理的な規則性の理解が不可欠である。
- 既存のベンチマークは動画生成の質に偏っており,物理法則理解の系統的な評価が困難である。
- ビデオにおける物理法則への適合/違反を詳細に分析し,LLMの理解度向上を目指す。
- 提案データセットPhyCheckを用いてQwen2.5-VLをファインチューニングすることで,物理的一貫性の理解が大幅に向上した。
- 診断サブセットの評価では,現在のモデルは追加の原因条件を判断に組み込むことが難しいことが示された。
- 表面的な不整合の認識と,根底にある物理メカニズムの理解との間にギャップが存在することが明らかになった。
制約付き三周期性最小曲面生成のためのフーリエ潜在拡散 [cs.GR]目的:三周期性最小曲面構造の制御可能な生成
- 材料設計において,軽量化や機能性付与に貢献する三周期性最小曲面構造の重要性が高まっている。
- 既存手法では,生成可能な構造が限定的であり,厳密な最小曲面性を満たさない近似に留まる場合が多い。
- ユーザー指定の制約を満たす,多様で低曲率の三周期性最小曲面候補を生成することを目指す。
- 大規模なTPMSデータセットを構築し,フーリエ潜在空間への投影を通じて周期性と対称性を明示的に表現した。
- Transformerベースの拡散モデルを学習させることで,無条件サンプリングや制約付き生成を実現した。
- 生成された候補は,指定された幾何学的制約や弾性特性を満たし,逆設計ツールとしての実用性を示した。
特性を意識した適応型ディープフェイク検出器AdaForensics [cs.CV]目的:ディープフェイク検出のための特性を意識した適応型ネットワーク
- 近年,ディープフェイク技術の発展により,偽情報の拡散が深刻化しており,その検知技術が急務である。
- 既存手法は,個々の顔の特徴を考慮せず,固定された検出器を用いるため,汎用性に課題がある。
- 本研究では,顔の特徴に応じて動的に適応する検出器を開発し,より高精度なディープフェイク検出を目指す。
- 提案手法AdaForensicsは,共有可能な特徴表現と個別の顔の特徴への適応を両立する。
- ハイパーネットワークを用いることで,入力画像の特徴に基づいて検出器のパラメータを自動調整する。
- FaceForensics,Celeb-DF,DFDC等のデータセットにおいて,最先端手法を上回る性能が確認された。
GSRAIN:3Dガウスシーンのための物理ベースの降雨合成手法 [cs.CV]目的:3Dガウススプラッティングシーンにおける高頻度・低頻度の降雨合成
- 自動運転システムの安全性評価において,多様な天候条件での性能検証が不可欠である。
- 既存の降雨シミュレーション手法は,物理的な制御性や多視点の一貫性に課題が残されている。
- 物理的に制御可能で再現性のある降雨シーンを生成し,自動運転アルゴリズムの評価を支援すること。
- GSRAINは,計測された降雨データから高頻度の雨粒モデルを構築し,形状を考慮した拡散モデルで低頻度の雨天効果を生成する。
- 提案手法は,FIDスコア149.09を達成し,CycleGAN-TurboやWeatherEditよりも優れた性能を示す。
- 生成されたシーンを用いた実験により,降雨量に応じてアルゴリズムの性能が変化することが確認された。
SWINSleepNet:階層的文脈認識型睡眠段階推定フレームワーク [cs.CV]目的:睡眠段階推定の精度向上
- 睡眠障害の診断や睡眠の質評価において,自動的な睡眠段階推定は不可欠である。
- 曖昧な段階や移行期の睡眠段階推定において,既存手法の性能が十分でない。
- 微細な時間構造と複雑な周波数依存性を適切にモデル化することで,睡眠段階推定の精度を高める。
- 提案手法SWINSleepNetは,時間領域と周波数領域の2つのストリームを用いて,睡眠段階の表現学習と文脈モデリングを最適化する。
- Sleep-EDF-20, Sleep-EDF-78, SHHSデータセットを用いた実験により,提案手法が競合する性能を示し,特に困難なN1段階と移行期の段階で高い安定性と堅牢性を示すことが確認された。
- 階層的アーキテクチャに基づく,最適化されたエポック内表現学習が,自動睡眠段階推定タスクに大きく貢献することが示された。
手術器具と組織の相互作用における時空間ペアワイズ関係モデリング:手術行動トリプレット認識のためのSPIRIT [cs.CV]目的:手術行動トリプレット認識のための表現学習
- 手術活動の理解は,安全監視やスキル評価など,手術支援において不可欠である。
- 既存のデータセットでは,施設間での汎化性能の評価が困難である。
- 施設間での汎化性能が高いトリプレット表現の学習を目指す。
- 提案手法SPIRITは,手術器具,動詞,標的の時空間表現を学習し,それらのペアワイズ関係をモデル化する。
- SPIRITは,既存のベースラインと比較して,複数の評価プロトコルで一貫して優れた性能を示す。
- 多施設データセットMultiBypass-4C-T40を構築し,その有効性を検証した。
DerainSplat:疎な雨天視点からの高速3D Gaussian Splatting [cs.IR, cs.CL, cs.CV]目的:雨天の少ない視点からのクリアな3Dシーン再構成
- 空間知能はAIや自動運転で重要性が増しており,3次元空間の理解が不可欠である。
- 既存の3D Gaussian Splattingはクリーンな入力に依存し,雨天時には性能が低下する。
- 雨天の少ない視点からの高品質な3Dシーン再構成を実現し,ロバスト性を向上させる。
- 提案手法DerainSplatは,雨天の少ない視点からクリアな3Dシーンを高速に再構成するフレームワークである。
- 大規模なマルチビュー雨天除去データセットを構築し,天候要素を予測するWeather Netを導入した。
- 実験結果から,DerainSplatは既存手法を凌駕し,多様なデータセットで高い汎化性能を示した。
T$^2$exture:疎な摂動を用いた熱からテクスチャへの画像処理 [cs.CV]目的:疎な摂動を利用した熱テクスチャ画像処理フレームワークの再構成
- 悪条件下でも有効な熱画像だが,微細なテクスチャ表現が課題。高度な認識や分析にはテクスチャ情報が不可欠である。
- 従来の熱テクスチャ処理は,追加のセンサーやデータが必要となり,負担が大きい。また,ノイズの影響も問題となる。
- 熱源を制御し,少ないアクティブなキーフレームから高密度なテクスチャ情報を再構成し,負担を軽減することを目指す。
- T$^2$extureは,AMT-Lにわずか0.20Mパラメータを追加するだけで,PSNRを6.66dB改善することを示した。
- シミュレーションおよび実データによる評価では,既存手法と比較して,より鮮明なテクスチャの復元と構造の保持が確認された。
- この結果から,T$^2$extureは,疎なアクティブ取得下での熱テクスチャ画像処理の有効なフレームワークであることが示された。
RSC-GestureNet:信頼度を考慮した中国の交通警察のジェスチャー因果認識 [cs.RO, cs.CV]目的:中国の交通警察のジェスチャー認識における信頼性,安定性,ロバスト性の向上
- 自動運転において,交通警察のジェスチャーは安全確保のための重要な情報である。
- 姿勢推定の誤りやノイズが,ジェスチャー認識の精度と安定性に悪影響を及ぼす場合がある。
- 姿勢推定の信頼度を考慮することで,より正確で安定したジェスチャー認識を実現することを目指す。
- RSC-GestureNetは,姿勢の信頼度を重視した因果認識モデルであり,高精度な認識性能を発揮する。
- CTPGesture-Cベンチマークにおいて,RSC-GestureNetは既存手法を上回り,ロバスト性の高い認識を実現した。
- 姿勢信頼度の明示的なモデリングが,早期,安定した交通指令認識の改善に貢献することが示された。
衝突を考慮した学習による,エビデンス誘導適応ルーティングを用いた統一的な疎視点3Dガウス超解像 [cs.CV]目的:疎視点3Dガウススプラッティング超解像の実現
- 3Dガウススプラッティングは,高画質な3Dシーンの表現とレンダリングを可能にする技術であり,その超解像は重要である。
- 既存手法は段階的な処理となり,段階ごとの誤差蓄積とガウス情報の転送が問題となる。
- 衝突を考慮した学習と適応ルーティングにより,単一段階での高精度な超解像を目指す。
- 提案手法CLEARは,疎視点3Dガウススプラッティング超解像のための初の統一的な単一段階フレームワークを構築した。
- LR観測とHR事前知識を統合的に最適化することで,段階的な誤差蓄積の問題を克服した。
- 実験結果から,CLEARが最先端のレンダリング品質と優れた幾何学的精度を達成することが示された。
自己教師あり学習によるDXA表現は,多系統疾患リスク,生物学的加齢,および遺伝可能性を符号化する [cs.CV, q-bio.QM]目的:DXA画像から全身の健康状態を表す表現を学習すること
- DXA検査は骨密度と体組成を評価するが,空間構造の情報活用が不十分である。
- 従来のDXA検査では,画像に内在する疾患リスク等の情報を十分に活用できていない。
- 自己教師あり学習を用いて,DXA画像からより多くの健康関連情報を抽出することを試みる。
- LeDXAは,従来のDXA測定や既存モデルと比較して,複数の疾患およびバイオマーカーの予測精度を向上させた。
- LeDXAによる予測は,特に股関節・膝変形症および2型糖尿病において,その効果が大きかった。
- 生物学的加齢のギャップは,疾患の負担度や死亡リスクと関連しており,ホルモン補充療法により縮小することが示唆された。
VARPose:視覚的自己回帰モデリングによる柔軟な2D姿勢密度化と3Dリフティングの向上 [cs.CV]目的:2Dの疎な姿勢の適応的な密度化
- 人体姿勢推定は,ロボット工学やコンピュータビジョンの分野で重要な役割を果たす。
- 既存手法では,姿勢データの密度が低い場合,3Dリフティングの精度が制限される。
- 姿勢データの密度を効果的に高めることで,3Dリフティングの性能向上を目指す。
- VARPoseは,視覚的自己回帰モデリングを用いて2D姿勢を柔軟に密度化する手法である。
- Granularity-agnostic Pose Tokenizer (GPT)により,様々な密度の姿勢を統一的な表現に変換する。
- 3D姿勢推定や人体メッシュ復元といった下流タスクにおいて,既存手法を上回る性能を示す。
テスト時の視覚言語モデル適応のための局所マージン復元 [cs.CV]目的:視覚言語モデルのテスト時適応における性能低下の抑制
- 視覚言語モデルはゼロショット学習で高い能力を示すが,分布シフトに弱い
- 既存のテスト時適応は,セマンティック構造を歪ませ,バイアスを蓄積しやすい
- 局所的なセマンティック構造を保護し,バイアス蓄積を抑制することで,ロバスト性を高める
- 提案手法LMRは,近傍の候補を保護するPMR目標により,局所的なセマンティック構造を復元する
- 適応的なマージン制御とバイアス補正により,ストリームレベルでの性能劣化を抑制する
- CIFAR-C,ImageNet-C等の実験で,既存手法を上回り,低バッチサイズ環境でも頑健性を示す
VC-Tooler:構成的・適応的なビジュアルツール利用の学習 [cs.CV]目的:ビジュアルツール利用の構成性と適応性を学習すること
- 画像理解を超え,能動的な情報収集による推論能力が求められている。
- 既存手法は固定されたツール空間とパターンに依存し,構成性と適応性が不十分である。
- ツール利用における構成性と適応性を高め,より高度な推論を可能にすること。
- VC-Toolerは,単一ツール,複数ツールの組み合わせ,多様な文脈に対応できる能力を学習した。
- V*ベンチマークで95.8%,VTC-Benchで35.3%と,オープンソースモデル中最高の性能を達成した。
- 推論時に豊富なツール設定下でも,優れた汎化能力を示すことが確認された。
音を奏でるキャンバス:ネットワーク化された感覚的なサウンドアートへのアルゴリズムの埋め込み [cs.SD]目的:触覚応答型マルチモーダルインスタレーションの実現
- 現代アートにおいて,鑑賞者の体験を拡張する新たな表現手法の探求が重要視されている。
- アルゴリズムが組み込まれたアート作品における,アルゴリズムの可視化と体験が課題となっている。
- 触覚と音の連動を通じて,アルゴリズムを鑑賞者に体感させる方法を提案する。
- 絵画に触れることで空間化された音が絵画から発せられるように,アルゴリズムを物理的・知覚的・パフォーマンス的に埋め込んだ。
- CNNベースのオフラインマッピングと,マルコフモデルおよびLSTMベースのポリシーという二つのオンラインイベントマネージャーを組み合わせた。
- ネットワーク化により,単独の触覚が分散型共同制作へと変容し,作者性,主体性,評価に関する新たな問いを提起する。
GenPrior:ゼロショット骨格ベース行動認識のためのテキスト-モーション生成事前知識の解放 [cs.CV]目的:ゼロショット骨格ベース行動認識における,テキストの意味論と骨格の特徴量との整合性向上
- 行動認識は,ロボット工学や人間-コンピュータインタラクション等,様々な応用分野において重要である。
- 既存手法では,幾何学的構造や物理的制約が欠如したテキスト由来のプロトタイプに依存し,意味論と運動論のギャップが生じている。
- 事前学習済みのテキスト-モーションモデルから生成される事前知識を活用し,このギャップを埋めることで認識精度を向上させる。
- 提案手法GenPriorは,テキスト埋込みに信頼性の高い構造的情報を適応的に注入し,合成的なアーティファクトを抑制する分散ゲート付き特徴融合を導入する。
- 生成されたモーションから抽出した運動学的プロトタイプとクラス内分散を活用し,高信頼度な未知サンプルをマイニングすることで,クラスプロトタイプを校正する生成プロトタイプ洗練を提案する。
- NTU-60,NTU-120,PKU-MMDにおける実験により,GenPriorがゼロショットおよび一般化ゼロショット設定の両方で最先端の性能を達成することが示された。
HarMoE:データセット解きほぐしエキスパートによる多ソース胸部X線画像事前学習 [cs.CV, cs.AI]目的:多様な胸部X線画像データセットを活用した,より堅牢な画像-言語モデルの構築
- 胸部X線画像理解は,医療診断支援において重要であり,高精度なモデルが求められている。
- 既存モデルはMIMIC-CXRに依存傾向があり,多様なデータセットの活用が不十分である。
- 異なるデータセット間の知識の混同を解消し,効果的な多ソース学習を実現すること。
- HarMoEは,データセット固有の特徴と共通の医療セマンティクスを分離するエキスパート混合モデルである。
- 多様な胸部X線ベンチマークにおいて,HarMoEはゼロショット分類,分布外転移,および根拠付けにおいて既存モデルを上回る性能を示した。
- 本研究は,単一ソースへの依存から脱却し,多様なデータセットからの構造化された知識構築の重要性を示唆している。
疎制約修正フローによるオープンセット視覚テキストフォレンジック [cs.RO, cs.CV, cs.AI]目的:視覚テキストの改ざん検出
- 生成AIの進化により,テキスト改ざんが高度化しており,その検出が重要になっている。
- 既存の識別モデルは特定の改ざんパターンに過学習しやすく,未知の攻撃への汎化性能が低い。
- 本研究は,改ざんパターンに依存せず,画像の本質的な統計とのずれを評価することで検出を行う。
- 提案手法は,既存手法と比較してF1スコアで3.2%,IoUで4.8%高い性能を達成した。
- 特に,未知のテキスト編集パターンに対するゼロショット性能が優れていることが示された。
- 本モデルによる局所的な調和処理が,既存検出器が依存する統計的特徴を弱める可能性があることが示された。
EOVSAM:SAM 3を用いた効率的なオープンボキャブラリセグメンテーション [cs.HC, cs.MM, cs.CV]目的:オープンボキャブラリセグメンテーションの効率化
- 画像認識分野において,テキストによる指示に基づいた物体検出・セグメンテーション技術は重要性を増している。
- 既存手法では,語彙規模の拡大に伴い計算コストが増大し,実用性に課題があった。
- SAM 3の能力を最大限に活かしつつ,計算コストを削減することで,より実用的なセグメンテーションを実現する。
- 提案手法EOVSAMは,SAM 3をシングルパス予測に対応させ,プロンプト条件付けを削除することで,効率的なマスク生成を実現した。
- アテンショナル集約戦略を導入し,オープンボキャブラリ分類をエンドツーエンドで最適化することで,既存手法よりも高いセグメンテーション精度を達成した。
- 評価データセットにおいて,推論速度を最大338倍に向上させ,高精度を維持しつつ,低解像度下でも高速な処理を可能にした。
Sen-Cap:LiDAR-カメラ統合によるセンサー柔軟性とノイズ耐性を持つ人体モーションキャプチャ [cs.CV]目的:LiDARとカメラのマルチモーダルデータを統合した,センサー柔軟性とノイズ耐性を持つ3D人体モーションキャプチャフレームワーク
- 近年,スポーツ分析やロボティクスなど,リアルワールドでのモーションキャプチャの需要が高まっている。
- 既存手法は,センサー配置の制約やノイズ,センサー故障に弱く,実用性に課題があった。
- 本研究は,センサー配置の自由度を高め,ノイズに対するロバスト性を向上させることを目指す。
- Sen-Capは,センサー間のキャリブレーションを不要とし,柔軟なセンサー配置を可能にした。
- ノイズ耐性のある軌道トラッカーにより,点群ノイズ下でも安定したモーションキャプチャを実現した。
- Human-M3やFreeMotion等の主要データセットで最先端の性能を示し,実用的なモーションキャプチャを可能とした。
VideoGANに基づく軌跡生成のための視界範囲拡張分析 [cs.CV, cs.LG]目的:現実的かつ多様な軌跡の生成
- 自動運転レベル向上には,複雑な交通状況を再現する技術が不可欠である。
- 従来のルールベースや機械学習では,交通行動の複雑さを捉えきれない場合がある。
- 生成モデルを用いて,より大規模で複雑な交通シーンに対応可能な軌跡生成を目指す。
- 提案手法では,セマンティック表現の改善やグラフベースの軌跡抽出により,より大規模な交通シーンへの適用を可能にした。
- 生成された動画における幻覚や物体永続性を評価する定量的なフレームワークを導入した。
- 実験結果から,本手法は現実的で一貫性のある軌跡を生成し,自動運転の予測・計画・シミュレーションに適していることが示された。
スパイクリストーマー:統一されたイベント推論による省エネルギー型画像復元へ [cs.CV]目的:多様な劣化に対応可能な画像復元における省エネルギー化
- 画像復元技術は,実世界の様々なアプリケーションにおいて不可欠であり,その性能向上が求められている。
- 従来のANNベースの画像復元は計算コストが高く,リアルタイム処理が困難であるという課題がある。
- スパイクニューラルネットワークの潜在能力を引き出し,省エネルギーな画像復元を実現することを目的とする。
- スパイクリストーマーは,内部生成されたスパイク信号を基にしたイベント推論によって,ANNベースの手法と同等の性能を達成した。
- 本手法は,サブトラクティブ劣化イベントアテンションや階層ベイズスキップマスキングなどのメカニズムを導入することで,劣化イベントの信頼性を高めている。
- 実験結果から,スパイクリストーマーは既存のSNNベースの手法と比較して,大幅な省エネルギー化を実現し,最先端の結果を示した。
汎用VLMが天文学の基礎モデルの銀河形態認識能力を向上させる [cs.CV]目的:銀河形態認識の改善
- 天文学研究において,銀河の形態分類は銀河の進化や宇宙構造の理解に不可欠である。
- 既存の天文学基礎モデルは新たな観測条件への適応や,特定の形態認識タスクにおいて,依然として多大な人的な監督を必要とする。
- 汎用VLMを活用し,人的なアノテーションコストを削減しつつ,銀河形態認識の精度を向上させる。
- 汎用VLMベースのVQAシステムは,銀河形態に関する有用な視覚・意味的知識を有しており,弱学習として機能する。
- 汎用VLMを教師としてZoobotに学習させることで,複数の観測条件において,銀河形態分類の性能が向上した。
- 汎用VLMは,天文学基礎モデルに補完的な知識を提供し,限られた人的な監督下で銀河形態認識能力を向上させることが示された。
動的な形状の連続的かつロバストな比較のためのプッシュフォワード変換 [cs.CV, cs.LG, cs.NA, math.NA]目的:形状比較のための数学的枠組み
- 画像解析において,形状とその時間変化を定量的に比較することは基本的な課題である。
- 従来の比較方法は,パラメータへの依存性や対応付けの困難さ,解釈の不透明さなどの課題がある。
- 形状自体を変えない変換に対して不変であり,かつ形状の幾何学的変化に敏感な表現を確立すること。
- プッシュフォワード変換を符号付き距離関数に適用することで,境界と内部幾何学の両方を捉える連続的な表現が得られる。
- 得られた表現を用いて,形状類似度を定量化し,骨格トポロジーや回転対称性などの特徴を明らかにできる。
- この変換は2次元,3次元の形状,時間変化する形状に一貫して適用でき,形状上のスカラー場との同時解析も可能である。
CalibBEV:BEVアラインメントによるLiDAR-カメラキャリブレーション [eess.SY, cs.SY, cs.CV]目的:LiDARとカメラのキャリブレーション手法
- 自動運転やロボティクスにおいて,LiDARとカメラの正確なキャリブレーションは不可欠である。
- 従来の点とピクセルのマッチング手法では,精度やロバスト性に課題があった。
- BEV(鳥瞰図)表現を用いたアラインメントにより,高精度でロバストなキャリブレーションを実現する。
- 提案手法CalibBEVは,LiDARとカメラデータを共有の3D空間表現に統合し,高精度なキャリブレーションを可能にする。
- KITTIベンチマークにおいて,相対回転誤差を51%,相対並進誤差を80%削減した。
- nuScenesベンチマークにおいても,それぞれ68%と91%の誤差削減を達成し,最先端の精度を実現した。
GEOID-Flood:洪水セグメンテーションのための大規模マルチモーダルベンチマークデータセット [cs.CL, cs.CV]目的:洪水セグメンテーションのための大規模マルチモーダルベンチマークデータセット
- 地理空間基礎モデルの性能評価には,地域やセンサーを跨ぐ汎化能力を測る大規模なデータセットが必要である。
- 既存の洪水マッピングデータセットは,時間変化のあるSAR画像と光学画像を大規模に組み合わせたものが少ない。
- 本研究は,地理空間基礎モデルの洪水マッピングにおける有効性を検証するためのベンチマークデータセットを提供する。
- GEOID-Floodは,Copernicus Emergency Management Serviceのデータに基づき,65か国,219の洪水イベントを10年間で網羅する大規模データセットである。
- 基礎モデルは一貫してわずかな優位性を示すが,一時的な洪水を解決するには,光学・SAR画像の融合とファインチューニングが有効である。
- GEOID-Floodで訓練されたモデルは,既存のデータセットで訓練されたモデルよりも,未知のイベントへの転移性能が高い。
TravKAN:コルモゴロフ・アーノルドネットワークによる高速かつ解釈可能な非線形トラバーサビリティ解析 [cs.RO, cs.CV]目的:非構造化環境下における自律移動ロボットのためのトラバーサビリティ推定
- ロボットの自律走行には,環境のトラバーサビリティを正確に把握することが不可欠である。
- 深層学習モデルは予測性能が高いが,解釈性が低く,地形とロボットの相互作用を理解しにくい。
- トラバーサビリティ推定において,高速性,解釈性,および計算効率を両立することを目指す。
- 提案手法TravKANは,既存の深層学習モデルと同等以上の性能を示すことが確認された。
- TravKAN-Liteは,非線形な特徴量の相互作用を明らかにし,コンパクトで高速な解析モデルを提供する。
- LiDARのリフレクティビティチャネルに基づく特徴量が,トラバーサビリティ推定に有効であることが示された。
NDVI時系列再構成のためのグローバル規模自己教師あり時空間学習 [cs.CV]目的:NDVI時系列の再構成
- リモートセンシングにおいて,植生の状況把握は重要であり,NDVIはそれを測る指標として広く用いられる。
- NDVIデータは雲の影響やノイズを受けやすく,正確なデータ取得が課題となっている。
- 雲の影響やノイズに強いNDVIデータの再構成手法を開発し,より正確な植生モニタリングを目指す。
- GloSSRは,人工的に劣化させたNDVIデータを用いて自己教師あり学習を行い,高い再構成性能を示した。
- 実際のNDVIデータを用いた評価では,GloSSRは植生動態や主要なフェノロジー状態を正確に捉えることが確認された。
- 長期的な植生トレンド分析やAVHRRデータへの適用により,GloSSRの汎用性と大規模環境モニタリングへの貢献が示された。
多モーダル縦断画像補完と補間のための暗黙的ニューラル表現 [cs.CV]目的:多モーダル縦断MRI画像の補完と補間手法
- 腫瘍学における経過観察において,縦断的マルチパラメトリックMRIが重要である。
- 実際の臨床データには,欠損シーケンスや不均一なプロトコルが存在する。
- 欠損データや空間・時間解像度の問題を解決する手法を開発する。
- 提案手法は,線形補間と比較して,T1CEおよびFLAIR画像の統計的に有意な改善を示した (p < 0.05)。
- T1CEの平均MS-SSIMは0.95 ± 0.02であり,高い再構成品質を実現している。
- 予測された信頼度は,実際の再構成品質と高い相関関係(ピアソンのr最大0.996)を示し,臨床応用への可能性を示唆する。
文脈を考慮した感情表現の専門家混合モデル:実環境における身体表現 [cs.CV, cs.AI]目的:実環境における身体表現から感情を認識するための,文脈を考慮した専門家混合モデル
- 感情認識は,人間とコンピュータの自然な対話を可能にする上で不可欠である。
- 従来の感情認識手法では,文脈情報を十分に活用できていない点が課題である。
- 本研究は,文脈情報を構造化された事前情報として活用することで,感情認識の精度向上を目指す。
- 提案手法CA-MoDEは,シーンとオブジェクトの専門家を用いて,感情カテゴリのソフトな分布を生成する。
- このソフトな分布は,文脈情報に基づいた事前情報として,身体表現の専門家の予測を調整する。
- Body Language Databaseにおいて,既存手法を上回る感情認識スコア0.3269を達成した。
ループ・マンバ:劣化を考慮した共有メモリを用いた古い写真の修復 [cs.CV]目的:古い写真の修復
- 古写真には様々な劣化が生じ,視覚的品質や意味内容が著しく損なわれるため,修復技術は重要である。
- 既存の手法では,複数の劣化を同時に処理することが難しく,構造的な再構築が不十分な場合がある。
- 劣化を考慮した状態進化と構造記憶の共有により,頑健な長距離構造再構築を目指す。
- 提案手法Loop-Mambaは,反復計算を通じて持続的な修復状態を進化させるループベースのフレームワークである。
- 劣化ガイダンスのためのSemantic-Guided Degradation Estimator (SGDE)と,構造記憶共有のためのS$^2$M-Mambaを導入した。
- SynOldベンチマークにおいて,従来の最先端手法と比較して,優れた性能を示した。特に,提案するOld Photo Damage Recovery Score (ODRS)において顕著な結果が得られた。
フィンクジラの歌の検出,音符の特性評価,および分散型音響センシングによる位置特定のためのエンドツーエンドワークフロー [cs.RO, cs.DC, cs.SD, physics.geo-ph]目的:フィンクジラの歌の検出,音符の特性評価,位置特定のワークフロー
- 海洋生態系の理解には,大型海洋生物の行動把握が不可欠である。
- 広範囲な海洋環境における鯨類のモニタリングは,技術的な課題が多い。
- DASデータから効率的に鯨類の情報を抽出し,行動モニタリングを可能にすること。
- 本ワークフローは,DASデータからフィンクジラの音符を高い精度で検出・特性評価できる。
- 手動アノテーションとの比較で,検出精度(precision)は0.88~0.99,再現率(recall)は0.74~0.81であった。
- 本手法は,重なり合う音響信号の分離や,音の種類分類,個体の移動推定に活用可能である。
ストリーミングビデオ体験からの一時的階層化メモリの成長と推論:GROVE [cs.CV, cs.AI]目的:ウェアラブルアシスタントにおける視覚的履歴に対する質問応答と,その履歴が現在の状況に役立つかどうかの認識
- ウェアラブルアシスタントの性能向上には,過去の視覚情報を活用する能力が不可欠である。
- 既存のビデオメモリシステムは質問に依存した検索に偏っており,状況に応じた能動的なサポートが難しい。
- 連続的なビデオストリームからメモリを成長させ,質問応答と状況に応じた支援を両立させること。
- GROVEは,トレーニングなしで,連続ビデオストリームから因果的に成長するメモリを構築する。
- このフレームワークは,詳細な知覚的証拠を保持し,時間的階層構造を形成することで,効率的な検索を実現する。
- MM-lifelongやEgoServeなどのベンチマークで,比較手法を上回る最高の性能を達成した。
説明可能性は転移するか? Vision TransformerとCNNに対する帰属方法の制御されたベンチマーク [cs.RO, cs.CV]目的:説明可能なAI(XAI)帰属手法の性能評価
- AIの信頼性向上には,モデルの判断根拠の解明が不可欠である。
- 従来の評価はCNNに偏っており,ViT等の新たなアーキテクチャへの適用可能性が不明である。
- ViTを含む多様なアーキテクチャにおける帰属手法の性能を体系的に比較・評価する。
- 帰属性能はアーキテクチャに強く依存し,CNNで確立されたランキングがTransformerに必ずしも適用されないことが示された。
- CAMベース手法はCNNや多くのViTで高い性能を示す一方,線形アテンションアーキテクチャでは性能が低い。
- 単一指標による評価の限界が示され,アーキテクチャを考慮した多角的評価の必要性が強調された。
基盤モデルは音の発生源を特定できるか? 音声・言語モデルと従来型分類器の段階的ベンチマーク:閉集合音源識別 [cs.SD, cs.AI]目的:閉集合音源識別における音声・言語モデルおよび従来型分類器の性能評価
- 音声認識技術は,多様なアプリケーションにおいて重要な役割を担うため,その精度向上は不可欠である。
- 既存手法では,細分化された音源の識別精度が十分でなく,実用上の課題となっている。
- 本研究は,最新の基盤モデルを含む多様な手法の性能を比較評価することで,音源識別の課題解決に貢献する。
- Gemini-3.1-Pro-Previewは,カテゴリレベルで85.6%,細分化レベルで56.7%のF1スコアを達成し,最も高い性能を示した。
- Kimi-Audioは,比較的小さなモデルサイズながらも,カテゴリレベルで67.5%,細分化レベルで32.9%のF1スコアでGeminiに匹敵する性能を示した。
- Geminiモデルの思考過程分析により,回答の長さと精度には相関関係がなく,誤った回答が自信を持って述べられることが示された。
USP-Mamba:アンミクシング由来のスペクトルおよび構造プロンプティングによるハイパースペクトル画像超解像 [cs.CV]目的:ハイパースペクトル画像の超解像技術
- 高分解能な画像と詳細なスペクトル情報の両立が求められているため。
- 従来の技術では,空間的隣接性が損なわれ,文脈情報の伝播が制限される。
- ハイパースペクトル画像の特性に合わせたMambaモデルの改良を目指す。
- 提案手法USP-Mambaは,アンミクシングに基づいたスペクトルプロンプトと画像依存の構造プロンプトを組み合わせることで,Mambaモデルの状態遷移を適応的に制御する。
- スペクトルプロンプトは,入力画像の材料組成を捉え,再構成を通して一貫した条件付けを提供する。
- 構造プロンプトは,空間的および周波数成分を利用し,局所的な詳細の保存と均質な領域と高周波詳細の適応的な遷移を可能にする。
ランツィのロッジア:3DフォトグラメトリによるAIサーモグラフィー強化比較 [cs.CV, cs.DL]目的:AIサーモグラフィー強化の比較検討
- 文化遺産の保存・修復には,構造変化の把握が不可欠である。
- 非破壊検査技術の解像度限界が,詳細な構造解析を妨げている。
- AI技術を用いた高解像度化による,構造解析の精度向上を目指す。
- AIによる画像強化が,隠れた建築的特徴の検出に貢献している。
- ハードウェア超解像とAI超解像の比較により,3Dモデルの精度への影響が定量的に評価された。
- 本研究で得られたデータセットは公開され,文化遺産アーカイブへの応用が期待される。
DF$^3$: 自律ナビゲーションにおけるデコーダーフリー特徴量予測による世界モデリング [cs.NI, cs.CE, cs.ET, cs.CV]目的:世界モデリングを通じた自律ナビゲーション
- ロボットの自律性を高める上で,周囲環境の正確な予測は不可欠である。
- 既存手法では,計算コストが高く,タスクに関連しない詳細に過剰な処理が行われる。
- デコーダーを不要とし,効率的かつ柔軟な世界予測の実現を目指す。
- 提案手法DF$^3$は,潜在空間で世界進化をモデル化し,タスク出力を直接導き出す。
- DF$^3$は,既存の画像認識モデルに学習可能なクエリを注入することで,将来の状態表現を直接抽出する。
- 公開ベンチマークやロボットシミュレーターでの実験により,高い性能と効率が確認された。
再帰的スペクトル分割による点群生成学習 [cs.CV]目的:点群生成のためのトポロジー保存テッセレーションプロセス
- 3D形状の表現として点群は重要であり,様々な応用分野で活用されている。
- 既存手法はヒューリスティックなトークン化戦略に依存し,点群のトポロジーを破壊しやすい。
- トポロジーを保存したテッセレーションにより,構造的に一貫性のある点群生成を目指す。
- PointRSPは,点群を非平衡二分木に分解するトポロジーを意識した分割オートエンコーダを導入した。
- 階層的な表現は,トポロジーの関係を維持しながら多スケール構造依存性を捉える。
- 提案手法は,生成品質と多様性において最先端の性能を達成し,複雑な3Dトポロジーへの強い汎化性を示した。
