arXiv雑要約
画像・音声 - 2026/07/31 公開
合成から現実へ:合成データと実データを用いた一貫性のあるメイクアップ転送に向けて [cs.CV]目的:メイクアップスタイル転送のための手法
- 画像編集技術の進歩は,個人の表現力向上に貢献し,様々な応用分野を広げている。
- 合成データと実データの間のドメインギャップが,実環境での性能低下を招いている。
- 合成データと実データを活用し,より自然で忠実なメイクアップ転送を実現すること。
- 本研究では,合成データ内のメイクアップの忠実性と厳密な個人識別の一貫性を保証するConsistentBeautyパイプラインを提案した。
- 実環境への適応を目的とした,強化学習に基づくRealBeautyという後学習フレームワークを新たに開発した。
- 多様なデータセットを構築し,複数のベンチマークで最先端の性能を達成,特に複雑な実環境下での個人識別性能が向上した。
表現レベルのTemporal AggregationとモデルレベルのHypergraph ReasoningによるEventベース物体検出の再考 [cs.CV]目的:Eventベース物体検出の精度向上
- 高速動作や困難な照明条件下の知覚において,Eventカメラの潜在能力が期待されている。
- 既存手法では,Temporal情報のエンコードが間接的であること,および断片的なEvent応答の集約が困難である。
- コンパクトなTemporal表現とTemporal-Hypergraph特徴推論を組み合わせることにより,これらの課題を解決する。
- 提案手法Ev-DTADは,Gen1, 1Mpx/Gen4, eTraMにおいて高い精度向上を達成した。
- HTAは,イベント間のTemporal情報を明示的に埋め込むコンパクトな表現である。
- FHTFは,多スケールEvent特徴をTemporal進化モデリングと高次の関係推論によって洗練する。
PROVE:視覚メディアのための知覚的除去一貫性ベンチマーク [cs.IR, cs.CL, cs.CV, cs.AI, cs.MM]目的:画像および動画における物体除去の一貫性評価
- 視覚メディアの編集技術は高度化の一途を辿っており,その品質評価が重要になっている。
- 既存の評価指標は,人間の知覚と一致せず,誤った評価結果をもたらす場合がある。
- 人間の知覚に合致した,より信頼性の高い評価指標とベンチマークの開発を目指す。
- 提案手法RCは,マスク領域と背景領域の空間的な一貫性,および隣接フレーム間での時間的な一貫性を評価する。
- RCは,既存の評価指標よりも人間の判断との相関性が高いことを実験的に示した。
- PROVE-Benchは,モーションオーギュメンテーションを加えたペアデータセットと,正解データのない挑戦的なサブセットで構成される。
スケール思考:適応的連続推論によるギガピクセル病理画像解析の高速化 [cs.CV]目的:ギガピクセル病理画像に対する効率的かつスケーラブルな解析手法
- 病理画像解析は,がんの診断精度向上や個別化医療の実現に不可欠である。
- 従来の解析手法は,全パッチ処理が必要であり,計算コストが高く,効率が低い。
- スケール空間における連続推論により,必要なパッチ数を削減し,解析時間を短縮すること。
- PathCTMは,従来のMILベース手法と比較して,必要な画像パッチ数を95.95%削減し,推論時間を約95.62%短縮した。
- AUCの低下なしに,上記の結果を達成した。
- PathCTMは,動的なスケール切り替えと注意機構による領域刈り込み,および信頼度に基づいた早期停止を組み合わせている。
単一画像からの物理に基づいた多物体シーン生成とリアルタイムインタラクション [cs.GR, cs.CV]目的:単一画像からの物理的に整合性があり,制御可能な動画生成
- 動画生成技術の発展は,現実世界の再現や新たな表現手法の創造に不可欠である。
- 既存手法では,物理的な整合性や制御性が十分でなく,現実的なインタラクティブ動画合成が困難である。
- 入力画像に基づき,物理的に正確で制御可能な3Dシーンを生成し,リアルタイムインタラクションを実現すること。
- PhysOmniは,単一画像から物理的に整合性のある動画を生成する,トレーニング不要のフレームワークである。
- シーン全体のジオメトリを統一された座標系で表現することで,物体の貫通や位置ずれを解消している。
- シミュレーションとレンダリングを分離することで,低遅延でフォトリアリスティックなインタラクションプレビューを実現している。
MinerU-Popo:構造化ドキュメント解析のための汎用後処理モデル [cs.CV, cs.AI, cs.CL]目的:構造化ドキュメントのページレベル解析結果から,ドキュメントレベルの一貫性のある構造を再構築すること
- ドキュメント解析は,情報検索や知識獲得において不可欠であり,その精度向上は重要である。
- 既存のOCRモデルはページ内の要素抽出に優れるものの,複数ページにわたる構造の連続性や整合性が課題である。
- ページ分割によって中断された構造(段落,表など)を回復し,ドキュメント全体の論理構造を再構築すること。
- MinerU-Popoは,多様な解析器のページレベル結果を,ドキュメントレベルの構造に変換する軽量な汎用フレームワークである。
- このフレームワークは,テキスト/表の途切れ回復,タイトル階層再構築,画像-テキスト関連付けという4つのサブタスクに分解して対処する。
- 実験結果から,MinerU-Popoは既存のOCRモデルのタイトル階層TEDSを少なくとも20%向上させ,RAGの精度向上とクエリ遅延の削減に貢献する。
BeCARE:拡散Transformer加速のための予算型キャッシュ更新 [cs.CV]目的:拡散Transformer推論におけるキャッシュ更新の最適化
- 拡散モデルは高品質な画像生成が可能だが,計算コストが高い。高速化が重要な課題。
- 既存のキャッシュ手法は,計算量予測と精度維持のバランスが難しく,柔軟性に欠ける。
- ユーザー指定の計算量制限内で,最適なキャッシュ更新戦略を自動的に決定する。
- BeCAREは,ノイズスケジュールから誤差増幅プロファイルを導出し,キャッシュリスクを評価する。
- プロンプト固有の残差とキャッシュの経過時間と組み合わせ,適切なタイミングでキャッシュを更新する。
- FLUX.1-devにおいて,既存手法と比較して3倍から6倍の高速化を実現し,画質も向上した。
より倫理的な顔画像からの年齢推定:子供のデータで学習しない汎化ゼロショットベンチマーク [cs.CV, cs.AI]目的:子供のデータを使用せずに顔画像から年齢を推定するための手法の評価
- 顔画像からの年齢推定は,児童虐待画像検出などに応用され,社会的なニーズが高い。
- 年齢推定の学習データに未成年者の画像が含まれることが倫理的・法的問題を引き起こす。
- 子供のデータを用いずに,年齢推定の精度低下を定量化し,倫理的な代替手法を模索する。
- 既存の年齢推定手法は,学習に使用されていない年齢層への汎化性能が著しく低いことが示された。
- 全てのモデルで,平均して46.4%,最大で52.8%の精度低下が見られた。
- モデルは未知の年齢層に対して,学習済み年齢層に近い値に予測を固定化する傾向がある。
PureLight: 光線追跡による複雑な照明器具の学習 [cs.HC, cs.IR, cs.SI, cs.GR, cs.CV]目的:複雑な照明器具の外観推定
- リアルな画像合成において,照明効果は重要な要素である。特に複雑な形状の照明器具の再現は困難である。
- 従来のパス トレーシング法では,複雑な光路を持つ照明器具の計算に時間がかかるという課題があった。
- 光線追跡と分布学習を用いて,効率的に複雑な照明器具の外観を推定し,高品質なレンダリングを実現すること。
- 本研究では,正規化フローネットワークを用いて,照明器具からの出射光度の確率密度関数をモデル化した。
- 学習された外観は,軽量なMLPに蒸留され,出射光度を直接推定することが可能となった。
- 提案手法により,少ないサンプル数で複雑な照明器具を任意のシーンにレンダリングすることが実現した。
胃腸転換形成の形態と病理を対象とした多種別内視鏡画像・動画データセットGIM-ENDO [cs.CV]目的:胃腸転換形成の形態と病理に関する人工知能モデル開発のためのデータセット
- 胃がんの早期発見は,治療成績向上に不可欠であり,内視鏡検査が重要な役割を担う。
- 胃腸転換形成の診断は熟練を要し,医師間のばらつきや見落としが課題となっている。
- 詳細な内視鏡所見と病理学的情報を組み合わせたデータセットを提供し,AI診断の精度向上を目指す。
- 本データセットGIM-ENDOは,内視鏡画像,動画,患者背景,病理結果を含む多種別データを提供する。
- 白色光内視鏡法(WLE)に加え,NBIやM-NBIなどの画像強調内視鏡法も収録している点が特徴である。
- 胃腸転換形成の亜型(完全型,不完全型)やOLGA/OLGIMステージング情報も含まれており,AIモデルの学習に有用である。
生成可能な再照明アバター [cs.CV]目的:フォトリアリスティックな自由視点レンダリングと環境マップによる再照明
- 人間をリアルに再現する技術は,バーチャルコミュニケーションやエンターテイメント分野で重要である。
- 既存手法では,照明条件の変化に対するリアリティの維持が課題となっていた。
- 本研究は,生成モデルを用いて,より自然で高品質な再照明アバターの実現を目指す。
- 提案手法は,物理ベースのレンダリングと確率的な改善を組み合わせることで,高画質な映像を生成する。
- 姿勢に依存したテクスチャの変動や照明効果を捉え,簡略化された反射モデルの限界を克服する。
- ビデオからビデオへの拡散モデルとエラーリサイクル戦略により,長時間の動画生成を実現する。
3D情報を考慮した幾何学的制約によるオープンボキャブラリBEVセグメンテーション [cs.CV, cs.LG]目的:オープンボキャブラリBEVセグメンテーションの実現
- 自動運転における周辺環境認識の重要性が高まっており,特にBEV表現はその有効性が示されている。
- 既存手法は学習済みのカテゴリに限定され,未知の物体に対する汎化性能が課題となっている。
- 2DセマンティクスをBEV空間に投影する際の幾何学的矛盾を解消し,未知物体認識の精度と効率を向上させる。
- 提案手法OVBEVSegは,3D幾何学的制約を活用し,GSベースの非投影を高精度化することで,オープンボキャブラリBEVセグメンテーションを実現した。
- nuScenesデータセットにおいて,未知カテゴリにおいて既存手法を15.3 mIoU上回る性能を達成した。
- 新たな学習データが不要でありながら,教師あり学習ベースラインと同等の性能を発揮し,高速かつ低メモリな推論を実現した。
SiamJEPA:JEPAにおける双子学生エンコーダの役割について [cs.CV, stat.ML]目的:JEPAにおける双子学生エンコーダの効果
- 自己教師あり学習は,ラベルなしデータから有用な特徴量を学習する上で重要である。
- 既存のJEPAモデルは,単一のエンコーダを使用しており,表現能力の限界がある。
- 双子エンコーダがJEPAの学習を促進し,表現分離度を向上させることを示す。
- SiamJEPAは,双子学生エンコーダとEMA教師ネットワークを組み合わせたモデルである。
- ImageNet線形プローブ実験により,双子エンコーダがJEPAの正則化として有効であることが示された。
- 限られた学習予算下で,SiamJEPAは単一エンコーダJEPAモデルやMAEよりも高い線形プローブ精度を達成した。
CompoVista:伝統中国絵画の構成分析のための構成グラフに基づく視覚分析システム [cs.HC, cs.GR]目的:伝統中国絵画における構成分析手法の確立
- 伝統中国絵画は,空間配置や文化的意味の理解において重要な役割を果たす。
- 大規模コレクションにおける構成パターン特定・比較が,定性的な解釈に依存し困難である。
- 構成分析のための表現と可視化システムを開発し,構成パターン発見を支援する。
- CompoGraphという構造化された表現を導入し,絵画の構成を多層的に分析可能にした。
- CompoVistaは,インタラクティブなクエリにより絵画群の構成を探索し,比較分析を可能にする。
- ケーススタディとユーザ調査の結果,CompoVistaが構成パターンの発見・検証に貢献することが示された。
運用地球観測分類器の事前照合評価:センチネル1内部波検出における3値報告手法のデモンストレーション [cs.LG, cs.CV, eess.IV]目的:内部波検出における運用分類器の評価方法の改善
- 地球観測は,環境変動の監視や防災などに不可欠であり,その精度向上が重要である。
- 従来の評価手法では,運用環境での発生率を考慮せず,過剰に高い精度を報告する問題があった。
- 運用環境の事前確率を考慮した評価手法を確立し,より現実的な性能評価を実現すること。
- 従来のバランスデータでの評価は,実際の運用における精度を過大評価することが示された。
- 事前確率を考慮した3値報告手法により,より正確な精度評価が可能となることが実証された。
- 内部波検出において,運用時の事前確率で0.927の精度を達成し,未知の期間への汎化性能も確認された。
実世界画像デヘイズのためのバックボーン非依存確率的摂動学習 [cs.CV]目的:実世界画像のデヘイズ処理における性能向上
- 現実世界の画像は,大気汚染などにより視界が悪化し,画像解析の精度低下を招くため,デヘイズ処理が重要である。
- 既存のデヘイズ手法は,空間的に不均一なヘイズや照明条件への依存性,物理的な曖昧さへの対応が不十分である。
- 本研究は,決定論的なマッピングではなく,確率的な摂動学習を用いることで,よりロバストなデヘイズ処理を実現する。
- 提案手法BSPLは,様々なバックボーンネットワークに容易に組み込むことが可能であり,わずかな推論オーバーヘッドで性能を向上させる。
- LSPMにより,入力画像に応じた摂動分布を学習し,特徴応答の不一致を適応的に調整することで,デヘイズ性能を高める。
- PPRMは,学習された摂動と伝送/大気光の事前知識を用いて,復元結果からヘイズ画像を再構築し,劣化の一貫性を強化する。
SAM3のセマンティック応答を用いたドメイン横断型インフラクラックセグメンテーションのための学習不要デコーディング [cs.CV]目的:ドメイン横断型インフラクラックセグメンテーションにおける性能向上
- インフラの老朽化が進み,クラックの自動検出・セグメンテーションの重要性が増している。
- 材料,撮影条件,クラック形状の違いにより,ドメイン横断的なクラックセグメンテーションは困難である。
- 凍結されたモデル内のクラック情報を最大限に活用し,学習不要でセグメンテーション精度を向上させる。
- 提案手法SERDは,SAM3のネイティブな提案インターフェースの出力と内部応答の不一致を解消する。
- SERDは,応答を直接デコードすることで,未知のデータセット上でSAM3を上回る性能を達成した。
- SERDは,わずかなソースドメインデータで高い汎化性能を示し,実用的なクラックセグメンテーションの実現に貢献する。
RFMSR:画像超解像のための残差フローマッチング [cs.CV]目的:画像超解像のための残差フローマッチングフレームワーク
- 画像超解像は,低解像度画像を高品質に復元する重要な技術であり,様々な応用分野で求められている。
- 既存手法は,大規模モデルや高コストな学習を必要とする,または低解像度画像の構造的情報を十分に活用できていない。
- 低解像度画像を起点としたフローマッチングにより,効率的かつ高精度な画像超解像を実現することを目指す。
- RFMSRは,低解像度画像を起点にフローを構成することで,輸送距離を短縮し,構造的情報を保持する。
- 二段階学習戦略により,単段階生成と多段階リファインメントの両立を実現した。
- 実験結果から,RFMSRは最先端手法と同等またはそれ以上の知覚的品質を達成することが示された。
FlexiGrad:階層的微細分類のための適応勾配変調 [cs.CV]目的:階層的微細分類における勾配の相互作用の制御
- 微細な認識タスクは,分類の精度向上に不可欠であり,その効率的な学習手法が求められている。
- 階層構造を持つ分類タスクにおいて,粗粒度と微粒度の分類器間の勾配の競合が学習の不安定化を招く。
- 勾配の競合を抑制し,一貫性のある粗粒度から微粒度への表現学習を可能にすること。
- 提案手法FlexiGradは,パラメータを必要とせず,バックプロパゲーション中に有害な勾配成分を除去し,共通方向を強化する。
- FlexiGradは,既存のアーキテクチャに容易に組み込むことができ,CUB-200-2011,FGVC-Aircraft,Stanford Carsデータセットで精度向上を実証した。
- この手法により,安定した最適化が実現し,大域的な構造と微細な識別的特徴の両方が維持される。
拡散Transformerにおけるテキストテンプレートトークンは暗黙的な意味登録器である [cs.CV]目的:拡散Transformerにおけるテキストテンプレートトークンの役割の解明
- 画像生成AIの性能向上には,Transformerアーキテクチャの理解が不可欠である。
- 大規模拡散Transformerでは,テキストプロンプト以外にテンプレートトークンが混在し,その影響が不明確である。
- テンプレートトークンが画像生成において,どのように意味情報を保持しているかを明らかにすること。
- テキストテンプレートトークンは,プロンプト自体の情報をほとんど持たないが,画像への注意機構において重要な役割を果たす。
- これらのトークンは,オブジェクトの同一性を維持する暗黙的な意味登録器として機能し,画像ラテントから情報を間接的に獲得する。
- 本研究から得られた知見に基づき,不要な注意ヘッドを削除するプルーニング手法を提案し,計算コストを削減した。
PathAgentBench:全スライド病理画像における証拠探索型ビジョン言語モデルのベンチマーク [cs.CV, cs.AI]目的:全スライド病理画像からの証拠探索能力を持つビジョン言語モデルの評価
- 病理診断の精度向上は医療の質を改善し,患者の予後を左右する重要な課題である。
- 既存のベンチマークは,あらかじめ切り出されたパッチや特徴量に依存しており,ギガピクセル画像からの自律的な証拠探索能力の評価が不十分である。
- 全スライド病理画像から直接証拠を獲得し,統合する能力を客観的に評価するためのベンチマークを確立すること。
- PathAgentBenchは,画像からテキストへのマッチング,テキストから画像への検索,診断領域の局所化,マルチスケール推論の4つの能力を評価する。
- 優れたオープンウェイトモデルは,マルチスケール推論で93%以上の精度,クロスモーダルマッチングで50%以上の精度を達成した。
- 診断領域の局所化は依然として課題であり,テキスト誘導型平均IoUは0.09を下回っている。自律探索では,倍率が高くなるにつれてヒット率が低下する。
エージェントHOI:暗黙的な表現アラインメントによる人間-物体インタラクション動画生成のためのマルチエージェント推論 [cs.CV]目的:人間-物体インタラクション動画生成におけるマルチエージェント推論
- 動画生成技術の進歩に伴い,人間と物体のインタラクションを精密に制御する需要が高まっている。
- 既存手法は明示的な運動制御に依存しており,多様な物体やインタラクションへの対応が困難である。
- 高レベルな意図と物理的な実行を結びつけることで,より自然で汎用性の高いインタラクション動画生成を目指す。
- AgentHOIは,知覚,インタラクション,運動計画といったマルチエージェント推論を通して,テキストから動画生成を行うフレームワークを提案。
- 生成されたインタラクション計画に基づき,テキスト駆動の運動理解を強化し,テキストと運動の暗黙的なアラインメント戦略を導入。
- 実験の結果,AgentHOIは,複雑な指示への準拠,物体外観の保持,インタラクションの自然さを大幅に向上させることが示された。
三人者微分ゲーム論理 [cs.LO, cs.GT]目的:三人者微分ゲームの検証
- 複数のエージェントが相互作用するシステムの検証が重要である。
- 従来のゲーム論理は,協力関係を考慮した検証が困難である。
- プレイヤー間の協調可能性を考慮した検証手法の確立。
- 本研究では,三人者微分ゲーム論理dGL3を提案し,離散動的システムと微分方程式のハイブリッドゲームの検証を可能にした。
- dGL3は,プレイヤーの個別の目標と協調の可能性を考慮することで,複雑な状況の検証に優れている。
- dGL3の構文と意味論を提示し,健全かつ完全な証明規則を導入した。
キャッシュ検索:ビデオ拡散におけるテスト時検索のための訓練不要キャッシュ探索 [cs.AI, cs.CV, cs.MM]目的:ビデオ拡散モデルにおけるテスト時検索の効率と品質の向上
- ビデオ拡散モデルは高品質な動画生成を可能にするが,計算コストが高いという課題がある。
- テスト時検索は計算コストを削減するが,候補生成に依然として大きな計算資源を要する。
- キャッシュ探索により,計算コストを抑えつつ,テスト時検索の性能を維持・向上させることを目指す。
- 訓練不要のキャッシュ手法を用いることで,候補生成の速度を向上させ,画質劣化を最小限に抑えることができた。
- キャッシュによる候補ランキングへの影響は軽微であり,自己制限的な傾向が見られた。
- 提案手法「キャッシュ検索」は,計算コストを削減しながら,既存手法と同等の性能を達成し,さらなる性能向上も示した。
LU-500:概念アンラーニングのためのロゴベンチマーク [eess.SY, cs.SY, cs.RO, cs.CV, cs.AI]目的:テキスト画像生成モデルにおける保護または危険な視覚的概念の再現を制限するための概念アンラーニングの評価
- テキスト画像生成モデルの安全性向上は重要であり,意図しない概念の再現を抑制する必要がある。
- 既存研究では,ロゴのような局所的で複雑な概念のアンラーニングは十分には検証されていない。
- ロゴのアンラーニングに特化したベンチマークを構築し,その困難性を明らかにすることを目指す。
- LU-500ベンチマークは,フォーチュン・グローバル500企業のロゴを用いて,明示的・暗示的な評価トラックを提供する。
- 評価対象手法は,ロゴの除去と画像全体の保全のバランスを取ることに苦慮していることが示された。
- ロゴの面積,位置,構造的複雑さがアンラーニングの難易度に影響することから,空間認識型制御の必要性が示唆された。
オンポリシー拡散蒸留におけるクラシファイアーフリーガイダンスの再検討 [cs.CV, cs.AI, cs.LG]目的:オンポリシー拡散蒸留におけるクラシファイアーフリーガイダンスの挙動に関する理解
- 拡散モデルは画像生成などの分野で高い性能を発揮しており,その応用範囲は広い。
- オンポリシー蒸留におけるクラシファイアーフリーガイダンスの適切な活用方法は未解明な点が多い。
- ネガティブブランチの非対称性に着目し,ブランチを意識した新しい学習方法を提案する。
- 従来の学習方法は,ブランチレベルで誤差が相殺され,教師モデルと生徒モデルの間の知識伝達が不十分になる場合があることが示された。
- 提案手法であるPositive--Direction Matching (PDM)は,ポジティブブランチとCFG条件方向を個別に制約することで,この問題を解決する。
- ビデオ制御の実験では,PDMは従来の学習方法よりもロバストで効果的な知識伝達を可能にすることが確認された。
デスクトップ・デルタ・ベンチ:コンピュータ使用モデルはデスクトップGUIの遷移を理解しているか? [cs.AI, cs.CV]目的:デスクトップGUI遷移の因果関係を再構成する能力の評価
- 複雑なタスク遂行において,GUIを通じたコンピュータ操作が不可欠であるため。
- 既存の評価指標では,GUI操作の因果関係を特定できず,モデルの信頼性検証が困難である。
- GUI遷移における状態検証,ソース追跡,文脈対応制御の能力評価指標を提示し,モデルの改善を目指す。
- Desktop-Delta Bench(DDB)は,GUI遷移の因果関係を評価するオフラインベンチマークである。
- 3フレームの時系列順序タスクと,行動前後のペアタスクにより,モデルの性能を評価した結果,明確な課題が残存する。
- タスクの文脈が誤認識の特定には役立つが,正確性とのトレードオフが存在し,改善の余地がある。
EgoSafe: 視覚的安全理解のための一人称モバイルキャプチャベンチマーク [cs.CL, cs.CV]目的:視覚的安全理解における因果関係推論能力の評価
- 実世界における安全確保のため,単なる物体認識を超えた高度な視覚理解が不可欠である。
- 既存の評価は第三者視点に偏っており,一人称視点の動的な状況下での論理的推論能力を十分に評価できていない。
- 一人称視点動画を用いた新しいベンチマークにより,LVLMの因果関係推論の脆弱性を明らかにすること。
- EgoSafe-Benchは,12,000件の評価サンプルと,階層的推論評価プロトコル(HRE)で構成され,論理的な整合性を重視した評価を可能にする。
- 最先端のLVLMの評価では,記述的なスコアは高いものの,因果関係推論と論理的な結論において脆弱性が見られた。
- 本研究は,論理的に堅牢な動画理解システムの開発を促進するための,挑戦的なデータセットと評価フレームワークを提供する。
表現軌跡は重要である:外分布検出と画像分類のための補完的な証拠 [cs.CV]目的:外分布検出と画像分類における表現学習の過程の重要性
- 画像認識の信頼性向上は,安全なAIシステム構築に不可欠である。
- 既存の外分布検出手法では,未知のデータに対する誤検出が多い。
- モデル内部の計算過程に着目し,信頼性の高い識別指標を開発する。
- 表現学習の軌跡はサンプル固有の連続性を示し,モデル構造に依存した深さプロファイルが確認された。
- 遷移驚異度(transition-surprise score)は,既存の外分布検出器と組み合わせて誤検出率を大幅に低減した。
- 凍結更新プローブは,クリーンなデータセットにおいてモデルの性能向上に寄与した。
潜空間におけるガルバニック前庭刺激 [cs.HC, cs.GT]目的:ガルバニック前庭刺激波形と自由記述による体験記述を結びつけるデータセット,およびターゲット記述からの候補波形を合成するための検索誘導型生成モデル
- ガルバニック前庭刺激は,自己定位,平衡感覚,運動知覚の調整に広く用いられ,身体的なフィードバックの手段として期待されている。
- ターゲットイベントや身体状態に合致するガルバニック前庭刺激波形の合成は困難であり,そのパラメータ間の相互作用が十分に解明されていない。
- テキストによる指示に基づいたガルバニック前庭刺激波形の合成を可能にし,意味的に合致した身体的フィードバックの提供を目指す。
- ガルバニック前庭刺激波形と体験記述のデータセットを構築し,多様な運動・力覚関連,身体感覚,状況連想が認められた。
- 同一波形から得られた記述は,より少ない意味カテゴリに分類され,主要カテゴリの割合が高かった(P < 0.001)。
- 検索誘導型1次元畳み込み変分オートエンコーダによる波形合成が可能であり,合致/不一致の識別実験で有意な結果が得られた(精度: 63.33%)。
ScratchSim:表面傷検出のための手続き型合成データパイプライン [cs.CV, cs.AI]目的:表面傷検出のための合成データ生成パイプライン
- 産業界における品質管理において,自動欠陥検出は重要な役割を担う。
- 欠陥データの注釈付きデータ不足が,自動欠陥検出の課題となっている。
- 大規模な合成データを用いて,実データ不足時の欠陥検出性能向上を目指す。
- 合成データで事前学習することで,実データのみでの学習を上回る性能が示された。
- 実データが少ない状況下では,合成データと実データを混合した学習が有効であることが確認された。
- 本手法は,大規模な注釈付き実データなしで,スケーラブルな欠陥検出を可能にする。
マルチモーダル空間推論における視覚的貢献度評価 [cs.CV, cs.AI]目的:マルチモーダル空間推論ベンチマークにおける視覚情報の貢献度評価
- 視覚情報と言語情報を組み合わせた推論は,AIの知能化において重要である。
- 既存の空間推論ベンチマークは,画像がなくても正解に到達できてしまう場合がある。
- 画像が正解にどの程度貢献しているかを客観的に評価する手法を開発する。
- 視覚的貢献度評価(VCA)により,モデルの判断に対する画像の貢献度と,関係性特有の視覚的証拠への応答を分離できることが示された。
- 多くのモデルにおいて,正解でありながら画像によるサポートが確認できないケースが12.73-26.25%存在することが明らかになった。
- 画像のシャッフル実験により,画像の貢献度が有意に低下することが確認され,VCAの有効性が裏付けられた。
MMAC:音声キャプションのための大規模多次元ベンチマーク [cs.SD, cs.AI]目的:音声キャプションの評価基準
- 近年,音声LLMが発展しており,音声キャプションの記述内容も簡潔なものから詳細なものへと変化しつつある。
- 既存の評価方法では,生成品質やタスクの性能に焦点が当たりがちで,情報網羅性や信頼性の診断が困難である。
- MMACは,情報網羅性と記述信頼性を評価するための多次元ベンチマークとして,この問題を解決することを目指す。
- MMACは,20以上のデータソースから収集された5,638個の音声クリップを含み,6つの能力カテゴリと15の評価次元を網羅する。
- 生成されたキャプションが,ターゲット次元における関連情報を記述しているか,そしてその内容が参照ラベルと一致しているかを検証する。
- オープンソースおよび商用のAudioLLMの評価結果から,評価次元,情報網羅性,記述信頼性に明確な差異が認められた。
BCNet:構造誘導表現学習による気管支分類 [eess.IV, cs.CV]目的:気管支の分類
- 肺や気道疾患の診断にはCT画像に基づく気管支解析が不可欠であり,その重要性は高い。
- 個々の患者間で気管支の構造が大きく異なるため,自動的な気管支分類は困難である。
- 個人差にロバストな気管支分類手法を開発し,診断支援の精度向上を目指す。
- 提案手法BCNetは,既存の最先端手法と比較して,F1スコアで8.0%以上の性能向上を達成した。
- BCNetは,点群からのセグメントレベルのトポロジー情報を活用し,ボクセルレベルの表現学習を改善する。
- BCNetは,高品質な気管支画像のアノテーションデータセットBronAtlasを公開し,今後の研究開発に貢献する。
物理的事前知識に基づく協調学習フレームワーク:大気乱れ劣化推定と赤外線画像復元の同時実行 [eess.IV, cs.CV]目的:大気乱れ強度の推定と赤外線画像の復元
- 赤外線画像と大気乱れ計測は,多くの分野で広く求められている。
- 従来の復元手法では,大気乱れの正確な推定が困難である。
- 物理的事前知識を活用し,推定と復元の精度向上を目指す。
- 提案手法P2GCLは,乱れ強度推定(Cn2 MAE 0.0156改善,R2 0.1065向上)と画像復元(PSNR 0.2775 dB向上)の両方で最高性能を達成した。
- 2つのモデル間の循環的な協調学習が,推定と復元を相互に高め合うことを示した。
- 物理理論に基づいた損失関数が,学習過程を物理的に整合させる上で重要であることが確認された。
医療画像AIにおけるスケーラブルなドリフト監視 [eess.IV, cs.CV, cs.LG]目的:医療画像AIにおけるドリフト監視の実現
- 医療AIは診断精度向上に貢献するが,長期的な信頼性確保が課題。
- AIモデルの性能は時間経過とともに劣化する可能性があり,監視が必要。
- 継続的な性能監視の代替案として,コスト効率の良いドリフト監視を目指す。
- MMC+は,多様なデータストリームに対応し,大規模な環境下でのスケーラビリティを向上。
- MedImageInsight等の基盤モデル統合により,サイト固有の学習を不要とし,高次元画像埋め込みを実現。
- COVID-19パンデミック時の実際のデータで検証し,データシフトとモデル性能変化との相関を検出。
AIの利益が広く共有されるのはいつか:AI駆動型自動化に対する政策的閾値 [econ.TH, cs.SI, econ.GN, cs.AI, cs.GT, q-fin.EC]目的:AI駆動型自動化による社会全体の利益の広範な共有の可否
- AI技術は経済成長と社会変革の重要な推進力となる可能性を秘めている。
- AIによる利益が一部に偏り,格差を拡大する懸念が存在する。
- AI技術の進歩が社会全体に恩恵をもたらすための政策的条件を特定する。
- AIの利益が広く共有されるためには,技術的進歩だけでなく,公共による獲得,導入コスト,自動化範囲,市場構造が重要である。
- 公共による獲得率を33%に引き上げることは,AI能力の大きな向上に匹敵する効果があり,さらに高める効果は限定的である。
- 税制や公的資産モデルなど,政府がAIの利益を測定,回収,分配するための具体的な手段を特定した。
ニューラル圧縮のためのロバスト残差有限スカラー量子化 [physics.med-ph, cs.RO, eess.IV, cs.CV, eess.AS]目的:ニューラルネットワークの圧縮における残差有限スカラー量子化の改良
- 深層学習モデルのサイズ削減は,モバイルデバイス等での利用を可能にする上で重要である。
- 多段階量子化では,後続の段階で信号強度が指数関数的に減衰し,性能低下を招く。
- 残差量の減衰を抑制し,多段階量子化の表現力を向上させることを目指す。
- 提案手法RFSQは,学習可能なスケーリング因子と可逆なレイヤー正規化により,残差量の減衰を効果的に抑制する。
- 音声再構成実験では,RFSQ-LayerNormは最先端手法RVQを3.6%上回るDNSMOSスコア3.646を達成した。
- ImageNet画像実験では,RFSQはL1損失と知覚損失においてそれぞれ9.7%と17.4%の改善を実現した。
口腔病変分類のための不確実性考慮型マルチモーダル融合 [eess.IV, cs.CV]目的:口腔病変の分類
- 口腔がんの早期発見は重要であり,特にリソースの限られた環境下では課題となる。
- アノテーション付きデータの不足が,正確な診断を妨げる要因となっている。
- 限られたデータでもロバストな診断を実現する手法を開発すること。
- RGB画像からハイパースペクトル画像を再構成することで,診断精度を向上させた。
- 複数の機械学習モデルをアンサンブル学習により統合し,不確実性を考慮した予測を可能にした。
- 提案手法は,未知のテストデータセットにおいて,マクロF1値66.23%,全体精度64.56%を達成した。
収縮アンカリングによる深層再構成演算子の安定化 [eess.IV, cs.CV]目的:深層再構成における不安定性を抑制するための枠組み
- 画像再構成は,医療や科学分野において重要な役割を担う処理であり,高精度な再構成手法が求められている。
- 深層学習を用いた再構成手法は強力だが,反復処理の過程で再構成が不安定になるという課題がある。
- 事前学習済みのデノイザーの不安定性を,再学習なしに抑制し,信頼性の高い再構成を実現すること。
- 提案手法では,再構成演算子の局所的な不安定性を定量化し,収縮演算子によってこれを抑制する。
- 収縮演算子は,再構成の安定性を保つための「アンカー」として機能し,崩壊を防ぐ。
- 様々な画像再構成タスクにおいて,提案手法は安定した性能と信頼性の向上を示した。
