arXiv雑要約

AI - 2026/08/05 公開

  • CARE-X:補助的監督学習,報酬整合学習,ツール拡張測定による臨床利用可能な放射線画像VLMsへ [cs.CV, cs.AI]目的:臨床的に有用な胸部X線画像システムの開発
    • 医療現場における画像診断の効率化と精度向上が求められている。
    • 既存のビジョン言語モデルは,画像所見の分類,局在化,計測を統合的に扱えていない。
    • 放射線科医のニーズに応える,構造化予測と生成を強化するモデルの構築。
    • CARE-Xは,補助的な識別的監督学習と報酬整合生成を統合することで,診断予測の精度と空間局在化性能を向上させた。
    • 報告書生成,視覚的質疑応答(VQA),空間的根拠付けにおいて,最先端の性能を達成した(ReXVQAで94.0%の精度)。
    • 測定依存型診断のため,Qwen3-VL-4B-Instructにツール呼び出し機能を組み込み,測定精度を大幅に向上させた(平均F1スコア+43.6pp)。

    Link: https://arxiv.org/abs/2608.03890

  • Qwen3におけるコントラスト付加活性化による時間的選好の制御 [cs.AI]目的:言語モデルにおける時間的選好,推奨,能力の変化
    • AIが遅延コスト・利益を伴う助言を行う上で,時間的選好の理解が重要である。
    • 大規模言語モデルの時間的選好が明確に測定・制御されていない。
    • 言語モデルの残差ストリームから時間的選好を特定し,制御する手法を確立する。
    • コントラスト付加活性化による制御により,言語モデルの時間的選好を双方向に大きく変化させることが可能となった。
    • 報酬の大きさや遅延時間を変化させた実験において,モデルの無差別点(より小さく早く得るか,より大きく遅く得るかの選択)を効果的にシフトさせた。
    • 適度な時間的制御によって,計画に関連する能力指標が向上した。

    Link: https://arxiv.org/abs/2608.03892

  • LLMファミリーにおけるクロスモデルKVキャッシュ転送:事前計算の再利用のための閉形式線形マッピング [cs.LG]目的:LLMファミリー内でのクロスモデルKVキャッシュ転送の実現
    • LLMの推論コストは高く,モデルサイズ変更時の再計算が課題。
    • モデル切り替え時にKVキャッシュを再計算する必要があり,効率が悪い。
    • KVキャッシュの再利用により,モデル切り替え時のコスト削減を目指す。
    • ソースモデルのKVキャッシュをターゲットモデルで再利用する手法を提案。
    • KVペアには線形構造が存在し,少数のソース層でターゲットの情報を説明可能。
    • 提案手法は,再計算と比較して大幅な高速化と高い精度を両立する。

    Link: https://arxiv.org/abs/2608.03893

  • 効率性が脆弱性となる時:適応型UAV追跡における動的ルーティング脆弱性の悪用 [cs.CL, cs.IR, cs.AI]目的:適応型UAV追跡における動的ルーティング脆弱性の悪用可能性
    • UAVの計算資源制約から,性能追求から効率と精度のバランス重視へと追跡パラダイムが変化している。
    • 適応型Transformer Trackerは効率性で優れるが,計算パス決定のLipschitz特異性という構造的欠陥を抱えている。
    • 入力摂動による推論トポロジーの劇的な変化を引き起こす脆弱性を明らかにし,新たな攻撃手法を提案する。
    • 適応型追跡ネットワークのゲートモジュールにおけるLipschitz特異性を数学的に特徴づけ,攻撃対象領域として特定した。
    • Adversarial Path-Inversion (API)フレームワークを提案し,ゲート決定を操作して計算パスを改変する攻撃を可能にした。
    • APIは既存の手法よりステルス性が高く,攻撃効果が高く,推論速度も速いことを実験で示した。

    Link: https://arxiv.org/abs/2608.03902

  • 社会理論を通じた多元的視点の協調:社会に根ざした能動的AI [cs.AI, cs.LG, cs.MA]目的:多元的な視点の認識,表現,および対応
    • AIの社会実装が進む中で,価値観の多様性への対応が不可欠となっている。
    • 既存のアプローチは,社会における価値観の組織化,争点化,協調のメカニズムが不明確である。
    • 社会理論を基盤とした,多元的な視点の構造化された協調を目指す。
    • 社会理論(社会学)の知見をAIシステム設計に活用し,役割ベースの表現,構造化された協調,文脈依存の評価を可能にする。
    • 出力の多様化ではなく,社会に根ざした協調という観点から多元的なアライメントを再定義する。
    • 多元的な視点を構造的かつ説明責任のある形で取り扱うシステムの設計空間を提示し,今後の研究の方向性を示す。

    Link: https://arxiv.org/abs/2608.03910

  • 効率的な回路抽出のための疎な重み分解 [cs.LG, cs.CL]目的:事前学習済みTransformerの効率的な回路抽出手法
    • 大規模言語モデルの内部動作を理解する試みは,AIの安全性と信頼性向上に不可欠である。
    • 既存手法は,回路抽出のために追加学習が必要で,計算コストが高く,元のモデルとの乖離が生じやすい。
    • 追加学習なしに,既存モデルの重みを分解し,解釈可能な回路ユニットを抽出することで,効率性と精度を両立する。
    • 提案手法(SWD)は,Transcoder等の既存手法と同等の精度を,より少ないデータで達成する。
    • SWDは,回路の十分性・必要性の目標を,より少ない活性化エッジと選択ユニット数で達成する。
    • SWDは,モデル全体の重み置換にも適用可能であり,ステップ毎の分析等のメカニズム解釈分析を促進する。

    Link: https://arxiv.org/abs/2608.03913

  • 加速一致による軌跡推論 [cs.LG, math.OC, stat.ML]目的:軌跡推論
    • 科学研究の多様な分野において,離散的な時間における観測スナップショットから滑らかな軌跡を生成することは重要である。
    • 既存のアルゴリズムは,計算コストが高く,前処理が必要であったり,シミュレーションに依存したりする課題があった。
    • 本研究は,計算効率が高く,前処理やシミュレーションを必要としない新しい軌跡推論アルゴリズムを提案し,その問題を解決する。
    • 提案手法である加速一致(AM)は,位相空間への問題を持ち上げ,観測データと一致する滑らかな軌跡を誘導する条件付き加速度場を回帰する。
    • AMは,位置データのみを必要とし,学習中に軌跡シミュレーションを行わず,高価な前処理を回避できる。
    • 複数のベンチマーク問題において,既存のアルゴリズムと同等またはそれ以上の性能を示すことが数値的に示された。

    Link: https://arxiv.org/abs/2608.03916

  • 因果的知覚の実装:競合するSCMと状況化された公平性 [cs.AI]目的:競合する構造因果モデル(SCM)を持つ主体間の因果的知覚
    • 因果推論は,意思決定やAIシステムの解釈可能性において重要であり,現実世界の問題解決に不可欠である。
    • 複数の主体が異なる因果モデルを持つ場合,公平性の評価が難しく,合意形成が困難になるという課題がある。
    • 異なる因果モデルを持つ主体間の認識のずれを定量化し,公平性への影響を評価することで,より公平な意思決定を支援する。
    • 因果的知覚のフレームワークを実装し,構造的およびパラメータ的な因果的知覚を操作化した。
    • 介入分布と反事実分布を計算するアルゴリズムを設計し,不一致を定量化するための距離尺度を提案した。
    • ドイツ信用データセットを用いて,因果的知覚が多専門家による意思決定の精度と公平性に影響を与えることを示した。

    Link: https://arxiv.org/abs/2608.03917

  • いつ,どこを見るか:効率的な長尺動画理解のための適応的視覚的証拠スケジュール [cs.CV, cs.AI]目的:効率的な長尺動画理解のための視覚的証拠スケジュール手法
    • 長尺動画理解は,動画の内容を正確に把握する上で不可欠であり,様々な応用分野で重要性が増している。
    • 既存手法は,固定された予算内でフレームを選択するため,動画の内容に応じて柔軟に対応できないという課題がある。
    • 本研究は,動画の内容に応じてフレーム予算を動的に調整し,効率的に証拠フレームを選択することを目指す。
    • 提案手法EcoFrameは,VLMsの推論フィードバックを活用し,フレーム予算の増加タイミングと追加証拠の検索場所を決定する。
    • Video-MME,LongVideoBench,MLVU等のデータセットで,EcoFrameは既存手法と比較して,精度と効率性のバランスに優れることを示した。
    • 特にQwen2.5-VLにおいては,BOLTを上回り,AKSやBOLTに対して1.85倍の高速化,A.I.R.に対して最大13.5倍の高速化を達成した。

    Link: https://arxiv.org/abs/2608.03918

  • 等変性音楽Transformer [cs.SD, cs.AI]目的:音楽表現空間における等変性の概念
    • 音楽認知において,時間移動や音高変化に対する不変性は重要である。
    • 既存の音楽Transformerは,規模拡大に伴い等変性が低下する。
    • 等変性を明示的に学習することで,音楽構造のより良い表現を目指す。
    • 提案手法Equivariant Music Transformer(EMT)は,自己知識蒸留と正則化損失により等変性を実現した。
    • EMTは,既存手法と比較して,等変性と生成能力の両面で優れていることを示した。
    • 標準的な言語モデリングでは音楽の対称性を捉えきれないことが示唆された。

    Link: https://arxiv.org/abs/2608.03920

  • Transformer革命:出力重み相互接続による動的処理 [cs.AI, cs.NE]目的:Transformerモデルにおける推論時の処理メカニズムの解明
    • 大規模言語モデルの性能向上は目覚ましいが,その内部動作は未だ解明されていない点が多い。
    • Transformerは統計的規則の再現に過ぎないとする「確率的オウム」説が広く存在する。
    • Transformerが入力に応じて動的に変換を生成し,概念を概念によって変換する仕組みを明らかにする。
    • Transformerは,訓練で固定された静的な処理に加え,入力シーケンスから生成される動的な処理によって概念変換を行う。
    • この動的処理の貢献度はプロンプトの長さとともに増加し,静的処理と同等かそれを上回る「強いプロンプト感度」を示す。
    • SIDPP(シーケンスレベルのインタラクティブな動的並列処理)は,人間の脳神経系でも実現可能であり,人間の言語処理との類似性が示唆される。

    Link: https://arxiv.org/abs/2608.03921

  • PRISM:多変量異常検知のための強力な時系列-画像変換表現 [cs.RO, cs.LG, cs.AI, cs.CV]目的:多変量時系列異常検知における画像ベース表現の構築と評価
    • 予測保全,金融,クラウドコンピューティングなど幅広い分野で時系列異常検知が重要視されている。
    • 多変量時系列データにおける適切な表現の選択が困難であり,性能に大きな影響を与える。
    • 時系列データを画像に変換する際の最適な手法を模索し,異常検知性能の向上を目指す。
    • PRISMというメタワークフローを開発し,7000件以上の実験を通じて画像ベース表現の有効性を示した。
    • PRISMの適切な設定は,14データセットのうち10個で最良のVUS-PRを達成し,競合手法を平均41%上回った。
    • ImageNetで事前学習したエンコーダが時系列異常検知に効果的に転移することを確認した。

    Link: https://arxiv.org/abs/2608.03926

  • エンジニアリングされた骨格筋組織の収縮ダイナミクスをパラメータ化する物理学に基づいたTransformerネットワーク [cs.LG]目的:エンジニアリングされた骨格筋組織の収縮ダイナミクスのパラメータ化
    • 生体医学疾患モデリングや薬理学的スクリーニングにおいて,エンジニアリングされた骨格筋組織は重要な構造となっている。
    • 従来の機能評価はピーク力に依存し,重要な運動学的情報を無視している。複雑なメカニズムモデルがその原因である。
    • 本研究は,物理学に基づいたニューラルネットワークを用いて,筋組織の運動学的特性評価を自動化し,スケーラブルなデータ解析を目指す。
    • 提案手法は,力-時間プロファイルから物理的に意味のあるパラメータを直接抽出する。
    • 合成データと実際の測定データを用いたハイブリッド学習により,高精度なパラメータ化を実現した。
    • デュシェンヌ型筋ジストロフィーモデルを含む多様な収縮表現型と細胞株で有効性が確認された。

    Link: https://arxiv.org/abs/2608.03927

  • 拡散モデルの嗜好性整合のための潜在報酬レジスタ [cs.LG, cs.CV]目的:拡散モデルと人間の嗜好性との整合
    • 近年の生成モデル研究において,人間の嗜好に合致した高品質な画像生成が重要な課題となっている。
    • 従来の報酬信号は最終生成物のみで評価されるため,多段階のノイズ除去過程における因果関係の特定が困難である。
    • 中間的な潜在変数から直接嗜好性を推定し,効率的な嗜好性整合を実現することを目指す。
    • 提案手法である潜在報酬レジスタは,ノイズの多い潜在変数から高精度に嗜好性を推定可能である。
    • 報酬勾配を用いたオンポリシー蒸留(RG-OPD)は,従来の強化学習手法を凌駕し,計算コストを大幅に削減する。
    • 報酬誘導サンプリング(RGS)は,パラメータ更新なしに最先端の性能を達成し,嗜好性整合と知覚品質の両方を向上させる。

    Link: https://arxiv.org/abs/2608.03929

  • 言語以前に論理を:形式的推論での事前事前学習がスキル獲得と圧縮可能性を促進する [cs.CL, cs.AI, cs.LG]目的:言語モデルにおけるスキル獲得の加速と圧縮可能性の向上
    • 自然言語処理の性能向上には,言語モデルの初期状態が重要である。
    • 既存の事前事前学習タスクは,自然言語の表現力を捉えきれていない。
    • 論理的推論を用いた事前事前学習により,より豊かな構造と言語的バイアスを導入する。
    • 論理的事前事前学習は,標準的な初期化と比較して,言語タスクにおいて高い精度を達成した。
    • 大規模な評価により,論理的事前事前学習はスキル獲得を大幅に加速させることが示された。
    • 形式的推論は,モデルの内部構造を再編成し,圧縮可能性を高めることに貢献する。

    Link: https://arxiv.org/abs/2608.03930

  • ミューオンとマンバ:状態空間モデルのためのスペクトル最適化 [cs.RO, cs.SY, eess.SY, cs.CY, cs.LG]目的:状態空間モデルにおける最適化手法の比較
    • 深層学習モデルの学習効率向上が重要であり,特に大規模言語モデルでは最適化がボトルネックとなる。
    • 従来の最適化手法では,状態空間モデルにおける最適な学習方法が確立されていない。
    • マンバモデルにおいて,ミューオン最適化の適用範囲と効果を特定すること。
    • 出力射影のみにミューオンを適用した場合が,入力射影や両方に適用した場合よりも優れていた。
    • ミューオンの利点は主にトークン効率の向上にあり,複数のコーパスとトークン予算で一貫していた。
    • 学習が計算量最適点を超えても効果が持続し,条件付けがこの改善を説明するものではないことが示された。

    Link: https://arxiv.org/abs/2608.03941

  • TACT:タクソノミーに基づいた後学習による,学習者適応型英語チューター [cs.AI]目的:学習者適応型英語チューターの構築と評価
    • 英語学習において,個別指導は効果的だが,質の高いチューターの確保が課題である。
    • LLMをチューターとして活用するには,流暢な応答生成だけでなく,学習者の行動に応じた指導戦略が必要となる。
    • 既存の指導原則をLLMに統合し,学習者に適した指導を実現する。
    • TACTフレームワークとTACTCorpusを構築し,指導戦略と学習者の行動を分類するタクソノミーを開発した。
    • Qwen3.5-4Bを後学習することで,TACTutorを開発し,従来のモデルと比較して,戦略的品質が向上した。
    • 実際の学習者を用いたブラインドテストで,TACTutorは他のチューターよりも高い評価を得た。

    Link: https://arxiv.org/abs/2608.03952

  • 基礎モデルのゲーム理論:類似性推論を通じた合理的協調の新たな道 [cs.NI, cs.AI]目的:基礎モデル搭載の自律エージェントにおける合理的協調のメカニズム解明
    • 社会経済システムへのAI統合が進む中,安全かつ協調的な行動原理の理解が不可欠である。
    • 古典的なゲーム理論は,エージェントの独立性を前提とするため,現代のAIエージェントの協調行動を説明できない。
    • 基礎モデルのエージェント特有の行動原理に基づいた,新たなゲーム理論の構築を試みる。
    • 基礎モデルのエージェントは,社会的なジレンマにおいて,古典ゲーム理論の予測に反して安定的な協調に収束することが示された。
    • この現象を説明するため,「埋め込みベイジアンエージェント」という理論モデルが提案された。
    • 類似性推論を通じて,エージェントは自身の意思決定を他者の行動予測の根拠として利用し,協調的な均衡を形成する。

    Link: https://arxiv.org/abs/2608.03958

  • LLMテスト時スケーリングにおける解釈可能な適応的サンプリング [cs.AI]目的:LLMのテスト時スケーリングにおける計算資源配分の最適化
    • LLMの推論能力向上は,その応用範囲拡大に不可欠である。
    • 固定予算によるサンプリングは,容易な問題と困難な問題で計算資源の配分が非効率である。
    • プロンプトの複雑さとモデルの確信度に基づき,計算資源を動的に調整する手法の提案。
    • 提案手法は,プロンプトの複雑さとモデルの確信度を解釈可能な信号として活用し,クエリごとにサンプリング予算を適応的に調整する。
    • 様々なモデルとデータセットにおいて,既存のベースライン手法と比較して性能向上を確認した。
    • 平均サンプリング数を削減しながら,フル予算での性能に匹敵する結果が得られた。

    Link: https://arxiv.org/abs/2608.03961

  • LLMエージェントへの入力:タイプ入力と音声入力の比較研究 [cs.CL, cs.CY, cs.AI]目的:LLMエージェントにおける音声入力とタイプ入力の摂動の影響
    • LLMの性能は,入力方法に大きく依存する。多様な入力様式への理解が不可欠である。
    • 音声入力とタイプ入力は,それぞれ固有のノイズ特性を持つ。その影響は十分に解明されていない。
    • 本研究は,入力様式がLLMの性能に与える影響を定量的に評価し,その原因を特定することを目的とする。
    • 音声入力の摂動は,全ての指示調整済みモデルにおいて精度低下を引き起こす。構造変化が主要因である。
    • タイプ入力の摂動は音声入力ほど深刻ではなく,モデルは比較的高い許容性を示す。
    • 両者の差は,回答の構築が必要なタスクでのみ顕著であり,選択問題では見られない。思考予算はタイプ入力の性能を回復するが,音声入力には効果がない。

    Link: https://arxiv.org/abs/2608.03970

  • ReflectRL:反省的直接推論による黄金ネガティブ軌跡からの学習 [cs.AI]目的:大規模言語モデルの推論能力向上
    • 大規模言語モデルの推論能力は,様々なタスクにおいて重要であり,その向上が求められている。
    • 従来の軌跡誘導法では,専門家モデルが失敗した場合,その軌跡が破棄され,学習機会が失われていた。
    • 失敗した専門家モデルの軌跡(黄金ネガティブ軌跡)から,反省的推論を通じて学習し,推論能力を向上させる。
    • ReflectRLは,黄金ネガティブ軌跡を利用して反省的推論を促し,それを直接推論に転移させる軽量なフレームワークである。
    • 9つのベンチマーク,4つのLLMバックボーン,4つのオンポリシー学習方法において,ReflectRLは一貫して推論性能を向上させた。
    • ReflectRLは,わずかなオーバーヘッドで,既存のオンポリシー学習方法に容易に組み込むことができる。

    Link: https://arxiv.org/abs/2608.03972

  • Video-DeepResearch:次世代マルチモーダル深層研究エージェントに向けて [cs.RO, cs.CV, cs.AI]目的:連続する動画ストリームに対するマルチモーダルエージェントの拡張
    • 画像認識を超え,動画理解が求められる現代において,より高度な情報処理技術が必要とされている。
    • 既存モデルでは,テキスト検索に偏ったり,外部ツールを有効活用できていないという課題がある。
    • 動画内の時空間的情報を正確に捉え,外部ツールとの連携を強化することで,より高度な研究支援を目指す。
    • 提案手法Video-DRは,フレーム間の視覚的情報を段階的に活用するパイプラインにより,既存モデルの課題を克服した。
    • 実験結果から,Video-DR-35B-A3Bは平均精度64.0%を達成し,Claude-4.5-Sonnet (59.0%)やGPT-5 (52.5%)を上回った。
    • 30B-A3Bモデルも59.3%の精度を示し,コンパクトなモデルでも高い性能を発揮することが示された。

    Link: https://arxiv.org/abs/2608.03979

  • 大規模言語モデルはコンパイラが見逃す意味的最適化機会を回復できるか? [cs.PL, cs.AI]目的:コンパイラが捉えきれない意味的最適化機会の回復
    • プログラム性能向上には最適化が不可欠であり,コンパイラはその主要な役割を担う。
    • コンパイラは解析対象の表現に意味情報がない場合,有効な変換を見逃してしまう。
    • LLMを活用し,コンパイラが捉えられない意味情報を推測・回復することで最適化を支援する。
    • LLMは,C/C++コードの文脈から意味情報を回復し,検証可能な成果物を生成できることが示された。
    • 最も性能の良いLLMは,94.8%の確率で正しい成果物を生成し,83.3%で1.05倍以上の高速化を達成した。
    • LLMは,検証を通じて成果物の正しさを担保することで,コンパイラの分析を補完する役割を果たす。

    Link: https://arxiv.org/abs/2608.03983

  • 条件付き拡散モデルによる合成病理組織画像生成の評価 [cs.CL, eess.SY, cs.SY, cs.LG]目的:合成病理組織画像生成の評価手法
    • 計算病理学において,データ不足は重要な課題であり,合成データ生成はその解決策となり得る。
    • 既存の評価指標は,医療応用における合成データの品質を十分に評価できていない。
    • 病理組織画像に特化した評価指標と下流タスクの検証を通して,評価手法の改善を目指す。
    • 従来のFIDやISといった指標は,ImageNetで事前学習された特徴抽出器に依存するため,病理組織画像への適用には限界がある。
    • デジタル病理データセットで事前学習された基盤モデルを用いたFID/ISの修正や,精度・再現率に基づく指標を組み合わせることで,より適切な評価が可能となる。
    • 合成データの品質指標と核セグメンテーション性能の間には相関があり,修正ISはオリジナルISよりも下流タスク性能との相関が高い(AJI+ r=0.6096, p=0.0122)。

    Link: https://arxiv.org/abs/2608.03990

  • 推論LLMにおけるテスト時スケーリング:推論レジーム,評価,再現性 [cs.LG, cs.AI]目的:推論時の計算資源増加に伴う推論問題解決能力の向上に関する体系的な考察
    • 大規模言語モデルの推論能力向上は,様々な応用分野において重要であり,その可能性を最大限に引き出す必要がある。
    • テスト時スケーリングの手法が多様化し,評価指標や計算資源の扱いが統一されていないため,研究間の比較が困難になっている。
    • テスト時スケーリングの構造的レジームを明確化し,評価方法と再現性の要件を定めることで,研究の透明性と進展を目指す。
    • テスト時スケーリングを,自己回帰モデルの暗黙的な接頭辞ツリーにおける予算制約付き推論として定式化し,3つの構造的レジームを特定した。
    • 推論システム全体を評価対象とし,エンドツーエンドの性能と候補バンクの診断を分離する評価原則を開発し,評価プロファイルを提案した。
    • 推論プロトコルの再現性を確保するための要件を定義し,モデル側とインターフェース機構によるオープンウェイト推論エコシステムを整理した。

    Link: https://arxiv.org/abs/2608.04001

  • TurnSight: ツール統合推論のためのターンレベルヒンドサイト自己蒸留 [cs.HC, cs.CL, cs.HC, cs.CL, cs.AI]目的:ツール統合推論におけるターンレベルヒンドサイト自己蒸留フレームワーク
    • 複雑なタスク解決のため,大規模言語モデルにツール利用を促す研究が重要である。
    • 既存手法では,長期的なツール利用シーケンスにおける報酬の割り当てが困難である。
    • 実行履歴に基づいたヒンドサイトを活用し,ターンレベルでの適切な学習信号を生成する。
    • TurnSightは,実行履歴に基づいたヒンドサイトを構築し,異なる予測範囲で信頼性の高い学習信号を選択する。
    • 選択された信号は,ロールアウト間で正規化され,RLの利点を適応的に調整し,最適化方向を維持する。
    • 3つのベンチマークにおいて,TurnSightの有効性が確認された。

    Link: https://arxiv.org/abs/2608.04007

  • 複数カメラにおける軌跡予測:軌跡テンソルを用いた手法 [cs.CV, cs.AI]目的:複数カメラネットワークにおける移動物体の軌跡予測
    • 監視や交通監視等の応用で複数カメラ利用は一般的だが,既存手法は単一カメラに限定され,その性能が制約されていた。
    • 単一カメラでは視界が限られ,長期的な軌跡予測が困難であるという課題が存在する。
    • 複数カメラからの情報を統合し,より広範な視野と長期的な予測を可能にすることを目的とする。
    • 提案手法は,複数カメラからの相対位置情報を同時に利用し,将来の位置を予測する「Which-When-Where」アプローチを採用している。
    • 軌跡テンソルという新たな手法を導入し,複数カメラ間の軌跡と不確実性をエンコードすることで,より高精度な予測を実現している。
    • 実験結果から,提案手法は既存の単一カメラ予測手法や,複数カメラ対応に改変された手法と比較して優れた性能を示すことが確認された。

    Link: https://arxiv.org/abs/2108.04694

  • CLIP-EBC:拡張ブロックワイズ分類によるCLIPの正確なカウント能力 [cs.CV, cs.AI]目的:群衆密度推定のための,CLIPベースのモデルの開発
    • 画像認識技術は,様々な分野で応用されており,特にゼロショット画像分類でその有用性が示されている。
    • 既存の群衆カウント手法は,カウント値の量子化や分類エラーへの偏重により,精度に限界がある。
    • 本研究は,整数値のビンを使用し,密度マップに基づく回帰損失を導入することで,カウント精度の向上を目指す。
    • 提案手法EBCは,既存の分類ベースの手法と比較して,UCF-QNRFデータセットで最大44.5%の改善を達成した。
    • CLIP-EBCは,NWPU-Crowdテストセットにおいて,MAE 58.2,RMSE 268.5を記録し,最先端の性能を示した。
    • CLIP-EBCは,STEERERと比較して,MAEで8.6%,RMSEで13.3%の改善となった。

    Link: https://arxiv.org/abs/2403.09281

  • 群衆ソーシングによる多言語音声明瞭度テスト [eess.AS, cs.AI, cs.SD, eess.SP]目的:多言語音声の明瞭度評価
    • 音声技術の発展に伴い,音声明瞭度の迅速な評価が重要になっている。
    • 従来の実験室での評価はコストが高く,拡張性に乏しい。
    • 群衆ソーシングを用いた多言語音声明瞭度テストの標準化を目指す。
    • 本研究では,群衆ソーシングによる明瞭度評価アプローチを提案した。
    • 多言語音声データの収集と公開を行い,テスト設計の詳細を明らかにした。
    • 初期実験の結果,群衆ソーシングによる評価の可能性が示された。

    Link: https://arxiv.org/abs/2403.14817

  • UL-UNAS:ネットワークアーキテクチャ探索によるリアルタイム音声強調のための超軽量U-Net [eess.AS, cs.AI]目的:リアルタイム音声強調のための超軽量U-Netの最適化
    • リアルタイム処理が求められる音声処理において,モデルの軽量化は重要な課題である。
    • 既存の軽量モデルは性能面で課題が残されており,更なる高性能なモデルの開発が求められている。
    • ネットワークアーキテクチャ探索によって,低消費電力デバイスへの実装に適した最適なアーキテクチャを探索する。
    • 提案手法UL-UNASは,同等の計算量あるいはそれ以下の計算量で,最新の超軽量モデルを大きく上回る性能を達成した。
    • 計算資源を多く必要とする既存のベースラインモデルと比較しても,競争力のある性能を発揮する。
    • アフィンPReLU活性化関数と因果的時周波数アテンションモジュールという2つの強化要素が性能向上に貢献している。

    Link: https://arxiv.org/abs/2503.00340

  • クリーンな音声条件におけるニューラルオーディオコーデックの評価のための音声品質指標の評価 [eess.AS, cs.AI, cs.SD, eess.SP]目的:ニューラルオーディオコーデックの音声品質評価指標の信頼性
    • 音声技術の発展に伴い,高品質な音声コーデックの評価が重要になっている。
    • ニューラルコーデックの性能評価において,どの客観指標が主観評価と一致するか不明である。
    • 客観指標と主観評価の相関関係を分析し,信頼性の高い指標を特定すること。
    • scoreqやutmosといったニューラルベースの指標が,主観評価とのPearson相関係数で最も高い結果を示した。
    • 主観品質範囲別の分析から,非侵襲的な指標は高い主観品質レベルで飽和する傾向があることが示された。

    Link: https://arxiv.org/abs/2509.24457

  • PASE:WavLMの音韻的事前知識を活用した低幻覚型生成音声強調 [eess.AS, cs.AI, cs.SD]目的:低幻覚型生成音声強調の実現
    • 音声強調は,ノイズ下での音声認識やコミュニケーションにおいて不可欠な技術である。
    • 従来の生成的音声強調は,特に強ノイズ下で幻覚が生じやすく,内容や話者特性に誤りをもたらす。
    • WavLMの音韻的事前知識を活用し,幻覚を抑制する新しいフレームワークを提案する。
    • PASEは,最先端の識別的モデルと比較して,知覚品質に優れている。
    • PASEは,既存の生成的モデルと比較して,言語的および音響的な幻覚を大幅に低減する。
    • WavLMを表現蒸留によりノイズ除去の専門家として適応させることで,頑健なノイズ除去と幻覚抑制を実現している。

    Link: https://arxiv.org/abs/2511.13300

  • StuPASE:幻覚の少ないスタジオ品質の生成音声強調に向けて [eess.AS, cs.AI, cs.SD]目的:生成音声強調における高知覚品質と幻覚抑制
    • 音声強調は,騒音環境下での音声明瞭度向上に不可欠であり,コミュニケーションの質を大きく左右する。
    • 既存手法では,幻覚の抑制と高知覚品質の両立が難しく,特に劣悪な環境下での性能向上が課題である。
    • 本研究は,幻覚を抑制しつつ,スタジオレベルの高品質な音声生成を実現することを目指している。
    • 提案手法StuPASEは,PASEをベースとし,ドライターゲットでのファインチューニングにより,残響除去性能を向上させている。
    • さらに,GANモジュールをFlow Matchingモジュールに置換することで,強ノイズ環境下でも高品質な音声生成を可能にしている。
    • 実験結果から,StuPASEは最新の音声強調手法と比較して,知覚的に高品質でありながら幻覚が少ないことが示された。

    Link: https://arxiv.org/abs/2603.09234

  • GAP-URGENet:汎用音声強調のための生成・予測融合フレームワーク [eess.AS, cs.AI, cs.SD]目的:汎用音声強調のための生成・予測融合フレームワークの開発
    • 音声強調は,様々な環境下での音声の明瞭化に不可欠であり,通信,補聴器,音声アシスタント等の幅広い応用分野で重要である。
    • 既存の音声強調手法は,ノイズの種類や強さ,あるいは音源の特性に依存する場合があり,汎用性に課題が残されている。
    • 多様な条件に対応可能な,ロバストかつ高品質な音声強調手法の確立を目指す。
    • 生成ブランチと予測ブランチを融合させることで,音声の復元とスペクトラム強調を相互補完的に行い,ロバスト性と知覚品質を向上させた。
    • 提案手法は,ICASSP 2026 URGENT Challenge Track 1において,客観評価で1位となる最高性能を達成した。
    • 48kHzでの音声生成とダウンサンプリングによる,より自然な音声表現を実現した。

    Link: https://arxiv.org/abs/2604.01832

  • UniPASE:高忠実度・低幻覚を実現する汎用音声強調生成モデル [eess.AS, cs.AI]目的:多様な歪みとサンプリングレートに対応した汎用音声強調
    • 音声認識やコミュニケーションにおいて,ノイズや歪みを除去し,明瞭な音声を復元することは重要である。
    • 従来の音声強調手法では,特定の環境や歪みに特化しており,汎用性に欠ける場合がある。
    • 様々な歪みやサンプリングレートに対応可能な,より汎用的で高品質な音声強調手法の開発。
    • UniPASEは,WavLMから知識蒸留されたDeWavLM-Omniを用いて,劣化波形を高品質な音響表現に変換する。
    • このモデルは,既存の最先端モデルと比較して,優れた性能または競争力のある性能を評価データセットで示している。
    • URGENT 2026チャレンジの客観評価において,UniPASEは1位を獲得した。

    Link: https://arxiv.org/abs/2604.14606

  • AgentStream:ストリーミングタスクにおける自己進化型LLMエージェントの性能 [cs.AI, cs.LG]目的:自己進化型LLMエージェントのストリーミングタスクにおける性能評価
    • LLMエージェントは,多様なタスクを効率的に処理する可能性を秘めており,その重要性は増している。
    • 既存研究では独立した評価が主流であり,現実的なストリーミング環境下でのエージェントの適応能力が不明である。
    • ストリーミング環境下での自己進化型エージェントの性能を包括的に評価し,改善の指針を示す。
    • AgentStreamフレームワークを用いて,多様な進化手法と基盤モデルを組み合わせ,ストリーミングシナリオごとに性能を評価した。
    • 自己進化の信頼性はストリーミングシナリオによって異なり,その効果はモデルの能力に依存し,単純に増加するわけではないことが示された。
    • 特定の自己進化手法が全てのモデル・シナリオで優位性を示すことはなく,状況に応じた手法選択の必要性が示唆された。

    Link: https://arxiv.org/abs/2608.00155

  • RF-HOI:無線周波数信号による人間と物体間の相互作用の認識 [cs.AI, cs.HC, cs.RO]目的:人間と物体間の相互作用の認識
    • 仮想現実やロボット工学など,知能システムにおける人間と物体間の相互作用の理解は不可欠である。
    • 視覚情報に基づく手法は,プライバシーや暗所での性能低下といった課題を抱えている。
    • 無線周波数信号のみを用いた,プライバシーに配慮したロバストな相互作用認識を実現すること。
    • RF-HOIは,mmWaveレーダーとRFIDを組み合わせた新たなモダリティ融合により,行動認識と物体識別を同時に行う。
    • 多様なHOIデータを大規模に合成するシミュレーターを開発し,少量の現実データでモデルを微調整することで,汎化性能を向上させた。
    • 実験結果は,RF-HOIが既存手法を上回り,視覚モデルの性能に匹敵することを示している。

    Link: https://arxiv.org/abs/2608.00289

  • MDArena:現実的な分子動力学ワークフローにおけるコーディングエージェントの評価 [physics.chem-ph, cs.AI]目的:現実的な分子動力学タスクにおけるコーディングエージェントの信頼性評価
    • 科学的発見の加速はAIの重要な応用分野であり,特にバイオ分子シミュレーションはその中でも有望である
    • 既存のワークフローは手作業が多く,自動化による効率化が求められている
    • コーディングエージェントの能力を定量的に評価し,信頼性向上への道筋を示す
    • MDArenaは,実際のバイオ分子シミュレーションプロジェクトから抽出した50のコンテナ化されたタスクで構成されるベンチマークである。
    • Codex GPT-5.5(extra-high reasoning effort)が最も高い性能を示し,24/50のStrict-Pass@1成功率を達成した。
    • エージェントは有益な部分的な進捗を示すものの,再現性のある科学的ワークフローに必要な詳細な部分で失敗することが多い。

    Link: https://arxiv.org/abs/2608.02642

  • 交差麻酔ECoG状態デコードは決定閾値で失敗し,表現では失敗しない [q-bio.QM, cs.AI]目的:麻酔状態のデコード
    • 脳活動に基づく麻酔状態の解明は,麻酔管理の最適化や意識の神経基盤理解に不可欠である。
    • 異なる麻酔薬間での状態デコード精度は低いことが知られており,特にケタミンでは顕著である。
    • 神経表現の維持と決定閾値の変化を分離することで,ケタミンに対するデコード失敗の原因を特定する。
    • 神経表現は,薬物間(ケタミンを含む)で高い精度(AUROC 0.96以上)で維持されることが示された。
    • ケタミンのデコード失敗は,表現ではなく決定閾値の変化に起因することが明らかになった(ランキングp=0.0025)。
    • 個体自身の麻酔導入前ベースラインに固定された閾値を設定することで,ケタミンのデコード精度が向上した(バランス精度0.50から0.85)。

    Link: https://arxiv.org/abs/2608.02646

  • アラインメントにおける盲点:大規模言語モデルにおける生物安全保障リスクの定量化 [q-bio.QM, cs.AI]目的:大規模言語モデルにおける生物安全保障リスクの定量化
    • 生物研究の加速化に伴い,バイオテクノロジーの悪用リスクが増大しているため,安全性の評価が重要である。
    • 既存の安全性評価は自然言語に基づき,生成されたアミノ酸配列の生物学的リスクを特定できないという課題がある。
    • この研究は,LLMによる毒素設計要求への対応能力と潜在的な生物学的危害を評価する新しい評価基準を提案する。
    • SPIKE-Benchは,毒素設計プロンプトと毒性予測の3段階フィルタリングを用いることで,モデルの有害性を評価する。
    • 32のLLMの監査により,ほとんどのモデルが毒素設計要求に応じることが判明し,有害性率は生成能力に左右されることが示された。
    • BioSafe-Guardは,毒性リスクを低減しつつ,有用性を維持するドメイン特化型分類器として提供される。

    Link: https://arxiv.org/abs/2608.02684

  • データ駆動型中間融合フレームワークDAIF:近似メッセージパッシングによるマルチモーダル教師あり学習 [stat.ME, cs.LG, math.ST, stat.ML, stat.TH]目的:マルチモーダル教師あり学習における,データ駆動による融合構造の学習
    • 複数のデータソースを統合することで予測性能向上を目指す分野であり,近年重要性が増している。
    • モダリティ間の適切な融合粒度の決定が難しく,過度な統合はノイズを増幅し,不十分な統合は依存関係を活用できない。
    • データから直接融合構造を学習し,モダリティ間の依存構造に適応できる手法を開発する。
    • 提案手法DAIFは,ランダム行列理論とノンパラメトリック依存度指標を活用し,データから融合構造を学習する。
    • モダリティを依存度に基づいてクラスタリングし,クラスタごとの経験ベイズ推定を用いて事前分布を推定する。
    • シミュレーションと実データ(TEA-seq,TCGA-BRCA)の両方で,最先端技術と同等またはそれ以上の性能を示す。

    Link: https://arxiv.org/abs/2608.02769

  • スコアベース生成モデリングの超有限フレームワーク [stat.ML, cs.AI, cs.LG, math.PR]目的:スコアベース生成モデリングの超有限定式化
    • 生成モデルは,画像生成など多様な応用で注目されており,その理論的基盤の確立が重要である。
    • 従来の定式化は,連続時間確率微分方程式に依存し,数学的な複雑さを伴うことが課題となっていた。
    • 非標準解析に基づき,離散的な超有限グリッド上で生成モデルを構築し,理論的な簡潔さと計算可能性を目指す。
    • 非標準解析の枠組みにおいて,超有限拡散過程と古典的なフォッカープランク方程式との対応が示された。
    • 内部スコアマッチング目的の最小化が,逆時間ダイナミクスに必要なスコア関数を回復することが明らかになった。
    • 超有限ダイナミクスの二階一致性が解析され,分散項を抑制する条件が導出された。

    Link: https://arxiv.org/abs/2608.02799

  • 動的モード分解を用いた脳波高周波異常信号の検出 [q-bio.NC, cs.LG, eess.SP]目的:脳波の高周波帯域における持続的な動的変化の抽出と,アルコール依存症患者の識別
    • 脳波は脳の活動を反映し,様々な神経疾患の診断や研究において重要な役割を果たす。
    • 高周波帯域の脳波信号はノイズが多く,異常信号の検出が困難である。
    • 動的モード分解を用いることで,高周波帯域の微細な動的変化を捉え,疾患の早期発見に貢献する。
    • 動的モード分解により,脳波の高周波帯域から一貫性のある動的変化を抽出することに成功した。
    • 抽出された高周波モードは,特定のチャンネルにおいて約70%のサンプルで一貫したダイナミクスを示した。
    • これらの特徴量を活用した分類実験により,アルコール依存症患者と健常者との識別が可能となった。

    Link: https://arxiv.org/abs/2608.02804

  • 生成モデル下における強化学習のための改良された量子アルゴリズム [quant-ph, cs.AI, cs.LG, stat.ML]目的:強化学習における近似最適方策の計算
    • 強化学習は,機械学習の重要な分野であり,自律的な意思決定システムの構築に不可欠である。
    • 古典的な強化学習アルゴリズムは,大規模な状態空間や行動空間において計算コストが高いという課題がある。
    • 量子アルゴリズムを用いることで,古典的なアルゴリズムよりも効率的に最適方策を計算することを目指す。
    • 本研究では,有限 horizon および割引無限 horizon MDP に対して,近似最適方策を計算するための新しい量子アルゴリズムを提案した。
    • 提案アルゴリズムは,価値反復と量子平均推定,量子最大値探索などの量子ルーチンを組み合わせることで実現されている。
    • これにより,既存の研究と比較してクエリ複雑性を改善し,確立された量子下限に近づいた。

    Link: https://arxiv.org/abs/2608.02826

  • 粒子に基づく一般化確率的最適化 [stat.ML, cs.LG, stat.CO]目的:困難な勾配を持つ損失関数に対する確率的最適化手法
    • 機械学習モデルの学習において,勾配計算が困難なケースが増加している。
    • 生成モデルや潜在変数モデルの学習では,勾配が積分計算となるため効率的な最適化が難しい。
    • 平均場ダイナミクスと相互粒子近似を用いて,新しい最適化手法を開発し,その収束性を解析する。
    • 提案手法は,指数関数的な収束性を持つことが理論的に示された。
    • 連続時間粒子系における非漸近的な誤差限界も導出された。
    • 最尤推定やエネルギーベースモデルの学習において,提案手法の有効性が確認された。

    Link: https://arxiv.org/abs/2608.02844

  • スコアベース生成事前分布を用いたニューラル逆散乱 [eess.IV, cs.LG, physics.comp-ph]目的:電磁波逆散乱問題の解法
    • 電磁波逆散乱は,医療画像診断や非破壊検査などに応用が期待される重要な研究分野である。
    • 強散乱条件下では,非線形な波動現象の正確なモデル化が困難であり,高精度な再構成が課題である。
    • スコアベース生成モデルを活用し,強散乱条件下でも高精度な再構成を可能にすることを目的とする。
    • ScoreFieldは,結合された暗黙的ニューラル表現(INR)と事前学習済みのスコアベース生成事前分布を統合したフレームワークである。
    • シミュレーションと実験データを用いて評価した結果,古典的な手法や深層学習ベースの手法と比較して再構成精度が大幅に向上した。
    • 特に実測されたフレネルデータにおいて,最良の競合手法と比較して平均PSNRが1.8dB改善された。

    Link: https://arxiv.org/abs/2608.02937

  • 確率的鞍点回避:ユニット励起と滑らかさの限界を超えて - 経路的 Lyapunov-Perron フレームワーク [math.CO, cs.DM, math.OC, cs.LG, math.DS, stat.ML]目的:確率的再帰における鞍点回避のための抽象的な定理の証明
    • 機械学習において最適化は重要であり,特に非凸な問題では局所的最適解への収束が課題となる。
    • 従来の鞍点回避理論は,確率的誤差に一定の正の成分が必要とするユニット励起の仮定に依存しており,現実のノイズ構造を捉えきれない。
    • ユニット励起の仮定を弱め,経路依存的な条件を用いて,より広範な状況下での鞍点回避を可能にすること。
    • ユニット励起を必要としない,確率的再帰に対する抽象的なほぼ確実な回避定理を証明した。
    • この定理は,確率的ミラー降下法(SGDを含む)やランダムシャッフルに対して,厳密な鞍点回避を保証する。
    • 非滑らかな合成目的関数に対しても,近接型確率的勾配法による回避結果が示され,局所最小化解への収束を可能にする。

    Link: https://arxiv.org/abs/2608.03001

  • 非構造化データに対する因果推論 [stat.ML, cs.LG]目的:非構造化データの因果効果を特定するためのクエリ
    • 従来の因果推論はスカラーな結果変数に焦点を当ててきたが,近年のデータはより複雑な形式を持つ。
    • テキストや画像のような非構造化データに対する因果効果の評価方法が確立されていない。
    • 治療が最も大きく影響を与えるアウトカムの特徴を特定し,因果効果を評価する。
    • 治療効果を最も明確に反映する特徴(MCF)を学習する手法を提案。
    • MCFを推定するために,アウトカムをスカラーに変換する特徴スコアリング関数を学習。
    • テキストと画像データを用いた実験で,提案手法が治療によって変化したアウトカムの重要な側面を捉えることを確認。

    Link: https://arxiv.org/abs/2608.03085

  • 物理情報に基づいた深層学習モデルによる自動患者特異的マイクロ波焼灼計画の高速化 [eess.IV, cs.LG]目的:患者特異的なマイクロ波焼灼計画の自動化
    • 肝臓腫瘍の低侵襲治療としてマイクロ波焼灼が注目されており,治療効果は計画に大きく依存する。
    • 正確な数値シミュレーションは信頼性が高いが,計算コストが高く,最適化計画への応用が制限される。
    • 深層学習モデルを用いた高速な前方モデルにより,最適化計画を可能にし,臨床応用を目指す。
    • 提案手法は,Dice係数95.1%を達成し,高精度な深層学習ベースの最適化を可能にした。
    • 13症例において,焼灼効率を54.3%向上,臓器損傷を55.0%軽減,挿入経路長を3.3%短縮した。
    • 生成された計画の多くは,マイクロ波焼灼専門家によって臨床的に適用可能と判断された。

    Link: https://arxiv.org/abs/2608.03086

  • 医療AIに対する最適な責任設計 [econ.TH, cs.AI, cs.CY]目的:医療AI導入における責任のあり方
    • 医療現場におけるAI利用が進む中で,責任所在の明確化が不可欠である。
    • 医師の能力差や質を評価することが難しく,AIの責任問題は複雑化している。
    • AI導入下における最適な責任設計を明らかにし,医療の質と安全性を確保すること。
    • 最適な責任設計は,標準治療からの逸脱に対して一律的な責任レベルを設定することが有効である。
    • AIの精度向上と責任の緩和の関係は一様ではなく,標準治療の不確実性により変化する。
    • 情報非対称性は必ずしも社会厚生を減少させず,AIの精度向上により損失は軽減される可能性がある。

    Link: https://arxiv.org/abs/2608.03114