arXiv雑要約

AI - 2026/08/03 公開

  • SCMA:構造と金属を考慮したフローマッチングによるCT金属アーチファクトの低減 [cs.CV, cs.AI]目的:CT金属アーチファクトの低減手法の提案
    • CT画像診断において,金属による影響は画質劣化を招き,正確な診断や定量分析を妨げるため,その低減は重要である。
    • 既存手法では,残存アーチファクトや構造のぼやけ,汎化性能の不足,解剖学的に不整合な構造の生成といった問題が残る。
    • サンプル固有の構造や金属による局所的な劣化を考慮し,より高精度な金属アーチファクト低減を目指す。
    • SCMAは,線形補間画像と金属マスクを利用し,構造を考慮したフローマッチングによりアーチファクトを効果的に抑制する。
    • 金属周辺の劣化領域に重点を置いた損失関数により,局所的な構造を保持しつつ,アーチファクトを低減する。
    • シミュレーションおよび実際のCTデータを用いた実験で,既存手法よりも優れたアーチファクト抑制効果と,より自然な構造復元が確認された。

    Link: https://arxiv.org/abs/2607.28759

  • 信号を待て:単純な周波数認識型フローマッチング [cs.CV, cs.AI, cs.LG, stat.ML]目的:高解像度画像生成におけるグローバルな一貫性,ローカルな詳細,テクスチャの忠実性の向上
    • 画像生成モデルは高解像度化が進み,生成品質には全体的な一貫性が不可欠である。
    • 従来のフローマッチングは周波数成分を均一に扱うため,高周波帯域のノイズ問題が生じやすい。
    • ウェーブレット変換により,粗い構造から細かい構造を段階的に生成することでノイズを抑制する。
    • WaiTは,ウェーブレット変換を用いて画像生成を粗い帯域と細かい帯域に分解する。
    • ImageNet 512x512において,WaiTはピクセル空間でのFIDを1.43とし,3つの評価軸で最適解を達成した。
    • 大規模モデルでは,ImageNet 512解像度においてFID 1.3を達成し,テクスチャの忠実性でも優れた性能を示した。

    Link: https://arxiv.org/abs/2607.28760

  • 物理情報ニューラルネットワークとニューラル演算子における特徴量交互作用モデリング [cs.LG]目的:パラメータ化された偏微分方程式の解多様体に対するモデル表現力向上
    • 物理現象のシミュレーションは科学技術の発展に不可欠であり,高精度な予測が求められる。
    • 従来の数値解法では,高次元問題や複雑な形状への対応が困難な場合がある。
    • 強度の相互依存性を持つパラメータ化された偏微分方程式の物理整合性モデリングを改善する。
    • ファクター化機械(FM)由来の特徴量交互作用モジュールを組み込むことで,PINNとニューラル演算子の表現力を高めた。
    • 特に非線形保存則や鋭勾配を持つ問題において,FM-OperatorとFM-DeepONetが有効であることを示した。
    • ショック波支配の方程式において著しい精度向上を達成し,物理整合性モデリングの新たな方向性を示唆した。

    Link: https://arxiv.org/abs/2607.28762

  • 事前学習済み機械学習原子間ポテンシャルからの表現を,材料生成と評価のための粗視化座標として [cs.LG, cond-mat.mtrl-sci]目的:無機結晶構造生成のための表現方法
    • 材料設計において,計算コストを削減し,効率的な探索を実現することが重要である。
    • 既存の生成モデルや評価方法は,結晶構造の表現が単純であるという課題がある。
    • 事前学習済みMLIPの特徴量を用いて,生成モデルの質と新規性を評価する指標を開発する。
    • MACEから得られる原子平均化特徴量を粗視化座標として用いることで,結晶構造の品質と新規性を同時に評価する新しい距離尺度CFTDを提案した。
    • CFTDは,既存のSUN指標と比較して,結晶構造の品質評価と記憶の検出において優れた性能を示した。
    • 粗視化されたMACE特徴量を生成モデルのガイドとして活用することで,より良い材料生成が可能となった。

    Link: https://arxiv.org/abs/2607.28776

  • RDFルールにおける層状否定:正しいアプローチ(拡張版) [cs.CL, cs.LO, cs.AI, cs.DB]目的:RDFルールにおける否定の適切な意味論の保証
    • RDFは,セマンティックウェブにおけるデータ表現の基盤であり,様々な応用が期待されている。
    • RDFルールとデフォルト否定を組み合わせる際,否定の順序依存性や曖昧性が問題となる場合がある。
    • 既存の方法では,RDFルールの否定を適切に処理できず,一意な推論結果を得ることが難しいという課題を解決する。
    • 本研究では,チェーン層状化という新たな条件を提案し,否定を含むRDFルールの意味論の健全性を保証する。
    • チェーン層状化は,多段階推論の解析と整合性制約の活用により,矛盾のない推論を可能にする。
    • 提案手法は,ルール適用順序に依存せず,一意で簡潔なRDFグラフを生成し,否定失敗のセマンティクスを維持する。

    Link: https://arxiv.org/abs/2607.28778

  • EarlyDx:入院時点を基準とした,証拠に基づいた救急外来診断のオープンエンド生成ベンチマーク [cs.HC, cs.CY, econ.GN, q-fin.EC, cs.AI]目的:救急外来での入院時診断の早期生成
    • 臨床診断は迅速な判断が求められ,患者の予後に大きく影響する重要な課題である。
    • 既存の診断予測ベンチマークは,限られた情報での早期診断という現実を反映していない。
    • 入院時の限られた情報のみから,正確な診断を生成する能力を評価する。
    • 既存のLLM(汎用,医療特化,ドメイン適応型)はいずれも,入院時点の証拠から信頼性高く診断を合成できないことが示された。
    • ゼロショットモデルは,記録から直接読み取れる診断のみを回収する傾向があり,推論が必要な診断の精度は低い。
    • 追加学習により推論に依存する再現率は向上するものの,臨床医の感度と精度を両立するには限界がある。

    Link: https://arxiv.org/abs/2607.28788

  • ベンチマークは単一ではない:LLM評価のためのサンプルレベル監査と編成 [cs.CL, cs.AI, cs.LG]目的:大規模言語モデルの評価におけるベンチマークデータセットのサンプルレベルでの多様性の解明
    • 大規模言語モデルの性能評価において,ベンチマークデータセットは不可欠な役割を担う。
    • 既存のベンチマークはタスク全体として捉えられがちで,個々のサンプルの特性の違いが見過ごされている。
    • ベンチマークのサンプルレベルでの分析を通じて,より詳細なモデル能力評価を目指す。
    • ベンチマークデータセットを認知,言語,倫理などの5つの側面から監査するフレームワークを開発した。
    • MMLU,ARCなど5つの主要なベンチマークにおいて,集約的な精度スコアでは捉えられない内部の多様性が明らかになった。
    • このアノテーションを活用し,推論深度や倫理的感受性など,特定の能力に焦点を当てたベンチマークの編成が可能となった。

    Link: https://arxiv.org/abs/2607.28801

  • モデルか,制御機構か:エージェントの失敗局所化のための相互作用中心の分類体系 [cs.AI]目的:エージェントの失敗原因の特定と,改善すべき構成要素の識別
    • エージェントの信頼性向上には,失敗原因の正確な把握が不可欠である。
    • 既存の評価では,失敗がシステムレベルで捉えられがちで,根本原因が不明確である。
    • エージェントの相互作用から失敗を局所化し,適切な改善策を導くことを目指す。
    • 本研究では,41種類の失敗モードを,構成要素間の関係性と故障箇所によって分類する体系を提案した。
    • この分類体系は,モデルのポストトレーニング,制御機構の修正,環境設計の改善など,具体的な対策へと繋がる。
    • 人間の判断と比較して,独立した推論エージェントによる再現性が確認された(Cohen's κ=0.76)。

    Link: https://arxiv.org/abs/2607.28802

  • 抵抗を受け流す:嗜好度最適化されたLLMカウンセラーは,動機づけ面接において目標の持続性と関係性の調和をトレードオフしうる [cs.CL, cs.AI, cs.LG]目的:動機づけ面接におけるカウンセラー応答の評価と最適化
    • 動機づけ面接は,クライアントの行動変容を促す上で重要な心理療法である。
    • カウンセラーが抵抗を受け流す際に,ラポール重視による目標放棄や,クライアントの自律性を無視する対立といった失敗が起こりうる。
    • 嗜好度最適化により,カウンセラーがより適切な応答を学習し,これらの失敗を回避することを目指す。
    • 嗜好度最適化において対立をペナルティ化すると,目標の持続性が一貫して低下することが確認された。
    • 関係性の調和の向上は,ベースモデルに依存するが,多くの場合において観察された。
    • プロンプトのみの調整では,目標の持続性を損なうことなく関係性の調和を高めることが可能であり,コストは最適化プロセスに由来する。

    Link: https://arxiv.org/abs/2607.28814

  • 親友という幻想:AIコンパニオンにおける長期的なペルソナ崩壊と行動ドリフトの評価 [cs.AI, cs.CL]目的:AIコンパニオンにおけるペルソナ崩壊と行動ドリフトの評価
    • AIコンパニオンは社会との接点を増しており,その一貫性が重要となる。
    • AIは一時的に適切な応答は生成できても,長期的な一貫性を保てない。
    • AIコンパニオンの長期的なペルソナ維持と行動の一貫性を評価する。
    • 実験の結果,評価されたどのモデルも長期的なペルソナの一貫性を保てないことが示された。
    • 軌跡の正確性は平均44.4%にとどまり,ユーザー状態の再現も困難である。
    • 現在のAIシステムでは,長期間にわたるコンパニオンとしての連続性を確保することが難しい。

    Link: https://arxiv.org/abs/2607.28818

  • 大規模言語モデルからの知識蒸留による軽量な強化学習エージェント:自律的なサイバー作戦への応用 [cs.LG]目的:自律的なサイバー作戦における防御的意思決定の改善
    • サイバー攻撃の高度化に伴い,企業ネットワークを防御するための自律的なサイバー作戦の重要性が増している。
    • 強化学習エージェントは,効果的な防御戦略を学習するために広範な探索が必要であり,不安定な振る舞いや初期の意思決定の質の低さが課題である。
    • 大規模言語モデルの知識を軽量なエージェントに蒸留することで,実用的な自律サイバー防御システムを実現する。
    • サイバーセキュリティデータで事前学習された大規模言語モデルは,改良されたCybORG CAGE Challenge 2環境において,ベースラインの強化学習エージェントを上回る性能を示した。
    • 大規模言語モデルの防御ポリシーを,わずか64,910パラメータの軽量な強化学習エージェントに転送するオンラインポリシー蒸留フレームワークを提案した。
    • ネットワーク構成の変化に対応可能なシナリオにおいて,本手法の有効性を確認し,報酬に基づいた強化学習最適化と教師主導の防御戦略の整合性の限界を示唆した。

    Link: https://arxiv.org/abs/2607.28826

  • エージェントネットワークにおけるポストトレーニング時の確実なデータ削除:学習解除が失敗する場合 [cs.CY, cs.NI, cs.LG]目的:自己改善型分散エージェントネットワークにおける信頼性の高いデータ削除
    • エージェントネットワークは様々なタスクを効率化するため重要であり,継続的な学習を通じて性能向上を図る。
    • データ削除要求時に,削除対象データが後の学習データに影響を与え,完全な削除が困難となる問題が存在する。
    • 学習解除後の影響の残存を防ぎ,データ削除の確実性を高めることを目指す。
    • 本研究では,データ削除後の影響(エコー)が残存し,学習データ量が増えるほど大きくなることを示した。
    • MUTEは,軽量なサーバー台帳を用いて影響を推定し,影響の高い学習データを隔離または低重み化することで,確実な削除を実現する。
    • 実験の結果,MUTEは行動漏洩を抑制し,タスクの有用性を維持しつつ,通信コストを削減できることが示された。

    Link: https://arxiv.org/abs/2607.28829

  • DeltaServe:LLMの推論とファインチューニングをホスト非依存で共存させる手法 [cs.DC, cs.LG]目的:LLMの推論とLoRAファインチューニングの同時実行によるGPUリソースの有効活用
    • LLMの利用拡大に伴い,GPUリソースの効率的な運用が重要となっている。
    • 推論処理のピーク負荷に備えたGPUプロビジョニングにより,アイドル状態のリソースが発生する。
    • アイドルGPUリソースを有効活用し,推論性能を維持しつつファインチューニングを高速化する。
    • DeltaServeは,既存の推論エンジンに容易に統合でき,LoRAバッチ処理のサポートがあれば適用可能である。
    • 実際の運用データを用いた評価で,vLLMにおいてLLMStationと比較して2.9倍のファインチューニングスループットを達成した。
    • DeltaServeは,追加のハードウェアなしで,vLLM+torchtuneのベースラインと比較して39%高いファインチューニングスループットを実現した。

    Link: https://arxiv.org/abs/2607.28848

  • 勾配ハイパーを用いた二層強化学習:改善されたサンプル複雑性 [cs.LG, cs.AI]目的:二層強化学習におけるサンプル複雑性の改善
    • 強化学習は,ロボティクスやゲームなど,様々な分野で重要な役割を担っている。
    • 既存の二層強化学習アルゴリズムは,スケーラビリティやサンプル効率に課題がある。
    • ボルツマン方策の最適性に着目し,効率的な二層強化学習アルゴリズムを開発する。
    • 本研究で提案するアルゴリズムは,ヘッセ行列を必要とせず,計算効率が高い。
    • 提案手法は,状態空間の探索効率が良く,従来のアルゴリズムより少ないサンプル数で学習が可能である。
    • 外層目的関数のポリアク・ロジャスビッチ条件への依存性を取り除き,理論的な収束性を保証した。

    Link: https://arxiv.org/abs/2607.28849

  • 複雑な離散選択課題における意思決定を強化するための機械学習手法の分析 [eess.SY, cs.SY, cs.HC, cs.LG]目的:複雑な離散選択課題における意思決定の改善に資する機械学習手法の評価
    • 政策決定において,個人の選好を把握することは重要であり,離散選択モデルはそのための一般的なツールである。
    • 従来のパラメータモデルでは,データ駆動型アプローチや個人の選好学習といった機械学習の可能性を十分に活かせない。
    • 個人の選好の多様性を考慮した上で,機械学習手法が離散選択ルールをどれだけ正確に推定できるかを検証する。
    • 準パラメータモデルおよび非パラメータモデルは,すべての選択ルールと実験条件下で,パラメータモデルを上回る性能を示した。
    • 訓練用選択肢のセット数や選択ルールの決定論的度合いの増加により,モデル性能はそれぞれ6%~96%,0%~55%程度向上した。
    • 実際のエネルギー政策の選好データを用いた事例研究では,TNNがBIC値13.351で最も優れた性能を発揮した。

    Link: https://arxiv.org/abs/2607.28854

  • 適切な損失関数のスワップ非依存学習の高速化に関する研究 [cs.LG]目的:適切な損失関数に対するスワップ非依存学習の効率的なアルゴリズムの開発
    • 機械学習において,予測の精度向上は重要な課題であり,損失関数の選択がその鍵となる。
    • 従来のagnostic学習では,予測値ごとに独立した学習が必要となり,計算コストが高いという問題があった。
    • 予測値に依存する後処理を効率的に行うためのスワップ非依存学習の学習レートの改善を目指す。
    • 適切な損失関数に対するオフラインスワップ非依存学習アルゴリズムを提案し,サンプル数mに対する超過リスクが$\widetilde{O}((\log |H|/m)^{2/3})$となることを示した。
    • オンラインスワップ後悔界限が$\widetilde{O}(T^{1/3}(\log |H|)^{2/3})$となることを示した。損失関数族全体に対してスワップ非依存な予測を行うアルゴリズムも提示した。
    • 凸かつ1-Lipschitzな適切な損失関数に対しては,オンラインおよびオフラインレートをそれぞれ$\widetilde{O}(T^{1/3}(\log |H|)^{2/3})$と$\widetilde{O}((\log |H|/m)^{2/3})$に改善した。

    Link: https://arxiv.org/abs/2607.28856

  • 磁気共鳴画像による多課題3D脳腫瘍セグメンテーションのための深層学習モデルの統一的ベンチマーク [cs.CV, cs.AI]目的:深層学習モデルの多課題3D脳腫瘍セグメンテーションの比較評価
    • 脳腫瘍の正確なセグメンテーションは,診断,治療計画,経過観察において不可欠である。
    • 研究ごとにデータセットや評価方法が異なり,客観的な比較が困難であった。
    • 公平な比較環境下で,様々な深層学習モデルの性能を評価し,最適なモデル選択を支援する。
    • 5つの最先端の3Dセグメンテーションモデル(3D U-Net, SegResNet, Swin UNETR, SegMamba, SegMambaV2)を,統一された条件下で評価した。
    • 評価データセットとして,髄膜腫(BraTS 2023)と治療後のグリオーマ(BraTS 2024)を用いた。
    • セグメンテーション精度と計算コストのトレードオフが示され,各アーキテクチャの特性が明らかになった。

    Link: https://arxiv.org/abs/2607.28858

  • TextCloak: RL駆動による学習不能なテキストを用いたLLMの不正利用の阻止 [cs.CL, cs.AI, cs.CR, cs.LG]目的:LLMの不正利用に対するテキストデータの保護
    • LLMの急速な発展は言語処理技術を向上させた一方で,データ不正利用やプライバシー侵害のリスクを高めている。
    • 既存のテキスト保護手法は分類タスクに特化しており,LLMのような生成モデルへの適用が困難である。
    • TextCloakは,汎用的な保護パターンを発見し,LLMの不正利用を効果的に防ぐことを目指す。
    • TextCloakは,テキストの意味と自然さを維持しつつ,LLMが学習困難なテキストを生成する。
    • 実験により,TextCloakは不正なファインチューニングを抑制しつつ,正当な利用におけるテキストの有用性を維持することが示された。
    • モデルアーキテクチャや学習設定,適応的攻撃への耐性も確認されており,実用的な防御策としての適用範囲が広い。

    Link: https://arxiv.org/abs/2607.28862

  • LLM修正エージェントにおける検証証拠:合格したテストが実際にバグをテストしている割合は? [cs.CY, cs.HC, cs.SE, cs.AI]目的:LLM修正エージェントによるテスト合格時の証拠の妥当性評価
    • ソフトウェア品質向上において,自動修正技術は開発効率を飛躍的に高める可能性を秘めている。
    • LLM修正エージェントはテストに合格するが,バグを特定できていない場合がある。
    • テスト合格時の証拠の質を評価し,よりバグを特定できる修正エージェントを目指す。
    • バグを含むコード,修正候補,正解修正に対してテストを再実行し,検証証拠の役割を分類した。
    • 全イベントの約46%はバグを識別する情報を含んでおらず,ベースラインロールアウトの24%は質の低い証拠のみで修正を完了した。
    • バグコントラストフィードバックにより,質の低い証拠での完了が7.8%減少し,バグ識別証拠が7.4%増加したが,実用的な規模は不明である。

    Link: https://arxiv.org/abs/2607.28871

  • 演奏による感情変化の予測学習:クラシックピアノ音楽における差異 [cs.SD, cs.LG, cs.MM]目的:演奏の違いに起因する感情の差異の特定と予測
    • 音楽は感情伝達の手段であり,演奏者の解釈が聴覚的な感情に影響を与える。
    • 楽曲自体が感情の主要因となる場合が多く,演奏による微細な感情変化の特定が困難。
    • 演奏に特有な特徴を用いて,演奏者間の感情変化を定量的に予測すること。
    • 演奏に特有な特徴量を用いることで,演奏者間の感情変化に意味のある差異が認められた。
    • 提案手法Delta-VAは,平均的な演奏からの感情変化を予測する際に高い方向性の一致性を示した。
    • しかし,予測値の幅が小さくなる傾向があり,表現力豊かな演奏効果を過小評価している可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28876

  • オープンソースLLM駆動型形式検証:RTL修正のためのマルチエージェントパイプライン [cs.AR, cs.LG, cs.SE]目的:RTL修正のためのマルチエージェントパイプラインの実現
    • チップ設計において検証は主要な工程であり,その効率化は重要である。
    • 形式検証ツールは高価であり,ライセンス制限も存在し,利用が制限されている。
    • オープンソースツールチェーンによる形式検証とLLMの組み合わせによるRTL修正を目指す。
    • 提案パイプラインは,ALUのケーススタディにおいて,実際の機能的なバグを検出し,形式的に修正に成功した。
    • 6つのベンチマークスイートにおいて,1つの設計は確実に修正され,4つの異なる失敗モードが特定された。
    • 本研究は実現可能性の検討であり,詳細な失敗分析とYosysのbindディレクティブに関する実用的な制限も報告する。

    Link: https://arxiv.org/abs/2607.28877

  • RareSense:トランザクションデータにおける異常検知のための希少性に基づいた類似性検索 [cs.IR, cs.AI, cs.LG]目的:トランザクションデータの異常検知における類似性検索手法
    • トランザクションデータ分析は,不正行為の検出や顧客行動の理解に不可欠である。
    • 従来の類似性検索は頻出属性に偏り,稀なイベントの検出が困難である。
    • 稀な共起パターンを活用し,より正確な異常検知を実現することを目指す。
    • RareSenseは,稀なアイテムセットを中間構造として活用し,信頼性の高い関連ルールを導出する。
    • オブジェクトを稀なルールプロファイルにマッピングし,重み付きJaccard類似度を用いて比較することで,稀な証拠に基づく近傍を特定する。
    • 実験の結果,RareSenseは複数のベンチマークデータセットにおいて,既存手法を上回る検索性能を示した。

    Link: https://arxiv.org/abs/2607.28879

  • LayoutBench:マルチメディアデータ向けクラウドストレージレイアウトの性能評価 [cs.DC, cs.DB, cs.LG]目的:マルチメディアデータのためのクラウドストレージレイアウトの性能評価
    • 機械学習の発展に伴い,クラウドストレージにおける大規模データセットの効率的な管理が重要となっている。
    • 既存のベンチマークはデータベース中心であり,マルチメディアデータへの適用性に関する体系的な評価が不足している。
    • マルチメディアデータ検索における,異なるストレージレイアウトの性能を評価し,最適なレイアウト選択を支援すること。
    • 個々のサンプルをオブジェクトとして保存するL1,tarアーカイブにまとめるL2,Parquetファイルに格納するL3の3つのレイアウト戦略を比較した。
    • L2は,小規模な検索では接続再利用により低遅延だが,大規模検索ではその利点が失われることが示された。
    • L3は大規模検索で最速だが,行グループの粒度によりデータ転送量が大幅に増加し,メモリ消費量も大きくなる。

    Link: https://arxiv.org/abs/2607.28880

  • 不完全な整合性下における価値の脆さ [cs.AI]目的:価値整合性の問題における価値の脆さの分析
    • AIの発展に伴い,人間の価値観との整合性が不可欠となっている。
    • 不完全な価値の代理指標による最適化が,甚大な結果を招く可能性がある。
    • 価値関数が特定の条件を満たす場合に,AIが許容範囲外の行動をとる可能性を明らかにする。
    • 代理指標の精度と人間の価値関数に依存して,深刻な結果をもたらすAIが展開される条件を特定した。
    • 最適化の過度な圧力は危険であり,最適化圧力を制限するAI設計の重要性を示唆した。
    • 量子化子のような設計は,事前訓練のみに頼るよりも安全性を高める可能性がある。

    Link: https://arxiv.org/abs/2607.28881

  • 機械を追加することは機械であり,削除することは人間である:LLMコード編集における削除回避の測定と軽減 [cs.CG, cs.CG, cs.SE, cs.AI, cs.LG]目的:LLMコード編集における削除回避の測定と軽減
    • 大規模言語モデルのコード生成・修正の利用が拡大する中で,保守性の低下が懸念されている。
    • LLMが生成する修正コードは,テストは通過するものの,コードベースの保守性を損なう傾向がある。
    • LLMが修正時に削除すべきコードを残してしまう「削除回避」の問題を定量化し,その対策を探る。
    • LLMは,開発者の修正と比較して,削除の再現率が最大71.7%に留まることが示された。
    • オリジナルのテストでは削除が確認されないため,LLMは削除せずにガードやフォールバックを追加する傾向が強い(Guard-and-Go)。
    • 削除を必須とするテストを追加すると,LLMの成功率が大幅に低下し,追加トレーニングによって削除回避を軽減できる可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28887

  • K-12教育におけるAI活用概念化のための人間とLLMの協調的帰納的コーディング [cs.HC, cs.AI]目的:K-12教育者と生成AIプラットフォーム間の45,000件のメッセージから階層型コードブックを開発するプロセス
    • 質的研究において,大規模なインタラクションデータが扱う必要性が高まっており,効率的な分析手法が求められている。
    • 手作業によるコーディングだけでは,大規模データを分析することが困難であり,分析の質が低下する可能性がある。
    • LLMを活用することで,コーディング作業の効率化と分析の質向上を目指し,人間による解釈の妥当性を維持する。
    • LLMは候補ラベルや構造化された注釈を大規模に生成し,人間研究者はカテゴリー定義や解釈フレームワークにおいて概念的な権限を保持した。
    • 開発されたコードブックを用いて系統的な人間によるコーディングを実施し,信頼性を確立,さらにLLM支援段階では明らかにならなかった5つのコードを追加した。
    • 最終的なコードブックは19カテゴリーと6つのドメインを含む72項目で構成され,質的研究におけるLLM支援のテンプレートとして活用できる。

    Link: https://arxiv.org/abs/2607.28889

  • 合意は品質ではない:人間とLLMの質的コーディングの盲検的な専門家による検証 - 人間の一致が真実ではない場合 [cs.HC, cs.AI]目的:LLM支援による質的コーディングの評価方法の検証
    • 質的データの分析は,社会科学や人文科学において不可欠であり,深い洞察を得るために重要である。
    • LLMの質的コーディングの評価は,人間のコーダーとの合意度で測られることが多いが,人間のコーディングが常に正しいとは限らない。
    • 人間のコーディングの限界を克服し,LLMのコーディングの品質をより正確に評価する方法を確立すること。
    • 従来の合意度測定では,人間とLLMの合意度は低い(Jaccard係数0.30)一方,人間同士の合意度は0.52であった。
    • 専門家による盲検的な検証では,人間とLLMのコーディングの好ましさは同程度であり(51.5% vs. 48.5%, p = 0.537),一部のLLMは人間のコーダーよりも上位にランク付けされた。
    • 人間の合意には偏りが含まれる場合があり,専門家はLLMの解釈を支持することがあった。合意度に基づく評価は不十分であり,検証プロトコルと分業フレームワークが重要となる。

    Link: https://arxiv.org/abs/2607.28890

  • ベイズ実験計画法による認知パラメータ推論のための情報的環境の特定 [cs.AI, stat.ML]目的:認知パラメータ推論のための情報的環境
    • 認知メカニズムの解明は,人間の認知機能を理解する上で不可欠であり,様々な応用につながる。
    • 既存研究では実験環境が固定されており,最適な実験環境の選択が課題となっていた。
    • ベイズ実験計画法を用いて,認知パラメータ推論に最適な実験環境を効率的に設計すること。
    • 提案手法であるamortized BEDは,exact Monte Carlo BEDの環境ランキングと高い一致性を示し,計算コストを大幅に削減した。
    • 単一の環境が全ての認知推論目的に対して最適であるとは限らず,情報量,事後回復可能性,情報効率の間のトレードオフが存在することが示された。
    • ベイズパラメータ推論のための情報的認知実験を設計するための原理的な枠組みが提供された。

    Link: https://arxiv.org/abs/2607.28894

  • TORUS:統一オーディオモデルにおけるレンダリング理解の一貫性テスト [cs.IR, cs.SD, cs.AI, cs.CL]目的:統一オーディオモデルにおける自己整合性の評価
    • 音声処理技術は,多様な応用分野において不可欠であり,その発展が求められている。
    • 現在の統一オーディオモデルは,個々の機能を評価するものの,生成と理解の一貫性は検証されていない。
    • 本研究は,統一オーディオモデルの自己整合性を評価し,今後の発展に資することを目的とする。
    • 本研究で開発したTORUSは,音声,音響,音楽の各分野における自己整合性を評価するテストである。
    • 評価の結果,最良の統一モデルは50.5%の正答率であり,従来の専門モデル群の63.2%を下回った。
    • 特に音声編集タスクにおいてモデルの自己整合性が低いことが示され,今後の課題が明確になった。

    Link: https://arxiv.org/abs/2607.28896

  • 確率的勾配法に対する並列アーキテクチャによる適応性 [cs.LG, cs.AR, math.OC]目的:確率的勾配法の適応性向上のための並列フレームワーク
    • 機械学習の分野において,効率的な最適化手法の確立は重要な課題である。
    • 従来の確率的勾配法では,適切なステップサイズの決定が難しい場合がある。
    • 並列アーキテクチャを用いることで,ステップサイズの探索を効率化し,収束性を高める。
    • 本研究では,複数のプロセッサを用いて異なるステップサイズを並行して探索するフレームワークを提案する。
    • 各プロセッサは,あらかじめ定義された関数に従い,異なる$T$の値で静的勾配法を実行する。
    • この並列化により,所望の収束条件を満たすステップサイズを効率的に見つけ出すことが可能となる。

    Link: https://arxiv.org/abs/2607.28902

  • 設計概念:技術者の地政学的省察の足場作り [cs.HC, cs.AI, cs.CY]目的:技術者の地政学的省察の促進
    • 技術企業とその従業員が国際情勢に影響を与える存在として認識されつつある。
    • 責任あるイノベーションやAI研究では,地政学的背景への考察が不足している。
    • 技術者が自身の価値観と立場を批判的に検討することを支援する。
    • AIを活用したインタラクティブな物語システムを通じて,技術,権力,地政学に関する考察を促す。
    • 物語との対話,類型化,ワークショップでの協調的省察により,問題意識の向上を目指す。
    • 戒律的なアプローチに頼らず,地政学的省察を責任ある技術イニシアチブに導入する可能性を示す。

    Link: https://arxiv.org/abs/2607.28904

  • 内省か,それとも再生成か:LLMの修正が人間の修正に成功する理由 [cs.LG]目的:LLMと人間の修正プロセス間の差異
    • 大規模言語モデル(LLM)の性能向上は,自然言語処理の重要な課題である。
    • LLMの自己修正能力は,必ずしも人間の内省的な修正と一致しない。
    • LLMの修正プロセスが,真の意味でのエラー駆動型であるか検証する。
    • LLMは,客観的課題では情報獲得がほぼゼロであり,再サンプリングと区別がつかない。
    • 主観的課題では,情報獲得がマイナスとなり,正解から遠ざかる傾向にある。
    • 人間の修正は,客観的・主観的課題の両方で情報獲得が正であり,LLMとは異なる。

    Link: https://arxiv.org/abs/2607.28908

  • ゲート付きQ学習:嗜好にオフポリシーバイアスを加える [eess.SY, cs.SY, cs.CE, cs.LG, cs.AI]目的:オフポリシーバイアスの制御と,効率的なマルチステップ信用割り当て
    • 強化学習において,サンプル効率は重要な課題であり,効率的な学習にはマルチステップ信用割り当てが不可欠である。
    • Q学習におけるオフポリシーバイアスの管理は長年の課題であり,バイアス除去と学習速度のトレードオフが存在する。
    • 本研究は,オフポリシーバイアスと学習速度の間の新たなバランスを実現し,より効率的なQ学習エージェントを開発することを目指す。
    • ゲート付きQ学習は,バイアス除去と学習速度の極端な選択肢の中間を滑らかに補間する新しいフレームワークである。
    • 状態行動に依存するゲート機構により,探索を意識した信用割り当ての減衰を実現し,理論的な収縮写像の性質を証明した。
    • 実験結果は,中間的なゲート処理がより長い信用割り当ての範囲を可能にし,初期学習速度を向上させることを検証した。

    Link: https://arxiv.org/abs/2607.28916

  • グラフニューラルネットワークによる最適動的マッチング学習 [cs.LG, cs.GT, econ.TH]目的:動的マッチング市場における最適マッチング戦略の学習
    • マッチング市場は経済活動において重要であり,資源配分の効率化に寄与する。
    • 従来の市場モデルでは,時間経過に伴う変化や不確実性を考慮した動的なマッチングが困難である。
    • グラフニューラルネットワークを用いて,動的な環境下で最適なマッチング戦略を学習する。
    • 提案手法は,イベント発生直後にのみ行動し,次のイベントを待機する戦略が最適であることを証明した。
    • 残差グラフ上の単一の継続価値関数で最適Q関数が特徴付けられ,学習対象が状態行動価値からグラフ価値へと簡略化される。
    • バイナリ型ベンチマークおよび腎臓交換ベンチマークにおいて,提案手法は既存手法を大幅に上回り,適応的な動的マッチングが可能であることを示した。

    Link: https://arxiv.org/abs/2607.28925

  • FairFund-Bench:LLMによる資源配分の分配バイアス評価 [cs.CL, cs.AI, cs.CY]目的:LLMにおける資源配分の分配バイアスの評価
    • LLMが資源配分に関わる機会が増加しており,公平性の確保が重要課題となっている。
    • 既存のLLM監査では,人種や性別による差別に関する結果が不一致する事例が見られる。
    • 監査形式の違いがバイアスの評価に影響することに着目し,その影響を系統的に検証する。
    • 監査形式(評価,ランキング,配分)や文脈(単独/複数刺激),透明性の有無がバイアスの方向性に影響を与えることが示された。
    • 隠蔽された監査ではバイアスの程度が大きく,透明性のある監査では公平な配分が行われやすい傾向が見られた。
    • 因果的枠組みの影響は,人口統計学的影響を大きく上回り,LLMが人間の価値判断を再現している可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28934

  • 潜在拡散モデルを用いた顔認識に対する回避攻撃:DiffAttack [cs.CV, cs.AI]目的:顔認識システムに対する回避攻撃手法の開発
    • 顔認証は生体認証の重要な要素であり,セキュリティにおいて不可欠である。
    • 既存の手法では,高品質で知覚できない攻撃画像の生成が困難である。
    • 異なる属性間での攻撃成功率向上を目指し,よりロバストな攻撃手法を提案する。
    • 提案手法DiffAttackは,FFHQやCelebA-HQ等の標準ベンチマークにおいて高い攻撃成功率(84.86%)を達成した。
    • DiffAttackは既存のノイズベース手法よりも15.28%以上,セマンティックベース手法よりも約5.21%高い転移性能を示した。
    • 潜在拡散モデルを活用することで,顔認識モデルの識別境界を欺く効果的な攻撃を実現した。

    Link: https://arxiv.org/abs/2607.28936

  • 潜在リー・ポアソンニューラルネットワーク:観測データと潜在的ダイナミクスによるリー・ポアソン系の運動の発見 [cs.LG, math.DS, math.OC]目的:リー・ポアソン系の運動学習
    • 力学や制御における多くのハミルトン系は,対称性縮約を通じてリー・ポアソン系として表現できる。
    • 通常,リー・ポアソン系のダイナミクスは観測不可能な運動量変数で発展する。観測データは構成や速度に限られる。
    • 観測データのみからリー・ポアソン系のダイナミクスを直接学習する構造保存フレームワークを提案する。
    • 提案手法は,ハミルトンデコーダまたは擬似ラグランジアンエンコーダ,普遍的なネーター不変量,リー・ポアソン流を利用する。
    • この手法は,幾何学的構造を保存し,正則および縮退したハミルトン系に適用可能である。
    • 数値実験では,SO(3)上の一般化された剛体,SE(3)上のキルヒホフの水中車両,SE(2)^N上の相互作用する車両の最適制御問題において,優れた予測精度とロバスト性が確認された。

    Link: https://arxiv.org/abs/2607.28939

  • NeSyFS:部分観測下におけるLLMエージェントのための神経記号高速・低速思考フレームワーク [cs.IR, cs.AI]目的:部分観測下におけるLLMエージェントの意思決定のための神経記号高速・低速思考フレームワーク
    • LLMエージェントの応用が拡大する中で,不完全な情報に基づく行動が課題となっている。
    • 過去の行動履歴に冗長な情報が含まれ,LLMエージェントの意思決定を誤らせる可能性がある。
    • 知識グラフを用いた信念状態の表現と,高速・低速思考モジュールによる不確実性への対応を目指す。
    • 提案手法NeSyFSは,ALFWorld,Webshop,ScienceWorldの3つのベンチマークにおいて,既存手法を上回る性能を示した。
    • 高速思考モジュールは即応的な行動を,低速思考モジュールは不確実性を考慮した計画立案を行う。
    • 反射モジュールは高速思考の行動を評価し,必要に応じて低速思考に切り替えることで,目的と行動のずれを軽減する。

    Link: https://arxiv.org/abs/2607.28942

  • FairDiffuseVQVAE:ベクトル量子化潜在変数の条件付き洗練による表形式データの拡散モデルにおけるサンプリング時の公平性 [cs.LG]目的:表形式データの拡散モデルにおける公平性の確保
    • プライバシー保護,データ拡張,分類器バイアスの軽減に表形式データの合成利用が拡大している。
    • 既存の公平性を考慮した生成モデルは,サンプル品質や実用性に大きな影響を与える場合がある。
    • サンプル時の公平性を確保しつつ,高い品質の合成データを生成することを目指す。
    • FairDiffuseVQVAEは,既存手法と比較して,人口統計学的パリティ比と平等化オッズ比において高い性能を示した。
    • 特に人口統計学的パリティ比は0.702であり,FairTabDDPMよりも47%向上している。
    • わずかなAUCの低下を許容することで,高い公平性とデータ品質を両立している。

    Link: https://arxiv.org/abs/2607.28945

  • データマスキングのためのシャプレイ値に基づく特徴量帰属 [cs.LG]目的:データマスキングにおける特徴量帰属
    • 個人情報保護の重要性が高まる中,データ活用との両立が課題となっている。
    • 既存研究はデータセット全体の評価に偏り,個々の特徴量レベルでの検討が不足している。
    • 特徴量レベルでのリスクと有用性のトレードオフを評価し,公平なデータマスキングを実現する。
    • 提案手法は,データマスキングにおける情報漏洩リスクを効果的に低減できる。
    • 同時に,データマスキング後のデータ有用性を維持することが可能である。
    • 本フレームワークは,様々なマスキング手法や評価指標に適用可能である。

    Link: https://arxiv.org/abs/2607.28946

  • LLM駆動型プログラム最適化における弱点リンク効果の克服:異種編集再結合によるアプローチ [cs.LG]目的:LLM駆動型プログラム最適化における性能向上
    • プログラム最適化は,計算資源の効率的な利用や問題解決能力の向上に不可欠である。
    • 従来のLLMを用いた最適化手法では,複雑なプログラム構造において信頼性の高い最適化方向の特定が困難である。
    • HEROは,複数の編集候補を評価し,効果的なものを選択・組み合わせることで,最適化の効率と精度を向上させる。
    • HEROは,アルゴリズム問題,戦略ゲーム,LLMエージェントの設計,ロボットの経路計画など,多様なタスクにおいて高い性能を発揮した。
    • HEROは,既存のLLM最適化手法と比較して,より高スコアなプログラムを発見し,収束までの時間が大幅に短縮された。
    • HEROは,トークン消費量を削減しながら,優れた最適化性能を実現した。

    Link: https://arxiv.org/abs/2607.28947

  • ニューラルネットワーク検証のための判定境界のマイニング [eess.SY, cs.SY, cs.RO, eess.SY, cs.SY, cs.LG, cs.LO, cs.SE]目的:ニューラルネットワークの完全検証
    • 深層学習の安全性確保が重要視される中で,ネットワークの正確な検証手法が求められている。
    • 既存の検証手法は計算コストが高く,大規模ネットワークへの適用が困難である。
    • 効率的な判定境界探索により,検証コストを削減し,大規模ネットワーク検証を可能にする。
    • 提案手法は,活性化関数を同時に分割することで,逐次的な処理の非効率性を改善する。
    • 経路の単調性を利用した効率的な探索により,検証に関係のない部分問題をスキップする。
    • 定量的な情報に基づいた境界位置の推定により,探索性能をさらに向上させている。

    Link: https://arxiv.org/abs/2607.28954

  • 検索駆動型学習不要AI生成動画の帰属特定 [cs.CV, cs.AI]目的:AI生成動画の生成元特定
    • AI技術の発展により,現実と区別がつかない動画が生成可能となり,社会に悪影響を及ぼす可能性が懸念されている。
    • 既存の画像帰属特定手法は,画像生成モデルに依存しており,大規模な動画データへの汎化が困難である。
    • 生成モデルが導入するアーティファクトを捉え,動画フレーム全体で集約することで,学習なしに動画の生成元を特定することを目指す。
    • 提案手法は,GenVidBenchベンチマークにおいて,AI生成動画の検出と帰属特定において高い性能を示した。
    • 既存の最先端手法と比較して,Rank-1精度は20.5%向上し,平均平均精度(mAP)は16.6%を達成した。
    • 直交色変換,多段階量子化残差生成,時系列・意味集約のパイプラインが,生成モデルに起因するアーティファクトを効果的に捉えている。

    Link: https://arxiv.org/abs/2607.28955

  • MerchantBench:Eコマース業務におけるLLMエージェントの長期一貫性評価 [cs.AI]目的:Eコマース業務におけるLLMエージェントの長期一貫性
    • LLMの自律的なツール利用能力は向上しているが,実用的な評価が課題となっている。
    • 既存のベンチマークは短期的なタスクに偏っており,長期的な一貫性を評価できない。
    • Eコマースのシミュレーション環境を用いて,LLMエージェントの長期的な意思決定能力を評価する。
    • MerchantBenchは,98,843件の実データに基づいた365日間のEコマースシミュレーション環境である。
    • 評価の結果,最新のLLMでさえも人間と比較して最終的な純資産が大きく低いことが示された。
    • 最良のLLM構成でも,人間の平均的な純資産の27.3%にしか到達しなかった。

    Link: https://arxiv.org/abs/2607.28956

  • 低ランク防御と回路誘導的代理モデルによる効率的なLLM敵対的学習 [cs.LG, cs.AI]目的:大規模言語モデルに対する敵対的学習の計算効率向上
    • 敵対的攻撃からモデルを保護することは,AIシステムの信頼性と安全性を確保する上で重要である。
    • 敵対的学習は効果的だが,特に大規模言語モデルにおいては計算コストが非常に高いという課題がある。
    • 計算コストを削減しつつ,敵対的学習の有効性を維持することを目的とする。
    • 提案手法は,標準的な敵対的学習と比較して,FLOPsを平均48.1%削減できる。
    • 学習可能なパラメータはわずか0.0118%で済むため,計算資源の節約に貢献する。
    • ReFTの適用トークンと攻撃対象のミスマッチの問題を明らかにし,理論的および実験的にその有効性を示した。

    Link: https://arxiv.org/abs/2607.28959

  • 効率的なプロンプトチューニングのための視覚的分布アンカリング [eess.SY, cs.SY, eess.SP, cs.CL, cs.CV, cs.LG]目的:視覚と言語モデルの少ない学習パラメータによる適応
    • 画像とテキストを組み合わせたモデルは,多様なタスクに応用可能であり,AI研究において重要性が増している。
    • 既存の手法では,効率性と適応性の両立が難しく,ソースクラスへの過学習や計算コストの問題がある。
    • ラベルなしターゲットデータを用いて,モデルを効率的に適応させ,性能向上を目指す。
    • VDAは,学習を必要としないターゲット適応フレームワークであり,ラベルなしターゲットプールからオフラインで推定されたクラスレベルの視覚的プロトタイプを用いる。
    • 実験の結果,VDAはCLIP,TCP,MaPLeのゼロショット性能をそれぞれ3.22,3.39,3.35ポイント向上させた。
    • 視覚的補正により,PromptKDの性能も2.79ポイント向上し,多様な設定で優れた結果が得られた。

    Link: https://arxiv.org/abs/2607.28967

  • LLM利用と科学的生産性の関連性:停止時間選択の評価 [cs.DL, cs.AI, cs.CY]目的:LLM利用と科学的生産性の関連性の強固さの評価
    • 科学研究の進展において,研究者の生産性向上は重要な課題である。
    • LLM利用が生産性に与える影響の評価には,バイアスの問題が存在する。
    • LLM利用時期の特定方法によるバイアスを検証し,真の因果効果を明らかにすること。
    • RBBが指摘する停止時間選択による影響は,観測された生産性変化を説明するには不十分である。
    • 様々な分析手法を用いてLLM利用と生産性の正の関連性が確認された。
    • ChatGPT以前のデータでは同様の結果は得られず,LLMの利用が生産性向上に寄与する可能性が示唆された。

    Link: https://arxiv.org/abs/2607.28968

  • 地域制約バッチング:ローカルコミュニティプラットフォームにおけるコントラスティブユーザモデリング [cs.IR, cs.LG]目的:コントラスティブユーザモデリングにおける地域制約バッチング手法
    • 大規模レコメンダーシステムにおいて,ユーザモデリングは重要な課題である。
    • 既存手法では,実際にはありえないユーザ・アイテムペアを負例として扱うことが問題である。
    • 現実的な露出制約下で,より質の高いユーザ表現を獲得することを目指す。
    • 地域制約バッチサンプリング(RCBS)は,ユーザと実際に閲覧可能なアイテムのみを比較するバッチを構成する。
    • RCBSは,不可能例を現実的な例に置き換えることで,より困難で有益な負例を導入する。
    • オフライン評価とオンラインA/Bテストの結果,RCBSはユーザ表現の質を向上させ,様々なランキング性能を改善した。

    Link: https://arxiv.org/abs/2607.28971

  • RAID:ビット反転画像を用いたロバストなAI生成画像検出へ [cs.CV, cs.AI]目的:AI生成画像の検出
    • AI技術の発展により,画像生成が容易になり,偽画像の悪用リスクが高まっているため。
    • 既存手法は,実画像と生成画像の根本的な違いに着目せず,汎化性能に課題がある。
    • ビットプレーンを利用し,ビット反転画像を導入することで,ロバストな検出を目指す。
    • 提案手法は,ビット反転画像の生成,勾配ベースのパッチ選択,畳み込み分類器から構成されるシンプルなパイプラインである。
    • 40以上のベンチマークで既存手法を凌駕し,処理速度も大幅に向上した。
    • 異なる生成モデルやデータセット間での汎化性能,ゼロショット性能においても高い有効性が確認された。

    Link: https://arxiv.org/abs/2607.28974

  • 特徴と構造の整合性を超えて:グラフ基盤モデルのための伝播知識の学習 [cs.CL, cs.LG]目的:グラフ基盤モデルにおける伝播可能な知識
    • グラフデータ分析は,社会ネットワークや分子構造など,様々な分野で重要性が増している。
    • 既存のグラフ学習手法は,特定のドメインに依存するため,未知のドメインへの汎化が困難である。
    • 異なるドメイン間での知識転移を可能にする,グラフデータの伝播パターンに着目する。
    • ProGFMは,エッジと特徴次元間の伝播関係を伝播可能な知識単位として捉える。
    • 伝播関係のプロトタイプバンクを通じて,ProGFMはドメインを越えた伝播知識を学習する。
    • 実験結果から,ProGFMは未知のグラフドメインにおいて優れた知識転移能力と汎化性能を示す。

    Link: https://arxiv.org/abs/2607.28980