arXiv雑要約
AI - 2026/07/31 公開
LM-GRASP:オンライン模倣学習による組合せ構築のためのインスタンス固有言語モデル [cs.LG]目的:組合せ最適化問題に対するオンライン模倣学習を用いた言語モデルの構築
- 組合せ最適化は,現実世界の様々な問題を解決するための重要な手法であり,効率的な解法が求められている。
- 従来の機械学習手法は,大規模なオフラインデータセットが必要であり,分布外汎化性能が低いという課題がある。
- インスタンス固有の言語モデルをオンラインで学習することで,問題固有の工夫を必要とせず,効率的な解探索を目指す。
- 提案手法LM-GRASPは,タイヤールPFSPベンチマークにおいて,GPU-GRASPを平均28.4makespan単位上回る性能を示した。
- この性能向上は,GPUアクセラレーションによる逐次実行との改善に匹敵し,実用的な代替手法となり得ることを示唆する。
- 特に,古典的な貪欲的構築が困難な地形において,インスタンス固有のオンライン学習言語モデルの有効性が示された。
非対称的コミュニケーション:大規模言語モデルと言語ゲーム [cs.CY, cs.AI]目的:大規模言語モデルと人間とのコミュニケーションにおける非対称性の構造
- AI研究は発展を続け,その能力と限界の理解が不可欠である。
- 大規模言語モデルに人間に見られる認知能力を過剰に帰属させる誤りが存在する。
- 人間とLLM間のコミュニケーションの構造を分析し,誤った帰属を解消すること。
- 本研究は,大規模言語モデルに対する誤った属性を「カテゴリーミステイク」として捉え,その構造を説明する。
- 人間とLLMの対話は,人間が全ての規範的活動を担う言語ゲームであり,LLMはコミットメントや評価を行わない非対称なコミュニケーションである。
- このフレームワークは,AIの安全性確保(ガードレール)を,機械の道徳的能動性ではなく,構造的な必要性として捉え直すことを可能にする。
エージェントは欺瞞できるか? 社会的推論ゲームを用いたParliamentBenchによる推論と欺瞞の評価 [cs.CL, cs.AI]目的:大規模言語モデルにおける欺瞞能力の評価
- 医療や法律システム等,高リスク環境でのLLM利用が増加しており,安全性確保が重要である。
- LLMの欺瞞能力は未知数であり,その評価方法が確立されていない。
- 社会的推論ゲームを通じて,LLMの欺瞞,説得,推論能力を定量的に評価する。
- 最先端モデル(GPT-5.4等)は協力と欺瞞の両方の役割で高い性能を示す。
- 性能の低いモデルはランダムな行動や単純なアルゴリズムよりも劣る結果となった。
- ほとんどのLLMはゲーム全体を通して一貫した欺瞞人格を維持するのに苦労しており,欺瞞の維持率は50%を下回る。
深層学習が伝統中国医学の舌診に有効である理由:包括的な消去研究 [cs.CV, cs.LG]目的:伝統中国医学における深層学習による舌診の最適設計原理の特定
- 伝統中国医学の舌診は,健康状態を把握する重要な手段であり,熟練した医師による診断が求められる。
- 舌診の自動化は進んでいるものの,深層学習モデルの設計空間は十分に検討されていない。
- 本研究は,深層学習モデルの構成要素を系統的に変化させ,最適な設計原理を明らかにすることを目的とする。
- ConvNeXt-Tinyがパラメータ効率の面で最適であることが示された。
- 二値交差エントロピー損失関数(BCE)が非対称損失関数よりも大幅に高い性能を示した(2.7%向上)。
- 抑制された色拡張と弱グループアンサンブル,データスケーリングが性能向上に寄与することが明らかになった。
OPLD:マルチモーダル推論のためのオンポリシー潜在蒸留 [cs.DC, cs.CV, cs.AI]目的:マルチモーダル推論における潜在表現の学習
- 視覚的推論はAIの重要な課題であり,多様な応用が期待されている。
- 既存手法は外部定義の推論過程に依存し,柔軟な視覚的思考が困難である。
- マルチモーダルCoTによる推論能力を潜在表現に転移し,抽象的思考を実現する。
- OPLDは,特権的なマルチモーダルCoTによって誘導される推論能力を潜在表現に転送するシンプルなフレームワークである。
- 多様なマルチモーダルベンチマークにおいて,既存の潜在推論手法を上回り,最先端の性能を達成した。
- 潜在表現を推論過程レベルで監督することが,従来のフィーチャーレベルの整合よりも効果的であることが示唆された。
拡散言語モデルにおけるコミット位置とタイミング:候補認識に基づくデコーディング [cs.CL, cs.AI]目的:拡散言語モデルのデコーディングにおける効率化
- 大規模言語モデルの推論コストは高い。計算資源の制約から,効率的な推論手法が求められている。
- 既存の早期終了手法は,精度を損なう可能性がある。特に,長文生成において誤ったタイミングで終了してしまう問題がある。
- 候補認識に基づき,より適切なタイミングでデコーディングを停止することで,精度と効率の両立を目指す。
- 提案手法LATCHは,既存手法と同等の精度を維持しつつ,最大17.8倍の推論速度向上を実現した。
- LATCHは,タスクの出力形式に基づいた検証を行うことで,プロンプトの工夫なしに効率的な推論を可能にする。
- 本手法は,異なるバックボーンモデル間でもパラメータ調整なしに高い性能を発揮する。
最適な分類および回帰木探索戦略 [cs.LG, cs.AI]目的:最適な決定木の探索戦略
- 決定木は解釈性が高く,機械学習において重要な役割を担う。
- 決定木の最適化は計算コストが高く,大規模データへの適用が困難である。
- 探索戦略を比較検討し,計算効率と性能のバランスを改善する。
- 提案手法は,既存の最新技術と比較して,分類タスクにおけるanytime性能を向上させた。
- 回帰タスクにおいては,実行時間を1桁以上短縮することに成功した。
- 本研究は,様々な探索戦略の効果を定量的に評価するための基盤を提供する。
エージェント的ASR:エージェント的アプローチによる現実世界での音声認識の改良 [cs.AI]目的:音声認識における読みやすいテキストの生成
- 音声認識技術は向上しているが,そのままでは読みづらく意図が伝わりにくい。
- 既存手法では,音声の変更によって前の内容の解釈が変わっても修正できない。
- 発話者の意図を損なわずに,不自然な箇所を削除し,テキストを洗練することを目指す。
- AgenticASRは,ASRとRefinerのアーキテクチャで継続的にテキストを生成・修正する。
- AASR-Benchベンチマークにおいて,既存システムを上回るスコアを達成した。
- 人間とAIの評価において,評価基準と専門家の評価が一致することを示した。
ソフトウェア工学教育におけるAIの要件品質学習への統合:TPACKに基づく経験的研究 [cs.SE, cs.AI]目的:ソフトウェア工学教育におけるAI統合の教育的アプローチ
- ソフトウェア工学分野では,AI技術の急速な進化に対応した教育が不可欠である。
- AI技術の教育的活用に関する体系的な研究が不足している。
- AIツールを用いた要件品質分析の教育効果を検証し,指導方法を提案する。
- 学生はAIツールを分析・評価の支援として選択的に使用した。
- 要件の価値明確性やテスト可能性といった具体的な側面での改善が認められた。
- 学生はAIに対する条件付き信頼と能動的な改善意欲を示し,要件品質基準への意識が高まった。
マルチチャネル・アップリフト方策学習 [cs.LG]目的:マルチチャネルにおけるアップリフト方策の学習
- ECプラットフォームのマーケティング予算配分は重要であり,収益最大化に直結する。
- 観察データには交絡が存在し,従来の予測・最適化手法では外挿が困難である。
- チャネル間の相互作用を考慮した,より正確な予算配分手法の確立を目指す。
- ReAllocは,短期的なログからバイアスフリーな局所勾配を抽出する高速な教師モデルと,長期的な視点での周辺場を学習する学生モデルを組み合わせる。
- シミュレーションおよびTaobaoプラットフォームでのA/Bテストの結果,ReAllocは収益と有料注文の両方を同時に増加させた。
- チャネル間の代替関係を考慮した保守的な意思決定が可能となり,安定した効果が期待できる。
再帰型グラフニューラルネットワークにおける過剰平滑化の防止:持続的なガウス摂動 [cs.LG, cs.AI, cs.IT, math.IT]目的:深層グラフニューラルネットワークにおける過剰平滑化現象の防止機構
- グラフ構造データに対する機械学習は,様々な分野で応用が広がっている重要な研究領域である。
- 深層グラフニューラルネットワークは,層を深くするとノード表現が均質化し,識別能力が低下する過剰平滑化問題に直面する。
- ガウスノイズの持続的な注入により,過剰平滑化を抑制し,表現の多様性を維持することを目指す。
- 各伝播ステップ後に独立なガウスノイズを注入する再帰型グラフニューラルネットワークを解析した結果,隠れ表現は幾何学的にエルゴードなマルコフ連鎖を形成することが示された。
- 理論的解析により,期待される定常ディリクレエネルギーに正の下限が導き出され,表現の崩壊を防ぐことが保証された。
- 数値実験は,理論的予測と一致し,ノイズ強度に対する限界ディリクレエネルギーの依存関係が確認された。
古典的な手法,新たなモデル:単純な画像変換が最新のAIベースコンテンツモデレーションを欺く方法 [cs.AI, cs.CR, cs.SE]目的:AIベースの画像コンテンツモデレーションシステムの脆弱性
- 有害コンテンツの拡散防止は重要であり,大規模なコンテンツモデレーションが求められる。
- 従来のコンテンツモデレーションは,ポリシーの網羅性と文脈理解に限界がある。
- 大規模基盤モデルを用いたモデレーションAPIの信頼性と安全性を評価する。
- 3つの商用画像モデレーションサービスは,勾配や代替モデルを必要としない単純な画像変換によって回避可能である。
- 色反転やグレースケール変換などの固定変換でも,人間には認識可能なコンテンツを維持しながら,安全でないと判断される場合がある。
- マルチモーダルコンテンツや自傷行為に関するコンテンツは,特に脆弱性が高いことが示された。
MADRSパイプライン:臨床試験におけるうつ病評価の支援 [cs.CL, cs.AI]目的:臨床試験におけるうつ病評価支援パイプライン
- うつ病は主要な精神疾患であり,正確な診断が重要である。
- 臨床試験における評価は標準化されたガイドラインに基づくものの,負担が大きい。
- 臨床試験におけるうつ病評価の効率化と質の向上を目指す。
- 開発したパイプラインは,音声インタビューをテキスト化し,MADRSの項目と照合する。
- 各項目の重症度を推定し,問題のある臨床評価を特定する。
- 専門家による評価との相関は0.867と高く,臨床試験における評価支援の有用性を示す。
臨床脳波データに対するプライバシー保護型連合学習のためのセキュアアグリゲーション [cs.CR, cs.DC, cs.LG]目的:臨床脳波データを用いたプライバシー保護型連合学習のためのフレームワーク
- 医療データの共有は重要だが,患者プライバシー保護が課題であるため,安全なデータ活用が求められている。
- 連合学習ではモデル更新時の情報漏えいリスクが存在し,高度なプライバシー保護技術が必要とされている。
- モデル更新時のプライバシー漏えいを防ぐセキュアアグリゲーション技術を臨床脳波データに適用し,安全な連合学習を実現する。
- 提案フレームワークは,グラフベース通信,閾値秘密分散,ドロップアウト耐性アグリゲーションなどを組み合わせ,高いプライバシー保護性能を示す。
- セキュアアグリゲーションは,モデル学習との両立が可能であり,半正直な環境下では低いオーバーヘッドで動作する。
- 悪意のある環境下でのセキュリティ強化や検証機構の導入は,計算コストや通信量の増加を伴うものの,データの一貫性や完全性を確保する。
多変量時系列データに対する反転型自己注意を用いた因果探索 [cs.CL, cs.LG]目的:多変量時系列データにおける因果関係の発見
- 時系列データ分析は,将来予測や意思決定において重要な役割を担う。
- 従来の因果探索手法は,複雑な相互作用や非線形性に対応しにくい。
- 複雑な時系列データにおける正確な因果構造の特定を目指す。
- 提案手法では,トランスフォーマーアーキテクチャ内に自己注意メカニズムを導入し,潜在的な因果関係の抽出を試みた。
- 反転型因果的自己注意メカニズム(CSAM)により,注意スコアの疎性を誘導し,重要な因果的相互作用に焦点を当てることができた。
- 線形および非線形データセットでの実験により,既存手法を上回る性能が確認された。
ワールドモデルに基づく具現化AIの安全性:脅威,防御,評価のライフサイクル [cs.CR, cs.AI]目的:具現化AIにおけるワールドモデルのセキュリティ
- 具現化AIは現実世界と相互作用するため,安全性確保は不可欠である。
- ワールドモデルは予測に基づくため,データの改ざんや攻撃に脆弱である。
- ワールドモデルのライフサイクル全体を考慮したセキュリティ評価を目指す。
- ワールドモデルのライフサイクル全体にわたる脅威を分類し,攻撃手法を明確化した。
- ワールドモデルが持つ安全性確保機能と,脆弱性による安全性の錯覚に焦点を当てた。
- データの出所,堅牢なグラウンディング,不確実性対応,実行ゲート,フィードバック監査といった防御策を提示した。
Qwen-UI-Agent技術報告:次世代の実世界中心型GUIエージェントへ [cs.AI, cs.CV]目的:実世界での利用を目指したGUIエージェントの構築
- デジタルデバイスの汎用的な操作実行者として,GUIエージェントの重要性が高まっている。
- 既存のエージェントは,実環境での信頼性や複雑なタスクの実行に課題がある。
- 多様な環境に対応し,自律的に能力を向上させるGUIエージェントの実現を目指す。
- Qwen-UI-Agentは,モバイル,コンピュータ,Web環境で高い性能を示す。
- モバイル環境では,MobileWorldで82.1%,MobileWorld-Realで92.2%の成功率を達成した。
- Opus 4.8,Gemini 3.1 Pro,GPT-5.6 Solを含む最先端モデルと比較しても遜色ない性能を発揮する。
EMBL AI ライブラリアン:AIエージェントのためのライフサイエンス知識レイヤー [cs.CL, cs.AI, cs.IR, cs.LG]目的:AIエージェント向けのライフサイエンス分野の知識獲得システム
- AI技術の進展により,ライフサイエンス研究における情報探索の自動化が不可欠となっている。
- 既存の文献検索リソースはAIエージェント向けに設計されておらず,効率的な情報抽出が困難である。
- 自然言語での質問に対し,必要な証拠を直接提供する知識レイヤーを構築し,AIエージェントの性能向上を目指す。
- EMBL AI Librarianは,Europe PMCのインターフェースをAIエージェント向けに改良した知識レイヤーである。
- ScholarQABenchにおいて,既存のベースラインと比較してCitation F1スコアを16ポイント以上向上させた。
- クレーム検証やLitQA2ベンチマークにおいて,専門家との合意率向上,GPT-5.4のスコア改善などが確認された。
CDAE:事前学習済み言語モデルにおける摂動に対するロバスト性の向上 [cs.AI, cs.CL]目的:事前学習済み言語モデルの埋め込み表現の摂動不変性の学習
- 文表現学習は自然言語処理の根幹であり,モデルの性能に直結する。
- 既存の埋め込み表現は,同義語置換などの軽微な摂動に弱く,頑健性に課題がある。
- 摂動の影響を受けにくい,より安定した文表現の学習を目指す。
- CDAEは,BERT埋め込み表現を対照学習と再構成目的を同時に最適化することで改良する。
- 複数の摂動戦略を用いた評価の結果,CDAEは摂動下でより高い埋め込み表現の類似性を維持した。
- CDAEは表現の安定性を向上させつつ意味情報を保持し,摂動不変学習の有効性を示唆する。
AIとイスラーム研究における信頼性:クルアーン,ハディース,フィクフ知識における生成AIの信頼性,幻覚,情報源の忠実性に関する批判的評価 [cs.AI]目的:生成AIシステムの信頼性に関する実証的評価
- イスラーム研究は,世界中のムスリムにとって不可欠な知識体系であり,信仰と実践の基盤となる。
- 生成AIが普及する中,イスラーム分野におけるその情報の信頼性と正確性に疑問が生じている。
- 生成AIが提供する情報の信頼性を検証し,適切な利用方法を提示することを目的とする。
- 現在の生成AIシステムは,入門的なイスラーム学習の補助ツールとしては有用である。
- しかし,宗教的な判断や研究においては,信頼できる一次情報源や専門家による検証が不可欠である。
- 本研究は,イスラーム知識におけるAIの信頼性に関する初の包括的な実証的評価を提供する。
エージェント型メタバースサービス:新たなAs-a-Serviceパラダイム [cs.SE, cs.AI, cs.MA]目的:エージェント型メタバースサービスとMeta-AaaSの形態,特性,原理の提示
- メタバースは,人々の生活,仕事,創作,娯楽を支える仮想生態系であり,重要性が増している。
- 従来のメタバースサービスは,多様なニーズへの対応や高度な自律性に課題があった。
- 生成AIを活用したエージェント型サービスをメタバースに導入し,新たなサービスパラダイムを確立すること。
- 生成AIの進化により,自律学習,マルチモーダル対話,コンテンツ生成能力を備えたエージェントが登場した。
- これらのエージェント能力をカプセル化し,メタバース上で提供するAgent-as-a-Service(AaaS)が,新たなサービス形態として注目されている。
- エージェント型メタバースサービス(AMServ)は,メタバースビジネス処理を促進し,AI時代のサービス産業の発展に貢献すると期待される。
自己生成:オンラインアンカー投射メモリとAction-3D RoPEを用いた自己中心的視点での世界-行動モデリング [cs.CV, cs.AI]目的:自己中心的視点の世界-行動シミュレーションによる,限られた実世界の訓練データ拡張
- 具現化されたAIにとって,自己中心的視点ビデオは豊富な操作経験を提供する重要な学習データである。
- 様々なシーン,物体,動作,具現化に対応した自己中心的視点データの収集には高コストがかかるという課題がある。
- 本研究は,実世界のデータ不足を補い,ロボットの汎化性能を向上させることを目指している。
- 提案手法は,事前学習済みのビデオ生成モデルを基盤とし,幾何学的な情報を考慮した2つの条件付け機構を導入している。
- オンラインアンカー投射メモリ(OAPM)は,初期フレームの3Dシーンアンカーを保持しつつ,自己回帰的な生成中に最新の状態を定期的に更新する。
- 実データ400件に合成データ400件を加えることで,シングルアームタスクの成功率が77%から84%,デュアルアームタスクでは53%から70%に向上した。
運用誘導型配置認識学習による産業用オンライン3Dビンパッキング [eess.SY, cs.SY, cs.RO, cs.AI]目的:産業用オンライン3Dビンパッキングにおける配置方法の改善
- 物流や産業用パレット積みにおいて,効率的な空間利用はコスト削減と生産性向上に不可欠である。
- 既存手法では,配置候補の生成や表現が形状に基づいているため,安定性や重心の偏りといった運用上の課題に対応しきれない。
- 運用知識を組み込み,配置候補の生成とランキングを学習することで,より実用的なパッキングを可能とする。
- 提案手法OPALは,BED-BPPベンチマークにおいて,空間利用率0.49を達成した。
- 運用誘導型配置候補生成により,15.1%の改善が見られた。
- 学習されたランキングにより,さらに6.3%の改善を達成し,高速な推論も実現した。
TopoFormer:グラフ学習におけるトポロジーとアテンションの融合 [cs.LG, math.AT]目的:グラフ表現学習のためのトポロジー構造をアテンション機構に適合した系列として符号化する軽量かつスケーラブルなフレームワーク
- グラフ構造データは様々な分野で現れ,その解析は重要である。従来の機械学習では構造情報を扱うのが困難であった。
- グラフニューラルネットワーク(GNN)は有効だが,計算コストが高い場合や,トポロジー情報の活用が十分でない場合がある。
- グラフのトポロジー構造を効率的に捉え,GNNの性能向上と計算効率化を目指す。
- 提案手法TopoFormerは,グラフのトポロジー構造を安定的に符号化し,並列処理を可能にするTopo-Scanモジュールを導入した。
- グラフ分類や分子特性予測のベンチマークにおいて,既存のGNNやトポロジーベースの手法を上回る性能を達成した。
- TopoFormerは,計算予測可能性と効率性に優れ,グラフ表現学習における新たなアプローチの可能性を示唆している。
制約モデル再構成のためのLLM誘導進化探索:ソルバー効率の向上 [cs.CL, cs.AI]目的:制約モデルの再構成によるソルバー効率の向上
- 組合せ最適化問題は産業界で広く現れるため,効率的な解法が求められている。
- 制約モデルの性能はモデルの記述方法に大きく依存し,最適なモデルを見つけるのは困難である。
- LLMを活用し,性能向上を目的とした制約モデルの自動再構成を目指す。
- LLMによる反復的な再構成により,保持されていない問題に対する大幅な高速化が実現された。
- 文脈の多様性を維持する戦略は,最近の試行や最速の試行のみを保持する戦略よりも優れた性能を示した。
- 検証に基づく最終モデル選択は,全ての戦略の保持されていない問題に対する高速化を改善した。
Theia:大規模多Modalキャプション生成とIncidents1Mデータセットのデータフリー知識蒸留のための自動検証 [cs.CV, cs.AI, cs.MM]目的:災害応答のための大規模多Modalデータセットの構築と自動検証
- 災害管理のような重要分野では,高品質な多Modalデータセットが不可欠である。知識蒸留による知識転移に特に重要。
- 既存のデータセットは,説明テキストがないか,テキストと画像の意味が一致していないという問題がある。
- データフリー知識蒸留のための信頼性の高い多Modalデータセットを自動的に構築・検証することを目指す。
- Qwen3.5の異なるモデル(4B denseモデルと35B MoEモデル)を用いて,Incidents1Mから10万枚の画像を復元し,高品質なテキスト記述を生成した。
- 画像からLLMを隠蔽するimage-blind LLM-as-a-Judge検証パイプラインを導入し,データフリー知識蒸留におけるモダリティギャップをシミュレーションした。
- 2つのアーキテクチャ間の高い意味的合意(78.65/100)と,高いPrecision(77.6%)と低いRecall(46.0%)が確認された。
レガシーコード移行の決定論的検証のためのエージェント手法 [eess.SY, cs.SY, cs.SE, cs.AI]目的:レガシーCOBOLプログラムからJavaへの移行における機能の正確性保証
- レガシーシステムは企業にとって重要な資産であり,現代的な環境への移行は不可欠である。
- 移行後のテストには十分なテストデータや全てのコーナーケースの検証が困難な場合がある。
- エージェントによるテスト合成手法を用いて,網羅的な検証と正確性の保証を目指す。
- 提案手法「Locksmith Loop」は,COBOLとJavaの実行環境をそれぞれ計装し,入力モックを用いた探索によりプログラム分岐を深く網羅する。
- 3つのCOBOL-Javaケーススタディにおいて,既存のテスト手法が停滞した状況下でも,カバレッジが向上し,特にオープンソースプログラムではほぼ完全なカバレッジを達成した。
- 生成されたJavaコードは,決定論的パリティチェックにおいてCOBOL参照と同等の結果を示し,エージェントによるコーディング出力の検証手法の有効性を実証した。
MemHarness:記憶は再演されるのではなく,再構築される [cs.AI]目的:大規模言語モデルエージェントの能力向上における過去の経験の活用
- LLMエージェントにおいて,過去の経験は重要な強化戦略として注目されている。
- 既存手法は記憶を静的な記録として扱うため,状況との適合性が低い場合がある。
- 現在の文脈に基づき,過去の経験を積極的に再構築するフレームワークを提案する。
- MemHarnessは,現在の状態に応じて過去の経験を批判的に評価し,再構築することで,文脈に即したガイダンスを生成する。
- ALFWorldおよびWebShopにおける実験により,MemHarnessは純粋な強化学習や静的な記憶拡張ベースラインを大幅に上回る性能を示す。
- 再構築の目的は,負の転移を防ぐだけでなく,エージェントの潜在的な推論能力を向上させる。
現代ギリシャ語の生産的な屈折能力の評価基準:MORFES [cs.FL, cs.CL, cs.LG]目的:現代ギリシャ語の屈折形態の認識と生成能力の評価
- 形態素論は言語理解の基礎であり,自然言語処理の性能向上に不可欠である。
- 既存の言語モデル評価は事実知識に偏っており,屈折言語の文法能力は十分に評価されていない。
- 現代ギリシャ語における屈折能力を正確に測定する評価基準を確立し,言語モデルの改善に貢献する。
- MORFESは,専門家によって検証された500項目から構成され,ギリシャ語の屈折形態の認識と生成を評価する。
- 低頻度な語彙を重視することで,正答が単なる記憶ではなく,規則に基づくものであることを保証する。
- Sophea-Genesis-1は,MORFESにおいて屈折形態論で高い性能を示し,同時に一般的な能力も維持している。
大規模言語モデルの信頼性のある自動評価の拡張性に関する研究 [cs.CL, cs.LG]目的:大規模言語モデルのテキスト出力の品質評価手法
- 自然言語処理の発展に伴い,大規模言語モデルの活用が広がっているため。
- 既存の自動評価指標は,LLM生成テキストの複雑さを捉えきれていない。
- LLM出力の評価において,専門家による介入を減らし,効率化を目指す。
- 複数のLLMによるペアワイズ比較とEloレーティングシステムを用いることで,安定したランキングを生成。
- 合意閾値の調整により,評価の信頼性と網羅性を柔軟に制御可能。
- 科学論文のアブストラクトからの能力プロファイルの評価で有効性が示され,専門家の判断と高い相関が確認された。
タイコ:プログラムによるワールドモデルを用いた能動的抽象化(ARC-AGI-3) [cs.AI, cs.CV, cs.SC]目的:ゲームのルール,隠れた状態,目標を推論しつつ,行動効率を維持する能力の獲得
- 汎用人工知能(AGI)の実現には,未知の環境に適応し,効率的に学習する能力が不可欠である。
- 既存の手法では,複雑なゲーム環境において,効率的なルール抽出と目標達成が困難である。
- インタラクティブな環境で,テスト可能なモデルを生成し,その利用価値を判断する手法を確立する。
- タイコは,ゲーム固有のモデルを構築・利用することで,行動効率を高めることを可能にした。
- 特にGPT-5.6 SolとOpus 5は,100.00のRHAEを達成し,全てのレベルをクリアした。
- Opus 5は,従来の人間ベースラインと比較して,61%少ない行動回数でゲームを完了した。
キャッシュUK:金融における逐次更新された量子化LLMのための安定性重視のメモリエディタ [cs.DC, cs.CL, cs.AI, cs.CE, cs.LG]目的:金融分野における量子化LLMの逐次更新時の知識劣化軽減
- 金融市場は常に変化するため,LLMの事実精度維持が不可欠である。
- 量子化により効率化される一方,逐次メモリエディタの性能劣化が課題である。
- 安定性重視のエディタにより,知識劣化を抑制し,事実精度を維持する。
- CACHE-UKは,金融に特化した量子化LLMの安定性を高めるフレームワークである。
- 4-bit量子化されたOpenLLaMA-3Bモデルで,知識劣化を11-17%削減することに成功した。
- テスト成功率は28%と,既存手法を6%上回る高い汎化性能を示した。
RGB-Dカメラを用いた埋め込みデバイスにおけるアフォードンスセグメンテーションのパレート最適解探索 [cs.CV, cs.LG, cs.RO]目的:埋め込みデバイスにおけるアフォードンスセグメンテーションのためのパレート最適解の探索
- ウェアラブルロボットの実現には,環境との相互作用を理解するアフォードンスセグメンテーションが不可欠である。
- 従来の小型ネットワークは,ハードウェア制約が厳しいため,実用的な性能を発揮できない場合がある。
- ハードウェアアクセラレータを活用し,性能とハードウェア要件のバランスを取る手法を確立することを目指す。
- 提案手法は,RGB-D情報を統合した小規模な深層ネットワークを生成し,既存手法と比較して有効性が確認された。
- 生成された解は,汎化性能とハードウェア要件のバランスが取れたパレート最適解を特定する傾向にある。
- Jetson NanoとRealSense RGB-Dカメラを用いたプロトタイプシステムは,標準的なバッテリーでリアルタイム性能を達成した。
MonoVoc:軽量単眼オープンボキャブラリー3Dガウスにおける幾何学と意味の分離 [cs.CV, cs.AI]目的:単眼動画からのコンパクトで解釈可能かつ検索可能なオブジェクトレベルのセマンティックガウスマップの出力
- 次世代のインタラクティブシステムにおいて,自然言語による3Dシーンの理解は不可欠である。
- 既存の3Dガウスフレームワークは,多視点キャプチャ要件や高コストな最適化,大規模なメモリ消費が課題である。
- 幾何学と意味を分離することで,メモリ効率の良いオープンボキャブラリー3Dシーン理解を実現する。
- 本手法は,従来の最先端手法と比較してメモリ使用量を大幅に削減する。
- Replicaデータセットにおける評価で,レンダリング忠実度とセグメンテーション精度が良好に維持された。
- 日常的な単眼動画からの3D検索と質問応答を効率的,かつスケーラブルに実現する。
HARGO:LLMのHPCタスクに対する報酬誘導最適化における異質性への対応 [cs.LG]目的:LLMのHPCタスクにおける性能向上のための異質性に対応した報酬誘導最適化手法
- 高性能計算(HPC)分野では,LLMの活用がデータ競合検出やベンチマーク問題解答などに期待される。
- LLMは知識獲得できるが,タスクに応じた適切な挙動を示すとは限らない。特にHPCタスクは多様性に富む。
- 本研究は,HPCタスクの異質性を考慮し,より効果的なLLMの報酬誘導最適化を目指す。
- HARGOは,WinRate,Data Race F1,PLP Similarityの3つの主要評価指標において,最高の性能を達成した。
- HARGOは,グループレベルの報酬コントラストと参照モデルの対数確率から重要度重み付けを行うことで,異質性のあるHPCタスクへの適応性を高めた。
- HARGOは,従来のRL手法と比較して,より高い全体的なアライメント品質を実現した。
分子グラフに対するアンサンブル合意による半教師あり学習 [cs.LG]目的:分子の半教師あり学習手法の開発
- 分子科学分野では,機械学習による物性予測や新物質探索が活発である。
- ラベル付きデータの取得コストが高く,ラベルなしデータは豊富であるという課題がある。
- 分子データに適した半教師あり学習手法を確立し,予測精度向上を目指す。
- アンサンブル合意に基づく半教師あり学習が,多様な分子データセットで予測精度を向上させることを示した。
- アンサンブル合意による学習は,モデルの頑健性を高め,知識蒸留と同様の効果をもたらす。
- 本手法による半教師あり学習は,モデルのキャリブレーション誤差を低減する。
テキスト要件からマイクロサービスアーキテクチャへ - LLMベースの設計合成に関する包括的評価 [cs.SE, cs.AI]目的:LLMによるテキスト要件からのマイクロサービスアーキテクチャの合成可能性の評価
- モノリスシステムを現代化する上で,マイクロサービスアーキテクチャが重要視されている。
- 適切なサービスを特定することが難しく,手動による作業が中心である。
- 自然言語による要件から,完全なマイクロサービスアーキテクチャを生成することを目指す。
- Few-shotプロンプティングにおいて,サービス識別のF1スコアが向上した(ZS: 0.79,FS: 0.97)。
- Few-shotプロンプティングは,サービス間通信の復元精度も向上させ,F1スコアを0.61から0.82に改善した。
- 専門家による評価では,Few-shotプロンプティングによるアーキテクチャは,モジュール性,一貫性,妥当性が高いと判断された。
幾何学的相補性を超えて:スパースMoEルーティングにおけるコヒーレントな重複 [cs.LG]目的:スパースMoEルーティングにおける専門家間の表現の重複と貢献
- 大規模言語モデルの性能向上にMoEが貢献しており,そのメカニズム解明が重要である。
- MoEのルーティングにおける専門家の選択原理と表現の役割が明確に理解されていない。
- ルーティングにおける専門家の重複と,それがモデルの機能に与える影響を明らかにすること。
- MoEモデルにおいて,選択された専門家の表現空間は大きく重複していることが示された。
- ルーティングによって選択された専門家は,トークン表現をより良く説明する。
- 専門家選択は,共有する幾何学的近傍からトークンに関連する専門家を選択しており,冗長性を示唆しない。
完全帰納的カーディナリティ推定 [cs.DB, cs.LG]目的:知識グラフにおけるBasic Graph Pattern (BGP) SPARQLクエリのカーディナリティ推定
- 知識グラフの効率的なクエリ処理には正確なカーディナリティ推定が不可欠である。
- 既存の学習型推定器はグラフ構造の変化に弱く,再学習が必要となる場合がある。
- 未知のグラフに対しても再学習なしでカーディナリティを推定する手法を開発する。
- FICEは,グラフニューラルネットワークを用いて,学習済みの推定器では困難であった,未知のグラフに対するカーディナリティ推定を実現した。
- FICEはエンコーダGNNとデコーダGNNの組み合わせにより,効率的なカーディナリティ推定と低遅延化を実現している。
- 10個の知識グラフを用いた実験で,FICEは既存手法と比較して,カーディナリティ推定の精度を大幅に向上させた。
ObjectStream: ストリーミング動画理解のための潜在的オブジェクトをメモリアンカーとして [cs.CV, cs.AI]目的:ストリーミング動画理解におけるメモリ管理の枠組み
- 動画理解は,AI技術の発展とともに,様々な応用分野で重要性が増している。
- 従来の動画理解モデルは,文脈を効率的に保持できず,長時間の動画処理が課題であった。
- 潜在的オブジェクトをメモリアンカーとして利用し,動画文脈の保持効率と理解精度を向上させる。
- ObjectStreamは,既存のVideo-LLM表現から潜在的オブジェクトを抽出し,フレーム間でリンクすることで,持続的なメモリアンカーを構築する。
- オンラインストリーミング評価において,OVO-Bench Real-Time Visual Perceptionのスコアを10.0ポイント向上させ,GPUメモリ消費量とTTFTを約50%削減した。
- オフラインの長動画ベンチマークにおいても,大幅なトークン削減を達成しながら,ベースラインを上回る性能を示した。
単一の人間,Nエージェント:誤校正された相関のある信頼性下におけるLLMエージェント群の監査予算配分 [cs.AI]目的:LLMエージェント群の監査予算配分戦略
- 大規模言語モデル(LLM)の利用拡大に伴い,その信頼性検証が不可欠となっている。
- LLMの自己報告する信頼度の精度が低い場合,効率的な監査が困難である。
- 信頼度の誤校正と相関誤差の影響を考慮した,最適な監査予算配分手法を確立する。
- 予算が減少すると,信頼度に基づいた監査の効果が低下し,ランダム監査よりも劣る閾値δ*が存在する。
- LLM間の相関関係は,系列の相違よりも共通の困難さによって強く影響を受けることが示唆された。
- 多くのオープンウェイトLLMは信頼度の点で実用性が低い一方,特定のプロプライエタリモデルは有用な情報を提供した。
PathView-Bench:マルチモーダル大規模言語モデルは病理画像の微細かつ多段階的な理解を達成できるか [cs.AI]目的:病理画像の微細かつ多段階的な視覚的理解度評価
- 病理診断支援は医療の質向上に不可欠であり,AIによる自動化が期待される。
- 既存のベンチマークは最終診断の精度に偏っており,モデルの視覚理解能力を詳細に評価できない。
- 病理画像の多段階的な視覚情報を理解する能力を定量的に評価する基準を確立すること。
- PathVUは,病理画像の局所領域(Region FOV)と全スライド視野(Slide FOV)の2つの視野で,モデルの視覚理解を評価する。
- 18種類のMLLMを評価した結果,高度なモデルであっても微細な視覚タスクに課題があることが示された。
- PathVUは,多段階的な視覚理解能力を持つ病理画像MLLMの開発と評価のための再現性のある基盤を提供する。
公平性プルーニング:GLU-MLP層における微分活性化を通じた人口統計学的バイアスの特定 [cs.CL, cs.CY, cs.LG]目的:大規模言語モデルにおける人口統計学的バイアスの管理と軽減
- 大規模言語モデルの社会実装が進む中で,バイアスの存在が倫理的・社会的な問題を引き起こす可能性が懸念されている。
- 既存手法では,バイアスの原因となる特定のニューロンの特定が困難であり,効果的なバイアス軽減策の確立が課題となっている。
- バイアスに関与するニューロンを特定し,モデル性能を維持しつつバイアスを軽減するための手法を開発することを目指す。
- 提案手法である公平性プルーニングは,GLU-MLP層における微分活性化を分析することで,人口統計学的属性に反応するニューロンを特定できる。
- 特定されたニューロンをゼロ化することで,モデルの応答が変化し,バイアスが不安定化することが確認された。しかし,単純なバイアス軽減ではなく,双方向のバイアス変動を引き起こす。
- わずかなニューロン数(0.031%未満)のゼロ化で高い推論能力を維持できることから,バイアス処理とモデル能力は分離された回路で動作することが示唆された。
次元削減散布図の空領域における歪みをギャップ指標で測定 [cs.LG]目的:高次元データの視覚的分析のための次元削減投影の品質評価
- 高次元データの可視化において,次元削減は重要な手法であり,その品質評価は不可欠である。
- 既存の品質指標は点間の直接的な関係に焦点を当てており,空領域の歪みを捉えられていない。
- 空領域の歪みを定量化し,視覚的に影響の大きい構造変形を検出することを目指す。
- ギャップ指標(GI)は,空間を空の三角形に分割し,高次元空間との変形を比較することで歪みを測定する。
- GIは,従来の品質指標とは異なり,視覚的な影響が大きい微小な構造変形に感度を持つことが示された。
- 計算速度が速く,解釈が容易であり,歪みのパターンを視覚化することも可能である。
真実を知らずに正直さに支払い:LLMマーケットプレイスエージェントのための評判ペナルティ設計 [cs.AI]目的:LLMマーケットプレイスにおけるエージェントの虚偽記述抑制機構の設計
- LLMエージェントが自律的に取引を行う市場が拡大しており,その信頼性確保が重要である。
- LLMエージェントは競争の中で虚偽の属性を記述しやすく,正直さを保つことが困難である。
- 真実の情報を得るのが困難な状況下で,効果的な評判ペナルティメカニズムを構築し,消費者を保護すること。
- CARPという評判ペナルティメカニズムは,ノイズに強く,戦略的な操作に耐性があることが示された。
- CARPは,低評価の虚偽記述を行うエージェントの販売量を抑制し,正直な販売者を保護する効果がある。
- SPARCと組み合わせることで,真実の情報へのアクセスなしに,理想的な情報を持つ場合の消費者の利益にほぼ匹敵する結果が得られた。
知覚できない誤りを修正する:マルチモーダル推論器における知覚蒸留のための信用割り当て [cs.CY, cs.AI]目的:マルチモーダル推論器における知覚蒸留のための信用割り当て手法
- マルチモーダル推論は,多様な情報を統合し高度な推論を可能にするため,AI研究において重要性が増している。
- 既存のオンポリシー蒸留では,推論の失敗原因が知覚段階か推論段階か特定が難しく,改善の方向性が不明確である。
- 知覚段階の誤りを特定し,修正することで,マルチモーダル推論器の性能向上を目指す。
- 提案手法PCDは,教師と生徒の意見の不一致と下流の失敗を組み合わせることで,修正可能な知覚の失敗を特定する。
- PCDは,知覚と推論を分離したロールアウトと平均保存重みを用いることで,推論目的を変化させずに知覚段階の改善を実現する。
- 8つのベンチマークにおいて,PCDは既存手法と比較して,8B 2Bおよび32B 8Bの性能をそれぞれ向上させた。
メタデータを用いた分散的EMによる暗号化適合型クラスタリング連邦学習 [cs.LG, cs.CR, cs.DC, stat.ML]目的:クラスタリング連邦学習におけるプライバシー保護,通信コスト,計算効率のトレードオフの解消
- データプライバシー保護の重要性が増す中,分散環境での機械学習の需要が高まっている。
- 既存のクラスタリング連邦学習は,プライバシー,通信,計算効率のバランスを取るのが難しい。
- 暗号化と両立可能なメタデータ利用による効率的なクラスタリング手法を提案する。
- FLAMECHEは,メタデータを用いたクラスタリング連邦学習を分散的EM手続きとして再構築した。
- サーバー側の更新を付加演算に制限することで,既存のセキュア連邦学習方式との互換性を確保した。
- 様々なデータセットでの実験により,FLAMECHEがクライアントモデルの有効性を向上させることが示された。
Teffic-Audio:真偽の識別 [cs.CL, cs.SI, cs.SD, cs.AI]目的:音声ディープフェイクの検出
- 音声技術の進歩に伴い,悪意ある音声改ざんが容易になり,社会的信用を損なうリスクが高まっている。
- 既存のディープフェイク検出システムは,様々な改ざん手法や環境条件の変化に弱く,汎化性能が課題である。
- 多様な条件でロバストな性能を発揮し,実用的なディープフェイク検出を実現すること。
- Teffic-Audioは,Conformerベースのエンコーダ,多頭注意機構による統計的プーリング,そして二値分類器というシンプルな構造を採用している。
- 多源データ,攻撃・ソースバランスサンプリング,多様なオーディオ拡張といった学習レシピにより,汎化性能を向上させている。
- オープンソースデータのみで学習し,Speech-DF-Arenaの14のテストセットで1.454%のEERを達成し,リーダーボードで現時点で公開されているシステム中最優位な性能を示した。
ShadowDancer:動画とその影から統一的なダイナミクス表現を学習し,あらゆるアクションをビデオ世界モデルに教える [eess.SY, cs.SY, cs.CC, cs.CL, cs.CV, cs.AI, cs.LG]目的:インタラクティブなビデオ世界モデルにおけるあらゆるアクションのフレームレベル制御
- ビデオ世界モデルは,現実世界の複雑な動きを再現可能にするため,ロボット工学やシミュレーションなど多くの分野で重要である。
- 既存の手法では,アクションを正確に表現することが難しく,多様なダイナミクスに対応した精密な制御が困難である。
- 実演動画から学習することで,アクションの汎化性能を高め,新しい環境下でも再現可能にすることを目指す。
- ShadowDancerは,同じダイナミクスを異なる外観で再現する「影ペア」を大規模に構築することで,アクションの制御性を高める。
- 「影ペア」間の予測を行うことで,外観の違いを排除し,ダイナミクスの本質的な表現を獲得する。
- 実験の結果,既存の手法と比較して,アクションの転移性能と長期的なアクションの再現性が大幅に向上した(平均86%の勝率)。
ベンチマークがコンピュータ利用エージェントの性能を誤って評価する理由 [cs.AI]目的:コンピュータ利用エージェントのベンチマーク評価における信頼性問題の特定と改善
- コンピュータ利用エージェントは,Webブラウジングやソフトウェア操作において重要な役割を担う。
- 既存のベンチマークは,脆弱な評価方法を用い,エージェントの真の性能を正確に反映していない場合がある。
- ベンチマーク評価の各段階における問題点を明らかにし,より信頼性の高い評価方法を確立することを目指す。
- 150件の失敗事例を調査した結果,15.3%の評価が誤りであり,評価者の誤検出や課題の欠陥が原因であることが判明した。
- 真の失敗事例では,検証・フィードバックや計画立案の失敗が,実行・接地におけるエラーよりも支配的であることが示された。
- これらの結果に基づき,長期的視点でのエージェント評価のための段階的な設計ルールを導き出した。
