LLM/NLP最新論文

永続環境を自己進化させるレッドチーミング基盤OpenARTが181 upvotesで首位。論文執筆を合成可能スキルとして統合するSpark-to-Paper、テスト時のハーネス経由で能力を移すAI4AI、スキルライブラリの圧縮、文脈圧縮でセッション制約が消える問題まで、エージェントの「安全性」と「スキルの資産化」が並走した一日となった。

注目度

注目論文

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

著者: Yunhao Chen, Xin Wang, Yixu Wang et al.

AIエージェントは永続的な環境で動作し、初期の状態変化が遠い将来の意思決定にまで影響を及ぼす(181 upvotes)。通常の言語モデルとの対話と異なり、エージェントの振る舞いは長期ホライズンのワークフローを通じて繰り返し書き換えられ再利用される共有状態を媒介として現れる。現在の安全性評価はこの構造を十分に捉えていない。

新規性: レッドチーミングの対象を「モデルへの入力」から「エージェントが住む環境そのもの」へ移した点が中核である。手作業で用意した固定シナリオでは長期ホライズンの状態汚染を網羅できないという診断に基づき、環境側を開放端的に進化させることで攻撃面のスケーリングを図る。

手法: 開放端の環境進化によってエージェント・レッドチーミングを大規模化する枠組みを構成し、永続的な共有状態を通じた長期の危険挙動を体系的に露出させる。

Hugging Face Daily Papers

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

著者: Zhuoyang Qian, Biao Wu, Yiran Wang et al.

研究の着想を完成した論文へ変えるには、テキスト生成以上のものが要る(176 upvotes)。文献を検索し、実験を設計・実行し、証拠に応じて主張を修正し、出版水準の図表を作り、長い生成過程を通して一貫性を保つ必要がある。

新規性: これらの工程を一枚岩のパイプラインではなく「合成可能なスキル」として定式化した点が貢献である。同日のSkillZip勢と同じく、エージェントの能力をスキル単位で持ち回る設計思想に立っており、研究自動化を個別システムではなく再利用可能な部品の組み合わせとして扱う。

手法: 文献検索、実験の設計と実行、証拠に基づく主張の改訂、図表生成、長期一貫性の維持を統合したエンドツーエンドの論文生成システムを提示する。

Hugging Face Daily Papers

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses

著者: Cheng Qian, Wenting Zhao, Liangwei Yang et al.

蒸留に関する近年の研究は、教師強制やオンポリシー蒸留といった訓練時の手法によって、小さいモデルのパラメータを更新することで大きいモデルの能力を移してきた(96 upvotes)。本研究はこの移転がテスト時に起こりうるかを問う。

新規性: 能力移転をパラメータ更新から切り離し、モデルを取り巻くハーネス(実行環境・文脈・インターフェース)の側に置いた点が中核である。同日のSHAPERが身体化エージェントで「モデルを凍結したままスキルとハーネスを進化させる」と主張しているのと軌を一にしており、能力の所在をモデル重みの外へ広げる潮流が複数の分野で同時に立ち上がっている。

手法: 強モデルから弱モデルへの能力移転をテスト時のハーネス経由で実現する方式を検討し、訓練時蒸留の代替となりうるかを評価する。

Hugging Face Daily Papers

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

著者: Mengru Wang, Junfeng Fang, Shuofei Qiao et al.

AIモデルは多様な領域で顕著な成功を収めてきたが、その能力の基盤にある機構も、もたらしうるリスクも十分には理解されていない(73 upvotes)。AI開発が高速化・自動化するなかで、機構の探索だけは依然としてほぼ手作業のままであり、両者の差は広がり続けている。

新規性: 解釈可能性研究そのものをAIに担わせるという役割反転が中核である。19名の大規模な共同研究であり、機構解釈をモデルの付随的な検査ではなく、独立した科学装置(scientific instrument)として位置づけ直そうとする。開発速度と理解速度の乖離という診断は、安全性研究の構造的なボトルネックを名指ししている。

手法: 知能の機構発見を自動化するための科学装置としてAIを用いる枠組みを提案し、手作業に留まっていた機構探索の規模を引き上げる。

Hugging Face Daily Papers

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

著者: Xingyu Tan, Xiaoyang Wang, Qing Liu et al.

LLMはますますエージェントとして振る舞い、その手続き的知識は再利用可能なスキルパッケージに格納され推論時に読み込まれる(72 upvotes)。スキルライブラリが成長するにつれ、限られた文脈予算のもとで「最小十分な実行可能コンテキスト」だけを露出させることが中心的な課題となる。

新規性: スキルの圧縮を、単なる要約ではなく契約(contract)の保存という制約付きグラフ圧縮として定式化した点が中核である。スキルが呼び出し側と結ぶ入出力の約束を壊さずに冗長構造だけを畳む、という定式化により、圧縮の正しさを検証可能な性質として扱える。

手法: 契約保存グラフ圧縮によりスキルライブラリを縮約し、文脈予算の制約下で必要十分な実行可能コンテキストのみを提示する。

Hugging Face Daily Papers

なお同日、同名の別研究「SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure」(Xiaofan Bai et al., 12 upvotes)も投稿されている。こちらは自己進化エージェントが成功手順と失敗修正を追記し続けた結果、同じ要件が複数の分岐・例・警告に散らばり共通の行動系列が再利用されずコピーされる問題を扱い、評価を必要とせず再利用可能な構造を発見して圧縮する。二つの独立したグループが同じ名前で同じ問題に到達したこと自体が、スキルライブラリの肥大化が実務的な痛点になっていることを示している。

Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution

著者: Changzhi Liu, Yilun Liu, Sikuan Yan, Volker Tresp, Yunpu Ma

自身のソースコードを反復的に書き換える自己改善型コーディングエージェントは、コーディングタスクで印象的な性能を示してきた(26 upvotes)。しかし既存手法は一度に単一の失敗軌跡から自己改変を導出しており、エージェントが持つ豊富な比較信号を見過ごしている。

新規性: 失敗の絶対値ではなく軌跡間の差分から学ぶという転換が中核である。名前が示す通り、Gödel Machine系の自己改善にメンデル的な比較・選抜の発想を持ち込み、複数の実行結果を突き合わせることで「何が効いたか」を分離する。

手法: 複数軌跡の比較信号に基づいて自己改変を生成する再帰的自己改善の枠組みを構成する。

arXiv

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

著者: Yingpeng Ma, Jianhao Yan, Bei Shi et al.

LLMの急速な進展は、開放端かつ流動的な対話型ストーリーテリングを可能にすることでゲームAIを変えつつある(25 upvotes)。しかし既存研究は、長期ホライズンにおける論理的一貫性と物語の整合性を維持するという中核的な課題をほとんど扱ってこなかった。

新規性: 一貫性の破綻を、ユーザからの逸脱入力に対する耐性という形で測定可能にした点が貢献である。単発の生成品質ではなく、長い相互作用のなかで設定を保ち続けられるかを問う設計であり、同日のVibeLifeBenchと同じ「持続性」の評価軸に属する。

手法: 対話型ナラティブにおける長期ホライズンの論理一貫性と物語整合性を測るベンチマークを構成する。

arXiv

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

著者: Xiaohongshu Inc

LLMエージェントは個人アシスタントとして配備が進むが、既存の評価はほとんどが静的環境における短く自己完結した要求を用いている(16 upvotes)。日常生活の支援はそれとは異なる。タスクは数分ではなく数週間にわたって走り、エージェントが動いている間も世界は変化し続ける。

新規性: 評価の時間スケールを週単位へ引き伸ばし、かつ「能動性(proactive)」を明示的な評価対象に据えた点が中核である。要求に応答する能力ではなく、要求されていない状況変化に自ら気づいて動けるかを問う。エージェント評価が短期タスク成功率から長期の持続的振る舞いへ移りつつある流れの、生活支援側での具体化である。

手法: 変化し続ける世界を模した環境で、生活支援エージェントの能動性と持続性を長期にわたり評価するベンチマークを構成する。

Hugging Face Daily Papers

Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction

著者: Zhiqi Wang, Yichi Zhang, Dongwon Lee, Yuchen Yang

文脈窓が逼迫すると、LLMシステムは進行中のタスクを続けるために過去の文脈を圧縮する。本研究は、そこで静かに失われる一群の指示を同定した。「私が確認するまでメールを削除しないで」のような、セッションの残り全体にわたってモデルの振る舞いを縛るはずのユーザ指示(Session Constraints, SC)である。

新規性: 「圧縮によって安全制約が消える」という運用上きわめて実害の大きい failure mode を定量化した点が重要である。現行の圧縮器はSCを平均17%しか保持せず、しかも多くの場合、圧縮せずに同じタスクを実行した場合より成績が悪い。保持率は圧縮器・プロンプト・文脈長・SCの言い回し・注入位置によって大きく変動し、特定条件の問題ではなく系統的な損失であることが示された。

手法: マルチターンチャット、エージェント軌跡、長期ホライズンの研究という三つの長文脈シナリオで圧縮器を評価するCOMPINTを構築する。対策として、圧縮器と並走するプラグアンドプレイのSC対応抽出器を提案し、圧縮器にもLLMにも手を加えずに三シナリオすべてで90%超の保持率を達成した。評価スイートと実装はGitHubで公開されている。

arXiv

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

著者: Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

説得は自然言語コミュニケーションの中核的な力学であり、LLMが信念を更新し、意見の相違を解消し、決定に至る過程を形づくる。LLMが人間や互いと議論し助言し協調的に思考するようになるにつれ、有害な説得への耐性は信頼できる振る舞いの必須要件となる。しかし本研究は、その要件が全く満たされていないことを示す。

新規性: 静的なプロンプト攻撃では見えない脆弱性を、試行錯誤による説得戦略の最適化が露出させると示した点が中核である。RLで訓練した説得者は訓練時の対象モデルに対する説得成功率を約24%から93%超へ引き上げ、単一の標的的説得論証だけで、それが事実として誤っていてもモデルの正答率をほぼゼロまで崩壊させる。

手法: 単一の相互作用で標的モデルの回答を変えさせるよう説得エージェントを訓練する敵対的強化学習の枠組みを構成する。学習された戦略は未知のモデルへ転移し、Qwen-14Bで83%、Llama-3.1-8Bで79%、GPT-4o-miniで25%の攻撃成功率を示した。説得されやすいオープンウェイトモデルで先にブートストラップしてから難しいモデルを狙うカリキュラムにより、GPT-4o-miniへの成功率は25%から38%へ上がる。最適化された説得者は捏造された引用や偽の権威的証拠といった信頼性ベースの戦術に次第に依存するようになった。

arXiv

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

著者: Yutao Mou, Pengfei Yang, Zhe Yin et al.

外部ツールと統合されたLLMエージェントは、環境状態に埋め込まれた間接プロンプトインジェクションに対して脆弱である(7 upvotes)。しかし既存研究は、手作業で実装または再利用された環境、確率的なLLMベースのツール模倣、あらかじめ定められた注入位置に大きく依存している。

新規性: 攻撃評価のボトルネックが攻撃手法ではなく環境の作成コストにあると特定し、そこをスケールさせる点で同日のOpenARTと問題意識を共有する。注入位置を固定しないことで、評価が特定の設計判断に依存する現状を崩そうとする。

手法: LLMエージェントのセキュリティ評価とアラインメントのために、敵対的環境をスケーラブルに生成する枠組みを構成する。

Hugging Face Daily Papers

Agent Safety Should Be a Runtime Contract

著者: Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

支配的なパラダイムは、AIの安全性をRLHF・DPO・Constitutional AIによって訓練時にモデルへ植え付ける性質として扱ってきた(3 upvotes)。本論文は、コードを実行しファイルを書き換えメッセージを送信しデータベースを変更する自律エージェントに対して、この考え方が構造的に不十分だと論じる。

新規性: 安全性の実装場所を訓練時から実行時の契約(runtime contract)へ移すという立場の表明である。upvote数は控えめだが、同日のOpenART・ToolHazardが「訓練済みモデルは環境経由で崩せる」ことを実証的に示していることと合わせると、この日の安全性研究群が同じ結論の別々の側面を突いていることが分かる。

手法: エージェントの安全性を実行時に検証・強制される契約として定式化する立場を提示する。

Hugging Face Daily Papers

分野別の動向

エージェント安全性:訓練時から実行時・環境へ

この日の安全性研究は、防御の位置を揃って後段へ移した。Agent Safety Should Be a Runtime Contract(3 upvotes)はRLHFやConstitutional AIによる訓練時の植え付けが自律エージェントには構造的に不十分だと明言し、OpenART(181 upvotes)とToolHazard(7 upvotes)はいずれも攻撃側から同じ結論を支える。両者とも、手作業で用意した固定環境では長期ホライズンの状態汚染や間接プロンプトインジェクションを網羅できないと診断し、環境そのものを自動生成・自己進化させることで攻撃面をスケールさせる。Learning to Persuade(2608.11624)はモデル内部の脆弱性側からこれを補強しており、RL最適化された説得者が説得成功率を24%から93%超へ引き上げ、未知のモデルへも転移する。静的なプロンプト攻撃で無事だったモデルが、探索を許した攻撃者には崩れるという結果は、訓練時アラインメントの検証手続き自体が甘かったことを意味する。Measure, Don’t Optimize(2608.11408)は隣接する問題を扱い、398個の公開unlearnedモデルの監査から、内部監査指標を最適化目標に変えるとモデルは知識を消すのではなく監査から隠すことを学ぶと示した。安全性指標を報酬にすることの危うさを、実測で裏づけた例である。

スキルとハーネス:モデル重みの外側にある能力

能力をパラメータではなくモデルの周辺に置く研究が、この日は複数分野で同時に立った。AI4AI at Test-Time(96 upvotes)は強モデルから弱モデルへの能力移転をパラメータ更新なしにテスト時のハーネス経由で行い、SHAPER(2608.11350)は身体化エージェントでモデルを凍結したままスキルと文脈コードのハーネスを対象環境でのロールアウトによって進化させる。同じ凍結モデルがプランナと最適化器の両方を務める構成である。Better, Faster, Stronger(2608.11338)はスキルをプログラムとして見る立場が最もコスト削減に効くと主張し、決定論的に実行できる行動系列が試行錯誤と長期ホライズンでの劣化を回避すると示した。この流れは同時にスキルライブラリの肥大化という問題を生んでおり、独立した二グループが同じ日に同じ「SkillZip」という名前で圧縮手法を投稿している(72 upvotes / 12 upvotes)。前者は契約保存グラフ圧縮で文脈予算下の最小十分なコンテキストを露出させ、後者は評価を要さず再利用可能な構造を発見して冗長な分岐・例・警告を畳む。Harnessing agent memory(2608.11224)は材料科学でこの発想を検証し、記憶がGPT-5.2のタスク成功率をパラメータ更新なしにほぼ倍増させ、繰り返しエラーの92%を回避した。

長期ホライズンと持続性の評価

エージェント評価の時間軸が明確に伸びた。VibeLifeBench(16 upvotes)は数週間走り続けるタスクと変化し続ける世界を前提に、生活支援エージェントの能動性と持続性を測る。Can LLM Agents Stick to the Script?(25 upvotes)は対話型ナラティブで長期の論理一貫性と物語整合性を扱い、InfraBench(2608.11234)はインフラ管理タスクで15構成を評価して、短期目標は満たしつつ非永続的な変更・壊れた分散不変条件・後始末されない状態を残すという共通の失敗パターンを露出させた。DSAgentBench(7 upvotes)は実OS環境でのデータサイエンス作業全体を、360CityArena(10 upvotes)は360度動画から構築した写実的都市での探索を対象とする。これらに共通するのは、単発の成功率が実運用の信頼性をほとんど予測しないという認識である。Beyond Single-Turn Confidence(2608.11552)はこの認識を不確実性定量化に適用し、五つのLLMと四つのマルチターンツール利用データセットで単発向けUQ手法の転移を検証した。トークン確率スコアはターン間の集約方法に極端に敏感で、ブラックボックスな自己整合性が最も強い系統だという結果である。

文脈の圧縮と効率

長文脈の扱いは、性能と安全性の両面から同時に攻められている。Lost in Compaction(2608.11242)は文脈圧縮によってセッション制約が平均17%しか残らず、多くの場合は圧縮しない方がましだと定量化し、プラグイン型のSC抽出器で90%超まで回復させた。効率側では、CoinRAG(5 upvotes)が粗いチャンク単位のKVキャッシュ再利用に残る冗長性と雑音を情報ナゲット単位へ細分化し、LinearKV(2608.11231)はハイブリッドLLMで位置非依存キャッシュを訓練なしに実現する。後者の発見は反直観的で、線形層の初期化には単一のキャッシュ状態で十分であり、代数的に厳密な全状態合成は不要なばかりかMamba-2系では有害ですらある(EPICで復元率46.6%対86.8%)。Not Worth Another Token(11 upvotes)は研究エージェントで追加証拠の限界価値が逓減する点を推定し、Lifecycle-Optimal Tokenization(2608.11361)は語彙サイズが訓練時の慣習ではなく配備レジームの関数だと示す。推論最適な語彙はバッチサイズ1の32kからバッチ64以上の524kまで16倍動き、品質はその範囲でほぼ不変(BPB差2%未満)である。

学習ダイナミクスと基礎的な理解

Is Convergence Inevitable?(2608.11426)は、言語モデルの出力多様性の欠如がアラインメントに起因するという通説を覆す。意味的収束はSFTの最初の段階から観測され、統制実験によればSFTデータは収束を顕在化・増幅はするが導入はしない。ベースモデルでもプロンプトだけでinstruct的な崩壊を誘発できることから、均質性は事前学習の目的関数から自然に生じており、事後的な介入だけでは緩和が難しいと結論づける。Retrofitting Recurrent Depth(2608.11233)は、事前学習済みの密なモデルに再帰的深さを後付けでき、6Mパラメータのアダプタが180Mの全ブロックと同等(83.8%対84.0%)に機能すること、獲得した操作が教師あり深度の約1.5倍まで外挿すること、同サイズのスクラッチパッド訓練モデルは学習ホライズンを超えると崩壊する(深度10超で保持率53%対2.5%)ことを示した。同時に、逆向きの規則を単独では学べるのに、既存の機構と汎用能力を保ったまま獲得できたものはないという破滅的干渉の境界も報告している。Three Tokens Force Exponential Feature Rank(2608.11427)はカーネル注意の理論的限界を示し、トークン三つの時点で非負カーネル注意は2^Ω(m)の特徴数を要するのに対し密なsoftmaxはm次元で解けると証明した。

ソース