永続環境でのエージェント・レッドチーミングを開放進化させるOpenARTが252 upvotesで突出。機構解釈をAI自身に担わせるMechanist、スキル群を契約保存圧縮するSkillZipが続き、エージェントの「安全性・自己理解・文脈予算」という運用側の三課題に関心が集中した一日となった。
注目論文
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
著者: Yunhao Chen, Xin Wang, Yixu Wang et al.
AIエージェントは永続的な環境で動作し、初期の状態変化が遠い将来の判断にまで影響を及ぼす(252 upvotes)。従来の言語モデルとの対話とは異なり、エージェントの振る舞いは長期ホライズンのワークフロー全体で繰り返し書き換えられ再利用される共有状態を介して媒介される。
新規性: 安全性評価の単位を「プロンプト」から「環境」へ移した点が中核である。現在の安全性研究は単発の入力に対する応答を見るが、エージェントの危険は共有状態に残った副作用が後続の判断を汚染する形で現れる。環境そのものを開放進化させることでレッドチーミングをスケールさせるという設計は、静的なテストスイートでは原理的に届かない領域を狙っている。252 upvotesはこの日の最高値で、エージェント安全性の評価手法が未整備であるという認識が広く共有されていることを示す。
手法: 永続的な共有状態を持つエージェント環境を開放的(open-ended)に進化させ、長期ホライズンのワークフローに潜む安全性リスクを大規模に探索するレッドチーミング枠組みを構成する。
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
著者: Mengru Wang, Junfeng Fang, Shuofei Qiao et al.
AIモデルは多様な領域で目覚ましい成功を収めているが、その能力を支える機構と、もたらしうるリスクの実体は依然としてほとんど理解されていない(82 upvotes)。AI開発が高速化し自動化が進むなかで、機構的な探究だけが手作業に留まり、両者の隔たりが広がり続けている。
新規性: 「開発の自動化と理解の手作業」という速度差そのものを問題として名指しした点が中核である。解釈可能性研究の個別手法を改善するのではなく、AIを科学装置(scientific instrument)として位置づけ、機構解明のループ自体をAIに回させる。同日のOpenARTがリスクを外側から突くのに対し、こちらは内側から機構を明らかにしようとしており、能力向上に追いつかない安全性研究という同じ焦りが二つの方向から現れている。
手法: 知能の内部機構とリスクの解明を自動化する枠組みを提示し、機構的探究をAI自身が担う科学装置として構成する。
SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries
著者: Xingyu Tan, Xiaoyang Wang, Qing Liu et al.
LLMは手続き的知識を再利用可能なスキルパッケージとして保持し、推論時に読み込むエージェントとして振る舞うことが増えている(74 upvotes)。スキルライブラリが肥大化するにつれ、限られた文脈予算のもとで「最小十分な実行文脈」だけを露出させることが中心的な課題になる。
新規性: スキル圧縮を単なる要約ではなく、契約(contract)を保存するグラフ圧縮として定式化した点が中核である。スキルは呼び出し規約や前提条件を持つため、要約で情報を落とすと実行時に壊れる。契約を不変量として保ったまま圧縮するという制約設定は、スキルライブラリをソフトウェア的なモジュール系として扱う立場を明確にしている。同日の@skills論文(arXiv)が「インストールは内容・永続性・自動起動の三機能を束ねすぎている」と指摘し文脈常駐コストを問題視しているのと、まったく同じ希少資源を巡る議論である。
手法: スキルライブラリをグラフとして表現し、契約を保存する圧縮を施すことで、限られた文脈予算下で最小十分な実行文脈のみを露出させる。
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
著者: Yingpeng Ma, Jianhao Yan, Bei Shi et al.
LLMの急速な進展はゲームAIに開放的で流動的な対話型ストーリーテリングをもたらしつつある(26 upvotes)。しかし既存研究は、想定外の入力に対して長期ホライズンの論理的一貫性と物語の整合性をどう保つかという決定的な課題をほぼ見落としてきた。
新規性: 一貫性の破綻を「敵対的入力下での維持」という測定可能な問題に落とし込んだ点が中核である。物語生成の評価は主観的になりがちだが、設定された脚本から逸脱させようとする入力に対してどれだけ持ちこたえるかであれば定量化できる。前日のPlayWorldが長期ホライズンの目標達成でワールドモデルを測ったのに対し、こちらは長期ホライズンの整合性維持でエージェントを測っており、「長く走らせたときに何が壊れるか」という共通の関心が別ドメインで反復されている。
手法: 対話型ナラティブにおける長期的な論理的一貫性と物語の整合性を、逸脱を誘う入力の下で測るベンチマークを構成する。
Self-Evolving Embodied Agents via Skill-Harness Evolution
著者: Peidong Wang, Zhiming Ma, Ying Chang et al.
身体化エージェントは基盤モデルを取り巻くシステムとして構築されることが増えており、性能はモデル重みだけでなく、スキル・文脈・行動インタフェース・実行ハーネスにも依存する(11 upvotes)。教師ありファインチューニングや強化学習はエージェントを適応させうるが、それだけでは系全体を扱えない。
新規性: ハーネス進化の議論を身体化領域へ持ち込んだ点が中核である。前日のDarwinX(自然選択によるハーネス進化)とAutoDesign(メタハーネス最適化)が言語・設計タスクで扱った枠組みが、翌日にはロボティクス側で反復されている。スキルと行動インタフェースを共進化の対象に含める点が言語エージェント版との差分であり、物理的な行動空間を持つ場合にハーネス最適化が何を意味するかを具体化している。
手法: モデル重みの更新ではなく、スキル・行動インタフェース・実行ハーネスの共進化としてエージェントの自己改善を定式化する。
Full-bandwidth transformer
著者: Xi Wang, Ziyang Cai, Zheng Zhan et al.
自己回帰Transformerは二つの軸に沿って計算する。生成トークンを横断する水平方向と、モデル深さを貫く垂直方向である(10 upvotes)。密な注意は各トークンに過去への広い水平アクセスを与えるが、復号ステップ間の垂直的な帰還路は狭いままで、次のステップへ戻るのはサンプルされたトークンだけである。
新規性: 復号ステップ間の情報帯域という、これまで暗黙の前提だった構造を明示的なボトルネックとして名指しした点が中核である。自己回帰生成では各ステップで深層まで計算した豊富な表現が、最後に1トークンへ圧縮されて次ステップへ渡される。この「1トークン分の帯域」を広げるという発想は、水平方向(文脈長・注意効率)にばかり向かってきた最適化の関心を垂直方向へ振り向けるものである。John Langfordら著者陣の顔ぶれも含め、アーキテクチャ研究として注目に値する。
手法: 復号ステップ間の垂直帰還路を広帯域化し、深さ方向の情報流を復号ループ内で保持するTransformerアーキテクチャを構成する。
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
著者: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
「画像で考える」パラダイムは、crop-and-zoomのような能動的視覚操作をマルチモーダルLLMに与える(7 upvotes)。しかしこれらの操作を用いるモデルは、直接推論に対してトークンコストが大幅に増える割に、限界的あるいは負の利得しか得られないことが多い。無関係な領域を繰り返し切り出すこともある。
新規性: 視覚ツール利用の効果を相関ではなく因果的監査で切り分けた点が中核である。ツールを使ったモデルの性能が高く見えても、それがツール利用によるものなのか、単にトークンを多く費やしたことによるものなのかは区別されてこなかった。「幻影」という強い語を掲げてこの区別を実証的に突きつけており、エージェント設計にツールを足すことの正当化を厳しくする方向の仕事である。
手法: 「画像で考える」モデルの視覚操作について因果的な監査を行い、操作の有無が推論結果へ与える寄与とトークンコストの見合いを分離して評価する。
Thought-Level Beam Search for Reasoning
著者: Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali
テスト時計算のスケーリングは大規模推論モデル(LRM)の性能を駆動する主要因だが、既存手法の極端な非効率が上限を作っており、問われるべき問いは「どれだけ計算を費やすか」から「どこに配分するか」へ移っている(6 upvotes)。
新規性: テスト時推論を制約付き計算資源配分問題として形式化した点が中核である。テスト時スケーリングの議論は総量の増加に集中してきたが、推論の途中で計算を要する箇所は一様ではない。探索の粒度をトークンではなく「思考」単位に置くことで、配分の判断を意味のある単位で行えるようにしている。同日のKnowing When to Quit(無益な推論の中断)と合わせると、テスト時計算を「増やす」段階から「配る/止める」段階へ進める動きとして読める。
手法: テスト時推論を制約付き計算配分として定式化し、思考単位のビームサーチによって計算を配分する。
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
著者: Xinyan Guan, Jiali Zeng, Chunlei Xin et al.
LLMは自らの能力を超えたタスクに対し、計算コストは高いが意味的には空虚な推論を生成する(3 upvotes)。もっともらしく響くが誤った導出がユーザを誤導するリスクを生む。
新規性: 「無益な推論(futile reasoning)」を診断可能な現象として特徴づけ、モデル横断の普遍的な傾向として分析した点が中核である。推論の質を高める研究は多いが、解けない問題を解けないと認めて止まる能力を明示的な訓練対象に据えた例は少ない。過剰な推論がコストとハルシネーションの両方を同時に悪化させるという指摘は、テスト時スケーリングの素朴な推進に対する実務的な歯止めになる。
手法: 無益な推論の現象を系統的に分析して能力横断的な傾向を明らかにし、LLMが無益な推論を中断するよう診断・訓練する。
Maglev: Sliding Recurrent Memory
著者: Bo Liu, Qiang Liu
固定サイズの記憶を持つ再帰型Transformerアーキテクチャであり、スライディングウィンドウ注意を一般化しつつ、学習時の並列性を保持する(5 upvotes)。全注意を活用するプリフィラQと、それに結合されたもう一つのモデルという二つの結合モデルから構成される。
新規性: 再帰型の固定記憶と学習時並列性という、通常はトレードオフの関係にある二つを同時に満たそうとする点が中核である。RNN系アーキテクチャの復権では学習時の並列化が常に障壁になってきた。スライディングウィンドウ注意の一般化として再帰を導入する経路は、既存のTransformer学習基盤を活かしたまま固定コストの推論へ移行する道筋を示す。実装上は全注意とスライディングウィンドウ注意を交互に配置する。
手法: プリフィラQを含む二つの結合モデルからなる再帰型Transformerを構成し、固定サイズ記憶とスライディングウィンドウ注意の一般化を、学習時の並列性を保ったまま実現する。
Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces
著者: Congchao Wang, Diwakar Singh, Qiaozi Gao et al.
推論LLMの改善には、長い推論トレースの品質を判定する能力が要る。データ選別、強化学習における訓練信号、モデル評価の理解のいずれにも必要だが、この課題は難しく、フロンティアモデルであっても単一の審査員では推論の欠陥をうまく特定できない。加えて、推論LLMのオンライン訓練中にフロンティアモデルを使うことは利用規約上一般に禁じられている。
新規性: 単一審査員を、調停者付きの陪審合議に置き換えた点が中核である。陪審員は互いの判定を批判し合い、初期投票を修正でき、調停者が合議または統合によって結論を導く。結果として、gpt-oss-120b等のオープンウェイトモデルからなる陪審団が、opus-4.6・sonnet-4.6・gemini-3.1-proといったフロンティアモデルを推論欠陥の検出精度で有意に上回った。しかも陪審全体の総コスト(初期評決・審議・統合を含む)はフロンティアモデルをLLM-as-a-judgeとして走らせる場合の8〜15%に収まる。前日のJagged Judgesが単一審査員の不安定性を実証したのに対し、こちらは合議という構造的な処方箋を提示しており、両者は表裏の関係にある。
手法: 複数LLMからなる陪審団と調停付き合議機構を構成し、推論トレースの欠陥とその重大度を審議を通じて表面化させる。得られた判定はベンチマーク上の失敗モード分析にも利用でき、モデル性能のより深い理解を可能にする。
Dual-Flow Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation
著者: Liming Liu, Mingze Wang, Tuo Zhao
LLMが処理するリクエストが増えるにつれ、累積推論コストは一度きりの訓練コストに対して相対的に重要性を増している。推論の二つの局面はハードウェアへの負荷が異なり、プロンプトのプリフィルは並列で計算律速、自己回帰的な復号は逐次でメモリ帯域律速になることが多い。従来の幅・深さ方向のスケーリングは、追加された層が両局面で評価されるため両方のコストを同時に押し上げる。
新規性: 追加計算をプリフィルと復号のどちらに配分するかを独立の設計変数にした点が中核である。主フローは完全な因果言語モデルとしてプロンプトを処理しKVキャッシュを書き、補助フローはプロンプト処理中は省略され、プロンプト末尾位置から先でのみ起動する。補助フローは永続状態を書かず主フローに影響も与えないため、単一の永続KVキャッシュが保たれる。MoEモデルでは、主・補助のエキスパートfan-outがプロンプトコスト・継続コスト・予測品質に対する独立した制御量になる。
手法: 二つのフローが主要な注意・MLP・出力行列を共有しつつ、別個のトークン埋め込みと軽量な結合を用いる。重みと主キャッシュの共有により、グループ実行時にロード済み重みとキャッシュ済みKVの再利用機会も生まれる。トークン数を揃えた比較で、アーキテクチャとデータ構成を通じて検証損失が改善した。プリフィル側のエキスパート計算を固定して復号計算を増やす場合と、固定の復号エキスパート予算を二フロー間で再配分する場合の二つの領域を検討し、プリフィル-復号-品質のトレードオフを明らかにしている。
Trie Automata for Constrained Decoding over Large Finite Sets
著者: Xingzi Xu, Karim Bouyarmane
LLMには事前定義されたスキーマに適合する構造化出力の生成が求められることが増えており、よくある制約の一つが有限集合の有効文字列からの選択である。現在の制約付き復号システムは汎用の文法コンパイルでこれを扱うが、有効値の数が数千に達すると極端に遅くなる。著者らはこれを「カーディナリティの壁」と呼ぶ。
新規性: 有限集合という構造(共有プレフィックス、有界な深さ、既知のカーディナリティ)を専用機構で突く点が中核である。汎用文法エンジンが一般性のために払っているコストを、頻出する特殊ケースで取り戻す。さらに、事前計算されたマスクがガイド付き復号パイプラインを迂回するステートレスな配信経路を可能にするため、バッチ配信で優位が複利的に効く。アルゴリズム的な高速化と統合経路の節約が合わさる構造が明確に示されている。
手法: Aho-Corasick型の多パターンマッチングを用いてノードごとのトークンマスクを事前計算するtrie automatonを導入する。ステップあたりの有効トークン計算はvLLM/SGLangの主要バックエンドの一つであるXGrammarに対して7倍高速(0.65μs対5.8μs)、K≧300でのコンパイルは2〜6.5倍高速。バッチサイズ256でのvLLMのend-to-endスループットは219 req/s対7.5 req/sで29倍に達する。32K〜262K語彙の7つのトークナイザファミリにわたり、K=10,000までコンパイルは100ms未満、ステップあたりコストは集合サイズによらず一定で、出力の妥当性は100%保証される。
分野別の動向
エージェント安全性・レッドチーミング
この日の最大の関心はエージェントの安全性評価にあった。首位のOpenART(252 upvotes)は、永続的な共有状態を持つ環境そのものを開放進化させることで、単発プロンプトの評価では届かない長期ホライズンのリスクを探る。前日のSteerBench-Workがコミット境界での判断を測ったのに対し、こちらは環境側を動かして危険な状態遷移を発見しにいく。評価の単位が「入力」から「環境」へ移りつつあることを示す一日である。
エージェント基盤と文脈予算
SkillZip(74 upvotes)と@skillsプロトコル論文(arXiv)が、まったく異なる立場から同じ希少資源を論じているのが目を引く。前者はスキルライブラリを契約保存グラフ圧縮で縮め、後者はインストール(内容・永続性・自動起動の束)を解体して常駐コストを持つ要素を最小化する。5万件を超える公開スキルに対して信頼できるトリガースロットは100未満という@skillsの指摘は、この問題が理論ではなく実務の壁として現れていることを裏づける。Self-Evolving Embodied Agentsは、前日のDarwinX/AutoDesignが言語・設計領域で扱ったハーネス進化を身体化領域へ持ち込んだ形になる。
テスト時計算の配分と節約
Thought-Level Beam Search(どこに配分するか)とKnowing When to Quit(いつ止めるか)が同日に並んだのは象徴的である。テスト時スケーリングの議論は総量の増加から、配分と打ち切りという運用の段階へ移りつつある。The Illusion of Visual Tool-Useも同じ系譜にあり、視覚ツール利用が支払ったトークンコストに見合う利得を生んでいないことを因果的監査で突きつけている。「計算を足せば良くなる」という前提が、複数の角度から同時に検証にかけられた日だった。
アーキテクチャと推論効率
Full-bandwidth transformerは復号ステップ間の垂直帰還路の狭さを、Dual-Flow Transformersはプリフィルと復号の計算特性の違いを、それぞれ設計変数として取り出した。Maglevは固定サイズ再帰記憶と学習時並列性の両立を狙う。いずれも文脈長や注意効率といった水平方向の最適化ではなく、自己回帰生成という計算構造そのものの再検討にあたる。Trie Automataは制約付き復号の実装層で29倍のスループット差を示しており、汎用機構の一般性コストを特殊ケースで取り戻す方向の成果である。
評価とジャッジの信頼性
Reasoning Juryは、単一のフロンティアモデル審査員をオープンウェイトモデルの陪審合議に置き換えることで、精度で上回りコストを8〜15%に抑えた。前日のJagged Judgesが単一審査員が圧力下で25〜71%の割合で判定を翻すことを実証したのに対し、こちらは合議という構造的処方箋を出しており、二日にわたってLLM-as-a-judgeの信頼性が問題と対策の両面から扱われたことになる。オンライン訓練でフロンティアモデルを審査に使えないという利用規約上の制約を明示的な動機に挙げている点も実務的である。
機構解明と自動化
Mechanist(82 upvotes)は、AI開発が自動化で加速する一方、機構的理解の探究だけが手作業に留まっているという速度差を問題化する。解釈可能性の個別手法ではなく、理解のループ自体をAIに担わせる「科学装置としてのAI」という位置づけである。OpenARTが外側からリスクを突き、Mechanistが内側から機構を開けにいく構図であり、能力向上に理解と安全性が追いついていないという共通の焦りが、この日の高upvote論文の背景にある。