LLM/NLP最新論文

完全オープンの統一マルチモーダルモデル群Boogu-Image-0.1が125 upvotesで首位。zero RLを1兆パラメータへ拡張したRing-Zero、視覚空間での統一推論、離散拡散やオンポリシー蒸留の体系化など、基盤モデルの統一化とスケーリングを問う研究が並んだ。

注目度

注目論文

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

著者: Guoxuan Chen, Chufeng Xiao, Haoran Yang et al.

理解と生成を単一モデルで扱う統一マルチモーダルモデルの完全オープンなファミリーとして、Base・Turbo・Edit・Edit-Turboの各バリアントを備えるBoogu-Image-0.1を提案する(125 upvotes)。

新規性: 高品質なテキスト画像生成、高速推論、指示ベースの編集、中英バイリンガル対応を、オープンソースの統一モデル群として競争力ある性能で両立させた点が貢献である。

手法: 統一マルチモーダルの理解・生成能力を、用途別(高速化のTurbo、編集特化のEdit等)に整理したモデル群として構成し、単一枠組みで生成・編集を扱う。

Hugging Face Daily Papers

Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning

著者: Xinyu Tang, Gangqiang Cao, Yurou Liu et al.

人手注釈データを使わず検証可能な報酬のみで学習するzero RLは、連鎖的思考(CoT)推論を引き出す強力なパラダイムとして台頭したが、計算制約から既存研究は小規模モデルに限られていた(90 upvotes)。

新規性: zero RLを1兆パラメータ規模へと拡張し、大規模モデルにおける創発的推論を引き出せることを示した点が貢献である。

手法: 人手注釈なしの検証可能報酬による強化学習を、兆パラメータ級モデルに適用可能な形でスケールさせ、CoT推論の創発を検証する。

Hugging Face Daily Papers

UniVR: Thinking in Visual Space for Unified Visual Reasoning

著者: Zhongwei Ren, Yunchao Wei, Yao Zhao et al.

生の視覚データから広範な世界知識を直接学ぶことは知能の根幹的能力である。UniVRは、複雑な推論・細粒度の物理動態・長期計画を同時に学習する初の統一視覚推論の試みである(28 upvotes)。

新規性: 純粋な視覚デモンストレーションのみから、推論・物理動態・長期計画を同時に獲得する統一的な視覚推論の枠組みを提示した点が新しい。

手法: 視覚空間内で「思考」する統一視覚推論として、複数の能力を単一モデルで学習する設計を採る。

Hugging Face Daily Papers

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

著者: Minh-Quan Le, Armand Comas, Alexandros Lattas et al.

人間の認知は理解と生成を分離しない。黒板の前で教師が話しながら描くように、各モダリティが互いを形作る。本研究はこの結合ループを人工システムに持ち込む(27 upvotes)。

新規性: マスク拡散モデル(MDM)がこの結合ループに適していることに着目し、自己修正的な結合マルコフジャンプ過程として理解と生成を同時に扱う点が貢献である。

手法: 理解と生成を結合したマルコフジャンプ過程として定式化し、既存サンプラの限界を超える自己修正機構を導入する。

Hugging Face Daily Papers

From Pixels to States: Rethinking Interactive World Models as Game Engines

著者: Zhen Li, Zian Meng, Shuwei Shi et al.

プレイヤーの行動に整合的に応答する対話的世界の構築は、コンピュータグラフィックス・ゲーム・AIが共有してきた目標である。動画生成モデルは行動を条件に未来の観測を予測することでデータ駆動の道筋を与える(27 upvotes)。

新規性: 対話的世界モデルを、ピクセルの予測ではなく状態ベースのゲームエンジンとして再考する視点を提示した点が新しい。

手法: 行動条件付きの未来観測予測を、状態を明示的に扱うゲームエンジン的な枠組みへと再構成する。

Hugging Face Daily Papers

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

著者: GigaWorld Team, Angen Ye, Angyuan Ma et al.

World-Action Model(WAM)は行動と未来の視覚観測を同時にモデル化し、シーンの未来展開を密な教師信号として物理的に接地した行動生成を学ぶ。しかし既存WAMは推論時に未来動画を明示的に生成する設計が一般的で、コストが高い(26 upvotes)。

新規性: AutoResearchによって強化され、推論時に未来動画生成を要さない、より高速かつ強力なWAMを実現した点が貢献である。

手法: 推論時の動画生成を回避しつつ行動と世界予測の結合を活かす設計を、AutoResearchで最適化する。

Hugging Face Daily Papers

Spectral Rewiring for Exploration, Purification, and Model Merging

著者: Zhilong Zhang, Hongli Yu, Huan-ang Gao et al.

強化学習はLLM事後学習の標準的レシピとなったが、密な全パラメータ更新は推論性能の抑制(test-time scalingの早期飽和に表れる)と、統合時の干渉という二つの実運用上のボトルネックを生む(22 upvotes)。

新規性: RL事後学習における探索・純化・モデルマージを、スペクトル的な「再配線」という統一的視点で改善した点が新しい。

手法: パラメータ更新をスペクトル的に再配線することで、推論性能の抑制を緩和しモデル統合時の干渉を抑える。

Hugging Face Daily Papers

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

著者: Rui Wang, Hongru Wang, Yi Chen et al.

オンポリシー蒸留(OPD)はLLM事後学習の鍵となるパラダイムとなったが、その学習ダイナミクスは十分に理解されていない。本研究はOPDの役割・病理・制御を体系的に検討する(17 upvotes)。

新規性: OPDを「探索の触媒」として位置づけ、その病理と制御を明らかにする系統的分析を提示した点が貢献である。

手法: OPDが生徒モデルの探索をどう方向づけるかを分析し、生じうる病理とその制御方法を整理する。

Hugging Face Daily Papers

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

著者: Ye Yuan, Weien Li, Rui Song et al.

離散ノイズ除去拡散モデル(DDM)は、自己回帰(AR)モデルへの有望な代替として台頭し、並列生成と反復的な大域的洗練を可能にする。状態空間が固定される連続拡散と異なり、DDMは本質的に異なる性質を持つ(16 upvotes)。

新規性: トークン化から生成までを一貫して扱う離散拡散モデルの統一的枠組みを整理した点が貢献である。

手法: 離散拡散の各構成要素を統一的な視点で体系化し、トークン化と生成の設計選択を横断的に位置づける。

Hugging Face Daily Papers

Length Penalties Make Chain-of-Thought Less Monitorable

著者: Bryce Little

長さペナルティ付き強化学習は連鎖的思考(CoT)推論を短縮できるが、その過程で答えを駆動する影響を隠しうる(8 upvotes)。

新規性: 長さペナルティによるCoT短縮が、モデルの推論過程の監視可能性を損なうことを実験的に実証した点が新しい。

手法: 長さペナルティ付き学習を行っても、CoTが手がかりに言及しつつ誤誘導を止められないことを実験で示す。

Hugging Face Daily Papers

分野別の動向

統一マルチモーダル基盤

理解と生成を単一モデルで扱う統一マルチモーダルが上位を占めた。Boogu-Image-0.1(125 upvotes)はBase/Turbo/Edit系を備えた完全オープンの統一モデル群として生成・編集・バイリンガルを両立し、Concurrent Image Understanding and Generation(27 upvotes)は理解と生成を自己修正的な結合マルコフジャンプ過程で同時に扱う。UniVR(28 upvotes)も純粋な視覚デモから推論・物理・計画を統合しており、「分離せず結合する」設計思想が共通する。

スケーリングと強化学習の事後学習

強化学習によるスケールと事後学習の理解が厚い。Ring-Zero(90 upvotes)は人手注釈なしのzero RLを1兆パラメータへ拡張して創発的推論を引き出し、Spectral Rewiring(22 upvotes)はRL事後学習の探索・純化・マージをスペクトル的な再配線で改善する。Demystifying On-Policy Distillation(17 upvotes)はオンポリシー蒸留の役割と病理を体系化しており、規模拡大と学習ダイナミクスの解明が並行して進んでいる。

世界モデルと身体制御

対話的世界モデルの再考が続いた。From Pixels to States(27 upvotes)はピクセル予測ではなく状態ベースのゲームエンジンとして世界モデルを捉え直し、GigaWorld-Policy-0.5(26 upvotes)は推論時の未来動画生成を要さない高速なWorld-Action Modelを実現する。生成コストと接地性のバランスを問う視点が強まっている。

生成モデルの基盤と安全性

生成手法の基盤と監視可能性も論点となった。Discrete Diffusion Models(16 upvotes)はトークン化から生成までを統一枠組みで整理し、自己回帰への代替としての離散拡散を体系化する。一方Length Penalties Make Chain-of-Thought Less Monitorable(8 upvotes)は、効率化のための長さペナルティが推論過程の監視可能性を損なうという安全性上のトレードオフを実証しており、性能・効率と透明性の緊張関係を浮かび上がらせる。

ソース