TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年6月2日
弱い批評家が強い学習者を作る: スケーラブルな監督のためのオンポリシー批評蒸留大規模言語モデルがより強力になるにつれて、弱い教師は複雑な出力に対して信頼できるラベル、選好、または最終判断を提供できず、弱から強への汎化とスケーラブルな監督の両方を制限する可能性があります。より扱いやすい弱い教師を使用する形式を研究します。
arXiv cs.AI
2026年6月2日
近未来ガイダンスを通じたオンポリシー蒸留における推論軌跡の橋渡しオンポリシー蒸留(OPD)は、教師の監督下で自身のポリシーからサンプリングされた軌跡について学生モデルを訓練することで大規模言語モデルの推論を改善します。OPDは軌跡上で動作しますが、その学習シグナルはトークンレベルのままです。高損失トークンを通じて逸脱を特定します。
arXiv cs.CL
2026年6月16日
Nemotron 3 Ultra:エージェント推論のためのオープンで効率的なMixture-of-ExpertsハイブリッドMamba-Transformerモデル5500億の総パラメータと550億のアクティブパラメータを持つMixture-of-ExpertsハイブリッドMamba-Attention言語モデル「Nemotron 3 Ultra」を紹介します。Nemotron 3 Ultraは20兆トークンのテキストで事前学習され、その後コンテキスト長を100万トークンに拡張し、教師ありファインチューニング(SFT)、強化学習(RL)、マルチティーチャー・オンポリシー蒸留(MOPD)を用いて事後学習されました。Nemotron 3 Ultraは、LatentMoE、マルチトークン予測(MTP)、NVFP4事前学習、マルチ環境RLVR、MOPD、推論バジェット制御といった複数の主要技術を採用した、これまでにない最も高性能なモデルです。Nemotron 3 Ultraは、最先端の公開LLMと比較して最大約6倍高い推論スループットを達成しながら、同等の精度を実現しています。最先端の精度、高い推論スループット、100万トークンのコンテキスト長により、Nemotron 3 Ultraは長期間実行される自律エージェントタスクに最適です。
arXiv cs.CL
2026年6月17日
近接政策最適化のゾーン:勾配ではなくプロンプト内の教師知識蒸留は教師の能力を小さな生徒モデルに転送しますが、生徒モデルが小さい場合に脆く、汎化性能を損なう可能性があります。 強化学習では、教師の応答をポリシー勾配に直接注入すると、オンポリシーの仮定が破られ、ドリフトを引き起こす可能性があります。 本研究では、プロンプト内に教師を保持する「近接政策最適化のゾーン(ZPPO)」を導入し、特に難しい質問に対して二つの再構成されたプロンプトを構築します。
arXiv cs.CL
2026年6月26日
DanceOPD: オンポリシー生成フィールド蒸留画像生成技術の分野で、多様な能力を一つのモデルで実現することを目指した新たな研究「DanceOPD」が発表されました。この技術は、生成したい画像の特性に応じて、最適な生成プロセスを自動で選択する仕組みを持っています。 具体的には、DanceOPDは生成したいサンプルごとに、その特徴を分析し、適切な「能力フィールド」へと誘導します。そして、そのフィールド内でノイズの少ない状態を特定してクエリすることで、目的に合った画像を生成します。このプロセスにより、これまで個別のモデルでしか実現できなかったような、専門的な能力を合成して学習することが可能になります。この研究は、画像生成における汎用性と効率性を飛躍的に向上させる可能性を秘めています。 arXiv cs.LG
arXiv cs.LG
2026年6月30日
SEAD:エントロピー誘導型教師あり学習による、能力を考慮したオンポリシー蒸留オンポリシー蒸留(OPD)は、オフライン蒸留や強化学習(RL)にはない特性、すなわち教師の監督品質が生徒の能力に依存するという特性を持っています。不整合なロールアウトはノイズの多い勾配を生み、既に習得したトークンは冗長なものになります。これは3つのスケール(トークン、トレーニングフェーズ、プロンプト)で無駄を生じさせますが、既存の方法は均一に監督します。本稿では、SEADを提案します。これは、3つのスケールにおけるこの能力依存型の劣化の統一的なプローブとしてエントロピーを使用します。(1)教師と生徒の共同エントロピーは、トークンを、調整されたダイバージェンスまたはゼロ勾配を受け取るゾーンに分割します(約50%がスキップされます)。(2)コサインスケジュールは、能力の成長に伴い、フォワードKLからリバースKLへと減衰します。(3)能力ゲート付きカリキュラムは、簡単なものから難しいものへとプロンプトを導入します。これらのコンポーネントは共生的かつ必要不可欠です。トークン選択には整合性の取れたロールアウト(カリキュラム)が必要であり、減衰には単調な改善(これもカリキュラム)が必要です。
arXiv cs.CL
2026年7月7日
学生の振る舞いを教師が正規化:英語証拠付きクロスリンガルRAGのための教師正則化強化学習クロスリンガル検索拡張生成(RAG)は、多くの場合、英語証拠レジームで展開されます。このレジームでは、ユーザーは多様な言語でクエリを発行しますが、検索されたパッセージは英語のままです。この設定では、強力なベースモデルがあっても生成が失敗する可能性があります。英語の証拠は言語ドリフト(英語またはコードスイッチング出力)を誘発し、モデルは非英語の回答を生成する際に証拠を信頼性なく使用します。これらの失敗は、2つのポストトレーニングの課題に起因すると考えられます。(i) エラーはプレフィックス依存であり、固定軌道監督はプレフィックスの不一致に苦しむ。(ii) シーケンスレベル(部分的に離散的/ジャッジベース)の報酬は、ノイズの多いクレジット割り当てと高分散の更新をもたらします。本研究では、報酬最適化と学生が訪問したプレフィックスでのオンポリシー蒸留を組み合わせた教師正則化RLレシピ、TR-RAGを提案します。
arXiv cs.CL
2026年7月28日
多ターン長期間計画の物理学:事前学習から事後学習まで、単一・複数教師のオンポリシーエージェント蒸留長期にわたる複雑な計画立案は、AIエージェントの能力向上に不可欠な要素ですが、その実現に向けた研究はまだ十分に進んでいません。この課題に対し、東京大学の研究者らは、AIエージェントの計画能力を体系的に評価・向上させるための新しいフレームワークを提案しました。 このフレームワークでは、AIエージェントの計画能力を「事前学習」「事後学習(GRPO/OPD)」「蒸留」の3段階に分けて分析します。まず、事前学習段階で基本的な計画能力を獲得させ、次にGRPOやOPDといった手法を用いて、より高度な計画能力を形成します。さらに、教師あり・なしの蒸留技術を適用することで、これらの能力を統合し、長期・多ターン計画におけるエージェントの性能を最大限に引き出すことを目指します。この研究は、AIエージェントがより複雑な意思決定を自律的に行えるようになるための重要な一歩となることが期待されます。 引用元: arXiv cs.LG
arXiv cs.LG
2026年7月28日
オンポリシー拡散蒸留における分類子フリーガイダンスの再考オンポリシー拡散蒸留(OPD)は、生成モデルの学習手法の一つであり、学習中のモデル(学生)が生成したデータ軌跡を利用して、より高性能なモデル(教師)から知識を転移させる技術です。この手法は、学生モデルが生成した軌跡に沿って教師モデルに問い合わせを行うことで、効率的な適応を目指します。 しかし、近年の拡散モデルで一般的に用いられている「分類子フリーガイダンス(CFG)」という技術との組み合わせにおいて、OPDの挙動は十分に解明されていませんでした。CFGは、生成されるデータの質を向上させるための重要な技術ですが、OPDとの相互作用については不明な点が残されていました。 従来のOPD手法では、CFGが生成する予測結果に対して、学生モデルと教師モデルの「ガイド付き速度」を直接比較することで、知識の転移を図っていました。これは、CFGによって調整された予測を、OPDの枠組みに自然に組み込む試みでした。 ところが、このアプローチには課題も指摘されています。具体的には、CFGは「正のデータ」と「負のデータ」の両方を考慮して予測を行うため、それぞれの予測における誤差が相殺されてしまう可能性があるという点です。このため、ブランチレベルでの正確な指導が難しく、OPDの効果を最大限に引き出せない可能性が示唆されています。 引用元: arXiv cs.LG
arXiv cs.LG
2026年7月29日
バトンを渡す: 軌跡中継型オンポリシー蒸留AIモデルの学習効率を高める新たな手法が提案されました。従来のオンポリシー蒸留(OPD)では、学習済みの教師モデルから生徒モデルへ知識を伝達する際、生徒モデルが途中で誤った学習経路に進んでしまう「プレフィックス失敗」という課題がありました。 この問題に対し、研究者たちは「リレーオンポリシー蒸留(Relay-OPD)」という手法を考案しました。これは、教師モデルと生徒モデルの役割を「リレー」のように切り替える考え方です。具体的には、教師モデルが担当する区間を設けることで、生徒モデルが初期段階で誤った方向に学習が進むのを防ぎます。これにより、計算資源の無駄遣いを抑制しつつ、より効率的な学習が可能になると期待されます。この新しい蒸留手法は、AIモデル開発のさらなる進歩に貢献する可能性があります。 (arXiv cs.AI)
arXiv cs.AI