TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
信頼度ショートカット:マスク拡散モデルの推論失敗モードarXiv:2605.29123v1 公表予定タイプ:新規 概要:マスク拡散言語モデル(MDM)は任意の順序の生成をサポートしており、信頼度ベースのデコーディングが事実上標準的な推論ポリシーとして機能している。これを最適化するため、最近のトレーニングスキームでは、生成時に観察されるマスクパターンと直接整合させることを試みている。
arXiv cs.AI
2026年5月30日
拡散モデルのグラフ-テキスト生成における復号化軌跡分析:最初に復号化されるトークンの考察マスク付き拡散言語モデルの復号化プロセスを分析した新しい研究が発表された。グラフ-テキスト生成タスクにおいて、同モデルが持つユニークな特性が初めて体系的に調査された。 研究によると、マスク付き拡散言語モデルは従来の自己回帰型大規模言語モデルと異なり、反復的な復号化の過程で特定の優先順序に従うことが明らかになった。具体的には、まず実体(エンティティ)を復号化し、その後に関係詞や機能語を復号化し、最終段階で構造トークンを復号化するという順序である。 同時に研究では、教師あり微調整がこの自然な復号化戦略を阻害する新たな問題モードを特定した。これに対し、推論時に重みなし修正を行う「ラムダスケーリング構造復号化」という手法を提案。この手法を導入することで、BLEUスコア(翻訳品質の評価指標)が9.4ポイント向上することが確認された。 この研究成果は、拡散モデルに基づくテキスト生成技術の精度向上に向けた重要な知見を提供するものとなっている。 (出典:arXiv cs.CL)
2026年6月2日
DLLM-JEPA: マスク付き拡散言語モデルのための結合埋め込み予測アーキテクチャ結合埋め込み予測アーキテクチャ(JEPA)はビジョンにおける自己教師あり表現学習を再構築しています。最近のLLM-JEPAは自動回帰言語モデルにJEPAを移植しましたが、因果注意メカニズムから2つの大きなコストを継承しています:明示的なマルチビュー情報(テキスト-コードペアなど)が必要とされます。
arXiv cs.CL
2026年6月5日
拡散言語モデル向け自己拡張検索離散拡散言語モデルの生成精度を高める新しいアプローチが提案された。このモデルは従来と異なり、テキスト全体を並列処理してノイズを段階的に除去する仕組みを持つ。 研究チームが開発した「SARDI」は、この特性を活かした動的な情報検索フレームワークである。通常は信頼度が低いとされる予測トークンに着目し、これらを先読み信号として利用。出力が確定する前の段階で関連情報を検索することで、より正確な回答生成を実現する。 既存の検索拡張生成(RAG)技術とは異なり、SARDIは追加の訓練を必要としない。複数の段階的推論が求められるマルチホップ質問応答ベンチマークでテストした結果、従来手法を上回る性能を示した。 このアプローチにより、大規模言語モデルの幻覚問題を軽減し、より信頼性の高い回答生成が期待できる。テキスト生成の効率性と精度の両立を目指す開発において、重要な進展といえる。 (arXiv cs.CL)
2026年6月8日
ポリシー内蒸留によるデータ効率的な自己回帰型から拡散型言語モデルへの変換本研究は、自己回帰言語モデル(ARLM)を拡散言語モデル(DLM)に変換する手法を検討している。先行研究では因果的注意機構を双方向注意に置き換えてDLM目的関数で訓練していたが、これは2つの分布シフトを引き起こす。1つ目は次トークン予測目的からDLM目的への移行により、ARLMが習得した知識が失われる可能性がある。2つ目は標準DLMが訓練と推論の不整合に苦しむ。著者らはこれらの課題に対処するため、オン・ポリシー拡散言語モデル(OPDLM)を提案する。OPDLMはオン・ポリシー蒸留(OPD)により訓練され、学生モデル(双方向注意を持つARL)が自身の軌跡を生成し、教師モデル(元のARLM)がこれらの軌跡上でターゲットロジットを提供することで知識を蒸留する。このアプローチにより、DLMの訓練推論不整合を排除しながら、元のモデルからの蒸留によりARLMからの知識保持を強化する。実験結果は、OPDLMが従来手法比で15倍から7,000倍少ない訓練トークンで、幅広いタスクで良好な性能を達成することを示している。
arXiv cs.CL
2026年6月19日
拡散言語モデル:実験的分析大規模言語モデル(LLM)は、自己回帰的生成によって言語モデリングに革命をもたらし、幅広いタスクで高いパフォーマンスを実現しました。最近、拡散言語モデル(DLM)は、次トークン予測ではなく反復的なノイズ除去を通じてテキストを生成する代替パラダイムとして登場し、シーケンス全体の並列的な洗練を可能にしました。多数の拡散ベースのアーキテクチャが提案されていますが、評価プロトコル、データセット、推論予算、生成ハイパーパラメータの違いにより、それらの能力を比較し、提供されるトレードオフを理解することが困難になっています。本研究では、最新のDLMの体系的な実験的分析を提示します。具体的には、推論、コーディング、翻訳、知識、構造化問題解決を網羅する8つのベンチマークで8つの最先端DLMを評価し、生成品質と計算効率の両方を明確に考慮します。下流タスクの評価を超えて、ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略を含む、推論時間における主要因子の影響を分析し、大規模な実験を、同一条件下でトレーニングされた小規模モデルの制御された比較によって補完します。
arXiv cs.AI
2026年7月2日
残余コンテキスト拡散言語モデル拡散大規模言語モデル(dLLM)は、複数のトークンを並列でデコードできるため、純粋な自己回帰言語モデルの有望な代替手段として登場しました。しかし、最先端のブロックごとのdLLMは、「リマスキング」メカニズムに依存しており、これは最も確信度の高いトークンのみをデコードし、残りを破棄するため、実質的に計算が無駄になります。これらの破棄されたトークンから計算を再利用することが有益であることを示します。
Apple Machine Learning Research
2026年7月2日
拡散言語モデルにおけるアンマスキングポリシーの学習拡散(大規模)言語モデル(dLLM)は、多くのタスクで自己回帰型モデルと同等の下流性能を発揮するようになり、推論時の効率性向上も期待されています。dLLMの重要な設計要素の一つは、各拡散ステップでどのトークンをアンマスクするかを選択するサンプリング手順です。
Apple Machine Learning Research
2026年7月3日
インタラクティブな放射線レポート作成のための離散拡散言語モデルトークンキャンバスを左から右にトークンを放出するのではなく双方向にノイズ除去することでテキストを生成する拡散言語モデルは、自己回帰(AR)生成に匹敵するようになっています。しかし、医療基盤モデルは、ほぼ完全に自己回帰のままです。私たちは、専門家混合拡散言語モデルDiffusionGemma-26Bを適応させ、医療画像質問応答データセットで、同じサイズのAR兄弟であるGemma-4-26Bと比較ベンチマークしました。この比較では、同一のLoRAレシピを使用し、冗長性に強いLLMジャッジによってスコアリングされました。拡散モデルは、すべてのベンチマークにおいてARと同等またはそれ以上の性能を示し、ファインチューニングされたモデル(アクティブ3.8B)は最先端のビジョン言語モデルと競争力があります。また、デコーディング速度も3.5~4.4倍高速です。この同等性に加えて、拡散モデルはARにはないドラフト作成機能を提供します。それは「任意の順序でのインフィル」です。キャンバスは双方向にノイズ除去されるため、放射線科医はレポートの断片を修正し、その間のテキストをモデルに補完させることができます。
arXiv cs.AI