TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
EvoSpec: リアルタイム語彙とパラメータ適応を通じた推測的デコーディングの進化推測的デコーディングは、ドラフト・検証パラダイムを通じて大規模言語モデルの推論を加速させますが、語彙サイズの拡大に伴い出力投影層がボトルネックになります。既存の静的プルーニング方法は有効にこのオーバーヘッドを削減しますが、受け入れ率の大幅な低下という課題があります。
arXiv cs.CL
2026年5月29日
信頼度ショートカット:マスク拡散モデルの推論失敗モードarXiv:2605.29123v1 公表予定タイプ:新規 概要:マスク拡散言語モデル(MDM)は任意の順序の生成をサポートしており、信頼度ベースのデコーディングが事実上標準的な推論ポリシーとして機能している。これを最適化するため、最近のトレーニングスキームでは、生成時に観察されるマスクパターンと直接整合させることを試みている。
arXiv cs.AI
2026年5月30日
拡散モデルのグラフ-テキスト生成における復号化軌跡分析:最初に復号化されるトークンの考察マスク付き拡散言語モデルの復号化プロセスを分析した新しい研究が発表された。グラフ-テキスト生成タスクにおいて、同モデルが持つユニークな特性が初めて体系的に調査された。 研究によると、マスク付き拡散言語モデルは従来の自己回帰型大規模言語モデルと異なり、反復的な復号化の過程で特定の優先順序に従うことが明らかになった。具体的には、まず実体(エンティティ)を復号化し、その後に関係詞や機能語を復号化し、最終段階で構造トークンを復号化するという順序である。 同時に研究では、教師あり微調整がこの自然な復号化戦略を阻害する新たな問題モードを特定した。これに対し、推論時に重みなし修正を行う「ラムダスケーリング構造復号化」という手法を提案。この手法を導入することで、BLEUスコア(翻訳品質の評価指標)が9.4ポイント向上することが確認された。 この研究成果は、拡散モデルに基づくテキスト生成技術の精度向上に向けた重要な知見を提供するものとなっている。 (出典:arXiv cs.CL)
2026年6月1日
言語間での推測デコーディング推測デコーディングは大規模言語モデル(LLM)の推論において重要な要素となり、複数のトークンをドラフト作成し並列検証することで高速な生成を実現している。しかし小規模ドラフトモデルは多言語対応で顕著な性能低下が生じる傾向にある。
arXiv cs.CL
2026年6月1日
COFT:大規模言語モデルにおけるフェアな思考の連鎖推論のための反事実適合デコーディングarXiv:2605.30641v1 大規模言語モデル(LLM)は、思考の連鎖(CoT)生成中に社会的偏見を明らかにし、増幅する可能性がある。本論文では、デコード時にトークンレベルのフェアネス制御を適用する訓練不要のデコーディング方法であるCOFT(フェアな思考の連鎖)を提案し、分布自由の周辺有効性を保証する。
arXiv cs.CL
2026年6月2日
ART: 効率的な大規模言語モデルデコーディングのための注意実行時終了大規模言語モデル(LLM)における長文脈デコーディングは、広範なキー・バリュー(KV)キャッシュをフェッチするために必要なメモリ帯域幅によって厳しく制限されています。既存のKV管理方法の大多数はデコーディング前のキーのみプルーニングに依存していますが、注意出力はキーと値に共同で依存することが実証されています。
arXiv cs.CL
2026年6月2日
BudgetDraft:スパースKV推測デコーディング用の受け入れ認識マルチビュー訓練推測デコーディングは、ドラフタが複数のトークンを提案し、検証者が並列で検証することによって、自己回帰デコーディングを高速化します。リソース制約のあるデプロイメントでは、ドラフタはスパースKVキャッシュを使用して、固定KV予算下でのピークGPUメモリとエンドツーエンドレイテンシを制限し、検証者が検証します。
arXiv cs.LG
2026年6月2日
TrustLDM: 言語拡散モデルの信頼性ベンチマーク言語拡散モデル(LDM)の急速な発展は、言語処理における自己回帰型モデルの優位性に課題を提示しています。ただし、その柔軟な任意順序デコーディング戦略は高速なデコーディング速度を実現する一方で、新しい信頼性の課題をもたらす可能性があります。
arXiv cs.CL
2026年6月2日
SENSE: 検索ベースの推測的デコーディングのためのセマンティック埋め込みナビゲーション(ソフトゲート評価付き)推測的デコーディング(SD)は軽量なドラフトモデルを使用して候補トークンを提案し、ターゲットモデルによって並列で検証することで、大規模言語モデル(LLM)の推論を加速化します。生成品質を損なわないまま実現されます。検索ベースの推測的デコーディング(RSD)はその利点から好まれています。
arXiv cs.CL
2026年6月8日
低データ・高次元出力問題のためのガウス過程潜在因子回帰科学分野では、少ない訓練例から高次元出力を予測する回帰タスクが頻繁に必要とされる。多出力ガウス過程は低データ体制で優れているが、通常は高次元出力に対応できない。PCA-GPなどの圧縮後予測パイプラインは高次元性を扱えるが、予測ではなく再構成に最適化された基底に依存している。このギャップに対処するため、ガウス過程事前分布から抽出した低次元潜在状態の線形ガウスデコーディングとして各出力を表現するモデルを提案する。デコーダの重みを解析的に周辺化することで、圧縮と予測を単一の目的関数に結合し、高次元出力に対応可能にした。このモデルをGaussian process latent factor regression (GPLFR)と呼ぶ。本研究では、ロッキータイプ系外惑星の全球気候モデルの初の空間分解エミュレータを構築することによってGPLFRを実証した。
arXiv cs.LG
2026年6月8日
ポリシー内蒸留によるデータ効率的な自己回帰型から拡散型言語モデルへの変換本研究は、自己回帰言語モデル(ARLM)を拡散言語モデル(DLM)に変換する手法を検討している。先行研究では因果的注意機構を双方向注意に置き換えてDLM目的関数で訓練していたが、これは2つの分布シフトを引き起こす。1つ目は次トークン予測目的からDLM目的への移行により、ARLMが習得した知識が失われる可能性がある。2つ目は標準DLMが訓練と推論の不整合に苦しむ。著者らはこれらの課題に対処するため、オン・ポリシー拡散言語モデル(OPDLM)を提案する。OPDLMはオン・ポリシー蒸留(OPD)により訓練され、学生モデル(双方向注意を持つARL)が自身の軌跡を生成し、教師モデル(元のARLM)がこれらの軌跡上でターゲットロジットを提供することで知識を蒸留する。このアプローチにより、DLMの訓練推論不整合を排除しながら、元のモデルからの蒸留によりARLMからの知識保持を強化する。実験結果は、OPDLMが従来手法比で15倍から7,000倍少ない訓練トークンで、幅広いタスクで良好な性能を達成することを示している。
arXiv cs.CL
2026年6月10日
多様体逸脱の緩和:信頼性の高いMLLMデコーディングのための不確実性を認識したサブスペース修正arXiv:2606.09859v1 新規発表 要約:MLLMは、視覚的入力と一致しないオブジェクトを頻繁に幻視します。この問題は通常、言語プリアイアンスへの過度の依存に起因しますが、これは視覚的コンテキストを上書きする可能性があります。最近のトレーニングフリーのデコーディング戦略は、言語プリアイアンスを罰することでこれに対処します。しかし、これらの方法は、視覚的証拠との整合性に応じて、言語プリアイアンスが有益であると同時に有害であるという二重の性質を見落としています。特に、言語プリアイアンスを盲目的に抑制すると、モデルのセマンティック多様体が破壊され、パフォーマンスが低下する現象が発生します。これを「多様体逸脱」と呼びます。この問題に対処するために、Manifold-Guided Adaptive Projection (MGAP) を提案します。これは、幻視を緩和しつつ、表現構造を維持する、ジオメトリを認識したトレーニングフリーのデコーディング手法です。MGAPはまず、SVDを介して盲目の隠れ状態から言語プリアイアンスサブスペースを構築します。
arXiv cs.LG
2026年6月11日
Google、拡散型テキスト生成モデル「DiffusionGemma」公開 ローカルGPUで毎秒1000トークン超Googleは、テキスト生成を最大4倍高速化する実験的AIモデル「DiffusionGemma」を発表した。画像生成の拡散手法を応用し、256トークンを一括で並列生成することで従来の自己回帰型モデルのボトルネックを解消する。
ITmedia AI+
2026年6月11日
LatticeBridge:忠実な構造化シーケンス合成のためのレアケース逐次推論arXiv:2606.11203v1 新規発表 構造化シーケンス生成では、しばしば1つの出力で複数の入力由来の制約を満たすことがモデルに求められます。標準的なデコーディング手法では、流暢な継続に高い確率を割り当てる一方で、必要なアンカーをすべて同時に実現する継続には低い確率を割り当てる可能性があります。これをレアケース逐次推論問題として研究します。LatticeBridgeは、コンパクトなプレフィックス言語モデル、インスタンスコンパイルされたサーフェスオートマトン、そしてリサンプリング、マルチレベル分割、インスタンス提供フレーズから導出されるソースサポート提案項を備えたツイスト逐次モンテカルロ(SMC)デコーダーを組み合わせます。制約表現は各入力インスタンスからコンパイルされ、手動でキュレーションされた語彙クラスに依存しません。
arXiv cs.CL
2026年6月13日
DiffusionGemmaの「生成途中の揺らぎ」で概念の矛盾を測る何を試したのか https://deepmind.google/models/gemma/diffusiongemma/ DiffusionGemmaは、通常の自己回帰型LLMのように左から1トークンずつ文章を伸ばすのではなく、いったんランダムなトークンで満たしたキャンバスを…
Zenn
2026年6月16日
自然言語における任意の条件付きモデルの単純化Causal Transformersは、同時分布の自己回帰的因数分解を通じてシーケンスをモデル化し、効率的な左から右へのデコーディングと条件付き尤度計算を可能にします。しかし、任意の条件(例:過去と未来のトークンに条件付けられたテキストブロック)からのサンプリングや評価を効率的に行うことはできません。最近の研究では、新しいアーキテクチャを通じてこの問題の解決を目指していますが、そのような条件のモデル化が最適でなく、生成結果が低下することがよくあります。我々は、標準的なCausal Transformersに簡単な変更を加えることで、単一のフォワードパス内で、過去、未来、混合コンテキストを含む任意の条件からの評価とサンプリングを可能にするArbitrary Conditionals GPT (AC-GPT)を提案します。先行研究とは異なり、我々の手法は、自然言語における高いパフォーマンスと効率的なトレーニングの両方に不可欠な、標準的な左から右への順序と次トークン予測の目的を維持します。重要なのは、この互換性により、既存のLLMを任意の条件付けのためにファインチューニングできることです。
arXiv cs.CL
2026年6月17日
Amazon SageMaker AIでP-EAGLEによる並列投機的デコーディングを実現この記事では、Amazon SageMaker AI内でP-EAGLEを直接使用する方法を解説します。SageMaker JumpStartカタログから互換性のあるモデルを選択し、並列ドラフトの仕様を設定して、生成AIアプリケーションを高速化する高度に最適化されたリアルタイムSageMaker AIエンドポイントをデプロイする方法をデモンストレーションします。
AWS Machine Learning Blog
2026年6月18日
JetFlow:並列ツリードラフティングで投機的デコーディングのスケーリング限界を打破投機的デコーディング(SD)は、複数のトークンをドラフトし、それらを並列に検証することで、自己回帰型大規模言語モデル(LLM)を高速化しますが、スケーリング上の限界に直面しています。ドラフト予算を増やしても、受理率が高く、ドラフトのオーバーヘッドが低い場合にのみ速度が向上します。この限界は、従来のヘッドベースのSD手法が因果関係と効率性のジレンマに直面しているため、打破が困難でした。自己回帰型ドラフターは、パス条件付き候補を生成し、これらは高い受理長を持つツリー投機的デコーディングに効果的ですが、そのドラフトコストはツリーの深さに比例して増加します。双方向ブロック拡散ドラフターは、一度のパスですべての位置を生成しますが、そのブランチに依存しない周辺分布は、個々にはもっともらしくても相互に矛盾するツリーを形成する可能性があり、予算を無駄にし、受理率を低下させます。本稿では、ヘッドベースのSDフレームワークであるJetFlowを提案します。これは、ワンフォワードドラフティングの効率性とブランチごとの因果条件付けを組み合わせたものです。
arXiv cs.CL
2026年6月18日
大規模音声言語モデルのための継続的音声思考大規模音声言語モデル(LALM)は、音声文字起こしから音楽分析まで、多様な音声理解タスクにおいて印象的な能力を示してきました。しかし、LALMは通常、テキストに合わせた応答を生成するように訓練されているため、その隠れ状態は、音響情報を保持するためではなく、テキスト生成のために段階的に形成されます。その結果、音声が持つ音素の詳細、イントネーション、音響イベント、感情、ピッチなどの多様な音響コンテンツは、途中で失われ、応答で活用することが困難になります。私たちは、応答生成に先立って音響情報を整理するための継続的な潜在ワークスペースを音声言語モデルに装備するフレームワークであるContinuous Audio Thinking(CoAT)を提案します。これは、音声専門家からの知識蒸留によって基盤が作られています。思考空間内では、モデルは応答を生成する際に、専門家からの知識蒸留によって提供される豊かな音響情報を利用できます。さらに、提案された継続的思考ブロックは単一のプリフィルで処理できるため、CoATはベースラインを超える追加の自己回帰デコーディングコストを必要としません。
arXiv cs.CL
2026年6月19日
ITNet: 畳み込み、アテンション、再帰を包含する学習可能な積分変換畳み込みネットワーク、再帰ネットワーク、トランスフォーマーは、それぞれ異なる帰納的バイアス(局所性、逐次メモリ、コンテンツ依存のペアワイズ相互作用)をエンコードしており、その誕生以来、数学的に区別されてきた。本研究では、この断片化は、信号の処理方法における根本的な多様性を反映するのではなく、単一の基盤となる数学的オブジェクト、すなわち学習可能な積分変換の不完全な見方であることを示す。我々は、位置と特徴の両方に依存する学習可能なカーネルを中心に構築された統一アーキテクチャ、Integral Transform Network (ITNet) を紹介する。このカーネルは、ペアワイズ相互作用をモデル化する小さなニューラルネットワーク、具体的にはMLPとして実装されており、モデルがデータからその動作を適応させることを可能にする。畳み込み、自己アテンション(マルチヘッドを含む)、自己回帰再帰(LSTM、GRU、S4、Mambaを含む)が適切なパラメータ化の下で特殊なケースとして現れること、そしてITNetが連続演算子の普遍的近似器であることを示す。
arXiv cs.AI
2026年6月19日
LLMのコンテキスト内学習における偶然的uncertaintyの定量化:予測信頼性の頑健な指標に向けてコンテキスト内学習(ICL)は、LLMが少数のデモンストレーションから新しいタスクに適応することを可能にしますが、その信頼性は依然として懸念事項です。予測はプロンプト設計とコンテキスト理解能力の両方に非常に敏感であり、失敗がデータ特性に起因するのか、モデルの限界に起因するのかが不明瞭になります。不確実性の分解、すなわち偶然的(aleatoric)なものと認識的(epistemic)なものの分離は、この設定において特に重要ですが、標準的な生成タスク用に設計された既存の方法では、ICLのユニークなダイナミクスを捉えきれません。この問題に対処するため、ベイズ的見解とICLのメカニズム的解釈可能性に基づいて構築された、self-function vectorという概念を導入します。これらのベクトルは、内部モデル表現を活用して、コンテキスト内プロンプティング中に学習された潜在概念をモデル化します。これにより、ベイズ的フレームワーク内で偶然的uncertaintyを直接推定することが可能になり、脆弱な入力やデコーディング操作への依存を回避できます。
arXiv cs.CL
2026年6月19日
拡散言語モデル:実験的分析大規模言語モデル(LLM)は、自己回帰的生成によって言語モデリングに革命をもたらし、幅広いタスクで高いパフォーマンスを実現しました。最近、拡散言語モデル(DLM)は、次トークン予測ではなく反復的なノイズ除去を通じてテキストを生成する代替パラダイムとして登場し、シーケンス全体の並列的な洗練を可能にしました。多数の拡散ベースのアーキテクチャが提案されていますが、評価プロトコル、データセット、推論予算、生成ハイパーパラメータの違いにより、それらの能力を比較し、提供されるトレードオフを理解することが困難になっています。本研究では、最新のDLMの体系的な実験的分析を提示します。具体的には、推論、コーディング、翻訳、知識、構造化問題解決を網羅する8つのベンチマークで8つの最先端DLMを評価し、生成品質と計算効率の両方を明確に考慮します。下流タスクの評価を超えて、ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略を含む、推論時間における主要因子の影響を分析し、大規模な実験を、同一条件下でトレーニングされた小規模モデルの制御された比較によって補完します。
arXiv cs.AI
2026年6月20日
クエリはどこに配置すべきか?デコーディングダイナミクスによる拡散LLMにおけるコンテキスト内学習のポジショナルバイアスの解明と緩和コンテキスト内学習(ICL)は自己回帰(AR)LLMで広く研究されているが、拡散大規模言語モデル(dLLM)におけるそのメカニズムはほとんど未解明のままである。ARモデルは単方向の因果マスキングに制約されるのに対し、dLLMは本質的に双方向アテンションを利用し、クエリ配置に広範な空間的柔軟性を提供する。しかし、現在の実践ではARスタイルの後続クエリテンプレートが慣習的に継承されており、構造的なパラダイムシフトが見過ごされがちである。本稿では、クエリ位置がdLLMにおいて実際に一次変数であることを明らかにする包括的な分析を提示する。経験的な分離を通じて、位置の変動が例のセマンティック品質と同等に生成品質に影響を与えることを実証する。内部的には、この位置的感度は、アテンションフローにおける空間的な「新近性効果」と、デコーディング軌跡におけるタスク依存的なシフトに起因する。正解ラベルなしでこの不安定性を緩和するために、従来の単一ステップ信頼度(C_decoded)がdLLMでは失敗することを明らかにする。
arXiv cs.CL
2026年6月25日
Dustin:投機的デコーディングによる効率的な長文脈生成のためのドラフト拡張スパース検証投機的デコーディングは、マルチバッチ長文脈大規模言語モデル(LLM)の推論スループットを向上させますが、その効率は、キー・バリュー(KV)キャッシュのロードがレイテンシを支配する検証ボトルネックによってしばしば制限されます。既存の圧縮方法はこの状況では機能しません。静的除外は顕著性のシフトによる精度低下を引き起こし、動的選択は検証パス中に許容できない計算オーバーヘッドを導入します。私たちは、長文脈の投機的デコーディングのために設計されたスパース検証フレームワークであるDustinを提案します。Dustinは、ドラフトモデルからのルックアヘッド信号とターゲットモデルからの履歴アテンションを統合し、マルチステップ検証ウィンドウ全体で高忠実度で重要なトークンを特定します。再計算レイテンシを削減するために、このアプローチはさらに、アテンションヘッドの最小サブセットに重要度スコアリングを制限するスパース推定スキームを採用しています。
arXiv cs.CL
2026年6月25日
SemEval-2026タスク13におけるDream:単一パス機械生成コード検出のためのSALSA大規模言語モデル(LLM)はコード生成を革新しましたが、著作者、評価の整合性、ソフトウェアの信頼性に関する懸念も高まっています。SemEval-2026タスク13サブタスクAは、特に未知のプログラミング言語やアプリケーションドメインをまたいだ分布外(OOD)汎化に重点を置き、コードスニペットに対する二項分類として検出を運用化します。本研究では、各クラスを専用の出力トークンにマッピングし、モデルが構造化された応答で単一トークンラベルを発行するようにトレーニングする、単一パス自己回帰LLM構造化分類(SALSA)スタイル定式化を提案します。手作りの特徴量や決定ルールを設計するのではなく、この定式化は著作者の判断をモデルに委任します。OODロバスト性を向上させるために、言語間のバランスの取れたサンプリングと、パラメータ効率の良いファインチューニングおよび保守的なトレーニング(低学習率、単一エポック)を組み合わせ、トレーニングドメインへの過学習を回避します。
arXiv cs.CL
2026年6月29日
EntMTP:エントロピー誘導型マルチトークン予測によるLLM推論の高速化マルチトークン予測は、トレーニング中のデータ密度を向上させ、下流のテキスト生成品質を改善することが示されており、自己投機的デコーディングの事実上のアプローチとして機能します。MTPヘッドを使用する既存の基盤モデルおよびオープンソースモデルは、生成シーケンス全体で静的なツリーベースの注意トポロジーにコミットしており、これは、推論の深さ、したがって検証中に必要な計算量が、コンテキストに関係なく一定であることを意味します。これは、自然言語のエントロピーパターンとは根本的に一致していません。自然言語では、低エントロピー領域は信頼性の高いマルチステップドラフトをサポートすることが多いですが、高エントロピー領域はより保守的な推論を必要とします。これを解決するために、ローカル生成エントロピーの実行中の推定値に基づいて、タスク固有のパレート最適ツリーのセットからツリーベースの注意トポロジーを切り替える、トレーニング不要のスケジューラであるエントロピー誘導型マルチトークン予測(EntMTP)を提案します。
arXiv cs.CL
2026年6月29日
内部化する未来:ワールドモデルプランニングのための統一的エージェント訓練パラダイム大規模言語モデル(LLM)エージェントは逐次的意思決定において強力な能力を示していますが、長期間のタスクにおいては依然として根本的に受動的です。標準的なエージェントは、コミットメントの前に潜在的な計画を評価するための「もしも」推論を使用する人間とは異なり、将来の結果をシミュレートするための内部ワールドモデルを備えていません。したがって、本研究では、将来を意識したプランニングを内部化することを提案します。これは、単一の自己回帰モデルを訓練して、将来の状態ロールアウトと計画条件付き成功推定(Q値のテキスト類似)の両方を言語化することによって行われます。重要なことに、フォーマットと能力のギャップを特定しました。ポストトレーニング中にルックアヘッドトレースでエージェントをファインチューニングするだけでは、真の予測的基盤なしに先見性の表層的な模倣につながります。このギャップを埋めるために、3段階のトレーニングパラダイムを導入します。
arXiv cs.AI
2026年7月1日
投機的デコーディングによる推論高速化(Eagle3・DFlash・DSpark)ここ最近、立て続けに投機的デコーディングの手法が出てきているので、備忘録も兼ねて記事にまとめました。投機的デコーディングの概要をふまえた上で、EAGLE-3、DFlash、DSpark という3つの発展的な手法について紹介します。 はじめに:投機的デコーディングとは何か?
Zenn
2026年7月2日
拡散言語モデルにおけるアンマスキングポリシーの学習拡散(大規模)言語モデル(dLLM)は、多くのタスクで自己回帰型モデルと同等の下流性能を発揮するようになり、推論時の効率性向上も期待されています。dLLMの重要な設計要素の一つは、各拡散ステップでどのトークンをアンマスクするかを選択するサンプリング手順です。
Apple Machine Learning Research
2026年7月2日
残余コンテキスト拡散言語モデル拡散大規模言語モデル(dLLM)は、複数のトークンを並列でデコードできるため、純粋な自己回帰言語モデルの有望な代替手段として登場しました。しかし、最先端のブロックごとのdLLMは、「リマスキング」メカニズムに依存しており、これは最も確信度の高いトークンのみをデコードし、残りを破棄するため、実質的に計算が無駄になります。これらの破棄されたトークンから計算を再利用することが有益であることを示します。
Apple Machine Learning Research