TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
EvoSpec: リアルタイム語彙とパラメータ適応を通じた推測的デコーディングの進化推測的デコーディングは、ドラフト・検証パラダイムを通じて大規模言語モデルの推論を加速させますが、語彙サイズの拡大に伴い出力投影層がボトルネックになります。既存の静的プルーニング方法は有効にこのオーバーヘッドを削減しますが、受け入れ率の大幅な低下という課題があります。
arXiv cs.CL
2026年6月2日
ART: 効率的な大規模言語モデルデコーディングのための注意実行時終了大規模言語モデル(LLM)における長文脈デコーディングは、広範なキー・バリュー(KV)キャッシュをフェッチするために必要なメモリ帯域幅によって厳しく制限されています。既存のKV管理方法の大多数はデコーディング前のキーのみプルーニングに依存していますが、注意出力はキーと値に共同で依存することが実証されています。
arXiv cs.CL
2026年6月17日
Pinterest、AI搭載の実験的ショッピングアプリ「Ask Pinterest」をローンチPinterestは、会話型インターフェースを通じてレコメンデーションやインスピレーションを求めることができる、AI搭載の実験的ショッピングアプリ「Ask Pinterest」をローンチしました。
TechCrunch AI
2026年6月18日
ソーシャルメディアの次なる進化:ユーザーが管理するアルゴリズムThreads、Instagram、TikTokなどのプラットフォームが、ユーザーがレコメンデーションを支えるアルゴリズムに直接影響を与えるツールを導入するにつれて、ソーシャルメディアのフィードはよりカスタマイズ可能になっています。
TechCrunch AI
2026年6月18日
構造化MoE圧縮のための属性ガイド付き・カバレッジ最大化プルーニングMixture-of-Experts (MoE)モデルは計算効率をスケールさせますが、その大幅なメモリフットプリントと推論オーバーヘッドのため、デプロイには依然としてコストがかかります。以前の圧縮手法は主にエキスパートレベルで動作し、エキスパート全体を削除するか、粗い重要度スコアでエキスパートをランク付けしていました。しかし、このようなエキスパート単位の決定は、細かい冗長性を捉えるには粗すぎることが多く、プルーニング予算の誤配分や圧縮の限界につながります。この問題に対処するため、MoEエキスパート内の情報は少数のチャネルに高度に集中しており、重要と見なされるエキスパートでさえかなりの冗長性が残っていることを観察しました。この観察に基づき、MoEモデルに特化した構造化プルーニングフレームワークを提案します。本手法は、プルーニング比率の割り当てをチャネルスコアカバレッジ最大化問題として再定式化し、属性ベースの近似を用いて効率的に解きます。
arXiv cs.LG
2026年6月19日
因果帰属によるプルーニングで大規模言語モデルの推論性能を維持大規模言語モデル(LLM)は多段階推論に優れているが、推論コストが大きい。本研究では、因果帰属プルーニング(CAP)を提案する。これは、推論タスクに対する因果的影響を測定することで重要なアテンションヘッドを特定し、これらのヘッドレベルのスコアを用いてきめ細やかな重みプルーニングをガイドする、トレーニング不要な手法である。CAPは、各アテンションヘッドについて、少数の推論問題のキャリブレーションセットでのフォワードパス中にヘッドをマスクした場合の期待される性能低下を推定する。これらの因果スコアは、対応する射影行列の重みレベルの重要度値に変換される。マグニチュードのみまたは活性化ベースの基準とは異なり、CAPの介入的測定は各ヘッドの機能的貢献を直接捉え、20%のスパース性でARC-ChallengeにおいてWandaと比較して最大61%の相対的な精度向上をもたらす。Llama-3-8B-InstructおよびMistral-7B-Instructを使用し、10%、20%、50%のスパース性でGSM8K、StrategyQA、ARC-ChallengeでCAPを評価した。
arXiv cs.CL
2026年6月19日
大規模言語モデル知識グラフ推論におけるハルシネーション検出知識グラフ(KG)推論は、既存の事実から新しい知識を推論するもので、質問応答、レコメンデーション、意思決定支援などに広く応用されている。大規模言語モデル(LLM)の急速な発展に伴い、取得したKG情報を活用するLLMベースのKG推論フレームワークがますます人気を集めている。しかし、LLMにおけるハルシネーションは依然として重大な問題である。関連するKG知識が組み込まれていても、モデルは誤った出力を生成し、誤情報や信頼できない意思決定につながる可能性がある。既存のハルシネーション検出方法は、LLMの内部状態に焦点を当てるか、取得したコンテキストとの一貫性を検証するかのいずれかであるが、どちらもKGの構造情報を無視しており、パフォーマンスが最適でない結果となっている。このギャップに対処するため、LLMベースの知識グラフ推論フレームワークのための初のハルシネーション検出方法であるLUCIDを提案する。LUCIDは、LLMのアテンションスコア、KGセマンティクス、構造情報を共同で活用する。
arXiv cs.CL
2026年6月24日
フィルターバブルの打破:マルチオブジェクティブ推薦のためのセマンティック・パレートDQNフレームワークレコメンデーションシステムは、しばしば即時的なユーザーエンゲージメントを単調に最適化することで、フィルターバブルやセマンティックな均質化を引き起こします。従来のDeep Q-Networksを含む標準的な単一目的モデルは、プラットフォーム維持と、情報多様性やプロバイダーの公平性といった重要な社会的価値とのトレードオフを処理するのに不十分です。これらの限界に対処するため、我々は推薦をセマンティックなマルチオブジェクティブ・マルコフ決定プロセスとして形式化する、マルチオブジェクティブ強化学習フレームワークを導入します。高忠実度のセマンティック埋め込みとパレートDQNエージェントを統合することにより、我々のアーキテクチャは、エンゲージメント、多様性、公平性を、静的な報酬スカラー化の落とし穴を回避しながら、区別可能で集約不可能な報酬信号として扱います。MovieLens smallデータセットでの経験的評価は、我々のハイパーボリュームベースのアクション選択が、セマンティック崩壊の原因となるフィードバックループを破壊することを示しています。
arXiv cs.AI
2026年7月1日
専門家ユーザーを超えて:エージェントは、選好を引き出すだけでなく、ユーザーが選好を構築するのを支援すべきであるエージェントは通常、専門家ユーザー、つまり明確な選好を持つユーザーを想定し、タスクが不明確な場合は常に確認の質問にデフォルトで対応します。しかし、この仮定は非現実的であると私たちは主張します。ユーザーはドメイン知識が不足していることが多く、完全な選好を形成できません。ある機能に関する選好について質問された場合、ユーザーはその機能に関する選好を形成するために必要なドメイン知識をエージェントが例や説明を介して学習するのを助けない限り、回答できない可能性があります。これらの原則を形式化するために、情報経済学のSearch-Experience-Credenceフレームワークから、エージェントの対話アクションに基づいたユーザーの選好構築モデルであるCoPrefを導入します。次に、エージェント型レコメンダーシステムでこれらのアイデアを具体的に研究し、インタラクティブなベンチマークであるCoShopを提案します。CoShopでは、エージェントはCoPrefユーザーと対話し、レコメンデーションを行います。
arXiv cs.AI
2026年7月6日
Fortress:時間的データ拡張と特徴量プルーニングによる検索レコメンデーションの安定化事例研究検索およびレコメンデーションシステムでは、特定の入力特徴量がアウトプットスコアに不安定さをもたらすことで、予測モデルが時間的な不安定性に悩まされることがよくあります。この不安定性は、下流の意思決定に一貫した予測が不可欠なマルチステージシステムにおいて、モデルの信頼性とユーザーエクスペリエンスを低下させる可能性があります。
Apple Machine Learning Research
2026年7月7日
Amazon SageMaker AIのストリーミングベンチマークとレコメンデーション結果をMLflowへこの記事では、Amazon SageMaker AIの最適化された推論レコメンデーションジョブとAmazon SageMaker AIベンチマークジョブの新しいMLflow統合を使用して、実験データを統合されたトラッキングインターフェースに自動的にストリーミングする方法を学びます。
AWS Machine Learning Blog
2026年7月8日
長文コンテキストサービングにおけるタスク品質とシステムパフォーマンスを対象としたKVキャッシュ最適化のベンチマーク大規模言語モデル(LLM)のサービングは、長文コンテキストのワークロード下でのKVキャッシュの増大によってますます制約されています。しかし、既存のKVキャッシュ圧縮技術は、異なるモデル、タスク、予算、サービングスタックで評価されていたため、比較が困難です。本稿では、量子化、プルーニング、マージといった代表的なKVキャッシュ最適化メカニズム(KIVI、TurboQuant、SnapKV、CaMを含む)について、Llama-3.1-8B-InstructとMistral-7B-Instruct-v0.3を使用してLongBenchスタイルのマルチドキュメントQA、シングルドキュメントQA、少数ショット学習、要約ワークロードで評価した、ワークロード認識型ベンチマークを提示します。このベンチマークは、コンテキスト長バケット全体にわたるタスク品質、平均出力スループット、平均初回トークン到達時間、および実現圧縮率を測定します。結果は、圧縮率だけではエンドツーエンドのパフォーマンスを予測するには不十分であることを示しています。
arXiv cs.CL
2026年7月9日
大規模行動モデル:小売顧客のプロンプタブル・デジタルツイン顧客行動モデリングは、レコメンデーション、マーケティング、意思決定支援の基盤となりますが、既存のアプローチは、決定を説明せずに予測精度を最適化するか、実際の行動データに根拠を持たせずにユーザーをシミュレーションするかのいずれかです。本稿では、大規模な小売取引データから、統合された「人物・環境」フォーミュレーションを通じて、顧客の意思決定を直接学習する大規模行動モデル(LBM)を提案します。顧客の状態は、過去の購入履歴から導き出される行動プロファイルによって表現され、製品コンテキストは、検索拡張生成(Retrieval-Augmented Generation)によって組み込まれます。このモデルは、言語化された行動データに対する継続的な事前学習、意思決定生成のための教師ありファインチューニング、そして証拠に基づくキャリブレーションのための検証可能な報酬を用いた強化学習によって訓練されます。提案されたフレームワークを、購入予測、ハードネガティブ識別、バスケット補完、プロモーション反応、ドメイン間バウチャー交換の各タスクで評価します。
arXiv cs.AI
2026年7月25日
AWSで説明可能な次善商品レコメンデーションシステムを構築AWSは、顧客一人ひとりの嗜好に合わせた精度の高い「次善商品レコメンデーションシステム」の構築方法を公開しました。このシステムは、Amazon SageMaker AIとPyTorchを基盤とし、学習済みの「アテンション」機能を搭載したマルチタワーニューラルネットワークを採用しています。 この技術により、単におすすめ商品を提示するだけでなく、なぜその商品が推奨されるのか、その根拠となる顧客の行動履歴や関心事などを説明することが可能になります。これにより、顧客はレコメンデーションへの信頼感を高め、より安心して購買行動に移ることが期待されます。 AWS Machine Learning Blogでは、このシステムの詳細なアーキテクチャや設計思想が解説されており、企業が顧客体験の向上と売上増加を目指す上での具体的な指針となる情報が提供されています。 AWS Machine Learning Blog
AWS Machine Learning Blog
2026年7月25日
AWSで構築する、説明可能な次善商品レコメンデーションシステム(金融機関向け)Amazon SageMaker AIとPyTorchを使用して構築された、金融機関向けの、説明可能な次善商品レコメンデーションシステムのアーキテクチャと設計上の決定事項を学びます。学習済みアテンション機構を備えたマルチタワーニューラルネットワークは、金融規制当局が要求する説明可能性を提供しながら、顧客ごとの正確なレコメンデーションを提供します。
AWS Machine Learning Blog
2026年7月25日
パメラ・アンダーソン、新作ダークコメディ『ローズブッシュ・プルーニング』、セカンドチャンス、そして『ベイウォッチ』再訪の可能性について語る2024年の『ザ・ラスト・ショウガール』での批評家から絶賛された役柄以来、パメラ・アンダーソンの演技キャリアは新たな方向へ進んでいる。ブロンドのセックスシンボルにふさわしい、よりメインストリームな役柄に長年専念してきたアンダーソンは、今や自身に挑戦し、恐怖を与えるようなプロジェクトに取り組んでいる。
Deadline