ai2026/6/2 13:00:00

大規模言語モデルにおけるインタラクティブ推論の評価:実行可能なゲームを用いた階層的ベンチマーク
ニュース概要
推論を能動的な証拠収集と信念更新として扱うマルチターン対話型推論評価フレームワークを紹介します。LLMはタスクルールのみを受け取り、隠れた環境への的を絞ったクエリを発行し、時間とともに部分的な観察を統合し、推論を停止する時期を決定する必要があります。
ニュースタイムライン
2026年6月26日
Know2Guess: 大規模言語モデルの知識境界評価のための汚染認識型マルチゾーンベンチマークarXiv cs.CL
2026年7月13日
大規模言語モデルによるファンダメンタル分析の拡張:投資家向けブリーフ生成のためのRAGベースシステムarXiv cs.CL
2026年7月16日
一般的な分布特性のためのインタラクティブ証明Apple Machine Learning Research
2026年7月20日
LVSum:タイムスタンプを考慮した長尺動画要約のためのベンチマークApple Machine Learning Research
2026年7月24日
大規模言語モデルのパーソナライゼーション能力のベンチマークarXiv cs.AI
記事AI質問チャット
PREMIUMこの記事についてAIが質問に答えます。背景・要約・影響まで深堀り。
ログインして利用関連記事
こんな記事も読まれています
この記事について疑問がありますか?
事実誤認や不適切な内容について通報できます (要ログイン)。
異議申し立て・通報










