TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
ディベートは弱い審査官がより強いモデルに報酬を与えるのに役立ちます理論的な約束にもかかわらず、スケーラブルな監視プロトコルとしてのディベートは混合した実証結果をもたらしています。いくつかの設定では利益を得ていますが、特に審査官が隠された情報を持たない場合は、他の設定では効果がありません。より強いディベーター・より弱い審査官の設定で提案者批評家ディベートを研究しました。
arXiv cs.CL
2026年6月1日
PReMISE: LLM審査官の測定仕様としてのポリシールーブリックLLM審査官はオープンエンド型の回答を評価する際にますます使用されているが、それらのスコアはそれらを条件付ける採点基準に大きく依存している。「有用で事実的」であることを要求する曖昧なルーブリックは、事実を作成したり、ユーザーの意図に違反したりする磨かれた回答に報酬を与える可能性がある。再利用可能なルーブリックを扱っている。
arXiv cs.AI
2026年6月6日
趣里主演7月期連ドラ『大空港』共演者第1弾 眞栄田郷敦&板垣李光人が出演決定俳優・趣里が主演を務める7月スタートのテレビ朝日系木曜ドラマ『大空港~GATE24~』(毎週木曜 後9:00)の第1弾共演者が発表された。超エリート入国審査官役に眞栄田郷敦、現場たたき上げの税関職員役に板垣李光人が決定した。
産経新聞
2026年6月6日
眞栄田郷敦が超エリート入国審査官、板垣李光人が税関職員役で趣里主演『大空港~GATE24~』に出演決定【コメントあり】(TV LIFE web)趣里が主演を務める『大空港~GATE24~』(テレビ朝日系 7月スタート 毎週(木)午後9時~9時54分)に、眞栄田郷敦と板垣李光人の出演が決定した。 本作は、国の境界線=ボーダーとなる空港を舞
Yahoo!ニュース エンタメ
2026年6月6日
眞栄田郷敦、入国審査官役で趣里主演『大空港~GATE24~』出演 板垣李光人は税関職員に(リアルサウンド)7月期のテレビ朝日系木曜ドラマ枠で放送される趣里主演ドラマ『大空港~GATE24~』に、眞栄田郷敦と板垣李光人が出演することが決定した。 本作は、『ドクターX ~外科医・大門未知子~』や『緊急取
Yahoo!ニュース エンタメ
2026年6月9日
会議で話を遮られる人が無意識に出している「発言終了サイン」とは - ニュースな本会議やディベートでの発言中に、話をかぶせられた経験はないだろうか?その原因はあなたにあるかもしれない。実は、話を途中で遮られてしまう人は、「発言が終わるサイン」をうまく出せていないことが多い。最後まで聞いてもらうために必要なこととは?※本稿は、編集者の水野太貴『会話の0.2秒を言語学する』(新潮社)の一部を抜粋・編集したものです。
ダイヤモンド・オンライン
2026年6月23日
PEAR: 順列等変適応ルーティングマルチエージェントディベートマルチエージェントディベートは、反復的なピアレビューを通じて大規模言語モデル(LLM)の信頼性を向上させます。しかし、固定トポロジーはしばしば永続的な位置バイアスを導入し、信頼性の低いエージェントを増幅させ、役割割り当てへの高い感度を引き起こします。本稿では、推論時に通信役割とスパーストポロジーを連続的なディベートラウンド間で動的に再構成する推論時間プロトコル、Permutation-Equivariant Adaptive Routing Multi-Agent Debate (PEAR) を紹介します。進化するエージェントの状態に基づいて戦略的にエージェントから役割への割り当てを切り替えることで、PEARはエージェントが特権的なネットワーク位置を永続的に占めることを防ぎ、またはディベート全体にわたって影響力をより均等に分散させます。PEARを同変スパースルーターとして理論的に特徴付けます。これは、エージェントの再ラベリング下での精度を維持しつつ、ルーティング複雑性を低減し、汎化性能を向上させます。
arXiv cs.AI
2026年6月25日
エージェント型説得における複合的失敗の診断と緩和:分類学的戦略検索を通じてマルチステップでオープンエンドな環境における基盤モデルエージェントは、初期の誤りが長期間の軌跡を汚染する複合的エラーに頻繁に悩まされます。マルチエージェントディベート(MAD)は決定論的なドメインで成功を収めていますが、説得のような主観的なタスクでは、エージェントは深刻な問題のドリフトと迎合的な同調に苦しんでいます。標準的なRetrieval-Augmented Generation(RAG)におけるセマンティックリークがこれらの失敗の再現可能なトリガーであることを特定しました。これは、標準RAGが論理的必然性よりも語彙の重複を優先するためです。このリークを排除するために、Taxonomic Strategy RAG(TS-RAG)を導入しました。これは、議論の構造とトピックの内容を分離するために、戦略を離散的なカテゴリのボトルネックにルーティングするシステム介入です。ゼロショット・クロスドメイン評価により、TS-RAGは標準的なセマンティック検索が崩壊する抽象論理の転移を大幅に改善することが示されました。
arXiv cs.AI
2026年7月24日
UZH共有タスク2026におけるLLM-INSTRUCT:段落レベルの論証マイニングのための制約認識型検索と選択的ディベート国連およびユネスコ決議における段落レベルの論証マイニングに関するArgMining 2026のUZH共有タスクで優勝したシステム、LLM-INSTRUCTを紹介します。このタスクは、最大8Bパラメータのオープンウェイトモデルのみを使用し、厳格なJSONスキーマ設定下での段落タイプ分類、141個の公式タグのサブセット予測、および指向性関係予測を要求します。このタスクを制約付き構造化予測として捉えます。システムはまず、メタデータ認識型密接検索で候補タグ空間を絞り込み、次に次元ごとの上限を持つ制約付きデコーディングを適用し、不確実なケースのみを3エージェントのディベートブランチにエスカレートし、最終的に出力スキーマを検証します。公式リーダーボードでは、LLM-INSTRUCTは総合1位、F1スコアで1位、LLM-as-a-Judgeで5位となりました。開発中、設定検索により、内部タスク2スコアを4.421に維持しながら、タスク1bマイクロF1を35.83%から40.08%にさらに改善しました。主な教訓は単純です。生成前に決定空間を削減すると、精度と提出の堅牢性の両方が向上します。
arXiv cs.CL