TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月29日
GTA:スケーラブルなWebエージェント用ロングホライズンタスク生成arXiv:2605.29218v1 文書の発表。言語モデルをブラウジングおよびツール使用機能と組み合わせたWebエージェントは、オープンなWebアシスタントとしての可能性を示していますが、スケーラブルなプロセスレベルの監督の不足により進展が制限されています。既存のベンチマークは主に手動で構築されており、粗い開始ゴール注釈のみを提供しています。
arXiv cs.AI
2026年6月1日
LongDS-Bench:長期ホライズンエージェント型データ分析の失敗について実世界のデータ分析は本質的に反復的であるが、既存のベンチマークはほぼ孤立した、または短い対話的タスクのみを評価しており、長期ホライズンにおけるエージェントの分析文脈追跡能力は未検証である。長期的で複数ターンのデータ分析のためのベンチマークLongDSを紹介する。
arXiv cs.LG
2026年6月2日
デモンストレーションから報酬へ:VLM報酬モデルのためのテスト時プロンプト最適化強化学習は正確な報酬関数に依存しており、ロボティクスなどの実世界アプリケーションではしばしば手作業で作成されるか利用できません。最近の研究では、事前学習済みビジョン言語モデル(VLM)の零ショット推論能力を報酬モデルとして活用することが検討されていますが、慎重な調整なしに実施することは困難です。
arXiv cs.LG
2026年6月4日
Cerebras CEO、スケールでのAI推論提供について語るAI推論インフラの経済性に焦点 Cerebras Systemsのアンドリュー・フェルドマンCEOは、ブルームバーグ・テック2026でAI推論サービスの大規模提供における経済的課題について言及した。同社は、AIモデルの推論処理を効率的かつ低コストで配信するための戦略を展開している。 AI推論は、学習済みモデルを用いた予測処理を指しており、実応用では推論の処理効率と採算性が重要となる。フェルドマンCEOの発言から、Cerebrasが現在のAIインフラストラクチャの課題を認識し、スケール段階での推論提供に向けた独自のアプローチを模索していることが伺える。 業界では、AI技術の商用化が進む中、高い計算処理を低コストで実現できるインフラの整備が競争力の源となっている。同社の経営方針は、今後のAI推論市場の発展方向を示す動きとして注視される。 (出典:Bloomberg)
2026年6月5日
TailLoR: パラメータ効率的継続学習における主要成分の保護機械学習モデルの継続学習において、新たなパラメータ効率化手法が提案された。arXiv上で発表された「TailLoR」と呼ばれるこの手法は、複数のタスクを順序立てて学習する際に、モデルの性能を維持しながら計算量を削減するアプローチである。 TailLoRの特徴は、事前学習済みモデルの重要な特性を活用する点にある。既存モデルの基本的な構造を参考基準として固定し、そこからの微調整を行う仕組みで、新しいタスク学習時に以前習得した知識の損失を抑制する。 手法の核となるのはスペクトルペナルティと呼ばれる制御機構で、モデル更新時に重要な成分への悪影響を最小化する。同時に、スペクトル分解における低ランク部分への適応可能性を確保することで、新規タスクの学習効率を損なわないよう設計されている。 この研究は、限られた計算資源で複数タスクに対応する必要があるAI応用分野での実用化が期待される。パラメータ効率性と学習性能のバランスを取る課題に対する一つの解決策として注目されている。
arXiv cs.LG
2026年6月8日
モデルの次は「ロングホライズン・タスク」へ——ELYZA 曽根岡氏が語る、LLM 主戦場の大転換本稿はKDDIが運営するサイト「MUGENLABO Magazine」に掲載された記事からの転載 「大規模言語モデル自体は、2018年10月に Google の BERT から始まった」。ELYZA代表取締役 CEO の […]
THE BRIDGE
2026年6月8日
業務に溶け込む AI を作る。ELYZA 曽根岡侑也氏が語る、ELYZA Works の設計思想本稿はKDDIが運営するサイト「MUGENLABO Magazine」に掲載された記事からの転載 前編では、LLM の主戦場が「ロングホライズン・タスク」に移り、その成立要件が何かについて、ELYZA代表取締役 CEO […]
THE BRIDGE
2026年6月11日
ProHiFlo:階層的フローマッチングと関数的ガイダンスによる新規タンパク質生成de novoタンパク質生成は、治療薬設計、酵素工学、合成生物学において革新的な可能性を秘めています。拡散ベースおよびフローマッチングアプローチは進歩を遂げていますが、通常は単一解像度で動作し、機能的制約を組み込むメカニズムを欠いています。本稿では、3つの革新的な階層的フローマッチングフレームワークであるProHiFloを提案します。(1) 骨格構造をモデリングしてから全原子座標へと洗練させる粗視的から微視的への生成により、精度を維持しながら計算コストを削減します。(2) 事前学習済み予測器を活用した機能的ガイダンスにより、再学習なしで望ましい特性へと生成を誘導します。(3) 効率的なマルチスケール処理のための適応型SE(3)-同変アーキテクチャ。非条件付き生成、モチーフ足場構築、機能設計における実験は、4回のサンプリングステップを削減しながら、最先端のパフォーマンスを示しました。酵素活性部位の足場構築では、ProHiFloはRFDiffusionの41.2%に対し、58.9%の成功率を達成しました。
arXiv cs.LG
2026年6月16日
AIエングラム:人工知能における記憶痕跡の探求記憶形成は知能の根幹をなすが、ディープニューラルネットワークが生物学的記憶単位に類似した識別可能な記憶痕跡を保持するかどうかは未解決の問題である。本研究では、特異性、再活性化、十分性、必要性という神経科学的基準を制約付き逆問題として形式化することにより、そのような「AIエングラム」を識別するための幾何学的フレームワークを導入する。グローバルに絡み合ったパラメータから個々の記憶痕跡を分離する閉形式推定器を導出し、この生物学的に導出された解がパラメータ多様体上の自然勾配更新に対応することを示す。AIエングラムは、学習済み知識の外科的操作を可能にする。反復最適化なしに、線形算術演算によって任意のサブセットの記憶を合成または消去できる。単純なMLPからLLMに至るまでの実験は、AIエングラムの因果的妥当性と実質的なスケーラビリティを実証する。これらの結果は、生物学的記憶の理論と人工表現学習の間の橋渡しをし、ディープネットワークが分散ストレージ内で機能的特異性を同時にどのようにサポートするかについての幾何学的洞察を提供する。
arXiv cs.AI
2026年6月17日
デジタルツインシミュレーションによる治療応答最適化臨床意思決定支援AIシステム臨床意思決定支援AIシステム(CDSAS)は、厳格な安全制約を遵守しながら、刻々と変化する患者の状態にリアルタイムで適応する必要があります。本研究では、治療効果(TE)推定、治療経過シミュレーションのための患者デジタルツイン(DT)、逐次意思決定のための強化学習(RL)を統合したオンライン適応フレームワークを提案します。AIシステムは、まず過去の医療記録で訓練され、継続的な学習ループで運用されます。安全性を確保するため、ルールベースのモジュールがバイタルサインを監視し、禁忌の治療をブロックします。内部モデルの不一致が強いケースは、臨床医のレビューのためにフラグが立てられ、実験では事前学習済みアウトカムモデルを介してシミュレートされます。本フレームワークは、合成臨床シミュレータとCancer Genome Atlas(TCGA)からの実際の卵巣がんデータセットの両方を使用して検証されます。シミュレーションおよび臨床設定の両方において、提案手法は標準的な計算ベースラインと比較して、治療法の推奨において優れた有効性と安定性を示しました。
arXiv cs.AI
2026年6月19日
富士通に対し、議員らが「直ちに」ポスティング・ホライズン被害者への支払いを要求下院ビジネス委員会の委員長を務めるリアム・バーン氏は、あまりにも多くの事業者がまだ補償を待っていると述べている。ポスティング・ホライズンITスキャンダルの中心となっている日本のテクノロジー企業は、議会委員会から、被害者への補償金支払いについて「直ちに」行うよう求める声に直面している。
The Guardian Business
2026年6月24日
ModTGCN:テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークグラフベースのテキスト分類モデルは、通常、局所的な近傍集約に依存し、意味的な文書グラフが強力なクラス一致クラスタリングを示すにもかかわらず、グローバルなコミュニティ構造を見落としています。これを無視すると、クラス境界が不明瞭になり、過度の平滑化につながる可能性があります。本稿では、クロスエントロピーとモジュラリティベースの補助目的を共同で最適化し、クラスに一致する文書コミュニティを促進すると同時に、識別表現を維持する、テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークであるModTGCNを提案します。モジュラリティ項は、トランスフォーマー埋め込み(事前学習済みまたはファインチューニング済み)から派生した文書間類似性グラフで計算されます。スケーラビリティを向上させるために、元の異種TextGCNグラフを文書-単語および単語-単語の個別のコンポーネントに分離し、トレーニング速度を2倍から10倍向上させました。さらに、モジュラリティ最適化のためのグラフ構築戦略、ラベルを意識したエッジ再重み付け、および監視の選択について研究します。
arXiv cs.CL
2026年6月24日
ニューロシンボリック・ドライブ:運転VLAのためのルール根拠に基づく忠実な推論連鎖思考(CoT)推論を組み込んだ運転VLAモデルは、事前学習済みのVLM表現を活用し、中間的な決定を自然言語で提示するため魅力的ですが、現在の根拠は、計画された動作と因果的に関連付けられるステップバイステップの決定セマンティクスを欠いていることがよくあります。本稿では、古典的なルールベースプランナーから直接抽出されたルール根拠に基づく推論トレースで運転VLAを監視するニューロシンボリック運転フレームワーク「Neuro-Symbolic Drive」を提案します。我々の重要な発見は、ルールベースプランナーがすでに実行可能な推論エンジンとして機能するシンボリックAIシステムであるということです。それらはアクティブな安全制約について推論し、候補となる操作を探索し、最終的な軌道を選択します。我々は、シミュレーションでこれらのプランナーを計測し、実行された軌道と各ルール評価ステップでの内部決定トレースの両方をキャプチャします。各トレースは構造化されたルール根拠に基づく推論にシリアライズされ、軌道とペアになってQwen3.5-4Bを運転VLAとしてファインチューニングします。
arXiv cs.AI
2026年6月25日
学習済み表現において保存則はいつ成り立つのか?潜在世界モデルのための認定ホライズン物理世界モデルに関する表現学習の疑問、すなわち、モデルが潜在表現を学習した後、保存則はいつ認定可能であり続けるのか、という問いを立てます。認定ホライズンとは、測定可能なモデルの欠陥から、あらかじめ、物理的invariantのレベルセットに証明可能に留まるロールアウトのステップ数を上限するものです。重要な設計選択は、何が認定されるかです。これは、学習済みの潜在ハミルトニアンや学習済みスカラー証人(モデルはいずれかを保存しながら真のエネルギーでドリフトする可能性がある)ではなく、潜在状態をデコードし既知のinvariantを評価することによって得られるデコードされた物理的invariantです。このオブジェクトを中心に、シェルホライズン証明を導出します。その予算は、表現、読み出し、潜在ダイナミクスの欠陥に分解され、ソフト学習済み証人を介してデコードされたinvariantの認定ホライズンを生成するモノトーンアライメントブリッジを介して、保存系における状態、学習済みリフト、ピクセル観測でテストします。
arXiv cs.LG
2026年6月29日
地上反復言語計画:パラメータ化された世界モデルがLLMエージェントの幻覚伝播をいかに低減するか言語エージェントの世界モデルには、2つの有用な形式があります。エージェントベースの世界モデルはLLM APIを呼び出し、言語で柔軟に推論しますが、そのエラーは通常の回帰損失でスコアリングするのが難しい幻覚状態変化として現れます。パラメータ化された世界モデルは、学習済みの遷移予測器であり、そのエラーはNodeMSE、デルタ精度、妥当性精度などの量で測定しやすいですが、通常はスタンドアロンプランナーとしては弱いです。これらの2つのファミリーを4つのグラフ構造計画ベンチマークで比較し、エージェントベースの場合の運用上の幻覚メトリクスを導入します。この比較により、少数のパラメータ化されたバックボーンのみをトレーニングし、APIベースのエージェント推論と組み合わせる extbf{地上反復言語計画}(GILP)が動機付けられます。バックボーンは有効なアクション、予測された状態デルタ、リスク、値を提供し、LLMはアクションと想像されたデルタをドラフトし、一貫性ゲートは両者が disagreement した場合に修正を求めます。
arXiv cs.AI
2026年7月1日
成果報酬モデルによるテキストからSQLへのテスト時検証推論時の大規模言語モデル(LLM)の信頼性向上は、テキストからSQLへの変換のような構造化推論タスクにおける中心的な課題です。Best-of-Nサンプリングや多数決などの一般的なテスト時推論戦略は、実行成功や出力頻度などのヒューリスティックな信号に依存していますが、候補出力間の意味的な識別能力は限られています。本研究では、テキストからSQLへの変換におけるテスト時検証のための学習済み意味スコアリング関数として、成果報酬モデル(ORM)を検討します。ORMは以前からテスト時のスケーリングやアライメントに検討されてきましたが、構造化クエリ生成への応用は十分に探求されていませんでした。自動化された候補生成と実行ベースのラベリングによるタスク固有ORMのトレーニングのためのスケーラブルなフレームワークであるGradeSQLを導入し、手動アノテーションなしでの検証器トレーニングを可能にします。ORMを検証駆動型Best-of-Nパイプラインに統合し、複数のオープンソースLLMファミリーにわたるBIRDおよびSpiderベンチマークでアプローチを評価します。
arXiv cs.CL
2026年7月2日
学習済みサポート関数による最大内積探索の償却最大内積探索(MIPS)は、機械学習における重要なサブルーチンであり、データベース内(キー)のベクトルの中から、与えられたクエリに最も一致するものを特定する必要があります。我々は、MIPSのコストを、既知の分布から取得されたクエリに対して、固定されたキーデータベースに対するMIPSを繰り返し解くコストを償却する、回帰ベースのアプローチであるAmortized MIPSを提案します。
Apple Machine Learning Research
2026年7月2日
EVOTS: 時系列予測のための進化的トランスフォーマー探索多変量時系列予測における進化的ニューラルアーキテクチャ設計は、タスクや予測設定によって大きなばらつきがあるにもかかわらず、ほとんどのアプローチが固定されたトランスフォーマーアーキテクチャに依存しているため、未だ十分に探求されていません。本稿では、時系列予測(EVOTS)のためのタスク適応型トランスフォーマーライクなモデルを発見するための進化的ニューラルアーキテクチャ探索フレームワークを紹介します。アーキテクチャはモジュール式ゲノム表現を使用してエンコードされ、アテンション、フィードフォワード、プロジェクションコンポーネントの柔軟な構成を可能にします。一方、修復メカニズムは進化プロセス全体で構造的な妥当性を保証します。この定式化により、手作りの設計ルールに依存することなく、多様なアーキテクチャ空間を効果的に探索できます。提案手法は、ETTファミリー(ETTh1、ETTh2、ETTm1、ETTm2)の4つのベンチマークデータセットで、単変量から単変量、多変量から単変量、多変量から多変量予測を含む複数の予測設定で、96、192、336、720のホライズンで評価されます。
arXiv cs.LG
2026年7月3日
「どんな賞でもあげれば、彼は駆けつける」:ナレンドラ・モディ首相、海外旅行で栄誉を積み重ねるインド首相は旅先で賞を集める習慣があり、中にはその賞の最初にして唯一の受賞者となるものもある。ナレンドラ・モディ首相が週末にセーシェルに到着すると、インド洋の島嶼国は迅速にインド首相にその「最高位」の栄誉の一つを授与した。モディ首相は、セーシェルのパトリック・ヘルミニエ大統領から「ガーディアン・オブ・ザ・ブルー・ホライズン」賞をトロフィーと証明書とともに受け取り、満面の笑みを浮かべた。
The Guardian World
2026年7月3日
次トークン予測を超えて: Atlassianワークフローにおけるツール使用エージェントのためのRLVR証明大規模言語モデルは、特定のAPI内で行動するためではなく、次トークンを予測するように訓練されています。成功が適切なネスト引数を適切な順序で適切なエンドポイントにヒットすることを意味する、ニッチなエンタープライズSaaSワークフローでは、この目的の不一致は、欠落した必須フィールド、幻覚を見たツール、または単一の読み取り後の早期終了といったサイレントな失敗として現れます。我々は、ターゲット環境に直接適用された検証可能報酬付き強化学習(RLVR)が、そのギャップを埋めるかどうかを問います。概念実証として、Jira REST v3およびConfluence v2 APIをスキーマ忠実度でエミュレートする5つの合成環境のスイートを構築します。報酬は、ツール呼び出しトレースから完全に計算され、ライブAPI、学習済みジャッジ、またはループ内の人間のラベルは使用しません。
arXiv cs.AI
2026年7月3日
ホライズンズ・ミドルイースト&アフリカ 2026年7月3日号「ホライズンズ・ミドルイースト&アフリカ」は、世界で最も急成長している地域の一つに焦点を当てる日刊ニュースです。ドバイから、MEA(中東・アフリカ)に特に注力した最新の世界市場情報、分析、そしてニュースを生み出すインタビューをお届けします。
Bloomberg
2026年7月8日
オフライン強化学習を用いたLLMエージェントハーネス制御の学習大規模言語モデル(LLM)エージェントは、通常、プロンプト、モデル、または手書きのワークフローを変更することで改善されますが、モデルを取り巻く実行ハーネスは固定インフラストラクチャとして扱われます。本稿では、このハーネス自体が学習可能な制御レイヤーであると主張します。LLMエクスキュートを凍結させたまま、軽量コントローラーが構造的な実行アクションを選択する有限ホライズン・ハーネスMDPとしてハーネス運用を形式化します。コントローラーは、終端タスク・ルーブリック報酬のみを用いたアドバンテージ加重回帰によるオフラインロールアウトから訓練されます。また、最終タスク品質と事後ハーネス成熟度スコアを分離し、後者は最終的な回答が正しいかどうかだけでなく、ハーネスが信頼性の高い実行パターンに従っているかを測定します。この分離により、ハーネス学習の有限バッファビューが得られます。最終品質の向上にはオフラインバッファでの高リターンサポートが必要ですが、プロセスの挙動はアドバンテージ加重アクションと一致すればいつでも変更可能です。
arXiv cs.LG
2026年7月8日
Design-CP: タンパク質ナノ粒子の設計のためのコンテキスト並列化多くの全原子生成タンパク質モデルは、原則として全ての鎖を共同でモデリングすることにより、大きな多量体複合体を設計できます。しかし、トークンと原子ペアの二次表現は、鎖とモデリングされる残基の数が増加するにつれて、単一GPUのメモリをすぐに超えてしまいます。本稿では、RFdiffusion 3のための2つのコンテキスト並列(CP)推論戦略(1D行シャーディングとリングアテンションを用いた2Dグリッドシャーディング)であるDesign-CPを導入します。これにより、事前学習済み重みを保持しながら、二次アクティベーションをマルチGPUメッシュ全体に分散させます。20面体アセンブリをサンプリングする際のスケーリングを特徴づけ、最大許容可能な非対称サブユニット(ASU)サイズがGPU数の期待される平方根トレンドで増加し、2Dシャーディングがより優れたウォールクロックスケーリングを達成することを示します。さらに、強力な点群対称性制約が、20面体ナノ粒子のエンドツーエンド、全原子設計のためにCPをすぐに利用可能にすることを示し、好ましいインシリコ構造およびインターフェースメトリクスをもたらします。
arXiv cs.LG
2026年7月14日
器用な操作のためのミニマリストなリターゲティング誘導強化学習ロボットが物をつかんで運ぶといった単純な動作だけでなく、より複雑で繊細な「器用な操作」を、人間の動きを模倣して学習する新しい技術が開発されました。この技術は、人間が物をつかむ際の接触や力の伝わり方を参考に、ロボットが器用な操作を習得できるようにするものです。 開発された手法では、まず人間が物体の操作を行う様子を観察し、その動きや物体との接触パターンをデータとして収集します。次に、このデータを基に、ロボットがシミュレーション環境で操作の練習を重ねます。シミュレーションでは、人間に近い滑らかな動きと、物体との適切な接触を維持することに重点が置かれます。学習済みのロボットは、このシミュレーションで得た知識を実際のロボットアームに適用し、器用な操作を実現します。 この技術は、これまでロボットが苦手としていた、壊れやすいものを扱ったり、複雑な形状の物を掴んだりするといった高度な作業への応用が期待されます。例えば、精密機器の組み立てや、食品の丁寧な盛り付けなどが考えられます。 arXiv cs.AI
arXiv cs.AI
2026年7月14日
検証器こそがカリキュラム:クロスファミリーゲーム生成のための実行ゲート付き自己蒸留学習済みジャッジに対してコードジェネレーターをポストトレーニングすると、成果物を改善せずにスコアを上昇させるプロキシ特徴を最適化できます。私たちはその逆の信号を研究します。それは、決定論的で、ジャッジフリーで、操作不可能なフィルターです。具体的には、生成されたプロジェクトがヘッドレスエンジン(厳格起動)でクリーンに起動するかどうかです。このゲートの下で、リジェクションサンプリング自己蒸留は、ファミリー外の一般化を増幅させます。GameCraft-Bench(自然言語の指示から完全なGodotプロジェクトへのマッピング)において、厳格起動下で蒸留された14Bモデル(Qwen3-14B+LoRA)は、4つの未知のゲームファミリーにおけるクリーンな生成率を候補あたり8.8%から42.2%に、K個中ベストのカバレッジを18/25から25/25(ゴールド天井)に、それぞれ3ラウンドで向上させました。各ラウンドで有意な増加が見られました(p=0.0019、p<1e-4、p<1e-4)。この増加は単にデータを追加したことによるものではありません。
arXiv cs.AI
2026年7月14日
RouteRec: レコメンダーエージェントの選択と集約の厳密な評価レコメンダーシステムは、協調フィルタリング、シーケンシャルモデル、コンテンツベースリトリーバー、LLMベースのリランキングなど、異種エージェントの中から選択する必要に直面していますが、単一のエージェントが常に最良とは限りません。RouteRecは、この選択をコスト制約下でのタスク認識型エージェントランキングとして研究するフレームワークであり、4つの従来のレコメンダーエージェントと1つのLLMリランカーエージェントに対して、リクエストレベルのハード選択とアイテムレベルの学習済み集約を比較します。MovieLens-1Mでは、完全な品質オラクルは大幅な余力(HR@10 = 0.584)があり、有用なクロスエージェント信号が存在することが確認されました。しかし、リークのない5分割クロスバリデーションプロトコルでは、ハード選択はBM25(0.223 vs 0.254)を下回り、選択的なLLMエスカレーションでは改善しません。同じプロトコルは、学習済み集約に対して異なる結果をもたらします。
arXiv cs.CL
2026年7月15日
1層で十分:画像生成のための事前学習済みビジュアルエンコーダーの適応ビジュアル生成モデル(例:拡散モデル)は、通常、トレーニング効率とサンプル品質のバランスをとるために圧縮された潜在空間で動作します。並行して、高品質な事前学習済みビジュアル表現を活用することへの関心が高まっています。これは、VAE内または生成モデル内で直接それらを整列させることによって行われます。
Apple Machine Learning Research
2026年7月15日
ミラー・ホライズン:バウンド・リフレクションの尺度としての実現可能なパス・エントロピーミラー理論は、知能システムは、それが何を表現しているかだけでなく、繰り返しのリフレクションの下で維持できる一貫した継続性によっても研究されるべきであると提唱しています。我々は、検証された継続能力の有限予算尺度である「Viable Path Entropy(VPE)」を通じて、この主張を運用可能にします。ミラー状態、ロールアウト・プロトコル、検証者、モード・マップが与えられると、VPEはバウンドされた能力を2つの部分に分解します:実現可能な継続に到達する確率と、成功したロールアウトの中で到達した検証された継続モードの多様性です。本論文は、この尺度の背後にある完全な理論的構造を回復します:局所的な決定制約の解除としての直観、不変量選択圧としてのテイスト、決定制約の解除のテイスト誘導解決としてのリフレクション、そして将来のリフレクションを安定させる学習された構造としてのジオメトリです。その後、GSM8Kにおける言語モデル推論実験で理論を具体化します。
arXiv cs.LG
2026年7月17日
CARPRT:ブラックボックス型ビジョン・言語モデルのためのクラス認識型ゼロショットプロンプト再重み付け事前学習済みのビジョン・言語モデル(VLM)は、画像とテキストの説明との類似性スコアを計算することで、ゼロショット画像分類を可能にします。この説明は通常、クラスラベル(例:「猫」)をプロンプト(例:「写真」)に挿入して形成されます。与えられた画像とクラスのペアのスコアはプロンプトの選択に敏感であるため、既存の研究では、複数のプロンプトを重み付けベクトルを使用してアンサンブルし、異なるプロンプトからのスコアを集約します。しかし、現在の戦略では、各プロンプトに割り当てられる重み付けベクトルはすべてのクラスで共有されており、プロンプトがクラスに条件付きで独立していると暗黙的に仮定しています。これは実際には当てはまらないことがよくあります。「空中からの眺め」のようなプロンプトは「空港」には適しているかもしれませんが、「リンゴ」には不向きです。この問題に対処するために、クラス認識型ゼロショットプロンプト再重み付け(CARPRT)を提案します。このスコアリングスキームは、トレーニングフリーの方法で異なるプロンプトのクラス固有の関連性を捉えることにより、各クラスラベルの重み付けベクトルを調整します。
arXiv cs.LG