TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
VFEAgent: 有限要素解析エンドツーエンド自動化のためのマルチモーダルエージェントフレームワーク有限要素解析(FEA)は現代工学設計の根幹をなします。しかし、そのワークフローは本質的に複雑であり、領域知識に大きく依存しています。最近のLLMのFEA統合の試みにもかかわらず、既存のアプローチは複数の側面の処理における制限に直面しています。
arXiv cs.AI
2026年6月2日
固体力学問題のためのエンドツーエンド有限要素解析を可能にするマルチAIエージェントフレームワーク有限要素解析(FEA)は固体力学における最も重要な数値解析手法です。FEAの課題には、初心者ユーザーにとって急な学習曲線と、境界条件、荷重ケース、解析パラメータなどの重要なシミュレーションコンポーネントの定義が誤っている場合の誤ったシミュレーションが含まれます。
arXiv cs.AI
2026年6月2日
自動微分可能非線形テンソルネットワーク(ADNTN)による深層ニューラルネットワークの指数関数的圧縮自動微分可能非線形テンソルネットワーク(ADNTN)を研究します。これはコンパクトなコアテンソルが逆モード自動微分(AD)によってエンドツーエンドで訓練される構造化重み生成器の一族です。このアプローチは低ランク適応とテンソル因数分解の自然な拡張と見なすことができます。
arXiv cs.LG
2026年6月2日
BudgetDraft:スパースKV推測デコーディング用の受け入れ認識マルチビュー訓練推測デコーディングは、ドラフタが複数のトークンを提案し、検証者が並列で検証することによって、自己回帰デコーディングを高速化します。リソース制約のあるデプロイメントでは、ドラフタはスパースKVキャッシュを使用して、固定KV予算下でのピークGPUメモリとエンドツーエンドレイテンシを制限し、検証者が検証します。
arXiv cs.LG
2026年6月3日
産業用ソフトウェア大手がNVIDIA NemoClawで安全で自律的なAIエンジニアを構築加速コンピューティングは産業エンジニアリングに革命をもたらし、シミュレーション時間を数週間から数時間に短縮しました。今日の残された課題は、シミュレーションを取り巻くエンドツーエンドワークフロー、すなわちコンピュータ支援設計、メッシング、シミュレーションのセットアップとデバッグ、および後処理とこれらのプロセスの概要レポート生成にあります。GTC Taipeiのコンputexで、NVIDIAおよび12…
NVIDIA Blog
2026年6月8日
FAIR-Calib: 拡散大規模言語モデルの学習後量子化のためのフロンティア認識不安定性重み付け校正拡散大規模言語モデル(dLLM)はトークンを反復的に精密化しますが、一度コミットすると取り消せないため、初期の決定が脆弱なまま残る「安定性遅延」が発生します。本研究では、学習後量子化(PTQ)エラーが境界線上の決定をライティングフロンティアで容易に翻してしまい、その後永久に固定・増幅されることを明らかにしました。これに対処するため、dLMM向けの2段階PTQフレームワークであるFAIR-Calib(フロンティア認識不安定性重み付け校正)を提案します。第1段階では全精度教師モデルを用いてフロンティアヒットとマスク段階の信頼性を組み合わせた位置事前分布を推定します。第2段階では、重み付けされた隠れ状態MSEを最小化するオフポリシーレイヤーごとの校正を実行し、高額なエンドツーエンド拡散ロールアウトを必要とせずに脆弱なフロンティア状態の保護を効果的に優先化します。さらに、重み付けされた目的関数を出力KLダイバージェンスの代理として理論的に正当化します。
arXiv cs.LG
2026年6月9日
Amazon SageMaker AIとFHEによるエンドツーエンド暗号化ML推論本ブログではこれまでML推論向けのFHE(完全準同型暗号)について「Amazon SageMakerエンドポイントで安全でリアルタイムな推論を実現する完全準同型暗号の有効化」という記事で論じてきたが、本稿はさらに一歩進めたものである。前の記事ではSEALという低レベルライブラリを使用して線形回帰アルゴリズムを手動で実装することでFHEベースの推論を「ゼロから」実装する方法を示していた。
AWS Machine Learning Blog
2026年6月11日
明示的要素から暗黙的意図へ:監査可能な行動推論のための事前定義ライブラリarXiv:2606.11207v1 新規発表。SemantiCleanは、Eコマースセッションデータから構造化されたセマンティック信号を抽出し、共有要素ライブラリを通じて購入意図、顧客セグメンテーション、商品親和性などのプラグ可能な推論ターゲットを駆動するモジュラーフレームワークです。従来の精度のみを最適化するエンドツーエンド予測子とは異なり、SemantiCleanは監査可能性、構造的ガバナンス、sigma=0再現性を優先し、要素レベルの透明性と正当な決定トレイルのためにわずかな予測ゲインを明示的にトレードオフします。Online Shoppers Purchasing Intention (OSPI) データセットに基づき、このフレームワークは24の行動要素を4層アーキテクチャ(機能、インタラクション、システム、コンテキスト)に整理し、3つのアンチインフレーションメカニズム(RedundancyGroup貢献キャップ、TieredPenaltyCalculatorバイアスペナルティ、AdaptiveConstraintModeコールドスタート保護)を通じて信号品質を強制します。
arXiv cs.AI
2026年6月15日
Deep AgentsとBedrock AgentCoreでコンテキストリッチなリサーチエージェントを構築するこの記事では、このパターンをエンドツーエンドで示す、競合力のあるリサーチエージェントを構築します。このチュートリアルは、エージェントのために分離された実行環境を必要とする、マルチステップAIワークフローを構築する開発者を対象としています。
AWS Machine Learning Blog
2026年6月16日
OSGuard:コンピューター利用エージェントの安全性ベンチマークコンピューター利用エージェントは、現実的なデスクトップおよびWebタスクを完了できるかによって、ますます評価されています。しかし、タスクの成功だけでは、エージェントが安全でない近道で公称目標を達成した場合の失敗を見逃す可能性があります。我々は、穏やかな、変更されていないユーザー指示の下でコンピューター利用エージェントの安全性を評価するためのデュアルグラニュラリティベンチマークスイートであるOSGuardを導入します。OSGuardは、ローカルガードレールの決定のためのアクションレベルベンチマークと、エンドツーエンド評価のためのリスク拡張実行スイートを含みます。アクションレベルベンチマークは、元の指示と現在のインターフェース状態に対して判断された、許可、無関係、または安全でないとラベル付けされたコンテキスト化された提案アクションで構成されています。実行スイートは、元のタスクが達成可能であるOSWorld派生タスクバリアントを手動で構築したものであり、環境は破壊的な上書きなどの潜在的な危険を導入するように変更されています。
arXiv cs.AI
2026年6月17日
Amazon SageMaker AIにおけるコンテナキャッシュ機能の導入による、より高速なモデルスケーリング本日、Amazon SageMaker AI推論におけるコンテナイメージキャッシュ機能を発表できることを嬉しく思います。これは、より高速なスケーリング最適化の旅における次なる大きな進歩です。これにより、スケールアウトイベント中の生成AIモデルのエンドツーエンドレイテンシが最大2倍高速化されます。
AWS Machine Learning Blog
2026年6月17日
複雑な地質層におけるCO2移動のための高速GNNサロゲートに向けて本章では、データ駆動型の機械学習アプローチがいかにして複雑な地質層における多相流の物理的挙動の主要な側面を再現できるかを論じる。我々は、地質貯留におけるCO2プルーム移動予測に特化したエンドツーエンドのグラフニューラルサロゲートを提案する。この手法は、SPE11Aベンチマークで評価される。SPE11Aは、CO2貯留シナリオを評価するために設計された著名な業界テストケースであり、シャープなガス-水界面、強い移流輸送、そしてフィンガリング発達を伴う急速な対流混合を特徴とする。このベンチマークは、ノードが計算セルを表し、エッジが幾何学的属性で強化された透過性ベースの相互作用をエンコードするグラフとして再定式化される。グリッドジオメトリ、浸透率のコントラスト、および地質学的不均一性に起因する方向性輸送は、異方性メッセージパッシングメカニズムを通じて捉えられる。このメカニズムでは、相互作用の重みはジオメトリ条件付きエッジ埋め込みによって計算され、物理的に関連性の高い輸送方向へのメッセージ集約を偏らせる。
arXiv cs.LG
2026年6月25日
SnowflakeとAmazon QuickSightによるAI搭載BIこの記事では、SnowflakeのセマンティックビューとAmazon QuickSightの間のエンドツーエンドの統合を構築する方法を説明します。サンプルデータはメディア企業のユーザーレビューデータです。
AWS Machine Learning Blog
2026年6月25日
プロジェクト・オートワールド:ニューラル関係推論の自動ベンチマークに向けて関係構造に関する推論は、ニューラルモデルにとって依然として大きな課題であり、特に学習した知識を訓練時よりも難しい問題インスタンスに体系的に適用しなければならない場合に顕著です。この一般化能力の評価の難しさから、進歩は妨げられています。なぜなら、事前には、何がインスタンスを難しくしているのかはほとんど明らかではないからです。本研究では、大規模言語モデル(LLM)を使用してベンチマーク生成を自動化し、エンドツーエンドでますます挑戦的なインスタンスを生成することを学習することによって、この問題にどのように対処できるかを調査します。具体的には、Datalogルールによってパラメータ化されたワールドと、推論評価者としてのEdge Transformerが与えられた場合、LLM主導の進化的探索(FunSearchに基づく)と自律的なエージェント探索を使用して、困難な問題インスタンスを生成するサンプリング関数を発見します。また、このデータを使用してEdge Transformerを改善できることも示しており、さらなるデータ摂動に対してうまく一般化します。
arXiv cs.AI
2026年6月25日
ASRエラー訂正のためのエラー認識TF-IDF検索拡張生成エンドツーエンドの自動音声認識(ASR)システムは、特にリソースの少ない言語において、まれなエンティティやドメイン固有の用語を頻繁に幻視します。検索拡張生成フレームワークは、大規模言語モデルを使用してこれらのエラーを軽減できますが、現在のアーキテクチャは大きな課題に直面しています。標準的なスパース検索に依存しており、音訳の誤認識を無視するか、高遅延を導入する重量級のクロスモーダル埋め込みを利用しています。本稿では、音訳とループの幻視を明示的に解決するように設計された、非常に効率的で純粋に辞書的なエラー認識フレームワークを提案します。このアプローチは、対称的なテキスト正規化モジュールと新しいエラー認識項頻度-逆文書頻度アルゴリズムを統合します。過去のエラーに基づいてスパース対角ペナルティ行列を構築することにより、リトリーバーは数学的に特定の高リスクの誤認識を含む修正ドキュメントを優先します。FLEURSデータセットのペルシャ語サブセットで評価したところ、この方法はエラー認識ヒット率を53.7%から90.9%に向上させました。
arXiv cs.CL
2026年6月26日
COrigami:平坦に折り畳める、認識可能なオリガミを共創するAIパイプライン生成AIは検証可能な解を持つ問題解決で目覚ましい成功を収めていますが、厳密な幾何学的制約と主観的な美的感覚の両方を満たす物理的なアートの生成は依然として課題です。本稿では、計算オリガミの領域におけるこれらの困難に取り組むアプローチを提示します。計算オリガミは、数理的に厳密な環境であり、芸術的デザインを平坦折り畳み可能性の数式内に位置づけます。本稿では、自然言語から折り目パターンを生成することでデザインサイクルを支援する、エンドツーエンドのAI駆動パイプラインであるCOrigamiを紹介します。このパイプラインは、セマンティックな棒人間生成、ベースパッキング計算、平坦折り畳み可能な折り目パターンの解決、平坦に折り畳まれた折り目パターンの整形、そして自律的な美的評価ループによって駆動される強化学習を用いた生成モデルの改良を含みます。本システムは、人間のアーティストがさらに発展させ、整形できる構造的な出発点を生成する、非常に効果的な共同アシスタントとして機能します。
arXiv cs.AI
2026年6月29日
DysLexLens:オンラインフォーラムの分析からディスレクシア学習者の洞察を得るための低リソースLLMフレームワークディスレクシア(読み書き障害)のある学習者は、読書、執筆、整理、学習関連のタスクをサポートするために人工知能(AI)ツールをますます活用しています。しかし、これらのツールとの実際の体験はほとんど調査されていません。本論文では、ディスレクシア学習者がオンラインフォーラムでの議論を通じてAIをどのように体験しているかを分析するために設計された、低リソースLLMフレームワークであるDysLexLensを提案します。DysLexLensは、エンドツーエンドで証拠を追跡可能なアーキテクチャとして設計されており、ノイズの多いソーシャルメディアの投稿を辞書駆動型コーパスに変換し、知識グラフ(KG)ベースの質問推論を提供し、検証可能なクエリ応答を生成し、定量的および人間による評価を通じて応答を評価できるようにします。DysLexLensには4つの主要な特徴があります。
arXiv cs.AI
2026年6月30日
機器レベルのエネルギー異常検知とLLM駆動型推奨のためのエージェンティックAIパイプラインオフィスビルにおける機器レベルのエネルギー監視は、専門知識のない施設管理者にとって利用が困難なノイズの多いアラートを生成します。本論文では、ディープ時系列予測、変分異常検知、LLMベースの推論を組み合わせ、優先順位付けされた実行可能なメンテナンス推奨事項を生成するエンドツーエンドのエージェンティックパイプラインを提案します。このシステムは、ハイブリッド単一スペクトル分析(SSA)とLong Short-Term Memory(LSTM)予測モデルを使用して7つのオフィス機器を追跡し、注意機構を備えた機器ごとのLSTM変分オートエンコーダー(VAE)を適用して異常な毎日の消費エピソードをフラグ付けします。3段階のLangChainパイプラインは、常に3つのコアRAGソース(モデル信頼性、時間別ベースライン、専門知識)を取得するコンテキストエージェントから始まり、イベント特性に基づいて最大3つの追加ソース(予測コンテキスト、異常履歴、グローバルベースライン)を条件付きで追加し、8回の推論ステップに制限されます。
arXiv cs.LG
2026年7月2日
Amazon SageMaker AI上のBoltzGenでタンパク質設計を加速この記事では、SageMaker AI上にBoltzGenをデプロイし、エンドツーエンドのタンパク質設計実験を実行する方法を解説します。このチュートリアルを終えると、迅速な検証実行から本番のバッチ処理までスケールできる動作設定が完成します。この設定は、研究のさまざまな段階に対応する2つの実行モードと、反復ワークフロー中のコンピューティング費用を削減するためのステップレベルキャッシュを提供します。
AWS Machine Learning Blog
2026年7月2日
RareDxR1: 人間のアノテーションを超えた希少疾患診断のための自律的医療推論希少疾患の鑑別診断は、医師が複雑で構造化されていない患者の症状から正確な表現型を特定し、広大な探索空間内で複雑な推論を実行することを必要とする、重要かつ困難な臨床タスクです。しかし、既存のAIアプローチは通常、パイプラインベースの表現型抽出または検索拡張生成に依存しており、これらは定義済みのオントロジー、検索のボトルネック、および診断ロジックの欠如による重大な情報損失に苦しんでいます。これらの課題に対処するため、構造化されていない臨床記録から直接、オープンな領域の希少疾患診断のために設計されたエンドツーエンドの推論中心大規模言語モデルであるRareDxR1を導入します。構造化された表現型とクローズドセットの意思決定への依存を回避するため、知識の内部化と自律的な進化学習を相乗させることで、段階的なエンドツーエンドのトレーニングフレームワークを設計しました。RAGと表現型の制限の限界を克服するために、断片化された希少疾患知識をモデルのパラメータに直接深く内部化できるようにしました。
arXiv cs.AI
2026年7月3日
ECG認識のためのドメイン知識ベース時空間グラフ畳み込みネットワーク人工知能(AI)の進歩と広範な応用にもかかわらず、AIモデルの解釈可能性、特に心電図(ECG)認識のような医療分野における専門領域では、依然として課題が残っています。本稿では、エンドツーエンドの畳み込みニューラルネットワークにのみ依存するのではなく、ECG認識のためのドメイン知識ベースのグラフ畳み込みネットワークを用いた新しいアプローチを提案します。ECG解釈に不可欠なPRQSTの主要なランドマークポイントをドメイン知識として組み込みます。二重ストリーム有向グラフは、ECGサイクル内の関係とサイクル間の関係の両方をモデル化するために採用されます。具体的には、空間有向グラフは主要ポイント間の位置関係を捉え、時間有向グラフは拡張ECGシーケンスにおける隣接サイクル間の時間的依存関係を区別します。9つのカテゴリにECGを特別に分類する最初の中国ECGインテリジェントコンペティションデータセットでの実験結果は、提案モデルの有効性を証明しています。全体の平均F1スコアは88.1%、希少カテゴリの平均F1スコアは76.3%であり、いずれも最先端モデルを上回っています。
arXiv cs.LG
2026年7月7日
動的組立フローショップスケジューリングのためのスライディングウィンドウベース強化学習(マルチプロダクト配送対応)マルチプロダクトキッティング配送は、処理と組立を統合したハイブリッド製造システムにおけるリアルタイムスケジューリングに大きな課題をもたらします。これは、動的な注文到着が同時に供給依存関係と実行可能なジョブ・マシン割り当てのセットを変更するためです。本論文では、複雑なキッティング制約を持つ柔軟な組立フローショップスケジューリング問題におけるエンドツーエンドのオンラインスケジューリングのために、スライディングウィンドウベース強化学習(SWRL)フレームワークを提案します。この問題は、二層キッティング構造と疎な報酬ランドスケープを生み出すテールプロダクトボトルネックダイナミクスを捉える、異種グラフベースマルコフ決定プロセスとして定式化されます。
arXiv cs.AI
2026年7月8日
Amazon Quick SightのマルチデータセットTopicでデータセットを横断する統一セマンティックレイヤーを構築この記事では、マルチデータセットTopicの仕組み、チャットエージェントが定義された関係性を使用してクロスデータセットクエリを生成する方法、そしてQuick Sightにおける小売分析シナリオを使用したエンドツーエンドの実装例を説明します。
AWS Machine Learning Blog
2026年7月8日
ループ内のメモリ:言語エージェントのための拡張ワーキングメモリとしてのインプロセス検索言語エージェントは、観察、推論、行動というループを実行しますが、推論の対象となるメモリはループの外、つまり1ターンあたり最大1回しかクエリされないストアにあります。本研究では、メモリがループ内に入り、各ステップで読み書きされるレジームを調査します。これまでの障害は常にレイテンシでした。ネットワーク化されたストアは数十ミリ秒から数百ミリ秒で応答し、ループ内検索は検索が高価な場合にエンドツーエンドのレイテンシを最大83倍に膨張させる可能性があります。これまでの研究では、このコストを管理するだけで、それを疑問視することはありませんでした。サービングレイヤスケジューリングはそれを隠蔽し、「メモリファースト」設計は検索を1ターンあたり1回に制限します。レイテンシはストアの場所の特性であり、ループ内パターンの特性ではないと主張します。インプロセスストアは、ネットワークレジームの3桁下である約100マイクロ秒で応答し、その速度ではステップあたりのコストが崩壊します。
arXiv cs.AI
2026年7月8日
Design-CP: タンパク質ナノ粒子の設計のためのコンテキスト並列化多くの全原子生成タンパク質モデルは、原則として全ての鎖を共同でモデリングすることにより、大きな多量体複合体を設計できます。しかし、トークンと原子ペアの二次表現は、鎖とモデリングされる残基の数が増加するにつれて、単一GPUのメモリをすぐに超えてしまいます。本稿では、RFdiffusion 3のための2つのコンテキスト並列(CP)推論戦略(1D行シャーディングとリングアテンションを用いた2Dグリッドシャーディング)であるDesign-CPを導入します。これにより、事前学習済み重みを保持しながら、二次アクティベーションをマルチGPUメッシュ全体に分散させます。20面体アセンブリをサンプリングする際のスケーリングを特徴づけ、最大許容可能な非対称サブユニット(ASU)サイズがGPU数の期待される平方根トレンドで増加し、2Dシャーディングがより優れたウォールクロックスケーリングを達成することを示します。さらに、強力な点群対称性制約が、20面体ナノ粒子のエンドツーエンド、全原子設計のためにCPをすぐに利用可能にすることを示し、好ましいインシリコ構造およびインターフェースメトリクスをもたらします。
arXiv cs.LG
2026年7月8日
長文コンテキストサービングにおけるタスク品質とシステムパフォーマンスを対象としたKVキャッシュ最適化のベンチマーク大規模言語モデル(LLM)のサービングは、長文コンテキストのワークロード下でのKVキャッシュの増大によってますます制約されています。しかし、既存のKVキャッシュ圧縮技術は、異なるモデル、タスク、予算、サービングスタックで評価されていたため、比較が困難です。本稿では、量子化、プルーニング、マージといった代表的なKVキャッシュ最適化メカニズム(KIVI、TurboQuant、SnapKV、CaMを含む)について、Llama-3.1-8B-InstructとMistral-7B-Instruct-v0.3を使用してLongBenchスタイルのマルチドキュメントQA、シングルドキュメントQA、少数ショット学習、要約ワークロードで評価した、ワークロード認識型ベンチマークを提示します。このベンチマークは、コンテキスト長バケット全体にわたるタスク品質、平均出力スループット、平均初回トークン到達時間、および実現圧縮率を測定します。結果は、圧縮率だけではエンドツーエンドのパフォーマンスを予測するには不十分であることを示しています。
arXiv cs.CL
2026年7月8日
Prompt-to-Paper:バイオインフォマティクス向けエージェント型AIシステム大規模言語モデルの最近の進歩により、エンドツーエンドでの原稿自動生成が可能になったが、既存システムには3つの重大な欠陥がある。(i)生成された主張が検証可能な文献に決定論的に裏付けられていない、(ii)実験結果が実行されるのではなく、しばしば捏造される、(iii)AI生成原稿が実世界での出版に必要な質と厳密性を満たしているかを評価するための標準化された多次元フレームワークが存在しない。我々は、3つの統合されたイノベーションを通じて、この評価ギャップに直接対処するマルチエージェントフレームワーク「Prompt-to-Paper」を発表する。第一に、セクション認識型の関連性スコアリングとスノーボール引用拡張を備えた決定論的な検索拡張生成パイプラインにより、60~100報の検証可能な論文コーパスに各主張を裏付ける。第二に、自律的なコーディングエージェントが実際の計算生物学実験を実行し、合成出力を実際の数値結果に置き換える。第三に、出版された論文からの参照統計の近似値でベンチマークされ、明示的な幻覚ペナルティで拡張された8次元の自動品質スコアラーが、標準化された再現性のある品質評価を提供する。
arXiv cs.AI
2026年7月9日
Amazon Bedrock AgentCoreとMistral AI Studioを活用した本番運用可能なEC MCPサーバーの構築と接続本記事では、エンドツーエンドでMCPサーバーを構築・接続します。MCPツールを実装し、二層JWT認証を設定し、AWS CDKでデプロイし、Mistral AIのVibeに接続します。また、前提条件、ソリューションアーキテクチャ、MCPサーバーとVibeコネクタのベストプラクティス、リソースのクリーンアップについても説明します。
AWS Machine Learning Blog
2026年7月14日
AuditWeave: AI支援およびデータ変換ワークフロー向けの改ざん防止、監査者による追跡可能な証拠レイヤーAIシステムは、監査、金融、ヘルスケアなどの規制分野における重要な意思決定を支援するために、ますます使用されています。これにより、組織は事後に、どの証拠が特定の結論に影響を与えたかを再構築し、その推論の記録が変更されていないことを示す義務が生じます。既存のツールは、モデルのオブザーバビリティ、ドリフト監視、ガバナンスレポートなど、関連するが異なる問題に対処しており、システムを運用する機械学習エンジニア向けに構築されていますが、特定の結論をそれを裏付ける証拠にまで遡って追跡する必要のあるレビュー担当者向けではありません。我々は、ランタイム依存関係のない軽量PythonライブラリであるAuditWeaveを提案します。これは、AI支援およびデータ変換ワークフローのステップを、単一の追記専用、ハッシュチェーン化された台帳に記録します。検索拡張生成(RAG)パイプラインと表形式/レイクハウス変換の両方を網羅する小さくシステムに依存しないイベント語彙により、両方に依存する結論は、1つの記録を通じてエンドツーエンドで追跡できます。
arXiv cs.LG
2026年7月20日
Causal-Audit: ターゲット認識型因果連鎖構築による明示的で監査可能なグラフベース推論因果関係と介入に基づく質問応答は、大規模言語モデル(LLM)を表面的な相関関係を超えた推論や、根本的な因果メカニズムの理解へと進歩させる上で不可欠です。しかし、既存のLLMベースの手法は、しばしば暗黙的な言語レベルの推論に依存しており、その結果、不透明な因果的仮定、検証不可能な推論パス、そして特にコンテキストフリーな設定における複雑な介入下での脆弱な予測につながります。本稿では、コンテキストフリーな介入ベースの質問応答のための、明示的で監査可能な因果推論フレームワークを提案します。我々の手法は、暗黙的なエンドツーエンド予測ではなく、4つのモジュール化された段階を経た明示的な因果グラフ上の構造化推論として因果推論を定式化します。主要な革新は、ターゲット変数をグラフ拡張中のコア制約として扱うターゲット認識型因果グラフ構築戦略であり、これにより無関係な変数、偽の因果関係、推論ノイズを効果的に抑制します。さらに、単一連鎖推論を超えた堅牢な意思決定を可能にする、複数の因果パスを組み合わせ、補強効果と相殺効果の両方をモデル化するパスレベルの因果証拠集約メカニズムを導入します。
arXiv cs.AI