TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
エージェンティックAI、ネストされた学習、セマンティックキャッシングによるAI持続性を通じたハルシネーション軽減ハルシネーションは本番LLMシステムにおける主要な信頼性の障壁であり、特にマルチエージェントパイプラインでは根拠のない主張が段階を通じて伝播する可能性があります。本論文は、HOPE着想のネストされた学習アーキテクチャとコンティニュアムメモリシステム(CMS)を応用しています。
arXiv cs.AI
2026年6月1日
大規模言語モデルの不確実性における人間的整合性、キャリブレーション、活性化パターンarXiv:2605.30675v1 不確実性定量化は大規模言語モデルの行動分析における大規模で成長するサブフィールドである。主にハルシネーション認識および対策のため、このフィールドは不確実性判断のタスク有効性への精度であるキャリブレーションの測定と改善に主に焦点を当ててきた。本研究では、
arXiv cs.CL
2026年6月2日
DeSQ:分解ベースのSPARQLクエリ生成知識ベース質問応答(KBQA)への支配的なアプローチは2つのカテゴリに分類されます。1つ目は脆弱性と説明可能性の制限に悩む形式的クエリの生成、2つ目はKB探索を通じた直接的な回答検索で、これは計算コストが高くハルシネーション(幻覚)が起きやすいです。
arXiv cs.CL
2026年6月9日
科学論文の「参考文献」に異変…4046件が完全な捏造、生成AI要因か(ビジネス+IT)米コロンビア大学などの研究チームは、科学論文に架空の参考文献が急増しているとの調査結果を英医学誌ランセットにて発表した。原因の大部分は生成AIのハルシネーションであると指摘している。
Yahoo!ニュース IT
2026年6月14日
水害の記憶つなぐタイムカプセル 50年ぶりに確認 三重・伊賀水害から逃れようと明治時代に集団移転(避水移居)した三重県伊賀市小田町で、移居100年を記念して埋めていたタイムカプセルが、約50年をへて掘り出された。安心安全を目指した150年前の大事業に思いをはせ、住民らは作業をした。近くふたを開けカプセル内部の状態を確かめる。
毎日新聞
2026年6月19日
大規模言語モデル知識グラフ推論におけるハルシネーション検出知識グラフ(KG)推論は、既存の事実から新しい知識を推論するもので、質問応答、レコメンデーション、意思決定支援などに広く応用されている。大規模言語モデル(LLM)の急速な発展に伴い、取得したKG情報を活用するLLMベースのKG推論フレームワークがますます人気を集めている。しかし、LLMにおけるハルシネーションは依然として重大な問題である。関連するKG知識が組み込まれていても、モデルは誤った出力を生成し、誤情報や信頼できない意思決定につながる可能性がある。既存のハルシネーション検出方法は、LLMの内部状態に焦点を当てるか、取得したコンテキストとの一貫性を検証するかのいずれかであるが、どちらもKGの構造情報を無視しており、パフォーマンスが最適でない結果となっている。このギャップに対処するため、LLMベースの知識グラフ推論フレームワークのための初のハルシネーション検出方法であるLUCIDを提案する。LUCIDは、LLMのアテンションスコア、KGセマンティクス、構造情報を共同で活用する。
arXiv cs.CL
2026年6月25日
完璧な検知、失敗した制御:言語モデルにおける「知ること」と「操ること」の幾何学メカニズム解釈可能性の中心的な目標は制御可能性です。つまり、モデルの活性化において行動がどこで表現されているかがわかれば、それを変更できるはずです。これは、行動を検知する方向とそれを制御する方向が同じか、それに近いという隠れた前提に基づいています。これを幾何学的に検証します。行動を最もよく検知する方向と、それを最もよく引き起こす方向との角度はどれくらいでしょうか? 検知が制御を意味する場合、コサインは1に近くなります。そうでない場合、それは検知と介入のギャップを定量化します。Gemma 2-2B-itでは、出力フォーマット(クリーンなJSON対Markdownフェンシング)は両方の役割を1つの軸に収縮させます。幻覚(ハルシネーション)はそうではありません。モデルは偽のエンティティを完璧な線形分離可能性(レイヤー5からAUC = 1.000)で検知しますが、その方向は拒否を引き起こす方向からcos = 0.12(約83度)の位置にあり、「検知は制御である」が要求するcos = 1からはかけ離れた、小さく再現可能な整合性を示します。
arXiv cs.CL
2026年6月29日
逆にすごい。大手コンサル作「AIのすごさを証明する報告書」がハルシネーションだらけAIのおかげで仕事が楽になった人は多いのではないでしょうか。私も、ライティングするにあたって、資料を探してもらったり、録音した音声を文字起こしして綺麗に整えてもらったりと、AIによって作業効率が上がったのを実感している側の一員。特に、録音し…
GIZMODO Japan
2026年7月6日
ASRエラー訂正の再検討:特化型モデルによるアプローチ自動音声認識(ASR)において言語モデルは中心的な役割を担っていますが、ほとんどの手法はASRのエラーパターンを認識しないテキスト専用モデルに依存しています。近年、大規模言語モデル(LLM)がASR訂正に応用されていますが、レイテンシとハルシネーション(偽情報生成)の懸念が伴います。
Apple Machine Learning Research
2026年7月7日
250年後の未来で「iPhone」は動くのか? タイムカプセル企画に専門家がツッコミ(CNET Japan)米国建国250年を記念するプロジェクト「America250」のタイムカプセルの一部として、Appleの「iPhone 17 Pro Max」が埋められた。しかし、掘り起こす時には機能しない可能性が
Yahoo!ニュース IT
2026年7月14日
「デザインによる忠実性」:多関係者向けLLM生成臨床試験要約の評価と改善大規模言語モデル(LLM)は、医療提供者、患者、支払者を対象とした臨床試験結果の要約にますます利用されていますが、幻覚(ハルシネーション)の傾向は、この重要な文脈において重大なリスクをもたらします。本研究では、3つの関係者オーディエンスにわたるLLM生成臨床試験要約の忠実性を測定するためのベンチマーク評価フレームワークを導入します。このフレームワークは、Aggregate Analysis of ClinicalTrials.govデータベースから抽出した200の層化された試験で構成され、オーディエンス固有のプロンプトテンプレートと6次元の忠実性アノテーションスキーマを使用して評価されます。GPT-4o、Claude Sonnet 4.6、Gemini 2.5 Flashのベースライン測定値が、クロスエンコーダー自然言語推論(NLI)モデルを使用してスコアリングされた1,800の生成要約全体で確立されました。3つのモデルすべてで、主な失敗モードとして「裏付けのない主張」が特定され、平均アノテーションスコアは3点満点中1.55でした。
arXiv cs.CL
2026年7月22日
SAAG:構造化エージェント評価とグラウンディングエージェント呼び出しの厳密一致評価は、質的に異なる失敗モードを不明瞭にします。モデルは正しい関数を選択するかもしれませんが、引数値がハルシネーション(幻覚)を起こしたり、スキーマを満たしながらも不適切な理由でエージェントを選択したりする可能性があります。既存のベンチマークでは、これらの違いを単一の二項スコアに集約してしまうため、実務家はエージェント呼び出しがどこで失敗するかを診断できません。本稿では、エージェント呼び出し評価を、レジストリ適合性、構造的完全性、引数グラウンディングの3つの連続したステージに分解するカスケード診断フレームワークSAAGを提案します。各ステージは解釈可能なステージ固有の診断を生成します。これらの診断は、反復的な自己修正も可能にします。予測失敗時には、ステージ固有の信号が、正解値に漏洩することなく、ターゲットを絞った修正をガイドします。本稿では、5、10、15エージェントのレジストリサイズでGlaiveの関数呼び出しデータセットから派生した制御されたベンチマークで、3つのローカルサブ4Bパラメータモデルを用いてこのフレームワークを評価します。
arXiv cs.AI
2026年7月29日
タイムカプセル:歴史的理解のための生成的手法としてのハルシネーション大規模言語モデル(LLM)は、現代の膨大なコーパスで学習するため、過去の出来事を語る上で信頼性に欠ける現代概念を内包しています。本研究では、1800年から1875年までのヴィクトリア朝時代のテキストのみで学習された、12億パラメータのLLaMAスタイルの因果モデル「タイムカプセル」を、認識論的に孤立した生成アーカイブとして提案します。定量的評価では、ヴィクトリア朝時代の文章を用いたテストにおいて、GPT-2ベースラインと比較してパープレキシティが45.4%削減されました。一方、より大規模な現代の因果モデルは、広範な事前学習により低いパープレキシティを達成しますが、時間的孤立性を欠いています。タイムカプセルは、馴染みのない現代の概念に対して、歴史的に妥当な類推的説明(例:コンピュータを「肥大化した肺」と表現するなど)を生成する計算的理解能力を示します。2名の人文科学者による質的な解釈学的調査では、本物のヴィクトリア朝時代の抜粋の約40%を機械生成と誤分類するという真正性の危機が明らかになりました。
arXiv cs.CL