TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月9日
スパーサー、高速、軽量なトランスフォーマー言語モデルトランスフォーマー言語モデルの実用化に向けた新たな技術開発が加速している。Sakana AIの研究によれば、モデルの構造を最適化することで、計算負荷を大幅に削減しながら性能を維持することが可能になりつつあるという。 具体的には、ニューラルネットワークの一部の接続を不要な部分として削減する「スパース化」と、モデル全体を軽量化する技術を組み合わせることが有効であると指摘されている。これらの手法により、処理速度が向上し、必要な計算リソースが削減されるメリットがある。 言語モデルの大規模化が進む一方で、実装には膨大な計算力が必要という課題があった。今回の技術は、より少ないリソースで高い精度を保つ可能性を示唆しており、スマートフォンなどの環境でも効率的に利用できるモデルの開発につながると期待されている。 今後、こうした効率化技術がAI活用の幅広い展開を促進する重要な基盤になると考えられる。 (引用元:Sakana AI)
2026年5月29日
ノルネ貯留層システムの逐次物理制約ニューラルオペレータ順方向モデリングフーリエニューラルオペレータ(FNO)と物理情報付きの変種(PINO)に特に重点を置いて、ニューラルオペレータを使用した3相ブラックオイル貯留層ダイナミクスの逐次サロゲートモデリング用の包括的な数学および計算フレームワークを開発する。アプリケーションの焦点はノルネシステムである。
arXiv cs.LG
2026年5月29日
反応トーンを通じたコミュニティ態度のモデリング:オンラインコミュニティの言語的行動とLLMアラインメント評価のための人間-AI協働フレームワーク大規模言語モデル(LLM)は計算社会分析のプロキシとしてますます利用されていますが、人間のコミュニティの「厚い記述」を忠実に表現する能力は依然として重大な課題です。現在の評価では、社会的アイデンティティを静的なラベルに縮小することが多いです。
arXiv cs.CL
2026年5月29日
認知圏論トランスフォーマー:言語モデリングのための圏論的帰納的バイアス認知圏論トランスフォーマー(CCT)は3億600万パラメータのアーキテクチャで、事前学習されたGPT-2 Smallバックボーンを圏論から導出された認知的に根拠のあるコンポーネント、および認知科学からのいくつかのインスピレーションで拡張しています。マッチドステップ・プロトコル下(215,000最適化ステップ)で...
arXiv cs.AI
2026年5月29日
すべてを支配するマスク:編集後の隠れた事実とそれらを見つける方法ROMEやMEMITなどのナレッジ編集手法は、MLPの重みを変更することでトランスフォーマーモデル内の事実的関連付けを更新します。主に出力行動によって評価されていますが、内部メカニズムは未だに十分に検討されていません。本研究では、編集がどの事実が対象であるかに関係なく共通のメカニズムに依存しているかどうかを調査します。
arXiv cs.LG
2026年5月29日
BEAMS: AI モデリング・シミュレーション評価ベンチマーク実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。
arXiv cs.AI
2026年5月29日
TRACES:軌跡状態モデリングによるマルチターンLLMエージェント向けプロアクティブセーフティ監査LLMエージェントはマルチターンツール使用と環境相互作用を通じてますます動作していますが、安全リスクは最終結果に表面化する前の中間ステップから生じることが多いです。したがって、リアクティブ監査は不十分です。事後診断はリスクを指摘する機会を逃すことが頻繁にあります。
arXiv cs.CL
2026年6月1日
CobSeg: 対話トピックセグメンテーションのための一貫性境界モデリング対話トピックセグメンテーションは異なる境界手がかり(発話エッジ付近の語彙遷移および発話全体の意味的不連続性)を識別する必要がある多くのヒト-AI協調アプリケーションで重要である。既存の発話モデルはしばしばこれらのローカル語彙信号を希薄化させる。
arXiv cs.CL
2026年6月1日
HADT: 自律型地球観測衛星クラスター向けの異種マルチエージェント差分トランスフォーマー本論文は、光学およびSAR衛星を含む地球観測ミッションを実施する異種衛星クラスターにおける自律的なリソース管理の問題に対処し、自動運用モードでは衛星に知的能力を備える。
arXiv cs.AI
2026年6月1日
パディング付きトランスフォーマー表現力の再検討:どのアーキテクチャの選択が重要でどれが重要でないのかarXiv:2605.30523v1発表タイプ:新規 概要:最近の研究では、トランスフォーマーがブール回路との接続を通じて計算できること・できないことを説明しているが、既存の結果は正確な特性化を欠き、モデリング選択に対して敏感である。パディング付きトランスフォーマー――入力に「...」などのフィラー記号が追加される――は有用なツールとして出現している。
arXiv cs.LG
2026年6月2日
マルチモーダルLLM評価器の知覚判断バイアス緩和:知覚摂動と報酬モデリング視覚と言語の矛盾を見分ける課題に対応 マルチモーダル大規模言語モデル(LLM)が自動評価システムとして機能する際、画像とテキストが相反する状況で問題が生じることが明らかになった。研究によると、これらのモデルはもっともらしく聞こえるテキスト応答を、実際の画像内容より優先する傾向があるという。 研究チームは、制御された画像変化を加えることでこの「知覚判断バイアス」を詳細に分析。実際の画像内容とは異なる反事実的な応答を組み込んだ新しい評価データセットを構築した。 対策として、報酬モデリングとバッチランキング目的を統合した統一的なフレームワークを開発。このアプローチにより、視覚情報とテキスト情報の両者を適切に重視し、より正確で一貫性のある評価を実現できるようになった。 成果は、マルチモーダルAIが複雑な判断を求められる場面で、より信頼できる決定を下すための基盤となる可能性を示している。 (arXiv)
arXiv cs.AI
2026年6月2日
ユニバーサル・クォンタム・トランスフォーマーarXiv:2606.00045v1発表タイプ:新規 抄録:古典的な連続空間ニューラルネットワークは、モジュロ演算や非可換代数などの厳密な数学的対称性にロックインするのに本質的に苦労している。これらの離散的な論理規則を近似するために、しばしば膨大なパラメータスケーリングに頼り、その後でも確率的不安定性をもたらす。
arXiv cs.AI
2026年6月2日
lmfaoooo at SemEval-2026 Task 1: ユーモアは観客である。制約付きユーモア生成のための選好モデリングユーモア生成は、流暢で新しいジョークを生成することの難しさだけでなく、「面白い」というのが観客に依存し、教師ラベルがノイズを含んでいるという点で困難です。選好は観客、文脈、文化によって異なり、アノテータ間の一致度も低くなります。本論文では、SemEvalのシステムについて説明します。
arXiv cs.CL
2026年6月2日
DAStatFormer: DASベースのパターン認識のための統計特徴統合を備えたハイブリッド多分岐トランスフォーマー分散音響センシング(DAS)は光ファイバーを通じた大規模監視を実現しますが、その高次元性と複雑な時空間パターンがイベント分類を困難にします。既存の深層学習アプローチ(CNN、リカレントモデル、トランスフォーマー変種)は長期的なパターンの捕捉に失敗しています。
arXiv cs.LG
2026年6月2日
オンラインコミュニティにおけるうつ病の認知言語指標:DistilBERTと holographic Reduced Representationによる分析本論文では、認知的に根拠のある言語的特徴とトランスフォーマーベースの埋め込みを組み合わせることで、オンラインテキストにおけるうつ病の自動検出が改善されるかどうかを調査しています。ベックの認知抑うつ理論を使用して、認知的歪みを測定可能な特徴として抽出します。
arXiv cs.CL
2026年6月5日
「トランスフォーマーニューレジェンズ」で「ギガストーム」が11月下旬発売!(HOBBY Watch)タカラトミーは、「トランスフォーマーニューレジェンズ」シリーズからアクションフィギュア「NL-04 ギガストーム」を11月下旬に発売する。価格は41,800円。6月5日より予約受付が開始される。
Yahoo!ニュース エンタメ
2026年6月5日
「トランスフォーマー ミッシングリンク」で「ラチェット」が登場!12月下旬発売(HOBBY Watch)タカラトミーは、「トランスフォーマー」シリーズより、可動フィギュア「ミッシングリンク C-15 ラチェット」を12月下旬に発売する。価格は16,500円。 仮想復刻版「ミッシングリンク」シリーズ
Yahoo!ニュース エンタメ
2026年6月6日
中央アフリカのエボラ感染拡大は2014年の過去最大流行と同規模に達する可能性、米保健当局が警告米CDCのモデリングでは、エボラ感染が「危険な軌道」を辿る可能性があることが示されているが、専門家はアウトブレイクは予測が非常に難しいと警告している。米保健当局による新たな分析によると、中央アフリカのエボラ流行は、1万1,000人以上の死亡者を出した西アフリカの2014~2016年の流行と同規模に拡大する可能性がある。
The Guardian World
2026年6月8日
Lean4Agent: エージェントワークフロー及び軌跡の形式的モデリングと検証大規模言語モデル(LLM)に信頼性の高い多段階ワークフロー実行能力を備えさせることはAIの中心的課題となっている。LLMのエージェント機能の最近の進歩にもかかわらず、ほとんどのエージェントシステムはワークフロー実行軌跡の仕様化、検証、デバッグのための形式的手法を欠いている。この課題は数学における長年の問題を反映しており、自然言語の曖昧性が形式言語開発の動機となっている。この範例に触発されて、我々は依存型形式言語Lean4を用いてエージェント動作をモデリング・検証する最初のフレームワークLean4Agentを提案する。Lean4Agentはエージェントワークフローの意味的一貫性を形式的にモデリング・検証し、実行時失敗の局所化を可能にする拡張可能なLean4ライブラリFormalAgentLibを立ち上げる。FormalAgentLibに基づいて、さらにLeanEvolveを開発し、ワークフローを改善してその能力を強化する。
arXiv cs.AI
2026年6月8日
HKJudge:香港判決文の法的言説注釈付きコーパス - 裁判所の判断根拠、推論過程、判決内容の解釈本研究は、香港の判決文に対する言説分析のための初めての専門家注釈付き法的言説コーパス「香港判決文言説データセット(HKJudge)」を紹介する。HKJudgeは香港の5段階の裁判所階級全体にわたる刑事判決を含み、約29万文、650万トークンから構成され、法言語学の専門家により完全に注釈付けされている。2層構造の言説スキーマを設計し、裁判所が認定した事実、推論過程、判決内容を捉える。文レベルでは各文に26の修辞的役割のいずれかが割り当てられ、スパンレベルでは有罪判決要素(罪状、懲役期間、罰金)でさらに注釈付けされている。10人の法言語学注釈者によるアノテーションは高い一致度(κ = 0.8)を達成している。HKJudgeに対して修辞的役割分類と法的要素抽出の2つのタスクを定式化し、4つのBERTベースモデル、2つのオープンソースLLM(ゼロショットおよびファインチューニング設定)、および4つの商用LLMについて初の基準評価を提供している。この研究は、文レベルの言説注釈が香港判決文の構造モデリングに価値があることを実証し、法的判決予測に関する将来の研究のための豊富なデータ基盤を提供する。
arXiv cs.CL
2026年6月9日
スパースな縦断的データに基づくアルツハイマー病のトランジションベースのデジタルツインモデリングアルツハイマー病(AD)の進行は異質性が高く、散発的で不規則な縦断的データで観察されるため、予測と個別監視が困難です。 既存の機械学習アプローチはAD予測を改善しましたが、静的な分類やコホートレベルのリスク推定に重点を置き、個別のモデリングや不確実性を考慮した推論には限界がありました。 これらの課題に対処するため、多モーダル縦断的データを用いたAD予測とシナリオベース分析のための個別化されたデジタルツインフレームワークを提案します。
arXiv cs.LG
2026年6月9日
Express言語モデリング言語モデルの効率化を目指し、新たなツール「Express」が導入されました。このExpressは、これまで非因果的アテンションの近似に用いられていた手法を、因果的アテンションの近似へと転換させる機能を持ちます。 具体的には、既存の「Thinformer」という近似手法と組み合わせることで、因果的アテンションの近似精度を向上させることが期待されています。これにより、言語モデリングにおいて課題となっていた四つのリソースボトルネックの克服に貢献すると考えられます。これらのボトルネックには、長いコンテキストの事前処理やKVキャッシュの圧縮などが含まれており、Expressの活用によって、より効率的な言語モデルの開発が進む可能性があります。 arXiv cs.LG
arXiv cs.LG
2026年6月11日
ProHiFlo:階層的フローマッチングと関数的ガイダンスによる新規タンパク質生成de novoタンパク質生成は、治療薬設計、酵素工学、合成生物学において革新的な可能性を秘めています。拡散ベースおよびフローマッチングアプローチは進歩を遂げていますが、通常は単一解像度で動作し、機能的制約を組み込むメカニズムを欠いています。本稿では、3つの革新的な階層的フローマッチングフレームワークであるProHiFloを提案します。(1) 骨格構造をモデリングしてから全原子座標へと洗練させる粗視的から微視的への生成により、精度を維持しながら計算コストを削減します。(2) 事前学習済み予測器を活用した機能的ガイダンスにより、再学習なしで望ましい特性へと生成を誘導します。(3) 効率的なマルチスケール処理のための適応型SE(3)-同変アーキテクチャ。非条件付き生成、モチーフ足場構築、機能設計における実験は、4回のサンプリングステップを削減しながら、最先端のパフォーマンスを示しました。酵素活性部位の足場構築では、ProHiFloはRFDiffusionの41.2%に対し、58.9%の成功率を達成しました。
arXiv cs.LG
2026年6月16日
融合は万能ではない:イベント発生までの時間モデリングのためのクロスモーダル表現アラインメントマルチモーダル臨床データからの正確なイベント発生までの時間(TTE)予測は、モダリティの不均衡と分布シフトにより依然として課題となっています。本研究では、CT画像と縦断的EHRデータ間のクロスモーダル表現アラインメントのための、タスクや施設を超えて汎用化できるように設計された、ファウンデーションモデル主導のフレームワークを提案します。CTとEHRのモダリティは、ドメイン固有のファウンデーションモデルを用いて個別にエンコードされ、4つの原則的な融合戦略(late fusion, contrastive alignment, cross-attention, co-attention)を通じて共有潜在空間でアラインメントされます。肺塞栓症(PE)の死亡率と心血管疾患(CVD)の転帰という、臨床的に異なる2つのTTEタスクを、大規模な複数施設コホート(PE: N=3,099学習; 1,098内部; 435外部; CVD: N=2,951学習; 837内部; 682外部)で評価しました。
arXiv cs.AI
2026年6月16日
生理信号からのマルチモーダル感情認識のための深層時間モデリングとアンサンブル融合生理的ストレスと感情認識は、健康モニタリングと感情コンピューティングにおいて重要です。本研究では、手首と胸のセンサー信号を用いたマルチモーダル感情認識のためのWESADデータセットにおける、Long Short-Term Memory (LSTM)、Temporal Convolutional Networks (TCN)、Transformerなどの深層学習モデルの包括的な評価を提示します。手首のみ、胸のみの入力でモデルをトレーニングすることにより、各モダリティの個別の貢献度を評価するためにアブレーションスタディを実施します。さらに、マルチモーダル入力でトレーニングされた3つのアーキテクチャすべての予測を組み合わせる、レイトフュージョンアンサンブル戦略を実装します。また、各モデルに入力する前に手首と胸の信号を連結することにより、センサーレベルでの早期融合も採用します。結果は、Transformerモデルがマルチモーダル設定で一貫して最も高い精度を達成する一方、TCNモデルが手首のみの構成で最良のパフォーマンスを発揮することを示しています。
arXiv cs.CL
2026年6月16日
運転軌跡予測におけるインタラクションモデリングのためのグラフニューラルネットワーク層選択の比較研究自動運転システムは、安全かつ効率的な移動計画のために正確な軌跡予測に依存しています。グラフニューラルネットワーク(GNN)は、道路上のエージェント間の時空間的インタラクションをモデリングするための有望なアプローチとなっています。しかし、軌跡予測のためのGNNアーキテクチャの設計は標準化されておらず、どのグラフ層が空間的インタラクションと時間的ダイナミクスを効果的に捉えられるかについてのガイダンスはほとんどありません。本稿では、19種類のグラフ層について、軌跡予測に最も効果的なアーキテクチャを発見するために、それらの空間的および時間的処理能力に焦点を当てた詳細な比較研究を提供します。探索されたハイパーパラメータ設定内で、ARMA、Chebyshev、およびトポロジー認識層が他の層よりも一貫して優れたパフォーマンスを示し、5つの際立った層の組み合わせを強調します。
arXiv cs.LG
2026年6月18日
モントリオール強制アライナーと2026年の音声認識アライメントの現状モントリオール強制アライナー(MFA)は2016年にリリースされ、以来、研究および産業分野で最も広く使用されている強制アライメントツールとなっています。それから10年間で、MFAは、より大規模なオープンソースデータセット、統一されたIPA辞書、モデル適応、クロス言語フォネティック再マッピング、およびサポートユーティリティを使用した、より多くの言語と方言へのカバレッジ拡大を含む、大幅な開発を経てきました。本論文は、バージョン1.0以降のMFA 3.0の開発を記録し、古典的およびニューラル強制アライナーをベンチマークとして、英語、日本語、韓国語におけるMFAのパフォーマンスを評価します。MFA 3.0は、平均境界誤差15ミリ秒未満で、4つのベンチマークデータセットすべてにおいて最先端またはそれに近いパフォーマンスを達成しています。適応とクロス言語再マッピングは、MFAのトレーニング分布外の言語に効果的であり、発音確率モデリングと音韻規則は特定の条件下で改善をもたらします。
arXiv cs.CL
2026年6月19日
拡散言語モデル:実験的分析大規模言語モデル(LLM)は、自己回帰的生成によって言語モデリングに革命をもたらし、幅広いタスクで高いパフォーマンスを実現しました。最近、拡散言語モデル(DLM)は、次トークン予測ではなく反復的なノイズ除去を通じてテキストを生成する代替パラダイムとして登場し、シーケンス全体の並列的な洗練を可能にしました。多数の拡散ベースのアーキテクチャが提案されていますが、評価プロトコル、データセット、推論予算、生成ハイパーパラメータの違いにより、それらの能力を比較し、提供されるトレードオフを理解することが困難になっています。本研究では、最新のDLMの体系的な実験的分析を提示します。具体的には、推論、コーディング、翻訳、知識、構造化問題解決を網羅する8つのベンチマークで8つの最先端DLMを評価し、生成品質と計算効率の両方を明確に考慮します。下流タスクの評価を超えて、ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略を含む、推論時間における主要因子の影響を分析し、大規模な実験を、同一条件下でトレーニングされた小規模モデルの制御された比較によって補完します。
arXiv cs.AI
2026年6月19日
REVEAL++:アルツハイマー病リスクの視覚言語網膜モデリングのための微分可能な表現型グルーピング網膜は、認知機能低下リスクに関連する微細な構造パターンを捉え、神経変性疾患への非侵襲的な窓を提供します。REVEALのような視覚言語アラインメントフレームワークは、網膜眼底画像と構造化された臨床リスク記述をペアにすることで、アルツハイマー病(AD)の早期予測を改善することが示されています。これらのアプローチにおける重要な設計上の選択は、表現型グルーピングの使用であり、リスクプロファイルが類似した個人が、対照学習中にマルチポジティブペアとして扱われます。しかし、既存の方法では、表現型の類似性を離散的な構成概念として具体化し、硬いグループ割り当てに依存しており、これは厳格な監視を課し、グループ形成を表現学習から切り離します。本研究では、対照学習における表現型構造の連続的な定式化を提案します。サンプルを固定クラスターに割り当てるのではなく、網膜画像とリスクプロファイルの両方におけるモダリティ内埋め込み類似性から導出される微分可能な重み付け関数として、被験者間の類似性をモデル化します。
arXiv cs.AI
2026年6月19日
ITNet: 畳み込み、アテンション、再帰を包含する学習可能な積分変換畳み込みネットワーク、再帰ネットワーク、トランスフォーマーは、それぞれ異なる帰納的バイアス(局所性、逐次メモリ、コンテンツ依存のペアワイズ相互作用)をエンコードしており、その誕生以来、数学的に区別されてきた。本研究では、この断片化は、信号の処理方法における根本的な多様性を反映するのではなく、単一の基盤となる数学的オブジェクト、すなわち学習可能な積分変換の不完全な見方であることを示す。我々は、位置と特徴の両方に依存する学習可能なカーネルを中心に構築された統一アーキテクチャ、Integral Transform Network (ITNet) を紹介する。このカーネルは、ペアワイズ相互作用をモデル化する小さなニューラルネットワーク、具体的にはMLPとして実装されており、モデルがデータからその動作を適応させることを可能にする。畳み込み、自己アテンション(マルチヘッドを含む)、自己回帰再帰(LSTM、GRU、S4、Mambaを含む)が適切なパラメータ化の下で特殊なケースとして現れること、そしてITNetが連続演算子の普遍的近似器であることを示す。
arXiv cs.AI