TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月13日
NVIDIA、Ineffable Intelligenceが強化学習インフラストラクチャの未来構築で協力試行錯誤を通じて学習するAIシステムである強化学習エージェントは、計算を新しい知識に変換することができます。これがNVIDIAとIneffable Intelligenceの新しいエンジニアリングレベルの協業の焦点です。
NVIDIA Blog
2026年5月29日
Waymoが自動運転車登録で優位、テスラが後塵を拝するテキサス州の新しい登録制度により、自動運転車の市場競争が数字で評価される段階に入りました。Waymoが登録台数で優位に立っていますが、これは両社が全く異なるビジネス戦略を展開していることを示しています。Waymoは運転手不要の「ロボタクシー」を複数都市で商用サービス展開させており、一台ごとが営業車両として登録されるため登録数が多くなります。一方テスラは自社の電気自動車に自動運転機能を組み込んで一般ユーザーに販売するアプローチを取っており、既存車のソフトウェア更新を通じた自動運転化を進めているため新規登録数には反映されにくいのです。登録台数の差は単純な優劣ではなく、ビジネスモデルの根本的な違いを反映しています。
TechCrunch
2026年5月29日
ウェイモが自動運転車登録で優位、テスラが後塵を拝す新しい法律とAVトラッカーツールにより、テキサス州にどれだけのロボタクシーと自動運転トラックが存在するかが最も明確に把握できるようになった。
TechCrunch
2026年5月29日
LLM報酬設計が失敗するとき:スパース構造化RLのための診断駆動型改善セマンティック報酬関数インターフェースを持つスパース構造化強化学習タスクの場合、LLM生成報酬形成は一度限りの生成ではなくデバッグとしてより適切に枠付けされている。MiniGridを中核評価として、MuJoCoを境界ストレステストとして使用するPPO訓練エージェントを研究する。本監査では2つの支配的な知見を発見する。
arXiv cs.LG
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
FedQHD: 閉形式関数空間フェデレーション強化学習フェデレーション強化学習は、生のトラジェクトリを交換することなく、分散エージェントが協力してポリシーまたは価値推定を改善することを可能にします。ただし、FedAvgスタイルのパラメータ平均化は関数空間で一貫性がなく、クライアントが異なるエンコーダを使用したり、同じ非線形ネットワークを使用する場合でも問題が生じます。
arXiv cs.LG
2026年5月29日
強化学習ベースの産業用ディスパッチングにおけるシミュレーション・ツー・リアル・ギャップの解決(実行セマンティクスを通じて)イベント駆動型スケジューリング・ポリシーは産業環境で導入されており、非同期で部分的に観測されたシステム状態下で決定が行われます。その結果、決定状態は時間的一貫性を欠き、アクション実行可能性が明示的に定義されず、実行の由来に関する問題が生じます。
arXiv cs.AI
2026年5月29日
カタストロフィック・フォーゲッティングの機序的起源:RLがSFTよりも回路をよく保持する理由大規模言語モデル(LLM)のファインチューニングはしばしば以前の能力のカタストロフィック・フォーゲッティングを引き起こす。最近の研究によれば、強化学習(RL)は教師あり学習(SFT)よりも効果的に以前の能力を保持し、ポリシー勾配更新がより近い状態に留まることに起因している。
arXiv cs.LG
2026年5月29日
微分可能な信念ベースの対戦相手形成人間の協調は、戦略的行動を通じて他者の信念に影響を与える能力に依存している。マルチエージェント強化学習では、対戦相手形成がこの影響を複製しようとしているが、既存の方法は通常、対戦相手のパラメータ、ポリシー、または価値空間内で動作している。
arXiv cs.AI
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
ビッグ2における不完全情報下の自己対戦強化学習不完全情報の多人数ゲームは、エージェントが隠された情報、スパースな報酬、および非定常の対手の下で行動できるかどうかをテストします。4人プレイの不完全情報カードゲームであるビッグ2でこれらの課題を研究し、制御された比較を可能にする自己対戦RLフレームワークを開発しました。
arXiv cs.LG
2026年5月30日
株式会社Pyreneeへの出資バンドー化学がソフトウェアベースの安全技術企業Pyreneeへ出資し、業界の構造転換が加速しています。電動化により従来の部品需要が減少する中、同社は自動運転やドライバー支援システムなどの高付加価値領域での競争力強化を狙っています。交通データ解析能力は現代のモビリティ産業で極めて重要となっており、ソフトウェア企業との協業によって部品供給者からデータプラットフォーマーへの事業転換を目指す動きと解釈できます。ただし、ハードウェア企業とソフトウェア企業の融合には開発サイクルや人材文化の違いなど多くの課題があり、成功には一定の時間を要する見通しです。
PR TIMES
2026年6月1日
PFN、トヨタ未来創生センターとAI半導体を活用したフィジカルAI高速化の共同研究開始Preferred Networks(PFN)はトヨタ未来創生センターと協力し、フィジカルAIの高速化に関する共同研究を開始した。 本研究では、PFNが開発したAI半導体「MN-Core Lシリーズ」を活用する。ロボットや自動運転システムといった物理世界で動作するAIシステムの処理性能を向上させることが狙いだ。 従来、フィジカルAIは複雑な計算処理に時間がかかり、実装の課題となっていた。専用設計の半導体と両社の技術知見を組み合わせることで、リアルタイム処理の実現に期待が集まる。 両機関は各分野での強みを生かし、ハードウェアとソフトウェアの最適化を進める方針。成果は製造業やモビリティ分野での次世代AI応用につながる可能性がある。 (引用元:Preferred Networks)
2026年6月1日
PFN、トヨタ未来創生センターとAI半導体活用でフィジカルAIの高速化へPreferred Networksはトヨタ未来創生センターと新たな共同研究契約を締結した。両者は自社開発のAI半導体「MN-Core Lシリーズ」を活用し、フィジカルAイ(物理空間で動作するAI技術)の高速化を目指す。 フィジカルAIは、ロボットや自動運転システムなど、現実世界で動作するAI技術の総称。これまで処理速度が課題とされてきたが、MN-Core Lシリーズの導入により、リアルタイム処理性能の向上が期待される。 トヨタグループの研究開発拠点である未来創生センターとの協業により、両社の技術的知見を融合させることで、より効率的なAI実装が可能になると見込まれている。この共同研究は、次世代のロボット技術や自動運転システムの実用化加速につながる可能性がある。 (Preferred Networks)
Preferred Networks
2026年6月1日
SLAT: 効率的なCoT推論のためのセグメントレベル適応トリミング大規模推論モデルの最近の進歩は強化学習(RL)を通じた思考の連鎖(CoT)機能を大幅に改善している。しかし生成された推論チェーンはしばしば構造的冗長性(いわゆる過度な思考)に悩まされ、改善なく高い計算オーバーヘッドを引き起こしている。
arXiv cs.AI
2026年6月1日
自動運転のための強化学習における不確実性認識と時間的に規制された専門家アドバイスarXiv:2605.30576v1 発表型:新規 要旨:自動運転の強化学習における探索は本質的に危険である。エージェントは学習のために新しい行動を経験する必要があるが、探索は衝突やオフロード走行につながる可能性がある。我々は、長期的な危険を回避しながら探索を導くために専門家アドバイスを活用する不確実性認識フレームワークを提案する。
arXiv cs.AI
2026年6月1日
構造認識報酬による深い研究のためのプランナー中心強化学習深い研究タスクではLLMが調査対象を計画し、エビデンスを検索し、複数の調査分野にわたって長文の回答を合成する必要がある。既存の訓練パラダイムは短文の検証可能なQAをプロキシとして依存するか、モノリシックな長軌跡を最適化するかのいずれかであり、計画と実行が困難である。
arXiv cs.AI
2026年6月1日
Leanの定理証明のためのLLMフィードバック蒸留推論モデルのポストトレーニングは通常、検証可能な報酬からの教師あり微調整と強化学習を組み合わせ、最も一般的にはGRPOで行われている。しかしこのアルゴリズムは報酬の疎さ、限定的な探索、モード崩壊に悩まされている。自己蒸留に関する最近の研究に基づき、改善されたアプローチを提案する。
arXiv cs.AI
2026年6月1日
状態拡張とコンセンサスを用いた分離可能ダイナミクスの拡張可能な制約付きマルチエージェント強化学習状態拡張ポリシー学習と双対変数の分散コンセンサスを組み合わせた制約付きマルチエージェント強化学習の分散アプローチを提示する。本手法は、エージェントが分離可能なダイナミクスを持つシステムを対象とし、グローバルリソース制約を満たすために調整する必要がある。
arXiv cs.LG
2026年6月1日
EUDAIMONIA: AIにおける望ましくないダイナミクスの評価大規模言語モデル(LLM)は伴侶関係、感情開示、対人アドバイスのための会話パートナーとしてますます使用されているが、これらのインタラクションの社会的ダイナミクスは能力指向的または従来の安全性評価によってキャプチャされないハームを生じさせる可能性がある。本研究ではこれを評価するための手法を導入する。
arXiv cs.CL
2026年6月1日
起業家のプレゼン資料にありがちな「5大ミス」。注目スタートアップ直伝、資金調達を成功させる「伝え方」のコツ起業家にとって、投資家へのピッチ(プレゼン)は資金調達を受けるうえで避けて通れません。だが多くの起業家がピッチの場でミスを犯しがち。過去に何度も資金調達をしてきた先輩起業家たちからのアドバイスとは?
Business Insider Japan
2026年6月2日
東武の新型1000系「自動運転」どう対応するのか 大師線で28年度に実証実験、踏切多い亀戸線は? | ビジネス | 東洋経済オンライン2026年3月に東武鉄道から発表された新形式車両1000系。これまでの東武のデザインから一新し、車体前面が六角形の形状をしている。
東洋経済オンライン
2026年6月2日
防衛技術企業Mach Industriesが18億ドルの評価額に達し、1年で4倍に跳ね上がる22歳のファウンダー兼CEOイーサン・ソーントンにとって驚異的な展開の中、Mach Industriesはさらに3億ドルの資金調達に成功した。同社は既に5台の自動運転車を保有している。
TechCrunch
2026年6月2日
仕事で失敗する「ポジティブ星人」のあちゃーな特徴 - 榎本博明のビジネス心理学「大丈夫です、完璧です」そう自信満々に言った部下が、本番で痛恨のミスを犯す。「もっとポジティブに考えよう」とアドバイスしたら部下のパフォーマンスが落ちてしまった……ビジネスの世界ではポジティブ思考が重要、とよく言われる。しかし“ポジティブであるがゆえの落とし穴”もあるのだ。
ダイヤモンド・オンライン
2026年6月2日
NVIDIAのJetsonがエージェンティックAIを現実世界に展開NVIDIAは、COMPUTEXでエッジAIプラットフォーム「Jetson」の最新版アップデートを発表しました。 新バージョン「JetPack 7.2」では、自律的に判断・実行するエージェンティックAI機能が追加されます。これにより、ロボットや産業機器などの現場でより複雑なタスクを自動化できるようになります。 主な改善点として、CUDA 13の搭載により計算性能が向上し、Jetson AGX Orin 32GBモデルの処理能力も強化されました。また、Linuxの組込み向けプロジェクト「Yocto」への対応により、カスタマイズ性が広がります。複数のAIタスクを同時実行できるマルチインスタンスGPU機能も実装されました。 さらに、NemoClaw対応により、音声認識や自然言語処理などのAI機能との統合も容易になります。 これらの強化により、製造現場から医療、自動運転まで、幅広い産業でエッジAI活用が加速すると期待されています。 (引用元:NVIDIA Blog)
NVIDIA Blog
2026年6月2日
エージェント的Transformerが強化学習を通じた探索学習を証明可能に行う木探索は多くの言語エージェント推論および意思決定タスクの背後にある中心的な抽象化です。エージェントはアクションを探索し、失敗を記憶し、有望な代替案に向かってバックトラックする必要があります。しかし、Transformerベースのポリシーがこのような探索能力をどのように習得するかについて、理論的理解が不足しています。
arXiv cs.LG
2026年6月2日
CAST:GRPOのための非特権化クリップ付き非対称セルフティーチングとアドバンテージ反転検証可能な報酬を用いた強化学習(RLVR)、特にグループ相対方針最適化(GRPO)は、大規模言語モデルの推論を改善するために広く使用されています。しかし、結果レベルの報酬は疎な教示のみを提供し、サンプリングされた軌跡がすべて同じ結果を得た場合、グループ相対アドバンテージは消失します。
arXiv cs.AI
2026年6月2日
SDR:放射線科レポート生成のための設定距離報酬arXiv:2606.00440v1 発表タイプ:新規 概要:検証可能な報酬による強化学習は、ビジョン言語モデルの推論を急速に進歩させています。ただし、胸部X線レポート生成の場合、標準的な報酬(正確一致精度およびステップレベルのプロセス)は、レポートが順序付けされていない直交的な検査結果で構成されているため、互換性がありません。
arXiv cs.AI
2026年6月2日
CSRP: 効率を考慮した報酬による強化学習を通じた中国語テキスト修正のための思考の連鎖推論LLMベースの中国語文法誤り修正(CGEC)システムは2つの重大な課題に直面しています。汎用モデルは微妙な文法的区別のための特化した言語的先験知識が不足しており、最尤推定による教師あり微調整は最適化に失敗しています。
arXiv cs.CL
2026年6月2日
安全な強化学習のためのロバストシールディングシールディングは、マルコフ決定過程(MDP)における強化学習エージェントの安全性を正式に保証する効果的なアプローチです。しかし、既存のシールディング技術は通常、安全性に関連する遷移ダイナミクスの知識を仮定しており、これは実際には稀に満たされる要件です。
arXiv cs.AI