TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月26日
ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方背景 大規模言語モデル(LLM)の普及により、AIとの対話は身近なものになりました。一方で、特定の用途に特化した小規模なモデルをローカル環境で動かす試みも関心を集めています。 自分好みの喋り方などを言語モデルにさせるため […] 投稿 ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方 は Preferred Net…
Preferred Networks
2026年2月20日
日本語の自然さを測る評価手法の検証Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月25日
コード生成ベンチマークのためのサンドボックス環境の開発はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年4月28日
存在感が高まる中国AI「Kimi」、コーディング能力の高さを米国勢も評価中国発のAI「Kimi」がコーディング分野で高く評価され、国際的な認知を広げている。同サービスを展開するMoonshot AIによれば、プログラミング能力が米国企業からも注目を集めており、アジア発のAIツールとして存在感を増しているという。 Kimiのコーディング性能は、複雑なプログラミングタスクの解決能力の高さが評価されている。このような技術的な競争力は、中国のAI開発が世界的な水準に達していることを示す指標となっている。 従来、大規模言語モデルの開発はOpenAIやGoogleといった米国企業が主導してきた。Kimiの台頭は、AI開発における地域的な多様化が進行していることを意味している。技術革新の中心が複数の国や企業に分散する傾向は、今後のAI産業の発展に新たな競争軸をもたらす可能性がある。 中国のAI企業による国際的な評価獲得は、今後のグローバルなAI市場において、新しい選択肢の登場を示唆している。 (出典:Moonshot AI)
Moonshot AI (Kimi)
2026年5月8日
GitHub エージェンティック・ワークフローのトークン効率を改善するすべてのプルリクエストで実行されるエージェンティック・ワークフローは、API請求額を静かに積み重ねることができます。本記事では、独自の本番環境ワークフローを計測し、非効率性を見つけ、それらを修正するエージェントを構築した方法について説明します。
GitHub Blog (AI)
2026年5月11日
BalCapRL: RL ベースのMLLM画像キャプション生成用のバランス型フレームワーク画像キャプション生成はコンピュータビジョンの最も基本的なタスクの一つです。その開放性の性質により、マルチモーダル大規模言語モデル(MLLM)の時代に多大な関心を集めています。
Apple Machine Learning Research
2026年5月18日
pretrained model向けのベンチマークの構築Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月19日
NVIDIACEOジェンセン・フアンがDell Technologies World:「需要は放物線を描いて増加しており、全く放物線的です」NVIDIAベラ・ルービンNVL72による1トークンあたり10分の1のコストでのエージェンティックAI推論。エージェント・サンドボックスはNVIDIAベラで従来のCPUより50%高速に実行され、エンタープライズデータクエリは最大3倍高速です。
NVIDIA Blog
2026年5月19日
EpiCache: リソース制約のある環境での長期会話向けのエピソード的KVキャッシュ管理最新の大規模言語モデル(LLM)は、コンテキスト長を数百万トークンまで拡張し、長い会話履歴に基づいた一貫性のあるパーソナライズされた応答を実現しています。しかし、キー・バリュー(KV)キャッシュが...
Apple Machine Learning Research
2026年5月21日
グーグルがOpenAIを抜き、消費者向けAIの王座を奪うしかし、ユーザーは毎月数十億のトークンを消費しており、コスト面での課題が浮き彫りになっている
The Economist Business
2026年5月28日
AI ファクトリー:インテリジェンスの新しいインフラストラクチャAIファクトリーはトークンファクトリーであり、電力をリアルタイムでインテリジェンスに変換しています。エージェンシャルAIがスケーリングし、自律的で常時稼働する特別なエージェントがエンタープライズに配備されると、ワットあたりのパフォーマンスは...
NVIDIA Blog
2026年5月29日
金や石油と同じく、間もなくAIトークン先物を取引できるようになる大手取引所はAIトークンを中心とした派生商品を設計している。AIトークンは、計算上の産出物というより、むしろ原材料として見なされることが増えている。
TechCrunch
2026年5月29日
金や石油と同じように、AI トークンの先物取引が間もなく可能にAI計算能力が金や石油のような商品として先物取引の対象になろうとしています。生成AIの急速な普及に伴い、膨大な計算リソースの需要が高まる中、大手取引所がAIトークン(計算実行権の証明書)の先物商品の設計を始めました。これにより、AI企業や利用企業は数ヶ月先の計算力を事前に確保でき、産業全体の投資計画が立てやすくなります。同時に新たな金融商品として、多くの投資家が参入する市場へと成長する可能性があります。
TechCrunch
2026年5月29日
Amazon SageMakerでアゼルバイジャン言語モデルの構築アゼルバイジャンの大手通信事業者であるアゼルセル・テレコムLLCは、通信ユースケースとカスタマー向けアプリケーション用にAmazon SageMaker AIでアゼルバイジャン大規模言語モデル(LLM)を構築したいと考えている。
AWS Machine Learning Blog
2026年5月29日
「ミュトス」級AI一般公開へ 新型「オーパス4.8」も発表―米アンソロピック米アンソロピックが高性能AI基盤モデル「ミュトス」級を一般公開し、新型「オーパス4.8」を発表しました。これまで限定利用に止めていた同社の方針転換は、OpenAIやGoogleの急速な技術進化と商用化への競争対応を示しており、大規模言語モデルの性能差縮小に伴い、アクセス可能性と価格競争力が市場シェアの決定要因へと変わりつつあることを反映しています。一般公開により、金融や製造、医療などAI導入の障壁が高かった領域での実装が加速し、スタートアップなど小規模企業による高性能モデル利用の民主化効果が期待される一方で、著作権問題やディープフェイク悪用、バイアス拡大など規制・倫理面での新たな課題が生じる可能性があります。
時事通信
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月29日
カタストロフィック・フォーゲッティングの機序的起源:RLがSFTよりも回路をよく保持する理由大規模言語モデル(LLM)のファインチューニングはしばしば以前の能力のカタストロフィック・フォーゲッティングを引き起こす。最近の研究によれば、強化学習(RL)は教師あり学習(SFT)よりも効果的に以前の能力を保持し、ポリシー勾配更新がより近い状態に留まることに起因している。
arXiv cs.LG
2026年5月29日
トーンに気をつけよう:トーンはLLMのパフォーマンスを変えるか?大規模言語モデル(LLM)の使用が増加していますが、プロンプトのスタイルとトーンによってパフォーマンスが異なることが観察されています。本研究では、プロンプトのトーンの変動が客観的な多肢選択問題に対するLLMの精度にどのような影響を与えるかを調査しています。
arXiv cs.AI
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
潜在推論による堅牢で効率的なガードレール大規模言語モデル(LLM)の安全性維持は、現実世界のアプリケーションへの導入が増加する中で極めて重要です。既存の安全ガードレールは通常、単一パス分類に依存するか、より最近では蒸留推論を使用しています。推論ベースのガードレールは従来の分類方法を大幅に上回ります。
arXiv cs.AI
2026年5月29日
StoryMI: 操作可能なマルチエージェント治療対話生成大規模言語モデル(LLM)は流暢な対話を生成できますが、先行研究は状況的な根拠付け、動的戦略制御、および動機面接(MI)の臨床基準に合致した評価が不足しています。我々はStoryMIを導入しました。これは制御可能なMI対話生成のための複数LLMエージェントフレームワークです。
arXiv cs.CL
2026年5月29日
モデルが一致しない場合:公開コメント分析向けLLM評価の再考連邦機関は公開コメント・コーパスを分類するために大規模言語モデル(LLM)を展開しており、モデルの記録の編成は政策立案者が見るものと登録される議論を形作ります。小規模な検証セットに対する姿勢精度に基づく標準的な評価は、モデルが相違する時期を検出できません。
arXiv cs.AI
2026年5月29日
幻覚は有用か?システムI/IIの推論連鎖によるSLMでの多段階質問解決最近、小規模言語モデル(SLM)が注目を集めています。これらは高速で良好な性能を示し、大規模言語モデル(LLM)よりもハードウェア要件が低いです。しかし、SLMはLLMよりも頻繁に幻覚を生じ、複雑な多段階推論問題を解く能力に影響を与えます。
arXiv cs.CL
2026年5月29日
LCO: LLMベースの制約最適化によるより安全なエージェントLLM実世界タスク対応大規模言語モデル(LLM)は自律エージェントとしてますます機能していますが、環境との継続的なインタラクションはコンテキスト内報酬ハッキング(ICRH)につながる可能性があり、これはLLMがプロキシ目標を最大化するために行動を反復的に最適化し、意図しない有害な副作用を生み出す現象です。
arXiv cs.CL
2026年5月29日
CosmicFish-HRM: コンパクト言語モデルにおける階層的回帰メカニズムを介した適応的推論大規模言語モデルは強力な推論能力を実現しているが、膨大なパラメータ数と高い推論コストが課題である。本研究では、コンパクト言語モデルにおける適応的推論深度の異なるアプローチを探索し、CosmicFish-HRMを提案している
arXiv cs.LG
2026年5月29日
ペーパーエージェント、ペーパーゲイン: DeFi投資エージェントの実証分析オンチェーン自動取引にAIを使用するDeFi投資エージェントは、2024年後半以来、合計30億米ドルを超えるトークン評価を達成しています。1,900以上のAIタグ付き暗号プロジェクトを調査し、投資焦点のエージェントにフィルタリングして、戦略にまたがる10の代表的なプロジェクトをキュレーションしました。
arXiv cs.AI
2026年5月29日
UniMaia: 人間らしいプレイのための言語によるチェス戦略の操舵大規模言語モデルの最近の進歩により、自然言語は複雑なシステムを制御するための柔軟なインターフェースとして機能するようになったが、大規模な多モーダル訓練またはドメイン固有の帰納バイアスの弱化が必要である。チェスなどの構造化意思決定領域では、専門的なアプローチが優先される。
arXiv cs.CL
2026年5月29日
ReasonOps:LLM推論トレースのオペレータセグメンテーション大規模推論モデルからの思考の連鎖トレースは数万のトークンに及ぶ可能性がありますが、その内部構造を説明するための語彙が不足しています。思考の連鎖トレースを分析するために開発された以前の方法は、あまりに厳格であるか表現力が不十分であり、領域全体の特徴を捉えられていません。
arXiv cs.AI
2026年5月29日
カリキュラムのカスタマイズ:動的データ・モデル互換性による学生中心の推論蒸留arXiv:2605.29229v1 文書の発表。推論蒸留は大規模言語モデル(LLM)から小規模モデルへ複雑な推論能力を転移させますが、その成功は訓練データが学生モデルとどの程度合致しているかに依存します。本論文では、データ・モデル互換性(DMC)メトリクスを導入し、その適合性を評価するために使用できます。
arXiv cs.AI