TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
安定性-表現性ギャップの橋渡け: 低資源音声言語モデルの合成データスケーリングと優先度調整音声言語モデル(SLM)は明示的な音素グラフ変換パイプラインをバイパスすることで音声合成の有望なパラダイムとして出現しています。ただし、低資源言語での有効性は転記済み音声の不足によって根本的に制限されています。実践では、合成データが重要になっています。
arXiv cs.CL
2026年5月29日
初音ミク公式YouTubeチャンネル「39ch」の新作オリジナルMV『Cocho Cocho / 鬱P feat. 初音ミク』公開!初音ミク公式YouTubeチャンネル「39ch」が、プロデューサー鬱Pとのコラボレーション新曲『Cocho Cocho』のMVを公開しました。デジタルアイドル初音ミクは登場から18年を経て、技術デモから独立した創作エコシステムへと進化しており、今回のMV公開は音声合成技術が人間のミュージシャンと対等なコラボレーターとなったことを示しています。ボーカロイドの台頭により、従来の音楽産業における歌手と作曲家の非対称な権力構造が揺らぎ、複数のクリエイターが「声」を重層的に利用することで創作者の個性がより強調される新たな構造が生まれています。この動きは日本の文化的資産の国際展開戦略として位置付けられ、グローバル市場でのAIアーティスト認知向上と音楽制作の民主化をもたらす可能性があります。
PR TIMES
2026年6月1日
ナレッジグラフ強化ゼロショット・トピック分類:複数戦略の比較研究arXiv:2605.30465v1。ラベル付き訓練データなしでの多ラベル・トピック分類は困難な課題であり、特に複雑な関係情報を含む文書の場合。記事ごとのナレッジグラフ拡張がどのように分類に影響するかを体系的に調査したゼロショット多ラベル・トピック分類フレームワークを提示。
arXiv cs.CL
2026年6月3日
Humanoid-GPT:ゼロショット動作追跡のためのデータと構造のスケーリング人間型ロボットの動作制御技術に新たな進展がもたらされた。AI研究機関による新手法「Humanoid-GPT」は、20億フレームに及ぶ膨大な動作データで訓練されたGPT型の言語モデルで、ロボットの全身制御を実現する仕組みだ。 複数のモーションキャプチャデータセットと大規模な内部記録を統合して学習させることで、これまで見たことのない動作や制御タスクに対しても高い精度で対応できるようになった。このゼロショット汎化能力により、複雑で動的な動作追跡が可能になり、人間のような自然な動きを持つロボットの実現に近づいた。 研究チームはデータ量とモデル規模の拡大に焦点を当てることで、汎用的な動作制御システムの構築に成功した形だ。この技術は将来のロボット技術における実用化の道を広げる可能性があり、産業用ロボットや介護支援ロボットなど様々な分野での応用が期待される。 (引用元:arXiv cs.AI)
arXiv cs.AI
2026年6月6日
多語表現分類における監督学習と文脈内学習の比較:トルコ語軽動詞構文を対象トルコ語の言語処理技術に関する研究が、自然言語処理分野で注目を集めている。トルコ語に特有の「軽動詞構文」と呼ばれる表現は、文法上は通常の動詞と目的語の組み合わせに見えながら、実際には慣用句として機能するため、従来のAI言語モデルにとって識別が困難だった。 研究では、BERTurkという専用モデルと、ChatGPTなどの大規模言語モデルの性能を比較検証した。結果として、事前学習なしのゼロショット学習では、大規模言語モデルは誤検出を抑える傾向を示したものの、対象の表現を見落とす傾向が見られた。一方、単一の例を学習するワンショット学習では検出精度が向上したが、モデルが特定のパターンに過度に反応するバイアスが生じる課題が明らかになった。 この知見は、多言語自然言語処理システムの開発や、言語特性に応じた最適なAI手法の選択に有用な情報となる見込みだ。 (arXiv cs.CL)
arXiv cs.CL
2026年6月8日
寝不足になるほど面白い ローカルAIと音声合成をつないだら、キャラが普通にしゃべり始めた (1/5)日本語に特化して開発されているTTSモデル(Text-to-Speech、テキストから音声)の「Irodori-TTS v3」が話題になっています。最近、様々なTTSが登場しているのですが、アナウンサー的な話し方のTTSが多いなか、このモデルは、より幅広い感情表現ができ、演技までできるうえに、生成速…
はてなブックマーク IT
2026年6月8日
HKJudge:香港判決文の法的言説注釈付きコーパス - 裁判所の判断根拠、推論過程、判決内容の解釈本研究は、香港の判決文に対する言説分析のための初めての専門家注釈付き法的言説コーパス「香港判決文言説データセット(HKJudge)」を紹介する。HKJudgeは香港の5段階の裁判所階級全体にわたる刑事判決を含み、約29万文、650万トークンから構成され、法言語学の専門家により完全に注釈付けされている。2層構造の言説スキーマを設計し、裁判所が認定した事実、推論過程、判決内容を捉える。文レベルでは各文に26の修辞的役割のいずれかが割り当てられ、スパンレベルでは有罪判決要素(罪状、懲役期間、罰金)でさらに注釈付けされている。10人の法言語学注釈者によるアノテーションは高い一致度(κ = 0.8)を達成している。HKJudgeに対して修辞的役割分類と法的要素抽出の2つのタスクを定式化し、4つのBERTベースモデル、2つのオープンソースLLM(ゼロショットおよびファインチューニング設定)、および4つの商用LLMについて初の基準評価を提供している。この研究は、文レベルの言説注釈が香港判決文の構造モデリングに価値があることを実証し、法的判決予測に関する将来の研究のための豊富なデータ基盤を提供する。
arXiv cs.CL
2026年6月10日
時系列を言語として捉える:汎用時系列基盤モデルのためのユニバーサル・トークナイザーarXiv:2606.09861v1 新規発表 要旨:次トークン予測(NTP)はLLMの事前学習を統一してきたが、その応用は無限で連続的な時系列(TS)には未解決のままでした。このギャップを埋めるため、TSを離散トークンに変換するユニバーサル・トークナイザーUniTokと、これらのトークン上でNTPにより事前学習された基盤モデルUniTok-FMを提案します。UniTok-FMは、ゼロショットおよびプロンプト強化型予測、さらに訓練不要のインコンテキスト推論による少数ショット生成・分類をサポートする汎用基盤モデルであり、これは先行研究では達成されていませんでした。技術的には、UniTokはスケール安定化のためのプレフィックス正規化、エンコード・デコードのための段階的解像度因果アーキテクチャ、および学習のための構造保存型再構築損失を組み込んだベクトル量子化オートエンコーダーです。UniTok-FMは、TS固有の修正なしに市販のLLMアーキテクチャを採用しています。
arXiv cs.LG
2026年6月11日
安全データシートからの情報抽出における大規模言語モデルのベンチマーク安全データシート(SDS)からの構造化情報の正確な抽出は、文書形式の多様性や従来のルールベース手法の限界から、産業安全分野では依然として課題となっています。本研究では、自動SDSデータ抽出のための最新の大規模言語モデル(LLM)をベンチマークし、テキストベースおよびマルチモーダル処理パイプラインを比較します。Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70Bの4つのモデルを、ゼロショット、フューショット、連鎖思考(Chain-of-Thought)の3つのプロンプト戦略で体系的に評価しました。評価フレームワークでは、50,000以上の抽出データフィールドにわたる精度、レイテンシ、コストを評価しました。結果として、テキストベースの抽出は、すべての指標においてマルチモーダル処理を常に上回ることが示されました。Chain-of-Thoughtプロンプトと組み合わせたGemini 1.5 Proが最高の精度(84%)を達成し、GPT-4o(81%)とClaude 3.7 Sonnet(79%)を上回りました。
arXiv cs.CL
2026年6月17日
EvolveNav:ゼロショット物体目標ナビゲーションのための先見的な事前反省と自己進化する記憶新たな研究「EvolveNav」が、事前の学習なしに特定の物体目標を見つけ出す人工知能エージェントの能力向上を目指す自己進化型フレームワークを提案しました。この技術は、過去の移動経路から有用な知識を抽出し、それを行動可能なルールとして記憶に蓄積する点が特徴です。 EvolveNavの主要な機能の一つは、この記憶に導かれる「事前反省モジュール」です。これにより、エージェントは効率の悪い探索経路を削減し、より迅速かつ的確に目標物体に到達できるようになります。研究者たちは、このアプローチが既存のベースライン手法と比較して、目標達成の成功率と探索の効率性の両方で優れていることを確認しました。 このフレームワークは、「ゼロショット物体目標ナビゲーション」と呼ばれる分野に属し、未知の環境や状況においても柔軟に対応できるエージェントの開発に貢献する可能性があります。将来的には、災害救助ロボットや自動運転システムなど、幅広い応用が期待されます。 引用元: arXiv cs.AI
arXiv cs.AI
2026年6月17日
SpeechDx: クリニカル音声AIのためのマルチタスクベンチマーク音声は、神経系、運動系、呼吸器系、声帯系を同時に活用することで、健康状態をユニークに把握できる情報源となります。現在のクリニカル音声AIの手法は、主に個別の疾患に特化した研究によって進歩してきましたが、結果の比較や一般化の評価を困難にしてきました。そこで、12のデータセットと27のタスクを多様な健康状態にまたがって網羅する、大規模なクリニカル音声AIベンチマークであるSpeechDxを導入します。共通の臨床メカニズムを横断した評価を可能にするため、SpeechDxはタスクを音声生成の段階(概念化、言語化、発声)で構造化します。このベンチマークは、ラベル付きデータが限られているタスクを含め、複数のデータセットにわたる同じ健康状態を評価することで一般化能力をテストし、臨床的に意味のあるパターンとデータセットの人工的な特徴を区別します。すべてのタスクにおいて、またゼロショットのクロスコンディション転移下で、12の最先端オーディオエンコーダーを体系的に評価します。
arXiv cs.AI
2026年6月19日
いつ信頼し、どう抽出するか:軽量で堅牢な科学的時系列予測のためのマルチ基盤モデルガイダンス時系列基盤モデル(TSFM)の物理科学分野への展開は、重要なトレードオフによって阻害されている。これらのモデルは豊かで普遍的な時間的ダイナミクスをエンコードする一方で、特定の科学分野にゼロショットで適用する際に深刻な分布のずれが生じ、その計算コストはエッジコンピューティングセンサーネットワークへの展開を妨げている。我々は根本的な課題に取り組む。ずれのある基盤モデル(FM)から潜在的な構造知識をどのように抽出して、軽量で専門的な予測器を訓練できるか?我々は、マルチティーチャー蒸留をインスタンスごとの決定プロセスとして再構築する新しいフレームワーク、Gated Uncertainty-Aware Routing for Distillation(Guard)を提案する。このフレームワークは2つの適応メカニズムを備えている。(1)多様な基盤モデル間の相補性を利用し、ローカル入力統計に基づいて最も関連性の高いティーチャーを動的に選択するコンテクスチュアルルーター。
arXiv cs.LG
2026年6月19日
創発的アライメント大規模言語モデル(LLM)は、自身の出力が人間の倫理観と乖離している場合にそれを識別できるのか?そして自己修正は可能か?我々はLLMに、自身の推論と出力をレビューする「良心ステップ」を付与し、訓練損失に直接選好最適化(DPO)を用いたアライメントコンポーネントを拡張して、非倫理的な出力からモデルを逸脱させる。この結果、訓練、ファインチューニング、敵対的プロンプティング、ゼロショット学習など、幅広いアプリケーションでモデルをアライメントさせるオンライン技術が実現する。これは、より弱い、あるいはより強いジャッジを必要とせず、代わりに自身の凍結されたコピーに依存する。以前の研究である「創発的乖離」シナリオでは、モデルをハッキングコードにファインチューニングすることで、様々な創発的な非倫理的行動が示された。それに対し、我々は「創発的アライメント」を達成する方法を実証的に示す。単一のハイレベルな内省的な質問が、同じコードハッキングシナリオ下で、訓練を倫理的なモデルへと導く。
arXiv cs.AI
2026年6月19日
クロスリンガル転移における言語的関連性とタスクアライメントの分離我々は、7つの大規模言語モデル(4B~671Bパラメータ)をアラビア語でファインチューニングし、セム諸語および非セム諸語でのゼロショット読解能力を評価することで、クロスリンガル転移を研究する。密なアーキテクチャとMixture-of-Expertsアーキテクチャ全体において、セム諸語特有の転移の証拠は見つからなかった。ベースラインが弱いモデルは全ての言語で劇的に改善する一方、ベースラインが強いモデルは言語ファミリーに関わらずわずかな改善しか示さなかった。連鎖思考のアブレーションはこの発見を補強する。ファインチューニングから最も恩恵を受けるモデルが、推論時の推論からも同様に恩恵を受けることは、両方のメカニズムがクロスリンガル知識転移ではなく、タスクフォーマットのアライメントに対処していることを示唆している。
arXiv cs.CL
2026年6月23日
EmoInstruct-TTS:デュアルパス命令誘導型感情音声合成命令ベースの制御可能な音声合成により、ユーザーは自然言語で感情を指定できます。しかし、既存のアプローチはしばしば粗い感情ラベルに依存し、詳細な強度モデル化を欠いています。本研究では、感情音声合成のためのデュアルパス命令誘導型フレームワークであるEmoInstruct-TTSを提案します。詳細なカテゴリや強度レベルを含む48の感情状態をカバーする教師あり意味音響感情埋め込みであるEmotion2embedを導入します。自由形式の指示から埋め込みを推論するために、音響的に裏付けられた感情表現を生成するInstruction-Conditioned Emotion Flow Model(ICE-Flow)を設計します。推論された埋め込みは、意味計画を維持しながら明示的な感情制御を提供するLLMベースの合成パイプラインに統合されます。実験により、強力なベースラインと比較して感情制御性と音声自然性が向上することが示されています。
arXiv cs.CL
2026年6月23日
CSIネイティブ基盤モデルへ:6G向けチャネル適応型ロードマップ無線基盤モデルは、第6世代(6G)システム向けの再利用可能なチャネル状態情報(CSI)インテリジェンスへの道を提供する。しかし、既存の汎用バックボーン適応およびCSI事前学習手法は、CSIを伝搬条件付きチャネル応答としてではなく、タスクテンソルとして扱うことが多く、無線環境の固有の時間・周波数・空間幾何学的特性を捉えきれていない。本稿では、CSIネイティブ基盤モデルに向けたチャネル適応型ロードマップを提示し、事前学習、位置モデリング、アテンション制御を3つのチャネル要件(スケール認識型異種公開、物理的時間・周波数・アンテナ座標、相関境界トークン相互作用)に整合させる統一フレームワークを提案する。広範な実験により、提案フレームワークのゼロショット汎化(空間・時間・周波数タスク全体でNMSEを4 dB以上削減)、スケール外挿(8倍の未知アンテナスケーリング下で最大5.4 dBのゲイン)、推論効率(モビリティ認識処理を最大18.8%高速化)の3つの次元での優位性が実証された。
arXiv cs.LG
2026年6月24日
RAGシステムにおける先行優位性の定量化Retrieval-Augmented Generation (RAG)は、大規模言語モデルを外部知識に接地させますが、現在の評価は離散的なヒューリスティックに依存しており、これは真の文脈情報抽出とパラメータメモリからの想起を区別できない「認識論的盲目」に苦しんでいます。この問題に対処するため、我々はNormalized Context Utilization (NCU)メトリックを導入します。これは、ゼロショット、オラクル、敵対的条件下での連続的なトークン対数確率を活用し、文脈情報ゲインを厳密に定量化します。1.5Bから72Bパラメータのアーキテクチャと、ある商用APIを評価した結果、厳密な事実抽出(Chain-of-Thought推論なし)においては、従来のスケール則は極端な収穫逓減を示し、非常に効率的なSmall Language Models (SLMs)が、高キャパシティなアーキテクチャと同等かそれ以上の性能を発揮することが明らかになりました。さらに、「先行優位性」がモデルのスケールや商用アライメントと相関することを示しました。
arXiv cs.CL
2026年6月24日
製品の望ましさに関する数値的・分類的隠れた感情分析の効率性と説明可能性のためのLLM利用評価定性的な製品フィードバックはニュアンスのあるユーザー体験を明らかにしますが、その隠れた感情を測定することは困難です。本論文では、大規模言語モデル(LLM)を使用して、このようなデータから製品の望ましさを定量化する、スケーラブルで解釈可能なフレームワークを提案します。ZORQとCARMAの2つのProduct Desirability Toolkit(PDT)データセットを使用し、106の回答者タームグルーピングをゴールドスタンダードの人間によるアノテーションで評価し、明示的なレビュー評価に依存せずに、ゼロショット連続数値感情スコアリングとカテゴリ感情分類を評価します。データセット全体で、LLMは定性的な回答から直接数値感情スコアを生成し、専門家のラベルに非常に近く、ピアソン相関係数は最大0.97、分類精度は最大94%を達成しました。LLMは、複数の形式で提示されたデータを処理しても堅牢性を維持し、一貫して高い信頼性を示しました。対照的に、辞書ベースおよびトランスフォーマーベースラインでは統計的に有意な結果は得られませんでした。
arXiv cs.CL
2026年6月25日
エージェント型説得における複合的失敗の診断と緩和:分類学的戦略検索を通じてマルチステップでオープンエンドな環境における基盤モデルエージェントは、初期の誤りが長期間の軌跡を汚染する複合的エラーに頻繁に悩まされます。マルチエージェントディベート(MAD)は決定論的なドメインで成功を収めていますが、説得のような主観的なタスクでは、エージェントは深刻な問題のドリフトと迎合的な同調に苦しんでいます。標準的なRetrieval-Augmented Generation(RAG)におけるセマンティックリークがこれらの失敗の再現可能なトリガーであることを特定しました。これは、標準RAGが論理的必然性よりも語彙の重複を優先するためです。このリークを排除するために、Taxonomic Strategy RAG(TS-RAG)を導入しました。これは、議論の構造とトピックの内容を分離するために、戦略を離散的なカテゴリのボトルネックにルーティングするシステム介入です。ゼロショット・クロスドメイン評価により、TS-RAGは標準的なセマンティック検索が崩壊する抽象論理の転移を大幅に改善することが示されました。
arXiv cs.AI
2026年6月29日
統一ゼロショット時系列予測:ダーツ財団2020年の初回リリース以来、ダーツは時系列分析に広く使われるオープンソースのPythonライブラリとなりました。最近、一連の基盤モデルがゼロショット予測の精度向上を主張し、カスタムモデルのトレーニングから事前トレーニング済みの汎用予測モデルの活用へのパラダイムシフトを約束しています。しかし、基盤モデルは、断片化されたインターフェースと一般的なツールとの相互運用性の制限を持つ独立したパッケージとしてリリースされることが多く、完全なパイプライン内での共同評価と統合を困難にしています。ダーツでは、標準化されたフルサイクル予測インターフェースを提供する統一された exttt{FoundationModel}クラスコレクション(Chronos-2, TimesFM 2.5, TiRex, PatchTST-FM)を開発しました。これにより、基盤モデルをエコシステムに統合するための外部依存性を最小限に抑えました。既存のダーツパイプラインは、名前の変更だけで基盤モデルを使用できるようになりました。
arXiv cs.LG
2026年6月29日
プレゼンテーション自動コーチングの調査:システム、手法、および未解決の課題スピーチのプレゼンテーションに対する自動コーチングは、コンピュータ支援発音トレーニング(CAPT)、プロソディモデリング、音声合成の交差点に位置しますが、これまでこれらの側面において既存のシステムを体系的に調査・比較した研究はありませんでした。本調査では、発音チューター、流暢さ・プロソディコーチ、マルチモーダルトレーナー、会議の質疑応答練習ツールなど、自動プレゼンテーションコーチングシステムをレビューし、分類します。セグメンタル発音、語彙ストレス、超セグメンタルプロソディ、ペース配分、内容の忠実性という5次元のタスク分類を導入し、調査対象システムをそれに明示的にマッピングして、カバー率のギャップを明らかにします。さらに、これらのシステムが採用するコア技術手法、すなわち、発音、プロソディ、流暢さの評価のためのTTSベースの模範生成および診断手法をレビューします。主要な未解決の課題には、注釈付きプレゼンテーションコーパスの不足、多様な第一言語の背景を持つ学習者に対するアクセントに公平なフィードバックの実現、リアルタイムリハーサルに向けた低遅延診断の提供が含まれます。
arXiv cs.CL
2026年7月1日
科学遺産の架け橋:持続可能な知識移転のためのアラビア語・ロシア語並列コーパスとLLMベンチマークロシア語とアラビア語は科学コミュニケーションにおける主要言語の一つです。言語の壁は、これらのコミュニティ間の研究結果の交換を妨げ、国際協力や持続可能性関連の研究の進歩に影響を与えています。本研究では、アラビア語・ロシア語の科学翻訳のためのベンチマークを提案します。このベンチマークは、科学論文の抄録と一般ドメインのテキスト(宗教、ニュース、会話)から収集された約27,000文ペアからなるハイブリッド並列コーパスを含んでいます。LoRA(ランク8、16、32、64)を用いて、3つの多言語言語モデル(mT5-base(5.8億パラメータ)、NLLB-200-distilled-1.3B(13億)、Qwen2.5-7B-Instruct(70億))をファインチューニングしました。QLoRA(ランク8)を用いたQwen2.5-7Bモデルは、BLEU 23.15、chrF 43.89、BERTScore 0.906、COMET 0.758を達成しました。これは、ゼロショットベースラインと比較してBLEUで+4.36、COMETで+0.051の向上です。
arXiv cs.CL
2026年7月2日
インディ・ロムコム:ローマ字化されたインド・英語指示におけるLLM評価のためのコード混合ベンチマークローマ字化コードミキシング(RCM)は、バイリンガルの話者がローマ字で地域言語と英語を流暢に融合させるもので、多言語コミュニティにおける主要なコミュニケーション形態として台頭しています。大規模言語モデル(LLM)は、単一言語およびネイティブスクリプトのベンチマークでは高いパフォーマンスを発揮しますが、RCMベースのコンテンツでの指示の理解や推論能力については、ほとんど探求されていません。そのため、インドのローマ字化コード混合指示における体系的な評価を促進するためのベンチマーク、インディ・ロムコムを導入します。このベンチマークは、7つの指示追従タスク、4つの広く話されているインドの言語、3つの制御されたコードミキシング強度レベルを網羅しています。ゼロショットおよびフューショットの設定で、プロプライエタリ、オープンウェイト、インド特化モデルを含むLLMスイートを広範囲に評価します。LLMはRCM指示において一貫してパフォーマンスが低く、コードミキシングの密度が増加するにつれてパフォーマンスは低下します。
arXiv cs.CL
2026年7月3日
SPARCLE:対照言語埋め込みによる話者認識アラインド表現音声合成における近年の進歩は、音素表現から直接的な書記素モデリングへと移行しています。音素は、テキストと音響間の1対多のマッピングに対応しますが、話者固有の音響変動を捉えられない書記素から音素(G2P)システムに依存しています。先行研究では、書記素ベースのモデルが音素ベースのシステムよりも大規模で優れた性能を発揮することを示していますが、リソースの少ない設定ではそうではありません。本稿では、話者認識書記素表現モデルであるSPARCLEを提案します。これは、文字に正確な音響実現を付加することで文字を強化します。SPARCLEは、話者IDを条件として、書記素を対応するWav2Vec2音響表現にアラインするために対照目的でトレーニングされます。結果として得られるモデルは、下流のテキスト音声合成(TTS)タスクのG2Pシステムの代替として機能します。SPARCLEが生成品質を改善し、標準的な書記素ベースのモデルと比較して、極端なリソースの少ない設定で単語エラー率を半分に削減することを示します。
arXiv cs.CL
2026年7月3日
Googleが追加学習不要の予測モデル「TabFM」を発表(ビジネス+IT)米グーグル(Google Research)は2026年6月30日、表形式データに特化したゼロショットAI基盤モデル「TabFM」を発表した。売上や顧客情報などの表データに対し、事前の追加学習(ファ
Yahoo!ニュース IT
2026年7月7日
電力価格予測における時系列基盤モデルの評価:汚染リスク、分布シフト、共変量依存性時系列基盤モデル(TSFM)は、ゼロショット予測において高い性能を示していますが、共変量駆動型の非定常な設定での汎化性能は十分に探求されていません。電力価格予測(EPF)は、複雑な時間的依存性、分布シフト、構造的および文脈情報への強い依存性から、挑戦的なテストベッドとなります。本研究では、汚染リスクを軽減し、TSFMの公平な評価を可能にするために、EPFのための2つのデータセットベンチマーキングフレームワークを提案します。点予測および確率的予測性能、テール挙動、価格高騰、およびドメイン固有手法との比較を含むEPFの主要な側面を検証します。TSFMは非常に競争力があり、しばしば汎用ベースラインを上回ることを発見しました。しかし、その性能は共変量サポートに決定的に依存し、EPFに特化されたドメイン固有手法を一貫して超えるわけではありません。興味深いことに、TSFMとドメイン固有手法の単純なアンサンブルは、かなりの可能性を秘めているように見え、両アプローチが補完的な予測情報を捉えていることを示唆しています。
arXiv cs.LG
2026年7月7日
GRAFT: ゼロショット音声合成における精密な発音のためのグラフト参照音声我々は、テキスト・トゥ・スピーチ(TTS)ニューラルコーデック言語モデリングのための単語ごとの発音条件付けメカニズムであるGRAFTを発表する。既存のシステムは高い明瞭度と自然さを実現するが、テキストの曖昧さを継承し、稀な固有名詞、外来語、専門用語を誤って発音する。音素条件付きモデルでさえ、単語ごとの発音に対する直接的な音響的制御は提供しない。GRAFTは、モデル自身の音声トークナイザーでエンコードされ、プロンプト内の単語の位置に紐付けられた短い音声サンプルから選択された単語の発音を制御する。トレーニングデータ構築中のボイスコンバージョンは、ヒント話者とターゲット話者を分離するため、ヒントはどの音声からでも取得できるが、出力はターゲット音声のままである。英語のブラインドリスニング研究では、人間評価者はGRAFTを明確な差で1位と評価し、難しい単語のレンダリングがその単語の参照録音に最も近いと判断した。
arXiv cs.LG
2026年7月7日
データ効率的なコードスイッチングASRのための強化学習音声言語モデルはコードスイッチング音声に対応可能ですが、そのデコーディングはコードスイッチングに最適化されておらず、言語境界で失敗することがよくあります。本研究では、グループ相対方策最適化を組み合わせた、検証可能な報酬を持つ実用的な強化学習手法を提案します。この手法は、エラー率報酬と、誤った表記体系を罰するスクリプト忠実度報酬、および2段階のドラフト・改良手順を組み合わせることで、音声言語モデルをコードスイッチングASRにデータ効率的に適応させます。再現可能なテストベッドとしてQwen2-Audioを10の言語ペアで使用し、TTSコードスイッチング音声のみで学習させた結果、RLVRはデータ量の10%でLoRA教師ありファインチューニング(全データセットで学習)と同等の性能を示し、特に類型学的に離れたペアで最大の効果が得られました。エラー率報酬は翻訳エラーを排除し、スクリプト忠実度報酬は劣化なくスクリプトの混入を個別に削減します。これらの改善は、人間が録音したコードスイッチングコーパスにゼロショットで転移します。
arXiv cs.CL
2026年7月17日
CARPRT:ブラックボックス型ビジョン・言語モデルのためのクラス認識型ゼロショットプロンプト再重み付け事前学習済みのビジョン・言語モデル(VLM)は、画像とテキストの説明との類似性スコアを計算することで、ゼロショット画像分類を可能にします。この説明は通常、クラスラベル(例:「猫」)をプロンプト(例:「写真」)に挿入して形成されます。与えられた画像とクラスのペアのスコアはプロンプトの選択に敏感であるため、既存の研究では、複数のプロンプトを重み付けベクトルを使用してアンサンブルし、異なるプロンプトからのスコアを集約します。しかし、現在の戦略では、各プロンプトに割り当てられる重み付けベクトルはすべてのクラスで共有されており、プロンプトがクラスに条件付きで独立していると暗黙的に仮定しています。これは実際には当てはまらないことがよくあります。「空中からの眺め」のようなプロンプトは「空港」には適しているかもしれませんが、「リンゴ」には不向きです。この問題に対処するために、クラス認識型ゼロショットプロンプト再重み付け(CARPRT)を提案します。このスコアリングスキームは、トレーニングフリーの方法で異なるプロンプトのクラス固有の関連性を捉えることにより、各クラスラベルの重み付けベクトルを調整します。
arXiv cs.LG
2026年7月27日
法人被害45億円、元警視庁が解説「会話もできるAI詐欺」の手口と対策生成AIによる音声合成の進化で、経営者や上司の声が数秒で複製される時代が訪れた。元警視庁職員やAI音声開発企業のCEOなど3人の専門家が、実演で脅威を体感させながら、最新のボイスフィッシングの手口と、組織が今すぐ取るべき備えを示した。
ITmedia AI+