トレンド一覧

sanoTTS 294kパラメータで動作する最小のTTSスタックをリリース

r/LocalLLaMA ・ 2026-09-03

原題: I released sanoTTS: smallest complete TTS stack in 294k params (337 KB) that runs on $3 microcontroller and a 1.46m one that beats models 3x and 10x it's size

AI による要約

sanoTTSが294kパラメータ(337KB)で動作する最小の完全なTTSスタックをリリースした。3ドルのマイクロコントローラーで動作し、1.46Mモデルは従来の3倍・10倍の規模のモデルを上回る性能を示した。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(r/LocalLLaMA)をご確認ください。

音声・音楽

この話題のこれまで

2026年7月に4Mおよび10M未満の極小サイズで完全な音声合成モデル「Inflect v2」がリリースされ、外部ボコーダーを必要とせずCPUやCUDA上で軽量に動作する特徴が示された。7月にはアリババが音声合成ランキング1位を獲得した「Qwen-Audio-3.0-TTS」を公開し、日本語対応と音声クローン機能を備えた。8月にはaudio.cpp 0.5がリリースされ、感情制御可能な音声生成モデルやクロスリンガル音声変換モデルが追加された。8月には動画自動生成における音声合成時の声のブレを解決する運用手法が提案され、一度の設計で複製し続ける手法が注目された。8月にはTTS自動評価モデルを10の言語学的次元で評価するベンチマークが構築された。9月にはsanoTTSが294kパラメータで動作する最小の完全なTTSスタックをリリースし、3ドルのマイクロコントローラーで動作する性能を示した。

  1. 4Mおよび10M未満の極小サイズで動作する完全な音声合成モデル「Inflect v2」 2026-07-25 ・ r/LocalLLaMA
  2. 音声合成ランキングで1位を獲得したAI「Qwen-Audio-3.0-TTS」をアリババが公開。日本語対応、音声クローンも可能(生成AIクローズアップ) - au Webポータル 2026-07-27 ・ Google News (音声・音楽AI)
  3. audio.cpp 0.5リリース、感情制御できる音声生成モデルなどを追加 2026-08-01 ・ r/LocalLLaMA
  4. 声を一回設計し複製し続けるTTS運用でAIナレーターの音声変動を解決 2026-08-03 ・ Zenn AI
  5. TTS自動評価モデルを10の言語学的次元で評価するベンチマーク 2026-08-10 ・ arXiv cs.AI

当サイトが集めた記事から、同じ話題のものを古い順に並べています。

この話題に関わるコラム