トレンド一覧

Voxtral Realtime基盤のフレーム同期型音声対話モデルX2-Turn

arXiv cs.CL ・ 2026-08-11

原題: X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

AI による要約

リアルタイム音声対話において、自動音声認識(ASR)と発話交代状態の判定をフレーム単位で同時予測する手法「X2-Turn」が開発された。事前に学習された Voxtral Realtime をベースとし、共通のストリーミング表現上でASRヘッドと発話状態検出ヘッドを並列動作させる。これにより従来のモジュール分離型モデルで発生していた応答の遅延やミスマッチを抑え、ユーザーの割り込みや相槌を精密に識別できる。

この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。

音声・音楽 / AIエージェント

この話題に関わるコラム