SonicCaps: 大規模多様なオーディオキャプションデータセットで音声検索を改善
arXiv cs.CL ・ 2026-09-02
原題: SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval
AI による要約
約70万のオーディオクリップに対し、マルチモーダルLLM(Qwen3-Omni)を用いて1500万の多様なキャプションを生成した SonicCaps を公開した。24件のキャプションを構造化プロンプトで生成し、音声検索の精度向上に寄与する。
この要約は当サイトの AI が生成したものです。正確な内容は 元記事(arXiv cs.CL)をご確認ください。