Unified audio creation model: speech, sound effects, ambience, and music generated on one timeline in a single pass — multi-character dialogue, zero-shot voice cloning, 20+ languages, clips up to 2 minutes. API-only (Volcengine); no weights or paper.

audiomultimodal

Related