BytePlus SeedAudio 1.0 音訊生成

以文字描述生成音效與語音,可上傳參考音檔或一張圖片引導音色與情境。

BytePlus SeedAudio 1.0 音訊生成讓使用者用自然語言描述想要的聲音,AI 就會生成對應的音訊,涵蓋環境音效、旁白語音、角色台詞與氛圍聲景。例如輸入「足球場內觀眾歡呼,播報員大喊:進球了!」,就會生成帶著現場環境音與語音的完整音效。支援中文、英文、日文、韓文、法文、德文等超過 20 種語言。除了純文字生成,也可以上傳參考音檔(最多 3 段,每段 30 秒以內且 10MB 以下,格式 wav、mp3、ogg、opus),並在描述中以 @Audio1、@Audio2 依上傳順序引用對應音檔,讓生成的聲線貼近參考音色;或改上傳一張圖片(jpeg、png、webp,10MB 以下),此時輸入文字即為要朗讀的內容,AI 會依畫面情境決定聲音表現。參考音檔與圖片不可同時使用。輸入文字上限 3000 字元。適合製作有聲書、影片配音、遊戲音效、廣告旁白與社群短片音效。生成音訊最長 120 秒,輸出格式為 MP3。 單次上傳總大小上限:256MB(全部檔案與訊息內容合計)。 可接受圖片格式:jpeg、jpg、png、webp。 圖片數量上限:1 張。 單張圖片檔案大小上限:10MB。 可接受音檔格式:mp3、ogg、opus、wav。 音檔數量上限:3 個。 單個音檔檔案大小上限:10MB。 輸出內容格式:聲音 文字輸入上限:3,000 字元。 音訊輸出格式:MP3(最長 120 秒)。 不支援連續對話。