Google Gemini 2.5 Flash 文字轉語音

以 Google Gemini 2.5 Flash TTS 快速將文字合成自然人聲,可選 30 種聲音與朗讀語言。

Google Gemini 2.5 Flash 文字轉語音是 Google 低延遲、經濟實惠的語音合成模型,把輸入的文字快速朗讀成自然流暢的人聲音檔,適合大量或即時的配音需求。上方下拉選單可選擇 30 種預建聲音,各有明亮、堅定、溫暖、知性等不同風格;另一個下拉選單可指定朗讀語言,預設為自動偵測,支援中文、英文、日文、韓文、法文、德文、西班牙文等多國語言。也可以用自然語言描述語氣,例如在文字前加上「用平靜的語氣說:」或「開心地說:」,模型會依描述調整情緒、語速與口吻。需要最高音質與更細膩語調時,可改用 Gemini 2.5 Pro 文字轉語音。適合製作短影音旁白、客服語音、教材朗讀、通知播報與無障礙閱讀語音。輸入上限 8,192 tokens,輸出格式為 MP3。 輸入加輸出 token 上限:約 24,576 tokens。 單次請求輸入 token 上限(含對話歷史):8,192 tokens。 輸出 token 上限:約 16,384 tokens(如有推理/思考過程,一併計入此上限)。 輸出內容格式:聲音 音訊輸出格式:MP3。 不支援連續對話。 AI可能會出錯,請核實重要資訊。