Google Gemini 3.8 Flash 文字轉語音是 Google 2026 年 9 月推出的新一代語音合成模型,專為錄音室品質的創作內容打造,會把輸入的文字逐字朗讀成自然、富有情感的人聲音檔,並自動偵測超過 130 種語言。上方下拉選單可選擇 30 種預建聲音,各有明亮、堅定、溫暖、知性等不同風格;另一個下拉選單可指定朗讀語言,預設為自動偵測。與前一代不同,本模型會把輸入文字視為逐字稿,語氣指示不要寫在正文裡,請在第一行以「語氣:」開頭描述,例如「語氣:興奮又親切」或「語氣:輕聲耳語」,模型會依描述調整情緒、語速與口吻;也可在文字中以尖括號插入「<laugh>」「<sigh>」「<short pause>」等標記,在該處加入笑聲、嘆息或停頓。適合製作有聲書、Podcast、教學旁白與產品介紹。需要大量、快速生成時可改用 Gemini 3.8 Flash-Lite 文字轉語音。輸入上限 8,192 tokens,輸出格式為 MP3。 輸入加輸出 token 上限:約 24,576 tokens。 單次請求輸入 token 上限(含對話歷史):8,192 tokens。 輸出 token 上限:約 16,384 tokens(如有推理/思考過程,一併計入此上限)。 輸出內容格式:聲音 音訊輸出格式:MP3。 不支援連續對話。 AI可能會出錯,請核實重要資訊。