語音辨識 gpt_transcribe 使用 OpenAI 新一代 gpt-transcribe 模型,是 whisper-1 與 gpt-4o-transcribe 之後的最新語音辨識世代,在嘈雜環境、多語言切換、專有名詞與口音辨識的正確率進一步提升,句構與標點保留完整,產出可讀性高的逐字稿。使用方式很簡單,直接上傳音訊或影片檔即可,系統會自動將音檔切段送進雲端推論,再把結果合併輸出。支援 mp3、wav、m4a、ogg、mp4、mov、webm 等常見格式,無需事前轉檔。適合會議錄音整理、採訪聽打、Podcast 逐字稿、線上課程錄影轉文字等情境。本模組輸出純文字逐字稿,不支援 SRT 字幕;需要 SRT 字幕請改用「語音辨識」,需要分辨多位說話者請改用「多語者語音辨識」,想邊說邊即時顯示請改用「即時語音辨識 gpt_live_transcribe」。 單次上傳總大小上限:256MB(全部檔案與訊息內容合計)。 輸出內容格式:文字 不支援連續對話。