多語者語音辨識採用 OpenAI 雲端的 gpt-4o-transcribe-diarize 模型,是 gpt-4o-transcribe 系列的多語者(diarization)版本,會在轉錄結果中自動分辨並標註不同說話者,例如 SPEAKER_01、SPEAKER_02,方便整理會議紀錄、訪談逐字稿或客服通話內容。使用方式很簡單,直接上傳音訊或影片檔即可,系統會自動把音檔每 30 分鐘切一段送進雲端辨識,同一段內的說話者標籤保持一致,辨識過程中逐字稿會以串流方式分段顯示,完成後合併成完整的純文字逐字稿;超過 30 分鐘的長音檔會跨多段處理,輸出會在切割處註明「切割處,前後語者可能不一致」,重要錄音建議以 30 分鐘為單位分段上傳。沿用 gpt-4o-transcribe 對嘈雜環境、多語言切換、專有名詞與口音的優異表現,句構與標點也保留得相當完整。支援 mp3、wav、m4a、ogg、mp4、mov、webm 等常見格式,無需事前轉檔。本模組不支援 SRT 字幕輸出;若音檔只有單人主講,或需要 SRT 字幕,建議改用「語音辨識」。 上傳檔案大小上限為 256MB。