圖片光學字元辨識

上傳圖片或截圖,AI 用 OCR 自動辨識並抽取出可編輯的純文字。

光學字元辨識 (OCR) 把圖片或截圖中的文字自動辨識成可編輯的純文字,方便後續搜尋,引用或丟給其他模組做摘要,翻譯等加工。使用方式很簡單,把照片,掃描文件,截圖或螢幕翻拍上傳,AI 會掃出畫面內的所有文字並依版面順序輸出。常見應用情境:紙本發票或收據數位化方便對帳,手寫筆記轉成可搜尋的文字檔,書籍或論文的特定段落擷取後丟給 paper 或 summary 模組分析,會議白板照片轉成可編輯的會議記錄初稿,程式碼截圖或錯誤訊息照片貼進 programming 模組做除錯。中英混合,繁體簡體,部分日文也能辨識,但對於極潦草手寫或低解析度圖片辨識率會下降,建議先用手機提升解析度或調整光線再上傳。輸出可直接複製,配合 sc2tc / tc2sc 處理簡繁轉換,或直接接續 translate_to_english / translate_to_tc 做翻譯,一條龍完成。 輸入加輸出 token 上限:約 1,000,000 tokens。 輸出 token 上限:約 64,000 tokens(如有推理/思考過程,一併計入此上限)。 單次上傳總大小上限:256MB(全部檔案與訊息內容合計)。 可接受文件格式:pdf、docx、xlsx、pptx、txt、csv(文件內容以文字擷取後提供給模型)。 可接受圖片格式:gif、jpeg、jpg、png、webp。 GIF 動畫僅分析第一幀。 圖片數量上限:600 張。 一次上傳超過 20 張時,單張圖片每邊最多 2,000 像素。 單張圖片檔案大小上限:10MB(以 base64 編碼後大小計)。 單次訊息圖片總大小上限:20MB(文字與對話歷史共用同一請求容量,接近上限時仍可能被 AI 服務拒絕)。 圖片尺寸:每邊 200~8,000 像素。 輸出內容格式:文字 不支援連續對話。