部落格 上傳媒體 短網址 工具 圖庫 常見問題 聯絡我們 登入
📢 永久無廣告,自動清除EXIF,保護隱私內容
Tools

📝 圖片轉文字 (OCR)

把截圖裡的字抓出來

選對語言差別很大。中文的辨識資料約 12MB,英文約 4MB,第一次使用需要下載,之後瀏覽器會快取。
灰階通常就夠。二值化對淺色背景上的深色文字很有效,但照片類的圖會整個壞掉。
文字太小是辨識失敗最常見的原因。字高低於約 20 像素時,先放大通常會明顯改善。

ℹ️ 辨識引擎(Tesseract)與語言資料是從 CDN 載入的,第一次使用需要等一下。圖片本身不會上傳 — 引擎在你的瀏覽器裡跑,走網路的只有程式與模型檔。

🔒 所有處理都在你的瀏覽器裡完成 — 檔案不會上傳到我們的伺服器,我們也看不到你的圖片。關掉分頁後就什麼都不留。

圖片轉文字 (OCR):處理前後對照範例
左邊是原圖,右邊是這個工具實際跑出來的結果,不是示意圖。圖上若有標檔案大小或尺寸,都是實際量到的數字。

使用步驟

  1. 選一張有文字的圖 截圖、掃描件、拍下來的文件、看板照片都可以。文字越清楚、越正、越大,結果越準 — 這比任何設定都重要。
  2. 選對語言 這是影響準確度最大的設定。中文選「繁體中文 + English」,日文選「日本語 + English」。選錯語言辨識率會掉到幾乎不能用,因為引擎是拿該語言的字形模型在比對。
  3. 決定前處理 灰階適合大多數情況。黑白二值對「淺色背景上的深色文字」(掃描件、白紙黑字)效果特別好,但照片類的圖會整個壞掉。不確定就先用灰階。
  4. 按開始處理 第一次使用會先下載辨識引擎與語言資料(中文約 12MB),要等一下;之後瀏覽器會快取,同一台裝置再用就快很多。狀態列會顯示辨識進度。
  5. 複製或下載成 .txt 結果會顯示在下面,附帶平均信心度。信心度低於 70% 就要仔細校對。可以直接複製,或下載成純文字檔。

什麼時候用得到

把截圖裡的文字抓出來

別人傳來一張截圖,你要引用裡面的一段話卻只能自己重打 — 這是 OCR 最日常的用途。錯誤訊息、對話內容、網頁上不能選取的文字都適用。

紙本文件數位化

把收據、名片、講義、書頁拍下來轉成文字,就能搜尋、編輯、貼進其他文件。掃描件建議用「黑白二值」前處理,準確度會明顯提升。

看不懂的外文招牌、菜單

先把文字辨識出來變成可複製的文字,再貼到翻譯工具 — 比對著照片一個字一個字輸入快得多,尤其是日文與韓文這種不好輸入的語言。

從 PDF 的掃描頁抓文字

掃描版的 PDF 裡面只有圖片沒有文字圖層,搜尋不到內容。先用PDF 轉圖片把該頁轉成 PNG(DPI 選 300),再拿來這裡辨識。

影響準確度的四件事

OCR 的結果好不好,八成取決於你餵給它什麼,而不是設定怎麼調。依影響力排序:

  1. 語言選對 — 引擎是拿該語言的字形模型在比對。用英文模型去辨識中文,結果會是一堆亂碼。
  2. 文字夠大 — 字高至少要 20 像素以上,30 以上比較保險。這是最常見的失敗原因,而且手機截圖經過縮放後很容易低於這個門檻。
  3. 圖是正的 — 傾斜幾度就會讓準確度明顯下降。拍紙本文件時盡量正對,或事後轉正。
  4. 對比夠強 — 深色文字配淺色背景最好。彩色背景、漸層、陰影都會干擾。

灰階還是二值化

灰階只是把顏色拿掉,保留所有明暗層次。安全、通用,不確定就用這個。

黑白二值把每個像素強制變成純黑或純白,門檻取整張圖的平均亮度。這對「白紙黑字」是很強的處理 — 背景的雜訊、紙張的紋理、輕微的陰影全部被清掉,只剩下文字。但如果圖裡有照片、有漸層背景、或文字本身顏色很淺,二值化會把資訊整個破壞掉。

它跟線上 OCR 服務的差別

大多數線上 OCR 是把你的圖片上傳到他們的伺服器辨識完再傳回來。這代表你的收據、名片、文件內容都經過了別人的機器。

這一頁用的是 WebAssembly 版的 Tesseract,整個辨識過程在你的瀏覽器裡完成。走網路的只有引擎程式與語言模型(從 CDN 下載一次),跟你的圖片內容完全無關。代價是第一次要等模型下載,而且準確度不如那些用大型雲端模型的商業服務 — 這是一個明確的交換,你要處理的如果是敏感文件,這個交換通常划算。


常見問題

為什麼第一次要下載那麼久?
因為 OCR 需要辨識引擎加上該語言的字形模型。Tesseract 的核心約 2MB,英文資料約 4MB,中文因為字元太多約 12MB。全部在你的瀏覽器裡跑,所以必須整包載下來。好消息是瀏覽器會快取,同一台裝置第二次使用就快很多。
辨識結果錯很多怎麼辦?
照這個順序檢查:一、語言選對了嗎(影響最大)。二、文字夠大嗎 — 字高低於 20 像素幾乎一定不準,保持「小圖先放大」開啟,或先用放大圖片。三、圖是正的嗎 — 傾斜超過幾度準確度就掉很快,先用旋轉圖片轉正。四、試試黑白二值,掃描件特別有效。
手寫字可以辨識嗎?
基本上不行。Tesseract 是針對印刷體訓練的,手寫的辨識率非常低,工整的正楷可能勉強有幾成。手寫辨識需要另一類專門的模型,不在這個引擎的能力範圍內。
我的圖片會上傳嗎?
不會。引擎是 WebAssembly,在你的瀏覽器裡執行,圖片從頭到尾沒有離開裝置。走網路的只有引擎程式與語言模型檔(從 CDN 下載),跟你的圖片內容無關 — 這跟「把圖片傳到伺服器辨識」的線上 OCR 服務有本質差別。

接下來可能會用到

圖片處理很少一步到位。這幾個是跟「圖片轉文字 (OCR)」最常搭著用的:

處理完想直接分享?上傳媒體可以把圖片、照片或影片轉成一組短網址,還能設密碼、有效期限與瀏覽次數上限。也可以回到工具總覽看全部 12 個工具。


其他工具