Toolonit
  1. 首頁
  2. 圖片
  3. 圖片轉文字(平衡)

圖片轉文字(OCR)

以中型 OCR 模型擷取圖片中的文字,兼顧速度與準確度。

將含有文字的圖片拖放到這裡或點擊選擇

照片、掃描檔與螢幕截圖:JPG、PNG、WebP、GIF、BMP、TIFF 或 AVIF。 可辨識英文等拉丁字母語言、中文與日文。無法辨識韓文。 檔案只在瀏覽器中處理,不會上傳。 圖片會保留在這個瀏覽器中,直到移除為止。

Ctrl+O選擇Ctrl+V貼上

文字辨識模型

平衡模型 · …

可辨識英文與其他拉丁字母語言(法文、德文、西班牙文、波蘭文…)、中文(簡體與繁體)以及日文。無法辨識韓文、俄文等西里爾字母語言、阿拉伯文、泰文、印地文或越南文。

 

授權: 模型(Apache-2.0) · 引擎(MIT)

從文件照片、掃描頁面或截圖中複製文字,再加以編輯與儲存。這是三種圖片轉文字工具中最適合日常使用的一種:30 MB 的辨識模型辨識小字、斜拍照片與雜亂背景的能力明顯優於最快的模型,一張截圖仍只要幾秒。全部在瀏覽器中執行:圖片不會離開你的裝置,而且免費、免註冊。

三種圖片轉文字模型比較

圖片轉文字(最快)圖片轉文字(平衡)本頁圖片轉文字(精準)
模型大小6 MB29.7 MB132.3 MB
首次使用:連同引擎的下載時間(50 Mbit/s)19.6 MB · ≈ 3 秒43.4 MB · ≈ 7 秒145.9 MB · ≈ 24 秒
之後儲存在瀏覽器中,不需再次下載
速度最快快最慢
準確度適合清晰的文字照片與小字更準確難辨識的圖片最準確
可辨識文字拉丁字母(英文、法文、德文等)和中文拉丁字母(英文、法文、德文等)、中文和日文拉丁字母(英文、法文、德文等)、中文和日文

辨識引擎(13.7 MB,支援 WebGPU 的瀏覽器為 27.4 MB)只需下載一次,三種模型共用。在工具中開始辨識之前不會下載任何內容。

如何擷取圖片中的文字

  1. 將圖片拖放到頁面任何位置、用 Ctrl+V 貼上,或點擊選擇檔案——一次多張也沒問題。在任何圖片工具(包括「最快」與「精準」頁面)加入過的圖片,都已在清單中等著。
  2. 第一次使用時,點擊「下載模型並辨識文字」。模型(30 MB)與執行它的引擎合計約 43 MB,只會下載一次並保存在瀏覽器中,之後新加入的圖片會立即辨識,所選的圖片在開啟頁面時就會辨識,清單中原有的其他圖片則用「辨識」或「全部辨識」來辨識。
  3. 對照文字與圖片:點擊區塊可找到對應的行,點擊某一行也能找到對應的區塊。加上底線的是模型沒把握的行。編輯後點擊「複製文字」(Ctrl+Shift+C)或「下載 .txt」。
  4. 若要分享不含文字的圖片,請開啟「隱藏圖片中的文字」,選擇顏色,讓想保留的區塊維持可見,再下載遮蔽後的副本。

功能

  • 可辨識印刷體英文與其他拉丁字母語言、中文(簡體與繁體)以及日文
  • 依閱讀順序輸出文字:分欄依序讀取,收據的品項與價格排在一起
  • 在圖片上框出文字區塊並編號;點擊區塊即可找到對應的行
  • 編輯文字後可複製或下載為 .txt;模型沒把握的行會加上底線
  • 隱藏文字:下載一份文字被色塊遮住的圖片副本
  • 可一次處理多張圖片;會偵測上下顛倒的頁面,並以正確方向辨識
  • 只需下載一次約 43 MB(30 MB 的模型與其引擎),之後儲存在瀏覽器中

隱私安全嗎?

是的。圖片由在瀏覽器中執行的模型辨識,圖片和文字都不會傳送到任何地方,圖片會一直保留在這個瀏覽器中,直到從清單中移除。只有模型與其引擎會從本網站下載一次,並保存在你的瀏覽器中。

常見問題

可以辨識哪些語言?

印刷體的英文與其他拉丁字母語言(法文、德文、西班牙文、葡萄牙文、義大利文、波蘭文、捷克文、土耳其文等)、數字與符號、中文(簡體與繁體)以及日文(漢字、平假名與片假名)。無法辨識韓文、俄文等西里爾字母語言、阿拉伯文、泰文、印地文或越南文。

為什麼第一次執行比較慢?

因為只有第一次,瀏覽器需要下載模型與執行它的引擎(14 MB;透過 WebGPU 使用顯示卡的瀏覽器則為 27 MB)並完成準備。之後兩者都已儲存,辨識時不需再下載,已開啟的頁面即使沒有網路連線也能繼續使用。如果你已用過其他圖片轉文字工具,引擎已經在瀏覽器中,只需下載模型。

最快、平衡、精準,該用哪一個?

大多數圖片用「平衡」就很合適。「最快」(6 MB 模型,第一次約需下載 20 MB)足以處理英文或中文的清晰截圖與文件。「平衡」(30 MB,約 43 MB)辨識照片與小字更準確,也能辨識日文。「精準」(132 MB,約 146 MB)對最困難的圖片辨識效果最好,但沒有圖形加速(WebGPU)時,一小頁就需要約半分鐘。每種模型都只下載一次,之後儲存在瀏覽器中。

會保留頁面的版面配置嗎?

會保留閱讀順序,但不會保留精確的版面:同一列的文字片段會合併,每一列成為一行,段落之間以空行分隔。並排的欄位會依序讀取,表格則依閱讀順序輸出為文字,而不是試算表。

可以一次辨識多張圖片嗎?

可以。圖片數量不限,會逐一辨識。「複製所有圖片」會把每段文字連同檔名一起複製,「全部下載(ZIP)」則會儲存所有遮蔽後的副本。

相關工具