图片转文字(OCR)
使用中等大小的 OCR 模型提取图片中的文字,兼顾速度与准确度。
拖放带文字的图片到此处或点击选择
照片、扫描件和截图:JPG、PNG、WebP、GIF、BMP、TIFF 或 AVIF。 可识别英文及其他拉丁字母语言、中文和日文。无法识别韩文。 文件仅在浏览器中处理,不会上传。 图片会保存在此浏览器中,直到被移除。
Ctrl+O选择Ctrl+V粘贴
文字识别模型
均衡模型 · …
可识别英文及其他拉丁字母语言(法语、德语、西班牙语、波兰语……)、中文(简体和繁体)和日文。无法识别韩文、俄文或其他西里尔字母文字、阿拉伯文、泰文、印地文或越南文。
许可证: 模型(Apache-2.0) · 引擎(MIT)
从文档照片、扫描页或截图中复制出文字,再编辑和保存。这是三款图片转文字工具中的日常之选:它 30 MB 的识别模型在识别小字、斜拍的照片和杂乱背景时明显优于极速版,识别一张截图仍然只需几秒钟。一切都在浏览器中运行:图片不会离开你的设备;免费,无需注册。
三种图片转文字模型对比
| 图片转文字(极速) | 图片转文字(均衡)本页 | 图片转文字(高精度) | |
|---|---|---|---|
| 模型大小 | 6 MB | 29.7 MB | 132.3 MB |
| 首次使用:连同引擎的下载时间(50 Mbit/s) | 19.6 MB · ≈ 3秒 | 43.4 MB · ≈ 7秒 | 145.9 MB · ≈ 24秒 |
| 之后 | 保存在浏览器中,无需再次下载 | ||
| 速度 | 最快 | 快 | 最慢 |
| 准确度 | 适合清晰的文字 | 照片和小字更准确 | 难识别的图片最准确 |
| 可识别文字 | 拉丁字母(英语、法语、德语等)和中文 | 拉丁字母(英语、法语、德语等)、中文和日语 | 拉丁字母(英语、法语、德语等)、中文和日语 |
识别引擎(13.7 MB,支持 WebGPU 的浏览器为 27.4 MB)只需下载一次,三种模型共用。在工具中开始识别之前不会下载任何内容。
如何提取图片中的文字
- 把图片拖到页面任意位置,用 Ctrl+V 粘贴,或点击选择文件——一次选多张也可以。在任何图片工具(包括“极速”和“高精度”页面)中添加过的图片,都已在列表中等待。
- 首次使用时,点“下载模型并识别文字”。模型(30 MB)及其运行引擎共约 43 MB,只需下载一次并保存在浏览器中,之后新添加的图片会立即识别,所选的图片在打开页面时就会识别,列表中原有的其他图片则用“识别”或“全部识别”来识别。
- 对照图片核对文字:点击区域可找到对应的行,点击某一行可找到对应的区域。加下划线的是模型不确定的行。编辑后点“复制文字”(Ctrl+Shift+C)或“下载 .txt”。
- 如果想分享图片但不带其中的文字,打开“遮盖图片中的文字”,选择颜色,保留你想显示的区域,然后下载遮盖后的副本。
功能
- 可识别印刷体英文及其他拉丁字母语言、中文(简体和繁体)和日文
- 文字按阅读顺序排列:分栏依次读取,收据上的商品紧挨着各自的价格
- 图片上的文字区域会被框出并编号;点击区域可找到对应的行
- 可编辑文字,再复制或下载为 .txt;模型不确定的行会加下划线
- 遮盖文字:下载一份文字被色块遮住的图片副本
- 可同时处理多张图片;能检测上下颠倒的页面并按正确方向识别
- 只需下载一次约 43 MB(30 MB 模型及其引擎),之后保存在浏览器中
隐私安全吗?
是的。图片由在浏览器中运行的模型识别;图片和文字都不会发送到任何地方,图片会一直保留在这个浏览器中,直到从列表中移除。只有模型及其引擎会从本站下载一次,之后一直保存在浏览器中。
常见问题
能识别哪些语言?
印刷体英文及其他拉丁字母语言(法语、德语、西班牙语、葡萄牙语、意大利语、波兰语、捷克语、土耳其语……)、数字和符号、中文(简体和繁体)以及日文(汉字、平假名和片假名)。它无法识别韩文、俄文或其他西里尔字母文字、阿拉伯文、泰文、印地文或越南文。
为什么第一次运行比较慢?
因为只有第一次,浏览器要下载模型和运行它的引擎(14 MB;在通过 WebGPU 使用显卡的浏览器中为 27 MB),并进行准备。之后它们会被保存,识别时无需下载,已经打开的页面即使断网也能继续使用。如果你已经用过其他图片转文字工具,引擎已经存在,只需下载模型。
极速、均衡、高精度,该选哪个?
大多数图片用“均衡”即可。“极速”(6 MB 模型,首次下载约 20 MB)足以应付清晰的英文或中文截图和文档。“均衡”(30 MB,约 43 MB)识别照片和小字更准确,还能识别日文。“高精度”(132 MB,约 146 MB)识别最难的图片效果最好,但没有图形加速(WebGPU)时,一页短文也需要约半分钟。每种模型都只需下载一次,之后保存在浏览器中。
能保留页面的排版吗?
它保留的是阅读顺序,而不是精确的版面:同一行上的文字片段会被连接起来,每一行作为一行输出,段落之间用空行分隔。并排的分栏会依次读取,表格会按阅读顺序输出为文字,而不是电子表格。
可以同时识别多张图片吗?
可以。想添加多少张都行;每张图片会依次识别。点“复制全部图片文字”会把每段文字连同文件名一起复制,点“全部下载(ZIP)”会保存遮盖后的副本。