画像から文字抽出(OCR)
中サイズのOCRモデルで画像内の文字を抽出します。速度と精度のバランス型です。
文字の入った画像をドロップするか、クリックして選択
写真・スキャン・スクリーンショット:JPG・PNG・WebP・GIF・BMP・TIFF・AVIF。 英語などのラテン文字の言語、中国語、日本語を読み取ります。韓国語は読み取れません。 ファイルはブラウザ内で処理され、アップロードされません。 削除するまで、このブラウザに保存されます。
Ctrl+O選択Ctrl+V貼り付け
文字認識モデル
バランスモデル · …
英語などのラテン文字の言語(フランス語、ドイツ語、スペイン語、ポーランド語など)、中国語(簡体字・繁体字)、日本語を読み取ります。韓国語、ロシア語などのキリル文字、アラビア語、タイ語、ヒンディー語、ベトナム語は読み取れません。
ライセンス: モデル(Apache-2.0) · エンジン(MIT)
書類の写真やスキャンしたページ、スクリーンショットから文字を取り出し、編集して保存できます。3つの「画像から文字抽出」ツールのうち、普段使いに向いているのがこのツールです。30MBの認識モデルは、小さな文字や斜めから撮った写真、ごちゃごちゃした背景を最速モデルよりはっきり正確に読み取り、それでいてスクリーンショットなら数秒で読み取れます。すべてブラウザ内で動作するため画像が端末の外に出ることはなく、無料で登録も不要です。
画像から文字を読み取る 3 つのモデルの比較
| 画像から文字抽出(最速) | 画像から文字抽出(バランス)このページ | 画像から文字抽出(高精度) | |
|---|---|---|---|
| モデルのサイズ | 6 MB | 29.7 MB | 132.3 MB |
| 初回:エンジンと合わせたダウンロード時間(50 Mbit/s) | 19.6 MB · ≈ 3 秒 | 43.4 MB · ≈ 7 秒 | 145.9 MB · ≈ 24 秒 |
| 2 回目以降 | ブラウザーに保存 — 再ダウンロードなし | ||
| 速度 | 最速 | 速い | 最も遅い |
| 精度 | くっきりした文字向き | 写真や小さな文字でより正確 | 難しい画像で最も正確 |
| 読める文字 | ラテン文字(英語、フランス語、ドイツ語など)、中国語 | ラテン文字(英語、フランス語、ドイツ語など)、中国語、日本語 | ラテン文字(英語、フランス語、ドイツ語など)、中国語、日本語 |
認識エンジン(13.7 MB、WebGPU 対応ブラウザーでは 27.4 MB)は一度だけダウンロードし、3 つのモデルで共有します。ツールで読み取りを始めるまで何もダウンロードしません。
画像から文字を抽出する方法
- ページのどこかに画像をドロップするか、Ctrl+Vで貼り付けるか、クリックしてファイルを選びます。複数まとめてでもかまいません。ほかの画像ツール(「最速」や「高精度」のページも含む)で追加した画像は、リストで待っています。
- 初回は「モデルをダウンロードして読み取る」をクリックします。モデル(30MB)とそれを動かすエンジン、合わせて約43MBを一度だけダウンロードしてブラウザに保存するので、次からは追加した画像はすぐに、選択中の画像はページを開くとすぐに読み取り、リストにあるほかの画像は「読み取る」か「すべて読み取る」で読み取ります。
- 文字と画像を見比べます。領域をクリックするとその行が、行をクリックするとその領域がわかります。下線の付いた行は、モデルが自信を持てなかった行です。編集してから「テキストをコピー」(Ctrl+Shift+C)か「.txtをダウンロード」をクリックします。
- 文字を隠して画像を共有したいときは、「画像内の文字を隠す」を開いて色を選び、残したい領域は表示したままにして、マスクしたコピーをダウンロードします。
主な機能
- 印刷された英語などのラテン文字の言語、中国語(簡体字・繁体字)、日本語を読み取り
- 読む順番どおりにテキスト化:段組みは1段ずつ順に、レシートは品目と金額を並べて
- 文字の領域を画像上に枠と番号で表示。領域をクリックすると対応する行へ
- テキストを編集してコピー、または.txtでダウンロード。モデルが自信を持てなかった行には下線
- 文字を隠す:文字を四角で覆った画像のコピーをダウンロード
- 複数の画像をまとめて処理。上下逆さまのページも検出して正しい向きで読み取り
- 約43MB(30MBのモデルとエンジン)を一度ダウンロードすれば、あとはブラウザに保存
プライバシーは守られますか?
はい。画像はブラウザ内で動くモデルが読み取るため、画像も文字もどこにも送信されず、画像はリストから削除するまでこのブラウザに残ります。ダウンロードするのはモデルとエンジンだけで、このサイトから一度だけ取得し、ブラウザに保存されます。
よくある質問
どの言語を読み取れますか?
印刷された英語などのラテン文字の言語(フランス語、ドイツ語、スペイン語、ポルトガル語、イタリア語、ポーランド語、チェコ語、トルコ語など)、数字と記号、中国語(簡体字・繁体字)、日本語(漢字・ひらがな・カタカナ)です。韓国語、ロシア語などのキリル文字、アラビア語、タイ語、ヒンディー語、ベトナム語は読み取れません。
初回の読み取りが遅いのはなぜですか?
初回だけ、ブラウザがモデルとそれを動かすエンジン(14MB、WebGPUでグラフィックカードを使うブラウザでは27MB)をダウンロードして準備するためです。その後は保存されるので、ダウンロードなしで読み取りが始まり、開いているページは接続がなくても動き続けます。ほかの「画像から文字抽出」ツールを使ったことがあれば、エンジンはすでにあるのでモデルだけがダウンロードされます。
最速・バランス・高精度のどれを使えばいいですか?
ほとんどの画像には「バランス」が向いています。「最速」(6MBのモデル、初回のダウンロードは約20MB)は、英語や中国語のはっきりしたスクリーンショットや書類なら十分です。「バランス」(30MB、約43MB)は写真や小さな文字をより正確に読み取り、日本語にも対応します。「高精度」(132MB、約146MB)は難しい画像を最もよく読み取りますが、グラフィックアクセラレーション(WebGPU)がないと短いページでも約30秒かかります。どれも一度ダウンロードすればブラウザに保存されます。
ページのレイアウトは保たれますか?
保たれるのは読む順番で、正確なレイアウトではありません。同じ行にある文字はつなげられて1行になり、段落の間には空行が入ります。横に並んだ段組みは1段ずつ順に読み取られ、表は表計算の形ではなく、読む順番どおりのテキストになります。
複数の画像をまとめて読み取れますか?
はい。画像はいくつでも追加でき、順番に読み取られます。「すべての画像のテキストをコピー」でファイル名ごとにすべてのテキストをコピーでき、「すべてダウンロード(ZIP)」でマスクしたコピーをまとめて保存できます。