- Главная
- Изображения
- Распознавание текста (баланс)
Распознавание текста с изображения (OCR)
Извлекает текст из изображения OCR-моделью среднего размера — баланс скорости и точности.
Перетащите изображения с текстом сюда или нажмите, чтобы выбрать
Фото, сканы и скриншоты: JPG, PNG, WebP, GIF, BMP, TIFF или AVIF. Читает английский и другие языки на латинице, китайский и японский. Корейский не читает. Файлы обрабатываются в браузере и никуда не загружаются. Они хранятся в этом браузере, пока вы их не уберёте.
Ctrl+OвыбратьCtrl+Vвставить
Модель распознавания текста
Модель «Баланс» · …
Читает английский и другие языки на латинице (французский, немецкий, испанский, польский…), китайский (упрощённый и традиционный) и японский. Не читает корейский, русский и другие языки на кириллице, арабский, тайский, хинди и вьетнамский.
Лицензии: модели (Apache-2.0) · движок (MIT)
Скопируйте текст с фотографии документа, отсканированной страницы или скриншота, затем отредактируйте и сохраните его. Это универсальный выбор из трёх инструментов распознавания текста: его модель на 30 МБ заметно лучше самой быстрой читает мелкий шрифт, снятые под углом фото и пёстрый фон и всё так же распознаёт скриншот за секунды. Всё работает в браузере: изображения не покидают ваше устройство, бесплатно и без регистрации.
Сравнение трёх моделей распознавания текста
| Распознавание текста (скорость) | Распознавание текста (баланс)Эта страница | Распознавание текста (точность) | |
|---|---|---|---|
| Размер модели | 6 MB | 29,7 MB | 132,3 MB |
| Первый запуск: загрузка вместе с движком при 50 Мбит/с | 19,6 MB · ≈ 3 с | 43,4 MB · ≈ 7 с | 145,9 MB · ≈ 24 с |
| Потом | Хранится в браузере — повторной загрузки нет | ||
| Скорость | Самая быстрая | Быстрая | Самая медленная |
| Точность | Хороша на чётком тексте | Точнее на фото и мелком шрифте | Лучшая на сложных изображениях |
| Читает | латиница (английский, французский, немецкий…) и китайский | латиница (английский, французский, немецкий…), китайский и японский | латиница (английский, французский, немецкий…), китайский и японский |
Движок распознавания (13,7 MB, или 27,4 MB в браузерах с WebGPU) загружается один раз и общий для всех трёх моделей. Ничего не загружается, пока вы не запустите распознавание.
Как извлечь текст из изображения
- Перетащите изображения в любое место страницы, вставьте картинку сочетанием Ctrl+V или нажмите, чтобы выбрать файлы, — можно сразу несколько. Изображения, уже добавленные в любом инструменте для изображений, включая страницы «Скорость» и «Точность», ждут в списке.
- В первый раз нажмите «Скачать модель и распознать текст». Модель (30 МБ) и запускающий её движок — вместе около 43 МБ — скачиваются один раз и хранятся в браузере, поэтому потом добавленное изображение распознаётся сразу, выбранное — как только вы открываете страницу, а остальные, уже бывшие в списке, — кнопками «Распознать» или «Распознать все».
- Сравните текст с картинкой: нажмите на область, чтобы найти её строку, или на строку, чтобы найти её область. Подчёркнутые строки — те, в которых модель не уверена. Отредактируйте текст, затем нажмите «Копировать текст» (Ctrl+Shift+C) или «Скачать .txt».
- Чтобы поделиться изображением без текста, откройте «Скрыть текст на изображении», выберите цвет, оставьте видимыми нужные области и скачайте замаскированную копию.
Возможности
- Читает печатный английский и другие языки на латинице, китайский (упрощённый и традиционный) и японский
- Текст в порядке чтения: колонки одна за другой, позиции чека рядом с ценами
- Области текста обведены и пронумерованы на изображении; нажмите на область, чтобы найти её строку
- Текст можно отредактировать, а затем скопировать или скачать в .txt; строки, в которых модель не уверена, подчёркнуты
- Скрытие текста: скачайте копию изображения, где текст закрыт прямоугольниками
- Несколько изображений сразу; перевёрнутые страницы распознаются и читаются правильно
- Одно скачивание около 43 МБ (модель на 30 МБ и её движок), затем всё хранится в браузере
Это конфиденциально?
Да. Изображение читает модель, работающая в браузере; ни картинка, ни текст никуда не отправляются, а ваши изображения остаются в этом браузере, пока вы не уберёте их из списка. С этого сайта один раз скачиваются только модель и её движок, и они остаются сохранёнными в браузере.
Частые вопросы
Какие языки распознаются?
Печатный английский и другие языки на латинице (французский, немецкий, испанский, португальский, итальянский, польский, чешский, турецкий…), цифры и символы, китайский (упрощённый и традиционный) и японский (кандзи, хирагану и катакану). Корейский, русский и другие языки на кириллице, арабский, тайский, хинди и вьетнамский он читать не умеет.
Почему первый запуск медленнее?
Потому что только в первый раз браузер скачивает модель и движок, который её запускает (14 МБ или 27 МБ в браузерах, использующих видеокарту через WebGPU), и подготавливает их. После этого они сохранены, поэтому распознавание начинается без скачивания, а уже открытая страница продолжает работать и без подключения к интернету. Если вы уже пользовались другим инструментом распознавания текста, движок уже есть и скачивается только модель.
«Скорость», «Баланс» или «Точность» — что выбрать?
«Баланс» подходит для большинства изображений. «Скорости» (модель на 6 МБ, около 20 МБ скачивания в первый раз) хватает для чётких скриншотов и документов на английском или китайском. «Баланс» (30 МБ, около 43 МБ) точнее на фото и мелком тексте и также читает японский. «Точность» (132 МБ, около 146 МБ) лучше всех читает самые сложные изображения, но без графического ускорения (WebGPU) ей нужно около полуминуты на короткую страницу. Каждая модель скачивается один раз и затем хранится в браузере.
Сохраняется ли разметка страницы?
Сохраняется порядок чтения, а не точная разметка: фрагменты текста в одном ряду объединяются, каждый ряд становится строкой, а абзацы разделяются пустой строкой. Колонки, стоящие рядом, читаются одна за другой, а таблицы выводятся текстом в порядке чтения, а не в виде электронной таблицы.
Можно ли распознать несколько изображений сразу?
Да. Добавьте сколько угодно — они распознаются по очереди. «Копировать все изображения» копирует весь текст, подписывая его именем файла, а «Скачать все (ZIP)» сохраняет замаскированные копии.