Сервис распознавания текста от Яндекса: читает «печатный и рукописный текст на изображениях и в файлах PDF» и отдаёт результат по API. Есть отдельные модели под сплошной текст, рукопись, таблицы и шаблонные документы вроде паспорта и водительского удостоверения. Работает синхронно через gRPC и REST, для больших объёмов есть пакетный режим. Это облако: ставить и лицензировать нечего, но документы уходят к провайдеру.

О продукте

Yandex Vision OCR — облачный сервис Яндекса для распознавания текста. Он относится к семейству Yandex AI Studio, куда переехали ИИ-сервисы Yandex Cloud, и живёт в собственном разделе документации: старые ссылки на yandex.cloud отдают редирект.

Задача сформулирована узко и честно: сервис распознаёт «печатный и рукописный текст на изображениях и в файлах PDF». Это именно распознавание, а не разбор бизнес-процесса: сравнивать его надо не с Entera, которая доводит документ до проводки в 1С, а с движком, на котором такую систему можно построить.

Модели под разные задачи

Сервис не пытается решить всё одной моделью. Разные модели отвечают за:

  • сплошной печатный текст на странице;
  • рукописный текст;
  • таблицы;
  • шаблонные документы — паспорт, водительское удостоверение и другие.

Языки подключаются отдельными моделями, полный список вынесен в документацию. Выбор модели — ваша ответственность: если отправить рукописную анкету в модель для печатного текста, результат будет плохим, и сервис здесь ни при чём.

Что приходит в ответе

Здесь у сервиса сильная сторона, о которой часто забывают при сравнении. Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки.

Практически это значит, что вы получаете не «простыню текста», а структуру, по которой можно самостоятельно определить, где на странице что находится: подтянуть значение справа от подписи «ИНН», собрать таблицу по координатам колонок, подсветить оператору исходное место в скане. Для собственной разработки это ценнее, чем готовый, но закрытый разбор полей.

Ограничения, которые надо проверить заранее

Документация задаёт жёсткие рамки: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».

Это те ограничения, из-за которых обычно ломается первый прототип. Скан договора на сорок страниц в высоком разрешении не пройдёт одним файлом — резать придётся на своей стороне. TIFF, привычный для промышленного сканирования, в списке форматов не значится: конвертация ложится на вас.

Как подключается

Два режима. Синхронные запросы через gRPC и REST — когда ответ нужен сразу, например клиент сфотографировал документ и ждёт. Асинхронная пакетная обработка — когда файлов много и важна не задержка, а пропускная способность. Разделение стандартное для облачных OCR, но выбирать надо на старте: это разные схемы вызова.

Что важно знать до выбора

Это облако, и документы уходят из вашего периметра. Ключевое отличие от Smart Document Engine и SOICA, которые работают в контуре заказчика. Если у вас паспорта клиентов или банковская тайна, вопрос к безопасникам возникнет раньше, чем вопрос о качестве.

Условия смотрите в разделе тарифов сервиса. Как считается оплата и что входит в стартовый грант, разработчик описывает отдельно, и это стоит сверить на актуальной странице, а не в обзорах.

Готового процесса нет. Сервис отдаёт текст и координаты; сопоставление с полями учётной системы, проверку и создание документа вы делаете сами. Если нужен результат «из коробки», смотрите системы, которые доводят документ до учётной записи.

Сколько стоит

Цены — на сайте разработчика — там они всегда сегодняшние

Сумм мы не публикуем: они меняются чаще, чем мы успеваем их проверять, а устаревшая цифра подрывает доверие ко всему разбору. Актуальную стоимость называет сам разработчик.

Тарифы на сайте разработчика
1 · 6 модулей — что входит, а за что доплата
Синхронный и пакетный режимы

Два режима: синхронные запросы через gRPC и REST — когда ответ нужен сразу, и асинхронная пакетная обработка — когда файлов много. Ограничения документации: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».

Страница модуля →
Распознавание печатного текста

Модель под сплошной печатный текст на странице. Выбор модели — ответственность заказчика: если отправить рукописную анкету в модель для печатного текста, результат будет плохим.

Страница модуля →
Распознавание рукописного текста

Отдельная модель под рукописный текст.

Страница модуля →
Распознавание таблиц

Отдельная модель под таблицы.

Страница модуля →
Шаблонные документы

Отдельные модели под шаблонные документы — паспорт, водительское удостоверение и другие. Языки подключаются отдельными моделями.

Страница модуля →
Структурированный ответ с координатами

Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки. Это не «простыня текста», а структура, по которой можно самостоятельно определить, где на странице что находится.

Страница модуля →

Жёлтым со знаком «плюс» — то, что тарифицируется отдельно и добавляется к счёту. Зелёным с галочкой — то, что уже входит в тариф.

=
счёт

Структуру видно, сумму — нет: точную цифру называет только сам разработчик, и только на сегодня.

Модули (6)

Функциональные блоки в составе платформы

Распознавание печатного текста Входит в тариф

Модель под сплошной печатный текст на странице. Выбор модели — ответственность заказчика: если отправить рукописную анкету в модель для печатного текста, результат будет плохим.

Распознавание рукописного текста Входит в тариф

Отдельная модель под рукописный текст.

Распознавание таблиц Входит в тариф

Отдельная модель под таблицы.

Шаблонные документы Входит в тариф

Отдельные модели под шаблонные документы — паспорт, водительское удостоверение и другие. Языки подключаются отдельными моделями.

Структурированный ответ с координатами Входит в тариф

Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки. Это не «простыня текста», а структура, по которой можно самостоятельно определить, где на странице что находится.

Синхронный и пакетный режимы Коннектор

Два режима: синхронные запросы через gRPC и REST — когда ответ нужен сразу, и асинхронная пакетная обработка — когда файлов много. Ограничения документации: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».

Возможности (4)

Что решение умеет делать — по данным с сайта разработчика

Характеристики (6)

Паспортные данные — развёртывание, интеграции, безопасность

Как попробовать до покупки стартовый грант или бесплатный лимит
Типы документов паспорта, водительские удостоверения, СТС и регистрационные номера автомобилей, рукописный и печатный текст, таблицы, формулы
Тип решения движок или API для встраивания
Форма поставки API или SDK для встраивания
Развёртывание облако
Где обрабатываются документы облако разработчика

О разработчике

Редакция Soframe сверила факты с сайтом разработчика 7 сентября 2026 г. Что-то устарело — напишите нам, поправим.

Похожие решения

Чем заменить Yandex Vision OCR →