Сервис распознавания текста от Яндекса: читает «печатный и рукописный текст на изображениях и в файлах PDF» и отдаёт результат по API. Есть отдельные модели под сплошной текст, рукопись, таблицы и шаблонные документы вроде паспорта и водительского удостоверения. Работает синхронно через gRPC и REST, для больших объёмов есть пакетный режим. Это облако: ставить и лицензировать нечего, но документы уходят к провайдеру.
О продукте
Yandex Vision OCR — облачный сервис Яндекса для распознавания текста. Он относится к семейству Yandex AI Studio, куда переехали ИИ-сервисы Yandex Cloud, и живёт в собственном разделе документации: старые ссылки на yandex.cloud отдают редирект.
Задача сформулирована узко и честно: сервис распознаёт «печатный и рукописный текст на изображениях и в файлах PDF». Это именно распознавание, а не разбор бизнес-процесса: сравнивать его надо не с Entera, которая доводит документ до проводки в 1С, а с движком, на котором такую систему можно построить.
Модели под разные задачи
Сервис не пытается решить всё одной моделью. Разные модели отвечают за:
- сплошной печатный текст на странице;
- рукописный текст;
- таблицы;
- шаблонные документы — паспорт, водительское удостоверение и другие.
Языки подключаются отдельными моделями, полный список вынесен в документацию. Выбор модели — ваша ответственность: если отправить рукописную анкету в модель для печатного текста, результат будет плохим, и сервис здесь ни при чём.
Что приходит в ответе
Здесь у сервиса сильная сторона, о которой часто забывают при сравнении. Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки.
Практически это значит, что вы получаете не «простыню текста», а структуру, по которой можно самостоятельно определить, где на странице что находится: подтянуть значение справа от подписи «ИНН», собрать таблицу по координатам колонок, подсветить оператору исходное место в скане. Для собственной разработки это ценнее, чем готовый, но закрытый разбор полей.
Ограничения, которые надо проверить заранее
Документация задаёт жёсткие рамки: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».
Это те ограничения, из-за которых обычно ломается первый прототип. Скан договора на сорок страниц в высоком разрешении не пройдёт одним файлом — резать придётся на своей стороне. TIFF, привычный для промышленного сканирования, в списке форматов не значится: конвертация ложится на вас.
Как подключается
Два режима. Синхронные запросы через gRPC и REST — когда ответ нужен сразу, например клиент сфотографировал документ и ждёт. Асинхронная пакетная обработка — когда файлов много и важна не задержка, а пропускная способность. Разделение стандартное для облачных OCR, но выбирать надо на старте: это разные схемы вызова.
Что важно знать до выбора
Это облако, и документы уходят из вашего периметра. Ключевое отличие от Smart Document Engine и SOICA, которые работают в контуре заказчика. Если у вас паспорта клиентов или банковская тайна, вопрос к безопасникам возникнет раньше, чем вопрос о качестве.
Условия смотрите в разделе тарифов сервиса. Как считается оплата и что входит в стартовый грант, разработчик описывает отдельно, и это стоит сверить на актуальной странице, а не в обзорах.
Готового процесса нет. Сервис отдаёт текст и координаты; сопоставление с полями учётной системы, проверку и создание документа вы делаете сами. Если нужен результат «из коробки», смотрите системы, которые доводят документ до учётной записи.
Сколько стоит
Сумм мы не публикуем: они меняются чаще, чем мы успеваем их проверять, а устаревшая цифра подрывает доверие ко всему разбору. Актуальную стоимость называет сам разработчик.
Тарифы на сайте разработчикаСинхронный и пакетный режимы
Два режима: синхронные запросы через gRPC и REST — когда ответ нужен сразу, и асинхронная пакетная обработка — когда файлов много. Ограничения документации: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».
Страница модуля →Распознавание печатного текста
Модель под сплошной печатный текст на странице. Выбор модели — ответственность заказчика: если отправить рукописную анкету в модель для печатного текста, результат будет плохим.
Страница модуля →Шаблонные документы
Отдельные модели под шаблонные документы — паспорт, водительское удостоверение и другие. Языки подключаются отдельными моделями.
Страница модуля →Структурированный ответ с координатами
Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки. Это не «простыня текста», а структура, по которой можно самостоятельно определить, где на странице что находится.
Страница модуля →Жёлтым со знаком «плюс» — то, что тарифицируется отдельно и добавляется к счёту. Зелёным с галочкой — то, что уже входит в тариф.
Структуру видно, сумму — нет: точную цифру называет только сам разработчик, и только на сегодня.
Модули (6)
Функциональные блоки в составе платформы
Модель под сплошной печатный текст на странице. Выбор модели — ответственность заказчика: если отправить рукописную анкету в модель для печатного текста, результат будет плохим.
Отдельная модель под рукописный текст.
Отдельная модель под таблицы.
Отдельные модели под шаблонные документы — паспорт, водительское удостоверение и другие. Языки подключаются отдельными моделями.
Результат отдаётся в формате JSON Lines с иерархией: слова собраны в строки, строки — в блоки, блоки — в страницы, и для каждого элемента возвращаются координаты ограничивающей рамки. Это не «простыня текста», а структура, по которой можно самостоятельно определить, где на странице что находится.
Два режима: синхронные запросы через gRPC и REST — когда ответ нужен сразу, и асинхронная пакетная обработка — когда файлов много. Ограничения документации: «Поддерживаемые форматы файлов: JPEG, PNG, PDF», «Максимальный размер файла: 10 МБ», «Размер изображения не должен превышать 20 мегапикселей».
Возможности (4)
Что решение умеет делать — по данным с сайта разработчика
Характеристики (6)
Паспортные данные — развёртывание, интеграции, безопасность
О разработчике
Редакция Soframe сверила факты с сайтом разработчика 7 сентября 2026 г. Что-то устарело — напишите нам, поправим.