Распознать Версия 2 (Net)
Описание
Извлечение текста из файла с помощью сервиса Робин OCR с Сойкой
Иконка действия
Параметры
Входные параметры
URL Ссылка для аутентификации на сервисе Сойки
Логин Логин для входа
Пароль Пароль для входа
Класс пакета Класс пакета, которым будет обрабатываться сценарий
Файл Путь к файлу, из которого необходимо извлечь текст
Тип результата Формат, в котором будут представлены результаты
Профиль распознавания Профиль распознавания для получения результатов
Тайм-аут Время в миллисекундах, в течение которого действие будет ожидать ответ от сервиса SOICA
Выходные параметры
Результат Коллекция json-объектов или xml-контекстов, содержащих распознанные данные
Статус Статус распознавания документа
Настройки
Свойство | Описание | Тип | Пример заполнения | Обязательность заполнения поля |
---|---|---|---|---|
Параметры | ||||
URL | Ссылка для аутентификации на сервисе Сойки | Robin.String | http://localhost/administrator | Да |
Логин | Логин для входа | Robin.String | admin | Да |
Пароль | Пароль для входа | Robin.Password | admin | Да |
Класс пакета | Класс пакета, которым будет обрабатываться сценарий | Robin.String. | Имя класса пакета | Да |
Файл | Путь к файлу, из которого необходимо извлечь текст. Поддерживаемые форматы изображений: JPEG, PDF, TIFF, BMP, PNG, DOCX, GIF | Robin.FilePath. | C:\Users\Документ\1.jpg | Да |
Тип результата | Формат, в котором будут представлены результаты Выпадающий список из элементов: XML, JSON Значение по умолчанию: XML | Robin.String | JSON | Нет |
Профиль распознавания | Профиль распознавания для получения результатов Профили создаются в самой Сойке и пользователь заранее знает, какой необходимо выбрать. Значение по умолчанию задается системой при создании класса пакетов и называется default | Robin.String | default | Нет |
Тайм-аут | Время в миллисекундах, в течение которого действие будет ожидать ответ от сервиса SOICA | Robin.Numeric | 1000000 | Нет |
Результаты | ||||
Результат | Коллекция json-объектов или xml-контекстов, содержащих распознанные данные. Если истек указанный тайм-аут, а сервис не закончил распознавание, этот параметр вернется пустым. Если распознание документа еще в процессе, то результат не заполнен. | Robin.Collection | ||
Статус | Статус распознавания документа | Robin.String |
Особые условия использования
Общие принципы работы с ROBIN OCR:
Для отправки документа на распознавание нужно выполнить минимум 2 запроса. Сначала отправляется запрос на создание пакета, в запрос передается единственное изображение пакета или первое. Запрос возвращает GUID пакета. Если изображений в пакете должно быть несколько, то в последующих запросах эти изображения добавляются к пакету (по одному). Завершающим запросом надо запустить пакет на обработку. Во второй и последующие запросы передается GUID созданного пакета.
Формат результата настраивается заранее, в сценарии.
Пользователь будет получать результат в виде коллекции json-объектов или xml-контекстов. С полученными результатами можно работать действиями студии.
Список классов пакета пользователь должен знать перед запуском действия.
Классы пакетов будут настроены в системе инженером, нужно выбрать класс, подходящий для обработки изображения. Имя класса пакета - это имя настроенного проекта. Имя класса пакета нужно указывать при создании пакета (обязательно). Имя пакета надо задавать в запросе.
Когда робот будет завершать работу с ошибкой, в тексте ошибки будет отображаться причина.
Если статус документа не "export", то робот не сможет получить результат и пропустит документ. Пользователь сам должен будет передвинуть документ в статус "экспорт" на сервере. Нужно провести валидацию файла вручную и отправить его на экспорт, путем внесения и принятия изменений в нем.
Статусы:
- import – импорт => ждать смены статуса;
- recognize – распознавание =>ждать смены статуса;
- validation – валидация=> вручную менять статус в системе Сойки;
- export – экспорт => готово к выгрузке, можно запускать действие "Получить статус распознавания";
- deleted - пакет был удален, ждать смены статуса;
- inaccessible - пакет недоступен, ждать смены статуса;
- quality control - если пользователь отправил по неправильному сценарию, вручную менять статус в системе Сойки.
- Если таймаут истекает до того как получим распознанный текст будет получен пустой результат, действие не завершается с ошибкой.
Извлечение текста из файла возможно с помощью сервиса Робин OCR с Сойкой.
Действие отправляет на проверку документы и сразу получает результаты:
- rest-сервис экспорта отвечает за получение результата;
- json или xml результат будет. Это настраивается внутри сценария обработки пакета в Сойке.;
- В действии надо вернуть не строку, а json-объект или сразу xml-контекст. у xml контекст нужно закрывать, у json не надо;
- Документ предварительно должен быть выгружен модулем экспорта;
- Действие должно ожидать пока статус документа станет "export". Тогда только запускать получение результата.
Пример использования
Задача
Распознать текст на документе.
Решение
Использовать действие "Распознать".
Реализация
- Установить действие "Распознать и получить результат" на рабочую область.
Заполнить параметры действия корректными данными.
- Запустить робота по кнопке "Старт" в верхней панели.
Результат
Робот вернул обработанные файлы. Результат представлен в виде коллекции с json-объектами или xml-контекстами. Статус "export".