Команда Astarus разработала локальную гибридную систему распознавания бухгалтерских документов. Она объединяет классическое OCR и пространственно-текстовую нейросеть, которая учитывает не только содержание текста, но и расположение элементов на странице.
Сначала документы проходят предобработку: выравнивание, удаление шумов, коррекцию перспективы и подавление теней. Затем Tesseract OCR извлекает текстовые блоки и координаты их расположения.
На следующем этапе модель анализирует данные. Она определяет назначение чисел и текстовых фрагментов с учетом контекста: например, отличает итоговую сумму от цены отдельной позиции в таблице. Для обучения модели команда подготовила и разметила датасет из более чем 1500 счетов-фактур.
Мы также реализовали постобработку данных. Система сопоставляет реквизиты с внутренними справочниками контрагентов, проверяет номера заказов, артикулы и количество товаров по данным ERP. Затем информация передаётся в SAP через API, где формируется готовый приходный документ.
Для сложных случаев был создан интерфейс верификации. Если уверенность модели недостаточна, система выделяет конкретные поля. Сотрудник может проверить или исправить их за несколько действий.
Все компоненты решения развернуты on-premise на серверах заказчика. Документы и извлеченные данные не выходят за пределы корпоративной инфраструктуры.