Сайт использует файлы cookies для улучшения пользовательского опыта. Продолжая пользоваться сайтом, вы соглашаетесь с их использованием.
Хорошо
ERP
AI
Разработали нейросеть для распознавания бухгалтерских документов

Раcпознавание
счетов-фактур

Сократить затраты на обработку счетов-фактур, снизить нагрузку на бухгалтеров.
Цель
Заказчик — крупный ИТ-интегратор с численностью более 600 сотрудников. Компания ежегодно обрабатывает десятки тысяч счетов-фактур от поставщиков.

Документы поступают в разных форматах: PDF, сканы и фотографии. Их структура, верстка и формулировки различаются: например, итоговая сумма может быть указана как «Итого без НДС», «Сумма» или «Total Net».

Бухгалтеры вручную переносили реквизиты в систему: наименование контрагента, номер и дату счета, суммы, НДС, позиции из таблиц. Один документ обрабатывался от 3 до 10 минут. Ошибки ручного ввода и пиковые нагрузки увеличивали затраты на обработку. Готовые подписочные решения по распознаванию документов обходятся компании примерно в 9 млн рублей в год.
Задачи клиента
1
Автоматизировать распознавание счетов-фактур и извлечение ключевых реквизитов.
2
Исключить передачу данных во внешние облачные сервисы.
3
Интегрировать результаты распознавания с SAP.
4
Создать возможность дообучения нейросети без переработки кода.
Наше решение
Команда Astarus разработала локальную гибридную систему распознавания бухгалтерских документов. Она объединяет классическое OCR и пространственно-текстовую нейросеть, которая учитывает не только содержание текста, но и расположение элементов на странице.

Сначала документы проходят предобработку: выравнивание, удаление шумов, коррекцию перспективы и подавление теней. Затем Tesseract OCR извлекает текстовые блоки и координаты их расположения.

На следующем этапе модель анализирует данные. Она определяет назначение чисел и текстовых фрагментов с учетом контекста: например, отличает итоговую сумму от цены отдельной позиции в таблице. Для обучения модели команда подготовила и разметила датасет из более чем 1500 счетов-фактур.

Мы также реализовали постобработку данных. Система сопоставляет реквизиты с внутренними справочниками контрагентов, проверяет номера заказов, артикулы и количество товаров по данным ERP. Затем информация передаётся в SAP через API, где формируется готовый приходный документ.

Для сложных случаев был создан интерфейс верификации. Если уверенность модели недостаточна, система выделяет конкретные поля. Сотрудник может проверить или исправить их за несколько действий.

Все компоненты решения развернуты on-premise на серверах заказчика. Документы и извлеченные данные не выходят за пределы корпоративной инфраструктуры.
97%
точности
Распознавание и извлечение данных
90% автоматизации
Без участия бухгалтера
100% on-premise
Данные внутри контура
Гибкое дообучение
Без изменения кода нейросети
9 млн рублей
в год
Экономия на OCR-подписке
Обработка за секунды
Вместо 3–10 минут
Результаты
Сроки и команда
5 человек
10 месяцев
OpenCV
Технологии
PyTorch
Tesseract
Postgres
Python
FastAPI
LiLT
Docker
React
Другие кейсы
Узнайте бюджет проекта в течение 2 часов
Заполните форму обратной связи — мы позвоним вам в пределах рабочего дня