Распознавание документов с ИИ: сканы в 1С и XML

Скан на входе, проверенные данные на выходе

Агент читает счета, акты, накладные и проектную документацию. Достаёт поля, показывает, откуда взял каждое, сверяет с правилами и выгружает в вашу систему. Спорные поля проверяет человек.

Документы приходят картинками, а работать нужно с данными

  • Бухгалтер перебивает реквизиты со сканов счетов в 1С и сверяет суммы глазами.
  • Об ошибке в акте узнают, когда контрагент возвращает его без подписи.
  • Для экспертизы нужен XML по схеме, а на руках комплект PDF, DOCX и сканов. Его собирают вручную и каждый раз с ошибками.
  • Входящих документов всё больше, а нанимать под них новых людей не хочется.

Что изменится после запуска

  • 01Сотрудник проверяет спорные поля, а не перепечатывает документ целиком
  • 02Ошибки в реквизитах и суммах ловятся до проводки, а не после
  • 03Строгие форматы вроде XML проходят проверку по схеме до отправки

Как работает агент

  1. 01

    Принимаем документ

    Из почты, общей папки, ЭДО или через загрузку в веб-интерфейсе. PDF, DOCX, фото и сканы.

  2. 02

    Распознаём текст

    Сканы проходят OCR. Структуру документа — таблицы, реквизиты, отметки о подписи — сохраняем.

  3. 03

    Достаём поля

    ИИ находит нужные поля и для каждого запоминает место на странице и уверенность. Поле без источника не принимается.

  4. 04

    Проверяем по правилам

    ИНН сверяем со справочником, суммы — с позициями, даты — с договором. Правила пишем кодом, а не просим модель «проверить на глаз».

  5. 05

    Человек решает спорное

    Поля с низкой уверенностью и нарушенные правила уходят сотруднику. Он подтверждает, правит или вводит значение вручную.

  6. 06

    Выгружаем

    В 1С, CRM, ЭДО или в файл по схеме. XML и другие строгие форматы собирает программа, а не нейросеть, и проверяет по схеме до отправки.

Какой масштаб ваш?

Одна задача — три разных проекта. Выберите похожий на вас и нажмите «Хочу это»: заявка придёт с пометкой, смету пришлём за 1–2 дня.

Малый бизнес

Один поток документов, например входящие счета, который каждую неделю съедает часы бухгалтера.

Что делаем

  • Один тип документа и фиксированный набор полей
  • Веб-интерфейс: загрузил, проверил, скачал
  • Проверка обязательных полей и простых правил
  • Выгрузка в Excel или CSV
Интеграции
Без интеграций: файл на входе, таблица на выходе
Где работает
Облако
Срок
Ориентир: около месяца

Средний бизнес

частый старт

Счета, акты, накладные и договоры идут потоком из почты и ЭДО, и проверяют их несколько человек.

Что делаем

  • Несколько типов документов и автоматическая сортировка на входе
  • Сверка со справочниками 1С: контрагенты, договоры, номенклатура
  • Очередь проверки для сотрудников с ролями
  • Создание документа в 1С или CRM после подтверждения
  • Отчёт о том, какие поля чаще всего правят вручную
Интеграции
1С, CRM, ЭДО, почта, общие папки
Где работает
Облако или ваш сервер
Срок
Ориентир: от 1–2 месяцев

Крупный бизнес

частый старт

В документах персональные данные и коммерческая тайна, выгрузка — в строгие отраслевые форматы, у ИБ свои требования.

Что делаем

  • Распознавание и модель в закрытом контуре на ваших серверах
  • Доступ к документам по отделам и юрлицам
  • Журнал: кто подтвердил поле и что изменил
  • Выгрузка в отраслевые форматы с проверкой по XSD
  • SLA и сопровождение при смене форм и схем
Интеграции
1С, СЭД, ЭДО, электронная подпись, внутренние API
Где работает
Закрытый контур на ваших серверах; сервер с GPU считаем отдельно
Срок
Ориентир: от 2–3 месяцев

Пилот — от 300 000 ₽. Дальше стоимость считаем по задаче и часам.

Вопросы

Что будет с плохими сканами?

До старта берём выборку ваших реальных документов, включая самые неудачные, и смотрим, что распознаётся. Поле, прочитанное неуверенно, не уходит дальше без человека. Если скан совсем нечитаемый, скажем прямо: его нужно переснять.

Нейросеть может перепутать сумму?

Может, поэтому одной нейросети мы не доверяем. Каждое поле привязано к месту в документе, суммы и реквизиты сверяют правила, спорное проверяет человек. В проекте ХМЛ модель только предлагает поля, а XML пояснительной записки собирает код по XSD-схеме.

Чем это отличается от обычного OCR?

OCR даёт текст. Вам нужны поля: кто поставщик, какая сумма с НДС, к какому договору относится счёт. Их достаёт ИИ поверх распознанного текста, а затем правила проверяют результат.

Где хранятся документы?

Зависит от контура. В облачном варианте — на сервере проекта. Если в документах персональные данные или коммерческая тайна, разворачиваем всё на ваших серверах и подключаем модель так, чтобы данные не выходили за периметр. Архитектуру проектируем под 152-ФЗ.

Сколько ждать первую версию?

Рабочая версия на одном типе документа обычно готова примерно через месяц. Сложные комплекты занимают больше: первый этап ХМЛ по ТЗ рассчитан на 45 дней. Стоимость считаем по задаче и часам: смету с этапами присылаем за 1–2 дня после брифа.

Смета за 1–2 дня

Напишите процесс, который съедает время. Вернём вилку пилота, не презентацию на 40 слайдов.

Презентация ↓ PDF

Или быстрая связь

Распознавание документов ИИ: сканы в 1С и XML | JimmyNeuron