Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Поиск по договорам: RAG на юридическом архиве

Юридический архив на несколько тысяч договоров превращается в проблему ровно в тот момент, когда нужно быстро ответить на конкретный вопрос: есть ли у нас пра...

Юридический архив на несколько тысяч договоров превращается в проблему ровно в тот момент, когда нужно быстро ответить на конкретный вопрос: есть ли у нас право на односторонний отказ, какой лимит ответственности согласован с этим поставщиком, продлевался ли договор допсоглашением. Поиск по имени файла и полнотекстовый поиск по словам здесь почти не помогают: формулировки в договорах разные, а смысл размазан по пунктам, приложениям и протоколам разногласий.

Почему обычный поиск не работает

Классический поиск ищет совпадение слов, а не смысл. Запрос «штраф за просрочку поставки» не найдёт пункт «пеня за нарушение сроков отгрузки в размере 0,1% за каждый день». Плюс архив неоднороден: свежие договоры лежат в Word и PDF, старые — сканы, часть — вложения в 1С:Документооборот, часть — в сетевой папке с произвольной структурой. Без нормализации и извлечения текста (OCR) любой интеллектуальный поиск даст ложную уверенность вместо ответа.

Что даёт RAG и как он устроен

RAG (Retrieval-Augmented Generation) — это связка «поиск + генерация»: система находит релевантные фрагменты документов и передаёт их языковой модели вместе с вопросом. Модель не выдумывает, а формулирует ответ по найденным пунктам и обязана ссылаться на источник. Ключевое требование в юридическом контуре — каждое утверждение сопровождается ссылкой на файл, номер пункта и дату версии документа. Иначе ответ бесполезен: юрист всё равно пойдёт проверять.

Данные: 1С как основной источник

В российской практике ядро архива обычно живёт в 1С: документы в 1С:Документооборот, реквизиты в справочнике «Контрагенты», суммы и сроки — в ERP или УТ. Правильный подход — не выгружать файлы в отдельную свалку, а строить индекс поверх 1С через HTTP-сервисы или OData, забирая вместе с текстом метаданные: контрагент, ИНН, тип договора, дата, сумма, статус, ответственный, связанные допсоглашения. Метаданные дают фильтры («только действующие договоры с этим ИНН») и позволяют наследовать права доступа — пользователь не должен видеть через поиск то, что закрыто в 1С.

Чанкинг: резать по смыслу, а не по символам

Договор нужно дробить по структурным единицам: пункт, подпункт, приложение, спецификация. Каждый чанк сохраняет иерархию («п. 5.3 → раздел 5 → договор № 14/2024») и заголовок раздела — без этого модель теряет контекст. Сканы прогоняются через OCR с проверкой качества: если распознавание ниже порога, фрагмент помечается и не попадает в индекс как надёжный источник.

Гибридный поиск и реранкинг

Один векторный поиск на юридических текстах ошибается: точные термины и номера пунктов он «размывает». Рабочая схема — гибрид: BM25 по ключевым словам плюс векторный поиск по эмбеддингам, затем реранкер, который пересортировывает топ-50 кандидатов и оставляет 5–8 действительно релевантных. Дальше LLM формирует ответ с цитатами. Отдельно нужен честный ответ «в архиве нет подходящего пункта» — это снижает риск галлюцинаций сильнее любых промптов.

Метрики и пилот

Качество измеряется на размеченном наборе из 100–200 реальных вопросов юристов: recall@k (попал ли нужный пункт в выдачу), точность цитирования, доля корректных отказов. Пилот разумно ставить на одном типе договоров (например, поставка) и горизонте 4–6 недель: месяц на подготовку данных и индекс, две недели на разметку и настройку. По результатам видно, масштабировать ли на весь архив.

Безопасность

Юридические документы — чувствительные данные. В российском контуре это означает развёртывание на своих серверах, локальные или доступные по API в закрытом периметре модели, шифрование индекса и журналирование всех запросов. Внешние облачные сервисы подходят только для обезличенных тестовых выборок.

Практические шаги

  1. Инвентаризация архива: где лежат файлы, какие форматы, сколько сканов.
  2. Выгрузка текстов и метаданных из 1С, настройка OCR.
  3. Чанкинг по пунктам с сохранением иерархии и прав доступа.
  4. Сборка гибридного поиска с реранкером и генерацией ответа со ссылками.
  5. Разметка вопросов, замер метрик, дообучение на ошибках.
  6. Интерфейс: чат для юриста и API для встраивания в 1С.

Как мы можем помочь

Мы проектируем и внедряем RAG-системы поверх корпоративных архивов: подключаем 1С и файловые хранилища, настраиваем OCR, гибридный поиск и генерацию ответов со ссылками на пункты, разворачиваем модели в вашем контуре и доводим качество по метрикам на ваших договорах. Обсудить проект

1С и ИИ ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.