Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Семантический поиск по 1С: подключаем базу знаний к учётной системе

Штатный поиск по учётной системе устроен по-бухгалтерски: он ищет точные слова. Менеджер вводит «когда согласовали отсрочку для Ромашки», а получает сотни док...

Штатный поиск по учётной системе устроен по-бухгалтерски: он ищет точные слова. Менеджер вводит «когда согласовали отсрочку для Ромашки», а получает сотни документов с фамилией Ромашова. Семантический поиск решает задачу иначе — он сравнивает смысл запроса со смыслом записи, а не последовательность символов.

Почему полнотекстовый поиск в 1С упирается в потолок

В 1С:Предприятие 8.3 есть полнотекстовый поиск с морфологией: он разбирает строковые реквизиты на лексемы и строит индекс. Этого хватает для поиска по номеру договора или наименованию номенклатуры, но не для смысловых запросов. Синонимы, опечатки, перефразировки, косвенные формулировки — всё это вне зоны его действия.

Вторая проблема — охват. Индекс строится по реквизитам, а реальный смысл часто лежит в приложенных файлах, комментариях, истории переписки, текстах допсоглашений. Пользователь ищет решение, а система ищет строку.

Как работает семантический поиск над данными учётной системы

Каждый фрагмент текста превращается в вектор — эмбеддинг фиксированной размерности. Запрос пользователя проходит через ту же модель, и поиск сводится к нахождению ближайших векторов в пространстве. Близость по косинусу означает смысловую близость, а не совпадение слов.

На выходе пользователь получает не строки, а объекты 1С: документы, заявки, договоры, элементы справочников. В интерфейсе это выглядит как обычный поиск, только результаты релевантные — с переходом в карточку по ссылке.

Архитектура: 1С плюс внешний векторный слой

Рабочая схема для российской практики выглядит так: HTTP-сервисы или ODATA в 1С отдают контент, очередь (RabbitMQ, Kafka) разгружает пиковые записи, отдельный сервис считает эмбеддинги, векторная база хранит индекс. Для хранения достаточно pgvector в PostgreSQL, если объём до нескольких миллионов чанков; дальше — Qdrant или Milvus.

Обратный путь тоже через HTTP-сервис: сервис возвращает ссылки на объекты, а 1С открывает формы. Всю связку можно развернуть on-premise, без выхода данных за периметр — это критично для контуров с 152-ФЗ и коммерческой тайной.

Что индексировать и как готовить данные

Корпус стоит собирать не «всё подряд», а по сценариям: договоры и допсоглашения, заявки и обращения, комментарии к документам, регламенты и инструкции, переписка с контрагентами. Длинные тексты режутся на чанки по 300–800 токенов с перекрытием 10–20%, иначе смысл теряется на границах.

К каждому чанку прикрепляются метаданные: ссылка на объект, дата, контрагент, автор, права доступа. Без ACL семантический поиск становится дырой в разграничении прав — пользователь найдёт то, что ему видеть не положено.

Практические шаги внедрения

Начните с аудита корпуса: какие объекты дают наибольшую нагрузку на поиск и сколько там текста. Затем выберите один сценарий для пилота — например, поиск по договорам в УТ 11 — и зафиксируйте метрику: recall@10 и время ответа.

Дальше настройте инкрементальную синхронизацию через подписки на события (ПриЗаписи, ПриПроведении) с учётом пометки удаления. Добавьте гибридный поиск: BM25 по лексемам плюс вектор плюс реранкер — так точность выше, чем у чистых эмбеддингов.

Для русского языка подойдут BGE-M3, multilingual E5, ru-en-RoSBERTa, а также локальные GigaChat и YandexGPT embeddings. При отсутствии GPU инференс возможен на CPU с квантованием, но задержки вырастут до 300–800 мс на запрос.

Что даёт на практике

Пилоты в российских компаниях обычно дают сокращение времени на поиск информации в 3–5 раз и снижение числа повторных обращений в поддержку. Отдельный эффект — вход в учётную систему для новых сотрудников: вместо изучения структуры меню они задают вопрос словами.

Ограничение одно: качество зависит от качества данных. Мусорные комментарии и дубли в справочниках будут находиться так же хорошо, как полезные документы.

Как мы можем помочь

Мы проектируем и внедряем семантический поиск поверх 1С: собираем корпус, настраиваем чанкинг и права доступа, разворачиваем векторную базу и локальные модели эмбеддингов в вашем контуре, встраиваем интерфейс в формы учётной системы. Обсудить проект — покажем архитектуру на ваших данных и оценим сроки пилота.

1С и ИИ ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.