Семантический поиск по 1С: подключаем базу знаний к учётной системе
Штатный поиск по учётной системе устроен по-бухгалтерски: он ищет точные слова. Менеджер вводит «когда согласовали отсрочку для Ромашки», а получает сотни док...
Штатный поиск по учётной системе устроен по-бухгалтерски: он ищет точные слова. Менеджер вводит «когда согласовали отсрочку для Ромашки», а получает сотни документов с фамилией Ромашова. Семантический поиск решает задачу иначе — он сравнивает смысл запроса со смыслом записи, а не последовательность символов.
Почему полнотекстовый поиск в 1С упирается в потолок
В 1С:Предприятие 8.3 есть полнотекстовый поиск с морфологией: он разбирает строковые реквизиты на лексемы и строит индекс. Этого хватает для поиска по номеру договора или наименованию номенклатуры, но не для смысловых запросов. Синонимы, опечатки, перефразировки, косвенные формулировки — всё это вне зоны его действия.
Вторая проблема — охват. Индекс строится по реквизитам, а реальный смысл часто лежит в приложенных файлах, комментариях, истории переписки, текстах допсоглашений. Пользователь ищет решение, а система ищет строку.
Как работает семантический поиск над данными учётной системы
Каждый фрагмент текста превращается в вектор — эмбеддинг фиксированной размерности. Запрос пользователя проходит через ту же модель, и поиск сводится к нахождению ближайших векторов в пространстве. Близость по косинусу означает смысловую близость, а не совпадение слов.
На выходе пользователь получает не строки, а объекты 1С: документы, заявки, договоры, элементы справочников. В интерфейсе это выглядит как обычный поиск, только результаты релевантные — с переходом в карточку по ссылке.
Архитектура: 1С плюс внешний векторный слой
Рабочая схема для российской практики выглядит так: HTTP-сервисы или ODATA в 1С отдают контент, очередь (RabbitMQ, Kafka) разгружает пиковые записи, отдельный сервис считает эмбеддинги, векторная база хранит индекс. Для хранения достаточно pgvector в PostgreSQL, если объём до нескольких миллионов чанков; дальше — Qdrant или Milvus.
Обратный путь тоже через HTTP-сервис: сервис возвращает ссылки на объекты, а 1С открывает формы. Всю связку можно развернуть on-premise, без выхода данных за периметр — это критично для контуров с 152-ФЗ и коммерческой тайной.
Что индексировать и как готовить данные
Корпус стоит собирать не «всё подряд», а по сценариям: договоры и допсоглашения, заявки и обращения, комментарии к документам, регламенты и инструкции, переписка с контрагентами. Длинные тексты режутся на чанки по 300–800 токенов с перекрытием 10–20%, иначе смысл теряется на границах.
К каждому чанку прикрепляются метаданные: ссылка на объект, дата, контрагент, автор, права доступа. Без ACL семантический поиск становится дырой в разграничении прав — пользователь найдёт то, что ему видеть не положено.
Практические шаги внедрения
Начните с аудита корпуса: какие объекты дают наибольшую нагрузку на поиск и сколько там текста. Затем выберите один сценарий для пилота — например, поиск по договорам в УТ 11 — и зафиксируйте метрику: recall@10 и время ответа.
Дальше настройте инкрементальную синхронизацию через подписки на события (ПриЗаписи, ПриПроведении) с учётом пометки удаления. Добавьте гибридный поиск: BM25 по лексемам плюс вектор плюс реранкер — так точность выше, чем у чистых эмбеддингов.
Для русского языка подойдут BGE-M3, multilingual E5, ru-en-RoSBERTa, а также локальные GigaChat и YandexGPT embeddings. При отсутствии GPU инференс возможен на CPU с квантованием, но задержки вырастут до 300–800 мс на запрос.
Что даёт на практике
Пилоты в российских компаниях обычно дают сокращение времени на поиск информации в 3–5 раз и снижение числа повторных обращений в поддержку. Отдельный эффект — вход в учётную систему для новых сотрудников: вместо изучения структуры меню они задают вопрос словами.
Ограничение одно: качество зависит от качества данных. Мусорные комментарии и дубли в справочниках будут находиться так же хорошо, как полезные документы.
Как мы можем помочь
Мы проектируем и внедряем семантический поиск поверх 1С: собираем корпус, настраиваем чанкинг и права доступа, разворачиваем векторную базу и локальные модели эмбеддингов в вашем контуре, встраиваем интерфейс в формы учётной системы. Обсудить проект — покажем архитектуру на ваших данных и оценим сроки пилота.
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.