Мартовская ревизия данных: готовим базу знаний к внедрению
Почему ревизия базы знаний идёт до, а не после внедрения Проекты по RAG и корпоративным ассистентам чаще буксуют не на модели, а на состоянии документов. Асси...
Почему ревизия базы знаний идёт до, а не после внедрения
Проекты по RAG и корпоративным ассистентам чаще буксуют не на модели, а на состоянии документов. Ассистент честно находит то, что лежит в хранилище: устаревшие регламенты, три версии одного договора, сканы без текстового слоя. Март — удобное окно: годовая отчётность сдана, бюджеты на ИИ-направление утверждены, до отпусков есть время на инвентаризацию без спешки.
Ревизия нужна не «для порядка». Её измеримый результат — меньший объём базы при более высокой точности ответов и предсказуемая стоимость индексации и обновления.
Шаг 1. Карта источников и владельцев
Начните с перечня: файловые шары, 1С:Документооборот, CRM, корпоративный вики-портал, почтовые архивы, папки отделов на сетевом диске. По каждому источнику зафиксируйте владельца — не ИТ-специалиста, а руководителя процесса, который отвечает за содержание.
Практика показывает: 20–30% найденных массивов никто не считает корпоративной базой знаний, а именно там лежат самые полезные для ассистента документы — регламенты, чек-листы, типовые ответы клиентам.
Шаг 2. Актуальность, дубли и мёртвый груз
Отсортируйте документы по дате последнего изменения и по тому, ссылаются ли на них сотрудники. Всё, что не открывали два года и что не упоминается в свежих регламентах, уходит в архив — не удаляется, а исключается из индексации.
Отдельно займитесь дублями: один документ в трёх редакциях даёт противоречивые ответы, и модель начинает ошибаться на ровном месте. Цель — оставить одну каноническую версию и явно помечать её как действующую.
Шаг 3. Форматы, OCR и структура
Сканы, фотографии актов и PDF без текстового слоя требуют OCR — иначе они физически не попадут в базу знаний. Здесь же стоит проверить таблицы: прайсы, спецификации и графики из 1С и Excel нужно приводить к виду, который корректно разбирается на фрагменты.
Заранее решите, как дробить документы: по разделам, по пунктам, с сохранением заголовков. Качество нарезки влияет на точность поиска сильнее, чем смена модели.
Шаг 4. Права доступа и метаданные
В российских компаниях доступ часто наследуется от старых папок и уже не отражает реальную структуру. Перед внедрением ассистента сведите права к ролям: кто видит кадровые документы, кто — коммерческие условия, кто — только общие регламенты.
Метаданные — тип документа, подразделение, дата, гриф — нужны не для красоты. Они позволяют фильтровать выдачу и объяснять пользователю, откуда взялся ответ.
Шаг 5. Оценочный набор вопросов
Соберите 50–100 реальных вопросов от сотрудников: как оформить возврат, какой срок согласования договора, какая ставка по проекту. Это ваш эталон для приёмки: на нём видно, что дала ревизия и где ещё дыры в данных.
Такой набор стоит делать до выбора модели и векторной базы — он же потом служит регрессионным тестом при каждом обновлении.
Что учесть в российской практике
Приватный контур, отсутствие внешних API и требования хранить данные внутри периметра означают, что база знаний остаётся на вашем железе. Чем чище данные, тем меньше нужен объём контекста и тем дешевле инференс на собственных GPU.
Ещё один момент — интеграции: связать ассистента с 1С, CRM и СЭД проще, когда справочники и номенклатура уже приведены к единому виду. Иначе агент будет искать «ООО Ромашка» в четырёх написаниях.
Как мы можем помочь
Мы проводим ревизию баз знаний и готовим данные к внедрению приватных LLM, RAG-систем и ИИ-агентов: инвентаризация источников, OCR, очистка дублей, разметка прав и метаданных, сбор оценочных наборов. Обсудить проект — начнём с аудита ваших хранилищ и плана работ на ближайший квартал.
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.