Векторная семантика бренд-запросов: как ИИ ищет упоминания
Бренд-мониторинг давно перестал быть задачей «найти строку в тексте». Упоминания живут в постах и комментариях, расшифровках видео, PDF-отчётах, тендерной док...
Бренд-мониторинг давно перестал быть задачей «найти строку в тексте». Упоминания живут в постах и комментариях, расшифровках видео, PDF-отчётах, тендерной документации и голосовых сообщениях — и почти никогда название компании не написано там так, как в брендбуке. Векторная семантика решает эту задачу иначе: ищет по смыслу, а не по точному совпадению символов.
Почему поиск по ключевым словам теряет упоминания
Классический grep по списку «АПС», «А-Пи-Эс», «APS» одновременно даёт лавину шума и пропуски. Название склоняют, пишут латиницей, сокращают до инициалов, разрывают переносом строки или вставляют в середину чужого предложения. Отдельная проблема — омонимия: та же аббревиатура «АПС» в половине отраслевых текстов означает автоматическую пожарную сигнализацию.
В результате маркетинг получает отчёт, где 60% карточек — мусор, а реальный негатив в комментарии под видео остаётся незамеченным. Правило на регулярках растёт до сотен строк и всё равно ломается на первом же новом сленге.
Как работает векторный поиск упоминаний
Текст разбивается на фрагменты и подаётся на вход энкодеру — модели, которая превращает фрагмент в вектор размерности 768–1536. Смысловая близость считается через косинусное расстояние: чем меньше угол между векторами, тем ближе содержание. Хранение и поиск обеспечивают HNSW-индексы в pgvector, Qdrant или Milvus — миллион фрагментов ищется за десятки миллисекунд.
Ключевой момент: запрос — не строка, а набор эталонных описаний бренда. Для студии внедрения ИИ это будут фразы «внедрение приватных LLM», «RAG для корпоративной базы знаний», «ИИ-агенты для отдела продаж». Порог отсечения обычно лежит в диапазоне 0,72–0,82 и подбирается на размеченной выборке, а не на глаз.
Что ломается на русском языке
Русская морфология разносит формы слова далеко друг от друга в векторном пространстве, транслит и смешанные алфавиты («AПС», «апс-студия») добавляют шум. Практика российских команд — гибридный поиск: BM25 по нормализованным леммам складывается с векторной выдачей через reciprocal rank fusion. Это даёт +15–25% recall по сравнению с чистым векторным поиском.
Для видео и подкастов добавляется ASR, для скриншотов, презентаций и сканов — OCR. Без этих двух слоёв вы теряете упоминания в обзорах на YouTube и в отраслевых PDF, где как раз и звучат названия подрядчиков.
Пайплайн мониторинга: от сбора до отчёта
Рабочая схема выглядит так:
- Сбор. API Telegram и VK, RSS отраслевых изданий, YouTube, отзовики, тендерные площадки, внутренние чаты клиента.
- Нормализация. Дедупликация, приведение к единому алфавиту, разметка источника и даты.
- Гибридный поиск кандидатов по словарю алиасов и векторным эталонам.
- LLM-верификация. Модель отвечает на три вопроса: о нашем ли бренде речь, какова тональность, какой это тип упоминания — отзыв, вакансия, новость, реклама конкурента.
- Маршрутизация. Негатив уходит алертом в мессенджер, тёплые лиды — сделкой в CRM и 1С.
LLM вызывается только для кандидатов, прошедших порог. Это снижает стоимость обработки в 20–50 раз по сравнению с прогоном всего потока через модель.
Метрики и настройка порогов
Качество измеряется на «золотом наборе» из 300–500 вручную размеченных фрагментов. Реалистичная цель — recall 0,90 при precision 0,85: пропустить негатив дороже, чем показать лишнюю карточку. Раз в месяц порог пересматривают, потому что язык аудитории дрейфует, а вместе с ним смещаются и векторы.
Полезно логировать каждое решение модели вместе с уверенностью. Это даёт материал для дообучения и позволяет объяснить маркетингу, почему конкретный пост попал в отчёт.
Практические шаги для маркетинга
- Соберите 300 размеченных примеров: 150 релевантных, 150 похожих, но чужих.
- Составьте словарь алиасов и отдельный список анти-примеров — омонимов и названий конкурентов.
- Запустите гибридный поиск, начните с порога 0,75 и калибруйте по метрикам, а не по ощущениям.
- Настройте SLA на негатив: алерт ответственному не позже 15 минут после публикации.
- Храните эмбеддинги рядом с основными данными в pgvector — так проще строить отчёты и не плодить отдельный сервис.
Как мы можем помочь
АПС проектирует и внедряет такие системы целиком: сбор данных, гибридный поиск, LLM-верификация, дашборды и интеграция с 1С и CRM. Мы разворачиваем модели в приватном контуре заказчика, чтобы переписка клиентов и внутренние документы не покидали инфраструктуру. Обсудить проект
Внедрить это в вашей компании
Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.
Обсудить проектКомментарии (0)
Пока нет комментариев — будьте первым.