Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Модели для обработки русского языка: бенчмарки 2026

Публичные лидерборды перестали быть главным аргументом при выборе модели для русского языка. В 2026 году решающими стали доменные тесты, стоимость инференса и...

Публичные лидерборды перестали быть главным аргументом при выборе модели для русского языка. В 2026 году решающими стали доменные тесты, стоимость инференса и возможность развернуть решение в закрытом контуре. Ниже — как читать бенчмарки и какие из них действительно отражают качество на русском.

Что изменилось в оценке русскоязычных моделей

Раньше выбор сводился к одной цифре в таблице: чем выше — тем лучше. Сейчас метрики разошлись по задачам — генерация, извлечение сущностей, суммаризация, RAG-ответы, вызов инструментов — и единого победителя нет. Модель, лидирующая в рассуждениях, часто проигрывает компактной версии на классификации обращений в поддержку.

Второе изменение — насыщение классических наборов. Задачи уровня RussianSuperGLUE решаются близко к потолку, и разница между топовыми системами лежит в пределах статистической погрешности. Поэтому фокус сместился на динамические и «живые» тесты, которые обновляются и не утекают в обучающие корпуса.

Ключевые бенчмарки и что они измеряют

MERA — объединённый русскоязычный набор из десятков заданий: от логики и математики до знания российского права и реалий. Полезен как быстрый срез общей пригодности модели, но по нему нельзя судить о качестве на вашей предметной области.

ruMTEB — эмбеддинги и поиск. Критичен для RAG: если векторная модель плохо различает близкие по смыслу русские формулировки, никакая генеративная надстройка не спасёт. Здесь смотрят не только средний балл, но и качество на коротких запросах и на текстах с аббревиатурами.

RuBQ и открытые QA-наборы — ответы на фактические вопросы, в том числе по русскоязычным источникам. Хорошо выявляют галлюцинации и склонность модели «дорисовывать» факты.

Инструкционные и агентные тесты — оценка следования формату, вызова функций, работы с длинным контекстом. Именно тут чаще всего расходятся открытые модели семейств Qwen, Llama, DeepSeek и российские GigaChat, YandexGPT, T-lite.

Внутренние доменные наборы — главный бенчмарк любой внедренческой задачи. Двести-триста реальных примеров с эталонными ответами дают больше, чем сотня публичных лидербордов.

Где бенчмарки врут

Первая проблема — контаминация. Публичные тесты попадают в веб-корпуса, и модель может «знать» ответы, а не решать задачу. Проверяется просто: перефразируйте вопросы и посмотрите, сохранится ли результат.

Вторая — несовпадение распределений. Бенчмарки написаны литературным языком, а в реальности приходят сообщения из мессенджеров с опечатками, транслитом и обрывками таблиц. Разрыв в качестве между «чистым» и «грязным» входом достигает десятков процентов.

Третья — игнорирование стоимости. Модель с разницей в 3% качества, но в пять раз дороже в инференсе, обычно проигрывает экономически. Считайте не только точность, но и токены на ответ, задержку и требования к GPU.

Практические шаги при выборе

  1. Соберите 150–300 реальных примеров из ваших систем: заявки, письма, выдержки из 1С, договоры. Разметьте эталонные ответы силами профильных сотрудников.
  2. Зафиксируйте метрики под задачу: точность извлечения полей, доля корректных ответов со ссылкой на источник, доля отказов вместо галлюцинации.
  3. Прогоните 3–5 кандидатов — включая компактные 7–14B-версии и одну крупную — на одинаковом промпте и температуре.
  4. Отдельно протестируйте длинный контекст: 30–60 страниц документации с вопросом в середине и в конце.
  5. Проверьте поведение в RAG-связке: качество чанкинга, реранкер, устойчивость к противоречивым фрагментам.
  6. Замерьте стоимость на 1000 запросов и требования к железу, прежде чем фиксировать архитектуру.

Российская специфика

Для большинства корпоративных сценариев решающим становится развёртывание в закрытом контуре: данные не покидают периметр, а модель дообучается на внутренних регламентах. Открытые веса здесь выигрывают у API, даже если формально уступают в лидербордах. Практика показывает: дообучение на 5–10 тысячах доменных примеров поднимает качество сильнее, чем переход на модель следующего поколения.

Отдельно стоит учитывать требования регуляторики и внутренней ИБ — журналирование, разграничение доступа к индексам, маскирование персональных данных до отправки в модель.

Как мы можем помочь

Мы подбираем модели под конкретную задачу, а не под строчку в рейтинге: собираем доменный набор, проводим сравнительные замеры, разворачиваем приватную LLM или RAG-контур и подключаем его к вашим системам — 1С, CRM, документообороту. Если нужен объективный ответ на вопрос «какая модель подходит именно нам», Обсудить проект.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.