Обсудить проект
Блог · инженерия ИИ

Заметки об инженерии ИИ

Как мы внедряем приватные модели, RAG и агентов в реальные процессы — без пафоса, на практике.

Kimi K2: длинный контекст для юридических документов

Длинный контекст перестал быть маркетинговой цифрой и стал рабочим инструментом там, где документы живут не по отдельности, а связками: рамочный договор плюс...

Длинный контекст перестал быть маркетинговой цифрой и стал рабочим инструментом там, где документы живут не по отдельности, а связками: рамочный договор плюс 12 приложений, плюс протоколы разногласий, плюс переписка об исполнении. Kimi K2 — открытая MoE-модель от Moonshot AI с активируемыми ~32 млрд параметров и контекстом до 128 тыс. токенов (в версии K2 Thinking — до 256 тыс.). Для юристов это означает возможность подать в модель не выжимку, а весь материал дела.

Что меняет длинный контекст в юридической работе

Классический RAG режет документ на чанки и теряет именно то, что юрист ищет: взаимные ссылки между пунктами, оговорки «несмотря на п. 5.2», отсылки к приложениям. Модель с длинным контекстом видит структуру целиком и отвечает на сквозные вопросы: где в цепочке договоров уступки меняется подсудность, какой лимит ответственности переживает пролонгацию, какие сроки исковой давности уже истекли. На практике это сокращает подготовку правового заключения по сделке с 6–8 часов до 1–2, если модель корректно проинструктирована.

Где Kimi K2 выигрывает у «нарезки на чанки»

Три сценария, где разница видна сразу. Первый — due diligence: 300–500 страниц корпоративных документов, где риск спрятан в несоответствии между уставом, корпоративным договором и протоколом. Второй — судебная аналитика: подбор релевантной практики по фабуле, когда нужно удержать в поле зрения и текст иска, и отзывы, и три инстанции. Третий — налоговые и банкротные споры, где решение зависит от хронологии платежей и аффилированности, а она восстанавливается только по массиву выписок и договоров.

Ограничения, о которых молчат в презентациях

Длинный контекст не бесплатен: KV-кеш съедает память GPU, а стоимость инференса растёт линейно. Модель деградирует на середине длинного промпта — эффект «lost in the middle» никуда не исчез, поэтому критичные условия лучше дублировать в инструкции. И главное: Kimi K2 — не юридическая модель, она не знает российского процессуального права «из коробки». Безfew-shot примеров на русских судебных актах и справочника по ГК/АПК качество ссылок падает.

Практические шаги внедрения

Начинайте не с выбора модели, а с корпуса. Соберите 20–50 закрытых дел с эталонными ответами юристов — это ваш тест-сет, и он же покажет, нужен ли вообще длинный контекст или хватит гибридной схемы RAG + 32К. Затем сравните два режима на одних вопросах: полный документ в контексте против поиска по чанкам. Дальше — квантизация (AWQ/FP8), развёртывание через vLLM или SGLang, обязательное цитирование с указанием пункта и страницы, логирование каждого ответа для аудита.

Российская специфика

Для юрдепартамента ключевое — не качество модели само по себе, а возможность держать данные в своём контуре. Открытые веса Kimi K2 позволяют развернуть модель на собственных GPU и не отправлять договоры с коммерческой тайной и персональными данными в зарубежные API. Это снимает вопросы по 152-ФЗ, адвокатской тайне и внутренним политикам ИБ, которые почти всегда блокируют пилоты на внешних сервисах. Дополнительно учитывайте русскоязычные сканы: без OCR-слоя (распознавание таблиц, штампов, рукописных правок) длинный контекст бесполезен — мусор на входе даст мусор на выходе.

Как мы можем помочь

Мы в АПС разворачиваем приватные LLM, включая Kimi K2, в контуре заказчика: подбираем GPU-конфигурацию, настраиваем OCR и гибридный поиск, обучаем модель на ваших договорах и судебной практике, интегрируем с 1С:Документооборот, ЭДО и CRM. На выходе вы получаете не демо, а рабочий инструмент с замеренным качеством на вашем тест-сете и понятной стоимостью за документ. Обсудить проект — покажем расчёт на ваших вводных.

Модели ИИ автоматизация АПС

Внедрить это в вашей компании

Приватный ИИ, RAG-поиск и агенты на вашем сервере — пилот за пару недель покажет эффект до полного бюджета.

Обсудить проект

Комментарии (0)

Пока нет комментариев — будьте первым.