Неудобная правда про рейтинги моделей
Мировые таблицы лидеров LLM измеряют в основном код, математику и английский язык. Мы регулярно прогоняем новые модели через российские юридические задачи — и видим одно и то же: модель, блестящая в кодинге, путает статьи кодексов, «англизирует» правовые конструкции и не чувствует процессуальных особенностей права РФ.
Вывод простой: чужим рейтингам в юриспруденции верить нельзя — нужно измерять самому.
Наш аналог LegalBench для права РФ
Мы собрали собственный набор юридических задач для российской правовой системы: квалификация споров, подбор применимых норм, расчёт процессуальных сроков, анализ договоров, подготовка процессуальных документов. Каждая кандидатная модель проходит этот бенчмарк, и в продукте остаётся та, что показала лучший результат на наших задачах, а не на абстрактных тестах.
Отбор идёт ещё и по скорости: юридический ответ нужен за минуты, поэтому для массовых шагов конвейера мы оптимизируем не только качество, но и время ответа.
Дообучение LoRA под российское право
Там, где базовой модели не хватает «юридической интуиции», мы дообучаем её методом LoRA на корпусах российских нормативных актов и судебной практики. Модель дотачивается под терминологию, стиль и логику права РФ — и даёт качество выше, чем более крупные, но необученные модели.
Подбор под каждую роль конвейера
КиберПравосудие — это конвейер из нескольких агентов, и каждый шаг может работать на своей модели: быстрые — на массовых операциях (классификация вопроса, планирование поиска, фильтрация актов, сжатие контекста), экспертные — на финальном заключении.
Текущий стек (сентябрь 2026)
- Qwen-3.8-Flash — субагенты: классификация, диспетчер поиска, ревизор находок, сжатие. Лучший баланс скорости и качества на массовых шагах по результатам наших тестов.
- DeepSeek-V4-Flash-Vision-Exp + LoRA — подготовка итогового юридического заключения: высокий уровень качества при высокой скорости, дообучение под право РФ и vision-модуль для чтения документов и сканов.
Стек — не догма
Выйдет модель, которая обгонит текущую на нашем бенчмарке, — заменим её в считанные дни, без миграций и простоев: сценарии, базы и контур проверки от модели не зависят. Клиент всегда работает на лучшей модели под задачу, даже не замечая замен.
Именно поэтому «у нас своя LLM» — не преимущество само по себе: преимущество в том, как вы выбираете и обновляете модели под свою предметную область. Мы выбрали измерять, дообучать и менять — быстро.



