Это большая языковая модель собственной разработки с 7 миллиардами параметров, адаптированная под русский язык и нативно исполняемая на процессорах «Эльбрус». Модель работает полностью локально - на сервере заказчика, без обращения к внешним облакам и API. Все демонстрации на этом стенде (ассистент, поиск объектов, риск-анализ) обслуживает именно она. В конфигурации демо-стенда используется квантизация INT4 с RAG-поиском по данным - это даёт оптимальный баланс скорости и качества ответов на отечественном процессоре.
В основе модели лежит собственная архитектура - не открытая и не производная от зарубежных открытых моделей. Фундамент - свёрточные слои CNN: ядро модели построено на сверточных блоках, которые извлекают локальные паттерны из последовательностей токенов и формируют многоуровневые представления текста. Поверх свёрточной основы работают механизмы внимания и feed-forward блоки, обеспечивающие учёт дальнего контекста. Модель имеет 32 слоя, рабочее окно контекста - 8k токенов. Поверх архитектуры выполнено дообучение на корпусе русскоязычных документов: нормативные акты, техническая документация, деловая переписка, инструкции и регламенты. Своя архитектура и свёрточная основа дают уверенное качество именно в рабочих сценариях госсектора и промышленности.
Три ключевых отличия. Первое - модель работает в закрытом контуре: данные никогда не покидают периметр заказчика, тогда как облачные сервисы передают запросы на свои серверы. Второе - исполнение на отечественных процессорах «Эльбрус», что снимает санкционные и лицензионные риски. Третье - модель разворачивается у вас, без подписки и помегабайтной оплаты: стоимость владения фиксирована. Дополнительно: своя архитектура на свёртках CNN, а не клон зарубежной открытой модели, что устраняет зависимость от чужих лицензий и изменений upstream-проектов.
Классические LLM-сценарии: вопросно-ответные системы по корпоративной базе знаний, суммаризация документов, извлечение сущностей и фактов, классификация обращений, генерация ответов и черновиков документов, риск-анализ транзакций, семантический поиск. На этом стенде показаны живые примеры: цифровой ассистент, аудит реестра транзакций, расширение поисковых запросов для детекции объектов. В каждом сценарии используется RAG - модель отвечает по вашим данным, а не по предобученным знаниям.
Базовая elbrus-llm · ru - текстовая. Рядом в стеке работают специализированные модели: vision-детектор для кадров с БПЛА и OCR-модуль для рукописных документов и чертежей. Все они объединяются в одном контуре: например, в демо «Распознавание рукописного текста» изображение или PDF обрабатывается vision-моделью, а структурирование результата выполняет elbrus-llm. Vision-модели также построены на свёрточной архитектуре CNN - это и составляет основу их способности к локальной детекции объектов.
Демо-стенд работает на процессоре Эльбрус, и конфигурация INT4 + RAG выбрана как оптимальная. INT4-квантизация даёт максимальную скорость инференса на CPU и минимальное потребление памяти, что критично для демонстраций в реальном времени. RAG (поиск по данным) компенсирует потерю точности от 4-битных весов: модель не полагается на предобученные знания, а отвечает по извлечённым из векторного индекса фрагментам ваших документов. В связке INT4 + RAG качество ответов соответствует INT8 без RAG, а скорость - в полтора раза выше. Для продакшена возможна конфигурация INT8 + RAG, если критична точность формулировок.
Сервер с моделью физически стоит в вашем машинном зале и не имеет маршрута в интернет. Модель, веса, векторные индексы RAG, журналы запросов - всё хранится и обрабатывается локально. Для работы не нужны внешние API, лицензионные серверы или телеметрия: после установки сетевой кабель наружу можно отключить, и система продолжит работать. RAG-индекс ваших документов также лежит внутри контура - ни один фрагмент корпуса не передаётся наружу для поиска или дообучения.
Никуда за пределы контура. На демо-стенде витрина связана с внешним шлюзом только для публичного показа; в продуктивной поставке запрос обрабатывается локальным инстансом elbrus-llm на Эльбрус. История диалогов хранится в вашей инфраструктуре (или только в браузере пользователя - как в демо ассистента) и никогда не передаётся третьей стороне. RAG-поиск выполняется по локальному векторному индексу, который обновляется только из ваших источников.
Обновления поставляются на физическом носителе через процедуру, согласованную с вашей службой безопасности: пакет с новыми весами или патчем рантайма, контрольные суммы, журнал изменений. Обновление устанавливается офлайн, с возможностью отката на предыдущую версию. Частота обновлений - по договору сопровождения, обычно раз в квартал. RAG-индекс обновляется отдельно и чаще: новые документы добавляются в векторную базу локально, без перезапуска модели.
Архитектура изначально проектировалась под требования защищённых контуров: отсутствие внешних соединений, локальное хранение данных, разграничение доступа на уровне развёртывания. Это существенно упрощает аттестацию. Конкретный состав мер и комплект документации формируется под ваш класс защищённости на этапе внедрения. Отсутствие внешних зависимостей (включая открытые модели и их лицензии) дополнительно снижает риски цепочки поставок.
Задайте вопрос живому ассистенту на базе elbrus-llm или сравните её ответ с зарубежными моделями.