Услуга 06

Ваш ИИ.
Ваша инфраструктура.
Ноль внешней экспозиции.

Большинство агентств запускают ваш ИИ в своём облаке. Мы разворачиваем на вашем сервере — ваши данные никогда не покидают ваш периметр. Создано для бизнесов, где суверенитет данных — не предпочтение, а обязательное требование.

ОБСУДИТЬ ТРЕБОВАНИЯ → ПРИМЕРЫ ПРИМЕНЕНИЯ
Полный суверенитет данных
GDPR-ready by design
Без cloud lock-in
Локальный деплой LLM
Исходный код включён
Проблема с облачным ИИ

Каждый API-вызов отправляет ваши данные
куда-то ещё.

Когда вы используете облачный ИИ-API — OpenAI, Anthropic, Google, Azure — ваши данные уходят в сторонний дата-центр на обработку. Для большинства бизнесов это приемлемый компромисс. Для вашего — возможно, нет.

Клиентские документы, медицинские записи, финансовые данные, юридическая переписка, проприетарные исследования — в момент прохождения через внешний API ваша претензия на суверенитет данных заканчивается. Ваша политика конфиденциальности становится зависимой от политики третьей стороны. Ваш комплаенс определяется их условиями использования, которые могут меняться.

On-premise ИИ устраняет это полностью. Модель работает на вашем железе. Данные никогда не покидают вашу сеть. Инференс происходит внутри вашего периметра — а не их.

Разрыв в производительности между локальными и облачными моделями фактически закрылся для большинства корпоративных сценариев. Mistral, Llama 3 и Qwen объёмом 7B–70B параметров теперь соответствуют GPT-3.5 и приближаются к GPT-4 в большинстве практических задач. Возможности есть. Вопрос — где они работают.

Облачный ИИ — риск для данных
Ваши данные транзитируют и обрабатываются на сторонней инфраструктуре. Подчиняются их политикам хранения данных, запросам со стороны государства и изменениям условий использования. Не подходит для регулируемых категорий данных.
Частное облако / VPC — частичный контроль
Данные остаются в вашем облачном тенанте, но вы по-прежнему зависите от инфраструктуры, ценообразования и доступности облачного провайдера. Суверенитет данных договорной — не технический.
On-Premise — полный суверенитет
Модель, данные и инференс работают на железе, которым вы владеете и управляете. Ноль сторонних зависимостей в любой точке пайплайна. Единственная архитектура, обеспечивающая подлинный, технический — а не договорной — суверенитет данных.
Кому это нужно

Если ваши данные не могут покинуть
ваше здание — позвоните нам первыми.

Сценарий использования определяет архитектуру. Это наиболее распространённые отправные точки — если ваш выглядит иначе, форма заявки это учтёт.

Право · Профессиональные услуги
Document Intelligence и анализ контрактов

Извлечение клаузул, поиск прецедентов, сравнение контрактов и резюмирование due diligence — полностью внутри вашей сети. Обязательства по конфиденциальности клиентов выполняются архитектурой, а не политикой.

Кейс: −71 % времени на проверку документов, 3,5× пропускная способность paralegals. Ни один байт данных не покинул инфраструктуру фирмы.
Здравоохранение · Медицина
Patient Record Intelligence и клиническая поддержка

Анализ клинических записей, помощь с кодированием, резюмирование истории болезни и инструменты диагностической поддержки — данные пациентов никогда не касаются внешнего сервера. Соответствие HIPAA и GDPR обеспечено архитектурой.

Типовой деплой: on-premise RAG по экспортам EHR, локальный инференс, интерфейс для персонала с ролевым доступом.
Финансовые услуги · Банкинг
Transaction Intelligence и автоматизация комплаенса

Анализ паттернов транзакций, обработка KYC-документов, подготовка регуляторных отчётов и поддержка внутреннего аудита — финансовые данные обрабатываются полностью on-premise. Архитектура совместима с PCI DSS и MiFID II.

Типовой деплой: локальная LLM с коннекторами для структурированных данных, никаких внешних API-вызовов ни на каком этапе.
Enterprise · любая отрасль
Внутренняя база знаний и Copilot

ИИ-ассистент, обученный на ваших внутренних документах, данных продукта и корпоративных знаниях — развёрнутый как приватный on-premise copilot для вашей команды. Никакая проприетарная информация никогда не обучает внешнюю модель.

Типовой деплой: RAG по внутренним документам, чат-интерфейс в интранете, аутентификация через Active Directory.
Производство · Операции
Process Intelligence и обнаружение аномалий

Анализ производственных данных, прогнозирование обслуживания, контроль качества и операционная отчётность — производственные данные и IP остаются на вашей инфраструктуре. Доступен air-gapped деплой для критических сред.

Типовой деплой: локальная модель + пайплайн данных с датчиков, без зависимости от интернета для инференса.
Госорганы · Публичный сектор
Суверенный ИИ для государственного управления

Обработка документов, работа с обращениями граждан, анализ политик и внутренние исследовательские инструменты — данные граждан и государственные секреты остаются под контролем суверенной инфраструктуры. Доступен полностью air-gapped деплой.

Типовой деплой: изолированная сеть, локальный model serving, без зависимостей от внешних DNS или CDN.
Технология

Что мы разворачиваем
на вашей инфраструктуре.

Каждый компонент — open-weight, самохостируемый и полностью передаваемый вашей команде. Никаких проприетарных зависимостей runtime.

Уровень 01 — Модели
Локальный LLM Runtime
Mistral 7B / 8×7B (MoE)
Llama 3 (8B / 70B)
Phi-3 / Phi-3.5
Gemma 2 (9B / 27B)
Qwen 2.5 (7B / 72B)
Обслуживается через Ollama / vLLM
Уровень 02 — Ретривал
RAG-пайплайн
LlamaIndex / LangChain
Qdrant / Chroma (local vector DB)
Локальные embedding-модели
PDF, DOCX, структурированные данные
Семантический + keyword-гибрид
Re-ranking-пайплайн
Уровень 03 — Приложение
Интерфейс и API
Node.js / FastAPI бэкенд
React / plain HTML фронтенд
REST API или внутренний SDK
Поддержка SSE-стриминга
Аутентификация Active Directory / SSO
Ролевое управление доступом
Уровень 04 — Операции
Деплой и мониторинг
Docker / Kubernetes
Prometheus + Grafana (локально)
Локальное логирование — без внешнего синка
Версионирование модели и откат
Автоматизированные health-проверки
Полный runbook + передача команде
Инфраструктура

Какое железо
вам реально нужно.

Мы оцениваем вашу существующую инфраструктуру перед любыми рекомендациями. Многие клиенты уже имеют достаточное железо. Новые инвестиции нужны реже, чем принято считать.

Tier 1 — Начальный
Одна GPU среднего класса

6–8 ГБ VRAM (RTX 3090, RTX 4080, A10G). Достаточно для моделей 7B параметров при 4-битной квантизации. Справляется с умеренным числом параллельных пользователей и рабочими нагрузками масштаба документов.

Runs: Mistral 7B · Llama 3 8B · Phi-3 · Gemma 2 9B
Tier 2 — Продакшн
Двойная GPU или класс A100

24–48 ГБ VRAM (2× RTX 4090, A100 40 ГБ, L40S). Поддерживает модели 13B–34B в полной точности или 70B с квантизацией. Корпоративная пропускная способность, низкая задержка, многопользовательская параллельность.

Runs: Llama 3 70B (Q4) · Qwen 72B (Q4) · Mistral 8×7B
Tier 3 — Высокая пропускная способность
Многопроцессорный GPU-сервер или CPU-кластер

80+ ГБ VRAM (A100 80 ГБ, H100) или CPU-сервер с большим объёмом RAM (256+ ГБ). Модели 70B в полной точности, высококонкурентные продакшн-нагрузки или air-gapped среды без GPU.

Runs: Any model at full precision · Custom fine-tuned models

Оценка железа входит в каждый контракт. Сначала исходим из вашей существующей инфраструктуры — новое оборудование рекомендуется только тогда, когда сценарий использования действительно требует этого.

Как мы разворачиваем

От аудита инфраструктуры
до рабочей системы.

01 — ОЦЕНКА

Инфраструктура и требования

Аудируем ваше существующее железо, сетевую архитектуру и требования комплаенса. Выбор модели и дизайн стека следуют из того, что у вас уже есть, — а не из стандартного шаблона.

02 — АРХИТЕКТУРА

Дизайн системы

Полный документ архитектуры: выбор модели, стратегия квантизации, дизайн RAG-пайплайна, аутентификация, мониторинг и топология деплоя. Утверждается до написания единой строки кода.

03 — РАЗРАБОТКА

Разработка и тестирование

Строим и тестируем систему в staging-среде, зеркалирующей вашу продакшн-инфраструктуру. Бенчмарки производительности, нагрузочное тестирование и security review завершаются до деплоя.

04 — DEPLOY

On-Premise-установка

Контейнеризованный деплой непосредственно на вашу инфраструктуру. После передачи никакого удалённого доступа не остаётся. Полная установка выполняется вашей командой по нашему runbook или нашей командой на месте.

05 — ПЕРЕДАЧА

Документация и обучение

Полная техническая документация, операционный runbook и обучение команды. Ваша команда может самостоятельно обслуживать, обновлять и расширять систему. Исходный код передаётся в полном объёме по завершении.

FAQ

On-Premise-ИИ —
Вопросы.

Что означает on-premise деплой ИИ?
On-premise деплой ИИ означает, что вся ИИ-система — модель, движок инференса, пайплайн данных и прикладной уровень — работает на серверах, которыми вы владеете и управляете. Никакие данные не отправляются в OpenAI, Anthropic, Google или любой другой сторонний API. Каждый инференс происходит внутри сетевого периметра. Это единственная архитектура, обеспечивающая подлинный суверенитет данных.
В каких отраслях требуется on-premise деплой ИИ?
Отрасли с регуляторными, договорными или репутационными требованиями к суверенитету данных включают: юридические услуги (конфиденциальность клиентов), здравоохранение и медицину (данные пациентов, HIPAA), финансовые услуги и банкинг (PCI DSS, MiFID II), государственные и публичные структуры, оборону и критическую инфраструктуру, а также любой бизнес, обрабатывающий чувствительные персональные данные по GDPR. Всё чаще корпоративные компании с проприетарными данными также требуют on-premise деплоя для защиты конкурентного преимущества.
Какие локальные LLM-модели вы разворачиваете?
Мы разворачиваем квантизированные open-weight модели, подходящие к железу и сценарию использования клиента. Среди часто используемых: Mistral 7B и 8×7B, Llama 3 (8B и 70B), Phi-3, Gemma 2 и Qwen 2.5. Выбор модели определяется анализом компромисса производительность/железо, который мы проводим на этапе аудита. Мы не рекомендуем модель до понимания вашей инфраструктуры и требований к нагрузке.
Какое железо нужно для on-premise ИИ?
Требования зависят от размера модели и нагрузки. Модель на 7B параметров при 4-битной квантизации требует около 6–8 ГБ VRAM — достаточно одной GPU среднего класса. Модель 70B требует 40–48 ГБ VRAM. Для инференса только на CPU, 32–64 ГБ RAM поддерживает модели 7B при меньшей пропускной способности. Сначала оцениваем вашу существующую инфраструктуру — у многих клиентов уже есть железо, достаточное для продакшн-уровня on-premise ИИ без новых капитальных вложений.
Сколько времени занимает on-premise деплой ИИ?
Стандартный on-premise RAG-пайплайн или система document intelligence разворачивается за 4–6 недель. Более сложные агентные системы — за 6–10 недель. On-premise деплой добавляет примерно 1–2 недели к сопоставимым облачным срокам — прежде всего на оценку инфраструктуры, квантизацию модели и контейнеризацию. Все сроки согласуются письменно до начала работы.
Сохраняете ли вы доступ к нашей системе после деплоя?
Нет. После передачи мы не сохраняем никакого доступа к вашей инфраструктуре, модели или данным. Весь исходный код, конфигурационные файлы и учётные данные передаются вам в полном объёме. Наше участие заканчивается по вашей инструкции. По умолчанию это не управляемый сервис — хотя мы предлагаем опциональные support-ретейнеры для клиентов, которым это нужно.
ASYNC FIRST — Без созвона
Бесплатная оценка инфраструктуры

Скажите нам,
что не может покинуть ваше здание.

Опишите ваш сценарий использования и ограничения инфраструктуры. Вернёмся с персонализированной рекомендацией по архитектуре и оценкой реализуемости в течение 48 часов.

Senior AI engineer рассмотрит запрос в течение 48 часов. Рекомендация по архитектуре включена. Без обязательств.