Большинство агентств запускают ваш ИИ в своём облаке. Мы разворачиваем на вашем сервере — ваши данные никогда не покидают ваш периметр. Создано для бизнесов, где суверенитет данных — не предпочтение, а обязательное требование.
Когда вы используете облачный ИИ-API — OpenAI, Anthropic, Google, Azure — ваши данные уходят в сторонний дата-центр на обработку. Для большинства бизнесов это приемлемый компромисс. Для вашего — возможно, нет.
Клиентские документы, медицинские записи, финансовые данные, юридическая переписка, проприетарные исследования — в момент прохождения через внешний API ваша претензия на суверенитет данных заканчивается. Ваша политика конфиденциальности становится зависимой от политики третьей стороны. Ваш комплаенс определяется их условиями использования, которые могут меняться.
On-premise ИИ устраняет это полностью. Модель работает на вашем железе. Данные никогда не покидают вашу сеть. Инференс происходит внутри вашего периметра — а не их.
Разрыв в производительности между локальными и облачными моделями фактически закрылся для большинства корпоративных сценариев. Mistral, Llama 3 и Qwen объёмом 7B–70B параметров теперь соответствуют GPT-3.5 и приближаются к GPT-4 в большинстве практических задач. Возможности есть. Вопрос — где они работают.
Сценарий использования определяет архитектуру. Это наиболее распространённые отправные точки — если ваш выглядит иначе, форма заявки это учтёт.
Извлечение клаузул, поиск прецедентов, сравнение контрактов и резюмирование due diligence — полностью внутри вашей сети. Обязательства по конфиденциальности клиентов выполняются архитектурой, а не политикой.
Анализ клинических записей, помощь с кодированием, резюмирование истории болезни и инструменты диагностической поддержки — данные пациентов никогда не касаются внешнего сервера. Соответствие HIPAA и GDPR обеспечено архитектурой.
Анализ паттернов транзакций, обработка KYC-документов, подготовка регуляторных отчётов и поддержка внутреннего аудита — финансовые данные обрабатываются полностью on-premise. Архитектура совместима с PCI DSS и MiFID II.
ИИ-ассистент, обученный на ваших внутренних документах, данных продукта и корпоративных знаниях — развёрнутый как приватный on-premise copilot для вашей команды. Никакая проприетарная информация никогда не обучает внешнюю модель.
Анализ производственных данных, прогнозирование обслуживания, контроль качества и операционная отчётность — производственные данные и IP остаются на вашей инфраструктуре. Доступен air-gapped деплой для критических сред.
Обработка документов, работа с обращениями граждан, анализ политик и внутренние исследовательские инструменты — данные граждан и государственные секреты остаются под контролем суверенной инфраструктуры. Доступен полностью air-gapped деплой.
Каждый компонент — open-weight, самохостируемый и полностью передаваемый вашей команде. Никаких проприетарных зависимостей runtime.
Мы оцениваем вашу существующую инфраструктуру перед любыми рекомендациями. Многие клиенты уже имеют достаточное железо. Новые инвестиции нужны реже, чем принято считать.
6–8 ГБ VRAM (RTX 3090, RTX 4080, A10G). Достаточно для моделей 7B параметров при 4-битной квантизации. Справляется с умеренным числом параллельных пользователей и рабочими нагрузками масштаба документов.
24–48 ГБ VRAM (2× RTX 4090, A100 40 ГБ, L40S). Поддерживает модели 13B–34B в полной точности или 70B с квантизацией. Корпоративная пропускная способность, низкая задержка, многопользовательская параллельность.
80+ ГБ VRAM (A100 80 ГБ, H100) или CPU-сервер с большим объёмом RAM (256+ ГБ). Модели 70B в полной точности, высококонкурентные продакшн-нагрузки или air-gapped среды без GPU.
Оценка железа входит в каждый контракт. Сначала исходим из вашей существующей инфраструктуры — новое оборудование рекомендуется только тогда, когда сценарий использования действительно требует этого.
Аудируем ваше существующее железо, сетевую архитектуру и требования комплаенса. Выбор модели и дизайн стека следуют из того, что у вас уже есть, — а не из стандартного шаблона.
Полный документ архитектуры: выбор модели, стратегия квантизации, дизайн RAG-пайплайна, аутентификация, мониторинг и топология деплоя. Утверждается до написания единой строки кода.
Строим и тестируем систему в staging-среде, зеркалирующей вашу продакшн-инфраструктуру. Бенчмарки производительности, нагрузочное тестирование и security review завершаются до деплоя.
Контейнеризованный деплой непосредственно на вашу инфраструктуру. После передачи никакого удалённого доступа не остаётся. Полная установка выполняется вашей командой по нашему runbook или нашей командой на месте.
Полная техническая документация, операционный runbook и обучение команды. Ваша команда может самостоятельно обслуживать, обновлять и расширять систему. Исходный код передаётся в полном объёме по завершении.
Опишите ваш сценарий использования и ограничения инфраструктуры. Вернёмся с персонализированной рекомендацией по архитектуре и оценкой реализуемости в течение 48 часов.