Первый в России сайт с полным циклом ИИСмотрите презентацию ИИ-сайта продажСайт, которым полностью управляет ИИКонтент, реклама, лиды и аналитика — на автопилоте

Локальная LLM

Локальная LLM: ИИ, который работает внутри вашего контура

Сотрудники уже пользуются ИИ — лично, через VPN, мимо компании. Локальная модель даёт им тот же инструмент, но данные физически не выходят наружу, и это проверяется, а не берётся на веру.

Подробнее
0
запросов наружу: сервер не ходит в интернет
3-4 нед
от готовности сервера до рабочей системы
14B
модель, которой хватает для офисных задач
от 10 900 ₽
аренда сервера с видеокартой в месяц

/ Что делаем

Что входит в развёртывание

01

Подбор модели под задачу

Выбираем архитектуру (Qwen, Llama, Saiga) и размерность (7B, 14B, 32B) исходя из доступного VRAM. Подбираем оптимальное квантование (например, Q4), чтобы модель занимала 10–12 ГБ и при этом эффективно выполняла суммаризацию, извлечение сущностей и написание писем, не перегружая оборудование.

02

Конфигурация железа

Рассчитываем спецификации сервера под вашу нагрузку: от видеокарт с 16 ГБ до мощных решений на 48 ГБ и выше, а также объем системной памяти и скорость NVMe. Вы получаете готовый перечень комплектующих, который исключает простои из-за нехватки видеопамяти при одновременной работе нескольких сотрудников.

03

Контур безопасности

Исключаем утечку данных через публичные API. Настраиваем сетевой экран так, чтобы трафик не уходил во внешнюю сеть, кроме разрешенных адресов. Это снимает риски компрометации персональных данных, финансовых отчетов и коммерческой тайны, так как все вычисления происходят внутри вашего периметра.

04

Ваши документы в базе знаний

Внедряем RAG-архитектуру: загружаем ваши регламенты, инструкции и НПА в векторную базу данных. Модель ищет ответы по смыслу в ваших файлах и выдает результат со ссылкой на конкретный документ. Это решает проблему галлюцинаций ИИ: нейросеть опирается только на ваши проверенные данные.

05

Интерфейс внутри Битрикс24

Интегрируем ИИ-помощника непосредственно в ваш портал в виде виджета или приложения. Сотрудникам не нужно переключаться между окнами и осваивать новый софт. Мы настраиваем права доступа, чтобы каждый пользователь видел только те данные, которые ему разрешены в вашей текущей системе прав.

06

Сопровождение

Обеспечиваем техническую поддержку: обновление базы знаний, дообучение модели под новые задачи и плановое обновление версий весов. Мы берем на себя контроль качества ответов и исправление ошибок, чтобы ИИ-инструмент работал стабильно и не требовал постоянного внимания ваших системных администраторов.

/ Что даёт внедрение

Как меняется работа

Было
  • Сотрудники носят данные в ChatGPT через VPN
  • Служба безопасности запретила ИИ совсем
  • За каждый запрос в облако платите отдельно
  • Вендор обещает не смотреть ваши данные
Стало
  • Свой инструмент внутри контура, VPN не нужен
  • Изоляция проверяется сетевым дампом
  • Фиксированная цена, лимитов на запросы нет
  • Проверяете сами, а не верите на слово

Изоляция обеспечивается не обещанием вендора, а настройкой firewall на вашей стороне. Исходящий трафик закрыт — значит, сервер не отправит ничего никуда.

Как мы объясняем это службе безопасности

/ Как мы работаем

Что вы получаете, кроме кода

Начинаем с пилота

Сначала小 пилот на вашем участке и замер результата, потом масштабирование. Вы платите за расширение только когда увидели эффект.

Данные остаются у вас

Разворачиваем в вашем контуре или на вашем аккаунте. Модели и промпты передаём — решение не привязано к нам.

Показываем метрику, а не демо

Договариваемся, что считаем успехом, и меряем: время обработки, конверсия, доля автоматики.

Сопровождаем после запуска

ИИ-решение требует подстройки под реальные данные — берём это на себя по договору.

/ Как внедряем

От данных к решению

01

Разбираем задачи и данные

Проводим аудит бизнес-процессов, чтобы понять, где ИИ принесет максимальный профит. Мы анализируем характер данных и объем запросов. Если задачи решаются дешевле через облачные API без риска утечки, мы прямо скажем об этом, чтобы вы не тратили бюджет на избыточное локальное железо.

02

Считаем модель и железо

Проводим расчеты: подбираем размер модели под ваши задачи и рассчитываем необходимый объем видеопамяти. Сравниваем экономику владения (CapEx) с арендой облачных мощностей (OpEx). На выходе вы получаете обоснованную смету, где стоимость владения ИИ-инфраструктурой привязана к реальным нагрузкам.

03

Разворачиваем и изолируем

Выполняем установку ПО, настройку firewall и разграничение прав доступа. Проводим нагрузочное тестирование на ваших реальных запросах, чтобы убедиться, что система не «падает» при одновременной работе отдела продаж или юридического департамента. Вы получаете полностью изолированную рабочую среду.

04

Обучаем и передаём

Проводим воркшопы для сотрудников по работе с промптами и передаем техническую документацию вашему ИТ-отделу. Вы получаете не просто установленный софт, а готовую к эксплуатации систему с понятными инструкциями по эксплуатации и регламентами поддержки.

Посчитаем локальную LLM под вашу задачу

Расскажите, какие данные нельзя отдавать наружу и сколько человек будут пользоваться — вернёмся с конфигурацией и сметой.

/ FAQ

Частые вопросы

Чем локальная LLM отличается от ChatGPT или Битрикс Coworker?

Местом, где живут данные. В облаке вы верите политике вендора, у локальной модели проверяете сами: снимаете сетевой дамп и видите, что исходящих соединений нет. Плюс фиксированная цена вместо оплаты за каждый запрос.

Какая модель нужна для офисных задач?

Обычно 14B: её хватает на сводки, письма, разбор документов и составление ТЗ. Модель 7-8B справляется только с простым переписыванием текста, а 32B и выше нужны для сложного анализа длинных регламентов.

Сколько стоит сервер?

Аренда видеокарты 16 ГБ в российском ЦОД — от 10 900 ₽ в месяц, карта 24 ГБ дороже примерно вдвое. Покупка своего сервера обойдётся в 1,3-1,8 млн ₽ единовременно и окупается около десяти лет, поэтому её выбирают только по требованию безопасности.

Модель будет знать свежие данные?

Знания самой модели зафиксированы на момент выпуска, но для рабочих задач это неважно: она работает с вашими документами, а не с памятью. Если нужны внешние данные, делаем отдельный канал с одним разрешённым адресом — наружу уходит только текст запроса.

Локальная модель врёт меньше?

Нет, выдумывать может любая модель. Снижается это не выбором модели, а тем, что ответ строится по вашим документам со ссылкой на источник — тогда проверка занимает секунды.

Сколько людей смогут работать одновременно?

Карта 16 ГБ тянет 2-3 параллельных запроса, 48 ГБ — до пяти. При 15 активных пользователях запросы встают в очередь на секунды: для офисных задач это нормально, для чат-бота на сайте — нет.

/ Смотрите также

/ Поехали

Обсудим локальную LLM

Расскажите про данные и задачи — предложим модель, конфигурацию сервера и смету.

+7 (495) 320-10-00