Доступ к облачным AI-сервисам зависит от внешнего провайдера, региона и правил конкретной платформы. Цель эксперимента — проверить возможность локального развёртывания модели, практически освоить архитектуру такой системы и создать основу для дальнейшего масштабирования в контролируемом или корпоративном контуре.
Основная ценность: собственная локальная модель снижает зависимость от доступности внешнего провайдера. При полностью локальном workflow содержимое запросов не требуется передавать стороннему облачному AI-сервису — это важно для чувствительных данных и NDA. Это не отменяет необходимости отдельно настроить безопасность сети, доступы и логи.
От оборудования до рабочих сценариев: сервер и GPU → Ollama → локальная модель → Web UI/Continue → n8n
Серверная материнская плата, два процессора Intel Xeon X5660 по 6 ядер / 12 потоков и Nvidia GeForce GTX 1660 Super с 6 ГБ VRAM. Ограниченные ресурсы сделали выбор размера и квантизации модели частью практической задачи.
Протестированы модели семейства Qwen Coder и Llama 3.2 в Q4-квантизации. В рабочем состоянии — Qwen Coder 2.5 7B и Llama 3.2.
Оба варианта проверены на рабочих сценариях. Самостоятельная реализация — инфраструктура собрана и настроена с помощью консультаций AI-ассистента DeepSeek.
Сравнение выделенного сервера и среды разработки на Windows