Как установить локальную нейросеть на компьютер: выбор софта и железа

Иван Корнев·3 августа 2026·6 мин

Чтобы установить локальную нейросеть на компьютер, скачайте LM Studio или Ollama, выберите модель в формате GGUF с квантованием Q4_K_M и убедитесь, что ваша видеокарта имеет от 8 ГБ VRAM. Это позволит запускать ИИ без интернета со скоростью 30–50 токенов в секунду.

Оглавление

Выбор программного обеспечения

Для запуска локальных нейросетей существует несколько инструментов, различающихся по сложности и функциональности.

LM Studio (для новичков)

Графическое приложение с встроенным поиском моделей, визуальной настройкой параметров и чат-интерфейсом, похожим на привычные веб-чаты. Актуальная версия — 0.4.x.

Как установить:

  1. Скачать с официального сайта lmstudio.ai
  2. Установить программу
  3. В поиске ввести название модели (например, Qwen3 или Llama 3)
  4. Скачать версию с квантованием Q4_K_M
  5. Выбрать модель в чате и начать диалог

При первом запуске обязательно включите режим GPU Offload (передача вычислений на видеокарту) на максимум, иначе модель будет работать очень медленно на процессоре.

Ollama (для продвинутых пользователей)

Инструмент для запуска моделей через терминал. Работает как локальный сервер на порту 11434, принимает OpenAI-совместимые запросы. Актуальная версия — v0.30.4.

Как установить:

  1. Скачать с ollama.com
  2. Запустить установщик
  3. В терминале ввести команду, например: ollama run qwen3:8b

Ollama позволяет подключать сторонние инструменты (Cursor, Open WebUI, Python-скрипты) через API.

Другие варианты

  • Open WebUI: Браузерный интерфейс для Ollama, выглядит как ChatGPT, но работает полностью локально
  • GPT4All: Простая программа для слабых ПК, работает даже без мощной видеокарты (только на CPU)

Требования к железу

Главное правило локальных нейросетей: VRAM (видеопамять) важнее всего. Если модель не помещается в видеопамять целиком, она начинает использовать оперативную память (RAM), что снижает скорость генерации в разы.

Минимальные требования (для старта)

КомпонентТребования
Видеокарта (GPU)NVIDIA с 8 ГБ VRAM (RTX 3060/4060)
Оперативная память (RAM)От 16 ГБ
Процессор (CPU)4–8 ядер (Core i5 / Ryzen 5 и выше)

Что запустится: Компактные модели на 7–8 миллиардов параметров (7B–8B) в сжатом формате. Скорость: 30–50 токенов в секунду (комфортно для чтения).

Рекомендуемые требования (для комфортной работы)

КомпонентТребования
ВидеокартаNVIDIA с 12–16 ГБ VRAM (RTX 3060 12GB, RTX 4070 Ti)
Оперативная память32 ГБ

Что запустится: Модели среднего размера (13B–14B параметров), которые лучше понимают контекст и пишут код.

Профессиональный уровень (для больших моделей)

КомпонентТребования
Видеокарта24 ГБ VRAM и более (RTX 3090/4090, RTX 5090) или несколько видеокарт
Apple MacЧипы M-series (M1/M2/M3/M4 Pro/Max/Ultra) с объединенной памятью

Что запустится: Модели на 32B параметров и выше. Mac с 32–64 ГБ RAM может запускать огромные модели (70B параметров), хотя и медленнее, чем топовые GPU.

Примечание для владельцев AMD: Видеокарты AMD поддерживаются через технологию ROCm, но настройка может быть сложнее, а стабильность ниже, чем у NVIDIA.

Выбор модели нейросети

Не нужно скачивать оригинальные модели весом в сотни гигабайт. Индустрия использует формат GGUF и квантование (сжатие весов с 16 бит до 4 бит). Потеря качества минимальна (1–2%), а требования к памяти падают в 4 раза.

Актуальные модели для 2026 года

  1. Qwen 2.5 / Qwen 3 (7B, 14B, 30B): Лидеры среди открытых моделей. Отлично понимают русский язык, хорошо пишут код. Версия 30B требует около 20–24 ГБ VRAM.

  2. Llama 3.2 (3B, 8B): Ультралегкая модель от Meta. Спасение для старых ноутбуков со слабой графикой.

  3. Llama 3.3 (70B): Флагман для владельцев мощных сборок (от 24 ГБ VRAM). По качеству аналитики сопоставима с платными коммерческими API.

  4. Gemma 4 E4B (Google): Идеальная модель для старта. Весит мало, работает молниеносно, окно контекста — 128 тысяч токенов. Главная фишка: продвинутый режим «рассуждения» (thinking mode).

  5. Mistral Nemo (12B): Хороший баланс между размером и качеством, легко помещается на карты с 12 ГБ VRAM.

  6. DeepSeek: Специализируется на программировании и сложных логических задачах.

  7. Phi-4: Компактная и быстрая модель.

Как выбрать размер модели под свое железо

VRAMРазмер модели
4 ГБ2–4B параметров
6–8 ГБ7B–8B (Qwen 2.5-7B, Llama 3.2-8B)
12 ГБ13B–14B
24 ГБ32B
40–48+ ГБ70B

Пошаговая инструкция установки

Рассмотрим установку на примере LM Studio — самого простого варианта для новичков.

  1. Скачайте программу с официального сайта lmstudio.ai и установите её.

  2. Найдите модель. Откройте программу и перейдите во вкладку поиска моделей (значок лупы). Введите название, например, Qwen 2.5 7B или Gemma 4.

  3. Скачайте правильную версию. В списке результатов выберите версию с пометкой Q4_K_M (это оптимальное сжатие) и нажмите Download. Модель весит около 4–6 ГБ.

  4. Загрузите модель в чат. Перейдите во вкладку чата (значок сообщения). В верхней части окна нажмите «Выберите модель для загрузки» и кликните на скачанный файл.

  5. Настройте GPU Offload (критически важно). В правой панели настроек найдите ползунок GPU Offload (Передача на GPU) и перетащите его вправо до упора (на все слои). Также убедитесь, что включен параметр Flash Attention — он дополнительно ускоряет генерацию.

  6. Запустите модель. Нажмите синюю кнопку «Загрузить модель».

  7. Начните диалог. Скорость генерации должна отображаться внизу (норма — от 15 токенов/сек, оптимум — 30–50 токенов/сек).

Частые ошибки

Не включен GPU Offload

Самая распространенная ошибка. Если ползунок GPU Offload не выкручен на максимум, все вычисления лягут на центральный процессор: скорость упадет до 1–2 слов в секунду, а CPU уйдет в троттлинг от перегрева.

Модель не помещается в VRAM

Если модель слишком велика для видеопамяти, она «выпадает» в оперативную память. RAM медленнее видеопамяти на порядок, поэтому скорость генерации становится непригодной для рабочего использования. Решение: выберите модель меньшего размера или с более сильным квантованием.

Проблемы с видеокартами AMD

Видеокарты AMD поддерживаются через технологию ROCm, но настройка сложнее, а стабильность ниже, чем у NVIDIA. Если возникают ошибки при запуске, попробуйте использовать CPU-режим или переключитесь на NVIDIA.

Использование тега :latest в Ollama

Тег :latest указывает на версию по умолчанию, а не самую мощную. Если хотите конкретное размерное окно, явно указывайте размер, например: qwen3:30b, а не qwen3:latest.

FAQ

Можно ли запустить нейросеть без видеокарты?

Да, но очень медленно. На современном CPU модель выдаёт 2–5 токенов в секунду — это читабельно, но для рабочего использования неудобно. Для комфортной работы нужна видеокарта с минимум 8 ГБ VRAM.

Какая минимальная видеопамять нужна для комфортной работы?

8 ГБ VRAM — минимальный комфортный порог для 2026 года. На нём нормально работают 7–8B-параметровые модели в 4-bit квантизации со скоростью 30–50 токенов в секунду.

Какую модель выбрать для начала?

Для старта рекомендуются:

  • Gemma 4 E4B — самая легкая и быстрая, с режимом рассуждения
  • Qwen 2.5 7B — отлично понимает русский язык
  • Llama 3.2 8B — надежный вариант от Meta

Все эти модели поместятся на видеокарту с 8 ГБ VRAM.

Почему модель работает медленно, хотя VRAM достаточно?

Возможные причины:

  • Не включен GPU Offload (вычисления идут на CPU)
  • Не включен Flash Attention (дополнительное ускорение)
  • Модель частично выгружается в RAM из-за нехватки VRAM
  • Фоновые процессы нагружают систему