Гайд по локальным LLM: как запустить DeepSeek и Llama на своем компьютере (аналог ChatGPT)

Гайд по локальным LLM: как запустить DeepSeek и Llama на своем компьютере (аналог ChatGPT)

KKlingen
12 апреля 2026, 21:02

Запустить современную LLM вроде DeepSeek или Llama на своем компьютере — задача вполне реальная и не требующая подробного руководства. Мы подготовили этот гайд, чтобы помочь вам разобраться с запуском локальной LLM на ПК и ключевыми инструментами — LM Studio и Ollama.

Быстрый запуск локальной LLM за 5 минут

Если вам нужно быстро запустить локальную нейросеть без сложной настройки, используйте один из двух способов.

LM Studio (для новичков)

  1. Скачайте LM Studio.
  2. Найдите модель (например, llama-3-8b).
  3. Нажмите Download — Load Model.

Ollama (через терминал)

Введите команду:

ollama run llama3

Зачем запускать LLM локально

Прежде чем перейти к техническим деталям, давайте разберемся, зачем это нужно. Локальное развертывание даёт ряд неоспоримых преимуществ:

  1. Прежде всего, это конфиденциально и безопасно. Все данные находятся на вашем компьютере, никуда не выгружаются, следовательно, не могут быть украдены. Это особенно важно, если вы работаете с личной или корпоративной информацией.
  2. Модель работает полностью автономно, без постоянного подключения к сети. Это особенно важно, учитывая ограничения сети в России в настоящий момент.
  3. У вас полный контроль над моделью. Вы можете использовать любые модели, которые считаете подходящими, без ограничений и цензуры.

Выбираем инструмент: LM Studio или Ollama

Перед началом работы нужно выбрать основной инструмент. LM Studio и Ollama — два самых популярных решения для запуска LLM на локальной машине. По сути, они предназначены для разной целевой аудитории.

В LM Studio графически понятный и интуитивный интерфейс. Устанавливается LM Studio через обычный установщик. Предназначена программа для новичков, дизайнеров и исследователей. Поиск и скачивание моделей в LM Studio происходит через магазин с нейросетью Hugging Face. Настройка модели происходит через параметры и ползунки самого интерфейса.

Сайт LM Studio
Сайт LM Studio

Ollama работает по совсем иным принципам. У Ollama интерфейс представляет собой командную строку, сервис функционирует за счёт автоматизированных скриптов. Устанавливается Ollama через команду в терминале или установщик. Также для установки есть Docker-образ. Ollama особенно хорошо подходит для разработчиков, которые встраивают LLM в свои приложения и скрипты. Всё управление Ollama осуществляется с помощью терминала и команд «ollama pull» и «ollama run». Для настройки моделей в Ollama нужно создавать конфигурационные файлы «Modelfile».

Сайт Ollama
Сайт Ollama

Итог:

  • LM Studio — ваш выбор, если вам нужен простой и понятный инструмент, чтобы просто «пообщаться» с нейросетью без погружения в технические детали.
  • Ollama — ваш выбор, если вы разработчик и планируете использовать локальную LLM как часть своих программ, скриптов или веб-приложений.

Оценка системных требований

Успех работы локальной LLM напрямую зависит от характеристик вашего компьютера, особенно от объема оперативной памяти (RAM) и видеопамяти (VRAM). Основное правило заключается в том, что модель должна целиком помещаться в вашу память.

Обычно модели по размеру обозначаются цифрой и буквой b. Например, 1b означает, что в модели 1 миллиард параметров. Чем больше цифра, тем более сложные вычисления модель может выполнять, но тем более мощное железо вам необходимо для установки. Среднестатическим вариантом считаются модели 16B-22B.

Вот примерные требования для моделей разного размера:

  • Модели 1B-2B требуют минимум 4 ГБ оперативной памяти. На диске занимают 2-4 ГБ Такие модели подходят для простых чатов и лёгкого рерайта.
  • Модели 3B-4B требуют минимум 8 ГБ оперативы, а также 3-6 ГБ на общем диске. Подходят для общих вопросов и помощи в написании кода.
  • Для моделей 7B-8B нужно минимум 16 ГБ ОЗУ и 5-8 ГБ основного хранилища. Такие модели предлагают хороший баланс между скоростью и качеством.
  • Модели 13-14B требуют 32 ГБ ОЗУ и 10-15 ГБ места на диске. Такие модели способны выполнять сложные задачи и заниматься аналитикой.
  • Есть также вариант для людей с очень мощным железом — это модели 70B и более. Таких моделей немного, например, из нашумевших — DeepSeek-685B, но такая модель потребует мощного сервера для своей работы. Требуется более 64 ГБ оперативной памяти, 48 ГБ видеопамяти (мультипоток) и 30-80 ГБ на диске.

Если вы хотите запускать LLM на менее мощных устройствах, обратите внимание на параметр квантования модели. Это метод сжатия модели, при котором она занимает меньше места, жертвуя небольшим процентом точности. Версии с 4-битным квантованием — Q4 — представляют собой оптимальный вариант. Они значительно экономят память при минимальной потере качества.

Какие модели выбрать для локального запуска

Если вы не знаете, какую модель скачать, ориентируйтесь на следующие варианты:

  • Llama 3 8B — универсальный вариант для чата и задач;
  • DeepSeek 7B — хороший вариант для кода и логики;
  • Mistral 7B — быстрый и легкий вариант;
  • TinyLlama — для слабых ПК.

Пошаговая установка и запуск LM Studio

Сейчас подробно расскажем, как установить и запустить оба сервиса — LM Studio и Ollama. Установка LM Studio проходит просто и понятно даже для новичков благодаря графическому интерфейсу.

Скачивание и установка

Перейдите на официальный сайт модели и скачайте версию для вашей операционной системы: Windows, macOS или Linux. Запустите установщик и следуйте инструкциям. После установки запустите приложение.

Окно скачивания LM Studio на Mac
Окно скачивания LM Studio на Mac

Настройка зеркала Hugging Face

LM Studio по умолчанию ищет модели на платформе Hugging Face, доступ к которой ограничен в России и СНГ. Для ускорения работы и надежности рекомендуется настроить зеркало:

  1. Закройте LM Studio.
  2. Найдите папку с установленной программой.
  3. С помощью текстового редактора (например, «Блокнот») откройте нужные файлы с расширением .js.
  4. Во всех открытых файлах найдите huggingface.co и замените его на hf-mirror.com.
  5. Сохраните изменения и перезапустите LM Studio.
Интерфейс Hugging Face
Интерфейс Hugging Face

Поиск и загрузка модели

В левом меню нажмите на значок поиска (лупа) для перехода на вкладку Discover или Model Search. В поисковой строке введите название модели, например, deepseek-r1-distill-qwen-7b или llama-3-8b-instruct. Вы увидите список доступных файлов в формате .gguf. Обратите внимание на колонку с размером файла и степенью квантования, например, Q4_K_M. Нажмите Download для загрузки.

Окно поиска модели в LM Studio
Окно поиска модели в LM Studio

Загрузка модели и начало общения

После загрузки перейдите на вкладку Chat. В выпадающем меню в верхней части экрана выберите загруженную модель. Нажмите кнопку Load Model. Когда модель загрузится в память, вы увидите, что строка состояния стала активной. Теперь можно начинать использование модели.

Интерфейс LM Studio
Интерфейс LM Studio

Пошаговая установка и запуск Ollama

Установка Ollama более сложная, так как требует работы с терминалом или командной строкой, но предлагает больше функций и возможность встроить LLM сразу в сервис.

Установка

Самый простой способ установки для пользователей macOS и Linux — выполнить в терминале одну команду:

'''bash
curl -fsSL https://ollama.com/install.sh | sh
'''

Для пользователей Windows нужно скачать и запустить установщик .exe с официального сайта. После установки проверьте версию командой ollama --version.

Окно загрузки Ollama на Windows
Окно загрузки Ollama на Windows

Загрузка и запуск модели

Ollama работает с готовыми образами моделей. Чтобы скачать и сразу запустить модель, выполните команду:

'''bash
ollama run deepseek-r1:7b
'''

или

'''bash
ollama run llama3.2
'''

Ollama автоматически загрузит подходящую версию модели и откроет интерактивный чат прямо в терминале. Чтобы просто скачать модель без запуска, используйте команду ollama pull.

API-сервер

После того как вы скачали модель, Ollama автоматически запускает локальный API-сервер, который по умолчанию доступен по адресу http://localhost:11434. Этот сервер совместим с API OpenAI, что позволяет использовать стандартные библиотеки для взаимодействия.

Полезные советы и следующие шаги

У LM Studio и Ollama есть дополнительный функционал, который может быть весьма полезным при использовании. Расскажем о некоторых таких особенностях.

Интеграция с API OpenAI

И LM Studio, и Ollama имеют встроенный сервер, который имитирует API OpenAI. Это позволяет подключать к вашей локальной LLM любые приложения, которые умеют работать с ChatGPT (например, расширения для VS Code, приложения для чата). Для LM Studio порт по умолчанию 1234, для Ollama — 11434.

Графический интерфейс для Ollama

Если вам не нравится работать в терминале, вы можете использовать Ollama с графическими оболочками, такими как Open WebUI или AnythingLLM. Они подключаются к API-серверу Ollama и предоставляют удобный веб-интерфейс.

AnythingLLM
AnythingLLM

Использование CPU против GPU

По возможности используйте видеокарту — GPU. Она значительно быстрее обрабатывает запросы. Модели могут работать и на центральном процессоре — CPU, но это будет заметно медленнее.

Возможные проблемы и их решение

В этой части гайда рассмотрим, какие проблемы могут возникать при установке LLM на ваш компьютер и как их решить.

Модель не загружается / мало памяти

Выберите модель с более высоким уровнем квантования (например, Q2 или Q3). Она будет менее точной, но займет меньше памяти. Убедитесь, что у вас закрыты все ресурсоемкие программы.

Ошибка при загрузке GGUF в LM Studio

Убедитесь, что файл модели не поврежден и попробуйте скачать заново. Проверьте, что путь к файлу не содержит символов на кириллице.

Медленная генерация ответов

Это почти всегда упирается в нехватку вычислительных ресурсов. Попробуйте выгрузить модель из памяти и загрузить версию поменьше. Для ускорения работы в LM Studio можно включить GPU offloading и увеличить количество потоков CPU.

Ollama не видит GPU

Убедитесь, что у вас установлены последние драйверы для вашей видеокарты. Ollama должен автоматически их обнаружить. Проверить это можно командой ollama run llama3 --verbose, которая покажет, на каком устройстве запущена модель.

Проблемы с подключением к API

Проверьте, запущен ли сервер: в LM Studio он включается вручную во вкладке Developer. Убедитесь, что порт (1234 или 11434) не блокируется брандмауэром.

    Пост создан пользователем

    Каждый может создавать посты на VGTimes, это очень просто - попробуйте!
    Понравился пост? Подпишитесь на автора, чтобы не пропустить новые публикации Подписаться Вы подписаны
    Об авторе
    Комментарии0