Гайд по локальным LLM: как запустить DeepSeek и Llama на своем компьютере (аналог ChatGPT)
Запустить современную LLM вроде DeepSeek или Llama на своем компьютере — задача вполне реальная и не требующая подробного руководства. Мы подготовили этот гайд, чтобы помочь вам разобраться с запуском локальной LLM на ПК и ключевыми инструментами — LM Studio и Ollama.
Быстрый запуск локальной LLM за 5 минут
Если вам нужно быстро запустить локальную нейросеть без сложной настройки, используйте один из двух способов.
LM Studio (для новичков)
- Скачайте LM Studio.
- Найдите модель (например, llama-3-8b).
- Нажмите Download — Load Model.
Ollama (через терминал)
Введите команду:
Зачем запускать LLM локально
Прежде чем перейти к техническим деталям, давайте разберемся, зачем это нужно. Локальное развертывание даёт ряд неоспоримых преимуществ:
- Прежде всего, это конфиденциально и безопасно. Все данные находятся на вашем компьютере, никуда не выгружаются, следовательно, не могут быть украдены. Это особенно важно, если вы работаете с личной или корпоративной информацией.
- Модель работает полностью автономно, без постоянного подключения к сети. Это особенно важно, учитывая ограничения сети в России в настоящий момент.
- У вас полный контроль над моделью. Вы можете использовать любые модели, которые считаете подходящими, без ограничений и цензуры.
Выбираем инструмент: LM Studio или Ollama
Перед началом работы нужно выбрать основной инструмент. LM Studio и Ollama — два самых популярных решения для запуска LLM на локальной машине. По сути, они предназначены для разной целевой аудитории.
В LM Studio графически понятный и интуитивный интерфейс. Устанавливается LM Studio через обычный установщик. Предназначена программа для новичков, дизайнеров и исследователей. Поиск и скачивание моделей в LM Studio происходит через магазин с нейросетью Hugging Face. Настройка модели происходит через параметры и ползунки самого интерфейса.
Ollama работает по совсем иным принципам. У Ollama интерфейс представляет собой командную строку, сервис функционирует за счёт автоматизированных скриптов. Устанавливается Ollama через команду в терминале или установщик. Также для установки есть Docker-образ. Ollama особенно хорошо подходит для разработчиков, которые встраивают LLM в свои приложения и скрипты. Всё управление Ollama осуществляется с помощью терминала и команд «ollama pull» и «ollama run». Для настройки моделей в Ollama нужно создавать конфигурационные файлы «Modelfile».
Итог:
- LM Studio — ваш выбор, если вам нужен простой и понятный инструмент, чтобы просто «пообщаться» с нейросетью без погружения в технические детали.
- Ollama — ваш выбор, если вы разработчик и планируете использовать локальную LLM как часть своих программ, скриптов или веб-приложений.
Оценка системных требований
Успех работы локальной LLM напрямую зависит от характеристик вашего компьютера, особенно от объема оперативной памяти (RAM) и видеопамяти (VRAM). Основное правило заключается в том, что модель должна целиком помещаться в вашу память.
Обычно модели по размеру обозначаются цифрой и буквой b. Например, 1b означает, что в модели 1 миллиард параметров. Чем больше цифра, тем более сложные вычисления модель может выполнять, но тем более мощное железо вам необходимо для установки. Среднестатическим вариантом считаются модели 16B-22B.
Вот примерные требования для моделей разного размера:
- Модели 1B-2B требуют минимум 4 ГБ оперативной памяти. На диске занимают 2-4 ГБ Такие модели подходят для простых чатов и лёгкого рерайта.
- Модели 3B-4B требуют минимум 8 ГБ оперативы, а также 3-6 ГБ на общем диске. Подходят для общих вопросов и помощи в написании кода.
- Для моделей 7B-8B нужно минимум 16 ГБ ОЗУ и 5-8 ГБ основного хранилища. Такие модели предлагают хороший баланс между скоростью и качеством.
- Модели 13-14B требуют 32 ГБ ОЗУ и 10-15 ГБ места на диске. Такие модели способны выполнять сложные задачи и заниматься аналитикой.
- Есть также вариант для людей с очень мощным железом — это модели 70B и более. Таких моделей немного, например, из нашумевших — DeepSeek-685B, но такая модель потребует мощного сервера для своей работы. Требуется более 64 ГБ оперативной памяти, 48 ГБ видеопамяти (мультипоток) и 30-80 ГБ на диске.
Если вы хотите запускать LLM на менее мощных устройствах, обратите внимание на параметр квантования модели. Это метод сжатия модели, при котором она занимает меньше места, жертвуя небольшим процентом точности. Версии с 4-битным квантованием — Q4 — представляют собой оптимальный вариант. Они значительно экономят память при минимальной потере качества.
Какие модели выбрать для локального запуска
Если вы не знаете, какую модель скачать, ориентируйтесь на следующие варианты:
- Llama 3 8B — универсальный вариант для чата и задач;
- DeepSeek 7B — хороший вариант для кода и логики;
- Mistral 7B — быстрый и легкий вариант;
- TinyLlama — для слабых ПК.
Пошаговая установка и запуск LM Studio
Сейчас подробно расскажем, как установить и запустить оба сервиса — LM Studio и Ollama. Установка LM Studio проходит просто и понятно даже для новичков благодаря графическому интерфейсу.
Скачивание и установка
Перейдите на официальный сайт модели и скачайте версию для вашей операционной системы: Windows, macOS или Linux. Запустите установщик и следуйте инструкциям. После установки запустите приложение.
Настройка зеркала Hugging Face
LM Studio по умолчанию ищет модели на платформе Hugging Face, доступ к которой ограничен в России и СНГ. Для ускорения работы и надежности рекомендуется настроить зеркало:
- Закройте LM Studio.
- Найдите папку с установленной программой.
- С помощью текстового редактора (например, «Блокнот») откройте нужные файлы с расширением .js.
- Во всех открытых файлах найдите huggingface.co и замените его на hf-mirror.com.
- Сохраните изменения и перезапустите LM Studio.
Поиск и загрузка модели
В левом меню нажмите на значок поиска (лупа) для перехода на вкладку Discover или Model Search. В поисковой строке введите название модели, например, deepseek-r1-distill-qwen-7b или llama-3-8b-instruct. Вы увидите список доступных файлов в формате .gguf. Обратите внимание на колонку с размером файла и степенью квантования, например, Q4_K_M. Нажмите Download для загрузки.
Загрузка модели и начало общения
После загрузки перейдите на вкладку Chat. В выпадающем меню в верхней части экрана выберите загруженную модель. Нажмите кнопку Load Model. Когда модель загрузится в память, вы увидите, что строка состояния стала активной. Теперь можно начинать использование модели.
Пошаговая установка и запуск Ollama
Установка Ollama более сложная, так как требует работы с терминалом или командной строкой, но предлагает больше функций и возможность встроить LLM сразу в сервис.
Установка
Самый простой способ установки для пользователей macOS и Linux — выполнить в терминале одну команду:
curl -fsSL https://ollama.com/install.sh | sh
'''
Для пользователей Windows нужно скачать и запустить установщик .exe с официального сайта. После установки проверьте версию командой ollama --version.
Загрузка и запуск модели
Ollama работает с готовыми образами моделей. Чтобы скачать и сразу запустить модель, выполните команду:
ollama run deepseek-r1:7b
'''
или
ollama run llama3.2
'''
Ollama автоматически загрузит подходящую версию модели и откроет интерактивный чат прямо в терминале. Чтобы просто скачать модель без запуска, используйте команду ollama pull.
API-сервер
После того как вы скачали модель, Ollama автоматически запускает локальный API-сервер, который по умолчанию доступен по адресу http://localhost:11434. Этот сервер совместим с API OpenAI, что позволяет использовать стандартные библиотеки для взаимодействия.
Полезные советы и следующие шаги
У LM Studio и Ollama есть дополнительный функционал, который может быть весьма полезным при использовании. Расскажем о некоторых таких особенностях.
Интеграция с API OpenAI
И LM Studio, и Ollama имеют встроенный сервер, который имитирует API OpenAI. Это позволяет подключать к вашей локальной LLM любые приложения, которые умеют работать с ChatGPT (например, расширения для VS Code, приложения для чата). Для LM Studio порт по умолчанию 1234, для Ollama — 11434.
Графический интерфейс для Ollama
Если вам не нравится работать в терминале, вы можете использовать Ollama с графическими оболочками, такими как Open WebUI или AnythingLLM. Они подключаются к API-серверу Ollama и предоставляют удобный веб-интерфейс.
Использование CPU против GPU
По возможности используйте видеокарту — GPU. Она значительно быстрее обрабатывает запросы. Модели могут работать и на центральном процессоре — CPU, но это будет заметно медленнее.
Возможные проблемы и их решение
В этой части гайда рассмотрим, какие проблемы могут возникать при установке LLM на ваш компьютер и как их решить.
Модель не загружается / мало памяти
Выберите модель с более высоким уровнем квантования (например, Q2 или Q3). Она будет менее точной, но займет меньше памяти. Убедитесь, что у вас закрыты все ресурсоемкие программы.
Ошибка при загрузке GGUF в LM Studio
Убедитесь, что файл модели не поврежден и попробуйте скачать заново. Проверьте, что путь к файлу не содержит символов на кириллице.
Медленная генерация ответов
Это почти всегда упирается в нехватку вычислительных ресурсов. Попробуйте выгрузить модель из памяти и загрузить версию поменьше. Для ускорения работы в LM Studio можно включить GPU offloading и увеличить количество потоков CPU.
Ollama не видит GPU
Убедитесь, что у вас установлены последние драйверы для вашей видеокарты. Ollama должен автоматически их обнаружить. Проверить это можно командой ollama run llama3 --verbose, которая покажет, на каком устройстве запущена модель.
Проблемы с подключением к API
Проверьте, запущен ли сервер: в LM Studio он включается вручную во вкладке Developer. Убедитесь, что порт (1234 или 11434) не блокируется брандмауэром.
Пост создан пользователем
Каждый может создавать посты на VGTimes, это очень просто - попробуйте!-
ИИ-стартап выпустил бесплатную модель Kimi K2.6 — дешевле GPT в 17 раз и конкурирует с лучшими закрытыми моделями -
«Персональный компьютер умер?» Глава Framework объяснил, почему ИИ оставит нас без нормальных PC -
Достаточно просто прикинуться евреем? В сети нашли странный способ обходить ограничения ChatGPT -
Час молчания ИИ — пользователи сообщают о глобальных проблемах с ChatGPT -
Лучшие Палы в Palworld 1.0 — кого ловить для старта, боя, базы и передвижения -
Инкубатор для яиц в Palworld — как построить и вывести Палов -
Как усилить Палов в Palworld — прокачка, конденсация, души и лучшие навыки -
Все боссы в Palworld: где найти, как победить и поймать







