Скачать модель через Discover
Откройте вкладку Discover
Значок лупы на левой панели. Там подборка популярных моделей и поиск.
Найдите модель
Введите название: Qwen, Llama, Gemma, Mistral, DeepSeek.
Выберите вариант
Справа список файлов с разным квантом и размером; LM Studio отмечает, какие поместятся в вашу память.
Нажмите Download
Скачивание идёт в фоне, прогресс виден в панели загрузок.
Как выбрать квант и размер
Размер модели — число параметров: 4–8 млрд работают на обычной игровой видеокарте, 14–32 млрд требуют 16–24 ГБ видеопамяти. Квант — степень сжатия: Q4_K_M считается разумным балансом, Q8 почти не теряет качества, но в два раза тяжелее.
Простое правило: файл модели должен быть меньше объёма видеопамяти с запасом на контекст. Для русского языка лучше других обычно справляются свежие Qwen и Gemma, но до облачных моделей им далеко.
Добавить свой файл GGUF
Если модель скачана вручную с Hugging Face, её можно добавить без повторной загрузки. Файлы моделей LM Studio хранит в папке models внутри .lmstudio в домашнем каталоге; путь виден и меняется во вкладке My Models.
Надёжнее всего импорт командой lms import путь_к_файлу.gguf — утилита lms ставится вместе с программой. При ручном копировании соблюдайте структуру папок «автор/модель/файл.gguf», иначе LM Studio модель не увидит. Поддерживается формат GGUF, а на Mac — ещё MLX.
Запустить модель
Перейдите в чат и откройте загрузчик моделей сверху (Ctrl+L или Cmd+L). Выберите модель, при необходимости раскройте настройки загрузки: выгрузку на GPU и длину контекста. После загрузки можно писать.
Если появляется ошибка нехватки памяти, уменьшите GPU Offload или длину контекста либо возьмите квант полегче. Выгружайте ненужные модели — две загруженные одновременно делят одну видеопамять.
Как отключить thinking
У «думающих» моделей перед ответом идёт блок рассуждений. У моделей с переключаемым режимом в LM Studio рядом с полем ввода есть кнопка размышлений — выключите её. У части моделей режим отключается командой в запросе, например /no_think у Qwen3; если модель обучена только думать, выключить это нельзя — берите обычную версию.
Управление скачанными моделями
Все скачанные модели видны во вкладке My Models. Там же можно удалить ненужные — это освобождает место на диске, — и задать настройки загрузки по умолчанию для каждой модели: выгрузку на GPU, длину контекста, системный промпт.
Системный промпт особенно полезен для русского языка: строка «Всегда отвечай на русском языке, кратко и по делу» заметно сокращает переходы на английский у маленьких моделей. Сохраните её в настройках модели, чтобы не вписывать в каждый чат.
Если скачивание обрывается, его можно продолжить из панели загрузок. Если сайт Hugging Face, откуда LM Studio берёт модели, открывается медленно, скачайте файл GGUF отдельно и импортируйте его, как описано выше.
Когда быстрее через ИИ-агента
Подбирать квант и бороться с памятью имеет смысл, когда нужна приватность или офлайн. Если нужен просто хороший ответ или готовый файл, ИИ-агент LeanTech даёт облачные GPT, Claude, Gemini, DeepSeek и Qwen без скачивания гигабайт. Оплата картой РФ, работает в браузере.
Агент не устанавливает модели на ваш компьютер и не работает без интернета. Генерацию картинок он делает в облаке — LM Studio картинки не рисует вовсе.