Possivelmente você já deve ter visto alguns tutoriais de como utilizar o LM Studio por aí. E o que esse tutorial tem de diferente dos outros? E eu já te digo de antemão, a diferença é que esse é escrito por mim (😁), até porque hoje em dia voce pode perguntar isso para o CHATGPT e ele possivelmente vai te responder mais rápido do que eu.
Mas a ideia é que nós — tanto eu quanto você — possamos aprender um pouco sobre como usar a ferramenta de LLM’s localmente e entender o funcionamento básico do sistema.
Primeiro de tudo, você deve baixar o LMStudio. Ao acessar o site do LM Studio, você verá o Download para a plataforma que você está utilizando.
Depois que você baixou o LM Studio, você deve ver uma tela parecida com essa imagem:

Agora, você pode clicar na Lupa na lateral esquerda do seu LM Studio, em Discover.

Aqui você já pode escolher seu modelo. Mas antes de fazer isso, algo importante para que você use o LM Studio em sua melhor forma possível, é saber qual modelo você consegue executar em sua máquina.
Dois pontos importantes que você tem que verificar:
1- O tamanho do modelo, ou seja a quantidade de parâmetros que ele tem
2- A quantidade de VRAM que você tem na sua máquina.
3- A quantização do modelo ( quantos bits por peso, por exemplo. Q4 = ≈4 bits; Q6 = ≈6 bits). Quanto menos bits, menos VRAM, mas também você perde qualidade.
Por exemplo, em minha configuração eu utilizo uma Placa de Vídeo da AMD com 16 GB de VRAM. Já dá para fazer algumas coisas legais, mas eu não consigo executar um modelo mais recente do LLAMA Scout sem ter um gargalo considerável e ter que aguardar respostas com mais de 5 minutos. A conta é é aproximadamente 0,75 GB de VRAM para 1B de parâmetros (para modelos Q4/Q5; em fp16 a conta sobe para ~2 GB/B). Mas para facilitar sua vida, segue uma lista de modelos para o computador que você tem.
Sem Placa de Vídeo:
Menos de 4 GB de RAM: **TinyLlama-1.1B-Q4/ SmolVLM-256M-Q4
**8 a 16 GB de RAM: Phi-3-mini-2.7B-Q4, Gemma-2B-Q4
Com Placa de Vídeo:
4 GB de VRAM: Mistral-7B-Instruct-Q4_K_M
8 GB de VRAM: **Llama-3–8B-Q5_K_M
**16 GB de VRAM: Llama-3–8B-fp16, Llama-2–13B-Q5_K_M
Acima de 16 GB de VRAM você tem muito mais possibilidades, lembrando também que os modelos de LLMS, Difussions foram em sua grande maioria treinados com o CUDA, dito isso, eles tendem a funcionar melhor em placas da NVIDIA. A minha atualmente roda o QWEN30BA3B, é um modelo bem interessante, mas já dá gargalo mesmo com 64 GB de RAM e 16 GB de Vídeo!
Vou considerar que se você chegou até aqui, quer dizer que já escolheu seu modelo, então vamos para a parte de Runtime. Alguns dos “Runtime Extension Packs” já vem instalado por padrão quando você instala seu LM Studio. Da experiência que eu tive, para a AMD sempre use o ROCM(Nem sempre para o Windows viu). Oferece desempenho superior em placas da AMD, já para NVIDIA use o CUDA. Sempre utilize a última versão.

Ponto Importante: O Linux performa muito melhor que o Windows. Então saiba que ao usar o sistema do Bill Gates, você vai precisar de mais VRAM para executar algo no Linux.
Beleza, você já escolheu o modelo, já definiu o modo de execução, vale dar um Check na guia de Hardware.

Essas são as configurações do meu computador atual, quanto mais VRAM maior a capacidade dos modelos. A única configuração importante é o GuardRails. É interessante você selecionar a opção que se encaixe melhor no seu padrão, lembrando que se você escolher a opção off(desligado), existe a possibilidade de você travar seu computador, pela quantidade de VRAM utilizada no modelo.

Perfeito, você já tem todas as configurações, a partir de agora você já pode fazer alguns testes na sua máquina na tela de Chat! Só clicar em selecionar o seu modelo. Importante, se você quiser usar as APIS do LM Studio, deixe habilitado o modo Developer na sua barra inferior.

Temos também o System Prompt, que vai ficar na sua barra superior esquerda, que vai servir de base de como você quer que sua LLM funcione.

Agora você já consegue rodar o seu LLM, mas e se você quiser otimizar os parâmetros do seu modelo, como você pode fazer isso?
Existem duas opções:
Toda vez que você carregar o modelo, você vai alterar esses parâmetros.
Você deixa a configuração já preparada para isso.
Para o primeiro caso, ao selecionar o modelo vai aparecer para você a opção de “Selecionar Manualmente os Parâmetros do Modelo”, já o Segundo após selecionar o modelo, clique na engrenagem do lado do modelo carregado. Você verá uma tela assim:

Perfeito, mas o você deve estar se perguntando, o que significa esses parâmetros?(está, não está?) Vamos a uma breve explicação de cada um deles.
Context Length (Janela de Contexto) : Define quantos tokens cabem no prompt + a resposta do LLM antes do modelo começar a alucinar/esquecer.
Cada modelo tem uma quantidade especifica, o modelo que está carregado consegue até 32000 Tokens. O LLAMA 4 até 1Bilhão. Lembrando que quanto mais Tokens, mais VRAM você consome
GPU Offload: Quantas camadas de pesos do modelo ficarão na GPU (Graphical Processing Unit). O resto passa para a CPU/RAM
CPU Thread Pool Size: Número de Threads que o modelo vai usar. A regra é usar a quantidade de núcleos fisícos que você tem. Usar núcleos virtuais não muda em quase nada o resultado, até atrapalha.
Evaluation Batch Size: Define o tamanho do bloco de tokens processado por passo quando o modelo lê o prompt. Blocos maiores → PréPreenchimento mais veloz; porém cada aumento consome mais VRAM. Na geração de resposta (um token de cada vez) esse parâmetro quase não influencia.
ROP Frequency Base/ ROP Frequency Scale: Útil se você está pensando em fazer uma Sintonia Fina (Fine Tunning) em seu modelo ou extrapolar sua janela de contexto. O Frequency Base define a frequência angular θ₀ usada nessa fórmula divertida aqui θ(i)=base^(-2 i/d), também chamado de Rotary Positional Embedding. Quanto maior o número, melhor em contextos maiores, já que o modelo vai conseguir visualizar posições mais distantes antes que ele não conseguia antes de repetir o mesmo processo de busca. Já o Frequency Scale divide a posição lógica por um fator constante antes de aplicar na função do RoPE, “esticando” a régua que o modelo usa para medir distância entre tokens.
OffLoad KV Cache in Memory: Guarda as chaves/valores de cada token na GPU em vez da RAM. Acelera muito a Atenção, ou seja a resposta será muito, mas muito mais rápida.
Keep Model in Memory: Mantém o modelo na memória depois de cada solicitação, legal se você fizer muitas chamadas, usar APIS e não estiver se importando em relação ao gasto da energia.
Try mmap(): Melhora a inicialização do modelo carregando somente as partes mais acessadas. Funciona melhor no Linux
Seed & Random Seed: Legal se você quiser fixar algum tipo de resposta do modelo. Caso contrário deixe em Random Seed.
Number of Experts: Quantos especialistas o roteador (também conhecido como Gate) pode ativar para gerar cada token. Menos experts = menor consumo, respostas um pouco mais rasas ou simples; Mais experts = Mais VRAM/FLOPs, chance de texto mais rico, melhor. Se você caiu de paraquedas por aqui, use o valor padrão, se não pode dar uma olhada nessa Thread no Reddit aqui.
Flash Attention: Ativa um kernel ultracompacto que combina as três etapas do mecanismo de atenção o otimizando . Isso reduz leituras de memória e, de quebra, corta o uso de VRAM em ~20–30 % durante a geração, especialmente se você estiver usando o CUDA com Linux. Mas por enquanto o suporte aparenta não estar 100% no Windows
K Cache Quantization Type/ V Cache Quantization Type: Esses dois menus definem como o LM Studio armazena o KV-cache (as chaves/valores que guardam o “histórico” da sua conversa) na GPU.
FP 16≈ (padrão) — Zero perda, consome mais memória.
FP8 / bf16-mix≈ 35% — Indistinguível na maioria dos prompts.
NF4 / Q4–0≈ 45% — Pequenas imprecisões só em contextos > 32 k.
Q2_K≈ 60 % — Pode introduzir repetições ou “saltos” no raciocínio em textos longos.
Quantizar o KV-cache é como trocar o caderno de capa dura por um fichário fino: ocupa menos espaço na mochila (VRAM), mas se ficar fino demais algumas páginas podem rasgar (Seu modelo vai perder a precisão). Comece em Q4–0 e vá modificando na sua GPU, até achar um valor legal para o uso.
Agora que você sabe como funciona cada parâmetro, ou pelo menos tem uma leve referência deles, você pode configurar seu modelo da melhor forma possível! Bons estudos!
Links Úteis
- Documentação oficial: https://lmstudio.ai/docs/app
- Discussão sobre RoPE scaling: https://github.com/ggerganov/llama.cpp/issues/2402
- **Otimização de Memória em LLMS:
**https://medium.com/%40tejaswi_kashyap/memory-optimization-in-llms-leveraging-kv-cache-quantization-for-efficient-inference-94bc3df5faef - Número máximo de especialistas por Token:
https://www.reddit.com/r/LocalLLaMA/comments/18la6ao/optimal_number_of_experts_per_token_in/ - Modelo QWEN 30B A3B:
https://huggingface.co/Qwen/Qwen3-30B-A3B