LM Studio requisitos 2026: hardware para executar LLMs locais com interface gráfica

O LM Studio é a porta de entrada mais simpática para os LLMs locais: descarregas a aplicação, procuras um modelo no catálogo integrado, carregas em descarregar e conversas. Sem terminal, sem comandos, sem editar ficheiros de configuração. Mas a simpatia da interface não muda a física: os modelos grandes continuam a precisar de hardware sério. Este guia diz-te o que precisas exatamente consoante o modelo que queres executar, e em que difere do Ollama na hora de escolher equipamento.

O que é o LM Studio

O LM Studio é uma aplicação de desktop (Windows, macOS, Linux) para descarregar e executar LLMs locais com interface gráfica. Por baixo usa o llama.cpp — o mesmo motor do Ollama — e no Mac acrescenta suporte do framework MLX da Apple, que aproveita melhor os chips M. Inclui:

Requisitos mínimos por sistema operativo

Windows

macOS

Linux

Hardware por tamanho de modelo

Os números são os mesmos que governam qualquer runtime baseado em llama.cpp — se já leste o nosso guia de requisitos do Ollama, soar-te-ão familiares:

ModeloRAM mínimaVRAM idealTokens/s esperados (GPU)
1B-3B (Llama 3.2, Phi-3 mini)8 GB2-3 GB40-60
7B-8B Q4 (Llama 3.1, Mistral)16 GB6 GB25-40
13B-14B Q4 (Qwen, DeepSeek R1)32 GB10 GB18-25
32B Q4 (Qwen, DeepSeek R1)48 GB20 GB8-15
70B Q4 (Llama 3.3)64 GB40+ GB5-12 (Mac M5 Max)

A regra prática não muda: modelo quantizado + 4-6 GB de margem disponíveis. Para o detalhe das quantizações (Q4_K_M vs Q5 vs Q8) e o que perdes com cada uma, vê quanta RAM para ChatGPT local.

LM Studio vs Ollama: qual escolher (e se muda o hardware)

A pergunta mais repetida. Resposta curta: o hardware necessário é idêntico — ambos usam o llama.cpp. A escolha é de fluxo de trabalho:

CritérioLM StudioOllama
InterfaceGráfica completaTerminal + API
Curva de entradaMínimaBaixa mas exige CLI
Catálogo de modelosIntegrado com pesquisaComando ollama pull
API para desenvolvimentoCompatível OpenAICompatível OpenAI
Automação / scriptsLimitadaExcelente
Suporte MLX (Mac)Sim — vantagem real no M5Não (usa Metal)
Consumo em repousoAlgo maior (app Electron)Mínimo (serviço)

O truque do GPU offload parcial

O LM Studio permite ajustar com um slider quantas camadas do modelo vão para a GPU e quantas ficam na RAM. Isto salva a situação quando o modelo quase cabe na tua VRAM:

Isto significa que uma GPU de 8 GB "estica" até modelos 13-14B com paciência, mas se o teu objetivo são esses modelos, os 12 GB de uma RTX 5070 são dinheiro mais bem gasto. Comparação completa em que RTX para LLMs.

Melhores portáteis para LM Studio por orçamento

Perguntas frequentes

O LM Studio é gratuito? Sim para uso pessoal. Existe licença de empresa para uso corporativo.

O LM Studio envia as minhas conversas para a internet? Não. Modelos e chats são processados 100% em local. Só há tráfego de saída ao descarregar modelos do catálogo.

Posso usar os mesmos modelos GGUF no LM Studio e no Ollama? Sim, o formato é o mesmo. O LM Studio guarda-os na sua própria pasta, mas podes apontar ambos para o mesmo diretório para não duplicar 50 GB de modelos.

Que modelo me recomendas para começar com 16 GB de RAM e sem GPU dedicada? Llama 3.2 3B Q4 para velocidade, ou Mistral 7B Q4 se toleras 5-6 tokens/s. Assim que experimentares, perceberás porque é que a GPU faz a diferença.

O LM Studio aproveita a NPU do meu Core Ultra ou Snapdragon? Ainda de forma limitada em 2026. O grosso da aceleração continua a ser GPU (CUDA/Metal/Vulkan). A NPU ajuda em tarefas auxiliares do sistema, não na inferência principal do LM Studio.

Que portátil exato para os teus modelos no LM Studio?

Diz ao assessor IA que modelos queres executar (tamanho e quantização se a souberes) e o teu orçamento. Dir-te-á o portátil concreto com a RAM e VRAM necessárias e os tokens por segundo que podes esperar.

Ainda em dúvida? Conte seu uso e orçamento ao consultor IA — você receberá uma recomendação específica com marcas e modelos atuais.

🤖 Falar com o consultor IA