LM Studio requisitos 2026: hardware para executar LLMs locais com interface gráfica
O LM Studio é a porta de entrada mais simpática para os LLMs locais: descarregas a aplicação, procuras um modelo no catálogo integrado, carregas em descarregar e conversas. Sem terminal, sem comandos, sem editar ficheiros de configuração. Mas a simpatia da interface não muda a física: os modelos grandes continuam a precisar de hardware sério. Este guia diz-te o que precisas exatamente consoante o modelo que queres executar, e em que difere do Ollama na hora de escolher equipamento.
O que é o LM Studio
O LM Studio é uma aplicação de desktop (Windows, macOS, Linux) para descarregar e executar LLMs locais com interface gráfica. Por baixo usa o llama.cpp — o mesmo motor do Ollama — e no Mac acrescenta suporte do framework MLX da Apple, que aproveita melhor os chips M. Inclui:
- Catálogo de modelos GGUF integrado (procura, filtra por tamanho, descarrega com um clique).
- Chat com histórico, system prompts e parâmetros ajustáveis.
- Servidor API local compatível com OpenAI para ligar outras aplicações.
- Um indicador de se um modelo cabe na tua VRAM antes de o descarregares (utilíssimo para não perderes tempo).
Requisitos mínimos por sistema operativo
Windows
- SO: Windows 10/11 de 64 bits.
- CPU: com suporte AVX2 (qualquer Intel/AMD desde 2015).
- RAM: 8 GB mínimo absoluto, 16 GB para modelos 7B, 32 GB recomendado.
- GPU: opcional mas muito recomendada. NVIDIA com CUDA é o ideal; AMD funciona via Vulkan com menos desempenho.
macOS
- Chip: Apple Silicon (M1 ou superior). Os Mac Intel não são suportados nas versões recentes.
- macOS: 13.4 ou superior. Para modelos MLX, 14+.
- RAM unificada: 16 GB mínimo prático, 32-64 GB para modelos 13B-30B.
Linux
- Distribuição: x64 com glibc moderna (Ubuntu 22.04+).
- GPU: NVIDIA com drivers oficiais e CUDA 12+ para aceleração.
Hardware por tamanho de modelo
Os números são os mesmos que governam qualquer runtime baseado em llama.cpp — se já leste o nosso guia de requisitos do Ollama, soar-te-ão familiares:
| Modelo | RAM mínima | VRAM ideal | Tokens/s esperados (GPU) |
|---|---|---|---|
| 1B-3B (Llama 3.2, Phi-3 mini) | 8 GB | 2-3 GB | 40-60 |
| 7B-8B Q4 (Llama 3.1, Mistral) | 16 GB | 6 GB | 25-40 |
| 13B-14B Q4 (Qwen, DeepSeek R1) | 32 GB | 10 GB | 18-25 |
| 32B Q4 (Qwen, DeepSeek R1) | 48 GB | 20 GB | 8-15 |
| 70B Q4 (Llama 3.3) | 64 GB | 40+ GB | 5-12 (Mac M5 Max) |
A regra prática não muda: modelo quantizado + 4-6 GB de margem disponíveis. Para o detalhe das quantizações (Q4_K_M vs Q5 vs Q8) e o que perdes com cada uma, vê quanta RAM para ChatGPT local.
LM Studio vs Ollama: qual escolher (e se muda o hardware)
A pergunta mais repetida. Resposta curta: o hardware necessário é idêntico — ambos usam o llama.cpp. A escolha é de fluxo de trabalho:
| Critério | LM Studio | Ollama |
|---|---|---|
| Interface | Gráfica completa | Terminal + API |
| Curva de entrada | Mínima | Baixa mas exige CLI |
| Catálogo de modelos | Integrado com pesquisa | Comando ollama pull |
| API para desenvolvimento | Compatível OpenAI | Compatível OpenAI |
| Automação / scripts | Limitada | Excelente |
| Suporte MLX (Mac) | Sim — vantagem real no M5 | Não (usa Metal) |
| Consumo em repouso | Algo maior (app Electron) | Mínimo (serviço) |
- Estás a começar e queres ver resultados hoje: LM Studio.
- És developer e queres integrar o LLM nas tuas ferramentas: Ollama.
- Tens um Mac M5: o LM Studio com modelos MLX rende 10-20% mais do que o Ollama no mesmo hardware.
- Muitos utilizadores acabam com ambos instalados: LM Studio para explorar modelos, Ollama para os servir.
O truque do GPU offload parcial
O LM Studio permite ajustar com um slider quantas camadas do modelo vão para a GPU e quantas ficam na RAM. Isto salva a situação quando o modelo quase cabe na tua VRAM:
- Modelo 13B Q4 (8 GB) numa RTX 4060 de 8 GB: não cabe inteiro com o contexto. Com 85-90% das camadas na GPU, obténs 12-15 tokens/s em vez dos 3-4 do modo CPU.
- Regra prática: cada 10% de camadas fora da GPU custa aproximadamente 20-30% de velocidade. Abaixo dos 60% na GPU, a experiência deixa de ser interativa.
Isto significa que uma GPU de 8 GB "estica" até modelos 13-14B com paciência, mas se o teu objetivo são esses modelos, os 12 GB de uma RTX 5070 são dinheiro mais bem gasto. Comparação completa em que RTX para LLMs.
Melhores portáteis para LM Studio por orçamento
- Experimentar sem gastar (0 €): qualquer portátil com 16 GB executa modelos 7B Q4 em CPU a 4-7 tokens/s. Lento mas funcional para avaliar se isto é para ti.
- Entrada (~1.300 €): ASUS TUF com RTX 4060 8 GB + 32 GB RAM. Modelos 7B-8B fluidos, 13B com offload parcial.
- Sweet spot (~2.000 €): Legion Pro 5 com RTX 5070 12 GB + 32 GB. Modelos 13-14B confortáveis a 20+ tokens/s.
- Sério (~2.900 €): RTX 5080 16 GB + 64 GB RAM, ou MacBook Pro M5 Pro 36 GB. Modelos 32B viáveis.
- Máximo em portátil (~4.000 €+): MacBook Pro M5 Max 64-96 GB. Llama 70B Q4 graças à memória unificada — impossível em qualquer RTX móvel.
Perguntas frequentes
O LM Studio é gratuito? Sim para uso pessoal. Existe licença de empresa para uso corporativo.
O LM Studio envia as minhas conversas para a internet? Não. Modelos e chats são processados 100% em local. Só há tráfego de saída ao descarregar modelos do catálogo.
Posso usar os mesmos modelos GGUF no LM Studio e no Ollama? Sim, o formato é o mesmo. O LM Studio guarda-os na sua própria pasta, mas podes apontar ambos para o mesmo diretório para não duplicar 50 GB de modelos.
Que modelo me recomendas para começar com 16 GB de RAM e sem GPU dedicada? Llama 3.2 3B Q4 para velocidade, ou Mistral 7B Q4 se toleras 5-6 tokens/s. Assim que experimentares, perceberás porque é que a GPU faz a diferença.
O LM Studio aproveita a NPU do meu Core Ultra ou Snapdragon? Ainda de forma limitada em 2026. O grosso da aceleração continua a ser GPU (CUDA/Metal/Vulkan). A NPU ajuda em tarefas auxiliares do sistema, não na inferência principal do LM Studio.
Que portátil exato para os teus modelos no LM Studio?
Diz ao assessor IA que modelos queres executar (tamanho e quantização se a souberes) e o teu orçamento. Dir-te-á o portátil concreto com a RAM e VRAM necessárias e os tokens por segundo que podes esperar.