LM Studio requisitos 2026: hardware para ejecutar LLMs locales con interfaz gráfica
LM Studio es la puerta de entrada más amable a los LLMs locales: descargas la aplicación, buscas un modelo en el catálogo integrado, pulsas descargar y chateas. Sin terminal, sin comandos, sin editar archivos de configuración. Pero la amabilidad de la interfaz no cambia la física: los modelos grandes siguen necesitando hardware serio. Esta guía te dice qué necesitas exactamente según el modelo que quieras ejecutar, y en qué se diferencia de Ollama a la hora de elegir equipo.
Qué es LM Studio
LM Studio es una aplicación de escritorio (Windows, macOS, Linux) para descargar y ejecutar LLMs locales con interfaz gráfica. Por debajo usa llama.cpp — el mismo motor que Ollama — y en Mac añade soporte del framework MLX de Apple, que exprime mejor los chips M. Incluye:
- Catálogo de modelos GGUF integrado (busca, filtra por tamaño, descarga con un clic).
- Chat con historial, system prompts y parámetros ajustables.
- Servidor API local compatible con OpenAI para conectar otras aplicaciones.
- Indicador de si un modelo cabe en tu VRAM antes de descargarlo (utilísimo para no perder tiempo).
Requisitos mínimos por sistema operativo
Windows
- SO: Windows 10/11 de 64 bits.
- CPU: con soporte AVX2 (cualquier Intel/AMD desde 2015).
- RAM: 8 GB mínimo absoluto, 16 GB para modelos 7B, 32 GB recomendado.
- GPU: opcional pero muy recomendada. NVIDIA con CUDA es lo óptimo; AMD funciona vía Vulkan con menos rendimiento.
macOS
- Chip: Apple Silicon (M1 o superior). Los Intel Mac no están soportados en versiones recientes.
- macOS: 13.4 o superior. Para modelos MLX, 14+.
- RAM unificada: 16 GB mínimo práctico, 32-64 GB para modelos 13B-30B.
Linux
- Distribución: x64 con glibc moderna (Ubuntu 22.04+).
- GPU: NVIDIA con drivers oficiales y CUDA 12+ para aceleración.
Hardware por tamaño de modelo
Las cifras son las mismas que gobiernan cualquier runtime basado en llama.cpp — si ya leíste nuestra guía de requisitos de Ollama, te sonarán:
| Modelo | RAM mínima | VRAM ideal | Tokens/s esperados (GPU) | |---|---:|---:|---:| | 1B-3B (Llama 3.2, Phi-3 mini) | 8 GB | 2-3 GB | 40-60 | | 7B-8B Q4 (Llama 3.1, Mistral) | 16 GB | 6 GB | 25-40 | | 13B-14B Q4 (Qwen, DeepSeek R1) | 32 GB | 10 GB | 18-25 | | 32B Q4 (Qwen, DeepSeek R1) | 48 GB | 20 GB | 8-15 | | 70B Q4 (Llama 3.3) | 64 GB | 40+ GB | 5-12 (Mac M5 Max) |
La regla práctica no cambia: modelo cuantizado + 4-6 GB de margen disponibles. Para el detalle de cuantizaciones (Q4_K_M vs Q5 vs Q8) y qué pierdes con cada una, mira cuánta RAM para ChatGPT local.
LM Studio vs Ollama: cuál elegir (y si cambia el hardware)
La pregunta más repetida. Respuesta corta: el hardware necesario es idéntico — ambos usan llama.cpp. La elección es de flujo de trabajo:
| Criterio | LM Studio | Ollama | |---|---|---| | Interfaz | Gráfica completa | Terminal + API | | Curva de entrada | Mínima | Baja pero requiere CLI | | Catálogo de modelos | Integrado con buscador | Comando ollama pull | | API para desarrollo | Compatible OpenAI | Compatible OpenAI | | Automatización / scripts | Limitada | Excelente | | Soporte MLX (Mac) | Sí — ventaja real en M5 | No (usa Metal) | | Consumo en reposo | Algo mayor (app Electron) | Mínimo (servicio) |
- Empiezas y quieres ver resultados hoy: LM Studio.
- Eres developer y quieres integrar el LLM en tus herramientas: Ollama.
- Tienes un Mac M5: LM Studio con modelos MLX rinde 10-20% más que Ollama en el mismo hardware.
- Muchos usuarios acaban con ambos instalados: LM Studio para explorar modelos, Ollama para servirlos.
El truco de la GPU offload parcial
LM Studio permite ajustar con un slider cuántas capas del modelo van a la GPU y cuántas se quedan en RAM. Esto salva la papeleta cuando el modelo casi cabe en tu VRAM:
- Modelo 13B Q4 (8 GB) en una RTX 4060 de 8 GB: no cabe entero con el contexto. Con 85-90% de capas en GPU, obtienes 12-15 tokens/s en lugar de los 3-4 del modo CPU.
- Regla práctica: cada 10% de capas fuera de la GPU cuesta aproximadamente un 20-30% de velocidad. Por debajo del 60% en GPU, la experiencia deja de ser interactiva.
Esto significa que una GPU de 8 GB "estira" hasta modelos 13-14B con paciencia, pero si tu objetivo son esos modelos, los 12 GB de una RTX 5070 son dinero mejor gastado. Comparativa completa en qué RTX para LLMs.
Mejores portátiles para LM Studio por presupuesto
- Probar sin gastar (0 €): cualquier portátil con 16 GB ejecuta modelos 7B Q4 en CPU a 4-7 tokens/s. Lento pero funcional para evaluar si esto es para ti.
- Entrada (~1.300 €): ASUS TUF con RTX 4060 8 GB + 32 GB RAM. Modelos 7B-8B fluidos, 13B con offload parcial.
- Sweet spot (~2.000 €): Legion Pro 5 con RTX 5070 12 GB + 32 GB. Modelos 13-14B cómodos a 20+ tokens/s.
- Serio (~2.900 €): RTX 5080 16 GB + 64 GB RAM, o MacBook Pro M5 Pro 36 GB. Modelos 32B viables.
- Máximo en portátil (~4.000 €+): MacBook Pro M5 Max 64-96 GB. Llama 70B Q4 gracias a la memoria unificada — imposible en cualquier RTX móvil.
Preguntas frecuentes
¿LM Studio es gratis? Sí para uso personal. Existe licencia de empresa para uso corporativo.
¿LM Studio envía mis conversaciones a internet? No. Modelos y chats se procesan 100% en local. Solo sale tráfico al descargar modelos del catálogo.
¿Puedo usar los mismos modelos GGUF en LM Studio y Ollama? Sí, el formato es el mismo. LM Studio los guarda en su propia carpeta, pero puedes apuntar ambos al mismo directorio para no duplicar 50 GB de modelos.
¿Qué modelo me recomiendas para empezar con 16 GB de RAM y sin GPU dedicada? Llama 3.2 3B Q4 para velocidad, o Mistral 7B Q4 si toleras 5-6 tokens/s. En cuanto pruebes, entenderás por qué la GPU marca la diferencia.
¿LM Studio aprovecha la NPU de mi Core Ultra o Snapdragon? Todavía de forma limitada en 2026. El grueso de la aceleración sigue siendo GPU (CUDA/Metal/Vulkan). La NPU ayuda en tareas auxiliares del sistema, no en la inferencia principal de LM Studio.
¿Qué portátil exacto para tus modelos en LM Studio?
Dile al asesor IA qué modelos quieres ejecutar (tamaño y cuantización si la sabes) y tu presupuesto. Te dirá el portátil concreto con la RAM y VRAM necesarias y los tokens por segundo que puedes esperar.