LM Studio configuration requise 2026 : matériel pour exécuter des LLM locaux avec interface graphique
LM Studio est la porte d'entrée la plus accueillante vers les LLM locaux : vous téléchargez l'application, cherchez un modèle dans le catalogue intégré, cliquez sur télécharger et discutez. Pas de terminal, pas de commandes, pas de fichiers de configuration à éditer. Mais la convivialité de l'interface ne change pas la physique : les gros modèles ont toujours besoin de matériel sérieux. Ce guide vous dit exactement ce qu'il vous faut selon le modèle que vous voulez exécuter, et en quoi cela diffère d'Ollama au moment de choisir une machine.
Qu'est-ce que LM Studio
LM Studio est une application de bureau (Windows, macOS, Linux) pour télécharger et exécuter des LLM locaux avec une interface graphique. En dessous, elle utilise llama.cpp — le même moteur qu'Ollama — et sur Mac elle ajoute la prise en charge du framework MLX d'Apple, qui exploite mieux les puces M. Elle inclut :
- Catalogue de modèles GGUF intégré (recherche, filtre par taille, téléchargement en un clic).
- Chat avec historique, system prompts et paramètres ajustables.
- Serveur API local compatible OpenAI pour connecter d'autres applications.
- Un indicateur qui montre si un modèle rentre dans votre VRAM avant de le télécharger (très utile pour ne pas perdre de temps).
Configuration minimale par système d'exploitation
Windows
- OS : Windows 10/11 64 bits.
- CPU : avec prise en charge AVX2 (tout Intel/AMD depuis 2015).
- RAM : 8 Go minimum absolu, 16 Go pour les modèles 7B, 32 Go recommandé.
- GPU : optionnel mais très recommandé. NVIDIA avec CUDA est optimal ; AMD fonctionne via Vulkan avec moins de performance.
macOS
- Puce : Apple Silicon (M1 ou supérieur). Les Mac Intel ne sont pas pris en charge dans les versions récentes.
- macOS : 13.4 ou supérieur. Pour les modèles MLX, 14+.
- RAM unifiée : 16 Go minimum pratique, 32-64 Go pour les modèles 13B-30B.
Linux
- Distribution : x64 avec glibc moderne (Ubuntu 22.04+).
- GPU : NVIDIA avec pilotes officiels et CUDA 12+ pour l'accélération.
Matériel par taille de modèle
Les chiffres sont les mêmes que ceux qui régissent tout runtime basé sur llama.cpp — si vous avez lu notre guide sur les prérequis d'Ollama, ils vous seront familiers :
| Modèle | RAM minimale | VRAM idéale | Tokens/s attendus (GPU) |
|---|---|---|---|
| 1B-3B (Llama 3.2, Phi-3 mini) | 8 Go | 2-3 Go | 40-60 |
| 7B-8B Q4 (Llama 3.1, Mistral) | 16 Go | 6 Go | 25-40 |
| 13B-14B Q4 (Qwen, DeepSeek R1) | 32 Go | 10 Go | 18-25 |
| 32B Q4 (Qwen, DeepSeek R1) | 48 Go | 20 Go | 8-15 |
| 70B Q4 (Llama 3.3) | 64 Go | 40+ Go | 5-12 (Mac M5 Max) |
La règle pratique ne change pas : modèle quantifié + 4-6 Go de marge disponibles. Pour le détail des quantifications (Q4_K_M vs Q5 vs Q8) et ce que vous perdez avec chacune, voyez combien de RAM pour ChatGPT en local.
LM Studio vs Ollama : lequel choisir (et si le matériel change)
La question la plus répétée. Réponse courte : le matériel nécessaire est identique — les deux utilisent llama.cpp. Le choix est une question de flux de travail :
| Critère | LM Studio | Ollama |
|---|---|---|
| Interface | Graphique complète | Terminal + API |
| Courbe d'apprentissage | Minimale | Faible mais nécessite la CLI |
| Catalogue de modèles | Intégré avec moteur de recherche | Commande ollama pull |
| API pour le développement | Compatible OpenAI | Compatible OpenAI |
| Automatisation / scripts | Limitée | Excellente |
| Prise en charge MLX (Mac) | Oui — vrai avantage sur M5 | Non (utilise Metal) |
| Consommation au repos | Un peu plus élevée (app Electron) | Minimale (service) |
- Vous débutez et voulez des résultats aujourd'hui : LM Studio.
- Vous êtes développeur et voulez intégrer le LLM dans vos outils : Ollama.
- Vous avez un Mac M5 : LM Studio avec des modèles MLX rend 10-20 % de plus qu'Ollama sur le même matériel.
- Beaucoup d'utilisateurs finissent avec les deux installés : LM Studio pour explorer les modèles, Ollama pour les servir.
L'astuce de l'offload GPU partiel
LM Studio permet d'ajuster avec un curseur combien de couches du modèle vont au GPU et combien restent en RAM. Cela sauve la mise quand le modèle rentre presque dans votre VRAM :
- Modèle 13B Q4 (8 Go) sur une RTX 4060 de 8 Go : il ne rentre pas entièrement avec le contexte. Avec 85-90 % des couches sur le GPU, vous obtenez 12-15 tokens/s au lieu des 3-4 du mode CPU.
- Règle pratique : chaque 10 % de couches hors du GPU coûte environ 20-30 % de vitesse. En dessous de 60 % sur le GPU, l'expérience cesse d'être interactive.
Cela signifie qu'un GPU de 8 Go « s'étire » jusqu'aux modèles 13-14B avec de la patience, mais si ces modèles sont votre objectif, les 12 Go d'une RTX 5070 sont un meilleur investissement. Comparatif complet dans quelle RTX pour LLM.
Meilleurs portables pour LM Studio par budget
- Essayer sans dépenser (0 €) : n'importe quel portable avec 16 Go exécute des modèles 7B Q4 sur CPU à 4-7 tokens/s. Lent mais fonctionnel pour évaluer si c'est fait pour vous.
- Entrée (~1 300 €) : ASUS TUF avec RTX 4060 8 Go + 32 Go de RAM. Modèles 7B-8B fluides, 13B avec offload partiel.
- Sweet spot (~2 000 €) : Legion Pro 5 avec RTX 5070 12 Go + 32 Go. Modèles 13-14B confortables à 20+ tokens/s.
- Sérieux (~2 900 €) : RTX 5080 16 Go + 64 Go de RAM, ou MacBook Pro M5 Pro 36 Go. Modèles 32B viables.
- Maximum sur portable (~4 000 €+) : MacBook Pro M5 Max 64-96 Go. Llama 70B Q4 grâce à la mémoire unifiée — impossible sur tout RTX mobile.
Questions fréquentes
LM Studio est-il gratuit ? Oui pour un usage personnel. Il existe une licence entreprise pour l'usage professionnel.
LM Studio envoie-t-il mes conversations sur internet ? Non. Modèles et discussions sont traités 100 % en local. Le seul trafic sortant a lieu au téléchargement des modèles du catalogue.
Puis-je utiliser les mêmes modèles GGUF dans LM Studio et Ollama ? Oui, le format est le même. LM Studio les stocke dans son propre dossier, mais vous pouvez pointer les deux vers le même répertoire pour ne pas dupliquer 50 Go de modèles.
Quel modèle recommandez-vous pour débuter avec 16 Go de RAM et sans GPU dédié ? Llama 3.2 3B Q4 pour la vitesse, ou Mistral 7B Q4 si vous tolérez 5-6 tokens/s. Dès que vous l'essaierez, vous comprendrez pourquoi le GPU fait la différence.
LM Studio exploite-t-il la NPU de mon Core Ultra ou Snapdragon ? Encore de façon limitée en 2026. L'essentiel de l'accélération reste le GPU (CUDA/Metal/Vulkan). La NPU aide sur des tâches auxiliaires du système, pas sur l'inférence principale de LM Studio.
Quel portable exact pour vos modèles dans LM Studio ?
Dites au conseiller IA quels modèles vous voulez exécuter (taille et quantification si vous la connaissez) et votre budget. Il vous indiquera le portable précis avec la RAM et la VRAM nécessaires et les tokens par seconde que vous pouvez espérer.