Installer un LLM en local : le guide complet (outils, modèles, étapes)
Un LLM se déploie en local avec des outils simples et un GPU adapté.
- VRAM minimale requise : 4 à 5 Go pour un modèle 7B.
- Ollama : référence technique avec API compatible OpenAI.
- LM Studio : interface ChatGPT, recherche intégrée sur Hugging Face.
- llama.cpp : framework C/C++ rapide pour experts.
- GPT4All : interface no-code pour professionnels non-codeurs.
- Aucune donnée ne transite vers des serveurs lointains avec l’installation locale.
Les meilleurs outils pour installer un LLM en local (Ollama, LM Studio, llama.cpp, GPT4All)
| Outil | Profil utilisateur | Atout principal | Public cible |
|---|---|---|---|
| Ollama | Développeur | Écosystème dominant | Technique |
| LM Studio | Débutant | Interface type ChatGPT | Grand public |
| llama.cpp | Expert | Framework C/C++ rapide | Développeurs |
| GPT4All | Non-codeur | Interface no-code | Professionnels |
Avec une installation locale, les conversations restent sur votre machine : aucune donnée ne transite vers des serveurs lointains. Le facteur limitant principal reste la VRAM, la mémoire dédiée du GPU. Un modèle 7B (7 milliards de paramètres) quantifié exige environ 4 à 5 Go de VRAM, tandis qu’un modèle 14B en demande 8 à 10 Go. Pas besoin d’un supercalculateur : les machines personnelles récentes suffisent pour la majorité des cas d’usage.
Ollama : la référence pour lancer des modèles en ligne de commande
Ollama s’impose comme l’outil de référence pour exécuter des modèles localement. Son installation passe par une page de téléchargement dédiée, suivie d’une commande unique pour récupérer un modèle. Sa force réside dans sa compatibilité avec l’ensemble des architectures récentes : Llama, Mistral, Qwen et bien d’autres. L’écosystème qui l’entoure propose des bibliothèques Python et des API compatibles OpenAI, facilitant l’intégration dans des applications existantes.
LM Studio : l’interface visuelle idéale pour débuter
Pour ceux qui préfèrent éviter le terminal, LM Studio offre une interface proche de ChatGPT, avec une recherche intégrée directement dans Hugging Face pour télécharger les modèles. Sa fonction de décodage spéculatif accélère la génération de 1,5 à 3 fois le débit de tokens. L’outil permet aussi de lancer plusieurs modèles simultanément pour comparer leurs réponses en temps réel.
llama.cpp et GPT4All : des alternatives pour configurations modestes
Écrit en C/C++, llama.cpp fonctionne principalement sur CPU et convient aux machines sans GPU puissant comptez 10,99 tokens/seconde en génération standard. GPT4All, pris en charge par Jan, propose une interface no-code pour les utilisateurs non techniques. Enfin, vLLM s’adresse aux environnements de production exigeant un débit optimisé, avec une version CUDA 11.8 ou supérieure requise sous Linux.
Cas d’usage concrets : RAG, chatbot, agents et analyse de documents

Interroger une base documentaire avec le RAG (Retrieval-Augmented Generation)
Le RAG transforme votre machine en un moteur de recherche intelligent capable de répondre à partir de vos propres documents. Concrètement, le système découpe vos fichiers en segments, les indexe dans une base vectorielle, puis ne transmet au LLM que les extraits les plus pertinents lors d’une question. Cette méthode évite de ré-entraîner le modèle et garantit que les réponses citent des sources vérifiables.
Pour une documentation interne, un contrat ou un rapport annuel, le RAG local est l’usage le plus prisé : il corrige les hallucinations et les biais du modèle généraliste. Avec un modèle 7B (7 milliards de paramètres) occupant 4 à 5 Go de VRAM une fois quantifié, vous pouvez interroger un corpus conséquent sans serveur externe. La base documentaire doit être sécurisée au même niveau que les poids du modèle, car elle contient des informations sensibles. , incluant les étapes rgpd obligatoires,
L’installation locale d’un LLM ouvre la voie à des usages avancés comme le RAG, mais pour structurer efficacement vos projets et documents, une bonne gestion de projet avec Asana s’avère complémentaire. , tout en améliorant son référencement local, améliorer son référencement local
Chatbot, agents autonomes et serveur d’inférence local
Une fois le LLM installé, plusieurs usages se débloquent selon votre matériel. Les performances varient fortement : avec llamafile, comptez 53,18 tokens par seconde contre 10,99 tokens par seconde sans cet outil un gain de 5x qui change radicalement l’ergonomie d’un chat. Sur une machine Apple à 16 Go de RAM (Mac mini M4), les modèles 7B à 13B tournent confortablement.
- Chatbot local : conversation privée, sans envoi de données vers des serveurs lointains
- Agents : automatisation de tâches (résumé, tri d’emails, génération de rapports)
- API locale : serveur compatible OpenAI via un package Python et CURL
- Modules : analyse d’images et transcription audio en complément du texte
Pour les agents autonomes, privilégiez un GPU 12 Go de VRAM afin d’exécuter Qwen3 14B ou DeepSeek V3.2 14B à 35-40 tokens/s. La création d’un serveur d’inférence local permet à plusieurs applications d’interroger le même modèle via une API unique, tout en contrôlant précisément les accès et la confidentialité.
Pourquoi déployer un LLM en local ? (confidentialité, coûts, souveraineté)
Le principal avantage du déploiement local est la confidentialité : vos conversations restent sur votre machine et ne transitent jamais par des serveurs distants. Fini les risques liés aux pannes de services en ligne ou aux fuites d’historiques ; vous gardez un contrôle total sur vos données, un atout décisif pour la souveraineté numérique des entreprises.
Ce choix est aussi un avantage économique. En éliminant les coûts d’abonnement récurrents, l’investissement matériel est rapidement rentabilisé. Cependant, un modèle exposé sur un réseau sans protection constitue un risque de sécurité. Il est donc essentiel de sécuriser l’accès, tout comme on le ferait pour toute autre application critique.
Prérequis matériels : CPU, GPU, VRAM et configurations Mac/PC
Avant de vous lancer, comprenez que le facteur limitant d’une installation locale n’est pas le CPU, mais la VRAM (mémoire vidéo du GPU). C’est elle qui détermine si un modèle de 7 milliards de paramètres (7B) ou de 14 milliards de paramètres (14B) peut tourner confortablement. Pour un modèle 7B quantifié, comptez environ 4 à 5 Go de VRAM. Pour un modèle 14B, passez à 8 à 10 Go de VRAM.
| Type de machine | Configuration recommandée | Modèles adaptés | Cas d’usage |
|---|---|---|---|
| PC entrée de gamme | 8 Go de VRAM | Mistral 7B, Phi-4 14B | Chat, résumés, codage léger |
| PC milieu de gamme | 12 Go de VRAM | Qwen3 14B, DeepSeek V3.2 14B | Analyse, RAG, raisonnement |
| Mac (M1/M2/M3/M4) | 16 Go de RAM unifiée | Modèles 7B à 13B | Chatbot local, brouillons |
| Station de travail | 24 Go+ VRAM ou multi-GPU | Modèles 70B quantifiés | Agents complexes, batch |
Bonne nouvelle : pas besoin d’un supercalculateur. Un Mac mini M4 avec 16 Go de RAM suffit pour exécuter des modèles 7B à 13B sans GPU dédié, grâce à la mémoire unifiée. Sur PC, vérifiez la version de votre pilote : vLLM (pour la production) exige par exemple CUDA 11.8 minimum sous Linux.
Interpréter les débits et optimiser ses attentes
Les performances varient fortement selon le format et l’outil. Avec llama.cpp sur CPU, attendez-vous à un débit modeste d’environ 10,99 tokens/seconde. Utilisez llamafile un format exécutable autonome pour grimper à 53,18 tokens/seconde. Avec un GPU 12 Go, les modèles comme Qwen3 14B ou DeepSeek V3.2 14B atteignent 35 à 40 tokens/seconde, soit un débit parfaitement fluide pour une conversation. Notez aussi que LM Studio propose un décodage spéculatif qui accélère la génération de 1,5 à 3 fois sur du matériel compatible.
Anticiper le poids des fichiers et l’avenir
Ne négligez pas le stockage. Les fichiers de modèles non quantifiés peuvent peser 100 Go et plus. Prévoyez un disque SSD rapide pour le chargement. Enfin, si vous visez une utilisation professionnelle réglementée, gardez un œil sur le futur cadre : les obligations de l’AI Act pour les systèmes à haut risque s’appliqueront à partir d’août 2026. Un déploiement local bien documenté facilitera cette mise en conformité.
Guide pas-à-pas pour débutants : installer son premier LLM avec une interface visuelle
Pour une première installation, LM Studio s’impose comme le choix le plus accessible : son interface graphique, très proche de celle d’un chat moderne, élimine toute manipulation en ligne de commande. L’outil gère le téléchargement des modèles, leur exécution et le démarrage d’un serveur local pour d’éventuelles connexions API.
- Télécharger et installer LM Studio Rendez-vous sur le site officiel et lancez l’installeur ; aucune configuration préalable n’est requise.
- Rechercher un modèle sur Hugging Face Dans l’onglet dédié de LM Studio, utilisez la barre de recherche pour trouver un modèle compatible, comme un Llama 7B ou un Mistral 7B.
- Télécharger et charger le modèle Choisissez une variante quantifiée (par exemple Q4_K_M) ; un modèle 7B quantifié pèse entre 4 et 5 Go. Le téléchargement s’effectue depuis l’interface, puis une seule action « charger » le rend actif.
- Démarrer une conversation en local Une fois le modèle chargé, ouvrez le panneau de chat : vos échanges sont 100 % traités sur votre machine, sans aucune requête sortante.
Pour comparer les modèles en toute liberté, LM Studio permet d’exécuter plusieurs LLM simultanément. Chacun tourne dans son propre onglet, ce qui facilite l’évaluation des réponses à la volée. Le logiciel bénéficie également d’un décodage spéculatif, une astuce d’accélération qui peut multiplier la vitesse de génération par 1,5 à 3 fois selon les modèles.
Une fois la conversation lancée, vous pouvez basculer sur un serveur d’inférence local : LM Studio expose une API compatible OpenAI. Cette adresse locale permet de connecter vos propres scripts Python ou outils tiers au LLM, sans même écrire de code serveur un premier pas naturel vers des projets plus ambitieux comme le RAG ou des agents.
Comment choisir son modèle : critères (Llama, Mistral, Qwen, Phi)
| Taille du modèle | VRAM requise | Débit attendu | Modèles concernés |
|---|---|---|---|
| 7B (7 milliards de paramètres) | 4 à 5 Go VRAM | Rapide sur GPU récent | Mistral 7B, Llama 3.1 |
| 14B (14 milliards de paramètres) | 8 à 10 Go VRAM | 35 à 40 tokens/s | Qwen3 14B, Phi-4 14B |
| 70B (70 milliards de paramètres) | 100 Go et plus de fichiers | Requiert GPU multiple | Llama 3.3, Mistral Large |
Critères de sélection d’un modèle (taille, type, performances)
Le choix d’un modèle repose d’abord sur votre matériel puis sur votre cas d’usage. Un modèle trop volumineux pour votre configuration entraînera une génération lente, voire une impossibilité d’exécution.
– Mistral 7B : chat créatif, bon équilibre qualité/ressources, tourne avec 8 Go VRAM
– Phi-4 14B : codage léger, chat rapide multilingue, idéal sur GPU 8 Go
– Qwen3 14B : polyvalent récent, débit de 35 à 40 tokens/seconde, conseillé avec 12 Go VRAM
– DeepSeek V3.2 : successeur de R1, performant pour le raisonnement, également adapté à 12 Go VRAM
Estimation de la VRAM nécessaire selon la taille du modèle
La VRAM est le facteur limitant principal. Un modèle 7B quantifié demande environ 4 à 5 Go VRAM, tandis qu’un 14B en exige 8 à 10 Go. Les fichiers d’un modèle 70B peuvent peser 100 Go et plus.
Sur un Mac mini M4 avec 16 Go RAM, vous pouvez faire tourner confortablement des modèles de 7B à 13B. Pour un PC, visez au minimum 8 Go VRAM pour Mistral 7B ou Phi-4 14B, et privilégiez 12 Go VRAM pour Qwen3 14B ou DeepSeek V3.2 14B si vous souhaitez un débit optimal.
Comparez aussi la vitesse : llamafile atteint 53,18 tokens/seconde, contre 10,99 tokens/seconde sans lui sur CPU. Avec LM Studio, le décodage spéculatif accélère la génération de 1,5 à 3 fois.
Sécurité d’une installation locale : bonnes pratiques et gestion des accès
Une fois votre modèle déployé, une erreur classique consiste à laisser le point d’entrée du serveur ouvert, sans authentification. Quiconque accède à votre réseau local peut alors envoyer des requêtes. Verrouillez systématiquement l’accès à votre endpoint et exigez une clé API pour chaque requête, même en local.
Isolez et chiffrez les fichiers de poids du modèle, ainsi que votre base documentaire RAG, qui possède le même niveau de sensibilité. Téléchargez toujours vos modèles depuis des sources vérifiées comme Hugging Face ou le registre Ollama. Un modèle de 7 milliards de paramètres nécessite environ 4 à 5 Go de VRAM, mais certains fichiers pèsent plus de 100 Go : dimensionnez votre matériel avant de commencer.
Enfin, pensez aux obligations réglementaires : la mise en conformité avec l’AI Act pour les systèmes à haut risque est attendue pour août 2026. Même en local, documentez vos usages et garantissez la traçabilité de vos données pour rester serein.
