Installer une IA en local : Ollama, LM Studio, quel modèle choisir (2026)
Quick Answer : comment installer une IA en local ?
Installer une IA en local — un LLM (grand modèle de langage, le moteur derrière ChatGPT ou Mistral) qui tourne sur votre machine, sans envoyer une seule donnée dans le cloud — prend moins de 15 minutes en 2026 :
- Installer un outil d’exécution : Ollama (ligne de commande + API locale) ou LM Studio (interface graphique). Les deux sont gratuits, disponibles sur macOS, Windows et Linux.
- Télécharger un modèle open-weight adapté à votre machine :
ollama run mistral-smallsuffit côté Ollama ; côté LM Studio, la recherche intégrée pioche directement dans le catalogue Hugging Face. - Choisir le modèle selon votre RAM / GPU : 8 Go de RAM → petits modèles (Phi-3, Gemma 2) ; 16 Go → Mistral 7B ou Llama 3.1-8B ; 24 Go de VRAM ou 32 Go de RAM → Mistral Small 3 (24B) ; Mac Apple Silicon 64-192 Go → jusqu’aux modèles 70B quantifiés.
Résultat : une IA qui rédige, résume, traduit et analyse vos documents sans qu’aucune donnée ne quitte votre machine. Gratuit, sans abonnement, sans compte.
Installer Ollama pas à pas
Ollama est devenu le standard de facto pour faire tourner un LLM en local. Installation en trois minutes.
macOS / Windows : télécharger l’installeur sur ollama.com, lancer, terminé. Linux :
curl -fsSL https://ollama.com/install.sh | sh
Puis, dans un terminal :
# Télécharger et lancer un modèle en une commande
ollama run mistral-small
# Ou séparer le téléchargement de l'exécution
ollama pull llama3.1
ollama run llama3.1
Le premier lancement télécharge le modèle (de 2 à 15 Go selon la taille — prévoir l’espace disque). Ensuite, tout est hors ligne : vous pouvez couper le Wi-Fi, l’IA répond toujours.
Le vrai atout d’Ollama : l’API locale. Ollama expose automatiquement un serveur REST sur http://localhost:11434, compatible avec le format d’API OpenAI. Concrètement : tout outil ou script conçu pour ChatGPT peut pointer vers votre modèle local en changeant une URL. C’est ce qui permet de brancher un RAG, un assistant de code ou une extension de navigateur sur votre IA locale.
Commandes utiles : ollama list (modèles installés), ollama rm <modèle> (libérer de l’espace), ollama ps (modèles chargés en mémoire).
Installer LM Studio : l’IA locale avec interface graphique
LM Studio est l’option la plus confortable si le terminal vous rebute. C’est une application de bureau (macOS, Windows, Linux) qui réunit tout au même endroit :
- Télécharger sur lmstudio.ai et installer comme n’importe quelle application.
- Chercher un modèle dans l’onglet de recherche : LM Studio pioche dans le catalogue Hugging Face et affiche, pour chaque modèle, s’il tiendra dans votre RAM — un garde-fou précieux pour débuter.
- Discuter dans l’interface de chat intégrée, avec réglages accessibles (température, contexte, prompt système).
LM Studio propose aussi un serveur local compatible OpenAI, comme Ollama — activable en un clic pour connecter d’autres outils.
Notre lecture honnête : LM Studio est idéal pour découvrir, comparer des modèles et régler la quantification visuellement. Ollama est plus adapté dès qu’on veut scripter, automatiser ou intégrer. Beaucoup d’utilisateurs installent les deux — ils ne se marchent pas dessus.
Quel modèle choisir selon votre RAM et votre GPU ?
La règle de base : un modèle quantifié en 4-bit occupe environ la moitié de son nombre de paramètres en Go (un 7B ≈ 4-5 Go, un 24B ≈ 14 Go, un 70B ≈ 40 Go). Il faut que le modèle tienne en RAM (Mac, mémoire unifiée) ou en VRAM (GPU dédié).
| Votre machine | Modèles recommandés | Ce que ça permet |
|---|---|---|
| Laptop 8 Go RAM | Phi-3 mini, Gemma 2 (quantifiés) | Résumé, reformulation, classification simple |
| Laptop / PC 16 Go RAM | Mistral 7B, Llama 3.1-8B | Rédaction courante, synthèse, traduction |
| GPU 24 Go VRAM (RTX 4090) ou 32 Go RAM | Mistral Small 3 (24B), Codestral (22B) | Qualité proche GPT-4o-mini, assistance code |
| Mac Apple Silicon 64-192 Go | Llama 3.3-70B quantifié (10-15 tok/s sur M2 Ultra) | Tâches complexes, gros documents |
| Serveur GPU A100/H100 80 Go | Mistral Small 3 ou Llama 3.3-70B en production | Multi-utilisateurs, usage entreprise |
Trois repères pour choisir la famille :
- Mistral (France) — Mistral Small 3 (24B) est le meilleur compromis qualité/ressources en 2026, et Codestral (22B) le bon choix pour le code. Cohérence souveraine en bonus : éditeur français, modèles entraînés en Europe, excellent en français.
- Llama 3.x (Meta) — la référence performance/coût, du 8B pour laptop au 70B pour station de travail. Licence permissive pour la quasi-totalité des organisations.
- Qwen 2.5 (Alibaba) et DeepSeek — très bons techniquement (multilingue, code), licence permissive, mais origine chinoise à pondérer selon la sensibilité de vos usages rédactionnels.
En cas de doute : commencez par ollama run mistral-small si votre machine le permet, sinon ollama run llama3.1. Vous ajusterez ensuite.
Que faire d’une IA locale : les cas d’usage qui marchent
Une IA locale n’est pas un jouet de démonstration. Cas d’usage éprouvés en 2026 :
- Travailler sur des documents confidentiels : contrats, données RH, dossiers clients, éléments financiers — tout ce que vous n’enverriez jamais dans un ChatGPT grand public se traite localement sans état d’âme.
- Rédaction et synthèse quotidiennes : emails, comptes rendus, notes de synthèse, reformulations. Un 7-8B bien prompté couvre l’essentiel.
- Assistance au code : Codestral en local, branché sur votre éditeur via l’API Ollama, sans que votre code propriétaire ne sorte.
- RAG sur votre documentation : indexer vos documents internes et les interroger en langage naturel — voir notre guide RAG en entreprise.
- Traitement en masse (batch) : classification, extraction, anonymisation sur des milliers de documents, à coût marginal nul — pas de facturation au token.
Pour identifier les cas industrialisables à l’échelle d’une organisation, voir notre guide des cas d’usage IA.
Passer à l’échelle : du poste de travail au LLM on-premise
Ollama sur votre poste, c’est l’IA locale individuelle. Le LLM on-premise, c’est la même logique portée au niveau de l’organisation : un serveur interne qui sert des dizaines ou centaines d’utilisateurs.
Le chemin type :
- POC (moins d’une semaine) : Ollama + Mistral Small 3 sur un Mac Studio ou un serveur GPU mid-range. Valider la qualité sur 100-200 exemples réels.
- Pilote (3-4 mois) : migrer vers vLLM ou Text Generation Inference — les moteurs d’inférence production, capables de servir des centaines de requêtes concurrentes, API compatible OpenAI. Serveur GPU dédié (NVIDIA A100 80 Go, ~25-40 k€, ou AMD MI300X), SSO, journalisation, monitoring.
- Industrialisation : élargissement des cas d’usage, plan de mise à jour des modèles (2-4 par an), formation des équipes — voir notre guide formation IA en entreprise.
Côté budget, l’ordre de grandeur pour 100 utilisateurs : 30-60 k€ de matériel, 15-40 k€ d’intégration, 10-25 k€/an de run — soit ~80-180 k€ sur 3 ans, contre ~215 k€ pour un ChatGPT Enterprise équivalent. Au-delà de 100-150 utilisateurs réguliers, le local devient compétitif sur le seul critère financier.
Pourquoi l’IA locale est plus qu’une astuce technique
On a volontairement gardé cet argument pour la fin, parce qu’il ne devrait pas être un préalable idéologique — mais il pèse lourd une fois qu’on a goûté au local.
Rien ne sort. Jamais. Pas de conditions d’utilisation à éplucher, pas de question « ce prompt sera-t-il utilisé pour entraîner le modèle ? », pas de transfert de données vers les États-Unis, pas de dépendance au Data Privacy Framework — ce cadre juridique contesté dont les deux prédécesseurs (Safe Harbor, Privacy Shield) ont été invalidés par la justice européenne. Une IA locale élimine structurellement toute la classe de risques liée aux transferts, détaillée dans notre guide IA et RGPD.
Vous êtes irrévocablement autonome. Si un fournisseur change ses prix, ferme un service ou devient inaccessible, votre modèle local continue de tourner. C’est la seule architecture qui résiste à la rupture d’un fournisseur unique — le cœur de l’argument développé dans notre guide de l’IA souveraine.
Chez DPLIANCE, c’est une conviction fondatrice : la vie privée est un droit, pas une option de configuration. L’IA locale est la traduction la plus concrète de ce principe — et pour les secteurs régulés (santé, voir notre guide IA et HDS), c’est souvent la seule architecture défendable.
Ce qu’on refuse de promettre
Trois raccourcis qu’on entend souvent — et qu’on refuse de reprendre à notre compte.
« Installe Ollama, tu as l’équivalent de ChatGPT gratuit. » Pas exactement. Un modèle local 7-24B couvre remarquablement les tâches courantes, mais les modèles propriétaires de pointe gardent 10-20 % d’avance sur le raisonnement complexe et le code avancé. Le local se choisit pour la confidentialité, le coût marginal nul et l’autonomie — pas en prétendant que la performance est strictement identique.
« C’est en local, donc plus besoin de RGPD. » Faux. Le local supprime les problématiques de transfert, pas les obligations de fond : registre des traitements, AIPD pour les usages à risque, formation des utilisateurs (article 4 AI Act). Le mode de déploiement facilite la conformité, il ne la remplace pas.
« Ollama tient la production pour 200 utilisateurs. » Non. Ollama est un excellent outil de POC et d’usage individuel ; une production multi-utilisateurs exige vLLM ou équivalent, un GPU dimensionné, du monitoring et un plan de mise à jour. Sauter cette marche, c’est transformer un actif souverain en point de fragilité.
Ce type de déploiement, nous le concevons et le mettons en production — c’est notre métier d’agence Data/IA. Quand une solution sur mesure inclut un LLM local ou on-premise, on prend la stack complète : choix du modèle, dimensionnement matériel, vLLM ou Mistral Inference, RAG sur votre base documentaire, intégration SI — en stack souveraine européenne.
FAQ
Faut-il un GPU pour installer une IA en local ?
Non pour essayer, oui pour un usage confortable. Sur CPU seul (via llama.cpp, le moteur sous Ollama), un modèle 7-8B quantifié tourne à 1-5 tokens/seconde — utilisable en batch, pénible en conversation. Un Mac avec puce Apple Silicon (mémoire unifiée) offre déjà une expérience fluide sur les modèles 7-24B. Un GPU NVIDIA avec 24 Go de VRAM (RTX 4090) fait tourner Mistral Small 3 ou Llama 3.1-8B avec une latence très confortable. Les GPU datacenter (A100/H100) ne deviennent nécessaires qu’en usage multi-utilisateurs.
Ollama ou LM Studio : lequel choisir ?
Ollama si vous êtes à l’aise avec un terminal et que vous voulez une API locale pour brancher des outils (scripts, RAG, extensions) : une commande, un modèle, un serveur REST compatible OpenAI. LM Studio si vous préférez une interface graphique : recherche de modèles intégrée, chat visuel, réglages de quantification à la souris, serveur local optionnel. Les deux sont gratuits pour un usage personnel et s’appuient sur les mêmes modèles open-weight. Beaucoup d’utilisateurs commencent par LM Studio puis passent à Ollama quand ils veulent automatiser.
Quel modèle IA locale avec 8 ou 16 Go de RAM ?
Avec 8 Go : visez les petits modèles — Phi-3 mini, Gemma 2 en version quantifiée — corrects pour le résumé, la reformulation, la classification simple. Avec 16 Go : Mistral 7B ou Llama 3.1-8B quantifiés en 4-bit deviennent confortables et couvrent la plupart des tâches rédactionnelles courantes. À partir de 32 Go de RAM (ou 24 Go de VRAM GPU), Mistral Small 3 (24B) offre un vrai saut de qualité, proche de GPT-4o-mini.
Une IA locale est-elle aussi performante que ChatGPT ?
Pas tout à fait, mais l’écart s’est resserré. Les meilleurs modèles open-weight 2026 (Mistral Small 3, Llama 3.3-70B, DeepSeek-V3) offrent 80-90 % de la qualité des modèles propriétaires de pointe sur les tâches métier courantes — rédaction, synthèse, extraction, classification, traduction. L’écart reste visible sur le raisonnement multi-étapes complexe et le code avancé. Pour un usage quotidien sur des documents que vous ne voulez pas envoyer dans un cloud, un modèle local bien choisi suffit largement.
Installer une IA en local est-il gratuit ?
Oui, si vous avez déjà la machine. Ollama et LM Studio sont gratuits, les modèles open-weight (Mistral, Llama, Qwen, Gemma, Phi) se téléchargent librement. Le seul coût est matériel : un laptop 16 Go suffit pour débuter, un poste avec RTX 4090 (~2 500 € le GPU) couvre un usage individuel exigeant, un serveur GPU A100 (25-40 k€) couvre 50-100 utilisateurs en entreprise. Aucun abonnement, aucun coût par requête.
Comment passer d’Ollama à un vrai LLM on-premise pour toute l’entreprise ?
Ollama est parfait pour le POC et l’usage individuel, mais n’est pas conçu pour la haute concurrence. Pour servir des dizaines ou centaines d’utilisateurs : migrer vers vLLM ou Text Generation Inference (API compatible OpenAI, donc migration du code triviale), sur un serveur GPU dédié (A100 80 Go ou AMD MI300X), avec SSO, journalisation et monitoring. Compter 3 à 6 mois pour un déploiement production intégré au SI, contre moins d’une semaine pour un POC.
Une IA locale est-elle conforme RGPD par défaut ?
Elle simplifie énormément la conformité — aucune donnée ne sort, donc zéro problématique de transfert hors UE, zéro dépendance au Data Privacy Framework — mais elle ne dispense de rien. Le traitement doit être inscrit au registre, une AIPD reste obligatoire pour les usages à risque élevé, et la formation des utilisateurs reste exigée (article 4 AI Act). Le local facilite la conformité, il ne la remplace pas.
Sources : documentation Ollama (ollama.com) ; documentation LM Studio (lmstudio.ai) ; Mistral AI, documentation modèles open-weight (mistral.ai) ; Meta, Llama 3.x model cards (llama.meta.com) ; documentation vLLM, Text Generation Inference, llama.cpp ; ANSSI, recommandations sécurité IA générative ; Règlement (UE) 2024/1689 (AI Act).
Pour aller plus loin — architecture souveraine, RAG interne, conformité — voir notre guide de l’IA souveraine, notre guide IA et RGPD, notre comparatif Le Chat (Mistral) vs ChatGPT, ou contactez-nous via nos solutions IA sur mesure.