Installer Ollama : le Guide Complet 2026 (Windows, Mac, Linux)
Vous voulez faire tourner une IA comme ChatGPT directement sur votre ordinateur — sans abonnement, sans envoyer vos données à l'extérieur, et même sans connexion internet une fois installée. C'est exactement ce que permet Ollama.
Ce guide vous accompagne de zéro : de la vérification de votre machine à l'installation sur votre système, du premier modèle téléchargé jusqu'aux usages avancés (API, sorties JSON, vision, agents). Débutant ou développeur, vous trouverez ce qu'il vous faut.
⚡ L'essentiel en 30 secondes
Pour installer Ollama : rendez-vous sur ollama.com/download, installez le fichier correspondant à votre OS, puis lancez ollama pull mistral et ollama run mistral dans un terminal. En moins de 10 minutes, vous avez une IA locale fonctionnelle. Le facteur clé de performance, c'est la RAM : 8 Go minimum, 16 Go recommandé.
Comprendre
Qu'est-ce qu'Ollama, et pourquoi l'installer ?
Ollama est un logiciel gratuit et open source (licence MIT) qui télécharge et exécute des grands modèles de langage (LLM) directement sur votre machine, via une simple commande. Il fait pour les modèles d'IA ce que Docker fait pour les applications : il masque toute la complexité technique pour vous permettre de lancer une IA en une seule ligne.
Le problème qu'Ollama résout
Installer un modèle d'IA « à la main » est un cauchemar, même pour un développeur expérimenté : télécharger les poids du modèle (plusieurs gigaoctets), installer les bonnes versions de Python, PyTorch et CUDA, configurer des dizaines de paramètres, écrire le code pour charger le modèle… Plusieurs heures de galère. Ollama réduit tout ça à une commande, avec configuration automatique pour votre matériel.
Qu'est-ce qu'un LLM, au juste ?
Un LLM (Large Language Model, ou grand modèle de langage) est un programme entraîné sur d'énormes quantités de texte — livres, articles, code, pages web. Il n'a pas « appris » de réponses par cœur : quand vous lui posez une question, il génère sa réponse mot par mot, en prédisant à chaque étape le mot le plus probable. C'est ce qui lui permet de rédiger, résumer, traduire, coder ou expliquer un concept.
Pourquoi « local » change tout
Avec ChatGPT, votre question part vers les serveurs d'OpenAI aux États-Unis, y est traitée, puis la réponse revient. Avec Ollama, tout le calcul se fait sur votre propre machine : rien ne sort de votre ordinateur. Les conséquences sont concrètes.
| Aspect | ChatGPT (cloud) | Ollama (local) |
|---|---|---|
| Confidentialité | Vos données transitent par des serveurs tiers | Vos données restent sur votre machine |
| Coût | Abonnement mensuel ou paiement à l'usage | Gratuit après l'achat du matériel |
| Internet | Obligatoire | Optionnel une fois le modèle téléchargé |
| Confidentialité RGPD | À justifier (transfert hors UE) | Native (aucune donnée ne sort) |
| Disponibilité | Peut être saturé ou en maintenance | Toujours disponible |
| Personnalisation | Limitée | Totale (vos propres modèles) |
Pour une entreprise, ce dernier point est décisif : une IA locale est le socle d'une IA souveraine, où vos données ne quittent jamais votre périmètre et échappent au Cloud Act.
Ollama face aux autres outils
Ollama n'est pas le seul moteur d'inférence local. LM Studio propose une interface graphique plus accessible aux non-techniciens. llama.cpp offre un contrôle fin sur la quantization et tourne sur du matériel modeste. vLLM vise le débit sur GPU pour servir plusieurs utilisateurs en production. Ollama gagne sur la simplicité de mise en route et son excellente compatibilité avec des outils comme Open WebUI. C'est aujourd'hui la référence pour déployer une IA locale en entreprise.
Cas d'usageDans quels cas Ollama est-il utile ?
Ollama brille dès qu'un assistant en ligne ne convient pas : données confidentielles, contraintes réglementaires, budget serré ou travail hors ligne. Quelques situations concrètes en PME.
Cabinet d'avocats
Analyser des pièces couvertes par le secret professionnel sans jamais les envoyer à un service tiers. Impossible avec ChatGPT, naturel avec Ollama.
Expert-comptable
Traiter des données financières et fiscales de clients en local, dans le respect du RGPD, sans risque de fuite vers un cloud étranger.
PME industrielle
Interroger des documentations techniques, brevets ou procédés de fabrication sans exposer ses secrets industriels.
Développeur sous NDA
Obtenir de l'aide sur du code confidentiel sans le copier dans un outil en ligne, ce qui violerait l'accord de confidentialité.
Vérifier que votre machine est compatible
Bonne nouvelle : la plupart des ordinateurs de moins de 5-6 ans font tourner Ollama. Le facteur le plus important est la RAM (mémoire vive), car le modèle y est entièrement chargé quand il tourne.
| RAM disponible | Modèles utilisables | Expérience |
|---|---|---|
| 4 Go | Insuffisant | Ollama refuse de lancer les modèles |
| 8 Go | Modèles légers (~3B) | Fonctionnel mais limité |
| 16 Go | Modèles moyens (~7B) | Bonne expérience pour la plupart des usages |
| 32 Go | Grands modèles (~13B) | Excellente expérience |
| 64 Go et + | Très grands modèles (~70B) | Usage professionnel intensif |
Comment vérifier votre RAM
Windows : clic droit sur la barre des tâches → Gestionnaire des tâches → onglet Performances → Mémoire.
macOS : menu Pomme → À propos de ce Mac → la RAM est indiquée.
Linux : dans un terminal, tapez la commande ci-dessous.
# Afficher la mémoire vive totale
free -h
L'espace disque
Chaque modèle occupe de la place : environ 2 Go pour un petit modèle 3B, 4 Go pour un 7B, jusqu'à 40 Go pour un 70B. Gardez au moins 20 Go libres pour pouvoir en essayer plusieurs.
Le GPU : optionnel mais accélérateur
Une carte graphique n'est pas obligatoire — Ollama fonctionne très bien sur processeur (CPU). La différence se joue sur la vitesse : sans GPU, une réponse prend quelques secondes ; avec un GPU NVIDIA compatible, elle est quasi instantanée. Ollama détecte et utilise automatiquement un GPU NVIDIA, AMD (sous Linux) ou un Mac Apple Silicon.
| Composant | Minimum | Recommandé | Idéal |
|---|---|---|---|
| RAM | 8 Go | 16 Go | 32 Go |
| Disque | 10 Go libres | 50 Go libres | 100 Go+ (SSD) |
| Processeur | 64-bit moderne | Multicœur récent | Apple M1+ ou Intel i7+ |
| GPU | Non requis | NVIDIA 8 Go VRAM | NVIDIA 16 Go+ VRAM |
| Système | Windows 10+, macOS 11+, Linux moderne (Ubuntu 20.04+) | ||
Installer Ollama sur Windows
Sur Windows, l'installation passe par un installateur graphique classique, sans ligne de commande.
1Téléchargez l'installateur. Rendez-vous sur ollama.com/download et cliquez sur « Download for Windows ». Le fichier OllamaSetup.exe (environ 200 Mo) se télécharge.
2Lancez l'installation. Double-cliquez sur le fichier. Si Windows demande une confirmation, cliquez sur « Oui », puis sur « Install ». L'installation prend quelques secondes.
3Vérifiez l'installation. Ouvrez PowerShell (cherchez « PowerShell » dans le menu Démarrer) et tapez :
ollama --version
Si un numéro de version s'affiche, l'installation est réussie. Une icône de lama apparaît dans la zone de notification (en bas à droite) : c'est le service Ollama qui tourne en arrière-plan — c'est normal et nécessaire.
Installer Ollama sur macOS
Sur macOS, Ollama se distribue sous forme d'application à glisser dans le dossier Applications.
1Téléchargez l'application. Sur ollama.com/download, cliquez sur « Download for macOS ». Un fichier ZIP se télécharge.
2Installez. Double-cliquez sur le ZIP pour le décompresser, puis glissez Ollama.app dans votre dossier Applications.
3Lancez Ollama. Double-cliquez sur l'app. macOS peut demander de confirmer l'ouverture d'une application téléchargée : cliquez sur « Ouvrir ». Une icône de lama apparaît dans la barre de menu en haut.
4Vérifiez. Ouvrez le Terminal (Applications → Utilitaires → Terminal) :
ollama --version
Installer Ollama sur Linux (Ubuntu, Debian, Fedora)
Linux est le système le plus rapide à configurer. Une seule commande suffit — mais par sécurité, mieux vaut inspecter le script avant de l'exécuter plutôt que de le lancer à l'aveugle.
Méthode recommandée — script officiel
# Télécharger le script, le relire, puis l'exécuter
curl -fsSL https://ollama.com/install.sh -o ollama-install.sh
less ollama-install.sh
sh ollama-install.sh
Le script détecte votre distribution, installe les dépendances, configure Ollama comme service système (démarrage automatique) et détecte votre GPU s'il y en a un. Comptez 1 à 2 minutes.
Vérifier l'installation
ollama --version
sudo systemctl status ollama
Le service doit afficher active (running) en vert. En cas de souci, consultez les logs avec sudo journalctl -u ollama -f et redémarrez avec sudo systemctl restart ollama.
Support GPU NVIDIA sous Linux
# Vérifier que les drivers NVIDIA sont présents
nvidia-smi
# Sinon, les installer (Ubuntu)
sudo apt install nvidia-driver-535 -y
sudo reboot
Après redémarrage, Ollama détecte automatiquement le GPU. Pour les GPU AMD, Ollama passe par ROCm : vérifiez la compatibilité de votre carte sur la liste officielle ROCm avant d'installer les pilotes.
Notre équipe installe et configure Ollama + Open WebUI sur votre infrastructure, avec formation de vos équipes incluse.
Télécharger votre premier modèle et discuter avec l'IA
Ollama est installé, mais il lui manque l'essentiel : un modèle. C'est lui qui génère les réponses. Comprendre le nom d'un modèle aide à choisir.
Comprendre le nom d'un modèle
Le nom porte deux informations : sa famille et sa taille. Dans « Llama 3.2 3B », le « 3B » signifie 3 milliards de paramètres — les poids ajustables du réseau de neurones. Plus il y en a, plus le modèle est capable… et plus il consomme de mémoire. Un petit modèle n'est pas « mauvais » : il est plus rapide et légèrement moins précis sur le raisonnement complexe.
| Taille du modèle | RAM minimale | Usage typique |
|---|---|---|
| 1-3B | 4-8 Go | Questions simples, résumés, traduction |
| 7-8B | 8-16 Go | Code, rédaction, raisonnement courant |
| 13-14B | 16-32 Go | Analyse complexe, créativité |
| 70B | 64 Go+ | Recherche, usage professionnel intensif |
Télécharger un modèle
Ouvrez votre terminal (ou PowerShell) et lancez la commande pull. Pour débuter, Mistral est un excellent choix : développé en France, très bon en français, léger sur du matériel standard.
ollama pull mistral
Ollama contacte son registre, télécharge le modèle morceau par morceau (barre de progression), vérifie l'intégrité des fichiers et l'optimise pour votre machine. Comptez 2 à 10 minutes selon votre connexion. La commande est rejouable sans risque : relancée, elle vérifie les couches et met à jour le modèle si une nouvelle version existe.
Vérifier et lancer
# Vérifier que le modèle est installé
ollama list
# Lancer une conversation
ollama run mistral
Une invite >>> apparaît : tapez votre question et appuyez sur Entrée. Voici un aperçu d'une première conversation.
>>> Explique-moi ce qu'est le RGPD en deux phrases simples.
Le RGPD est une loi européenne qui protège les données
personnelles des citoyens. Elle oblige les entreprises à
demander votre accord avant de collecter vos données et à
les sécuriser.
>>> /bye
Pour quitter la session, tapez /bye. Félicitations : vous venez de faire tourner votre première IA locale, entièrement privée.
Quels modèles choisir en 2026 ?
Ollama donne accès à des dizaines de modèles. Plutôt que de courir après la dernière version, raisonnez par famille, chacune ayant sa personnalité.
| Modèle | Commande | Point fort |
|---|---|---|
| Mistral 🇫🇷 | ollama pull mistral | Développé en France, excellent en français, polyvalent |
| Llama | ollama pull llama3.2 | Très polyvalent, bon raisonnement, décliné en plusieurs tailles |
| Qwen | ollama pull qwen3 | Excellent multilingue, bon rapport taille/performance |
| Gemma | ollama pull gemma2:2b | Ultra-léger, idéal pour machines modestes |
| CodeLlama | ollama pull codellama | Spécialisé dans la génération de code |
Pour débuter en PME française, Mistral est notre recommandation : souverain, performant en français, et disponible en plusieurs tailles selon votre matériel. Ajoutez CodeLlama si vous développez beaucoup, et un modèle Gemma léger si votre machine est modeste.
Comprendre la quantization et la VRAM
Point technique mais essentiel si vous avez un GPU. Les modèles distribués par Ollama sont quantizés — compressés pour tenir dans moins de mémoire, au format Q4_K_M par défaut. La règle de dimensionnement : prévoyez à peu près autant de VRAM (la mémoire de la carte graphique) que la taille du fichier téléchargé, plus 1 à 2 Go pour le contexte.
- 8 Go de VRAM → un modèle 7B ou 8B
- 16 Go de VRAM → un modèle 13-14B
- 24 Go et plus → un modèle 32B
- Sans GPU → restez sur du 1-3B, sinon la génération devient pénible
Les commandes Ollama essentielles
Quelques commandes couvrent tout le cycle de vie d'un modèle. La plus utile au quotidien est ollama rm : les modèles s'accumulent vite, autant faire le ménage de ceux que vous ne testez plus.
# Lister les modèles installés
ollama list
# Télécharger (ou mettre à jour) un modèle
ollama pull mistral
# Lancer une conversation interactive
ollama run mistral
# Poser une question unique (pratique pour un script)
ollama run mistral "Quelle est la capitale de l'Australie ?"
# Voir les détails d'un modèle (taille, licence, paramètres)
ollama show mistral
# Supprimer un modèle pour libérer de l'espace
ollama rm mistral
# Voir les modèles en cours d'exécution
ollama ps
# Arrêter un modèle chargé en mémoire
ollama stop mistral
Rendre Ollama accessible sur votre réseau
Par défaut, Ollama n'écoute que sur 127.0.0.1:11434 — accessible uniquement depuis la machine où il est installé. Pour le rendre disponible depuis d'autres postes (par exemple pour brancher Open WebUI), il faut modifier la variable OLLAMA_HOST.
sudo systemctl edit ollama.service
# Ajouter dans l'éditeur :
[Service]
Environment="OLLAMA_HOST=0.0.0.0"
# Puis redémarrer
sudo systemctl restart ollama
# Windows (PowerShell)
$env:OLLAMA_HOST = "0.0.0.0"
ollama serve
# macOS (Terminal)
OLLAMA_HOST=0.0.0.0 ollama serve
Ollama devient alors accessible à l'adresse http://IP_DU_SERVEUR:11434 depuis n'importe quel appareil du réseau.
OLLAMA_HOST=0.0.0.0 rend l'API accessible sans aucune authentification : n'importe qui sur le réseau peut lister vos modèles, en télécharger, en supprimer et consommer votre GPU. Si l'accès distant est nécessaire, placez Ollama derrière un reverse proxy authentifié et restreignez le port au réseau local via le pare-feu. N'exposez jamais ce port directement sur internet.
Utiliser l'API Ollama avec Python
Ollama expose une API REST locale sur le port 11434, compatible avec le format OpenAI. Vous pouvez l'appeler depuis vos scripts de plusieurs façons.
Test rapide avec curl
curl http://localhost:11434/api/generate -d '{
"model": "mistral",
"prompt": "Résume les avantages de l'\''IA locale en 3 points.",
"stream": false
}'
Le client OpenAI, pointé sur Ollama
Comme l'API est compatible OpenAI, vous pouvez réutiliser la bibliothèque officielle en changeant simplement l'URL de base. Idéal pour migrer un code existant vers le local.
from openai import OpenAI
client = OpenAI(
base_url='http://localhost:11434/v1',
api_key='ollama' # valeur quelconque, non vérifiée
)
response = client.chat.completions.create(
model='mistral',
messages=[{'role': 'user', 'content': 'Bonjour !'}]
)
print(response.choices[0].message.content)
Sorties structurées (JSON) : des réponses exploitables par un programme
Quand vous branchez un LLM sur du code, vous ne voulez pas un paragraphe mais un JSON conforme à un schéma, directement utilisable. Ollama supporte les sorties structurées via le paramètre format, auquel on passe un schéma JSON.
import requests, json
schema = {
"type": "object",
"properties": {
"nom": {"type": "string"},
"priorite": {"type": "string"},
"urgent": {"type": "boolean"}
},
"required": ["nom", "priorite", "urgent"]
}
response = requests.post('http://localhost:11434/api/chat', json={
'model': 'mistral',
'messages': [{'role': 'user',
'content': 'Classe ce ticket : « impossible de me connecter »'}],
'format': schema,
'stream': False
})
print(json.loads(response.json()['message']['content']))
Le modèle renvoie un objet JSON valide que votre programme peut parser directement — idéal pour classer des demandes, extraire des données de documents, ou alimenter une base.
Avancé · 2026Tool calling : laisser l'IA appeler vos fonctions
Le tool calling (ou function calling) permet au modèle d'appeler vos propres fonctions — interroger une base, lancer un calcul, consulter une API interne — au lieu de simplement décrire ce qu'il ferait. C'est la brique de base des agents IA locaux.
import ollama
def stock_produit(reference: str) -> int:
# Ici vous interrogeriez votre vraie base
return {"REF-001": 42, "REF-002": 0}.get(reference, -1)
response = ollama.chat(
model='mistral',
messages=[{'role': 'user',
'content': 'Combien de REF-001 en stock ?'}],
tools=[stock_produit] # Ollama expose la fonction au modèle
)
# Le modèle décide d'appeler stock_produit("REF-001")
Le modèle détecte qu'il doit appeler la fonction, vous renvoie le nom et les arguments, votre code l'exécute et lui renvoie le résultat. C'est ainsi qu'on construit un assistant capable d'agir sur vos systèmes, entièrement en local.
Avancé · 2026Vision : analyser des images en local
Certains modèles sont multimodaux : ils comprennent aussi les images. Utile pour analyser une capture d'écran, lire un schéma, extraire du texte d'une photo de document — le tout sans envoyer l'image à un service tiers.
import ollama
response = ollama.chat(
model='llama3.2-vision',
messages=[{
'role': 'user',
'content': 'Décris le contenu de cette facture.',
'images': ['facture.jpg']
}]
)
print(response['message']['content'])
Un modèle de vision local ouvre la porte à des cas d'usage puissants pour une PME : lecture automatique de factures, analyse de plans, extraction de données depuis des documents scannés — en gardant tout sur votre infrastructure. C'est un socle idéal pour un système de RAG qui interroge vos documents.
DépannageRésoudre les problèmes courants
Ollama ne démarre pas après installation
Vérifiez que le service tourne. Sous Linux : systemctl status ollama. Sous Windows/macOS : cherchez l'icône du lama dans la barre — si absente, relancez l'application.
Le téléchargement d'un modèle échoue
Vérifiez votre connexion et votre espace disque. Si le téléchargement s'interrompt, relancez simplement ollama pull : Ollama reprend là où il s'était arrêté.
Les réponses sont très lentes
Votre machine utilise probablement le CPU seul. Vérifiez qu'Ollama détecte votre GPU : au lancement, la première ligne doit indiquer le GPU utilisé. Si vous voyez « CPU only », vérifiez l'installation de vos pilotes. Autre cause fréquente : un modèle trop gros qui déborde de la VRAM (voir la section quantization).
Erreur « model not found »
Le modèle n'est pas installé localement. Lancez ollama pull NOM_DU_MODELE avant ollama run.
Ollama n'est pas accessible depuis le réseau
Vérifiez que vous avez bien défini OLLAMA_HOST=0.0.0.0 et que le port 11434 n'est pas bloqué par votre pare-feu (tout en respectant les précautions de sécurité vues plus haut).
🎯 À retenir
- Ollama = IA locale en une commande.
ollama pullpour télécharger,ollama runpour discuter. Pas de configuration complexe. - La RAM est le facteur clé. 8 Go pour les petits modèles, 16 Go recommandé, 32 Go pour les grands.
- Avec un GPU, c'est la VRAM qui compte. Un modèle qui tient en VRAM est bien plus rapide qu'un modèle qui déborde.
- Gratuit, illimité, hors ligne. Aucun abonnement, aucune donnée qui sort — la base d'une IA conforme au RGPD.
- Une API compatible OpenAI. Sorties JSON, tool calling, vision : tout se pilote depuis Python, en local.
✓ Checklist d'installation
ollama --version fonctionne)systemctl status ollama)ollama pull mistral)ollama run mistral)Questions fréquentes sur Ollama
Oui. Ollama est open source sous licence MIT, utilisable en contexte commercial sans frais de licence. Les modèles ont leurs propres licences, généralement permissives pour un usage commercial (Mistral, Llama). Vérifiez la licence de chaque modèle sur le dépôt officiel d'Ollama en cas de doute.
Le téléchargement initial des modèles nécessite internet. Ensuite, une fois les modèles récupérés, tout le traitement se fait localement — vous pouvez couper la connexion. C'est ce qui rend Ollama adapté aux environnements sécurisés et aux données sensibles.
Non. Ollama fonctionne sur processeur (CPU) seul, mais les réponses sont plus lentes. Un GPU NVIDIA compatible, ou un Mac Apple Silicon, accélère la génération d'un facteur 5 à 20. Pour un usage confortable sans GPU, restez sur des modèles légers (1-3B).
Oui, la limite pratique est votre RAM (ou VRAM) disponible : chaque modèle actif occupe sa portion de mémoire. Sur 32 Go, vous pouvez par exemple faire tourner un modèle 7B et un modèle léger simultanément.
Sur Windows et macOS, téléchargez la nouvelle version depuis ollama.com et relancez l'installation, elle remplace l'ancienne. Sur Linux, relancez le script d'installation officiel : il gère la mise à jour automatiquement.
LM Studio propose une interface graphique complète, plus accessible aux non-techniciens, mais moins flexible pour une intégration serveur. Ollama est orienté ligne de commande et API, idéal pour brancher Open WebUI ou automatiser via des scripts. Pour un usage PME avec serveur partagé, Ollama est notre recommandation.
Ollama lui-même ne transmet aucune donnée : le traitement est 100 % local, ce qui en fait une base naturellement compatible RGPD, sans transfert hors UE à documenter. La conformité globale dépend ensuite de la façon dont vous déployez et gouvernez la solution (droits d'accès, journalisation). C'est précisément ce qu'apporte une démarche d'IA souveraine encadrée.
Passez d'Ollama installé à une IA d'entreprise complète
Ollama, c'est le moteur. Pour une solution utilisable par toute votre équipe — interface web, connexion à vos documents, gouvernance et formation — notre équipe déploie tout, clé en main, sur votre infrastructure.
