Comment installer un LLM en local sur son PC avec Ollama

Ollama en test réel : contexte et configuration

Faire tourner une IA directement sur son PC, sans cloud, sans abonnement, sans que vos données quittent votre machine — c’est exactement ce que permet Ollama. Testé pendant trois semaines sur deux configurations différentes : un PC fixe sous Windows 11 avec une RTX 3060 (12 Go VRAM) et un laptop sous macOS avec puce M2. Objectif : savoir si un débutant complet peut installer et utiliser un LLM local sans toucher à une ligne de code compliquée.

Spoiler : oui. Mais avec des nuances selon votre matériel.

Méthodologie du test

Quatre critères évalués sur une échelle de 1 à 5 :

  • Facilité d’installation — temps réel mesuré, nombre d’étapes
  • Performance des modèles — vitesse de génération (tokens/seconde), cohérence des réponses
  • Consommation ressources — RAM, VRAM, CPU pendant l’utilisation
  • Accessibilité débutant — documentation, gestion des erreurs, interface

Modèles testés : Llama 3.2 3B, Mistral 7B et Gemma 2 9B. Les trois sont disponibles gratuitement via Ollama.

Installation pas à pas — ce qui se passe vraiment

Étape 1 : télécharger Ollama

Rendez-vous sur ollama.com, téléchargez l’installateur selon votre système (Windows, macOS, Linux). Le fichier pèse environ 100 Mo. Installation classique, type “next → next → finish”. Durée réelle : 2 minutes.

Étape 2 : lancer un modèle

Ouvrez votre terminal (PowerShell sur Windows, Terminal sur Mac) et tapez :

ollama run llama3.2

Ollama télécharge automatiquement le modèle (environ 2 Go pour Llama 3.2 3B). Une barre de progression s’affiche. Au premier lancement : comptez 5 à 8 minutes selon votre connexion. Ensuite, le modèle est en cache — il démarre en moins de 10 secondes.

Étape 3 : utiliser l’interface

Vous pouvez chatter directement dans le terminal. Mais si vous préférez une interface visuelle, LM Studio propose une interface graphique complète pour utiliser des IA en local — compatible avec les modèles Ollama. Alternative : installer Open WebUI via Docker pour obtenir une interface proche de ChatGPT, hébergée localement.

Résultats détaillés par critère

Critère Score /5 Détail
Facilité d’installation 5/5 Un fichier à télécharger, une commande à lancer. Rien de plus.
Performance (RTX 3060) 4/5 Mistral 7B : ~35 tokens/sec. Fluide, agréable à utiliser.
Performance (M2) 5/5 Gemma 2 9B : ~45 tokens/sec grâce à l’accélération Metal.
Consommation ressources 3/5 Mistral 7B exige 8 Go RAM minimum. Llama 3.2 3B tourne avec 6 Go.
Accessibilité débutant 4/5 Documentation claire, mais le terminal déroute certains utilisateurs.

Ce qui a fonctionné — ce qui a décevé

Les bons points

  • Confidentialité totale : aucune donnée ne quitte votre machine. Idéal pour documents sensibles, données RH, projets confidentiels.
  • Zéro abonnement : une fois installé, c’est gratuit à vie.
  • Choix des modèles : plus de 80 modèles disponibles dans la bibliothèque Ollama (Llama, Mistral, Gemma, Phi, CodeLlama…).
  • API locale intégrée : Ollama expose automatiquement une API REST — parfait si vous voulez l’intégrer à vos propres scripts.

Les limites réelles

  • Matériel minimum requis : 8 Go de RAM pour les petits modèles, 16 Go conseillés pour les 7B+. Sur une machine vieille de 10 ans avec 4 Go de RAM, inutile d’essayer.
  • Qualité inférieure à ChatGPT ou Claude sur les tâches complexes — les modèles locaux restent en retrait sur le raisonnement avancé. Pour comprendre pourquoi, l’article sur le fonctionnement de ChatGPT éclaire bien les différences d’architecture.
  • Pas de multimodalité par défaut : pas d’analyse d’image ni de génération audio dans la version de base.
  • Terminal obligatoire pour l’installation initiale — un frein pour les débutants absolus.

Pour qui c’est adapté — pour qui ça ne l’est pas

Ollama est fait pour vous si…

  • Vous traitez des données confidentielles et refusez le cloud
  • Vous voulez une IA gratuite sans limite de messages ni d’abonnement
  • Vous avez au moins 8 Go de RAM et un PC relativement récent (moins de 5 ans)
  • Vous êtes à l’aise avec un terminal, même basiquement
  • Vous voulez expérimenter, coder, personnaliser vos modèles

Passez votre chemin si…

  • Votre PC tourne sous Windows 10 avec 4 Go de RAM — l’expérience sera catastrophique
  • Vous avez besoin de la puissance de GPT-4 ou Claude pour des tâches critiques
  • Vous n’avez jamais ouvert un terminal et l’idée vous panique

FAQ — les questions que vous allez vous poser

Ollama est-il gratuit ?

Oui, entièrement gratuit et open source. Vous téléchargez les modèles une fois, ils fonctionnent ensuite hors ligne, sans aucun coût récurrent.

Quel modèle choisir pour débuter ?

Llama 3.2 3B si vous avez 6–8 Go de RAM : rapide, léger, surprenant pour sa taille. Mistral 7B si vous avez 12 Go+ : meilleure qualité de réponse, excellent rapport qualité/poids.

Ollama fonctionne-t-il sans carte graphique dédiée ?

Oui. Ollama tourne en mode CPU si vous n’avez pas de GPU. C’est plus lent (5–10 tokens/sec au lieu de 35+), mais tout à fait utilisable pour les petits modèles comme Llama 3.2 3B.

Quelle est la différence entre Ollama et LM Studio ?

Ollama est un moteur en ligne de commande, léger et pilotable via API. LM Studio ajoute une interface graphique complète. Les deux sont complémentaires : Ollama pour les utilisateurs qui veulent de la flexibilité, LM Studio pour ceux qui préfèrent le clic-bouton.

Verdict

Ollama est l’outil le plus simple qui existe pour faire tourner un LLM en local sur un PC standard. L’installation prend moins de 10 minutes, les modèles sont gratuits, et la confidentialité est totale. La seule barrière réelle reste le matériel : en dessous de 8 Go de RAM, ne vous lancez pas. Pour tout le reste, c’est une entrée en matière sérieuse dans l’IA locale — sans compromis sur la facilité.

Pour approfondir votre culture sur les concepts autour de l’IA, consultez le Lexique & Culture de l’IA — Guide Complet : définitions, comparatifs et guides pratiques classés par niveau.