Mes lectures 0

Mes lectures

Guides

Mac : comment lancer un agent IA local en 30 min (2026)

Installer un agent IA qui tourne entièrement sur ton Mac ne prend que 30 minutes, sans frais mensuels ni connexion cloud obligatoire.

Boussole en laiton sur une carte, symbole d'un guide pas à pas pour installer une IA locale sur Mac.

Tu vas installer un agent IA qui tourne entièrement sur ton Mac, sans passer par le cloud. Zéro abonnement, zéro donnée envoyée ailleurs. Il te faut 30 minutes et un Mac avec 16 Go de RAM minimum.

Points clés – Ollama est devenu le standard pour l’IA locale : 170 000 étoiles sur GitHub et 52 millions de téléchargements de modèles par mois au premier trimestre 2026, selon ai-explorer.io. – Sur 16 Go de RAM, le point de départ recommandé est un modèle 7B ou 8B — Mistral 3 8B, Llama 3.1 8B ou Qwen 3 Coder 7B selon ton usage. – Un Mac M-series avec 32 Go gère confortablement des modèles 27-32B, et 64 Go ouvre la porte aux modèles 70B et plus. – Coût réel : 0 €. Tous les outils de ce guide sont gratuits et open source.

Prérequis

Tu as besoin de trois choses avant de commencer :

  • Un Mac Apple Silicon (M1, M2, M3 ou M4) avec 16 Go de RAM minimum. C’est le plancher pour faire tourner un modèle 7B ou 8B en quantization Q4, selon le guide de multiagentai.ai.
  • 10 Go d’espace disque libre au minimum (un modèle 8B pèse entre 4 et 5 Go, et tu vas en tester plusieurs).
  • Un accès terminal. Tu n’as pas besoin de savoir coder — copier-coller des commandes suffit largement.

Si ton Mac a 8 Go de RAM, ne t’inquiète pas : tu pourras quand même tester, mais avec des modèles plus légers. On y revient dans la section « Aller plus loin ».

Comprendre : à quoi sert un agent IA local

Un agent IA local, c’est comme avoir un artisan qui travaille chez toi, dans ton propre atelier, avec ses propres outils. Plutôt que d’envoyer chaque question à un prestataire extérieur, tu poses la question directement à quelqu’un installé dans la pièce d’à côté.

Concrètement : le modèle de langage tourne sur ton processeur, tes données ne quittent jamais ta machine, et tu ne paies rien par requête. C’est la différence entre appeler un consultant à chaque question et avoir un collègue à demeure.

L’inconvénient, c’est que ton « collègue » a la puissance de ton Mac, pas celle d’un centre de données entier. D’où l’importance de bien choisir son modèle selon ta configuration — c’est tout l’objet de ce guide.

Étape 1 — Installe Ollama sur ton Mac

Ollama est le moteur qui va faire tourner tes modèles en arrière-plan. C’est l’outil recommandé par les trois guides de référence sur l’IA locale en 2026, et il s’installe en un clic.

Rends-toi sur le site officiel d’Ollama, télécharge la version macOS, puis ouvre le fichier .dmg et glisse l’application dans ton dossier Applications. Lance-la une première fois : une icône apparaît dans ta barre de menu, en haut de l’écran.

Cette icône signifie que le service Ollama tourne désormais en arrière-plan et expose une API locale sur le port 11434, d’après le tutoriel détaillé d’ai-explorer.io. Tu n’as rien d’autre à configurer à ce stade.

[capture: icône Ollama dans la barre de menu macOS après installation]

Astuce : si l’icône n’apparaît pas tout de suite, ouvre le dossier Applications et double-clique sur Ollama manuellement. Le service met parfois quelques secondes à démarrer.

Étape 2 — Vérifie que le service tourne

Ouvre l’application Terminal (tu la trouves via Spotlight, Cmd + Espace puis tape « Terminal »). Tape cette commande :

ollama --version

Si tu vois un numéro de version s’afficher, le service tourne correctement. Si tu obtiens une erreur, relance l’application Ollama depuis le dossier Applications et réessaie.

[capture: terminal affichant le numéro de version après ollama --version]

Cette vérification prend dix secondes, mais elle t’évite de perdre du temps plus tard si le service n’a pas démarré. C’est la même logique que vérifier qu’une prise est branchée avant de dire que l’appareil est en panne.

Étape 3 — Choisis ton modèle selon ta RAM

C’est l’étape la plus importante du guide. Le bon modèle dépend directement de la mémoire de ton Mac.

Pour la majorité des utilisateurs avec 16 Go de RAM, un modèle 7B ou 8B instruction-tuned (entraîné pour suivre des consignes) est le point d’équilibre idéal pour le raisonnement d’un agent, selon multiagentai.ai. Si tu veux confier des tâches lourdes en appels d’outils à ton agent, il faudra monter vers un modèle 14B ou 32B.

Grâce à la mémoire unifiée des puces Apple Silicon, un Mac M-series avec 16 Go fait tourner confortablement des modèles jusqu’à 12-14B, 32 Go gère la tranche 27-32B, et 64 Go et plus ouvre l’accès aux modèles de la classe 70B, précise le guide de hybrid-llm.com. Un Mac tire donc un peu mieux parti de sa RAM qu’un PC classique équivalent.

Voici les trois choix recommandés en 2026 selon ton usage :

  • Usage généraliste, en français : Mistral 3 8B — bon en anglais, excellent en français, raisonnement solide et conversation naturelle, selon ai-explorer.io.
  • Code et développement : Qwen 3 Coder 7B, qui atteint 76,0 sur le benchmark HumanEval — le meilleur score pour un modèle de moins de 8 milliards de paramètres.
  • Raisonnement profond : DeepSeek R1 32B distillé, dont les performances en mathématiques et en logique se rapprochent des modèles propriétaires.

[capture: comparatif visuel des trois modèles recommandés selon l’usage]

Étape 4 — Télécharge et teste ton premier modèle

Dans le Terminal, télécharge et lance ton premier modèle avec une seule commande. Pour un usage généraliste sur 16 Go de RAM :

ollama run llama3.1:8b "Reply with the single word ready."

Le téléchargement prend quelques minutes selon ta connexion (comptez 4 à 5 Go). Une fois terminé, le modèle doit te répondre simplement « ready ». Si ça fonctionne, ton agent IA local est opérationnel.

[capture: réponse du modèle « ready » dans le terminal après la première commande]

Sur un Mac sans configuration particulière, tu peux t’attendre à une vitesse comparable à un usage CPU classique : entre 1 et 5 tokens par seconde pour un modèle 7B, contre 30 à 60 tokens par seconde sur une machine équipée d’un GPU dédié, selon les repères donnés par ai-explorer.io. Sur un Mac Apple Silicon récent, la mémoire unifiée accélère nettement ce chiffre en pratique.

Astuce : teste toujours un petit modèle en premier (comme llama3.1:8b) avant de télécharger un modèle de 40 Go. Ça confirme que tout fonctionne sans attendre une heure pour rien.

Étape 5 — Branche une interface graphique façon ChatGPT

Le terminal, c’est efficace, mais pas très confortable pour un usage quotidien. Une interface web locale type Open WebUI te donne une expérience proche de ChatGPT, connectée à ton Ollama.

Après l’installation d’une interface web locale, tu crées un compte : le premier compte créé récupère automatiquement les droits administrateur. Tu te retrouves alors avec une interface conversationnelle qui tourne à 100 % en local, comme le décrit ai-explorer.io.

[capture: interface web locale façon ChatGPT connectée à Ollama, écran de création de compte]

Tu peux dès maintenant tester des prompts classiques pour valider le comportement du modèle : « Explique la photosynthèse en 3 phrases », « Résume Cyrano de Bergerac en 100 mots », ou encore « Explique la blockchain en 50 mots ». Si les réponses sont cohérentes, ton installation est propre.

Étape 6 — Donne des capacités d’agent à ton modèle

Un chatbot répond à des questions. Un agent, lui, appelle des outils — recherche fichier, exécution de code, requête API — pour accomplir une tâche. C’est là que le choix du modèle redevient important : tous ne gèrent pas bien les appels d’outils.

Certains modèles supportent l’appel d’outils nativement tout en restant légers en mémoire grâce à leur architecture MoE (mixture of experts) — c’est le cas de modèles comme gemma4:26b, selon hybrid-llm.com. À l’inverse, un modèle de code comme qwen2.5-coder:14b gère mal l’appel d’outils, malgré de bonnes performances en génération de code brute.

Pour connecter ton agent local à un framework ou un script existant, Ollama expose une API compatible avec le SDK OpenAI. Tu changes simplement l’URL de base :

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # requis par le SDK, ignoré par Ollama
)

response = client.chat.completions.create(
    model="qwen3:14b",
    messages=[{"role": "user", "content": "Explain quicksort in Python"}]
)

[capture: code Python exécuté dans un éditeur, réponse du modèle local affichée]

Tu peux aussi fixer un rôle système précis pour orienter le comportement de ton agent, par exemple : « You are a terse senior engineer. Answer in code first, prose second. » Cette technique fonctionne aussi bien en local qu’avec une API cloud.

Étape 7 — Personnalise ton agent avec un Modelfile

Un Modelfile te permet de figer la personnalité, la température (le degré de créativité) et la fenêtre de contexte de ton agent, sans réécrire de code à chaque lancement.

Voici un exemple basé sur qwen3:14b :

FROM qwen3:14b
PARAMETER temperature 0.3
PARAMETER num_ctx 8192

Tu crées ensuite ton modèle personnalisé et tu le lances :

ollama create mon-agent -f ./Modelfile
ollama run mon-agent

[capture: fichier Modelfile ouvert dans un éditeur de texte, avec la commande ollama create dans le terminal juste en dessous]

Une température basse (0,3) donne des réponses plus prévisibles, utile pour un agent qui doit exécuter des tâches précises plutôt qu’improviser. Une fenêtre de contexte de 8192 tokens suffit pour la plupart des tâches d’agent courantes, comme résumer un fichier local avec une commande du type ollama run qwen3:14b "Summarize this file: $(cat README.md)".

Aller plus loin

Si ton Mac dispose de plus de RAM, tu peux monter en gamme. Voici les paliers à connaître pour 2026 :

RAM Mac (M-series)Modèles accessiblesExemple
16 Go7B-8B, jusqu’à 12-14BMistral 3 8B, Qwen 3 Coder 7B
32 Go13B confortable, 27-32BDeepSeek R1 32B distillé
64 Go et plus70B et plus, Q4 à Q8modèles de classe 70B

Pour les très gros modèles (30B et plus), il faut compter 32 à 64 Go de RAM, selon ai-explorer.io. Attention : les tags distillés de DeepSeek R1 (14B, 32B) tournent en local, mais pas le modèle complet à 671 milliards de paramètres — celui-là reste réservé aux infrastructures cloud.

Si tu manques de RAM (8 Go), privilégie des modèles compacts de 3 à 4 milliards de paramètres. Ils sacrifient un peu de qualité de raisonnement mais restent utilisables au quotidien.

Un modèle mérite une mention à part : Llama 4 Scout, qui offre 10 millions de tokens de contexte et un support multimodal natif (texte et images) — utile si ton agent doit traiter des documents longs ou des captures d’écran.

Sur le plan du coût, la différence avec le cloud est nette. Des développeurs travaillant sur des modèles propriétaires haut de gamme peuvent dépenser entre 500 et 2 000 dollars par mois en appels API, contre 0 € une fois le matériel amorti en local, selon les calculs de hybrid-llm.com. Sur une boucle de recherche approfondie tournant sur une pile locale, le coût par requête est descendu jusqu’à 0,22 dollar dans les tests documentés par la même source.

Pour comparer les modèles disponibles selon ton budget matériel, tu peux aussi consulter notre comparatif des meilleurs LLM locaux en 2026.

Récap 30 secondes – ✅ Installer Ollama depuis le site officiel – ✅ Vérifier le service avec ollama --version – ✅ Choisir un modèle 7B/8B pour 16 Go de RAM – ✅ Tester avec ollama run llama3.1:8b "Reply with the single word ready." – ✅ Ajouter une interface web pour un usage quotidien – ✅ Connecter via l’API compatible OpenAI pour un usage agent – ✅ Personnaliser avec un Modelfile

Astuces pro – Un modèle reste chargé en mémoire pendant 5 minutes par défaut après une requête. Si tu enchaînes les questions, cette valeur peut être ajustée pour éviter de recharger le modèle à chaque fois. – Pour améliorer la qualité sans faire exploser la taille du modèle, la quantization Q5_K_M offre une nette amélioration par rapport à Q4, pour environ 25 % de poids en plus. – Teste toujours un petit modèle (llama3.1:8b) avant de télécharger un modèle de 40 Go — ça évite de découvrir un problème de configuration après une longue attente. – Pour du code, sépare les usages : un modèle léger comme Qwen 3 Coder 7B pour l’autocomplétion rapide, un modèle plus lourd comme Devstral 2 (24B, 68,0 % sur SWE-bench Verified) pour les tâches complexes.

Erreurs courantesTélécharger un gros modèle sans tester d’abord : tu risques de perdre du temps sur un téléchargement de plusieurs dizaines de Go avant de découvrir que ta configuration ne suit pas. – Confondre un modèle de code avec un modèle d’agent : certains modèles de code, comme qwen2.5-coder:14b, gèrent mal l’appel d’outils malgré de bonnes performances en génération pure. – Ignorer le message « Error: model not found » : ça signifie simplement que le nom du modèle est mal orthographié ou n’a pas encore été téléchargé. Vérifie l’orthographe exacte avec ollama list. – Sous-estimer sa RAM disponible : le système d’exploitation et les autres applications ouvertes consomment aussi de la mémoire. Ferme les logiciels lourds avant de lancer un modèle proche de ta limite. – Oublier de vérifier le service Ollama : si l’API ne répond pas, l’erreur vient souvent du service qui ne tourne pas en arrière-plan, pas du modèle lui-même.

Récap

Tu as maintenant un agent IA fonctionnel sur ton Mac : Ollama installé, un modèle adapté à ta RAM téléchargé, une interface graphique branchée, et une connexion API prête pour un usage agent avec appel d’outils. Le tout sans dépense récurrente.

La suite logique consiste à affiner ton Modelfile pour ton cas d’usage précis, puis à connecter cet agent local à un framework plus large si tu veux orchestrer plusieurs agents entre eux — un sujet que nous détaillons dans notre guide sur la construction d’un système multi-agent.

FAQ

Quoi faire si Ollama affiche « Error: model not found » ?

Ce message signifie que le nom du modèle tapé ne correspond à rien de téléchargé ou de disponible. Vérifie l’orthographe exacte (avec les deux-points et le tag de version, comme llama3.1:8b), puis lance ollama list pour voir les modèles déjà présents sur ta machine.

Un Mac Intel peut-il faire tourner un agent IA local ?

Oui, mais les performances seront proches du mode CPU pur — entre 1 et 5 tokens par seconde pour un modèle 7B. Un Mac Apple Silicon (M1 à M4) reste bien plus adapté grâce à sa mémoire unifiée, qui accélère nettement l’inférence par rapport à un Mac Intel classique.

Quoi faire si mon Mac rame pendant l’inférence ?

Ferme les applications gourmandes en mémoire, et redescends d’un cran de taille de modèle (par exemple de 14B vers 7B). Le message « model requires more system memory » indique explicitement que la RAM disponible ne suffit pas pour le modèle choisi.

Peut-on combiner un agent local avec une API cloud en secours ?

Oui. Comme Ollama expose une API compatible avec le SDK OpenAI, tu peux basculer entre un modèle local et un modèle cloud simplement en changeant l’URL de base et la clé API dans ton code, sans réécrire ta logique d’agent.

Sources
Avatar photo
Transparence

Rédigé avec l'assistance d'outils d'IA générative à partir de sources primaires identifiées, puis vérifié et validé par Mohamed Meguedmi, fondateur et directeur éditorial de LaGazetteIA. Charte éditoriale · Tous ses articles