Tu vas monter un agent IA qui tourne entièrement sur ton Mac, sans envoyer une seule ligne vers un serveur cloud. On installe Ollama, on télécharge un modèle adapté à ta machine, puis on teste en ligne de commande. Zéro code, 30 minutes chrono, captures à l’appui. À la fin, tu auras une API locale prête pour tes workflows privés.
Ce qu’il faut retenir
– Ollama fait le pont entre tes applications et un modèle LLM local comme Llama 3.1, et expose une API HTTP locale sur le port 11434.
– Sur un Mac équipé de 16 Go de RAM, un modèle 7B ou 8B instruct est le point idéal pour du raisonnement d’agent, selon le guide 2026 de Multi Agent AI.
– Le parcours tient en trois gestes : installer Ollama, choisir le modèle, valider avec une commande de test.
– Bonus : avec 32 Go, tu montes à un modèle 13B ou tu gardes plusieurs petits modèles en mémoire.
Ce dont tu as besoin avant de commencer
Tu n’as pas besoin de grand-chose, mais chaque élément compte. Il te faut un Mac avec au minimum 16 Go de RAM : c’est le seuil pour faire tourner un modèle 7B ou 8B en quantization Q4, d’après le guide Ollama de Multi Agent AI. Sous ce chiffre, tu vas ramer.
Tu as aussi besoin d’un accès administrateur pour installer un logiciel, et d’une connexion internet le temps de télécharger le modèle. Une fois le modèle sur ton disque, tu peux couper le wifi : tout tourne en local. C’est tout. Pas de clé API, pas de carte bancaire, pas de compte à créer.
Comprendre : à quoi sert vraiment Ollama
Ollama, c’est le maître d’hôtel entre toi et le modèle. Imagine un traducteur assis à ta table : tu parles français, le modèle « parle » en calculs bruts, et Ollama fait passer le message dans les deux sens. Concrètement, il installe un service en arrière-plan qui expose une API HTTP locale sur le port 11434.
Cette API est compatible avec le format OpenAI. Autrement dit, un outil conçu pour dialoguer avec ChatGPT peut parler à ton modèle local sans réécriture, juste en changeant l’adresse. C’est là tout l’intérêt pour un workflow privé : tes données ne quittent jamais ta machine. Pas de facture au token, pas de fuite possible vers un tiers.
Étape 1 — Installe le service Ollama sur macOS
Rends-toi sur le site officiel d’Ollama et télécharge la version macOS. L’installeur enregistre un service en arrière-plan qui démarre tout seul et expose l’API locale sur le port 11434, comme le détaille le guide 2026 de Multi Agent AI.
[capture: page de téléchargement Ollama, bouton « Download for macOS » entouré en vert]
Une fois l’installation terminée, ouvre le Terminal (Applications → Utilitaires → Terminal). Vérifie que tout est en place avec cette commande :
ollama --version
Si un numéro de version s’affiche, le service tourne. Tu vois ? Rien de sorcier. Si rien ne s’affiche ou si tu tombes sur une erreur « command not found », c’est que l’installeur n’a pas terminé son travail : relance-le et redémarre le Terminal.
[capture: fenêtre Terminal affichant le numéro de version d’Ollama]
Astuce
Le service Ollama démarre automatiquement à chaque allumage de ton Mac. Tu n’as rien à relancer à la main. Pour vérifier qu’il écoute bien, tu peux tapercurl http://localhost:11434dans le Terminal : un message « Ollama is running » confirme que la porte 11434 est ouverte.
Étape 2 — Choisis et télécharge le modèle adapté à ton Mac
C’est le choix qui fait ou défait ton setup. Un modèle trop gros pour ta RAM va se traîner ou refuser de démarrer. Un modèle trop petit va bâcler le raisonnement.
Pour la majorité des utilisateurs sur 16 Go de RAM, un modèle instruction-tuned de 7B ou 8B est le point idéal pour du raisonnement d’agent, selon Multi Agent AI. Deux valeurs sûres pour démarrer : Llama 3.1 8B ou Mistral 7B Instruct. Le suffixe « instruct » signifie que le modèle a été entraîné à suivre des consignes, pas juste à compléter du texte. C’est exactement ce que tu veux pour un agent.
Télécharge Llama 3.1 8B avec cette commande :
ollama pull llama3.1:8b
[capture: Terminal affichant la barre de progression du téléchargement du modèle]
Le fichier pèse plusieurs gigaoctets, laisse-le finir. Une fois récupéré, il reste sur ton disque : tu ne le télécharges qu’une fois.
Astuce
Tu hésites entre Llama et Mistral ? Prends Llama 3.1 8B pour commencer. Il gère bien le français et le suivi d’instructions. Tu pourras toujours tester Mistral 7B ensuite avec un simpleollama pull mistral: les deux cohabitent sans conflit sur ta machine.
Étape 3 — Teste le modèle en ligne de commande
Le moment de vérité. On envoie une requête minuscule au modèle pour confirmer que le runtime répond. Tape cette commande dans le Terminal :
ollama run llama3.1:8b "Reply with the single word ready."
Cette consigne demande au modèle de répondre par un seul mot : « ready ». C’est un test volontairement trivial. Si le modèle te renvoie « ready » (ou une variante très proche), ton agent local fonctionne. Le pont Ollama ↔ modèle est opérationnel.
[capture: Terminal affichant la commande et la réponse « ready » du modèle]
Cette étape sert à isoler les problèmes. Si la réponse arrive, tu sais que l’installation, le téléchargement et le runtime marchent, tous les trois. Si elle bloque, tu sais que le souci est en amont, pas dans ton application. C’est le réflexe d’un bon diagnostic : tu valides la brique de base avant d’empiler le reste.
La première réponse peut prendre quelques secondes : le modèle se charge en mémoire. Les requêtes suivantes seront plus rapides tant que le modèle reste « chaud », c’est-à-dire en mémoire vive.
Astuce
Reste dans la session interactive en tapant simplementollama run llama3.1:8bsans texte derrière. Tu ouvres un mode conversation où tu enchaînes les questions sans relancer la commande. Pour sortir, tape/bye. Pratique pour tester le comportement de ton modèle avant de le brancher sur une application.
Adapter ton setup aux tâches lourdes
Un test réussi, c’est bien. Un agent qui tient la charge, c’est mieux. Selon le poids de tes tâches, tu devras ajuster deux curseurs : le modèle et la RAM.
Pour du travail d’agent gourmand en outils — quand ton agent enchaîne les appels de fonctions, manipule des API, jongle avec plusieurs étapes — un 7B Instruct peut suffire, mais tu gagnes à monter vers un modèle 14B ou 32B, comme le note le guide de Multi Agent AI. Plus le modèle est gros, plus il garde le fil d’un raisonnement à plusieurs sauts. Le prix à payer : de la mémoire.
Côté RAM, les paliers sont nets. Avec 16 Go, tu es à l’aise sur un 7B/8B en Q4. Avec 32 Go, tu fais tourner confortablement un modèle 13B, ou tu gardes plusieurs petits modèles chauds en mémoire en même temps, toujours d’après la même source. Ce second scénario est intéressant pour un système multi-agent : un modèle rapide pour trier, un modèle plus costaud pour raisonner, sans recharger à chaque bascule.
Fais le calcul avant d’acheter du hardware. Passer de 16 à 32 Go double ta marge de manœuvre, mais un 8B bien choisi couvre déjà la plupart des usages d’un agent local. Inutile de viser un 32B si tes tâches restent simples : tu paierais de la latence pour rien. Commence petit, mesure, puis monte en gamme seulement quand tu butes sur un vrai plafond.
Erreurs courantes à éviter
– Choisir un modèle trop gros pour ta RAM. Un 13B sur 16 Go va nager. Respecte le palier 7B/8B tant que tu n’as pas 32 Go.
– Oublier le suffixe « instruct ». Un modèle de base non instruit complète du texte au lieu de suivre tes consignes. Pour un agent, prends toujours la version instruction-tuned.
– Couper le Terminal pendant lepull. Le téléchargement s’interrompt. Laisse la commande finir avant de fermer la fenêtre.
– Confondre lenteur et panne. La première requête charge le modèle en mémoire, d’où le délai. Ce n’est pas un bug, juste le temps de chauffe.
Récapitulatif du processus
Tu viens de monter un agent IA local en trois gestes. Reprenons le fil, dans l’ordre, pour que tu puisses le refaire les yeux fermés.
D’abord, tu as installé Ollama sur macOS : le service tourne en arrière-plan et ouvre l’API locale sur le port 11434. Ensuite, tu as choisi un modèle calibré pour ton Mac — Llama 3.1 8B sur 16 Go — et tu l’as récupéré avec ollama pull. Enfin, tu as validé le tout avec une commande de test qui a renvoyé « ready ».
À partir de là, tout est à ta portée. Tu peux brancher n’importe quel outil compatible OpenAI sur ton adresse locale, monter des workflows privés, ou faire grandir ton setup vers des modèles plus costauds. Tes données restent chez toi, sur ton disque.
Récap 30 secondes
1. Installer Ollama pour macOS depuis le site officiel.
2. Vérifier avecollama --version.
3. Télécharger le modèle :ollama pull llama3.1:8b.
4. Tester :ollama run llama3.1:8b "Reply with the single word ready.".
5. Réponse « ready » = agent local opérationnel.
À retenir
- 16 Go de RAM = 7B/8B en Q4. C’est le seuil minimum et le point idéal pour un agent local sur Mac, selon Multi Agent AI.
- 32 Go = un cran au-dessus. Tu fais tourner un 13B confortablement, ou tu gardes plusieurs modèles chauds pour un système multi-agent.
- 3 commandes suffisent. Installer,
pull,run: le test « ready » confirme que tout marche.
À suivre
Ton setup de base tient en 30 minutes, mais le terrain de jeu s’ouvre à peine. Le prochain chantier logique : brancher un vrai client sur ton API locale plutôt que le Terminal. Comme l’endpoint est compatible OpenAI, un framework d’agents existant peut pointer vers localhost:11434 sans réécriture lourde.
D’ici la fin de l’année, garde un œil sur les modèles instruct de nouvelle génération : chaque sortie repousse le rapport qualité/poids, et un 8B de fin 2026 rivalisera avec un 13B d’aujourd’hui. Concrètement, ta machine 16 Go gagnera en capacité sans que tu changes une vis. Le bon réflexe : refaire tourner le test « ready » à chaque nouveau modèle, et comparer la vitesse de réponse avant d’adopter.
FAQ
Quoi faire si mon modèle ne répond pas après l’installation ?
Vérifie d’abord que le service Ollama tourne bien en arrière-plan. Tape ollama --version dans le Terminal : si un numéro s’affiche, le service est actif. Sinon, relance l’installeur et redémarre le Terminal. Contrôle aussi que le port 11434 répond avec curl http://localhost:11434.
Est-ce que j’ai besoin de plus de 16 Go pour des tâches lourdes ?
Pas forcément, mais ça aide. Avec 32 Go de RAM, tu exécutes confortablement un modèle 13B, ou tu gardes plusieurs petits modèles chauds en mémoire, selon Multi Agent AI. Pour du travail gourmand en outils, un modèle 14B ou 32B tient mieux un raisonnement à plusieurs étapes.
Quel modèle choisir entre Llama 3.1 8B et Mistral 7B ?
Les deux sont de bons points de départ pour 16 Go. Llama 3.1 8B gère bien le français et le suivi de consignes ; Mistral 7B Instruct est un peu plus léger. Teste les deux : ils cohabitent sans conflit sur ta machine, et tu gardes celui qui répond le mieux à tes cas d’usage.
Est-ce que mes données partent vers un serveur ?
Non. Une fois le modèle téléchargé, tout le calcul se fait sur ton Mac. L’API vit sur localhost, ton disque garde le modèle. Tu peux même couper internet : ton agent continue de répondre. C’est tout l’intérêt d’un setup local pour des workflows privés.


