Guide · 6 min de lecture
Faire tourner de l'IA locale sur votre Mac
Votre Mac a déjà tout ce qu'il faut pour faire tourner un vrai modèle de langage — pas de cloud, pas de clés API, pas de facture mensuelle. Ce guide couvre les trois façons les plus simples de le faire, la RAM dont vous avez réellement besoin, et comment mettre le modèle au travail dans Telegram.
Pourquoi faire tourner les modèles en local ?
Trois raisons, dans l'ordre de ce qui compte vraiment pour les gens :
- Confidentialité. Vos prompts et votre historique ne quittent jamais la machine.
- C'est gratuit. Pas de prix par token, pas d'abonnement — juste de l'électricité.
- Ça marche hors ligne. Pas d'internet, pas de problème. Mode avion inclus.
Le compromis, c'est le matériel : les gros modèles demandent plus de RAM et tournent moins vite qu'une API cloud de premier plan. Pour la plupart des tâches quotidiennes d'un assistant — rappels, résumés, rédaction, réponses aux questions — un modèle local bien choisi est vraiment suffisant.
Les trois façons de faire tourner des modèles
mlx-serve — le plus rapide sur Apple Silicon
Le framework MLX d'Apple est conçu spécifiquement pour la mémoire unifiée d'Apple Silicon, et mlx-serve est le moyen le plus simple d'obtenir un serveur compatible OpenAI. C'est le cerveau par défaut de Telebot AI — lancez-le, pointez le bot vers http://localhost:11234, terminé.
pip install mlx-serve mlx-serve
Ollama — une commande, une énorme bibliothèque de modèles
Ollama est le runtime local le plus populaire pour une bonne raison : installez-le une fois, puis tirez n'importe quel modèle d'une grande bibliothèque avec une seule commande. Il parle aussi l'API compatible OpenAI nativement.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — pointez et cliquez
Si vous préférez une interface graphique, LM Studio emballe tout dans une app propre : parcourir les modèles, télécharger, discuter, et lancer un serveur API local — sans jamais toucher au terminal.
De combien de RAM avez-vous besoin ?
La réponse honnête, c'est la taille du modèle — un modèle de 7 milliards de paramètres a besoin d'environ 5–7 Go de mémoire en quantification typique, plus de la place pour le système. Guide approximatif pour les Mac M-series :
| RAM | Taille de modèle confortable | Bons choix |
|---|---|---|
| 8 GB | 1–3B paramètres | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B paramètres | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B paramètres | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ paramètres | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Règle de base : choisissez le plus gros modèle qui tient dans la moitié de votre RAM — le reste est pour le système d'exploitation, votre navigateur et le bot lui-même.
Le connecter à Telegram
Une fois le serveur local lancé, n'importe quel client compatible OpenAI peut l'utiliser. Telebot AI est une app macOS dans la barre de menus qui connecte vos bots Telegram exactement à ce serveur — ou à n'importe quelle API cloud — avec des secours automatiques, la mémoire et plus de 30 outils comme les rappels, la météo et les actions.
Pour commencer, comptez environ deux minutes : téléchargez l'app, collez votre token @BotFather et pointez vers localhost. Tout — historique, souvenirs, compétences — reste dans ~/.mlx-serve sur votre Mac.