Guide · 6 min de lecture

Faire tourner de l'IA locale sur votre Mac

Votre Mac a déjà tout ce qu'il faut pour faire tourner un vrai modèle de langage — pas de cloud, pas de clés API, pas de facture mensuelle. Ce guide couvre les trois façons les plus simples de le faire, la RAM dont vous avez réellement besoin, et comment mettre le modèle au travail dans Telegram.

Pourquoi faire tourner les modèles en local ?

Trois raisons, dans l'ordre de ce qui compte vraiment pour les gens :

Le compromis, c'est le matériel : les gros modèles demandent plus de RAM et tournent moins vite qu'une API cloud de premier plan. Pour la plupart des tâches quotidiennes d'un assistant — rappels, résumés, rédaction, réponses aux questions — un modèle local bien choisi est vraiment suffisant.

Les trois façons de faire tourner des modèles

mlx-serve — le plus rapide sur Apple Silicon

Le framework MLX d'Apple est conçu spécifiquement pour la mémoire unifiée d'Apple Silicon, et mlx-serve est le moyen le plus simple d'obtenir un serveur compatible OpenAI. C'est le cerveau par défaut de Telebot AI — lancez-le, pointez le bot vers http://localhost:11234, terminé.

pip install mlx-serve
mlx-serve

Ollama — une commande, une énorme bibliothèque de modèles

Ollama est le runtime local le plus populaire pour une bonne raison : installez-le une fois, puis tirez n'importe quel modèle d'une grande bibliothèque avec une seule commande. Il parle aussi l'API compatible OpenAI nativement.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — pointez et cliquez

Si vous préférez une interface graphique, LM Studio emballe tout dans une app propre : parcourir les modèles, télécharger, discuter, et lancer un serveur API local — sans jamais toucher au terminal.

De combien de RAM avez-vous besoin ?

La réponse honnête, c'est la taille du modèle — un modèle de 7 milliards de paramètres a besoin d'environ 5–7 Go de mémoire en quantification typique, plus de la place pour le système. Guide approximatif pour les Mac M-series :

RAMTaille de modèle confortableBons choix
8 GB1–3B paramètresQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B paramètresLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B paramètresQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ paramètresQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Règle de base : choisissez le plus gros modèle qui tient dans la moitié de votre RAM — le reste est pour le système d'exploitation, votre navigateur et le bot lui-même.

Le connecter à Telegram

Une fois le serveur local lancé, n'importe quel client compatible OpenAI peut l'utiliser. Telebot AI est une app macOS dans la barre de menus qui connecte vos bots Telegram exactement à ce serveur — ou à n'importe quelle API cloud — avec des secours automatiques, la mémoire et plus de 30 outils comme les rappels, la météo et les actions.

Pour commencer, comptez environ deux minutes : téléchargez l'app, collez votre token @BotFather et pointez vers localhost. Tout — historique, souvenirs, compétences — reste dans ~/.mlx-serve sur votre Mac.

Télécharger Telebot AI