Guida · 6 min di lettura
Eseguire l'IA locale sul tuo Mac
Il tuo Mac ha già tutto il necessario per eseguire un modello linguistico serio — niente cloud, niente chiavi API, niente bolletta mensile. Questa guida copre i tre modi più semplici per farlo, quanta RAM ti serve davvero e come mettere il modello al lavoro in Telegram.
Perché eseguire i modelli in locale?
Tre ragioni, in ordine di quanto spesso importano davvero alle persone:
- Privacy. I tuoi prompt e la cronologia chat non lasciano mai la macchina.
- È gratis. Nessun prezzo per token, nessun abbonamento — solo elettricità.
- Funziona offline. Niente internet, nessun problema. Modalità aereo inclusa.
Il compromesso è l'hardware: i modelli più grandi richiedono più RAM e girano più lenti di un'API cloud di alto livello. Per la maggior parte del lavoro quotidiano di un assistente — promemoria, riepiloghi, bozze, risposte alle domande — un modello locale ben scelto è davvero sufficiente.
I tre modi per eseguire i modelli
mlx-serve — il più veloce su Apple Silicon
Il framework MLX di Apple è costruito apposta per la memoria unificata di Apple Silicon, e mlx-serve è il modo più semplice per ottenere un server compatibile con OpenAI. È il cervello predefinito per Telebot AI — avvialo, punta il bot su http://localhost:11234, fatto.
pip install mlx-serve mlx-serve
Ollama — un comando, enorme libreria di modelli
Ollama è il runtime locale più popolare per una buona ragione: installi una volta, poi scarichi qualsiasi modello da una grande libreria con un solo comando. Parla anche l'API compatibile con OpenAI fin da subito.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — punta e clicca
Se preferisci una GUI, LM Studio avvolge tutto in un'app pulita: sfoglia i modelli, scarica, chatta ed esegui un server API locale — tutto senza toccare un terminale.
Quanta RAM ti serve?
La dimensione del modello è la risposta onesta — un modello da 7 miliardi di parametri richiede circa 5–7 GB di memoria con la quantizzazione tipica, più spazio per il sistema. Guida approssimativa per i Mac della serie M:
| RAM | Dimensione modello comoda | Buone scelte |
|---|---|---|
| 8 GB | 1–3B parametri | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B parametri | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B parametri | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ parametri | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Regola pratica: scegli il modello più grande che sta nella metà della tua RAM — il resto serve al sistema operativo, al browser e al bot stesso.
Collegarlo a Telegram
Una volta che un server locale è in esecuzione, qualsiasi client compatibile con OpenAI può usarlo. Telebot AI è un'app della barra menu per macOS che collega i tuoi bot Telegram esattamente a quel server — o a qualsiasi API cloud — con fallback automatici, memoria e 30+ strumenti come promemoria, meteo e azioni.
Per iniziare bastano circa due minuti: scarica l'app, incolla il tuo token @BotFather e puntala su localhost. Tutto — cronologia, memorie, skill — resta in ~/.mlx-serve sul tuo Mac.