Guida · 6 min di lettura

Eseguire l'IA locale sul tuo Mac

Il tuo Mac ha già tutto il necessario per eseguire un modello linguistico serio — niente cloud, niente chiavi API, niente bolletta mensile. Questa guida copre i tre modi più semplici per farlo, quanta RAM ti serve davvero e come mettere il modello al lavoro in Telegram.

Perché eseguire i modelli in locale?

Tre ragioni, in ordine di quanto spesso importano davvero alle persone:

Il compromesso è l'hardware: i modelli più grandi richiedono più RAM e girano più lenti di un'API cloud di alto livello. Per la maggior parte del lavoro quotidiano di un assistente — promemoria, riepiloghi, bozze, risposte alle domande — un modello locale ben scelto è davvero sufficiente.

I tre modi per eseguire i modelli

mlx-serve — il più veloce su Apple Silicon

Il framework MLX di Apple è costruito apposta per la memoria unificata di Apple Silicon, e mlx-serve è il modo più semplice per ottenere un server compatibile con OpenAI. È il cervello predefinito per Telebot AI — avvialo, punta il bot su http://localhost:11234, fatto.

pip install mlx-serve
mlx-serve

Ollama — un comando, enorme libreria di modelli

Ollama è il runtime locale più popolare per una buona ragione: installi una volta, poi scarichi qualsiasi modello da una grande libreria con un solo comando. Parla anche l'API compatibile con OpenAI fin da subito.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — punta e clicca

Se preferisci una GUI, LM Studio avvolge tutto in un'app pulita: sfoglia i modelli, scarica, chatta ed esegui un server API locale — tutto senza toccare un terminale.

Quanta RAM ti serve?

La dimensione del modello è la risposta onesta — un modello da 7 miliardi di parametri richiede circa 5–7 GB di memoria con la quantizzazione tipica, più spazio per il sistema. Guida approssimativa per i Mac della serie M:

RAMDimensione modello comodaBuone scelte
8 GB1–3B parametriQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B parametriLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B parametriQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ parametriQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Regola pratica: scegli il modello più grande che sta nella metà della tua RAM — il resto serve al sistema operativo, al browser e al bot stesso.

Collegarlo a Telegram

Una volta che un server locale è in esecuzione, qualsiasi client compatibile con OpenAI può usarlo. Telebot AI è un'app della barra menu per macOS che collega i tuoi bot Telegram esattamente a quel server — o a qualsiasi API cloud — con fallback automatici, memoria e 30+ strumenti come promemoria, meteo e azioni.

Per iniziare bastano circa due minuti: scarica l'app, incolla il tuo token @BotFather e puntala su localhost. Tutto — cronologia, memorie, skill — resta in ~/.mlx-serve sul tuo Mac.

Scarica Telebot AI