Guía · 6 min de lectura
Ejecutando IA local en tu Mac
Tu Mac ya tiene todo lo necesario para ejecutar un modelo de lenguaje serio — sin nube, sin claves de API, sin factura mensual. Esta guía cubre las tres formas más fáciles de hacerlo, cuánta RAM necesitas de verdad y cómo poner el modelo a trabajar en Telegram.
¿Por qué ejecutar modelos en local?
Tres razones, en orden de lo que más le importa a la gente:
- Privacidad. Tus prompts y tu historial nunca salen de la máquina.
- Es gratis. Sin precio por token, sin suscripciones — solo electricidad.
- Funciona offline. Sin internet, sin problema. Modo avión incluido.
La contra es el hardware: los modelos grandes necesitan más RAM y van más lentos que una API en la nube de primer nivel. Para la mayoría del trabajo cotidiano de un asistente — recordatorios, resúmenes, redacción, responder preguntas — un modelo local bien elegido es de sobra suficiente.
Las tres formas de ejecutar modelos
mlx-serve — lo más rápido en Apple Silicon
El framework MLX de Apple está construido específicamente para la memoria unificada de Apple Silicon, y mlx-serve es la forma más fácil de montar un servidor compatible con OpenAI. Es el cerebro por defecto de Telebot AI — inícialo, apunta el bot a http://localhost:11234, listo.
pip install mlx-serve mlx-serve
Ollama — un comando, biblioteca de modelos enorme
Ollama es el runtime local más popular por una buena razón: instálalo una vez y baja cualquier modelo de una biblioteca enorme con un solo comando. También habla la API compatible con OpenAI de serie.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — apunta y haz clic
Si prefieres una interfaz gráfica, LM Studio lo envuelve todo en una app limpia: explora modelos, descarga, chatea y ejecuta un servidor de API local — todo sin tocar la terminal.
¿Cuánta RAM necesitas?
La respuesta honesta es el tamaño del modelo — un modelo de 7 mil millones de parámetros necesita unos 5–7 GB de memoria con cuantización típica, más espacio para el sistema. Guía aproximada para Macs M-series:
| RAM | Tamaño de modelo cómodo | Buenas opciones |
|---|---|---|
| 8 GB | 1–3B parámetros | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B parámetros | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B parámetros | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ parámetros | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Regla práctica: elige el modelo más grande que quepa en la mitad de tu RAM — el resto queda para el sistema operativo, tu navegador y el propio bot.
Conectándolo a Telegram
Una vez que el servidor local está corriendo, cualquier cliente compatible con OpenAI puede usarlo. Telebot AI es una app de barra de menús para macOS que conecta tus bots de Telegram exactamente a ese servidor — o a cualquier API en la nube — con respaldos automáticos, memoria y más de 30 herramientas como recordatorios, clima y acciones.
Empezar toma unos dos minutos: descarga la app, pega tu token de @BotFather y apunta a localhost. Todo — historial, recuerdos, habilidades — se queda en ~/.mlx-serve en tu Mac.