Guía · 6 min de lectura

Ejecutando IA local en tu Mac

Tu Mac ya tiene todo lo necesario para ejecutar un modelo de lenguaje serio — sin nube, sin claves de API, sin factura mensual. Esta guía cubre las tres formas más fáciles de hacerlo, cuánta RAM necesitas de verdad y cómo poner el modelo a trabajar en Telegram.

¿Por qué ejecutar modelos en local?

Tres razones, en orden de lo que más le importa a la gente:

La contra es el hardware: los modelos grandes necesitan más RAM y van más lentos que una API en la nube de primer nivel. Para la mayoría del trabajo cotidiano de un asistente — recordatorios, resúmenes, redacción, responder preguntas — un modelo local bien elegido es de sobra suficiente.

Las tres formas de ejecutar modelos

mlx-serve — lo más rápido en Apple Silicon

El framework MLX de Apple está construido específicamente para la memoria unificada de Apple Silicon, y mlx-serve es la forma más fácil de montar un servidor compatible con OpenAI. Es el cerebro por defecto de Telebot AI — inícialo, apunta el bot a http://localhost:11234, listo.

pip install mlx-serve
mlx-serve

Ollama — un comando, biblioteca de modelos enorme

Ollama es el runtime local más popular por una buena razón: instálalo una vez y baja cualquier modelo de una biblioteca enorme con un solo comando. También habla la API compatible con OpenAI de serie.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — apunta y haz clic

Si prefieres una interfaz gráfica, LM Studio lo envuelve todo en una app limpia: explora modelos, descarga, chatea y ejecuta un servidor de API local — todo sin tocar la terminal.

¿Cuánta RAM necesitas?

La respuesta honesta es el tamaño del modelo — un modelo de 7 mil millones de parámetros necesita unos 5–7 GB de memoria con cuantización típica, más espacio para el sistema. Guía aproximada para Macs M-series:

RAMTamaño de modelo cómodoBuenas opciones
8 GB1–3B parámetrosQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B parámetrosLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B parámetrosQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ parámetrosQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Regla práctica: elige el modelo más grande que quepa en la mitad de tu RAM — el resto queda para el sistema operativo, tu navegador y el propio bot.

Conectándolo a Telegram

Una vez que el servidor local está corriendo, cualquier cliente compatible con OpenAI puede usarlo. Telebot AI es una app de barra de menús para macOS que conecta tus bots de Telegram exactamente a ese servidor — o a cualquier API en la nube — con respaldos automáticos, memoria y más de 30 herramientas como recordatorios, clima y acciones.

Empezar toma unos dos minutos: descarga la app, pega tu token de @BotFather y apunta a localhost. Todo — historial, recuerdos, habilidades — se queda en ~/.mlx-serve en tu Mac.

Descargar Telebot AI