Guia · 6 min de leitura

Executar IA local no seu Mac

O seu Mac já tem tudo o que é preciso para executar um modelo de linguagem a sério — sem nuvem, sem chaves de API, sem fatura mensal. Este guia cobre as três formas mais fáceis de o fazer, quanta RAM precisa realmente e como pôr o modelo a trabalhar no Telegram.

Porquê executar modelos localmente?

Três razões, pela ordem do que as pessoas realmente se importam:

O trade-off é o hardware: modelos maiores precisam de mais RAM e correm mais devagar do que uma API cloud de topo. Para a maioria do trabalho diário de um assistente — lembretes, resumos, rascunhos, responder a perguntas — um modelo local bem escolhido é genuinamente suficiente.

As três formas de executar modelos

mlx-serve — o mais rápido em Apple Silicon

O framework MLX da Apple é construído especificamente para a memória unificada do Apple Silicon, e o mlx-serve é a forma mais fácil de obter um servidor compatível com OpenAI. É o cérebro predefinido do Telebot AI — inicie-o, aponte o bot para http://localhost:11234, feito.

pip install mlx-serve
mlx-serve

Ollama — um comando, biblioteca de modelos enorme

O Ollama é o runtime local mais popular por boa razão: instale uma vez e puxe qualquer modelo de uma grande biblioteca com um único comando. Também fala a API compatível com OpenAI de série.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — aponte e clique

Se preferir uma interface gráfica, o LM Studio embrulha tudo numa app limpa: navegue por modelos, transfira, converse e execute um servidor de API local — tudo sem tocar no terminal.

De quanta RAM precisa?

A resposta honesta é o tamanho do modelo — um modelo de 7 mil milhões de parâmetros precisa de cerca de 5–7 GB de memória com quantização típica, mais espaço para o sistema. Guia aproximado para Macs M-series:

RAMTamanho de modelo confortávelBoas escolhas
8 GB1–3B parâmetrosQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B parâmetrosLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B parâmetrosQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ parâmetrosQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Regra prática: escolha o maior modelo que caiba em metade da sua RAM — o resto fica para o sistema operativo, o seu navegador e o próprio bot.

Ligá-lo ao Telegram

Assim que um servidor local estiver a correr, qualquer cliente compatível com OpenAI pode usá-lo. O Telebot AI é uma app de barra de menus para macOS que liga os seus bots Telegram exatamente a esse servidor — ou a qualquer API cloud — com recursos automáticos, memória e mais de 30 ferramentas como lembretes, meteorologia e ações.

Começar leva cerca de dois minutos: transfira a app, cole o seu token do @BotFather e aponte para localhost. Tudo — histórico, memórias, competências — fica em ~/.mlx-serve no seu Mac.

Transferir Telebot AI