Guia · 6 min de leitura
Executar IA local no seu Mac
O seu Mac já tem tudo o que é preciso para executar um modelo de linguagem a sério — sem nuvem, sem chaves de API, sem fatura mensal. Este guia cobre as três formas mais fáceis de o fazer, quanta RAM precisa realmente e como pôr o modelo a trabalhar no Telegram.
Porquê executar modelos localmente?
Três razões, pela ordem do que as pessoas realmente se importam:
- Privacidade. Os seus prompts e o seu histórico nunca saem da máquina.
- É grátis. Sem preço por token, sem subscrições — só eletricidade.
- Funciona offline. Sem internet, sem problema. Modo de avião incluído.
O trade-off é o hardware: modelos maiores precisam de mais RAM e correm mais devagar do que uma API cloud de topo. Para a maioria do trabalho diário de um assistente — lembretes, resumos, rascunhos, responder a perguntas — um modelo local bem escolhido é genuinamente suficiente.
As três formas de executar modelos
mlx-serve — o mais rápido em Apple Silicon
O framework MLX da Apple é construído especificamente para a memória unificada do Apple Silicon, e o mlx-serve é a forma mais fácil de obter um servidor compatível com OpenAI. É o cérebro predefinido do Telebot AI — inicie-o, aponte o bot para http://localhost:11234, feito.
pip install mlx-serve mlx-serve
Ollama — um comando, biblioteca de modelos enorme
O Ollama é o runtime local mais popular por boa razão: instale uma vez e puxe qualquer modelo de uma grande biblioteca com um único comando. Também fala a API compatível com OpenAI de série.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — aponte e clique
Se preferir uma interface gráfica, o LM Studio embrulha tudo numa app limpa: navegue por modelos, transfira, converse e execute um servidor de API local — tudo sem tocar no terminal.
De quanta RAM precisa?
A resposta honesta é o tamanho do modelo — um modelo de 7 mil milhões de parâmetros precisa de cerca de 5–7 GB de memória com quantização típica, mais espaço para o sistema. Guia aproximado para Macs M-series:
| RAM | Tamanho de modelo confortável | Boas escolhas |
|---|---|---|
| 8 GB | 1–3B parâmetros | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B parâmetros | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B parâmetros | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ parâmetros | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Regra prática: escolha o maior modelo que caiba em metade da sua RAM — o resto fica para o sistema operativo, o seu navegador e o próprio bot.
Ligá-lo ao Telegram
Assim que um servidor local estiver a correr, qualquer cliente compatível com OpenAI pode usá-lo. O Telebot AI é uma app de barra de menus para macOS que liga os seus bots Telegram exatamente a esse servidor — ou a qualquer API cloud — com recursos automáticos, memória e mais de 30 ferramentas como lembretes, meteorologia e ações.
Começar leva cerca de dois minutos: transfira a app, cole o seu token do @BotFather e aponte para localhost. Tudo — histórico, memórias, competências — fica em ~/.mlx-serve no seu Mac.