Handleiding · 6 min lezen
Lokale AI draaien op je Mac
Je Mac heeft al alles wat nodig is om een serieus taalmodel te draaien — geen cloud, geen API-sleutels, geen maandelijkse rekening. Deze handleiding behandelt de drie eenvoudigste manieren, hoeveel RAM je echt nodig hebt en hoe je het model in Telegram aan het werk zet.
Waarom modellen lokaal draaien?
Drie redenen, in volgorde van hoe vaak mensen er echt om geven:
- Privacy. Je prompts en chatgeschiedenis verlaten nooit de machine.
- Het is gratis. Geen prijs per token, geen abonnementen — alleen elektriciteit.
- Het werkt offline. Geen internet, geen probleem. Vliegtuigmodus inbegrepen.
Het compromis zit in de hardware: grotere modellen hebben meer RAM nodig en draaien langzamer dan een top-cloud-API. Voor het meeste dagelijkse assistentwerk — herinneringen, samenvattingen, opstellen, vragen beantwoorden — is een goed gekozen lokaal model echt goed genoeg.
De drie manieren om modellen te draaien
mlx-serve — het snelst op Apple Silicon
Apple's MLX-framework is speciaal gebouwd voor de unified memory van Apple Silicon, en mlx-serve is de eenvoudigste manier om er een OpenAI-compatibele server van te maken. Het is het standaardbrein voor Telebot AI — start het, richt de bot op http://localhost:11234, klaar.
pip install mlx-serve mlx-serve
Ollama — één commando, enorme modelbibliotheek
Ollama is niet voor niets de populairste lokale runtime: één keer installeren, daarna haal je met één commando elk model uit een grote bibliotheek. Bovendien spreekt het out of the box de OpenAI-compatibele API.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — klik en klaar
Als je een GUI prefereert, verpakt LM Studio alles in een nette app: modellen doorbladeren, downloaden, chatten en een lokale API-server draaien — allemaal zonder een terminal aan te raken.
Hoeveel RAM heb je nodig?
Het eerlijke antwoord is de modelgrootte — een model met 7 miljard parameters heeft bij typische quantisatie ruwweg 5–7 GB geheugen nodig, plus ruimte voor het systeem. Grove richtlijn voor M-serie-Macs:
| RAM | Comfortabele modelgrootte | Goede keuzes |
|---|---|---|
| 8 GB | 1–3B parameters | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B parameters | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B parameters | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ parameters | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Vuistregel: kies het grootste model dat in de helft van je RAM past — zo blijft de rest over voor het besturingssysteem, je browser en de bot zelf.
Het aan Telegram koppelen
Zodra een lokale server draait, kan elke OpenAI-compatibele client hem gebruiken. Telebot AI is een macOS-menubalk-app die je Telegram-bots precies aan die server koppelt — of aan elke cloud-API — met automatische back-ups, geheugen en 30+ tools zoals herinneringen, weer en aandelen.
Aan de slag duurt ongeveer twee minuten: download de app, plak je @BotFather-token en richt hem op localhost. Alles — geschiedenis, herinneringen, vaardigheden — blijft in ~/.mlx-serve op je Mac.