Guide · 6 Min. Lesezeit
Lokale KI auf deinem Mac betreiben
Dein Mac hat bereits alles, was ein ernsthaftes Sprachmodell braucht — keine Cloud, keine API-Keys, keine Monatsrechnung. Dieser Guide behandelt die drei einfachsten Wege, wie viel RAM du wirklich brauchst und wie du das Modell in Telegram einsetzt.
Warum Modelle lokal betreiben?
Drei Gründe, in der Reihenfolge, wie sehr sie die Leute wirklich interessieren:
- Datenschutz. Deine Prompts und dein Chatverlauf verlassen nie den Rechner.
- Es ist kostenlos. Keine Token-Preise, keine Abos — nur Strom.
- Es funktioniert offline. Kein Internet, kein Problem. Flugmodus inklusive.
Der Preis ist Hardware: Größere Modelle brauchen mehr RAM und sind langsamer als eine Top-Cloud-API. Für die meisten alltäglichen Assistenten-Aufgaben — Erinnerungen, Zusammenfassungen, Entwürfe, Fragen beantworten — ist ein gut gewähltes lokales Modell wirklich gut genug.
Die drei Wege, Modelle zu betreiben
mlx-serve — am schnellsten auf Apple Silicon
Apples MLX-Framework ist speziell für den Unified Memory von Apple Silicon gebaut, und mlx-serve ist der einfachste Weg zu einem OpenAI-kompatiblen Server. Es ist das Standard-Gehirn von Telebot AI — starten, Bot auf http://localhost:11234 zeigen, fertig.
pip install mlx-serve mlx-serve
Ollama — ein Befehl, riesige Modellbibliothek
Ollama ist aus gutem Grund der beliebteste lokale Runtime: einmal installieren, dann mit einem einzigen Befehl jedes Modell aus einer großen Bibliothek ziehen. Es spricht auch out-of-the-box die OpenAI-kompatible API.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — klicken und loslegen
Wenn du eine GUI bevorzugst, verpackt LM Studio alles in eine saubere App: Modelle durchstöbern, herunterladen, chatten und einen lokalen API-Server laufen lassen — ganz ohne Terminal.
Wie viel RAM brauchst du?
Die ehrliche Antwort ist die Modellgröße — ein Modell mit 7 Milliarden Parametern braucht bei typischer Quantisierung grob 5–7 GB Speicher, plus Platz fürs System. Grobe Orientierung für M-Series-Macs:
| RAM | Bequeme Modellgröße | Gute Wahl |
|---|---|---|
| 8 GB | 1–3B Parameter | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B Parameter | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B Parameter | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ Parameter | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Faustregel: Nimm das größte Modell, das in die Hälfte deines RAM passt — den Rest brauchen Betriebssystem, Browser und der Bot selbst.
Mit Telegram verbinden
Sobald ein lokaler Server läuft, kann ihn jeder OpenAI-kompatible Client nutzen. Telebot AI ist eine macOS-Menüleisten-App, die deine Telegram-Bots genau mit diesem Server verbindet — oder mit jeder Cloud-API — inklusive automatischer Fallbacks, Gedächtnis und über 30 Tools wie Erinnerungen, Wetter und Aktien.
Der Start dauert etwa zwei Minuten: App herunterladen, dein @BotFather-Token einfügen und auf localhost zeigen. Alles — Verlauf, Erinnerungen, Fähigkeiten — bleibt in ~/.mlx-serve auf deinem Mac.