Guide · 6 Min. Lesezeit

Lokale KI auf deinem Mac betreiben

Dein Mac hat bereits alles, was ein ernsthaftes Sprachmodell braucht — keine Cloud, keine API-Keys, keine Monatsrechnung. Dieser Guide behandelt die drei einfachsten Wege, wie viel RAM du wirklich brauchst und wie du das Modell in Telegram einsetzt.

Warum Modelle lokal betreiben?

Drei Gründe, in der Reihenfolge, wie sehr sie die Leute wirklich interessieren:

Der Preis ist Hardware: Größere Modelle brauchen mehr RAM und sind langsamer als eine Top-Cloud-API. Für die meisten alltäglichen Assistenten-Aufgaben — Erinnerungen, Zusammenfassungen, Entwürfe, Fragen beantworten — ist ein gut gewähltes lokales Modell wirklich gut genug.

Die drei Wege, Modelle zu betreiben

mlx-serve — am schnellsten auf Apple Silicon

Apples MLX-Framework ist speziell für den Unified Memory von Apple Silicon gebaut, und mlx-serve ist der einfachste Weg zu einem OpenAI-kompatiblen Server. Es ist das Standard-Gehirn von Telebot AI — starten, Bot auf http://localhost:11234 zeigen, fertig.

pip install mlx-serve
mlx-serve

Ollama — ein Befehl, riesige Modellbibliothek

Ollama ist aus gutem Grund der beliebteste lokale Runtime: einmal installieren, dann mit einem einzigen Befehl jedes Modell aus einer großen Bibliothek ziehen. Es spricht auch out-of-the-box die OpenAI-kompatible API.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — klicken und loslegen

Wenn du eine GUI bevorzugst, verpackt LM Studio alles in eine saubere App: Modelle durchstöbern, herunterladen, chatten und einen lokalen API-Server laufen lassen — ganz ohne Terminal.

Wie viel RAM brauchst du?

Die ehrliche Antwort ist die Modellgröße — ein Modell mit 7 Milliarden Parametern braucht bei typischer Quantisierung grob 5–7 GB Speicher, plus Platz fürs System. Grobe Orientierung für M-Series-Macs:

RAMBequeme ModellgrößeGute Wahl
8 GB1–3B ParameterQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B ParameterLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B ParameterQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ ParameterQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Faustregel: Nimm das größte Modell, das in die Hälfte deines RAM passt — den Rest brauchen Betriebssystem, Browser und der Bot selbst.

Mit Telegram verbinden

Sobald ein lokaler Server läuft, kann ihn jeder OpenAI-kompatible Client nutzen. Telebot AI ist eine macOS-Menüleisten-App, die deine Telegram-Bots genau mit diesem Server verbindet — oder mit jeder Cloud-API — inklusive automatischer Fallbacks, Gedächtnis und über 30 Tools wie Erinnerungen, Wetter und Aktien.

Der Start dauert etwa zwei Minuten: App herunterladen, dein @BotFather-Token einfügen und auf localhost zeigen. Alles — Verlauf, Erinnerungen, Fähigkeiten — bleibt in ~/.mlx-serve auf deinem Mac.

Telebot AI herunterladen