Poradnik · 6 min czytania
Uruchamianie lokalnego AI na Macu
Twój Mac ma już wszystko, czego trzeba, by uruchomić poważny model językowy — bez chmury, bez kluczy API, bez comiesięcznych rachunków. Ten poradnik omawia trzy najprostsze sposoby, ile RAM-u naprawdę potrzebujesz i jak wdrożyć model w Telegramie.
Po co uruchamiać modele lokalnie?
Trzy powody, w kolejności od tego, na czym ludziom faktycznie zależy:
- Prywatność. Twoje polecenia i historia czatów nigdy nie opuszczają komputera.
- Jest darmowe. Bez opłat za tokeny, bez subskrypcji — tylko prąd.
- Działa offline. Bez internetu? Nie ma problemu. Tryb samolotowy w cenie.
Kompromis to sprzęt: większe modele potrzebują więcej RAM-u i działają wolniej niż najlepsze API w chmurze. Do większości codziennej pracy asystenta — przypomnień, streszczeń, szkiców, odpowiedzi na pytania — dobrze dobrany lokalny model w zupełności wystarczy.
Trzy sposoby uruchamiania modeli
mlx-serve — najszybszy na Apple Silicon
Framework MLX od Apple powstał specjalnie dla scalonej pamięci Apple Silicon, a mlx-serve to najprostszy sposób, by uzyskać z niego serwer zgodny z OpenAI. To domyślny mózg dla Telebot AI — uruchom go, wskaż botowi http://localhost:11234 i gotowe.
pip install mlx-serve mlx-serve
Ollama — jedna komenda, ogromna biblioteka modeli
Ollama to najpopularniejszy lokalny runtime nie bez powodu: instalujesz raz, a potem ściągasz dowolny model z dużej biblioteki jedną komendą. Od razu po wyjęciu z pudełka mówi też zgodnym z OpenAI API.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — wskaż i kliknij
Jeśli wolisz GUI, LM Studio pakuje wszystko w schludną aplikację: przeglądaj modele, pobieraj, rozmawiaj i uruchamiaj lokalny serwer API — bez dotykania terminala.
Ile RAM-u potrzebujesz?
Szczera odpowiedź to rozmiar modelu — model o 7 miliardach parametrów potrzebuje mniej więcej 5–7 GB pamięci przy typowej kwantyzacji, plus zapas dla systemu. Przybliżona ściąga dla Maców z serii M:
| RAM | Wygodny rozmiar modelu | Dobre wybory |
|---|---|---|
| 8 GB | 1–3 mld parametrów | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8 mld parametrów | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14 mld parametrów | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30 mld+ parametrów | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Zasada kciuka: wybierz największy model, który zmieści się w połowie Twojego RAM-u — resztę zostaw dla systemu, przeglądarki i samego bota.
Podłączanie do Telegrama
Gdy lokalny serwer już działa, może z niego korzystać każdy klient zgodny z OpenAI. Telebot AI to aplikacja na pasku menu macOS, która łączy Twoje boty Telegram z dokładnie tym serwerem — lub z dowolnym API w chmurze — z automatycznymi kopiami zapasowymi, pamięcią i 30+ narzędziami, jak przypomnienia, pogoda i akcje.
Start zajmuje około dwóch minut: pobierz aplikację, wklej token ze @BotFather i wskaż localhost. Wszystko — historia, wspomnienia, umiejętności — zostaje w ~/.mlx-serve na Twoim Macu.