Panduan · 6 menit baca
Menjalankan AI lokal di Mac Anda
Mac Anda sudah punya semua yang diperlukan untuk menjalankan model bahasa yang serius — tanpa cloud, tanpa kunci API, tanpa tagihan bulanan. Panduan ini membahas tiga cara termudah untuk melakukannya, berapa banyak RAM yang sebenarnya Anda butuhkan, dan cara memakai model itu di Telegram.
Mengapa menjalankan model secara lokal?
Tiga alasan, diurutkan dari yang paling sering dipedulikan orang:
- Privasi. Prompt dan riwayat chat Anda tidak pernah meninggalkan mesin.
- Gratis. Tanpa harga per token, tanpa langganan — hanya listrik.
- Berfungsi offline. Tanpa internet pun tetap jalan. Mode pesawat ikut tersedia.
Tukarnya ada di perangkat keras: model yang lebih besar butuh lebih banyak RAM dan berjalan lebih lambat daripada API cloud kelas atas. Untuk sebagian besar pekerjaan asisten sehari-hari — pengingat, ringkasan, draf, menjawab pertanyaan — model lokal yang dipilih dengan baik sudah benar-benar memadai.
Tiga cara menjalankan model
mlx-serve — tercepat di Apple Silicon
Kerangka kerja MLX dari Apple dibuat khusus untuk memori terpadu Apple Silicon, dan mlx-serve adalah cara termudah untuk mendapatkan server yang kompatibel OpenAI darinya. Ini otak bawaan untuk Telebot AI — mulai, arahkan bot ke http://localhost:11234, selesai.
pip install mlx-serve mlx-serve
Ollama — satu perintah, pustaka model raksasa
Ollama adalah runtime lokal paling populer karena suatu alasan: pasang sekali, lalu tarik model apa pun dari pustaka besar hanya dengan satu perintah. Ollama juga langsung berbicara API yang kompatibel OpenAI.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — klik dan jalan
Jika Anda lebih suka GUI, LM Studio membungkus semuanya dalam aplikasi yang rapi: jelajahi model, unduh, mengobrol, dan jalankan server API lokal — semua tanpa menyentuh terminal.
Berapa banyak RAM yang Anda butuhkan?
Ukuran model adalah jawaban jujurnya — model 7 miliar parameter butuh sekitar 5–7 GB memori pada kuantisasi biasa, plus ruang untuk sistem. Panduan kasar untuk Mac seri M:
| RAM | Ukuran model yang nyaman | Pilihan bagus |
|---|---|---|
| 8 GB | 1–3 miliar parameter | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8 miliar parameter | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14 miliar parameter | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30 miliar+ parameter | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Aturan praktis: pilih model terbesar yang muat di separuh RAM Anda — sisanya untuk sistem operasi, browser, dan bot itu sendiri.
Menghubungkannya ke Telegram
Setelah server lokal berjalan, klien apa pun yang kompatibel OpenAI bisa memakainya. Telebot AI adalah aplikasi bilah menu macOS yang menjembatani bot Telegram Anda ke server itu — atau ke API cloud mana pun — dengan fallback otomatis, memori, dan 30+ alat seperti pengingat, cuaca, dan saham.
Memulai hanya butuh sekitar dua menit: unduh aplikasinya, tempel token @BotFather Anda, dan arahkan ke localhost. Semuanya — riwayat, memori, skill — tetap di ~/.mlx-serve di Mac Anda.