गाइड · 6 मिनट पढ़ें
अपने Mac पर लोकल AI चलाना
आपके Mac के पास एक गंभीर भाषा मॉडल चलाने के लिए सब कुछ पहले से मौजूद है — न क्लाउड, न API कुंजियाँ, न मासिक बिल। यह गाइड ऐसा करने के तीन सबसे आसान तरीके, आपको वास्तव में कितनी RAM चाहिए, और मॉडल को Telegram में कैसे काम पर लगाएँ, बताती है।
मॉडल लोकल क्यों चलाएँ?
तीन कारण, लोगों की वास्तविक परवाह के क्रम में:
- गोपनीयता। आपके प्रॉम्प्ट और चैट हिस्ट्री कभी मशीन से बाहर नहीं जाते।
- यह मुफ़्त है। न कोई प्रति-टोकन मूल्य, न कोई सब्सक्रिप्शन — सिर्फ़ बिजली।
- यह ऑफ़लाइन काम करता है। न इंटरनेट, न दिक्कत। एयरप्लेन मोड शामिल है।
इसकी कीमत हार्डवेयर है: बड़े मॉडलों को ज़्यादा RAM चाहिए और वे टॉप-टियर क्लाउड API से धीमे चलते हैं। ज़्यादातर रोज़मर्रा के सहायक कामों के लिए — रिमाइंडर, सारांश, ड्राफ्टिंग, सवालों के जवाब — एक सही चुना हुआ लोकल मॉडल सच में काफ़ी अच्छा है।
मॉडल चलाने के तीन तरीके
mlx-serve — Apple Silicon पर सबसे तेज़
Apple का MLX फ्रेमवर्क खास तौर पर Apple Silicon की यूनिफाइड मेमोरी के लिए बनाया गया है, और mlx-serve इससे OpenAI-संगत सर्वर पाने का सबसे आसान तरीका है। यह Telebot AI का डिफ़ॉल्ट दिमाग़ है — इसे शुरू करें, बॉट को http://localhost:11234 पर इंगित करें, हो गया।
pip install mlx-serve mlx-serve
Ollama — एक कमांड, विशाल मॉडल लाइब्रेरी
Ollama सबसे लोकप्रिय लोकल रनटाइम है, और ठीक ही है: एक बार इंस्टॉल करें, फिर एक ही कमांड से बड़ी लाइब्रेरी से कोई भी मॉडल खींचें। यह बिना किसी सेटअप के OpenAI-संगत API भी बोलता है।
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — पॉइंट एंड क्लिक
अगर आपको GUI पसंद है, तो LM Studio सब कुछ एक साफ़-सुथरे ऐप में लपेट देता है: मॉडल ब्राउज़ करें, डाउनलोड करें, चैट करें, और लोकल API सर्वर चलाएँ — बिना टर्मिनल छुए।
आपको कितनी RAM चाहिए?
मॉडल का आकार ही सच्चा जवाब है — 7-बिलियन-पैरामीटर मॉडल को सामान्य क्वांटाइज़ेशन पर लगभग 5–7 GB मेमोरी चाहिए, साथ में सिस्टम के लिए भी जगह। M-सीरीज़ Mac के लिए मोटा-मोटा गाइड:
| RAM | आरामदायक मॉडल आकार | अच्छे विकल्प |
|---|---|---|
| 8 GB | 1–3B पैरामीटर | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B पैरामीटर | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B पैरामीटर | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ पैरामीटर | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
अंगूठे का नियम: अपनी आधी RAM में समाने वाला सबसे बड़ा मॉडल चुनें — बाकी ऑपरेटिंग सिस्टम, आपके ब्राउज़र और बॉट के लिए बचा रहे।
इसे Telegram से जोड़ना
लोकल सर्वर चालू होने पर, कोई भी OpenAI-संगत क्लाइंट उसे उपयोग कर सकता है। Telebot AI एक macOS मेनू बार ऐप है जो आपके Telegram बॉट्स को ठीक उसी सर्वर से जोड़ता है — या किसी भी क्लाउड API से — स्वचालित फ़ॉलबैक, मेमोरी और रिमाइंडर, मौसम और स्टॉक्स जैसे 30+ उपकरणों के साथ।
शुरू करने में लगभग दो मिनट लगते हैं: ऐप डाउनलोड करें, अपना @BotFather टोकन पेस्ट करें, और इसे localhost पर इंगित करें। सब कुछ — हिस्ट्री, यादें, स्किल — आपके Mac पर ~/.mlx-serve में रहता है।