Hướng dẫn · 6 phút đọc
Chạy AI cục bộ trên Mac của bạn
Mac của bạn đã có sẵn mọi thứ cần thiết để chạy một mô hình ngôn ngữ thực thụ — không đám mây, không khóa API, không hóa đơn hàng tháng. Hướng dẫn này trình bày ba cách dễ nhất để làm điều đó, lượng RAM bạn thực sự cần, và cách đưa mô hình vào làm việc trong Telegram.
Tại sao nên chạy mô hình cục bộ?
Ba lý do, xếp theo mức độ mọi người thực sự quan tâm:
- Quyền riêng tư. Câu lệnh và lịch sử trò chuyện của bạn không bao giờ rời khỏi máy.
- Miễn phí. Không tính phí theo token, không đăng ký — chỉ tốn tiền điện.
- Hoạt động ngoại tuyến. Không internet cũng chẳng sao. Chế độ máy bay sẵn sàng.
Đánh đổi là phần cứng: mô hình càng lớn càng cần nhiều RAM và chạy chậm hơn API đám mây hàng đầu. Với hầu hết công việc trợ lý hằng ngày — lời nhắc, tóm tắt, soạn thảo, trả lời câu hỏi — một mô hình cục bộ được chọn kỹ thực sự là quá đủ.
Ba cách chạy mô hình
mlx-serve — nhanh nhất trên Apple Silicon
Khung MLX của Apple được xây dựng riêng cho bộ nhớ hợp nhất của Apple Silicon, và mlx-serve là cách dễ nhất để có một máy chủ tương thích OpenAI từ đó. Nó là bộ não mặc định của Telebot AI — khởi động nó, trỏ bot tới http://localhost:11234, xong.
pip install mlx-serve mlx-serve
Ollama — một lệnh, thư viện mô hình khổng lồ
Ollama là runtime cục bộ phổ biến nhất có lý do của nó: cài một lần, rồi kéo bất kỳ mô hình nào từ thư viện lớn chỉ với một lệnh. Nó cũng nói được API tương thích OpenAI ngay khi cài xong.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — bấm là xong
Nếu bạn thích giao diện đồ họa, LM Studio gói gọn mọi thứ trong một ứng dụng sạch sẽ: duyệt mô hình, tải xuống, trò chuyện, và chạy máy chủ API cục bộ — tất cả không cần đụng tới terminal.
Bạn cần bao nhiêu RAM?
Kích thước mô hình là câu trả lời trung thực — một mô hình 7 tỷ tham số cần khoảng 5–7 GB bộ nhớ ở mức lượng tử hóa thông thường, cộng thêm chỗ cho hệ điều hành. Hướng dẫn sơ bộ cho Mac dòng M:
| RAM | Kích thước mô hình thoải mái | Lựa chọn tốt |
|---|---|---|
| 8 GB | 1–3B tham số | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B tham số | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B tham số | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ tham số | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Quy tắc ngón tay cái: chọn mô hình lớn nhất vừa trong một nửa RAM của bạn — phần còn lại dành cho hệ điều hành, trình duyệt, và chính bot.
Kết nối với Telegram
Khi máy chủ cục bộ đang chạy, bất kỳ ứng dụng khách tương thích OpenAI nào cũng dùng được nó. Telebot AI là ứng dụng thanh menu macOS kết nối bot Telegram của bạn với đúng máy chủ đó — hoặc với bất kỳ API đám mây nào — kèm dự phòng tự động, ký ức, và 30+ công cụ như lời nhắc, thời tiết và chứng khoán.
Bắt đầu chỉ mất khoảng hai phút: tải ứng dụng, dán token @BotFather của bạn, và trỏ nó tới localhost. Mọi thứ — lịch sử, ký ức, kỹ năng — nằm trong ~/.mlx-serve trên Mac của bạn.