คู่มือ · อ่าน 6 นาที
การรัน AI โลคัลบน Mac ของคุณ
Mac ของคุณมีทุกอย่างที่จำเป็นสำหรับรันโมเดลภาษาขนาดจริงอยู่แล้ว — ไม่ต้องใช้คลาวด์ ไม่ต้องใช้คีย์ API ไม่มีบิลรายเดือน คู่มือนี้ครอบคลุมสามวิธีที่ง่ายที่สุด จำนวน RAM ที่คุณต้องใช้จริง และวิธีนำโมเดลไปทำงานใน Telegram
ทำไมต้องรันโมเดลแบบโลคัล?
สามเหตุผล เรียงตามสิ่งที่คนสนใจจริงบ่อยที่สุด:
- ความเป็นส่วนตัว. โพรอมต์และประวัติแชทของคุณไม่เคยออกจากเครื่อง
- ฟรี. ไม่คิดราคาต่อโทเคน ไม่มีค่าสมัคร — แค่ค่าไฟ
- ทำงานออฟไลน์ได้. ไม่มีอินเทอร์เน็ตก็ไม่มีปัญหา โหมดเครื่องบินก็ใช้ได้
ข้อแลกเปลี่ยนคือฮาร์ดแวร์: โมเดลใหญ่ต้องการ RAM มากกว่าและรันช้ากว่า API คลาวด์ระดับท็อป สำหรับงานผู้ช่วยทั่วไปส่วนใหญ่ — การเตือน สรุป ร่างข้อความ ตอบคำถาม — โมเดลโลคัลที่เลือกดีๆ ก็ดีพอจริงๆ
สามวิธีในการรันโมเดล
mlx-serve — เร็วที่สุดบน Apple Silicon
เฟรมเวิร์ก MLX ของ Apple สร้างขึ้นสำหรับหน่วยความจำรวมของ Apple Silicon โดยเฉพาะ และ mlx-serve เป็นวิธีที่ง่ายที่สุดในการได้เซิร์ฟเวอร์แบบรองรับ OpenAI จากมัน เป็นสมองเริ่มต้นของ Telebot AI — เริ่มมัน ชี้บอทไปที่ http://localhost:11234 ก็เสร็จ
pip install mlx-serve mlx-serve
Ollama — คำสั่งเดียว คลังโมเดลมหึมา
Ollama เป็นรันไทม์โลคัลยอดนิยมที่สุดด้วยเหตุผลที่ดี: ติดตั้งครั้งเดียว จากนั้นดึงโมเดลใดก็ได้จากคลังขนาดใหญ่ด้วยคำสั่งเดียว และยังพูด API แบบรองรับ OpenAI ได้ทันที
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — คลิกแล้วเสร็จ
ถ้าชอบ GUI, LM Studio ห่อทุกอย่างไว้ในแอปที่สะอาดตา: เรียกดูโมเดล ดาวน์โหลด แชท และรันเซิร์ฟเวอร์ API โลคัล — โดยไม่ต้องแตะเทอร์มินัลเลย
ต้องใช้ RAM เท่าไหร่?
ขนาดโมเดลคือคำตอบที่ตรงไปตรงมา — โมเดล 7 พันล้านพารามิเตอร์ต้องการหน่วยความจำประมาณ 5–7 GB ที่การควอนไทซ์ทั่วไป บวกพื้นที่สำหรับระบบ คำแนะนำคร่าวๆ สำหรับ Mac ตระกูล M:
| RAM | ขนาดโมเดลที่ใช้ได้สบาย | ตัวเลือกดีๆ |
|---|---|---|
| 8 GB | พารามิเตอร์ 1–3B | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | พารามิเตอร์ 7–8B | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | พารามิเตอร์ 13–14B | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | พารามิเตอร์ 30B+ | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
กฎคร่าวๆ: เลือกโมเดลที่ใหญ่ที่สุดที่พอดีกับครึ่งหนึ่งของ RAM — ที่เหลือไว้ให้ระบบปฏิบัติการ เบราว์เซอร์ และตัวบอทเอง
การเชื่อมต่อกับ Telegram
เมื่อเซิร์ฟเวอร์โลคัลทำงานแล้ว ไคลเอนต์ใดก็ได้ที่รองรับ OpenAI ก็ใช้มันได้ Telebot AI คือแอปแถบเมนู macOS ที่เชื่อมบอท Telegram ของคุณกับเซิร์ฟเวอร์นั้นโดยตรง — หรือ API คลาวด์ใดก็ได้ — พร้อมตัวสำรองอัตโนมัติ ความทรงจำ และเครื่องมือ 30+ รายการ เช่น การเตือน สภาพอากาศและหุ้น
เริ่มต้นใช้เวลาประมาณสองนาที: ดาวน์โหลดแอป วางโทเคน @BotFather ของคุณ แล้วชี้ไปที่ localhost ทุกอย่าง — ประวัติ ความทรงจำ สกิล — ยังคงอยู่ใน ~/.mlx-serve บน Mac ของคุณ