指南 · 阅读时长 6 分钟
在 Mac 上运行本地 AI
您的 Mac 已经具备运行严肃语言模型所需的一切 —— 无需云端、无需 API 密钥、没有月费。本指南介绍三种最简单的运行方式、您实际需要多少内存,以及如何把模型接入 Telegram。
为什么要在本地运行模型?
三个理由,按人们实际在意的程度排序:
- 隐私。您的提示词和聊天记录永远不会离开这台机器。
- 免费。没有按 token 计费,没有订阅 —— 只需电费。
- 离线可用。没有网络也没问题。飞行模式也照常。
代价是硬件:更大的模型需要更多内存,运行速度也慢于顶级云端 API。对于大多数日常助手工作 —— 提醒、摘要、起草、回答问题 —— 一个精心挑选的本地模型完全够用。
运行模型的三种方式
mlx-serve —— Apple Silicon 上最快
Apple 的 MLX 框架专为 Apple Silicon 的统一内存而构建,mlx-serve 是其中最轻松的 OpenAI 兼容服务器方案。它是 Telebot AI 的默认大脑 —— 启动它,把机器人指向 http://localhost:11234,搞定。
pip install mlx-serve mlx-serve
Ollama —— 一条命令,海量模型库
Ollama 是最受欢迎的本地运行时,原因很简单:安装一次,然后一条命令即可从庞大的模型库中拉取任意模型。它也开箱即用地支持 OpenAI 兼容 API。
brew install ollama ollama pull llama3.1 ollama serve
LM Studio —— 点点鼠标就行
如果您更喜欢图形界面,LM Studio 把所有东西都装进一个干净的应用:浏览模型、下载、聊天、运行本地 API 服务器 —— 全程无需碰终端。
需要多少内存?
诚实的答案是看模型大小 —— 一个 70 亿参数的模型在典型量化下大约需要 5–7 GB 内存,还要给系统留出空间。M 系列 Mac 的粗略参考:
| 内存 | 适合的模型大小 | 推荐选择 |
|---|---|---|
| 8 GB | 1–3B 参数 | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B 参数 | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B 参数 | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ 参数 | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
经验法则:选择能装进一半内存的最大模型 —— 剩下的一半留给操作系统、浏览器和机器人本身。
连接到 Telegram
本地服务器运行后,任何 OpenAI 兼容客户端都可以使用它。Telebot AI 是一款 macOS 菜单栏应用,把您的 Telegram 机器人连接到这台服务器 —— 或任意云端 API —— 支持自动备用、记忆,以及提醒、天气、股票等 30+ 工具。
开始使用大约需要两分钟:下载应用,粘贴您的 @BotFather 令牌,指向 localhost。所有内容 —— 历史记录、记忆、技能 —— 都保存在您 Mac 上的 ~/.mlx-serve。