指南 · 阅读时长 6 分钟

在 Mac 上运行本地 AI

您的 Mac 已经具备运行严肃语言模型所需的一切 —— 无需云端、无需 API 密钥、没有月费。本指南介绍三种最简单的运行方式、您实际需要多少内存,以及如何把模型接入 Telegram。

为什么要在本地运行模型?

三个理由,按人们实际在意的程度排序:

代价是硬件:更大的模型需要更多内存,运行速度也慢于顶级云端 API。对于大多数日常助手工作 —— 提醒、摘要、起草、回答问题 —— 一个精心挑选的本地模型完全够用。

运行模型的三种方式

mlx-serve —— Apple Silicon 上最快

Apple 的 MLX 框架专为 Apple Silicon 的统一内存而构建,mlx-serve 是其中最轻松的 OpenAI 兼容服务器方案。它是 Telebot AI 的默认大脑 —— 启动它,把机器人指向 http://localhost:11234,搞定。

pip install mlx-serve
mlx-serve

Ollama —— 一条命令,海量模型库

Ollama 是最受欢迎的本地运行时,原因很简单:安装一次,然后一条命令即可从庞大的模型库中拉取任意模型。它也开箱即用地支持 OpenAI 兼容 API。

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio —— 点点鼠标就行

如果您更喜欢图形界面,LM Studio 把所有东西都装进一个干净的应用:浏览模型、下载、聊天、运行本地 API 服务器 —— 全程无需碰终端。

需要多少内存?

诚实的答案是看模型大小 —— 一个 70 亿参数的模型在典型量化下大约需要 5–7 GB 内存,还要给系统留出空间。M 系列 Mac 的粗略参考:

内存适合的模型大小推荐选择
8 GB1–3B 参数Qwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B 参数Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B 参数Qwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ 参数Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

经验法则:选择能装进一半内存的最大模型 —— 剩下的一半留给操作系统、浏览器和机器人本身。

连接到 Telegram

本地服务器运行后,任何 OpenAI 兼容客户端都可以使用它。Telebot AI 是一款 macOS 菜单栏应用,把您的 Telegram 机器人连接到这台服务器 —— 或任意云端 API —— 支持自动备用、记忆,以及提醒、天气、股票等 30+ 工具。

开始使用大约需要两分钟:下载应用,粘贴您的 @BotFather 令牌,指向 localhost。所有内容 —— 历史记录、记忆、技能 —— 都保存在您 Mac 上的 ~/.mlx-serve。

下载 Telebot AI