ガイド · 読了目安 6 分
Mac でローカル AI を実行する
本格的な言語モデルを実行するために必要なものは、すでに Mac に揃っています — クラウドも API キーも月額料金も不要。このガイドでは、最も簡単な3つの方法、実際に必要なメモリ量、そしてモデルを Telegram で活用する方法を説明します。
なぜローカルで実行するのか?
3つの理由を、人々が実際に気にする順で:
- プライバシー。プロンプトとチャット履歴がマシンの外に出ません。
- 無料。トークン課金もサブスクリプションもなし — 電気代だけ。
- オフラインで動作。ネットがなくても問題なし。機内モードもOK。
代償はハードウェア:大きなモデルほど多くのメモリが必要で、最上位クラウド API より遅くなります。日常的なアシスタント作業 — リマインダー、要約、下書き、質問への回答 — のほとんどでは、よく選んだローカルモデルで十分すぎるほどです。
モデルを実行する3つの方法
mlx-serve — Apple Silicon で最速
Apple の MLX フレームワークは Apple Silicon のユニファイドメモリ専用に作られており、mlx-serve は OpenAI 互換サーバーを立てる最も簡単な方法です。Telebot AI のデフォルトの頭脳でもあります — 起動して、ボットを http://localhost:11234 に向けるだけ。
pip install mlx-serve mlx-serve
Ollama — 1コマンド、巨大なモデルライブラリ
Ollama が最も人気のローカルランタイムなのには理由があります:一度インストールすれば、大規模なライブラリから任意のモデルを1コマンドで取得できます。OpenAI 互換 API も標準で話せます。
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — クリックするだけ
GUI がお好みなら、LM Studio はすべてをクリーンなアプリにまとめています:モデルの閲覧、ダウンロード、チャット、ローカル API サーバーの実行 — ターミナルに触れる必要は一切ありません。
メモリはどれくらい必要?
正直な答えはモデルサイズ次第 — 70億パラメータのモデルは、一般的な量子化でおよそ 5–7 GB のメモリに加えてシステム分が必要です。M シリーズ Mac のおおよその目安:
| メモリ | 快適なモデルサイズ | おすすめ |
|---|---|---|
| 8 GB | 1–3B パラメータ | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B パラメータ | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B パラメータ | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ パラメータ | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
経験則:RAM の半分に収まる最大のモデルを選びましょう — 残りは OS、ブラウザ、そしてボット自身のために。
Telegram に接続する
ローカルサーバーが動き出せば、OpenAI 互換クライアントなら何でも使えます。Telebot AI は、Telegram ボットをまさにそのサーバー — または任意のクラウド API — に接続する macOS メニューバーアプリです。自動フォールバック、メモリー、リマインダー・天気・株などの 30+ ツール付き。
セットアップは約2分:アプリをダウンロードして @BotFather のトークンを貼り付け、localhost を指定するだけ。履歴・メモリー・スキルはすべて Mac 上の ~/.mlx-serve に残ります。