ガイド · 読了目安 6 分

Mac でローカル AI を実行する

本格的な言語モデルを実行するために必要なものは、すでに Mac に揃っています — クラウドも API キーも月額料金も不要。このガイドでは、最も簡単な3つの方法、実際に必要なメモリ量、そしてモデルを Telegram で活用する方法を説明します。

なぜローカルで実行するのか?

3つの理由を、人々が実際に気にする順で:

代償はハードウェア:大きなモデルほど多くのメモリが必要で、最上位クラウド API より遅くなります。日常的なアシスタント作業 — リマインダー、要約、下書き、質問への回答 — のほとんどでは、よく選んだローカルモデルで十分すぎるほどです。

モデルを実行する3つの方法

mlx-serve — Apple Silicon で最速

Apple の MLX フレームワークは Apple Silicon のユニファイドメモリ専用に作られており、mlx-serve は OpenAI 互換サーバーを立てる最も簡単な方法です。Telebot AI のデフォルトの頭脳でもあります — 起動して、ボットを http://localhost:11234 に向けるだけ。

pip install mlx-serve
mlx-serve

Ollama — 1コマンド、巨大なモデルライブラリ

Ollama が最も人気のローカルランタイムなのには理由があります:一度インストールすれば、大規模なライブラリから任意のモデルを1コマンドで取得できます。OpenAI 互換 API も標準で話せます。

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — クリックするだけ

GUI がお好みなら、LM Studio はすべてをクリーンなアプリにまとめています:モデルの閲覧、ダウンロード、チャット、ローカル API サーバーの実行 — ターミナルに触れる必要は一切ありません。

メモリはどれくらい必要?

正直な答えはモデルサイズ次第 — 70億パラメータのモデルは、一般的な量子化でおよそ 5–7 GB のメモリに加えてシステム分が必要です。M シリーズ Mac のおおよその目安:

メモリ快適なモデルサイズおすすめ
8 GB1–3B パラメータQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B パラメータLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B パラメータQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ パラメータQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

経験則:RAM の半分に収まる最大のモデルを選びましょう — 残りは OS、ブラウザ、そしてボット自身のために。

Telegram に接続する

ローカルサーバーが動き出せば、OpenAI 互換クライアントなら何でも使えます。Telebot AI は、Telegram ボットをまさにそのサーバー — または任意のクラウド API — に接続する macOS メニューバーアプリです。自動フォールバック、メモリー、リマインダー・天気・株などの 30+ ツール付き。

セットアップは約2分:アプリをダウンロードして @BotFather のトークンを貼り付け、localhost を指定するだけ。履歴・メモリー・スキルはすべて Mac 上の ~/.mlx-serve に残ります。

Telebot AI をダウンロード