Інструкція · 6 хв читання

Запускаємо локальний ШІ на вашому Mac

На вашому Mac уже є все необхідне для запуску серйозної мовної моделі — без хмари, ключів API та щомісячних рахунків. Ця інструкція розповідає про три найпростіші способи, скільки RAM вам справді потрібно та як залучити модель до роботи в Telegram.

Навіщо запускати моделі локально?

Три причини в порядку того, наскільки часто вони справді важливі:

Компроміс — у обладнанні: більші моделі потребують більше RAM і працюють повільніше, ніж топовий хмарний API. Для більшості повсякденних асистентських задач — нагадувань, підсумків, чернеток, відповідей на питання — вдало підібраної локальної моделі справді достатньо.

Три способи запуску моделей

mlx-serve — найшвидший на Apple Silicon

Фреймворк MLX від Apple створено спеціально для уніфікованої пам'яті Apple Silicon, а mlx-serve — найпростіший спосіб отримати з нього сумісний з OpenAI сервер. Це мозок за замовчуванням для Telebot AI — запустіть його, вкажіть боту http://localhost:11234 — і готово.

pip install mlx-serve
mlx-serve

Ollama — одна команда, величезна бібліотека моделей

Ollama — найпопулярніше локальне середовище недарма: встановіть один раз, а потім завантажуйте будь-яку модель із великої бібліотеки однією командою. Воно також розмовляє сумісним з OpenAI API одразу з коробки.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — натисніть і готово

Якщо вам зручніший графічний інтерфейс, LM Studio вміщує все в охайний застосунок: переглядайте моделі, завантажуйте, спілкуйтеся та запускайте локальний API-сервер — усе без жодного дотику до термінала.

Скільки RAM вам потрібно?

Чесною відповіддю є розмір моделі — модель із 7 мільярдами параметрів потребує приблизно 5–7 ГБ пам'яті за типового квантування плюс місце для системи. Орієнтовний посібник для Mac серії M:

RAMКомфортний розмір моделіВдалі варіанти
8 GB1–3B параметрівQwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B параметрівLlama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B параметрівQwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ параметрівQwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

Правило великого пальця: обирайте найбільшу модель, яка вміщується в половину вашої RAM — решта залишиться операційній системі, вашому браузеру та самому боту.

Підключення до Telegram

Як тільки локальний сервер запрацює, ним зможе скористатися будь-який сумісний з OpenAI клієнт. Telebot AI — це застосунок macOS у рядку меню, який об'єднує ваших Telegram-ботів саме з цим сервером — або з будь-яким хмарним API — з автоматичними резервами, пам'яттю та 30+ інструментами, як-от нагадування, погода та акції.

Налаштування займає близько двох хвилин: завантажте застосунок, вставте свій токен @BotFather і вкажіть localhost. Усе — історія, спогади, навички — зберігається в ~/.mlx-serve на вашому Mac.

Завантажити Telebot AI