Інструкція · 6 хв читання
Запускаємо локальний ШІ на вашому Mac
На вашому Mac уже є все необхідне для запуску серйозної мовної моделі — без хмари, ключів API та щомісячних рахунків. Ця інструкція розповідає про три найпростіші способи, скільки RAM вам справді потрібно та як залучити модель до роботи в Telegram.
Навіщо запускати моделі локально?
Три причини в порядку того, наскільки часто вони справді важливі:
- Конфіденційність. Ваші запити та історія чатів ніколи не залишають пристрій.
- Безкоштовно. Жодної оплати за токени, жодних підписок — лише електроенергія.
- Працює офлайн. Немає інтернету — немає проблем. Режим польоту включено.
Компроміс — у обладнанні: більші моделі потребують більше RAM і працюють повільніше, ніж топовий хмарний API. Для більшості повсякденних асистентських задач — нагадувань, підсумків, чернеток, відповідей на питання — вдало підібраної локальної моделі справді достатньо.
Три способи запуску моделей
mlx-serve — найшвидший на Apple Silicon
Фреймворк MLX від Apple створено спеціально для уніфікованої пам'яті Apple Silicon, а mlx-serve — найпростіший спосіб отримати з нього сумісний з OpenAI сервер. Це мозок за замовчуванням для Telebot AI — запустіть його, вкажіть боту http://localhost:11234 — і готово.
pip install mlx-serve mlx-serve
Ollama — одна команда, величезна бібліотека моделей
Ollama — найпопулярніше локальне середовище недарма: встановіть один раз, а потім завантажуйте будь-яку модель із великої бібліотеки однією командою. Воно також розмовляє сумісним з OpenAI API одразу з коробки.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — натисніть і готово
Якщо вам зручніший графічний інтерфейс, LM Studio вміщує все в охайний застосунок: переглядайте моделі, завантажуйте, спілкуйтеся та запускайте локальний API-сервер — усе без жодного дотику до термінала.
Скільки RAM вам потрібно?
Чесною відповіддю є розмір моделі — модель із 7 мільярдами параметрів потребує приблизно 5–7 ГБ пам'яті за типового квантування плюс місце для системи. Орієнтовний посібник для Mac серії M:
| RAM | Комфортний розмір моделі | Вдалі варіанти |
|---|---|---|
| 8 GB | 1–3B параметрів | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B параметрів | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B параметрів | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ параметрів | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Правило великого пальця: обирайте найбільшу модель, яка вміщується в половину вашої RAM — решта залишиться операційній системі, вашому браузеру та самому боту.
Підключення до Telegram
Як тільки локальний сервер запрацює, ним зможе скористатися будь-який сумісний з OpenAI клієнт. Telebot AI — це застосунок macOS у рядку меню, який об'єднує ваших Telegram-ботів саме з цим сервером — або з будь-яким хмарним API — з автоматичними резервами, пам'яттю та 30+ інструментами, як-от нагадування, погода та акції.
Налаштування займає близько двох хвилин: завантажте застосунок, вставте свій токен @BotFather і вкажіть localhost. Усе — історія, спогади, навички — зберігається в ~/.mlx-serve на вашому Mac.