Гайд · 6 мин чтения
Запускаем локальный ИИ на вашем Mac
На вашем Mac уже есть всё необходимое для серьёзной языковой модели — никакого облака, ключей API и ежемесячных счетов. В этом гайде — три самых простых способа это сделать, сколько RAM вам реально нужно и как заставить модель работать в Telegram.
Зачем запускать модели локально?
Три причины в порядке того, насколько часто о них думают:
- Приватность. Ваши запросы и история чатов никогда не покидают машину.
- Это бесплатно. Никакой оплаты за токены и подписок — только электричество.
- Работает офлайн. Нет интернета — нет проблем. Авиарежим включён.
Обратная сторона — железо: модели покрупнее требуют больше RAM и работают медленнее первоклассного облачного API. Для большинства повседневных задач ассистента — напоминаний, сводок, черновиков, ответов на вопросы — хорошо подобранная локальная модель действительно достаточно хороша.
Три способа запуска моделей
mlx-serve — самый быстрый на Apple Silicon
Фреймворк MLX от Apple создан специально под единую память Apple Silicon, а mlx-serve — самый простой способ получить из него совместимый с OpenAI сервер. Это мозг по умолчанию для Telebot AI: запустите его, направьте бота на http://localhost:11234 — и готово.
pip install mlx-serve mlx-serve
Ollama — одна команда, огромная библиотека моделей
Ollama — самый популярный локальный рантайм, и не зря: установите один раз, а затем загружайте любую модель из большой библиотеки одной командой. Из коробки он также говорит на совместимом с OpenAI API.
brew install ollama ollama pull llama3.1 ollama serve
LM Studio — наведи и нажми
Если вам ближе графический интерфейс, LM Studio упакует всё в аккуратное приложение: просмотр моделей, скачивание, чат и локальный API-сервер — и всё это без единой команды в терминале.
Сколько RAM вам нужно?
Честный ответ — размер модели: модель на 7 миллиардов параметров при типичном квантовании занимает примерно 5–7 ГБ памяти, плюс запас для системы. Примерный ориентир для Mac на M-чипах:
| RAM | Комфортный размер модели | Хорошие варианты |
|---|---|---|
| 8 GB | 1–3B параметров | Qwen 2.5 1.5B, Llama 3.2 3B |
| 16 GB | 7–8B параметров | Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B |
| 32 GB | 13–14B параметров | Qwen 2.5 14B, Llama 3.3 70B (quantized) |
| 64 GB+ | 30B+ параметров | Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B |
Правило большого пальца: выбирайте самую большую модель, которая помещается в половину вашей RAM, — остальное останется операционной системе, браузеру и самому боту.
Подключение к Telegram
Когда локальный сервер запущен, им может пользоваться любой совместимый с OpenAI клиент. Telebot AI — это приложение в строке меню macOS, которое соединяет ваших Telegram-ботов именно с этим сервером — или с любым облачным API — с автоматическими резервами, памятью и 30+ инструментами вроде напоминаний, погоды и акций.
Начало работы занимает около двух минут: скачайте приложение, вставьте токен @BotFather и направьте его на localhost. Всё — история, воспоминания, навыки — остаётся в ~/.mlx-serve на вашем Mac.