가이드 · 6분 읽기

Mac에서 로컬 AI 실행하기

Mac에는 진지한 언어 모델을 실행하는 데 필요한 모든 것이 이미 있습니다 — 클라우드도, API 키도, 월 요금도 필요 없습니다. 이 가이드는 가장 쉬운 세 가지 방법, 실제로 필요한 RAM 용량, 그리고 모델을 텔레그램에서 활용하는 방법을 다룹니다.

왜 로컬에서 모델을 실행하나요?

사람들이 실제로 신경 쓰는 빈도순으로 세 가지 이유:

대가는 하드웨어입니다: 큰 모델은 더 많은 RAM이 필요하고 최상위 클라우드 API보다 느립니다. 알림, 요약, 초안 작성, 질문 답변 같은 일상적인 어시스턴트 작업 대부분에는 잘 고른 로컬 모델이면 충분합니다.

모델을 실행하는 세 가지 방법

mlx-serve — Apple Silicon에서 가장 빠름

Apple의 MLX 프레임워크는 Apple Silicon의 통합 메모리 전용으로 만들어졌으며, mlx-serve는 여기서 OpenAI 호환 서버를 얻는 가장 쉬운 방법입니다. Telebot AI의 기본 두뇌이기도 합니다 — 시작하고 봇을 http://localhost:11234에 연결하면 끝.

pip install mlx-serve
mlx-serve

Ollama — 명령어 하나, 방대한 모델 라이브러리

Ollama가 가장 인기 있는 로컬 런타임인 데는 이유가 있습니다: 한 번 설치하면 큰 라이브러리에서 단일 명령으로 모델을 내려받을 수 있습니다. 또한 기본적으로 OpenAI 호환 API를 지원합니다.

brew install ollama
ollama pull llama3.1
ollama serve

LM Studio — 클릭 몇 번으로

GUI를 선호한다면 LM Studio가 모든 것을 깔끔한 앱으로 감쌌습니다: 모델 탐색, 다운로드, 채팅, 로컬 API 서버 실행까지 — 터미널을 만질 필요가 없습니다.

RAM은 얼마나 필요할까요?

솔직한 답은 모델 크기입니다 — 70억 파라미터 모델은 일반적인 양자화 기준으로 약 5–7 GB 메모리가 필요하고, 시스템 공간도 남겨야 합니다. M 시리즈 Mac 기준 대략적인 가이드:

RAM넉넉한 모델 크기추천 모델
8 GB1–3B 파라미터Qwen 2.5 1.5B, Llama 3.2 3B
16 GB7–8B 파라미터Llama 3.1 8B, Qwen 2.5 7B, Gemma 2 9B
32 GB13–14B 파라미터Qwen 2.5 14B, Llama 3.3 70B (quantized)
64 GB+30B+ 파라미터Qwen 2.5 32B, Mixtral 8x7B, Llama 3.3 70B

경험 법칙: RAM의 절반에 들어가는 가장 큰 모델을 고르세요 — 나머지는 운영 체제, 브라우저, 봇이 사용합니다.

텔레그램에 연결하기

로컬 서버가 실행되면 모든 OpenAI 호환 클라이언트가 사용할 수 있습니다. Telebot AI는 텔레그램 봇을 그 서버나 어떤 클라우드 API에도 연결하는 macOS 메뉴 바 앱입니다 — 자동 대체, 메모리, 알림·날씨·주식 등 30개 이상의 도구를 갖추고 있습니다.

시작하는 데 약 2분이면 충분합니다: 앱을 다운로드하고 @BotFather 토큰을 붙여넣은 다음 localhost에 연결하세요. 기록, 메모리, 스킬 등 모든 것이 Mac의 ~/.mlx-serve에 저장됩니다.

Telebot AI 다운로드