Step 6 · Practice · Practice · Running the Cluster in Practice PT
Local AI Cluster · Visual Course

Running the Cluster in Practice

Install the tools, start the local servers and connect Open WebUI for a unified chat interface.

Lesson objectives
  • Instalar mlx-lm, mlx-vlm, mlx-audio e Ollama.
  • Subir servidores OpenAI-compatíveis para texto, visão e áudio.
  • Conectar o Open WebUI como frontend único.
Read first (primary source)
mlx-examples/llms

Exemplos oficiais de uso do mlx-lm, incluindo server e geração.

Read the simple version, or open the technical layer in any section.
1

The big idea


Depois de escolher os modelos, você os transforma em serviços locais. Cada motor expõe uma API parecida com a da OpenAI, então ferramentas como Open WebUI, LangGraph ou agentes de código conseguem falar com eles sem saber qual motor está por trás.

Pense em tomadas universais: cada aparelho (modelo) tem uma tomada diferente, mas o inversor (API OpenAI-compatível) deixa tudo no mesmo padrão. Assim você liga uma única interface.

Under the hood

mlx_lm.server, mlx_vlm.server e mlx_audio.server expõem endpoints /v1/chat/completions, /v1/audio/transcriptions, /v1/audio/speech etc. Ollama também é OpenAI-compatível via /v1/chat/completions. Open WebUI aponta para qualquer desses backends.

mlx_lm.server porta 8080 mlx_vlm.server porta 8081 mlx_audio.server porta 8000 Open WebUI interface única Três servidores → uma interface
Cada motor roda em uma porta; Open WebUI unifica a experiência.
2

Installation


A instalação base é simples: instale as bibliotecas Python da Apple e o Ollama. Para quem prefere interface gráfica, LM Studio é uma alternativa. O Open WebUI roda em Docker e aponta para os servidores locais.

Under the hood

Use pip install -U mlx-lm mlx-vlm mlx-audio para a stack nativa. Ollama 0.19+ já usa MLX como backend no Apple Silicon. Open WebUI pode ser iniciado com Docker apontando para http://host.docker.internal:8080/v1.

pip install mlx-lm mlx-vlm mlx-audio brew upgrade ollama docker run open-webui
Três comandos para subir a base do cluster.
Terminal · instalação
# Stack MLX nativa
pip install -U mlx-lm mlx-vlm mlx-audio

# Ollama (provavelmente já instalado)
brew upgrade ollama

# Open WebUI via Docker
docker run -d -p 3000:8080   -e OPENAI_API_BASE_URL=http://host.docker.internal:8080/v1   -e OPENAI_API_KEY=not-needed   ghcr.io/open-webui/open-webui:main
3

Starting the servers


Com as ferramentas instaladas, você sobe cada servidor em uma porta. O servidor de texto usa mlx_lm.server; o multimodal usa mlx_vlm.server; o de áudio usa mlx_audio.server. O Open WebUI aponta para um deles por vez, ou você pode usar um proxy como LiteLLM.

Under the hood

Os servidores expõem API OpenAI. Você pode configurar múltiplos endpoints no Open WebUI ou usar variáveis de ambiente para alternar. Para carregamento sob demanda, o MLX descarrega e recarrega modelos rapidamente, então manter vários modelos "quentes" não é obrigatório.

:8080 texto :8081 visão :8000 áudio :11434 ollama
Cada serviço ocupa uma porta padrão no localhost.
Terminal · servidores
# Text
python -m mlx_lm.server   --model mlx-community/Qwen3.6-35B-A3B-8bit   --host 127.0.0.1 --port 8080

# Multimodal
python -m mlx_vlm.server   --model unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit   --port 8081 --kv-bits 8

# Audio
mlx_audio.server --host 127.0.0.1 --port 8000

# Ollama
ollama pull qwen3.6:35b-a3b
ollama serve
4

Try it


Test what you learned with quick exercises.

Roteiro para ligar o cluster
1
Instale mlx-lm, mlx-vlm, mlx-audio e o Ollama.
2
Start mlx_lm.server on port 8080 with Qwen3.6-35B-A3B.
3
Suba mlx_vlm.server na porta 8081 com Gemma 4.
4
Inicie Open WebUI apontando para http://host.docker.internal:8080/v1.
5
Now you: abra o navegador em http://localhost:3000 e faça uma pergunta.
Por que os servidores MLX usam API OpenAI-compatível?
b está correta. O padrão OpenAI é amplamente suportado; assim uma única interface serve para vários backends locais.
Recall
Qual comando inicia o servidor de texto MLX?
Click to flip
python -m mlx_lm.server --model <modelo> --port 8080
Recall
Como apontar Open WebUI para o servidor local?
Click to flip
Defina OPENAI_API_BASE_URL=http://host.docker.internal:8080/v1 ao iniciar o container.
Questions? Ask your teacher/agent before moving to the next lesson.