Passo 6 · Prática · Prática · Rodando o Cluster na Prática EN
Cluster Local de IA · Visual Course

Rodando o Cluster na Prática

Instale as ferramentas, suba os servidores locais e conecte o Open WebUI para ter uma interface de chat unificada.

Objetivos desta lição
  • Instalar mlx-lm, mlx-vlm, mlx-audio e Ollama.
  • Subir servidores OpenAI-compatíveis para texto, visão e áudio.
  • Conectar o Open WebUI como frontend único.
Leia primeiro (fonte primária)
mlx-examples/llms

Exemplos oficiais de uso do mlx-lm, incluindo server e geração.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


Depois de escolher os modelos, você os transforma em serviços locais. Cada motor expõe uma API parecida com a da OpenAI, então ferramentas como Open WebUI, LangGraph ou agentes de código conseguem falar com eles sem saber qual motor está por trás.

Pense em tomadas universais: cada aparelho (modelo) tem uma tomada diferente, mas o inversor (API OpenAI-compatível) deixa tudo no mesmo padrão. Assim você liga uma única interface.

Por baixo do capô

mlx_lm.server, mlx_vlm.server e mlx_audio.server expõem endpoints /v1/chat/completions, /v1/audio/transcriptions, /v1/audio/speech etc. Ollama também é OpenAI-compatível via /v1/chat/completions. Open WebUI aponta para qualquer desses backends.

mlx_lm.server porta 8080 mlx_vlm.server porta 8081 mlx_audio.server porta 8000 Open WebUI interface única Três servidores → uma interface
Cada motor roda em uma porta; Open WebUI unifica a experiência.
2

Instalação


A instalação base é simples: instale as bibliotecas Python da Apple e o Ollama. Para quem prefere interface gráfica, LM Studio é uma alternativa. O Open WebUI roda em Docker e aponta para os servidores locais.

Por baixo do capô

Use pip install -U mlx-lm mlx-vlm mlx-audio para a stack nativa. Ollama 0.19+ já usa MLX como backend no Apple Silicon. Open WebUI pode ser iniciado com Docker apontando para http://host.docker.internal:8080/v1.

pip install mlx-lm mlx-vlm mlx-audio brew upgrade ollama docker run open-webui
Três comandos para subir a base do cluster.
Terminal · instalação
# Stack MLX nativa
pip install -U mlx-lm mlx-vlm mlx-audio

# Ollama (provavelmente já instalado)
brew upgrade ollama

# Open WebUI via Docker
docker run -d -p 3000:8080   -e OPENAI_API_BASE_URL=http://host.docker.internal:8080/v1   -e OPENAI_API_KEY=not-needed   ghcr.io/open-webui/open-webui:main
3

Subindo os servidores


Com as ferramentas instaladas, você sobe cada servidor em uma porta. O servidor de texto usa mlx_lm.server; o multimodal usa mlx_vlm.server; o de áudio usa mlx_audio.server. O Open WebUI aponta para um deles por vez, ou você pode usar um proxy como LiteLLM.

Por baixo do capô

Os servidores expõem API OpenAI. Você pode configurar múltiplos endpoints no Open WebUI ou usar variáveis de ambiente para alternar. Para carregamento sob demanda, o MLX descarrega e recarrega modelos rapidamente, então manter vários modelos "quentes" não é obrigatório.

:8080 texto :8081 visão :8000 áudio :11434 ollama
Cada serviço ocupa uma porta padrão no localhost.
Terminal · servidores
# Texto
python -m mlx_lm.server   --model mlx-community/Qwen3.6-35B-A3B-8bit   --host 127.0.0.1 --port 8080

# Multimodal
python -m mlx_vlm.server   --model unsloth/gemma-4-26b-a4b-it-UD-MLX-4bit   --port 8081 --kv-bits 8

# Áudio
mlx_audio.server --host 127.0.0.1 --port 8000

# Ollama
ollama pull qwen3.6:35b-a3b
ollama serve
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Roteiro para ligar o cluster
1
Instale mlx-lm, mlx-vlm, mlx-audio e o Ollama.
2
Suba mlx_lm.server na porta 8080 com Qwen3.6-35B-A3B.
3
Suba mlx_vlm.server na porta 8081 com Gemma 4.
4
Inicie Open WebUI apontando para http://host.docker.internal:8080/v1.
5
Agora você: abra o navegador em http://localhost:3000 e faça uma pergunta.
Por que os servidores MLX usam API OpenAI-compatível?
b está correta. O padrão OpenAI é amplamente suportado; assim uma única interface serve para vários backends locais.
Recordar
Qual comando inicia o servidor de texto MLX?
Clique para virar
python -m mlx_lm.server --model <modelo> --port 8080
Recordar
Como apontar Open WebUI para o servidor local?
Clique para virar
Defina OPENAI_API_BASE_URL=http://host.docker.internal:8080/v1 ao iniciar o container.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.