Passo 2 · Fundamentos · Fundamentos · Hardware e Motor MLX EN
Cluster Local de IA · Visual Course

Hardware e Motor MLX

Entenda por que o M5 Max 128 GB e o MLX são a combinação nativa ideal para inferência local em Apple Silicon.

Objetivos desta lição
  • Explicar o papel da Unified Memory no M5 Max.
  • Comparar MLX, Ollama, llama.cpp e ds4/DwarfStar.
  • Escolher o motor certo para cada tipo de tarefa.
Leia primeiro (fonte primária)
Qwen Docs — MLX local inference

Fonte primária para entender como modelos convertidos para MLX rodam nativamente no Apple Silicon.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


O Mac M5 Max não é só um laptop caro: ele é quase um acelerador de IA com memória compartilhada. CPU, GPU e Neural Engine acessam os mesmos 128 GB sem precisar copiar dados de um lado para outro. O MLX é a biblioteca da Apple que aproveita isso.

Pense como uma cozinha compacta: em computadores comuns, ingredientes ficam em armários separados e você perde tempo transportando panelas. No Mac, tudo está na mesma bancada; o chef (MLX) pega e usa sem perder tempo.

Por baixo do capô

A Unified Memory do Apple Silicon permite zero-copy entre CPU, GPU Metal e Neural Engine. Isso reduz o uso de RAM em ~7–13% em comparação com GGUF/llama.cpp. O M5 Max entrega ~614 GB/s de largura de banda, o que torna o gargalo a largura de banda e a eficiência dos kernels Metal, não a VRAM.

Em benchmarks de julho/2026, o M5 Max 128 GB executa Qwen3.6-35B-A3B a ~80 tok/s em 8-bit. Os Neural Accelerators do M5 reduzem o TTFT (time-to-first-token) em 3–4× em comparação com o M4 Max no mesmo modelo, graças a kernels Metal otimizados para atenção e matmul.

128 GB Unified Memory ~614 GB/s · LPDDR5X CPU Neural Engine GPU Metal
CPU, GPU e Neural Engine compartilham os mesmos 128 GB sem cópias.
Benchmark de referência: Qwen3.6-35B-A3B-8bit atinge ~80 tok/s no M5 Max 128 GB. O TTFF cai 3–4× versus o M4 Max graças aos Neural Accelerators do M5 — um ganho perceptível em prompts longos e RAG.
2

Os motores de inferência


Existem vários programas que "falam" com os modelos. O MLX é o mais rápido no Apple Silicon porque foi feito pela Apple. O Ollama é o mais fácil de usar. O llama.cpp é o mais compatível. O ds4/DwarfStar é especialista em modelos gigantes como DeepSeek V4 Flash.

Por baixo do capô

MLX (mlx-lm, mlx-vlm, mlx-audio) usa kernels Metal otimizados, suporta APC, KV cache quantization e speculative decoding. Ollama 0.19+ usa MLX automaticamente para Safetensors no Apple Silicon, mas adiciona overhead da camada Go. llama.cpp é o padrão ouro de compatibilidade GGUF. ds4 é uma engine nativa para DeepSeek V4, GLM 5.2 e Laguna S.

MLX mais rápido no M5 Ollama mais fácil llama.cpp GGUF universal ds4 DeepSeek V4 Escolha pelo trade-off velocidade × facilidade × compatibilidade
Quatro motores, quatro perfis de uso.
3

Quando usar cada motor


Use MLX como padrão para quase tudo. Use Ollama quando quiser prototipar rápido ou integrar com agentes que já falam Ollama. Use llama.cpp quando só existir um modelo em GGUF. Use ds4 quando precisar rodar DeepSeek V4 Flash localmente e aceitar a configuração extra.

Por baixo do capô

Regra prática do research_mac_inference_m5max.md: "Use MLX sempre que possível no M5 Max; reserve Ollama/llama.cpp para compatibilidade com GGUF e ds4 para modelos grandes de fronteira."

Modelo tem MLX? Sim → use MLX Quer facilidade? Sim → Ollama Modelo gigante? DeepSeek → ds4/llama.cpp
Árvore de decisão simples para escolher o motor.
Terminal
# MLX padrão
python -m mlx_lm.server --model mlx-community/Qwen3.6-35B-A3B-8bit

# Ollama rápido
ollama pull qwen3.6:35b-a3b
ollama run qwen3.6:35b-a3b

# llama.cpp com GGUF
./llama-cli -m modelo.gguf -ngl 99 -c 32768

# ds4 para DeepSeek V4 Flash
./ds4 -p "Explique a arquitetura." --nothink
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Qual motor é recomendado como padrão no M5 Max?
a está correta. MLX é nativo Apple Silicon e geralmente mais rápido. Ollama é mais fácil; ds4 é especializado em modelos gigantes.
Qual vantagem a Unified Memory dá para inferência local?
c está correta. Zero-copy entre CPU/GPU/Neural Engine reduz latência e uso de memória. Não é sobre núcleos ou bateria.
Recordar
Por que MLX é mais rápido que llama.cpp no Apple Silicon?
Clique para virar
MLX foi feito pela Apple para Metal e Unified Memory; llama.cpp traduz padrões CUDA→Metal, perdendo otimizações dos Neural Accelerators do M5.
Recordar
Quando escolher Ollama em vez de MLX puro?
Clique para virar
Quando a facilidade e a compatibilidade com agentes superam a velocidade máxima, ou para prototipagem rápida.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.