Step 2 · Fundamentals · Fundamentals · Hardware and the MLX Engine PT
Local AI Cluster · Visual Course

Hardware and the MLX Engine

Understand why the M5 Max 128 GB and MLX are the ideal native combo for local inference on Apple Silicon.

Lesson objectives
  • Explicar o papel da Unified Memory no M5 Max.
  • Comparar MLX, Ollama, llama.cpp e ds4/DwarfStar.
  • Escolher o motor certo para cada tipo de tarefa.
Read first (primary source)
Qwen Docs — MLX local inference

Fonte primária para entender como modelos convertidos para MLX rodam nativamente no Apple Silicon.

Read the simple version, or open the technical layer in any section.
1

The big idea


O Mac M5 Max não é só um laptop caro: ele é quase um acelerador de IA com memória compartilhada. CPU, GPU e Neural Engine acessam os mesmos 128 GB sem precisar copiar dados de um lado para outro. O MLX é a biblioteca da Apple que aproveita isso.

Pense como uma cozinha compacta: em computadores comuns, ingredientes ficam em armários separados e você perde tempo transportando panelas. No Mac, tudo está na mesma bancada; o chef (MLX) pega e usa sem perder tempo.

Under the hood

Apple Silicon Unified Memory enables zero-copy between CPU, Metal GPU and Neural Engine. This reduces RAM usage by ~7–13% compared to GGUF/llama.cpp. The M5 Max delivers ~614 GB/s of bandwidth, so the bottleneck becomes bandwidth and Metal kernel efficiency, not VRAM.

In July 2026 benchmarks, the M5 Max 128 GB runs Qwen3.6-35B-A3B at ~80 tok/s in 8-bit. The M5's Neural Accelerators cut TTFT (time-to-first-token) by 3–4× versus the M4 Max on the same model, thanks to Metal kernels optimized for attention and matmul.

128 GB Unified Memory ~614 GB/s · LPDDR5X CPU Neural Engine GPU Metal
CPU, GPU and Neural Engine share the same 128 GB without copies.
Reference benchmark: Qwen3.6-35B-A3B-8bit reaches ~80 tok/s on the M5 Max 128 GB. TTFT drops 3–4× versus the M4 Max thanks to the M5 Neural Accelerators — a noticeable gain on long prompts and RAG.
2

Inference engines


Existem vários programas que "falam" com os modelos. O MLX é o mais rápido no Apple Silicon porque foi feito pela Apple. O Ollama é o mais fácil de usar. O llama.cpp é o mais compatível. O ds4/DwarfStar é especialista em modelos gigantes como DeepSeek V4 Flash.

Under the hood

MLX (mlx-lm, mlx-vlm, mlx-audio) usa kernels Metal otimizados, suporta APC, KV cache quantization e speculative decoding. Ollama 0.19+ usa MLX automaticamente para Safetensors no Apple Silicon, mas adiciona overhead da camada Go. llama.cpp é o padrão ouro de compatibilidade GGUF. ds4 é uma engine nativa para DeepSeek V4, GLM 5.2 e Laguna S.

MLX mais rápido no M5 Ollama mais fácil llama.cpp GGUF universal ds4 DeepSeek V4 Escolha pelo trade-off velocidade × facilidade × compatibilidade
Quatro motores, quatro perfis de uso.
3

When to use each engine


Use MLX como padrão para quase tudo. Use Ollama quando quiser prototipar rápido ou integrar com agentes que já falam Ollama. Use llama.cpp quando só existir um modelo em GGUF. Use ds4 quando precisar rodar DeepSeek V4 Flash localmente e aceitar a configuração extra.

Under the hood

Regra prática do research_mac_inference_m5max.md: "Use MLX sempre que possível no M5 Max; reserve Ollama/llama.cpp para compatibilidade com GGUF e ds4 para modelos grandes de fronteira."

Modelo tem MLX? Sim → use MLX Quer facilidade? Sim → Ollama Modelo gigante? DeepSeek → ds4/llama.cpp
Árvore de decisão simples para escolher o motor.
Terminal
# MLX default
python -m mlx_lm.server --model mlx-community/Qwen3.6-35B-A3B-8bit

# Ollama quick start
ollama pull qwen3.6:35b-a3b
ollama run qwen3.6:35b-a3b

# llama.cpp com GGUF
./llama-cli -m modelo.gguf -ngl 99 -c 32768

# ds4 para DeepSeek V4 Flash
./ds4 -p "Explique a arquitetura." --nothink
4

Try it


Test what you learned with quick exercises.

Qual motor é recomendado como padrão no M5 Max?
a está correta. MLX é nativo Apple Silicon e geralmente mais rápido. Ollama é mais fácil; ds4 é especializado em modelos gigantes.
Qual vantagem a Unified Memory dá para inferência local?
c está correta. Zero-copy entre CPU/GPU/Neural Engine reduz latência e uso de memória. Não é sobre núcleos ou bateria.
Recall
Por que MLX é mais rápido que llama.cpp no Apple Silicon?
Click to flip
MLX foi feito pela Apple para Metal e Unified Memory; llama.cpp traduz padrões CUDA→Metal, perdendo otimizações dos Neural Accelerators do M5.
Recall
Quando escolher Ollama em vez de MLX puro?
Click to flip
Quando a facilidade e a compatibilidade com agentes superam a velocidade máxima, ou para prototipagem rápida.
Questions? Ask your teacher/agent before moving to the next lesson.