Understand why the M5 Max 128 GB and MLX are the ideal native combo for local inference on Apple Silicon.
Fonte primária para entender como modelos convertidos para MLX rodam nativamente no Apple Silicon.
O Mac M5 Max não é só um laptop caro: ele é quase um acelerador de IA com memória compartilhada. CPU, GPU e Neural Engine acessam os mesmos 128 GB sem precisar copiar dados de um lado para outro. O MLX é a biblioteca da Apple que aproveita isso.
Pense como uma cozinha compacta: em computadores comuns, ingredientes ficam em armários separados e você perde tempo transportando panelas. No Mac, tudo está na mesma bancada; o chef (MLX) pega e usa sem perder tempo.
Apple Silicon Unified Memory enables zero-copy between CPU, Metal GPU and Neural Engine. This reduces RAM usage by ~7–13% compared to GGUF/llama.cpp. The M5 Max delivers ~614 GB/s of bandwidth, so the bottleneck becomes bandwidth and Metal kernel efficiency, not VRAM.
In July 2026 benchmarks, the M5 Max 128 GB runs Qwen3.6-35B-A3B at ~80 tok/s in 8-bit. The M5's Neural Accelerators cut TTFT (time-to-first-token) by 3–4× versus the M4 Max on the same model, thanks to Metal kernels optimized for attention and matmul.
Existem vários programas que "falam" com os modelos. O MLX é o mais rápido no Apple Silicon porque foi feito pela Apple. O Ollama é o mais fácil de usar. O llama.cpp é o mais compatível. O ds4/DwarfStar é especialista em modelos gigantes como DeepSeek V4 Flash.
MLX (mlx-lm, mlx-vlm, mlx-audio) usa kernels Metal otimizados, suporta APC, KV cache quantization e speculative decoding. Ollama 0.19+ usa MLX automaticamente para Safetensors no Apple Silicon, mas adiciona overhead da camada Go. llama.cpp é o padrão ouro de compatibilidade GGUF. ds4 é uma engine nativa para DeepSeek V4, GLM 5.2 e Laguna S.
Use MLX como padrão para quase tudo. Use Ollama quando quiser prototipar rápido ou integrar com agentes que já falam Ollama. Use llama.cpp quando só existir um modelo em GGUF. Use ds4 quando precisar rodar DeepSeek V4 Flash localmente e aceitar a configuração extra.
Regra prática do research_mac_inference_m5max.md: "Use MLX sempre que possível no M5 Max; reserve Ollama/llama.cpp para compatibilidade com GGUF e ds4 para modelos grandes de fronteira."
# MLX default python -m mlx_lm.server --model mlx-community/Qwen3.6-35B-A3B-8bit # Ollama quick start ollama pull qwen3.6:35b-a3b ollama run qwen3.6:35b-a3b # llama.cpp com GGUF ./llama-cli -m modelo.gguf -ngl 99 -c 32768 # ds4 para DeepSeek V4 Flash ./ds4 -p "Explique a arquitetura." --nothink
Test what you learned with quick exercises.