Passo 3 · Modelos · Modelos · Modelos de Texto e Quantização EN
Cluster Local de IA · Visual Course

Modelos de Texto e Quantização

Compare Qwen3.6-35B-A3B, DeepSeek-V4-Flash e Gemma 4; entenda como quantização decide o que cabe nos 128 GB.

Objetivos desta lição
  • Comparar Qwen3.6-35B-A3B, DeepSeek-V4-Flash e Gemma 4.
  • Interpretar formatos de quantização: Q4_K_M, UD-IQ3_XXS, 8-bit.
  • Escolher o modelo certo para texto, código e contexto longo.
Leia primeiro (fonte primária)
Hugging Face — mlx-community

Coleção de modelos convertidos para MLX; usada para escolher tamanhos e quantizações que cabem no M5 Max.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


Modelos de IA são enormes. Para caber no Mac, usamos quantização: representar cada peso com menos bits. Quanto menos bits, menor e mais rápido, mas com leve perda de qualidade. O segredo é escolher a quantização certa para cada tarefa.

Pense em compressão de música: MP3 de 128 kbps é pequeno e "bom o suficiente"; FLAC é enorme e fiel. Para ouvir no carro, MP3 vale a pena; para masterização, você quer FLAC.

Por baixo do capô

Quantização reduz a precisão dos pesos (e optionally da KV cache). No M5 Max 128 GB, Q4_K_M ou 4bit é o sweet spot: perda de perplexidade típica de apenas 1–3% em relação ao FP16. Q3 já perde visivelmente em raciocínio longo e código; Q2/IQ2 só valem para contexto gigante onde a janela importa mais que a fidelidade. Q8_0/8-bit é usado quando a qualidade máxima é crítica e o modelo cabe.

Q8_0 / 8-bit alta fidelidade Q4_K_M / 4-bit ponto ideal UD-IQ3_XXS ~3 bits IQ2_XXS ~2 bits FP16 Menos bits → menor, mais rápido, mas com mais perda de qualidade
Espectro de quantização: escolha pelo trade-off tamanho vs qualidade.
2

Os modelos de texto


Para texto/código/RAG, o Qwen3.6-35B-A3B é a recomendação principal: ~80 tok/s em 8-bit no M5 Max 128 GB, 256K de contexto, excelente em português e líder em benchmarks de código. Para contexto extremo de 1M tokens, o DeepSeek-V4-Flash cabe apertado em 3-bit (~103 GB). O Gemma 4 também serve para texto, mas brilha mesmo em multimodal.

Por baixo do capô

Qwen3.6-35B-A3B é MoE (~35B total, ~3B ativos por token), com velocidade medida em ~80–110 tok/s no M5 Max 128 GB e contexto de 256K. Benchmarks de qualidade detalhados (SWE-Verified, MMLU) são proxies baseados na arquitetura Qwen3.5-35B-A3B; use-o como motor de equilíbrio velocidade/memória. DeepSeek-V4-Flash é MoE 284B/~13B ativos, ELO 1431, contexto até 1M. Gemma-4-31B é denso, ELO 1441–1452, MMLU-Pro 85.2%, 256K contexto, multimodal nativo. Qwen3.5-122B-A10B entrega ELO 1418 e 262K contexto; GLM-5.2 atinge ELO 1465.

Benchmarks cruzados (julho/2026)

ModeloVelocidade local*LLMCheckSWE-VerifiedMMLUArena ELOContextoQuantizaçãoMultilíngue
Qwen3.6-35B-A3B~80–110 tok/s~70%*~86%*~1396*256K8bit ~22–28 GB / 4bit ~14 GBPT/EN forte
DeepSeek-V4-Flash~34 tok/s (IQ2/UD-IQ3)14311MUD-IQ3_XXS ~103 GB
Gemma 4 31BMMLU-Pro 85.2%1441–1452256K4bit ~20 GBMMMLU 88.4%
Gemma 4 26B-A4B~50 tok/s256K4bit ~18 GB
Qwen3.5-122B-A10B1418262K4bit ~70 GBMMMLU 86.7%
GLM-5.21465varia

*Velocidades medidas no M5 Max 128 GB com MLX; tok/s dependem do prompt e da carga do sistema. Os valores de SWE-Verified, MMLU e Arena ELO para Qwen3.6-35B-A3B são proxies baseados em Qwen3.5-35B-A3B e relatórios da comunidade.

Qwen3.6-35B-A3B ~22–28 GB · 256K ctx DeepSeek-V4-Flash ~103 GB · 1M ctx Gemma-4-31B ~20 GB · 256K ctx Llama-4 Scout ~60 GB · 10M teórico Uso de memória aproximado em quantizações recomendadas 128 GB cabem Qwen + Gemma juntos, ou DeepSeek sozinho apertado
Comparativo de memória e contexto dos principais modelos de texto.
3

Otimização de inferência


Além de quantizar pesos, você pode quantizar a KV cache (memória de contexto), ativar Flash Attention e usar speculative decoding (um modelo pequeno sugere tokens que o grande confirma). Essas técnicas multiplicam a janela de contexto e a velocidade.

Por baixo do capô

KV cache quantization reduz memória de estados chave/valor em 1,3–6,4×. Flash Attention diminui acessos à HBM. Speculative decoding usa um draft model para gerar candidatos. No MLX: --kv-bits 8 e --max-kv-size 65536; no Ollama: OLLAMA_KV_CACHE_TYPE=q8_0.

KV cache quant menos memória de contexto Flash Attention atenção eficiente Speculative decoding draft + verificação
Três alavancas para contexto longo e velocidade.
Terminal · otimização
# KV cache quantization no MLX
python -m mlx_lm.server --model mlx-community/Qwen3.6-35B-A3B-8bit   --kv-bits 8 --max-kv-size 65536

# Ollama com KV cache q8_0
export OLLAMA_KV_CACHE_TYPE=q8_0
ollama serve

# Speculative decoding com draft model
python -m mlx_lm.generate --model large_model   --draft-model small_draft_model --num-draft-tokens 4
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Qual quantização é o ponto ideal no M5 Max 128 GB para modelos até ~70B?
b está correta. Q4_K_M oferece o melhor equilíbrio qualidade/tamanho. Q8_0 é para fidelidade crítica; IQ2_XXS é para modelos muito grandes com perda perceptível.
Exercício guiado
1
Leia o tamanho do modelo: Qwen3.6-35B-A3B-8bit ≈ 22–28 GB.
2
Verifique espaço livre: 128 GB − 25 GB ≈ 103 GB para KV cache e sistema.
3
Se quiser rodar Gemma-4-26B-A4B-4bit (~18 GB) junto, some: 25 + 18 = 43 GB — cabe com folga.
4
Agora você: DeepSeek-V4-Flash UD-IQ3_XXS ≈ 103 GB. Ele cabe sozinho, mas não junto com Qwen 8-bit.
Recordar
Qual modelo usar para contexto de 1M tokens localmente?
Clique para virar
DeepSeek-V4-Flash em GGUF UD-IQ3_XXS (~103 GB) via llama.cpp, Ollama ou ds4. Cabe apertado em 128 GB.
Recordar
O que é speculative decoding?
Clique para virar
Um modelo pequeno gera tokens candidatos rapidamente; o modelo grande verifica vários de uma só vez, acelerando a geração.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.