Passo 7 · Conclusão · Conclusão · Arquitetura Recomendada e Handoff EN
Cluster Local de IA · Visual Course

Arquitetura Recomendada e Handoff

Feche o projeto com a stack final de referência, um checklist de entrega e um roteiro claro de próximos passos.

Objetivos desta lição
  • Apresentar a arquitetura final recomendada para o M5 Max 128 GB.
  • Revisar trade-offs e decisões do curso.
  • Fornecer um checklist de handoff e referências rápidas.
Leia primeiro (fonte primária)

report-cluster-ai.html no workspace — documento interativo que consolidou a pesquisa e deu origem a este curso.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


A arquitetura final é um pré-processador local multimodal: Qwen3.6-35B-A3B cuida de texto/código/RAG, Gemma 4 cuida de visão+áudio, DeepSeek-V4-Flash fica disponível sob demanda para contexto de 1M tokens, e RAG/orquestração filtram o que vai para nuvem.

Pense como uma fábrica enxuta: máquinas locais fazem o trabalho repetitivo e barato; a linha de montagem externa só entra quando a peça precisa de acabamento artesanal. O resultado é velocidade, privacidade e custo controlado.

Por baixo do capô

Recomendação do report-cluster-ai.html (julho/2026): rodar três modelos simultâneos — Qwen3.6-35B-A3B-MLX-8bit (~22–28 GB, ~80 tok/s), Gemma-4-26B-A4B-MLX-4bit (~18 GB) e DeepSeek-V4-Flash-GGUF UD-IQ3_XXS (~103 GB) sob demanda. Isso deixa ~78 GB para Qwen + Gemma + buffers/KV-cache. DeepSeek-V4-Flash é reservado para contexto de 1M tokens; Qwen3.6-35B-A3B é o motor padrão de texto/código.

Qwen3.6-35B-A3B 8-bit · ~22–28 GB · texto/código/RAG 256K contexto · ~80 tok/s Gemma-4-26B-A4B 4-bit · ~18 GB · visão+áudio 256K contexto DeepSeek-V4-Flash UD-IQ3_XXS · ~103 GB 1M contexto · sob demanda RAG + Orquestração pgvector · bge-m3 · LangGraph Stack final: dois modelos quentes + um gigante sob demanda + RAG/orquestração
Arquitetura recomendada para o Mac M5 Max 128 GB.
2

Trade-offs e decisões


Nenhuma escolha é perfeita. Qwen3.6-35B-A3B é rápido e enxuto, mas não chega a 1M de contexto. DeepSeek-V4-Flash chega a 1M, mas ocupa quase toda a RAM. Gemma 4 é multimodal nativo, mas perde para Qwen3.6-35B-A3B em código difícil. O handoff documenta essas decisões para quem continuar o projeto.

Por baixo do capô

Decisões registradas: motor padrão MLX; Qwen3.6-35B-A3B como LLM principal; Gemma-4-26B-A4B para VLM/áudio; DeepSeek-V4-Flash sob demanda para contexto de 1M tokens; RAG com pgvector + bge-m3; orquestração via LangGraph/n8n; frontend Open WebUI; Ollama como alternativa rápida.

Qwen3.6-35B-A3B ~80 tok/s · PT/EN · 256K DeepSeek V4 1M ctx · lento · ~103 GB Gemma 4 multimodal · 256K · 140+ idiomas Cada modelo tem um superpoder e uma limitação
Trade-offs que orientam a escolha do modelo.
3

Checklist de handoff


Para entregar o projeto, verifique: ferramentas instaladas, modelos baixados, servidores subindo, Open WebUI acessível, RAG configurado e documentação de decisões. O handoff garante que outra pessoa (ou você no futuro) consiga retomar sem adivinhar.

Por baixo do capô

Checklist técnico: which ollama mlx_lm python3 node npm gh brightdata; modelos mlx-community/Qwen3.6-35B-A3B-8bit, Gemma-4-26B-A4B-MLX-4bit, GLM-OCR-bf16, Kokoro-82M-bf16, Qwen3-ASR-1.7B-8bit; servidores nas portas 8080/8081/8000; Postgres + pgvector; Open WebUI em localhost:3000.

Instalar Baixar modelos Subir servidores RAG Doc
Cinco passos para um handoff confiável.
Terminal · validação rápida
# Verifique se as ferramentas estão no PATH
which ollama mlx_lm python3 node npm gh brightdata

# Teste o servidor de texto
curl http://localhost:8080/v1/models

# Teste pgvector
psql rag_local -c "SELECT * FROM pg_extension WHERE extname='vector';"
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Revisão do curso
Qual é a função do cluster local?
b está correta. O cluster filtra e enxuga tarefas antes de enviar à nuvem.
Qual motor é nativo e mais rápido no Apple Silicon?
a está correta. MLX foi projetado para Metal e Unified Memory.
Qual modelo é recomendado para OCR de documentos?
c está correta. GLM-OCR é especialista e lidera benchmarks documentais.
Os 5 próximos passos
  1. Rode pip install -U mlx-lm mlx-vlm mlx-audio e valide a instalação.
  2. Baixe mlx-community/Qwen3.6-35B-A3B-8bit e meça tok/s no seu prompt típico.
  3. Suba mlx_vlm.server com Gemma-4-26B-A4B e descreva uma imagem.
  4. Configure Postgres + pgvector e indexe um PDF com bge-m3.
  5. Conecte Open WebUI e teste o fluxo texto → imagem → áudio.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.