Feche o projeto com a stack final de referência, um checklist de entrega e um roteiro claro de próximos passos.
report-cluster-ai.html no workspace — documento interativo que consolidou a pesquisa e deu origem a este curso.
A arquitetura final é um pré-processador local multimodal: Qwen3.6-35B-A3B cuida de texto/código/RAG, Gemma 4 cuida de visão+áudio, DeepSeek-V4-Flash fica disponível sob demanda para contexto de 1M tokens, e RAG/orquestração filtram o que vai para nuvem.
Pense como uma fábrica enxuta: máquinas locais fazem o trabalho repetitivo e barato; a linha de montagem externa só entra quando a peça precisa de acabamento artesanal. O resultado é velocidade, privacidade e custo controlado.
Recomendação do report-cluster-ai.html (julho/2026): rodar três modelos simultâneos — Qwen3.6-35B-A3B-MLX-8bit (~22–28 GB, ~80 tok/s), Gemma-4-26B-A4B-MLX-4bit (~18 GB) e DeepSeek-V4-Flash-GGUF UD-IQ3_XXS (~103 GB) sob demanda. Isso deixa ~78 GB para Qwen + Gemma + buffers/KV-cache. DeepSeek-V4-Flash é reservado para contexto de 1M tokens; Qwen3.6-35B-A3B é o motor padrão de texto/código.
Nenhuma escolha é perfeita. Qwen3.6-35B-A3B é rápido e enxuto, mas não chega a 1M de contexto. DeepSeek-V4-Flash chega a 1M, mas ocupa quase toda a RAM. Gemma 4 é multimodal nativo, mas perde para Qwen3.6-35B-A3B em código difícil. O handoff documenta essas decisões para quem continuar o projeto.
Decisões registradas: motor padrão MLX; Qwen3.6-35B-A3B como LLM principal; Gemma-4-26B-A4B para VLM/áudio; DeepSeek-V4-Flash sob demanda para contexto de 1M tokens; RAG com pgvector + bge-m3; orquestração via LangGraph/n8n; frontend Open WebUI; Ollama como alternativa rápida.
Para entregar o projeto, verifique: ferramentas instaladas, modelos baixados, servidores subindo, Open WebUI acessível, RAG configurado e documentação de decisões. O handoff garante que outra pessoa (ou você no futuro) consiga retomar sem adivinhar.
Checklist técnico: which ollama mlx_lm python3 node npm gh brightdata; modelos mlx-community/Qwen3.6-35B-A3B-8bit, Gemma-4-26B-A4B-MLX-4bit, GLM-OCR-bf16, Kokoro-82M-bf16, Qwen3-ASR-1.7B-8bit; servidores nas portas 8080/8081/8000; Postgres + pgvector; Open WebUI em localhost:3000.
# Verifique se as ferramentas estão no PATH which ollama mlx_lm python3 node npm gh brightdata # Teste o servidor de texto curl http://localhost:8080/v1/models # Teste pgvector psql rag_local -c "SELECT * FROM pg_extension WHERE extname='vector';"
Teste o que aprendeu com exercícios rápidos.
pip install -U mlx-lm mlx-vlm mlx-audio e valide a instalação.mlx-community/Qwen3.6-35B-A3B-8bit e meça tok/s no seu prompt típico.mlx_vlm.server com Gemma-4-26B-A4B e descreva uma imagem.