Este curso parte do relatório report-cluster-ai.html e das pesquisas locais research_*.md. A missão é ensinar como operar a arquitetura recomendada.
Leia a versão simples, ou abra a camada técnica em qualquer seção.
1
A grande ideia
Imagine que você tem um assistente de pesquisa ao lado do seu computador. Ele lê PDFs, descreve imagens, transcreve áudios e responde perguntas em português — tudo sem enviar dados para a internet. Só quando o assunto é realmente difícil ele pede ajuda a um "especialista caro" na nuvem.
Pense como um restaurante: a cozinha local (Mac) prepara 80% dos ingredientes; o chef externo (Frontier) só finaliza os pratos mais sofisticados. O segredo é enviar para ele apenas o que já foi cortado, temperado e organizado.
Por baixo do capô
O cluster é composto por motores de inferência locais (mlx-lm, mlx-vlm, mlx-audio, Ollama, llama.cpp) servindo modelos quantizados. A estratégia é pré-processamento multimodal: usar a máquina local para triagem, OCR, transcrição, sumarização e roteamento, reduzindo drasticamente o volume de tokens pagos.
Pipeline do cluster: quatro modalidades entram; só o que é realmente complexo segue para a nuvem.
2
Por que local?
Rodar IA localmente traz três vantagens diretas: privacidade (seus documentos não saem da máquina), custo (você não paga por token de inferência) e latência (respostas instantâneas para tarefas repetitivas). O M5 Max 128 GB tem memória suficiente para carregar vários modelos ao mesmo tempo.
Por baixo do capô
O MacBook Pro M5 Max entrega ~614 GB/s de largura de banda de memória unificada LPDDR5X. Isso elimina cópias CPU↔GPU e permite carregar modelos de dezenas de bilhões de parâmetros na RAM compartilhada com a GPU Metal. Modelos como mlx-community/Qwen3.6-35B-A3B-8bit (~22–28 GB) e Gemma-4-26B-A4B-4bit (~18 GB) cabem simultaneamente.
Local não substitui a nuvem: ele filtra o que a nuvem precisa processar.
3
O que o cluster cobre
O curso ensina a operar um cluster que lida com texto longo (até 256K tokens), visão e OCR, áudio (fala→texto e texto→fala), vídeo via extração de frames e busca semântica (RAG). Tudo em português e inglês, usando modelos open-source.
Por baixo do capô
A arquitetura recomendada no relatório usa três modelos simultâneos: mlx-community/Qwen3.6-35B-A3B-8bit para texto/código/RAG, Gemma-4-26B-A4B-MLX-4bit para visão+áudio e DeepSeek-V4-Flash-GGUF UD-IQ3_XXS sob demanda para contexto de 1M tokens.
Quatro modalidades principais, todas rodando no mesmo Mac.
4
Experimente
Teste o que aprendeu com exercícios rápidos.
Recordar
Qual a vantagem de processar 80% das tarefas localmente?
Clique para virar
Reduzir custo de tokens na nuvem, manter dados privados e ter respostas rápidas para tarefas repetitivas.
Recordar
O que é pré-processamento multimodal?
Clique para virar
Usar o Mac para filtrar, transcrever, descrever e resumir dados de texto, imagem, áudio e vídeo antes de delegar o difícil.
Antes de continuar
Se um modelo local gera tokens sem cobrar, por que ainda usar um modelo Frontier pago?
Modelos locais são mais rápidos e baratos, mas modelos Frontier ainda superam em raciocínio profundo, criatividade de alto nível e codificação complexa. O segredo é enviar a eles apenas o que o local não resolve bem.
Qual é a função principal do cluster local no Mac M5 Max?
b está correta. O cluster local faz triagem, OCR, STT, TTS e resumo; a nuvem fica para julgamento ambíguo, criatividade e código difícil. "Substituir totalmente" é impossível com 128 GB, e treinar do zero não é o objetivo.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.