Este curso parte do relatório report-cluster-ai.html e das pesquisas locais research_*.md. A missão é ensinar como operar a arquitetura recomendada.
Read the simple version, or open the technical layer in any section.
1
The big idea
Imagine que você tem um assistente de pesquisa ao lado do seu computador. Ele lê PDFs, descreve imagens, transcreve áudios e responde perguntas em português — tudo sem enviar dados para a internet. Só quando o assunto é realmente difícil ele pede ajuda a um "especialista caro" na nuvem.
Pense como um restaurante: a cozinha local (Mac) prepara 80% dos ingredientes; o chef externo (Frontier) só finaliza os pratos mais sofisticados. O segredo é enviar para ele apenas o que já foi cortado, temperado e organizado.
Under the hood
O cluster é composto por motores de inferência locais (mlx-lm, mlx-vlm, mlx-audio, Ollama, llama.cpp) servindo modelos quantizados. A estratégia é pré-processamento multimodal: usar a máquina local para triagem, OCR, transcrição, sumarização e roteamento, reduzindo drasticamente o volume de tokens pagos.
Pipeline do cluster: quatro modalidades entram; só o que é realmente complexo segue para a nuvem.
2
Why local?
Rodar IA localmente traz três vantagens diretas: privacidade (seus documentos não saem da máquina), custo (você não paga por token de inferência) e latência (respostas instantâneas para tarefas repetitivas). O M5 Max 128 GB tem memória suficiente para carregar vários modelos ao mesmo tempo.
Under the hood
The MacBook Pro M5 Max delivers ~614 GB/s of unified LPDDR5X memory bandwidth. This eliminates CPU↔GPU copies and lets you load models with tens of billions of parameters in RAM shared with the Metal GPU. Models like mlx-community/Qwen3.6-35B-A3B-8bit (~22–28 GB) and Gemma-4-26B-A4B-4bit (~18 GB) fit simultaneously.
Local não substitui a nuvem: ele filtra o que a nuvem precisa processar.
3
What the cluster covers
O curso ensina a operar um cluster que lida com texto longo (até 256K tokens), visão e OCR, áudio (fala→texto e texto→fala), vídeo via extração de frames e busca semântica (RAG). Tudo em português e inglês, usando modelos open-source.
Under the hood
The recommended architecture in the report runs three models side by side: mlx-community/Qwen3.6-35B-A3B-8bit for text/code/RAG, Gemma-4-26B-A4B-MLX-4bit for vision+audio, and DeepSeek-V4-Flash-GGUF UD-IQ3_XXS on demand for 1M-token context.
Quatro modalidades principais, todas rodando no mesmo Mac.
4
Try it
Test what you learned with quick exercises.
Recall
Qual a vantagem de processar 80% das tarefas localmente?
Click to flip
Reduzir custo de tokens na nuvem, manter dados privados e ter respostas rápidas para tarefas repetitivas.
Recall
O que é pré-processamento multimodal?
Click to flip
Usar o Mac para filtrar, transcrever, descrever e resumir dados de texto, imagem, áudio e vídeo antes de delegar o difícil.
Before continuing
Se um modelo local gera tokens sem cobrar, por que ainda usar um modelo Frontier pago?
Modelos locais são mais rápidos e baratos, mas modelos Frontier ainda superam em raciocínio profundo, criatividade de alto nível e codificação complexa. O segredo é enviar a eles apenas o que o local não resolve bem.
Qual é a função principal do cluster local no Mac M5 Max?
b está correta. O cluster local faz triagem, OCR, STT, TTS e resumo; a nuvem fica para julgamento ambíguo, criatividade e código difícil. "Substituir totalmente" é impossível com 128 GB, e treinar do zero não é o objetivo.
Questions? Ask your teacher/agent before moving to the next lesson.