Passo 9 · Agentic Workflows · Módulo 3 · Fusion, Orquestração e Gateway Frontier EN
Cluster Local de IA · Visual Course

Fusion, Orquestração e Gateway Frontier

Três padrões agentic — /opinion, /fusion e /auto-validate — transformam modelos locais em uma equipe confiável antes de qualquer chamada à nuvem.

Objetivos desta lição
  • Usar /opinion para gerar múltiplas perspectivas locais.
  • Usar /fusion para consolidar opiniões em um documento decisão-ready.
  • Usar /auto-validate como gate executável antes da nuvem.
  • Desenhar a arquitetura 3-tier e escolher modelos por papel de agente.
Leia primeiro (fonte primária)

AGENTS.md no projeto — descreve o padrão fusion e a delegação cross-agent para validação de alto risco.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

Padrão /opinion


/opinion é o comando que diz: "antes de decidir, ouça várias vozes". Em vez de confiar numa única resposta, você faz dois ou mais modelos locais — ou o mesmo modelo com prompts diferentes — gerarem perspectivas independentes sobre o mesmo problema.

O valor está na divergência controlada: um modelo pode notar um risco que outro ignorou. Depois, um segundo passo funde essas opiniões. Isso reduz alucinação e aumenta a cobertura antes de gastar tokens caros.

Por baixo do capô

Implemente /opinion como chamadas paralelas a endpoints locais. Cada worker recebe o mesmo contexto, mas um prompt especialista diferente: um focado em segurança, outro em performance, outro em conformidade. Use asyncio.gather ou curl paralelo. No Mac M5 Max, quatro chamadas simultâneas a Qwen3.6-35B-A3B ou Gemma-4-26B-A4B ainda cabem na memória unificada.

Shell · chamadas /opinion em paralelo
for role in security performance compliance; do
  curl -s http://localhost:8080/v1/chat/completions \\
    -H "Content-Type: application/json" \\
    -d "{\"model\":\"Qwen3.6-35B-A3B\",\"messages\":[{\"role\":\"system\",\"content\":\"You are the ${role} reviewer.\"},{\"role\":\"user\",\"content\":\"${PROMPT}"\"}]} > opinion_${role}.json &
done
wait
2

Padrão /fusion


Depois de coletar opiniões, /fusion consolida tudo em um documento decisão-ready. Ele não apenas resume: identifica concordâncias, divergências e recomenda uma ação clara com justificativa. A nuvem recebe esse pacote, não o debate bruto.

Por baixo do capô

O nó /fusion é um modelo local atuando como juiz. O prompt de sistema instrui: "Dado o contexto e as três opiniões abaixo, produza: (1) resumo das concordâncias, (2) divergências principais, (3) recomendação, (4) confiança (alta/média/baixa), (5) próxima ação sugerida." O juiz pode ser Qwen3.6-35B-A3B para código/texto ou DeepSeek-V4-Flash quando o contexto excede 256K tokens.

3

Padrão /auto-validate


/auto-validate é o portão executável: antes de enviar qualquer coisa à nuvem, o agente local roda checks que só podem ser verdadeiros ou falsos. Isso inclui testes unitários, lint, validação de schema, políticas de segurança e assertivas sobre o conteúdo.

Pense em um fiscal de alfândega: ele não decide se a carga é boa, mas impede que contrabando atravesse. Só passa o que está documentado e dentro das regras.

Por baixo do capô

Gates comuns: pytest, ruff/eslint, mypy, JSON Schema validation, regex de PII, tamanho do contexto, custo estimado. O resultado é um relatório {passed: bool, checks: [...]}. Se falhar, o workflow volta para o worker responsável ou para um humano.

Python · gate de validação
def auto_validate(payload):
    checks = [
        len(payload["context"]) <= 200_000,
        payload["confidence"] in ("high", "medium"),
        payload.get("pii_detected") is False,
    ]
    return {"passed": all(checks), "checks": checks}
4

Arquitetura 3-tier


A equipe agentic se organiza em três camadas: orchestrator decide o plano, team leads coordenam workers especialistas, e workers executam tarefas concretas — OCR, ASR, VLM, geração de código, validação.

Essa hierarquia evita que um único prompt gigante tente fazer tudo. Cada camada tem responsabilidade clara e pode falhar isoladamente, facilitando debug.

Por baixo do capô

O orchestrator pode ser um script Python ou um grafo LangGraph. Cada team lead gerencia uma fila de workers: vision_lead com mlx_vlm.server, audio_lead com mlx_audio, code_lead com mlx_lm.server. Os resultados sobem para /opinion/fusion/auto-validate → gateway Frontier.

Orchestrator Team Lead · Texto Team Lead · Visão Team Lead · Áudio OCR worker Code worker VLM worker ASR worker Validate Gateway Frontier
Opinion → fusion → validate → frontier, sobre uma arquitetura 3-tier.
5

CMUX/Tmux como camada de visibilidade


Agentes rodam como processos de longa duração. Sem visibilidade, você não sabe se estão vivos, travados ou gastando tempo no lugar errado. tmux (ou cmux, se usar uma camada de múltiplas sessões) oferece janelas persistentes, logs em tempo real e a capacidade de reconectar depois.

Por baixo do capô

Uma sessão por agente ou por equipe: tmux new-session -s orchestrator, tmux new-session -s vision_team, etc. Use tmux send-keys para iniciar workers remotamente e tmux capture-pane para coletar logs. Para múltiplos servidores, cmux (ou scripts customizados) sincroniza comandos em várias sessões ao mesmo tempo.

Terminal · visibilidade com tmux
# crie uma sessão para cada camada
tmux new-session -d -s orchestrator "python orchestrator.py"
tmux new-session -d -s text_team "python text_lead.py"

# inspecione em tempo real
tmux attach -t orchestrator
Atenção. Nunca exponha a API key do Frontier no log do tmux. Use variáveis de ambiente e redija secrets antes de capturar panes.
6

Alocação de modelos por papel


Cada worker do cluster precisa de um modelo com o perfil certo: rápido para tarefas rotineiras, longo contexto para sumarização de documentos, multimodal para imagem/áudio, especialista para OCR e fala. A tabela abaixo sugere alocações de referência para o Mac M5 Max 128 GB.

Por baixo do capô

As alocações consideram memória e latência. Qwen3.6-35B-A3B é o workhorse de texto/código. Gemma-4-26B-A4B cobre visão e áudio leve. DeepSeek-V4-Flash entra sob demanda para contexto de 1M tokens. Especialistas menores — GLM-OCR-bf16, Qwen3-ASR-1.7B-8bit, Kokoro-82M-bf16 — rodam em paralelo sem competir pela RAM.

Papel do agenteModelo localQuando usar
Orchestrator / juizQwen3.6-35B-A3BPlanejamento, /fusion, decisões de roteamento.
Vision lead / VLM workerGemma-4-26B-A4BDescrição de imagens, OCR leve, entendimento visual.
Long-context summarizerDeepSeek-V4-FlashDocumentos enormes, contexto de 1M tokens sob demanda.
OCR specialistGLM-OCR-bf16PDFs complexos, tabelas e layouts.
STT workerQwen3-ASR-1.7B-8bitTranscrição de áudio para texto.
TTS workerKokoro-82M-bf16Geração de voz local.
Embedding / RAGbge-m3Busca semântica e recuperação de contexto.
Regra prática. Comece com Qwen3.6-35B-A3B como default. Só adicione especialistas quando a tarefa provar que precisa deles.
7

Experimente


Teste o que aprendeu com exercícios rápidos.

Revisão do módulo
Qual padrão executa testes, lint e verificações antes de enviar à nuvem?
c está correta. /auto-validate é o gate executável que impede que saídas ruins cheguem ao Frontier.
Na arquitetura 3-tier, quem coordena os workers especialistas?
b está correta. Team leads traduzem a estratégia do orchestrator em tarefas para workers.
Qual modelo é recomendado para contexto de 1M tokens sob demanda?
a está correta. DeepSeek-V4-Flash é o modelo de longo contexto, reservado para casos específicos.
Dúvida? Pergunte ao seu professor/agente antes de encerrar o módulo.