Três padrões agentic — /opinion, /fusion e /auto-validate — transformam modelos locais em uma equipe confiável antes de qualquer chamada à nuvem.
/opinion para gerar múltiplas perspectivas locais./fusion para consolidar opiniões em um documento decisão-ready./auto-validate como gate executável antes da nuvem.AGENTS.md no projeto — descreve o padrão fusion e a delegação cross-agent para validação de alto risco.
/opinion é o comando que diz: "antes de decidir, ouça várias vozes". Em vez de confiar numa única resposta, você faz dois ou mais modelos locais — ou o mesmo modelo com prompts diferentes — gerarem perspectivas independentes sobre o mesmo problema.
O valor está na divergência controlada: um modelo pode notar um risco que outro ignorou. Depois, um segundo passo funde essas opiniões. Isso reduz alucinação e aumenta a cobertura antes de gastar tokens caros.
Implemente /opinion como chamadas paralelas a endpoints locais. Cada worker recebe o mesmo contexto, mas um prompt especialista diferente: um focado em segurança, outro em performance, outro em conformidade. Use asyncio.gather ou curl paralelo. No Mac M5 Max, quatro chamadas simultâneas a Qwen3.6-35B-A3B ou Gemma-4-26B-A4B ainda cabem na memória unificada.
for role in security performance compliance; do curl -s http://localhost:8080/v1/chat/completions \\ -H "Content-Type: application/json" \\ -d "{\"model\":\"Qwen3.6-35B-A3B\",\"messages\":[{\"role\":\"system\",\"content\":\"You are the ${role} reviewer.\"},{\"role\":\"user\",\"content\":\"${PROMPT}"\"}]} > opinion_${role}.json & done wait
Depois de coletar opiniões, /fusion consolida tudo em um documento decisão-ready. Ele não apenas resume: identifica concordâncias, divergências e recomenda uma ação clara com justificativa. A nuvem recebe esse pacote, não o debate bruto.
O nó /fusion é um modelo local atuando como juiz. O prompt de sistema instrui: "Dado o contexto e as três opiniões abaixo, produza: (1) resumo das concordâncias, (2) divergências principais, (3) recomendação, (4) confiança (alta/média/baixa), (5) próxima ação sugerida." O juiz pode ser Qwen3.6-35B-A3B para código/texto ou DeepSeek-V4-Flash quando o contexto excede 256K tokens.
/auto-validate é o portão executável: antes de enviar qualquer coisa à nuvem, o agente local roda checks que só podem ser verdadeiros ou falsos. Isso inclui testes unitários, lint, validação de schema, políticas de segurança e assertivas sobre o conteúdo.
Pense em um fiscal de alfândega: ele não decide se a carga é boa, mas impede que contrabando atravesse. Só passa o que está documentado e dentro das regras.
Gates comuns: pytest, ruff/eslint, mypy, JSON Schema validation, regex de PII, tamanho do contexto, custo estimado. O resultado é um relatório {passed: bool, checks: [...]}. Se falhar, o workflow volta para o worker responsável ou para um humano.
def auto_validate(payload): checks = [ len(payload["context"]) <= 200_000, payload["confidence"] in ("high", "medium"), payload.get("pii_detected") is False, ] return {"passed": all(checks), "checks": checks}
A equipe agentic se organiza em três camadas: orchestrator decide o plano, team leads coordenam workers especialistas, e workers executam tarefas concretas — OCR, ASR, VLM, geração de código, validação.
Essa hierarquia evita que um único prompt gigante tente fazer tudo. Cada camada tem responsabilidade clara e pode falhar isoladamente, facilitando debug.
O orchestrator pode ser um script Python ou um grafo LangGraph. Cada team lead gerencia uma fila de workers: vision_lead com mlx_vlm.server, audio_lead com mlx_audio, code_lead com mlx_lm.server. Os resultados sobem para /opinion → /fusion → /auto-validate → gateway Frontier.
Agentes rodam como processos de longa duração. Sem visibilidade, você não sabe se estão vivos, travados ou gastando tempo no lugar errado. tmux (ou cmux, se usar uma camada de múltiplas sessões) oferece janelas persistentes, logs em tempo real e a capacidade de reconectar depois.
Uma sessão por agente ou por equipe: tmux new-session -s orchestrator, tmux new-session -s vision_team, etc. Use tmux send-keys para iniciar workers remotamente e tmux capture-pane para coletar logs. Para múltiplos servidores, cmux (ou scripts customizados) sincroniza comandos em várias sessões ao mesmo tempo.
# crie uma sessão para cada camada tmux new-session -d -s orchestrator "python orchestrator.py" tmux new-session -d -s text_team "python text_lead.py" # inspecione em tempo real tmux attach -t orchestrator
Cada worker do cluster precisa de um modelo com o perfil certo: rápido para tarefas rotineiras, longo contexto para sumarização de documentos, multimodal para imagem/áudio, especialista para OCR e fala. A tabela abaixo sugere alocações de referência para o Mac M5 Max 128 GB.
As alocações consideram memória e latência. Qwen3.6-35B-A3B é o workhorse de texto/código. Gemma-4-26B-A4B cobre visão e áudio leve. DeepSeek-V4-Flash entra sob demanda para contexto de 1M tokens. Especialistas menores — GLM-OCR-bf16, Qwen3-ASR-1.7B-8bit, Kokoro-82M-bf16 — rodam em paralelo sem competir pela RAM.
| Papel do agente | Modelo local | Quando usar |
|---|---|---|
| Orchestrator / juiz | Qwen3.6-35B-A3B | Planejamento, /fusion, decisões de roteamento. |
| Vision lead / VLM worker | Gemma-4-26B-A4B | Descrição de imagens, OCR leve, entendimento visual. |
| Long-context summarizer | DeepSeek-V4-Flash | Documentos enormes, contexto de 1M tokens sob demanda. |
| OCR specialist | GLM-OCR-bf16 | PDFs complexos, tabelas e layouts. |
| STT worker | Qwen3-ASR-1.7B-8bit | Transcrição de áudio para texto. |
| TTS worker | Kokoro-82M-bf16 | Geração de voz local. |
| Embedding / RAG | bge-m3 | Busca semântica e recuperação de contexto. |
Qwen3.6-35B-A3B como default. Só adicione especialistas quando a tarefa provar que precisa deles.Teste o que aprendeu com exercícios rápidos.
/auto-validate é o gate executável que impede que saídas ruins cheguem ao Frontier.DeepSeek-V4-Flash é o modelo de longo contexto, reservado para casos específicos.