Passo 5 · Aplicações · Aplicações · RAG e Orquestração de Agentes EN
Cluster Local de IA · Visual Course

RAG e Orquestração de Agentes

Monte uma memória semântica local e orquestre agentes para resolver tarefas sofisticadas com o mínimo de tokens pagos.

Objetivos desta lição
  • Montar um pipeline RAG com embeddings e vector DB.
  • Explicar os padrões sidekick, fusion e roteamento por dificuldade.
  • Conectar orquestração a modelos locais via API OpenAI-compatível.
Leia primeiro (fonte primária)
Blaizzy/mlx-audio no GitHub

Motor de áudio para Apple Silicon, com exemplos de TTS/STT e servidor OpenAI-compatible.

Leia a versão simples, ou abra a camada técnica em qualquer seção.
1

A grande ideia


RAG (Retrieval-Augmented Generation) é dar ao modelo acesso a documentos externos: ele busca os trechos mais relevantes e só então responde. Já a orquestração é decidir qual modelo faz cada parte do trabalho — um modelo leve classifica, um modelo médio executa e um Frontier revisa.

Pense em uma equipe de consultoria: um estagiário encontra os documentos, um analista escreve o rascunho e só o sócio senior aprova a versão final. Cada um faz o que é mais barato para a qualidade exigida.

Por baixo do capô

O pipeline RAG recomendado no research_rag_local_mac.md usa nomic-embed-text-v2-moe ou BAAI/bge-m3 para embeddings, pgvector no Postgres local para vetores + full-text, BAAI/bge-reranker-v2-m3 para reranking e Qwen3-32B via mlx_lm para síntese.

Query Embedding pgvector LLM local RAG local: pergunta → embedding → busca → rerank → síntese A resposta é gerada a partir dos trechos mais relevantes, não da memória do modelo
Pipeline RAG: a pergunta encontra documentos e o modelo local sintetiza a resposta.
2

Padrões de orquestração


Três padrões reduzem custo na nuvem: Sidekick/Architect–Editor (um planeja, outro executa), Fusion (dois modelos respondem e um juiz funde) e Roteamento por dificuldade (tarefas simples vão para modelo local, difíceis para Frontier).

Por baixo do capô

Devin Fusion reporta 35–41% de redução de custo mantendo performance frontier. OpenRouter Fusion mostra painéis orçamento atingindo performance próxima de Fable 5 a metade do custo. Localmente, use LangGraph ou n8n para implementar esses padrões com mlx-lm/Ollama.

Sidekick frontier planeja · local executa Fusion dois modelos · juiz funde Roteamento classifica · envia para quem resolve
Três padrões para reduzir custo mantendo qualidade.
3

Implementação mínima


Para começar, você precisa de um banco vetorial local, um modelo de embeddings e um modelo de síntese. O Postgres com pgvector é a escolha recomendada porque une metadados, embeddings e busca full-text no mesmo lugar.

Por baixo do capô

Stack mínima: brew install postgresql@16 pgvector, ollama pull nomic-embed-text-v2-moe, pip install markitdown crawl4ai sentence-transformers pgvector psycopg2-binary langchain mlx-lm. A ingestão usa MarkItDown para documentos e Crawl4AI/Firecrawl para web.

Postgres + pgvector nomic / bge-m3 bge-reranker Qwen3 via mlx-lm
Stack mínima viável de RAG no M5 Max.
Python · RAG mínimo
# ingestão e busca com Chroma (prototipagem)
import chromadb
from sentence_transformers import SentenceTransformer

client = chromadb.Client()
collection = client.create_collection("docs")
emb = SentenceTransformer("BAAI/bge-m3")
texts = ["doc1 em português", "doc2 em inglês"]
collection.add(ids=["1","2"], documents=texts,
               embeddings=emb.encode(texts).tolist())
res = collection.query(query_embeddings=emb.encode(["pergunta"]).tolist(),
                       n_results=5)
print(res)
4

Experimente


Teste o que aprendeu com exercícios rápidos.

Qual o objetivo do reranker em um pipeline RAG?
b está correta. O reranker recebe os top-k trechos da busca vetorial e escoreia pela pergunta. Embeddings geram vetores; o banco os armazena.
Padrão sidekick passo a passo
1
Modelo frontier (architect) recebe a tarefa e planeja os passos.
2
Modelo local (builder) executa buscas, formatação e testes mecânicos.
3
Frontier revisa e aprova apenas o resultado final.
4
Agora você: tente aplicar o mesmo padrão a uma tarefa de código.
Recordar
O que é gate-first validation?
Clique para virar
Definir critérios de aceite antes de delegar. Se o local atende, não chama frontier — evita tokens pagos desnecessários.
Recordar
Por que pgvector em vez de Chroma para produção?
Clique para virar
pgvector unifica metadados, embeddings e full-text search no mesmo banco, simplificando backups, auth e RRF.
Dúvida? Pergunte ao seu professor/agente antes de ir para a próxima lição.