Step 5 · Applications · Applications · RAG and Agent Orchestration PT
Local AI Cluster · Visual Course

RAG and Agent Orchestration

Build a local semantic memory and orchestrate agents to solve sophisticated tasks with minimal paid tokens.

Lesson objectives
  • Montar um pipeline RAG com embeddings e vector DB.
  • Explicar os padrões sidekick, fusion e roteamento por dificuldade.
  • Conectar orquestração a modelos locais via API OpenAI-compatível.
Read first (primary source)
Blaizzy/mlx-audio no GitHub

Motor de áudio para Apple Silicon, com exemplos de TTS/STT e servidor OpenAI-compatible.

Read the simple version, or open the technical layer in any section.
1

The big idea


RAG (Retrieval-Augmented Generation) é dar ao modelo acesso a documentos externos: ele busca os trechos mais relevantes e só então responde. Já a orquestração é decidir qual modelo faz cada parte do trabalho — um modelo leve classifica, um modelo médio executa e um Frontier revisa.

Pense em uma equipe de consultoria: um estagiário encontra os documentos, um analista escreve o rascunho e só o sócio senior aprova a versão final. Cada um faz o que é mais barato para a qualidade exigida.

Under the hood

O pipeline RAG recomendado no research_rag_local_mac.md usa nomic-embed-text-v2-moe ou BAAI/bge-m3 para embeddings, pgvector no Postgres local para vetores + full-text, BAAI/bge-reranker-v2-m3 para reranking e Qwen3-32B via mlx_lm para síntese.

Query Embedding pgvector LLM local RAG local: pergunta → embedding → busca → rerank → síntese A resposta é gerada a partir dos trechos mais relevantes, não da memória do modelo
Pipeline RAG: a pergunta encontra documentos e o modelo local sintetiza a resposta.
2

Orchestration patterns


Três padrões reduzem custo na nuvem: Sidekick/Architect–Editor (um planeja, outro executa), Fusion (dois modelos respondem e um juiz funde) e Roteamento por dificuldade (tarefas simples vão para modelo local, difíceis para Frontier).

Under the hood

Devin Fusion reporta 35–41% de redução de custo mantendo performance frontier. OpenRouter Fusion mostra painéis orçamento atingindo performance próxima de Fable 5 a metade do custo. Localmente, use LangGraph ou n8n para implementar esses padrões com mlx-lm/Ollama.

Sidekick frontier planeja · local executa Fusion dois modelos · juiz funde Roteamento classifica · envia para quem resolve
Três padrões para reduzir custo mantendo qualidade.
3

Minimal implementation


Para começar, você precisa de um banco vetorial local, um modelo de embeddings e um modelo de síntese. O Postgres com pgvector é a escolha recomendada porque une metadados, embeddings e busca full-text no mesmo lugar.

Under the hood

Stack mínima: brew install postgresql@16 pgvector, ollama pull nomic-embed-text-v2-moe, pip install markitdown crawl4ai sentence-transformers pgvector psycopg2-binary langchain mlx-lm. A ingestão usa MarkItDown para documentos e Crawl4AI/Firecrawl para web.

Postgres + pgvector nomic / bge-m3 bge-reranker Qwen3 via mlx-lm
Stack mínima viável de RAG no M5 Max.
Python · RAG mínimo
# ingestão e busca com Chroma (prototipagem)
import chromadb
from sentence_transformers import SentenceTransformer

client = chromadb.Client()
collection = client.create_collection("docs")
emb = SentenceTransformer("BAAI/bge-m3")
texts = ["doc1 em português", "doc2 em inglês"]
collection.add(ids=["1","2"], documents=texts,
               embeddings=emb.encode(texts).tolist())
res = collection.query(query_embeddings=emb.encode(["pergunta"]).tolist(),
                       n_results=5)
print(res)
4

Try it


Test what you learned with quick exercises.

Qual o objetivo do reranker em um pipeline RAG?
b está correta. O reranker recebe os top-k trechos da busca vetorial e escoreia pela pergunta. Embeddings geram vetores; o banco os armazena.
Padrão sidekick passo a passo
1
Modelo frontier (architect) recebe a tarefa e planeja os passos.
2
Modelo local (builder) executa buscas, formatação e testes mecânicos.
3
Frontier revisa e aprova apenas o resultado final.
4
Now you: tente aplicar o mesmo padrão a uma tarefa de código.
Recall
O que é gate-first validation?
Click to flip
Definir critérios de aceite antes de delegar. Se o local atende, não chama frontier — evita tokens pagos desnecessários.
Recall
Por que pgvector em vez de Chroma para produção?
Click to flip
pgvector unifica metadados, embeddings e full-text search no mesmo banco, simplificando backups, auth e RRF.
Questions? Ask your teacher/agent before moving to the next lesson.