← Voltar ao portfólio

AI Copilot

Um copiloto de IA multi-agente embutido na web e no WhatsApp — GPT-4o, Claude e Groq com RAG, function calling e streaming em tempo real.

Engenheiro Full-Stack Líder2024 — 2025
  • Vercel AI SDK
  • OpenAI GPT-4o
  • Anthropic Claude
  • Groq / Llama
  • pgvector
  • TypeScript
  • Next.js
  • PostgreSQL
Capa do estudo de caso do AI Copilot

Desafio

Times de suporte e operação de 100+ organizações se afogavam em perguntas repetitivas e buscas manuais espalhadas por dados de billing, agendamento e CRM. Precisavam de respostas fundamentadas nos dados do próprio tenant — não um chatbot genérico — disponíveis onde já trabalhavam: no app web e no WhatsApp.

Solução

Construí um copiloto multi-agente e agnóstico de provedor sobre a Vercel AI SDK. Um agente roteador escolhe agentes especialistas e ferramentas via function calling, recupera contexto fundamentado com RAG sobre pgvector e transmite as respostas token a token para web e WhatsApp. A escolha de modelo (GPT-4o, Claude, Groq/Llama) fica abstraída atrás de uma interface, roteando por custo, latência e capacidade.

Visão geral

O AI Copilot é uma feature de produção embutida em um SaaS multi-tenant, dando a cada organização um assistente fundamentado sobre os próprios dados. Roda na aplicação web e no WhatsApp, compartilhando um backend e um runtime de agentes.

Arquitetura

  • Roteador + agentes especialistas — um roteador leve classifica a intenção e delega a agentes especialistas, cada um expondo um conjunto focado de ferramentas via function calling.
  • Recuperação fundamentada — um pipeline de RAG sobre pgvector injeta contexto por tenant (documentos, registros, configs) com isolamento estrito por row-level security, então respostas nunca vazam entre organizações.
  • Modelos agnósticos de provedor — GPT-4o, Claude e Groq/Llama ficam atrás de uma única interface; o roteador escolhe o modelo por custo, latência e capacidade, com fallback automático.
  • Streaming em todo lugar — as respostas fluem token a token na UI web e são fragmentadas para entrega no WhatsApp, mantendo a latência percebida baixa.

Foco de engenharia

As partes difíceis eram confiabilidade e segurança, não o demo: schemas de ferramentas que o modelo chama corretamente, isolamento de tenant na recuperação, fallbacks determinísticos quando um provedor degrada e observabilidade completa (traces, custos, rastreio de erros) para que a feature fosse confiável em produção.

Impacto

  • Em produção na web e no WhatsApp para 100+ organizações
  • Function calling sobre ferramentas reais do tenant (billing, agendamento, CRM)
  • RAG com pgvector para respostas fundamentadas por tenant
  • Roteamento agnóstico de provedor entre GPT-4o, Claude e Groq
  • UX de streaming em tempo real com fallback gracioso e observabilidade