Fundador · solo (API + Web) · 5 meses. Em produção atendendo ~49 conversas por dia, hoje rodando o atendimento da própria Batameta (dogfooding). Pequenos negócios perdem venda no WhatsApp porque ninguém responde rápido o bastante, ainda mais de madrugada - e um bot genérico piora com resposta errada e preço inventado. O Ledio é um SaaS onde qualquer negócio sobe um agente de IA que atende no WhatsApp 24/7, treinado por conversa, sem código. A aposta: a arquitetura carrega a inteligência, então um modelo de propósito barato produz resposta boa o suficiente pro dono confiar em conversa real.
O que ele resolve
Pequeno negócio perde venda no WhatsApp por um motivo: ninguém responde rápido o bastante, ainda mais de madrugada. Um chatbot genérico não resolve - responde errado, inventa preço e irrita o cliente. A régua não é 'um bot', é 'um agente bom o suficiente pro dono confiar nele em conversa real'.
A arquitetura carrega a inteligência
Em vez de apelar pro LLM maior e mais caro, o tier padrão é um modelo barato - a qualidade vem de como cada turno é montado, não da força bruta do modelo. Um serviço Brain decide se vale responder, roda análise de engajamento e monta um prompt situacional (triagem, follow-up, venda, suporte) antes de um único token ser gerado. O modelo caro fica reservado pro trabalho realmente pesado.
RAG enxuto + anti-alucinação
Um document learner ingere PDFs, docs e URLs num pipeline multi-passo pra uma memória tipada (fatos, scripts, respostas a objeção) e injeta as top-K memórias relevantes em cada turno - um RAG enxuto. Depois da geração, um checador de alucinação roda guardrails baseados em regra: qualquer preço, URL, porcentagem ou horário que o agente emitir e que não esteja apoiado na base de conhecimento do negócio é sinalizado e mandado pra um humano, em vez de deixar o agente inventar.
Multi-tenant sem vazar contexto
Um agente treinado atende vários negócios ao mesmo tempo. O isolamento de tenant é garantido por um businessId carregado dos decorators de request até cada repositório e fronteira de serviço, com salas Socket.IO escopadas por negócio pro dashboard ao vivo. Uma conversa do negócio A nunca vaza pro contexto do negócio B.
O resto da máquina
Mensagens de áudio são transcritas com Whisper. Um construtor visual de fluxos (React Flow) deixa não-devs desenharem fluxos determinísticos que o backend executa como engine com estado, escalando pra humano em falha repetida. BullMQ + Redis cuidam do trabalho async (broadcast, e-mail, treino) com retry e dead-letter. A conectividade com o WhatsApp fica atrás de uma interface com duas implementações - WAHA (sessão por QR) e a Cloud API oficial - trocável por negócio. Tem até uma suíte de testes de prompt que usa um segundo LLM como 'AI judge' pra pontuar a qualidade da montagem do prompt.
- Por que um modelo de propósito barato por padrão?Orquestração acima do tamanho do modeloCom a orquestração certa - um Brain que monta o prompt, um RAG enxuto e guardrails pós-geração - um modelo pequeno produz resposta ótima por uma fração do custo. O modelo caro é escalação, não o padrão.
- Por que um checador de alucinação pós-geração?Guardrails de fato por regra + handoffEm venda, preço ou link inventado é pior que não responder. Checar a mensagem gerada por qualquer fato que não esteja na base de conhecimento - e mandar esses pra um humano - é o que torna o agente seguro pra confiar com cliente real.
- Por que multi-tenancy escopado por businessId?Isolamento em toda camadaUm agente, muitos clientes, zero vazamento de contexto. O businessId é garantido do decorator de request até cada repositório e sala Socket.IO, então o isolamento é propriedade da arquitetura, não uma query que você pode esquecer de filtrar.
- Por que abstrair o WhatsApp atrás de uma interface?WAHA + Cloud API, trocávelWAHA (sessão por QR) e a Cloud API oficial têm trade-offs diferentes em custo, confiabilidade e onboarding. Um contrato com duas implementações deixa cada negócio escolher o rail certo sem tocar no core do agente.
Em produção atendendo ~49 conversas por dia, hoje rodando o atendimento da própria Batameta - construído solo em 5 meses: um agente multi-tenant rodando num modelo econômico, guardrails anti-alucinação que mandam fato sem lastro pra um humano, um document learner com RAG enxuto, um construtor visual de fluxos em React Flow e uma suíte de testes de prompt pontuada por um AI judge.