Engenheiro de IA focado em produção — sistemas agênticos, RAG e plataformas orientadas a avaliação. Cada projeto abaixo tem testes, CI, métricas publicadas e uma forma de você verificar as afirmações sem acreditar na minha palavra.
🔨 Forgehand — agentes com garantias de produção
Sistema multiagente de entrega de software: orquestração LangGraph, fan-out
paralelo, judge LLM com veto objetivo (pytest, ruff e mypy podem reprovar
mesmo quando o judge aprova), gates humanos e execução durável com checkpoints
em PostgreSQL.
Piloto medido: 88,9% de conclusão em 9 workflows reais, custo médio de US$ 0,003 por workflow e latência p95 de 41,6 s — metodologia e diagnóstico no relatório do piloto. 95 funções de teste, CI com PostgreSQL 16 e Neo4j 5.
🔎 Enterprise RAG System — recuperação que dá para medir
RAG híbrido (BM25 + vetorial) com fusão de scores, reranking, respostas com citações e Recall@K / MRR como endpoint de primeira classe da API. Toda resposta expõe os scores de cada estágio — dá para ver por que um trecho foi recuperado, não apenas que ele foi.
55 testes offline, dataset rotulado e versionado, mesmo código do backend em memória ao Qdrant. Demo ao vivo — experimente o
/querye o/evaluate/batchno navegador.
🏥 SRAG Health Monitor — IA aplicada a um domínio público real
Relatórios epidemiológicos a partir de dados DATASUS/SIVEP-Gripe: API FastAPI, worker assíncrono, jobs retomáveis por etapa, auditoria, anonimização de PII e guardrails.
89 testes offline, Docker Compose, e um relatório de exemplo versionado no repositório — a saída é verificável antes de instalar qualquer coisa.
| Projeto | Evidência |
|---|---|
| AutoDiag | Diagnóstico OBD2 publicado no PyPI — 89 testes, demo completa sem hardware, CLI + web |
| LoRA TweetSumm | Fine-tuning T5 com LoRA — ablação de rank, ROUGE-L 0,357 e demo ao vivo no Hugging Face |
| RAG Agentic System | Loop de tool use com Claude sobre recuperação — raciocínio multi-passo, complementar ao Enterprise RAG |
| Sistema de Otimização Logística | OR-Tools, CVRP com restrições logísticas do Brasil, comparação de algoritmos e interface Streamlit |
- Avaliação primeiro: Recall@K, MRR, ROUGE, groundedness e datasets versionados — se não dá para medir, não dá para melhorar
- Produção, não demo: Docker, filas/workers, health checks, retries, circuit breakers e execução durável
- Observabilidade: OpenTelemetry, Langfuse, Prometheus, custo e latência rastreados por execução
- Qualidade automatizada: pytest, ruff, mypy e GitHub Actions em todos os projetos
- Stack: Python, FastAPI, PyTorch, Transformers, PEFT/LoRA, LangGraph, PostgreSQL, Qdrant, Neo4j
Forward Deployed AI Engineering: traduzir problemas de negócio complexos em sistemas de IA confiáveis, observáveis e mensuráveis.

