Automação que lê peças processuais (sentenças, razões de apelação, contrarrazões, pareceres etc.), extrai as teses jurídicas reaproveitáveis nelas contidas e as generaliza, preservando os fundamentos jurídicos e a jurisprudência citada, mas removendo qualquer vínculo com o caso concreto. O resultado é uma base de conhecimento em arquivos Markdown estruturados, pensada para ser consultada por um agente no futuro, como insumo para a elaboração de novas peças.
Este repositório também serve como exemplo de um fluxo de trabalho completo com o Claude, do planejamento até a automação, e vale registrar as etapas percorridas:
-
Planejamento em chat. Tudo começou numa conversa com o Claude, sem nenhuma linha de código. Ali amadurecemos a ideia, discutimos alternativas e chegamos a um desenho de solução: uma automação que extrai teses de peças processuais e as generaliza, preservando argumentos jurídicos e jurisprudência, para compor uma base de conhecimento em Markdown. Essa é a fase mais importante — é nela que se define o fluxo de trabalho, o tipo de peça a ser analisada, o formato de saída esperado e como os scripts de apoio devem se encaixar no processo.
-
Prompt de scaffold. Ao final da conversa, pedimos ao Claude um prompt que organizasse a pasta de trabalho, criasse o ambiente virtual Python, instalasse as bibliotecas necessárias, gerasse os scripts de automação e estabelecesse o roteiro de extração no formato de Skill do Claude Code. Esse processo de gerar toda a estrutura inicial (pastas, ambiente, arquivos) a partir de uma especificação é chamado de scaffold do projeto.
-
Execução no VS Code. Abrimos o VS Code, executamos o Claude Code dentro dele e fornecemos o prompt de scaffold obtido no passo anterior. A partir daí, a estrutura de pastas, o ambiente virtual e os scripts (
scripts/preparar_entrada.pyescripts/validar_gravar.py) foram criados automaticamente, e o arquivo.claude/skills/extrair-teses/SKILL.mdfoi gravado na pasta correta. Conferimos objetivamente se o resultado correspondia ao que havia sido planejado no chat. -
Processamento das peças. Com a estrutura pronta, as peças processuais passaram a ser depositadas na pasta
entrada/. No chat do Claude Code, solicitamos o processamento explicitamente ou invocamos a Skill diretamente (/extrair-teses). Se tudo correu como planejado, as teses aparecem generalizadas — sem nomes, datas, valores ou referências de autos do caso concreto — mas com a jurisprudência e a legislação citadas na peça original preservadas, prontas para reaproveitamento futuro, por exemplo, por uma outra skill dedicada à elaboração de contrarrazões.
entrada/ peças .docx a processar (entrada bruta)
entrada/_texto_extraido/ texto das peças já extraído (cache por hash)
teses/_bruto/ saída bruta da Skill, um arquivo por peça (por hash)
teses/ teses validadas e gravadas, uma por arquivo
teses/_revisar/ teses muito similares a alguma já existente
teses/_index.json índice de todas as teses gravadas
processados.json controle de idempotência (hash -> status)
scripts/preparar_entrada.py extrai texto dos .docx e lista peças pendentes
scripts/validar_gravar.py valida a saída da Skill e grava as teses finais
.claude/skills/extrair-teses/SKILL.md prompt/roteiro da Skill de extração
- Coloque as peças processuais (
.docx) na pastaentrada/. - Rode
uv run python scripts/preparar_entrada.pypara extrair o texto de cada peça nova (por hash, evitando reprocessar peças já tratadas) e listar o que está pendente. - No Claude Code, peça para aplicar a skill
extrair-tesesa cada texto pendente. A saída deve ser salva emteses/_bruto/<hash>.md. - Rode
uv run python scripts/validar_gravar.py <hash>para cada peça processada. O script valida o formato (frontmatter YAML + schema), verifica duplicidade por similaridade e grava a tese emteses/(ou emteses/_revisar/, se muito parecida com uma já existente) — atualizandoteses/_index.jsoneprocessados.json.
Cada arquivo em teses/ é um Markdown com frontmatter YAML (titulo, area_direito, tema, tags, tipo_peca_origem, jurisprudencia, legislacao, id, data_extracao) seguido do texto sanitizado da tese, pronto para reaproveitamento em novas peças.
