Skip to content

feat(Jornal de Brasília): Criação do scraper completo do Jornal de Brasília - #9

Open
eduardoferre wants to merge 5 commits into
developfrom
feat/jornalDeBrasilia
Open

eduardoferre wants to merge 5 commits into
developfrom
feat/jornalDeBrasilia

Conversation

@eduardoferre

@eduardoferre eduardoferre commented Oct 8, 2025 •

Copy link
Copy Markdown

Descrição

O que:

  • Foi criada a extração de notícias para o portal Jornal de Brasília. Essa extração foi desenvolvida para atender aos requisitos do projeto de coleta de notícias.
  • Criei o arquivo play/jornaldebrasilia.py para realizar o scraping completo dos dados das notícias (título, URL, corpo e descrição) usando as URLs coletadas. As tags não são extraídas, pois não foram identificadas na estrutura do portal.
  • Adicionei dois novos comandos no Makefile:
    • crawl_jornalDeBrasilia: executa o spider via:

    • make crawl_jornalDeBrasilia
    • scrape_jornalDeBrasilia : executa o scraper e envia os dados ao MinIO via

      docker compose exec --user root scraper bash
      python scrape_no_openai.py --platform jornaldebrasilia.com.br

Por que:

  • Para adicionar um novo portal de notícias e, por consequência, aumentar a base do nosso banco de dados com mais informações relevantes.
  • Os novos comandos no Makefile padronizam e facilitam a execução do projeto, especialmente em ambientes com múltiplos desenvolvedores ou pipelines de CI/CD.

🗂️ Tipo de Mudança

  • 🐞 Correção de bug (fix)
  • ✨ Nova funcionalidade (feat)
  • ♻️ Refatoração (refactor/improve)
  • 📝 Documentação (docs)
  • 🚀 Performance (perf)
  • 🧪 Testes (test)
  • ⚙️ Build/CI (build/ci/cd/static)

📌 Checklist

  • Mensagem de commit segue o padrão Conventional Commits
  • Nome da branch segue a Política de Branches Git Flow
  • Testes adicionados/atualizados
  • Documentação atualizada (README / Storybook / Swagger / MkDocs)
  • Pipeline CI/CD aprovado
  • Sem dependências pendentes

🔗 Issues Relacionadas

#18

🧪 Como Testar

  1. Subir o serviço
make start
  1. Inicializar o banco:
make init_db
  1. Aplicar migrações:
make migrate_db
  1. Rodar spider para coletar URLs de notícias:
make crawl_jornalDeBrasilia
  1. Rodar scraper para processar e salvar as notícias no MinIO:
docker compose exec --user root scraper bash
python scrape_no_openai.py --platform jornaldebrasilia.com.br

📷 Evidências

image

@eduardoferre eduardoferre changed the title Feat(Jornal de Brasília): Criação do scraper completo do Jornal de Brasília feat(Jornal de Brasília): Criação do scraper completo do Jornal de Brasília Oct 8, 2025
@eduardoferre eduardoferre added the enhancement New feature or request label Oct 8, 2025
@eduardoferre eduardoferre self-assigned this Oct 14, 2025
@alanagabriele
alanagabriele self-requested a review October 22, 2025 00:53

This branch has not been deployed

No deployments
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

enhancement New feature or request

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant