Skip to content

Feat(scraping Brasil de Fato): Criação do spider e scraper do portal de notícias Brasil de Fato - #39

Open
fsousac wants to merge 5 commits into
developfrom
feat/scraping-brasildefato
Open

fsousac wants to merge 5 commits into
developfrom
feat/scraping-brasildefato

Conversation

@fsousac

@fsousac fsousac commented Sep 24, 2025 •

Copy link
Copy Markdown

Descrição

O que:

  • Foi criada a extração de notícias de um novo portal para o projeto check-up, o portal Brasil de Fato. Essa extração foi criada pensando nos novos requisitos do projeto.
  • Criei o arquivo play/brasildefato.py para realizar o scraping completo dos dados das notícias (título, URL, corpo, tags e descrição) usando as URLs coletadas.
  • Adicionei dois novos comandos no Makefile:
    • crawl_brasildefato: executa o spider via:

    • make crawl_brasildefato
    • scrape_brasildefato : executa o scraper e envia os dados ao MinIO via

      docker compose exec scraper python scrape_no_openai.py --platform brasildefato.com.br

Por que:

  • Para adicionar novos portais de notícias e, por consequência, aumentar a base do nosso banco de dados com mais informações.
  • Os novos comandos no Makefile padronizam e facilitam a execução do projeto, especialmente em ambientes com múltiplos devs ou pipelines.

🗂️ Tipo de Mudança

  • 🐞 Correção de bug (fix)
  • ✨ Nova funcionalidade (feat)
  • ♻️ Refatoração (refactor/improve)
  • 📝 Documentação (docs)
  • 🚀 Performance (perf)
  • 🧪 Testes (test)
  • ⚙️ Build/CI (build/ci/cd/static)

📌 Checklist

  • Mensagem de commit segue o padrão Conventional Commits
  • Nome da branch segue a Política de Branches Git Flow
  • Testes adicionados/atualizados
  • Documentação atualizada (README / Storybook / Swagger / MkDocs)
  • Pipeline CI/CD aprovado
  • Sem dependências pendentes

🔗 Issues Relacionadas

Closes #41

🧪 Como Testar

  1. Subir o serviço
make start
  1. Inicializar o banco:
make init_db
  1. Aplicar migrações:
make migrate_db
  1. Rodar spider para coletar URLs de notícias:
make crawl_brasildefato
  1. Rodar scraper para processar e salvar as notícias no MinIO:
docker compose exec scraper python scrape_no_openai.py --platform brasildefato.com.br

📷 Evidências

não se aplica

Co-authored-by: Lua Medeiros <luanalm02@gmail.com>
@fsousac
fsousac marked this pull request as ready for review September 30, 2025 20:10
@luciano-freitas-melo luciano-freitas-melo moved this to Revisão PR (equipe de projeto) in Board de PR's | 2025.2 Oct 22, 2025
@alanagabriele alanagabriele moved this from Revisão PR (equipe) to PR's que precisam de alterações in Board de PR's | 2025.2 Oct 22, 2025

@alanagabriele alanagabriele left a comment

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

Necessário adicionar o jornal na tabela "portal", sem essa informação o scrape não roda.

@fsousac

fsousac commented Nov 19, 2025

Copy link
Copy Markdown
Author

Necessário adicionar o jornal na tabela "portal", sem essa informação o scrape não roda.

Corrigido.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

Status: PR's que precisam de alterações

Development

Successfully merging this pull request may close these issues.

[NOVO] Portal: Brasil de Fato

4 participants