Releases: work-search/lumibot
Release list
version 2.0
🚀 Release v2.0.0 : Refonte Complète du Robot Explorateur Web
Nous publions aujourd'hui une version majeure du robot explorateur web, avec une architecture repensée, et une gestion des données optimisée.
🔧 Changements et Améliorations
1. Architecture Unifiée
- Le code est désormais encapsulé dans une classe
RobotExplorateur, centralisant toute la logique. - Utilisation d'une base de données SQLite pour gérer les URLs et leur statut.
2. Gestion des URLs et File d'Attente
- Statuts clairs pour chaque URL :
en_attente,en_cours,terminee,echouee. - Filtrage des domaines (
.net,.fr,.com, etc.) et exclusion des fichiers binaires (PDF, EXE, etc.). - Reprise d'exploration possible après une interruption.
3. Extraction et Sauvegarde des Données
- Extraction du titre et de la description (balise
<meta name="description">) de chaque page. - Extraction des paragraphes (balise
<p>), les titres (<h1>,<h2>, et enfin<h3>).
4. Sécurité et Robustesse
- Vérification du type de contenu (
text/html,application/xhtml+xml) avant exploration. - Gestion des redirections et des erreurs (timeout, URLs invalides, etc.).
5. Interface Utilisateur et Logs
- Logs détaillés avec horodatage pour chaque étape.
- Interaction utilisateur pour reprendre ou démarrer une exploration.
📦 Requirements
Pour exécuter ce projet, assurez-vous d'avoir installé les dépendances suivantes :
pip install -r requirements.txtLe fichier requirements.txt contient :
aiohttp
aiosqlite
beautifulsoup4
langdetect
robotexclusionrulesparser
🛠️ Comment Mettre à Jour ?
- Remplacez l'ancien code par les nouveaux fichiers (la db reste la même).
- Installez les dépendances :
pip install -r requirements.txt
- Exécutez le script :
python main.py
- Suivez les instructions pour démarrer ou reprendre une exploration.
📝 Licence
Ce projet est sous AGPL-3.0 License.
📢 Remerciements
Merci à tous les contributeurs et utilisateurs pour leurs retours ! Cette version est le fruit de vos suggestions et de notre volonté d'améliorer continuellement l'outil.
N'hésitez pas à ouvrir une issue ou une pull request pour nous faire part de vos idées ou signaler des bugs !
Bonne exploration ! 🌐
Discord: https://discord.gg/QkwWDKeMjF
version 1.0
Il s'agit de la v1 du scraper web.
Il ne récupère seulement le titre de la page et la description (info dans head)
Cette API a été conçue pour Lumina.
Le code est sous licence MIT
Développeurs qui ont travaillé sur le projet :
This is the v1 of the web scraper.
It only recovers the page title and description (info in head)
This API was designed for Lumina.
The code is under an MIT license
Developers who worked on the project: