Besoin
La langue d'une release est aujourd'hui déduite du nom (tags FRENCH, VF…) ou du réglage par indexer. Quand rien n'est tagué, on ne sait pas ce qu'on a réellement téléchargé. Idée : ouvrir l'ebook et détecter la langue directement dans le contenu.
Idées
- À l'import, extraire un échantillon de texte (epub = zip de XHTML, trivial à lire ; mobi/azw3 via lecture des sections) et détecter la langue (n-grammes — lingua, franc, ou équivalent .NET) ;
- Croiser avec la métadonnée
dc:language de l'OPF quand elle existe (souvent absente ou fausse — la détection contenu fait foi) ;
- Utiliser le résultat pour : valider/rejeter l'import si la langue exigée ne correspond pas (upgrade du filtre langue actuel), taguer le fichier, corriger l'édition monitorée ;
- Score de confiance + seuil configurable, et action au choix (rejeter / avertir / juste logger).
Complète le parsing de nom existant : le nom ment parfois, le contenu jamais.
Feature request notée le 2026-08-10, à raffiner avant implémentation.
Besoin
La langue d'une release est aujourd'hui déduite du nom (tags FRENCH, VF…) ou du réglage par indexer. Quand rien n'est tagué, on ne sait pas ce qu'on a réellement téléchargé. Idée : ouvrir l'ebook et détecter la langue directement dans le contenu.
Idées
dc:languagede l'OPF quand elle existe (souvent absente ou fausse — la détection contenu fait foi) ;Complète le parsing de nom existant : le nom ment parfois, le contenu jamais.
Feature request notée le 2026-08-10, à raffiner avant implémentation.