Skip to content

Détection de la langue par analyse du contenu de l'ebook #31

Description

@greenlynxe

Besoin

La langue d'une release est aujourd'hui déduite du nom (tags FRENCH, VF…) ou du réglage par indexer. Quand rien n'est tagué, on ne sait pas ce qu'on a réellement téléchargé. Idée : ouvrir l'ebook et détecter la langue directement dans le contenu.

Idées

  • À l'import, extraire un échantillon de texte (epub = zip de XHTML, trivial à lire ; mobi/azw3 via lecture des sections) et détecter la langue (n-grammes — lingua, franc, ou équivalent .NET) ;
  • Croiser avec la métadonnée dc:language de l'OPF quand elle existe (souvent absente ou fausse — la détection contenu fait foi) ;
  • Utiliser le résultat pour : valider/rejeter l'import si la langue exigée ne correspond pas (upgrade du filtre langue actuel), taguer le fichier, corriger l'édition monitorée ;
  • Score de confiance + seuil configurable, et action au choix (rejeter / avertir / juste logger).

Complète le parsing de nom existant : le nom ment parfois, le contenu jamais.

Feature request notée le 2026-08-10, à raffiner avant implémentation.

Metadata

Metadata

Assignees

No one assigned

    Labels

    enhancementNew feature or request

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions