Corpus numérique · Thèse

Les Fictions Littéraires
de Gallica

Un corpus de travail de 10 898 romans, dérivé de la collection BnF, filtré, dédoublonné et enrichi pour l'analyse computationnelle de la littérature de genre.

10 898
Romans
3 629
Auteurs
1800–1950
Période

Du dépôt Zenodo au corpus de travail

Le point de départ est la collection Fictions Littéraires de Gallica publiée par Pierre-Carl Langlais (Zenodo, 2021), qui rassemble 19 240 romans numérisés par la BnF. Ce corpus brut a été retravaillé en quatre étapes — filtrage de la qualité d'OCR, puis trois passes de dédoublonnage — pour produire la base utilisée dans la thèse.

SOURCE
19 240
Fictions de Gallica
Langlais 2021, Zenodo
ÉTAPE 1
12 176
Filtrage OCR
Seuil de qualité, hors œuvres complètes
ÉTAPE 2
11 909
Dédoublonnage temporel
−267 rééditions datées
ÉTAPE 3
10 992
Dédoublonnage hybride
−917 : MinHash + métadonnées
FINAL
10 898
Corpus enrichi
−94 seconde passe · métadonnées BnF + Wikidata

Au-delà du simple filtrage, chaque entrée a été enrichie : correction des artefacts d'OCR sur les noms et titres, récupération des dates auteur via croisement BnF / Wikidata, normalisation des identités auctoriales (résolution des pseudonymes et variantes orthographiques), et identification automatique de deux sous-genres majeurs — le roman d'aventures et le roman policier.

Distribution temporelle

Romans par décennie (n = 10 898)

Les années 1890 et 1891 sont manquantes dans cette version du corpus (bug de jointure des métadonnées, correction en cours) : la portion hachurée de la barre 1890 est une estimation d'environ 240 titres, non incluse dans les fichiers téléchargeables.

La distribution culmine dans la décennie 1880 (2 101 titres), reflet de l'âge d'or du roman-feuilleton et de la massification éditoriale du dernier tiers du xixe siècle. Le déclin après 1900 tient pour partie aux limites de la numérisation Gallica.

Signatures du corpus

Sur 3 629 auteurs identifiés — auxquels s'ajoutent 321 notices anonymes —, une longue traîne caractéristique : Dumas, Montépin, Paul de Kock et Féval dominent en volume, mais l'essentiel de la production se distribue parmi des centaines de signatures peu canoniques. 1 159 titres du corpus relèvent par ailleurs du canon, par auteur (1 024) ou par titre (262).

Deux genres identifiés

Au sein du corpus général, deux ensembles génériques ont été extraits par classification supervisée et correction par graphe de similarité, à partir d'amorces d'entraînement issues de la critique (liste Letourneux pour l'aventure, liste Boltanski–Esquenazi pour le policier).

Téléchargement et citation

L'ensemble des fichiers est distribué sous licence CC-BY 4.0 ; les textes intégraux restent accessibles via les identifiants Gallica (ARK).

Pour citer ce corpus : Barré, J. (2026). Hors d'usage: Curated French Fiction from Gallica, 1800–1950. Journal of Open Humanities Data, 12. https://doi.org/10.5334/johd.597 Jeu de données : https://doi.org/10.5281/zenodo.20233178