• Congress: Humanistica 2023 (2023-06-26 - 2023-06-28)
  • Director(s): Association francophone des humanités numériques

Summary

Cet article compare trois méthodes pour explorer de grands corpus de documents historiques par leurs sujets. Nous travaillons ici sur les débats parlementaires français de la Troisième République, qui se prêtent particulièrement bien à ce type d'analyse. Après avoir présenté le contexte de cette étude, nous exposons les résultats obtenus avec trois méthodes issues du traitement automatique des langues et appliquées sur des textes publiés entre 1876 et 1914 : l'allocation de Dirichlet latente, les plongements de mots et le Transfer Learning.

Partager sur les réseaux sociaux