Navigation – Plan du site

AccueilNumérosXXXVI-2Le temps lexical

Le temps lexical

Un bilan méthodologique sur l’analyse des séries textuelles chronologiques
Lexical Time Trends: A Methodological Report on the Analysis of Textual Time Series
André Salem
p. 21-56

Résumés

Depuis les années 1970, une méthodologie centrée sur le traitement des séries textuelles chronologiques s’est progressivement mise en place, enrichie par des applications dans des langues variées et dans des sphères de recherche très diverses. Cette étude présente les applications de cette méthodologie à des corpus de textes historiques pour lesquels l’évolution des discours dans le temps constitue une préoccupation importante. La première partie est consacrée à des rappels sur l’approche textométrique des textes (1). On présente ensuite des méthodes plus particulièrement adaptées à l’étude des séries textuelles chronologiques (2). La dernière partie propose de nouveaux types d’unités textuelles qui permettent de mieux décrire les modifications textuelles qui surviennent au fil du temps dans les corpus chronologiques (3).

Haut de page

Notes de l’auteur

Les expériences réalisées pour parvenir aux résultats présentés ici n’auraient pu être menées à bien sans les nombreuses collaborations entretenues au fil des années avec des chercheurs travaillant dans différentes disciplines. Nous tenons à remercier Jacqueline Authier-Revuz, Étienne Brunet, Jean-Claude Deroubaix, Pierre Fiala, Serge Fleury, Annie Geffroy, Jacques Guilhaumou, Benoît Habert, Pierre Lafon, Cédric Lamalle, Stéphane Lamassé, Ludovic Lebart, Jun Miao, William Martinez, Damon Mayaffre, Serge de Sousa, Maurice Tournier, en priant tous ceux que nous n’avons pu mentionner de bien vouloir nous en excuser.

Texte intégral

  • 1 La publication des articles coordonnés A. Salem, 1986, et J. Guilhaumou, 1986, constituait le prem (...)

1Vers la fin du siècle dernier, la jeune revue Histoire & Mesure nous avait offert la possibilité d’exposer des développements méthodologiques de la textométrie adaptés à l’étude des séries textuelles chronologiques (STC)1. Dans le contexte de l’époque qui voyait se développer des études quantitatives portant sur des corpus de textes de plus en plus divers, rédigés dans des langues de plus en plus variées, ces applications à des corpus composés de textes émis au fil du temps par une même source textuelle paraissaient, en effet, susceptibles d’attirer l’attention des historiens, souvent confrontés à des corpus du même type.

2Depuis cette époque, de nombreuses expériences réalisées sur des corpus socio-politiques, dont certaines font l’objet de contributions dans le présent numéro d’Histoire & Mesure, sont venues renforcer notre conviction que la méthodologie des STC peut être appliquée avec profit pour tenter d’observer l’évolution dans le temps de productions textuelles émises par une source homogène. L’articulation raisonnée de plusieurs méthodes statistiques permet alors de poser toute une série de questions au corpus que l’on a réuni et d’obtenir des descriptions aisément interprétables portant sur les transformations textuelles qui surviennent au fil du temps.

3Pour exposer ce bilan de manière claire, il nous a semblé nécessaire de commencer par rappeler des éléments qui appartiennent au quotidien des chercheurs qui travaillent sur les textes dans des domaines scientifiques très différents (histoire, linguistique, analyse du discours, traductologie, statistique, informatique). La première partie est consacrée à l’approche textométrique des corpus de textes (1). On examine ensuite les méthodes spécifiquement adaptées à l’étude des séries textuelles chronologiques (2). La dernière section est consacrée à la description d’unités textuelles que l’on peut construire dans le but d’améliorer la description des changements textuels qui interviennent progressivement dans les corpus chronologiques (3).

1. Approches textométriques des corpus textuels

  • 2 La discipline s’est parfois appelée « statistique linguistique », « statistique lexicale », « lexi (...)

4Comme c’est le cas pour la plupart des paradigmes de recherche, il serait hasardeux d’essayer de ramener la courte histoire des communautés de chercheurs qui partagent le noyau commun de l’approche statistique des textes à une succession de progrès scientifiques améliorant, à chaque étape, les connaissances communes de l’étape précédente. La longue liste des dénominations mobilisées tour à tour pour servir de bannière aux approches quantitatives des textes porte au contraire la trace de changements de perspective, de confrontations d’intérêts scientifiques parfois divergents, de tentatives qui se sont révélées des impasses, de recours à des ressources opérationnelles différentes2.

Évolution du contexte de la recherche

  • 3 Les Contes des Mille et une nuits (nuit 178) relatent ainsi l’histoire d’une servante, la Docte sy (...)

5On trouve dans la littérature mondiale des traces de comptages, pratiqués à partir de corpus de textes, suivis ou non d’exploitation statistique des données collectées, qui sont bien antérieures à la révolution informatique3. Mais c’est vers les années 1970 que cette dernière va insuffler une vive accélération aux études textométriques. Devant ce surgissement de possibilités nouvelles, la pluridisciplinarité devient l’invitée de marque d’une rencontre qui apparaît comme un festin scientifique à venir. Des chercheurs formés dans des communautés qui n’entretenaient que peu de rapports jusque-là, poursuivant des objectifs de recherche très différents, vont apprendre à collaborer, à partager leurs connaissances, à questionner leurs propres croyances et à assimiler de nouveaux savoirs.

  • 4 Certains auteurs proposent de retenir le facteur multiplicatif de 1015 pour estimer la progression (...)

6Les changements les plus remarquables, encore que les acteurs de l’époque semblent s’y être habitués rapidement, trouvent leur source dans le développement fulgurant des capacités de calcul qui mettent désormais à portée de main des entreprises que nul n’aurait pu envisager dans la période précédente4. Dès cette époque, il devient possible d’effectuer instantanément des recherches documentaires, auxquelles les chercheurs en sciences humaines consacraient précédemment de longues heures de travail, comme dans le cas des recherches d’attestations de formes lexicales ou d’expressions plus complexes au sein de vastes corpus textuels. De plus, il va devenir possible d’appliquer à ces corpus des méthodes d’exploration statistique peu utilisées jusqu’alors dans le domaine des études textuelles. Parallèlement, de grandes masses de textes, dont l’encodage sur support informatique s’étendra sur des dizaines d’années, vont être mises à la disposition de tous avant que la plupart des textes ne soient, par la suite, directement composés sur des claviers d’ordinateurs.

  • 5 On notera que les principales méthodes statistiques utilisées de nos jours dans le domaine textomé (...)

7À côté de ces avancées fulgurantes, le développement des méthodes de recherche suivra, pour sa part, un rythme plus « humain », c’est-à-dire incomparablement plus lent5. La caractéristique fondamentale qui marque la période qui s’ouvre alors vient du fait qu’il va désormais être possible, pour de très larges communautés de chercheurs, d’utiliser à des coûts insignifiants des méthodes dont la mise en œuvre aurait suffi à occuper nos prédécesseurs durant leur vie entière et dont l’exécution sur les premiers ordinateurs se chiffrait encore en heures, lors de leurs implémentations pionnières.

8Durant la même période, le domaine des études textuelles connaît des transformations importantes. La linguistique structurale s’impose désormais aux côtés de la philologie traditionnelle. Cependant, d’autres courants apparaissent déjà, telle l’analyse de discours, qui utilisent les connaissances acquises sur le système de la langue, dans la période précédente, pour se préoccuper plus directement des discours produits dans différentes sphères d’activité. Une communauté importante du traitement automatique des langues (TAL) va se constituer, concentrant son intérêt, dans un premier temps, sur les problèmes posés par la traduction automatique des textes.

  • 6 « Des modèles qui comportent plus de paramètres à ajuster qu’il n’y a de données à décrire ! », ra (...)

9Enfin, dans la communauté statisticienne, la révolution informatique va renforcer l’exigence d’une profonde remise en question de la manière de traiter les grands ensembles de données. Remettant en cause l’utilisation de modèles pré-élaborés dont il suffirait d’estimer différents paramètres pour décrire la réalité mesurable, le courant de l’analyse des données prône désormais la nécessité de « laisser émerger des structures à partir des données6 ».

10Comme on le voit, en ce début des années 1970, chacune des composantes de la rencontre pluridisciplinaire qui s’organise autour du traitement statistique des corpus de textes connaît en son sein des remises en causes importantes.

Dérives méthodologiques

11Tout le monde s’accorde désormais sur l’idée que le recours à l’ordinateur ne constitue pas, en lui-même, un gage de scientificité. À ce propos, la méthode des nuages de mots, à laquelle nous consacrons une courte parenthèse, constitue une excellente illustration des dérives auxquelles peuvent conduire les progrès technologiques lorsqu’ils sont utilisés en dehors de toute réflexion scientifique (Figure 1).

12Au-delà d’une utilisation dont la visée serait purement esthétique, la méthode se révèle, en effet, d’une parfaite inutilité pour le chercheur désireux d’acquérir des connaissances à propos d’un corpus de textes. Sa vogue actuelle et les explications fournies par ses promoteurs nous paraissent constituer, en revanche, une source de réflexion sur des attentes et des présupposés, rarement explicités dans les publications qui relèvent de l’étude automatisée des corpus de textes.

13La technique utilisée produit une représentation des « mots » du corpus sur un graphique plan en utilisant des polices et des couleurs variables et en les positionnant selon des règles dont la description est souvent lacunaire. L’ensemble de l’entreprise laisse transparaître la croyance qu’un ensemble de textes peut être « représenté » par une simple figure qui permettra au lecteur d’objectiver des « liens sémantiques » inhérents au texte.

Figure 1. « Nuage de mots » réalisé à partir du corpus Duchesne

Figure 1. « Nuage de mots » réalisé à partir du corpus Duchesne

Note. Le nuage de mots a été réalisé le 23 novembre 2020 sur le site d’un générateur de nuages de mots (URL : www.wordclouds.com), à partir du corpus Duchesne, auquel nous empruntons nos exemples dans ce qui suit. Ce même jour, un service en ligne d’analyse du trafic web estimait à plus des 400 000 visites par mois la fréquentation de la version française de ce site. Pour une présentation générale de la méthode et de ses objectifs, on pourra consulter la notice Wikipédia (URL : https://fr.wikipedia.org/​wiki/​Nuage_de_mots-cl%C3%A9s). Dans les instructions fournies aux utilisateurs potentiels, les auteurs affirment que « le nuage de mots-clés est une sorte de condensé sémantique d’un document », omettant d’expliciter les termes utilisés et de renvoyer à des publications sérieuses.

14Le défaut majeur de cette méthode tient au fait qu’il n’est pas anodin de proposer à l’attention d’un lecteur humain de telles juxtapositions de formes. Bien que la description de la méthode indique que le placement des formes résulte d’un calcul aléatoire, la perception de telles images entrainera inévitablement le lecteur humain dans des tentatives d’établir des liens entre les formes qui sont proches sur le graphique afin de les relier dans des séquences syntaxiques plus interprétables à ses yeux qu’une simple collection de formes isolées de tout contexte. Ces rapprochements seront tentés à partir de liens d’équivalence sémantique très généraux dont personne ne peut assurer qu’ils possèdent la moindre pertinence pour l’étude du corpus soumis à la procédure et qu’ils ne constituent pas de simples projections, fondées sur la culture personnelle du lecteur et susceptibles par là même de varier fortement d’un lecteur à l’autre.

Schéma de l’approche informatisée

15De la collecte des textes que l’on désire comparer à la production du commentaire final, la démarche textométrique emprunte un chemin qui passe par des étapes de nature différente (Figure 2). Au cours de la première étape, des considérations de recherche amènent des chercheurs, animés par différents types de curiosité scientifique, à rassembler des textes dans le but de les soumettre à des comparaisons informatisées. La deuxième phase voit l’application de méthodes statistiques, largement utilisées dans d’autres domaines que le domaine textométrique, aux données issues du dépouillement du corpus. Lors de la dernière étape, le chercheur est amené à produire, d’abord pour lui-même et ensuite pour tenter de communiquer son expérience à une communauté plus large, des commentaires qui visent à synthétiser les résultats auxquels il est parvenu à l’issue de l’exploration statistique, en établissant des liens avec le contexte qui a vu naître les textes soumis à analyse.

Figure 2. Schéma général de l’approche textométrique des corpus textuels

Figure 2. Schéma général de l’approche textométrique des corpus textuels

Guide de lecture :
La ligne horizontale qui partage la Figure 2 symbolise la frontière, aisément repérable dans la pratique textométrique, entre le monde de la communication humaine et celui des données et des processus informatisés. Au sein de ce dernier, les informations circulent essentiellement sous forme de « 0 » et de « 1 ». On ne franchit cette ligne de haut en bas qu’au prix de certaines simplifications des données textuelles qui se transforment alors en des suites de chiffres binaires [Note : Lors de la phase d’encodage des textes, on décide souvent d’ignorer toute une série de métadonnées, marques, disposition, pagination, enrichissements typographiques, etc., qui figurent dans le texte d’origine. Dans le cas des corpus constitués à partir de différentes sources de stockage déjà informatisées, il est nécessaire de procéder à une homogénéisation des normes de présentation du texte.]. Symétriquement, la formulation de commentaires dans un langage compréhensible par un humain, à partir des résultats obtenus à l’issue de traitements statistiques, suppose un processus d’interprétation et de mise en forme de ces résultats.
– La phase de préparation du corpus voit les textes réunis par le chercheur se transformer en un corpus informatisé.
– Lors de la phase d’exploration textométrique, les méthodes statistiques produisent des états informatisés consultables par le chercheur. Au départ, ces états portent sur la répartition des unités intrinsèques (unités produites par les procédures de dépouillement définies au départ de l’analyse). À partir de ces états, le chercheur peut, par la suite, élaborer des unités structurantes (nous y reviendrons dans la troisième partie) qui correspondent mieux à la perception des textes par les humains et permettent de mieux rendre compte des résultats obtenus.
– Sur la base des états générés lors des phases précédentes, le chercheur produit enfin une interprétation des résultats produits par les analyses textométriques à l’intention d’un lecteur humain, lequel ne dispose pas, dans le cas général, d’un accès au corpus étudié. Le seul fait de distinguer, parmi des résultats statistiques, des résultats dont on considère qu’ils peuvent intéresser les chercheurs d’autres résultats que l’on considère comme présentant un intérêt moindre constitue déjà une forme d’interprétation. De plus, l’étape d’interprétation mobilise, la plupart du temps, des catégories d’analyse et des connaissances encyclopédiques extérieures au corpus informatisé soumis à l’analyse.

Les paradoxes textométriques

16Ces considérations générales sur la nature de la démarche textométrique ne constituent pas, à elles seules, un guide pratique pour la réalisation du dépouillement statistique d’un corpus textuel. Une fois les textes rassemblés en un corpus, la phase des analyses statistiques implique que soient opérés plusieurs choix préalables aux calculs statistiques : a) des choix sur le type d’unités qui présideront aux dépouillements ; b) le choix d’un découpage du corpus en parties qui seront soumises à des comparaisons statistiques. Comme nous allons le voir, ces choix sont susceptibles d’influer sur la nature des résultats qui seront produits lors des phases ultérieures de comparaisons statistiques.

Le choix des unités de décompte

  • 7 Ces remarques s’appliquent avec d’autant plus de pertinence au cas où l’analyste, mettant à profit (...)

17Un des premiers constats auxquels on aboutit lorsque l’on entreprend d’analyser des textes est lié au fait que certaines des unités textuelles (formes lexicales, expressions, etc.) revêtent des significations différentes en fonction des contextes dans lesquels elles sont employées. En fonction d’un contexte changeant (la page d’un livre qu’il a sous les yeux, une concordance informatisée) ou parfois en fonction de connaissances personnelles issues de la fréquentation d’un domaine dont il est spécialiste (l’intégralité d’un ouvrage, l’ensemble de l’œuvre d’un auteur, les productions textuelles d’un courant, d’une époque, etc.), le lecteur mobilisera, plus ou moins consciemment, des compétences (linguistiques, encyclopédiques, etc.) qui lui permettront de construire du sens à partir du texte qu’il est en train de lire7.

  • 8 Dans la séquence textuelle « les mots et les choses », on compte par exemple 5 occurrences, 4 form (...)

18À l’inverse, l’analyse automatisée d’un corpus de textes implique que l’on détermine, avant la phase des dépouillements textométriques et, au moins de manière temporaire, un système d’unités textuelles (« formes » ou « types ») dont on décomptera ensuite les occurrences dans chacune des parties du corpus8. Cette simplification, qui permet que le dépouillement puisse ensuite être confié à des automates, a pour conséquence que, lors de la première phase de l’analyse au moins, chacune des occurrences d’un même type sera considérée comme l’apparition d’une même entité dont on postulera ainsi de manière implicite qu’elle possède une certaine stabilité dans l’ensemble du corpus, indépendamment du contexte dans lequel cette entité apparaît. Cette manière de procéder ne respecte pas, à l’évidence, les considérations sur la nature complexe des unités textuelles que nous venons d’exposer ci-dessus.

  • 9 Les avis sur le choix des unités les plus adaptées au dépouillement automatique des corpus de text (...)

19On parvient à dépasser ce paradoxe apparent en distinguant clairement plusieurs phases dans le processus d’analyse. Dans la phase initiale de dépouillement, on a recours à un système d’unités textuelles dont la reconnaissance doit pouvoir être confiée à des automates9. Nous appelons ces unités de départ les unités textométriques. Dans la phase d’analyse statistique qui suit, on étudie les variations de fréquence de ces unités. Enfin, dans la dernière phase, consacrée à la production des commentaires, il redevient possible de tenir compte de toute une série de liens entre les unités textuelles, indispensables à la synthèse finale, mais qui n’ont pu être pris en compte lors des premières phases de l’analyse.

Le choix d’une partition

20Comme nous allons l’illustrer dans la deuxième section de cet article, le découpage d’un corpus en parties joue également un rôle important dans les analyses statistiques. Dans les cas où le corpus semble posséder des divisions « naturelles » en livres, en tomes, en périodes ou en documents, la décision de le découper en parties en vue de le soumettre à des analyses textométriques doit être prise en fonction d’objectifs de recherche définis. La division d’un même corpus en un petit nombre de parties sera privilégiée si le but poursuivi est de comparer efficacement des moyennes d’utilisation, pour chacune des unités textuelles, au sein de chacune de ces parties. Si l’on souhaite au contraire rapprocher des fragments de textes qui abordent une thématique commune, on privilégiera des partitions du corpus en fragments relativement courts (paragraphes, phrases, etc.).

Un corpus d’exemples

  • 10 Le corpus Duchesne est constitué par 96 livraisons du journal Le père Duchesne de Jacques-René Héb (...)

21Le souci d’exposer clairement des propositions méthodologiques, qui constitue l’objectif premier de cet article, implique que nous convoquions un corpus auquel nous emprunterons des exemples d’application, tout au long de notre étude. Nous avons choisi pour cela de privilégier à nouveau le corpus Père Duchesne sur lequel nous avions réalisé les premières expériences sur les STC10. Ce choix nous permettra, en premier lieu, de faire état de résultats accumulés au cours de plusieurs années de fréquentation de ces textes ; il devrait d’autre part permettre au lecteur de mieux mesurer les avancées réalisées dans le domaine depuis les premières expériences.

Articuler l’utilisation des méthodes statistiques

  • 11 On appelle ce tableau le « tableau lexical », même lorsque les comptages portent sur d’autres unit (...)

22Dans le cadre de l’approche textométrique, une fois les textes sélectionnés, la partition du corpus choisie et les normes de dépouillement en unités textométriques fixées, on constitue un tableau à double entrée11 dans lequel chaque colonne j correspond à l’une des parties du corpus, chaque ligne i, à l’une des unités de décompte sélectionnées pour le dépouillement. À l’intersection de la ligne i et de la colonne j, on trouve le nombre de fois que l’unité i a été rencontrée dans la partie j. C’est ce tableau, que l’on appelle « tableau lexical », qui servira de base à la plupart des analyses statistiques.

  • 12 Le tableau lexical entier construit sur la base du dépouillement textométrique du corpus Duchesne (...)

23Les décomptes d’unités textuelles au sein des différentes parties d’un corpus de textes aboutissent à la constitution de tableaux dont les dimensions constituent, le plus souvent, un obstacle à leur appréhension par le chercheur12. Sur la base de ces tableaux, il devient possible de répondre presque immédiatement à la question : quel est le nombre de fois que la forme i apparaît dans la partie j ? Cependant, l’abondance de données rend impossible toute synthèse par un être humain à propos des écarts dans la répartition des formes. Face à cette situation, il est impératif de recourir à des méthodes statistiques qui, mises en œuvre sur un ordinateur, permettront de pointer les irrégularités les plus importantes, au plan quantitatif, dans la distribution des formes au sein des parties.

24Dans ce qui suit, nous avons choisi de parler de deux méthodes statistiques souvent utilisées dans le domaine de l’analyse des textes et d’expliquer en quoi ces méthodes, lorsqu’elles sont judicieusement articulées, se révèlent complémentaires pour l’étude des tableaux lexicaux : la méthode des spécificités et l’analyse factorielle des correspondances (AFC).

L’analyse des spécificités

  • 13 L’effectif observé dans la case (i, j) est comparé aux résultats qu’aurait produit un modèle dans (...)

25L’analyse des spécificités produit, pour chacune des cases du tableau lexical, un diagnostic local qui traduit un jugement probabiliste sur la fréquence observée au croisement de la ligne qui correspond à la forme i et de la colonne qui correspond à la partie j. Ce jugement s’appuie sur la comparaison de quatre nombres : kij, fréquence de la forme i dans la partie j ; Fi, fréquence de la forme i dans l’ensemble du corpus ; tj, nombre des occurrences dans la partie j ; T, nombre total des occurrences du corpus13. Les indices de spécificités calculés pour chacune des cases du tableau permettent de mettre en évidence les écarts les plus importants. En considérant les spécificités calculées pour une même forme-ligne, on établit un profil de spécificité qui permet de distinguer les parties dans lesquelles les occurrences de la forme sont relativement abondantes de celles dans lesquelles ces occurrences sont plus rares. Symétriquement, la hiérarchisation des formes, de la plus spécifique à la moins spécifique, pour chacune des parties ou groupe de parties, permet de mieux caractériser les raisons pour lesquelles chacune des parties du corpus se rapproche ou se distingue des autres (Figure 3).

Figure 3. Spécificités, accroissements spécifiques et spécificités chronologiques

Figure 3. Spécificités, accroissements spécifiques et spécificités chronologiques

26Dans le but de mettre en évidence les variations qui surviennent au cours de la période j par rapport aux périodes précédentes, le calcul des accroissements spécifiques applique ce même modèle au tableau réduit à ses j premières colonnes. Dans ce second cas, la somme des occurrences du corpus est ramenée à Tj, somme de l’ensemble des occurrences contenues dans les j premières parties ; la somme des occurrences de chaque terme analysé est également ramenée à Fji, somme de ses occurrences dans les j premières parties du corpus. Ce calcul permet d’étudier l’apparition et la disparition des termes utilisés dans une des parties du corpus en les comparant aux seuls textes produits lors des étapes précédentes.

27Pour le calcul des spécificités chronologiques, les marges du tableau initial restent inchangées. On calcule ensuite les spécificités éventuelles de chaque terme dans tous les empans de parties consécutives que l’on peut découper dans le corpus pour ne retenir que la spécificité la plus forte.

L’analyse factorielle des correspondances (AFC)

  • 14 Pour plus de détails sur la méthode d’analyse factorielle des correspondances, on se reportera à J (...)

28L’analyse factorielle des correspondances fournit un jugement global qui porte sur chacun des deux ensembles mis en correspondance. La méthode produit une hiérarchisation des écarts constatés entre le tableau lexical et un tableau construit à partir de ce dernier mais dans lequel toutes les lignes (et respectivement, toutes les colonnes) seraient proportionnelles entre elles. Des facteurs, hiérarchisés en fonction de l’importance des corrections qu’ils apportent par rapport au tableau moyen, permettent de représenter approximativement les distances calculées entre les lignes et les colonnes du tableau. La représentation sur les premiers facteurs de chacun des ensembles mis en correspondance permet d’établir des typologies approchées portant sur chacun des deux ensembles (lignes et colonnes, ici : formes et parties). La représentation simultanée des deux ensembles sur les premiers facteurs permet d’accéder à une représentation synthétique des affinités entre parties, ou groupes de parties, et le vocabulaire qu’elles emploient (ou qu’elles évitent) préférentiellement14.

Les unités intrinsèques

  • 15 Sur la méthode des segments répétés, on pourra consulter P. Lafon & A. Salem, 1983 ; A. Salem, 198 (...)
  • 16 Cette possibilité s’appuie sur le raisonnement suivant : on peut considérer l’ensemble des occurre (...)

29La définition du système des unités textométriques qui permet le dépouillement initial induit toute une série de systèmes d’unités dont on peut également confier le recensement à des automates, dès l’issue de la phase de segmentation du texte. Ces unités forment, avec le système des unités textométriques qui a présidé au dépouillement initial, l’ensemble des unités intrinsèques produites par la segmentation du texte. Un segment répété15 est une suite d’unités textométriques issues du dépouillement initial que l’on retrouve à différents endroits du corpus. L’ensemble des segments répétés dans un corpus constitue, la plupart du temps, une liste extrêmement volumineuse. Pour sélectionner les segments qui pourraient présenter un intérêt lors de la phase d’interprétation, il est pratique d’utiliser les mêmes procédures de sélection statistique que celles qui sont appliquées aux unités élémentaires du dépouillement initial16.

  • 17 Plusieurs modèles de calcul des cooccurrences entre formes ont été proposés. Voir par exemple : P. (...)

30De la même manière, la rencontre entre deux formes à l’intérieur d’un même empan textuel (phrase, paragraphe, séquence de x formes, etc.) constitue une cooccurrence de ces deux formes. Plusieurs modèles statistiques permettent de sélectionner des ensembles de formes cooccurrentes sur la base du nombre de rencontres que ces formes opèrent à l’intérieur de séquences de textes comme la phrase ou le paragraphe17.

Variables illustratives

  • 18 On appelle ainsi les éléments qui n’ont pas participé à l’analyse et que l’on positionne ensuite à (...)

31Dans le cas de l’AFC, les coordonnées d’une unité sur les axes se calculent à partir de sa ventilation dans les parties (son profil). Après avoir extrait des facteurs à partir d’un tableau lexical, il est possible de calculer, a posteriori, la position sur chacun des axes (et partant, sur des représentations planaires) de toute autre unité prenant des valeurs positives ou nulles dans chacune des parties. Les unités ainsi positionnées sur les plans factoriels s’appellent des éléments supplémentaires ou illustratifs18.

32Dans le cas du calcul des spécificités, une fois les marges du tableau lexical calculées sur la base des unités principales, il est également possible de porter des jugements sur la répartition dans chacune des parties des unités supplémentaires ainsi calculées (segments répétés, cooccurrences, etc.).

L’influence du découpage en parties sur les typologies

33On trouve sur la Figure 4 deux typologies, établies à partir du corpus Duchesne en utilisant la même méthode d’analyse statistique, l’AFC. Les tableaux qui ont été soumis à l’analyse ont été constitués dans les deux cas sur la base du décompte des occurrences des formes dont la fréquence atteint au moins 10 occurrences dans le corpus. La partition utilisée n’est pas la même pour les deux analyses, ce qui explique les différences que l’on peut constater.

Figure 4. AFC à partir de deux partitions du corpus Duchesne

Figure 4. AFC à partir de deux partitions du corpus Duchesne

Guide de lecture :
Pour les deux analyses (a et b), seules les 1 420 formes de fréquence égale ou supérieure à 10 occurrences ont été retenues.
a : L’analyse porte sur un découpage du corpus en 96 livraisons.
b : La méthode a été appliquée à l’analyse d’un tableau dans lequel les livraisons sont regroupées en 8 périodes d’un mois, étiquetées de M1 à M8.
Chacune des figures fournit une représentation des parties du corpus sur les deux premiers axes issus de l’AFC. Sur chacune, on a représenté les formes les plus spécifiques de l’opposition constatée sur le premier axe.

  • 19 Sur la partie droite de la Figure 4a, les livraisons utilisent un discours, souvent à la première (...)

34Pour la première analyse (Figure 4a), nous avons retenu une partition en 96 livraisons. L’AFC oppose alors deux types de livraisons qui correspondent à deux styles d’écriture différents, utilisés tour à tour par l’auteur dans des proportions qui varient19.

35La seconde analyse opère sur des empans de textes plus étendus, constitués par la réunion de plusieurs livraisons publiées au cours d’un même mois. La typologie produite par l’AFC, à partir de cette nouvelle partition en 8 parties, met cette fois en évidence une modification progressive du stock lexical au cours du temps. On en conclut que stock lexical de chacune des parties ressemble plus à celui des parties qui lui sont proches qu’à celui de parties plus éloignées dans le temps.

2. Le cas des séries chronologiques

  • 20 Sur la méthodologie du traitement des séries textuelles chronologiques on consultera par exemple A (...)

36Appliquée à des séries chronologiques comme la série Duchesne, à laquelle nous empruntons nos exemples, l’AFC produit des figures particulières, dont l’interprétation relève de règles spécifiques que nous allons évoquer dans ce qui suit20. Sur la Figure 4b on voit la représentation des parties du corpus Duchesne, divisé en 8 périodes qui correspondent chacune à un mois de parution du journal. La forme générale de cette représentation, qui rappelle grossièrement une « parabole », constitue un indice du fait que le renouvellement progressif du vocabulaire dans le temps apparaît comme la principale source de variation du corpus. S’il s’avère que certaines des parties s’écartent du schéma d’ensemble pour se placer dans des positions un peu décalées par rapport à l’alignement d’ensemble (ce qui est le cas pour la période M7, sur la Figure 4b), la question se posera alors de décrire plus précisément les variations du vocabulaire qui sont à l’origine de ce qui apparaît comme un écart par rapport au schéma général.

37En résumé, dans ce genre de situation, l’AFC fournit à la fois une information sur l’évolution globale du vocabulaire et un modèle empirique qui permet de repérer des écarts ponctuels par rapport au schéma d’ensemble.

Choisir une échelle d’observation

  • 21 Pour mesurer cette autocorrélation, nous avons utilisé le coefficient de Von Neumann qui compare l (...)

38La propriété de rapprocher les parties consécutives du corpus analysé peut être soumise à des mesures formelles qui permettront de sélectionner les partitions les plus aptes à rendre compte de l’évolution chronologique. Le Tableau 1 permet de comparer la manière dont différentes analyses réalisées sur le corpus Duchesne, à partir de différents découpages en parties de tailles variables, permettent de rendre compte de l’évolution du vocabulaire. Les partitions ont été classées dans l’ordre croissant de la taille des parties que l’on peut découper dans le corpus : livraisons, semaines, quinzaines, mois. La deuxième colonne indique le nombre des parties découpées dans chacun des cas. On trouve ensuite la longueur moyenne des parties. La dernière colonne fournit le résultat du calcul d’un coefficient d’autocorrélation calculé à partir des valeurs prises par l’ensemble des parties sur le premier facteur21.

Tableau 1. Mesure de l’autocorrélation sur le premier facteur issu de l’AFC à partir de différentes partitions du corpus Duchesne

Tableau 1. Mesure de l’autocorrélation sur le premier facteur issu de l’AFC à partir de différentes partitions du corpus Duchesne

39Les calculs portés sur ce tableau précisent les résultats obtenus à l’aide de l’AFC (Figure 4). Le premier facteur issu de l’analyse du corpus divisé en 96 livraisons ne possède pas la propriété de rapprocher les parties consécutives. On voit sur ce même tableau que la partition en semaines possède un peu mieux cette propriété qui devient manifeste pour le découpage en quinzaines ainsi que pour le découpage en mois, dans une mesure un peu moindre.

Encadré 1. L’effet « temps lexical », un cadre d’analyse pour les séries textuelles chronologiques

De nombreuses études montrent que les analyses textométriques pratiquées à partir de séries textuelles chronologiques peuvent désormais s’appuyer sur des méthodes éprouvées. Nous appelons « effet temps lexical » la réalisation simultanée d’un certain nombre de propriétés qui trouvent leur origine dans des sphères d’analyse différentes.

a) L’analyse factorielle des correspondances (AFC) est une méthode d’analyse statistique qui permet de créer des typologies portant à la fois sur les lignes et les colonnes des tableaux croisés de nombres positifs. Dans le domaine textométrique, on analyse des tableaux qui croisent des parties et des formes (lexicales).

b) L’effet Guttman est un cadre de lecture des résultats fournis par l’AFC qui s’applique avec profit lorsque les données du tableau analysé sont soumises à une variation d’ensemble qui peut être ramenée, approximativement, à une progression unidimensionnellea.

c) Le fait de constituer un corpus en série textuelle chronologique entraîne que l’on attache aux parties du corpus des métadonnées temporelles (ou, plus simplement qu’on affecte à chaque partie une date de création : avérée ou estimée, provisoire ou définitive).

d) La propriété de proximité globale des parties consécutives sur un facteur issu de l’AFC traduit le fait que ce facteur rend compte d’une variation qui est corrélée à la localisation des textes dans le temps.

e) Le facteur temporel qui émerge de l’AFC pour servir de base à d’autres analyses à venir (en général le premier facteur) se trouve alors investi d’une double légitimité :
– il constitue un résultat empirique, calculé à partir du tableau de départ sans qu’aucune connaissance extérieure au corpus n’ait pu influer sur son calculb ;
– sa propriété de rapprocher les parties consécutives dans le temps traduit sa pertinence pour la description de l’évolution temporelle du corpus.

Le facteur temporel ainsi dégagé peut alors servir de modèle empirique pour l’analyse du renouvellement du vocabulaire. Il permet de considérer, simultanément, la progression d’ensemble et les écarts au modèle, constitués par les parties pour lesquelles le stock lexical observé ne correspond pas à ce que laissait prévoir le modèle global de renouvellement.

a. La propriété, parfois liée aux résultats de l’AFC, que l’on appelle l’« effet Guttman » a été décrite dans L. Guttman, 1941. On trouvera un exposé plus accessible dans J.-P. Benzécri, 1973, p. 192-196, de nombreuses applications dans J. L. A. Van Rijckevorsel, 1987, ainsi que des applications aux séries textuelles chronologiques dans A. Salem, 1988. Le modèle d’interprétation proposé par Guttman permet de gérer une situation particulière que l’on rencontre parfois dans l’analyse des résultats d’une AFC. Face à un tableau de données sous-tendu par l’existence d’une évolution dominante, il convient d’abandonner les techniques habituelles d’interprétation des facteurs successifs, pour lesquelles chaque facteur précise la typologie établie sur la base des facteurs précédents. Dans ce type de situation, on considérera que l’AFC décompose de manière relativement complexe une évolution de caractère unidimensionnel dont le premier facteur fournit une bonne approximation.
b. Rappelons cependant que les différents modes de segmentation du corpus en unités textométriques et différents découpages du corpus en parties sont susceptibles d’avoir une influence sur les résultats d’une AFC pratiquée à partir d’un corpus de textes.

40Dans le cas du corpus Duchesne, il apparaît que le découpage en livraisons constitue une unité statistique trop fine pour l’observation directe des variations chronologiques. La variabilité des thèmes abordés d’un numéro à l’autre, les différents styles employés, ne permettent pas, à cette échelle, de mettre en évidence une évolution chronologique. Par contre, le découpage du corpus en quinzaines, ou en mois, permet à l’AFC de repérer une évolution des fréquences textuelles au fil du temps.

Repérer les termes de l’évolution temporelle

41La mise en évidence du caractère évolutif du corpus, considéré à travers une partition adaptée, permet de poser toute une série de questions sur l’évolution lexicale du corpus : Quelles sont les modifications qui apparaissent à un moment donné du corpus ? Durant quelles périodes les modifications sont-elles les plus importantes ? Y a-t-il des termes dont les contextes font l’objet de modifications au cours des périodes couvertes par le corpus ?

42On voit sur le Tableau 2 les accroissements spécifiques positifs majeurs (voir infra) calculés pour la partie M6 du corpus Duchesne divisé en 8 périodes. Nous examinerons dans ce qui suit (troisième section), en étudiant cette liste de plus près, l’hypothèse que les termes spécifiques de la période M6 participent d’un vocabulaire « offensif » qui trouve dans cette période un emploi remarquable.

Tableau 2. Accroissements spécifiques positifs majeurs pour la période M6 du corpus Duchesne

Terme F6 f6 s
patriotes 111 60 21
les patriotes        68 36 13
*phélipotin 13 13 11
*vincent 10 10 9
les 3 667 687 8
nouvelle 42 21 8
conspirateurs        35 18 7
c est là que 10 8 6
les meilleurs 22 13 6

Guide de lecture :
La colonne F6 du tableau donne la fréquence du terme dans le corpus réduit aux six premières parties du corpus ; la colonne f6 le nombre des occurrences du terme dans la sixième partie (M6) ; la colonne s indique l’indice de spécificité associé à cette répartition.

43La tresse chronologique est un document confectionné de manière automatisée à partir de la sélection et de l’ordonnancement d’un très grand nombre de constats portant sur la répartition de différents types d’unités recensées dans les empans de périodes consécutives du corpus. Cette présentation constitue un résumé très synthétique des variations qui surviennent au cours du temps dans le corpus de textes analysé.

  • 22 Pour des raisons de présentation dans le cadre du présent recueil, le volume de la liste a été dra (...)

44Le Tableau 3 rassemble les spécificités chronologiques les plus importantes extraites à partir de la partition du corpus Duchesne en 8 parties. Les lignes du tableau ont été triées en fonction du barycentre temporel (période moyenne d’utilisation que l’on calcule à partir des fréquences de la forme dans les parties)22.

Tableau 3. Tresse chronologique calculée sur les 8 périodes du corpus Duchesne

Terme F f S 1 2 3 4 5 6 7 8
nobles 42 21 9
*marat 65 38 9
elle 360 272 9
*custine 69 46 12
constitution 72 53 16
*paris 171 93 14
la *france 107 84 8
c est vous 24 18 12
qui avez 41 22 10
avez 171 55 12
vous 1 084 218 13
argent 47 29 8
ni 136 63 8
tu 296 200 9
ai 202 114 8
on 854 287 9
je 979 561 8
nouvelle 46 21 9
patriotes 152 60 18
républicains      129 38 9
la raison 46 20 8

45Malgré le volume restreint de la liste présentée ici, on peut repérer des termes qui apparaissent préférentiellement dans certains des empans du corpus. Pour chaque unité sélectionnée, la partie droite du tableau précise les bornes de l’empan le plus spécifique.

Repérer des moments-clés de l’évolution

46Comme nous venons de le voir, le découpage en périodes permet de mettre en évidence des termes dont l’utilisation varie fortement dans le temps. De manière symétrique, il est possible de localiser des portions du texte dans lesquelles ces changements apparaissent, s’intensifient ou, au contraire, s’atténuent.

Cohortes et zones caractéristiques

  • 23 Les développements qui suivent s’appliquent également à des zones textuelles composées d’une sélec (...)

47Dans ce qui suit, nous appelons « zone textuelle » un ensemble d’occurrences sélectionnées dans le corpus : partie, ensemble de parties, paragraphes ou séquence de phrases consécutives23. À partir d’une zone textuelle Z et d’un seuil de spécificité s, on peut calculer, par comparaison avec le reste du corpus, la liste des termes qui possèdent, pour cette zone, une spécificité positive supérieure au seuil s. Nous appelons cet ensemble de formes la « cohorte spécifique » de la zone Z (au seuil s).

48Symétriquement, à partir d’une cohorte spécifique donnée, il est possible de déterminer une liste de zones dans laquelle les occurrences de la cohorte entraînent un diagnostic de spécificité, par rapport au reste du corpus. Les zones textuelles considérées peuvent être les parties créées par la partition du corpus ou tout autre système de zones que l’on peut découper dans le corpus. C’est ce que nous appelons la « relation duale » entre zones et cohortes spécifiques (Figure 5).

Figure 5. Dualité spécifique entre zones et cohortes spécifiques

Figure 5. Dualité spécifique entre zones et cohortes spécifiques

Guide de lecture :
La sélection d’une cohorte de termes spécifiques à un seuil s, pour une zone textuelle du corpus (sur la gauche) induit automatiquement la sélection d’une série de zones du corpus (ici, sur la droite, des paragraphes) pour lesquelles l’effectif de la cohorte déclenche un diagnostic de spécificité. Symétriquement, pour chaque sélection de zones (sur la droite) on peut calculer la cohorte des termes qui sont spécifiques dans cette sélection.

  • 24 Associé au précieux travail de datation produit sur chaque numéro du corpus Duchesne par l’histori (...)

49Pour obtenir l’histogramme suivant (Figure 6), nous avons commencé par calculer la cohorte spécifique CSM6+ composée des formes dont la spécificité dépasse le seuil de 1/105 dans la partie M6 du corpus. Dans un second temps, nous avons calculé les spécificités de cette cohorte pour chacune des 96 livraisons du corpus. L’examen de la Figure 6 montre que l’émergence de ce vocabulaire est assez nette sur l’ensemble de la période M6, ce qui ne constitue pas une surprise, compte tenu du mode de construction de la cohorte24. Quelques livraisons extérieures à la période M6, dont plusieurs sont situées dans la période M5 qui la précède immédiatement, se signalent également par un emploi spécifique de ce même vocabulaire. L’avant-dernier numéro de la série H354 (paru dans la semaine qui précèdera l’arrestation de Jacques-René Hébert) marque une nette reprise de ce vocabulaire, plus rarement utilisé dans la période qui précède.

Figure 6. Spécificités de la cohorte CSM6+ dans chacun des 96 numéros du corpus Duchesne

Figure 6. Spécificités de la cohorte CSM6+ dans chacun des 96 numéros du corpus Duchesne
  • 25 La carte des sections est une représentation graphique d’un corpus qui permet de localiser les var (...)

50Il est possible de repérer encore plus précisément des portions de texte qui emploient fortement les termes de la cohorte CSM6+ que nous avons constituée. Nous avons projeté sur une carte des sections (Figure 7), établie en nous appuyant sur un découpage du texte en paragraphes, le type constitué par les formes qui appartiennent à la cohorte spécifique CSM6+. Les paragraphes représentés avec une couleur plus sombre contiennent, un grand nombre d’occurrences de formes appartenant à cette dernière cohorte25.

Figure 7. Carte des sections (paragraphes du texte) établie à partir du corpus Duchesne découpé en 8 parties (mois)

Figure 7. Carte des sections (paragraphes du texte) établie à partir du corpus Duchesne découpé en 8 parties (mois)

51Comme on pouvait s’y attendre, la grande majorité des paragraphes dans lesquels la cohorte CSM6+ trouve une forte spécificité se situent au sein de la période M6. L’étude de la disposition de ces paragraphes permet cette fois de localiser des zones plus précises qui peuvent s’étendre sur plusieurs paragraphes successifs. Cette fois encore, on étudiera tout particulièrement les paragraphes spécifiques qui sont extérieurs à la partie M6. Certains de ces paragraphes anticipent l’évolution qui va se produire au cours de la période M6. Deux paragraphes, situés dans la période M8, constituent au contraire des échos tardifs du type d’expression mis en œuvre en M6.

52Parmi d’autres paragraphes spécifiques pour la cohorte CSM6+, l’extrait ci-dessous, emprunté au numéro H328 de la période M6, fournit un exemple de ce type de texte à tonalité particulièrement offensive. Dans cet extrait, à côté des formes qui ont servi à construire la cohorte CSM6+, détachées en caractères gras, on remarquera la présence de formes comme rebelles, malveillants, bourreaux, assassins, écraser, que leur faible fréquence a écartées de la sélection spécifique, mais qui auraient manifestement toute leur place dans une liste des termes polémiques.

H328 [§ 447] celui qui traite les meilleurs patriotes de bourreaux, d'assassins, et qui en même temps s'apitoye sur le sort des aristocrates, n'est-il pas un conspirateur, qui veut rallier tous les malveillants, encourager tous les traîtres pour les armer contre la république? n'est-il pas un rebelle contre les décrets de la convention /…/ les faux patriotes, les fripons qui ne savent plus à quelle branche s'accrocher, tâtent les modérés et les aristocrates; ils cherchent à faire cause commune pour écraser ensemble les hommes purs qui les pourchassent.

3. Vers de nouvelles unités d’analyse

53L’utilité première de la méthodologie chronologique tient au fait que les résultats qu’elle propose à l’attention de l’analyste sont produits par des méthodes formalisées qui permettent de limiter la projection d’hypothèses a priori, de la part de l’analyste. Cependant, au vu des résultats statistiques et afin de produire un commentaire intelligible pour un lecteur dépourvu de la possibilité d’explorer le corpus textuel par ses propres moyens, la tentation est parfois vive d’opérer des rapprochements entre des faits textuels mis en évidence simultanément par les méthodes textométriques qui présentent manifestement des traits communs (sur des plans divers de l’analyse des textes : morphologie, syntaxe, sémantique, pragmatique, etc.). Cette dernière entreprise nécessite cependant que soit précisée la nature des rapprochements qui permettront de produire des commentaires plus synthétiques.

L’hypothèse de la montée d’un vocabulaire « offensif »

54L’analyse des accroissements spécifiques de la période M6 montre l’augmentation progressive d’un vocabulaire lié au conflit politique que nous appellerons, dans le cadre de cette étude, « vocabulaire offensif ». Ces formes, relativement peu fréquentes dans les premières parties du corpus (M1, M2, M3), connaissent par la suite une utilisation croissante qui trouve un paroxysme durant la période M6. Du point de vue de cette évolution d’ensemble, la période M7 marque un net recul dans l’utilisation de formes qui seront à nouveau mobilisées dans la période M8. C’est cette évolution qui est à l’origine de l’effet temps lexical que nous avons constaté plus haut.

  • 26 Partisans d’un adversaire politique de Hébert, nommé en fait Pierre Nicolas Philippeaux (1754-1794(...)

55Pour plusieurs de ces formes (conspirateurs, contre, diviser, aristocrates, accuser), le rattachement à la catégorie du vocabulaire offensif peut être établi à partir du sens que les dictionnaires de langue consignent dans leurs définitions. On peut penser que ces formes revêtent, en conséquence, une charge polémique qui sera évidente pour tout lecteur. Pour des formes comme aristocrates ou phélipotins26, une connaissance superficielle de la période historique permet de reconstituer la charge polémique que ces termes ont pu revêtir dans le contexte révolutionnaire. La situation est plus délicate lorsqu’il s’agit d’expliquer l’appartenance à cet ensemble de formes comme nouvelle, meilleurs, etc., auxquelles on n’a pas coutume d’attacher une valeur polémique dans l’usage courant.

Encadré 2. Quelques repères historiques…

Dans le cadre de cet encart, nous tenterons d’opérer quelques rapprochements entre les variations observées dans la répartition des formes lexicales lors des analyses textométriques et les principaux événements survenus au plan politique dans la période couverte par le corpus.

Dans les premières périodes du corpus (périodes M1-M4), les positions politiques défendues par l’auteur du Père Duchesne au détriment des ennemis politiques qu’Hébert ne cesse de dénoncer (les brissotins, i. e. partisans de Brissot, etc.) rencontrent un certain succès.

Fort de cette victoire politique, Hébert entre en opposition avec les dirigeants du mouvement jacobin et plus particulièrement avec les montagnards du Comité de salut public (Robespierre, Saint-Just, etc.). Dans le but d’influencer l’action du Comité, il redouble d’ardeur dans la dénonciation des conspirateurs, des faux patriotes, des modérés, de ceux qui veulent allumer la guerre civile et appelle à l’union des meilleurs patriotes, au cours d’une offensive qui connaît son apogée entre la mi-décembre 1793 et la mi-janvier 1794 (période M6).

Les jacobins réagiront d’abord par la voix de Camille Desmoulins qui attaquera Hébert dans son journal Le vieux cordelier. Hébert tentera, dans un premier temps (période M7), de reprendre l’offensive en faisant à nouveau appel aux thèmes qui avaient assuré sa popularité durant les premières périodes couvertes par le corpus que nous considérons : lutte pour la déchristianisation, lutte contre la présence de nobles à la tête des armées, etc.

Devant l’échec de cette tentative, il tentera de reprendre, au cours de la dernière période qui se terminera par son arrestation et son exécution (période M8), l’offensive politique amorcée durant la période M6.

56Pour comprendre la raison de la présence de ces formes dans une situation de conflit, il est nécessaire de considérer l’ensemble des contextes de leurs utilisations dans le corpus, ou dans un groupe de ses parties, et de tenter de replacer ces emplois dans leur contexte historique.

Repérer des significations locales

  • 27 Notons que la modélisation des dialogues homme/machine, qui a largement prouvé son utilité dans ce (...)

57Le processus de lecture d’un texte s’appuie sur un contrat implicite entre le lecteur du texte et celui qui en est l’auteur. Ce contrat pose que, sauf exception signalée, les mots sont utilisés au sein du texte avec le sens qu’ils revêtent pour une large communauté de locuteurs. Lorsque les textes sont produits dans un espace temporel restreint, on peut considérer que cette condition de stabilité sémantique est plus ou moins réalisée27. Tel n’est plus le cas, bien entendu, dès qu’il s’agit de textes littéraires, historiques, etc., dont la compréhension par un lecteur humain s’appuie sur un ensemble de connaissances qui doivent sans cesse être réactualisées. Lorsque plusieurs siècles séparent le moment de la lecture de la période historique qui a vu l’écriture du texte, le lecteur doit prêter une attention particulière aux variations de sens qui ont pu survenir entre le moment où le texte a été rédigé et celui auquel il tente d’en percevoir le sens.

Le cas de la forme modérés

  • 28 « Qui fait preuve de mesure, qui se tient éloigné de tout excès […] » (Robert) ; « Qui appartienne (...)
  • 29 Pour certains de ces termes, la connotation intrinsèquement négative se situe au niveau de la lang (...)

58Les dictionnaires contemporains28 s’accordent à peu près sur le sens du mot modéré(s) pour retenir une signification qui dérive du verbe modérer : faire preuve de mesure, etc. L’examen simultané de l’ensemble des contextes de ce terme dans le corpus Duchesne fait cependant apparaître que, pour chacun des 17 contextes dans lequel il est employé, le terme revêt une tout autre signification. Comme dans les quelques exemples qui suivent (Tableau 4), le terme modérés apparaît chaque fois dans le cadre d’une énumération dont tous les termes se situent dans une axiologie fortement négative29.

Tableau 4. Contextes de la forme modérés dans le corpus Duchesne (extraits)

Tableau 4. Contextes de la forme modérés dans le corpus Duchesne (extraits)
  • 30 En 1793, les accusations de modérantisme frappent principalement certains jacobins qui envisagent (...)

59Dans ce cas, la prise en compte du contexte historique peut, seule, fournir les éclaircissements nécessaires. Le retour systématique au contexte montre que, dans le corpus, la forme modérés renvoie chaque fois à des opposants politiques, le « parti modéré », auxquels s’oppose fermement l’auteur du texte30.

Le cas de la forme nouvelle

  • 31 La province de la Vendée a connu, à partir de mars 1793, un soulèvement armé contre le pouvoir rév (...)

60La forme nouvelle possède également une forte spécificité dans la partie M6. L’examen de l’ensemble des contextes de la forme dans cette période du corpus montre que, dans la plupart des cas (14 sur 21), la forme est utilisée dans une acception particulière : nouvelle *vendée31, nouvelle clique d’aristocrates, nouvelle clique de modérés, nouvelle liste civile, nouvelle majesté égorgeante, nouvelle conspiration, etc.

Tableau 5. Contextes de la forme nouvelle dans la période M6 du corpus Duchesne (extraits)

Tableau 5. Contextes de la forme nouvelle dans la période M6 du corpus Duchesne (extraits)

61Loin de véhiculer le sens usuel de « chose qui n’était pas apparue précédemment », la forme nouvelle prend, dans ces énoncés particuliers, le sens de « chose qui apparaît à nouveau ». On remarque en outre que les phénomènes dont Hébert dénonce la résurgence ont tous donné lieu à une féroce répression dans les périodes précédentes. On peut donc penser que, dans ce contexte particulier, l’adjectif nouvelle introduit l’idée que la lutte de la période précédente n’est pas terminée et qu’il convient de la mener « à nouveau ». Cette incitation à la reprise de la répression s’inscrit, de cette manière, dans le moment offensif auquel participent les textes de la période M6.

Le cas de la forme les

62La forme graphique les, que nos analyses signalent comme l’un des accroissements spécifiques les plus remarquables de la période M6, mélange, compte tenu de la méthode de segmentation en formes graphiques utilisée depuis le début de cette expérience, les occurrences de l’article défini pluriel les et celles du pronom personnel homographe de la troisième personne du pluriel. De plus, comme dans la plupart des textes rédigés en français, cette unité est très fréquente dans le corpus (4 748 occ.). Le retour aux contextes dans lesquels cette forme trouve un grand nombre d’occurrences permet de comprendre les raisons de cette utilisation massive.

[H332] /…/ les *brissotins, comme les jean-foutres de conseillers de *capet, ont persécuté les patriotes et les ont accusés également d'être des anarchistes. on se sert aujourd'hui d'un autre mot pour avilir les ardents républicains. on les appelle des ultrarévolutionnaires, parce que les mots de factieux et de désorganisateurs sont usés; mais foutre, le peuple ne prendra pas le change, ce sont encore les apôtres du modérantisme, les amis de la royauté et les aristocrates déguisés qui les accusent. /…/

  • 32 Ces résultats constituent un contre-exemple manifeste de l’affirmation, souvent exprimée dans les (...)

63Dans ces contextes, l’article défini les introduit des actants, hostiles en majorité, les constituant comme des groupes dont l’unité ne peut être remise en cause au moment de l’énonciation : les patriotes (91 occ.), mais aussi : les traîtres (86 occ.), les aristocrates (75 occ.), les fripons (64 occ.), les brigands (63 occ.), etc. La densification des occurrences de cette forme au sein d’un fragment de texte peut même constituer un indicateur de l’accroissement local du caractère offensif du discours, comme on le voit, à partir de l’exemple ci-dessus32. L’auteur oppose des catégories préexistantes, introduites par l’article défini les, à des groupes, dont l’existence n’est plus présupposée (on les appelle des anarchistes, des ultra-révolutionnaires, etc.) introduits, pour leur part, par la forme indéfinie des.

Schèmes syntaxiques

64L’examen de l’ensemble des occurrences du segment les meilleurs dans la partie M6 permet de comprendre en quoi ce segment peut être rattaché au vocabulaire offensif de la période (Tableau 6).

Tableau 6. Les occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne

Tableau 6. Les occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne

65Cet examen montre que les séquences rassemblées introduisent une distinction particulièrement insistante parmi des catégories d’actants présentés jusqu’alors comme positifs dans leur totalité. L’apparition de la qualification les meilleurs devant chacun de ces groupes induit la question de l’hétérogénéité de la catégorie initiale et la possibilité de l’existence d’intrus parmi les actants de la période susceptibles de s’en réclamer. Les meilleurs (patriotes, républicains, etc.) sont, en outre, systématiquement présentés comme faisant l’objet d’intrigues, de manigances, d’accusations diverses, de la part d’actants plus difficiles à identifier. Dans ce sens, contrairement à ce que laissaient prévoir les traits axiologiques très généraux liés à ce segment, la spécificité du terme les meilleurs dans la partie M6 peut également être rattachée à la montée en fréquence du vocabulaire offensif signalée plus haut.

66Pour rendre compte de manière plus synthétique du recours à ce procédé énonciatif récurrent, nous proposerons le concept de schème discursif récurrent. On posera que, dans chacun des contextes présentés (Tableau 7), le segment les meilleurs constitue le pivot d’un schème plus étendu.

Tableau 7. Schème discursif récurrent autour du pivot les meilleurs

actant négatif + action hostile + pivot + actant positif
actants négatifs : vils intriguants, phélipotins, modérés, royalistes, aristocrates, jean-foutres, gredins, nains, agents de *pitt et *cobourg
action hostile : accuser (5), dénoncer (2), déchirer, traiter de, égorger
pivot : les meilleurs
actants positifs : patriotes (7), républicains (4), citoyens (1), montagnards (1)
  • 33 Plusieurs chercheurs ont proposé des méthodes permettant de repérer des motifs plus complexes que (...)

67Les substantifs qualifiés dans ces exemples (sur la droite du pivot) appartiennent à un ensemble restreint d’actants dont on peut remarquer qu’ils se situent tous dans une axiologie positive pour l’auteur des textes : patriotes, républicains, citoyens, montagnards. Sur la gauche du pivot, on trouve des verbes qui renvoient à une action hostile envers l’actant situé à droite. Le fait que chacune des 13 occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne relève précisément de ce schéma milite fortement pour son utilisation lors de l’interprétation des résultats33.

Référents locaux

68Comme nous l’avons souligné, les décomptes statistiques opérés sur les formes issues de la segmentation initiale nous conduisent inévitablement à des jugements quantitatifs sur des unités qui ne réfèrent pas forcément aux mêmes réalités, en fonction des contextes dans lesquels elles sont utilisées.

  • 34 À l’exception remarquable d’une forte sous-utilisation de la forme plurielle ennemis dans la parti (...)
  • 35 Les résultats présentés dans cette section sont issus d’un travail mené par l’auteur en collaborat (...)

69Les formes ennemi (35 occ.) et ennemis (181 occ.) possèdent dans le corpus des répartitions plutôt stables34. Afin d’étudier les différents contextes dans lesquels apparaissent ces formes, nous avons constitué un ensemble d’unités textuelles qui contient, outre les formes graphiques ennemi et ennemis, tous les segments répétés qui contiennent l’une ou l’autre des formes35. Sur la Figure 8, on voit la représentation des unités les plus fréquentes de cet ensemble, portées en qualité d’éléments supplémentaires sur le plan des deux premiers facteurs issus de l’analyse sur les mois. La position des différents segments montre que ces unités ne sont pas utilisées de manière uniforme tout au long des périodes. Ainsi, par exemple, le segment plus cruels ennemis trouve toutes ses occurrences au début du corpus alors que les occurrences du segment ennemis de la liberté sont plutôt concentrées vers la fin. L’analyse des projections des différents segments qui contiennent le n-gramme /e-n-n-e-m-i/ va nous permettre de dégager des contextes dont la distribution diffère fortement entre le début et la fin de la période temporelle couverte par le corpus.

Figure 8. Segments du corpus Duchesne contenant la séquence ennemi

Figure 8. Segments du corpus Duchesne contenant la séquence ennemi

Note. Les segments répétés contenant la séquence ennemi ont été placés en qualité d’éléments supplémentaires sur le plan des deux premiers facteurs issus de l’analyse du tableau, 8 parties × 1 420 formes (F≥10).

70On peut estimer que le contenu sémantique de la forme ennemi(s) conserve un noyau de valeurs relativement stable tout au long des périodes couvertes par le corpus. En effet, le chercheur confronté à l’analyse des contextes dans lesquels apparaît la forme retrouvera sans peine, lors de l’examen de chacune des occurrences du terme, les principaux traits sémantiques décrits dans les dictionnaires de langue à propos de ce lexème (opposé, hostile, etc.). Cependant, l’examen minutieux des contextes montre qu’il en va tout autrement pour ce qui concerne les référents auxquels la forme renvoie pour chaque période particulière (Figure 9). Aux plus cruels ennemis, plus mortels ennemis, ennemis du dehors (vraisemblablement : les puissances étrangères et les expatriés) des périodes du début, succèdent bientôt les ennemis du dedans et du dehors, expressions qui peuvent s’analyser comme une dénonciation du fait que les ennemis du dehors ne constituent plus le seul danger. La coordination ennemis du dedans et du dehors – dont il faudra analyser les liens avec la configuration ennemis de l’intérieur et de l’extérieur, également attestée à plusieurs reprises – permet de distinguer, pour mieux les associer ensuite, deux types de référents manifestement distincts. Le segment ennemis de l’intérieur est de plus en plus souvent précédé, à mesure que l’on progresse dans le temps, par l’article défini les qui le désigne comme une réalité dont l’existence est présupposée.

Figure 9. Niveaux d’analyse linguistique et unités d’analyse textométrique

Figure 9. Niveaux d’analyse linguistique et unités d’analyse textométrique

71Progressivement, nos ennemis deviennent vos ennemis, puis les ennemis. Dans la dernière période, les ennemis, désormais désignés de manière préférentielle au pluriel, ne sont plus qualifiés par leur localisation ou par leur rapport aux destinataires du message (nos ennemis ou vos ennemis) mais par des valeurs supposées communes auxquelles ils sont censés s’opposer : ennemis du peuple, ennemis de la république, ennemis de la révolution, ennemis de la liberté, ennemis de l’égalité.

  • 36 Les travaux de William Martinez et d’Erin MacMurray consacrés aux développements de la problématiq (...)

72Beaucoup de ces différences d’emploi n’apparaissent précisément que lors de l’étude statistique de leurs contextes respectifs et ne peuvent être directement perçues lors d’une lecture cursive du corpus. Des projets sont en cours qui permettront bientôt de disposer de procédures capables d’étendre les constats opérés à partir des unités textométriques que constituent les formes et les segments répétés à des décomptes automatisés de cooccurrences entre ces mêmes unités. Dans le cas de l’étude des séries chronologiques, nous parlons alors de cooccurrences dynamiques36.

Conclusion

73L’analyse textométrique impose que, dans un premier temps, les dépouillements textométriques soient effectués selon des normes suffisamment formalisées pour que l’on puisse confier leur réalisation à des machines. À l’issue de cette première étape, les analyses statistiques mettent en évidence des particularités dans la distribution des unités de dépouillement textométrique. La prise en compte de toute une série d’unités que l’on peut construire de manière formelle à partir des unités textométriques (segments répétés, cooccurrences, etc.) permet d’affiner ces premières descriptions.

74Dans le cas où le corpus étudié constitue une série textuelle chronologique, des méthodes spécifiques permettent d’étudier les textes rassemblés sous l’angle particulier de l’évolution du vocabulaire au fil du temps. Pour pratiquer cette étude de manière efficace, il faut s’assurer que les parties issues du découpage du corpus constituent des éléments statistiques suffisamment importants pour permettre l’étude des variations de fréquence des unités textométriques. La mesure de l’autocorrélation du premier facteur issu de l’AFC du tableau lexical qui croise les formes et les parties est un indice précieux pour vérifier que l’évolution du vocabulaire au fil du temps constitue bien la principale caractéristique quantitative du corpus. Lorsque ces conditions sont réunies, l’AFC offre un modèle d’évolution temporelle qui permet parfois de mettre en évidence des périodes qui s’écartent du schéma d’évolution générale, pour des raisons qui resteront à préciser.

75À l’issue des analyses textométriques effectuées sur la base des unités intrinsèques fournies par le découpage automatique lors du dépouillement initial, il est possible de construire des unités plus étroitement liées au contexte de la recherche et de les étudier en s’appuyant sur la structure chronologique du corpus. Les schèmes syntaxiques regroupent, selon des procédures dont la description doit être soigneusement explicitée, des séquences distinguées dans un premier temps par le processus de segmentation automatique, entre lesquelles on peut, dans un second temps, formaliser un lien utile pour l’interprétation des résultats fournis par les méthodes statistiques.

76La progression prévisible des capacités de calcul des machines, la mise à la disposition de vastes communautés de chercheurs de corpus chronologiques de plus en plus importants et de plus en plus soigneusement établis devraient permettre aux méthodes de la textométrie chronologique de trouver de nombreuses applications dans un avenir proche.

Haut de page

Bibliographie

Benzécri, Jean-Paul (dir.), L’analyse des données, vol. 1 : La taxinomie, Paris, Bruxelles et Montréal, Dunod, 1973.

Benzécri, Jean-Paul (dir.), L’analyse des données, vol. 2 : L’analyse des correspondances, Paris, Bruxelles et Montréal, Dunod, 1973.

Benzécri, Jean-Paul (dir.), Pratique de l’analyse des données, t. 3 : Linguistique et lexicologie, Paris, Dunod, 1981.

Brunet, Étienne, Le vocabulaire français de 1789 à nos jours, d’après les données du Trésor de la langue française, 3 vol., Paris et Genève, Slatkine et Champion (Travaux de linguistique quantitative, 17), 1981.

Guilhaumou, Jacques, « L’historien du discours et la lexicométrie. Étude d’une série chronologique : le “Père Duchesne” d’Hébert (juillet 1793-mars 1794) », Histoire & Mesure, 1986, vol. 1, no 3-4, p. 27-46.

Guilhaumou, Jacques, « Dater Le Père Duchesne d’Hébert (juillet 1793-mars 1794) », Annales historiques de la Révolution française, no 303, 1996, p. 67-75.

Guilhaumou, Jacques & Salem, André, « Le Père Duchesne mesure de l’évolution du mouvement cordelier », communication non publiée au colloque « L’outil ordinateur et le métier d’historien », Aix-en-Provence, 1er-2 octobre 1987.

Guttman, Louis, « The Quantification of a Class of Attributes: A Theory and Method of a Scale Construction », in Paul Horst (dir.), The Prediction of Personal Adjustment, New York, Social Science Research Council, 1941, p. 319-348.

Habert, Benoît, Nazarenko, Adeline & Salem, André, Les linguistiques de corpus, Paris, Armand Colin, 1997.

Kraif, Olivier, Tutin, Agnès & Diwersy, Sascha, « Extraction de pivots complexes pour l’exploration de la combinatoire du lexique : une étude dans le champ des noms d’affect », SHS Web of Conferences, vol. 8 (« Actes du 4e congrès mondial de linguistique française, Berlin, juillet 2014 »), 2014, p. 2663-2674.
DOI : https://doi.org/10.1051/shsconf/20140801362

Lafon, Pierre, Dépouillements et statistiques en lexicométrie, Genève et Paris, Slatkine et Champion (Travaux de linguistique quantitative, 24), 1984.

Lafon, Pierre & Salem, André, « L’inventaire des segments répétés d’un texte », Mots. Les langages du politique, no 6, 1983, p. 161-177.

Lebart, Ludovic, Salem, André & Berry, Lisette, Exploring Textual Data, Boston, Kluwer Academic Publishers, 1997.

Lebart, Ludovic & Salem, André, Statistique textuelle, Paris, Dunod, 1994.

Lebart, Ludovic, Pincemin, Bénédicte & Poudat, Céline, Analyse des données textuelles, Québec, Presses de l’Université du Québec, 2019.

Longhi, Julien & Salem, André, « Approche textométrique des variations du sens », Proceedings of the 14th International Conference on Statistical Analysis of Textual Data, Rome, Universitalia, 2018, p. 452-458.

MacMurray, Erin, « Discours de presse et veille stratégique d’événements. Approche textométrique et extraction d’informations pour la fouille de textes », thèse de doctorat en sciences du langage, Université Paris 3-Sorbonne nouvelle, 2012.

Martinez, William, « Contribution à une méthodologie de l’analyse des cooccurrences lexicales multiples dans les corpus textuels », thèse de doctorat en sciences du langage, Université Paris 3-Sorbonne nouvelle, 2003.

Mayaffre, Damon, Paroles de président, Paris, Honoré Champion, 2004.

Salem, André, « La typologie des segments répétés dans un corpus, fondée sur l’analyse d’un tableau croisant mots et textes », Les cahiers d’analyse des données, vol. 9, no 4, 1984, p. 489-500.

Salem, André, « Segments répétés et analyse statistique des données textuelles. Étude quantitative à propos du “Père Duchesne” de Hébert », Histoire & Mesure, vol. 1, no 2, 1986, p. 5-28.

Salem, André, Pratique des segments répétés. Essai de statistique textuelle, Paris, Klincksieck (Saint-Cloud), 1987.

Salem, André, « Approches du temps lexical. Statistique textuelle et séries chronologiques », Mots. Les langages du politique, no 17, 1988, p. 105-143.

Steuckardt, Agnès, « Les ennemis selon L’Ami du peuple, ou la catégorisation identitaire par contraste », Mots. Les langages du politique, no 69, 2002, p. 7-22.
URL : http://journals.openedition.org/mots/10023

Van Rijckevorsel, Jan L. A., The Application of Fuzzy Coding and Horseshoes in Multiple Correspondance Analysis, Leiden, DSWO Press, 1987.

Von Neumann, John, « Distribution of the Ratio of the Mean Square Successive Difference to the Variance », The Annals of Mathematical Statistics, vol. 12, no 4, 1941, p. 367-395.

Haut de page

Notes

1 La publication des articles coordonnés A. Salem, 1986, et J. Guilhaumou, 1986, constituait le premier bilan d’une recherche pluridisciplinaire développée au sein de l’équipe « Lexicométrie et textes politiques » (CNRS et École normale supérieure de Fontenay Saint-Cloud), alors dirigée par Maurice Tournier. On peut consulter différents travaux réalisés à l’aide des méthodes textométriques sur la revue Lexicometrica. URL : http://lexicometrica.univ-paris3.fr/.

2 La discipline s’est parfois appelée « statistique linguistique », « statistique lexicale », « lexicométrie », « textométrie », « statistique textuelle », « analyse statistique des données textuelles », « logométrie », etc.

3 Les Contes des Mille et une nuits (nuit 178) relatent ainsi l’histoire d’une servante, la Docte sympathie (Tawaddud al-Jâriya, تودد الجارية), qui, pour prouver l’étendue de son savoir, énonce devant un aréopage de savants des décomptes portant sur le livre du Coran : nombre de sourates, nombre de versets, mais également nombre de mots. La qualité des décomptes mentionnés dans ce récit est largement confirmée par les décomptes informatisés réalisés de nos jours. Le travail du mathématicien russe Andreï Andreïevitch Markov, publié en 1913 et consacré à l’étude des successions voyelles/consonnes dans le poème de Pouchkine Eugène Onéguine (Евгений Онегин), fournit un autre exemple d’entreprise textométrique pionnière. Notons que cette dernière recherche, qui marque le point de départ d’une méthodologie appelée à connaître d’innombrables applications dans toutes sortes de domaines scientifiques sous le nom de « chaînes de Markov », trouvera assez peu d’écho dans le domaine de la poétique qui avait au départ suscité l’intérêt de son auteur.

4 Certains auteurs proposent de retenir le facteur multiplicatif de 1015 pour estimer la progression de la puissance de calcul des ordinateurs, depuis les années 1970 jusqu’à nos jours.

5 On notera que les principales méthodes statistiques utilisées de nos jours dans le domaine textométrique ont été élaborées des dizaines et parfois des centaines d’années avant la généralisation des approches informatisées.

6 « Des modèles qui comportent plus de paramètres à ajuster qu’il n’y a de données à décrire ! », raillait le maître Benzécri lors de causeries « péripatéticiennes » entre le laboratoire de Jussieu et la gare d’Austerlitz.

7 Ces remarques s’appliquent avec d’autant plus de pertinence au cas où l’analyste, mettant à profit les capacités des ordinateurs modernes, a rassemblé un corpus de textes dont les dimensions font que sa lecture exhaustive par un lecteur humain n’est plus envisageable sur un plan pratique.

8 Dans la séquence textuelle « les mots et les choses », on compte par exemple 5 occurrences, 4 formes différentes, parmi lesquelles 3 formes (mots, et, choses) sont des formes hapax (hapax legomenon, « dit une seule fois »).

9 Les avis sur le choix des unités les plus adaptées au dépouillement automatique des corpus de textes ont donné lieu à de vifs débats dans le monde des analyses textuelles. Dans le domaine des études littéraires, il semblait alors naturel aux spécialistes formés à la lexicologie de recenser les occurrences de lemmes en ramenant, à l’aide de moyens plus ou moins automatisés, les formes fléchies au lemme correspondant du dictionnaire (singulier pour les substantifs, masculin singulier pour les adjectifs, infinitif pour les verbes, etc.). Les analystes confrontés aux textes politiques objectaient que les oppositions singulier/pluriel (ex : la liberté vs. les libertés) pouvaient être porteuses de sens, dans les textes qu’ils étudiaient ; de même pour ce qui concerne les flexions verbales (il fallait, il faut, il faudra, il aurait fallu) qui peuvent être considérées comme des signes de positionnement politique tout à fait dignes d’intérêt et ne peuvent, dans ce contexte, être aveuglément rapportées à la forme infinitive.

10 Le corpus Duchesne est constitué par 96 livraisons du journal Le père Duchesne de Jacques-René Hébert, parues entre le 17 juillet 1793 et le 13 mars 1794. La division du corpus en livraisons (numérotées de H260 à H355) correspond à une partition « naturelle » en 96 parties. Des partitions dont chacune des parties regroupe plusieurs livraisons consécutives permettent de mieux cerner la dimension chronologique du corpus : partition en mois (numérotés de M1 à M8), partition en quinzaines, partition en semaines, etc. Le dépouillement automatisé du corpus Duchesne aboutit aux caractéristiques suivantes : 142 177 occurrences, 10 988 formes, la forme de fréquence maximale est la forme de, avec 6 130 occurrences, on recense 5 056 formes hapax.

11 On appelle ce tableau le « tableau lexical », même lorsque les comptages portent sur d’autres unités que les formes lexicales du texte. De la même manière, on appelle la liste des unités effectivement rencontrées dans le corpus : le « vocabulaire » du corpus.

12 Le tableau lexical entier construit sur la base du dépouillement textométrique du corpus Duchesne compte donc 10 988 lignes pour 96 colonnes, soit plus d’un million de cellules.

13 L’effectif observé dans la case (i, j) est comparé aux résultats qu’aurait produit un modèle dans lequel les occurrences des formes qui composent le texte seraient réparties de manière aléatoire. On choisit ensuite un seuil de significativité s. Si l’effectif observé dépasse fortement la valeur que le modèle laissait prévoir, on dit que la valeur observée dans la case (i, j) est une spécificité positive au seuil s. Lorsque la valeur observée est au contraire significativement plus faible que l’effectif que le modèle laissait prévoir, on dit que la spécificité est négative. Si l’effectif observé ne s’éloigne pas significativement des valeurs que le modèle laissait prévoir, on dit que la forme i est banale pour la partie j. Dans ce qui suit, on dira que l’indice de spécificité calculé pour un effectif kij est égal à « +X », si la probabilité d’observer un effectif supérieur à kij, compte tenu des paramètres du modèle retenu, est de l’ordre de 1/10X. Pour en savoir plus sur le calcul des spécificités on consultera P. Lafon, 1984. Pour des exposés sur les accroissements spécifiques et les spécificités chronologiques, on consultera A. Salem, 1987 ainsi que L. Lebart & A. Salem, 1994.

14 Pour plus de détails sur la méthode d’analyse factorielle des correspondances, on se reportera à J.-P. Benzécri, 1973. Un exposé plus accessible et des applications aux données textuelles sont consultables dans J.-P. Benzécri, 1981 ; L. Lebart & A. Salem, 1994, ainsi que dans d’autres publications.

15 Sur la méthode des segments répétés, on pourra consulter P. Lafon & A. Salem, 1983 ; A. Salem, 1987.

16 Cette possibilité s’appuie sur le raisonnement suivant : on peut considérer l’ensemble des occurrences du segment A B C D (dans lequel chaque lettre capitale représente une occurrence découpée par le dépouillement initial) comme le sous-ensemble des occurrences de la forme A qui sont immédiatement suivies dans le texte par les formes B C D. Ce sous-ensemble possède une fréquence qui est égale à celle du segment A B C D. Dès lors, on peut appliquer le calcul des spécificités à cette unité dont on comparera la fréquence dans chaque partie à sa fréquence totale dans le corpus. De la même manière, on peut projeter le profil de cette unité segmentale sur des plans factoriels, ce qui permet de situer à la fois une forme et les segments qui la contiennent.

17 Plusieurs modèles de calcul des cooccurrences entre formes ont été proposés. Voir par exemple : P. Lafon, 1984 ; W. Martinez, 2003.

18 On appelle ainsi les éléments qui n’ont pas participé à l’analyse et que l’on positionne ensuite à l’endroit où l’analyse les aurait placés s’ils y avaient participé avec une masse infinitésimale. Cette procédure s’applique également aux empans textuels ou groupes de parties du corpus qui peuvent également être positionnés en tant qu’éléments-parties supplémentaires.

19 Sur la partie droite de la Figure 4a, les livraisons utilisent un discours, souvent à la première personne qui contient beaucoup de pronoms personnels. Les livraisons situées sur la partie gauche correspondent à un discours donné dans un style plus soutenu, voir J. Guilhaumou, 1986.

20 Sur la méthodologie du traitement des séries textuelles chronologiques on consultera par exemple A. Salem, 1988.

21 Pour mesurer cette autocorrélation, nous avons utilisé le coefficient de Von Neumann qui compare la moyenne des carrés des distances entre les parties consécutives à celle des carrés des distances prises deux à deux entre toutes les parties. Une valeur faible du coefficient indique que les parties consécutives sont en moyenne plus proches que les parties prises deux à deux, dans un ordre quelconque. Une valeur proche de 1 indique l’absence d’autocorrélation. J. Von Neumann, 1941.

22 Pour des raisons de présentation dans le cadre du présent recueil, le volume de la liste a été drastiquement limité en ne retenant que les termes de fréquence supérieure à 20 et des indices de spécificités supérieurs à 8 (i. e. spécificité inférieure à 10-8). Pour simplifier la lecture, les segments qui constituent des troncatures de segments plus étendus ont été écartés.

23 Les développements qui suivent s’appliquent également à des zones textuelles composées d’une sélection arbitraire d’unités textuelles (pas forcément consécutives dans le texte) que nous ne considèrerons pas dans le cadre de cette étude.

24 Associé au précieux travail de datation produit sur chaque numéro du corpus Duchesne par l’historien Jacques Guilhaumou, ce résultat nous permet de fixer le début de la période d’utilisation de ce vocabulaire offensif au numéro H322 (du 14 décembre 1793, dernier numéro de la période précédente M5). Il signale également que le numéro H329 (du 11 janvier 1794) qui appartient à la période M6 n’utilise pas ce vocabulaire de manière spécifique. On note que les numéros H325 et H335 (respectivement du 22 décembre 1793 et du 18 janvier 1794) se distinguent par l’emploi massif qu’ils font de ce même vocabulaire. Voir J. Guilhaumou, 1996.

25 La carte des sections est une représentation graphique d’un corpus qui permet de localiser les variations mises en évidence par les procédures statistiques. Sur cette carte, chaque section du texte (ici les paragraphes délimités par des « retours à la ligne ») est représentée par un carré, susceptible de prendre des couleurs différentes en fonction de calculs statistiques effectués sur la section. Chaque partition du corpus peut être matérialisée par une ligne horizontale. Cette fonctionnalité est disponible dans les logiciels Lexico3 et Lexico5 (logiciel de textométrie réalisé dans l’équipe du Centre de lexicométrie et d’analyse automatique des textes, au sein du laboratoire Systèmes linguistiques, énonciation et discours (SYLED-CLA2T) à l’université Paris 3 Sorbonne nouvelle, URL : https://lexi-co.com/).

26 Partisans d’un adversaire politique de Hébert, nommé en fait Pierre Nicolas Philippeaux (1754-1794).

27 Notons que la modélisation des dialogues homme/machine, qui a largement prouvé son utilité dans certains systèmes d’interactions de caractère industriel, s’appuie au contraire sur des dictionnaires informatisés contenant des unités dont le sens est considéré comme stabilisé.

28 « Qui fait preuve de mesure, qui se tient éloigné de tout excès […] » (Robert) ; « Qui appartiennent aux partis ennemis des extrêmes […] » (Littré).

29 Pour certains de ces termes, la connotation intrinsèquement négative se situe au niveau de la langue commune (fripons, intrigants, etc.). Pour d’autres termes (royalistes, nobles, aristocrates, etc.), c’est la connaissance du corpus et parfois celle du contexte historique qui permettra d’affirmer l’hostilité du scripteur envers les représentations convoquées.

30 En 1793, les accusations de modérantisme frappent principalement certains jacobins qui envisagent une paix séparée avec les puissances disposées à reconnaître la République. Notons que ce sens de la forme modéré, évident pour les historiens spécialistes de la période comme pour les contemporains du Père Duchesne, n’est plus toujours mentionné par les dictionnaires de langue de notre époque.

31 La province de la Vendée a connu, à partir de mars 1793, un soulèvement armé contre le pouvoir révolutionnaire, suivi d’une très dure répression menée par le pouvoir central. Ce mouvement, qui connaîtra des suites jusqu’en mars 1796, est considéré comme ayant été maîtrisé, à l’époque où sont publiés les textes de la période M6 (décembre 1793-janvier 1794).

32 Ces résultats constituent un contre-exemple manifeste de l’affirmation, souvent exprimée dans les travaux textométriques, qu’il est possible d’écarter systématiquement des analyses une série de mots-outils (ou mots grammaticaux) pour la raison qu’ils ne seraient porteurs d’aucune signification particulière.

33 Plusieurs chercheurs ont proposé des méthodes permettant de repérer des motifs plus complexes que les répétitions à l’identique d’une suite de termes (segments répétés). Les approches les plus formalisées s’appuient sur la comparaison d’arbres lexicosyntaxiques (O. Kraif, A. Tutin & S. Diwersy, 2014). Les rapprochements de séquences textuelles esquissés dans la présente section s’appuient, pour leur part, sur des analogies textuelles qui concernent à la fois le lexique, la syntaxe et la sémantique. Ces schèmes, qui présentent un degré de formalisation moindre, se révèlent cependant utiles lors de la phase d’interprétation des résultats fournis par les outils textométriques.

34 À l’exception remarquable d’une forte sous-utilisation de la forme plurielle ennemis dans la partie M4.

35 Les résultats présentés dans cette section sont issus d’un travail mené par l’auteur en collaboration avec Julien Longhi et ont déjà fait l’objet d’une communication lors des Journées d’analyse statistique des données textuelles JADT 2018 qui se sont tenues à Rome ; voir J. Longhi & A. Salem, 2018. La figure a été allégée des segments redondants (segments contenus dans des segments plus longs). Certains des éléments superposés par l’analyse ont été très légèrement déplacés afin de la rendre plus lisible.

36 Les travaux de William Martinez et d’Erin MacMurray consacrés aux développements de la problématique des cooccurrences ont constitué des avancées dans cette direction. W. Martinez, 2003 ; E. MacMurray 2012.

Haut de page

Table des illustrations

Titre Figure 1. « Nuage de mots » réalisé à partir du corpus Duchesne
Légende Note. Le nuage de mots a été réalisé le 23 novembre 2020 sur le site d’un générateur de nuages de mots (URL : www.wordclouds.com), à partir du corpus Duchesne, auquel nous empruntons nos exemples dans ce qui suit. Ce même jour, un service en ligne d’analyse du trafic web estimait à plus des 400 000 visites par mois la fréquentation de la version française de ce site. Pour une présentation générale de la méthode et de ses objectifs, on pourra consulter la notice Wikipédia (URL : https://fr.wikipedia.org/​wiki/​Nuage_de_mots-cl%C3%A9s). Dans les instructions fournies aux utilisateurs potentiels, les auteurs affirment que « le nuage de mots-clés est une sorte de condensé sémantique d’un document », omettant d’expliciter les termes utilisés et de renvoyer à des publications sérieuses.
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-1.jpg
Fichier image/jpeg, 781k
Titre Figure 2. Schéma général de l’approche textométrique des corpus textuels
Légende Guide de lecture : La ligne horizontale qui partage la Figure 2 symbolise la frontière, aisément repérable dans la pratique textométrique, entre le monde de la communication humaine et celui des données et des processus informatisés. Au sein de ce dernier, les informations circulent essentiellement sous forme de « 0 » et de « 1 ». On ne franchit cette ligne de haut en bas qu’au prix de certaines simplifications des données textuelles qui se transforment alors en des suites de chiffres binaires [Note : Lors de la phase d’encodage des textes, on décide souvent d’ignorer toute une série de métadonnées, marques, disposition, pagination, enrichissements typographiques, etc., qui figurent dans le texte d’origine. Dans le cas des corpus constitués à partir de différentes sources de stockage déjà informatisées, il est nécessaire de procéder à une homogénéisation des normes de présentation du texte.]. Symétriquement, la formulation de commentaires dans un langage compréhensible par un humain, à partir des résultats obtenus à l’issue de traitements statistiques, suppose un processus d’interprétation et de mise en forme de ces résultats. – La phase de préparation du corpus voit les textes réunis par le chercheur se transformer en un corpus informatisé. – Lors de la phase d’exploration textométrique, les méthodes statistiques produisent des états informatisés consultables par le chercheur. Au départ, ces états portent sur la répartition des unités intrinsèques (unités produites par les procédures de dépouillement définies au départ de l’analyse). À partir de ces états, le chercheur peut, par la suite, élaborer des unités structurantes (nous y reviendrons dans la troisième partie) qui correspondent mieux à la perception des textes par les humains et permettent de mieux rendre compte des résultats obtenus. – Sur la base des états générés lors des phases précédentes, le chercheur produit enfin une interprétation des résultats produits par les analyses textométriques à l’intention d’un lecteur humain, lequel ne dispose pas, dans le cas général, d’un accès au corpus étudié. Le seul fait de distinguer, parmi des résultats statistiques, des résultats dont on considère qu’ils peuvent intéresser les chercheurs d’autres résultats que l’on considère comme présentant un intérêt moindre constitue déjà une forme d’interprétation. De plus, l’étape d’interprétation mobilise, la plupart du temps, des catégories d’analyse et des connaissances encyclopédiques extérieures au corpus informatisé soumis à l’analyse.
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-2.jpg
Fichier image/jpeg, 790k
Titre Figure 3. Spécificités, accroissements spécifiques et spécificités chronologiques
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-3.jpg
Fichier image/jpeg, 893k
Titre Figure 4. AFC à partir de deux partitions du corpus Duchesne
Légende Guide de lecture : Pour les deux analyses (a et b), seules les 1 420 formes de fréquence égale ou supérieure à 10 occurrences ont été retenues. a : L’analyse porte sur un découpage du corpus en 96 livraisons. b : La méthode a été appliquée à l’analyse d’un tableau dans lequel les livraisons sont regroupées en 8 périodes d’un mois, étiquetées de M1 à M8. Chacune des figures fournit une représentation des parties du corpus sur les deux premiers axes issus de l’AFC. Sur chacune, on a représenté les formes les plus spécifiques de l’opposition constatée sur le premier axe.
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-4.jpg
Fichier image/jpeg, 542k
Titre Tableau 1. Mesure de l’autocorrélation sur le premier facteur issu de l’AFC à partir de différentes partitions du corpus Duchesne
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-5.jpg
Fichier image/jpeg, 248k
Titre Figure 5. Dualité spécifique entre zones et cohortes spécifiques
Légende Guide de lecture : La sélection d’une cohorte de termes spécifiques à un seuil s, pour une zone textuelle du corpus (sur la gauche) induit automatiquement la sélection d’une série de zones du corpus (ici, sur la droite, des paragraphes) pour lesquelles l’effectif de la cohorte déclenche un diagnostic de spécificité. Symétriquement, pour chaque sélection de zones (sur la droite) on peut calculer la cohorte des termes qui sont spécifiques dans cette sélection.
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-6.jpg
Fichier image/jpeg, 790k
Titre Figure 6. Spécificités de la cohorte CSM6+ dans chacun des 96 numéros du corpus Duchesne
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-7.jpg
Fichier image/jpeg, 288k
Titre Figure 7. Carte des sections (paragraphes du texte) établie à partir du corpus Duchesne découpé en 8 parties (mois)
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-8.jpg
Fichier image/jpeg, 454k
Titre Tableau 4. Contextes de la forme modérés dans le corpus Duchesne (extraits)
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-9.jpg
Fichier image/jpeg, 235k
Titre Tableau 5. Contextes de la forme nouvelle dans la période M6 du corpus Duchesne (extraits)
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-10.jpg
Fichier image/jpeg, 458k
Titre Tableau 6. Les occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-11.jpg
Fichier image/jpeg, 315k
Titre Figure 8. Segments du corpus Duchesne contenant la séquence ennemi
Légende Note. Les segments répétés contenant la séquence ennemi ont été placés en qualité d’éléments supplémentaires sur le plan des deux premiers facteurs issus de l’analyse du tableau, 8 parties × 1 420 formes (F≥10).
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-12.jpg
Fichier image/jpeg, 379k
Titre Figure 9. Niveaux d’analyse linguistique et unités d’analyse textométrique
URL http://journals.openedition.org/histoiremesure/docannexe/image/14804/img-13.jpg
Fichier image/jpeg, 303k
Haut de page

Pour citer cet article

Référence papier

André Salem, « Le temps lexical »Histoire & mesure, XXXVI-2 | 2021, 21-56.

Référence électronique

André Salem, « Le temps lexical »Histoire & mesure [En ligne], XXXVI-2 | 2021, mis en ligne le 01 janvier 2024, consulté le 14 septembre 2026. URL : http://journals.openedition.org/histoiremesure/14804 ; DOI : https://doi.org/10.4000/histoiremesure.14804

Haut de page

Auteur

André Salem

Université Sorbonne nouvelle Paris 3. E-mail : salem@msh-paris.fr

Articles du même auteur

  • Des textes en mouvement… [Texte intégral]
    Analyse textométrique des rapports d’ouverture présentés aux congrès du Parti communiste chinois (1982-2017)
    Words in Motion… Textometric Analysis of Opening Reports to the Chinese Communist Party Congress (1982-2017)
    文本在演变…1982至2017年党代会开幕式词历时词量学研究
    Paru dans Histoire & mesure, XXXVI-2 | 2021
Haut de page

Droits d’auteur

Le texte et les autres éléments (illustrations, fichiers annexes importés), sont « Tous droits réservés », sauf mention contraire.

Haut de page
Search OpenEdition Search

You will be redirected to OpenEdition Search