- 1 La publication des articles coordonnés A. Salem, 1986, et J. Guilhaumou, 1986, constituait le prem (...)
1Vers la fin du siècle dernier, la jeune revue Histoire & Mesure nous avait offert la possibilité d’exposer des développements méthodologiques de la textométrie adaptés à l’étude des séries textuelles chronologiques (STC)1. Dans le contexte de l’époque qui voyait se développer des études quantitatives portant sur des corpus de textes de plus en plus divers, rédigés dans des langues de plus en plus variées, ces applications à des corpus composés de textes émis au fil du temps par une même source textuelle paraissaient, en effet, susceptibles d’attirer l’attention des historiens, souvent confrontés à des corpus du même type.
2Depuis cette époque, de nombreuses expériences réalisées sur des corpus socio-politiques, dont certaines font l’objet de contributions dans le présent numéro d’Histoire & Mesure, sont venues renforcer notre conviction que la méthodologie des STC peut être appliquée avec profit pour tenter d’observer l’évolution dans le temps de productions textuelles émises par une source homogène. L’articulation raisonnée de plusieurs méthodes statistiques permet alors de poser toute une série de questions au corpus que l’on a réuni et d’obtenir des descriptions aisément interprétables portant sur les transformations textuelles qui surviennent au fil du temps.
3Pour exposer ce bilan de manière claire, il nous a semblé nécessaire de commencer par rappeler des éléments qui appartiennent au quotidien des chercheurs qui travaillent sur les textes dans des domaines scientifiques très différents (histoire, linguistique, analyse du discours, traductologie, statistique, informatique). La première partie est consacrée à l’approche textométrique des corpus de textes (1). On examine ensuite les méthodes spécifiquement adaptées à l’étude des séries textuelles chronologiques (2). La dernière section est consacrée à la description d’unités textuelles que l’on peut construire dans le but d’améliorer la description des changements textuels qui interviennent progressivement dans les corpus chronologiques (3).
- 2 La discipline s’est parfois appelée « statistique linguistique », « statistique lexicale », « lexi (...)
4Comme c’est le cas pour la plupart des paradigmes de recherche, il serait hasardeux d’essayer de ramener la courte histoire des communautés de chercheurs qui partagent le noyau commun de l’approche statistique des textes à une succession de progrès scientifiques améliorant, à chaque étape, les connaissances communes de l’étape précédente. La longue liste des dénominations mobilisées tour à tour pour servir de bannière aux approches quantitatives des textes porte au contraire la trace de changements de perspective, de confrontations d’intérêts scientifiques parfois divergents, de tentatives qui se sont révélées des impasses, de recours à des ressources opérationnelles différentes2.
- 3 Les Contes des Mille et une nuits (nuit 178) relatent ainsi l’histoire d’une servante, la Docte sy (...)
5On trouve dans la littérature mondiale des traces de comptages, pratiqués à partir de corpus de textes, suivis ou non d’exploitation statistique des données collectées, qui sont bien antérieures à la révolution informatique3. Mais c’est vers les années 1970 que cette dernière va insuffler une vive accélération aux études textométriques. Devant ce surgissement de possibilités nouvelles, la pluridisciplinarité devient l’invitée de marque d’une rencontre qui apparaît comme un festin scientifique à venir. Des chercheurs formés dans des communautés qui n’entretenaient que peu de rapports jusque-là, poursuivant des objectifs de recherche très différents, vont apprendre à collaborer, à partager leurs connaissances, à questionner leurs propres croyances et à assimiler de nouveaux savoirs.
- 4 Certains auteurs proposent de retenir le facteur multiplicatif de 1015 pour estimer la progression (...)
6Les changements les plus remarquables, encore que les acteurs de l’époque semblent s’y être habitués rapidement, trouvent leur source dans le développement fulgurant des capacités de calcul qui mettent désormais à portée de main des entreprises que nul n’aurait pu envisager dans la période précédente4. Dès cette époque, il devient possible d’effectuer instantanément des recherches documentaires, auxquelles les chercheurs en sciences humaines consacraient précédemment de longues heures de travail, comme dans le cas des recherches d’attestations de formes lexicales ou d’expressions plus complexes au sein de vastes corpus textuels. De plus, il va devenir possible d’appliquer à ces corpus des méthodes d’exploration statistique peu utilisées jusqu’alors dans le domaine des études textuelles. Parallèlement, de grandes masses de textes, dont l’encodage sur support informatique s’étendra sur des dizaines d’années, vont être mises à la disposition de tous avant que la plupart des textes ne soient, par la suite, directement composés sur des claviers d’ordinateurs.
- 5 On notera que les principales méthodes statistiques utilisées de nos jours dans le domaine textomé (...)
7À côté de ces avancées fulgurantes, le développement des méthodes de recherche suivra, pour sa part, un rythme plus « humain », c’est-à-dire incomparablement plus lent5. La caractéristique fondamentale qui marque la période qui s’ouvre alors vient du fait qu’il va désormais être possible, pour de très larges communautés de chercheurs, d’utiliser à des coûts insignifiants des méthodes dont la mise en œuvre aurait suffi à occuper nos prédécesseurs durant leur vie entière et dont l’exécution sur les premiers ordinateurs se chiffrait encore en heures, lors de leurs implémentations pionnières.
8Durant la même période, le domaine des études textuelles connaît des transformations importantes. La linguistique structurale s’impose désormais aux côtés de la philologie traditionnelle. Cependant, d’autres courants apparaissent déjà, telle l’analyse de discours, qui utilisent les connaissances acquises sur le système de la langue, dans la période précédente, pour se préoccuper plus directement des discours produits dans différentes sphères d’activité. Une communauté importante du traitement automatique des langues (TAL) va se constituer, concentrant son intérêt, dans un premier temps, sur les problèmes posés par la traduction automatique des textes.
- 6 « Des modèles qui comportent plus de paramètres à ajuster qu’il n’y a de données à décrire ! », ra (...)
9Enfin, dans la communauté statisticienne, la révolution informatique va renforcer l’exigence d’une profonde remise en question de la manière de traiter les grands ensembles de données. Remettant en cause l’utilisation de modèles pré-élaborés dont il suffirait d’estimer différents paramètres pour décrire la réalité mesurable, le courant de l’analyse des données prône désormais la nécessité de « laisser émerger des structures à partir des données6 ».
10Comme on le voit, en ce début des années 1970, chacune des composantes de la rencontre pluridisciplinaire qui s’organise autour du traitement statistique des corpus de textes connaît en son sein des remises en causes importantes.
11Tout le monde s’accorde désormais sur l’idée que le recours à l’ordinateur ne constitue pas, en lui-même, un gage de scientificité. À ce propos, la méthode des nuages de mots, à laquelle nous consacrons une courte parenthèse, constitue une excellente illustration des dérives auxquelles peuvent conduire les progrès technologiques lorsqu’ils sont utilisés en dehors de toute réflexion scientifique (Figure 1).
12Au-delà d’une utilisation dont la visée serait purement esthétique, la méthode se révèle, en effet, d’une parfaite inutilité pour le chercheur désireux d’acquérir des connaissances à propos d’un corpus de textes. Sa vogue actuelle et les explications fournies par ses promoteurs nous paraissent constituer, en revanche, une source de réflexion sur des attentes et des présupposés, rarement explicités dans les publications qui relèvent de l’étude automatisée des corpus de textes.
13La technique utilisée produit une représentation des « mots » du corpus sur un graphique plan en utilisant des polices et des couleurs variables et en les positionnant selon des règles dont la description est souvent lacunaire. L’ensemble de l’entreprise laisse transparaître la croyance qu’un ensemble de textes peut être « représenté » par une simple figure qui permettra au lecteur d’objectiver des « liens sémantiques » inhérents au texte.
Figure 1. « Nuage de mots » réalisé à partir du corpus Duchesne
Note. Le nuage de mots a été réalisé le 23 novembre 2020 sur le site d’un générateur de nuages de mots (URL : www.wordclouds.com), à partir du corpus Duchesne, auquel nous empruntons nos exemples dans ce qui suit. Ce même jour, un service en ligne d’analyse du trafic web estimait à plus des 400 000 visites par mois la fréquentation de la version française de ce site. Pour une présentation générale de la méthode et de ses objectifs, on pourra consulter la notice Wikipédia (URL : https://fr.wikipedia.org/wiki/Nuage_de_mots-cl%C3%A9s). Dans les instructions fournies aux utilisateurs potentiels, les auteurs affirment que « le nuage de mots-clés est une sorte de condensé sémantique d’un document », omettant d’expliciter les termes utilisés et de renvoyer à des publications sérieuses.
14Le défaut majeur de cette méthode tient au fait qu’il n’est pas anodin de proposer à l’attention d’un lecteur humain de telles juxtapositions de formes. Bien que la description de la méthode indique que le placement des formes résulte d’un calcul aléatoire, la perception de telles images entrainera inévitablement le lecteur humain dans des tentatives d’établir des liens entre les formes qui sont proches sur le graphique afin de les relier dans des séquences syntaxiques plus interprétables à ses yeux qu’une simple collection de formes isolées de tout contexte. Ces rapprochements seront tentés à partir de liens d’équivalence sémantique très généraux dont personne ne peut assurer qu’ils possèdent la moindre pertinence pour l’étude du corpus soumis à la procédure et qu’ils ne constituent pas de simples projections, fondées sur la culture personnelle du lecteur et susceptibles par là même de varier fortement d’un lecteur à l’autre.
15De la collecte des textes que l’on désire comparer à la production du commentaire final, la démarche textométrique emprunte un chemin qui passe par des étapes de nature différente (Figure 2). Au cours de la première étape, des considérations de recherche amènent des chercheurs, animés par différents types de curiosité scientifique, à rassembler des textes dans le but de les soumettre à des comparaisons informatisées. La deuxième phase voit l’application de méthodes statistiques, largement utilisées dans d’autres domaines que le domaine textométrique, aux données issues du dépouillement du corpus. Lors de la dernière étape, le chercheur est amené à produire, d’abord pour lui-même et ensuite pour tenter de communiquer son expérience à une communauté plus large, des commentaires qui visent à synthétiser les résultats auxquels il est parvenu à l’issue de l’exploration statistique, en établissant des liens avec le contexte qui a vu naître les textes soumis à analyse.
Figure 2. Schéma général de l’approche textométrique des corpus textuels
Guide de lecture :
La ligne horizontale qui partage la Figure 2 symbolise la frontière, aisément repérable dans la pratique textométrique, entre le monde de la communication humaine et celui des données et des processus informatisés. Au sein de ce dernier, les informations circulent essentiellement sous forme de « 0 » et de « 1 ». On ne franchit cette ligne de haut en bas qu’au prix de certaines simplifications des données textuelles qui se transforment alors en des suites de chiffres binaires [Note : Lors de la phase d’encodage des textes, on décide souvent d’ignorer toute une série de métadonnées, marques, disposition, pagination, enrichissements typographiques, etc., qui figurent dans le texte d’origine. Dans le cas des corpus constitués à partir de différentes sources de stockage déjà informatisées, il est nécessaire de procéder à une homogénéisation des normes de présentation du texte.]. Symétriquement, la formulation de commentaires dans un langage compréhensible par un humain, à partir des résultats obtenus à l’issue de traitements statistiques, suppose un processus d’interprétation et de mise en forme de ces résultats.
– La phase de préparation du corpus voit les textes réunis par le chercheur se transformer en un corpus informatisé.
– Lors de la phase d’exploration textométrique, les méthodes statistiques produisent des états informatisés consultables par le chercheur. Au départ, ces états portent sur la répartition des unités intrinsèques (unités produites par les procédures de dépouillement définies au départ de l’analyse). À partir de ces états, le chercheur peut, par la suite, élaborer des unités structurantes (nous y reviendrons dans la troisième partie) qui correspondent mieux à la perception des textes par les humains et permettent de mieux rendre compte des résultats obtenus.
– Sur la base des états générés lors des phases précédentes, le chercheur produit enfin une interprétation des résultats produits par les analyses textométriques à l’intention d’un lecteur humain, lequel ne dispose pas, dans le cas général, d’un accès au corpus étudié. Le seul fait de distinguer, parmi des résultats statistiques, des résultats dont on considère qu’ils peuvent intéresser les chercheurs d’autres résultats que l’on considère comme présentant un intérêt moindre constitue déjà une forme d’interprétation. De plus, l’étape d’interprétation mobilise, la plupart du temps, des catégories d’analyse et des connaissances encyclopédiques extérieures au corpus informatisé soumis à l’analyse.
16Ces considérations générales sur la nature de la démarche textométrique ne constituent pas, à elles seules, un guide pratique pour la réalisation du dépouillement statistique d’un corpus textuel. Une fois les textes rassemblés en un corpus, la phase des analyses statistiques implique que soient opérés plusieurs choix préalables aux calculs statistiques : a) des choix sur le type d’unités qui présideront aux dépouillements ; b) le choix d’un découpage du corpus en parties qui seront soumises à des comparaisons statistiques. Comme nous allons le voir, ces choix sont susceptibles d’influer sur la nature des résultats qui seront produits lors des phases ultérieures de comparaisons statistiques.
- 7 Ces remarques s’appliquent avec d’autant plus de pertinence au cas où l’analyste, mettant à profit (...)
17Un des premiers constats auxquels on aboutit lorsque l’on entreprend d’analyser des textes est lié au fait que certaines des unités textuelles (formes lexicales, expressions, etc.) revêtent des significations différentes en fonction des contextes dans lesquels elles sont employées. En fonction d’un contexte changeant (la page d’un livre qu’il a sous les yeux, une concordance informatisée) ou parfois en fonction de connaissances personnelles issues de la fréquentation d’un domaine dont il est spécialiste (l’intégralité d’un ouvrage, l’ensemble de l’œuvre d’un auteur, les productions textuelles d’un courant, d’une époque, etc.), le lecteur mobilisera, plus ou moins consciemment, des compétences (linguistiques, encyclopédiques, etc.) qui lui permettront de construire du sens à partir du texte qu’il est en train de lire7.
- 8 Dans la séquence textuelle « les mots et les choses », on compte par exemple 5 occurrences, 4 form (...)
18À l’inverse, l’analyse automatisée d’un corpus de textes implique que l’on détermine, avant la phase des dépouillements textométriques et, au moins de manière temporaire, un système d’unités textuelles (« formes » ou « types ») dont on décomptera ensuite les occurrences dans chacune des parties du corpus8. Cette simplification, qui permet que le dépouillement puisse ensuite être confié à des automates, a pour conséquence que, lors de la première phase de l’analyse au moins, chacune des occurrences d’un même type sera considérée comme l’apparition d’une même entité dont on postulera ainsi de manière implicite qu’elle possède une certaine stabilité dans l’ensemble du corpus, indépendamment du contexte dans lequel cette entité apparaît. Cette manière de procéder ne respecte pas, à l’évidence, les considérations sur la nature complexe des unités textuelles que nous venons d’exposer ci-dessus.
- 9 Les avis sur le choix des unités les plus adaptées au dépouillement automatique des corpus de text (...)
19On parvient à dépasser ce paradoxe apparent en distinguant clairement plusieurs phases dans le processus d’analyse. Dans la phase initiale de dépouillement, on a recours à un système d’unités textuelles dont la reconnaissance doit pouvoir être confiée à des automates9. Nous appelons ces unités de départ les unités textométriques. Dans la phase d’analyse statistique qui suit, on étudie les variations de fréquence de ces unités. Enfin, dans la dernière phase, consacrée à la production des commentaires, il redevient possible de tenir compte de toute une série de liens entre les unités textuelles, indispensables à la synthèse finale, mais qui n’ont pu être pris en compte lors des premières phases de l’analyse.
20Comme nous allons l’illustrer dans la deuxième section de cet article, le découpage d’un corpus en parties joue également un rôle important dans les analyses statistiques. Dans les cas où le corpus semble posséder des divisions « naturelles » en livres, en tomes, en périodes ou en documents, la décision de le découper en parties en vue de le soumettre à des analyses textométriques doit être prise en fonction d’objectifs de recherche définis. La division d’un même corpus en un petit nombre de parties sera privilégiée si le but poursuivi est de comparer efficacement des moyennes d’utilisation, pour chacune des unités textuelles, au sein de chacune de ces parties. Si l’on souhaite au contraire rapprocher des fragments de textes qui abordent une thématique commune, on privilégiera des partitions du corpus en fragments relativement courts (paragraphes, phrases, etc.).
- 10 Le corpus Duchesne est constitué par 96 livraisons du journal Le père Duchesne de Jacques-René Héb (...)
21Le souci d’exposer clairement des propositions méthodologiques, qui constitue l’objectif premier de cet article, implique que nous convoquions un corpus auquel nous emprunterons des exemples d’application, tout au long de notre étude. Nous avons choisi pour cela de privilégier à nouveau le corpus Père Duchesne sur lequel nous avions réalisé les premières expériences sur les STC10. Ce choix nous permettra, en premier lieu, de faire état de résultats accumulés au cours de plusieurs années de fréquentation de ces textes ; il devrait d’autre part permettre au lecteur de mieux mesurer les avancées réalisées dans le domaine depuis les premières expériences.
- 11 On appelle ce tableau le « tableau lexical », même lorsque les comptages portent sur d’autres unit (...)
22Dans le cadre de l’approche textométrique, une fois les textes sélectionnés, la partition du corpus choisie et les normes de dépouillement en unités textométriques fixées, on constitue un tableau à double entrée11 dans lequel chaque colonne j correspond à l’une des parties du corpus, chaque ligne i, à l’une des unités de décompte sélectionnées pour le dépouillement. À l’intersection de la ligne i et de la colonne j, on trouve le nombre de fois que l’unité i a été rencontrée dans la partie j. C’est ce tableau, que l’on appelle « tableau lexical », qui servira de base à la plupart des analyses statistiques.
- 12 Le tableau lexical entier construit sur la base du dépouillement textométrique du corpus Duchesne (...)
23Les décomptes d’unités textuelles au sein des différentes parties d’un corpus de textes aboutissent à la constitution de tableaux dont les dimensions constituent, le plus souvent, un obstacle à leur appréhension par le chercheur12. Sur la base de ces tableaux, il devient possible de répondre presque immédiatement à la question : quel est le nombre de fois que la forme i apparaît dans la partie j ? Cependant, l’abondance de données rend impossible toute synthèse par un être humain à propos des écarts dans la répartition des formes. Face à cette situation, il est impératif de recourir à des méthodes statistiques qui, mises en œuvre sur un ordinateur, permettront de pointer les irrégularités les plus importantes, au plan quantitatif, dans la distribution des formes au sein des parties.
24Dans ce qui suit, nous avons choisi de parler de deux méthodes statistiques souvent utilisées dans le domaine de l’analyse des textes et d’expliquer en quoi ces méthodes, lorsqu’elles sont judicieusement articulées, se révèlent complémentaires pour l’étude des tableaux lexicaux : la méthode des spécificités et l’analyse factorielle des correspondances (AFC).
- 13 L’effectif observé dans la case (i, j) est comparé aux résultats qu’aurait produit un modèle dans (...)
25L’analyse des spécificités produit, pour chacune des cases du tableau lexical, un diagnostic local qui traduit un jugement probabiliste sur la fréquence observée au croisement de la ligne qui correspond à la forme i et de la colonne qui correspond à la partie j. Ce jugement s’appuie sur la comparaison de quatre nombres : kij, fréquence de la forme i dans la partie j ; Fi, fréquence de la forme i dans l’ensemble du corpus ; tj, nombre des occurrences dans la partie j ; T, nombre total des occurrences du corpus13. Les indices de spécificités calculés pour chacune des cases du tableau permettent de mettre en évidence les écarts les plus importants. En considérant les spécificités calculées pour une même forme-ligne, on établit un profil de spécificité qui permet de distinguer les parties dans lesquelles les occurrences de la forme sont relativement abondantes de celles dans lesquelles ces occurrences sont plus rares. Symétriquement, la hiérarchisation des formes, de la plus spécifique à la moins spécifique, pour chacune des parties ou groupe de parties, permet de mieux caractériser les raisons pour lesquelles chacune des parties du corpus se rapproche ou se distingue des autres (Figure 3).
Figure 3. Spécificités, accroissements spécifiques et spécificités chronologiques
26Dans le but de mettre en évidence les variations qui surviennent au cours de la période j par rapport aux périodes précédentes, le calcul des accroissements spécifiques applique ce même modèle au tableau réduit à ses j premières colonnes. Dans ce second cas, la somme des occurrences du corpus est ramenée à Tj, somme de l’ensemble des occurrences contenues dans les j premières parties ; la somme des occurrences de chaque terme analysé est également ramenée à Fji, somme de ses occurrences dans les j premières parties du corpus. Ce calcul permet d’étudier l’apparition et la disparition des termes utilisés dans une des parties du corpus en les comparant aux seuls textes produits lors des étapes précédentes.
27Pour le calcul des spécificités chronologiques, les marges du tableau initial restent inchangées. On calcule ensuite les spécificités éventuelles de chaque terme dans tous les empans de parties consécutives que l’on peut découper dans le corpus pour ne retenir que la spécificité la plus forte.
- 14 Pour plus de détails sur la méthode d’analyse factorielle des correspondances, on se reportera à J (...)
28L’analyse factorielle des correspondances fournit un jugement global qui porte sur chacun des deux ensembles mis en correspondance. La méthode produit une hiérarchisation des écarts constatés entre le tableau lexical et un tableau construit à partir de ce dernier mais dans lequel toutes les lignes (et respectivement, toutes les colonnes) seraient proportionnelles entre elles. Des facteurs, hiérarchisés en fonction de l’importance des corrections qu’ils apportent par rapport au tableau moyen, permettent de représenter approximativement les distances calculées entre les lignes et les colonnes du tableau. La représentation sur les premiers facteurs de chacun des ensembles mis en correspondance permet d’établir des typologies approchées portant sur chacun des deux ensembles (lignes et colonnes, ici : formes et parties). La représentation simultanée des deux ensembles sur les premiers facteurs permet d’accéder à une représentation synthétique des affinités entre parties, ou groupes de parties, et le vocabulaire qu’elles emploient (ou qu’elles évitent) préférentiellement14.
- 15 Sur la méthode des segments répétés, on pourra consulter P. Lafon & A. Salem, 1983 ; A. Salem, 198 (...)
- 16 Cette possibilité s’appuie sur le raisonnement suivant : on peut considérer l’ensemble des occurre (...)
29La définition du système des unités textométriques qui permet le dépouillement initial induit toute une série de systèmes d’unités dont on peut également confier le recensement à des automates, dès l’issue de la phase de segmentation du texte. Ces unités forment, avec le système des unités textométriques qui a présidé au dépouillement initial, l’ensemble des unités intrinsèques produites par la segmentation du texte. Un segment répété15 est une suite d’unités textométriques issues du dépouillement initial que l’on retrouve à différents endroits du corpus. L’ensemble des segments répétés dans un corpus constitue, la plupart du temps, une liste extrêmement volumineuse. Pour sélectionner les segments qui pourraient présenter un intérêt lors de la phase d’interprétation, il est pratique d’utiliser les mêmes procédures de sélection statistique que celles qui sont appliquées aux unités élémentaires du dépouillement initial16.
- 17 Plusieurs modèles de calcul des cooccurrences entre formes ont été proposés. Voir par exemple : P. (...)
30De la même manière, la rencontre entre deux formes à l’intérieur d’un même empan textuel (phrase, paragraphe, séquence de x formes, etc.) constitue une cooccurrence de ces deux formes. Plusieurs modèles statistiques permettent de sélectionner des ensembles de formes cooccurrentes sur la base du nombre de rencontres que ces formes opèrent à l’intérieur de séquences de textes comme la phrase ou le paragraphe17.
- 18 On appelle ainsi les éléments qui n’ont pas participé à l’analyse et que l’on positionne ensuite à (...)
31Dans le cas de l’AFC, les coordonnées d’une unité sur les axes se calculent à partir de sa ventilation dans les parties (son profil). Après avoir extrait des facteurs à partir d’un tableau lexical, il est possible de calculer, a posteriori, la position sur chacun des axes (et partant, sur des représentations planaires) de toute autre unité prenant des valeurs positives ou nulles dans chacune des parties. Les unités ainsi positionnées sur les plans factoriels s’appellent des éléments supplémentaires ou illustratifs18.
32Dans le cas du calcul des spécificités, une fois les marges du tableau lexical calculées sur la base des unités principales, il est également possible de porter des jugements sur la répartition dans chacune des parties des unités supplémentaires ainsi calculées (segments répétés, cooccurrences, etc.).
33On trouve sur la Figure 4 deux typologies, établies à partir du corpus Duchesne en utilisant la même méthode d’analyse statistique, l’AFC. Les tableaux qui ont été soumis à l’analyse ont été constitués dans les deux cas sur la base du décompte des occurrences des formes dont la fréquence atteint au moins 10 occurrences dans le corpus. La partition utilisée n’est pas la même pour les deux analyses, ce qui explique les différences que l’on peut constater.
Figure 4. AFC à partir de deux partitions du corpus Duchesne
Guide de lecture :
Pour les deux analyses (a et b), seules les 1 420 formes de fréquence égale ou supérieure à 10 occurrences ont été retenues.
a : L’analyse porte sur un découpage du corpus en 96 livraisons.
b : La méthode a été appliquée à l’analyse d’un tableau dans lequel les livraisons sont regroupées en 8 périodes d’un mois, étiquetées de M1 à M8.
Chacune des figures fournit une représentation des parties du corpus sur les deux premiers axes issus de l’AFC. Sur chacune, on a représenté les formes les plus spécifiques de l’opposition constatée sur le premier axe.
- 19 Sur la partie droite de la Figure 4a, les livraisons utilisent un discours, souvent à la première (...)
34Pour la première analyse (Figure 4a), nous avons retenu une partition en 96 livraisons. L’AFC oppose alors deux types de livraisons qui correspondent à deux styles d’écriture différents, utilisés tour à tour par l’auteur dans des proportions qui varient19.
35La seconde analyse opère sur des empans de textes plus étendus, constitués par la réunion de plusieurs livraisons publiées au cours d’un même mois. La typologie produite par l’AFC, à partir de cette nouvelle partition en 8 parties, met cette fois en évidence une modification progressive du stock lexical au cours du temps. On en conclut que stock lexical de chacune des parties ressemble plus à celui des parties qui lui sont proches qu’à celui de parties plus éloignées dans le temps.
- 20 Sur la méthodologie du traitement des séries textuelles chronologiques on consultera par exemple A (...)
36Appliquée à des séries chronologiques comme la série Duchesne, à laquelle nous empruntons nos exemples, l’AFC produit des figures particulières, dont l’interprétation relève de règles spécifiques que nous allons évoquer dans ce qui suit20. Sur la Figure 4b on voit la représentation des parties du corpus Duchesne, divisé en 8 périodes qui correspondent chacune à un mois de parution du journal. La forme générale de cette représentation, qui rappelle grossièrement une « parabole », constitue un indice du fait que le renouvellement progressif du vocabulaire dans le temps apparaît comme la principale source de variation du corpus. S’il s’avère que certaines des parties s’écartent du schéma d’ensemble pour se placer dans des positions un peu décalées par rapport à l’alignement d’ensemble (ce qui est le cas pour la période M7, sur la Figure 4b), la question se posera alors de décrire plus précisément les variations du vocabulaire qui sont à l’origine de ce qui apparaît comme un écart par rapport au schéma général.
37En résumé, dans ce genre de situation, l’AFC fournit à la fois une information sur l’évolution globale du vocabulaire et un modèle empirique qui permet de repérer des écarts ponctuels par rapport au schéma d’ensemble.
- 21 Pour mesurer cette autocorrélation, nous avons utilisé le coefficient de Von Neumann qui compare l (...)
38La propriété de rapprocher les parties consécutives du corpus analysé peut être soumise à des mesures formelles qui permettront de sélectionner les partitions les plus aptes à rendre compte de l’évolution chronologique. Le Tableau 1 permet de comparer la manière dont différentes analyses réalisées sur le corpus Duchesne, à partir de différents découpages en parties de tailles variables, permettent de rendre compte de l’évolution du vocabulaire. Les partitions ont été classées dans l’ordre croissant de la taille des parties que l’on peut découper dans le corpus : livraisons, semaines, quinzaines, mois. La deuxième colonne indique le nombre des parties découpées dans chacun des cas. On trouve ensuite la longueur moyenne des parties. La dernière colonne fournit le résultat du calcul d’un coefficient d’autocorrélation calculé à partir des valeurs prises par l’ensemble des parties sur le premier facteur21.
Tableau 1. Mesure de l’autocorrélation sur le premier facteur issu de l’AFC à partir de différentes partitions du corpus Duchesne
39Les calculs portés sur ce tableau précisent les résultats obtenus à l’aide de l’AFC (Figure 4). Le premier facteur issu de l’analyse du corpus divisé en 96 livraisons ne possède pas la propriété de rapprocher les parties consécutives. On voit sur ce même tableau que la partition en semaines possède un peu mieux cette propriété qui devient manifeste pour le découpage en quinzaines ainsi que pour le découpage en mois, dans une mesure un peu moindre.
Encadré 1. L’effet « temps lexical », un cadre d’analyse pour les séries textuelles chronologiques
De nombreuses études montrent que les analyses textométriques pratiquées à partir de séries textuelles chronologiques peuvent désormais s’appuyer sur des méthodes éprouvées. Nous appelons « effet temps lexical » la réalisation simultanée d’un certain nombre de propriétés qui trouvent leur origine dans des sphères d’analyse différentes.
a) L’analyse factorielle des correspondances (AFC) est une méthode d’analyse statistique qui permet de créer des typologies portant à la fois sur les lignes et les colonnes des tableaux croisés de nombres positifs. Dans le domaine textométrique, on analyse des tableaux qui croisent des parties et des formes (lexicales).
b) L’effet Guttman est un cadre de lecture des résultats fournis par l’AFC qui s’applique avec profit lorsque les données du tableau analysé sont soumises à une variation d’ensemble qui peut être ramenée, approximativement, à une progression unidimensionnellea.
c) Le fait de constituer un corpus en série textuelle chronologique entraîne que l’on attache aux parties du corpus des métadonnées temporelles (ou, plus simplement qu’on affecte à chaque partie une date de création : avérée ou estimée, provisoire ou définitive).
d) La propriété de proximité globale des parties consécutives sur un facteur issu de l’AFC traduit le fait que ce facteur rend compte d’une variation qui est corrélée à la localisation des textes dans le temps.
e) Le facteur temporel qui émerge de l’AFC pour servir de base à d’autres analyses à venir (en général le premier facteur) se trouve alors investi d’une double légitimité :
– il constitue un résultat empirique, calculé à partir du tableau de départ sans qu’aucune connaissance extérieure au corpus n’ait pu influer sur son calculb ;
– sa propriété de rapprocher les parties consécutives dans le temps traduit sa pertinence pour la description de l’évolution temporelle du corpus.
Le facteur temporel ainsi dégagé peut alors servir de modèle empirique pour l’analyse du renouvellement du vocabulaire. Il permet de considérer, simultanément, la progression d’ensemble et les écarts au modèle, constitués par les parties pour lesquelles le stock lexical observé ne correspond pas à ce que laissait prévoir le modèle global de renouvellement.
a. La propriété, parfois liée aux résultats de l’AFC, que l’on appelle l’« effet Guttman » a été décrite dans L. Guttman, 1941. On trouvera un exposé plus accessible dans J.-P. Benzécri, 1973, p. 192-196, de nombreuses applications dans J. L. A. Van Rijckevorsel, 1987, ainsi que des applications aux séries textuelles chronologiques dans A. Salem, 1988. Le modèle d’interprétation proposé par Guttman permet de gérer une situation particulière que l’on rencontre parfois dans l’analyse des résultats d’une AFC. Face à un tableau de données sous-tendu par l’existence d’une évolution dominante, il convient d’abandonner les techniques habituelles d’interprétation des facteurs successifs, pour lesquelles chaque facteur précise la typologie établie sur la base des facteurs précédents. Dans ce type de situation, on considérera que l’AFC décompose de manière relativement complexe une évolution de caractère unidimensionnel dont le premier facteur fournit une bonne approximation.
b. Rappelons cependant que les différents modes de segmentation du corpus en unités textométriques et différents découpages du corpus en parties sont susceptibles d’avoir une influence sur les résultats d’une AFC pratiquée à partir d’un corpus de textes.
40Dans le cas du corpus Duchesne, il apparaît que le découpage en livraisons constitue une unité statistique trop fine pour l’observation directe des variations chronologiques. La variabilité des thèmes abordés d’un numéro à l’autre, les différents styles employés, ne permettent pas, à cette échelle, de mettre en évidence une évolution chronologique. Par contre, le découpage du corpus en quinzaines, ou en mois, permet à l’AFC de repérer une évolution des fréquences textuelles au fil du temps.
41La mise en évidence du caractère évolutif du corpus, considéré à travers une partition adaptée, permet de poser toute une série de questions sur l’évolution lexicale du corpus : Quelles sont les modifications qui apparaissent à un moment donné du corpus ? Durant quelles périodes les modifications sont-elles les plus importantes ? Y a-t-il des termes dont les contextes font l’objet de modifications au cours des périodes couvertes par le corpus ?
42On voit sur le Tableau 2 les accroissements spécifiques positifs majeurs (voir infra) calculés pour la partie M6 du corpus Duchesne divisé en 8 périodes. Nous examinerons dans ce qui suit (troisième section), en étudiant cette liste de plus près, l’hypothèse que les termes spécifiques de la période M6 participent d’un vocabulaire « offensif » qui trouve dans cette période un emploi remarquable.
Tableau 2. Accroissements spécifiques positifs majeurs pour la période M6 du corpus Duchesne
| Terme |
F6 |
f6 |
s |
| patriotes |
111 |
60 |
21 |
| les patriotes |
68 |
36 |
13 |
| *phélipotin |
13 |
13 |
11 |
| *vincent |
10 |
10 |
9 |
| les |
3 667 |
687 |
8 |
| nouvelle |
42 |
21 |
8 |
| conspirateurs |
35 |
18 |
7 |
| c est là que |
10 |
8 |
6 |
| les meilleurs |
22 |
13 |
6 |
Guide de lecture :
La colonne F6 du tableau donne la fréquence du terme dans le corpus réduit aux six premières parties du corpus ; la colonne f6 le nombre des occurrences du terme dans la sixième partie (M6) ; la colonne s indique l’indice de spécificité associé à cette répartition.
43La tresse chronologique est un document confectionné de manière automatisée à partir de la sélection et de l’ordonnancement d’un très grand nombre de constats portant sur la répartition de différents types d’unités recensées dans les empans de périodes consécutives du corpus. Cette présentation constitue un résumé très synthétique des variations qui surviennent au cours du temps dans le corpus de textes analysé.
- 22 Pour des raisons de présentation dans le cadre du présent recueil, le volume de la liste a été dra (...)
44Le Tableau 3 rassemble les spécificités chronologiques les plus importantes extraites à partir de la partition du corpus Duchesne en 8 parties. Les lignes du tableau ont été triées en fonction du barycentre temporel (période moyenne d’utilisation que l’on calcule à partir des fréquences de la forme dans les parties)22.
Tableau 3. Tresse chronologique calculée sur les 8 périodes du corpus Duchesne
| Terme |
F |
f |
S |
1 |
2 |
3 |
4 |
5 |
6 |
7 |
8 |
| nobles |
42 |
21 |
9 |
— |
|
|
|
|
|
|
|
| *marat |
65 |
38 |
9 |
— |
|
|
|
|
|
|
|
| elle |
360 |
272 |
9 |
— |
|
|
|
|
|
|
|
| *custine |
69 |
46 |
12 |
— |
— |
|
|
|
|
|
|
| constitution |
72 |
53 |
16 |
— |
— |
|
|
|
|
|
|
| *paris |
171 |
93 |
14 |
— |
— |
|
|
|
|
|
|
| la *france |
107 |
84 |
8 |
— |
— |
— |
— |
|
|
|
|
| c est vous |
24 |
18 |
12 |
|
|
|
— |
|
|
|
|
| qui avez |
41 |
22 |
10 |
|
|
|
— |
|
|
|
|
| avez |
171 |
55 |
12 |
|
|
|
— |
|
|
|
|
| vous |
1 084 |
218 |
13 |
|
|
|
— |
|
|
|
|
| argent |
47 |
29 |
8 |
|
|
|
— |
— |
|
|
|
| ni |
136 |
63 |
8 |
|
|
|
— |
— |
|
|
|
| tu |
296 |
200 |
9 |
|
|
— |
— |
— |
— |
|
|
| ai |
202 |
114 |
8 |
|
|
|
— |
— |
— |
|
|
| on |
854 |
287 |
9 |
|
|
|
|
— |
— |
|
|
| je |
979 |
561 |
8 |
|
|
|
— |
— |
— |
— |
|
| nouvelle |
46 |
21 |
9 |
|
|
|
|
|
— |
|
|
| patriotes |
152 |
60 |
18 |
|
|
|
|
|
— |
|
|
| républicains |
129 |
38 |
9 |
|
|
|
|
— |
— |
— |
— |
| la raison |
46 |
20 |
8 |
|
|
|
|
|
|
— |
— |
45Malgré le volume restreint de la liste présentée ici, on peut repérer des termes qui apparaissent préférentiellement dans certains des empans du corpus. Pour chaque unité sélectionnée, la partie droite du tableau précise les bornes de l’empan le plus spécifique.
46Comme nous venons de le voir, le découpage en périodes permet de mettre en évidence des termes dont l’utilisation varie fortement dans le temps. De manière symétrique, il est possible de localiser des portions du texte dans lesquelles ces changements apparaissent, s’intensifient ou, au contraire, s’atténuent.
- 23 Les développements qui suivent s’appliquent également à des zones textuelles composées d’une sélec (...)
47Dans ce qui suit, nous appelons « zone textuelle » un ensemble d’occurrences sélectionnées dans le corpus : partie, ensemble de parties, paragraphes ou séquence de phrases consécutives23. À partir d’une zone textuelle Z et d’un seuil de spécificité s, on peut calculer, par comparaison avec le reste du corpus, la liste des termes qui possèdent, pour cette zone, une spécificité positive supérieure au seuil s. Nous appelons cet ensemble de formes la « cohorte spécifique » de la zone Z (au seuil s).
48Symétriquement, à partir d’une cohorte spécifique donnée, il est possible de déterminer une liste de zones dans laquelle les occurrences de la cohorte entraînent un diagnostic de spécificité, par rapport au reste du corpus. Les zones textuelles considérées peuvent être les parties créées par la partition du corpus ou tout autre système de zones que l’on peut découper dans le corpus. C’est ce que nous appelons la « relation duale » entre zones et cohortes spécifiques (Figure 5).
Figure 5. Dualité spécifique entre zones et cohortes spécifiques
Guide de lecture :
La sélection d’une cohorte de termes spécifiques à un seuil s, pour une zone textuelle du corpus (sur la gauche) induit automatiquement la sélection d’une série de zones du corpus (ici, sur la droite, des paragraphes) pour lesquelles l’effectif de la cohorte déclenche un diagnostic de spécificité. Symétriquement, pour chaque sélection de zones (sur la droite) on peut calculer la cohorte des termes qui sont spécifiques dans cette sélection.
- 24 Associé au précieux travail de datation produit sur chaque numéro du corpus Duchesne par l’histori (...)
49Pour obtenir l’histogramme suivant (Figure 6), nous avons commencé par calculer la cohorte spécifique CSM6+ composée des formes dont la spécificité dépasse le seuil de 1/105 dans la partie M6 du corpus. Dans un second temps, nous avons calculé les spécificités de cette cohorte pour chacune des 96 livraisons du corpus. L’examen de la Figure 6 montre que l’émergence de ce vocabulaire est assez nette sur l’ensemble de la période M6, ce qui ne constitue pas une surprise, compte tenu du mode de construction de la cohorte24. Quelques livraisons extérieures à la période M6, dont plusieurs sont situées dans la période M5 qui la précède immédiatement, se signalent également par un emploi spécifique de ce même vocabulaire. L’avant-dernier numéro de la série H354 (paru dans la semaine qui précèdera l’arrestation de Jacques-René Hébert) marque une nette reprise de ce vocabulaire, plus rarement utilisé dans la période qui précède.
Figure 6. Spécificités de la cohorte CSM6+ dans chacun des 96 numéros du corpus Duchesne
- 25 La carte des sections est une représentation graphique d’un corpus qui permet de localiser les var (...)
50Il est possible de repérer encore plus précisément des portions de texte qui emploient fortement les termes de la cohorte CSM6+ que nous avons constituée. Nous avons projeté sur une carte des sections (Figure 7), établie en nous appuyant sur un découpage du texte en paragraphes, le type constitué par les formes qui appartiennent à la cohorte spécifique CSM6+. Les paragraphes représentés avec une couleur plus sombre contiennent, un grand nombre d’occurrences de formes appartenant à cette dernière cohorte25.
Figure 7. Carte des sections (paragraphes du texte) établie à partir du corpus Duchesne découpé en 8 parties (mois)
51Comme on pouvait s’y attendre, la grande majorité des paragraphes dans lesquels la cohorte CSM6+ trouve une forte spécificité se situent au sein de la période M6. L’étude de la disposition de ces paragraphes permet cette fois de localiser des zones plus précises qui peuvent s’étendre sur plusieurs paragraphes successifs. Cette fois encore, on étudiera tout particulièrement les paragraphes spécifiques qui sont extérieurs à la partie M6. Certains de ces paragraphes anticipent l’évolution qui va se produire au cours de la période M6. Deux paragraphes, situés dans la période M8, constituent au contraire des échos tardifs du type d’expression mis en œuvre en M6.
52Parmi d’autres paragraphes spécifiques pour la cohorte CSM6+, l’extrait ci-dessous, emprunté au numéro H328 de la période M6, fournit un exemple de ce type de texte à tonalité particulièrement offensive. Dans cet extrait, à côté des formes qui ont servi à construire la cohorte CSM6+, détachées en caractères gras, on remarquera la présence de formes comme rebelles, malveillants, bourreaux, assassins, écraser, que leur faible fréquence a écartées de la sélection spécifique, mais qui auraient manifestement toute leur place dans une liste des termes polémiques.
H328 [§ 447] celui qui traite les meilleurs patriotes de bourreaux, d'assassins, et qui en même temps s'apitoye sur le sort des aristocrates, n'est-il pas un conspirateur, qui veut rallier tous les malveillants, encourager tous les traîtres pour les armer contre la république? n'est-il pas un rebelle contre les décrets de la convention /…/ les faux patriotes, les fripons qui ne savent plus à quelle branche s'accrocher, tâtent les modérés et les aristocrates; ils cherchent à faire cause commune pour écraser ensemble les hommes purs qui les pourchassent.
53L’utilité première de la méthodologie chronologique tient au fait que les résultats qu’elle propose à l’attention de l’analyste sont produits par des méthodes formalisées qui permettent de limiter la projection d’hypothèses a priori, de la part de l’analyste. Cependant, au vu des résultats statistiques et afin de produire un commentaire intelligible pour un lecteur dépourvu de la possibilité d’explorer le corpus textuel par ses propres moyens, la tentation est parfois vive d’opérer des rapprochements entre des faits textuels mis en évidence simultanément par les méthodes textométriques qui présentent manifestement des traits communs (sur des plans divers de l’analyse des textes : morphologie, syntaxe, sémantique, pragmatique, etc.). Cette dernière entreprise nécessite cependant que soit précisée la nature des rapprochements qui permettront de produire des commentaires plus synthétiques.
54L’analyse des accroissements spécifiques de la période M6 montre l’augmentation progressive d’un vocabulaire lié au conflit politique que nous appellerons, dans le cadre de cette étude, « vocabulaire offensif ». Ces formes, relativement peu fréquentes dans les premières parties du corpus (M1, M2, M3), connaissent par la suite une utilisation croissante qui trouve un paroxysme durant la période M6. Du point de vue de cette évolution d’ensemble, la période M7 marque un net recul dans l’utilisation de formes qui seront à nouveau mobilisées dans la période M8. C’est cette évolution qui est à l’origine de l’effet temps lexical que nous avons constaté plus haut.
- 26 Partisans d’un adversaire politique de Hébert, nommé en fait Pierre Nicolas Philippeaux (1754-1794(...)
55Pour plusieurs de ces formes (conspirateurs, contre, diviser, aristocrates, accuser), le rattachement à la catégorie du vocabulaire offensif peut être établi à partir du sens que les dictionnaires de langue consignent dans leurs définitions. On peut penser que ces formes revêtent, en conséquence, une charge polémique qui sera évidente pour tout lecteur. Pour des formes comme aristocrates ou phélipotins26, une connaissance superficielle de la période historique permet de reconstituer la charge polémique que ces termes ont pu revêtir dans le contexte révolutionnaire. La situation est plus délicate lorsqu’il s’agit d’expliquer l’appartenance à cet ensemble de formes comme nouvelle, meilleurs, etc., auxquelles on n’a pas coutume d’attacher une valeur polémique dans l’usage courant.
Encadré 2. Quelques repères historiques…
Dans le cadre de cet encart, nous tenterons d’opérer quelques rapprochements entre les variations observées dans la répartition des formes lexicales lors des analyses textométriques et les principaux événements survenus au plan politique dans la période couverte par le corpus.
Dans les premières périodes du corpus (périodes M1-M4), les positions politiques défendues par l’auteur du Père Duchesne au détriment des ennemis politiques qu’Hébert ne cesse de dénoncer (les brissotins, i. e. partisans de Brissot, etc.) rencontrent un certain succès.
Fort de cette victoire politique, Hébert entre en opposition avec les dirigeants du mouvement jacobin et plus particulièrement avec les montagnards du Comité de salut public (Robespierre, Saint-Just, etc.). Dans le but d’influencer l’action du Comité, il redouble d’ardeur dans la dénonciation des conspirateurs, des faux patriotes, des modérés, de ceux qui veulent allumer la guerre civile et appelle à l’union des meilleurs patriotes, au cours d’une offensive qui connaît son apogée entre la mi-décembre 1793 et la mi-janvier 1794 (période M6).
Les jacobins réagiront d’abord par la voix de Camille Desmoulins qui attaquera Hébert dans son journal Le vieux cordelier. Hébert tentera, dans un premier temps (période M7), de reprendre l’offensive en faisant à nouveau appel aux thèmes qui avaient assuré sa popularité durant les premières périodes couvertes par le corpus que nous considérons : lutte pour la déchristianisation, lutte contre la présence de nobles à la tête des armées, etc.
Devant l’échec de cette tentative, il tentera de reprendre, au cours de la dernière période qui se terminera par son arrestation et son exécution (période M8), l’offensive politique amorcée durant la période M6.
56Pour comprendre la raison de la présence de ces formes dans une situation de conflit, il est nécessaire de considérer l’ensemble des contextes de leurs utilisations dans le corpus, ou dans un groupe de ses parties, et de tenter de replacer ces emplois dans leur contexte historique.
- 27 Notons que la modélisation des dialogues homme/machine, qui a largement prouvé son utilité dans ce (...)
57Le processus de lecture d’un texte s’appuie sur un contrat implicite entre le lecteur du texte et celui qui en est l’auteur. Ce contrat pose que, sauf exception signalée, les mots sont utilisés au sein du texte avec le sens qu’ils revêtent pour une large communauté de locuteurs. Lorsque les textes sont produits dans un espace temporel restreint, on peut considérer que cette condition de stabilité sémantique est plus ou moins réalisée27. Tel n’est plus le cas, bien entendu, dès qu’il s’agit de textes littéraires, historiques, etc., dont la compréhension par un lecteur humain s’appuie sur un ensemble de connaissances qui doivent sans cesse être réactualisées. Lorsque plusieurs siècles séparent le moment de la lecture de la période historique qui a vu l’écriture du texte, le lecteur doit prêter une attention particulière aux variations de sens qui ont pu survenir entre le moment où le texte a été rédigé et celui auquel il tente d’en percevoir le sens.
- 28 « Qui fait preuve de mesure, qui se tient éloigné de tout excès […] » (Robert) ; « Qui appartienne (...)
- 29 Pour certains de ces termes, la connotation intrinsèquement négative se situe au niveau de la lang (...)
58Les dictionnaires contemporains28 s’accordent à peu près sur le sens du mot modéré(s) pour retenir une signification qui dérive du verbe modérer : faire preuve de mesure, etc. L’examen simultané de l’ensemble des contextes de ce terme dans le corpus Duchesne fait cependant apparaître que, pour chacun des 17 contextes dans lequel il est employé, le terme revêt une tout autre signification. Comme dans les quelques exemples qui suivent (Tableau 4), le terme modérés apparaît chaque fois dans le cadre d’une énumération dont tous les termes se situent dans une axiologie fortement négative29.
Tableau 4. Contextes de la forme modérés dans le corpus Duchesne (extraits)
- 30 En 1793, les accusations de modérantisme frappent principalement certains jacobins qui envisagent (...)
59Dans ce cas, la prise en compte du contexte historique peut, seule, fournir les éclaircissements nécessaires. Le retour systématique au contexte montre que, dans le corpus, la forme modérés renvoie chaque fois à des opposants politiques, le « parti modéré », auxquels s’oppose fermement l’auteur du texte30.
- 31 La province de la Vendée a connu, à partir de mars 1793, un soulèvement armé contre le pouvoir rév (...)
60La forme nouvelle possède également une forte spécificité dans la partie M6. L’examen de l’ensemble des contextes de la forme dans cette période du corpus montre que, dans la plupart des cas (14 sur 21), la forme est utilisée dans une acception particulière : nouvelle *vendée31, nouvelle clique d’aristocrates, nouvelle clique de modérés, nouvelle liste civile, nouvelle majesté égorgeante, nouvelle conspiration, etc.
Tableau 5. Contextes de la forme nouvelle dans la période M6 du corpus Duchesne (extraits)
61Loin de véhiculer le sens usuel de « chose qui n’était pas apparue précédemment », la forme nouvelle prend, dans ces énoncés particuliers, le sens de « chose qui apparaît à nouveau ». On remarque en outre que les phénomènes dont Hébert dénonce la résurgence ont tous donné lieu à une féroce répression dans les périodes précédentes. On peut donc penser que, dans ce contexte particulier, l’adjectif nouvelle introduit l’idée que la lutte de la période précédente n’est pas terminée et qu’il convient de la mener « à nouveau ». Cette incitation à la reprise de la répression s’inscrit, de cette manière, dans le moment offensif auquel participent les textes de la période M6.
62La forme graphique les, que nos analyses signalent comme l’un des accroissements spécifiques les plus remarquables de la période M6, mélange, compte tenu de la méthode de segmentation en formes graphiques utilisée depuis le début de cette expérience, les occurrences de l’article défini pluriel les et celles du pronom personnel homographe de la troisième personne du pluriel. De plus, comme dans la plupart des textes rédigés en français, cette unité est très fréquente dans le corpus (4 748 occ.). Le retour aux contextes dans lesquels cette forme trouve un grand nombre d’occurrences permet de comprendre les raisons de cette utilisation massive.
[H332] /…/ les *brissotins, comme les jean-foutres de conseillers de *capet, ont persécuté les patriotes et les ont accusés également d'être des anarchistes. on se sert aujourd'hui d'un autre mot pour avilir les ardents républicains. on les appelle des ultrarévolutionnaires, parce que les mots de factieux et de désorganisateurs sont usés; mais foutre, le peuple ne prendra pas le change, ce sont encore les apôtres du modérantisme, les amis de la royauté et les aristocrates déguisés qui les accusent. /…/
- 32 Ces résultats constituent un contre-exemple manifeste de l’affirmation, souvent exprimée dans les (...)
63Dans ces contextes, l’article défini les introduit des actants, hostiles en majorité, les constituant comme des groupes dont l’unité ne peut être remise en cause au moment de l’énonciation : les patriotes (91 occ.), mais aussi : les traîtres (86 occ.), les aristocrates (75 occ.), les fripons (64 occ.), les brigands (63 occ.), etc. La densification des occurrences de cette forme au sein d’un fragment de texte peut même constituer un indicateur de l’accroissement local du caractère offensif du discours, comme on le voit, à partir de l’exemple ci-dessus32. L’auteur oppose des catégories préexistantes, introduites par l’article défini les, à des groupes, dont l’existence n’est plus présupposée (on les appelle des anarchistes, des ultra-révolutionnaires, etc.) introduits, pour leur part, par la forme indéfinie des.
64L’examen de l’ensemble des occurrences du segment les meilleurs dans la partie M6 permet de comprendre en quoi ce segment peut être rattaché au vocabulaire offensif de la période (Tableau 6).
Tableau 6. Les occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne
65Cet examen montre que les séquences rassemblées introduisent une distinction particulièrement insistante parmi des catégories d’actants présentés jusqu’alors comme positifs dans leur totalité. L’apparition de la qualification les meilleurs devant chacun de ces groupes induit la question de l’hétérogénéité de la catégorie initiale et la possibilité de l’existence d’intrus parmi les actants de la période susceptibles de s’en réclamer. Les meilleurs (patriotes, républicains, etc.) sont, en outre, systématiquement présentés comme faisant l’objet d’intrigues, de manigances, d’accusations diverses, de la part d’actants plus difficiles à identifier. Dans ce sens, contrairement à ce que laissaient prévoir les traits axiologiques très généraux liés à ce segment, la spécificité du terme les meilleurs dans la partie M6 peut également être rattachée à la montée en fréquence du vocabulaire offensif signalée plus haut.
66Pour rendre compte de manière plus synthétique du recours à ce procédé énonciatif récurrent, nous proposerons le concept de schème discursif récurrent. On posera que, dans chacun des contextes présentés (Tableau 7), le segment les meilleurs constitue le pivot d’un schème plus étendu.
Tableau 7. Schème discursif récurrent autour du pivot les meilleurs
| actant négatif + action hostile + pivot + actant positif |
| actants négatifs : |
vils intriguants, phélipotins, modérés, royalistes, aristocrates, jean-foutres, gredins, nains, agents de *pitt et *cobourg |
| action hostile : |
accuser (5), dénoncer (2), déchirer, traiter de, égorger |
| pivot : |
les meilleurs |
| actants positifs : |
patriotes (7), républicains (4), citoyens (1), montagnards (1) |
- 33 Plusieurs chercheurs ont proposé des méthodes permettant de repérer des motifs plus complexes que (...)
67Les substantifs qualifiés dans ces exemples (sur la droite du pivot) appartiennent à un ensemble restreint d’actants dont on peut remarquer qu’ils se situent tous dans une axiologie positive pour l’auteur des textes : patriotes, républicains, citoyens, montagnards. Sur la gauche du pivot, on trouve des verbes qui renvoient à une action hostile envers l’actant situé à droite. Le fait que chacune des 13 occurrences du segment les meilleurs dans la partie M6 du corpus Duchesne relève précisément de ce schéma milite fortement pour son utilisation lors de l’interprétation des résultats33.
68Comme nous l’avons souligné, les décomptes statistiques opérés sur les formes issues de la segmentation initiale nous conduisent inévitablement à des jugements quantitatifs sur des unités qui ne réfèrent pas forcément aux mêmes réalités, en fonction des contextes dans lesquels elles sont utilisées.
- 34 À l’exception remarquable d’une forte sous-utilisation de la forme plurielle ennemis dans la parti (...)
- 35 Les résultats présentés dans cette section sont issus d’un travail mené par l’auteur en collaborat (...)
69Les formes ennemi (35 occ.) et ennemis (181 occ.) possèdent dans le corpus des répartitions plutôt stables34. Afin d’étudier les différents contextes dans lesquels apparaissent ces formes, nous avons constitué un ensemble d’unités textuelles qui contient, outre les formes graphiques ennemi et ennemis, tous les segments répétés qui contiennent l’une ou l’autre des formes35. Sur la Figure 8, on voit la représentation des unités les plus fréquentes de cet ensemble, portées en qualité d’éléments supplémentaires sur le plan des deux premiers facteurs issus de l’analyse sur les mois. La position des différents segments montre que ces unités ne sont pas utilisées de manière uniforme tout au long des périodes. Ainsi, par exemple, le segment plus cruels ennemis trouve toutes ses occurrences au début du corpus alors que les occurrences du segment ennemis de la liberté sont plutôt concentrées vers la fin. L’analyse des projections des différents segments qui contiennent le n-gramme /e-n-n-e-m-i/ va nous permettre de dégager des contextes dont la distribution diffère fortement entre le début et la fin de la période temporelle couverte par le corpus.
Figure 8. Segments du corpus Duchesne contenant la séquence ennemi
Note. Les segments répétés contenant la séquence ennemi ont été placés en qualité d’éléments supplémentaires sur le plan des deux premiers facteurs issus de l’analyse du tableau, 8 parties × 1 420 formes (F≥10).
70On peut estimer que le contenu sémantique de la forme ennemi(s) conserve un noyau de valeurs relativement stable tout au long des périodes couvertes par le corpus. En effet, le chercheur confronté à l’analyse des contextes dans lesquels apparaît la forme retrouvera sans peine, lors de l’examen de chacune des occurrences du terme, les principaux traits sémantiques décrits dans les dictionnaires de langue à propos de ce lexème (opposé, hostile, etc.). Cependant, l’examen minutieux des contextes montre qu’il en va tout autrement pour ce qui concerne les référents auxquels la forme renvoie pour chaque période particulière (Figure 9). Aux plus cruels ennemis, plus mortels ennemis, ennemis du dehors (vraisemblablement : les puissances étrangères et les expatriés) des périodes du début, succèdent bientôt les ennemis du dedans et du dehors, expressions qui peuvent s’analyser comme une dénonciation du fait que les ennemis du dehors ne constituent plus le seul danger. La coordination ennemis du dedans et du dehors – dont il faudra analyser les liens avec la configuration ennemis de l’intérieur et de l’extérieur, également attestée à plusieurs reprises – permet de distinguer, pour mieux les associer ensuite, deux types de référents manifestement distincts. Le segment ennemis de l’intérieur est de plus en plus souvent précédé, à mesure que l’on progresse dans le temps, par l’article défini les qui le désigne comme une réalité dont l’existence est présupposée.
Figure 9. Niveaux d’analyse linguistique et unités d’analyse textométrique
71Progressivement, nos ennemis deviennent vos ennemis, puis les ennemis. Dans la dernière période, les ennemis, désormais désignés de manière préférentielle au pluriel, ne sont plus qualifiés par leur localisation ou par leur rapport aux destinataires du message (nos ennemis ou vos ennemis) mais par des valeurs supposées communes auxquelles ils sont censés s’opposer : ennemis du peuple, ennemis de la république, ennemis de la révolution, ennemis de la liberté, ennemis de l’égalité.
- 36 Les travaux de William Martinez et d’Erin MacMurray consacrés aux développements de la problématiq (...)
72Beaucoup de ces différences d’emploi n’apparaissent précisément que lors de l’étude statistique de leurs contextes respectifs et ne peuvent être directement perçues lors d’une lecture cursive du corpus. Des projets sont en cours qui permettront bientôt de disposer de procédures capables d’étendre les constats opérés à partir des unités textométriques que constituent les formes et les segments répétés à des décomptes automatisés de cooccurrences entre ces mêmes unités. Dans le cas de l’étude des séries chronologiques, nous parlons alors de cooccurrences dynamiques36.
73L’analyse textométrique impose que, dans un premier temps, les dépouillements textométriques soient effectués selon des normes suffisamment formalisées pour que l’on puisse confier leur réalisation à des machines. À l’issue de cette première étape, les analyses statistiques mettent en évidence des particularités dans la distribution des unités de dépouillement textométrique. La prise en compte de toute une série d’unités que l’on peut construire de manière formelle à partir des unités textométriques (segments répétés, cooccurrences, etc.) permet d’affiner ces premières descriptions.
74Dans le cas où le corpus étudié constitue une série textuelle chronologique, des méthodes spécifiques permettent d’étudier les textes rassemblés sous l’angle particulier de l’évolution du vocabulaire au fil du temps. Pour pratiquer cette étude de manière efficace, il faut s’assurer que les parties issues du découpage du corpus constituent des éléments statistiques suffisamment importants pour permettre l’étude des variations de fréquence des unités textométriques. La mesure de l’autocorrélation du premier facteur issu de l’AFC du tableau lexical qui croise les formes et les parties est un indice précieux pour vérifier que l’évolution du vocabulaire au fil du temps constitue bien la principale caractéristique quantitative du corpus. Lorsque ces conditions sont réunies, l’AFC offre un modèle d’évolution temporelle qui permet parfois de mettre en évidence des périodes qui s’écartent du schéma d’évolution générale, pour des raisons qui resteront à préciser.
75À l’issue des analyses textométriques effectuées sur la base des unités intrinsèques fournies par le découpage automatique lors du dépouillement initial, il est possible de construire des unités plus étroitement liées au contexte de la recherche et de les étudier en s’appuyant sur la structure chronologique du corpus. Les schèmes syntaxiques regroupent, selon des procédures dont la description doit être soigneusement explicitée, des séquences distinguées dans un premier temps par le processus de segmentation automatique, entre lesquelles on peut, dans un second temps, formaliser un lien utile pour l’interprétation des résultats fournis par les méthodes statistiques.
76La progression prévisible des capacités de calcul des machines, la mise à la disposition de vastes communautés de chercheurs de corpus chronologiques de plus en plus importants et de plus en plus soigneusement établis devraient permettre aux méthodes de la textométrie chronologique de trouver de nombreuses applications dans un avenir proche.