Navigation – Plan du site

AccueilNuméros12Quand l’arbre ne tient plus qu’à ...

Quand l’arbre ne tient plus qu’à ses branches : trois essais récents pour reconstruire un arbre mondial des langues

When the Tree Clings Only to Its Branches: Three Recent Attempts to Reconstruct a Global Language Tree
Julien d’Huy

Résumés

La phylogénie des langues connaît aujourd’hui un essor sans précédent grâce aux outils computationnels empruntés aux sciences de la biologie. Cet article examine trois tentatives récentes de reconstruire un arbre mondial des langues, fondées sur des données et des méthodes très différentes : typologie structurale, lexique phonétisé, modèles mixtes bayésiens. Il interroge la validité du modèle arborescent à l’échelle globale, la fiabilité des algorithmes utilisés, la qualité et la compatibilité des données, ainsi que les biais implicites dans les choix méthodologiques. Malgré leurs divergences, ces approches laissent voir certains regroupements profonds, suggérant l’existence de structures historiques robustes au sein du bruit des contacts et des convergences. À travers une synthèse comparative, l’article plaide pour une modélisation critique et synthétique de l’évolution linguistique mondiale, articulant héritage vertical et dynamiques horizontales, dans une perspective réflexive, interdisciplinaire et épistémologique.

Haut de page

Texte intégral

Introduction

1La quête d’une arborescence ultime des langues s’inscrit dans une longue tradition intellectuelle visant à retrouver une langue originelle. Umberto Eco, dans La Recherche de la langue parfaite dans la culture européenne (1994), a exploré cette fascination pour une langue primordiale, soulignant ses motivations souvent idéologiques et religieuses. Il est donc essentiel d’adopter une posture réflexive sur ce type de recherches, en reconnaissant leurs racines historiques et les implications qu’elles peuvent avoir sur notre compréhension des phénomènes linguistiques.

2Depuis les travaux fondateurs d’August Schleicher (1853 ; 1857 ; 1863), le modèle de l’arbre s’est imposé comme une représentation canonique de l’évolution des langues. Un arbre phylogénétique est une structure hiérarchique représentant des relations de descendance entre entités : en linguistique, il modélise la façon dont des langues dérivent d’un ancêtre commun, par des bifurcations successives. Cette structure permet de reconstituer des protolangues, de dater des divergences et d’évaluer la cohérence historique d’un groupe linguistique.

3Les approches modernes s’appuient en grande partie sur des outils développés en biologie évolutionniste, tels que les algorithmes de parcimonie maximale, de probabilité maximale ou les approches bayésiennes à travers les méthodes de Monte-Carlo par chaînes de Markov. Ces techniques permettent de reconstruire des arbres optimaux à partir de données lexicales (cognats), phonologiques ou typologiques, tout en tenant compte des incertitudes. Les longueurs de branches peuvent représenter, soit le temps, soit l’intensité des changements observés.

4Ce tournant marque l’émergence d’une nouvelle discipline, la linguistique historique computationnelle, où les phylogénies sont devenues un outil standard pour tester des hypothèses sur l’origine des familles linguistiques, les migrations humaines ou les co-évolutions culturelles (Greenhill 2015 ; Jäger 2019).

  • 1 https://beast.community/.
  • 2 En archéologie et en géologie, la locution « AP » (« BP » en anglais) signifie « avant le présent » (...)

5De telles méthodes ont rendu possibles des avancées majeures dans plusieurs domaines, notamment en permettant d’évaluer quantitativement des hypothèses rivales sur l’origine et la dispersion des langues. Un exemple emblématique est la controverse sur l’origine des langues indo-européennes. Bouckaert et al. (2012) ont utilisé l’algorithme BEAST (Bayesian Evolutionary Analysis Sampling Tree1) pour analyser un ensemble de cognats indo-européens, soutenant une origine anatolienne (~ 7000-9000 AP2) liée à l’agriculture. Ce résultat a été notamment contesté par Pereltsvaig et Lewis (2015), qui critiquent la robustesse des données cognatiques et la résolution temporelle des modèles. Plus récemment, Heggarty et al. (2023) ont proposé un modèle hybride, suggérant une origine sud-caucasienne (~ 8100 AP), suivie d’une expansion vers la steppe pontique, conciliant ainsi les données linguistiques, archéologiques et génétiques.

6Les arbres linguistiques peuvent aussi servir de proxies, soit de variables de substitution, pour étudier des dynamiques culturelles ou sociales, certains traits culturels se transmettant de façon majoritairement verticale. Currie et al. (2010) ont modélisé l’évolution de la complexité politique chez les sociétés austronésiennes, en utilisant des arbres linguistiques calibrés. De la même façon, ont été reconstruits les évolutions de certains traits religieux (Watts et al. 2015), de la résidence postmaritale (Fortunato et Jordan 2010) ou des systèmes de parenté (Jordan 2011). Ces études utilisent des chaînes de Markov discrètes pour tester des scénarios d’évolution culturelle, avec ou sans dépendance phylogénétique.

7Des arbres robustes ont été produits pour de nombreuses familles, notamment indo-européenne (voir quelques références supra), austronésienne (par exemple, Gray et al. 2009), bantoue (par exemple, Holden 2002 ; Currie et al. 2013), japonique (par exemple, Lee et Hasegawa 2011) ou tasmanienne (par exemple, Bowern 2012). Ces travaux montrent que, dans certains cas, les données linguistiques sont aussi arborescentes que les données génétiques. Cependant, un modèle arborescent se heurte rapidement à des phénomènes de convergence, d’emprunt et de création mixte (comme les créoles), mettant en cause le postulat d’une transmission exclusivement verticale.

8Pour répondre à ces limites, Johannes Schmidt (1872) a proposé la wellentheorie, selon laquelle les innovations linguistiques se diffusent comme des ondes à partir de centres d’innovation. Cette approche aréale, plutôt que généalogique, suggère une autre dynamique d’évolution, dans laquelle des langues non apparentées peuvent néanmoins partager des traits par contact.

9Cette tension entre héritage vertical et influences horizontales se retrouve dans les débats contemporains. Campbell (2004) critique ainsi les usages excessifs de la typologie structurelle à des fins de classification généalogique, soulignant que des traits similaires peuvent émerger par diffusion ou convergence fonctionnelle, tandis que Nichols (1992 ; 1994) soutient que les structures linguistiques, en particulier lorsqu’elles sont corrélées à la géographie, peuvent permettre d’inférer d’anciennes migrations humaines.

10Une question se pose alors. Si le modèle de l’arbre est un pilier de la linguistique historique et reste utile pour étudier des familles bien établies, peut-il être étendu à l’ensemble des langues du monde ? Quelles hypothèses un tel arbre global implique-t-il ? Et quels types de données et de méthodes s’avéreraient-ils appropriés pour cette entreprise ?

11Le projet d’un arbre mondial des langues soulève aussi des questions épistémologiques majeures. La linguistique historique s’est toujours refusée à postuler une monogénèse linguistique. Les hypothèses de superfamilles, comme les langues nostratiques, demeurent marginales et souvent contestées. Mais ne peut-on pas imaginer que la phylogénie mondiale, si elle ne suffit pas à prouver la parenté, peut au moins en cartographier des affinités ? Ne serait-elle pas capable d’offrir une heuristique, à défaut d’une preuve ?

12Nous comparerons trois tentatives récentes de fonder un tel arbre global des langues, par ordre chronologique :

  1. d’Huy (2015), fondée sur des données typologiques et une double approche par réseau et arbre bayésien (voir le glossaire, encadré 1)

  2. Jäger et Wichmann (2016), exploitant des données lexicales standardisées pour inférer des distances phonétiques et construire un arbre global

  3. Bouckaert et al. (2022), combinant données géographiques, typologiques et cognatiques dans un modèle bayésien à des fins d’analyse de la diversification linguistique

13Cet article proposera une comparaison approfondie de ces trois approches, en matière de corpus, de méthodologie, de résultats et de limites, pour en proposer une synthèse critique. Nous nous proposons d’en tirer une réflexion plus large sur la modélisation linguistique à l’échelle mondiale, dans une démarche réflexive, épistémologique et comparative.

Encadré 1. Glossaire

Arbre bayésien (MrBayes/BEAST) : modèle probabiliste d’évolution inféré à partir de données, représentant des relations de parenté supposées.

Consensus majoritaire : méthode de construction d’un arbre consensuel à partir de plusieurs arbres, en conservant les regroupements présents dans la majorité des cas (généralement 50 %).

F-score : moyenne harmonique de la précision et du rappel, utilisée pour évaluer la performance des classifications. La précision est la proportion de clades (ou bipartitions) de l’arbre reconstruit qui sont corrects (présents dans l’arbre de référence). Le rappel est la proportion de clades de l’arbre de référence qui sont retrouvés dans l’arbre reconstruit.

Indice de rétention (IR) : indicateur de la quantité d’information phylogénétique conservée dans les données. L’IR évalue le degré d’homoplasie dans un arbre, c’est-à-dire le niveau de convergence ou de réversion évolutive. Plus l’IR est proche de 1, plus l’arbre est fiable.

Neighbor-Net : méthode de visualisation des relations entre langues, permettant de représenter des structures en réseau plutôt que de façon strictement arborescente.

Score delta : mesure de la compatibilité des données avec une structure arborescente. Plus le score delta est proche de 0, plus les données présentent une structure arborescente.

Taxon : unité taxonomique, telle que les êtres vivants ou les langues ou les familles de langues, utilisée dans les analyses phylogénétiques.

« How to Build a Global Tree of All Known Languages ? » (d’Huy 2015)

Corpus et protocole

14L’étude de d’Huy (2015) repose sur une exploitation des données du World Atlas of Language Structures (WALS ; Dryer et Haspelmath 2013), codées de façon binaire par Dediu (2011). À partir d’un sous-ensemble de 255 langues et 86 traits documentés dans au moins 40 % des langues étudiées (généralement plus), les données ont été analysées à l’aide de l’algorithme Structure 2.3.4, initialement développé pour étudier la génétique des populations (Pritchard, Stephens et Donnelly 2000 ; Falush, Stephens et Pritchard 2003). Cet algorithme bayésien est normalement utilisé pour reconstruire la structure d’une population en se basant sur un ensemble de gènes recombinés – autrement dit, des gènes hérités de plus d’un parent. Il crée un nombre K de groupes, auquel chaque échantillon analysé est rattaché, soit complètement, soit en partie (si tel est le cas, sa probabilité d’appartenir au groupe est indiquée). Par ailleurs, pour chaque taxon (voir le glossaire, encadré 1), il permet d’établir la contribution particulière de chaque groupe et quelle est la meilleure organisation de l’ensemble des données.

15Dans d’Huy (2015), les 0 et les 1 ont été considérés comme d’égale valeur. À la suite des travaux pionniers de Reesink, Singer et Dunn (2009) et de Bowern (2012), le but était d’identifier le nombre optimal de groupes homogènes (K) dans le corpus linguistique. Une division du corpus entre 1 à 25 groupes a été testée et, pour chacune de ces hypothèses, le calcul a été relancé 20 fois. Pour calculer le nombre optimal de groupes constituant le corpus, d’Huy a utilisé la méthode proposée par Pritchard, Stephens et Donnelly (2000) afin de comparer le delta K de chaque division testée (Earl et vonHold 2012). Le delta K est basé sur le taux de changement dans la log-vraisemblance des données entre les valeurs successives de K (Evanno, Regnaut et Goudet 2005). Son application a permis de montrer que le classement le plus probable consistait à diviser l’ensemble des langues étudiées en 20 groupes.

16Toutefois, ces groupes n’avaient pas de cohérence linguistique ou géographique apparente. Ce brouillage a été attribué à la présence de langues fortement influencées par acculturation ou contact, identifiées par leur faible assignation à un seul cluster (< 70 %). Ces langues « mixtes » ont alors été exclues du corpus.

17L’auteur a utilisé ensuite le logiciel SplitsTree (version 4.12 ; Bryant et Moulton 2004) pour créer un réseau de relations entre les langues basé sur leurs différences, appelé Neighbor-Net (voir le glossaire, encadré 1, et la figure 1). Il s’est appuyé sur une méthode dite « distance de Hamming » (Hamming 1950) qui mesure le nombre de différences entre deux langues. Le résultat obtenu – un score delta (voir le glossaire, encadré 1) de 0,3941 – montre que les langues étudiées ont été fortement influencées les unes par les autres. Cela signifie qu’un modèle en forme d’arbre, où chaque langue descendrait d’une autre de façon claire et linéaire, ne suffit pas à représenter cette complexité, même après avoir pratiqué un filtrage des données.

18Toutefois, adoptant l’hypothèse que certaines langues du corpus répondaient à un modèle général en arbre (stammbaum) et que celui-ci pourrait être modélisé, d’Huy a généré un arbre neighbor-joining grâce au logiciel SplitsTree (figure 2 ; uncorrected_p distance). Il a ensuite généré 80 000 000 d’arbres bayésiens (8 000 retenus pour éviter des biais statistiques) à l’aide du logiciel MrBayes. L’arbre de consensus majoritaire (voir le glossaire, encadré 1), faisant la synthèse des nœuds reconstruits dans au moins 50 % de ces arbres, a été enraciné sur la branche la plus longue, supposée avoir connu la plus longue évolution (figure 3). L’indice de rétention (voir le glossaire, encadré 1) de cet arbre (0,75) suggère une transmission majoritairement verticale, mais ne permet pas à lui seul de valider la topologie complète de l’arbre.

Figure 1. Graphe Neighbor-Net produit à partir des données filtrées de d’Huy (score delta = 0,3941 ; score Q-résiduel = 0,08549)

Figure 1. Graphe Neighbor-Net produit à partir des données filtrées de d’Huy (score delta = 0,3941 ; score Q-résiduel = 0,08549)

d’Huy 2015

Figure 2. Arbre neighbor-joining produit à partir des données filtrées de d’Huy

Figure 2. Arbre neighbor-joining produit à partir des données filtrées de d’Huy

d’Huy 2015

Figure 3. Arbre produit par MrBayes à partir des données filtrées de d’Huy

Figure 3. Arbre produit par MrBayes à partir des données filtrées de d’Huy

d’Huy 2015

Principaux résultats

19Le réseau Neighbor-Net est richement réticulé, indiquant une forte transmission horizontale (emprunts, convergence typologique). Les branches sont larges, peu résolues, mais dégagent néanmoins des pôles de densité : africain, australien, austronésien, austro-asiatique, eurasiatique.

20L’arbre bayésien, produit à partir du corpus filtré, donne un indice de rétention élevé (0,75), suggérant l’existence d’un signal vertical. Il isole clairement les familles connues et propose deux axes migratoires depuis l’Afrique, vers l’Asie du Sud-Est, l’Australie et le Pacifique (austro-asiatique et austronésien) d’une part, vers l’Eurasie du Nord et de l’Ouest (altaïque, indo-européen, dravidien, nakh-daghestanais), avec une extension en Amérique du Nord, d’autre part.

21Ce schéma de double diffusion est cohérent avec certaines hypothèses issues de la génétique et de la mythologie comparée (d’Huy 2020 ; 2023), mais il doit être pris avec prudence.

Évaluation critique

22Plusieurs limites de cette étude doivent être soulignées.

  1. Une possible inadéquation théorique : les algorithmes mis en œuvre dans le logiciel Structure supposent une recombinaison génétique entre individus, concept sans véritable équivalent linguistique. L’analogie avec des langues « recombinées » est suggestive mais fragile.

  2. La binarisation forcée : le codage réduit la complexité typologique en dichotomies arbitraires, ce qui introduit des biais, la présence de la tonalité se voyant par exemple réduite à un choix entre « ton complexe » et « ton non complexe ».

  3. La dépendance à des traits interdépendants dans WALS : par exemple, le trait « relation entre l’ordre de l’objet et du verbe et l’ordre de la proposition subordonnée relative et du nom » (« relationship between the order of object and verb and the order of relative clause and noun ») (WALS Ch. 96) inclut les traits « ordre de l’objet et du verbe » (« order of object and verb ») (WALS Ch. 83) et « ordre de la proposition subordonnée relative et du nom » (« order of relative clause and noun ») (WALS Ch. 90). Si à la fois le trait 96 et le trait 83 ou 90 sont présents dans la langue étudiée, alors le trait 83 ou le trait 90 seront représentés deux fois dans la matrice, accentuant leurs poids au détriment des autres. Toutefois, ce problème d’interdépendance demeure limité dans l’ensemble du corpus traité.

  4. La faible résolution typologique : par exemple, dans une phrase, il n’existe que six permutations possibles de l’ordre du sujet, de l’objet et du verbe, soit six arrangements possibles de trois éléments, ce qui augmente les risques d’une ressemblance accidentelle entre deux langues. Néanmoins, l’agrégation de nombreux traits compense partiellement ce biais.

  5. Le problème de la diversité géographique : la combinaison de traits issus d’aires linguistiques très différentes produit des signaux contradictoires, réduisant la robustesse des regroupements.

  6. L’insuffisance de l’indice de rétention seul pour juger de la qualité d’un arbre : cet indice mesure uniquement la cohérence verticale d’un signal, mais non la robustesse topologique ou la validité historique de l’arbre.

  7. L’arbre enraciné par la branche la plus longue : il s’agit d’une méthode heuristique non calibrée qui peut conduire à surinterpréter l’ancienneté supposée du taxon. Une longue branche ne garantit pas nécessairement l’antériorité, surtout si les taux d’évolution varient.

23Malgré cela, et bien que cette approche soit un premier essai publié dans une revue non spécialisée et ne permettant qu’une présentation très sommaire (Journal of Brief Ideas), elle constitue une tentative pionnière de modélisation phylogénétique globale fondée sur des données typologiques, avec filtrage explicite des langues instables.

« Inferring the World Tree of Languages from Word Lists » (Jäger et Wichmann 2016)

Corpus et protocole

24L’étude menée par Jäger et Wichmann, dont l’on trouve la méthode plus amplement expliquée dans Jäger 2018, représente une tentative ambitieuse d’établir un arbre phylogénétique mondial des langues à partir de données lexicales minimales mais systématiques. Le corpus utilisé est issu de la base de données ASJP (Automated Similarity Judgment Program), qui compile des listes de 40 concepts lexicaux considérés comme stables (par exemple : « eau », « feu », « main ») pour plus de 6 000 langues et dialectes. Ces mots sont transcrits dans une phonétique standardisée, propre à la base, ce qui permet d’appliquer des outils d’analyse automatique à grande échelle.

25Contrairement aux approches fondées sur des jugements d’experts ou des classifications préexistantes, la méthode employée pour établir cet arbre global repose exclusivement sur des mesures de similarité phonétique. Deux types de distances ont été utilisés :

  • La pointwise mutual information (PMI), qui mesure le degré d’association entre des phonèmes alignés dans les mots de deux langues. Cette méthode pondère les alignements par leur plausibilité phonétique, produisant ainsi des comparaisons plus fines qu’une simple distance d’édition.

  • La distance de Jaccard appliquée aux bigrammes phonétiques, qui mesure la proportion de bigrammes communs entre les lexiques comparés, donnant un aperçu de la structure sonore globale des langues.

26La combinaison de ces distances vise à contourner certaines limites de la méthode de Levenshtein.

27L’arbre final (figure 4) est généré à l’aide d’un algorithme de réduction minimale de la variance (minimum variance reduction).

Figure 4. Arbre mondial des langues créé par Jäger et Wichmann

Figure 4. Arbre mondial des langues créé par Jäger et Wichmann

Jäger et Wichmann 2016 · https://profgerhard.de/​sfs/​slides/​slidesTorunWorldtree.pdf · image reproduite avec l’aimable autorisation de Gerhard Jäger

Principaux résultats

28L’arbre obtenu reflète largement les familles linguistiques établies, avec des F-scores (voir le glossaire, encadré 1) supérieurs à 0,95 pour 40 des 52 familles identifiées par WALS. Cette validation interne témoigne de la capacité de l’algorithme à reproduire des regroupements connus, mais ne garantit pas la robustesse des structures plus profondes.

29Au-delà des familles linguistiques, l’analyse suggère quatre grands ensembles géo-généalogiques, dont certains peu attendus :

  1. un bloc Afrique + Eurasie occidentale et nordique, englobant les langues afro-asiatiques, indo-européennes, ouraliennes, altaïques et caucasiennes

  2. un groupe Asie du Sud-Est + Pacifique, où se retrouvent les langues austro-asiatiques, austronésiennes, hmong-mien, sino-tibétaines, timor-alor-pantar et taï-kadaï

  3. un ensemble Amérique, comprenant notamment les langues na-dené, salish, pénutiennes et les autres familles du continent

  4. un groupe Sahul rassemblant les langues australiennes et papoues

  • 3 Il est à noter que les Inuits modernes viennent d’un flux migratoire datant d’environ 4 000 à 6 000 (...)

30Certaines configurations surprenantes sont également observées, comme une proximité apparente entre les langues eskimo-aléoutes et tchouktches-kamtchadales, que les auteurs interprètent par un possible effet de contacts anciens et répétés dans la région circumpolaire3, ou entre les langues dravidiennes et indo-iraniennes.

31À l’inverse, des contacts historiques bien documentés – comme entre les langues papoues et austronésiennes – ne laissent aucune trace significative dans l’arbre, probablement parce qu’ils sont trop récents pour affecter profondément le lexique stable utilisé ici.

Évaluation critique

32Tout comme pour d’Huy (2015), la principale force de cette approche réside dans son automatisation intégrale et son absence d’a priori : aucune hypothèse sur les parentés ou les classifications ne vient biaiser l’analyse. Cela permet de tester les regroupements traditionnels à la lumière de critères formels.

33Cependant, plusieurs limites importantes doivent être soulignées.

  1. Le faible nombre de concepts (40) est insuffisant pour soutenir des inférences robustes sur de fortes profondeurs historiques. Le choix de ces concepts repose sur leur stabilité supposée à travers le temps et les cultures, mais leur nombre relativement faible limite fortement la résolution de l’analyse phylogénétique et reste bien en deçà des standards nécessaires pour une comparaison historique fiable, où 100 à 200 concepts sont un minimum recommandé. La variabilité interlinguistique sur si peu d’items génère une instabilité méthodologique bien connue dans les approches glottochronologiques.

  2. La standardisation phonétique ne rend pas compte des subtilités phonologiques spécifiques à chaque langue, ce qui peut introduire des artéfacts, notamment l’absence de distinction entre cognats et emprunts, donc d’identification rigoureuse de la parenté. De plus, l’absence de contrôle morphologique peut conduire à ne pas prendre en compte des affixes, des racines ou des règles phonologiques spécifiques.

  3. La méthode de distance – même si elle évite la Levenshtein brute – ne permet pas de distinguer clairement entre emprunts, convergences, héritage commun ou coïncidences, et peut les amalgamer. L’emploi de la distance de Jaccard pour analyser la proximité des bigrammes repose notamment sur une simple similarité phonologique : or les faits phonotactiques peuvent être influencés par des phénomènes de convergence ou de diffusion régionale. Par ailleurs, aucune validation externe par des simulations ou des données indépendantes n’est fournie.

  4. La pondération arbitraire entre lexique et phonologie peut conduire à une surévaluation des similarités phonologiques à grande échelle et à la production de regroupements géographiques plausibles mais trompeurs.

  5. L’héritage de la glottochronologie dans le choix des concepts stables, hérités des listes Swadesh, pose la question de la validité d’une hypothèse implicite : l’homogénéité du taux de changement lexical, qui n’est pas discuté ni modélisé ici, peut varier fortement selon les aires linguistiques. Or, de nombreux travaux (par exemple, Pagel, Atkinson et Meade 2007 ; Holman et al. 2008) ont montré la grande variabilité des vitesses d’évolution lexicale, ce qui biaise fortement les reconstructions. L’algorithme neighbour-joining, utilisé ici pour produire l’arbre final, repose sur la similarité globale et ignore des variations de taux d’évolution d’un mot à l’autre.

  6. L’arbre obtenu n’est pas comparé à d’autres arbres obtenus sur le même corpus avec d’autres méthodes (par exemple, bayésiennes ou maximum de vraisemblance), ce qui aurait permis de tester la robustesse topologique des résultats obtenus.

  7. Les biais introduits par les emprunts ou les convergences phonétiques locales ne sont pas discutés. L’arbre n’intègre pas de réseau réticulé, ce qui empêche de modéliser explicitement les zones de contact.

34En résumé, bien que cette étude soit précieuse par son ampleur et sa tentative de modélisation, elle souffre d’un déficit de réflexivité méthodologique. Elle ne précise pas dans quelle mesure ses résultats sont comparables à ceux d’autres approches, ni les limites de son modèle. Le manque de clarté sur la finalité (cartographie des similarités ou reconstruction phylogénétique) brouille la lecture de l’ensemble.

« Global language diversification is linked to socio-ecology and threat status » (Bouckaert et al. 2022)

  • 4 Skirgård et al. (2023) ont utilisé cet arbre pour évaluer les effets de la phylogénie sur les trait (...)

35Bien que le working paper de Bouckaert et al. (2022) n’ait pas pour objectif principal de tester une hypothèse phylogénétique, l’arbre global qu’il propose est largement utilisé comme structure de référence dans des études évaluées par les pairs. Il a ainsi servi de base à des reconstructions syntaxiques (Skirgård et al. 20234), pour modéliser la complexité grammaticale des langues dans une perspective comparative à grande échelle (Shcherbakova et al. 2023), ou encore a été employé pour reconstruire l’ordre ancestral des numéraux dans les langues humaines et étudier la co-évolution syntaxique avec l’ordre des adjectifs (Her et al. 2024) ainsi que pour tester des « universaux » grammaticaux, soit des contraintes durables sur l’évolution des grammaires humaines (Verkerk et al. 2025). Ces usages supposent que la topologie de l’arbre est considérée comme suffisamment fiable pour appuyer des analyses linguistiques profondes. Son inclusion dans l’article se justifie ainsi par son rôle actif dans la recherche actuelle, où il fonctionne de facto comme un outil phylogénétique.

Corpus et protocole

36L’étude de Bouckaert et al. (2022) se distingue des précédentes par l’ampleur de son corpus (plus de 6 600 langues) et par son inclusion de dimensions géographiques, typologiques et cognatiques dans une approche bayésienne formellement structurée. L’objectif est double : reconstituer un arbre phylogénétique global et modéliser les dynamiques de diversification linguistique à l’échelle planétaire.

37Le corpus est dérivé de Glottolog 4.01, avec exclusion des langues pidgins et créoles, des langues mortes, des langues artificielles et des catégories peu informatives. Les langues conservées ont été enrichies à partir de multiples bases de données, intégrant des traits grammaticaux, lexicaux et cognats lorsque ceux-ci étaient disponibles.

38Pour construire la phylogénie mondiale, les auteurs ont eu recours à une méthode d’inférence bayésienne, fondée sur des méthodes de Monte-Carlo par chaînes de Markov, à l’aide du logiciel BEAST 2. Cette méthode permet d’explorer les configurations d’arbre compatibles avec les données et de produire un ensemble d’arbres représentatifs des probabilités postérieures. L’analyse s’appuie sur plusieurs sources d’information : les classifications internes aux familles linguistiques, les coordonnées géographiques des langues, des données archéologiques, historiques et linguistiques sur l’âge des familles, ainsi que les résultats d’analyses bayésiennes antérieures de sous-ensembles.

39En raison de la taille immense de l’arbre à modéliser, Bouckaert et al. ont adopté une stratégie en deux temps. D’abord, ils ont construit un arbre échantillonné global, intégrant des représentants des 27 plus grandes familles linguistiques. Cette première structure a permis d’estimer la topologie globale, c’est-à-dire l’ordre d’embranchement entre les grandes familles. Puis chaque famille a été analysée séparément dans une modélisation indépendante, incluant l’ensemble de ses langues. L’arbre a ainsi été divisé en 30 ensembles monophylétiques (27 familles + 3 macroclades géographiques : Amérique, Sahul et le reste du monde). Ces sous-arbres familiaux ont été ensuite greffés à leur place respective dans l’arbre global, selon la topologie estimée lors de l’analyse échantillonnée. Ce processus a permis de réduire le temps de calcul tout en conservant la cohérence de l’ensemble, aboutissant à un arbre complet cohérent englobant 6 635 langues.

40La construction de l’arbre a été encadrée par des contraintes phylogénétiques strictes : chaque famille devait rester monophylétique et respecter un âge minimum d’origine. Des données géographiques et archéologiques ont été utilisées pour fixer des bornes chronologiques sur certaines branches profondes de l’arbre, notamment pour les langues de Sahul et des Amériques. Le modèle de diversification utilisé (multi-Yule) permettait d’ajuster les taux de diversification selon les familles, tout en conservant une structure temporelle réaliste.

41La géographie a été intégrée au modèle à travers une diffusion sphérique, simulant la propagation des langues dans l’espace terrestre. Cette dimension permet de pondérer les taux de diversification linguistique en fonction de facteurs comme la dispersion, l’isolement ou l’urbanisation.

42L’ensemble du processus a permis de produire un jeu de 901 arbres postérieurs, chacun représentant une version plausible de la phylogénie mondiale. Ces arbres ont ensuite servi de base à l’analyse des taux de diversification, de l’isolement évolutif des langues et des risques d’extinction linguistique, qui était l’objectif de l’article.

Principaux résultats

43L’arbre de crédibilité maximale issu de cette analyse permet d’identifier plusieurs clades profonds, parmi lesquels trois grands ensembles se démarquent nettement :

  1. un groupe afro-asiatique/indo-européen

  2. un bloc australo-amérindien, regroupant les langues papoues, australiennes et amérindiennes

  3. un ensemble orientalo-austrique, englobant les langues austro-asiatiques, austronésiennes, ouraliennes et tibéto-birmanes

44Ces regroupements correspondent en partie aux clusters obtenus par d’Huy (2015) et Jäger et Wichmann (2016), malgré les divergences de méthode.

Évaluation critique

45L’étude de Bouckaert et al. offre le cadre le plus global et le plus complet à ce jour pour une modélisation phylogénétique des langues du monde. Elle repose sur une infrastructure computationnelle robuste, une combinaison des bases de données et des hypothèses testables sur les modèles de diversification.

46Cependant, cette étude souffre de plusieurs limites méthodologiques et empiriques.

  1. La non-publication complète des données de codage empêche toute reproduction exhaustive de l’analyse.

  2. Certaines sources intégrées à la base, notamment Bouckaert et al. (2012), ont été critiquées pour leurs hypothèses contestées sur l’origine des langues indo-européennes, concernant en particulier la structure des arbres phylogénétiques obtenus (cf. Pereltsvaig et Lewis 2015). Par ailleurs, bien que les auteurs utilisent des partitions lexicales, la granularité du traitement morphologique reste opaque.

  3. La complexité algorithmique et le partitionnement en sous-analyses introduisent des incertitudes sur la convergence globale des résultats.

  4. Le système contraint l’arbre selon des hypothèses préalables (monophylie des familles, diffusion spatiale). Les arbres sont partiellement forcés à refléter les classifications existantes ; ils valident un a priori plus qu’ils ne le testent.

  5. La proximité spatiale est un facteur dans le modèle, ce qui peut créer un biais vers la continuité géographique plutôt qu’une parenté réelle.

  6. L’enracinement africain de l’arbre est fixé à titre d’hypothèse ; il oriente les inférences au lieu de faire émerger des données.

  7. Enfin, les calibrations temporelles importées peuvent refléter les biais des sources archéologiques et non les données linguistiques elles-mêmes.

47Malgré ces limites, l’étude constitue une avancée très importante vers une phylogénie globale, articulant les dimensions linguistiques, géographiques et historiques dans un cadre probabiliste rigoureux.

Analyse comparée des résultats

Corpus et discussion préliminaire

48Avant d’aborder les études, il convient de préciser que toutes les méthodes discutées ici reposent sur le présupposé de la parenté. Elles n’ont pas pour vocation de tester cette parenté mais de la modéliser sous forme d’arbre ou de réseau. En linguistique historique, la parenté est établie en identifiant des traits linguistiques partagés qui ne peuvent raisonnablement être attribués au hasard ou au contact, mais à un héritage commun. C’est pourquoi le lexique et la morphologie sont généralement privilégiés, car ils sont réputés moins susceptibles d’être influencés par des facteurs externes. Les traits structurels, bien qu’ils puissent contenir un signal phylogénétique, sont souvent considérés comme moins fiables pour inférer des arbres linguistiques, ainsi que le soulignent Hartmann et Walkden (2024) dans leur étude sur le signal phylogénétique des données syntaxiques.

49Cependant, Dunn et al. (2005) ont mis en évidence, à travers une analyse phylogénétique des structures grammaticales présentes dans les langues papoues, que des connexions historiques significatives pouvaient remonter à plus de 10 000 ans. Reesink, Singer et Dunn (2009) ont également utilisé des données structurales pour classifier les langues du supercontinent Sahul, atteignant des profondeurs historiques similaires, voire plus anciennes. Enfin, Matsumae et al. (2021), analysant les liens entre la variation génétique et culturelle dans les familles de langues de l’Asie du Nord-Est, ont montré que la grammaire présente la corrélation la plus forte avec la génétique, suggérant qu’elle pourrait être un bon indicateur de l’histoire de ces populations. En revanche, le lexique ne révèle des relations qu’au sein des familles de langues et n’établit pas de liens entre elles. Quant à la musique et la phonologie, elles n’affichent pas de corrélation significative avec la génétique. Polyakov, Makarova et Solovyev (2022) ont obtenu des résultats similaires par l’étude d’un corpus de langues diverses, montrant comment un arbre phylogénétique construit à partir de données typologiques reflète bien les relations généalogiques entre les langues à de grands intervalles de temps, à la différence d’un arbre construit à partir de données lexicales, qui représente mieux la généalogie sur des périodes plus récentes. Toutefois, Greenhill et al. (2017) ont démontré que certains traits grammaticaux sont en réalité très instables, souvent influencés par les contacts. Se fondant sur l’analyse de 81 langues du Pacifique, cette équipe a mis en évidence que les traits grammaticaux changent généralement plus vite et sont plus sujets à des influences externes (comme le contact entre langues) que le vocabulaire de base. Cependant, les chercheurs ont noté que certains éléments de ces deux sous-systèmes restent stables dans le temps et qu’une modélisation plus fine des variations entre les sous-systèmes linguistiques pourrait aider à mieux comprendre l’évolution des langues et à remonter dans leur histoire plus profondément qu’on ne le fait actuellement.

50L’ensemble de ces résultats suggère donc qu’au moins certains traits structuraux des langues changent très lentement, à raison d’un par plusieurs centaines d’années, permettant ainsi de franchir les limites temporelles où les cognats ne sont plus utilisables pour établir des liens généalogiques (voir aussi Dunn et al. 2008 ; Levinson et al. 2011).

Structure arborée et cohérence interne

Critère

d’Huy (2015)

Jäger et Wichmann (2016)

Bouckaert et al. (2022)

Type d’arbre

MrBayes + distance +
Neighbor-Net

Distance +
clustering

Arbre MCMC (BEAST 2)

Conflits de signal

par Neighbor-Net

Non représentés

Seulement arbre consensuel

Robustesse des nœuds

IR = 0,75
(assez fort)

F-score = 0,95
(sur familles)

Bootstrap non
détaillé

Présence de réseaux secondaires

Réseau visible

Non représentés

Graphe unique par consensus

Homogénéité des clusters

Bonne

Bonne, selon
l’algorithme

Forte (mais partiellement contrainte)

51d’Huy met en avant les conflits par réseau ; Jäger produit un arbre par distance, sans représentation des conflits ; Bouckaert propose un arbre bayésien robuste mais contraint. D’un point de vue formel, seul d’Huy explicite les zones d’instabilité.

Scénarios de diffusion spatiale

Trajectoire majeure

d’Huy

Jäger et Wichmann

Bouckaert et al.

Origine africaine

Enracinement sur la branche la plus longue

Distances
croissantes

Imposée

Vague d’Eurasie continentale

Fort soutien

Eurasie groupée

Fort soutien

Vague austrique (Asie du SE)

Austro-asiatique + Austronésien

Proches

Soutenue

Expansion papoue-australienne

Périphérie Australie

En cluster bas

Bloc Trans-Nouvelle-Guinée

Vagues vers les Amériques

Rattachées à l’Eurasie

Rattachées à l’Eurasie et aux langues papoues

Trans-Nouvelle-Guinée vers Amérique

52Malgré des corpus, des méthodologies et des paradigmes épistémologiques très différents, les trois tentatives récentes de reconstitution d’un arbre linguistique global convergent sur plusieurs points.

53Ces trois approches enracinent explicitement ou implicitement l’histoire des langues humaines en Afrique. Cette origine commune, suggérée dès l’arbre bayésien de d’Huy, confirmée par les enracinements lexicaux chez Jäger et Wichmann et modélisée formellement par Bouckaert et al., renforce l’hypothèse d’une co-évolution entre migration humaine et diversification linguistique à partir du continent africain, suivant en cela une hypothèse proposée par Cavalli-Sforza (Cavalli-Sforza et al. 1988 ; Cavalli-Sforza 1991). La divergence entre les langues d’Afrique et les autres ensembles linguistiques est marquée dans les trois modèles.

54Significativement, les trois publications mettent en évidence des regroupements interfamiliaux très semblables, qui paraissent constituer des clades profonds au-delà des familles traditionnelles. C’est notamment le cas du regroupement de langues en Asie du Sud-Est, incluant notamment les langues austro-asiatiques et austronésiennes, que l’on retrouve dans les trois arbres, auxquelles s’ajoutent parfois les langues thaï-kadai. Retrouvé à partir de données très différentes – typologiques pour d’Huy, lexicales pour Jäger et Wichmann et mixtes pour Bouckaert –, cet ensemble renforce l’idée d’un substrat commun ou d’une diffusion ancienne dans le Sud-Est asiatique et confirme l’intérêt de revisiter la superfamille austrique, rassemblant notamment les langues austro-asiatiques et austronésiennes (Schmidt 1906 ; Reid 1994 ; 1999 ; Blust 2009). Par ailleurs, dans d’Huy 2015, la proximité de quatre langues malayo-polynésiennes (l’indonésien, le taba, le lenakel et le pohnpei) d’une part, et des langues austro-asiatiques d’autre part, peut s’expliquer par un substrat commun. En effet, les langues appartenant à l’aire malayo-polynésienne ont été fortement influencées par les langues papoues, soit par substrat, soit par contact. On peut notamment citer l’apparition de traits tels que la structure d’actance de type actif-statif (Donohue 2004), l’utilisation fréquente de la sérialisation des verbes et de nombreux changements dans l’ordre des mots (Donohue 2007) ou encore le genre neutre ou l’émergence des bases non décimales (pour d’autres exemples, voir par exemple, Schapper 2015 ; Edwards et Grimes 2021). Il est intéressant de noter que l’ensemble austronésien semble également divisé en deux parties dans l’arbre phylogénétique de Cavalli-Sforza et al. (1988).

55Un second clade profond émerge dans les résultats de Jäger et Wichmann, et de Bouckaert, réunissant les langues australiennes, papoues et amérindiennes. Cette connexion, également observée en mythologie comparée (Berezkin 2013 ; d’Huy 2020, 2023 ; Le Quellec 2021 ; 2022), suggère une relation ancienne, potentiellement paléolithique, entre ces deux régions. Cependant, les mécanismes de cette proximité (diffusion, héritage commun, convergence) restent incertains. Dans d’Huy (2015), l’analyse en réseau place les langues amérindiennes à la frontière entre l’Eurasie continentale et les aires austro-asiatique et austronésienne. Cette position intermédiaire pourrait refléter une double origine des langues amérindiennes, hypothèse compatible avec les modèles de colonisation du Nouveau Monde par vagues successives (Nichols 1994) et les données issues de la mythologie comparée (voir références supra).

56Par ailleurs, les langues eurasiatiques – notamment indo-européennes, dravidiennes, altaïques et ouraliennes – tendent à former un bloc relativement homogène dans d’Huy, ainsi que dans Jäger et Wichmann, suggérant une possible convergence évolutive ou une homogénéisation secondaire liée à des dynamiques postglaciaires (Nichols 1992). Là encore, la convergence entre résultats lexicaux et typologiques est remarquable et semble partiellement compatible avec les hypothèses nostratique ou eurasiatique (Pedersen 1903 ; Greenberg 2000 ; Mallory et Adams 2006). Cependant, les langues indo-européennes ne sont pas toujours liées aux autres langues d’Europe continentale (Bouckaert et al.). Les résultats divergent également sur le positionnement des langues afro-asiatiques, parfois rattachées aux autres langues eurasiatiques (Jäger et Wichmann ; Bouckaert et al.) et parfois plus isolées, tout en demeurant à proche distance (d’Huy). Les langues nakho-daghestaniennes n’apparaissent clairement situées dans aucun regroupement, soulevant la question de leur position généalogique réelle. Enfin, il faut rappeler que les hypothèses nostratiques, eurasiatiques et austriques sont aujourd’hui largement abandonnées, car elles se sont révélées stériles et n’ont pas permis de mieux comprendre l’histoire des langues concernées.

57Cependant, si les trois études divergent dans leurs méthodes de traitement des données (filtrage des langues hybrides chez d’Huy, distance phonétique pondérée chez Jäger et Wichmann, modélisation intégrée chez Bouckaert et al.), elles tendent à converger vers une structuration cohérente en macroclades, reflétant à la fois des dynamiques de filiation et des effets de contact ou de diffusion géographique.

58Ces convergences soulignent la robustesse de certains signaux phylogénétiques globaux, dès lors que des précautions sont prises pour limiter les biais (emprunts, hybridation, dépendances typologiques). Elles plaident pour un modèle cohésif, combinant typologie, lexique, géographie et modélisation probabiliste, afin de capter la complexité diachronique des langues humaines.

Arbres et migrations

59Dans un article célèbre, Cavalli-Sforza et ses collègues (1988) ont examiné l’évolution humaine à l’aune des données génétiques, archéologiques et linguistiques disponibles en leur temps. Pour ce faire, ils ont analysé les fréquences génétiques de 42 populations mondiales pour construire un arbre phylogénétique des populations humaines. Celui-ci s’est révélé cohérent avec les données archéologiques et a montré l’existence d’une corrélation partielle entre gènes et langues, suggérant une co-évolution. Diverses études viennent appuyer ce parallélisme, montrant que les langues peuvent se diffuser, au moins en partie, en même temps que les gènes (voir par exemple, Forster et Renfrew 2011 ; Sun et al. 2013 ; Creanza et al. 2015 ; Longobardi et al. 2015 ; Baker, Rotimi et Shriner 2017 ; Matsumae et al. 2021). Ce constat est d’importance, puisqu’il permettrait d’interpréter et d’articuler les ensembles et les macroclades putatifs mis en évidence plus haut.

60Ainsi, si les figures des trois articles ne racontent pas exactement la même histoire, elles paraissent partager des structures profondes. Cela suggère qu’un signal historique survit à travers les couches de bruit (contacts, convergence, pertes), mais qu’aucune méthode seule ne peut le restituer entièrement.

61En comparant la totalité des résultats obtenus à partir des trois études, il est alors possible de proposer une propagation des langues cohérentes avec les migrations humaines. Depuis l’Afrique, les langues se seraient diffusées le long des côtes du Pacifique en Asie du Sud et du Sud-Est, puis dans le Sahul d’une part, vers les Amériques d’autre part. Une autre vague linguistique se serait propagée plus au nord, de l’Eurasie, peut-être depuis le sud-ouest ou le sud de l’Asie, et serait à l’origine d’une nouvelle diffusion limitée à l’Amérique du Nord, également décelable dans les études de génétique et de mythologie comparée (voir d’Huy 2023, pour une synthèse).

Conclusion : pour une modélisation critique et globale

62Aucune des trois études ne prétend prouver une parenté globale. L’arbre est ici une heuristique : il suggère des proximités, des trajets de diffusion possibles, mais ne remplace pas la démonstration comparatiste. À ce titre, l’intérêt des modèles phylogénétiques est réel mais ils doivent être mobilisés de façon réflexive, avec une conscience des limites des données, des biais des méthodes et des enjeux épistémologiques.

63Les big data et la linguistique computationnelle permettent d’explorer des hypothèses anciennes sous un jour nouveau. Toutefois, la construction d’un arbre mondial ne peut ignorer les limites du matériel (stabilité des traits), des outils (sensibilité des algorithmes) et des postulats (monophylie implicite). Une modélisation réellement informée devrait combiner approches arborescentes et réticulées, incorporer l’incertitude à travers des arbres postérieurs (Bayes) et articuler données linguistiques, génétiques, archéologiques et culturelles (notamment mythologiques) dans un cadre évolutionnaire commun.

64Ainsi pensée, la phylogénie mondiale ne devient pas une vérité révélée mais un outil parmi d’autres pour comprendre la complexité de l’évolution linguistique humaine.

Remerciements. Je souhaiterais remercier ici Gerhard Jäger pour nos échanges ainsi que les deux relecteurs de cet article, dont les remarques ont fortement contribué à améliorer l’ensemble du texte.

Haut de page

Bibliographie

Baker, Jennifer L., Charles N. Rotimi et Daniel Shriner. 2017. « Human Ancestry Correlates With Language and Reveals That Race Is Not an Objective Genomic Classifier ». Scientific Reports 7 : 1572. https://doi.org/10.1038/s41598-017-01837-7.

Berezkin, Yuri. 2013. Afrika, migracii, mifologija. Arealyrasprostranenija fol’klornyx motivov v istoričeskoj perspektive. Saint-Pétersbourg : Nauka.

Blust, Robert A. 2009. The Austronesian Languages. Canberra : Australian National University.

Bouckaert, Remco, Philippe Lemey, Michael Dunn, Simon J. Greenhill, Alexander V. Alekseyenko, Alexei J. Drummond, Russell D. Gray, Marc A. Suchard et Quentin D. Atkinson. 2012. « Mapping the Origins and Expansion of the Indo-European Language Family ». Science 337 (6097) : 957-960. https://doi.org/10.1126/science.1219669.

Bouckaert, Remco, David Redding, Oliver Sheehan, Thanos Kyritsis, Russell Gray, Kate E. Jones et Quentin Atkinson. 2022. « Global Language Diversification Is Linked to Socio-Ecology and Threat Status ». Working Paper. SocArXiv. https://doi.org/10.31235/osf.io/f8tr6.

Bowern, Claire. 2012. « The Riddle of Tasmanian Languages ». Proceedings of the Royal Society B : Biological Sciences 279 (1747) : 4590-4595. https://doi.org/10.1098/rspb.2012.1842.

Bowern, Claire et Quentin Atkinson. 2012. « Computational Phylogenetics and the Internal Structure of Pama-Nyungan ». Language 88 (4) : 817-845. http://www.jstor.org/stable/23357554.

Bryant, David et Vincent Moulton. 2004. « Neighbor-Net : an Agglomerative Method for the Construction of Phylogenetic Networks ». Molecular Biology and Evolution 21 (2) : 255-265. https://doi.org/10.1093/molbev/msh018.

Campbell, Lyle. 2004. Historical Linguistics. An Introduction. Cambridge : MIT Press.

Cavalli-Sforza, Luigi Luca. 1991. « Genes, Peoples and Languages ». Scientific American 265 (5) : 104-111. https://www.jstor.org/stable/24938803.

Cavalli-Sforza, Luigi Luca, Alberto Piazza, Paolo Menozzi et Joanna Mountain. 1988. « Reconstruction of Human Evolution : Bringing Together Genetic, Archaeological, and Linguistic Data ». Proceedings of the National Academy of Sciences of the United States of America 85 (16) : 6002-6006. https://doi.org/10.1073/pnas.85.16.6002.

Creanza, Nicole, Merritt Ruhlen, Trevor J. Pemberton, Noah A. Rosenberg, Marcus W. Feldman et Sohini Ramachandran. 2015. « A Comparison of Worldwide Phonemic and Genetic Variation in Human Populations ». Proceedings of the National Academy of Sciences 112 (5) : 1265-1272. https://doi.org/10.1073/pnas.1424033112.

Currie, Thomas E., Simon J. Greenhill, Russell D. Gray, Toshikazu Hasegawa et Ruth Mace. 2010. « Rise and Fall of Political Complexity in Island South-East Asia and the Pacific ». Nature 467 (7317) : 801-804. https://doi.org/10.1038/nature09461.

Currie, Thomas E., Andrew Meade, Myrtille Guillon et Ruth Mace. 2013. « Cultural Phylogeography of the Bantu Languages of Sub-Saharan Africa ». Proceedings of the Royal Society B : Biological Sciences 280 (1762) : 20130695. https://doi.org/10.1098/rspb.2013.0695.

Dediu, Dan. 2011. « A Bayesian Phylogenetic Approach to Estimating the Stability of Linguistic Features and the Genetic Biasing of Tone ». Proceedings of the Royal Society of London B : Biological Sciences 278 (1704) : 474-479. https://doi.org/10.1098/rspb.2010.1595.

Donohue, Mark. 2004. « Typology and Linguistic Areas ». Oceanic Linguistics 43 (1) : 221-239. https://www.jstor.org/stable/3623382.

Donohue, Mark. 2007. « Word Order in Austronesian From North to South and West to East ». Linguistic Typology 11 (2) : 349-391. https://doi.org/10.1515/LINGTY.2007.026.

Dryer, Matthew S. et Martin Haspelmath, éd. 2013. « The World Atlas of Language Structures Online (v2020.4) ». Zenodo. https://doi.org/10.5281/zenodo.13950591.

Dunn, Michael, Stephen C. Levinson, Eva Lindström, Ger Reesink et Angela Terrill. 2008. « Structural Phylogeny in Historical Linguistics : Methodological Explorations Applied in Island Melanesia ». Language 84 (4) : 710-759. https://www.jstor.org/stable/40071101.

Dunn, Michael, Angela Terrill, Ger Reesink, Robert A. Foley et Stephen C. Levinson. 2005. « Structural Phylogenetics and the Reconstruction of Ancient Language History ». Science 309 (5743) : 2072-2075. https://doi.org/10.1126/science.1114615.

Earl, Dent A. et Bridgett M. vonHoldt. 2012. « STRUCTURE HARVESTER : a Website and Program for Visualizing STRUCTURE Output and Implementing the Evanno Method ». Conservation Genetics Resources 4 (2) : 359-361. https://doi.org/10.1007/s12686-011-9548-7.

Eco, Umberto. 1994. La Recherche de la langue parfaite dans la culture européenne. Paris : Le Seuil.

Edwards, Owen et Charles Grimes. 2021. « Revising the Classification of the Austronesian Languages of Eastern Indonesia and Timor-Leste ». Dans 15th International Conference on Austronesian Linguistics (ICAL-15). Book of Abstracts. June 28 to July 2, 38-39. Olomouc : Palacký University.

Evanno, Guillaume, Sebastien Regnaut et Jérôme Goudet. 2005. « Detecting the Number of Clusters of Individuals Using the Software STRUCTURE : a Simulation Study ». Molecular Ecology 14 (8) : 2611-2620. https://doi.org/10.1111/j.1365-294X.2005.02553.x.

Falush, Daniel, Matthew Stephens et Jonathan K. Pritchard. 2003. « Inference of Population Structure Using Multilocus Genotype Data : Linked Loci and Correlated Allele Frequencies ». Genetics 164 (4) : 1567-1587. https://doi.org/10.1093/genetics/164.4.1567.

Flegontov, Pavel, N. Ezgi Altınışık, Piya Changmai, Nadin Rohland, Swapan Mallick, Nicole Adamski, Deborah A. Bolnick, Nasreen Broomandkhoshbacht, Francesca Candilio, Brendan J. Culleton, et al. 2019. « Palaeo-Eskimo Genetic Ancestry and the Peopling of Chukotka and North America ». Nature 570 (7760) : 236-240. https://doi.org/10.1038/s41586-019-1251-y.

Forster, Peter et Colin Renfrew. 2011. « Mother Tongue and Y Chromosomes ». Science 333 (6048) : 1390-1391. https://doi.org/10.1126/science.1205331.

Fortunato, Laura et Fiona Jordan. 2010. « Your place or Mine ? A Phylogenetic Comparative Analysis of Marital Residence in Indo-European and Austronesian Societies ». Philosophical Transactions of the Royal Society B : Biological Sciences 365 (1559) : 3913-3922. https://doi.org/10.1098/rstb.2010.0017.

Gray, Russell D., Alexei J. Drummond et Simon J. Greenhill. 2009. « Language Phylogenies Reveal Expansion Pulses and Pauses in Pacific Settlement ». Science 323 (5913) : 479-483. https://doi.org/10.1126/science.1166858.

Greenberg, Joseph Harold. 2002. Indo-European and Its Closest Relatives. The Eurasiatic Language Family. Stanford : Stanford University Press.

Greenhill, Simon. 2015. « Evolution and Language : Phylogenetic Analyses ». Dans International Encyclopedia of the Social and Behavioral Sciences, 2e éd., édité par James D. Wright, 370-377. Oxford : Elsevier. https://doi.org/10.1016/B978-0-08-097086-8.81035-1.

Greenhill, Simon J., Chieh-Hsi Wu, Xia Hua, Michael Dunn, Stephen C. Levinson et Russell D. Gray. 2017. « Evolutionary Dynamics of Language Systems ». Proceedings of the National Academy of Sciences 114 (42) : E8822-E8829. https://doi.org/10.1073/pnas.1700388114.

Hamming, Richard W. 1950. « Error Detecting and Error Correcting Codes ». The Bell System Technical Journal 29 (2) : 147-160. https://doi.org/10.1002/j.1538-7305.1950.tb00463.x.

Hartmann, Frederik et George Walkden. 2024. « The Strength of the Phylogenetic Signal in Syntactic Data ». Glossa : a Journal of General Linguistics 9 (1). https://doi.org/10.16995/glossa.10598.

Heggarty, Paul, Cormac Anderson, Matthew Scarborough, Benedict King, Remco Bouckaert, Lechosław Jocz, Martin Joachim Kümmel, Thomas Jügel, Britta Irslinger, Roland Pooth, et al. 2023. « Language Trees With Sampled Ancestors Support a Hybrid Model for the Origin of Indo-European Languages ». Science 381 (6656) : eabg0818. https://doi.org/10.1126/science.abg0818.

Her, One-Soon, Yung-Ping Liang, Eugene Chan, Hung-Hsin Hsu, Anthony Chi-Pin Hsu et Marc Allassonnière-Tang. 2024. « Early Humans Out of Africa Had Only Base-Initial Numerals ». Humanities and Social Sciences Communications 11 (1) : 1-7. https://doi.org/10.1057/s41599-023-02506-z.

Holden, Clare Janaki. 2002. « Bantu Language Trees Reflect the Spread of Farming Across Sub-Saharan Africa : a Maximum-Parsimony Analysis ». Proceedings of the Royal Society B : Biological Sciences 269 (1493) : 793-799. https://doi.org/10.1098/rspb.2002.1955.

Holman, Eric W., Søren Wichmann, Cecil H. Brown, Viveka Velupillai, André Müller et Dik Bakker. 2008. « Explorations in Automated Language Classification ». Folia Linguistica 42 (3-4) : 331-354. https://doi.org/10.1515/FLIN.2008.331.

Huy, Julien (d’). 2015. « How to Build a Global Tree of All Known Languages ? A Brief Demonstration ». The Journal of Brief Ideas. https://doi.org/10.5281/zenodo.31290.

Huy, Julien (d’). 2020. Cosmogonies. La préhistoire des mythes. Paris : La Découverte.

Huy, Julien (d’). 2023. L’Aube des mythes. Quand les premiers Sapiens parlaient de l’au-delà. Paris : La Découverte.

Jäger, Gerhard. 2018. « Global-Scale Phylogenetic Linguistic Inference from Lexical Resources ». Scientific Data 5 (1) : 180189. https://doi.org/10.1038/sdata.2018.189.

Jäger, Gerhard. 2019. « Computational Historical Linguistics ». Theoretical Linguistics 45 (3-4) : 151-182. https://doi.org/10.1515/tl-2019-0011.

Jäger, Gerhard et Søren Wichmann. 2016. « Inferring the World Tree of Languages From Word Lists ». Dans The Evolution of Language. Proceedings of the 11th International Conference (EVOLANG11), édité par Seán Roberts, Christine Cuskley, Luke McCrohon, Lluís Barceló-Coblijn, Olga Feher et Tessa Verhoef. Hattiesburg : University of Southern Mississippi. http://evolang.org/neworleans/papers/147.html.

Jordan, Fiona M. 2011. « A Phylogenetic Analysis of the Evolution of Austronesian Sibling Terminologies ». Human Biology 83 (2) : 297-321. https://doi.org/10.3378/027.083.0209.

Le Quellec, Jean-Loïc. 2021. Avant nous le Déluge ! L’humanité et ses mythes. Bordeaux : Éditions du Détour.

Le Quellec, Jean-Loïc. 2022. La Caverne originelle. Art, mythes et premières humanités. Paris : La Découverte.

Lee, Sean et Toshikazu Hasegawa. 2011. « Bayesian Phylogenetic Analysis Supports an Agricultural Origin of Japonic Languages ». Proceedings of the Royal Society B : Biological Sciences 278 (1725) : 3662-3669. https://doi.org/10.1098/rspb.2011.0518.

Levinson, Stephen C., Simon J. Greenhill, Russell D. Gray et Michael Dunn. 2011. « Universal Typological Dependencies Should Be Detectable in the History of Language Families ». Linguistic Typology 15 (2) : 509-534. https://doi.org/10.1515/lity.2011.034.

Longobardi, Giuseppe, Silvia Ghirotto, Cristina Guardiano, Francesca Tassi, Andrea Benazzo, Andrea Ceolin et Guido Barbujani. 2015. « Across Language Families : Genome Diversity Mirrors Linguistic Variation Within Europe ». American Journal of Physical Anthropology 157 (4) : 630-640. https://doi.org/10.1002/ajpa.22758.

Mallory, James P. et Douglas Q. Adams. 2006. The Oxford Introduction to Proto-Indo-European and the Proto-Indo-European World. Oxford : Oxford University Press.

Matsumae, Hiromi, Peter Ranacher, Patrick E. Savage, Damián E. Blasi, Thomas E. Currie, Kae Koganebuchi, Nao Nishida, Takehiro Sato, Hideyuki Tanabe, Atsushi Tajima, et al. 2021. « Exploring Correlations in Genetic and Cultural Variation Across Language Families in Northeast Asia ». Science Advances 7 (34) : eabd9223. https://doi.org/10.1126/sciadv.abd9223.

Nichols, Johanna. 1992. Linguistic Diversity in Space and Time. Chicago : University Press of Chicago.

Nichols, Johanna. 1994. « The Spread of Language Around the Pacific Rim ». Evolutionary Anthropology : Issues, News, and Reviews 3 (6) : 206-215. https://doi.org/10.1002/evan.1360030607.

Pagel, Mark, Quentin D. Atkinson et Andrew Meade. 2007. « Frequency of Word-Use Predicts Rates of Lexical Evolution Throughout Indo-European History ». Nature 449 (7163) : 717-720. https://doi.org/10.1038/nature06176.

Pedersen, Holger. 1903. « Türkische Lautgesetze ». Zeitschrift der Deutschen Morgenländischen Gesellschaft 57 (3) : 535-561. https://www.jstor.org/stable/43367070.

Pereltsvaig, Asya et Martin W. Lewis. 2015. The Indo-European Controversy. Facts and Fallacies in Historical Linguistics. Cambridge : Cambridge University Press.

Polyakov, Vladimir N., Elena A. Makarova et Valery D. Solovyev. 2022. « Phylogenetic Trees : Grammar Versus Vocabulary ». Russian Journal of Linguistics 26 (1) : 31-50. https://doi.org/10.22363/2687-0088-26460.

Pritchard, Jonathan K., Matthew Stephens et Peter Donnelly. 2000. « Inference of Population Structure Using Multilocus Genotype Data ». Genetics 155 (2) : 945-959. https://doi.org/10.1093/genetics/155.2.945.

Raghavan, Maanasa, Matthias Steinrücken, Kelley Harris, Stephan Schiffels, Simon Rasmussen, Michael DeGiorgio, Anders Albrechtsen, Cristina Valdiosera, María C. Ávila-Arcos, Anna-Sapfo Malaspinas, et al. 2015. « Genomic evidence for the Pleistocene and recent population history of Native Americans ». Science 349 (6250) : aab3884. https://doi.org/10.1126/science.aab3884.

Reesink, Ger, Ruth Singer et Michael Dunn. 2009. « Explaining the Linguistic Diversity of Sahul Using Population Models ». PLoS Biology 7 (11) : e1000241. https://doi.org/10.1371/journal.pbio.1000241.

Reid, Lawrence A. 1994. « Morphological Evidence for Austric ». Oceanic Linguistics 33 (2) : 323-344. https://doi.org/10.2307/3623132.

Reid, Lawrence A. 1999. « New Linguistic Evidence for the Austric Hypothesis ». Dans Selected Papers from the Eight International Conference on Austronesian Linguistics, édité par Elizabeth Zeitoun et Paul Jen-kuei Li, 5-30. Taipei : Academia Sinica.

Schapper, Antoinette. 2015. « Wallacea, a Linguistic Area ». Archipel. Études interdisciplinaires sur le monde insulindien 90 (octobre) : 99-151. https://doi.org/10.4000/archipel.371.

Schleicher, August. 1853. « O jazyku litevském, zvlástě na slovanskỳ. Čteno v posezení sekcí filologické král. České Společnosti Nauk dne 6. června 1853 ». Časopis Čsekého Museum 27 : 320-334.

Schleicher, August. 1857. Litauische Märchen, Sprichworte, Rätsel und Lieder. Weimar : Hermann Böhlau.

Schleicher, August. 1863. Die Darwinsche Theorie und die Sprachwissenschaft. Weimar : Hermann Böhlau.

Schmidt, Johannes. 1872. Die Verwantschaftsverhältnisse der Indogermanischen Sprachen. Weimar : Hermann Böhlau. http://archive.org/details/dieverwantschaf04schmgoog.

Schmidt, Wilhelm. 1906. Die Mon-Khmer-Völker. Ein Bindeglied Zwischen Völkern Zentralasiens und Austronesiens. Braunschweig : F. Vieweg und Sohn.

Shcherbakova, Olena, Susanne Maria Michaelis, Hannah J. Haynie, Sam Passmore, Volker Gast, Russell D. Gray, Simon J. Greenhill, Damián E. Blasi et Hedvig Skirgård. 2023. « Societies of Strangers Do Not Speak Less Complex Languages ». Science Advances 9 (33) : eadf7704. https://doi.org/10.1126/sciadv.adf7704.

Skirgård, Hedvig, Hannah J. Haynie, Damián E. Blasi, Harald Hammarström, Jeremy Collins, Jay J. Latarche, Jakob Lesage, Tobias Weber, Alena Witzlack-Makarevich, Sam Passmore, et al. 2023. « Grambank Reveals the Importance of Genealogical Constraints on Linguistic Diversity and Highlights the Impact of Language Loss ». Science Advances 9 (16) : eadg6175. https://doi.org/10.1126/sciadv.adg6175.

Sun, Hao, Chi Zhou, Xiaoqin Huang, Shuyuan Liu, Keqin Lin, Liang Yu, Kai Huang, Jiayou Chu et Zhaoqing Yang. 2013. « Correlation Between the Linguistic Affinity and Genetic Diversity of Chinese Ethnic Groups ». Journal of Human Genetics 58 (10) : 686-693. https://doi.org/10.1038/jhg.2013.79.

Verkerk, Annemarie, Olena Shcherbakova, Hannah J. Haynie, Hedvig Skirgård, Christoph Rzymski, Quentin D. Atkinson, Simon J. Greenhill et Russell D. Gray. 2025. Enduring Constraints on Grammar Revealed by Bayesian Spatiophylogenetic Analyses. Nature Human Behaviour. https://doi.org/10.1038/s41562-025-02325-z.

Watts, Joseph, Simon J. Greenhill, Quentin D. Atkinson, Thomas E. Currie, Joseph Bulbulia et Russell D. Gray. 2015. « Broad Supernatural Punishment But Not Moralizing High Gods Precede the Evolution of Political Complexity in Austronesia ». Proceedings of the Royal Society B : Biological Sciences 282 (1804) : 20142556. https://doi.org/10.1098/rspb.2014.2556.

Haut de page

Notes

1 https://beast.community/.

2 En archéologie et en géologie, la locution « AP » (« BP » en anglais) signifie « avant le présent » (« before present » en anglais). Le « présent » est fixé par convention à l’année 1950. Donc, par exemple, « 7000 AP » veut dire 7 000 ans avant 1950, soit environ −5050 av. J.-C. Cette convention est surtout utilisée dans le cadre des datations au radiocarbone (14C), car 1950 correspond à l’époque où cette méthode a commencé à être largement employée.

3 Il est à noter que les Inuits modernes viennent d’un flux migratoire datant d’environ 4 000 à 6 000 ans, en provenance du nord-est de la Sibérie par le détroit de Béring (Flegontov et al. 2019). Cette arrivée tardive explique qu’ils partagent davantage d’ascendance génétique avec certaines populations sibériennes actuelles qu’avec les autres Amérindiens (Raghavan et al. 2015) et permettrait de rendre compte de la connexion identifiée ici.

4 Skirgård et al. (2023) ont utilisé cet arbre pour évaluer les effets de la phylogénie sur les traits structuraux recensés dans la base de données en ligne Grambank. Étant donné l’usage que fait d’Huy (2015) de tels traits, les résultats obtenus méritent d’être rapidement présentés. Bien que l’effet de la phylogénie varie considérablement entre ces caractéristiques, allant de très fort (0,98) à presque inexistant (< 0,01), il est globalement plus marqué que celui de la distance géographique (moyenne de la phylogénie = 0,72, écart-type = 0,26 contre moyenne de la distance géographique = 0,03, écart-type = 0,06). Cependant, comme le notent les auteurs, ces forts effets phylogénétiques sont à interpréter avec prudence, car il peut être difficile d’estimer de manière indépendante les effets de la distance géographique et de la phylogénie, la diversification des langues étant elle-même un processus spatial.

Haut de page

Table des illustrations

Titre Figure 1. Graphe Neighbor-Net produit à partir des données filtrées de d’Huy (score delta = 0,3941 ; score Q-résiduel = 0,08549)
Crédits d’Huy 2015
URL http://journals.openedition.org/revuehn/docannexe/image/5287/img-1.jpg
Fichier image/jpeg, 106k
Titre Figure 2. Arbre neighbor-joining produit à partir des données filtrées de d’Huy
Crédits d’Huy 2015
URL http://journals.openedition.org/revuehn/docannexe/image/5287/img-2.jpg
Fichier image/jpeg, 57k
Titre Figure 3. Arbre produit par MrBayes à partir des données filtrées de d’Huy
Crédits d’Huy 2015
URL http://journals.openedition.org/revuehn/docannexe/image/5287/img-3.jpg
Fichier image/jpeg, 82k
Titre Figure 4. Arbre mondial des langues créé par Jäger et Wichmann
Crédits Jäger et Wichmann 2016 · https://profgerhard.de/​sfs/​slides/​slidesTorunWorldtree.pdf · image reproduite avec l’aimable autorisation de Gerhard Jäger
URL http://journals.openedition.org/revuehn/docannexe/image/5287/img-4.jpg
Fichier image/jpeg, 6,7M
Haut de page

Pour citer cet article

Référence électronique

Julien d’Huy, « Quand l’arbre ne tient plus qu’à ses branches : trois essais récents pour reconstruire un arbre mondial des langues »Humanités numériques [En ligne], 12 | 2025, mis en ligne le 01 décembre 2025, consulté le 14 septembre 2026. URL : http://journals.openedition.org/revuehn/5287 ; DOI : https://doi.org/10.4000/15ici

Haut de page

Auteur

Julien d’Huy

UMR 7130 Laboratoire d’anthropologie sociale, Paris, France
Julien d’Huy est un anthropologue français spécialisé dans l’application de méthodes phylogénétiques aux mythes et aux cultures, dans une perspective comparatiste et évolutionniste. Il est l’auteur de Cosmogonies. La préhistoire des mythes (2020), L’Aube des mythes. Quand les premiers Sapiens parlaient de l’au-delà (2023) et Dragon. Généalogie mondiale d’un mythe (2025).
ORCID 0000-0002-7566-2741
dhuy.julien@yahoo.fr

Haut de page

Droits d’auteur

CC-BY-4.0

Le texte seul est utilisable sous licence CC BY 4.0. Les autres éléments (illustrations, fichiers annexes importés) sont susceptibles d’être soumis à des autorisations d’usage spécifiques.

Haut de page
Rechercher dans OpenEdition Search

Vous allez être redirigé vers OpenEdition Search