Navigation – Plan du site

AccueilNuméros23-2ExpérimentationSituer l’analyse phylogénétique e...

Expérimentation

Situer l’analyse phylogénétique entre les sciences historiques et expérimentales

Locating phylogenetic analyses between the historical and experimental sciences
Thomas Bonnin et Jonathan Lombard
p. 131-148

Résumés

Cet article propose une étude conceptuelle d’une pratique scientifique. L’analyse phylogénétique, méthode phare en biologie de l’évolution, permet d’inférer les relations évolutives entre différentes espèces ou organismes. De nos jours, elle fait souvent intervenir l’usage de données moléculaires, dont les résultats sont appelés des phylogénies moléculaires. Comment caractériser cette pratique ? Nous commençons par une présentation de la méthode, en la découpant en quatre étapes : (1) l’identification puis (2) l’alignement de séquences homologues (descendants d’un ancêtre commun) ; (3) la construction puis (4) l’interprétation d’un arbre phylogénétique. Nous montrons que l’analyse phylogénétique n’est pas une expérimentation, et donc n’appartient pas au « style de laboratoire », tel que défini par Hacking. Elle ne correspond pas non plus à une méthode typique des sciences historiques, telle que décrite par Cleland. Bien que la correspondance de l’analyse phylogénétique avec ces catégorisations ne soit que partielle, nous défendons l’utilité de chacune de ces confrontations pour souligner des aspects distincts de cette pratique. Nous remettons aussi en cause l’idée d’une séparation méthodologique nette entre sciences expérimentales et sciences historiques.

Haut de page

Texte intégral

1 Introduction

1Si ce numéro spécial de la revue Philosophia Scientiæ propose une comparaison des formes d’expérimentations à l’œuvre dans les sciences de la nature et dans les sciences humaines et sociales, cet article prend deux tangentes qui, nous l’espérons, déboucheront quand même sur une contribution pertinente.

2La première concerne le type de science analysée. Nous nous intéressons à une pratique appartenant aux sciences historiques. Plus précisément, l’article s’intéresse à la description de l’analyse phylogénétique (et plus particulièrement, de la phylogénie moléculaire), une méthode principalement employée en biologie évolutive. Cette pratique constitue l’outil privilégié pour étudier l’histoire du vivant depuis l’apparition des premières formes de vie sur Terre jusqu’au suivi des nouvelles résistances aux antibiotiques dans le présent. Cet outil combine des connaissances fonctionnelles provenant d’autres domaines biologiques et des données moléculaires au profit d’études évolutives qui sont, par définition, historiques. Il ne s’agit donc pas d’une pratique « typique » des sciences naturelles, au sens où elle ne cherche pas à dégager les régularités et les lois qui régissent le comportement des choses, mais à décrire une suite temporelle d’événements contingents.

3La seconde tangente concerne la manière dont cette pratique est habituellement définie. Contrairement à d’autres contributions de ce numéro spécial, l’analyse phylogénétique n’est pas, à notre connaissance, considérée comme une forme d’expérimentation. Tout en se basant sur la comparaison d’organismes actuels, les études phylogénétiques essayent de fournir un regard sur des événements passés et contingents sur lesquels il est impossible d’intervenir, et que l’on ne peut pas reproduire. Cette méthode n’essaye d’ailleurs pas de déterminer des événements à l’échelle d’organismes spécifiques du passé, mais plutôt de générer une représentation du phénomène évolutif dans son intégralité. L’analyse phylogénétique ne semble donc pas intuitivement correspondre à une investigation expérimentale.

4Malgré cela, nous proposons avec cet article d’explorer ce qui découle d’une confrontation entre l’analyse phylogénétique et la notion d’expérimentation, et par ce biais, d’étudier la relation entre sciences historiques et sciences expérimentales. Nous commençons, dans la section 2, par une présentation de l’analyse phylogénétique en tant que méthode. Elle se découpe en quatre étapes principales : (1) la recherche de séquences issues d’un ancêtre commun, (2) l’alignement de ces séquences afin de les comparer entre elles, (3) la production et (4) l’interprétation d’un arbre phylogénétique. Dans la section 3, nous analysons le type de pratique qu’est l’analyse phylogénétique. Nous montrons que l’analyse phylogénétique n’est pas une expérimentation, et donc n’appartient pas au style de laboratoire, tel que défini par Hacking [Hacking 1992a]. Elle ne correspond pas non plus à une méthode typique des sciences historiques, telle que décrite par Cleland [Cleland 2002].

5Bien que la correspondance de l’analyse phylogénétique avec ces catégorisations soit partielle, nous défendons l’utilité de chacune de ces confrontations pour souligner des aspects distincts de cette pratique. L’analyse phylogénétique partage avec une expérimentation typique le soin apporté dans la définition du système cible et dans l’amélioration de la reproductibilité des résultats. L’idée du style de laboratoire, bien qu’utilisée hors de son domaine d’application, permet de mettre en avant les différentes composantes de cette pratique, et d’ouvrir la réflexion sur ses dynamiques d’autolégitimation. Enfin, comme une science historique typique, l’analyse phylogénétique consiste à relier des traces contemporaines par des causes communes situées dans le passé.

6En conclusion, notre analyse met en avant l’insuffisance de nos catégories actuelles pour caractériser pleinement une pratique comme l’analyse phylogénétique et remet en cause l’idée d’une séparation méthodologique nette entre sciences expérimentales et sciences historiques.

2 L’analyse phylogénétique

7L’analyse phylogénétique constitue un des outils principaux de la biologie évolutive. Elle s’inspire de l’idée d’arbre généalogique. Une généalogie est une figure arborescente qui montre les liens génétiques qui connectent les ancêtres à leurs descendants. Il s’agit d’une nécessité théorique découlant d’un présupposé fondamental de la biologie, qui postule l’existence d’une parenté commune plus ou moins éloignée dans le temps pour expliquer les similarités observées entre les êtres vivants. Afin d’étudier ces relations, la biologie évolutive utilise les caractéristiques communes entre organismes pour reconstruire des arbres phylogénétiques (ou « phylogénies ») qui représentent le lien de parenté existant entre les caractéristiques étudiées. Ces relations sont souvent employées pour inférer les relations de parenté entre espèces.

  • 1 Notre caractérisation méthodologique de l’analyse phylogénétique s’inspire des travaux de Suárez-Dí (...)

8Les premiers caractères à avoir été utilisés pour effectuer ces comparaisons étaient « morphologiques », c’est-à-dire des caractéristiques « visibles » des êtres vivants, tels que l’ossature des animaux. Les analyses phylogénétiques sont maintenant souvent effectuées à partir de caractères « moléculaires », correspondant aux séquences d’ADN et de protéines. Ce type d’analyse a suivi un développement fulgurant depuis les années 1960, notamment grâce à l’accumulation de données génomiques permise par l’avènement des technologies de séquençage [Suárez-Díaz & Anaya-Muñoz 2008]1.

9Les caractères moléculaires ont constitué une révolution méthodologique au sein de l’analyse phylogénétique. Les séquences d’ADN sont toutes constituées des mêmes bases nucléotidiques. Le code génétique, c’est-à-dire la correspondance entre un triplet de nucléotides et un acide aminé constituant des protéines, est le même pour la quasi-totalité des organismes. Cette constante presque universelle du vivant au niveau moléculaire fournit une base comparative unique exploitée par les analyses phylogénétiques moléculaires.

10L’utilisation de caractères moléculaires possède de nombreux avantages. D’abord, il y a dans chaque organisme beaucoup plus de gènes et de protéines que de traits morphologiques. Chaque nucléotide d’un gène ou acide aminé d’une protéine constitue potentiellement un caractère comparable entre espèces. Ainsi, les caractères moléculaires permettent de comparer des organismes tellement différents morphologiquement qu’ils seraient difficiles à comparer, ou tellement proches qu’ils seraient difficiles à distinguer. Tel est le cas, par exemple, de l’évolution des microorganismes (protistes, bactéries, archées), dont la diversité était difficile à mesurer morphologiquement auparavant [Castelle & Banfield 2018].

11Étant donné la profusion de caractères moléculaires, la première étape de l’analyse phylogénétique consiste en la recherche de séquences issues d’un dernier ancêtre commun, qui puissent être comparées.

2.1 Sélectionner des homologues

12En biologie évolutive, deux caractères sont dits homologues s’ils sont hérités d’un dernier ancêtre commun. Si la comparaison de caractères homologues est la seule qui puisse avoir un sens biologique, comment faire pour établir une relation d’homologie entre deux traits ? En ce qui concerne les caractères morphologiques, l’homologie est souvent déterminée par les connexions de chaque caractère avec d’autres structures adjacentes. Par exemple, on peut établir la relation d’homologie entre chaque os des extrémités antérieures des vertébrés en étudiant les autres os qui s’y connectent. Dans le cas moléculaire, l’argument est statistique. Sachant qu’un petit gène est composé d’environ 600 nucléotides, et qu’il existe 4 types de nucléotides, cela veut dire qu’il existe, pour un gène de cette taille, , soit  combinaisons possibles de nucléotides de cette longueur. Pour une petite protéine de 200 acides aminés et sachant qu’il existe 20 acides aminés différents, le nombre de combinaisons aléatoires possibles est de , soit  combinaisons possibles. À titre de comparaison, le nombre d’atomes existants dans l’univers est estimé à . La détermination d’homologies se base donc sur le présupposé que la ressemblance entre deux séquences d’ADN ou de protéines ne puisse pas être due au hasard, surtout si l’on sait par ailleurs que les fonctions des protéines codées par ces gènes sont les mêmes, ou très similaires, entre les différents organismes qui les portent. Au contraire, ces ressemblances trahissent une descendance commune.

13Cette recherche de séquences similaires ne peut pas se faire manuellement. La taille des séquences concernées, le nombre possible de leurs variantes et l’ampleur des bases de données de séquences d’ADN et de protéines rendent nécessaire l’emploi de méthodes heuristiques. Ces méthodes cherchent à explorer les « meilleures possibilités » en un temps réduit pour rendre l’analyse possible. Aujourd’hui, les outils les plus largement utilisés pour effectuer cette tâche sont le Basic Local Alignment Search Tool (BLAST) [Altschul & Gish et al. 1990] et ses dérivés. BLAST calcule un « score de similarité » entre deux séquences potentiellement homologues. Ce score ne se limite pas à compter le nombre de sites identiques entre les deux séquences, mais pondère la présence d’éventuelles mutations par l’utilisation d’une « matrice de substitution ».

14La matrice de substitution rassemble les différentes fréquences de substitution d’un acide aminé à un autre. En effet, toutes les mutations n’ont pas la même fréquence. Cela s’explique d’abord par la redondance du code génétique (toutes les mutations de l’ADN n’impliquent pas un changement de l’acide aminé correspondant). Cela vient aussi des propriétés chimiques spécifiques des acides aminés. La sélection naturelle tend à conserver des acides aminés avec des comportements chimiques proches, qui auront un impact moindre sur l’activité de la protéine en question. La matrice en elle-même est construite en fonction de données empiriques sur les fréquences relatives de chaque type de mutation.

15La pertinence de la similarité entre deux séquences est indiquée par l’e-value calculée par BLAST, qui mesure les chances de retrouver par hasard ce même score de similarité pour une séquence de cette taille au sein de la base de données utilisée. Plus l’e-value est faible, moins le score de similarité a de chances d’être le résultat du hasard. En pratique, le seuil d’e-value à partir duquel la similarité de séquences n’est plus considérée comme pertinente est arbitraire, mais doit être explicitement signalée par l’utilisateur.

2.2 L’alignement de séquences

16Une fois les séquences homologues identifiées, il faut les aligner, c’est-à-dire déterminer l’homologie entre chacun des nucléotides (ou acides aminés) des séquences disponibles. En effet, chaque élément qui compose une séquence constitue un caractère pour lequel on cherche à établir la relation avec les caractères équivalents des autres séquences homologues. Ainsi, toutes les séquences homologues identifiées sont comparées entre elles (on parle ainsi d’alignement multiple). Le résultat est une matrice où chaque ligne correspond à une séquence et chaque colonne correspond aux sites présumés homologues (Fig. 1a). Chaque alignement peut ainsi recevoir un score mesuré sur la base de l’identité, d’une pénalité de substitution pondérée en fonction de matrices prédéfinies (souvent les mêmes que pour BLAST), ainsi qu’une pénalité pour les espaces (insertions et délétions) nécessaires pour assurer une correspondance optimale des autres sites entre eux. L’impossibilité d’évaluer l’ensemble des alignements possibles rend à nouveau nécessaire l’emploi de méthodes heuristiques.

17Une deuxième phase de l’alignement, le « découpage » [trimming], permet d’éliminer pour la suite des analyses les sites contenant trop d’espaces (notamment aux extrémités) ou trop de variabilité. On ne garde ainsi que les sites dont on pourrait extraire des informations phylogénétiques (Fig. 1b). Cette sélection est en principe faite à l’aide d’un des nombreux logiciels qui utilisent des critères plus ou moins sophistiqués pour exclure automatiquement les sites dont l’homologie paraît incertaine. Certaines méthodes sont plus adaptées à certains cas, mais toutes les méthodes de découpage peuvent être soumises à des critiques [Tan, Muffato et al. 2015]. La répétition de cette étape avec différents paramètres ou logiciels devient alors une manière d’évaluer la fiabilité des résultats, et le choix de la méthode retenue apparaît explicitement dans les publications.

Figure 1 : Présentation de 4 séquences homologues alignées (a) avant et (b) après découpage. Les résidus enlevés lors du découpage sont indiqués en gras sur la figure 1a. Il s’agit d’un extrait de séquences homologues au sein d’un alignement qui intègre, par ailleurs, de nombreuses autres séquences. Cela explique le retrait de résidus identiques entre ces 4 séquences.

a.

A

 - - LP-TRR-PY- - - - - - -DSATAP- -GYMAVGDAAAHV-N

B

 - - LP-TRR-PY- - - - - - -DSATAP- -GFMAVGDAAGHV-N

C

 - - LP-TRR-PY- - - - - - -DSAVHP- -GYMAIGDAAGHV-N

D

 - - LP-TRR-PY- - - - - - -DSAVHP- -GYVAIGDAAGHV-N

b.

A

LPTRRPDSATGYMAVGDAAAHVN

B

LPTRRPDSATGFMAVGDAAGHVN

C

LPTRRPDSAVGYMAIGDAAGHVN

D

LPTRRPDSAVGYVAIGDAAGHVN

18L’étape d’alignement est cruciale, car elle détermine la base comparative sur laquelle l’arbre phylogénétique est construit.

2.3 Construction des arbres

19Cette étape consiste à représenter sous forme d’un arbre phylogénétique les relations évolutives entre nos séquences. Une manière de faire cela est d’utiliser le principe de parcimonie. Celui-ci affirme que le meilleur arbre est celui qui minimise le nombre d’évènements évolutifs. Dans la pratique, le principe de parcimonie est souvent invoqué dans les hypothèses et scénarios évolutifs, mais rarement utilisé pour la reconstruction de phylogénies moléculaires à cause (a) de la difficulté à distinguer entre plusieurs arbres également parcimonieux et (b) des artefacts connus induits par ses méthodes [Felsenstein 1978].

20Les autres méthodes de reconstruction phylogénétique se basent plutôt sur la distance évolutive entre les séquences. Ces méthodes commencent par le calcul d’une matrice de distances entre toutes les paires de séquences. Pour cela, on emploie le modèle d’évolution le plus à même de décrire l’évolution des séquences. Cet article n’a pas pour vocation d’entrer dans le détail des divers paramètres pris en compte par ces modèles. On peut citer comme exemples des vitesses variables d’évolution, à la fois entre différentes séquences et d’un site au sein d’une séquence par rapport à un autre. Le choix des modèles d’évolution peut lui même faire le sujet d’études comparatives et est toujours spécifié dans les travaux de phylogénie. Ces méthodes de calcul diffèrent de celles employées dans les étapes d’identification et d’alignement des homologues par leur degré de sophistication accru. Le but ici n’est pas de sélectionner parmi une foule d’alignements possibles, mais d’évaluer plus finement les relations entre les séquences choisies.

21Une fois que la matrice des distances est obtenue, elle peut être soumise à différentes méthodes possibles. Dans les méthodes de distances, on utilise la matrice de distances pour regrouper deux des séquences (par exemple, les deux séquences les plus proches), recalculer les distances en se basant sur ces dernières, et intégrer ainsi les autres au fur et à mesure. Dans les méthodes probabilistes (de vraisemblance ou bayésiennes), on calcule la probabilité d’obtenir chaque arbre possible à partir des données de l’alignement, pour sélectionner ensuite l’arbre avec la meilleure probabilité. Dans la pratique, une application exhaustive des méthodes de probabilité impliquerait encore l’exploration de beaucoup trop de topologies, des méthodes heuristiques sont donc à nouveau utilisées.

22L’arbre phylogénétique obtenu est composé de nœuds et de branches (Fig. 2). Les nœuds représentent des ancêtres communs qui, dans ce cas, sont virtuels, comme des portraits-robots que l’on peut reconstruire en recoupant les informations connues à propos des espèces en amont et en aval du nœud. La longueur des branches représente la quantité de changements que l’on estime s’être produits entre deux points. Cette représentation permet donc de comparer les anciennetés des ancêtres communs de diverses séquences et, par extrapolation, cela permet de comparer les anciennetés des ancêtres communs entre les espèces portant ces séquences.

Figure 2 : Exemple schématique d’arbre phylogénétique. Les flèches indiquent les nœuds représentant d’hypothétiques ancêtres communs entre les séquences comparées.

Figure 2 : Exemple schématique d’arbre phylogénétique. Les flèches indiquent les nœuds représentant d’hypothétiques ancêtres communs entre les séquences comparées.

23Finalement, quelle que soit la méthode utilisée pour construire l’arbre, le soutien statistique des résultats obtenus est évalué. Dans une phylogénie, il n’est pas possible d’appliquer les concepts classiques d’intervalles de confiance ou de tests de significativité. Les méthodes bayésiennes intègrent par définition une mesure de ce soutien, mais pour les autres méthodes, on applique généralement des mesures de bootstrap. Ces dernières évaluent la robustesse de la topologie en « ré-échantillonnant » les données utilisées. L’objectif de ces mesures est de déterminer le soutien de chaque nœud de l’arbre, ce qui, dans une certaine mesure, constitue une forme d’évaluation de la reproductibilité du résultat.

2.4 Interprétation des arbres

24L’interprétation des résultats de l’analyse phylogénétique nécessite de nombreuses précautions. D’abord, comme dans toute analyse statistique, le fait qu’un nœud proposé ait un haut degré de soutien n’indique pas nécessairement que le nœud proposé soit validé. Il est en effet tout à fait possible que le haut degré de soutien obtenu soit le résultat d’un artefact méthodologique, d’un biais d’échantillonnage ou du choix d’un modèle d’évolution inadapté. Pareillement, ce n’est pas parce qu’un nœud est faiblement soutenu qu’il est nécessairement faux. On parle ici plutôt d’un nœud « non résolu ». Les discussions et validations finales des résultats se font en comparant les arbres obtenus avec d’autres analyses, où (1) les mêmes données sont soumises à d’autres méthodes d’alignement, de trimming, de reconstruction d’arbres ou à d’autres modèles d’évolution ; ou bien (2) d’autres données sont employées, en comparant, par exemple, la phylogénie du (des) gène(s) d’intérêt à celle d’autres gènes ou de phylogénies indépendamment obtenues.

25Après cette présentation succincte de l’analyse phylogénétique, que peut-on dire sur le type de pratique que cela constitue ? L’analyse ci-dessous confronte l’analyse phylogénétique et les arbres phylogénétiques à diverses manières potentielles de le conceptualiser.

3 Catégoriser l’analyse et les arbres phylogénétiques

3.1 L’analyse phylogénétique n’est pas une expérimentation

26Dans cette section, nous approfondissons la relation entre l’analyse phylogénétique et la notion d’expérimentation. Comme évoqué dans l’introduction, l’analyse phylogénétique n’est pas habituellement caractérisée comme une expérimentation. Selon Dupouy, « l’expérimentation est un procédé d’investigation par lequel on cherche à produire ou modifier un phénomène, en isolant et manipulant les variables qui sont susceptibles d’agir sur le phénomène en question » [Dupouy 2011, 215]. De cette définition émergent deux propriétés explicites : l’isolement de variables d’intérêt sur un système cible et une intervention sur ce dernier pour produire un phénomène. Deux propriétés implicites suivent : la définition d’un système cible sur lequel l’intervention a lieu et la reproductibilité des résultats obtenus lors de l’intervention effectuée. Nous montrons que les deux premières propriétés, isolement et intervention, ne sont pas présentes dans l’analyse phylogénétique. Par conséquent, on ne peut pas considérer cette dernière comme une expérimentation.

27Dans un contexte où les bases de données contiennent des millions de séquences appartenant à toutes sortes d’organismes, les étapes de sélection et d’alignement ont pour but de ne garder que les portions de séquences alignées qu’on estime porteuses des signaux phylogénétiques recherchés. Cette étape est analogue, au sein d’une expérimentation, à la définition d’un système cible. Cependant, cette définition n’est pas faite dans le but d’isoler certaines variables d’intérêt sur le système cible afin d’étudier leurs rôles. Dans l’analyse phylogénétique, on ne s’intéresse pas à l’évolution spécifique de certains des homologues isolés, mais plutôt aux relations généalogiques de l’ensemble des homologues. L’étape qui « transforme » l’ensemble des séquences isolées en arbre phylogénétique peut être perçue comme une intervention sur le système cible, effectuée avec l’aide d’un ensemble d’outils computationnels. Cependant, il ne s’agit pas, comme dans une expérimentation, de modifier de manière contrôlée le comportement du système cible, mais plutôt de restituer le déroulement des relations phylogénétiques entre espèces vivantes. Enfin, de nombreuses méthodes sont employées pour évaluer la qualité des produits obtenus après chaque étape de l’analyse. On peut citer la vérification de l’e-value, la comparaison des résultats entre méthodes d’alignement ou reconstruction phylogénétique, entre différents modèles évolutifs ou l’évaluation de la robustesse des résultats. Cet ensemble de mesures est orienté vers l’amélioration de la reproductibilité des résultats obtenus.

28Pour résumer, si l’analyse phylogénétique en possède certains éléments caractéristiques, elle ne peut pas, à proprement parler, être définie comme une expérimentation. Malgré cette inadéquation, nous allons, dans un second temps, montrer la correspondance, à nouveau partielle, entre cette pratique scientifique et le « style de laboratoire » défini par Hacking.

3.2 L’analyse phylogénétique et le style de laboratoire (1) : idées, choses et marques

29Le concept de style de laboratoire, inspiré par Crombie [Crombie 1981], cherche à décrire les pratiques réalisées dans cet espace physique particulier. Le laboratoire, selon Hacking, est conçu comme un espace où, à l’aide d’appareils, on interfère avec des phénomènes naturels dans des conditions contrôlables et isolables. Ces interférences ont pour but de produire un savoir de type général ou généralisable. Les sciences de laboratoire forment donc un sous-ensemble des sciences expérimentales. Du point de vue de Hacking, il existe de nombreuses expérimentations, notamment dans les sciences humaines, qui n’ont pas lieu dans un laboratoire. À l’inverse, le travail de certaines sciences historiques (paléontologie, archéologie) et de l’espace (astrophysique, astronomie, cosmologie) peut se dérouler au sein de laboratoires. Cependant, puisque ces dernières n’interfèrent pas avec leurs phénomènes d’intérêt, elles n’appartiennent pas au style de laboratoire [Hacking 1992a, 33–36]. Cette absence d’interférence empêche également à l’analyse phylogénétique d’appartenir au style de laboratoire.

30Le concept de Hacking spécifie une typologie de composantes que l’on retrouve dans les pratiques de laboratoire. Ces composantes sont regroupées en trois catégories : les idées, les choses et les marques. Nous montrons dans cette section que cette typologie est utile pour identifier les composantes de l’analyse phylogénétique et leurs rôles.

31Sur le plan des idées, Hacking identifie d’abord les questions, les raisons pour lesquelles une expérimentation est mise en œuvre. Elles correspondent ici aux enjeux historiques et classificatoires à propos desquels les analyses phylogénétiques cherchent à apporter des éléments de réponse.

32Ensuite, il identifie la théorie, qu’il divise en trois types d’éléments, ces distinctions étant plus ou moins graduelles selon la discipline concernée [Hacking 1992a, 44]. Les savoirs d’arrière-plan et les théories systématiques sont les présupposés et attentes théoriques, respectivement non-systématisés et systématisés, qui sont tenus pour acquis dans la formulation d’une expérimentation. Bien qu’elles soient nécessaires à la création d’une expérimentation, ces théories n’ont pas ou peu de conséquences concrètes immédiates. Ici, ces savoirs correspondent aux théories concernant l’évolution et le fonctionnement des organismes (en particulier sous leurs aspects moléculaires).

33Ces savoirs sont reliés avec la situation empirique concrète à l’aide d’hypothèses topiques faisant la connexion entre les théories abstraites mobilisées et les phénomènes concrets étudiés. Au sein de la phylogénie moléculaire, ces hypothèses correspondent aux matrices de substitution et aux modèles d’évolution employés pour identifier et aligner des homologues puis pour reconstruire les relations phylogénétiques à partir de la similarité des séquences alignées. Le choix de ces modèles est aussi régi par des contraintes plus pragmatiques provenant souvent des limites des ressources computationnelles à disposition.

34Le dernier composant de ces idées correspond aux modèles des appareils employés lors de l’analyse. Ici, il s’agit des différents programmes informatiques employés tout au long de l’analyse phylogénétique. Ces programmes ne cherchent pas nécessairement à intégrer des savoirs mis en jeu lors de l’analyse, mais à rendre cette analyse possible par l’emploi de l’outil informatique. Ils sont en ce sens similaires aux éléments d’un microscope employés pour étudier les structures cellulaires.

35Sur le plan des choses, Hacking identifie la cible de l’expérimentation. Celle-ci correspond aux « substances ou populations étudiées » [Hacking 1992a, 46, notre traduction]. Elle peut être préparée afin que certaines de ses composantes soient mises en avant pour permettre l’analyse. Ici, les cibles sont les séquences d’ADN et de protéines, qui constituent des « archives » de l’histoire du vivant, elles-mêmes archivées et accessibles au sein de bases de données.

36Les interventions sur la cible sont effectuées par les sources de modification. Les résultats de ces modifications sont ensuite perçus par des détecteurs et enregistrés par des générateurs de données. Ces processus sont facilités par un ensemble d’outils, objets moins spécifiques d’une situation expérimentale donnée, mais nécessaires à leur déroulement. Cet ensemble de choses contribuant à la génération de données est, dans le cas de l’analyse phylogénétique, intégralement constitué par les outils informatiques de stockage, de calcul et de visualisation, distribués au sein d’un vaste réseau de programmes, ordinateurs, réseaux et serveurs. C’est par le biais de cet ensemble informatique intégré que les interventions sur les séquences préparées sont effectuées.

37Enfin, les marques sont les résultats de l’interaction des choses avec les idées. Parmi ces marques se trouvent, d’abord, les données, que Hacking considère comme le produit « brut » de l’intervention effectuée. Les données sont, ensuite, traitées afin d’être rendues intelligibles et adaptées aux questions auxquelles elles sont destinées à répondre. Les arbres phylogénétiques publiés sont le produit final de ce processus. Ce sont ces derniers qui circuleront principalement hors de leurs laboratoires d’origine.

38Hacking distingue deux composantes de ce processus de traitement de données. Lorsque ce processus n’est pas dirigé par des considérations théoriques, il parle de réduction des données. Cela correspond, par exemple, à l’amélioration des qualités esthétiques de l’arbre obtenu. Lorsque ce processus est dirigé par des considérations théoriques, telles que la question sous-jacente ou les modèles employés lors du protocole, il parle d’analyse des données. Ici, cela peut correspondre à la mise en avant de certaines séquences particulièrement pertinentes pour le questionnement initial. Cela aboutit à l’obtention de données qui, avec l’aide de principes théoriques et en lien avec la question soulevée, permettent d’effectuer une interprétation à la lumière de la question initiale.

3.3 L’analyse phylogénétique et le style de laboratoire (2) : autolégitimation

39La notion de Hacking n’est pas uniquement proposée pour rendre possible des descriptions précises des composantes contemporaines d’une pratique. Le style de laboratoire cherche aussi à mettre en avant la présence de dynamiques d’autolégitimation [self-vindication] des pratiques concernées. Cette autolégitimation s’effectue par un ajustement mutuel des choses, des idées et des marques mobilisées pour qu’elles puissent produire de manière stable et pérenne du savoir scientifique fiable. Les composantes d’un style de laboratoire sont donc reliées par une forme de circularité vertueuse, créant un « système clos essentiellement irréfutable » [Hacking 1992a, 30, notre traduction]. Ces processus d’ajustement mutuel sous-tendent l’idée défendue par Hacking selon laquelle les expérimentations « ont une vie propre » : elles « se développent, changent, et, pourtant, gardent un certain développement au long terme » [Hacking 1992b, 307, notre traduction].

40L’analyse phylogénétique, bien que ne constituant pas à nos yeux une forme d’expérimentation, possède aussi ses dynamiques d’autolégitimation. Celles-ci sont sous-tendues par la sophistication accrue de l’ensemble théorique mobilisé (que ce soit les théories d’arrière-plan ou les hypothèses topiques) et par une croissance exponentielle des ressources matérielles disponibles, que ce soit les séquences disponibles pour l’analyse ou les ressources computationnelles informatiques. Ces ensembles se sont ajustés mutuellement pour produire des données de plus en plus fiables et précises, et revendiquer au passage un ensemble de succès notable. La découverte des archées comme troisième domaine du vivant [Woese & Fox 1977] est un exemple de succès précoce de cette méthode. De plus, l’actuelle ubiquité des analyses phylogénétiques moléculaires, à différentes échelles (que ce soit pour retracer l’évolution de l’ensemble du vivant ou l’émergence présente de résistances bactériennes) et pour différents buts (qu’ils soient l’établissement de fonctions ou de classifications), constitue pour nous le marqueur le plus clair de sa légitimité acquise et de son développement continu.

41L’identification de cette dynamique d’autolégitimation est féconde, dans le sens où elle ouvre des questionnements sur ses modalités. Nous nous contenterons, dans cet article, d’esquisser quelques pistes. Nous pensons qu’un parallèle intéressant peut être effectué avec les simulations, une pratique qui a aussi pour but de produire du savoir sur un système cible sans interférence avec ce dernier.

42La légitimité des résultats de simulations a fait l’objet de controverses au sein de la philosophie de sciences. Dans le contexte des sciences sociales, Guala et Morgan justifient l’infériorité épistémique relative des simulations par rapport aux expérimentations à cause de l’absence d’interaction matérielle directe avec le phénomène étudié [Guala 2002], [Morgan 2003]. De son côté, Ruphy défend une interprétation antiréaliste des simulations du fonctionnement de galaxies. D’abord, le choix des modèles employés est sous-déterminé. De plus, les modèles employés doivent être ajustés pour être opérationnalisés au sein de ces simulations, faisant ainsi de ces dernières des représentations infidèles des ensembles théoriques sur lesquels elles sont bâties [Ruphy 2017]. Pour ces raisons, Ruphy considère que ces simulations représentent des processus possibles plutôt que des processus réels.

43Les arbres phylogénétiques ont ceci en commun avec les simulations du fonctionnement de galaxies qu’ils constituent notre seul accès épistémique au phénomène étudié. De plus, notre analyse en section 2 montre que le choix des modèles employés pour les construire est tout aussi sous-déterminé. Ces arguments sceptiques, confrontés à l’autolégitimation des analyses phylogénétiques, créent une tension qui permet d’ouvrir de nombreuses pistes d’investigation. Comment les biologistes utilisant ces méthodes échappent-ils (en partie) à ce scepticisme et arrivent-ils à construire des connaissances fiables sur leurs phénomènes d’intérêt ?

44Cela vaudrait la peine d’étudier plus précisément les dimensions formelles, informelles, tacites ou explicites qui dirigent la constellation de choix qui parsèment les étapes de l’analyse phylogénétique. Il est particulièrement intéressant de souligner ces éléments pour une pratique qui s’est construite en opposition à des phylogénies morphologiques jugées trop dépendantes envers des considérations subjectives [Suárez-Díaz & Anaya-Muñoz 2008]. Ensuite, on pourrait se pencher sur le rôle que joue le savoir théorique dans la construction des modèles et la validation des résultats obtenus. Les composantes identifiées par Hacking mettent en avant la relation indirecte entre des théories de « haut niveau » et les hypothèses topiques plus concrètes. Comment, plus concrètement, les connaissances sur l’évolution et le fonctionnement des organismes sont-elles intégrées dans les modèles employés ? Comment permettent-elles de légitimer les résultats obtenus ? De surcroît, comment les résultats obtenus par d’autres méthodes (s’il y en a) permettent-ils d’accroître ou de saper la confiance envers un arbre phylogénétique ?

45Pour résumer, nous jugeons que la confrontation de l’analyse phylogénétique avec le style de laboratoire est philosophiquement fructueuse. Elle permet non seulement de clarifier les différents éléments de cette pratique, mais aussi de générer de nombreuses investigations concernant les modalités de légitimation de ses résultats.

3.4 Les analyses phylogénétiques comme méthode typique des sciences historiques ?

46Notre analyse a, jusque-là, mis en avant des parallèles intéressants entre analyse phylogénétique et pratiques expérimentales. Cela nous a permis d’effectuer une caractérisation fine des composantes de cette pratique et d’ouvrir de nombreuses pistes d’investigations sur les modalités de légitimation de ses résultats. Dans cette dernière section, nous confrontons l’analyse phylogénétique, une pratique historique, avec la conceptualisation de la méthodologie des sciences historiques proposée par Cleland.

47Par l’application de modèles d’évolution aux données apportées, l’analyse phylogénétique s’emploie à reconstituer les relations généalogiques entre des séquences individuelles. De ce point de vue, l’analyse phylogénétique peut être conçue comme une méthode typique des sciences historiques. Ces dernières, selon Cleland, possèdent leur méthodologie propre, distincte de celle des sciences expérimentales. Les sciences historiques sont caractérisées par la volonté d’expliquer une collection de traces contemporaines à l’aide d’une cause commune située dans le passé [Cleland 2002]. L’analyse phylogénétique, de même, permet d’inférer une cause commune (des ancêtres communs plus ou moins éloignés dans le temps) à la similarité de séquences contemporaines.

48Les sciences historiques sont souvent présentées comme confrontées à un manque de données (que ce soit en quantité ou en qualité). Cet ensemble limité de traces à disposition aboutit à une sous-détermination ubiquitaire des théories par les preuves. Dans ce contexte, les confirmations et réfutations de théories proviennent, selon Cleland, de la découverte de « pistolets fumants » [smoking guns] : des traces capables de favoriser une hypothèse par rapport à d’autres, jusque-là empiriquement équivalentes [Cleland 2002, 480–481]. Les traces du passé dénichées sont présentées comme le fruit de découvertes en partie fortuites sur les terrains d’investigations. L’emploi de méthodes pour aider à l’identification et à l’analyse de traces est présenté comme secondaire, comme des « outils utiles empruntés à d’autres disciplines dans des buts précis » [Cleland 2011, 566, notre traduction].

49Au regard de l’analyse développée dans les sections précédentes, cette conception de la méthodologie des sciences historiques semble incomplète et inadaptée au cas de la pratique de l’analyse phylogénétique. Le séquençage d’une diversité toujours plus étendue d’organismes constitue toujours une tâche essentielle des approches phylogénétiques. En effet, l’obtention de nouvelles données peut permettre d’éviter des artefacts liés à des biais d’échantillonnage, d’étoffer la connaissance sur l’évolution d’un groupe connu ou même la description de nouveaux groupes préalablement inconnus. Cela peut avoir des effets importants sur la validité des hypothèses évolutives disponibles. Pour ces raisons, les phylogénéticiens sont, d’une certaine manière, en manque de données.

50D’un point de vue pratique, cependant, la situation actuelle indique plutôt l’inverse. De fait, les immenses bases de données apportent déjà une surabondance de données disponibles. Cela fait de la sélection de séquences pertinentes une préoccupation majeure des pratiques phylogénétiques actuelles [O’Malley 2016]. La principale limite des démarches phylogénétiques n’est ainsi plus la capacité à trouver de nouvelles données, mais le développement de méthodes qui permettent d’en extraire les informations voulues. Cela passe par le développement d’une panoplie d’outils et de logiciels opérationnalisant de nombreux modèles et concepts à chaque étape de l’analyse phylogénétique, comme présenté ci-dessus. Ce développement fait l’objet de ce que Suárez-Díaz & Anaya-Muñoz [Suárez-Díaz & Anaya-Muñoz 2008] décrivent comme une « anxiété méthodologique » de la part des biologistes de l’évolution. En somme, il est désormais difficile de considérer, comme le fait Cleland, ces enjeux comme « secondaires » à la découverte de nouvelles séquences.

4 Conclusion

51Dans le cadre de cet article, nous avons cherché à explorer la fécondité d’une confrontation de l’analyse phylogénétique avec une série de conceptualisations potentielles de cette pratique. En mobilisant une pratique « périphérique » à celles discutées au sein de ce numéro spécial, nous pensons avoir souligné et exploré de manière fructueuse la limite parfois ténue existant entre pratiques historiques et expérimentales, ainsi que la difficulté résultante de placer certaines pratiques scientifiques dans l’éventail des conceptualisations disponibles.

52Notre discussion a montré que l’analyse phylogénétique fait partie de ces pratiques qu’il est difficile de catégoriser. L’analyse phylogénétique partage avec les expérimentations le souci d’une définition précise de son système d’intérêt et d’augmenter la fiabilité et reproductibilité des résultats obtenus. L’absence d’isolement et d’intervention à proprement parler nous empêche, cependant, de caractériser cette pratique comme une expérience. Cette non-correspondance n’est pas une surprise en soi : cette pratique n’a jamais été décrite comme telle. Cependant, l’exploration de cette possibilité, notamment en faisant correspondre l’analyse phylogénétique avec le « style de laboratoire », a permis d’effectuer une description fine des composantes de cette pratique et de soulever une série de questionnements sur les modalités de légitimation de ses résultats. Cela montre la fécondité du concept de Hacking hors de son domaine d’application initial.

53La caractérisation des sciences historiques par Cleland fut effectuée dans le but de distinguer ces dernières des sciences expérimentales, notamment en ce qui concerne les manières d’établir la solidité de leurs hypothèses. Le cas d’étude de cet article est, d’un côté, une méthodologie typique des sciences historiques. De l’autre, la surabondance de données et l’importance et la complexité des outils méthodologiques employés ne correspondent pas avec la description proposée par Cleland. La proximité entre cette pratique historique et les pratiques expérimentales, notamment en ce qui concerne la légitimation des résultats et l’évitement soigneux d’erreurs et d’artefacts, semble indiquer une distinction plus fine entre ces types de pratiques qu’il n’y paraît de prime abord.

Haut de page

Bibliographie

Altschul, Stephen F., Gish, Warren et al. [1990], Basic local alignment search tool, Journal of Molecular Biology, 215(3), 403–410, S0022-2836(05)80360-2.

Castelle, Cindy J. & Banfield, Jillian F. [2018], Major new microbial groups expand diversity and alter our understanding of the tree of life, Cell, 172(6), 1181–1197, doi: 10.1016/j.cell.2018.02.016.

Cleland, Carol E. [2002], Methodological and epistemic differences between historical science and experimental science, Philosophy of Science, 69(3), 447–451, doi: 10.1086/342455.

Cleland, Carol E. [2011], Prediction and explanation in historical natural science, The British Journal for the Philosophy of Science, 62(3), 551–582, doi: 10.1093/bjps/axq024.

Crombie, Alistair C. [1981], Philosophical presuppositions and shifting interpretations of Galileo, dans: Theory Change, Ancient Axiomatics, and Galileo’s Methodology: Proceedings of the 1978 Pisa Conference on the History and Philosophy of Science, édité par J. Hintikka, D. Gruender & E. Agazzi, Dordrecht: Springer Netherlands, t. I, 271–286, doi: 10.1007/978-94-009-9045-6_19.

Dupouy, Stéphanie [2011], L’expérimentation, dans : Philosophie des sciences humaines, édité par Fl. Hulak & Ch. Girard, Paris : Vrin, 213–241.

Felsenstein, Joseph [1978], Cases in which parsimony or compatibility methods will be positively misleading, Systematic Biology, 27(4), 401–410, doi : 10.1093/sysbio/27.4.401.

Guala, Francesco [2002], The Methodology of Experimental Economics, Cambridge : Cambridge University Press.

Hacking, Ian [1992a], The self-vindication of the laboratory sciences, dans : Science as Practice and Culture, édité par A. Pickering, Chicago : University of Chicago Press, 29–64.

Hacking, Ian [1992b], Do thought experiments have a life of their own ? Comments on James Brown, Nancy Nersessian and David Gooding, dans : PSA : Proceedings of the Biennial Meeting of the Philosophy of Science Association, 302–308.

Morgan, Mary S. [2003], Experiments without material intervention : Model experiments, virtual experiments and virtually experiments, dans : The Philosophy of Scientific Experimentation, édité par H. Radder, Pittsburgh : University of Pittsburgh Press, 216–235.

O’Malley, Maureen A. [2016], Histories of molecules : Reconciling the past, Studies in History and Philosophy of Science Part A, 55, 69–83, doi : 10.1016/j.shpsa.2015.09.002.

Ruphy, Stéphanie [2017], Scientific Pluralism Reconsidered : A New Approach to the (Dis)unity of Science, Pittsburgh : Pittsburgh University Press.

Suárez-Díaz, Edna & Anaya-Muñoz, Victor H. [2008], History, objectivity, and the construction of molecular phylogenies, Studies in History and Philosophy of Science Part C, 39(4), 451–468, doi : 10.1016/j.shpsc.2008.09.002.

Tan, Ge, Muffato, Matthieu et al. [2015], Current methods for automated filtering of multiple sequence alignments frequently worsen single-gene phylogenetic inference, Systematic Biology, 64(5), 778–791, doi : 10.1093/sysbio/syv033.

Woese, Carl & Fox, George E. [1977], Phylogenetic structure of the prokaryotic domain : the primary kingdoms, dans : Proceedings of the National Academy of Sciences of the United States of America, t. 74, 5088–5090.

Haut de page

Notes

1 Notre caractérisation méthodologique de l’analyse phylogénétique s’inspire des travaux de Suárez-Díaz & Anaya-Muñoz, qui proposent une caractérisation plus technique et détaillée que la nôtre. Leur angle philosophique, centré sur l’étude des formes d’objectivité et de subjectivité en jeu dans cette méthode, est complémentaire à celui que nous proposons ici.

Haut de page

Table des illustrations

Titre Figure 2 : Exemple schématique d’arbre phylogénétique. Les flèches indiquent les nœuds représentant d’hypothétiques ancêtres communs entre les séquences comparées.
URL http://journals.openedition.org/philosophiascientiae/docannexe/image/1957/img-1.jpg
Fichier image/jpeg, 29k
Haut de page

Pour citer cet article

Référence papier

Thomas Bonnin et Jonathan Lombard, « Situer l’analyse phylogénétique entre les sciences historiques et expérimentales »Philosophia Scientiæ, 23-2 | 2019, 131-148.

Référence électronique

Thomas Bonnin et Jonathan Lombard, « Situer l’analyse phylogénétique entre les sciences historiques et expérimentales »Philosophia Scientiæ [En ligne], 23-2 | 2019, mis en ligne le 01 janvier 2021, consulté le 06 septembre 2026. URL : http://journals.openedition.org/philosophiascientiae/1957 ; DOI : https://doi.org/10.4000/philosophiascientiae.1957

Haut de page

Auteurs

Thomas Bonnin

Exeter Centre for the Study of the Life Sciences (Egenis), University of Exeter (Grande-Bretagne)

Jonathan Lombard

Department of Cell and Molecular Biology, Science for Life Laboratory, Uppsala University (Suède)

Haut de page

Droits d’auteur

Le texte et les autres éléments (illustrations, fichiers annexes importés), sont « Tous droits réservés », sauf mention contraire.

Haut de page
Rechercher dans OpenEdition Search

Vous allez être redirigé vers OpenEdition Search