BootLoops : vérifier les calculs de l’IA ne suffit pas à faire de la science
BootLoops associe les modèles de langage à des outils de calcul contrôlables. Les chercheurs restent nécessaires pour choisir les questions et interpréter les résultats.
Sur quoi repose cet articleExplication
Type de travail
Article d’explication
À garder en tête
Une synthèse des connaissances : suivez les sources pour aller plus loin.
Matthew Schwartz rapporte avoir traité avec Claude et BootLoops 30 intégrales de physique mathématique en quelques semaines : 15 reproductions de résultats connus et 15 calculs qu’il présente comme inédits. L’intérêt de cette approche tient à la possibilité de contrôler les réponses avec des outils numériques. Mais une réponse correcte ne devient pas automatiquement un résultat scientifique intéressant : dans les autres disciplines explorées, les spécialistes ont souvent dû réorienter le travail.[1]
Des logiciels pour calculer, des protocoles pour contrôler
BootLoops n’est pas un nouveau modèle d’IA. C’est un ensemble de logiciels et de protocoles qui encadre le travail d’un modèle de langage : outils de calcul, tests et critères d’acceptation des résultats. Son site le présente comme utilisable avec Claude, Gemini ou ChatGPT, indépendamment de leur version. Le modèle peut ainsi mobiliser des méthodes scientifiques réunies dans un cadre commun, plutôt que produire seulement une réponse textuelle.[2]
Les premiers calculs concernent des intégrales de Feynman, des objets mathématiques qui interviennent dans les prédictions des interactions entre particules. La méthode ne consiste pas toujours à effectuer directement toute l’intégration. Elle impose d’abord des contraintes physiques et mathématiques pour restreindre les expressions possibles, puis utilise des calculs numériques de haute précision pour déterminer les coefficients encore inconnus.[1][2]
Le contrôle repose alors sur deux voies de calcul : un logiciel évalue numériquement l’intégrale d’origine, tandis qu’un autre évalue la formule obtenue. Pour les amplitudes étudiées, le site de BootLoops fixe un accord d’au moins 30 chiffres, souvent 100, à des points qui n’ont pas servi à ajuster la formule. Ce test porte sur les calculs concernés. Il ne constitue ni une garantie universelle de fiabilité de l’IA ni, à lui seul, une preuve symbolique de toute identité mathématique.[2]
Réutiliser une méthode là où la même intégrale apparaît
Le rôle du modèle de langage est aussi de repérer des liens entre des disciplines qui utilisent des mathématiques similaires. Schwartz cite la phylogénétique, qui reconstruit les liens de parenté entre espèces à partir de leur ADN. Pour comparer des arbres de parenté possibles, les chercheurs calculent notamment une intégrale qui mesure dans quelle mesure chaque arbre rend compte des données. Selon son récit, cette intégrale appartient à la famille de problèmes pour laquelle BootLoops a été construit.[1]
Ce transfert ne signifie pas que l’outil sait résoudre n’importe quel problème scientifique. Il dépend d’une question adaptée, de méthodes disponibles et d’un résultat contrôlable. Schwartz souligne lui-même que les outils d’IA actuels ne peuvent pas résoudre la plupart des problèmes en science. La diversité des applications rapportées montre donc une stratégie de réutilisation des méthodes, pas une compétence générale de chercheur autonome.[1][2]
Les spécialistes choisissent ce qui mérite d’être étudié
L’exemple de l’écologie montre la différence entre réussir un calcul et poser une question utile. Dans le récit de Schwartz, Claude a résolu une équation de la théorie neutre de la biodiversitéBiodiversité La biodiversité désigne l'intégralité du tissu vivant de notre planète, englobant la diversité génétique au sein des populations, la variété des espèces animales, végétales et microbiennes, ainsi que la multiplicité…, qui étudie ce que le hasard peut expliquer dans l’évolution des communautés d’espèces. Le résultat appliqué à une forêt indiquait que cette théorie ne rendait pas compte du rythme des changements observés. Mais l’écologue James O’Dwyer lui a expliqué que les spécialistes connaissaient déjà, de manière plus qualitative, cette insuffisance.[1]
O’Dwyer a proposé de soustraire la prédiction de la théorie neutre pour étudier ce qui restait : les différences liées aux espèces, à la compétition ou à la sélection naturelle. Les deux chercheurs ont ensuite travaillé avec Claude à un nouveau modèle. L’apport humain n’était donc pas seulement de corriger le code. Il consistait à replacer le calcul dans les connaissances du domaine et à reformuler l’objectif pour obtenir un résultat susceptible d’intéresser les écologues.[1]
Des contrôles humains et un témoignage à situer
Même avec des tests, Schwartz recommande d’examiner directement les résultats, notamment les graphiques, et de questionner les conclusions. Il rapporte que ses contrôles automatisés ne sont pas toujours fiables et que Claude peut tirer une conclusion erronée d’un calcul. La vérification doit donc porter à la fois sur la réponse numérique et sur ce qu’on prétend lui faire dire.[1]
Les projets décrits demandent aussi beaucoup de calcul et de jetons, les unités de texte traitées par le modèle. Schwartz explique qu’une partie de cette dépense vient de la construction d’outils réutilisables au-delà d’un projet. Son témoignage ne permet donc pas de présenter la méthode comme peu coûteuse, même si la mutualisation des logiciels vise à éviter que chaque utilisateur reparte de zéro.[1]
Enfin, les résultats présentés ici proviennent du témoignage de Schwartz publié sur le site d’Anthropic et de la présentation de BootLoops, pas d’une validation indépendante ni d’une étude évaluée par les pairs établissant les performances de l’ensemble. Schwartz déclare avoir été chercheur invité chez Anthropic pendant le projet. Le site de BootLoops indique également un financement de l’entreprise, tout en précisant que l’outil appartient à Schwartz, qui le maintient, et n’est pas un projet d’Anthropic.[1][2]



![Inscription « DevDay 2026 [Recap] » sur fond noir, entourée de cercles colorés portant des signes graphiques.](https://media.scienceactu.com/2026/10/scienceactu-20261001-openai-devday-2026-sol-agents-api-dots-1024x576.webp)





La discussion