Test gauntlet

Un test gauntlet est une pile de validations automatisées que le code — souvent produit par un agent IA — doit traverser avant d’être accepté.

Tests unitaires, tests d’acceptation, couverture, mutation testing, linters, métriques de complexité, contrôles de dépendances, scans de sécurité : chaque couche répond à une question différente. Aucune n’imprime à elle seule un tampon « LE CODE EST BON ». Ensemble, elles rendent visible une partie du travail que l’œil ne peut plus suivre à l’échelle agentique.

Robert C. Martin appelle parfois ces mécanismes des physical barriers : des contraintes concrètes qui limitent ce que l’agent peut produire ou merger sans preuve.

Dans l’atelier

Le gauntlet ne remplace pas le jugement. Il concentre l’attention humaine là où les instruments ne suffisent pas : une spécification mal cadrée, un parcours utilisateur non couvert, une décision d’architecture.

Dans l’approche la plus poussée de la série Clean AI: Agentic Discipline, les humains revoient surtout les spécifications de comportement (Gherkin, procédures QA) ; le code d’implémentation traverse le gauntlet sans relecture ligne à ligne. D’autres équipes garderont un examen ciblé du diff. Le gauntlet reste utile dans les deux cas : il structure quelles preuves doivent exister avant la décision finale.

Exemple

Un agent termine une tâche. Le gauntlet exécute :

acceptance tests    ✅
unit tests          ✅
coverage            ✅  (seuil minimal)
mutation testing    ✅  (sur les zones changées)
lint                ✅
dependency rules    ✅
CRAP gate           ⚠️  (une fonction complexe peu couverte)

Le vert global ne suffit pas : l’alerte CRAP indique où ouvrir la pastèque — quelle zone mérite encore un regard avant merge.

À ne pas confondre

Un test gauntlet n’est pas un pipeline CI générique. C’est une pile choisie et calibrée pour le risque du changement agentique — parfois orchestrée dans un harness ou un golden path.

Ce n’est pas non plus une garantie de correction. Une spec mal revue peut alimenter toute une chaîne disciplinée et produire le mauvais résultat avec élégance.

À retenir

Le gauntlet répond à : sur quelles preuves observables reposons-nous pour accepter ce changement ?

Dans Golden Thread, il prépare l’atelier : l’agent sait quelles commandes lancer, quels seuils respecter, et le développeur reçoit un résultat lisible — pas seulement une colonne de coches vertes.