Idée

La qualité d'une sortie probabiliste se juge sur son acceptabilité, pas seulement sur sa conformité

Idée principale

Une fonctionnalité déterministe se teste par comparaison à un attendu : le résultat est conforme ou il ne l'est pas. Une réponse produite par un modèle n'offre pas cette prise. Deux formulations correctes n'ont pas la même valeur pour l'utilisateur, une réponse fausse peut être parfaitement plausible, et l'expérience de l'échec — ce que le produit fait quand il ne sait pas — devient une partie du produit au même titre que le succès.

Évaluer ce type de sortie porte donc sur des questions qu'aucun jeu de tests de conformité ne couvre : la robustesse face aux cas tordus, la cohérence avec l'intention produit, la confiance que l'utilisateur peut raisonnablement accorder, et ce qu'il est prêt à accepter comme marge d'erreur dans son métier.

C'est pourquoi ramener cette évaluation à de l'assurance qualité classique la vide de sa substance : la question n'est pas seulement « la sortie est-elle juste ? » mais « cette sortie est-elle acceptable, ici, pour cet usage ? » — une question de produit, pas de vérification.

Pourquoi c'est important

Cela dit à qui revient l'évaluation : elle ne peut pas être entièrement déléguée à une fonction de contrôle en fin de chaîne, puisqu'elle demande de trancher sur l'intention et sur ce que l'utilisateur tolère.

Et cela rend testable ce que beaucoup d'équipes renoncent à mesurer : la confiance et l'acceptabilité se travaillent avec des cas métier, des scénarios d'échec et des critères écrits, pas avec une impression générale de qualité.

Nuances et limites

L'acceptabilité n'exonère pas de la conformité : sur les règles vérifiables — un calcul, un droit d'accès, un format —, l'exigence reste binaire et l'argument probabiliste ne doit pas servir d'excuse.

Et le seuil d'acceptabilité n'appartient pas à l'équipe qui produit : il se constate auprès de ceux qui utilisent, et il varie selon le métier, l'enjeu et la réversibilité de ce que la sortie déclenche.

Questions ouvertes

  • Comment fixer par écrit un seuil d'acceptabilité, quand ce qui se joue est la confiance d'un utilisateur et non un taux d'erreur observable ?