Idée principale
Demander à un assistant IA « trouve-moi trente bonnes sources sur ce sujet », c'est décider de la taille de la recherche avant de savoir ce qui manque. Le nombre devient alors l'indicateur implicite de la qualité : trente sources donnent l'impression d'une couverture.
Or trente documents peuvent ne porter que quelques idées répétées. Ils peuvent venir du même type d'acteur, citer les mêmes travaux, partager les mêmes hypothèses et ignorer la même contradiction. Le volume mesure l'effort de collecte, pas l'étendue de ce qui a été compris — et les angles mal représentés dans les premiers résultats restent invisibles, quel que soit le nombre de documents rassemblés.
Le problème n'est pas le grand nombre de sources : certaines recherches en exigent des centaines. C'est de le fixer d'avance, sur la séquence « périmètre → trente sources → lecture → synthèse », au lieu de le laisser découler de ce que la recherche découvre.
Pourquoi c'est important
Cela corrige un réflexe très répandu dans la commande passée à un outil de recherche : la question pertinente n'est pas « combien de sources ai-je ? » mais « qu'est-ce que mon corpus sait déjà, et qu'est-ce qu'il ignore ? ».
Et cela explique pourquoi un corpus volumineux peut être plus pauvre qu'un corpus court : la redondance produit de la confirmation, pas de la connaissance.
Nuances et limites
Un nombre fixé d'avance reste utile comme budget — une limite de coût ou de temps. Il devient un problème quand on le lit comme une preuve de couverture.
Et un corpus redondant n'est pas inutile en soi : des preuves indépendantes qui convergent renforcent une affirmation. C'est la redondance non voulue, prise pour de la diversité, qui trompe.
Questions ouvertes
- Comment détecter, sans tout relire, qu'un ensemble de sources ne fait que répéter les mêmes travaux sous des signatures différentes ?