Quand on demande à une IA de faire une recherche, le réflexe est souvent le même :
Trouve-moi 20, 30 ou 50 bonnes sources sur ce sujet.
Le problème n'est pas le nombre de sources. Le problème est de décider combien chercher avant de savoir ce qu'il manque réellement.
On accumule alors facilement des documents qui se recouvrent, reprennent les mêmes concepts, citent les mêmes travaux et donnent une impression artificielle de couverture. Pendant ce temps, certains angles restent invisibles parce qu'ils ne sont pas bien représentés dans les premiers résultats.
J'utilise une autre approche : partir d'un corpus très petit mais fortement qualifié, en extraire des connaissances structurées, diagnostiquer ce que ce corpus permet déjà de comprendre — et surtout ce qu'il ne permet pas encore de comprendre — puis laisser cet état déterminer la recherche suivante.
J'appelle cette méthode Stateful Corpus Research Loop, ou SCRL.
Sa logique tient en une phrase :
Ne pas chercher plus de sources. Chercher la prochaine source susceptible de changer ce que l'on sait déjà sur une mission donnée.
1. Le problème n'est pas la recherche en masse
Chercher beaucoup de sources n'est évidemment pas mauvais en soi. Certaines recherches nécessitent des dizaines, voire des centaines de documents.
Le problème apparaît lorsque la stratégie est fixée dès le départ :
scope → 30 sources → lecture → synthèse
Le volume devient alors un proxy de qualité.
Or trente sources peuvent en réalité ne couvrir que quelques idées répétées. Elles peuvent provenir du même type d'acteur, citer les mêmes travaux, utiliser les mêmes hypothèses ou ignorer la même contradiction.
La question intéressante n'est donc pas : combien de sources ai-je ?
C'est : qu'est-ce que mon corpus sait déjà, qu'est-ce qu'il ne sait pas encore, et quelle recherche aurait le plus de chances de modifier cet état ?
Une SCRL inverse donc la logique habituelle.
Au lieu de collecter d'abord et de comprendre ensuite, on comprend suffisamment pour décider ce qu'il faut chercher ensuite.
2. Tout commence par une mission et un scope
Une boucle itérative sans frontière peut devenir infinie.
Chaque nouvelle source ouvre de nouvelles questions. Chaque question conduit à de nouveaux concepts. Et chaque concept peut justifier vingt nouvelles lectures.
Une SCRL commence donc par une mission explicite :
- une question centrale ;
- ce qui est dans le sujet ;
- ce qui est hors sujet ;
- les axes à comprendre ;
- le type de connaissance attendu.
La convergence n'existe jamais dans l'absolu.
On ne peut pas conclure : « nous savons désormais tout ce qu'il faut savoir sur les agents IA ».
On peut seulement conclure : pour cette mission, dans ce périmètre, les nouvelles itérations ont désormais une faible probabilité de modifier substantiellement notre modèle actuel.
Le scope n'est pas une contrainte administrative. C'est ce qui rend possible un critère d'arrêt.
3. Partir d'un seed petit mais très qualifié
Une SCRL ne commence pas par une collecte exhaustive. Elle commence par un seed : quelques sources choisies avec attention.
Ce premier ensemble doit être suffisamment :
- fiable ;
- diversifié ;
- proche du cœur du sujet ;
- riche pour faire apparaître une première structure conceptuelle.
Le seed n'a pas vocation à couvrir le domaine.
Son rôle est plus modeste et plus utile : produire un premier état de connaissance suffisamment bon pour découvrir ce qu'il manque.
Il sert à amorcer la boucle.
4. Transformer les sources en connaissances, pas en résumés
Un document brut est une mauvaise unité de raisonnement.
Un article peut contenir cinq mécanismes indépendants. Deux documents très différents peuvent soutenir exactement la même idée. À l'inverse, une même source peut contenir une affirmation solide, une hypothèse spéculative et une définition ambiguë.
Il faut donc une couche intermédiaire entre les sources et le livrable.
Dans mon système, cette couche repose principalement sur trois types de notes déjà détaillés sur ce blog :
- une note atomique stabilise une unité de connaissance autonome, avec un seul centre de gravité intellectuel ; Qu'est-ce qu'une note atomique ?
- une note thématique relie plusieurs connaissances pour produire une compréhension supplémentaire ; Qu'est-ce qu'une note thématique ?
- une entrée de glossaire stabilise le sens d'un terme lorsqu'une ambiguïté peut modifier l'interprétation du corpus. Qu'est-ce qu'une entrée de glossaire ?
Une SCRL ne pilote donc pas la recherche directement depuis une pile de documents.
Elle la pilote depuis la connaissance déjà extraite et structurée.
5. Le corpus devient stateful
Après la première ingestion, le corpus possède un état.
Il peut progressivement représenter :
- ce qui semble établi ;
- ce qui reste faiblement documenté ;
- ce qui dépend d'une seule source ;
- ce qui reste incertain ;
- les contradictions ;
- les ambiguïtés terminologiques ;
- les mécanismes encore mal compris ;
- les limites déjà identifiées ;
- les zones surreprésentées ;
- les zones presque absentes ;
- les relations entre plusieurs parties du corpus.
Cet état devient l'entrée de la décision suivante.
Mission / scope → Seed qualifié → Sources → Notes → État du corpus → Diagnostic → Recherche ciblée → Nouvelles sources → Mise à jour du corpus → Test de convergence → nouvelle itération
Le corpus n'est plus seulement le résultat de la recherche.
Il devient le moteur de la recherche suivante.
6. Ce qu'une nouvelle itération peut réellement chercher
Une nouvelle itération ne signifie plus : « trouve-moi encore des articles pertinents ».
Elle reçoit un objectif produit par le diagnostic du corpus.
Une itération peut chercher à :
- élargir — découvrir une dimension importante encore absente ;
- renforcer — ajouter des preuves indépendantes à une connaissance importante ;
- combler un trou — documenter un mécanisme, une étape, une métrique ou une condition encore manquante ;
- chercher la contradiction — trouver volontairement des travaux capables d'invalider ou de limiter ce que le corpus considère déjà comme solide ;
- préciser les limites — déterminer où et quand une affirmation cesse d'être vraie ;
- distinguer les sens concurrents — repérer les termes utilisés différemment selon les auteurs, produits ou disciplines ;
- passer du descriptif au mécanisme — comprendre non seulement ce qui se produit, mais pourquoi et comment ;
- diversifier les preuves — mélanger théorie, benchmark, étude empirique, documentation technique, retour terrain et observation réelle ;
- tester la transférabilité — vérifier si une idée observée dans un domaine tient encore dans un autre ;
- identifier les dépendances — trouver les conditions nécessaires au fonctionnement du mécanisme ;
- chercher les effets de bord — coûts, latence, biais, régressions, contraintes organisationnelles ou risques de gouvernance ;
- vérifier l'obsolescence — détecter si une évolution technique invalide une partie du corpus ;
- relier des zones séparées — identifier qu'un même mécanisme traverse plusieurs parties du sujet ;
- rééquilibrer — corriger une conclusion qui paraît forte uniquement parce qu'un type de source est surreprésenté ;
- chercher ce qui pourrait casser le modèle — formuler explicitement la recherche qui, si elle aboutissait, obligerait à revoir une conclusion centrale ;
- mesurer la saturation — tester si une nouvelle recherche produit encore de la connaissance substantielle.
Cette liste est importante parce qu'elle change la fonction de la recherche.
Le moteur de recherche n'a plus pour mission de trouver « de bonnes sources ». Il doit trouver le type de preuve dont le corpus a besoin maintenant.
7. Recherche en masse vs SCRL
Une recherche classique ressemble souvent à ceci :
scope → grande collecte → lecture → extraction → synthèse
Une SCRL ressemble plutôt à ceci :
scope → petit seed → connaissances → diagnostic → recherche suivante déterminée par le diagnostic
La différence n'est donc pas 5 sources contre 50 sources.
Une SCRL peut parfaitement finir avec 100 sources.
La différence est entre :
collecter avant de connaître précisément ses besoins
et
laisser la connaissance déjà acquise déterminer ce qu'il faut chercher ensuite.
8. Une expérience réelle : Adobe Summit Paris 2026
J'ai testé cette approche dans un travail personnel préparatoire autour de l'Adobe Summit Paris 2026.
La mission avait été volontairement bornée à cinq axes :
- Production de contenu et organisation à l'ère agentique — agents, orchestration, supervision humaine, workflows et industrialisation ;
- Contexte de marque et gouvernance du contenu par l'IA — représentation de la marque, contraintes, validation, contexte persistant et contrôle ;
- Documents et systèmes de connaissance interrogables — RAG, retrieval, grounding, citations, contradictions documentaires et production à partir d'un corpus ;
- Web agentique, découvrabilité et visibilité dans les LLM — GEO, citation, attribution, données structurées, distribution et mesure de visibilité ;
- Interfaces conversationnelles et création par intention — langage naturel, contrôle créatif, maintien d'état, manipulation directe et traduction de l'intention en opérations.
La recherche a ensuite évolué par boucles successives.
Au terme de l'expérience :
- 15 itérations de recherche ;
- 82 sources créées dans le corpus ;
- 1 source inexploitable faute d'extraction fiable ;
- 51 notes actives ;
- 34 notes atomiques ;
- 10 entrées de glossaire ;
- 7 notes thématiques ;
- 5 briefs de synthèse, un par axe.
Mais le chiffre intéressant n'est pas 82.
C'est la manière dont le rôle des itérations a changé.
Au début : élargir
Les premières boucles servent surtout à comprendre le terrain. Elles révèlent les concepts, les mécanismes et les premières frontières du sujet.
Au milieu : renforcer et structurer
Les itérations suivantes cherchent de meilleures preuves, séparent certaines idées, comblent des trous et font émerger des relations entre notes.
À la fin : attaquer le modèle
Les dernières itérations changent de nature.
Les itérations 13, 14 et 15 ont surtout servi de tests de rupture.
La question n'était plus : « qu'est-ce qu'on peut encore ajouter ? »
Elle devenait : « qu'est-ce qu'on pourrait trouver qui nous obligerait à revoir ce que nous croyons avoir compris ? »
À la quinzième itération, aucune nouvelle source suffisamment importante n'a été retenue pour modifier le modèle conceptuel des cinq axes.
Cela ne signifie évidemment pas que le sujet était épuisé.
Cela indiquait que, dans le scope défini, le corpus commençait à converger.
9. La convergence : savoir quand arrêter
C'est probablement le bénéfice le plus intéressant de cette approche.
Dans une recherche classique, la question « quand ai-je assez cherché ? » reste souvent sans réponse.
30 sources ? 50 ? 100 ?
Ces nombres ne constituent pas un critère épistémique.
Une SCRL peut utiliser un autre signal.
La recherche commence à converger lorsque les nouvelles itérations :
- ne créent plus de connaissances centrales nouvelles ;
- ne modifient plus significativement les notes importantes ;
- ne révèlent plus de contradiction majeure ;
- ne découvrent plus de trou important dans le scope ;
- ajoutent principalement de la confirmation ou de la redondance ;
- laissent les incertitudes restantes clairement identifiées.
La convergence ne signifie donc pas « nous savons tout ».
Elle signifie : la probabilité qu'une nouvelle itération modifie substantiellement notre représentation actuelle devient faible par rapport au coût de cette itération.
Et ce critère peut être testé.
On peut lancer volontairement des recherches destinées à casser le modèle. Si elles échouent plusieurs fois de suite, le signal de saturation devient beaucoup plus crédible.
10. Ce que cela change pour les agents de recherche
Beaucoup de systèmes de « deep research » suivent encore implicitement une architecture proche de :
search → scrape → summarize → write
Même lorsqu'ils lancent plusieurs recherches, elles restent souvent des branches d'un plan défini très tôt.
Une vraie boucle de recherche adaptative nécessite davantage.
L'agent doit maintenir un état comprenant notamment :
- le scope ;
- les connaissances stabilisées ;
- leur provenance ;
- leur niveau de support ;
- les contradictions ;
- les incertitudes ;
- les trous identifiés ;
- les recherches déjà effectuées ;
- les stratégies qui n'ont rien apporté ;
- les zones considérées comme saturées.
Il peut alors décider :
Quelle recherche maximise maintenant la probabilité d'un gain de connaissance utile ?
L'architecture devient :
scope → mémoire → état du corpus → diagnostic → stratégie de recherche → nouvelles preuves → mise à jour de la connaissance → test de convergence
La recherche n'est plus une phase avant la génération.
Elle devient un système qui met à jour sa propre représentation de ce qu'il sait et utilise cette représentation pour choisir son prochain mouvement.
Stateful plutôt que simplement deep
L'expression deep research met l'accent sur la profondeur.
Mais la profondeur ne garantit pas la qualité.
Un agent peut lire cent documents tout en répétant les mêmes biais. Il peut explorer énormément sans jamais rechercher la source qui contredit sa conclusion centrale. Il peut accumuler un contexte gigantesque sans savoir clairement ce qui reste incertain.
Le changement important n'est donc peut-être pas de chercher plus profondément.
C'est de chercher avec un état.
C'est l'idée de la Stateful Corpus Research Loop.
Le corpus n'est plus une pile de documents.
Il devient une représentation évolutive de la connaissance acquise sur une mission donnée — et cette représentation sert à décider de la prochaine recherche.
La prochaine source doit avoir une raison d'exister
Une bonne recherche ne devrait probablement plus commencer par :
Quels sont les meilleurs articles sur ce sujet ?
Elle devrait progressivement arriver à une question plus exigeante :
Au regard de ce que nous savons déjà, quelle information serait maintenant la plus susceptible de changer notre compréhension ?
C'est une différence subtile.
Mais elle transforme complètement le rôle de la recherche.
Une SCRL ne cherche pas à trouver beaucoup de bonnes sources. Elle cherche à déterminer, à chaque instant, quelle source pourrait encore changer ce que nous savons sur une mission donnée.