Idée

Un agent de deep research sans état de ses connaissances ne peut pas choisir sa recherche suivante

Idée principale

Beaucoup de systèmes de deep research suivent une architecture « chercher → extraire → résumer → rédiger ». Même quand ils lancent plusieurs recherches, celles-ci restent des branches d'un plan défini très tôt. La recherche y est une phase qui précède la génération.

Une boucle réellement adaptative exige que l'agent maintienne un état : le périmètre, les connaissances stabilisées, leur provenance et leur niveau de support, les contradictions, les incertitudes, les trous identifiés, les recherches déjà menées, les stratégies qui n'ont rien donné, les zones jugées saturées. C'est cet état qui lui permet de répondre à la seule question utile à chaque pas : quelle recherche maximise maintenant la chance d'un gain de connaissance ?

La profondeur ne remplace pas cet état. Un agent peut lire cent documents en répétant les mêmes biais, explorer énormément sans jamais chercher la source qui contredit sa conclusion centrale, accumuler un contexte gigantesque sans savoir ce qui reste incertain.

Pourquoi c'est important

Cela déplace le critère d'évaluation d'un outil de recherche par IA : non pas combien de sources il lit, mais ce qu'il sait de ce qu'il a compris et de ce qui lui manque.

Et cela dit ce qu'il faut construire en plus d'un pipeline de recherche : une mémoire de l'état de la connaissance, mise à jour à chaque itération et relue avant la suivante.

Nuances et limites

Tenir cet état coûte, en tokens comme en conception, et sur une question simple une recherche linéaire suffit.

Et un état mal tenu — des incertitudes non mises à jour, des zones déclarées saturées à tort — conduit l'agent à des choix plus assurés mais pas plus justes.

Questions ouvertes

  • Sous quelle forme cet état reste-t-il lisible par un humain qui veut contrôler les choix de l'agent ?