Terme

Seed

Définition courte

Premier lot de sources, petit et choisi avec soin, qui amorce une recherche itérative en produisant un premier état de connaissance.

Définition détaillée

Le mot circule dans plusieurs traditions : en apprentissage automatique, la seed est la valeur qui initialise un générateur aléatoire ; dans la recherche documentaire par boule de neige, le seed set ou start set est l'ensemble de départ dont on suit les références.

Dans les articles de ce blog, le seed désigne le lot initial d'une recherche pilotée par l'état du corpus. Il se définit par sa fonction — faire apparaître ce qui manque — et non par sa couverture. On attend de lui qu'il soit fiable, diversifié, proche du cœur du sujet et assez riche pour qu'une première structure conceptuelle apparaisse.

Usage dans le domaine

Employé au cadrage d'une recherche menée par boucles — préparation d'une conférence, revue de littérature, commande passée à un agent de recherche —, au moment de choisir par quoi commencer.

Synonymes et variantes

« corpus d'amorçage », « lot initial », start set.

À ne pas confondre avec

  • Snowballing — technique qui part d'une source et suit ses références et ses citations. Elle part elle aussi d'un ensemble initial, mais c'est la bibliographie qui décide de la suite ; ici, c'est le diagnostic du corpus.
  • échantillon représentatif — sous-ensemble qui reflète les proportions d'une population. Le seed ne cherche pas à être représentatif, il cherche à rendre les manques visibles.

Exemples

« Partir d'un seed petit mais très qualifié » : quelques sources choisies pour amorcer une recherche qui finira avec 82 sources.

Ambiguïtés / débats

La frontière entre seed et première itération reste floue : un lot initial enrichi trop tôt devient une collecte classique.