Escrito originalmente en francés. Traducido por IA — se ha preservado el sentido, no la prosa.
Cuando le pedimos a una IA que investigue algo, el reflejo suele ser el mismo:
Encuéntrame 20, 30 o 50 buenas fuentes sobre este tema.
El problema no es el número de fuentes. El problema es decidir cuántas buscar antes de saber qué falta realmente.
Así se acumulan con facilidad documentos que se solapan, retoman los mismos conceptos, citan los mismos trabajos y dan una sensación artificial de cobertura. Mientras tanto, algunos ángulos siguen invisibles porque apenas aparecen en los primeros resultados.
Yo uso otro enfoque: partir de un corpus muy pequeño pero muy bien seleccionado, extraer de él conocimiento estructurado, diagnosticar lo que ese corpus ya permite entender — y, sobre todo, lo que todavía no permite entender — y dejar que ese estado determine la siguiente búsqueda.
A este método lo llamo Stateful Corpus Research Loop, o SCRL.
Su lógica cabe en una frase:
No buscar más fuentes. Buscar la próxima fuente capaz de cambiar lo que ya sabemos sobre una misión concreta.
1. El problema no es la investigación masiva
Buscar muchas fuentes no es malo en sí mismo, evidentemente. Algunas investigaciones necesitan decenas, incluso cientos de documentos.
El problema aparece cuando la estrategia se fija desde el principio:
scope → 30 fuentes → lectura → síntesis
El volumen se convierte entonces en un indicador sustituto de la calidad.
Pero treinta fuentes pueden cubrir en realidad solo unas pocas ideas repetidas. Pueden proceder del mismo tipo de actor, citar los mismos trabajos, partir de los mismos supuestos o pasar por alto la misma contradicción.
La pregunta interesante no es, por tanto: ¿cuántas fuentes tengo?
Es: ¿qué sabe ya mi corpus, qué no sabe todavía y qué búsqueda tendría más posibilidades de modificar ese estado?
Una SCRL invierte así la lógica habitual.
En lugar de recopilar primero y entender después, se entiende lo suficiente para decidir qué hay que buscar a continuación.
2. Todo empieza con una misión y un scope
Un bucle iterativo sin fronteras puede volverse infinito.
Cada fuente nueva abre preguntas nuevas. Cada pregunta lleva a conceptos nuevos. Y cada concepto puede justificar veinte lecturas más.
Por eso una SCRL empieza con una misión explícita:
- una pregunta central;
- lo que entra en el tema;
- lo que queda fuera;
- los ejes que hay que entender;
- el tipo de conocimiento que se espera.
La convergencia nunca existe en términos absolutos.
No podemos concluir: "ya sabemos todo lo que hay que saber sobre los agentes de IA".
Solo podemos concluir: para esta misión, dentro de este perímetro, las nuevas iteraciones tienen ya pocas probabilidades de modificar sustancialmente nuestro modelo actual.
El scope no es una restricción administrativa. Es lo que hace posible un criterio de parada.
3. Partir de un seed pequeño pero muy bien seleccionado
Una SCRL no empieza con una recopilación exhaustiva. Empieza con un seed: unas pocas fuentes elegidas con cuidado.
Este primer conjunto tiene que ser suficientemente:
- fiable;
- diverso;
- cercano al núcleo del tema;
- rico como para que aparezca una primera estructura conceptual.
El seed no pretende cubrir el ámbito.
Su papel es más modesto y más útil: producir un primer estado de conocimiento lo bastante bueno como para descubrir qué falta.
Sirve para poner en marcha el bucle.
4. Convertir las fuentes en conocimiento, no en resúmenes
Un documento en bruto es una mala unidad de razonamiento.
Un artículo puede contener cinco mecanismos independientes. Dos documentos muy distintos pueden sostener exactamente la misma idea. Y, a la inversa, una misma fuente puede contener una afirmación sólida, un supuesto especulativo y una definición ambigua.
Hace falta, por tanto, una capa intermedia entre las fuentes y el entregable.
En mi sistema, esa capa se apoya sobre todo en tres tipos de notas que ya he descrito en este blog:
- una nota atómica estabiliza una unidad de conocimiento autónoma, con un único centro de gravedad intelectual; ¿Qué es una nota atómica?
- una nota temática relaciona varios conocimientos para producir una comprensión adicional; ¿Qué es una nota temática?
- una entrada de glosario estabiliza el sentido de un término cuando una ambigüedad puede cambiar la interpretación del corpus. ¿Qué es una entrada de glosario?
Una SCRL no dirige, pues, la investigación directamente desde una pila de documentos.
La dirige desde el conocimiento ya extraído y estructurado.
5. El corpus se vuelve stateful
Tras la primera ingesta, el corpus tiene un estado.
Puede ir representando:
- lo que parece establecido;
- lo que sigue poco documentado;
- lo que depende de una sola fuente;
- lo que sigue siendo incierto;
- las contradicciones;
- las ambigüedades terminológicas;
- los mecanismos aún mal entendidos;
- los límites ya identificados;
- las zonas sobrerrepresentadas;
- las zonas casi ausentes;
- las relaciones entre distintas partes del corpus.
Ese estado se convierte en la entrada de la siguiente decisión.
Misión / scope → Seed bien seleccionado → Fuentes → Notas → Estado del corpus → Diagnóstico → Búsqueda dirigida → Nuevas fuentes → Actualización del corpus → Prueba de convergencia → nueva iteración
El corpus ya no es solo el resultado de la investigación.
Se convierte en el motor de la siguiente búsqueda.
6. Lo que una nueva iteración puede buscar de verdad
Una nueva iteración ya no significa: "encuéntrame más artículos relevantes".
Recibe un objetivo que sale del diagnóstico del corpus.
Una iteración puede buscar:
- ampliar — descubrir una dimensión importante que todavía falta;
- reforzar — añadir evidencias independientes a un conocimiento importante;
- cubrir un hueco — documentar un mecanismo, una etapa, una métrica o una condición que aún falta;
- buscar la contradicción — encontrar a propósito trabajos capaces de invalidar o acotar lo que el corpus ya da por sólido;
- precisar los límites — determinar dónde y cuándo una afirmación deja de ser cierta;
- distinguir los sentidos en competencia — localizar los términos que se usan de forma distinta según los autores, los productos o las disciplinas;
- pasar de lo descriptivo al mecanismo — entender no solo qué ocurre, sino por qué y cómo;
- diversificar las evidencias — combinar teoría, benchmark, estudio empírico, documentación técnica, experiencia de campo y observación real;
- probar la transferibilidad — comprobar si una idea observada en un ámbito sigue valiendo en otro;
- identificar las dependencias — encontrar las condiciones necesarias para que el mecanismo funcione;
- buscar los efectos secundarios — costes, latencia, sesgos, regresiones, restricciones organizativas o riesgos de gobernanza;
- verificar la obsolescencia — detectar si una evolución técnica invalida una parte del corpus;
- conectar zonas separadas — identificar que un mismo mecanismo atraviesa varias partes del tema;
- reequilibrar — corregir una conclusión que parece fuerte solo porque un tipo de fuente está sobrerrepresentado;
- buscar lo que podría romper el modelo — formular de forma explícita la búsqueda que, si diera resultado, obligaría a revisar una conclusión central;
- medir la saturación — comprobar si una nueva búsqueda sigue produciendo conocimiento sustancial.
Esta lista importa porque cambia la función de la búsqueda.
La misión del buscador ya no es encontrar "buenas fuentes". Tiene que encontrar el tipo de evidencia que el corpus necesita ahora.
7. Investigación masiva frente a SCRL
Una investigación clásica suele tener este aspecto:
scope → gran recopilación → lectura → extracción → síntesis
Una SCRL se parece más a esto:
scope → seed pequeño → conocimiento → diagnóstico → siguiente búsqueda determinada por el diagnóstico
La diferencia no está, por tanto, en 5 fuentes frente a 50.
Una SCRL puede perfectamente terminar con 100 fuentes.
La diferencia está entre:
recopilar antes de conocer con precisión lo que se necesita
y
dejar que el conocimiento ya adquirido determine qué hay que buscar a continuación.
8. Una experiencia real: Adobe Summit Paris 2026
Probé este enfoque en un trabajo personal de preparación del Adobe Summit Paris 2026.
La misión se había acotado a propósito a cinco ejes:
- Producción de contenido y organización en la era agéntica — agentes, orquestación, supervisión humana, flujos de trabajo e industrialización;
- Contexto de marca y gobernanza del contenido por la IA — representación de la marca, restricciones, validación, contexto persistente y control;
- Documentos y sistemas de conocimiento consultables — RAG, retrieval, grounding, citas, contradicciones documentales y producción a partir de un corpus;
- Web agéntica, descubribilidad y visibilidad en los LLM — GEO, citación, atribución, datos estructurados, distribución y medición de la visibilidad;
- Interfaces conversacionales y creación por intención — lenguaje natural, control creativo, mantenimiento del estado, manipulación directa y traducción de la intención en operaciones.
A partir de ahí, la investigación avanzó por bucles sucesivos.
Al terminar la experiencia:
- 15 iteraciones de búsqueda;
- 82 fuentes creadas en el corpus;
- 1 fuente inutilizable por falta de una extracción fiable;
- 51 notas activas;
- 34 notas atómicas;
- 10 entradas de glosario;
- 7 notas temáticas;
- 5 briefs de síntesis, uno por eje.
Pero la cifra interesante no es 82.
Es la manera en que cambió el papel de las iteraciones.
Al principio: ampliar
Los primeros bucles sirven sobre todo para entender el terreno. Revelan los conceptos, los mecanismos y las primeras fronteras del tema.
A mitad de camino: reforzar y estructurar
Las iteraciones siguientes buscan mejores evidencias, separan algunas ideas, cubren huecos y hacen surgir relaciones entre notas.
Al final: atacar el modelo
Las últimas iteraciones cambian de naturaleza.
Las iteraciones 13, 14 y 15 sirvieron sobre todo como pruebas de ruptura.
La pregunta ya no era: "¿qué más podemos añadir?"
Pasaba a ser: "¿qué podríamos encontrar que nos obligara a revisar lo que creemos haber entendido?"
En la decimoquinta iteración, no se incorporó ninguna fuente nueva lo bastante importante como para modificar el modelo conceptual de los cinco ejes.
Eso no significa, evidentemente, que el tema estuviera agotado.
Indicaba que, dentro del scope definido, el corpus empezaba a converger.
9. La convergencia: saber cuándo parar
Probablemente sea el beneficio más interesante de este enfoque.
En una investigación clásica, la pregunta "¿cuándo he buscado lo suficiente?" suele quedar sin respuesta.
¿30 fuentes? ¿50? ¿100?
Esas cifras no constituyen un criterio epistémico.
Una SCRL puede usar otra señal.
La investigación empieza a converger cuando las nuevas iteraciones:
- ya no crean conocimiento central nuevo;
- ya no modifican de forma significativa las notas importantes;
- ya no revelan ninguna contradicción importante;
- ya no descubren ningún hueco importante dentro del scope;
- añaden sobre todo confirmación o redundancia;
- dejan las incertidumbres restantes claramente identificadas.
La convergencia no significa, por tanto, "lo sabemos todo".
Significa: la probabilidad de que una nueva iteración modifique sustancialmente nuestra representación actual se vuelve baja en relación con el coste de esa iteración.
Y este criterio se puede poner a prueba.
Podemos lanzar a propósito búsquedas pensadas para romper el modelo. Si fracasan varias veces seguidas, la señal de saturación gana mucha credibilidad.
10. Lo que esto cambia para los agentes de investigación
Muchos sistemas de "deep research" siguen todavía, de forma implícita, una arquitectura parecida a:
search → scrape → summarize → write
Incluso cuando lanzan varias búsquedas, estas suelen ser ramas de un plan definido muy pronto.
Un verdadero bucle de investigación adaptativo necesita algo más.
El agente debe mantener un estado que incluya, entre otras cosas:
- el scope;
- los conocimientos estabilizados;
- su procedencia;
- su nivel de respaldo;
- las contradicciones;
- las incertidumbres;
- los huecos identificados;
- las búsquedas ya realizadas;
- las estrategias que no han aportado nada;
- las zonas que se consideran saturadas.
Entonces puede decidir:
¿Qué búsqueda maximiza ahora la probabilidad de una ganancia de conocimiento útil?
La arquitectura pasa a ser:
scope → memoria → estado del corpus → diagnóstico → estrategia de búsqueda → nuevas evidencias → actualización del conocimiento → prueba de convergencia
La investigación ya no es una fase previa a la generación.
Se convierte en un sistema que actualiza su propia representación de lo que sabe y usa esa representación para elegir su siguiente movimiento.
Stateful antes que simplemente deep
La expresión deep research pone el acento en la profundidad.
Pero la profundidad no garantiza la calidad.
Un agente puede leer cien documentos repitiendo los mismos sesgos. Puede explorar muchísimo sin buscar nunca la fuente que contradice su conclusión central. Puede acumular un contexto gigantesco sin saber con claridad qué sigue siendo incierto.
Quizá el cambio importante no sea, entonces, buscar más a fondo.
Sino buscar con un estado.
Esa es la idea de la Stateful Corpus Research Loop.
El corpus ya no es una pila de documentos.
Se convierte en una representación en evolución del conocimiento adquirido sobre una misión concreta — y esa representación sirve para decidir la siguiente búsqueda.
La próxima fuente tiene que tener una razón de ser
Una buena investigación probablemente ya no debería empezar por:
¿Cuáles son los mejores artículos sobre este tema?
Debería ir llegando a una pregunta más exigente:
A la vista de lo que ya sabemos, ¿qué información tendría ahora más probabilidades de cambiar nuestra comprensión?
Es una diferencia sutil.
Pero transforma por completo el papel de la búsqueda.
Una SCRL no intenta encontrar muchas buenas fuentes. Intenta determinar, en cada momento, qué fuente podría todavía cambiar lo que sabemos sobre una misión concreta.