IA & contextoConhecimento & notas

Stateful Corpus Research Loop: parar de colecionar fontes

Saber o que buscar em seguida e, principalmente, quando parar. Em vez de fixar de antemão 30 ou 50 fontes, você parte de um corpus pequeno e bem selecionado, extrai dele conhecimento estruturado e deixa que o que ele sabe — e o que ele ignora — escolha a próxima busca. Resultado: menos redundância, pontos cegos visíveis e um critério de parada testável.

Info

Escrito originalmente em francês. Traduzido por IA — o sentido foi preservado, não a prosa.

Quando pedimos a uma IA que faça uma pesquisa, o reflexo costuma ser o mesmo:

Me encontre 20, 30 ou 50 boas fontes sobre este assunto.

O problema não é o número de fontes. O problema é decidir quanto buscar antes de saber o que realmente está faltando.

Aí fica fácil acumular documentos que se sobrepõem, retomam os mesmos conceitos, citam os mesmos trabalhos e dão uma impressão artificial de cobertura. Enquanto isso, alguns ângulos continuam invisíveis porque não aparecem bem nos primeiros resultados.

Eu uso outra abordagem: partir de um corpus bem pequeno, mas muito bem selecionado, extrair dele conhecimento estruturado, diagnosticar o que esse corpus já permite entender — e, principalmente, o que ele ainda não permite entender — e deixar que esse estado determine a próxima busca.

Chamo esse método de Stateful Corpus Research Loop, ou SCRL.

A lógica dele cabe numa frase:

Não buscar mais fontes. Buscar a próxima fonte capaz de mudar o que já sabemos sobre uma missão.

1. O problema não é a pesquisa em massa

Buscar muitas fontes, claro, não é ruim em si. Algumas pesquisas exigem dezenas, às vezes centenas de documentos.

O problema aparece quando a estratégia é fixada logo de saída:

escopo → 30 fontes → leitura → síntese

O volume vira então um indicador indireto de qualidade.

Só que trinta fontes podem, na prática, cobrir apenas algumas ideias repetidas. Podem vir do mesmo tipo de ator, citar os mesmos trabalhos, partir das mesmas premissas ou ignorar a mesma contradição.

A pergunta interessante, portanto, não é: quantas fontes eu tenho?

É: o que o meu corpus já sabe, o que ele ainda não sabe, e qual busca teria mais chance de mudar esse estado?

Uma SCRL inverte a lógica habitual.

Em vez de coletar primeiro e entender depois, você entende o bastante para decidir o que precisa buscar em seguida.

2. Tudo começa com uma missão e um escopo

Um loop iterativo sem fronteira pode virar infinito.

Cada nova fonte abre novas perguntas. Cada pergunta leva a novos conceitos. E cada conceito pode justificar vinte novas leituras.

Por isso, uma SCRL começa com uma missão explícita:

  • uma pergunta central;
  • o que está dentro do assunto;
  • o que está fora do assunto;
  • os eixos a entender;
  • o tipo de conhecimento esperado.

A convergência nunca existe em termos absolutos.

Não dá para concluir: "agora sabemos tudo o que é preciso saber sobre agentes de IA".

Dá apenas para concluir: para esta missão, dentro deste escopo, as novas iterações agora têm pouca probabilidade de mudar de forma substancial o nosso modelo atual.

O escopo não é uma restrição burocrática. É o que torna possível um critério de parada.

3. Partir de um seed pequeno, mas muito bem selecionado

Uma SCRL não começa com uma coleta exaustiva. Ela começa com um seed: algumas fontes escolhidas com cuidado.

Esse primeiro conjunto precisa ser suficientemente:

  • confiável;
  • diversificado;
  • próximo do núcleo do assunto;
  • rico para fazer aparecer uma primeira estrutura conceitual.

O seed não tem a função de cobrir o domínio.

O papel dele é mais modesto e mais útil: produzir um primeiro estado de conhecimento bom o bastante para descobrir o que está faltando.

Ele serve para dar a partida no loop.

4. Transformar as fontes em conhecimento, não em resumos

Um documento bruto é uma péssima unidade de raciocínio.

Um artigo pode conter cinco mecanismos independentes. Dois documentos muito diferentes podem sustentar exatamente a mesma ideia. No sentido inverso, uma mesma fonte pode conter uma afirmação sólida, uma premissa especulativa e uma definição ambígua.

É preciso, portanto, uma camada intermediária entre as fontes e o entregável.

No meu sistema, essa camada se apoia sobretudo em três tipos de nota que já detalhei neste blog:

Uma SCRL, portanto, não conduz a pesquisa diretamente a partir de uma pilha de documentos.

Ela a conduz a partir do conhecimento já extraído e estruturado.

5. O corpus se torna stateful

Depois da primeira ingestão, o corpus tem um estado.

Aos poucos, ele consegue representar:

  • o que parece estabelecido;
  • o que continua pouco documentado;
  • o que depende de uma única fonte;
  • o que continua incerto;
  • as contradições;
  • as ambiguidades terminológicas;
  • os mecanismos ainda mal compreendidos;
  • os limites já identificados;
  • as áreas super-representadas;
  • as áreas quase ausentes;
  • as relações entre várias partes do corpus.

Esse estado vira a entrada da decisão seguinte.

↻ Stateful Corpus Research Loop

Missão / escopo → Seed bem selecionado → Fontes → Notas → Estado do corpus → Diagnóstico → Busca direcionada → Novas fontes → Atualização do corpus → Teste de convergência → nova iteração

O corpus deixa de ser apenas o resultado da pesquisa.

Ele vira o motor da próxima busca.

6. O que uma nova iteração pode realmente buscar

Uma nova iteração deixa de significar: "me encontre mais artigos relevantes".

Ela recebe um objetivo produzido pelo diagnóstico do corpus.

Uma iteração pode tentar:

  • ampliar — descobrir uma dimensão importante que ainda está ausente;
  • reforçar — acrescentar evidências independentes a um conhecimento importante;
  • preencher uma lacuna — documentar um mecanismo, uma etapa, uma métrica ou uma condição que ainda está faltando;
  • procurar a contradição — encontrar de propósito trabalhos capazes de invalidar ou limitar o que o corpus já considera sólido;
  • definir com precisão os limites — determinar onde e quando uma afirmação deixa de ser verdadeira;
  • distinguir sentidos concorrentes — identificar os termos usados de forma diferente conforme os autores, os produtos ou as disciplinas;
  • passar do descritivo ao mecanismo — entender não só o que acontece, mas por que e como;
  • diversificar as evidências — misturar teoria, benchmark, estudo empírico, documentação técnica, relato de campo e observação real;
  • testar a transferibilidade — verificar se uma ideia observada num domínio ainda se sustenta em outro;
  • identificar as dependências — encontrar as condições necessárias para o mecanismo funcionar;
  • procurar os efeitos colaterais — custos, latência, vieses, regressões, restrições organizacionais ou riscos de governança;
  • verificar a obsolescência — detectar se uma evolução técnica invalida uma parte do corpus;
  • ligar áreas separadas — perceber que um mesmo mecanismo atravessa várias partes do assunto;
  • reequilibrar — corrigir uma conclusão que só parece forte porque um tipo de fonte está super-representado;
  • procurar o que poderia quebrar o modelo — formular explicitamente a busca que, se desse resultado, obrigaria a rever uma conclusão central;
  • medir a saturação — testar se uma nova busca ainda produz conhecimento substancial.

Essa lista importa porque muda a função da pesquisa.

A função do mecanismo de busca deixa de ser encontrar "boas fontes". Ele precisa encontrar o tipo de evidência de que o corpus precisa agora.

7. Pesquisa em massa vs SCRL

Uma pesquisa clássica costuma se parecer com isto:

escopo → grande coleta → leitura → extração → síntese

Uma SCRL se parece mais com isto:

escopo → seed pequeno → conhecimento → diagnóstico → próxima busca determinada pelo diagnóstico

A diferença, portanto, não é 5 fontes contra 50 fontes.

Uma SCRL pode muito bem terminar com 100 fontes.

A diferença está entre:

coletar antes de saber com precisão do que você precisa

e

deixar o conhecimento já adquirido determinar o que buscar em seguida.

8. Uma experiência real: Adobe Summit Paris 2026

Testei essa abordagem num trabalho pessoal de preparação para o Adobe Summit Paris 2026.

A missão foi limitada de propósito a cinco eixos:

  1. Produção de conteúdo e organização na era agêntica — agentes, orquestração, supervisão humana, workflows e industrialização;
  2. Contexto de marca e governança do conteúdo pela IA — representação da marca, restrições, validação, contexto persistente e controle;
  3. Documentos e sistemas de conhecimento consultáveis — RAG, retrieval, grounding, citações, contradições documentais e produção a partir de um corpus;
  4. Web agêntica, descobribilidade e visibilidade nos LLM — GEO, citação, atribuição, dados estruturados, distribuição e medição de visibilidade;
  5. Interfaces conversacionais e criação por intenção — linguagem natural, controle criativo, manutenção de estado, manipulação direta e tradução da intenção em operações.

A pesquisa evoluiu então por loops sucessivos.

No fim da experiência:

  • 15 iterações de busca;
  • 82 fontes criadas no corpus;
  • 1 fonte inutilizável por falta de uma extração confiável;
  • 51 notas ativas;
  • 34 notas atômicas;
  • 10 entradas de glossário;
  • 7 notas temáticas;
  • 5 briefs de síntese, um por eixo.

Mas o número interessante não é 82.

É a forma como o papel das iterações mudou.

No início: ampliar

Os primeiros loops servem sobretudo para entender o terreno. Eles revelam os conceitos, os mecanismos e as primeiras fronteiras do assunto.

No meio: reforçar e estruturar

As iterações seguintes buscam evidências melhores, separam algumas ideias, preenchem lacunas e fazem surgir relações entre notas.

No fim: atacar o modelo

As últimas iterações mudam de natureza.

As iterações 13, 14 e 15 serviram sobretudo como testes de ruptura.

A pergunta já não era: "o que ainda dá para acrescentar?"

Passou a ser: "o que poderíamos encontrar que nos obrigaria a rever o que achamos que entendemos?"

Na décima quinta iteração, nenhuma nova fonte importante o bastante foi selecionada para modificar o modelo conceitual dos cinco eixos.

Isso evidentemente não significa que o assunto estava esgotado.

Indicava que, dentro do escopo definido, o corpus começava a convergir.

9. A convergência: saber quando parar

Esse é provavelmente o benefício mais interessante dessa abordagem.

Numa pesquisa clássica, a pergunta "quando já busquei o bastante?" muitas vezes fica sem resposta.

30 fontes? 50? 100?

Esses números não constituem um critério epistêmico.

Uma SCRL pode usar outro sinal.

A pesquisa começa a convergir quando as novas iterações:

  • não criam mais conhecimento central novo;
  • não modificam mais de forma significativa as notas importantes;
  • não revelam mais nenhuma contradição grave;
  • não descobrem mais lacunas importantes no escopo;
  • acrescentam principalmente confirmação ou redundância;
  • deixam as incertezas restantes claramente identificadas.

Convergência, portanto, não significa "sabemos tudo".

Significa: a probabilidade de que uma nova iteração modifique de forma substancial a nossa representação atual fica baixa diante do custo dessa iteração.

E esse critério pode ser testado.

Dá para lançar de propósito buscas feitas para quebrar o modelo. Se elas fracassam várias vezes seguidas, o sinal de saturação fica muito mais crível.

10. O que isso muda para os agentes de pesquisa

Muitos sistemas de "deep research" ainda seguem, implicitamente, uma arquitetura parecida com:

search → scrape → summarize → write

Mesmo quando lançam várias buscas, elas costumam continuar sendo ramificações de um plano definido muito cedo.

Um loop de pesquisa realmente adaptativo exige mais do que isso.

O agente precisa manter um estado que inclua, entre outras coisas:

  • o escopo;
  • o conhecimento estabilizado;
  • a proveniência dele;
  • o grau de respaldo dele;
  • as contradições;
  • as incertezas;
  • as lacunas identificadas;
  • as buscas já realizadas;
  • as estratégias que não trouxeram nada;
  • as áreas consideradas saturadas.

Aí ele pode decidir:

Qual busca maximiza agora a probabilidade de um ganho de conhecimento útil?

A arquitetura passa a ser:

escopo → memória → estado do corpus → diagnóstico → estratégia de busca → novas evidências → atualização do conhecimento → teste de convergência

A pesquisa deixa de ser uma fase anterior à geração.

Ela vira um sistema que atualiza a própria representação do que sabe e usa essa representação para escolher o próximo movimento.

Stateful, e não simplesmente deep

A expressão deep research põe o foco na profundidade.

Mas profundidade não garante qualidade.

Um agente pode ler cem documentos e repetir os mesmos vieses. Pode explorar muito sem nunca procurar a fonte que contradiz a sua conclusão central. Pode acumular um contexto gigantesco sem saber com clareza o que continua incerto.

A mudança importante talvez não seja, então, buscar mais fundo.

É buscar com um estado.

Essa é a ideia da Stateful Corpus Research Loop.

O corpus deixa de ser uma pilha de documentos.

Ele vira uma representação em evolução do conhecimento adquirido sobre uma missão — e essa representação serve para decidir a próxima busca.

A próxima fonte precisa ter uma razão de existir

Uma boa pesquisa provavelmente não deveria mais começar por:

Quais são os melhores artigos sobre este assunto?

Ela deveria chegar, aos poucos, a uma pergunta mais exigente:

Diante do que já sabemos, que informação teria agora mais chance de mudar a nossa compreensão?

É uma diferença sutil.

Mas ela transforma por completo o papel da pesquisa.

Uma SCRL não tenta encontrar muitas boas fontes. Ela tenta determinar, a cada momento, qual fonte ainda poderia mudar o que sabemos sobre uma missão.