A IA pode aprender a pesquisar melhor.

O Dream-RSI transforma o histórico de experimentos em um ambiente de replay para melhorar a escolha dos próximos caminhos de pesquisa.

Guia independente INEMA · Fontes conferidas em 19 set. 2026
Leitura introdutória · Figuras originais dos autores

Figura original: explorar com um agente, registrar a árvore, simular políticas e voltar à exploração.
O ciclo de pesquisa do Dream-RSI. Figura 1, Zheng et al. (2026). Fonte original ↗

O próximo experimento também é uma decisão.

Executar uma ideia com perfeição não garante que ela mereça ser testada. Na pesquisa com IA, escolher onde insistir, abrir alternativas ou parar pode fazer tanta diferença quanto escrever um bom programa.

Imagine um mapa de tentativas

Cada experimento deixa um caminho e um resultado. Quem pesquisa depois pode percorrer esse mapa, comparar decisões e aproveitar o que já foi medido. A analogia ajuda a entender o método, mas o mapa real é feito de registros estruturados de execuções.

Quem melhora é a estratégia

Uma política de exploração é a regra que decide como distribuir tentativas. No Dream-RSI, essa política é código modificável. O agente de programação e o avaliador permanecem fixos durante a comparação controlada.

A distinção que orienta este guia: o estudo demonstra autoaperfeiçoamento na organização da busca. Ele não demonstra um modelo reescrevendo seus próprios pesos nem uma explosão autônoma de inteligência. Método no artigo ↗

Uma volta produz o mapa da próxima.

O processo alterna trabalho real e avaliação sobre registros. As duas fases têm funções diferentes.

1

Explorar e registrar

A política atual orienta o agente. Programas são criados e avaliados; tentativas, relações e resultados formam uma árvore. Esta fase consome execuções reais.

2

Transformar o histórico em replay

A árvore vira um ambiente consultável. Uma política pode visitar os ramos em outra ordem e escolher quando interrompê-los, usando os resultados que já existem.

3

Comparar políticas candidatas

Um agente desenvolve variações do código de exploração. O replay fornece feedback para selecionar uma política com boa relação entre qualidade, trabalho e paralelismo.

4

Voltar à pesquisa e ampliar o histórico

A política selecionada orienta a rodada seguinte. Novas execuções acrescentam árvores ao conjunto de simuladores. A melhoria da estratégia e a expansão do histórico fecham o ciclo.

HistóricoReplayPolíticaExperimento realNovo histórico

Veja o mecanismo nas figuras dos autores.

Imagens baixadas do site original e preservadas, com leitura orientada em português. Clique em uma figura para abrir em tamanho completo.

O histórico vira um simulador. À esquerda, tentativas reais constroem a árvore. À direita, outras políticas percorrem partes dessa mesma árvore. O replay muda as decisões de navegação, sem fabricar resultados para ramos desconhecidos.
O histórico vira um simulador. À esquerda, tentativas reais constroem a árvore. À direita, outras políticas percorrem partes dessa mesma árvore. O replay muda as decisões de navegação, sem fabricar resultados para ramos desconhecidos. Figura 2, Zheng et al. (2026). Fonte ↗
Menos chamadas, programas com menor tempo de execução. Leia dois eixos: o horizontal conta chamadas ao agente de descoberta; o vertical mede o tempo médio dos programas resultantes em dados de teste. Ir para baixo e para a esquerda é desejável neste gráfico.
Menos chamadas, programas com menor tempo de execução. Leia dois eixos: o horizontal conta chamadas ao agente de descoberta; o vertical mede o tempo médio dos programas resultantes em dados de teste. Ir para baixo e para a esquerda é desejável neste gráfico. Figura 3(b), Zheng et al. (2026). Fonte ↗

O que foi medido — e contra quem.

O artigo avalia oito tarefas em três domínios. Não há uma métrica única: tempo de execução, chamadas ao agente e qualidade da solução respondem a perguntas diferentes.

Lasso · Valores reportados na Figura 3(a). Menor é melhor nas duas colunas numéricas.
Política / modeloChamadas de descobertaTempo médio final (ms)
Fixa · Gemini-3.1-Pro5503.587,1
Dream-RSI · Gemini-3.1-Pro3172.931,0
Fixa · Gemini-3.7-Flash3.2002.516,7
Dream-RSI · Gemini-3.7-Flash1.8792.350,6

O tempo médio reúne seis datasets de teste. “Compute” nessa tabela significa número acumulado de chamadas, e não dólares, energia ou tempo total de toda a pesquisa. Os nomes dos modelos foram mantidos como publicados pelos autores. Artigo, seção 4.1 ↗

Compare a mesma base.

Visualização dos números publicados. Não executa IA nem estima uma conta financeira.

Exploração fixa550 chamadas
Dream-RSI317 chamadas
42,4% menos chamadas de descoberta.

Tempo médio final: de 3.587,1 para 2.931,0 ms.

O número de 162× tem contexto

Ele compara 51.200 chamadas do SimpleTES com 317 do Dream-RSI no Lasso. As bases usam modelos diferentes; não é a comparação controlada de mudar apenas a política. Não use esse fator como promessa geral de economia.

Também há resultados sem vitória

Em matemática, Dream-RSI melhora o resultado de soma–diferença e empata em empacotamento de círculos entre os métodos listados. Em autocorrelação, o SimpleTES mantém o melhor valor; Dream-RSI usa um orçamento menor de gerações.

Quatro gráficos KernelBench: VGG16 e LayerNorm com menos gerações; ConvDiv e ConvMax com mais desempenho em orçamento comparável.
Outro domínio, outras comparações. VGG16: 2,43× menos gerações; LayerNorm: 1,79×, com desempenho comparável. ConvDiv e ConvMax: 2,09× e 1,44× mais desempenho, respectivamente, em orçamentos comparáveis. Figura 4, Zheng et al. Fonte ↗
Evolução no ConvDiv: melhora do melhor resultado por rodada e variação da quantidade de tentativas avaliadas.
O esforço se adapta. Nesta execução ConvDiv, as tentativas diminuem e depois aumentam. É um comportamento observado, não uma regra universal “progresso fácil = menos compute”. Figura 6, Zheng et al. Fonte ↗

Entender também é saber onde a ideia termina.

O replay não vê o futuro.

Ele responde sobre o espaço já percorrido. Um ramo nunca executado não ganha um resultado confiável só porque existe uma simulação. Por isso, novas rodadas reais continuam necessárias.

Zero novas execuções não significa custo total zero.

O histórico precisou ser produzido. Gerar e revisar políticas, armazenar registros e executar replay também requer recursos. A economia reportada em chamadas de descoberta não mede toda essa conta.

Uma política melhor no histórico pode falhar fora dele.

Incluir a política atual entre as candidatas permite escolher uma que não piore a pontuação naquele replay. Isso não garante o mesmo resultado em novas tarefas. O plano educativo separa árvores de desenvolvimento e teste para tornar esse risco visível.

O agente não pode consultar a resposta antes de decidir.

O apêndice B restringe a política ao prefixo observado: apenas os nós já revelados podem orientar a próxima decisão. Escolher ramos olhando os resultados ocultos seria vazamento de informação e invalidaria a comparação.

“Menos orientação foi melhor” tem um escopo.

A ablação do estudo testa uma forma específica de inserir resumos direcionais de trajetórias nos prompts. Esse mecanismo prejudicou o resultado nas condições avaliadas. Não é evidência de que toda instrução, memória ou orientação seja ruim.

A história da IA é uma analogia, não o dataset deste estudo.

Hinton, GPUs, Transformers, AlphaGo e AlphaFold ajudam a discutir dependências entre descobertas. O Dream-RSI apresentado utiliza árvores registradas nas tarefas de descoberta; não simula toda a história da ciência, nem demonstra redescobrir o futuro com um corte histórico de conhecimento.

Estado do trabalho: preprint de setembro de 2026. Na consulta de 19/09, o repositório oficial ainda anunciava a preparação do código completo. Este guia é uma análise educativa independente, sem afiliação com Google ou DeepMind. Consultar o status atual ↗

Onde o AlphaEvolve entra nessa história.

O AlphaEvolve combina modelos de linguagem e avaliação automática em um processo evolutivo de programas. O Dream-RSI enfatiza como melhorar a política que organiza a exploração. Ambos participam da pesquisa automatizada, mas seus mecanismos e resultados precisam ser apresentados separadamente.

A DeepMind relata que uma heurística descoberta pelo AlphaEvolve para o Borg recupera, em média, 0,7% dos recursos computacionais globais do Google. A fonte não converte esse resultado em “milhões de dólares”; essa estimativa do narrador não será usada como fato.

Ler o relato original da DeepMind ↗

Uma pergunta para testar sua leitura.

Uma política foi melhor em todas as árvores históricas disponíveis. O que podemos concluir?

Escolha uma resposta para ver a explicação.

Um projeto para aprender a avaliar descobertas.

Proposta: um laboratório educativo em português que começa com leitura visual e evolui para experimentos de decisão. O guia e a atividade acima já estão disponíveis; as etapas abaixo são o plano de expansão.

Disponível
Guia com fontes e evidênciasExplicação do ciclo, cinco figuras originais, comparação interativa de Lasso, limites e verificação de compreensão.
Etapa 1
Sequência de oito encontrosDecisão científica → árvores → replay → políticas → recursão → métricas → limites → projeto final. Cada encontro terá uma pergunta, uma atividade e uma evidência de aprendizagem.
Etapa 2
Laboratório de replay didáticoÁrvores sintéticas, orçamento fixo e estratégias comparáveis. Resultados ocultos até a visita; cenários de teste separados. Será uma simulação educativa, não uma reprodução do paper.
Etapa 3
Caderno de leitura críticaExercícios sobre baselines, qualidade versus custo, overfitting, vazamento e generalização. Gabaritos comentados e rubrica para o projeto final.
Etapa 4
Reprodução técnica opcionalApós a disponibilização do código e a definição de infraestrutura, avaliar uma tarefa pequena, registrar o custo completo e publicar resultados, inclusive negativos.
Para quem: pessoas interessadas em IA, educadores e desenvolvedores que querem entender pesquisa automatizada. O guia inicial não exige programação. O laboratório futuro começa sem APIs; a extensão técnica exigirá Python e noções de avaliação.

Abrir o plano completo Ler a análise do material

Vá à fonte. Confira os detalhes.

Referências primárias orientam as afirmações. O vídeo é o ponto de partida editorial; a imagem anexada não é usada como evidência científica.

  1. Site original do Dream-RSIApresentação do método, demonstração e origem das cinco figuras desta página.
  2. Zheng et al. — Dream-RSI: Recursive Self-Improvement through Evolving WorldsarXiv:2609.14858v1 · 14 setembro 2026. Método, tabelas, ablações e prompts.
  3. Repositório dos autoresStatus do código, instruções de citação e plano de disponibilização.
  4. AlphaEvolve — Google DeepMindFonte do resultado de 0,7% no gerenciamento de recursos computacionais.
  5. Vídeo: “O Google está de volta...”Origem do resumo fornecido para este projeto; análise feita a partir do texto recebido e da comparação com as fontes primárias.

Figuras: Zheng et al. / Dream-RSI, mantidas sem tradução sobreposta. Créditos e URLs de origem em registro de imagens. Direitos pertencem aos respectivos titulares. Comentários e atividades são conteúdo educativo INEMA.