Framework · Sistemas e empresas autoaperfeiçoáveis

Sua empresa faz mil tarefas com IA. Por que continua igual?

O LOOP-R transforma um processo do seu negócio em um loop: executa, mede, critica, propõe, testa — e só o que for comprovado vira a nova versão. Com registro de tudo e botão de voltar.

LOOP-R — ciclo de melhoria contínua com IA
O que é

Não é um prompt melhor. É um sistema que aprende com cada execução.

Hoje a IA funciona assim: pedido → resposta → fim. Na próxima proposta, começa do zero. O LOOP-R fecha o ciclo: cada trabalho realizado alimenta a próxima versão do jeito de trabalhar.

🧪 Evidência, não opinião

Cada execução vira uma linha na planilha. O sistema só afirma o que os números provam — e diz quando ainda não há dados suficientes para afirmar nada.

👥 Nove assistentes, uma função cada

Executor, Observador, Crítico, Otimizador, Guardião, Experimentador, Avaliador, Memória e Meta-agente. Nenhum avalia o próprio trabalho — é a separação que impede o sistema de se convencer sozinho.

↩️ Botão de voltar

Toda versão do processo fica no histórico. Promover é um comando; reverter é outro. Uma versão pior nunca substitui a atual por decisão do sistema.

Não peça para a IA melhorar. Faça cada execução produzir evidência, cada evidência gerar uma hipótese, cada hipótese virar um experimento — e só o que for comprovado entrar na próxima versão.

Como funciona

Cinco etapas que fecham em círculo

Localizar o que melhorar, operar, observar o resultado, propor uma hipótese, reforçar o que ganhou. Depois, de novo. Por dentro, um ciclo de oito passos com um assistente responsável por cada um.

Locate Operate Observe Propose Reinforce
1

Observador e Crítico

Leem a planilha, contam, e dizem o que funcionou e o que falhou — com a força da evidência marcada: forte, moderada ou fraca.

2

Otimizador e Guardião

Um escreve hipóteses testáveis (SE… ENTÃO… PORQUE…). O outro veta o que fere o que você definiu como intocável. O veto é final.

3

Experimentador e Avaliador

Desenham o teste A contra B com a quantidade que prova, e respondem uma de três coisas: B ganhou, A segue, ou amostra insuficiente.

4

Memória e Meta-agente

Registram tudo — inclusive o que perdeu, para não testar de novo — e vigiam o custo do próprio loop.

O que ele garante — e o que não

GaranteNão garante
Não-regressão — versão pior nunca entraque o número sobe
Auditabilidade — toda versão, teste e decisão registrados; volta em um comandoque cada ciclo gere uma hipótese boa
Constância — o ciclo roda toda vez, do mesmo jeitoque o custo compense sem você olhar
Teto de custo — para quando atinge
Pré-requisitos

Uma planilha e o Claude Code

Na versão 0.1 o loop roda dentro do Claude Code, e os dados entram por uma planilha exportada em CSV — uma linha por execução. Sem servidor, sem banco, sem integração.

Claude Code

O runner é uma skill; os nove assistentes são arquivos de texto. Quem tem o Claude Code clona e roda.

# instalar / conferir
claude --version

Git

É o histórico com botão de voltar: cada versão do processo é um commit; promover e reverter são operações de git.

git --version

Uma planilha do processo

Onde você já anota o resultado de cada proposta, chamado ou post. O iniciar gera o esquema de colunas para você preencher ou exportar.

# uma linha por execução
id,data,versao,variante,resposta,resultado,...
Guia de uso · passo a passo

Do zero ao primeiro ciclo

Cinco respostas em linguagem natural montam o loop inteiro. Depois, um comando por semana.

1

Clone e abra no Claude Code

O repositório já traz o runner, os nove assistentes e um exemplo completo que rodou de verdade.

git clone https://github.com/inematds/loop-r && cd loop-r
claude
2

Responda as cinco perguntas

São as únicas coisas que nenhum sistema pode inferir com segurança. O resto o LOOP-R propõe e você confirma.

/loop-r iniciar
# 1. Qual processo, e qual número mover de quanto para quanto?
# 2. Onde fica registrado o resultado de cada execução?
# 3. O que a IA NUNCA pode mudar sozinha? O que não pode piorar?
# 4. Quanto pode gastar por ciclo? Semanal ou mensal?
# 5. Você aprova cada mudança (L1) ou só quer ver propostas (L0)?
3

Leia a frase de honestidade e confirme

Antes de criar qualquer coisa, o sistema calcula quantas execuções o seu teste precisa — e diz se vai otimizar primeiro uma métrica mais rápida.

"Com 50 propostas por semana, provar 3% → 5% leva ~60 semanas.
 Vou otimizar primeiro a TAXA DE RESPOSTA (~12 semanas) e vigiar a conversão. Confirma?"
4

Preencha a planilha e rode um ciclo

Os nove assistentes rodam em sequência e deixam um manifesto do que cada um leu, decidiu e por quê. Ciclo sem manifesto completo não conta.

/loop-r ciclo     # → ciclos/0001/ (evidência, crítica, hipóteses, veto, experimento, veredito)
5

Decida com o cartão de cinco linhas

Quando uma versão B ganha com margem e sem piorar o que você vigia, você recebe um cartão. Sem resposta em sete dias, o padrão é não promover.

CICLO 0004 — hipótese: "abrir com algo específico da avaliação"
Resultado:   taxa de resposta 19,3% → 29,3%  (N = 300 vs 300)
Vigiado:     margem ok · reclamações ok · opt-out ok
Custo:       ~R$ 45 neste ciclo (teto R$ 50)
Decisão:     aprovar / rejeitar / esperar mais dados

/loop-r decidir
6

Promova — ou volte atrás

Promover cria a versão nova e aponta a produção para ela, com commit. Reverter aponta de volta. A versão antiga nunca é apagada: é memória.

/loop-r promover   # versoes/v2 vira a oficial · commit "promote v2"
/loop-r reverter   # volta para v1 · linha no ledger com o motivo
/loop-r status
Exemplo rodado

Quatro ciclos rodados pelos assistentes sobre dados sintéticos

Clínica de estética, propostas por WhatsApp, 1.500 execuções sintéticas. Os assistentes rodaram de verdade; os dados não — foram gerados para refletir um efeito verdadeiro, e o README do exemplo diz exatamente o que é real e o que é simulado. O que aconteceu é mais instrutivo do que um caso perfeito seria.

Ciclo 0001 — o Guardião vetou a primeira ideia

O Otimizador propôs fechar com "prefere começar esta semana ou na próxima?". O Guardião vetou: escolha forçada pressiona reclamações. A segunda hipótese (mensagem com até 80 palavras) foi para teste — depois de o Experimentador escalar que o teste, como estimado, levaria 40 semanas.

Ciclo 0002 — ganhou na métrica, perdeu no guarda-corpo

Taxa de resposta subiu de 19% para 30% (N=300/300). Mas reclamações marcaram 6 contra 1 com tolerância zero — e o Avaliador respondeu A segue. A regra estava errada (6 vs 1 em 300 é ruído), não o sistema: o humano ajustou a tolerância para os próximos testes e a hipótese ficou registrada como descartada.

Ciclo 0003 — a hipótese que esperava

Uma hipótese aprovada no primeiro ciclo esperou treze semanas na fila — um teste por vez. O Meta-agente apontou o custo dessa espera e sugeriu um gatilho automático. Entrou no roadmap.

Ciclo 0004 — promoção

Abrir a proposta citando algo específico da avaliação da cliente: 19,3% → 29,3% de resposta, guarda-corpos dentro da tolerância. Cartão de decisão, aprovação, versoes/v2. O primeiro aprendizado provado do loop.

# memoria/ledger.md — trecho (uma linha por evento, nunca apagada)
| 2026-02-02 | ciclo 0001 | H1 (fechar com pergunta de escolha forçada) | — | — | — | VETADA |
| 2026-04-27 | ciclo 0002 | H2 (teto de 80 palavras, E0001) | A_SEGUE — resposta A=0,1933 vs B=0,2967, p=0,0033 | reclamacoes Δ+0,0167 tol 0,0 → FALHA | aceito | DESCARTADA |
| 2026-05-04 | ciclo 0003 | H4 (valor logo após a saudação) | — | — | — | VETADA |
| 2026-05-04 | ciclo 0003 | H3 (abrir citando a avaliação, E0002) | AMOSTRA_INSUFICIENTE — N=0/212 | — | — | EM TESTE |
| 2026-07-27 | ciclo 0004 | H3 (abrir citando a avaliação, E0002) | B_GANHOU — resposta A=0,1933 vs B=0,2933, p=0,0043 | todas OK | aprovado | PROMOVIDA v2 |
Roadmap

Começa pelo dado, não pelos agentes

Sem evidência o resto é teatro. Cada fase entrega algo que funciona sozinho, e nenhuma começa antes que a anterior tenha um usuário real com três ciclos no histórico.

v0.1
Um loop, uma planilha, um ciclo — prontoCinco perguntas → ficha do loop → nove assistentes → ciclo sobre CSV, com git como histórico. Meta-agente só relata. Exemplo rodado.
v0.2
Medir de verdadeLista de conferência sim/não para o artefato, juiz em pares embaralhados, calibração com 15 exemplos avaliados por você. Curso completo (5 trilhas).
v1
Roda sem vocêRunner independente do Claude Code, agendamento, gatilho quando a amostra atinge o mínimo, conectores Google Sheets e WhatsApp, promoção automática com rollback (L2) após cinco promoções corretas.
v2
Vários loopsVendas, atendimento e conteúdo no mesmo repositório; um meta-loop lendo todos os históricos. Pesquisa — depende de meses de dado real.