Tema

Tamanho do texto

Fonte

Entrelinha

MÓDULO 1.3

⚖️ O paradoxo e as regras que vieram junto

O Fable 5.1 pontua mais alto. O sistema ao redor dele ficou muito maior. Nenhuma fonte prova que uma coisa causou a outra. Este módulo ensina a manter as duas afirmações separadas, e mostra as regras novas que vieram com a memória.

6
Tópicos
40
Minutos
Básico
Nível
Fundamento
Tipo
0 de 60%
1

📈 Três números que subiram

Na página do produto, a Anthropic relata pontuações maiores do Fable 5.1 em relação ao Fable 5 em três testes com agentes:

Fable 5 Fable 5.1Ciência com agentes 24,7 52,6Fluxos de negócios 17,1 31,4Programação com agentes 70,5 73,4
O que olhar: Os dois primeiros mais que dobraram ou quase. O terceiro subiu pouco, porque já estava alto. Onde a barra cinza é curta, o salto é maior.

📊 Como ler esses números

  • São selecionados pela Anthropic. Empresas mostram os testes em que melhoraram.
  • Medem o modelo em condições controladas, não o produto com memória e 46 ferramentas.
  • Sustentam a afirmação "o modelo melhorou". Não sustentam "porque ganhou ferramentas".
2

🔗 Coexistência não é causalidade

Duas coisas são verdadeiras ao mesmo tempo: o modelo pontuou mais alto, e o prompt capturado ficou 2,3 vezes maior. A tentação é dizer "o Fable 5.1 é melhor porque ganhou memória e 28 ferramentas". Nenhuma das fontes prova isso.

✓ Afirmações que as fontes sustentam

  • O modelo Fable 5.1 pontua mais alto que o Fable 5 nos três benchmarks relatados.
  • O prompt capturado do 5.1 tem 28 definições de ferramentas a mais.
  • As duas mudanças aconteceram na mesma versão.

✗ Afirmações que as fontes NÃO sustentam

  • As ferramentas novas causaram as pontuações maiores.
  • Sem as ferramentas, o modelo não teria melhorado.
  • Quem usa o Claude no app recebe a melhora medida no benchmark, na mesma proporção.

🧭 Por que a separação importa na prática

Se você acredita que a melhora veio das ferramentas, vai avaliar o Claude testando ferramentas. Se acredita que veio do modelo, vai testar raciocínio. As duas avaliações são úteis, mas respondem perguntas diferentes. Misturá-las produz conclusões que não se sustentam quando alguém pergunta "como você sabe?".

💡 Frase-modelo para usar

"Os benchmarks mostram melhora do modelo. O prompt capturado mostra expansão do produto. As duas coisas aconteceram juntas; não sei qual causou o quê, e as fontes também não dizem."

3

🔬 Julgue o modelo e o produto separadamente

Camada do modelo O raciocínio melhorouBenchmarks com agentes subiramMedido em teste controladoIndepende do seu plano Camada do produto O sistema se expandiuMemória, recuperação, visuaisDescoberta, pesquisa, controleVaria por superfície e conta julgar em separado
O que olhar: A coluna da esquerda é medida por quem tem acesso ao modelo cru. A da direita você mesmo pode testar na sua conta, e é o que a Trilha 2 faz.

Como aplicar as duas réguas

1

Anote a observação

O que exatamente aconteceu?

"Pedi uma comparação de três notebooks e recebi um cartão comparativo em vez de texto."

2

Classifique a camada

Modelo ou produto?

Um cartão comparativo é interface. Camada de produto. O raciocínio que escolheu os três notebooks é modelo.

3

Escolha a régua

Como isso se mede?

Interface se mede por utilidade e disponibilidade na sua conta. Raciocínio se mede por acerto e consistência.

4

Registre o contexto

Superfície, plano, data

Testes de produto não são benchmarks universais. Sem o contexto, o resultado não serve para mais ninguém.

💡 O veredito do material-fonte

Fable 5.1 melhorou o modelo e o sistema ao redor dele. A qualidade cotidiana do Claude depende cada vez mais de como o produto lembra contexto, chama ferramentas e transforma raciocínio em resultado utilizável. Julgue os dois separadamente.

4

🔒 Mais memória significa mais regras

Com mais capacidade de lembrar, o prompt ganhou regras sobre o que pode ser mantido, aplicado, editado ou simplesmente deixado de lado. Três faixas:

MEMÓRIA NORMAL estilo de escrita, preferências estáveis, pessoas, projetos ativos. Compacta e corrigível. DEPENDENTE DE CONFIGURAÇÃO tópicos sensíveis (saúde, religião) só quando configuração e conversa tornam relevante NUNCA ARMAZENAR dados de pagamento e categorias proibidas de histórico pessoal. Limite rígido. de fora para dentro
O que olhar: Quanto mais para dentro, mais rígida a regra. A faixa central não se abre nem com pedido explícito.
Exemplos do próprio bloco de omissão do prompt capturado, parafraseados.
Você diz...O que o prompt capturado manda guardar
"Tenho 52 anos e pulei a corrida por causa da diabetes; sugere um treino mais leve?"Idade 52 e interesse em rotinas de exercício. Nada sobre saúde, nem "gerencia uma condição".
"Sou enfermeira."Guarda a profissão como dita.
"Tenho TDAH, então preciso disso em blocos de 15 minutos."Guarda a preferência de blocos de 15 minutos. O diagnóstico fica fora.
"Nasci na Coreia."Guarda a origem como dita. Nunca converte origem em categoria racial.

⚠️ Pedir não desbloqueia

O prompt capturado é explícito: quando você pede para o Claude lembrar algo que cai numa categoria bloqueada, ele não guarda. Inferência também é proibida: um sintoma mencionado nunca vira uma condição armazenada. E o que é permitido continua sendo guardado com normalidade; omitir um fato permitido é tratado como erro igual a guardar um proibido.

5

✍️ O que muda no jeito de responder

Além das ferramentas, o prompt capturado carrega regras de tom e formatação. Elas explicam boa parte da "sensação" de conversar com o Fable 5.1:

🎚️

Formatação mínima

Listas e bullets só quando pedidos ou quando o conteúdo é multifacetado o bastante para ajudar. Em conversa pessoal ou emocional, nenhuma formatação.

🚫

Palavras evitadas

"Genuinamente", "honestamente", "direto ao ponto". O prompt diz que o modelo é honesto por padrão e que esses modificadores soam falsos.

🤝

Recusa sem bullets

Ao declinar uma tarefa, nunca usar lista. O cuidado extra suaviza.

⏱️

Curto, em turnos

Resposta focada e breve. Pode responder em vários turnos e avisar que tem mais a acrescentar, em vez de despejar tudo de uma vez.

📎

Citação limitada

De resultados de busca: no máximo uma citação curta (menos de 15 palavras) por fonte. Nunca letras de música ou poemas.

🔁

Atualizações durante ferramentas

Quando faz muitas chamadas de ferramenta, uma frase curta a cada duas ou três mantém você informado.

✓ O que isso pede de você

  • Peça o formato quando quiser um específico ("em tabela", "em três bullets").
  • Se quiser profundidade, diga "explicação completa"; o padrão é resumo de alto nível.
  • Aceite respostas em partes; peça "continua" quando ele oferecer mais.

✗ O que não adianta mais

  • Empilhar "seja conciso" três vezes: já é o padrão.
  • Pedir "seja honesto": o prompt já proíbe o modelo de se vender assim.
  • Esperar bullets numa conversa pessoal: ele vai responder em prosa de propósito.
6

🕳️ Onde o material é fraco (e o que fazer)

Um curso que só repete o material herda os buracos dele. Três lacunas precisam ficar explícitas:

As três lacunas

1

Disponibilidade varia

Superfície, plano, conta

As 46 ferramentas são definições no arquivo capturado. Você pode não ver as 13 visuais no seu plano, ou ver ferramentas que não estão lá (as do Claude Code, por exemplo). Por isso a Trilha 2 pede para você registrar superfície, plano e data em cada teste.

2

O arquivo está congelado

02/09/2026

O repositório e o produto podem mudar depois do corte. Uma afirmação deste curso tem validade "em setembro de 2026". Se algo não bater no seu teste, isso é dado, não falha.

3

Nada sobre preço nem API

A maior lacuna

O material-fonte fala de aplicativo e produto. Não diz quanto custa, nem como o Fable 5.1 se comporta na API. A Trilha 3 usa a tabela oficial de preços e as medições de custo publicadas para fechar esse buraco.

1 Trilha 1 entendero que mudou 2 Trilha 2 testarna sua conta 3 Trilha 3 medircusto por tarefa Ponte entre as três trilhas do curso
O que olhar: Cada lacuna vira uma trilha: disponibilidade e congelamento pedem teste próprio (Trilha 2); preço pede medição (Trilha 3).

💡 Antes de seguir

Anote agora, num papel ou arquivo: qual superfície do Claude você usa (web, celular, Claude Code), qual plano, e a data de hoje. Você vai precisar disso em todos os testes da próxima trilha.

🧪 Teste rápido do módulo

Três perguntas. Clique numa opção para ver a resposta.

1. "O Fable 5.1 é melhor porque ganhou 28 ferramentas." Qual o problema?

2. Você diz "tenho diabetes, quero um treino leve". O que o prompt capturado manda guardar na memória?

3. Um teste que você faz na sua conta do Claude é:

📋 Resumo do módulo

Três benchmarks subiram - ciência 24,7→52,6; negócios 17,1→31,4; programação 70,5→73,4. Selecionados pela Anthropic; medem o modelo.
Coexistência não é causalidade - modelo melhorou E produto cresceu. Nenhuma fonte liga um ao outro.
Duas réguas - raciocínio se mede em benchmark; memória, ferramentas, interface e política se testam na sua conta.
Três faixas de memória - normal, dependente de configuração, nunca armazenar. Pedir não desbloqueia; inferir é proibido.
Tom e formatação - curto, formatação mínima, sem palavras de autoconvencimento, sem bullets ao recusar, citação limitada.
Três lacunas - disponibilidade varia, arquivo congelado em 02/09/2026, nada sobre preço. Viram as Trilhas 2 e 3.