📈 Três números que subiram
Na página do produto, a Anthropic relata pontuações maiores do Fable 5.1 em relação ao Fable 5 em três testes com agentes:
📊 Como ler esses números
- •São selecionados pela Anthropic. Empresas mostram os testes em que melhoraram.
- •Medem o modelo em condições controladas, não o produto com memória e 46 ferramentas.
- •Sustentam a afirmação "o modelo melhorou". Não sustentam "porque ganhou ferramentas".
🔗 Coexistência não é causalidade
Duas coisas são verdadeiras ao mesmo tempo: o modelo pontuou mais alto, e o prompt capturado ficou 2,3 vezes maior. A tentação é dizer "o Fable 5.1 é melhor porque ganhou memória e 28 ferramentas". Nenhuma das fontes prova isso.
✓ Afirmações que as fontes sustentam
- ✓O modelo Fable 5.1 pontua mais alto que o Fable 5 nos três benchmarks relatados.
- ✓O prompt capturado do 5.1 tem 28 definições de ferramentas a mais.
- ✓As duas mudanças aconteceram na mesma versão.
✗ Afirmações que as fontes NÃO sustentam
- ✗As ferramentas novas causaram as pontuações maiores.
- ✗Sem as ferramentas, o modelo não teria melhorado.
- ✗Quem usa o Claude no app recebe a melhora medida no benchmark, na mesma proporção.
🧭 Por que a separação importa na prática
Se você acredita que a melhora veio das ferramentas, vai avaliar o Claude testando ferramentas. Se acredita que veio do modelo, vai testar raciocínio. As duas avaliações são úteis, mas respondem perguntas diferentes. Misturá-las produz conclusões que não se sustentam quando alguém pergunta "como você sabe?".
💡 Frase-modelo para usar
"Os benchmarks mostram melhora do modelo. O prompt capturado mostra expansão do produto. As duas coisas aconteceram juntas; não sei qual causou o quê, e as fontes também não dizem."
🔬 Julgue o modelo e o produto separadamente
Como aplicar as duas réguas
Anote a observação
O que exatamente aconteceu?
"Pedi uma comparação de três notebooks e recebi um cartão comparativo em vez de texto."
Classifique a camada
Modelo ou produto?
Um cartão comparativo é interface. Camada de produto. O raciocínio que escolheu os três notebooks é modelo.
Escolha a régua
Como isso se mede?
Interface se mede por utilidade e disponibilidade na sua conta. Raciocínio se mede por acerto e consistência.
Registre o contexto
Superfície, plano, data
Testes de produto não são benchmarks universais. Sem o contexto, o resultado não serve para mais ninguém.
💡 O veredito do material-fonte
Fable 5.1 melhorou o modelo e o sistema ao redor dele. A qualidade cotidiana do Claude depende cada vez mais de como o produto lembra contexto, chama ferramentas e transforma raciocínio em resultado utilizável. Julgue os dois separadamente.
🔒 Mais memória significa mais regras
Com mais capacidade de lembrar, o prompt ganhou regras sobre o que pode ser mantido, aplicado, editado ou simplesmente deixado de lado. Três faixas:
| Você diz... | O que o prompt capturado manda guardar |
|---|---|
| "Tenho 52 anos e pulei a corrida por causa da diabetes; sugere um treino mais leve?" | Idade 52 e interesse em rotinas de exercício. Nada sobre saúde, nem "gerencia uma condição". |
| "Sou enfermeira." | Guarda a profissão como dita. |
| "Tenho TDAH, então preciso disso em blocos de 15 minutos." | Guarda a preferência de blocos de 15 minutos. O diagnóstico fica fora. |
| "Nasci na Coreia." | Guarda a origem como dita. Nunca converte origem em categoria racial. |
⚠️ Pedir não desbloqueia
O prompt capturado é explícito: quando você pede para o Claude lembrar algo que cai numa categoria bloqueada, ele não guarda. Inferência também é proibida: um sintoma mencionado nunca vira uma condição armazenada. E o que é permitido continua sendo guardado com normalidade; omitir um fato permitido é tratado como erro igual a guardar um proibido.
✍️ O que muda no jeito de responder
Além das ferramentas, o prompt capturado carrega regras de tom e formatação. Elas explicam boa parte da "sensação" de conversar com o Fable 5.1:
Formatação mínima
Listas e bullets só quando pedidos ou quando o conteúdo é multifacetado o bastante para ajudar. Em conversa pessoal ou emocional, nenhuma formatação.
Palavras evitadas
"Genuinamente", "honestamente", "direto ao ponto". O prompt diz que o modelo é honesto por padrão e que esses modificadores soam falsos.
Recusa sem bullets
Ao declinar uma tarefa, nunca usar lista. O cuidado extra suaviza.
Curto, em turnos
Resposta focada e breve. Pode responder em vários turnos e avisar que tem mais a acrescentar, em vez de despejar tudo de uma vez.
Citação limitada
De resultados de busca: no máximo uma citação curta (menos de 15 palavras) por fonte. Nunca letras de música ou poemas.
Atualizações durante ferramentas
Quando faz muitas chamadas de ferramenta, uma frase curta a cada duas ou três mantém você informado.
✓ O que isso pede de você
- ✓Peça o formato quando quiser um específico ("em tabela", "em três bullets").
- ✓Se quiser profundidade, diga "explicação completa"; o padrão é resumo de alto nível.
- ✓Aceite respostas em partes; peça "continua" quando ele oferecer mais.
✗ O que não adianta mais
- ✗Empilhar "seja conciso" três vezes: já é o padrão.
- ✗Pedir "seja honesto": o prompt já proíbe o modelo de se vender assim.
- ✗Esperar bullets numa conversa pessoal: ele vai responder em prosa de propósito.
🕳️ Onde o material é fraco (e o que fazer)
Um curso que só repete o material herda os buracos dele. Três lacunas precisam ficar explícitas:
As três lacunas
Disponibilidade varia
Superfície, plano, conta
As 46 ferramentas são definições no arquivo capturado. Você pode não ver as 13 visuais no seu plano, ou ver ferramentas que não estão lá (as do Claude Code, por exemplo). Por isso a Trilha 2 pede para você registrar superfície, plano e data em cada teste.
O arquivo está congelado
02/09/2026
O repositório e o produto podem mudar depois do corte. Uma afirmação deste curso tem validade "em setembro de 2026". Se algo não bater no seu teste, isso é dado, não falha.
Nada sobre preço nem API
A maior lacuna
O material-fonte fala de aplicativo e produto. Não diz quanto custa, nem como o Fable 5.1 se comporta na API. A Trilha 3 usa a tabela oficial de preços e as medições de custo publicadas para fechar esse buraco.
💡 Antes de seguir
Anote agora, num papel ou arquivo: qual superfície do Claude você usa (web, celular, Claude Code), qual plano, e a data de hoje. Você vai precisar disso em todos os testes da próxima trilha.
🧪 Teste rápido do módulo
Três perguntas. Clique numa opção para ver a resposta.
1. "O Fable 5.1 é melhor porque ganhou 28 ferramentas." Qual o problema?
2. Você diz "tenho diabetes, quero um treino leve". O que o prompt capturado manda guardar na memória?
3. Um teste que você faz na sua conta do Claude é: