Tema

Tamanho do texto

Fonte

Entrelinha

MÓDULO 3.1

🏷️ Preço por token contra preço por tarefa

Por token, o Fable 5.1 é o modelo mais caro da família. A economia só existe medida em custo por tarefa concluída: menos turnos, menos retrabalho, esforço calibrado. E há casos em que o modelo mais barato vence.

6
Tópicos
45
Minutos
Básico
Nível
Fundamento
Tipo
0 de 60%
1

💵 A tabela de preços

Preços de lista da API direta da Anthropic (tabela oficial, consultada em setembro de 2026). Plataformas parceiras podem diferir.
ModeloEntrada ($/1M)Saída ($/1M)Em relação ao Fable
Fable 5.1 / Fable 510,0050,00referência
Opus 55,0025,00metade
Sonnet 52,0010,00um quinto
Haiku 4.51,005,00um décimo
entrada saídaFable 5.1 $10 $50Opus 5 $5 $25Sonnet 5 $2 $10Haiku 4.5 $1 $5
O que olhar: A saída custa cinco vezes a entrada em todos os modelos. E o Fable é o topo da escada. Se a conversa terminasse aqui, a conclusão seria "use o mais barato". Ela não termina aqui.

⚠️ Premissa honesta da trilha

Por token, Fable 5.x é mais caro, não mais barato. Este curso não vai fingir o contrário. O que vem a seguir é como a economia aparece quando você para de contar tokens e começa a contar tarefas concluídas.

2

⚖️ Por que "por token" engana

Um modelo barato que erra e precisa de duas tentativas custou o dobro do que a tabela diz. Um modelo caro que acerta de primeira, com menos idas e vindas, pode ter custado menos. A guia de otimização de custo da Anthropic resume: julgue o custo por tarefa concluída, não por pedido.

Por tokenFable: $50 / 1M saídaSonnet: $10 / 1M saída"o barato ganha" Por tarefatentativas × tokens+ retrabalho + turnos"depende da tarefa" Balança entre preço por token e custo por tarefa concluída
O que olhar: O prato da direita pesa mais porque inclui o que a tabela esconde: quantas vezes você precisou pedir de novo.

🧮 A conta que você precisa fazer

Custo por tarefa = (tokens de entrada × preço de entrada + tokens de saída × preço de saída) × número de tentativas até ficar bom. Some os turnos de correção. Um modelo que precisa de 1,5 tentativa em média já perdeu boa parte da vantagem de preço.

Ilustrativo. O ponto é que tentativas multiplicam o preço de lista.
CenárioPreço de listaTentativasCusto real relativo
Modelo barato, acerta de primeira1x11x
Modelo barato, precisa refazer uma vez1x22x
Modelo 5x mais caro, acerta de primeira5x15x
Modelo 5x mais caro em esforço baixo (metade do custo), acerta de primeira2,5x12,5x
3

🥇 Quando o Fable em esforço baixo vence o barato

A guia oficial de otimização de custo relata: em uma bateria de pesquisa profunda, o Fable 5 em esforço baixo venceu o Sonnet 5 custando cerca de 10% menos por tarefa. O modelo com o token mais caro terminou a tarefa mais barato, porque errou menos e precisou de menos passos.

Sonnet 5 (padrão) Fable 5 (low)Custo por tarefa 100 ~90Qualidade menor maior
O que olhar: Menos custo e mais qualidade ao mesmo tempo. Isso só aparece quando a unidade de medida é a tarefa concluída.

📊 Outros números da mesma guia (pesquisa e conhecimento, Fable 5)

  • Esforço medium igualou a acurácia do padrão custando 70% a 85% do preço.
  • Esforço low perdeu 1 a 3 pontos e cortou um terço a metade do custo por tarefa.
  • O padrão (high) não comprou nada mensurável acima de medium em nenhum dos quatro benchmarks medidos.
  • Esforço baixo também é mais rápido: 4,5 contra 7,9 minutos por problema num benchmark de pesquisa.

⚠️ Validade dos números

As medições são da Anthropic, com o Fable 5 (não o 5.1), em benchmarks específicos. Elas mostram o formato da curva, não o seu resultado. Sua tarefa pode se comportar diferente. Por isso o módulo 3.2 ensina a medir.

4

🔁 A economia do assinante: parar de repetir

Se você paga assinatura, não paga por token. Mas paga em cota de mensagens e em tempo. Cada vez que você cola de novo o contexto do projeto, explica quem você é ou repete uma decisão antiga, gastou um turno que a memória e a busca em conversas poderiam ter poupado.

Onde o assinante gasta sem perceber

1

Colar o contexto de novo

Mil palavras a cada conversa nova

Com memória em arquivos, perfil e projeto entram sozinhos. A Trilha 2 mostrou como testar se isso está funcionando na sua conta.

2

Reexplicar uma decisão

"Como eu te disse antes..."

Com busca em conversas, "aquela decisão sobre o fornecedor" basta. Um turno em vez de três.

3

Pedir para encurtar

"Resume isso", "menos texto"

O prompt capturado já impõe brevidade e formatação mínima. Se você ainda pede para encurtar, está gastando turno em algo que o padrão já faz; peça o formato certo de primeira.

4

Refazer por falta de formato

"Não era isso que eu queria"

Um exemplo positivo curto no primeiro pedido (Trilha 2, módulo 2.3) evita o segundo pedido.

Copie e rode

Medir sua própria repetição por uma semana

Durante uma semana, a cada conversa nova com o Claude, anote:
- Quantas linhas de contexto você colou antes da primeira pergunta? <número>
- Quantas vezes escreveu "como eu disse", "lembra que", "de novo"? <número>
- Quantas vezes pediu "encurta" ou "refaz"? <número>

No fim da semana, some. Depois tente uma semana sem colar contexto (confiando na memória e na busca) e compare.
Como verificar: Se os números da segunda semana caíram sem perda de qualidade, a memória e a busca estão pagando a assinatura. Se não caíram, volte à Trilha 2 e veja qual teste falhou.
5

🧮 Exercício: três tarefas suas, dois modelos

Escolha três tarefas que você faz com frequência. Para cada uma, estime tokens de entrada e saída e o número de tentativas que cada modelo costuma precisar. A conta é simples e o resultado costuma surpreender.

Copie e rode

Planilha mínima de custo por tarefa (copie para uma planilha ou faça à mão)

Tarefa: <ex.: resumo de relatório de 10 páginas para a diretoria>
Tokens de entrada estimados: <ex.: 8.000>   (≈ 700 palavras por mil tokens)
Tokens de saída estimados:   <ex.: 600>

Modelo A: <Fable 5.1, esforço low>
  custo = 8.000/1M × $10 + 600/1M × $50 = $0,08 + $0,03 = $0,11 por tentativa
  tentativas típicas: <1>   →   custo por tarefa: $0,11

Modelo B: <Sonnet 5>
  custo = 8.000/1M × $2 + 600/1M × $10 = $0,016 + $0,006 = $0,022 por tentativa
  tentativas típicas: <2, porque costuma precisar de correção>   →   custo por tarefa: $0,044

Vencedor nesta tarefa: <B, por 2,5x>   Observação: <B ainda ganha mesmo com retrabalho>
Como verificar: Repita para as três tarefas. Se o modelo barato ganhou nas três mesmo contando tentativas, ele é o certo para elas. Se o caro em esforço baixo ganhou em alguma, você achou uma tarefa onde a tabela de preços mente.

🎯 O que este exercício ensina

  • A saída pesa mais que a entrada: 600 tokens de saída no Fable custam mais que 8.000 de entrada no Sonnet.
  • O raciocínio interno é saída cobrada. Esforço alto gera mais raciocínio; esforço baixo, menos. É por isso que esforço é a primeira alavanca.
  • Tentativas multiplicam tudo. Um modelo que acerta de primeira tem uma vantagem escondida.
6

🥈 Onde o mais barato ganha

A mesma guia de custo da Anthropic mostra o outro lado. Em um subconjunto de código onde os dois modelos já acertam quase tudo, o Opus 5 igualou o Fable 5 (91,7% contra 91,3%) custando cerca de 60%. Quando a tarefa satura, o modelo mais caro não tem onde ganhar.

SituaçãoMedição publicadaDecisão
Código onde ambos acertam quase tudoOpus 5: 91,7% · Fable 5: 91,3% · custo do Opus ≈ 60%Desça para o Opus 5.
Perguntas de conhecimento em alto volumeHaiku 4.5: 63% de acerto a 1/10 do custo do Opus 5 (92%)Haiku, se você consegue checar a saída e o erro é barato.
Loop longo com agentesModelos pequenos perdem na cauda de tarefas difíceisNão desça; a economia se perde em falhas.
Pesquisa profundaFable 5 em low venceu Sonnet 5 por 10% menosFable em esforço baixo.
Desça de modelo Ambos saturam (acertam quase tudo)Alto volume, saída checávelErro é barato de corrigirVocê mediu e a curva é plana Não desça Loop longo com muitas etapasCauda de tarefas difíceis pesaErro é caro ou invisívelVocê ainda não mediu a régua é a tarefa
O que olhar: Descer de modelo é a última alavanca, não a primeira. Antes dela vêm cache e esforço (módulo 3.2). E a decisão é sempre por tarefa, com medição.

💡 Recomendação padrão da própria Anthropic

Para a maioria dos fluxos com agentes, comece com o Opus 5. Reserve o Fable 5.1 para o trabalho de raciocínio mais exigente e de horizonte longo. E lembre: em Claude Code e API, o modelo padrão sugerido para novos projetos é o Opus 5, não o Fable.

🧪 Teste rápido do módulo

Três perguntas. Clique numa opção para ver a resposta.

1. Por token, o Fable 5.1 custa quanto em relação ao Opus 5?

2. Um modelo barato que precisa de duas tentativas em média, comparado a um 5x mais caro que acerta de primeira em esforço baixo (metade do custo):

3. Em qual caso medido o modelo mais barato entregou praticamente o mesmo resultado?

📋 Resumo do módulo

Tabela de preços - Fable 10/50, Opus 5 5/25, Sonnet 5 2/10, Haiku 1/5 dólares por milhão. Por token, Fable é o mais caro.
Custo por tarefa - tokens × preço × tentativas, mais retrabalho. A tabela não prevê o ranking.
Fable em low venceu Sonnet - em pesquisa profunda, por 10% menos por tarefa. Medium igualou o padrão a 70–85% do custo.
Economia do assinante - memória e busca em conversas cortam turnos de re-explicação. Meça por uma semana.
Exercício de três tarefas - estime tokens e tentativas em dois modelos; decida por tarefa.
Onde o barato ganha - código saturado (Opus a 60%), alto volume checável (Haiku). Não em loop longo.

Próximo módulo:

3.2 - Esforço, falhas e a cauda