💵 A tabela de preços
| Modelo | Entrada ($/1M) | Saída ($/1M) | Em relação ao Fable |
|---|---|---|---|
| Fable 5.1 / Fable 5 | 10,00 | 50,00 | referência |
| Opus 5 | 5,00 | 25,00 | metade |
| Sonnet 5 | 2,00 | 10,00 | um quinto |
| Haiku 4.5 | 1,00 | 5,00 | um décimo |
⚠️ Premissa honesta da trilha
Por token, Fable 5.x é mais caro, não mais barato. Este curso não vai fingir o contrário. O que vem a seguir é como a economia aparece quando você para de contar tokens e começa a contar tarefas concluídas.
⚖️ Por que "por token" engana
Um modelo barato que erra e precisa de duas tentativas custou o dobro do que a tabela diz. Um modelo caro que acerta de primeira, com menos idas e vindas, pode ter custado menos. A guia de otimização de custo da Anthropic resume: julgue o custo por tarefa concluída, não por pedido.
🧮 A conta que você precisa fazer
Custo por tarefa = (tokens de entrada × preço de entrada + tokens de saída × preço de saída) × número de tentativas até ficar bom. Some os turnos de correção. Um modelo que precisa de 1,5 tentativa em média já perdeu boa parte da vantagem de preço.
| Cenário | Preço de lista | Tentativas | Custo real relativo |
|---|---|---|---|
| Modelo barato, acerta de primeira | 1x | 1 | 1x |
| Modelo barato, precisa refazer uma vez | 1x | 2 | 2x |
| Modelo 5x mais caro, acerta de primeira | 5x | 1 | 5x |
| Modelo 5x mais caro em esforço baixo (metade do custo), acerta de primeira | 2,5x | 1 | 2,5x |
🥇 Quando o Fable em esforço baixo vence o barato
A guia oficial de otimização de custo relata: em uma bateria de pesquisa profunda, o Fable 5 em esforço baixo venceu o Sonnet 5 custando cerca de 10% menos por tarefa. O modelo com o token mais caro terminou a tarefa mais barato, porque errou menos e precisou de menos passos.
📊 Outros números da mesma guia (pesquisa e conhecimento, Fable 5)
- •Esforço medium igualou a acurácia do padrão custando 70% a 85% do preço.
- •Esforço low perdeu 1 a 3 pontos e cortou um terço a metade do custo por tarefa.
- •O padrão (high) não comprou nada mensurável acima de medium em nenhum dos quatro benchmarks medidos.
- •Esforço baixo também é mais rápido: 4,5 contra 7,9 minutos por problema num benchmark de pesquisa.
⚠️ Validade dos números
As medições são da Anthropic, com o Fable 5 (não o 5.1), em benchmarks específicos. Elas mostram o formato da curva, não o seu resultado. Sua tarefa pode se comportar diferente. Por isso o módulo 3.2 ensina a medir.
🔁 A economia do assinante: parar de repetir
Se você paga assinatura, não paga por token. Mas paga em cota de mensagens e em tempo. Cada vez que você cola de novo o contexto do projeto, explica quem você é ou repete uma decisão antiga, gastou um turno que a memória e a busca em conversas poderiam ter poupado.
Onde o assinante gasta sem perceber
Colar o contexto de novo
Mil palavras a cada conversa nova
Com memória em arquivos, perfil e projeto entram sozinhos. A Trilha 2 mostrou como testar se isso está funcionando na sua conta.
Reexplicar uma decisão
"Como eu te disse antes..."
Com busca em conversas, "aquela decisão sobre o fornecedor" basta. Um turno em vez de três.
Pedir para encurtar
"Resume isso", "menos texto"
O prompt capturado já impõe brevidade e formatação mínima. Se você ainda pede para encurtar, está gastando turno em algo que o padrão já faz; peça o formato certo de primeira.
Refazer por falta de formato
"Não era isso que eu queria"
Um exemplo positivo curto no primeiro pedido (Trilha 2, módulo 2.3) evita o segundo pedido.
Copie e rode
Medir sua própria repetição por uma semana
Durante uma semana, a cada conversa nova com o Claude, anote:
- Quantas linhas de contexto você colou antes da primeira pergunta? <número>
- Quantas vezes escreveu "como eu disse", "lembra que", "de novo"? <número>
- Quantas vezes pediu "encurta" ou "refaz"? <número>
No fim da semana, some. Depois tente uma semana sem colar contexto (confiando na memória e na busca) e compare.
🧮 Exercício: três tarefas suas, dois modelos
Escolha três tarefas que você faz com frequência. Para cada uma, estime tokens de entrada e saída e o número de tentativas que cada modelo costuma precisar. A conta é simples e o resultado costuma surpreender.
Copie e rode
Planilha mínima de custo por tarefa (copie para uma planilha ou faça à mão)
Tarefa: <ex.: resumo de relatório de 10 páginas para a diretoria>
Tokens de entrada estimados: <ex.: 8.000> (≈ 700 palavras por mil tokens)
Tokens de saída estimados: <ex.: 600>
Modelo A: <Fable 5.1, esforço low>
custo = 8.000/1M × $10 + 600/1M × $50 = $0,08 + $0,03 = $0,11 por tentativa
tentativas típicas: <1> → custo por tarefa: $0,11
Modelo B: <Sonnet 5>
custo = 8.000/1M × $2 + 600/1M × $10 = $0,016 + $0,006 = $0,022 por tentativa
tentativas típicas: <2, porque costuma precisar de correção> → custo por tarefa: $0,044
Vencedor nesta tarefa: <B, por 2,5x> Observação: <B ainda ganha mesmo com retrabalho>
🎯 O que este exercício ensina
- •A saída pesa mais que a entrada: 600 tokens de saída no Fable custam mais que 8.000 de entrada no Sonnet.
- •O raciocínio interno é saída cobrada. Esforço alto gera mais raciocínio; esforço baixo, menos. É por isso que esforço é a primeira alavanca.
- •Tentativas multiplicam tudo. Um modelo que acerta de primeira tem uma vantagem escondida.
🥈 Onde o mais barato ganha
A mesma guia de custo da Anthropic mostra o outro lado. Em um subconjunto de código onde os dois modelos já acertam quase tudo, o Opus 5 igualou o Fable 5 (91,7% contra 91,3%) custando cerca de 60%. Quando a tarefa satura, o modelo mais caro não tem onde ganhar.
| Situação | Medição publicada | Decisão |
|---|---|---|
| Código onde ambos acertam quase tudo | Opus 5: 91,7% · Fable 5: 91,3% · custo do Opus ≈ 60% | Desça para o Opus 5. |
| Perguntas de conhecimento em alto volume | Haiku 4.5: 63% de acerto a 1/10 do custo do Opus 5 (92%) | Haiku, se você consegue checar a saída e o erro é barato. |
| Loop longo com agentes | Modelos pequenos perdem na cauda de tarefas difíceis | Não desça; a economia se perde em falhas. |
| Pesquisa profunda | Fable 5 em low venceu Sonnet 5 por 10% menos | Fable em esforço baixo. |
💡 Recomendação padrão da própria Anthropic
Para a maioria dos fluxos com agentes, comece com o Opus 5. Reserve o Fable 5.1 para o trabalho de raciocínio mais exigente e de horizonte longo. E lembre: em Claude Code e API, o modelo padrão sugerido para novos projetos é o Opus 5, não o Fable.
🧪 Teste rápido do módulo
Três perguntas. Clique numa opção para ver a resposta.
1. Por token, o Fable 5.1 custa quanto em relação ao Opus 5?
2. Um modelo barato que precisa de duas tentativas em média, comparado a um 5x mais caro que acerta de primeira em esforço baixo (metade do custo):
3. Em qual caso medido o modelo mais barato entregou praticamente o mesmo resultado?
📋 Resumo do módulo
Próximo módulo:
3.2 - Esforço, falhas e a cauda