Mapa da trilha
Conteúdo detalhado
🏷️ Preço por token contra preço por tarefa
Por token, o Fable 5.1 é o modelo mais caro da família. A economia só existe medida em custo por tarefa concluída: menos turnos, menos retrabalho, esforço calibrado. E há casos em que o modelo mais barato vence.
Tópicos do módulo
O que é
Os preços oficiais da API da Anthropic por milhão de tokens de entrada e de saída, para os modelos atuais.
Por que aprender
É a premissa honesta desta trilha: por token, Fable custa 2x o Opus 5 e 5x o Sonnet 5. Qualquer conversa sobre economia começa aqui.
Conceitos-chave
Token, entrada, saída, $/1M, família de modelos.
O que é
A unidade que importa é o custo para terminar uma tarefa com qualidade aceitável, incluindo tentativas falhas, retrabalho e turnos extras.
Por que aprender
Um pedido mais barato que precisa de mais turnos ou de correção não é mais barato. A tabela de preços não prevê o ranking.
Conceitos-chave
Custo por tarefa, retrabalho, turnos, taxa de acerto.
O que é
Em medições publicadas pela Anthropic, o Fable 5 em esforço baixo superou o Sonnet 5 num benchmark de pesquisa profunda custando cerca de 10% menos por tarefa.
Por que aprender
É a prova de que o ranking por preço de lista não prevê o ranking por custo real. O modelo mais caro, em esforço baixo, pode ser o mais barato por tarefa.
Conceitos-chave
Esforço baixo, benchmark de pesquisa, cauda de tarefas difíceis.
O que é
Para quem usa o aplicativo (plano fixo), a economia não é em dólares por token: é em cota de uso e tempo. Cada re-explicação de contexto é um turno gasto.
Por que aprender
A maior parte do público do curso paga assinatura, não API. As ferramentas novas de memória e busca em conversas são a alavanca de economia deles.
Conceitos-chave
Cota de uso, turno, re-explicação, memória, busca em conversas.
O que é
Estimar o custo de três tarefas reais suas em dois modelos, contando tokens e tentativas, para ver qual sai mais barato por tarefa.
Por que aprender
É o hábito que a trilha quer instalar: nunca decidir modelo pela tabela de preços; decidir pela conta da tarefa.
Conceitos-chave
Estimativa de tokens, tentativas, custo por tarefa, comparação.
O que é
Casos medidos em que o modelo mais barato entregou o mesmo ou quase: Opus 5 empatou com Fable 5 em código a 60% do custo; Haiku a um décimo do custo com acurácia menor.
Por que aprender
Uma trilha de economia que só defende o modelo caro não merece confiança. Estes são os casos em que descer de modelo é a decisão certa.
Conceitos-chave
Saturação, subconjunto de código, alto volume, saída checável.
🎚️ Esforço, falhas e a cauda
Esforço (effort) é a primeira alavanca de custo que troca capacidade por dinheiro. Depois vem a política de "rodar barato e refazer só o que falhou". E a lição mais contra-intuitiva: a conta é decidida pelas tarefas difíceis, não pelas típicas.
Tópicos do módulo
O que é
Um parâmetro (low, medium, high, xhigh, max) que controla quanto o modelo pensa e quantas chamadas de ferramenta faz, sem trocar de modelo.
Por que aprender
Troca capacidade por custo dentro do mesmo modelo. Trocar de modelo muda o teto de inteligência; esforço não. Por isso é testado primeiro.
Conceitos-chave
effort, output_config, profundidade de raciocínio, chamadas de ferramenta.
O que é
Em trabalho de pesquisa e conhecimento, as curvas medidas são quase planas: medium igualou o padrão por 70–85% do custo; low perdeu 1 a 3 pontos por um terço a metade do custo.
Por que aprender
É onde a economia é maior e mais segura. Se seu trabalho é ler, resumir, comparar e responder, provavelmente sua curva é essa.
Conceitos-chave
Curva plana, medium, low, 70–85%, um terço a metade.
O que é
Em código de horizonte longo, a troca é real: no Opus 5, medium perdeu cerca de 2 pontos por metade do custo, e low perdeu cerca de 8 pontos por um quarto.
Por que aprender
Saber que a curva é íngreme evita cortar esforço onde isso destrói o resultado. E abre a alternativa do módulo seguinte.
Conceitos-chave
Curva íngreme, 2 pontos por metade, 8 pontos por um quarto, teto de raciocínio.
O que é
Uma política: rodar tudo em esforço baixo e refazer no padrão apenas as tarefas que falharam num verificador. Em código, deu 93% de acerto a $0,70 por tarefa contra 91,7% a $1,39 rodando tudo no padrão.
Por que aprender
É o jeito de ter economia mesmo em curva íngreme. Só funciona se você tem um sinal de falha (teste, validador, checador).
Conceitos-chave
Política de re-execução, sinal de falha, verificador, custo contando as tentativas falhas.
O que é
Na tarefa típica todos os modelos parecem iguais e o barato parece melhor. A conta é decidida pelas tarefas difíceis: numa rodada de 20 problemas de pesquisa, 2 carregaram 43% do gasto.
Por que aprender
É a lição mais contra-intuitiva de custo. Quem compara pela mediana escolhe o modelo errado.
Conceitos-chave
Cauda, mediana, 10% mais difíceis, concentração de gasto.
O que é
As disciplinas de medição da guia oficial: varredura com células idênticas exceto o esforço, sessões separadas, tarefa difícil incluída, repetição quando a diferença é pequena, uma alavanca por diff.
Por que aprender
Uma medição mal feita é pior que nenhuma: ela dá confiança em algo errado.
Conceitos-chave
Célula idêntica, sessão separada, ruído, repetição, uma alavanca por vez.
🔧 Alavancas do 5.1 para quem usa a API
Módulo opcional para quem programa contra a API. O Fable 5.1 trouxe leitura de cache a um quarto de centavo por mil tokens, troca de esforço sem resetar o cache, orçamento de tarefa e fallbacks. A ordem de aplicação continua a mesma: cache, esforço, orçamento, modelo.
Tópicos do módulo
O que é
Um mapa das alavancas de custo da API, na ordem em que a guia oficial manda aplicar, marcando o que é novo no Fable 5.1.
Por que aprender
Quem aplica fora de ordem não sabe o que ajudou e perde cache no caminho.
Conceitos-chave
Cache de prompt, effort, task_budget, batch, fallbacks, ordem de aplicação.
O que é
Colocar o conteúdo que não muda (prompt de sistema, ferramentas, documentos fixos) no início do pedido e marcar um ponto de cache. No 5.1 a leitura custa $0,25 por milhão.
Por que aprender
É a única alavanca que não troca qualidade por nada. E é a mais fácil de quebrar sem perceber.
Conceitos-chave
Prefixo, cache_control, invalidador silencioso, cache_read_input_tokens.
O que é
Uma mensagem de sistema com conteúdo vazio e um novo esforço, inserida no meio da conversa, muda o esforço dali em diante sem invalidar o prefixo cacheado.
Por que aprender
Antes, trocar o esforço no topo do pedido resetava o cache. Agora dá para começar alto e baixar quando a tarefa fica rotineira, mantendo o cache.
Conceitos-chave
Mensagem de sistema no array, content vazio, output_config.effort, beta.
O que é
Um teto de tokens para um laço com agentes que o modelo vê durante a geração, diferente do limite duro de saída. Mínimo 20.000. Beta.
Por que aprender
Reduz custo com perda controlada: -18% por -2,7 pontos num orçamento folgado; -47% por -4,4 no mais apertado permitido.
Conceitos-chave
task_budget, advisório, p90, streaming, invalida cache se mudar.
O que é
O endpoint de lotes processa pedidos sem pressa a 50% do preço. Os fallbacks server-side redirecionam para outro modelo quando o Fable 5.1 recusa por categoria de segurança.
Por que aprender
Lote é a maior economia bruta para trabalho assíncrono. Fallback evita código defensivo e mantém a taxa de conclusão.
Conceitos-chave
Batches, custom_id, resultado fora de ordem, stop_reason refusal, fallbacks default.
O que é
A receita mínima de avaliação para quem programa: pedidos congelados, julgamento barato, executor que grava uso de tokens, e aprovação de custo antes de rodar.
Por que aprender
Sem medição, toda alavanca vira aposta. Com vinte pedidos e um roteiro, você tem decisão.
Conceitos-chave
Eval mínimo, usage, custo por tarefa, uma alavanca por diff.