Tema

Tamanho do texto

Fonte

Entrelinha

Trilha 3

💰 Gastar menos

Por token o Fable custa mais. A economia só existe em custo por tarefa concluída. Como medir e onde o barato ganha.

3
Módulos
18
Tópicos
~2.3h
Duração
Seu progresso0%
0 de 18 tópicos concluídos
Trilha 3Gastar menos18 tópicos +6 3.1 Preço por token contra preço por tarefa Fable custa 2x o Opus. E daí? +6 3.2 Esforço, falhas e a cauda O primeiro botão antes de trocar de modelo +6 3.3 Alavancas do 5.1 para quem usa a API Opcional: cache, esforço por mensagem, orçamento, lote

Mapa da trilha

Conteúdo detalhado

Módulo 3.1
~45 min 0 de 6

🏷️ Preço por token contra preço por tarefa

Por token, o Fable 5.1 é o modelo mais caro da família. A economia só existe medida em custo por tarefa concluída: menos turnos, menos retrabalho, esforço calibrado. E há casos em que o modelo mais barato vence.

Tópicos do módulo

O que é

Os preços oficiais da API da Anthropic por milhão de tokens de entrada e de saída, para os modelos atuais.

Por que aprender

É a premissa honesta desta trilha: por token, Fable custa 2x o Opus 5 e 5x o Sonnet 5. Qualquer conversa sobre economia começa aqui.

Conceitos-chave

Token, entrada, saída, $/1M, família de modelos.

O que é

A unidade que importa é o custo para terminar uma tarefa com qualidade aceitável, incluindo tentativas falhas, retrabalho e turnos extras.

Por que aprender

Um pedido mais barato que precisa de mais turnos ou de correção não é mais barato. A tabela de preços não prevê o ranking.

Conceitos-chave

Custo por tarefa, retrabalho, turnos, taxa de acerto.

O que é

Em medições publicadas pela Anthropic, o Fable 5 em esforço baixo superou o Sonnet 5 num benchmark de pesquisa profunda custando cerca de 10% menos por tarefa.

Por que aprender

É a prova de que o ranking por preço de lista não prevê o ranking por custo real. O modelo mais caro, em esforço baixo, pode ser o mais barato por tarefa.

Conceitos-chave

Esforço baixo, benchmark de pesquisa, cauda de tarefas difíceis.

O que é

Para quem usa o aplicativo (plano fixo), a economia não é em dólares por token: é em cota de uso e tempo. Cada re-explicação de contexto é um turno gasto.

Por que aprender

A maior parte do público do curso paga assinatura, não API. As ferramentas novas de memória e busca em conversas são a alavanca de economia deles.

Conceitos-chave

Cota de uso, turno, re-explicação, memória, busca em conversas.

O que é

Estimar o custo de três tarefas reais suas em dois modelos, contando tokens e tentativas, para ver qual sai mais barato por tarefa.

Por que aprender

É o hábito que a trilha quer instalar: nunca decidir modelo pela tabela de preços; decidir pela conta da tarefa.

Conceitos-chave

Estimativa de tokens, tentativas, custo por tarefa, comparação.

O que é

Casos medidos em que o modelo mais barato entregou o mesmo ou quase: Opus 5 empatou com Fable 5 em código a 60% do custo; Haiku a um décimo do custo com acurácia menor.

Por que aprender

Uma trilha de economia que só defende o modelo caro não merece confiança. Estes são os casos em que descer de modelo é a decisão certa.

Conceitos-chave

Saturação, subconjunto de código, alto volume, saída checável.

Módulo 3.2
~45 min 0 de 6

🎚️ Esforço, falhas e a cauda

Esforço (effort) é a primeira alavanca de custo que troca capacidade por dinheiro. Depois vem a política de "rodar barato e refazer só o que falhou". E a lição mais contra-intuitiva: a conta é decidida pelas tarefas difíceis, não pelas típicas.

Tópicos do módulo

O que é

Um parâmetro (low, medium, high, xhigh, max) que controla quanto o modelo pensa e quantas chamadas de ferramenta faz, sem trocar de modelo.

Por que aprender

Troca capacidade por custo dentro do mesmo modelo. Trocar de modelo muda o teto de inteligência; esforço não. Por isso é testado primeiro.

Conceitos-chave

effort, output_config, profundidade de raciocínio, chamadas de ferramenta.

O que é

Em trabalho de pesquisa e conhecimento, as curvas medidas são quase planas: medium igualou o padrão por 70–85% do custo; low perdeu 1 a 3 pontos por um terço a metade do custo.

Por que aprender

É onde a economia é maior e mais segura. Se seu trabalho é ler, resumir, comparar e responder, provavelmente sua curva é essa.

Conceitos-chave

Curva plana, medium, low, 70–85%, um terço a metade.

O que é

Em código de horizonte longo, a troca é real: no Opus 5, medium perdeu cerca de 2 pontos por metade do custo, e low perdeu cerca de 8 pontos por um quarto.

Por que aprender

Saber que a curva é íngreme evita cortar esforço onde isso destrói o resultado. E abre a alternativa do módulo seguinte.

Conceitos-chave

Curva íngreme, 2 pontos por metade, 8 pontos por um quarto, teto de raciocínio.

O que é

Uma política: rodar tudo em esforço baixo e refazer no padrão apenas as tarefas que falharam num verificador. Em código, deu 93% de acerto a $0,70 por tarefa contra 91,7% a $1,39 rodando tudo no padrão.

Por que aprender

É o jeito de ter economia mesmo em curva íngreme. Só funciona se você tem um sinal de falha (teste, validador, checador).

Conceitos-chave

Política de re-execução, sinal de falha, verificador, custo contando as tentativas falhas.

O que é

Na tarefa típica todos os modelos parecem iguais e o barato parece melhor. A conta é decidida pelas tarefas difíceis: numa rodada de 20 problemas de pesquisa, 2 carregaram 43% do gasto.

Por que aprender

É a lição mais contra-intuitiva de custo. Quem compara pela mediana escolhe o modelo errado.

Conceitos-chave

Cauda, mediana, 10% mais difíceis, concentração de gasto.

O que é

As disciplinas de medição da guia oficial: varredura com células idênticas exceto o esforço, sessões separadas, tarefa difícil incluída, repetição quando a diferença é pequena, uma alavanca por diff.

Por que aprender

Uma medição mal feita é pior que nenhuma: ela dá confiança em algo errado.

Conceitos-chave

Célula idêntica, sessão separada, ruído, repetição, uma alavanca por vez.

Módulo 3.3
~50 min 0 de 6

🔧 Alavancas do 5.1 para quem usa a API

Módulo opcional para quem programa contra a API. O Fable 5.1 trouxe leitura de cache a um quarto de centavo por mil tokens, troca de esforço sem resetar o cache, orçamento de tarefa e fallbacks. A ordem de aplicação continua a mesma: cache, esforço, orçamento, modelo.

Tópicos do módulo

O que é

Um mapa das alavancas de custo da API, na ordem em que a guia oficial manda aplicar, marcando o que é novo no Fable 5.1.

Por que aprender

Quem aplica fora de ordem não sabe o que ajudou e perde cache no caminho.

Conceitos-chave

Cache de prompt, effort, task_budget, batch, fallbacks, ordem de aplicação.

O que é

Colocar o conteúdo que não muda (prompt de sistema, ferramentas, documentos fixos) no início do pedido e marcar um ponto de cache. No 5.1 a leitura custa $0,25 por milhão.

Por que aprender

É a única alavanca que não troca qualidade por nada. E é a mais fácil de quebrar sem perceber.

Conceitos-chave

Prefixo, cache_control, invalidador silencioso, cache_read_input_tokens.

O que é

Uma mensagem de sistema com conteúdo vazio e um novo esforço, inserida no meio da conversa, muda o esforço dali em diante sem invalidar o prefixo cacheado.

Por que aprender

Antes, trocar o esforço no topo do pedido resetava o cache. Agora dá para começar alto e baixar quando a tarefa fica rotineira, mantendo o cache.

Conceitos-chave

Mensagem de sistema no array, content vazio, output_config.effort, beta.

O que é

Um teto de tokens para um laço com agentes que o modelo vê durante a geração, diferente do limite duro de saída. Mínimo 20.000. Beta.

Por que aprender

Reduz custo com perda controlada: -18% por -2,7 pontos num orçamento folgado; -47% por -4,4 no mais apertado permitido.

Conceitos-chave

task_budget, advisório, p90, streaming, invalida cache se mudar.

O que é

O endpoint de lotes processa pedidos sem pressa a 50% do preço. Os fallbacks server-side redirecionam para outro modelo quando o Fable 5.1 recusa por categoria de segurança.

Por que aprender

Lote é a maior economia bruta para trabalho assíncrono. Fallback evita código defensivo e mantém a taxa de conclusão.

Conceitos-chave

Batches, custom_id, resultado fora de ordem, stop_reason refusal, fallbacks default.

O que é

A receita mínima de avaliação para quem programa: pedidos congelados, julgamento barato, executor que grava uso de tokens, e aprovação de custo antes de rodar.

Por que aprender

Sem medição, toda alavanca vira aposta. Com vinte pedidos e um roteiro, você tem decisão.

Conceitos-chave

Eval mínimo, usage, custo por tarefa, uma alavanca por diff.

← Trilha 2: Na prática Início do curso →