Seu conforto de leitura
MÓDULO 4.1

Benchmarks, calibração e avaliação

Compare o que foi realmente medido.

6 tópicos 35–50 min com prática Qualidade e evolução Exercícios comentados
Dados rotulados Métricas Conclusão LAYA / INEMA · fluxo conceitual
Seu progresso
Seu progresso
  1. Leia a unidade de comparação
  2. Os limites do zero-shot
  3. Acurácia e matriz de confusão
  4. Brier e ECE respondem perguntas diferentes
  5. Calibração exige dados reservados
  6. Execute e interprete a avaliação local
1

Leia a unidade de comparação

O que é

As fontes combinam resultados de benchmarks, tarefas e checkpoints diferentes. O desempenho do modelo especializado não descreve o modelo base. Os números do Jev citados pelo Laya vêm de terceiros e não de uma execução controlada pelo mesmo autor com prompts idênticos.

Por que aprender

Antes de repetir uma porcentagem, anote modelo, revisão, dataset, quantidade de classes, número de exemplos e método. Uma tabela pode ser útil como indicação de investigação sem sustentar um ranking universal. As condições devem acompanhar os números no relatório.

Exemplo aplicado

Typed-decisions usa workflows específicos; Banking77 testa muitas classes. Ganhar no primeiro não implica ganhar no segundo.

✓ Aplicar com critério

Não sem ressalvas. O espaço de respostas e a amostra mudam a dificuldade; registre a diferença e evite atribuir tudo à arquitetura.

✗ Evitar a conclusão automática

Posso comparar 72 classes com 77 como se fosse a mesma prova?

Não aceite uma resposta só pelo nome do campo ou pela aparência de precisão. Confira a definição e o contexto desta seção.

Conceitos-chave

Protocolo

condições

Amostra

exemplos usados

Tarefa

objetivo medido

Comparabilidade

condições alinhadas

Teste sua compreensão

Posso comparar 72 classes com 77 como se fosse a mesma prova?

Conferir resposta comentada

Não sem ressalvas. O espaço de respostas e a amostra mudam a dificuldade; registre a diferença e evite atribuir tudo à arquitetura.

2

Os limites do zero-shot

O que é

O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora. Isso indica que instruir perguntas novas não garante competência no domínio. A especialização e os dados de treino importam para interpretar o resultado.

Por que aprender

No laboratório, o conjunto pequeno de tickets é um smoke test funcional. Mesmo um resultado excelente não valida mensagens reais, abreviações, casos adversariais ou categorias raras. O próximo passo é reunir exemplos representativos antes de decidir investir em treinamento.

Exemplo aplicado

Um modelo treinado para quatro workflows sintéticos não é automaticamente um analista universal de processos empresariais.

  1. 1
    Observe

    Um modelo treinado para quatro workflows sintéticos não é automaticamente um analista universal de processos empresariais.

  2. 2
    Defina

    O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora.

  3. 3
    Confira

    Não. A ficha informa o escopo específico e recomenda validação própria; desempenho fora desses workflows pode cair.

Conceitos-chave

Zero-shot

tarefa sem ajuste

Baseline

referência simples

Especialista

modelo ajustado

Generalização

novos dados

Teste sua compreensão

O modelo especializado ter boa acurácia dispensa teste em outro domínio?

Conferir resposta comentada

Não. A ficha informa o escopo específico e recomenda validação própria; desempenho fora desses workflows pode cair.

3

Acurácia e matriz de confusão

O que é

Acurácia é a fração de previsões corretas. Ela pode esconder desequilíbrio e erros concentrados numa classe. Uma matriz de confusão conta, para cada rótulo esperado, quais saídas foram produzidas. Compare também uma regra simples, como sempre escolher a classe mais frequente.

Por que aprender

Em atendimento, confundir sales com other pode ter impacto diferente de desviar um incidente crítico. Relate erros por categoria e exemplos representativos. Com amostra pequena, mostre contagens além de porcentagens para não sugerir precisão estatística que os dados não sustentam.

Exemplo aplicado

Se 90 de 100 tickets são financeiros, escolher billing sempre já dá 90% de acurácia, sem entender qualquer texto.

Exemplo de raciocínio

python3 -m practical --device cuda evaluate --output avaliacao.json
# Amostra local: 16 tickets sintéticos, 4 departamentos
# 13/16 acertos; baseline majoritária = 4/16
# Resultado didático, não validação de produção.

Conceitos-chave

Acurácia

fração correta

Confusão

erro entre classes

Desbalanceamento

classes desiguais

Baseline majoritária

classe dominante

Teste sua compreensão

Por que o dataset didático inclui quatro classes em igual quantidade?

Conferir resposta comentada

Para tornar o smoke test fácil de inspecionar e a baseline explícita. Isso não reproduz necessariamente a frequência real de uma operação.

4

Brier e ECE respondem perguntas diferentes

O que é

O Brier multiclasses soma o erro quadrático entre probabilidades e rótulo one-hot. ECE compara, em faixas de probabilidade, confiança média e frequência de acerto. A implementação usa a probabilidade da classe escolhida em dez bins, não a confiança de entropia do SDK.

Por que aprender

Declare a fórmula: alguns relatórios dividem Brier pelo número de classes, outros somam. ECE depende das faixas e da amostra; poucos casos deixam bins vazios ou instáveis. Um valor pequeno em dezesseis exemplos não é comprovação de calibração.

Exemplo aplicado

Uma previsão errada com probabilidade 0,99 recebe penalidade maior que uma distribuição cautelosa. As duas podem ter a mesma acurácia de argmax.

✓ Aplicar com critério

As normalizações, classes e conjuntos podem diferir. Mesmo o mesmo nome de métrica não garante uma definição idêntica.

✗ Evitar a conclusão automática

Por que não comparar Brier de dois relatórios sem ler o método?

Não aceite uma resposta só pelo nome do campo ou pela aparência de precisão. Confira a definição e o contexto desta seção.

Conceitos-chave

Brier

erro da distribuição

ECE

diferença por faixas

One-hot

rótulo unitário

Bin

intervalo de probabilidade

Teste sua compreensão

Por que não comparar Brier de dois relatórios sem ler o método?

Conferir resposta comentada

As normalizações, classes e conjuntos podem diferir. Mesmo o mesmo nome de métrica não garante uma definição idêntica.

5

Calibração exige dados reservados

O que é

Temperature scaling divide logits por uma temperatura antes do softmax. Pode reduzir excesso de confiança sem melhorar a classificação escolhida. Ajustar a temperatura e medir seu efeito nos mesmos dados cria uma estimativa otimista. Separe calibração de avaliação final.

Por que aprender

O checkpoint multilingual é descrito como não calibrado para o domínio do usuário. O laboratório informa essa condição e não finge realizar calibração. Antes de confiar num limiar, reúna dados suficientes e acompanhe taxa de erro versus cobertura no conjunto reservado.

Exemplo aplicado

Treino ensina parâmetros; calibração ajusta probabilidades; teste mede o resultado final sem novos ajustes.

Conceitos-chave

Temperatura

escala de logits

Holdout

dados reservados

Cobertura

fração aceita

Vazamento

uso indevido do teste

Teste sua compreensão

Ajustar temperatura pode corrigir o departamento errado em todos os casos?

Conferir resposta comentada

Não. Uma temperatura positiva global preserva a ordem dos logits. Ela altera a distribuição, não a capacidade de distinguir classes.

6

Execute e interprete a avaliação local

O que é

O comando evaluate lê JSONL, roda pesos reais e grava resultados por exemplo, acurácia, baseline, Brier e ECE. As mensagens são sintéticas e o relatório traz uma limitação explícita. Inspecione cada erro antes de pensar em treinamento ou alteração de limiar.

Por que aprender

Use o relatório como ponto de partida para um conjunto próprio. Acrescente negações, duplicatas, mensagens muito curtas, categorias raras e textos longos. Se mudar perguntas após ver os resultados, mantenha a versão anterior e avalie em novos casos reservados.

Exemplo aplicado

python3 -m practical --device cuda evaluate --output avaliacao.json

Conceitos-chave

JSONL

um caso por linha

Evidência

resultados por caso

Erro

oportunidade de diagnóstico

Novo teste

dados não vistos

Teste sua compreensão

Qual conclusão é permitida se todos os exemplos didáticos acertarem?

Conferir resposta comentada

Que o caminho de inferência classificou corretamente aquela amostra, naquele ambiente e esquema. Não que a ferramenta está validada para produção.

Resumo do módulo

Selecione um trecho da aula para destacar ou anotar. Dúvidas e notas ficam na sua jornada; exporte o JSON para fazer backup.

Leitura do módulo