Benchmarks, calibração e avaliação
Compare o que foi realmente medido.
- Leia a unidade de comparação
- Os limites do zero-shot
- Acurácia e matriz de confusão
- Brier e ECE respondem perguntas diferentes
- Calibração exige dados reservados
- Execute e interprete a avaliação local
Leia a unidade de comparação
O que é
As fontes combinam resultados de benchmarks, tarefas e checkpoints diferentes. O desempenho do modelo especializado não descreve o modelo base. Os números do Jev citados pelo Laya vêm de terceiros e não de uma execução controlada pelo mesmo autor com prompts idênticos.
Por que aprender
Antes de repetir uma porcentagem, anote modelo, revisão, dataset, quantidade de classes, número de exemplos e método. Uma tabela pode ser útil como indicação de investigação sem sustentar um ranking universal. As condições devem acompanhar os números no relatório.
Typed-decisions usa workflows específicos; Banking77 testa muitas classes. Ganhar no primeiro não implica ganhar no segundo.
✓ Aplicar com critério
Não sem ressalvas. O espaço de respostas e a amostra mudam a dificuldade; registre a diferença e evite atribuir tudo à arquitetura.
✗ Evitar a conclusão automática
Posso comparar 72 classes com 77 como se fosse a mesma prova?
Não aceite uma resposta só pelo nome do campo ou pela aparência de precisão. Confira a definição e o contexto desta seção.
Conceitos-chave
condições
exemplos usados
objetivo medido
condições alinhadas
Teste sua compreensão
Posso comparar 72 classes com 77 como se fosse a mesma prova?
Conferir resposta comentada
Não sem ressalvas. O espaço de respostas e a amostra mudam a dificuldade; registre a diferença e evite atribuir tudo à arquitetura.
Os limites do zero-shot
O que é
O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora. Isso indica que instruir perguntas novas não garante competência no domínio. A especialização e os dados de treino importam para interpretar o resultado.
Por que aprender
No laboratório, o conjunto pequeno de tickets é um smoke test funcional. Mesmo um resultado excelente não valida mensagens reais, abreviações, casos adversariais ou categorias raras. O próximo passo é reunir exemplos representativos antes de decidir investir em treinamento.
Um modelo treinado para quatro workflows sintéticos não é automaticamente um analista universal de processos empresariais.
-
1
Observe
Um modelo treinado para quatro workflows sintéticos não é automaticamente um analista universal de processos empresariais.
-
2
Defina
O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora.
-
3
Confira
Não. A ficha informa o escopo específico e recomenda validação própria; desempenho fora desses workflows pode cair.
Conceitos-chave
tarefa sem ajuste
referência simples
modelo ajustado
novos dados
Teste sua compreensão
O modelo especializado ter boa acurácia dispensa teste em outro domínio?
Conferir resposta comentada
Não. A ficha informa o escopo específico e recomenda validação própria; desempenho fora desses workflows pode cair.
Acurácia e matriz de confusão
O que é
Acurácia é a fração de previsões corretas. Ela pode esconder desequilíbrio e erros concentrados numa classe. Uma matriz de confusão conta, para cada rótulo esperado, quais saídas foram produzidas. Compare também uma regra simples, como sempre escolher a classe mais frequente.
Por que aprender
Em atendimento, confundir sales com other pode ter impacto diferente de desviar um incidente crítico. Relate erros por categoria e exemplos representativos. Com amostra pequena, mostre contagens além de porcentagens para não sugerir precisão estatística que os dados não sustentam.
Se 90 de 100 tickets são financeiros, escolher billing sempre já dá 90% de acurácia, sem entender qualquer texto.
Exemplo de raciocínio
python3 -m practical --device cuda evaluate --output avaliacao.json
# Amostra local: 16 tickets sintéticos, 4 departamentos
# 13/16 acertos; baseline majoritária = 4/16
# Resultado didático, não validação de produção.
Conceitos-chave
fração correta
erro entre classes
classes desiguais
classe dominante
Teste sua compreensão
Por que o dataset didático inclui quatro classes em igual quantidade?
Conferir resposta comentada
Para tornar o smoke test fácil de inspecionar e a baseline explícita. Isso não reproduz necessariamente a frequência real de uma operação.
Brier e ECE respondem perguntas diferentes
O que é
O Brier multiclasses soma o erro quadrático entre probabilidades e rótulo one-hot. ECE compara, em faixas de probabilidade, confiança média e frequência de acerto. A implementação usa a probabilidade da classe escolhida em dez bins, não a confiança de entropia do SDK.
Por que aprender
Declare a fórmula: alguns relatórios dividem Brier pelo número de classes, outros somam. ECE depende das faixas e da amostra; poucos casos deixam bins vazios ou instáveis. Um valor pequeno em dezesseis exemplos não é comprovação de calibração.
Uma previsão errada com probabilidade 0,99 recebe penalidade maior que uma distribuição cautelosa. As duas podem ter a mesma acurácia de argmax.
✓ Aplicar com critério
As normalizações, classes e conjuntos podem diferir. Mesmo o mesmo nome de métrica não garante uma definição idêntica.
✗ Evitar a conclusão automática
Por que não comparar Brier de dois relatórios sem ler o método?
Não aceite uma resposta só pelo nome do campo ou pela aparência de precisão. Confira a definição e o contexto desta seção.
Conceitos-chave
erro da distribuição
diferença por faixas
rótulo unitário
intervalo de probabilidade
Teste sua compreensão
Por que não comparar Brier de dois relatórios sem ler o método?
Conferir resposta comentada
As normalizações, classes e conjuntos podem diferir. Mesmo o mesmo nome de métrica não garante uma definição idêntica.
Calibração exige dados reservados
O que é
Temperature scaling divide logits por uma temperatura antes do softmax. Pode reduzir excesso de confiança sem melhorar a classificação escolhida. Ajustar a temperatura e medir seu efeito nos mesmos dados cria uma estimativa otimista. Separe calibração de avaliação final.
Por que aprender
O checkpoint multilingual é descrito como não calibrado para o domínio do usuário. O laboratório informa essa condição e não finge realizar calibração. Antes de confiar num limiar, reúna dados suficientes e acompanhe taxa de erro versus cobertura no conjunto reservado.
Treino ensina parâmetros; calibração ajusta probabilidades; teste mede o resultado final sem novos ajustes.
Conceitos-chave
escala de logits
dados reservados
fração aceita
uso indevido do teste
Teste sua compreensão
Ajustar temperatura pode corrigir o departamento errado em todos os casos?
Conferir resposta comentada
Não. Uma temperatura positiva global preserva a ordem dos logits. Ela altera a distribuição, não a capacidade de distinguir classes.
Execute e interprete a avaliação local
O que é
O comando evaluate lê JSONL, roda pesos reais e grava resultados por exemplo, acurácia, baseline, Brier e ECE. As mensagens são sintéticas e o relatório traz uma limitação explícita. Inspecione cada erro antes de pensar em treinamento ou alteração de limiar.
Por que aprender
Use o relatório como ponto de partida para um conjunto próprio. Acrescente negações, duplicatas, mensagens muito curtas, categorias raras e textos longos. Se mudar perguntas após ver os resultados, mantenha a versão anterior e avalie em novos casos reservados.
python3 -m practical --device cuda evaluate --output avaliacao.json
Conceitos-chave
um caso por linha
resultados por caso
oportunidade de diagnóstico
dados não vistos
Teste sua compreensão
Qual conclusão é permitida se todos os exemplos didáticos acertarem?
Conferir resposta comentada
Que o caminho de inferência classificou corretamente aquela amostra, naquele ambiente e esquema. Não que a ferramenta está validada para produção.
Resumo do módulo
- Não sem ressalvas. O espaço de respostas e a amostra mudam a dificuldade; registre a diferença e evite atribuir tudo à arquitetura.
- Para tornar o smoke test fácil de inspecionar e a baseline explícita. Isso não reproduz necessariamente a frequência real de uma operação.
- Não. Uma temperatura positiva global preserva a ordem dos logits. Ela altera a distribuição, não a capacidade de distinguir classes.
Selecione um trecho da aula para destacar ou anotar. Dúvidas e notas ficam na sua jornada; exporte o JSON para fazer backup.