📊 Qualidade e evolução
Meça erros, calibre expectativas e planeje a especialização.
Mapa da trilha
📊 Benchmarks, calibração e avaliação
Compare o que foi realmente medido.
📊 Especialização e projeto final
Defina quando evoluir e quando parar.
Conteúdo detalhado
Benchmarks, calibração e avaliação
Compare o que foi realmente medido.
O que é
As fontes combinam resultados de benchmarks, tarefas e checkpoints diferentes.
Por que aprender
Antes de repetir uma porcentagem, anote modelo, revisão, dataset, quantidade de classes, número de exemplos e método.
Conceitos-chave
condições
exemplos usados
objetivo medido
condições alinhadas
O que é
O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora.
Por que aprender
No laboratório, o conjunto pequeno de tickets é um smoke test funcional.
Conceitos-chave
tarefa sem ajuste
referência simples
modelo ajustado
novos dados
O que é
Acurácia é a fração de previsões corretas.
Por que aprender
Em atendimento, confundir sales com other pode ter impacto diferente de desviar um incidente crítico.
Conceitos-chave
fração correta
erro entre classes
classes desiguais
classe dominante
O que é
O Brier multiclasses soma o erro quadrático entre probabilidades e rótulo one-hot.
Por que aprender
Declare a fórmula: alguns relatórios dividem Brier pelo número de classes, outros somam.
Conceitos-chave
erro da distribuição
diferença por faixas
rótulo unitário
intervalo de probabilidade
O que é
Temperature scaling divide logits por uma temperatura antes do softmax.
Por que aprender
O checkpoint multilingual é descrito como não calibrado para o domínio do usuário.
Conceitos-chave
escala de logits
dados reservados
fração aceita
uso indevido do teste
O que é
O comando evaluate lê JSONL, roda pesos reais e grava resultados por exemplo, acurácia, baseline, Brier e ECE.
Por que aprender
Use o relatório como ponto de partida para um conjunto próprio.
Conceitos-chave
um caso por linha
resultados por caso
oportunidade de diagnóstico
dados não vistos
Especialização e projeto final
Defina quando evoluir e quando parar.
O que é
Fine-tuning tem custo e só faz sentido quando os erros encontrados justificam mudar o modelo.
Por que aprender
Classifique erros antes de agir: erro de rótulo humano, de esquema, de contexto, de idioma ou de capacidade.
Conceitos-chave
causa provável
mudança controlada
aprendizado necessário
esforço total
O que é
Um dataset de domínio precisa representar linguagem, frequência de classes e casos difíceis da operação.
Por que aprender
Registre versão da rubrica e processo de rotulagem.
Conceitos-chave
partição
unidade de separação
fonte de rótulos
informação compartilhada
O que é
O repositório inclui um notebook de fine-tuning para typed-decisions em duas GPUs T4.
Por que aprender
Leia as células, checkpoints de saída e destino de publicação antes de executar.
Conceitos-chave
execução por células
passagem pelos dados
pesos novos
etapa separada
O que é
O trabalho usa recompensas baseadas em distribuições, incluindo componentes logarítmico e esférico e um termo ordinal para score.
Por que aprender
Uma função de treino com propriedades desejáveis não garante calibração após treinamento finito ou mudança de domínio.
Conceitos-chave
incentivo probabilístico
sinal de treino
distância entre níveis
novos dados
O que é
Uma evolução razoável começa em modo sombra: o modelo recomenda, humanos decidem e divergências são analisadas.
Por que aprender
Defina métricas e critérios de parada antes do piloto.
Conceitos-chave
sem ação
mudança dos dados
volta de versão
limite definido
O que é
Entregue o projeto funcionando, contrato das quatro perguntas, dataset versionado, relatório de inferência e análise de limitações.
Por que aprender
Compare três exemplos: um claro, um ambíguo e um fora do domínio.
Conceitos-chave
repetir
encontrar origem
fronteira conhecida
hipótese