Seu conforto de leitura
TRILHA 4

📊 Qualidade e evolução

Meça erros, calibre expectativas e planeje a especialização.

2 módulos 12 tópicos 70–100 min com prática 12 exercícios
Compreender Experimentar Verificar LAYA / INEMA · fluxo conceitual
Seu progresso

Mapa da trilha

4.1 35–50 min

📊 Benchmarks, calibração e avaliação

Compare o que foi realmente medido.

4.2 35–50 min

📊 Especialização e projeto final

Defina quando evoluir e quando parar.

Conteúdo detalhado

MÓDULO 4.1

Benchmarks, calibração e avaliação

Compare o que foi realmente medido.

O que é

As fontes combinam resultados de benchmarks, tarefas e checkpoints diferentes.

Por que aprender

Antes de repetir uma porcentagem, anote modelo, revisão, dataset, quantidade de classes, número de exemplos e método.

Conceitos-chave

Protocolo

condições

Amostra

exemplos usados

Tarefa

objetivo medido

Comparabilidade

condições alinhadas

O que é

O relatório atual mostra os checkpoints base abaixo da baseline de classe majoritária em typed-decisions, enquanto a versão especializada melhora.

Por que aprender

No laboratório, o conjunto pequeno de tickets é um smoke test funcional.

Conceitos-chave

Zero-shot

tarefa sem ajuste

Baseline

referência simples

Especialista

modelo ajustado

Generalização

novos dados

O que é

Acurácia é a fração de previsões corretas.

Por que aprender

Em atendimento, confundir sales com other pode ter impacto diferente de desviar um incidente crítico.

Conceitos-chave

Acurácia

fração correta

Confusão

erro entre classes

Desbalanceamento

classes desiguais

Baseline majoritária

classe dominante

O que é

O Brier multiclasses soma o erro quadrático entre probabilidades e rótulo one-hot.

Por que aprender

Declare a fórmula: alguns relatórios dividem Brier pelo número de classes, outros somam.

Conceitos-chave

Brier

erro da distribuição

ECE

diferença por faixas

One-hot

rótulo unitário

Bin

intervalo de probabilidade

O que é

Temperature scaling divide logits por uma temperatura antes do softmax.

Por que aprender

O checkpoint multilingual é descrito como não calibrado para o domínio do usuário.

Conceitos-chave

Temperatura

escala de logits

Holdout

dados reservados

Cobertura

fração aceita

Vazamento

uso indevido do teste

O que é

O comando evaluate lê JSONL, roda pesos reais e grava resultados por exemplo, acurácia, baseline, Brier e ECE.

Por que aprender

Use o relatório como ponto de partida para um conjunto próprio.

Conceitos-chave

JSONL

um caso por linha

Evidência

resultados por caso

Erro

oportunidade de diagnóstico

Novo teste

dados não vistos

Ver Completo →
MÓDULO 4.2

Especialização e projeto final

Defina quando evoluir e quando parar.

O que é

Fine-tuning tem custo e só faz sentido quando os erros encontrados justificam mudar o modelo.

Por que aprender

Classifique erros antes de agir: erro de rótulo humano, de esquema, de contexto, de idioma ou de capacidade.

Conceitos-chave

Diagnóstico

causa provável

Intervenção

mudança controlada

Capacidade

aprendizado necessário

Custo

esforço total

O que é

Um dataset de domínio precisa representar linguagem, frequência de classes e casos difíceis da operação.

Por que aprender

Registre versão da rubrica e processo de rotulagem.

Conceitos-chave

Split

partição

Grupo

unidade de separação

Professor

fonte de rótulos

Vazamento

informação compartilhada

O que é

O repositório inclui um notebook de fine-tuning para typed-decisions em duas GPUs T4.

Por que aprender

Leia as células, checkpoints de saída e destino de publicação antes de executar.

Conceitos-chave

Notebook

execução por células

Época

passagem pelos dados

Checkpoint de saída

pesos novos

Publicação

etapa separada

O que é

O trabalho usa recompensas baseadas em distribuições, incluindo componentes logarítmico e esférico e um termo ordinal para score.

Por que aprender

Uma função de treino com propriedades desejáveis não garante calibração após treinamento finito ou mudança de domínio.

Conceitos-chave

Regra própria

incentivo probabilístico

Recompensa

sinal de treino

Ordinalidade

distância entre níveis

Mudança de domínio

novos dados

O que é

Uma evolução razoável começa em modo sombra: o modelo recomenda, humanos decidem e divergências são analisadas.

Por que aprender

Defina métricas e critérios de parada antes do piloto.

Conceitos-chave

Modo sombra

sem ação

Drift

mudança dos dados

Rollback

volta de versão

Critério de parada

limite definido

O que é

Entregue o projeto funcionando, contrato das quatro perguntas, dataset versionado, relatório de inferência e análise de limitações.

Por que aprender

Compare três exemplos: um claro, um ambíguo e um fora do domínio.

Conceitos-chave

Reprodutibilidade

repetir

Rastreabilidade

encontrar origem

Limitação

fronteira conhecida

Próximo experimento

hipótese

Ver Completo →
Leitura do módulo