← Construir e avaliar

MÓDULO 10 · TRÊS AULAS, SEIS ETAPAS

Medir qualidade de verdade

Comparar métodos sem confundir exemplos ajustados com evidência independente.

Referência Teste separado Métricas
0/72 etapas · 0%
Ajustar leitura e aparência
AULA 10.1 · CONCEITO

Construir referência humana

O que é

Uma avaliação começa com a definição do que é correto. Se os rótulos mudam de pessoa para pessoa, a métrica pode estar medindo desacordo de processo. Crie um guia de rotulagem, revise exemplos e documente os casos que não se encaixam bem.

Separe desenvolvimento, calibração e teste. Use desenvolvimento para melhorar perguntas; calibração para escolher limiares; teste para verificar a política congelada. Mensagens da mesma conversa não podem ficar em partições diferentes, pois isso facilita o reconhecimento de conteúdo já visto. Quando houver variação no tempo, avalie também dados posteriores.

Os 24 tickets fictícios do laboratório servem para aprender a executar e ler uma avaliação. Não são uma amostra representativa de uma empresa nem comprovam adequação à produção. Um dataset operacional precisa cobrir as classes, ambiguidades e mudanças do tráfego real, com revisão humana e proteção dos dados.

Por que aprender

Comparar métodos sem confundir exemplos ajustados com evidência independente.

Conceitos-chave

Use o exemplo a seguir para distinguir os dados disponíveis, o julgamento solicitado e o que ainda precisa de comprovação.

AULA 10.1 · PRÁTICA

Aplicar: Construir referência humana

Sua vez

Pode ajustar a pergunta depois de olhar o erro do teste final e divulgar a nova taxa no mesmo teste como independente?

Conferir resposta comentada

Não. O teste foi usado no ajuste. É necessário reservar outro conjunto para uma nova avaliação independente.

AULA 10.2 · CONCEITO

Comparar alternativas

O que é

Use a mesma tarefa e os mesmos dados para comparar regras, Jev, um modelo generativo com saída estruturada e um fluxo híbrido. Registre configurações e versões. Diferenças de entrada ou de critérios tornam a comparação difícil de interpretar.

Acurácia informa a proporção total de acertos, mas pode esconder classes pequenas. A matriz de confusão mostra para onde cada classe foi encaminhada. Macro-F1 dá o mesmo peso às classes, embora também precise ser lida com as contagens. Observe especialmente o erro que tem maior custo operacional.

Meça latência ponta a ponta e custo de todas as tentativas. O resultado da baseline lexical deste projeto é reproduzível pela CLI: ele apresenta acertos e erros conhecidos no conjunto fictício. Não compare esse tempo local de regra com latência de rede como se fossem a mesma coisa. O experimento Jev real só poderá ser reportado após execução com acesso ao serviço.

Prática com os recursos atuais

O avaliador complementar pacotes.qualidade exige uma referência para cada pergunta. Choice mede acurácia; Noul mede acurácia com corte 0,5 e Brier; Score mede erro absoluto e erro normalizado pela escala. O corte usado na métrica não define a política de ação. Erros de contrato reduzem cobertura e acurácia; MAE e Brier usam apenas respostas válidas, por isso precisam ser lidos junto com a cobertura.

Por que aprender

Comparar métodos sem confundir exemplos ajustados com evidência independente.

Conceitos-chave

Use o exemplo a seguir para distinguir os dados disponíveis, o julgamento solicitado e o que ainda precisa de comprovação.

AULA 10.2 · PRÁTICA

Aplicar: Comparar alternativas

Sua vez

Uma classe muito comum tem 99% de acerto e outra importante tem 40%. A média global basta?

Conferir resposta comentada

Não. Reportar métricas por classe, suporte amostral, matriz de confusão e custo dos erros. A média pode esconder a classe importante.

AULA 10.3 · CONCEITO

Escolher e congelar limiares

O que é

Ao aumentar um limiar, normalmente menos respostas passam para a sugestão automática. Isso pode reduzir alguns erros, mas aumenta a revisão e pode deixar passar os erros mais confiantes. Precisamos medir duas coisas juntas: qualidade dos casos aceitos e cobertura, a fração de casos que a política aceita.

Escolha o limiar no conjunto de calibração e congele antes do teste. Registre se ele usa a probabilidade da classe, confidence ou ambos. Não copie o limiar de uma primitiva para outra, de um idioma para outro ou de uma versão para outra sem avaliação.

A incerteza da medição importa. Se dez exemplos passaram sem erro, ainda não temos prova de que a taxa de erro seja pequena. Quanto mais estreita a meta, maior tende a ser a necessidade de dados. Quando a amostra é insuficiente, a conclusão correta pode ser coletar mais exemplos, em vez de declarar sucesso.

Aprofundamento da versão 1.2.0

A CLI experiment registra dataset, template, política, modelo, falhas e procedência. O modo replay permite comparar respostas externas, incluindo LLM, mas não autentica a origem declarada. Uma comparação de modelo isolado deve ter entrada equivalente; uma comparação de fluxo mede a tarefa inteira.

Agrupe previsões por faixas de confiança para investigar onde os erros aparecem, preservando tamanho de cada grupo e classe. Poucos exemplos por faixa geram conclusões frágeis. Uma mudança de critério que corrige um caso conhecido precisa ser reexecutada em um conjunto independente; não basta demonstrar o caso corrigido.

Por que aprender

Comparar métodos sem confundir exemplos ajustados com evidência independente.

Conceitos-chave

Use o exemplo a seguir para distinguir os dados disponíveis, o julgamento solicitado e o que ainda precisa de comprovação.

AULA 10.3 · PRÁTICA

Aplicar: Escolher e congelar limiares

Sua vez

Por que essa interação com valores inventados não comprova que 0,95 é o limiar certo?

Conferir resposta comentada

Porque não mede respostas reais contra rótulos independentes. Demonstra apenas como uma política reage aos números.

Fechamento do módulo

  1. Recupere a decisão escolhida no início do curso.
  2. Compare sua resposta com os exemplos deste módulo.
  3. Registre uma alteração nos critérios e o teste necessário para aceitá-la.

Verificação rápida

Você corrigiu critérios até acertar todos os exemplos conhecidos. Como medir a melhoria?

Prática e continuidade

Abrir os laboratórios e gabaritos · Laboratório visual do projeto

# No repositório jev: demonstração offline, sem API
python3 -m pacotes.executar reunioes
python3 -m pacotes.qualidade reunioes

Estas saídas usam uma fixture fictícia. Para testar seus dados, use o roteiro de referência humana e o modo real explicitamente.