Avaliação pessoal para Claude Code

Compare modelos com o seu trabalho real

Use as tarefas que você realmente executa e os critérios que você realmente cobra para descobrir qual modelo funciona melhor para você.

Dois sistemas neurais sendo comparados em um laboratório de avaliação
O que é

Seu histórico vira o teste

O benchmark parte das conversas e correções que já existem no seu Claude Code. O resultado mede aderência ao seu jeito de trabalhar, não a uma prova genérica.

🧭 Trabalho pessoal

Extrai tarefas recorrentes do seu próprio histórico e transforma suas correções em critérios de qualidade.

🧊 Comparação congelada

Reutiliza o mesmo conjunto de tarefas entre execuções, preservando a validade da comparação.

⚖️ Julgamento cego

Compara as respostas nas duas ordens e trata divergência do avaliador como empate.

Como funciona

Da conversa ao veredito

A ferramenta minera, executa, julga e apresenta a recomendação em uma cadeia única.

Histórico local→ Tarefas pessoais→ Modelos em paralelo→ Julgamento cego→ Veredito + relatório
Pré-requisitos

Instalação leve

Não há dependências Python para instalar. As execuções usam a assinatura do Claude Code já autenticada.

Claude Code

Tenha o CLI instalado e conectado à sua conta.

# confirme a instalação
claude --version

Python 3.9+

Os scripts usam apenas a biblioteca padrão.

# confira a versão
python3 --version

macOS ou Linux

O fluxo lê o histórico local do Claude Code.

# pasta usada como fonte
~/.claude/projects
Guia de uso · passo a passo

Do clone à recomendação

Instale a skill, construa seu conjunto pessoal e compare modelos com comandos curtos.

1

Instale a skill

Clone o projeto diretamente na pasta global de skills do Claude Code.

git clone https://github.com/inematds/personal-benchmark.git ~/.claude/skills/benchmark
2

Abra o menu

O primeiro uso apresenta a configuração inicial e pede permissão antes de criar memória persistente.

/benchmark
3

Construa seu conjunto pessoal

Analise o histórico recente e aprove as tarefas representativas antes da primeira comparação.

/benchmark mine
4

Compare os modelos

O modelo antigo vai primeiro como referência. O novo entra como desafiante.

/benchmark opus-4.8 vs opus-5
5

Leia o veredito

Receba a recomendação, o relatório detalhado e um cartão pronto para compartilhar.

/benchmark report
Exemplos

Duas perguntas que o benchmark responde

Compare gerações diferentes ou descubra quanto esforço realmente vale a pena no seu tipo de tarefa.

Capa do Personal Benchmark com dois sistemas neurais lado a lado
Modelo novo: o Opus 5 melhora o seu trabalho em relação ao Opus 4.8?
Laboratório digital comparando dois sistemas neurais
Nível de esforço: o resultado em high compensa o tempo e o volume adicionais?
Roadmap

Um fluxo completo, de ponta a ponta

Cada fase deixa artefatos verificáveis e preserva o conjunto usado naquela execução.

MINERAR
Descobrir o seu trabalho realAgrupa tarefas recorrentes e aproveita suas correções como critérios.
COMPARAR
Executar o mesmo testeRoda cada modelo em ambiente isolado e guarda respostas, arquivos e métricas.
DECIDIR
Transformar evidência em escolhaEntrega veredito, relatório navegável e recomendação por categoria.