Pódio

1º
Claude Fable 5.1
assinatura Claude 97%
2º
GPT-6.1 Sol
assinatura ChatGPT/Codex 94%
3º
GPT-6 Astra
assinatura ChatGPT/Codex 91%Como foi medido
- 19 modelos: 10 rodando no próprio computador (Ollama) e 9 pela assinatura (Claude Code e Codex). Nenhuma API paga.
- Uma tentativa por modelo, no dia 05/10/2026. Rode de novo e o desenho muda: é uma foto, não uma sentença.
- Juiz principal: claude-sonnet-5-5. Viu 306 confrontos, cada par nas duas ordens (esquerda/direita), sem os nomes.
- Lado esquerdo venceu 50% das vezes (50% = sem viés de posição).
- Segundo juiz (gpt-6-luna) refez 64 confrontos sorteados e concordou em 92%.
- Ranking pela taxa de vitória. O ELO (média de 200 ordens sorteadas) vem ao lado só para comparar.
Ranking completo
| # | Desenho | Modelo | Onde roda | Vitórias | Taxa | ||
|---|---|---|---|---|---|---|---|
| 1 | ![]() | Claude Fable 5.1claude-fable-5-1 | assinatura Claude | 33/34 | 97% | ||
| 2 | ![]() | GPT-6.1 Solgpt-6.1-sol | assinatura ChatGPT/Codex | 32/34 | 94% | ||
| 3 | ![]() | GPT-6 Astragpt-6-astra | assinatura ChatGPT/Codex | 31/34 | 91% | ||
| 4 | ![]() | Claude Opus 5.5claude-opus-5-5 | assinatura Claude | 28/34 | 82% | ||
| 5 | ![]() | Qwen 3.8 27Bqwen3.8:27b | no seu PC | 25/34 | 74% | ||
| 6 | ![]() | GPT-5.5gpt-5.5 | assinatura ChatGPT/Codex | 24/34 | 71% | ||
| 7 | ![]() | Claude Sonnet 5.5claude-sonnet-5-5 | assinatura Claude | 22/34 | 65% | ||
| 8 | ![]() | GPT-6 Solgpt-6-sol | assinatura ChatGPT/Codex | 20/34 | 59% | ||
| 9 | ![]() | Qwen 3.6 35B-A3Bqwen3.6:35b-a3b | no seu PC | 18/34 | 53% | ||
| 10 | ![]() | GPT-6 Lunagpt-6-luna | assinatura ChatGPT/Codex | 17/34 | 50% | ||
| 11 | ![]() | Claude Haiku 4.5claude-haiku-4-5-20251001 | assinatura Claude | 14/34 | 41% | ||
| 12 | ![]() | DeepSeek R1 14Bdeepseek-r1:14b | no seu PC | 12/34 | 35% | ||
| 13 | ![]() | Qwen 3 30Bqwen3:30b | no seu PC | 10/34 | 29% | ||
| 14 | ![]() | Llama 3.1 70Bllama3.1:70b | no seu PC | 8/34 | 24% | ||
| 15 | ![]() | Llama 3.2 3Bllama3.2:latest | no seu PC | 5/34 | 15% | ||
| 16 | ![]() | Qwen 2.5 14Bqwen2.5:14b | no seu PC | 4/34 | 12% | ||
| 17 | ![]() | Llama 3.1 8Bllama3.1:8b | no seu PC | 2/34 | 6% | ||
| 18 | ![]() | Llama 3 8Bllama3:latest | no seu PC | 1/34 | 3% | ||
| – | Command R 35Bcommand-r:35b | no seu PC | não entregou SVG válido | ||||
E os modelos locais?
O melhor modelo que roda no próprio computador foi Qwen 3.8 27B, em 5º lugar de 18. O pior da nuvem ficou em 11º.
O confronto mais desigual
Primeiro contra último colocado. O que o juiz escreveu:

A mostra uma capivara reconhecível pedalando uma bicicleta bem desenhada, numa cena completa, enquanto B é só um conjunto de formas abstratas com texto sobreposto, sem capivara nem bicicleta identificáveis.
Todos os desenhos

















