PTENES
Saltar al contenido
RUTA 4

🛡️ La prueba real

Antes de creer en cualquier número, hay que confiar en la vara. Esta ruta muestra cómo midió tres veces — 7 sesiones locales, luego una muestra igualada y después 4.892 pasos del dataset abierto — y descubrió que una muestra pequeña engaña en ambas direcciones. Y qué soluciones aplicar para medir, inyectar y reproducir sin equivocarte.

7 sesiones ±inestable muestra 1 ~950 pasos igualada · ruidosa muestra 2 4.892 pasos 30 sesiones · HF sólida muestra 3 85% vs 54% +31pp · defendible
3
Módulos
18
Temas
~75 min
Duración
Avanzado
Nivel
Progreso de la Ruta 4 0%
0 de 0

Mapa de la ruta

Contenido detallado

4.1 ~25 min

🪤 La trampa de la muestra

Cómo las muestras pequeñas engañan en ambas direcciones: el recorrido de las tres pruebas hasta llegar a un número defendible.

Qué es:

El recorrido de la medición en tres rondas: 7 sesiones locales → muestra igualada (~950 pasos) → 4.892 pasos del dataset abierto de HF.

Por qué aprender:

Cada ronda corrige un sesgo de la anterior; ver la secuencia enseña a no confiar en la primera medición.

Conceptos clave:

Medir tres veces; cada muestra más grande; de lo emocionante (engañoso) a lo defendible (sólido).

Qué es:

7 sesiones / ~950 pasos de Fable local dieron 99% de "piensa antes de actuar" contra 54% de Opus — un delta de +45pp.

Por qué aprender:

La cifra entusiasma, pero proviene de apenas 7 sesiones: es el tipo de resultado que parece una prueba y no es más que ruido.

Conceptos clave:

99% vs. 54% (+45pp); muestra de 7 sesiones; emocionante ≠ confiable.

Qué es:

Al igualar el tamaño (~950 pasos de cada uno), Opus salta a 94% en un recorte de solo 4 sesiones.

Por qué aprender:

Limitar el tamaño ayuda a comparar, PERO 4 sesiones siguen siendo pocas: el número varía según el recorte.

Conceptos clave:

Muestra igualada; recorte de 4 sesiones; inestable; el mismo tamaño no basta sin volumen.

Qué es:

4.892 pasos / 30 sesiones del dataset abierto Glint-Research/Fable-5-traces: Fable 85% vs. Opus 54% (+31pp).

Por qué aprender:

La muestra grande de ambos lados es lo que hace que el número sea defendible: la vara que conviene llevar adelante.

Conceptos clave:

85% vs 54% (+31pp); 4.892 pasos / 30 sesiones; dataset abierto; defendible.

Qué es:

La muestra pequeña INFLÓ el «pensar antes de actuar» (99→85) Y OCULTÓ la «prueba después de editar» (en el conjunto local daba 0%; el valor real es 41%).

Por qué aprender:

Es el punto central del recorrido: una muestra pequeña no se equivoca solo hacia arriba — se equivoca en ambos sentidos.

Conceptos clave:

Inflar (99→85) y ocultar (0→41%); el sesgo tiene dos direcciones; presencia, no contenido.

Qué es:

Nunca concluyas a partir de una muestra pequeña; equilibra los tamaños antes de comparar; confirma con una muestra grande antes de creerlo.

Por qué aprender:

Es el destilado práctico de la trampa — la disciplina que separa un número de una opinión.

Conceptos clave:

No concluir demasiado pronto; equilibrar tamaños; confirmar con una muestra grande; mantener el escepticismo hasta alcanzar el volumen necesario.

Ver completo
4.2 ~25 min

🛠️ Las soluciones aplicables

El playbook corregido y cómo medir, inyectar y reproducir correctamente: honestidad por encima del hype.

Qué es:

Solo dos reglas se transfieren con respaldo: pensar antes de actuar (85 vs 54) y cerrar el ciclo con una prueba después de editar (41 vs 2).

Por qué aprender:

El foco vale más que el volumen: un playbook de dos reglas con respaldo supera a uno de diez sin pruebas.

Conceptos clave:

Pensar antes (85 vs 54); probar después (41 vs 2); solo lo que realmente se transfiere.

Qué es:

Un hook SessionStart lee uno .md por separado (editable sin modificar el settings), es fail-open y se MEZCLA en el array de hooks — no lo sobrescribe.

{
  "hooks": {
    "SessionStart": [
      { "hooks": [
        { "type": "command",
          "command": "cat ~/.claude/fable-playbook.md 2>/dev/null || true" }
      ] }
    ]
  }
}
Por qué aprender:

Separar la regla en un .md te permite iterar el playbook sin tocar settings, y el || true garantiza que la sesión nunca se interrumpa.

Conceptos clave:

SessionStart; .md editable; fail-open; combinar el array (no sobrescribirlo).

Qué es:

Equilibra la muestra (limita por número de pasos, p. ej.: ~950) y avisa cuando los tamaños difieran demasiado entre los modelos.

Por qué aprender:

Es exactamente lo que evita el +45pp falso: sin balanceo, el modelo con más datos parece «mejor».

Conceptos clave:

Limita por pasos; alerta de divergencia; compara solo tamaños similares.

Qué es:

Descargar el dump CRU de Glint-Research/Fable-5-traces (son .jsonl de Claude Code, no un chat aplanado) vía API de HF — sin la lib datasets — y ejecutar en el fable_lib.

BASE=https://huggingface.co/datasets/Glint-Research/Fable-5-traces/resolve/main
curl -sL "$BASE/<arquivo>.jsonl" -o sessao.jsonl
python -m fable_lib.measure sessao.jsonl
Por qué aprender:

Es cómo obtener una referencia amplia incluso sin datos propios — y conservar el formato de eventos que necesita el medidor.

Conceptos clave:

Volcado EN BRUTO; .jsonl de eventos; API de HF; sin datasets; ejecutarlo en fable_lib.

Qué es:

Los comandos que reproducen la medición (extract_corpus.py, compare_models.py, el medidor de HF) y guardar una línea de base CON FECHA en un lugar duradero; no en /tmp.

Por qué aprender:

Sin una línea base duradera y fechada, no tienes con qué comparar después — y pierdes la prueba de que algo cambió.

Conceptos clave:

extract_corpus / compare_models; medidor de HF; baseline fechado; lugar duradero (no /tmp).

Qué es:

Presencia ≠ contenido (el razonamiento está cifrado en los logs); los pesos del modelo no se transfieren; el playbook debe iterarse con datos nuevos.

Por qué aprender:

Conocer los límites es lo que mantiene el método honesto: copias el ritmo, no el cerebro del modelo.

Conceptos clave:

Razonamiento cifrado; los pesos no se transfieren; itera con datos nuevos; la honestidad está por encima del hype.

Ver completo
4.3 ~25 min

🧰 Ejemplos de utilidad

Dónde resulta realmente útil: elegir un modelo, diagnosticar el tuyo, incorporar al equipo, demostrar un cambio y desmontar el hype.

Qué es:

Sonnet piensa solo 10% y usa pocas herramientas (ideal para tareas rápidas, mecánicas y baratas); Opus y Fable para el trabajo que exige planificar y cerrar el ciclo.

Por qué aprender:

La vara se convierte en criterio de enrutamiento: eliges el modelo según la naturaleza de la tarea, con los números a la mano.

Conceptos clave:

Sonnet 10% / pocas herramientas; Opus y Fable para planificar y cerrar el ciclo; modelo según la tarea.

Qué es:

Mide tus propios logs y fíjate dónde fallas. Ej.: si tu Opus prueba después de editar solo 2%, la mayor ventaja está en cerrar el ciclo, no en «pensar más».

Por qué aprender:

Transforma consejos genéricos en un diagnóstico personal: corriges la falla que muestran TUS datos.

Conceptos clave:

Medir los propios logs; encontrar la falla real; palanca = donde el número es más bajo.

Qué es:

Inyectar el buen ritmo por defecto (hook SessionStart o CLAUDE.md) para que todo dev empiece la sesión con pensar antes + probar después.

Por qué aprender:

Estandariza el buen comportamiento sin depender de que cada persona lo recuerde — el playbook se convierte en cultura, no en folclore.

Conceptos clave:

Default mediante hook/CLAUDE.md; pensar antes + probar después; no depender de la memoria individual.

Qué es:

Baseline fechado ANTES, aplica el playbook, mide DESPUÉS con una muestra suficiente: transforma "creo que mejoró" en un número.

Por qué aprender:

Es la diferencia entre impresión y evidencia. Cuidado con la dilución: aísla las sesiones nuevas para que el efecto no desaparezca en el promedio.

Conceptos clave:

Antes/después; baseline fechado; muestra suficiente; aislar sesiones nuevas (antidilución).

Qué es:

El mismo método mide Codex y modelos de código abierto: basta con tener los registros en formato de eventos. El campo model es la clave.

Por qué aprender:

La vara no es específica de un proveedor: donde haya eventos con model, mides.

Conceptos clave:

Codex y código abierto; formato de eventos; campo model como clave; método agnóstico.

Qué es:

Usa la regla para exigir un número de muestra grande antes de creer cualquier «el modelo X es mejor que Y».

Por qué aprender:

Así fue exactamente como derribamos el "+45pp": exigir una muestra es lo que separa el marketing de la medición.

Conceptos clave:

Exigir una muestra grande; escepticismo ante las afirmaciones; así fue como cayó el +45pp.

Ver completo