🧪 Las tres pruebas, en orden
El delta entre Fable y Opus no salió de una sola medición: salió de una recorrido de tres. Primero, un puñado de sesiones locales. Después, un intento de equilibrar el tamaño. Por último, un dataset abierto con miles de pasos. Cada ronda dio un número diferente, y justamente esa diferencia enseña a no confiar en el primer resultado.
7 sesiones locales
El primer recorte: ~950 pasos de Fable local. Emocionante, pero diminuto, y ahí comenzó la trampa.
Muestra igualada (~950 cada uno)
Intentamos equilibrarlos limitando por el n.º de pasos. Ayuda — pero si el lado contrario sigue siendo minúsculo, continúa siendo ruido.
4.892 pasos de HF
Dataset abierto Fable-5-traces: 30 sesiones. Una muestra grande de ambos lados = un número defendible.
💡 ¿Por qué medir tres veces?
Porque el primer número fue demasiado bonito. Cuando un resultado parece demasiado bueno para ser verdad, la primera pregunta no es «guau, ¿cuánto?» sino «¿de cuántas sesiones salió eso?». Repetirlo con más datos es lo que separa el hallazgo de la ilusión.
1️⃣ Prueba 1 — la muestra diminuta
El primer recorte fue de 7 sesiones / 950 pasos de Fable local. El número salió redondo y emocionante: 99% piensa en Fable frente a 54% en Opus — una diferencia de +45pp. Parece la prueba definitiva. Pero el 99% de una muestra de 7 sesiones es exactamente el tipo de número que debería activar la alerta, no cerrar la cuenta.
✓ Lo que la muestra parecía mostrar
- ✓Fable piensa antes de actuar 99% de las veces.
- ✓Opus piensa 54% — un abismo de +45pp.
- ✓"Listo, está probado: Fable es mucho mejor."
✗ Lo que ocultaba la muestra de 7
- ✗7 sesiones no representan el comportamiento típico.
- ✗El 99% casi nunca sobrevive a más datos (bajó al 85%).
- ✗El +45pp era un artefacto del tamaño, no un hecho.
🔎 La trampa del 99%
Un valor tan extremo (99%) con un n pequeño es una señal clásica de sobreajuste a la muestra: pocas sesiones, todas parecidas, y la estadística «se satura». El número correcto no es cero ni 99%: es el 85% que solo aparece cuando sumas miles de pasos al cálculo.
⚖️ Prueba 2 — misma muestra
Desconfiados del +45pp, probamos lo obvio: equilibrar los tamaños. Limitamos ambos lados a ~950 pasos cada uno. Resultado sorprendente: Opus saltó al 94%. Pero ese recorte de Opus vino de solo 4 sesiones. Limitar el tamaño ayudó a reducir el sesgo del volumen, pero cambió un problema por otro: 4 sesiones todavía son ruido, y el número se volvió inestable.
📊 Lo que aprendimos con la prueba 2
- Equilibrar el tamaño es necesario — comparar 950 con 42k pasos siempre va a distorsionar.
- Pero no basta — si el lado equilibrado tiene 4 sesiones, solo cambiaste un sesgo por varianza.
- 94% de 4 sesiones ≠ verdad — es el mismo error de la prueba 1, ahora del otro lado.
💡 Consejo práctico
Equilibrar la muestra resuelve una de las dos amenazas (el sesgo de volumen). La otra — variación de muestra pequeña — solo desaparece con más sesiones. Equilibra el tamaño e asegúrate de que haya suficiente volumen en ambos lados antes de sacar una conclusión.
📊 Prueba 3 — 4.892 pasos de HF
La respuesta vino del dataset abierto Glint-Research/Fable-5-traces: 4.892 pasos
en 30 sesiones de Fable, comparados con la base amplia de Opus. Ahora el "pensar antes de actuar" se estabilizó en
Fable 85% vs Opus 54% (+31pp). No es el eufórico +45pp ni el 94% invertido: es el número que
resiste el volumen. Una muestra grande de ambos lados es lo que hace que la comparación sea defendible.
| Prueba | Sample | Sesiones | % piensa (Fable vs Opus) | Lectura |
|---|---|---|---|---|
| 1️⃣ local | ~950 pasos | 7 sesiones | 99% vs. 54% (+45pp) | engañoso |
| ⚖️ igual | ~950 cada uno | 4 sesiones (Opus) | Opus salta a 94% | inestable |
| 📊 HF | 4.892 pasos | 30 sesiones | 85% vs 54% (+31pp) | sólido |
Fable-5-traces (HF)
4.892 / 262 turnos
30
85 vs 54 = +31pp
🔀 Engaño en DOS direcciones
Este es el punto central del módulo. Una muestra pequeña no se equivoca solo "de más" — se equivoca en las dos direcciones al mismo tiempo. En nuestro caso, ella se infló el «pensar antes de actuar» (mostró 99%, el real es 85%) y al mismo tiempo ocultó una ventaja real: la "prueba después de editar", que el local marcaba en 0%, en la muestra grande es 41%. Es decir: la muestra pequeña exageró un eje y minimizó el otro.
↑ Dirección 1 — infló
- ↑"Pensar antes de actuar": el entorno local decía 99%.
- ↑La muestra grande corrige a 85%.
- ↑El exceso se convirtió en un +45pp falso sobre Opus.
↓ Dirección 2 — ocultó
- ↓"Probar después de editar": el entorno local marcaba 0%.
- ↓En la muestra grande, Fable prueba 41% (Opus 2%).
- ↓Una ventaja real quedó invisible en la muestra pequeña.
💡 Recuerda la honestidad de la medición
El texto del thinking viene cifrado en los logs — entonces medimos la presencia del razonamiento, no el contenido. Aun así, su presencia basta para mostrar que la muestra pequeña distorsionó en ambas direcciones: infló donde había poco y borró donde había mucho.
📐 La regla de oro
Todo esto se destila en tres mandamientos. Nunca concluyas de una muestra pequeña. Equilibra los tamaños antes de comparar (limitar por el n.º de pasos). Y confirma con una muestra grande antes de creerlo. Fue siguiendo ese criterio que el +45pp eufórico se convirtió en el +31pp defendible, y que por fin apareció la ventaja oculta de «probar» (0→41%).
✓ Hazlo así
- ✓Equilibra la muestra (p. ej.: ~950 pasos por lado).
- ✓Exige volumen en ambos lados, no solo en uno.
- ✓Confirma con un dataset grande antes de creerlo.
✗ Nunca lo hagas
- ✗Cerrar la cuenta con solo 7 sesiones porque el número se ve bonito.
- ✗Comparar 950 pasos con 42k sin equilibrar.
- ✗Creer en el 99% (o en el 94%) sin repetirlo con más datos.
🔎 La vara en una frase
Antes de creer que «el modelo X es mejor que el Y», pregunta: de cuántas sesiones salió esto, ¿y ambos lados estaban equilibrados? Si la respuesta es «pocos» o «no», todavía no tienes un número: tienes una impresión.
🪤 Resumen del módulo
A continuación:
Ahora que sabes qué te engañó, veamos las soluciones aplicables: medir con honestidad, inyectar la regla específica y reproducir todo.