PTENES
Saltar al contenido
MÓDULO 4.1

🪤 La trampa de la muestra

Medimos el mismo delta tres veces — y el número cambió cada vez. Aquí ves cómo una muestra pequeña engaña en las dos direcciones: ella se infló una ventaja que no existía (+45pp) y ocultó otra que era real. La medida honesta solo aparece con una muestra grande de ambos lados.

6
Temas
~25
Minutos
Avanzado
Nivel
Conceptual
Tipo
7 7 sesiones ~950 pasos ~950 muestra igual 4 sesiones (Opus) 4.9k 4.892 pasos (HF) 30 sesiones +45pp engañoso 94% Opus inestable +31pp sólido / defendible
1

🧪 Las tres pruebas, en orden

El delta entre Fable y Opus no salió de una sola medición: salió de una recorrido de tres. Primero, un puñado de sesiones locales. Después, un intento de equilibrar el tamaño. Por último, un dataset abierto con miles de pasos. Cada ronda dio un número diferente, y justamente esa diferencia enseña a no confiar en el primer resultado.

1

7 sesiones locales

El primer recorte: ~950 pasos de Fable local. Emocionante, pero diminuto, y ahí comenzó la trampa.

2

Muestra igualada (~950 cada uno)

Intentamos equilibrarlos limitando por el n.º de pasos. Ayuda — pero si el lado contrario sigue siendo minúsculo, continúa siendo ruido.

3

4.892 pasos de HF

Dataset abierto Fable-5-traces: 30 sesiones. Una muestra grande de ambos lados = un número defendible.

💡 ¿Por qué medir tres veces?

Porque el primer número fue demasiado bonito. Cuando un resultado parece demasiado bueno para ser verdad, la primera pregunta no es «guau, ¿cuánto?» sino «¿de cuántas sesiones salió eso?». Repetirlo con más datos es lo que separa el hallazgo de la ilusión.

2

1️⃣ Prueba 1 — la muestra diminuta

El primer recorte fue de 7 sesiones / 950 pasos de Fable local. El número salió redondo y emocionante: 99% piensa en Fable frente a 54% en Opus — una diferencia de +45pp. Parece la prueba definitiva. Pero el 99% de una muestra de 7 sesiones es exactamente el tipo de número que debería activar la alerta, no cerrar la cuenta.

✓ Lo que la muestra parecía mostrar

  • ✓Fable piensa antes de actuar 99% de las veces.
  • ✓Opus piensa 54% — un abismo de +45pp.
  • ✓"Listo, está probado: Fable es mucho mejor."

✗ Lo que ocultaba la muestra de 7

  • ✗7 sesiones no representan el comportamiento típico.
  • ✗El 99% casi nunca sobrevive a más datos (bajó al 85%).
  • ✗El +45pp era un artefacto del tamaño, no un hecho.

🔎 La trampa del 99%

Un valor tan extremo (99%) con un n pequeño es una señal clásica de sobreajuste a la muestra: pocas sesiones, todas parecidas, y la estadística «se satura». El número correcto no es cero ni 99%: es el 85% que solo aparece cuando sumas miles de pasos al cálculo.

3

⚖️ Prueba 2 — misma muestra

Desconfiados del +45pp, probamos lo obvio: equilibrar los tamaños. Limitamos ambos lados a ~950 pasos cada uno. Resultado sorprendente: Opus saltó al 94%. Pero ese recorte de Opus vino de solo 4 sesiones. Limitar el tamaño ayudó a reducir el sesgo del volumen, pero cambió un problema por otro: 4 sesiones todavía son ruido, y el número se volvió inestable.

📊 Lo que aprendimos con la prueba 2

  • Equilibrar el tamaño es necesario — comparar 950 con 42k pasos siempre va a distorsionar.
  • Pero no basta — si el lado equilibrado tiene 4 sesiones, solo cambiaste un sesgo por varianza.
  • 94% de 4 sesiones ≠ verdad — es el mismo error de la prueba 1, ahora del otro lado.

💡 Consejo práctico

Equilibrar la muestra resuelve una de las dos amenazas (el sesgo de volumen). La otra — variación de muestra pequeña — solo desaparece con más sesiones. Equilibra el tamaño e asegúrate de que haya suficiente volumen en ambos lados antes de sacar una conclusión.

4

📊 Prueba 3 — 4.892 pasos de HF

La respuesta vino del dataset abierto Glint-Research/Fable-5-traces: 4.892 pasos en 30 sesiones de Fable, comparados con la base amplia de Opus. Ahora el "pensar antes de actuar" se estabilizó en Fable 85% vs Opus 54% (+31pp). No es el eufórico +45pp ni el 94% invertido: es el número que resiste el volumen. Una muestra grande de ambos lados es lo que hace que la comparación sea defendible.

Prueba Sample Sesiones % piensa (Fable vs Opus) Lectura
1️⃣ local ~950 pasos 7 sesiones 99% vs. 54% (+45pp) engañoso
⚖️ igual ~950 cada uno 4 sesiones (Opus) Opus salta a 94% inestable
📊 HF 4.892 pasos 30 sesiones 85% vs 54% (+31pp) sólido
Dataset

Fable-5-traces (HF)

Pasos

4.892 / 262 turnos

Sesiones

30

Delta sólido

85 vs 54 = +31pp

5

🔀 Engaño en DOS direcciones

Este es el punto central del módulo. Una muestra pequeña no se equivoca solo "de más" — se equivoca en las dos direcciones al mismo tiempo. En nuestro caso, ella se infló el «pensar antes de actuar» (mostró 99%, el real es 85%) y al mismo tiempo ocultó una ventaja real: la "prueba después de editar", que el local marcaba en 0%, en la muestra grande es 41%. Es decir: la muestra pequeña exageró un eje y minimizó el otro.

lo que mostró la muestra pequeña INFLÓ el «pensar» 99% → 85% el real es menor OCULTÓ el «probar» 0% → 41% el real es mayor

↑ Dirección 1 — infló

  • ↑"Pensar antes de actuar": el entorno local decía 99%.
  • ↑La muestra grande corrige a 85%.
  • ↑El exceso se convirtió en un +45pp falso sobre Opus.

↓ Dirección 2 — ocultó

  • ↓"Probar después de editar": el entorno local marcaba 0%.
  • ↓En la muestra grande, Fable prueba 41% (Opus 2%).
  • ↓Una ventaja real quedó invisible en la muestra pequeña.

💡 Recuerda la honestidad de la medición

El texto del thinking viene cifrado en los logs — entonces medimos la presencia del razonamiento, no el contenido. Aun así, su presencia basta para mostrar que la muestra pequeña distorsionó en ambas direcciones: infló donde había poco y borró donde había mucho.

6

📐 La regla de oro

Todo esto se destila en tres mandamientos. Nunca concluyas de una muestra pequeña. Equilibra los tamaños antes de comparar (limitar por el n.º de pasos). Y confirma con una muestra grande antes de creerlo. Fue siguiendo ese criterio que el +45pp eufórico se convirtió en el +31pp defendible, y que por fin apareció la ventaja oculta de «probar» (0→41%).

✓ Hazlo así

  • ✓Equilibra la muestra (p. ej.: ~950 pasos por lado).
  • ✓Exige volumen en ambos lados, no solo en uno.
  • ✓Confirma con un dataset grande antes de creerlo.

✗ Nunca lo hagas

  • ✗Cerrar la cuenta con solo 7 sesiones porque el número se ve bonito.
  • ✗Comparar 950 pasos con 42k sin equilibrar.
  • ✗Creer en el 99% (o en el 94%) sin repetirlo con más datos.

🔎 La vara en una frase

Antes de creer que «el modelo X es mejor que el Y», pregunta: de cuántas sesiones salió esto, ¿y ambos lados estaban equilibrados? Si la respuesta es «pocos» o «no», todavía no tienes un número: tienes una impresión.

🪤 Resumen del módulo

✓
Tres pruebas, en orden — 7 sesiones → muestra igualada → 4.892 pasos de HF.
✓
Prueba 1 — la muestra minúscula — 99% vs 54% (+45pp) con solo 7 sesiones. Engañoso.
✓
Prueba 2 — muestra igual — Opus salta al 94% en un recorte de 4 sesiones. Inestable.
✓
Prueba 3 — 4.892 pasos de HF — Fable 85% vs Opus 54% (+31pp). Sólido.
✓
Engaño en DOS direcciones — infló el "pensar" (99→85) Y ocultó el "probar" (0→41%).
✓
La regla de oro — nunca saques conclusiones de una muestra pequeña; equilibra; confirma con una muestra grande.

A continuación:

Ahora que sabes qué te engañó, veamos las soluciones aplicables: medir con honestidad, inyectar la regla específica y reproducir todo.