PTENES
Saltar al contenido
RUTA 2

🛠️ Manos a la obra

Ahora que sabes dónde está el oro, puedes extraerlo. Esta ruta ejecuta los scripts de verdad: el debloat que destila una sesión pesada en una transcripción ligera, y el extract/compare que extrae el corpus de cada modelo y mide el delta Fable vs Opus en números reales.

sesión.jsonl crudo / pesado 100% debloat destila lo esencial transcripción ligero / legible ~26% turno lógico · ¿pensó antes? herramientas / turno read-antes-de-edit Δ Fable vs Opus
2
Módulos
12
Temas
~55 min
Duración
Práctico
Nivel
Progreso de la Ruta 2 0%
0 de 0

Mapa de la ruta

Contenido detallado

2.1 ~25 min

🧪 Debloat: destilando la transcripción

Qué descartar, qué guardar, el script que hace eso y el ~74% que desaparece, sin perder el ritmo.

Qué es:

La mayor parte de una sesión JSONL es grasa: tool_result con la salida repetida, volcados de archivos completos, salida de comandos y adjuntos en base64. Cargar lo crudo en el contexto es un desperdicio.

Por qué aprender:

Sin destilar, cualquier análisis ahoga la señal en bytes opacos — y consume contexto innecesariamente.

Conceptos clave:

La salida repetida y los blobs son peso, no comportamiento; el contenido sin procesar no cabe en el contexto.

Qué es:

Preserva tus prompts, el texto del asistente, el message.model, 1 línea por tool_use (nombre + objetivo breve) y la PRESENCIA de razonamiento (marca 🧠, ya que el texto viene cifrado).

Por qué aprender:

Es exactamente el oro — decisiones, orden de las acciones y cadencia — que usará el playbook.

Conceptos clave:

Mantén el ritmo, no la salida; marca 🧠 = pensó (sin revelar qué).

Qué es:

Descarta los payloads de tool_result, los blobs adjuntos y la contabilidad del harness: usage, uuids, isMeta, sidechain.

Por qué aprender:

Es lo que pesa y no aporta señal de comportamiento — descartarlo no cambia el ritmo medido.

Conceptos clave:

Se eliminan la salida repetida y los metadatos del harness; se conserva el «qué se hizo».

Qué es:

Se ejecuta en el demo_session.jsonl por defecto; acepta -o (salida), --no-thinking e --no-open; imprime el tamaño antes y después.

Por qué aprender:

Es la primera herramienta práctica — ves el formato ligero en acción.

Conceptos clave:

Default = demo; -o elige la salida; muestra antes → después.

Qué es:

En una sesión típica, el debloat recorta cerca de 74% del peso — lo superfluo era la mayor parte del archivo.

Por qué aprender:

Ajusta las expectativas: la señal cabe en un archivo pequeño y legible.

Conceptos clave:

−74% típico; el ~26% restante es el oro que analizas.

Qué es:

Cada bloque del asistente es una LÍNEA separada; el debloat conserva el orden, así que ves al asistente en varios encabezados seguidos. Es normal.

Por qué aprender:

Por eso el análisis agrupa por TURNO LÓGICO — de lo contrario, la señal se diluye por línea.

Conceptos clave:

Orden preservado; varios encabezados = un turno; agrupa por indicación humana.

Ver completo
2.2 ~30 min

📊 Corpus, números y el Delta Fable vs Opus

Extraer el corpus por modelo, medir el ritmo con números reales, comparar dos modelos y leer el delta con honestidad.

Qué es:

extract_corpus.py --model claude-fable-5 extrae TODOS los turnos de un modelo de todo el historial (todos los proyectos). --list muestra los modelos presentes.

Por qué aprender:

Es lo que separa el corpus de cada modelo — la base de toda comparación.

Conceptos clave:

Filtrar por message.model; recorre proyectos enteros; --list revela los modelos.

Qué es:

Un turno lógico es 1 prompt humano hasta el siguiente. Como cada bloque es una línea, medir por línea distorsiona; por eso las métricas se calculan por turno lógico.

Por qué aprender:

Es la unidad que revela «cuánto hizo el modelo para responder a ese prompt» — el ritmo real.

Conceptos clave:

Prompt → prompt; agrupa bloques; todas las métricas son por turno lógico.

Qué es:

Turnos lógicos, % que pensaron antes, herramientas/turno (promedio y mediana), lectura antes de editar y prueba después de editar: todo medido, no estimado a ojo.

Por qué aprender:

Cambiar impresiones por cifras es lo que hace que el hallazgo sea defendible y transferible.

Conceptos clave:

Presencia de razonamiento + densidad de herramientas + orden (read→edit→test).

Qué es:

compare_models.py --a claude-fable-5 --b claude-opus-4-8 imprime la tabla lado a lado y la columna Δ; --out compare.json guarda el resultado.

Por qué aprender:

El Δ es la materia prima del playbook: la diferencia entre los dos ritmos.

Conceptos clave:

Dos columnas + Δ; cada fila es una métrica; se guarda en compare.json.

Qué es:

Fable-5 pensó antes en 99% de los turnos frente a Opus 54% (+45 puntos). Herramientas/turno: 6,57 vs 7,86 (Fable más económico).

⚠ Actualización: medido después con una muestra grande (4.892 pasos), el número honesto es ~85% (no 99%) y la brecha baja a +31 pts — y aparece una brecha oculta en prueba-después-de-editar (41% frente a 2%). Consulta la Ruta 4 · La prueba real.

Por qué aprender:

Es el hallazgo sólido y transferible — se convierte en la regla ancla «piensa antes de actuar».

Conceptos clave:

Honestidad: más herramientas ≠ mejor (densidad vs. uso excesivo).

Qué es:

La muestra de Fable es pequeña (7 sesiones), lo que hace que las mediciones de leer antes de editar y probar después de editar sean ruidosas; además, el texto del razonamiento viene cifrado: se mide la presencia, no el contenido.

Por qué aprender:

Saber qué NO afirmar es lo que mantiene el curso honesto y defendible.

Conceptos clave:

Dónde Fable era débil: pensar demasiado en tareas triviales, verbosidad.

Ver completo