🛠️ Manos a la obra
Ahora que sabes dónde está el oro, puedes extraerlo. Esta ruta ejecuta los scripts de verdad: el debloat que destila una sesión pesada en una transcripción ligera, y el extract/compare que extrae el corpus de cada modelo y mide el delta Fable vs Opus en números reales.
Mapa de la ruta
Contenido detallado
🧪 Debloat: destilando la transcripción
Qué descartar, qué guardar, el script que hace eso y el ~74% que desaparece, sin perder el ritmo.
La mayor parte de una sesión JSONL es grasa: tool_result con la salida repetida, volcados de archivos completos, salida de comandos y adjuntos en base64. Cargar lo crudo en el contexto es un desperdicio.
Sin destilar, cualquier análisis ahoga la señal en bytes opacos — y consume contexto innecesariamente.
La salida repetida y los blobs son peso, no comportamiento; el contenido sin procesar no cabe en el contexto.
Preserva tus prompts, el texto del asistente, el message.model, 1 línea por tool_use (nombre + objetivo breve) y la PRESENCIA de razonamiento (marca 🧠, ya que el texto viene cifrado).
Es exactamente el oro — decisiones, orden de las acciones y cadencia — que usará el playbook.
Mantén el ritmo, no la salida; marca 🧠 = pensó (sin revelar qué).
Descarta los payloads de tool_result, los blobs adjuntos y la contabilidad del harness: usage, uuids, isMeta, sidechain.
Es lo que pesa y no aporta señal de comportamiento — descartarlo no cambia el ritmo medido.
Se eliminan la salida repetida y los metadatos del harness; se conserva el «qué se hizo».
Se ejecuta en el demo_session.jsonl por defecto; acepta -o (salida), --no-thinking e --no-open; imprime el tamaño antes y después.
Es la primera herramienta práctica — ves el formato ligero en acción.
Default = demo; -o elige la salida; muestra antes → después.
En una sesión típica, el debloat recorta cerca de 74% del peso — lo superfluo era la mayor parte del archivo.
Ajusta las expectativas: la señal cabe en un archivo pequeño y legible.
−74% típico; el ~26% restante es el oro que analizas.
Cada bloque del asistente es una LÍNEA separada; el debloat conserva el orden, así que ves al asistente en varios encabezados seguidos. Es normal.
Por eso el análisis agrupa por TURNO LÓGICO — de lo contrario, la señal se diluye por línea.
Orden preservado; varios encabezados = un turno; agrupa por indicación humana.
📊 Corpus, números y el Delta Fable vs Opus
Extraer el corpus por modelo, medir el ritmo con números reales, comparar dos modelos y leer el delta con honestidad.
extract_corpus.py --model claude-fable-5 extrae TODOS los turnos de un modelo de todo el historial (todos los proyectos). --list muestra los modelos presentes.
Es lo que separa el corpus de cada modelo — la base de toda comparación.
Filtrar por message.model; recorre proyectos enteros; --list revela los modelos.
Un turno lógico es 1 prompt humano hasta el siguiente. Como cada bloque es una línea, medir por línea distorsiona; por eso las métricas se calculan por turno lógico.
Es la unidad que revela «cuánto hizo el modelo para responder a ese prompt» — el ritmo real.
Prompt → prompt; agrupa bloques; todas las métricas son por turno lógico.
Turnos lógicos, % que pensaron antes, herramientas/turno (promedio y mediana), lectura antes de editar y prueba después de editar: todo medido, no estimado a ojo.
Cambiar impresiones por cifras es lo que hace que el hallazgo sea defendible y transferible.
Presencia de razonamiento + densidad de herramientas + orden (read→edit→test).
compare_models.py --a claude-fable-5 --b claude-opus-4-8 imprime la tabla lado a lado y la columna Δ; --out compare.json guarda el resultado.
El Δ es la materia prima del playbook: la diferencia entre los dos ritmos.
Dos columnas + Δ; cada fila es una métrica; se guarda en compare.json.
Fable-5 pensó antes en 99% de los turnos frente a Opus 54% (+45 puntos). Herramientas/turno: 6,57 vs 7,86 (Fable más económico).
⚠ Actualización: medido después con una muestra grande (4.892 pasos), el número honesto es ~85% (no 99%) y la brecha baja a +31 pts — y aparece una brecha oculta en prueba-después-de-editar (41% frente a 2%). Consulta la Ruta 4 · La prueba real.
Es el hallazgo sólido y transferible — se convierte en la regla ancla «piensa antes de actuar».
Honestidad: más herramientas ≠ mejor (densidad vs. uso excesivo).
La muestra de Fable es pequeña (7 sesiones), lo que hace que las mediciones de leer antes de editar y probar después de editar sean ruidosas; además, el texto del razonamiento viene cifrado: se mide la presencia, no el contenido.
Saber qué NO afirmar es lo que mantiene el curso honesto y defendible.
Dónde Fable era débil: pensar demasiado en tareas triviales, verbosidad.