PTENES
MÓDULO 2.2

🗑️🔥 Substrato y Contexto — el camión de basura en llamas

La segunda capa de la base: el conocimiento bruto del dominio. Empiezas con un camión de basura en llamas — 500 a 5.000 archivos caóticos. El trabajo es organizar antes de conectar la IA, recopilar lo que falta y destilar todo en hallazgos. Inyecta solo los nuggets.

8
Temas
~55
Minutos
Intermed.
Nivel
Práctico
Tipo
0%
0 de 0 temas leídos · Sección 1 de 8

Contenido detallado

1

🚛 La analogía del camión de basura en llamas

O Sustrato es el conocimiento bruto de tu dominio, y casi siempre empiezas con lo que el autor llama "un camión de basura en llamas". Especialmente en un negocio, son 500, 5.000 archivos de tipos y estructuras variados: PDF, hojas de cálculo, zips e incluso archivos exóticos como Parquet. Caos. El Sustrato es la capa que transforma ese caos en algo que el OS puede usar.

🌱 ¿Nuevo aquí?

Sustrato = el material de referencia guardado fuera del CLAUDE.md, que el OS consulta solo cuando lo necesita. Contexto = lo que realmente entra en la conversación en ese momento. La diferencia es la clave del módulo: guardas mucho (sustrato), pero inyectas poco (contexto) para no exceder el ventana de contexto — el límite de texto que el modelo lee de una vez.

🔥 Qué es

La imagen del camión de basura en llamas sirve para bajar la ansiedad: es normal empezar con desorden. El trabajo no es "tener datos perfectos", sino dar forma al caos — y eso es design, no ingeniería pesada.

  • •Muchos archivos, muchos formatos, cero orden: el punto de partida habitual.
  • •El Substrato es donde este material se vuelve una referencia consultable.

Por qué aprender

Porque la mayoría intenta conectar la IA sobre el caos y se frustra con las respuestas malas. Aceptar el camión de basura en llamas como punto de partida —y tratarlo con método— es lo que distingue un OS que conoce tu dominio de uno que adivina. En dominios con mucho contexto (Tax OS ~34%), esta es la capa más importante de todas.

Conceptos clave

Sustrato
referencia guardada
Contexto
lo que entra en la conversación
500–5.000 archivos
el caos normal
Diseño > ingeniería
dar forma al caos
2

🗂️ Organizar ANTES de conectar la IA

Antes de pedirle cualquier cosa a Claude Code, haz una mini ingeniería de datos: organiza. El autor describe dos divisiones sencillas: primero por tipo de archivo (PDFs con PDFs, hojas de cálculo con hojas de cálculo), luego por edad (últimos 6 meses vs. últimos 2 años). Esto aísla partes del material y le da al OS un terreno limpio.

💡 La IA puede ayudarte a organizar

"Organizar antes" no significa hacerlo todo a mano: puedes pedirle a Claude Code que mover cada archivo a la carpeta de su tipo y después dividir por edad. El punto es que esa organización ocurra antes de cualquier análisis: preparas el terreno y luego lo aprovechas.

El flujo de organización en 3 cortes

1

Por tipo

Cada archivo va a la carpeta de su formato: pdf/, hojas de cálculo/, transcricoes/.

2

Por edad

Dentro de cada tipo, separa lo reciente (últimos 6 meses) de lo antiguo (hasta 2 años). Lo reciente suele valer más.

3

Aislar y nombrar

Con todo separado, queda claro qué es fuente y qué es ruido, y el OS lee solo la parte correcta.

Por qué aprender

Porque la calidad del OS está limitada por la calidad del Substrato. Cargar 5.000 archivos desorganizados en la IA produce respuestas vagas y costosas (muchos tokens). Organizar primero es el paso económico que multiplica todo lo que viene después.

Conceptos clave

Mini ing. de datos
ordenar es diseñar
Por tipo
1.er corte
Por edad
reciente vs. antiguo
Antes de la IA
prepara el terreno
3

🌾 Harvesting: lo que le falta al especialista

Después de ordenar, viene el harvesting (cosecha). La pregunta guía es: además de lo que ya tengo, ¿qué falta para crear al «especialista soñado» de este dominio? Vas a recopilar información de donde reside el conocimiento —YouTube, Instagram, expertos, leyes, abogados— y traerla al Substrato.

🔥caos puro organizarpor tipo + edad harvestingrecopilar lo que falta ⚙️ workhorsedestila en nuggets 📁 raw/guardado 📁 synthesized/solo nuggets ↗ contexto

Cómo leer: el caos (naranja) se organiza y luego se recopila de fuentes externas; entonces, un modelo workhorse lo destila todo. Quedan dos carpetas: raw/ (guardada como precaución, en gris) y synthesized/ (los nuggets, azules): solo esta entra en el contexto.

Por qué aprender

Porque lo que ya tienes rara vez es suficiente. Un verdadero especialista conoce cosas que no están en tus archivos, sino en la cabeza de expertos y en fuentes públicas. La recopilación es el paso que cierra deliberadamente esa brecha, en vez de confiar en que el modelo "lo sepa".

Conceptos clave

Harvesting
recopilar lo que falta
Especialista ideal
la meta del dominio
Fuentes externas
YouTube, expertos, leyes
Vacío intencional
lo que falta, a propósito
4

🧠 Conocimiento tácito: lo que el genérico no tiene

El objetivo del harvesting es el conocimiento tácito: aquello que un modelo genérico no sabe por qué no está bien documentado: está en la práctica de quien lo hace. En Freedom OS, por ejemplo, son detalles como qué agencias de traducción son confiables, lo que necesita ser certificado (firmado oficialmente) y qué documentos traducir al árabe o al francés según el país.

🌱 ¿Nuevo aquí?

Conocimiento tácito es lo opuesto a lo «explícito»: es el saber adquirido con la experiencia, rara vez escrito: atajos, excepciones, «lo que siempre sale mal». El modelo genérico se entrenó con texto público, así que conoce lo explícito, pero no lo tácito de tu caso. El Substrato existe precisamente para capturar ese conocimiento tácito.

🔎 Dónde se esconde lo tácito

  • Personas — expertos, abogados, contadores que responden «depende» y explican por qué.
  • Videos y publicaciones — YouTube e Instagram de quienes viven el dominio, llenos de trucos no oficiales.
  • Tus propios casos — los correos electrónicos, formularios y preguntas repetidas que ya respondiste.

Por qué aprender

Porque es precisamente lo tácito lo que hace que el OS parezca un especialista y no un chatbot. Sin él, el OS repite lo que cualquier modelo diría. Capturar lo tácito es la diferencia entre "genérico" y "nadie lo hace como mi OS": la prueba que vuelve en la auditoría de la Trilha 4.

Conceptos clave

Tácito
saber práctico
Explícito
lo que el genérico ya tiene
Excepciones
"qué sale mal"
No genérico
la diferencia del OS
5

📚 Playbooks y compendios

El material recopilado y disperso todavía no sirve. El siguiente paso es reunir las fuentes en un compendio (un compendium.md) —un documento de referencia destilado— y en playbooks: guiones de "cómo se hace X en este dominio". Es lo que consulta el OS para responder con la profundidad de un especialista.

📘 Compendio

Referencia destilada del dominio: leyes, hechos, definiciones, «cómo funciona».

  • ✓Responde «¿qué es verdad aquí?»
  • ✓Reúne muchas fuentes en un solo lugar.

📗 Playbook

Guion de ejecución: pasos para realizar tareas recurrentes del dominio.

  • ✓Responde «¿cómo se hace X?»
  • ✓Se convierte en materia prima de las Skills (Trilha 3).

💡 El done-check del Sustrato

La capa está lista cuando existe un substrate/compendium.md organizado que responde la pregunta objetivo que definiste para el dominio. Si la pregunta sigue sin una buena respuesta, falta recopilar o destilar más.

Por qué aprender

Porque los compendios y playbooks son el formato que convierte el conocimiento en algo utilizable. También son el puente hacia la siguiente trilha: un buen playbook es casi una Skill esperando a que la empaqueten.

Conceptos clave

Compendio
referencia destilada
Playbook
cómo se hace X
Pregunta-objetivo
la comprobación de finalización
Puente hacia Skills
playbook → verbo
6

🧊 Raw vs. sintetizado: inyectar solo nuggets

El patrón central del Substrato es la separación raw vs. sintetizado. Mantienes una carpeta raw/ con las transcripciones y los documentos sin procesar (guardados por si acaso) y una carpeta adyacente y complementario con las versiones destiladas: los hallazgos. La regla de oro: inyecta solo los nuggets en el contexto.

🌱 ¿Nuevo aquí?

Un hallazgo es un resumen muy condensado: piensa en 10 viñetas que contienen lo esencial de una transcripción de una hora. Inyectar en el contexto = poner ese texto en la conversación para que el modelo lo use. Quieres inyectar nuggets (pequeños y densos), no el material sin procesar (enorme y disperso), para que el OS sea rápido y económico.

📁 raw/ — la despensa

  • •Transcripciones y documentos sin procesar, tal como llegaron.
  • •Guardado por si acaso; casi nunca se incorpora al contexto.
  • •Tu red de seguridad por si necesitas redestilar.

📁 synthesized/ — el plato listo

  • ✓Nuggets: lo esencial en pocas viñetas.
  • ✓Es lo que realmente se inyecta en el contexto.
  • ✓Pequeño, denso, económico en tokens.

Por qué aprender

Porque es el patrón que se repite en todo dominio: despensa vs. plato listo. Confundirlos (inyectar lo crudo) desborda la ventana de contexto, encarece y empeora las respuestas. Separar raw de lo sintetizado es lo que mantiene el OS ligero y el conocimiento recuperable.

Conceptos clave

raw/
crudo, guardado
synthesized/
hallazgos destilados
Inyectar solo nuggets
la regla de oro
Despensa vs. plato
la analogía
7

⚙️ Workhorse model en loop para sintetizar

Quien hace la destilación no tiene que ser el modelo más caro. El autor usa un modelo workhorse (modelo «caballo de batalla») — barato y eficiente, como el Gemini Flash — en ejecución en bucle por todos los archivos: "usa este modelo, recorre cada archivo y crea la síntesis de los nuggets centrales de estas transcripciones".

🌱 ¿Nuevo aquí?

Un modelo workhorse es un modelo económico elegido para tareas repetitivas y de gran volumen, no para razonamientos difíciles, sino para «pasar la escoba» por muchos archivos. En bucle = repetir la misma operación archivo por archivo. Gastas poco por elemento y procesas cientos de fuentes sin quemar tokens costosos.

🔁 La skill "knowledge harvester"

Este loop puede convertirse en una skill reutilizable: te pregunta qué handles extraer y cuántos videos, guarda todo en raw/ y ejecuta el workhorse para generar la versión sintetizada. Se convierte en un sistema mejorable automáticamente con una persona en el ciclo: agregas cada vez más, destilas y también haces backup (copia privada en GitHub, con .gitignore de lo que es sensible).

Por qué aprender

Porque destilar a mano no es escalable, y usar el modelo de primera línea para eso es un desperdicio. La combinación «workhorse económico + loop» hace viable la síntesis a gran escala, y cuando generalizas el script, obtienes un motor de Substrato que se ejecuta cada vez que llega material nuevo.

Conceptos clave

Workhorse
modelo barato
Gemini Flash
ejemplo del autor
En bucle
archivo por archivo
Humano en el bucle
automejora guiada
8

⚡ Práctico: recorrer raw/ y generar nuggets

Vamos a armar el motor de síntesis. El prompt copy-run abajo le indica a Claude Code que ejecute un modelo workhorse en bucle sobre todo lo que está en raw/ y escribir un nugget por archivo en synthesized/. Cambia solo los fragmentos entre <corchetes>.

🎯 Objetivo

Transformar la carpeta raw/ (sin procesar) en una carpeta synthesized/ de fragmentos listos para inyectar, usando un modelo barato y sin gastar tokens caros.

Pega en Claude Code — prompt copy-run

prompt
Você é meu pipeline de Substrato. Use o modelo workhorse
<modelo barato: ex. gemini-flash> para destilar meu material bruto.

Passos:
1. Liste todos os arquivos em ./raw/ (transcrições, PDFs já em texto,
   posts). NÃO modifique nada em raw/ — é a minha despensa.
2. Para CADA arquivo, chame o modelo workhorse e gere um nugget:
   - no máximo <N: ex. 10> bullets com o essencial;
   - capture o conhecimento tácito (exceções, "o que dá errado",
     atalhos), não só o resumo óbvio;
   - foque no que responde à minha pergunta-objetivo:
     "<sua pergunta-objetivo do domínio>".
3. Salve cada nugget em ./synthesized/ com o MESMO nome do
   arquivo de origem + sufixo ".nugget.md".
4. Ao final, gere ./synthesized/compendium.md agregando os
   nuggets por tema, e me diga quantos arquivos processou.

Regra: só os arquivos de synthesized/ entram no contexto depois.
Nunca injete o conteúdo de raw/ diretamente.

✔️ Cómo verificar

  • 1.La carpeta raw/ quedó intacta (la misma cantidad de archivos que antes).
  • 2.Hay un .nugget.md en synthesized/ para cada archivo de raw/.
  • 3.Cada nugget cabe en unos pocos bullets e incluye al menos 1 detalle tácito (no solo lo obvio).
  • 4.O compendium.md responde tu pregunta objetivo (verificación de finalización de Substrato).

Por qué aprender

Porque este es el corazón operativo de la capa de Sustrato. Con ejecutarlo una vez ya obtienes el synthesized/; generalizar el prompt te da la skill "knowledge harvester", que reutilizas cada vez que llega material nuevo: el sistema que mejora por sí mismo contigo en el loop.

Conceptos clave

raw/ intacto
nunca modificar
1 nugget / archivo
bucle del workhorse
compendium.md
agrupa por tema
<corchetes>
lo que intercambias

✅ Resumen del módulo

✓
Empiezas con un camión de basura en llamas — 500–5.000 archivos caóticos; es normal.
✓
Organiza antes de activar la IA — por tipo y antigüedad; mini ingeniería de datos.
✓
Harvesting recopila lo tácito — lo que no tiene el modelo genérico, proveniente de expertos y fuentes.
✓
Compendios y playbooks — el conocimiento se convierte en una referencia consultable.
✓
raw vs. sintetizado; workhorse en loop — destila a bajo costo, inyecta solo las pepitas.

Siguiente módulo:

2.3 — Reglas y Ganchos: las cercas 🚧