Contenido detallado
🚛 La analogía del camión de basura en llamas
O Sustrato es el conocimiento bruto de tu dominio, y casi siempre empiezas con lo que el autor llama "un camión de basura en llamas". Especialmente en un negocio, son 500, 5.000 archivos de tipos y estructuras variados: PDF, hojas de cálculo, zips e incluso archivos exóticos como Parquet. Caos. El Sustrato es la capa que transforma ese caos en algo que el OS puede usar.
🌱 ¿Nuevo aquí?
Sustrato = el material de referencia guardado fuera del CLAUDE.md, que el OS consulta solo cuando lo necesita. Contexto = lo que realmente entra en la conversación en ese momento. La diferencia es la clave del módulo: guardas mucho (sustrato), pero inyectas poco (contexto) para no exceder el ventana de contexto — el límite de texto que el modelo lee de una vez.
🔥 Qué es
La imagen del camión de basura en llamas sirve para bajar la ansiedad: es normal empezar con desorden. El trabajo no es "tener datos perfectos", sino dar forma al caos — y eso es design, no ingeniería pesada.
- •Muchos archivos, muchos formatos, cero orden: el punto de partida habitual.
- •El Substrato es donde este material se vuelve una referencia consultable.
Por qué aprender
Porque la mayoría intenta conectar la IA sobre el caos y se frustra con las respuestas malas. Aceptar el camión de basura en llamas como punto de partida —y tratarlo con método— es lo que distingue un OS que conoce tu dominio de uno que adivina. En dominios con mucho contexto (Tax OS ~34%), esta es la capa más importante de todas.
Conceptos clave
🗂️ Organizar ANTES de conectar la IA
Antes de pedirle cualquier cosa a Claude Code, haz una mini ingeniería de datos: organiza. El autor describe dos divisiones sencillas: primero por tipo de archivo (PDFs con PDFs, hojas de cálculo con hojas de cálculo), luego por edad (últimos 6 meses vs. últimos 2 años). Esto aísla partes del material y le da al OS un terreno limpio.
💡 La IA puede ayudarte a organizar
"Organizar antes" no significa hacerlo todo a mano: puedes pedirle a Claude Code que mover cada archivo a la carpeta de su tipo y después dividir por edad. El punto es que esa organización ocurra antes de cualquier análisis: preparas el terreno y luego lo aprovechas.
El flujo de organización en 3 cortes
Por tipo
Cada archivo va a la carpeta de su formato: pdf/, hojas de cálculo/, transcricoes/.
Por edad
Dentro de cada tipo, separa lo reciente (últimos 6 meses) de lo antiguo (hasta 2 años). Lo reciente suele valer más.
Aislar y nombrar
Con todo separado, queda claro qué es fuente y qué es ruido, y el OS lee solo la parte correcta.
Por qué aprender
Porque la calidad del OS está limitada por la calidad del Substrato. Cargar 5.000 archivos desorganizados en la IA produce respuestas vagas y costosas (muchos tokens). Organizar primero es el paso económico que multiplica todo lo que viene después.
Conceptos clave
🌾 Harvesting: lo que le falta al especialista
Después de ordenar, viene el harvesting (cosecha). La pregunta guía es: además de lo que ya tengo, ¿qué falta para crear al «especialista soñado» de este dominio? Vas a recopilar información de donde reside el conocimiento —YouTube, Instagram, expertos, leyes, abogados— y traerla al Substrato.
Cómo leer: el caos (naranja) se organiza y luego se recopila de fuentes externas; entonces, un modelo workhorse lo destila todo. Quedan dos carpetas: raw/ (guardada como precaución, en gris) y synthesized/ (los nuggets, azules): solo esta entra en el contexto.
Por qué aprender
Porque lo que ya tienes rara vez es suficiente. Un verdadero especialista conoce cosas que no están en tus archivos, sino en la cabeza de expertos y en fuentes públicas. La recopilación es el paso que cierra deliberadamente esa brecha, en vez de confiar en que el modelo "lo sepa".
Conceptos clave
🧠 Conocimiento tácito: lo que el genérico no tiene
El objetivo del harvesting es el conocimiento tácito: aquello que un modelo genérico no sabe por qué no está bien documentado: está en la práctica de quien lo hace. En Freedom OS, por ejemplo, son detalles como qué agencias de traducción son confiables, lo que necesita ser certificado (firmado oficialmente) y qué documentos traducir al árabe o al francés según el país.
🌱 ¿Nuevo aquí?
Conocimiento tácito es lo opuesto a lo «explícito»: es el saber adquirido con la experiencia, rara vez escrito: atajos, excepciones, «lo que siempre sale mal». El modelo genérico se entrenó con texto público, así que conoce lo explícito, pero no lo tácito de tu caso. El Substrato existe precisamente para capturar ese conocimiento tácito.
🔎 Dónde se esconde lo tácito
- Personas — expertos, abogados, contadores que responden «depende» y explican por qué.
- Videos y publicaciones — YouTube e Instagram de quienes viven el dominio, llenos de trucos no oficiales.
- Tus propios casos — los correos electrónicos, formularios y preguntas repetidas que ya respondiste.
Por qué aprender
Porque es precisamente lo tácito lo que hace que el OS parezca un especialista y no un chatbot. Sin él, el OS repite lo que cualquier modelo diría. Capturar lo tácito es la diferencia entre "genérico" y "nadie lo hace como mi OS": la prueba que vuelve en la auditoría de la Trilha 4.
Conceptos clave
📚 Playbooks y compendios
El material recopilado y disperso todavía no sirve. El siguiente paso es reunir las fuentes en un compendio (un compendium.md) —un documento de referencia destilado— y en playbooks: guiones de "cómo se hace X en este dominio". Es lo que consulta el OS para responder con la profundidad de un especialista.
📘 Compendio
Referencia destilada del dominio: leyes, hechos, definiciones, «cómo funciona».
- ✓Responde «¿qué es verdad aquí?»
- ✓Reúne muchas fuentes en un solo lugar.
📗 Playbook
Guion de ejecución: pasos para realizar tareas recurrentes del dominio.
- ✓Responde «¿cómo se hace X?»
- ✓Se convierte en materia prima de las Skills (Trilha 3).
💡 El done-check del Sustrato
La capa está lista cuando existe un substrate/compendium.md organizado que responde la pregunta objetivo que definiste para el dominio. Si la pregunta sigue sin una buena respuesta, falta recopilar o destilar más.
Por qué aprender
Porque los compendios y playbooks son el formato que convierte el conocimiento en algo utilizable. También son el puente hacia la siguiente trilha: un buen playbook es casi una Skill esperando a que la empaqueten.
Conceptos clave
🧊 Raw vs. sintetizado: inyectar solo nuggets
El patrón central del Substrato es la separación raw vs. sintetizado. Mantienes una carpeta raw/ con las transcripciones y los documentos sin procesar (guardados por si acaso) y una carpeta adyacente y complementario con las versiones destiladas: los hallazgos. La regla de oro: inyecta solo los nuggets en el contexto.
🌱 ¿Nuevo aquí?
Un hallazgo es un resumen muy condensado: piensa en 10 viñetas que contienen lo esencial de una transcripción de una hora. Inyectar en el contexto = poner ese texto en la conversación para que el modelo lo use. Quieres inyectar nuggets (pequeños y densos), no el material sin procesar (enorme y disperso), para que el OS sea rápido y económico.
📁 raw/ — la despensa
- •Transcripciones y documentos sin procesar, tal como llegaron.
- •Guardado por si acaso; casi nunca se incorpora al contexto.
- •Tu red de seguridad por si necesitas redestilar.
📁 synthesized/ — el plato listo
- ✓Nuggets: lo esencial en pocas viñetas.
- ✓Es lo que realmente se inyecta en el contexto.
- ✓Pequeño, denso, económico en tokens.
Por qué aprender
Porque es el patrón que se repite en todo dominio: despensa vs. plato listo. Confundirlos (inyectar lo crudo) desborda la ventana de contexto, encarece y empeora las respuestas. Separar raw de lo sintetizado es lo que mantiene el OS ligero y el conocimiento recuperable.
Conceptos clave
⚙️ Workhorse model en loop para sintetizar
Quien hace la destilación no tiene que ser el modelo más caro. El autor usa un modelo workhorse (modelo «caballo de batalla») — barato y eficiente, como el Gemini Flash — en ejecución en bucle por todos los archivos: "usa este modelo, recorre cada archivo y crea la síntesis de los nuggets centrales de estas transcripciones".
🌱 ¿Nuevo aquí?
Un modelo workhorse es un modelo económico elegido para tareas repetitivas y de gran volumen, no para razonamientos difíciles, sino para «pasar la escoba» por muchos archivos. En bucle = repetir la misma operación archivo por archivo. Gastas poco por elemento y procesas cientos de fuentes sin quemar tokens costosos.
🔁 La skill "knowledge harvester"
Este loop puede convertirse en una skill reutilizable: te pregunta qué handles extraer y cuántos videos, guarda todo en raw/ y ejecuta el workhorse para generar la versión sintetizada. Se convierte en un sistema mejorable automáticamente con una persona en el ciclo: agregas cada vez más, destilas y también haces backup (copia privada en GitHub, con .gitignore de lo que es sensible).
Por qué aprender
Porque destilar a mano no es escalable, y usar el modelo de primera línea para eso es un desperdicio. La combinación «workhorse económico + loop» hace viable la síntesis a gran escala, y cuando generalizas el script, obtienes un motor de Substrato que se ejecuta cada vez que llega material nuevo.
Conceptos clave
⚡ Práctico: recorrer raw/ y generar nuggets
Vamos a armar el motor de síntesis. El prompt copy-run abajo le indica a Claude Code que ejecute un modelo workhorse en bucle sobre todo lo que está en raw/ y escribir un nugget por archivo en synthesized/. Cambia solo los fragmentos entre <corchetes>.
🎯 Objetivo
Transformar la carpeta raw/ (sin procesar) en una carpeta synthesized/ de fragmentos listos para inyectar, usando un modelo barato y sin gastar tokens caros.
Pega en Claude Code — prompt copy-run
promptVocê é meu pipeline de Substrato. Use o modelo workhorse <modelo barato: ex. gemini-flash> para destilar meu material bruto. Passos: 1. Liste todos os arquivos em ./raw/ (transcrições, PDFs já em texto, posts). NÃO modifique nada em raw/ — é a minha despensa. 2. Para CADA arquivo, chame o modelo workhorse e gere um nugget: - no máximo <N: ex. 10> bullets com o essencial; - capture o conhecimento tácito (exceções, "o que dá errado", atalhos), não só o resumo óbvio; - foque no que responde à minha pergunta-objetivo: "<sua pergunta-objetivo do domínio>". 3. Salve cada nugget em ./synthesized/ com o MESMO nome do arquivo de origem + sufixo ".nugget.md". 4. Ao final, gere ./synthesized/compendium.md agregando os nuggets por tema, e me diga quantos arquivos processou. Regra: só os arquivos de synthesized/ entram no contexto depois. Nunca injete o conteúdo de raw/ diretamente.
✔️ Cómo verificar
- 1.La carpeta raw/ quedó intacta (la misma cantidad de archivos que antes).
- 2.Hay un .nugget.md en synthesized/ para cada archivo de raw/.
- 3.Cada nugget cabe en unos pocos bullets e incluye al menos 1 detalle tácito (no solo lo obvio).
- 4.O compendium.md responde tu pregunta objetivo (verificación de finalización de Substrato).
Por qué aprender
Porque este es el corazón operativo de la capa de Sustrato. Con ejecutarlo una vez ya obtienes el synthesized/; generalizar el prompt te da la skill "knowledge harvester", que reutilizas cada vez que llega material nuevo: el sistema que mejora por sí mismo contigo en el loop.
Conceptos clave
✅ Resumen del módulo
Siguiente módulo:
2.3 — Reglas y Ganchos: las cercas 🚧