📥 Elegir y preparar la fuente
Antes de ejecutar cualquier comando, tú decides qué Graphify va a leer código o documentos. Después descarga el corpus, limpia la carpeta y deja todo listo para extraer. Fuente limpia, grafo limpio.
🧭 Código o documentos: qué indicar
Graphify lee una fuente y de ella extrae el grafo. Esta fuente puede ser de dos tipos: un base de código (un repositorio de código) o un corpus de documentos (PDF, markdown, textos). La primera decisión del módulo es cuál de los dos vas a señalar — porque eso cambia cómo funciona Graphify internamente.
🔰 ¿Eres nuevo aquí? «base de código» y «corpus»
Un base de código es simplemente la carpeta con el código de un proyecto (archivos .py, .ts, etc.). Un corpus es un conjunto de documentos sobre un tema: la «materia prima» textual. Graphify acepta ambos, pero trata cada uno de manera distinta.
La diferencia es técnica y es importante: código se extrae mediante AST (el árbol sintáctico que el tree-sitter se arma a partir del código) — es determinista, rápido y no necesitas una API key. Ya documentos pasan por un LLM, que lee el sentido del texto e infiere entidades y relaciones. Decidir pronto evita retrabajo más adelante.
↑ Los dos caminos — código (extraído por la AST, sin clave) y documentos (leídos por un LLM) —terminan en la misma carpeta de origen limpia. En este curso seguimos el camino de los documentos, pero el principio sirve para ambos.
💻 Ruta del código (AST)
- ✓12 lenguajes mediante tree-sitter.
- ✓Determinístico y sin clave de API.
- ✓Los nodos son funciones, módulos, clases.
📄 Ruta de los documentos (LLM)
- ✓PDF, markdown, texto: cualquier documento.
- ✓Lee el sentido, no solo la sintaxis.
- ✓Dentro de Claude Code, sin una clave propia.
🔑 Conceptos clave
⬇️ Descargar la documentación de Claude Code
Para tener un corpus real y conocido, lo más fácil es pedírselo al propio Claude Code que descargues su documentación oficial en una carpeta local — por ejemplo ./claude-code-docs. No necesitas un script: describes la tarea en lenguaje natural y el agente hace el trabajo tedioso de guardar archivo por archivo.
Objetivo: descargar la documentación oficial de Claude Code en una carpeta fuente local, lista para convertirse en grafo.
Baixe a documentação oficial do Claude Code numa pasta chamada ./claude-code-docs no diretório atual. - Salve uma página por arquivo .md, com nome legível. - Mantenha só o conteúdo (sem menus/rodapé do site). - Ao terminar, me diga quantos arquivos foram salvos.
Cómo verificar: cuenta los archivos descargados.
ls ~/projetos/segundo-cerebro/claude-code-docs | wc -l
Cambia la ruta por aquella donde creaste la carpeta. La cantidad de archivos es tuya, no una constante: depende de cuánta documentación había ese día.
Tener un corpus conocido ayuda a comparar tu resultado con el de referencia. En una ejecución mostrada en el video, la documentación de Claude Code produjo 145 documentos que se convirtieron en 591 nodos, 685 conexiones e 67 comunidades. Úsalo solo como orden de magnitud («en la ejecución del video dio…»); tus números variarán según la versión de la documentación y el alcance que elijas.
🔰 ¿Eres nuevo aquí? Por qué pedirle al agente que descargue
Claude Code ya sabe navegar y guardar páginas. En vez de que busques cada URL, recorre la documentación y guarda los .md para ti. Es el mismo agente que después ejecutará Graphify, así que tiene sentido que ya prepare la fuente.
🔑 Conceptos clave
🗂️ Organizar la carpeta fuente
A carpeta de origen es exactamente lo que Graphify va a recorrer; por eso merece una raíz dedicada y sin basura. Reúne los archivos que describen el conocimiento en un solo lugar, separado del resto del sistema. La regla de oro: lo que entra en la carpeta se convierte en un nodo del grafo.
Objetivo: crear una carpeta fuente dedicada dentro del proyecto del curso.
mkdir -p ~/projetos/segundo-cerebro/claude-code-docs
Cómo verificar: la carpeta existe y puedes listar su contenido (vacía al principio, luego con tus .md).
ls ~/projetos/segundo-cerebro/claude-code-docs | wc -l
Ruta sugerida: ~/projetos/segundo-cerebro/<sua-pasta-fonte>. Usa el nombre que quieras; solo mantén junto todo lo que provenga de la misma fuente.
🔰 ¿Eres nuevo aquí? Qué hace el mkdir -p
mkdir crea la carpeta; el flag -p también crea las carpetas principales que falten y no se queja si la carpeta ya existe. Es seguro volver a ejecutarlo.
🔑 Conceptos clave
📏 Tamaño y alcance (empieza con poco)
La tentación es apuntar a todo el corpus de una vez. Resiste. Empieza con un subconjunto — una docena de archivos representativos — y amplía solo el alcance después de que todo el flujo funcione de principio a fin. Una extracción más pequeña es más rápida y económica para probar y ajustar.
🔰 ¿Eres nuevo aquí? Qué significa «iterar»
Iterar es repetir un ciclo corto —ejecutar, mirar el resultado, ajustar— en vez de intentar acertar todo de una sola vez. Con una fuente pequeña, cada vuelta cuesta segundos; con todo el corpus, cuesta minutos (y, en el flujo con LLM, tokens).
✓ Empezar poco a poco
- ✓Se ejecuta en segundos: respuesta rápida.
- ✓Económico de repetir hasta acertar con el ajuste.
- ✓El error aparece pronto y es fácil de corregir.
✗ Corpus completo desde el principio
- ✗Larga espera antes de ver cualquier cosa.
- ✗Si el grafo no sirve, ya lo gastaste todo.
- ✗El error aparece al final y es costoso de corregir.
Indica un subconjunto
Unos 10–15 archivos que representen bien el tema. Ejecuta todo el flujo hasta llegar al grafo.
Mira el resultado
¿El grafo tiene sentido? ¿Coinciden los nodos y las conexiones? Ajusta la fuente si hace falta.
Amplía el alcance
Con el flujo confiable, recién entonces apunta a todo el corpus de una vez.
🔑 Conceptos clave
🧹 Limpieza: qué excluir
Cada archivo adicional en la carpeta de origen es ruido potencial en el gráfico. Quita binarios, builds, dependencias, duplicados y todo lo que no tenga significado. El objetivo es mejorar la relación señal/ruido: dejar solo los archivos que describen el conocimiento, nada que sea un subproducto de la máquina.
🔰 ¿Eres nuevo aquí? «señal/ruido» y .gitignore
Señal es el contenido útil; ruido es todo lo que lo distrae. Un .gitignore es una lista de patrones de archivos que se deben ignorar; aquí usamos la misma idea para decidir qué no entra en la fuente.
✓ Conservar (señal)
- ✓Markdown, texto y documentación de referencia.
- ✓Código fuente (si la fuente es código).
- ✓Qué describe conceptos y decisiones.
✗ Excluir (ruido)
- ✗Binarios, imágenes,
node_modules, builds. - ✗Registros, cachés, temporales, borradores.
- ✗Copias duplicadas del mismo contenido.
# lo que NO se convierte en fuente node_modules/ dist/ build/ *.png *.jpg *.zip *.log .cache/ **/tmp/
🔑 Conceptos clave
📁 Dónde ejecutar (graphify-out queda aquí)
Graphify guarda la salida en la carpeta graphify-out/ dentro del directorio actual (o cwd, de current working directory). Por eso, de dónde tú ejecutas define dónde aparecen los archivos. Ejecútalo en la raíz del proyecto y siempre sabrás dónde encontrar el graph.json después.
🔰 ¿Eres nuevo aquí? Qué es «cwd»
O cwd es la carpeta en la que está tu terminal en ese momento, lo que pwd muestra. Los comandos con rutas relativas (como graphify-out/) se resuelven a partir de ella.
↑ A raíz del proyecto es tu cwd: allí están tanto la carpeta de origen (entrada) como graphify-out/ (salida generada). Ruta predecible para encontrar el graph.json en el próximo módulo.
🔑 Conceptos clave
✋ Autorrecuperación (opcional, no bloquea): vas a apuntar Graphify a un repositorio de código. ¿Cómo extrae el grafo?
📌 Resumen del módulo
Siguiente módulo
2.3 · Ejecutar Graphify y leer el grafo — genera el grafo de conocimiento y aprende a leer lo que produjo, desde lo visual hasta el informe.