Lo que se analizó.
Lo que se midió.
El curso separa material editorial, afirmaciones de los autores, código observado y prueba local.
Material proporcionado
Dos textos de visión general y comparación Jev × Laya y tres imágenes editoriales. Los textos dieron el punto de partida; las afirmaciones se contrastaron con el repositorio y las fichas actuales.
El video se descargó y se transcribió íntegramente con inemavox y Whisper large-v3: cerca de 26 minutos, 401 segmentos. La transcripción automática a veces confunde Laya con Leia y ModernBERT con Modern Bird; el curso usa los nombres del código.
Video original en YouTubeFuentes técnicas y procedencia
- Código upstream en el commit analizado: SDK, Router, montaje de secuencia, confianza y presets.
- Informe de benchmarks del autor: consultar condiciones y limitaciones, no tratarlo como una medición nuestra.
- Ficha multilingual y ficha typed-decisions: idiomas, alcance y calibración.
- Artículo del creador: arquitectura e historia; algunas afirmaciones promocionales son más fuertes que la evidencia actual.
- AbdelStark/jev-benchmarks y nibzard/decision-model-benchmark: mediciones externas de Jev con sus propios protocolos.
- Demo oficial y paquete PyPI: referencias de uso y distribución.
Correcciones que orientan las clases
| Afirmación simplificada | Lectura adoptada |
|---|---|
| No genera texto, así que no se equivoca. | La salida estructurada evita texto libre, pero puede clasificar mal y quedarse demasiado confiada. |
| Multilingual tiene 135M de parámetros. | El video cita una descripción anterior; la ficha actual indica 322M totales, con mmBERT-base. |
| Router siempre elige al especialista. | typed-decisions requiere indicación explícita o tener habilitado auto_task_detection. |
| 95% de confianza = 95% de acierto. | Laya supera a Jev universalmente. |
| Laya derrota Jev de manera universal. | Las fuentes usan prompts, muestras y condiciones diferentes; el entrenamiento especializado no equivale a zero-shot. |
| Fine-tuning en el benchmark prueba fuga. | Entrenar en el split de entrenamiento es legítimo; el problema es comparar capacidades sin explicitar esa preparación. La fuga de prueba exige evidencia específica. |
| Self-hosted tiene costo cero. | Sin cobro de Laya por llamada, pero con costos de hardware, energía y operación. |
Ejecución local observada
Checkpoint multilingual, GPU NVIDIA GB10, cuatro preguntas por ticket, 16 mensajes sintéticos balanceados. Resultado: 13 aciertos (81,25%), baseline mayoritaria 25%, Brier multiclases sumado 0,30835 y ECE top-probability en diez bins 0,17988. La muestra es pequeña y no mide la confiabilidad en producción.
Errores preservados: compra de 20 licencias → billing; predicción del tiempo → technical; mensaje enviado por error → technical. Todos los resultados siguen exigiendo revisión humana.
La primera inferencia medida llevó 1.401 ms, incluso después de cargar el modelo; las siguientes variaron entre cerca de 22 y 124 ms en este ensayo. Son observaciones de una ejecución, con calentamiento y otras tareas en la máquina, no un benchmark de latencia controlado.
Inspeccionar el informe JSON completoMateriales y recursos
Los archivos integrales de terceros, el video y la transcripción quedan en el acervo local de investigación, fuera del Git del curso. Las clases son de autor y señalan las fuentes originales. El curso no ejecutó Jev ni entrenó un nuevo checkpoint.