Este es el experimento detrás del short de Jev: qué medimos, cómo, qué salió y el código para que lo corras con tus datos. El short: https://www.youtube.com/shorts/P_e44zE1FEg @Andres Van wersch @Oscar Rodríguez Coloma @Leafar Maina @Nick Arvelo @Orlando Vergara, esto viene de lo que conversamos sobre Jev. Nick, a tu pregunta: ya no hace falta invitación, está en OpenRouter. Qué medimos En Ecosistema Startup, antes de publicar una nota, una IA compara cada afirmación contra la fuente original. Si la fuente no la respalda, la nota no sale. Tomamos 39 afirmaciones que ya habíamos juzgado y le pedimos lo mismo a cada modelo: ¿la fuente respalda esta afirmación? Y además, qué tan seguro está, de 0 a 1. Lo que salió (corridas del 20-sep-2026, con la fuente completa) • deepseek-v3.2, el modelo que usamos en producción: acertó 37-38 de 39. Pero su "confianza" no sirve: en un campo pedido de 0 a 1 devolvió −1 trece veces y −9 una vez. Cuando se equivocó, dijo 0,9. • Claude Haiku 4.5: 37 de 39, y respondió 0,95 en 36 de las 39. También en sus dos errores. • Jev (typesafe/jev-1.13): 36 de 39. Menos que deepseek, pero su probabilidad sí significa algo. En 35 de 39 decisiones estuvo seguro (p ≤ 0,15 o p ≥ 0,85) y acertó 34. Las otras 4 quedaron en zona gris (0,17 · 0,54 · 0,74 · 0,84), y ahí estaban 2 de sus 3 errores. La cascada Jev decide todo. Lo que queda en zona gris se lo pasas a deepseek. Resultado: la misma precisión que deepseek solo, por menos de un tercio del costo ($0,0104 contra $0,0348 por corrida), y 0,41 s por decisión en 9 de cada 10 casos, en vez de 4,7 s. Lo que este experimento NO dice • 39 afirmaciones es poco. Sirve para decidir si vale la pena probarlo en tu caso, no para sacar una conclusión general. • deepseek no da siempre lo mismo, ni a temperatura 0: 38 de 39 en una corrida, 37 de 39 en otra.