IA nativa para máquinas y los benchmarks que la respaldan
TypeSafe AI dice que es 193x más rápido que los LLM. Su propia prueba muestra 75x.
TypeSafe AI llama a Jev el primer System One Model: un sistema construido para devolver decisiones tipadas al software, entrenado con un algoritmo al que llama RLCD. La página de lanzamiento afirma cero alucinaciones y una ventaja de precio de 238 veces frente a una única línea base nombrada, Claude Fable 5.1.
Emmanuel Fabrice Omgbwa Yasse Asistido por IA
2026-09-21 · 5 min de lectura

TypeSafe AI dice que pasó dos años en modo sigiloso, y quiere que se la lea como un rechazo de la era de los chatbots. Su página de lanzamiento abre con una frase y un fragmento de dos palabras: «Tomamos la dirección de investigación opuesta», seguido de «no chat».
La empresa, cuyo pie de página dice «Made in SF», ha lanzado Jev, al que llama su primer System One Model público. Un System One Model, según la página, está construido para responder preguntas estructuradas dentro del software en lugar de mantener una conversación. Tres afirmaciones rodean el producto: salidas tipadas, una estimación de confianza en cada decisión y «cero alucinaciones». Por debajo está un benchmark de 193.6x más rápido y 444.6x más barato que los LLM.
Qué lanzó realmente TypeSafe AI
La página presenta los System One Models como «una nueva clase de modelo de IA construida para las decisiones dentro del software», en contraste con los LLM que, según dice, «producen palabras para las personas». Jev devuelve decisiones tipadas con probabilidades asociadas, de modo que el código de un programa puede ramificar a partir de ellas. TypeSafe afirma que la construcción se apoya en tres rupturas con la práctica actual: una nueva arquitectura, un nuevo sampler y un nuevo algoritmo de entrenamiento llamado Reinforcement Learning for Calibrated Decisions, o RLCD. La salida estructurada es ya un objetivo muy transitado, y las mejoras en ese terreno tienden a medirse en puntos, no en órdenes de magnitud, como muestran los resultados de esquema de LFM2.5-350M.
La página lleva la marca de la versión 0.01 y copyright 2026. Junto al anuncio, no enumera ningún paper, publicación de código ni model card que lo acompañe. Esa brecha entre un lanzamiento seguro de sí mismo y un rastro de evidencia vacío resulta familiar: el asistente de salud de Samsung se lanzó en beta con grandes promesas y pocos detalles concretos.
El benchmark: 193.6x más rápido, 444.6x más barato
Esos multiplicadores de titular se sitúan por encima de un único ejemplo desarrollado que la página etiqueta como «(prueba)». En él, el sistema de TypeSafe completa una tarea en 0.114 segundos con un costo de $0.000081. La columna marcada como «LLMs» completa la misma tarea en 8.566 segundos por $0.013880.
Si se dividen ambas, las cifras no reproducen el titular. El ejemplo implica aproximadamente 75x en velocidad y unos 171x en costo. La página no explica de dónde salen 193.6x y 444.6x, y no define los «workflows for System One tasks» a los que apunta su asterisco. Es posible que las cifras más grandes agreguen un conjunto de tareas más amplio que el mostrado. La página tampoco dice eso. Una aceleración que se encoge cuando uno lee los resultados adjuntos es un patrón conocido, y la afirmación de 2.57x en WebGPU de Hugging Face venía con 176 pérdidas adjuntas.
| Métrica | TypeSafe AI (el ejemplo de «prueba») | LLMs (mismo ejemplo) | Relación implícita |
|---|---|---|---|
| Costo por tarea | $0.000081 | $0.013880 | unas 171x más barato |
| Tiempo de finalización | 0.114s | 8.566s | unas 75x más rápido |
| Titular de la página | 193.6x más rápido, 444.6x más barato | no mostrado | |
Cero alucinaciones y la afirmación sobre la confianza
«Zero Hallucinations» figura como encabezado. La línea que aparece debajo es más estrecha de lo que sugiere la palabra: cada decisión de Jev lleva una estimación de confianza, de modo que el software puede actuar cuando la confianza es alta y escalar para revisión cuando no lo es. La página indica a quienes construyen que «establezcan los umbrales para cuándo actúa de forma autónoma y cuándo pide revisión».
Eso canaliza la incertidumbre. No garantiza que el modelo tenga razón, y una respuesta equivocada expresada con confianza sigue siendo equivocada. El acuerdo tampoco lo arregla: un panel de agentes de IA puede estar de acuerdo y aun así equivocarse cuando sus errores están correlacionados. Las preguntas frecuentes de la página incluyen «¿Puede Jev equivocarse todavía?» y «¿Es Jev determinista?», y el juicio sobre dónde trazar la línea pasa a quien fija el umbral.
RLCD frente a RLHF
La afirmación sobre el método es una bifurcación en el entrenamiento. TypeSafe describe el Reinforcement Learning from Human Feedback como un proceso que optimiza los modelos para las preferencias humanas y que produjo sistemas «sobrehumanos siguiendo instrucciones», a lo que llama chat. Enumera los costos: mode dropping, exceso de confianza y falta de fiabilidad, que, según dice, dejan a los LLM dependientes de un humano en el bucle.
Su reemplazo, RLCD, se define solo como «reinforcement learning for calibrated decisions», aprendizaje por refuerzo para decisiones calibradas. El nombre apunta directamente al fallo que la página identifica en RLHF: el exceso de confianza. Que RLCD sea un método genuinamente nuevo no es algo que la página demuestre. No hay protocolo, ni línea de base, ni comparación. Las propias preguntas frecuentes de la página plantean «¿Es Jev solo un LLM más pequeño?» y «¿En qué se diferencia del modo JSON o de las salidas estructuradas?». Esas son las dos preguntas que separarían un algoritmo nuevo de un clasificador bien ajustado. Los papers que proponen un método de entrenamiento suelen publicar también sus salvedades, del mismo modo que un resultado de destilación de 33 sobre 36 se publicó con el asterisco de los propios autores.
Quién está detrás de TypeSafe AI
El sitio enlaza con un manifiesto, una página de equipo y secciones de empresa y documentación, e invita a inscribirse en la lista de espera y a postularse a puestos abiertos. La página de lanzamiento no nombra fundadores, ni inversores, ni investigación publicada con anterioridad. El contacto pasa por una única dirección, hello@typesafe.ai, además de cuentas de LinkedIn y X.
Se enumeran tres entradas del blog: «Presentando los System One Models & Jev», «La lección más amarga» y «IA: demasiado buena para ser verdad, demasiado mala para ser útil». La segunda lleva una línea de resumen sobre cómo el cómputo impulsa el progreso, «pero de qué sirve el progreso si no estás haciendo la tarea correcta». La tercera se pregunta qué viene después de los modelos entrenados con RLHF que «agradan a los humanos» en lugar de «tomar decisiones autónomas fiables». El planteamiento es una agenda de investigación. La página no muestra la investigación.
El problema de la línea de base de comparación
El precio de Jev figura en $42 por cada mil millones de tokens de entrada, descrito como un «precio de entrada 238x más bajo que Claude Fable 5.1». Una línea de base, una métrica, una dirección: los tokens de entrada. Cualquier multiplicador de titular deja abierta la pregunta de contra qué se midió, y eso vale tanto si el rival tiene nombre como si no, como muestra la afirmación de 9.27x sobre memoria de Alibaba Cloud frente a un rival sin nombre.
De ahí se derivan dos vacíos. Un precio por token para decisiones tipadas y un precio por token para texto pueden no medir la misma unidad de trabajo, así que la cifra de 238x se apoya en dos salidas distintas. Y el precio de entrada deja fuera el costo de salida, los reintentos y la revisión humana que el mecanismo de confianza está diseñado para activar. En esta página, $42 es un precio por token de entrada, y la página se detiene ahí.
Nada de esto hace que los System One Models estén equivocados. Una página de lanzamiento no es un paper, y TypeSafe es lo bastante temprana como para ser juzgada por lo que lance a continuación. Pero lo más ruidoso que ha publicado es un conjunto de multiplicadores, y el único bloque que llama «prueba» arroja cifras más pequeñas. Mientras no se muestre el método que hay detrás de RLCD, las afirmaciones van por delante de la evidencia.
- Fuente : TypeSafe AI launch page
Lo esencial de la tecnología en 3 minutos cada mañana
Un correo, cada día laborable, con lo que realmente importa en IA y tecnología.