← Volver al blog
Aiaprox. 9 min de lectura

Un modelo que se niega a escribir frases ahora procesa un billón de tokens al día

Publicado 5 oct 2026
Un modelo que se niega a escribir frases ahora procesa un billón de tokens al día

TypeSafe AI lanzó Jev el 15 de septiembre de 2026 y cerró la lista de espera el 27 de septiembre. La propuesta es lo bastante acotada como para sonar a error tipográfico a primera vista: Jev no genera texto. Le envías un fragmento de estado y un conjunto de preguntas tipadas, y devuelve respuestas extraídas de un esquema que definiste de antemano, cada una con una probabilidad y un valor de confianza.

Tres primitivas cubren todo lo que responderá. Choice elige una opción de una lista que tú proporcionas. Score puntúa la entrada frente a niveles descriptivos ordenados. Noul responde a una pregunta de sí o no con la probabilidad de que la respuesta sea sí.

Ese es todo el producto. Sin chat, sin párrafos, sin markdown, sin disculpas por ser una IA.

Por qué alguien querría eso

Diogo Almeida fundó TypeSafe AI y antes trabajó en OpenAI en los métodos de seguimiento de instrucciones que dieron forma al comportamiento de ChatGPT. Se marchó en 2024. Su argumento desde entonces ha sido consistente: una interfaz de chat es la forma equivocada para el software. El código no quiere que le devuelvan una frase. Quiere un valor sobre el que pueda ramificar.

Cualquiera que haya conectado un LLM a un sistema en producción reconoce el dolor que describe. Le pides a un modelo que clasifique un ticket de soporte y recibes un párrafo amable que empieza con la clasificación y termina con una oferta de ayuda adicional. Luego escribes una regex. Luego el modelo cambia su formato y la regex se rompe. Luego añades un modo JSON y, de vez en cuando, el JSON está mal formado. El modelo nunca fue la parte frágil. La interfaz lo era.

Jev lo esquiva eliminando por completo la generación. Utiliza un muestreador paralelo en lugar de la generación autorregresiva de tokens, lo que significa que las salidas posibles se enumeran antes de que se ejecute la inferencia. El cumplimiento del esquema deja de ser algo que esperas y pasa a ser algo que la arquitectura garantiza. Las propias cifras de TypeSafe sitúan la latencia de extremo a extremo entre 70 y 500 milisegundos.

Una fila de pequeñas palancas de latón insertadas en una consola negro mate bajo una luz cálida

La empresa lo entrenó con un método al que llama Reinforcement Learning for Calibrated Decisions. El énfasis recae en la palabra calibrado. Una puntuación de confianza solo es útil si 0,85 significa de verdad que en aproximadamente el 85 por ciento de los casos la respuesta va por ahí, y los modelos de lenguaje son notoriamente optimistas sobre sus propias respuestas. Si tu aplicación va a actuar automáticamente por encima de un umbral y escalar a una persona por debajo, la calibración deja de ser un extra y pasa a ser todo el diseño.

Hay una segunda propiedad que importa igual de en producción, y es fácil pasarla por alto. Como el espacio de salida es fijo antes de la llamada, dos ejecuciones con el mismo estado y las mismas preguntas devuelven la misma respuesta. La reproducibilidad es eso que la mayoría de los equipos descubre que necesita solo después de una revisión de incidentes, cuando alguien pregunta por qué el sistema enrutó un ticket concreto de una forma concreta hace tres semanas y nadie puede reconstruirlo. Un modelo de decisión hace que esa pregunta tenga respuesta.

La curva de adopción se volvió extraña muy rápido

Vercel añadió Jev a su AI Gateway al segundo día y luego informó de que se convirtió en el modelo de adopción más rápida en la historia del gateway. Casi el 13 por ciento de los equipos de pago lo estaban usando en 24 horas, aproximadamente el doble de la tasa de la familia GPT-5.6 y más de seis veces la de Fable 5.1. Netlify siguió. LangChain publicó integraciones de TypeSafeClassifier con enrutamiento de modelos y middleware que filtra las llamadas a herramientas antes de su ejecución. Cinco clientes de Elixir independientes aparecieron en cuestión de días, que es el tipo de detalle que te dice que los desarrolladores ya estaban buscando esta forma de cosa.

Las cifras de escala son más difíciles de ignorar. Almeida declaró al Wall Street Journal que Jev estaba procesando alrededor de un billón de tokens al día en aproximadamente una semana desde el lanzamiento, y que cerca de una cuarta parte de las empresas del Fortune 500 lo estaban usando. The Information informó de que TypeSafe está negociando una ronda que apunta a 1.000 millones de dólares o más, con algunos inversores interesados valorando la empresa por encima de los 10.000 millones. Almeida declinó comentar el informe de financiación.

La estructura de costes explica parte del tirón. La entrada cuesta 0,042 dólares por millón de tokens y la salida es gratuita, y la ventana de contexto es de 32.000 tokens. Comparado con enrutar una tarea de clasificación a través de un modelo de frontera, la aritmética deja de estar reñida.

Dónde se sostiene realmente

Las evaluaciones de flujos de trabajo publicadas por TypeSafe sitúan a Jev a la par de los modelos de la clase Sonnet en precisión en cuatro tareas internas, con una fracción de la latencia y el coste, aunque por detrás de la configuración de frontera más potente en 6,3 puntos. El rendimiento se divide por tarea: 76,0 por ciento en clasificación de atención al cliente y 61,8 por ciento en procesamiento de facturas.

La empresa también es inusualmente directa sobre lo que no se le debería pedir a Jev. Su documentación advierte contra usarlo para aritmética, comparación de fechas o conteo sobre un estado grande y ruidoso, y dice a los equipos que mantengan esa lógica en código normal y que fijen un id de modelo versionado en lugar de un alias flotante.

Esa orientación señala el límite honesto de la categoría. Jev es un clasificador con una interfaz mucho mejor y comprensión del contexto a nivel de lenguaje, y está dirigido a trabajo que ya estaba estructurado: enrutar un ticket a facturación o a técnico, puntuar una señal de abuso, bloquear la llamada a herramienta de un agente antes de que gaste dinero aguas abajo, clasificar resultados de búsqueda. En esas posiciones reemplaza a un reranker caro o a una llamada de frontera diseñada con prompts, y el reemplazo es más rápido y más barato por un margen amplio.

El conjunto de competidores llegó en tres semanas

Una categoría tan obvia no permanece en silencio. Cloudflare lanzó Clef y Clef-flash el 1 de octubre, dos modelos de decisión de pesos abiertos bajo Apache 2.0, construidos sobre Qwen 3.8-27B y una columna vertebral de 9B respectivamente. Aceptan la misma forma de solicitud, añaden entrada de visión y una ventana de contexto de 65.536 tokens, y vienen con un servicio de ajuste fino por RL. Las propias cifras de latencia de Cloudflare sitúan a Clef-flash en una mediana de 38,8 milisegundos frente a los 524,1 milisegundos de Jev, una brecha lo bastante grande para importar en cualquier cosa que esté en la ruta de una solicitud. El trabajo de protocolo de OpenAI y el lanzamiento de Cloudflare se apoyaron en la misma idea, y Clef se diseñó para que el código escrito contra Jev siga funcionando.

Fastino Labs lanzó GLiDE y GLiNER2.5-Decide dentro de la misma ventana. También aparecieron réplicas abiertas: Jeff v1.1 ajusta Qwen3.5 y Gemma 4 en modelos de decisión de 0,8B y 2B que responden en 22 a 28 milisegundos en una GPU de estación de trabajo. Hay una advertencia que vale la pena señalar, y MarkTechPost lo hizo: las comparaciones de Fastino se hacen contra sus propias suites de pruebas y una reproducción abierta de Jev en lugar del modelo alojado de TypeSafe, así que las cifras entre proveedores no son una clasificación limpia.

Nada de eso borra lo que TypeSafe estableció. La empresa le puso nombre a una división que se había ido formando lentamente durante un año, entre modelos que generan lenguaje para personas y modelos que devuelven decisiones para software. Una vez que la segunda categoría tiene una forma de solicitud y un precio por millón de tokens, deja de ser una curiosidad de investigación y empieza a ser una partida en el presupuesto.

Qué hacer con esto

La pregunta práctica para un equipo es poco glamurosa. Mira lo que actualmente estás pagando a un modelo de frontera por hacer y cuenta cuántas de esas llamadas terminan con código leyendo un único valor de una respuesta que gastaste tokens en generar. Enrutamiento de tickets, filtros de moderación, puntuación de leads, clasificación de relevancia, aprobación de llamadas a herramientas. Cada una de ellas es candidata a moverse.

La razón para moverse no tiene nada que ver con que un modelo de decisión sea más listo. La interfaz simplemente deja de pelearse contigo. Envías un estado, recibes de vuelta una respuesta acotada con una probabilidad calibrada adjunta, y tu código ramifica. Escala por debajo del umbral, actúa por encima y mantén la aritmética en el código, donde pertenece.

También hay un argumento del lado del coste, y es el que harán los equipos de finanzas. La salida de un modelo de decisión son unos cientos de bytes en lugar de un párrafo, y los tokens de salida son donde el precio de frontera duele más. Una llamada de enrutamiento que cuesta fracciones de céntimo a 0,042 dólares por millón de tokens de entrada con salida gratuita convierte una partida que necesitaba justificación en una que no la necesita.

Eso es una promesa más pequeña que el «razonamiento», y se corresponde mejor con lo que la mayoría de los sistemas en producción ya intentaban obtener de un modelo de lenguaje.

Artículos relacionados