← Volver al blog
Aiaprox. 8 min de lectura

Cloudflare lanza un modelo de decisión de 27B que supera a Jev en su propio terreno

Publicado 6 oct 2026
Cloudflare lanza un modelo de decisión de 27B que supera a Jev en su propio terreno

Cloudflare lanzó Clef en los primeros días de octubre bajo licencia Apache 2.0. Es un modelo de 27.000 millones de parámetros construido sobre Qwen3.8-27B, y no escribe prosa. Puntúa opciones.

La categoría es pequeña y específica. Un modelo de decisión toma una entrada y un conjunto de opciones de esquema candidatas, y devuelve una ordenación en lugar de una frase generada. Jev, de Typesafe AI, estableció el enfoque y se convirtió en su punto de referencia. Clef llega como el segundo competidor serio y, según las cifras que Cloudflare ha publicado, supera al titular tanto en precisión como en latencia.

En qué se diferencia la arquitectura

Clef utiliza un diseño de solo prefill. Lee la entrada y puntúa las opciones de esquema en paralelo en lugar de emitir tokens uno a uno. Esa única decisión explica la mayor parte de la diferencia de rendimiento, porque la parte cara de una llamada convencional a un modelo de lenguaje es el bucle de decodificación.

En BANKING77, un benchmark estándar de clasificación de intenciones, Clef obtiene 94,20 de macro-F1 frente a los 79,74 de Jev. Cloudflare también informa de que Clef-flash, la configuración más pequeña, tiene una latencia mediana de 38,8 milisegundos, lo que describe como aproximadamente 13 veces más rápido que la línea base de 524,1 milisegundos de Jev.

La interfaz importa tanto como la puntuación. Clef es compatible con la API de Jev, así que un equipo que ya está conectado a Jev puede cambiar el endpoint sin reescribir el código de integración. Clef también acepta entradas multimodales dentro de una ventana de contexto de 64.000 tokens, mientras que Jev es solo texto y está limitado a 32.000.

El planteamiento de Cloudflare es directo: para el enrutamiento, la clasificación y la selección estructurada, generar texto es trabajo desperdiciado. Si la respuesta que necesitas es una de doce categorías, un modelo que escribe un párrafo y luego lo posprocesa está haciendo algo más difícil de lo que exige la tarea.

Dónde encaja esto junto a los embeddings

Vale la pena separar los modelos de decisión del enfoque más antiguo para el mismo problema. Los equipos llevan años enrutando y clasificando con embeddings: incrustan la entrada, la comparan con ejemplos etiquetados y eligen la más cercana. Eso funciona y es barato, pero necesita un conjunto etiquetado con el que comparar, y tiene dificultades cuando la decisión depende de instrucciones y no de la similitud.

Un modelo de decisión toma un esquema y un conjunto de opciones como parte de la solicitud. Puede responder a una gama más amplia de preguntas de lo que permite una comprobación de similitud: a qué categoría pertenece un mensaje, cuál de tres herramientas llamar, a qué modelo enrutar y cuál de varias políticas se aplica. Las instrucciones viven en la solicitud en lugar de en un índice de ejemplos mantenido, lo que facilita cambiar el comportamiento sin volver a etiquetar nada.

El inconveniente es que un modelo de decisión sigue siendo un modelo de lenguaje haciendo la puntuación, así que hereda sus modos de fallo. Puede equivocarse con una confianza alta, y sus puntuaciones de confianza no están calibradas a una probabilidad en la que una política de enrutamiento pueda confiar sin probarla. El diseño de solo prefill elimina el coste de decodificación, pero no elimina el problema de saber cuándo el modelo está adivinando.

En cualquier caso, los cálculos de coste son lo que hace interesante a la categoría. Enrutar una solicitud a través de un modelo generativo cuesta una generación completa en la ruta crítica, a menudo varios cientos de milisegundos y unos cientos de tokens. Cloudflare reporta Clef por debajo de los 40 milisegundos de mediana para la configuración flash. Para un agente que toma varias decisiones de enrutamiento por turno de usuario, esa diferencia se acumula, y se acumula en el paso que los usuarios realmente perciben.

La categoría se está estandarizando rápido

Lo que hace que esto sea más que el lanzamiento de un proveedor es la rapidez con la que se ha engrosado el ecosistema de herramientas en torno a los modelos de decisión.

El 30 de septiembre, SGLang añadió rutas nativas /v1/decisions y /v1/systemone, lo que permite que los modelos de lenguaje y de visión actúen como clasificadores y puntuadores sin generación token a token. El framework demostró la capacidad ejecutando Qwen3.8-27B como modelo de decisión multimodal y reportó haber superado Pokemon FireRed en un intento con una latencia inferior a 100 milisegundos.

Días después, llama.cpp añadió compatibilidad con modelos de decisión mediante un nuevo endpoint /v1/systemone, que abarca modelos abiertos como Kev-4B y OpenJev, con un lanzamiento previsto en la versión 0.6.0. Los modelos pequeños se ejecutan en CPU, y algunos admiten entradas de imagen para la clasificación.

Respan lanzó su propia propuesta, Span-01, un clasificador de razonamiento hiperparalelo para detectar inyección de prompts, alucinaciones y uso indebido de herramientas en las trazas de agentes. Se entrena con RLAIF y evalúa múltiples definiciones de comportamiento no vistas en una sola pasada hacia delante. Respan lo cobra a dos centavos por millón de tokens de entrada, con una versión Lite gratuita.

Son cuatro proyectos distintos que tratan los modelos de decisión como una interfaz que merece implementarse de forma nativa, en el plazo de dos semanas. Cuando un patrón aparece a la vez en un framework de inferencia, un runtime local y la línea de producto de una startup, ha dejado de ser una curiosidad.

Por qué esto importa para el enrutamiento de agentes

Quienes tienen más que ganar primero son los que construyen agentes que llaman a otros modelos. Un agente necesita decidir qué herramienta usar, a qué modelo enrutar, si una solicitud es un intento de inyección y si una respuesta está fundamentada. Hoy muchos equipos implementan esos pasos pidiendo a un modelo grande que responda en JSON y esperando que el formato se mantenga.

Un clasificador que devuelve una puntuación en decenas de milisegundos cambia el coste de esa decisión. Enrutar una solicitud a través de un modelo de lenguaje cuesta una generación completa, y la cuesta en la ruta crítica. Enrutarla a través de un puntuador de solo prefill cuesta una fracción de eso y termina antes. Si la precisión se mantiene, el efecto práctico es que una mayor parte del flujo de control de un agente puede ejecutarse a velocidad de máquina en lugar de a velocidad de token.

Una única barra de vidrio esmerilado que brilla en color turquesa suspendida justo por encima de una superficie lisa de piedra gris

El argumento de la propia Cloudflare tiene que ver con la economía de la infraestructura. La compañía afirma que los modelos de pesos abiertos ahora resultan entre un 15 y un 90 por ciento más baratos que sus equivalentes cerrados para la mayoría de las cargas de trabajo en producción, y que la era en la que los pesos abiertos iban a la zaga ha terminado. Clef se ofrece como prueba: un modelo descargable, con licencia Apache 2.0, que supera a un competidor propietario en la propia categoría de benchmark de ese competidor y que puede autoalojarse.

Qué comprobar antes de creerse el titular

Merece la pena retener tres advertencias.

Primero, los benchmarks los elige el proveedor. BANKING77 es un conjunto de datos de intenciones real y ampliamente utilizado, pero una única cifra de macro-F1 no describe cómo se comporta un modelo a lo largo de una distribución de producción con clases raras, entradas ambiguas y formulaciones adversarias. Una evaluación independiente resolvería más de lo que puede hacer un post de lanzamiento.

Segundo, la compatibilidad con la API de Jev es una afirmación sobre la forma de la solicitud, no sobre el comportamiento. Un endpoint que se puede sustituir directamente pero que devuelve una calibración de confianza distinta puede seguir rompiendo una política de enrutamiento ajustada en torno al original.

Tercero, la comparación se mide contra el Jev publicado. Typesafe AI tiene sus propios lanzamientos en marcha, y la brecha entre un retador y un titular rara vez se mantiene fija mucho tiempo.

Nada de eso elimina el punto más duradero. Los modelos de decisión existen porque el enrutamiento, el filtrado y la clasificación son una gran parte de lo que realmente hace la infraestructura de agentes, y hacerlo con un generador de texto siempre fue un encaje incómodo. Clef, Span-01 y los nuevos endpoints de SGLang y llama.cpp convergen en la misma idea: algunas llamadas a modelos deberían devolver un número en lugar de una frase. La pregunta ahora es cuál de estas implementaciones acabará debajo del bucle de agentes de todos los demás, y cuánto tiempo seguirá disputada la categoría.

Artículos relacionados