← 블로그로
Ai약 13 분 읽기

Cloudflare, Jev의 전문 영역에서 Jev를 능가하는 27B 결정 모델 공개

게시일 2026년 10월 6일
Cloudflare, Jev의 전문 영역에서 Jev를 능가하는 27B 결정 모델 공개

Cloudflare는 10월 초 Apache 2.0 라이선스로 Clef를 공개했습니다. 이는 Qwen3.8-27B를 기반으로 구축된 270억 파라미터 모델이며, 산문을 작성하지 않습니다. 선택지에 점수를 매깁니다.

이 범주는 작고 특정적입니다. 결정 모델은 입력과 후보 스키마 선택 세트를 받아, 생성된 문장 대신 순위를 반환합니다. Typesafe AI의 Jev가 이 접근 방식을 확립했고 이 분야의 기준점이 되었습니다. Clef는 두 번째 진지한 진입자로 등장했으며, Cloudflare가 발표한 수치에 따르면 정확도와 지연 시간 모두에서 기존 강자를 앞섭니다.

아키텍처는 어떻게 다른가

Clef는 프리필 전용(prefill-only) 설계를 사용합니다. 토큰을 하나씩 생성하는 대신 입력을 읽고 스키마 옵션에 병렬로 점수를 매깁니다. 이 단일 선택이 성능 격차의 대부분을 설명합니다. 기존 언어 모델 호출에서 비용이 많이 드는 부분은 디코드 루프이기 때문입니다.

표준 의도 분류 벤치마크인 BANKING77에서 Clef는 매크로 F1 94.20을 기록해 Jev의 79.74를 앞섰습니다. Cloudflare는 또한 더 작은 구성인 Clef-flash의 중앙값 지연 시간이 38.8밀리초라고 밝혔으며, 이를 Jev의 524.1밀리초 기준선보다 약 13배 빠르다고 설명합니다.

인터페이스는 점수만큼 중요합니다. Clef는 Jev-API와 호환되므로, 이미 Jev에 연결된 팀은 통합 코드를 다시 작성하지 않고 엔드포인트를 교체할 수 있습니다. Clef는 또한 64,000토큰 컨텍스트 창 안에서 멀티모달 입력을 받아들이는 반면, Jev는 텍스트 전용이며 32,000토큰으로 제한됩니다.

Cloudflare의 설명은 직설적입니다. 라우팅, 분류, 구조화된 선택에서는 텍스트 생성이 낭비되는 작업입니다. 필요한 답이 열두 개 범주 중 하나라면, 문단을 쓴 뒤 후처리하는 모델은 작업에 필요한 것보다 더 어려운 일을 하고 있는 것입니다.

임베딩과 비교했을 때 이 기술의 위치

결정 모델을 같은 문제에 대한 더 오래된 접근 방식과 구분할 필요가 있습니다. 팀들은 수년간 임베딩으로 라우팅하고 분류해 왔습니다. 입력을 임베딩하고, 레이블이 지정된 예시와 비교한 뒤, 가장 가까운 것을 고르는 방식입니다. 이 방식은 작동하고 비용도 저렴하지만, 비교할 레이블 세트가 필요하며, 결정이 유사성이 아니라 지침에 달려 있을 때 어려움을 겪습니다.

결정 모델은 요청의 일부로 스키마와 옵션 세트를 받습니다. 유사성 검사가 허용하는 것보다 더 넓은 범위의 질문에 답할 수 있습니다. 메시지가 어느 범주에 속하는지, 세 가지 도구 중 어느 것을 호출할지, 어느 모델로 라우팅할지, 여러 정책 중 어느 것이 적용되는지 등입니다. 지침은 유지 관리되는 예시 인덱스가 아니라 요청 안에 있으므로, 아무것도 다시 레이블링하지 않고 동작을 바꾸기가 더 쉽습니다.

대가는 결정 모델이 여전히 점수를 매기는 언어 모델이라는 점이며, 따라서 언어 모델의 실패 모드를 물려받습니다. 높은 확신을 가지고 틀릴 수 있고, 그 신뢰도 점수는 라우팅 정책이 테스트 없이 신뢰할 수 있는 확률로 보정되어 있지 않습니다. 프리필 전용 설계는 디코드 비용을 없애지만, 모델이 추측하고 있는 시점을 아는 문제를 없애지는 않습니다.

어쨌든 이 범주를 흥미롭게 만드는 것은 비용 계산입니다. 생성 모델을 통해 요청을 라우팅하면 핵심 경로에서 전체 생성이 필요하며, 흔히 수백 밀리초와 수백 토큰이 듭니다. Cloudflare는 flash 구성에서 Clef의 중앙값 지연 시간이 40밀리초 미만이라고 보고합니다. 사용자 턴마다 여러 라우팅 결정을 내리는 에이전트에게 이 차이는 누적되고, 사용자가 실제로 체감하는 단계에서 누적됩니다.

범주가 빠르게 표준화되고 있다

이것이 단순히 한 벤더의 출시 이상인 이유는 결정 모델을 둘러싼 도구 생태계가 얼마나 빠르게 두터워졌는지입니다.

9월 30일, SGLang은 네이티브 /v1/decisions 및 /v1/systemone 라우트를 추가해 언어 및 비전 모델이 토큰 단위 생성 없이 분류기와 스코어러 역할을 할 수 있게 했습니다. 이 프레임워크는 Qwen3.8-27B를 멀티모달 결정 모델로 실행해 이 기능을 시연했고, 100밀리초 미만 지연 시간으로 한 번의 시도에서 Pokemon FireRed를 이겼다고 보고했습니다.

며칠 후, llama.cpp는 새로운 /v1/systemone 엔드포인트를 통해 결정 모델 지원을 추가했습니다. Kev-4B와 OpenJev를 포함한 오픈 모델을 지원하며, 버전 0.6.0에 출시할 계획입니다. 작은 모델은 CPU에서 실행되며, 일부는 분류를 위한 이미지 입력을 지원합니다.

Respan은 자체 제품인 Span-01을 출시했습니다. 이는 에이전트 트레이스에서 프롬프트 인젝션, 환각, 도구 오용을 탐지하기 위한 초병렬 추론 분류기입니다. RLAIF로 훈련되었으며, 하나의 순전파에서 여러 보지 못한 행동 정의를 평가합니다. Respan은 백만 입력 토큰당 2센트로 가격을 책정했으며, 무료 Lite 버전도 제공합니다.

이는 두 주 안에 결정 모델을 네이티브로 구현할 가치가 있는 인터페이스로 다루는 네 개의 별도 프로젝트입니다. 어떤 패턴이 추론 프레임워크, 로컬 런타임, 그리고 스타트업의 제품 라인에 동시에 나타난다면, 그것은 더 이상 호기심의 대상이 아닙니다.

에이전트 라우팅에 중요한 이유

가장 먼저 이득을 볼 사람들은 다른 모델을 호출하는 에이전트를 만드는 이들입니다. 에이전트는 어느 도구를 사용할지, 어느 모델로 라우팅할지, 요청이 인젝션 시도인지, 응답이 근거에 기반하는지를 결정해야 합니다. 오늘날 많은 팀이 대형 모델에 JSON으로 답하라고 요청하고 형식이 유지되기를 바라는 방식으로 이 단계를 구현합니다.

수십 밀리초 안에 점수를 반환하는 분류기는 그 결정의 비용을 바꿉니다. 언어 모델을 통해 요청을 라우팅하면 전체 생성이 필요하고, 그 비용은 핵심 경로에서 발생합니다. 프리필 전용 스코어러를 통해 라우팅하면 그 비용의 일부만 들고 더 빨리 끝납니다. 정확도가 유지된다면 실질적인 효과는 에이전트 제어 흐름의 더 많은 부분이 토큰 속도가 아니라 기계 속도로 실행될 수 있다는 것입니다.

단일 반투명 유리 막대가 평범한 회색 돌 표면 바로 위에 청록색으로 빛나며 떠 있는 모습

Cloudflare 자신의 주장은 인프라 경제성에 관한 것입니다. 회사는 오픈 가중치 모델이 이제 대부분의 프로덕션 워크로드에서 폐쇄형 동등 모델보다 15~90퍼센트 더 저렴하게 실행되며, 오픈 가중치가 따라잡는 시대는 끝났다고 말합니다. Clef는 그 증거로 제시됩니다. 다운로드 가능하고 Apache 2.0 라이선스이며, 경쟁자의 자체 벤치마크 범주에서 독점 경쟁자를 앞서고, 자체 호스팅할 수 있는 모델입니다.

헤드라인을 믿기 전에 확인할 것

세 가지 주의점을 염두에 둘 가치가 있습니다.

첫째, 벤치마크는 벤더가 선택한 것입니다. BANKING77은 실제로 널리 사용되는 의도 데이터셋이지만, 단일 매크로 F1 수치가 희귀 클래스, 모호한 입력, 적대적 표현이 있는 프로덕션 분포 전반에서 모델이 어떻게 작동하는지 설명하지는 않습니다. 독립적인 평가가 출시 게시물보다 더 많은 것을 밝혀낼 것입니다.

둘째, Jev-API 호환성은 동작이 아니라 요청 형태에 관한 주장입니다. 다른 신뢰도 보정을 반환하는 드롭인 엔드포인트는 원래 모델에 맞춰 조정된 라우팅 정책을 여전히 망가뜨릴 수 있습니다.

셋째, 비교는 공개된 Jev를 기준으로 측정되었습니다. Typesafe AI도 자체 출시를 진행 중이며, 도전자와 기존 강자 사이의 격차는 오래 고정되어 있기 어렵습니다.

그중 어느 것도 더 오래가는 요점을 없애지는 않습니다. 결정 모델이 존재하는 이유는 라우팅, 게이팅, 분류가 에이전트 인프라가 실제로 하는 일의 큰 부분을 차지하며, 이를 텍스트 생성기로 처리하는 것은 항상 어색한 맞춤이었기 때문입니다. Clef, Span-01, 그리고 SGLang과 llama.cpp의 새 엔드포인트는 같은 아이디어로 수렴하고 있습니다. 일부 모델 호출은 문장이 아니라 숫자를 반환해야 한다는 것입니다. 이제 질문은 이 구현 중 어느 것이 다른 모든 사람의 에이전트 루프 아래에 깔리게 될지, 그리고 이 범주가 얼마나 오래 경쟁 상태로 남을지입니다.

관련 글