← 블로그로
Ai약 13 분 읽기

문장 쓰기를 거부하는 모델, 이제 하루에 1조 토큰을 처리하다

게시일 2026년 10월 5일
문장 쓰기를 거부하는 모델, 이제 하루에 1조 토큰을 처리하다

TypeSafe AI는 2026년 9월 15일 Jev를 출시했고, 9월 27일에는 대기자 명단을 내렸다. 그 제안은 처음에는 오타처럼 들릴 만큼 좁다. Jev는 텍스트를 생성하지 않는다. 상태 조각 하나와 타입이 지정된 질문 세트를 보내면, 미리 정의한 스키마에서 끌어낸 답변을 반환하며, 각 답변에는 확률과 신뢰도 값이 함께 붙는다.

세 가지 기본 요소가 답할 수 있는 범위를 구성한다. Choice는 사용자가 제공한 목록에서 하나의 옵션을 고른다. Score는 입력을 순서가 있는 서술적 등급에 비추어 평가한다. Noul은 예/아니오 질문에 답이 '예'일 확률로 응답한다.

그게 제품의 전부다. 채팅도, 문단도, 마크다운도, AI라서 미안하다는 말도 없다.

누가 왜 이걸 원할까

Diogo Almeida는 TypeSafe AI를 창업했으며, 이전에는 OpenAI에서 ChatGPT의 동작 방식을 형성한 지시 수행(instruction-following) 방법을 연구했다. 그는 2024년에 회사를 떠났다. 그 이후 그의 주장은 일관된다. 채팅 인터페이스는 소프트웨어에 맞지 않는 형태다. 코드는 문장을 돌려받기를 원하지 않는다. 분기할 수 있는 값을 원한다.

LLM을 프로덕션 시스템에 연결해 본 사람이라면 그가 설명하는 고통을 알아볼 것이다. 모델에게 지원 티켓을 분류해 달라고 요청하면, 분류로 시작해서 추가 도움을 제안하며 끝나는 친절한 문단을 돌려받는다. 그러면 정규식을 작성한다. 그다음 모델이 형식을 바꾸고, 정규식이 깨진다. 그러면 JSON 모드를 추가하고, 때때로 JSON이 잘못된 형식으로 나온다. 모델은 취약한 부분이 아니었다. 인터페이스가 취약했다.

Jev는 생성을 완전히 제거함으로써 이 문제를 피한다. 자기회귀 토큰 생성이 아니라 병렬 샘플러를 사용하므로, 추론이 실행되기 전에 가능한 출력이 열거된다. 스키마 준수는 바라는 것이 아니라 아키텍처가 보장하는 것이 된다. TypeSafe의 자체 수치에 따르면 종단 간 지연 시간은 70~500밀리초 사이다.

따뜻한 빛 아래 무광 블랙 콘솔에 박힌 한 줄의 작은 황동 레버

회사는 이를 '보정된 결정을 위한 강화 학습(Reinforcement Learning for Calibrated Decisions)'이라는 방법으로 훈련했다. 강조점은 '보정된'이라는 말에 있다. 신뢰도 점수는 0.85가 실제로 약 85퍼센트의 사례가 그쪽으로 간다는 뜻일 때만 유용하며, 대부분의 언어 모델은 자신의 답변에 대해 낙관적인 것으로 악명 높다. 애플리케이션이 임계값 이상에서는 자동으로 행동하고 그 아래에서는 사람에게 에스컬레이션하려는 경우, 보정은 보너스가 아니라 설계의 전부가 된다.

프로덕션에서 똑같이 중요한 두 번째 속성이 있는데, 간과하기 쉽다. 호출 전에 출력 공간이 고정되기 때문에, 같은 상태와 같은 질문으로 두 번 실행하면 같은 답이 반환된다. 재현성은 대부분의 팀이 사고 리뷰 이후에야 필요하다는 것을 깨닫는 것이다. 누군가 3주 전에 시스템이 특정 티켓을 왜 특정 방식으로 라우팅했는지 묻는데 아무도 재구성할 수 없을 때 말이다. 결정 모델은 그 질문에 답할 수 있게 한다.

도입 곡선이 빠르게 이상해졌다

Vercel은 둘째 날 Jev를 자사 AI Gateway에 추가했고, 이후 게이트웨이 역사상 가장 빠르게 채택된 모델이 되었다고 보고했다. 유료 팀의 거의 13퍼센트가 24시간 이내에 사용했는데, 이는 GPT-5.6 패밀리의 약 두 배, Fable 5.1의 6배가 넘는 비율이다. Netlify도 뒤따랐다. LangChain은 모델 라우팅과 실행 전에 도구 호출을 검사하는 미들웨어가 포함된 TypeSafeClassifier 통합을 출시했다. 며칠 안에 독립적인 Elixir 클라이언트 다섯 개가 등장했는데, 이런 세부 사항은 개발자들이 이미 이런 형태의 무언가를 찾고 있었다는 것을 말해준다.

규모 수치는 무시하기 더 어렵다. Almeida는 월스트리트 저널에 Jev가 출시 후 약 일주일 만에 하루에 약 1조 토큰을 처리하고 있었고, 포춘 500 기업의 약 4분의 1이 이를 사용하고 있다고 말했다. The Information은 TypeSafe가 10억 달러 이상을 목표로 하는 라운드를 협상 중이며, 일부 관심 투자자들은 회사 가치를 100억 달러 이상으로 평가한다고 보도했다. Almeida는 자금 조달 보도에 대해 논평을 거부했다.

비용 구조가 끌림의 일부를 설명한다. 입력은 백만 토큰당 0.042달러이고 출력은 무료이며, 컨텍스트 윈도우는 32,000토큰이다. 분류 작업을 프런티어 모델을 통해 라우팅하는 것과 비교하면, 산술은 더 이상 비슷하지도 않다.

이것이 실제로 강점을 보이는 곳

TypeSafe가 공개한 워크플로 평가에 따르면 Jev는 네 가지 내부 작업에서 정확도 면에서 Sonnet급 모델과 동등하면서 지연 시간과 비용은 극히 일부에 불과했고, 가장 강력한 프런티어 구성보다는 6.3포인트 뒤졌다. 성능은 작업별로 나뉜다. 고객 서비스 분류에서 76.0퍼센트, 인보이스 처리에서 61.8퍼센트다.

회사는 또한 Jev에게 시켜서는 안 되는 일에 대해 이례적으로 직접적이다. 문서는 산술, 날짜 비교, 크고 잡음이 많은 상태 전반에 걸친 계산에 사용하지 말라고 경고하며, 그러한 로직은 일반 코드에 두고 떠다니는 별칭이 아니라 버전이 지정된 모델 ID에 고정하라고 팀에 말한다.

그 지침은 이 범주의 정직한 경계를 가리킨다. Jev는 훨씬 나은 인터페이스와 언어 수준의 문맥 이해를 갖춘 분류기이며, 이미 구조화되어 있던 작업을 겨냥한다. 티켓을 결제나 기술로 라우팅하기, 남용 신호 점수화하기, 에이전트의 도구 호출이 다운스트림에서 비용을 쓰기 전에 게이트하기, 검색 결과 순위 매기기 등이다. 이런 자리에서 Jev는 값비싼 리랭커나 프롬프트 엔지니어링된 프런티어 호출을 대체하며, 그 대체는 훨씬 빠르고 훨씬 저렴하다.

경쟁 제품군은 3주 만에 등장했다

이렇게 뻔한 범주는 조용히 있지 않는다. Cloudflare는 10월 1일 Clef와 Clef-flash를 출시했는데, 각각 Qwen 3.8-27B와 9B 백본을 기반으로 구축된 Apache 2.0 라이선스의 오픈 웨이트 결정 모델 두 가지다. 이들은 같은 요청 형태를 받아들이고, 비전 입력과 65,536토큰 컨텍스트 윈도우를 추가하며, RL 파인튜닝 서비스를 제공한다. Cloudflare 자체 지연 시간 수치에 따르면 Clef-flash는 중앙값 38.8밀리초인 반면 Jev는 524.1밀리초로, 요청 경로에 있는 모든 것에 중요할 만큼 큰 차이다. OpenAI의 프로토콜 작업과 Cloudflare의 출시는 모두 같은 아이디어에 기대었고, Clef는 Jev에 맞춰 작성된 코드가 계속 작동하도록 설계되었다.

Fastino Labs는 같은 기간에 GLiDE와 GLiNER2.5-Decide를 출시했다. 오픈 복제품도 등장했다. Jeff v1.1은 Qwen3.5와 Gemma 4를 0.8B 및 2B 결정 모델로 파인튜닝하여 워크스테이션 GPU에서 22~28밀리초에 응답한다. 언급할 가치가 있는 단서가 있는데 MarkTechPost가 지적했다. Fastino의 비교는 TypeSafe의 호스팅 모델이 아니라 자체 테스트 스위트와 Jev의 오픈 재현판을 대상으로 실행되므로, 벤더 간 수치는 깨끗한 순위가 아니다.

그렇다고 해서 TypeSafe가 확립한 것이 지워지지는 않는다. 이 회사는 사람을 위해 언어를 생성하는 모델과 소프트웨어를 위해 결정을 반환하는 모델 사이에서 1년 동안 천천히 형성되어 온 분열에 이름을 붙였다. 두 번째 범주에 요청 형태와 백만 토큰당 가격이 생기면, 그것은 더 이상 연구적 호기심이 아니라 비용 항목이 되기 시작한다.

이것을 어떻게 활용할까

팀에게 실용적인 질문은 매력적이지 않다. 현재 프런티어 모델에 돈을 내고 하는 일을 살펴보고, 그 호출 중 코드가 토큰을 들여 생성한 응답에서 단일 값을 읽는 것으로 끝나는 것이 얼마나 되는지 세어 보라. 티켓 라우팅, 모더레이션 게이트, 리드 스코어링, 관련성 순위, 도구 호출 승인. 그 각각은 옮길 후보다.

옮길 이유는 결정 모델이 더 똑똑해서가 전혀 아니다. 인터페이스가 더 이상 당신과 싸우지 않을 뿐이다. 상태를 보내면 보정된 확률이 붙은 제한된 답을 돌려받고, 코드가 분기한다. 임계값 아래에서는 에스컬레이션하고, 위에서는 행동하며, 산술은 있어야 할 곳인 코드에 둔다.

비용 측면의 논거도 있는데, 재무 팀이 제기할 바로 그것이다. 결정 모델의 출력은 문단이 아니라 수백 바이트에 불과하며, 출력 토큰은 프런티어 가격이 가장 아프게 작용하는 부분이다. 백만 입력 토큰당 0.042달러에 출력 무료로 센트 단위의 비용이 드는 라우팅 호출은 정당화가 필요했던 비용 항목을 그럴 필요가 없는 항목으로 바꾼다.

그것은 '추론'보다 작은 약속이며, 대부분의 프로덕션 시스템이 이미 언어 모델에서 얻으려 했던 것에 더 가깝게 대응한다.

관련 글