← 블로그로
Ai약 14 분 읽기

서브에이전트 경제: 왜 저렴한 모델이 진짜 에이전트의 핵심인가

게시일 2026년 10월 10일
서브에이전트 경제: 왜 저렴한 모델이 진짜 에이전트의 핵심인가

10월 초 가장 중대한 AI 출시는 가장 저렴한 모델이었다. 10월 7일, Anthropic은 Claude Haiku 5.5를 출시하며 평균 실행 비용이 이전 Haiku보다 약 75퍼센트 낮다고 밝혔다. 100,000 토큰 미만 요청의 경우 API 가격은 약 90퍼센트 인하되어 입력 100만 토큰당 10센트, 출력 100만 토큰당 50센트가 되었다. Anthropic은 또한 Sonnet 5.5의 캐시 읽기 가격을 절반으로 줄였다.

저렴한 모델은 대수롭지 않게 여기기 쉽다. 가격 정책의 움직임처럼 보이지, 성능에 관한 이야기는 아니다. 하지만 이번 출시에서 흥미로운 점은 가격이 아니다. 그것은 Haiku 5.5가 무엇을 위한 모델인가이다.

작은 모델이 성장했다

작은 모델에 대한 예전의 비판은 간단한 작업에는 괜찮지만 실제 작업에는 쓸모없다는 것이었다. 그 격차는 빠르게 좁혀졌다. Terminal-Bench 코딩 평가에서 Haiku 4.5는 0점을 받았다. Haiku 5.5는 39.2퍼센트를 기록했다. 인터페이스를 통해 컴퓨터를 조작하는 능력을 테스트하는 OSWorld에서는 15.7퍼센트에서 72.4퍼센트로 올라, 비교 대상인 GPT-6 Luna의 48.9퍼센트를 앞섰다.

Anthropic은 또한 Haiku 제품군 최초로 조절 가능한 추론 노력(reasoning effort)을 제공했으며, 낮음부터 최대까지 다섯 단계가 있다. 이로써 개발자는 도움이 되는 곳에 연산을 쓰고 그렇지 않은 곳에는 건너뛸 수 있는데, 이는 지속적으로 무언가를 실행할 때 비용에 큰 영향을 주는 작은 기능이다.

하나의 밝은 계획 노드가 여러 작은 실행 노드로 분기되는 모습

서브에이전트라는 구도

이번 출시에서 강조할 만한 부분은 포지셔닝이다. Anthropic은 Haiku 5.5가 더 큰 Opus 5.5와 Sonnet 5.5의 서브에이전트 역할을 할 수 있다고 말했다. 쉽게 말해, 플래그십 모델이 계획하고 결정하며, Haiku가 실행을 맡는다: 문서 정리, 컴퓨터 조작, 데이터 처리 등이다.

이는 실제 아키텍처의 전환이며 비용 논의의 틀을 바꾼다. 각 호출이 더 저렴해진 것만이 아니다. 하나의 값비싼 계획 호출이 이제 여러 값싼 실행 호출로 퍼져 나갈 수 있다는 점이다. 모든 단계마다 플래그십 모델 하나를 실행하던 에이전트가 어려운 부분에는 플래그십을, 나머지 전부에는 Haiku를 실행할 수 있다. 값비싼 호출이 애초에 얼마나 많이 발생하는지를 바꾸기 때문에, 청구서는 토큰당 할인 폭이 시사하는 것보다 더 많이 떨어질 수 있다.

Anthropic의 경쟁자들도 다른 각도에서 같은 형태로 수렴하고 있다. 10월 1일 출시된 Google의 Gemini 4 Argon은 코딩, 리서치, 금융 및 법률 업무를 겨냥하며, 대규모 검토를 위해 최대 100만 토큰 출력을 지원한다. OpenAI의 중간급 모델들은 입지를 지키기 위해 가격을 인하해 왔다. 출시 메시지는 다르지만 근본적인 베팅은 공유된다: 작업은 하나의 모델이 하나의 질문에 답하는 것이 아니다. 그것은 오케스트레이션된 여러 호출이며, 오케스트레이터에게는 값싼 손이 필요하다.

병목이 이동한 이유

긴급성을 설명하는 숫자가 있다. 이 분야를 추적하는 분석가들은 2026년 전 세계 일일 활성 에이전트를 약 7,900만 개로 추정하며, 이는 전년의 약 2,900만 개에서 증가한 수치이고 2030년에는 수십억 개에 이를 것으로 전망한다. 정확한 수치가 무엇이든 방향은 분명하다. 에이전트는 시연에서 프로덕션으로 이동하고 있으며, 프로덕션 에이전트를 멈추게 하는 것은 모델이 너무 멍청해서인 경우가 드물다. 충분히 여러 번 실행하면 비용이 너무 많이 드는 것이 문제다.

그래서 업계가 오케스트레이션 계층에 대해 이야기하기 시작했다. 이 계층은 요청을 단계로 나누고, 각 단계를 적절한 모델로 라우팅하며, 결과를 조립하는 부분이다. 기본 모델이 저렴해질수록 이 계층은 덜 가치 있어지는 것이 아니라 더 가치 있어지는데, 값싼 모델이 어디로 가야 하는지를 결정하는 것이 바로 이 계층이기 때문이다.

체인이 실제로 작업을 나누는 방식

서브에이전트에 대한 추상적인 이야기는 구체적인 작업을 들면 더 명확해진다. 에이전트에게 시장을 조사하고 브리핑을 작성하라고 요청한다고 가정하자. 플래그십 모델은 요청을 읽고 무엇을 찾아야 할지 결정하며 단계를 계획한다. 그런 다음 작은 모델이 반복 작업을 맡는다: 페이지를 방문하고, 숫자를 추출하고, 표를 다시 포맷하고, 출처의 중복을 제거하고, 각 주장에 인용이 있는지 확인한다. 플래그십은 마지막에 돌아와 종합을 작성하고 초안이 충분히 좋은지 판단한다. 양 끝에 값비싼 호출 하나씩, 중간에 값싼 호출 여러 개가 있다.

이 패턴은 여러 작업에서 반복된다. 양이 많고 모호함이 적은 일은 모두 저렴한 모델의 후보이다: 양식 작성, 로그 읽기, 지원 티켓 분류, 문서가 템플릿과 일치하는지 확인 등이다. 다음에 무엇을 해야 할지 판단이 필요한 일은 플래그십이 맡는다. 경계는 고정되어 있지 않으며, 지금 흥미로운 엔지니어링 작업은 각 워크플로에서 그 경계를 어디에 둘지 결정하는 것이다.

Anthropic의 조절 가능한 추론 노력은 여기에 잘 맞는다. 가벼운 처리가 필요한 작업은 낮은 노력으로 실행할 수 있고, 더 세심한 주의가 필요한 작업은 모델을 바꾸지 않고도 높일 수 있다. 실제로 이는 같은 저렴한 모델이 빠른 분류와 신중한 검토를 모두 처리할 수 있음을 의미하며, 팀이 관리해야 하는 구성 요소의 수를 줄여 준다.

가격 인하가 제품에 바꾸는 것

더 저렴한 실행은 어떤 제품을 만들 가치가 있는지를 바꾼다. 들어오는 모든 메시지마다 에이전트를 실행하는 기능은 각 실행에 실제 비용이 들 때는 말이 되지 않았다. 실행 비용이 1센트의 일부에 불과할 때는 말이 된다. 그 결과 1년 동안 기술적으로는 가능했지만 지금까지 경제적으로는 불가능했던 기능들의 물결이 일고 있다: 상시 모니터, 항목별 보강, 샘플이 아니라 모든 산출물을 확인하는 백그라운드 검토자 등이다.

거기에는 함정이 있고, 빠지기 쉽다. 실행이 저렴해지면 팀은 실행을 측정하지 않게 된다. 하루에 값싼 호출을 1,000번 실행하는 워크플로는 호출당 기준으로는 무해해 보이지만, 재시도, 실패, 값비싼 모델로의 에스컬레이션을 포함하면 놀라운 월 청구서가 될 수 있다. 중요한 숫자는 단일 호출 비용이 아니라 완료된 작업의 비용이다.

작은 모델의 벤치마크 문제

작은 모델은 벤치마크에서 더 나아지고 있으며, 벤치마크는 개선을 과대 해석하기 가장 쉬운 바로 그곳이다. 컴퓨터 조작 테스트의 대표 점수는 모델이 알려진 인터페이스 단계 순서를 따를 수 있다는 것을 말해 준다. 그 모델이 언제 멈춰야 하는지, 언제 도움을 요청해야 하는지, 또는 작업이 조용히 잘못되었는지를 아는지에 대해서는 훨씬 덜 말해 준다. 그러한 행동이 저렴한 에이전트가 프로덕션에서 실패하는 지점이며, 점수화하기 어렵다.

실용적인 방어책은 매력적이지 않다. 저렴한 서브에이전트에게 좁은 작업, 명확한 완료 정의, 추측 대신 에스컬레이션할 방법을 주어라. 그런 다음 중요한 일을 맡기기 전에 일주일 동안 엣지 케이스에서 어떻게 하는지 지켜보라. 자신의 작업 한계를 아는 저렴한 모델이 즉흥적으로 처리하는 영리한 모델보다 더 유용하다.

솔직한 주의사항

자신감 있게 틀리는 저렴한 모델은 값비싼 모델보다 나쁘며, 에이전트 체인은 그 위험을 증폭한다. 추가되는 모든 단계는 오류가 들어와 전파될 수 있는 지점이다. 토큰당 가격은 저렴한 모델이 모호한 지시를 사람처럼 처리했는지에 대해서는 아무것도 말해 주지 않는다.

아직 해소되지 않은 거버넌스 격차도 있다. 9월 말 NIST와 CISA의 지침은 에이전트를 신뢰도가 낮은 비인간 신원으로 취급하고, 수명이 짧은 자격 증명, 유지 관리되는 인벤토리, 고위험 작업에 대한 인간 승인을 요구한다. 대부분의 조직은 인벤토리도 승인 흐름도 갖추지 못했다. 저렴한 실행은 많은 에이전트를 실행하기는 더 쉽게 만들고, 얼마나 많이 실행 중인지 알기는 더 어렵게 만든다.

빌드하는 사람에게 이것이 의미하는 것

지금 길러야 할 유용한 습관은 기본적으로 가장 큰 모델을 찾는 것을 멈추는 것이다. 작업을 계획과 실행으로 나누고, 판단이 필요한 곳에 플래그십을 쓰고, 나머지는 작은 모델로 라우팅하라. 단일 호출이 아니라 전체 체인을 측정하라.

Haiku 5.5가 화제인 이유는 저렴해서가 아니다. 저렴한 등급이 마침내 예전에는 값비싼 모델이 필요했던 에이전트의 부분들을 감당할 만큼 좋아졌기 때문이다.

관련 글