모델 선택기가 오케스트레이션 선택기로 변하고 있다

GitHub는 9월 30일 HydraFusion을 명령줄에서 에디터로 옮겼습니다. 이제 이 연구 프리뷰는 VS Code 1.140 이상과 GitHub Copilot 앱에서 실행되며, 일반 개발자에게 다소 이례적인 아이디어를 제시합니다. 모델 선택을 멈추고 워크플로를 선택하세요.
HydraFusion은 모델이 아닙니다. 각 턴마다 작업에 필요한 모델 역할 수를 결정하는 계층입니다.
하나의 요청을 위한 세 가지 형태
Single은 익숙한 사례입니다. Copilot Auto가 이미 작동하는 방식처럼 하나의 모델이 요청을 처리합니다.
Cascade는 저렴하게 시작합니다. 효율적인 모델이 초안을 작성하고, 품질 게이트가 이를 수락하거나 더 강력한 모델로 작업을 에스컬레이션합니다. 핵심은 일상적인 편집은 저렴한 모델에 맡기고, 비싼 모델은 실제로 필요한 문제를 위해 남겨 두는 것입니다.
Critique는 더 안전해지기 위해 더 많은 비용을 지불합니다. 한 모델이 초안을 작성하고, 다른 계열의 두 번째 모델이 읽기 전용 비평가 역할을 하며, 초안 작성 모델은 그 피드백을 바탕으로 한 번 수정합니다. 비평가는 코드를 전혀 건드리지 않으므로, 루프가 두 모델의 논쟁으로 변하는 것을 막습니다.
Auto와의 차이는 아키텍처적입니다. Auto는 어떤 단일 모델이 프롬프트를 받아야 할지 결정합니다. HydraFusion은 해당 턴에 필요한 역할 수와 이들이 상호작용하는 방식을 결정합니다. 이는 지능 제어가 어디에 위치하는지에 있어 의미 있는 전환입니다. 역사적으로 여러분은 특정 모델이 자신의 업무 유형에 더 뛰어나서 그 모델을 골랐습니다. 여기서는 최적화 정책을 고르고 플랫폼이 그 아래에서 모델들을 구성하도록 합니다.

경제성은 실제이며 동시에 자기 보고식이다
문제는 과금입니다. GitHub는 각 선택된 모델의 표준 요율로 토큰당 비용을 청구합니다. Critique 실행은 최소 두 모델을 호출하므로 요청당 단일 호출보다 비용이 더 들 수 있습니다. Cascade는 쉬운 작업을 아래로 밀어 비용을 낮추도록 설계되었습니다. 절감은 어떤 모델의 할인이 아닙니다. 대부분의 턴에는 최고 모델이 필요하지 않다는 베팅입니다.
GitHub의 자체 통제된 평가에서는 세 가지 코딩 에이전트 벤치마크 전반에서 Claude Opus 5 기준선 대비 워크플로 비용이 36~67% 감소했다고 보고했습니다. 품질은 TerminalBench 2.1에서 4.9%포인트 높았고, DeepSWE에서 1.5%포인트 낮았으며, CheckpointBench에서 0.1%포인트 낮았습니다. 이는 GitHub 자체 테스트 환경에서 벤더가 산출한 수치입니다. 여러분의 저장소에 대한 가설일 뿐 보장이 아니며, HydraFusion에 참여하는 모델 풀은 완전히 공개되지 않았습니다. 프리뷰 위에 구축하는 모든 것은 라우팅 동작이 예고 없이 바뀔 수 있는 것으로 취급해야 합니다.
또한 명백한 지연 비용도 있습니다. 초안에 검토까지 더하면 답변 하나보다 오래 걸립니다. Business 및 Enterprise 플랜 팀은 사용량 대시보드를 면밀히 지켜봐야 합니다. 시스템이 언제 에스컬레이션할지 결정하며, 그 결정은 공짜가 아니기 때문입니다.
검사할 수 없는 최적화는 신뢰하기 어렵다
라우팅의 곤란한 점은 결정을 내리는 주체가 개발자가 아니라 플랫폼이라는 것입니다. 어떤 모델이 답했는지는 사후에 볼 수 있지만, 시스템이 왜 그 워크플로를 선택했는지, 품질 게이트가 무엇을 측정했는지, Cascade 실행이 에스컬레이션에 얼마나 근접했는지는 쉽게 알 수 없습니다. GitHub의 벤치마크 주장은 자체 테스트 세트의 평균을 설명하며, 평균은 중요한 사례들을 가립니다.
그 격차는 오케스트레이션을 순전히 기술적인 문제가 아니라 거버넌스 문제로 만듭니다. 특정 풀 리퀘스트가 왜 두 모델 계열에 의해 검토되고 그에 따라 비용이 청구되었는지 설명해야 하는 엔지니어링 팀에는 라우팅 텔레메트리가 필요하지만, 프리뷰는 아직 이를 노출하지 않습니다. 해결책은 이 기능을 피하는 것이 아닙니다. 내부가 숨겨진 다른 의존성을 테스트하듯 테스트하는 것입니다. 고정되고 지루한 저장소 작업 세트에서 단일 프런티어 모델 대비 완료 작업 비용을 측정하고, 한 선택의 표시 가격이 아니라 재시도와 검토 노력을 지켜보는 것입니다.
Auto와의 비교는 계속 기억할 가치가 있습니다. Auto는 어떤 모델이 프롬프트에 가장 적합한지에 대한 질문에 답합니다. HydraFusion은 한 턴에 얼마나 많은 프로세스가 필요한지에 대한 질문에 답하며, 프로세스는 항상 소프트웨어 작업에서 비싼 부분이었습니다.
흥미로운 부작용은 모델 선택을 덜 감정적으로 만든다는 점입니다. 개발자들은 특정 모델에 애착을 가지며, 그 애착은 대개 몇 번의 기억에 남는 성공에 기반해 형성됩니다. 작업 유형별로 라우팅하고 실패 시 에스컬레이션하는 시스템은 어떤 단일 모델도 모든 범주에서 이기지 못한다는 사실을 조용히 인정합니다. 이는 오래전부터 사실이었지만 좀처럼 실행에 옮겨지지 않았습니다.
에디터의 다음 영역은 이를 위해 만들어지고 있다
Insiders 빌드는 다음 행보를 이미 보여줍니다. Run Multiple Agents라는 레이블이 붙은 Compare Agents 기능은 하나의 프롬프트를 여러 에이전트에 병렬로 보내며, 각 에이전트는 자체 git worktree에서 실행됩니다. 그런 다음 심판 에이전트가 승자를 고르거나 후보 목록을 사람에게 넘깁니다.
흥미로운 세부 사항은 심판이 무엇을 보는지입니다. 변경된 파일과 diff 통계, 테스트 결과, 빌드 상태, 진단, 타이밍, 아키텍처 차이를 비교합니다. 테스트 스위트를 실행합니다. 또 다른 언어 모델에게 코드를 읽고 추측하게 하지 않습니다. 이는 큰 결과를 낳는 작은 결정입니다. 비교가 모델의 의견이 아니라 프로젝트의 실제 상태에 근거하기 때문입니다.
같은 릴리스의 나머지는 에이전트가 병렬로 실행된 뒤에야 중요해지는 더 조용한 인프라입니다. Multi-folder sessions를 사용하면 한 세션의 각 대화가 자체 폴더나 worktree를 사용할 수 있어 변경 사항이 충돌하지 않습니다. Remote delegation은 연결된 원격 에이전트 호스트에 작업을 넘깁니다. Shared worktree folders는 무시된 디렉터리를 재사용해 모든 브랜치에서 의존성을 다시 설치하지 않도록 합니다. Dev Containers는 이제 5분간 유휴 상태이면 중지되고 요청 시 다시 시작됩니다.
거버넌스는 기능과 같은 커밋으로 계속 도착한다
릴리스의 IT 대상 절반은 나중에 덧붙인 것이 아닙니다. AI 기능을 사용할 수 없을 때 에디터는 이제 일반적인 업데이트 안내 대신 최소 요구 버전을 명시합니다. 관리자는 Auto 모델의 기본 티어를 설정할 수 있습니다. 새로운 OpenTelemetry 설정은 Copilot 사용량을 개별 개발자에게 다시 매핑합니다.
이 세 가지를 함께 읽으면 윤곽이 분명해집니다. 여러 턴에 걸쳐 여러 모델을 조정하는 플랫폼은 단일 모델 자동완성이 결코 만들지 않았던 비용, 텔레메트리, 권한 문제를 발생시킵니다. 비용 귀속은 재무팀의 흥미거리에서 그치는 것이 아니라 이 기능을 프로덕션 근처에도 들이기 위한 전제 조건이 됩니다.
다중 모델 검토는 신중한 엔지니어링 팀 사이에서 한동안 표준 관행이었습니다. 한 모델에게 작성을 요청하고 다른 모델에게 실수를 찾게 하거나, 빠른 모델을 먼저 시도하고 결과가 아쉬우면 에스컬레이션합니다. HydraFusion은 그 습관을 가져와 자동화합니다. 이는 편리하며, 일부 팀이 직접 내리기를 좋아했던 결정을 없애기도 합니다.
프리뷰 기능이 얼마나 오래 프리뷰로 남아야 하는지는 타당한 질문입니다. 도구는 그 주변의 정책보다 빠르게 도입되고 있으며, 가격 예측 가능성이 첫 번째 희생물입니다. 대규모 저장소에서 조용히 두 개의 프런티어 모델을 호출하는 Critique 실행은 누구도 알아차리기 전에 실제 돈을 쓸 수 있습니다. HydraFusion이 기본값으로 승격될지 여부는 라우팅이 작동하는지보다 GitHub가 청구서를 누군가 서명할 수 있을 만큼 읽기 쉽게 만들 수 있는지에 더 달려 있습니다.
관련 글
AI 비디오 도구, 사용 편의성은 10점 만점에 9점. 컴플라이언스 점수는 다른 이야기다.
사용자들은 AI 비디오 생성기를 좋아한다. 법무팀은 아직 검토 요청을 받지 않았다.
InternLumina-U2, 텍스트·이미지·비디오·3D를 단일 16B 모델에 담고 두 세트의 가중치를 공개하다
작업 목록은 야심 차다. 공개 형식이 더 많은 신호를 담고 있다.
HappyOyster는 보는 클립이 아니라 걸어 들어갈 수 있는 세계를 판다
대부분의 비디오 모델은 파일 하나를 건네줍니다. 이 모델은 문이 있는 방을 건네줍니다.
Luma Ray3 Modify, 연기는 그대로 두고 주변 세계를 다시 협상하다
AI 영상 편집에서 가장 어려운 문제는 효과가 아니다. 이미 비용을 치른 테이크를 망가뜨리지 않는 일이다.