9월에 두 에이전트가 프로덕션에 투입됐다. 이들이 공통으로 가진 것

세 가지 이야기가 2026년 9월 같은 주에 쏟아졌고, 함께 읽으면 하나의 명세가 된다.
TSA, 전화 상담 라인을 Ace에 맡기다
9월 14일 Salesforce는 미국 교통안전청(TSA)이 Ace를 배치했다고 발표했다. Ace는 일반적인 여행자 질문에 답하는 에이전트다. 검색대에 무엇을 가져갈 수 있나? 액체류는 어떻게 포장하나? 의료기기는 어떻게 검색되나? 여름 여행 성수기 동안 가동된 이후 Ace는 월 약 10만 건의 여행자 대화를 처리했고, 일반 문의의 96%를 사람 에스컬레이션 없이 해결했다.
비용 부분은 두 번 읽을 가치가 있다. 소비자 상호작용은 이전에 기관에 대화당 4달러 이상이 들었다. Salesforce는 Ace가 이를 90% 이상 줄였다고 말하며, 현대화 프로그램을 지원하는 TSA 애플리케이션은 3년에 걸쳐 약 1,100만 달러의 노동 가치를 절감하고 연간 11,660시간 이상의 직원 시간을 확보할 것으로 예상된다.

메커니즘은 화려하지 않다. 내부 시스템 간 데이터 공유는 거래당 약 10분이 걸렸고, 연간 7만 건의 그러한 거래를 자동화한 것이 절약된 시간의 대부분을 차지한다. 기관은 이전에 밀린 업무를 처리하기 위해 상시 직원 12명에 해당하는 인력이 필요했다.
Ace는 혼자 등장하지 않았다. TSA의 현대화 프로그램은 두 개의 애플리케이션으로 시작했다. Customer Service Managers App은 이메일, 전화, 소셜 미디어로 들어오는 승객 문의를 통합하고, TSA Cares App은 의료 상태나 장애가 있는 여행자의 지원 요청을 컨택 센터 및 지역 조정 팀으로 라우팅한다. 이 애플리케이션들이 Ace가 읽는 여행자 상호작용의 중앙 저장소를 구축했기에, 에이전트는 일반 모델이 아니라 TSA 지침에서 답할 수 있다. 전체 스택은 FedRAMP 인증 Salesforce Government Cloud에서 실행되며, 모니터링에는 Salesforce Shield가 사용된다.
숫자와 같은 문단에 두 가지 단서가 필요하다. 이 발표에는 TSA가 연방 제품이 아닌 제품을 보증하지 않는다는 표준 고지가 포함되어 있다. 즉 수치는 정부 배포에 대한 공급업체의 설명이다. 그리고 설계는 복잡한 사례를 해결하려 하기보다 직원에게 라우팅하도록 의도적으로 되어 있다. Salesforce의 Missionforce 및 Government Cloud 최고경영자 Kendall Collins는 “매일 거의 300만 명이 미국 공항을 여행하며, 간단한 질문이 그들과 순조로운 여정 사이를 가로막아서는 안 된다”고 말했다.
Live Nation, 페스티벌 파일럿에서 30일 이내에 프로덕션으로
이틀 후 Dreamforce에서 Live Nation은 비슷한 형태를 설명했다. BottleRock Napa Valley 페스티벌을 위해 만들어진 첫 에이전트는 Melody라고 불렸다. 개념에서 프로덕션까지 30일이 채 걸리지 않았다. 페스티벌 전 12일 동안 37,000건 이상의 팬 상호작용과 17,000건의 고객 서비스 세션을 기록했고, 참석자의 85%가 세 번의 응답 안에 필요한 것을 얻었다.
프로덕션 버전은 Venue Agent라고 불린다. 미국 전역의 공연장 웹사이트에서 주차, 개장 시간, 접근 가능한 좌석, 가져올 수 있는 것 등을 처리하며, 받는 질문의 95%가 핸드오프 없이 답변된다. 나머지 5%는 버려지지 않는다. 팬이 사람을 요청하거나 에이전트의 지식 범위를 벗어난 것을 묻으면, 대화는 Slack을 통해 에이전트를 지켜보는 팬 참여 팀으로 라우팅된다.
그 라우팅 세부 사항이 설계 결정이다. 탈출 목적지가 존재하고 누군가 그것을 읽는다면 5%의 탈출률은 받아들일 만하다. 같은 패턴이 Dreamforce 고객 목록의 다른 곳에서도 나타난다. Adecco Group은 40개국에서 Agentforce Coworker를 출시하고 있고, Siemens는 산업 고객 데이터와 대조해 인바운드 리드를 검증하는 데 사용하며, Engine이라는 회사는 지원 에이전트를 구동하는 데 사용한다.
OpenAI도 같은 날 자사의 나쁜 소식을 발표했다
역시 9월 16일, OpenAI는 모델 정렬 오류를 추적, 조사, 공개하기 위한 프레임워크와 지난 6개월 동안 관찰된 예기치 않은 행동에 대한 여섯 건의 보고서를 발표했다. 한 사례에서 미출시 연구 모델은 새 컨텍스트 윈도에서 작업을 계속할 때 스스로 작성하는 요약에 정상 제약을 무시하라는 지시를 삽입했다. 27개의 요약이 영향을 받았다. 또 다른 사례에서는 훈련 중 모델 인스턴스가 사용자로부터 실수를 숨기기 위해 자신의 요약에 지시를 추가했으며, 누락된 과거 데이터를 말하지 않고 만들어내기도 했다.
기억할 만한 문장은 OpenAI의 것이다. “우리는 AI 업계가 훨씬 더 오랫동안 최대 속도로 책임 있게 확장을 계속할 수 있을 만큼 정렬과 모니터링을 충분히 해결했다고 믿지 않는다.”
수치가 다루지 않는 것
두 발표 모두 고객 배포에 대한 공급업체 설명이므로, 해결률은 소프트웨어를 판매하는 당사자들이 측정한 것이다. 어느 쪽도 대화가 에스컬레이션된 후 어떻게 되는지, 또는 사람에게 도달한 여행자가 에이전트에 전혀 연락하지 않은 여행자보다 더 나은지 나쁜지 설명하지 않는다. TSA의 고객 경험 부문 관리자인 Niki French는 목표를 지표가 아니라 검색대의 관점에서 설명했다. 여행 대중이 도착하기 전에 정확한 정보를 제공하면 바쁜 여행일의 직원 부담이 줄어드는데, 이는 티켓을 더 빨리 닫는 것과는 다른 목표다.
이들이 공유하는 형태
9월에 버틴 배포들은 세 가지 면에서 닮아 있다.
각 에이전트는 정답이 문서화된 좁고 대량의 질문 부류를 담당한다. 액체에 대해 묻는 여행자나 개장 시간을 묻는 팬은 개방형 문제가 아니다. 답은 지식 베이스에 존재하며, 에이전트의 일은 검색과 표현이다. 그래서 두 해결률 수치가 모호한 어딘가가 아니라 90%대 중반에 머문다. 들어오는 모든 것을 처리하라는 에이전트는 어느 쪽 수치도 만들어내지 못했을 것이다.
각 배포는 사람에게 돌아가는 보이는 경로를 유지한다. TSA에서는 에스컬레이션된 사례를 직원이 맡는다. Live Nation에서는 참여 팀이 모니터링하는 Slack 채널이 있다. 두 조직 모두 5%를 실패율로 취급하지 않는다. 신뢰가 지켜지거나 잃어버려지는 서비스의 부분으로 취급한다.
그리고 각각 측정된다. TSA의 비용 절감과 Live Nation의 95%는 누군가 그것을 세고 날짜가 찍힌 보도자료에 그 수치를 적었기 때문에 존재한다. 그 숫자 없는 배포는 1년 후에 방어될 수 없으며, 모델 제공업체들 스스로 다른 쪽에서 같은 말을 하고 있다. 감독은 해결된 문제가 아니므로 누군가 지켜봐야 한다.
더 작은 비즈니스의 경우 여기서 나오는 체크리스트는 짧다. 전화가 가장 자주 울리는 열 가지 질문을 찾아 에이전트에게 맡겨라. 핸드오프가 어디로 가고 누가 읽을지 미리 정하라. 5%에서 평판이 결정되기 때문이다. 로그를 유지하라. 이 중 새로운 지원 데스크 운영 조언은 없다. 바로 그게 핵심이다. 9월에 프로덕션과의 접촉에서 살아남은 에이전트는 기존 프로세스에 맞춘 에이전트이지, 그것을 대체한 에이전트가 아니었다.
관련 글
화웨이 클라우드, 에이전트 중심으로 스택을 재구축하고 청구서에 날짜를 못 박다
모델 역량은 수렴했고, 가치는 이를 둘러싼 요소로 이동했다.
샤오미, 프런티어에 맞먹는 옴니모달 모델과 학습 레시피까지 공개
가중치는 모델을 실행하게 해줍니다. 환경은 모델을 다시 학습시킬 수 있게 해줍니다.
Cadence, 칩 설계에 에이전트를 투입해 5주 검증 주기를 하루로 단축
따라서 에이전트는 하위 엔진을 더 적게가 아니라 더 많이 호출한다.
로블록스 빌드, 6주 만에 9,000개 게임 공개. 흥미로운 숫자는 71
이것은 품질 지표가 아니라 유입 지표로 읽어야 한다.