← 블로그로
Ai약 12 분 읽기

프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.

게시일 2026년 10월 4일
프론티어 에이전트가 연구 워크플로의 30퍼센트를 완료했다. 그 숫자가 핵심이다.

스탠퍼드가 Terminal-Bench-Science 0.1이라는 새 벤치마크를 공개했는데, 그 대표 결과는 에이전트를 둘러싼 마케팅만큼 흥미진진하지는 않다. 이 벤치마크는 전문가가 직접 작성한 연구 워크플로 70개를 프론티어 에이전트에게 제시했다. 가장 우수한 에이전트가 그중 30퍼센트를 완료했다.

기억해야 할 숫자는 30퍼센트다. 이는 실패도 승리도 아니다. 과제를 손수 작성한 사람들이 공개한, 현재 기술이 어디에 서 있는지를 보여주는 정직한 측정치다.

벤치마크가 실제로 테스트하는 것

과제는 도메인 전문가가 작성한 과학 워크플로이며, 에이전트는 터미널에서 실행된다. 이 선택은 중요하다. 터미널은 과제가 실제로 이루어지는 작업 환경이다. 의존성을 실제로 설치하고, 파일을 작성하고, 분석을 실행하고, 출력을 확인해야 한다. 올바른 접근법을 설명하는 데에는 부분 점수가 없다. 명령은 작동하거나, 작동하지 않거나 둘 중 하나다.

이 워크플로는 연구 현장에서 가져온 것으로, 깔끔한 테스트 스위트가 있는 코딩 과제보다 훨씬 지저분한 대상이다. 코딩 벤치마크는 보통 정답이 정해져 있어 자동으로 채점할 수 있다. 연구 작업은 그렇지 않은 경우가 많고, 그래서 이런 벤치마크를 만들려면 저장소에서 과제를 긁어오는 대신 전문가가 직접 작성해야 했다.

왜 30퍼센트가 적절한 기준 틀인가

벤치마크는 통과 아니면 실패로 읽히는 경향이 있다. 코딩 벤치마크에서 90점을 받은 모델은 거의 해결된 것으로 취급된다. 연구 워크플로의 30퍼센트를 완료한 모델도 같은 맥락에서 보면 대부분의 경우 실패한다고 읽힐 수 있다.

그런 해석은 이 숫자가 무엇을 위한 것인지를 놓친다. 손으로 작성한 전문가 과제에서 30퍼센트 완료라는 것은 에이전트가 연구 작업의 일상적인 3분의 1을 처리할 수 있다는 뜻이다. 환경 설정, 기존 파이프라인 실행, 데이터 정리, 표준 출력 생성 같은 일이다. 나머지 70퍼센트는 워크플로에 명시되지 않은 판단이 필요한 부분이거나, 다음에 무엇을 할지 사람이 결정해야 하는 방식으로 단계가 깨지는 부분이다.

이는 유용한 구분이다. 연구실에는 오늘 에이전트를 어디에 투입할지 알려주고, 도구 개발자에게는 격차가 어디에 있는지 알려준다.

터미널이 흥미로운 부분이다

에이전트를 터미널에서 실행하는 것은 작업이 실제로 일어나는 곳에서 시험하겠다는 의도적 선택이다. 연구용 소프트웨어는 대부분 명령줄 소프트웨어다. 채팅 창만 다룰 수 있는 모델은 연구실에 도움이 되지 않는다. 셸 앞에 앉아 문서를 읽고, 툴체인을 설치하고, 빌드가 실패했을 때 복구할 수 있는 모델은 차원이 다른 유용함을 지닌다.

또한 실패 양상이 가장 잘 드러나는 곳이기도 하다. 터미널은 오류를 숨기지 않는다. 명령이 모호한 메시지를 반환하거나 스크립트가 절반만 완료되면, 에이전트는 재시도할지, 접근을 바꿀지, 멈출지 결정해야 한다. 바로 이 결정 지점에서 70퍼센트의 대부분이 사라지며, 이는 깔끔한 테스트 스위트를 갖춘 코딩 벤치마크가 결코 드러내지 못하는 종류의 문제다.

스테인리스 스틸 벤치 위의 실험실 유리기구와 뒤로 흐릿하게 보이는 어두운 화면

코딩 벤치마크와 어떻게 다른가

당연한 비교 대상은 코딩 벤치마크로, 이는 에이전트의 발전을 알리는 표준 수단이 되었다. 코딩 벤치마크는 보통 저장소와 테스트 스위트를 함께 제공하므로 정답이 정의되어 있고 점수가 자동으로 나온다. 그래서 실행 비용이 저렴하고 비교하기 쉬우며, 그런 숫자들이 대화를 지배하는 이유다.

연구 워크플로는 그런 처리를 거부한다. 흔히 단일한 정답 출력이 없고, 결과의 품질은 무엇을 어떻게 측정할지에 대한 판단에 달려 있다. 그래서 이곳의 과제는 저장소에서 긁어온 것이 아니라 전문가가 작성했고, 이 벤치마크가 테스트 통과율이 아니라 완료율을 보고하는 것이다.

그 대가는 범위를 현실성과 맞바꾼 것이다. 코딩 벤치마크는 하루에 수천 번 실행해 정밀한 숫자를 낼 수 있다. 워크플로 벤치마크는 더 느리고 잡음이 많지만, 기술 작업의 상당 부분이 실제로 일어나는 환경을 시험한다. 둘 다 유용하며, 이전에는 그중 하나만 널리 이용 가능했다.

왜 이 숫자를 이런 방식으로 측정하는가

완료율은 투박한 지표이며, 저자들은 의도적으로 이를 선택했다. 워크플로는 끝나거나 끝나지 않거나 둘 중 하나이고, 이는 외부 관찰자가 결과의 품질을 판단하지 않고도 확인할 수 있는 사실이다. 우아함은 점수화되지 않는다. 정확성에 대한 논쟁도 없다. 에이전트는 워크플로가 요구한 출력을 만들어냈거나, 어딘가에서 중단했거나 둘 중 하나다.

그 투박함이 핵심이다. 개방형 연구 과제에서 품질을 점수화하려는 벤치마크는 결국 벤치마크 저자의 취향으로 귀결되기 쉽다. 완료율을 채점함으로써 이 벤치마크는 미묘함을 재현성과 맞바꾼다. 두 연구실이 같은 워크플로를 실행하면 같은 답을 얻으며, 그래서 이 숫자는 인용할 가치가 있다.

그 비용은 거의 끝낸 에이전트와 즉시 실패한 에이전트를 구분하지 못한다는 점이다. 둘 다 실패로 집계된다. 이는 한계이며 향후 버전에서 다룰 수 있겠지만, 모두가 동의하는 거친 숫자가 아무도 믿지 않는 정교한 숫자보다 낫다.

이 결과가 과학 연구에 대해 말하는 것

이 벤치마크는 에이전트가 곧 연구를 수행할 것이라는 요란한 주장에 대한 조용한 답이다. 그것이 보여주는 것은 에이전트가 연구를 운영할 수 있다는 점, 즉 사람이 이미 정리해 둔 절차를 점점 더 많은 일상적 단계에서 실행할 수 있다는 뜻이다. 절차가 알려지지 않아 누군가 새로 만들어내야 하는 부분은 아직 하지 못한다.

이 격차는 사소한 엔지니어링 세부 사항이 아니다. 일상적인 작업은 과학자의 시간에서 큰 비중을 차지하며, 이를 자동화하면 실제로 돈과 시간을 아낀다. 다만 그것은 발견을 만들어내는 부분은 아니다. 이 구분은 앞으로 몇 년간 AI가 과학에 어떤 일을 할지 예측하는 누구에게나 중요하다.

이런 벤치마크를 읽는 법

새로운 벤치마크에는 두 가지 주의 사항이 따른다. 첫째는 버전 번호다. 이는 0.1이며, 저자들이 어떤 과제가 잘 정의되었고 어떤 과제가 모호한지 알게 되면서 과제 세트가 바뀔 것이라는 뜻이다. 서로 다른 버전의 점수는 직접 비교할 수 없다.

둘째는 벤치마크가 저자가 선택한 워크플로를 측정한다는 점이다. 과학 분야에서 뽑은 70개 과제는 표본이지 전수 조사가 아니다. 30퍼센트라는 수치는 연구 작업에 대한 에이전트 역량의 대략적인 형태를 보여주는 좋은 신호다. 다음 개정에서도 살아남을 정밀한 숫자는 아니다.

지켜볼 것

지켜봐야 할 발전은 대표 퍼센트가 올라가는 것이 아니다. 어떤 과제가 통과되기 시작하는지다. 에이전트가 다단계 복구가 필요한 워크플로를 통과하기 시작한다면 그것이 진짜 진보다. 향상이 더 쉬운 환경 설정과 데이터 정리 과제에서만 나온다면, 한계는 대표 수치가 시사하는 것보다 낮다.

낮은 숫자를 정직하게 보고하는 벤치마크는 사람들이 재현할 수 없는 높은 숫자를 보고하는 벤치마크보다 유용하다. 이 벤치마크는 전자를 하고 있으며, 이 분야에는 그런 것이 더 필요하다.

관련 글