최근 Aran Komatsuzaki가 공유한 'cua-speedrun' 자료는 컴퓨터 사용 에이전트들의 속도 격차를 극명하게 보여준다. 동일한 점수를 기록했음에도 Astra와 Kimi K3 사이에는 4.4배의 속도 차이가 발생했다. 이는 LLM 에이전트의 효율성 측정 및 개선이 시급함을 시사한다. 연구는 에이전트 성능 최적화를 위한 새로운 벤치마크의 필요성을 제기한다.
왜 지금LLM 에이전트의 실제 응용 사례가 늘면서 속도와 효율성 측정이 중요해진다.
써먹기vibe-coder는 자체 에이전트 개발 시 이 벤치마크를 활용해 속도 성능을 체계적으로 비교한다.