2026-02-24

이 벤치마크는 최첨단 AI 모델이 극한의 장문 컨텍스트 압박(10만 토큰 이상) 하에서 현실적인 비코딩 워크플로우에서 올바른 다음 단계 오케스트레이션 결정을 얼마나 잘 내리는지 측정합니다. 각 모델은 정확성(시나리오 정답률 %), 평균 지연 시간, **평균 추론 비용(입력 + 출력 토큰)**의 세 가지 차원에서 평가됩니다.
주요 결과: **Claude 4.5 Opus(76%)**와 **Gemini 3.1 Pro Preview(74%)**가 벤치마크를 주도합니다. 더 넓게 보면, Claude와 Gemini 모델 제품군이 리더보드 상단을 장악하고 있으며, 이는 강력한 지시 사항 준수 및 에이전트 능력에 대한 일반적인 LLM 커뮤니티의 평가와 일치합니다. 상위와 하위 성능 모델 간의 격차는 거의 2배에 달하며, 이는 기존 벤치마크가 포착하지 못하는 차별점을 드러냅니다.
AI 산업은 벤치마킹에 막대한 투자를 해왔습니다. SWE-bench Verified는 실제 GitHub 리포지토리의 버그 수정을 평가합니다. GAIA는 다중 도구 질의응답을 테스트합니다. AgentBench는 8개의 상호작용 환경에서 에이전트를 스트레스 테스트합니다. WebArena는 웹 탐색을 측정합니다. τ-bench는 고객 서비스 시나리오에서 도구 호출을 평가합니다. 이러한 벤치마크들은 에이전트 능력을 발전시키는 데 중요한 역할을 해왔습니다.
하지만 한 가지 패턴이 있습니다. 이러한 평가의 대부분은 코딩 중심의 작업이나 단문에서 중문 컨텍스트 상호작용에 초점을 맞추고 있습니다. SWE-bench는 Python 리포지토리의 코드 수정을 측정합니다. WebArena는 시뮬레이션된 사이트에서의 탐색을 테스트합니다. τ-bench는 좁은 서비스 대화 내에서 도구 호출을 평가합니다. 그룹 중 가장 광범위한 GAIA조차도 주로 에이전트가 올바른 최종 답변에 도달할 수 있는지를 테스트할 뿐, 극한의 컨텍스트 압박 하에서 올바른 오케스트레이션 결정을 내릴 수 있는지는 테스트하지 않습니다.
실제 운영되는 에이전트 시스템에서 가장 어려운 문제는 질문에 답하거나 버그를 수정하는 것이 아닙니다. 그것은 다음에 무엇을 할지 결정하는 것입니다. 12단계 워크플로우의 7단계에서, 150,000 토큰의 누적된 상태와 함께, 올바른 조치가 시스템 프롬프트의 지시, 이전 단계의 결과, 사용자의 원래 의도, 그리고 현재 진행 상황을 종합해야 할 때 말입니다.
기존 벤치마크는 이 능력을 분리하여 측정하지 않습니다. Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크는 바로 그 일을 합니다.
각 시나리오는 단 하나의 질문에 답합니다:
100,000 토큰 이상의 컨텍스트를 가진 워크플로우 오케스트레이터 역할을 맡았을 때, 모델이 일관되게 올바른 다음 단계 결정을 내릴 수 있는가?
각 시나리오는 모델에게 진행 중인 워크플로우의 현실적이고 고정된 스냅샷을 제시합니다. 입력에는 대화 기록, 이전 워크플로우 단계에서 누적된 결과, 사용자의 현재 요청, 도메인별 지침이 포함될 수 있습니다. 모델은 이 밀도 높은 상태를 분석하고 워크플로우를 완료로 이끌기 위한 단 하나의 올바른 다음 조치를 결정해야 합니다.
이것들은 합성된 추론 퍼즐이 아닙니다. 시나리오는 연구, 생산성, 커뮤니케이션, 문서 생성, 일정 관리, 데이터 분석, 다중 애플리케이션 조정 등 실제 세계의 비코딩 워크플로우에서 가져온 것으로, 일상적인 에이전트 유용성을 정의하지만 벤치마킹 환경에서는 거의 다루어지지 않았던 종류의 작업들입니다.
벤치마크는 31개의 시나리오(계속 추가 중)로 구성되며, 각 시나리오는 잠재적인 단일 단계 또는 다단계 워크플로우 내의 단일 중요 결정 지점을 나타냅니다. 각 시나리오는 모델에게 다음을 요구합니다:
시나리오의 다양성은 의도적입니다. 모델이 좁은 작업 유형에 과적합되는 대신 오케스트레이션 능력을 일반화할 수 있는지 테스트하기 위해 광범위한 도메인과 복잡성 수준을 포괄합니다.
모든 모델은 해당 모델에 대해 가장 낮은 추론/사고 설정과 온도 0으로 실행됩니다. 이는 결정론, 속도, 비용 효율성이 창의적인 탐색보다 더 중요한 실제 에이전트 오케스트레이션 환경을 반영합니다. 목표는 무제한의 컴퓨팅이 주어졌을 때 '더 열심히 생각하는' 능력이 아니라 모델의 기본 지시 사항 준수 및 의사 결정 능력을 평가하는 것입니다.
기존의 에이전트 벤치마크는 소프트웨어 엔지니어링에 크게 치우쳐 있습니다. SWE-bench Verified는 실제 리포지토리의 버그 수정을 평가합니다. Terminal-Bench는 DevOps 및 시스템 관리를 테스트합니다. τ-bench와 같은 더 넓은 벤치마크조차도 고객 서비스 시나리오 내의 좁은 도구 호출 패턴에 중점을 둡니다.
이 벤치마크는 전문가, 연구원, 소비자가 실제로 AI 에이전트에게 처리하도록 요구하는 다단계 작업인 범용적인 일상 워크플로우를 대상으로 합니다. 연구 종합, 이메일 조정, 캘린더 관리, 문서 생성, 다중 플랫폼 정보 수집. 이러한 워크플로우는 실제 에이전트 유용성을 정의하며 체계적으로 과소평가되어 왔습니다.
이것은 우연히 장문 컨텍스트를 사용하는 벤치마크가 아닙니다. 장문 컨텍스트가 핵심입니다. 모든 시나리오는 100,000 토큰의 입력을 초과하도록 설계되어 모델이 일관성을 유지하고, 상태를 추적하며, 밀도 높은 정보 환경에서 관련 신호를 추출하도록 강제합니다.
단문 컨텍스트 벤치마크에서 좋은 성능을 보이는 많은 모델들이 장문 컨텍스트 압박 하에서는 성능이 크게 저하됩니다. 최근 LLM 에이전트 평가에 대한 설문조사에서 언급된 바와 같이, 단문 컨텍스트와 장문 컨텍스트 성능 간의 격차는 모델 능력의 가장 측정되지 않은 차원 중 하나로 남아 있습니다. 이 벤치마크는 그 격차를 직접적으로 드러냅니다.
이 벤치마크에 사용된 오케스트레이션 로직, 액션 분류 체계, 워크플로우 구조는 전적으로 Jenova.ai의 독점 자산입니다. 테스트되는 특정 의사 결정 패턴을 설명하는 공개 데이터셋, 오픈 소스 프레임워크 또는 출판된 논문이 없습니다.
데이터 오염은 인기 있는 벤치마크 전반에 걸쳐 잘 문서화된 우려 사항입니다. 모델이 훈련 중에 테스트 질문이나 유사한 변형을 보았을 수 있으며, 이는 점수를 부풀릴 수 있습니다. 스탠포드 AI 인덱스 보고서 2025는 특히 오염을 벤치마크 유효성에 대한 지속적인 과제로 강조합니다.
우리의 오케스트레이션 로직과 프롬프트 구조는 독점적이며 공개 웹에 존재하지 않기 때문에, 공개적으로 사용 가능한 데이터셋을 기반으로 구축된 벤치마크에 비해 오염 가능성이 극히 낮습니다. 비공개 가중치 모델을 포함하는 모든 평가와 마찬가지로 사전 훈련 데이터에 대해 절대적인 보장을 할 수는 없지만, 설계상 이 위험을 최소화합니다.
학술 벤치마크는 일반적으로 정확성만을 최적화합니다. 실제 운영되는 에이전트 시스템에서는 정확성이 필요하지만 충분하지 않습니다. 모델이 얼마나 빠르고 저렴하게 올바른 결정을 내릴 수 있는지도 알아야 합니다. Pluralsight의 2026년 모델 비교가 SWE-bench를 통해 보여주었듯이, 14배의 비용으로 더 높은 점수를 받은 모델이 오류 허용 범위와 처리량에 따라 더 나쁜 운영 선택이 될 수 있습니다. 이 벤치마크는 세 가지 차원을 모두 보고합니다. 왜냐하면 최적의 오케스트레이션 모델은 특정 사용 사례에 대한 정확성-비용-속도 비율에 따라 달라지기 때문입니다.
결과를 바탕으로 세 가지 뚜렷한 성능 등급을 관찰할 수 있습니다:
1등급: 강력한 오케스트레이터 (65% 이상)
| 모델 | 정확도 | 평균 속도 | 평균 비용 |
|---|---|---|---|
| Claude 4.5 Opus | 76% | 4.1초 | $0.35 |
| Gemini 3.1 Pro Preview | 74% | 32.9초 | $0.13 |
| Gemini 3 Pro Preview | 66% | 8.8초 | $0.12 |
| Gemini 3 Flash Preview | 66% | 5.3초 | $0.03 |
| Claude Opus 4.6 | 65% | 4.8초 | $0.35 |
| Claude Sonnet 4.5 | 65% | 4.2초 | $0.21 |
Claude와 Gemini 모델 제품군이 명확하게 선두를 달리고 있습니다. 이는 그들의 지시 사항 준수 및 에이전트 능력에 대한 광범위한 LLM 커뮤니티의 공감대와 일치하는 결과입니다. 특히, Gemini 3 Flash Preview는 Claude Opus 4.6과 동일한 66%의 정확도를 보이면서 비용은 $0.03 대 $0.35로 — 동등한 성능에 12배의 비용 차이를 보여, 이 벤치마크에서 가장 효율적인 오케스트레이터라고 할 수 있습니다.
2등급: 유능하지만 일관성 부족 (55–64%)
| 모델 | 정확도 | 평균 속도 | 평균 비용 |
|---|---|---|---|
| DeepSeek V3.2 | 61% | 9.4초 | $0.02 |
| Claude Sonnet 4.6 | 58% | 4.8초 | $0.21 |
이 등급의 모델들은 신뢰할 만한 성능을 보이지만 장문 컨텍스트 압박 하에서 더 많은 일관성 부족을 보입니다. Claude Sonnet 4.6의 58%는 4.5 버전(65%)에 비해 눈에 띄는 하락이며, 이는 모델 세대 업그레이드가 항상 오케스트레이션 개선으로 이어지지는 않음을 시사합니다.
3등급: 55% 미만
| 모델 | 정확도 | 평균 속도 | 평균 비용 |
|---|---|---|---|
| MiniMax M2.5 | 50% | 20.5초 | $0.02 |
| GPT-5.2 | 48% | 2.5초 | $0.10 |
| Grok 4.1 Fast | 47% | 6.7초 | $0.01 |
| Kimi K2.5 | 47% | 12.1초 | $0.01 |
| GLM 5 | 44% | 28.2초 | $0.02 |
몇 가지 관찰 사항:
GPT-5.2의 48%는 주목할 만한 결과입니다. 벤치마크에서 가장 빠른 모델(2.5초)이지만 가장 정확도가 낮은 모델 중 하나입니다. 이는 "최소 추론 설정" 제약과 직접적으로 관련이 있습니다. GPT 계열 모델은 추론 집약적인 구성에 크게 최적화되어 있으며, 확장된 추론이 제거되면 장문 컨텍스트 압박 하에서의 기본 지시 사항 준수 능력이 크게 떨어집니다. 이는 근본적인 약점을 나타내는 것이 아니라, 다른 모델 제품군이 같은 정도로 공유하지 않는 추론 컴퓨팅에 대한 아키텍처적 의존성을 보여줍니다.
주요 중국 오픈 소스 모델들 — Kimi K2.5(47%), GLM 5(44%), MiniMax M2.5(50%) — 은 이 벤치마크에서 상대적으로 약한 성능을 보입니다. 한 가지 가능한 기여 요인은 훈련 할당입니다. 서구 경쟁 모델보다 더 빠듯한 컴퓨팅 예산 하에서 개발되는 이 모델들은, 시장 포지셔닝에 필수적인 경쟁력 있는 성능을 위해 기존의 가시성 높은 벤치마크 카테고리(추론, 코딩, 지식)에 훈련 용량을 합리적으로 우선순위를 둘 수 있습니다. 최적화할 기존 공개 벤치마크가 없는 장문 컨텍스트 오케스트레이션 일반화 능력은 결과적으로 덜 집중적인 초점을 받을 수 있습니다. 이는 근본적인 한계가 아닌 합리적인 우선순위 설정이며, 오케스트레이션 관련 평가가 더 확립됨에 따라 이 격차가 좁혀질 것으로 예상합니다.
1. 주요 모델 간 오케스트레이션 능력의 상당한 편차.
최고 성능 모델과 최저 성능 모델 간의 격차는 거의 2배(76% 대 44%)입니다. MMLU, GPQA 또는 LMArena와 같은 기존 벤치마크에서 이들 모델 중 다수가 서로 몇 퍼센트 포인트 내에서 점수를 받는다는 점을 고려하면 이는 주목할 만합니다. 장문 컨텍스트 에이전트 오케스트레이션은 기존 벤치마크가 포착하지 못하는 차별점을 드러냅니다.
2. 정확성, 속도, 비용은 예상과 다르게 상관관계가 없습니다.
가장 비싼 모델이 가장 정확하지는 않습니다(Claude Opus 4.6은 $0.35에 65% 점수, 같은 가격의 Claude 4.5 Opus는 76% 점수). 가장 빠른 모델(GPT-5.2, 2.5초)은 가장 정확도가 낮은 모델 중 하나입니다(48%). 가장 저렴한 모델들은 전체 정확도 범위를 아우릅니다 — Grok 4.1 Fast의 47%($0.01)에서 Gemini 3 Flash Preview의 66%($0.03)까지. 이는 세 가지 차원을 함께 평가하는 것의 중요성을 강화하며, 이는 에이전트 평가에서 모범 사례로 부상하고 있는 비용-성능 파레토 분석과 일치하는 발견입니다.
3. 장문 컨텍스트 압박 하에서의 지시 사항 준수가 차별점입니다.
대부분의 모델이 틀리는 시나리오는 공통된 패턴을 공유하는 경향이 있습니다. 올바른 조치는 모델이 더 '명백'하거나 '기본'적인 조치보다 컨텍스트 깊숙이 묻혀 있는 특정 지시 사항을 우선시하도록 요구합니다. 이 벤치마크에서 뛰어난 성능을 보이는 모델들은 관련 지시 사항이 수만 개의 경쟁 정보 토큰으로 둘러싸여 있을 때에도 지시 사항 충실도를 유지하는 우수한 능력을 보여줍니다. 이는 GAIA의 평가 프레임워크의 발견과 일치하며, 광범위한 계획과 다중 도구 통합을 요구하는 가장 까다로운 작업이 에이전트 능력의 진정한 시험장으로 남아 있습니다.
4. 최소 추론 설정은 기본 능력 격차를 드러냅니다.
모든 모델은 가장 낮은 추론 설정에서 평가되었습니다. 높은 추론 모드에서 강력한 성능으로 알려진 일부 모델들은 여기서 놀라울 정도로 약한 결과를 보였습니다. 우리는 특정 모델 제품군이 신뢰성을 달성하기 위해 확장된 추론 모드에 상당히 더 의존적이라는 것을 관찰합니다. 지연 시간과 비용 제약이 지배적인 실제 운영 오케스트레이션 환경에서처럼 그 추론 컴퓨팅이 제거되면, 근본적인 지시 사항 준수 능력이 드러납니다. 이것이 GPT-5.2의 저조한 성능의 주된 요인입니다. 그 아키텍처는 추론 집약적인 워크플로우에 크게 최적화되어 있으며, 최소 추론 제약이 불균형적으로 영향을 미칩니다.
| 벤치마크 | 주요 초점 | 컨텍스트 길이 | 도메인 |
|---|---|---|---|
| SWE-bench Verified | 실제 GitHub 리포지토리의 버그 수정 | 중간 | 코딩 |
| GAIA | 다중 도구 질의응답 | 중간 | 일반 |
| AgentBench | 다중 환경 에이전트 행동 | 다양함 | 8개 도메인 |
| WebArena | 웹 탐색 작업 | 단문–중간 | 웹 |
| τ-bench | 서비스 시나리오에서의 도구 사용 | 단문 | 고객 서비스 |
| Jenova 오케스트레이션 벤치마크 | 장문 컨텍스트 하에서의 다음 단계 결정 | 10만+ 토큰 | 비코딩 워크플로우 |
이 벤치마크는 기존 평가와 경쟁하거나 대체하지 않습니다. SWE-bench는 코딩 에이전트의 표준으로 남아 있습니다. GAIA는 일반적인 에이전트 능력의 가장 광범위한 테스트로 남아 있습니다. 이 벤치마크는 다른 계층을 분리합니다: 비코딩 도메인에서 극한의 컨텍스트 압박 하에서의 다음 단계 결정 품질.
우리의 결과는 오케스트레이션 능력이 추론 능력과 구별된다는 것을 시사합니다. 추론 벤치마크에서의 높은 성능이 장문 컨텍스트 오케스트레이션에서의 높은 성능을 보장하지는 않습니다.
에이전트 시스템을 구축하는 개발자들에게 이 분리는 실질적인 결과를 가져옵니다:
우리는 그 아키텍처적 결정에 대한 데이터 포인트를 제공하기 위해 이 결과를 공개합니다. 더 많은 도메인과 워크플로우 패턴을 다루기 위해 시나리오 세트를 확장함에 따라, 우리는 계속해서 이 지표들을 업데이트할 것입니다.
Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크는 Jenova 엔지니어링 팀이 실제 운영 오케스트레이션 환경에서 모델 성능을 평가하기 위해 개발했습니다. 기술적인 문의나 방법론 세부 사항은 [email protected]로 연락 주시기 바랍니다.