Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크 (2026년 2월)


2026-02-24


Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크 — 31개 시나리오에 걸친 결과로, 주요 AI 모델의 정확성, 속도, 비용을 보여줍니다.

개요

이 벤치마크는 최첨단 AI 모델이 극한의 장문 컨텍스트 압박(10만 토큰 이상) 하에서 현실적인 비코딩 워크플로우에서 올바른 다음 단계 오케스트레이션 결정을 얼마나 잘 내리는지 측정합니다. 각 모델은 정확성(시나리오 정답률 %), 평균 지연 시간, **평균 추론 비용(입력 + 출력 토큰)**의 세 가지 차원에서 평가됩니다.

주요 결과: **Claude 4.5 Opus(76%)**와 **Gemini 3.1 Pro Preview(74%)**가 벤치마크를 주도합니다. 더 넓게 보면, Claude와 Gemini 모델 제품군이 리더보드 상단을 장악하고 있으며, 이는 강력한 지시 사항 준수 및 에이전트 능력에 대한 일반적인 LLM 커뮤니티의 평가와 일치합니다. 상위와 하위 성능 모델 간의 격차는 거의 2배에 달하며, 이는 기존 벤치마크가 포착하지 못하는 차별점을 드러냅니다.


이 벤치마크가 필요한 이유

AI 산업은 벤치마킹에 막대한 투자를 해왔습니다. SWE-bench Verified는 실제 GitHub 리포지토리의 버그 수정을 평가합니다. GAIA는 다중 도구 질의응답을 테스트합니다. AgentBench는 8개의 상호작용 환경에서 에이전트를 스트레스 테스트합니다. WebArena는 웹 탐색을 측정합니다. τ-bench는 고객 서비스 시나리오에서 도구 호출을 평가합니다. 이러한 벤치마크들은 에이전트 능력을 발전시키는 데 중요한 역할을 해왔습니다.

하지만 한 가지 패턴이 있습니다. 이러한 평가의 대부분은 코딩 중심의 작업이나 단문에서 중문 컨텍스트 상호작용에 초점을 맞추고 있습니다. SWE-bench는 Python 리포지토리의 코드 수정을 측정합니다. WebArena는 시뮬레이션된 사이트에서의 탐색을 테스트합니다. τ-bench는 좁은 서비스 대화 내에서 도구 호출을 평가합니다. 그룹 중 가장 광범위한 GAIA조차도 주로 에이전트가 올바른 최종 답변에 도달할 수 있는지를 테스트할 뿐, 극한의 컨텍스트 압박 하에서 올바른 오케스트레이션 결정을 내릴 수 있는지는 테스트하지 않습니다.

실제 운영되는 에이전트 시스템에서 가장 어려운 문제는 질문에 답하거나 버그를 수정하는 것이 아닙니다. 그것은 다음에 무엇을 할지 결정하는 것입니다. 12단계 워크플로우의 7단계에서, 150,000 토큰의 누적된 상태와 함께, 올바른 조치가 시스템 프롬프트의 지시, 이전 단계의 결과, 사용자의 원래 의도, 그리고 현재 진행 상황을 종합해야 할 때 말입니다.

기존 벤치마크는 이 능력을 분리하여 측정하지 않습니다. Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크는 바로 그 일을 합니다.


이 벤치마크가 측정하는 것

각 시나리오는 단 하나의 질문에 답합니다:

100,000 토큰 이상의 컨텍스트를 가진 워크플로우 오케스트레이터 역할을 맡았을 때, 모델이 일관되게 올바른 다음 단계 결정을 내릴 수 있는가?

각 시나리오는 모델에게 진행 중인 워크플로우의 현실적이고 고정된 스냅샷을 제시합니다. 입력에는 대화 기록, 이전 워크플로우 단계에서 누적된 결과, 사용자의 현재 요청, 도메인별 지침이 포함될 수 있습니다. 모델은 이 밀도 높은 상태를 분석하고 워크플로우를 완료로 이끌기 위한 단 하나의 올바른 다음 조치를 결정해야 합니다.

이것들은 합성된 추론 퍼즐이 아닙니다. 시나리오는 연구, 생산성, 커뮤니케이션, 문서 생성, 일정 관리, 데이터 분석, 다중 애플리케이션 조정 등 실제 세계의 비코딩 워크플로우에서 가져온 것으로, 일상적인 에이전트 유용성을 정의하지만 벤치마킹 환경에서는 거의 다루어지지 않았던 종류의 작업들입니다.


벤치마크 설계

시나리오

벤치마크는 31개의 시나리오(계속 추가 중)로 구성되며, 각 시나리오는 잠재적인 단일 단계 또는 다단계 워크플로우 내의 단일 중요 결정 지점을 나타냅니다. 각 시나리오는 모델에게 다음을 요구합니다:

  1. 장문 컨텍스트 상태 파싱 — 종종 100,000 토큰을 초과하며, 대화 기록, 누적된 워크플로우 결과, 업로드된 파일, 사용자 선호도, 시스템 수준 지침을 포함합니다.
  2. 사용자 의도 이해 — 대화의 전체 맥락과 이전에 취해진 모든 조치 내에서 사용자의 의도를 파악합니다.
  3. 올바른 다음 조치 결정 — 제공된 오케스트레이션 지침에 따라 전체 워크플로우를 올바르게 진행시키는 단 하나의 결정을 내립니다.

시나리오의 다양성은 의도적입니다. 모델이 좁은 작업 유형에 과적합되는 대신 오케스트레이션 능력을 일반화할 수 있는지 테스트하기 위해 광범위한 도메인과 복잡성 수준을 포괄합니다.

평가 기준

  • 이진 채점. 각 시나리오는 정답 또는 오답으로 채점됩니다. 부분 점수는 없습니다.
  • 여러 유효한 조치. 하나 이상의 조치가 합리적으로 정답으로 간주될 수 있는 경우, 모든 유효한 옵션이 사전에 정의되고 인정됩니다.
  • 세 가지 차원. 각 모델은 다음을 기준으로 평가됩니다:
    • 정확성 — 모델이 올바른 다음 단계 결정을 선택한 시나리오의 백분율
    • 속도 — 모든 시나리오에 걸친 평균 처리 시간
    • 비용 — 시나리오당 평균 추론 비용(입력 + 출력 토큰), 모든 단일 결정에 대해 10만 토큰 이상의 컨텍스트를 처리하는 경제적 현실을 반영

모델 구성

모든 모델은 해당 모델에 대해 가장 낮은 추론/사고 설정온도 0으로 실행됩니다. 이는 결정론, 속도, 비용 효율성이 창의적인 탐색보다 더 중요한 실제 에이전트 오케스트레이션 환경을 반영합니다. 목표는 무제한의 컴퓨팅이 주어졌을 때 '더 열심히 생각하는' 능력이 아니라 모델의 기본 지시 사항 준수 및 의사 결정 능력을 평가하는 것입니다.


이 벤치마크가 다른 점

1. 비코딩 에이전트 평가

기존의 에이전트 벤치마크는 소프트웨어 엔지니어링에 크게 치우쳐 있습니다. SWE-bench Verified는 실제 리포지토리의 버그 수정을 평가합니다. Terminal-Bench는 DevOps 및 시스템 관리를 테스트합니다. τ-bench와 같은 더 넓은 벤치마크조차도 고객 서비스 시나리오 내의 좁은 도구 호출 패턴에 중점을 둡니다.

이 벤치마크는 전문가, 연구원, 소비자가 실제로 AI 에이전트에게 처리하도록 요구하는 다단계 작업인 범용적인 일상 워크플로우를 대상으로 합니다. 연구 종합, 이메일 조정, 캘린더 관리, 문서 생성, 다중 플랫폼 정보 수집. 이러한 워크플로우는 실제 에이전트 유용성을 정의하며 체계적으로 과소평가되어 왔습니다.

2. 장문 컨텍스트 스트레스 테스트

이것은 우연히 장문 컨텍스트를 사용하는 벤치마크가 아닙니다. 장문 컨텍스트가 핵심입니다. 모든 시나리오는 100,000 토큰의 입력을 초과하도록 설계되어 모델이 일관성을 유지하고, 상태를 추적하며, 밀도 높은 정보 환경에서 관련 신호를 추출하도록 강제합니다.

단문 컨텍스트 벤치마크에서 좋은 성능을 보이는 많은 모델들이 장문 컨텍스트 압박 하에서는 성능이 크게 저하됩니다. 최근 LLM 에이전트 평가에 대한 설문조사에서 언급된 바와 같이, 단문 컨텍스트와 장문 컨텍스트 성능 간의 격차는 모델 능력의 가장 측정되지 않은 차원 중 하나로 남아 있습니다. 이 벤치마크는 그 격차를 직접적으로 드러냅니다.

3. 오염 위험 최소화

이 벤치마크에 사용된 오케스트레이션 로직, 액션 분류 체계, 워크플로우 구조는 전적으로 Jenova.ai의 독점 자산입니다. 테스트되는 특정 의사 결정 패턴을 설명하는 공개 데이터셋, 오픈 소스 프레임워크 또는 출판된 논문이 없습니다.

데이터 오염은 인기 있는 벤치마크 전반에 걸쳐 잘 문서화된 우려 사항입니다. 모델이 훈련 중에 테스트 질문이나 유사한 변형을 보았을 수 있으며, 이는 점수를 부풀릴 수 있습니다. 스탠포드 AI 인덱스 보고서 2025는 특히 오염을 벤치마크 유효성에 대한 지속적인 과제로 강조합니다.

우리의 오케스트레이션 로직과 프롬프트 구조는 독점적이며 공개 웹에 존재하지 않기 때문에, 공개적으로 사용 가능한 데이터셋을 기반으로 구축된 벤치마크에 비해 오염 가능성이 극히 낮습니다. 비공개 가중치 모델을 포함하는 모든 평가와 마찬가지로 사전 훈련 데이터에 대해 절대적인 보장을 할 수는 없지만, 설계상 이 위험을 최소화합니다.

4. 실제 운영 관련 지표

학술 벤치마크는 일반적으로 정확성만을 최적화합니다. 실제 운영되는 에이전트 시스템에서는 정확성이 필요하지만 충분하지 않습니다. 모델이 얼마나 빠르고 저렴하게 올바른 결정을 내릴 수 있는지도 알아야 합니다. Pluralsight의 2026년 모델 비교가 SWE-bench를 통해 보여주었듯이, 14배의 비용으로 더 높은 점수를 받은 모델이 오류 허용 범위와 처리량에 따라 더 나쁜 운영 선택이 될 수 있습니다. 이 벤치마크는 세 가지 차원을 모두 보고합니다. 왜냐하면 최적의 오케스트레이션 모델은 특정 사용 사례에 대한 정확성-비용-속도 비율에 따라 달라지기 때문입니다.


결과 및 분석

성능 등급

결과를 바탕으로 세 가지 뚜렷한 성능 등급을 관찰할 수 있습니다:

1등급: 강력한 오케스트레이터 (65% 이상)

모델정확도평균 속도평균 비용
Claude 4.5 Opus76%4.1초$0.35
Gemini 3.1 Pro Preview74%32.9초$0.13
Gemini 3 Pro Preview66%8.8초$0.12
Gemini 3 Flash Preview66%5.3초$0.03
Claude Opus 4.665%4.8초$0.35
Claude Sonnet 4.565%4.2초$0.21

Claude와 Gemini 모델 제품군이 명확하게 선두를 달리고 있습니다. 이는 그들의 지시 사항 준수 및 에이전트 능력에 대한 광범위한 LLM 커뮤니티의 공감대와 일치하는 결과입니다. 특히, Gemini 3 Flash Preview는 Claude Opus 4.6과 동일한 66%의 정확도를 보이면서 비용은 $0.03 대 $0.35로 — 동등한 성능에 12배의 비용 차이를 보여, 이 벤치마크에서 가장 효율적인 오케스트레이터라고 할 수 있습니다.

2등급: 유능하지만 일관성 부족 (55–64%)

모델정확도평균 속도평균 비용
DeepSeek V3.261%9.4초$0.02
Claude Sonnet 4.658%4.8초$0.21

이 등급의 모델들은 신뢰할 만한 성능을 보이지만 장문 컨텍스트 압박 하에서 더 많은 일관성 부족을 보입니다. Claude Sonnet 4.6의 58%는 4.5 버전(65%)에 비해 눈에 띄는 하락이며, 이는 모델 세대 업그레이드가 항상 오케스트레이션 개선으로 이어지지는 않음을 시사합니다.

3등급: 55% 미만

모델정확도평균 속도평균 비용
MiniMax M2.550%20.5초$0.02
GPT-5.248%2.5초$0.10
Grok 4.1 Fast47%6.7초$0.01
Kimi K2.547%12.1초$0.01
GLM 544%28.2초$0.02

몇 가지 관찰 사항:

  • GPT-5.2의 48%는 주목할 만한 결과입니다. 벤치마크에서 가장 빠른 모델(2.5초)이지만 가장 정확도가 낮은 모델 중 하나입니다. 이는 "최소 추론 설정" 제약과 직접적으로 관련이 있습니다. GPT 계열 모델은 추론 집약적인 구성에 크게 최적화되어 있으며, 확장된 추론이 제거되면 장문 컨텍스트 압박 하에서의 기본 지시 사항 준수 능력이 크게 떨어집니다. 이는 근본적인 약점을 나타내는 것이 아니라, 다른 모델 제품군이 같은 정도로 공유하지 않는 추론 컴퓨팅에 대한 아키텍처적 의존성을 보여줍니다.

  • 주요 중국 오픈 소스 모델들 — Kimi K2.5(47%), GLM 5(44%), MiniMax M2.5(50%) — 은 이 벤치마크에서 상대적으로 약한 성능을 보입니다. 한 가지 가능한 기여 요인은 훈련 할당입니다. 서구 경쟁 모델보다 더 빠듯한 컴퓨팅 예산 하에서 개발되는 이 모델들은, 시장 포지셔닝에 필수적인 경쟁력 있는 성능을 위해 기존의 가시성 높은 벤치마크 카테고리(추론, 코딩, 지식)에 훈련 용량을 합리적으로 우선순위를 둘 수 있습니다. 최적화할 기존 공개 벤치마크가 없는 장문 컨텍스트 오케스트레이션 일반화 능력은 결과적으로 덜 집중적인 초점을 받을 수 있습니다. 이는 근본적인 한계가 아닌 합리적인 우선순위 설정이며, 오케스트레이션 관련 평가가 더 확립됨에 따라 이 격차가 좁혀질 것으로 예상합니다.

주요 관찰 사항

1. 주요 모델 간 오케스트레이션 능력의 상당한 편차.

최고 성능 모델과 최저 성능 모델 간의 격차는 거의 2배(76% 대 44%)입니다. MMLU, GPQA 또는 LMArena와 같은 기존 벤치마크에서 이들 모델 중 다수가 서로 몇 퍼센트 포인트 내에서 점수를 받는다는 점을 고려하면 이는 주목할 만합니다. 장문 컨텍스트 에이전트 오케스트레이션은 기존 벤치마크가 포착하지 못하는 차별점을 드러냅니다.

2. 정확성, 속도, 비용은 예상과 다르게 상관관계가 없습니다.

가장 비싼 모델이 가장 정확하지는 않습니다(Claude Opus 4.6은 $0.35에 65% 점수, 같은 가격의 Claude 4.5 Opus는 76% 점수). 가장 빠른 모델(GPT-5.2, 2.5초)은 가장 정확도가 낮은 모델 중 하나입니다(48%). 가장 저렴한 모델들은 전체 정확도 범위를 아우릅니다 — Grok 4.1 Fast의 47%($0.01)에서 Gemini 3 Flash Preview의 66%($0.03)까지. 이는 세 가지 차원을 함께 평가하는 것의 중요성을 강화하며, 이는 에이전트 평가에서 모범 사례로 부상하고 있는 비용-성능 파레토 분석과 일치하는 발견입니다.

3. 장문 컨텍스트 압박 하에서의 지시 사항 준수가 차별점입니다.

대부분의 모델이 틀리는 시나리오는 공통된 패턴을 공유하는 경향이 있습니다. 올바른 조치는 모델이 더 '명백'하거나 '기본'적인 조치보다 컨텍스트 깊숙이 묻혀 있는 특정 지시 사항을 우선시하도록 요구합니다. 이 벤치마크에서 뛰어난 성능을 보이는 모델들은 관련 지시 사항이 수만 개의 경쟁 정보 토큰으로 둘러싸여 있을 때에도 지시 사항 충실도를 유지하는 우수한 능력을 보여줍니다. 이는 GAIA의 평가 프레임워크의 발견과 일치하며, 광범위한 계획과 다중 도구 통합을 요구하는 가장 까다로운 작업이 에이전트 능력의 진정한 시험장으로 남아 있습니다.

4. 최소 추론 설정은 기본 능력 격차를 드러냅니다.

모든 모델은 가장 낮은 추론 설정에서 평가되었습니다. 높은 추론 모드에서 강력한 성능으로 알려진 일부 모델들은 여기서 놀라울 정도로 약한 결과를 보였습니다. 우리는 특정 모델 제품군이 신뢰성을 달성하기 위해 확장된 추론 모드에 상당히 더 의존적이라는 것을 관찰합니다. 지연 시간과 비용 제약이 지배적인 실제 운영 오케스트레이션 환경에서처럼 그 추론 컴퓨팅이 제거되면, 근본적인 지시 사항 준수 능력이 드러납니다. 이것이 GPT-5.2의 저조한 성능의 주된 요인입니다. 그 아키텍처는 추론 집약적인 워크플로우에 크게 최적화되어 있으며, 최소 추론 제약이 불균형적으로 영향을 미칩니다.


방법론 노트

  • 재현성. 각 시나리오는 정적이고 결정론적인 평가입니다. 실시간 도구 실행, 외부 API 의존성, 확률적 변동이 없습니다. 동일한 입력과 모델 구성이 주어지면 결과는 완전히 재현 가능합니다. 이는 에이전트 평가 연구에서 제기된 주요 우려 사항을 해결합니다. 에이전트의 비결정성은 일반적으로 여러 실행에 걸친 통계적 평가를 필요로 합니다. 이 벤치마크는 온도 0에서 시나리오당 단일 결정 지점을 평가하므로 다중 실행 집계 없이 결정론적 재현성을 달성합니다.
  • 출력 채점. 모델 출력은 시나리오별로 사전에 정의된 허용 가능한 다음 단계 결정 레이블 세트와 비교하여 평가됩니다. 여러 조치가 유효한 경우, 평가 전에 모두 허용 세트에 포함됩니다.
  • 시나리오 선택. 시나리오는 적대적인 엣지 케이스가 아닌 현실적인 오케스트레이션 과제를 나타내도록 선별됩니다. 목표는 모델 실패를 조작하는 것이 아니라 실제 운영 관련 능력을 측정하는 것입니다.
  • 지속적인 확장. 벤치마크는 적극적으로 유지 관리됩니다. 실제 사용에서 새로운 워크플로우 패턴이 나타나면 새로운 시나리오가 추가됩니다. 현재 버전(n=31)은 초기 릴리스를 나타냅니다.

벤치마크 환경 내에서의 위치

벤치마크주요 초점컨텍스트 길이도메인
SWE-bench Verified실제 GitHub 리포지토리의 버그 수정중간코딩
GAIA다중 도구 질의응답중간일반
AgentBench다중 환경 에이전트 행동다양함8개 도메인
WebArena웹 탐색 작업단문–중간
τ-bench서비스 시나리오에서의 도구 사용단문고객 서비스
Jenova 오케스트레이션 벤치마크장문 컨텍스트 하에서의 다음 단계 결정10만+ 토큰비코딩 워크플로우

이 벤치마크는 기존 평가와 경쟁하거나 대체하지 않습니다. SWE-bench는 코딩 에이전트의 표준으로 남아 있습니다. GAIA는 일반적인 에이전트 능력의 가장 광범위한 테스트로 남아 있습니다. 이 벤치마크는 다른 계층을 분리합니다: 비코딩 도메인에서 극한의 컨텍스트 압박 하에서의 다음 단계 결정 품질.


에이전트 설계에 대한 시사점

우리의 결과는 오케스트레이션 능력이 추론 능력과 구별된다는 것을 시사합니다. 추론 벤치마크에서의 높은 성능이 장문 컨텍스트 오케스트레이션에서의 높은 성능을 보장하지는 않습니다.

에이전트 시스템을 구축하는 개발자들에게 이 분리는 실질적인 결과를 가져옵니다:

  1. 모델 선택. '가장 똑똑한' 모델이 항상 가장 신뢰할 수 있는 오케스트레이터는 아닙니다. 추론 벤치마크만으로 모델을 평가하면 오케스트레이션 계층에 대한 차선의 선택으로 이어질 수 있습니다.
  2. 비용 최적화. 추론 오버헤드가 낮은 모델은 컨텍스트 압박 하에서 우수한 지시 사항 준수 안정성을 가지고 있다면 비싼 최첨단 모델을 능가할 수 있습니다. 대량 생산 환경에서는 이 차이가 크게 복합적으로 작용합니다.
  3. 아키텍처. 오케스트레이션과 작업 실행 모두에 단일 모델에 의존하는 것은 비효율적일 수 있습니다. 전문화된 라우팅 — 오케스트레이션 계층에는 높은 안정성의 모델을 사용하고 특정 하위 작업에는 높은 추론 모델을 사용하는 것 — 이 더 낮은 비용으로 더 나은 신뢰성을 낳을 수 있습니다.

우리는 그 아키텍처적 결정에 대한 데이터 포인트를 제공하기 위해 이 결과를 공개합니다. 더 많은 도메인과 워크플로우 패턴을 다루기 위해 시나리오 세트를 확장함에 따라, 우리는 계속해서 이 지표들을 업데이트할 것입니다.


Jenova.ai 장문 컨텍스트 에이전트 오케스트레이션 벤치마크는 Jenova 엔지니어링 팀이 실제 운영 오케스트레이션 환경에서 모델 성능을 평가하기 위해 개발했습니다. 기술적인 문의나 방법론 세부 사항은 [email protected]로 연락 주시기 바랍니다.