Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста (февраль 2026 г.)


2026-02-24


Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста — результаты по 31 сценарию, показывающие точность, скорость и стоимость для ведущих моделей ИИ.

Обзор

Этот бенчмарк измеряет, насколько хорошо передовые модели ИИ принимают правильные решения по оркестрации следующего шага в реалистичных рабочих процессах, не связанных с кодированием, в условиях экстремального давления длинного контекста (100 тыс.+ токенов). Каждая модель оценивается по трем параметрам: точность (% правильных сценариев), средняя задержка и средняя стоимость вывода (входные + выходные токены).

Основные результаты: Claude 4.5 Opus (76%) и Gemini 3.1 Pro Preview (74%) лидируют в бенчмарке. В более широком смысле, семейства моделей Claude и Gemini доминируют в верхней части таблицы лидеров, что соответствует общей оценке сообщества LLM их сильных способностей к следованию инструкциям и агентских возможностей. Разрыв между лучшими и худшими исполнителями составляет почти 2 раза, что выявляет дифференциацию, которую традиционные бенчмарки не улавливают.


Зачем этот бенчмарк

Индустрия ИИ вложила значительные средства в бенчмаркинг. SWE-bench Verified оценивает исправление ошибок в реальных репозиториях GitHub. GAIA тестирует ответы на вопросы с использованием нескольких инструментов. AgentBench подвергает агентов стресс-тестам в восьми интерактивных средах. WebArena измеряет навигацию в вебе. τ-bench оценивает вызов инструментов в сценариях обслуживания клиентов. Эти бенчмарки сыграли важную роль в развитии возможностей агентов.

Но есть закономерность: большинство этих оценок сосредоточены либо на задачах, ориентированных на кодирование, либо на взаимодействиях с коротким или умеренным контекстом. SWE-bench измеряет исправление кода в репозиториях Python. WebArena тестирует навигацию по симулированным сайтам. τ-bench оценивает вызов инструментов в узких диалогах обслуживания. Даже GAIA, самый широкий из группы, в основном проверяет, может ли агент прийти к правильному окончательному ответу, а не может ли он принять правильное оркестрационное решение под экстремальным давлением контекста.

В производственных агентных системах самая сложная проблема — это не ответить на вопрос или исправить ошибку. Это решить, что делать дальше — на 7-м шаге 12-шагового рабочего процесса, с 150 000 токенов накопленного состояния, когда правильное действие требует синтеза инструкций из системного промпта, результатов предыдущих шагов, первоначального намерения пользователя и текущего состояния прогресса.

Существующие бенчмарки не выделяют эту способность. Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста — выделяет.


Что измеряет этот бенчмарк

Каждый сценарий отвечает на один вопрос:

Находясь в роли оркестратора рабочего процесса с контекстом более 100 000 токенов, может ли модель последовательно принимать правильное решение о следующем шаге?

Каждый сценарий представляет модели реалистичный, замороженный снимок незавершенного рабочего процесса. Входные данные могут включать историю разговора, накопленные результаты предыдущих шагов рабочего процесса, текущий запрос пользователя и инструкции, специфичные для домена. Модель должна проанализировать это плотное состояние и определить единственное правильное следующее действие для продвижения рабочего процесса к завершению.

Это не синтетические головоломки на рассуждение. Сценарии взяты из реальных рабочих процессов, не связанных с кодированием, охватывающих исследования, производительность, коммуникацию, генерацию документов, планирование, анализ данных и координацию нескольких приложений — те виды задач, которые определяют повседневную полезность агента, но в значительной степени отсутствовали в ландшафте бенчмаркинга.


Дизайн бенчмарка

Сценарии

Бенчмарк состоит из 31 сценария (и их число растет), каждый из которых представляет собой одну критическую точку принятия решения в рамках потенциального одно- или многошагового рабочего процесса. Каждый сценарий требует от модели:

  1. Разобрать состояние с длинным контекстом — часто превышающее 100 000 токенов — которое включает историю разговора, накопленные результаты рабочего процесса, загруженные файлы, предпочтения пользователя и инструкции системного уровня.
  2. Понять намерение пользователя в полном контексте разговора и любых ранее предпринятых действий.
  3. Определить правильное следующее действие — единственное решение, которое правильно продвигает общий рабочий процесс в соответствии с предоставленными инструкциями по оркестрации.

Разнообразие сценариев является преднамеренным. Они охватывают широкий спектр доменов и уровней сложности, чтобы проверить, может ли модель обобщать свои возможности оркестрации, а не переобучаться на узком типе задач.

Критерии оценки

  • Бинарная оценка. Каждый сценарий оценивается как правильный или неправильный. Частичные баллы не начисляются.
  • Несколько допустимых действий. В случаях, когда более одного действия можно разумно считать правильным, все допустимые варианты предопределены и принимаются.
  • Три измерения. Каждая модель оценивается по:
    • Точность — процент сценариев, в которых модель выбрала правильное решение о следующем шаге
    • Скорость — среднее время обработки по всем сценариям
    • Стоимость — средняя стоимость вывода на сценарий (входные + выходные токены), отражающая экономическую реальность обработки контекстов 100 тыс.+ токенов для каждого отдельного решения

Конфигурация модели

Все модели запускаются при температуре 0 с самыми низкими доступными настройками рассуждения/мышления для этой модели. Это отражает реальные среды оркестрации агентов, где детерминизм, скорость и экономическая эффективность важнее творческого исследования. Цель состоит в том, чтобы оценить базовую способность модели следовать инструкциям и принимать решения, а не ее способность «думать усерднее» при неограниченных вычислительных ресурсах.


Что отличает этот бенчмарк

1. Оценка агентов, не связанная с кодированием

Существующие бенчмарки для агентов сильно смещены в сторону разработки программного обеспечения. SWE-bench Verified оценивает исправление ошибок в реальных репозиториях. Terminal-Bench тестирует DevOps и системное администрирование. Даже более широкие бенчмарки, такие как τ-bench, фокусируются на узких паттернах вызова инструментов в сценариях обслуживания клиентов.

Этот бенчмарк нацелен на общие, повседневные рабочие процессы — многошаговые задачи, которые профессионалы, исследователи и потребители действительно хотят, чтобы ИИ-агенты выполняли. Синтез исследований, координация электронной почты, управление календарем, создание документов, сбор информации с нескольких платформ. Эти рабочие процессы определяют реальную полезность агента и систематически недооценивались.

2. Стресс-тестирование в условиях длинного контекста

Это не бенчмарк, который случайно использует длинные контексты. Длинный контекст и есть суть. Каждый сценарий разработан так, чтобы превышать 100 000 токенов на входе, заставляя модель поддерживать согласованность, отслеживать состояние и извлекать релевантные сигналы из плотной информационной среды.

Многие модели, которые хорошо работают на бенчмарках с коротким контекстом, значительно деградируют под давлением длинного контекста. Как отмечается в недавних обзорах по оценке LLM-агентов, разрыв между производительностью в коротком и длинном контексте остается одним из наименее измеренных аспектов возможностей модели. Этот бенчмарк прямо вскрывает этот разрыв.

3. Минимизация риска контаминации

Логика оркестрации, таксономия действий и структура рабочего процесса, используемые в этом бенчмарке, являются полностью собственностью Jenova.ai. Нет общедоступного набора данных, фреймворка с открытым исходным кодом или опубликованной статьи, описывающей конкретные тестируемые паттерны принятия решений.

Контаминация данных является хорошо задокументированной проблемой в популярных бенчмарках — модели могли видеть тестовые вопросы или их близкие варианты во время обучения, что завышает их оценки. Отчет Stanford AI Index Report 2025 особо выделяет контаминацию как постоянную проблему для валидности бенчмарков.

Поскольку наша логика оркестрации и структура промптов являются проприетарными и не присутствуют в общедоступном вебе, вероятность контаминации чрезвычайно низка по сравнению с бенчмарками, построенными на общедоступных наборах данных. Как и при любой оценке с использованием моделей с закрытыми весами, мы не можем дать абсолютных гарантий относительно данных предварительного обучения, но дизайн минимизирует этот риск по своей конструкции.

4. Метрики, релевантные для производства

Академические бенчмарки обычно оптимизируют только точность. В производственных агентных системах точность необходима, но недостаточна — вам также нужно знать, насколько быстро и дешево модель может принимать правильные решения. Как показало сравнение моделей Pluralsight 2026 года с SWE-bench, модель с более высоким баллом при 14-кратной стоимости может быть худшим выбором для производства в зависимости от допустимой ошибки и объема. Этот бенчмарк сообщает все три измерения, потому что оптимальная модель оркестрации зависит от соотношения точности, стоимости и скорости для вашего конкретного случая использования.


Результаты и анализ

Уровни производительности

На основе результатов мы наблюдаем три различных уровня производительности:

Уровень 1: Сильные оркестраторы (65%+)

МодельТочностьСред. скоростьСред. стоимость
Claude 4.5 Opus76%4.1с$0.35
Gemini 3.1 Pro Preview74%32.9с$0.13
Gemini 3 Pro Preview66%8.8с$0.12
Gemini 3 Flash Preview66%5.3с$0.03
Claude Opus 4.665%4.8с$0.35
Claude Sonnet 4.565%4.2с$0.21

Семейства моделей Claude и Gemini явно лидируют — результат, который согласуется с общим мнением сообщества LLM об их способностях следовать инструкциям и агентских возможностях. Примечательно, что Gemini 3 Flash Preview соответствует Claude Opus 4.6 с точностью 66%, при этом стоит $0.03 против $0.35 — разница в стоимости в 12 раз при эквивалентной производительности, что делает его, возможно, самым эффективным оркестратором в бенчмарке.

Уровень 2: Способные, но нестабильные (55–64%)

МодельТочностьСред. скоростьСред. стоимость
DeepSeek V3.261%9.4с$0.02
Claude Sonnet 4.658%4.8с$0.21

Модели этого уровня показывают достойные результаты, но демонстрируют большую нестабильность под давлением длинного контекста. Claude Sonnet 4.6 с 58% — это заметное снижение по сравнению с его аналогом 4.5 (65%), что говорит о том, что обновления поколений моделей не всегда приводят к улучшениям в оркестрации.

Уровень 3: Ниже 55%

МодельТочностьСред. скоростьСред. стоимость
MiniMax M2.550%20.5с$0.02
GPT-5.248%2.5с$0.10
Grok 4.1 Fast47%6.7с$0.01
Kimi K2.547%12.1с$0.01
GLM 544%28.2с$0.02

Несколько наблюдений:

  • GPT-5.2 с 48% — заметный результат. Это самая быстрая модель в бенчмарке (2.5с), но одна из наименее точных. Это напрямую связано с ограничением «минимальных настроек рассуждения» — модели семейства GPT сильно оптимизированы для конфигураций, требующих интенсивных рассуждений, и когда это расширенное рассуждение убирается, базовая способность следовать инструкциям под давлением длинного контекста значительно падает. Это не указывает на фундаментальную слабость, а скорее на архитектурную зависимость от вычислительных ресурсов для рассуждений, которой другие семейства моделей не обладают в той же степени.

  • Ведущие китайские модели с открытым исходным кодом — Kimi K2.5 (47%), GLM 5 (44%) и MiniMax M2.5 (50%) — показывают относительно более слабые результаты в этом бенчмарке. Одним из возможных факторов является распределение ресурсов на обучение. Эти модели, часто разрабатываемые с более ограниченными вычислительными бюджетами, чем их западные аналоги, могут разумно приоритизировать обучающие мощности на устоявшиеся, заметные категории бенчмарков (рассуждение, кодирование, знания), где конкурентоспособная производительность важна для позиционирования на рынке. Обобщение оркестрации в длинном контексте — способность, для которой нет существующего публичного бенчмарка для оптимизации — может получать меньше целенаправленного внимания в результате. Это рациональная приоритизация, а не фундаментальное ограничение, и мы ожидаем, что этот разрыв сократится по мере того, как оценки, специфичные для оркестрации, станут более устоявшимися.

Ключевые наблюдения

1. Значительная вариативность в возможностях оркестрации среди ведущих моделей.

Разрыв между моделями с наилучшей и наихудшей производительностью составляет почти 2 раза (76% против 44%). Это примечательно, учитывая, что многие из этих моделей набирают баллы в пределах нескольких процентных пунктов друг от друга на устоявшихся бенчмарках, таких как MMLU, GPQA или LMArena. Оркестрация агентов в длинном контексте выявляет дифференциацию, которую традиционные бенчмарки не улавливают.

2. Точность, скорость и стоимость не коррелируют так, как можно было бы ожидать.

Самая дорогая модель не является самой точной (Claude Opus 4.6 за $0.35 набирает 65%, в то время как Claude 4.5 Opus по той же цене набирает 76%). Самая быстрая модель (GPT-5.2 за 2.5с) — одна из наименее точных (48%). Самые дешевые модели охватывают весь диапазон точности — от Grok 4.1 Fast с 47% ($0.01) до Gemini 3 Flash Preview с 66% ($0.03). Это подтверждает важность совместной оценки всех трех измерений — вывод, согласующийся с анализом Парето по соотношению затрат и производительности, который становится лучшей практикой в оценке агентов.

3. Следование инструкциям под давлением длинного контекста является отличительной чертой.

Сценарии, в которых большинство моделей ошибаются, как правило, имеют общую закономерность: правильное действие требует от модели приоритизировать конкретную инструкцию, зарытую глубоко в контексте, над более «очевидным» или «стандартным» действием. Модели, которые преуспевают в этом бенчмарке, демонстрируют превосходную способность сохранять верность инструкциям, даже когда релевантная инструкция окружена десятками тысяч токенов конкурирующей информации. Это согласуется с выводами из оценочной системы GAIA, где самые требовательные задачи — требующие обширного планирования и интеграции нескольких инструментов — остаются настоящим испытанием для возможностей агента.

4. Минимальные настройки рассуждения вскрывают пробелы в базовых возможностях.

Все модели оценивались на их самых низких настройках рассуждения. Некоторые модели, известные своей высокой производительностью в режимах с интенсивными рассуждениями, показали здесь удивительно слабые результаты. Мы наблюдаем, что определенные семейства моделей значительно более зависимы от расширенных режимов рассуждения для достижения надежности. Когда эти вычислительные ресурсы для рассуждений убираются — как это должно быть в производственных средах оркестрации, где доминируют ограничения по задержке и стоимости — базовая способность следовать инструкциям становится очевидной. Это основной фактор, стоящий за низкой производительностью GPT-5.2: его архитектура сильно оптимизирована для рабочих процессов, требующих интенсивных рассуждений, и ограничение на минимальное рассуждение непропорционально сильно влияет на него.


Методологические примечания

  • Воспроизводимость. Каждый сценарий — это статическая, детерминированная оценка. Нет живого выполнения инструментов, нет зависимости от внешних API и нет стохастической вариации. При одинаковых входных данных и конфигурации модели результаты полностью воспроизводимы. Это решает ключевую проблему, поднятую в исследованиях по оценке агентов: недетерминизм агентов обычно требует статистической оценки по нескольким запускам. Поскольку этот бенчмарк оценивает одну точку принятия решения за сценарий при температуре 0, он достигает детерминированной воспроизводимости без необходимости агрегации по нескольким запускам.
  • Оценка вывода. Выводы моделей оцениваются по предопределенному набору допустимых меток решений для следующего шага для каждого сценария. Если допустимо несколько действий, все они включаются в разрешенный набор до оценки.
  • Выбор сценариев. Сценарии подбираются так, чтобы представлять реалистичные проблемы оркестрации, а не пограничные случаи. Цель — измерить производственно-релевантные возможности, а не спровоцировать сбой модели.
  • Постоянное расширение. Бенчмарк активно поддерживается. Новые сценарии добавляются по мере появления новых паттернов рабочих процессов в производственном использовании. Текущая версия (n=31) представляет собой первоначальный выпуск.

Позиционирование в ландшафте бенчмарков

БенчмаркОсновной фокусДлина контекстаДомен
SWE-bench VerifiedИсправление ошибок в реальных репо GitHubУмереннаяКодирование
GAIAОтветы на вопросы с несколькими инструментамиУмереннаяОбщий
AgentBenchПоведение агента в нескольких средахВарьируется8 доменов
WebArenaЗадачи веб-навигацииКороткая–умереннаяВеб
τ-benchИспользование инструментов в сценариях обслуживанияКороткаяОбслуживание клиентов
Jenova Orchestration BenchmarkРешение о следующем шаге в длинном контексте100 тыс.+ токеновРабочие процессы без кодирования

Этот бенчмарк не конкурирует с существующими оценками и не заменяет их. SWE-bench остается стандартом для агентов кодирования. GAIA остается самым широким тестом общих возможностей агентов. Этот бенчмарк выделяет другой уровень: качество решения о следующем шаге под экстремальным давлением контекста в доменах, не связанных с кодированием.


Последствия для дизайна агентов

Наши результаты показывают, что способность к оркестрации отличается от способности к рассуждению. Высокая производительность на бенчмарках рассуждений не гарантирует высокой производительности в оркестрации с длинным контекстом.

Для разработчиков, создающих агентные системы, это разделение имеет практические последствия:

  1. Выбор модели. «Самая умная» модель не всегда является самым надежным оркестратором. Оценка моделей только по бенчмаркам рассуждений может привести к неоптимальному выбору для слоя оркестрации.
  2. Оптимизация затрат. Модели с меньшими накладными расходами на рассуждения могут превосходить дорогие передовые модели, если у них есть превосходная стабильность следования инструкциям под давлением контекста. В производственных объемах эта разница значительно увеличивается.
  3. Архитектура. Опора на одну модель как для оркестрации, так и для выполнения задач может быть неэффективной. Специализированная маршрутизация — использование высокостабильной модели для слоя оркестрации и моделей с высокими способностями к рассуждению для конкретных подзадач — может обеспечить лучшую надежность при меньших затратах.

Мы публикуем эти результаты, чтобы предоставить данные для этого архитектурного решения. По мере расширения набора сценариев для охвата большего числа доменов и паттернов рабочих процессов мы будем продолжать обновлять эти метрики.


Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста разработан инженерной командой Jenova для оценки производительности моделей в производственных средах оркестрации. По техническим вопросам или деталям методологии обращайтесь по адресу [email protected].