2026-02-24

Этот бенчмарк измеряет, насколько хорошо передовые модели ИИ принимают правильные решения по оркестрации следующего шага в реалистичных рабочих процессах, не связанных с кодированием, в условиях экстремального давления длинного контекста (100 тыс.+ токенов). Каждая модель оценивается по трем параметрам: точность (% правильных сценариев), средняя задержка и средняя стоимость вывода (входные + выходные токены).
Основные результаты: Claude 4.5 Opus (76%) и Gemini 3.1 Pro Preview (74%) лидируют в бенчмарке. В более широком смысле, семейства моделей Claude и Gemini доминируют в верхней части таблицы лидеров, что соответствует общей оценке сообщества LLM их сильных способностей к следованию инструкциям и агентских возможностей. Разрыв между лучшими и худшими исполнителями составляет почти 2 раза, что выявляет дифференциацию, которую традиционные бенчмарки не улавливают.
Индустрия ИИ вложила значительные средства в бенчмаркинг. SWE-bench Verified оценивает исправление ошибок в реальных репозиториях GitHub. GAIA тестирует ответы на вопросы с использованием нескольких инструментов. AgentBench подвергает агентов стресс-тестам в восьми интерактивных средах. WebArena измеряет навигацию в вебе. τ-bench оценивает вызов инструментов в сценариях обслуживания клиентов. Эти бенчмарки сыграли важную роль в развитии возможностей агентов.
Но есть закономерность: большинство этих оценок сосредоточены либо на задачах, ориентированных на кодирование, либо на взаимодействиях с коротким или умеренным контекстом. SWE-bench измеряет исправление кода в репозиториях Python. WebArena тестирует навигацию по симулированным сайтам. τ-bench оценивает вызов инструментов в узких диалогах обслуживания. Даже GAIA, самый широкий из группы, в основном проверяет, может ли агент прийти к правильному окончательному ответу, а не может ли он принять правильное оркестрационное решение под экстремальным давлением контекста.
В производственных агентных системах самая сложная проблема — это не ответить на вопрос или исправить ошибку. Это решить, что делать дальше — на 7-м шаге 12-шагового рабочего процесса, с 150 000 токенов накопленного состояния, когда правильное действие требует синтеза инструкций из системного промпта, результатов предыдущих шагов, первоначального намерения пользователя и текущего состояния прогресса.
Существующие бенчмарки не выделяют эту способность. Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста — выделяет.
Каждый сценарий отвечает на один вопрос:
Находясь в роли оркестратора рабочего процесса с контекстом более 100 000 токенов, может ли модель последовательно принимать правильное решение о следующем шаге?
Каждый сценарий представляет модели реалистичный, замороженный снимок незавершенного рабочего процесса. Входные данные могут включать историю разговора, накопленные результаты предыдущих шагов рабочего процесса, текущий запрос пользователя и инструкции, специфичные для домена. Модель должна проанализировать это плотное состояние и определить единственное правильное следующее действие для продвижения рабочего процесса к завершению.
Это не синтетические головоломки на рассуждение. Сценарии взяты из реальных рабочих процессов, не связанных с кодированием, охватывающих исследования, производительность, коммуникацию, генерацию документов, планирование, анализ данных и координацию нескольких приложений — те виды задач, которые определяют повседневную полезность агента, но в значительной степени отсутствовали в ландшафте бенчмаркинга.
Бенчмарк состоит из 31 сценария (и их число растет), каждый из которых представляет собой одну критическую точку принятия решения в рамках потенциального одно- или многошагового рабочего процесса. Каждый сценарий требует от модели:
Разнообразие сценариев является преднамеренным. Они охватывают широкий спектр доменов и уровней сложности, чтобы проверить, может ли модель обобщать свои возможности оркестрации, а не переобучаться на узком типе задач.
Все модели запускаются при температуре 0 с самыми низкими доступными настройками рассуждения/мышления для этой модели. Это отражает реальные среды оркестрации агентов, где детерминизм, скорость и экономическая эффективность важнее творческого исследования. Цель состоит в том, чтобы оценить базовую способность модели следовать инструкциям и принимать решения, а не ее способность «думать усерднее» при неограниченных вычислительных ресурсах.
Существующие бенчмарки для агентов сильно смещены в сторону разработки программного обеспечения. SWE-bench Verified оценивает исправление ошибок в реальных репозиториях. Terminal-Bench тестирует DevOps и системное администрирование. Даже более широкие бенчмарки, такие как τ-bench, фокусируются на узких паттернах вызова инструментов в сценариях обслуживания клиентов.
Этот бенчмарк нацелен на общие, повседневные рабочие процессы — многошаговые задачи, которые профессионалы, исследователи и потребители действительно хотят, чтобы ИИ-агенты выполняли. Синтез исследований, координация электронной почты, управление календарем, создание документов, сбор информации с нескольких платформ. Эти рабочие процессы определяют реальную полезность агента и систематически недооценивались.
Это не бенчмарк, который случайно использует длинные контексты. Длинный контекст и есть суть. Каждый сценарий разработан так, чтобы превышать 100 000 токенов на входе, заставляя модель поддерживать согласованность, отслеживать состояние и извлекать релевантные сигналы из плотной информационной среды.
Многие модели, которые хорошо работают на бенчмарках с коротким контекстом, значительно деградируют под давлением длинного контекста. Как отмечается в недавних обзорах по оценке LLM-агентов, разрыв между производительностью в коротком и длинном контексте остается одним из наименее измеренных аспектов возможностей модели. Этот бенчмарк прямо вскрывает этот разрыв.
Логика оркестрации, таксономия действий и структура рабочего процесса, используемые в этом бенчмарке, являются полностью собственностью Jenova.ai. Нет общедоступного набора данных, фреймворка с открытым исходным кодом или опубликованной статьи, описывающей конкретные тестируемые паттерны принятия решений.
Контаминация данных является хорошо задокументированной проблемой в популярных бенчмарках — модели могли видеть тестовые вопросы или их близкие варианты во время обучения, что завышает их оценки. Отчет Stanford AI Index Report 2025 особо выделяет контаминацию как постоянную проблему для валидности бенчмарков.
Поскольку наша логика оркестрации и структура промптов являются проприетарными и не присутствуют в общедоступном вебе, вероятность контаминации чрезвычайно низка по сравнению с бенчмарками, построенными на общедоступных наборах данных. Как и при любой оценке с использованием моделей с закрытыми весами, мы не можем дать абсолютных гарантий относительно данных предварительного обучения, но дизайн минимизирует этот риск по своей конструкции.
Академические бенчмарки обычно оптимизируют только точность. В производственных агентных системах точность необходима, но недостаточна — вам также нужно знать, насколько быстро и дешево модель может принимать правильные решения. Как показало сравнение моделей Pluralsight 2026 года с SWE-bench, модель с более высоким баллом при 14-кратной стоимости может быть худшим выбором для производства в зависимости от допустимой ошибки и объема. Этот бенчмарк сообщает все три измерения, потому что оптимальная модель оркестрации зависит от соотношения точности, стоимости и скорости для вашего конкретного случая использования.
На основе результатов мы наблюдаем три различных уровня производительности:
Уровень 1: Сильные оркестраторы (65%+)
| Модель | Точность | Сред. скорость | Сред. стоимость |
|---|---|---|---|
| Claude 4.5 Opus | 76% | 4.1с | $0.35 |
| Gemini 3.1 Pro Preview | 74% | 32.9с | $0.13 |
| Gemini 3 Pro Preview | 66% | 8.8с | $0.12 |
| Gemini 3 Flash Preview | 66% | 5.3с | $0.03 |
| Claude Opus 4.6 | 65% | 4.8с | $0.35 |
| Claude Sonnet 4.5 | 65% | 4.2с | $0.21 |
Семейства моделей Claude и Gemini явно лидируют — результат, который согласуется с общим мнением сообщества LLM об их способностях следовать инструкциям и агентских возможностях. Примечательно, что Gemini 3 Flash Preview соответствует Claude Opus 4.6 с точностью 66%, при этом стоит $0.03 против $0.35 — разница в стоимости в 12 раз при эквивалентной производительности, что делает его, возможно, самым эффективным оркестратором в бенчмарке.
Уровень 2: Способные, но нестабильные (55–64%)
| Модель | Точность | Сред. скорость | Сред. стоимость |
|---|---|---|---|
| DeepSeek V3.2 | 61% | 9.4с | $0.02 |
| Claude Sonnet 4.6 | 58% | 4.8с | $0.21 |
Модели этого уровня показывают достойные результаты, но демонстрируют большую нестабильность под давлением длинного контекста. Claude Sonnet 4.6 с 58% — это заметное снижение по сравнению с его аналогом 4.5 (65%), что говорит о том, что обновления поколений моделей не всегда приводят к улучшениям в оркестрации.
Уровень 3: Ниже 55%
| Модель | Точность | Сред. скорость | Сред. стоимость |
|---|---|---|---|
| MiniMax M2.5 | 50% | 20.5с | $0.02 |
| GPT-5.2 | 48% | 2.5с | $0.10 |
| Grok 4.1 Fast | 47% | 6.7с | $0.01 |
| Kimi K2.5 | 47% | 12.1с | $0.01 |
| GLM 5 | 44% | 28.2с | $0.02 |
Несколько наблюдений:
GPT-5.2 с 48% — заметный результат. Это самая быстрая модель в бенчмарке (2.5с), но одна из наименее точных. Это напрямую связано с ограничением «минимальных настроек рассуждения» — модели семейства GPT сильно оптимизированы для конфигураций, требующих интенсивных рассуждений, и когда это расширенное рассуждение убирается, базовая способность следовать инструкциям под давлением длинного контекста значительно падает. Это не указывает на фундаментальную слабость, а скорее на архитектурную зависимость от вычислительных ресурсов для рассуждений, которой другие семейства моделей не обладают в той же степени.
Ведущие китайские модели с открытым исходным кодом — Kimi K2.5 (47%), GLM 5 (44%) и MiniMax M2.5 (50%) — показывают относительно более слабые результаты в этом бенчмарке. Одним из возможных факторов является распределение ресурсов на обучение. Эти модели, часто разрабатываемые с более ограниченными вычислительными бюджетами, чем их западные аналоги, могут разумно приоритизировать обучающие мощности на устоявшиеся, заметные категории бенчмарков (рассуждение, кодирование, знания), где конкурентоспособная производительность важна для позиционирования на рынке. Обобщение оркестрации в длинном контексте — способность, для которой нет существующего публичного бенчмарка для оптимизации — может получать меньше целенаправленного внимания в результате. Это рациональная приоритизация, а не фундаментальное ограничение, и мы ожидаем, что этот разрыв сократится по мере того, как оценки, специфичные для оркестрации, станут более устоявшимися.
1. Значительная вариативность в возможностях оркестрации среди ведущих моделей.
Разрыв между моделями с наилучшей и наихудшей производительностью составляет почти 2 раза (76% против 44%). Это примечательно, учитывая, что многие из этих моделей набирают баллы в пределах нескольких процентных пунктов друг от друга на устоявшихся бенчмарках, таких как MMLU, GPQA или LMArena. Оркестрация агентов в длинном контексте выявляет дифференциацию, которую традиционные бенчмарки не улавливают.
2. Точность, скорость и стоимость не коррелируют так, как можно было бы ожидать.
Самая дорогая модель не является самой точной (Claude Opus 4.6 за $0.35 набирает 65%, в то время как Claude 4.5 Opus по той же цене набирает 76%). Самая быстрая модель (GPT-5.2 за 2.5с) — одна из наименее точных (48%). Самые дешевые модели охватывают весь диапазон точности — от Grok 4.1 Fast с 47% ($0.01) до Gemini 3 Flash Preview с 66% ($0.03). Это подтверждает важность совместной оценки всех трех измерений — вывод, согласующийся с анализом Парето по соотношению затрат и производительности, который становится лучшей практикой в оценке агентов.
3. Следование инструкциям под давлением длинного контекста является отличительной чертой.
Сценарии, в которых большинство моделей ошибаются, как правило, имеют общую закономерность: правильное действие требует от модели приоритизировать конкретную инструкцию, зарытую глубоко в контексте, над более «очевидным» или «стандартным» действием. Модели, которые преуспевают в этом бенчмарке, демонстрируют превосходную способность сохранять верность инструкциям, даже когда релевантная инструкция окружена десятками тысяч токенов конкурирующей информации. Это согласуется с выводами из оценочной системы GAIA, где самые требовательные задачи — требующие обширного планирования и интеграции нескольких инструментов — остаются настоящим испытанием для возможностей агента.
4. Минимальные настройки рассуждения вскрывают пробелы в базовых возможностях.
Все модели оценивались на их самых низких настройках рассуждения. Некоторые модели, известные своей высокой производительностью в режимах с интенсивными рассуждениями, показали здесь удивительно слабые результаты. Мы наблюдаем, что определенные семейства моделей значительно более зависимы от расширенных режимов рассуждения для достижения надежности. Когда эти вычислительные ресурсы для рассуждений убираются — как это должно быть в производственных средах оркестрации, где доминируют ограничения по задержке и стоимости — базовая способность следовать инструкциям становится очевидной. Это основной фактор, стоящий за низкой производительностью GPT-5.2: его архитектура сильно оптимизирована для рабочих процессов, требующих интенсивных рассуждений, и ограничение на минимальное рассуждение непропорционально сильно влияет на него.
| Бенчмарк | Основной фокус | Длина контекста | Домен |
|---|---|---|---|
| SWE-bench Verified | Исправление ошибок в реальных репо GitHub | Умеренная | Кодирование |
| GAIA | Ответы на вопросы с несколькими инструментами | Умеренная | Общий |
| AgentBench | Поведение агента в нескольких средах | Варьируется | 8 доменов |
| WebArena | Задачи веб-навигации | Короткая–умеренная | Веб |
| τ-bench | Использование инструментов в сценариях обслуживания | Короткая | Обслуживание клиентов |
| Jenova Orchestration Benchmark | Решение о следующем шаге в длинном контексте | 100 тыс.+ токенов | Рабочие процессы без кодирования |
Этот бенчмарк не конкурирует с существующими оценками и не заменяет их. SWE-bench остается стандартом для агентов кодирования. GAIA остается самым широким тестом общих возможностей агентов. Этот бенчмарк выделяет другой уровень: качество решения о следующем шаге под экстремальным давлением контекста в доменах, не связанных с кодированием.
Наши результаты показывают, что способность к оркестрации отличается от способности к рассуждению. Высокая производительность на бенчмарках рассуждений не гарантирует высокой производительности в оркестрации с длинным контекстом.
Для разработчиков, создающих агентные системы, это разделение имеет практические последствия:
Мы публикуем эти результаты, чтобы предоставить данные для этого архитектурного решения. По мере расширения набора сценариев для охвата большего числа доменов и паттернов рабочих процессов мы будем продолжать обновлять эти метрики.
Бенчмарк Jenova.ai для оркестрации агентов в условиях длинного контекста разработан инженерной командой Jenova для оценки производительности моделей в производственных средах оркестрации. По техническим вопросам или деталям методологии обращайтесь по адресу [email protected].