Benchmark de Orquestación de Agentes de Contexto Largo de Jenova.ai (Febrero de 2026)


2026-02-24


Benchmark de Orquestación de Agentes de Contexto Largo de Jenova.ai — Resultados en 31 escenarios que muestran la precisión, velocidad y costo de los principales modelos de IA.

Resumen

Este benchmark mide qué tan bien los modelos de IA de frontera toman decisiones correctas de orquestación para el siguiente paso en flujos de trabajo realistas y sin código bajo una presión extrema de contexto largo (más de 100k tokens). Cada modelo se evalúa en tres dimensiones: precisión (% de escenarios correctos), latencia promedio y costo de inferencia promedio (tokens de entrada + salida).

Resultados principales: Claude 4.5 Opus (76%) y Gemini 3.1 Pro Preview (74%) lideran el benchmark. En general, las familias de modelos Claude y Gemini dominan la parte superior de la tabla de clasificación, lo que es consistente con la evaluación de la comunidad general de LLM sobre sus sólidas capacidades para seguir instrucciones y sus capacidades agénticas. La brecha entre los modelos de mayor y menor rendimiento es de casi 2x, revelando una diferenciación que los benchmarks tradicionales no capturan.


¿Por qué este benchmark?

La industria de la IA ha invertido mucho en benchmarks. SWE-bench Verified evalúa la corrección de errores en repositorios reales de GitHub. GAIA prueba la respuesta a preguntas con múltiples herramientas. AgentBench somete a los agentes a pruebas de estrés en ocho entornos interactivos. WebArena mide la navegación web. τ-bench evalúa la llamada a herramientas en escenarios de servicio al cliente. Estos benchmarks han sido fundamentales para avanzar en las capacidades de los agentes.

Pero hay un patrón: la mayoría de estas evaluaciones se centran en tareas centradas en la codificación o en interacciones de contexto corto a moderado. SWE-bench mide la reparación de código en repositorios de Python. WebArena prueba la navegación en sitios simulados. τ-bench evalúa la llamada a herramientas en diálogos de servicio estrechos. Incluso GAIA, el más amplio del grupo, prueba principalmente si un agente puede llegar a una respuesta final correcta, no si puede tomar la decisión de orquestación correcta bajo una presión de contexto extrema.

En los sistemas agénticos de producción, el problema más difícil no es responder una pregunta o corregir un error. Es decidir qué hacer a continuación: en el paso 7 de un flujo de trabajo de 12 pasos, con 150,000 tokens de estado acumulado, cuando la acción correcta requiere sintetizar instrucciones del prompt del sistema, resultados de pasos anteriores, la intención original del usuario y el estado actual del progreso.

Los benchmarks existentes no aíslan esta capacidad. El Benchmark de Orquestación de Agentes de Contexto Largo de Jenova.ai sí lo hace.


¿Qué mide este benchmark?

Cada escenario responde a una sola pregunta:

Cuando se le asigna el rol de un orquestador de flujos de trabajo con más de 100,000 tokens de contexto, ¿puede un modelo tomar consistentemente la decisión correcta para el siguiente paso?

Cada escenario presenta a un modelo una instantánea realista y congelada de un flujo de trabajo en progreso. La entrada puede incluir historial de conversaciones, resultados acumulados de pasos anteriores del flujo de trabajo, la solicitud actual del usuario e instrucciones específicas del dominio. El modelo debe analizar este estado denso y determinar la única acción correcta siguiente para hacer avanzar el flujo de trabajo hacia su finalización.

No se trata de rompecabezas de razonamiento sintéticos. Los escenarios se extraen de flujos de trabajo del mundo real y sin código que abarcan investigación, productividad, comunicación, generación de documentos, programación, análisis de datos y coordinación de múltiples aplicaciones, el tipo de tareas que definen la utilidad diaria de los agentes pero que han estado en gran medida ausentes del panorama de los benchmarks.


Diseño del benchmark

Escenarios

El benchmark consta de 31 escenarios (y sigue creciendo), cada uno representando un punto de decisión crítico dentro de un posible flujo de trabajo de uno o varios pasos. Cada escenario requiere que el modelo:

  1. Analice un estado de contexto largo —a menudo superior a 100,000 tokens— que incluye historial de conversaciones, resultados de flujo de trabajo acumulados, archivos cargados, preferencias del usuario e instrucciones a nivel de sistema.
  2. Comprenda la intención del usuario dentro del contexto completo de la conversación y cualquier acción previa realizada.
  3. Determine la siguiente acción correcta —la única decisión que hace avanzar correctamente el flujo de trabajo general de acuerdo con las instrucciones de orquestación proporcionadas.

La diversidad de escenarios es intencional. Abarcan una amplia gama de dominios y niveles de complejidad para probar si un modelo puede generalizar sus capacidades de orquestación en lugar de sobreajustarse a un tipo de tarea específico.

Criterios de evaluación

  • Puntuación binaria. Cada escenario se califica como correcto o incorrecto. No hay crédito parcial.
  • Múltiples acciones válidas. En los casos en que más de una acción podría considerarse razonablemente correcta, todas las opciones válidas están predefinidas y se aceptan.
  • Tres dimensiones. Cada modelo se evalúa en:
    • Precisión — porcentaje de escenarios en los que el modelo seleccionó la decisión correcta para el siguiente paso
    • Velocidad — tiempo de procesamiento promedio en todos los escenarios
    • Costo — costo de inferencia promedio por escenario (tokens de entrada + salida), reflejando la realidad económica de procesar contextos de más de 100k tokens para cada decisión

Configuración del modelo

Todos los modelos se ejecutan a temperatura 0 con la configuración de razonamiento/pensamiento más baja disponible para ese modelo. Esto refleja los entornos de orquestación agéntica del mundo real donde el determinismo, la velocidad y la eficiencia de costos importan más que la exploración creativa. El objetivo es evaluar la capacidad base del modelo para seguir instrucciones y tomar decisiones, no su capacidad para "pensar más" cuando se le da cómputo ilimitado.


¿Qué hace diferente a este benchmark?

1. Evaluación agéntica sin codificación

Los benchmarks agénticos existentes se inclinan fuertemente hacia la ingeniería de software. SWE-bench Verified evalúa la corrección de errores en repositorios reales. Terminal-Bench prueba DevOps y administración de sistemas. Incluso benchmarks más amplios como τ-bench se centran en patrones estrechos de llamada a herramientas dentro de escenarios de servicio al cliente.

Este benchmark se enfoca en flujos de trabajo cotidianos de propósito general: tareas de varios pasos que los profesionales, investigadores y consumidores realmente necesitan que los agentes de IA manejen. Síntesis de investigación, coordinación de correos electrónicos, gestión de calendarios, creación de documentos, recopilación de información multiplataforma. Estos flujos de trabajo definen la utilidad real de los agentes y han sido sistemáticamente subestimados.

2. Pruebas de estrés de contexto largo

Este no es un benchmark que casualmente utiliza contextos largos. El contexto largo es el punto central. Cada escenario está diseñado para superar los 100,000 tokens de entrada, obligando al modelo a mantener la coherencia, seguir el estado y extraer señales relevantes de un entorno de información denso.

Muchos modelos que funcionan bien en benchmarks de contexto corto se degradan significativamente bajo la presión de un contexto largo. Como se señaló en encuestas recientes sobre la evaluación de agentes LLM, la brecha entre el rendimiento en contexto corto y largo sigue siendo una de las dimensiones menos medidas de la capacidad de un modelo. Este benchmark expone directamente esa brecha.

3. Minimización del riesgo de contaminación

La lógica de orquestación, la taxonomía de acciones y la estructura de flujo de trabajo utilizadas en este benchmark son totalmente propiedad de Jenova.ai. No existe un conjunto de datos público, un marco de código abierto o un artículo publicado que describa los patrones específicos de toma de decisiones que se están probando.

La contaminación de datos es una preocupación bien documentada en los benchmarks populares: los modelos pueden haber visto preguntas de prueba o variantes cercanas durante el entrenamiento, inflando sus puntuaciones. El Informe del Índice de IA de Stanford 2025 destaca específicamente la contaminación como un desafío continuo para la validez de los benchmarks.

Debido a que nuestra lógica de orquestación y estructura de prompts son propietarias y no tienen presencia en la web pública, la probabilidad de contaminación es extremadamente baja en comparación con los benchmarks construidos sobre conjuntos de datos disponibles públicamente. Como con cualquier evaluación que involucre modelos de pesos cerrados, no podemos dar garantías absolutas sobre los datos de preentrenamiento, pero el diseño minimiza este riesgo por construcción.

4. Métricas relevantes para la producción

Los benchmarks académicos suelen optimizar solo la precisión. En los sistemas agénticos de producción, la precisión es necesaria pero insuficiente: también necesitas saber qué tan rápido y qué tan barato un modelo puede tomar decisiones correctas. Como demostró la comparación de modelos 2026 de Pluralsight con SWE-bench, un modelo con una puntuación más alta a un costo 14 veces mayor puede ser una peor opción de producción dependiendo de la tolerancia a errores y el volumen. Este benchmark informa las tres dimensiones porque el modelo de orquestación óptimo depende de la relación precisión-costo-velocidad para su caso de uso específico.


Resultados y análisis

Niveles de rendimiento

Basándonos en los resultados, observamos tres niveles de rendimiento distintos:

Nivel 1: Orquestadores fuertes (65%+)

ModeloPrecisiónVel. Prom.Costo Prom.
Claude 4.5 Opus76%4.1s$0.35
Gemini 3.1 Pro Preview74%32.9s$0.13
Gemini 3 Pro Preview66%8.8s$0.12
Gemini 3 Flash Preview66%5.3s$0.03
Claude Opus 4.665%4.8s$0.35
Claude Sonnet 4.565%4.2s$0.21

Las familias de modelos Claude y Gemini lideran claramente el grupo, un resultado que se alinea con el consenso más amplio de la comunidad de LLM sobre sus capacidades para seguir instrucciones y sus capacidades agénticas. Notablemente, Gemini 3 Flash Preview iguala a Claude Opus 4.6 con un 66% de precisión mientras cuesta $0.03 frente a $0.35, una diferencia de costo de 12 veces para un rendimiento equivalente, lo que lo convierte posiblemente en el orquestador más eficiente del benchmark.

Nivel 2: Capaces pero inconsistentes (55–64%)

ModeloPrecisiónVel. Prom.Costo Prom.
DeepSeek V3.261%9.4s$0.02
Claude Sonnet 4.658%4.8s$0.21

Los modelos en este nivel se desempeñan de manera creíble pero muestran más inconsistencia bajo la presión de un contexto largo. Claude Sonnet 4.6 con un 58% es un descenso notable con respecto a su contraparte 4.5 (65%), lo que sugiere que las actualizaciones en la generación de modelos no siempre se traducen en mejoras en la orquestación.

Nivel 3: Por debajo del 55%

ModeloPrecisiónVel. Prom.Costo Prom.
MiniMax M2.550%20.5s$0.02
GPT-5.248%2.5s$0.10
Grok 4.1 Fast47%6.7s$0.01
Kimi K2.547%12.1s$0.01
GLM 544%28.2s$0.02

Varias observaciones aquí:

  • GPT-5.2 con un 48% es un resultado notable. Es el modelo más rápido del benchmark (2.5s) pero uno de los menos precisos. Esto está directamente relacionado con la restricción de "configuraciones mínimas de razonamiento": los modelos de la familia GPT están muy optimizados para configuraciones intensivas en razonamiento, y cuando se elimina ese razonamiento extendido, la capacidad base para seguir instrucciones bajo presión de contexto largo disminuye sustancialmente. Esto no indica una debilidad fundamental, sino más bien una dependencia arquitectónica del cómputo de razonamiento que otras familias de modelos no comparten en el mismo grado.

  • Los principales modelos chinos de código abierto — Kimi K2.5 (47%), GLM 5 (44%) y MiniMax M2.5 (50%) — tienen un rendimiento relativamente más débil en este benchmark. Un posible factor contribuyente es la asignación de entrenamiento. Estos modelos, a menudo desarrollados con presupuestos de cómputo más ajustados que sus contrapartes occidentales, pueden priorizar razonablemente la capacidad de entrenamiento hacia categorías de benchmarks establecidas y de alta visibilidad (razonamiento, codificación, conocimiento) donde el rendimiento competitivo es esencial para el posicionamiento en el mercado. La generalización de la orquestación de contexto largo, una capacidad sin un benchmark público existente contra el cual optimizar, puede recibir menos atención específica como resultado. Esta es una priorización racional, no una limitación fundamental, y esperamos que esta brecha se reduzca a medida que las evaluaciones específicas de orquestación se establezcan más.

Observaciones clave

1. Variación significativa en la capacidad de orquestación entre los principales modelos.

La brecha entre los modelos de mayor y menor rendimiento es de casi 2x (76% vs. 44%). Esto es notable dado que muchos de estos modelos obtienen puntuaciones con pocos puntos porcentuales de diferencia en benchmarks establecidos como MMLU, GPQA o LMArena. La orquestación agéntica de contexto largo revela una diferenciación que los benchmarks tradicionales no capturan.

2. La precisión, la velocidad y el costo no están correlacionados como se esperaría.

El modelo más caro no es el más preciso (Claude Opus 4.6 a $0.35 obtiene un 65%, mientras que Claude 4.5 Opus al mismo precio obtiene un 76%). El modelo más rápido (GPT-5.2 a 2.5s) se encuentra entre los menos precisos (48%). Los modelos más baratos abarcan todo el rango de precisión, desde Grok 4.1 Fast con un 47% ($0.01) hasta Gemini 3 Flash Preview con un 66% ($0.03). Esto refuerza la importancia de evaluar las tres dimensiones juntas, un hallazgo consistente con el análisis Pareto de costo-rendimiento que emerge como una mejor práctica en la evaluación de agentes.

3. El seguimiento de instrucciones bajo presión de contexto largo es el diferenciador.

Los escenarios en los que la mayoría de los modelos se equivocan tienden a compartir un patrón común: la acción correcta requiere que el modelo priorice una instrucción específica enterrada en lo profundo del contexto sobre una acción más "obvia" o "predeterminada". Los modelos que sobresalen en este benchmark demuestran una capacidad superior para mantener la fidelidad a las instrucciones incluso cuando la instrucción relevante está rodeada por decenas de miles de tokens de información competidora. Esto se alinea con los hallazgos del marco de evaluación de GAIA, donde las tareas más exigentes, que requieren una planificación extensa e integración de múltiples herramientas, siguen siendo el verdadero campo de pruebas para la capacidad de los agentes.

4. Las configuraciones mínimas de razonamiento exponen brechas en la capacidad base.

Todos los modelos fueron evaluados en sus configuraciones de razonamiento más bajas. Algunos modelos conocidos por su fuerte rendimiento en modos de alto razonamiento mostraron resultados sorprendentemente débiles aquí. Observamos que ciertas familias de modelos son sustancialmente más dependientes de los modos de razonamiento extendido para lograr fiabilidad. Cuando se elimina ese cómputo de razonamiento, como debe ser en entornos de orquestación de producción donde las restricciones de latencia y costo dominan, la capacidad subyacente para seguir instrucciones queda al descubierto. Este es el factor principal detrás del bajo rendimiento de GPT-5.2: su arquitectura está muy optimizada para flujos de trabajo intensivos en razonamiento, y la restricción de razonamiento mínimo lo afecta de manera desproporcionada.


Notas sobre la metodología

  • Reproducibilidad. Cada escenario es una evaluación estática y determinista. No hay ejecución de herramientas en vivo, ni dependencia de API externas, ni variación estocástica. Con la misma entrada y configuración del modelo, los resultados son totalmente reproducibles. Esto aborda una preocupación clave planteada en la investigación sobre evaluación de agentes: el no determinismo de los agentes generalmente requiere una evaluación estadística a través de múltiples ejecuciones. Debido a que este benchmark evalúa un único punto de decisión por escenario a temperatura 0, logra una reproducibilidad determinista sin requerir la agregación de múltiples ejecuciones.
  • Calificación de la salida. Las salidas de los modelos se evalúan contra un conjunto predefinido de etiquetas de decisión de siguiente paso aceptables por escenario. Cuando varias acciones son válidas, todas se incluyen en el conjunto permitido antes de la evaluación.
  • Selección de escenarios. Los escenarios se seleccionan para representar desafíos de orquestación realistas, no casos extremos adversarios. El objetivo es medir la capacidad relevante para la producción, no diseñar el fallo del modelo.
  • Expansión continua. El benchmark se mantiene activamente. Se agregan nuevos escenarios a medida que surgen nuevos patrones de flujo de trabajo en el uso de producción. La versión actual (n=31) representa el lanzamiento inicial.

Posicionamiento dentro del panorama de benchmarks

BenchmarkEnfoque PrincipalLongitud de ContextoDominio
SWE-bench VerifiedCorrección de errores en repos de GitHubModeradaCodificación
GAIARespuesta a preguntas con multi-herramientaModeradaGeneral
AgentBenchComportamiento de agentes en multi-entornoVaría8 dominios
WebArenaTareas de navegación webCorta–moderadaWeb
τ-benchUso de herramientas en escenarios de servicioCortaServicio al cliente
Benchmark de Orquestación de JenovaDecisión del siguiente paso en contexto largo+100k tokensFlujos de trabajo sin código

Este benchmark no compite ni reemplaza las evaluaciones existentes. SWE-bench sigue siendo el estándar para los agentes de codificación. GAIA sigue siendo la prueba más amplia de la capacidad general de los agentes. Este benchmark aísla una capa diferente: la calidad de la decisión del siguiente paso bajo una presión de contexto extrema en dominios sin codificación.


Implicaciones para el diseño de agentes

Nuestros resultados sugieren que la capacidad de orquestación es distinta de la capacidad de razonamiento. Un alto rendimiento en benchmarks de razonamiento no garantiza un alto rendimiento en la orquestación de contexto largo.

Para los desarrolladores que construyen sistemas agénticos, este desacoplamiento tiene consecuencias prácticas:

  1. Selección del modelo. El modelo "más inteligente" no siempre es el orquestador más fiable. Evaluar modelos solo en benchmarks de razonamiento puede llevar a elecciones subóptimas para la capa de orquestación.
  2. Optimización de costos. Los modelos con menor sobrecarga de razonamiento pueden superar a los costosos modelos de frontera si tienen una estabilidad superior en el seguimiento de instrucciones bajo presión de contexto. A volumen de producción, esta diferencia se agrava significativamente.
  3. Arquitectura. Depender de un solo modelo tanto para la orquestación como para la ejecución de tareas puede ser ineficiente. El enrutamiento especializado, utilizando un modelo de alta estabilidad para la capa de orquestación y modelos de alto razonamiento para subtareas específicas, puede producir una mayor fiabilidad a un menor costo.

Publicamos estos resultados para proporcionar un punto de datos para esa decisión arquitectónica. A medida que ampliemos el conjunto de escenarios para cubrir más dominios y patrones de flujo de trabajo, continuaremos actualizando estas métricas.


El Benchmark de Orquestación de Agentes de Contexto Largo de Jenova.ai es desarrollado por el equipo de ingeniería de Jenova para evaluar el rendimiento de los modelos en entornos de orquestación de producción. Para consultas técnicas o detalles sobre la metodología, contacte a [email protected].