Benchmark di Orchestrazione di Agenti a Contesto Lungo di Jenova.ai (Febbraio 2026)


2026-02-24


Benchmark di Orchestrazione di Agenti a Contesto Lungo di Jenova.ai — Risultati su 31 scenari che mostrano accuratezza, velocità e costo per i principali modelli di AI.

Panoramica

Questo benchmark misura quanto bene i modelli di AI di frontiera prendono decisioni di orchestrazione corrette per il passo successivo in flussi di lavoro realistici e non legati alla programmazione, sotto estrema pressione di contesto lungo (oltre 100k token). Ogni modello è valutato su tre dimensioni: accuratezza (% di scenari corretti), latenza media e costo medio di inferenza (token di input + output).

Risultati principali: Claude 4.5 Opus (76%) e Gemini 3.1 Pro Preview (74%) guidano il benchmark. Più in generale, le famiglie di modelli Claude e Gemini dominano la parte alta della classifica, in linea con la valutazione della comunità LLM generale sulle loro forti capacità di seguire le istruzioni e agire come agenti. Il divario tra i modelli migliori e peggiori è quasi del doppio, rivelando una differenziazione che i benchmark tradizionali non catturano.


Perché Questo Benchmark

L'industria dell'AI ha investito molto nel benchmarking. SWE-bench Verified valuta la correzione di bug in repository GitHub reali. GAIA testa la risposta a domande con più strumenti. AgentBench mette alla prova gli agenti in otto ambienti interattivi. WebArena misura la navigazione web. τ-bench valuta l'uso di strumenti in scenari di servizio clienti. Questi benchmark sono stati fondamentali per far progredire le capacità degli agenti.

Ma c'è uno schema: la maggior parte di queste valutazioni si concentra su compiti incentrati sulla programmazione o su interazioni a contesto breve o moderato. SWE-bench misura la riparazione del codice nei repository Python. WebArena testa la navigazione su siti simulati. τ-bench valuta l'uso di strumenti in dialoghi di servizio ristretti. Anche GAIA, il più ampio del gruppo, testa principalmente se un agente può arrivare a una risposta finale corretta, non se può prendere la giusta decisione di orchestrazione sotto estrema pressione di contesto.

Nei sistemi di agenti in produzione, il problema più difficile non è rispondere a una domanda o correggere un bug. È decidere cosa fare dopo — al passo 7 di un flusso di lavoro di 12 passi, con 150.000 token di stato accumulato, quando l'azione corretta richiede di sintetizzare le istruzioni dal prompt di sistema, i risultati dei passi precedenti, l'intento originale dell'utente e lo stato attuale di avanzamento.

I benchmark esistenti non isolano questa capacità. Il Benchmark di Orchestrazione di Agenti a Contesto Lungo di Jenova.ai sì.


Cosa Misura Questo Benchmark

Ogni scenario risponde a una singola domanda:

Quando posto nel ruolo di un orchestratore di flussi di lavoro con oltre 100.000 token di contesto, un modello può prendere costantemente la decisione corretta per il passo successivo?

Ogni scenario presenta a un modello un'istantanea realistica e congelata di un flusso di lavoro in corso. L'input può includere la cronologia della conversazione, i risultati accumulati dai passi precedenti del flusso di lavoro, la richiesta attuale dell'utente e istruzioni specifiche del dominio. Il modello deve analizzare questo stato denso e determinare la singola azione successiva corretta per far progredire il flusso di lavoro verso il completamento.

Questi non sono puzzle di ragionamento sintetici. Gli scenari sono tratti da flussi di lavoro reali e non legati alla programmazione che spaziano tra ricerca, produttività, comunicazione, generazione di documenti, pianificazione, analisi dei dati e coordinamento multi-applicazione — i tipi di compiti che definiscono l'utilità quotidiana degli agenti ma che sono stati in gran parte assenti dal panorama del benchmarking.


Progettazione del Benchmark

Scenari

Il benchmark è composto da 31 scenari (in crescita), ognuno dei quali rappresenta un singolo punto decisionale critico all'interno di un potenziale flusso di lavoro a uno o più passi. Ogni scenario richiede al modello di:

  1. Analizzare uno stato a contesto lungo — spesso superiore a 100.000 token — che include la cronologia della conversazione, i risultati accumulati del flusso di lavoro, i file caricati, le preferenze dell'utente e le istruzioni a livello di sistema.
  2. Comprendere l'intento dell'utente nel contesto completo della conversazione e di eventuali azioni precedenti intraprese.
  3. Determinare l'azione successiva corretta — la singola decisione che fa progredire correttamente il flusso di lavoro complessivo secondo le istruzioni di orchestrazione fornite.

La diversità degli scenari è intenzionale. Essi coprono una vasta gamma di domini e livelli di complessità per testare se un modello può generalizzare le sue capacità di orchestrazione piuttosto che sovradattarsi a un tipo di compito ristretto.

Criteri di Valutazione

  • Punteggio binario. Ogni scenario è valutato come corretto o errato. Non c'è credito parziale.
  • Azioni valide multiple. Nei casi in cui più di un'azione potrebbe essere ragionevolmente considerata corretta, tutte le opzioni valide sono predefinite e accettate.
  • Tre dimensioni. Ogni modello è valutato su:
    • Accuratezza — percentuale di scenari in cui il modello ha selezionato la decisione corretta per il passo successivo
    • Velocità — tempo medio di elaborazione in tutti gli scenari
    • Costo — costo medio di inferenza per scenario (token di input + output), che riflette la realtà economica dell'elaborazione di contesti di oltre 100k token per ogni singola decisione

Configurazione del Modello

Tutti i modelli sono eseguiti a temperatura 0 con le impostazioni di ragionamento/pensiero più basse disponibili per quel modello. Ciò rispecchia gli ambienti di orchestrazione di agenti del mondo reale in cui determinismo, velocità ed efficienza dei costi contano più dell'esplorazione creativa. L'obiettivo è valutare la capacità di base del modello di seguire le istruzioni e prendere decisioni, non la sua abilità di "pensare più a fondo" quando gli viene dato un calcolo illimitato.


Cosa Rende Questo Benchmark Diverso

1. Valutazione di Agenti Non Legati alla Programmazione

I benchmark di agenti esistenti tendono pesantemente verso l'ingegneria del software. SWE-bench Verified valuta la correzione di bug in repository reali. Terminal-Bench testa DevOps e l'amministrazione di sistema. Anche benchmark più ampi come τ-bench si concentrano su schemi ristretti di chiamata di strumenti all'interno di scenari di servizio clienti.

Questo benchmark si rivolge a flussi di lavoro quotidiani e di uso generale — compiti a più passi che professionisti, ricercatori e consumatori hanno effettivamente bisogno che gli agenti AI gestiscano. Sintesi di ricerche, coordinamento di email, gestione del calendario, creazione di documenti, raccolta di informazioni multi-piattaforma. Questi flussi di lavoro definiscono l'utilità reale degli agenti e sono stati sistematicamente sottomisurati.

2. Stress Test a Contesto Lungo

Questo non è un benchmark che casualmente utilizza contesti lunghi. Il contesto lungo è il punto. Ogni scenario è progettato per superare i 100.000 token di input, costringendo il modello a mantenere la coerenza, tracciare lo stato ed estrarre segnali rilevanti da un ambiente informativo denso.

Molti modelli che si comportano bene su benchmark a contesto breve si degradano significativamente sotto la pressione di un contesto lungo. Come notato in recenti sondaggi sulla valutazione degli agenti LLM, il divario tra le prestazioni a contesto breve e a contesto lungo rimane una delle dimensioni meno misurate della capacità del modello. Questo benchmark espone direttamente quel divario.

3. Minimizzazione del Rischio di Contaminazione

La logica di orchestrazione, la tassonomia delle azioni e la struttura del flusso di lavoro utilizzate in questo benchmark sono interamente proprietarie di Jenova.ai. Non esiste un dataset pubblico, un framework open-source o un articolo pubblicato che descriva i specifici schemi decisionali testati.

La contaminazione dei dati è una preoccupazione ben documentata in tutti i benchmark popolari — i modelli potrebbero aver visto le domande del test o varianti molto simili durante l'addestramento, gonfiando i loro punteggi. Il Rapporto sull'Indice AI di Stanford 2025 evidenzia specificamente la contaminazione come una sfida continua per la validità dei benchmark.

Poiché la nostra logica di orchestrazione e la struttura dei prompt sono proprietarie e non hanno alcuna presenza sul web pubblico, la probabilità di contaminazione è estremamente bassa rispetto ai benchmark costruiti su dataset disponibili pubblicamente. Come per qualsiasi valutazione che coinvolge modelli a pesi chiusi, non possiamo dare garanzie assolute sui dati di pre-addestramento — ma il design minimizza questo rischio per costruzione.

4. Metriche Rilevanti per la Produzione

I benchmark accademici tipicamente ottimizzano solo per l'accuratezza. Nei sistemi di agenti in produzione, l'accuratezza è necessaria ma non sufficiente — è necessario sapere anche quanto velocemente ed economicamente un modello può prendere decisioni corrette. Come ha dimostrato il confronto dei modelli 2026 di Pluralsight con SWE-bench, un modello con un punteggio più alto ma con un costo 14 volte superiore potrebbe essere una scelta di produzione peggiore a seconda della tolleranza agli errori e del volume. Questo benchmark riporta tutte e tre le dimensioni perché il modello di orchestrazione ottimale dipende dal rapporto accuratezza-costo-velocità per il tuo specifico caso d'uso.


Risultati e Analisi

Livelli di Prestazione

Sulla base dei risultati, osserviamo tre distinti livelli di prestazione:

Livello 1: Orchestratori Forti (65%+)

ModelloAccuratezzaVel. MediaCosto Medio
Claude 4.5 Opus76%4.1s$0.35
Gemini 3.1 Pro Preview74%32.9s$0.13
Gemini 3 Pro Preview66%8.8s$0.12
Gemini 3 Flash Preview66%5.3s$0.03
Claude Opus 4.665%4.8s$0.35
Claude Sonnet 4.565%4.2s$0.21

Le famiglie di modelli Claude e Gemini guidano chiaramente il gruppo — un risultato che si allinea con il consenso più ampio della comunità LLM sulle loro capacità di seguire le istruzioni e agire come agenti. In particolare, Gemini 3 Flash Preview eguaglia Claude Opus 4.6 con il 66% di accuratezza costando $0.03 contro $0.35 — una differenza di costo di 12 volte per prestazioni equivalenti, rendendolo probabilmente l'orchestratore più efficiente nel benchmark.

Livello 2: Capaci ma Incoerenti (55–64%)

ModelloAccuratezzaVel. MediaCosto Medio
DeepSeek V3.261%9.4s$0.02
Claude Sonnet 4.658%4.8s$0.21

I modelli in questo livello si comportano in modo credibile ma mostrano maggiore incoerenza sotto la pressione di un contesto lungo. Claude Sonnet 4.6 al 58% è un notevole passo indietro rispetto alla sua controparte 4.5 (65%), suggerendo che gli aggiornamenti di generazione del modello non si traducono sempre in miglioramenti dell'orchestrazione.

Livello 3: Sotto il 55%

ModelloAccuratezzaVel. MediaCosto Medio
MiniMax M2.550%20.5s$0.02
GPT-5.248%2.5s$0.10
Grok 4.1 Fast47%6.7s$0.01
Kimi K2.547%12.1s$0.01
GLM 544%28.2s$0.02

Diverse osservazioni qui:

  • GPT-5.2 al 48% è un risultato notevole. È il modello più veloce nel benchmark (2.5s) ma tra i meno accurati. Ciò è direttamente correlato al vincolo delle "impostazioni di ragionamento minime" — i modelli della famiglia GPT sono fortemente ottimizzati per configurazioni ad alta intensità di ragionamento, e quando quel ragionamento esteso viene rimosso, la capacità di base di seguire le istruzioni sotto la pressione di un contesto lungo cala sostanzialmente. Questo non indica una debolezza fondamentale, quanto piuttosto una dipendenza architetturale dal calcolo di ragionamento che altre famiglie di modelli non condividono nella stessa misura.

  • I principali modelli open-source cinesi — Kimi K2.5 (47%), GLM 5 (44%) e MiniMax M2.5 (50%) — hanno prestazioni relativamente più deboli su questo benchmark. Un possibile fattore contribuente è l'allocazione dell'addestramento. Questi modelli, spesso sviluppati con budget di calcolo più ristretti rispetto alle loro controparti occidentali, possono ragionevolmente dare priorità alla capacità di addestramento verso categorie di benchmark consolidate e ad alta visibilità (ragionamento, programmazione, conoscenza) dove le prestazioni competitive sono essenziali per il posizionamento sul mercato. La generalizzazione dell'orchestrazione a contesto lungo — una capacità senza un benchmark pubblico esistente su cui ottimizzare — potrebbe ricevere di conseguenza un'attenzione meno mirata. Questa è una prioritizzazione razionale, non una limitazione fondamentale, e ci aspettiamo che questo divario si riduca man mano che le valutazioni specifiche per l'orchestrazione diventeranno più consolidate.

Osservazioni Chiave

1. Varianza significativa nella capacità di orchestrazione tra i principali modelli.

Il divario tra i modelli con le migliori e le peggiori prestazioni è quasi del doppio (76% vs. 44%). Questo è notevole dato che molti di questi modelli ottengono punteggi entro pochi punti percentuali l'uno dall'altro su benchmark consolidati come MMLU, GPQA o LMArena. L'orchestrazione di agenti a contesto lungo rivela una differenziazione che i benchmark tradizionali non catturano.

2. Accuratezza, velocità e costo non sono correlati come ci si aspetterebbe.

Il modello più costoso non è il più accurato (Claude Opus 4.6 a $0.35 ottiene il 65%, mentre Claude 4.5 Opus allo stesso prezzo ottiene il 76%). Il modello più veloce (GPT-5.2 a 2.5s) è tra i meno accurati (48%). I modelli più economici coprono l'intera gamma di accuratezza — da Grok 4.1 Fast al 47% ($0.01) a Gemini 3 Flash Preview al 66% ($0.03). Ciò rafforza l'importanza di valutare tutte e tre le dimensioni insieme — una scoperta coerente con l'analisi Pareto costo-prestazioni che sta emergendo come una best practice nella valutazione degli agenti.

3. Il seguire le istruzioni sotto la pressione di un contesto lungo è il fattore differenziante.

Gli scenari che la maggior parte dei modelli sbaglia tendono a condividere uno schema comune: l'azione corretta richiede al modello di dare la priorità a un'istruzione specifica sepolta in profondità nel contesto rispetto a un'azione più "ovvia" o "predefinita". I modelli che eccellono in questo benchmark dimostrano una capacità superiore di mantenere la fedeltà alle istruzioni anche quando l'istruzione pertinente è circondata da decine di migliaia di token di informazioni concorrenti. Ciò si allinea con i risultati del framework di valutazione di GAIA, dove i compiti più impegnativi — che richiedono una pianificazione estesa e l'integrazione di più strumenti — rimangono il vero banco di prova per la capacità degli agenti.

4. Le impostazioni di ragionamento minime espongono le lacune nelle capacità di base.

Tutti i modelli sono stati valutati con le loro impostazioni di ragionamento più basse. Alcuni modelli noti per le loro forti prestazioni in modalità ad alto ragionamento hanno mostrato risultati sorprendentemente deboli qui. Osserviamo che alcune famiglie di modelli sono sostanzialmente più dipendenti da modalità di ragionamento estese per raggiungere l'affidabilità. Quando quel calcolo di ragionamento viene rimosso — come deve essere negli ambienti di orchestrazione di produzione dove i vincoli di latenza e costo dominano — la capacità sottostante di seguire le istruzioni viene messa a nudo. Questo è il fattore principale dietro le scarse prestazioni di GPT-5.2: la sua architettura è fortemente ottimizzata per flussi di lavoro ad alta intensità di ragionamento, e il vincolo di ragionamento minimo lo colpisce in modo sproporzionato.


Note sulla Metodologia

  • Riproducibilità. Ogni scenario è una valutazione statica e deterministica. Non c'è esecuzione di strumenti dal vivo, nessuna dipendenza da API esterne e nessuna variazione stocastica. Dati lo stesso input e la stessa configurazione del modello, i risultati sono completamente riproducibili. Questo affronta una preoccupazione chiave sollevata nella ricerca sulla valutazione degli agenti: la non-determinismo degli agenti richiede tipicamente una valutazione statistica su più esecuzioni. Poiché questo benchmark valuta un singolo punto decisionale per scenario a temperatura 0, raggiunge una riproducibilità deterministica senza richiedere l'aggregazione di più esecuzioni.
  • Valutazione dell'output. Gli output dei modelli sono valutati rispetto a un insieme predefinito di etichette di decisione del passo successivo accettabili per scenario. Laddove più azioni sono valide, tutte sono incluse nell'insieme consentito prima della valutazione.
  • Selezione degli scenari. Gli scenari sono curati per rappresentare sfide di orchestrazione realistiche, non casi limite avversari. L'obiettivo è misurare la capacità rilevante per la produzione, non ingegnerizzare il fallimento del modello.
  • Espansione continua. Il benchmark è mantenuto attivamente. Nuovi scenari vengono aggiunti man mano che emergono nuovi schemi di flusso di lavoro nell'uso in produzione. La versione attuale (n=31) rappresenta la versione iniziale.

Posizionamento nel Panorama dei Benchmark

BenchmarkFocus PrimarioLunghezza ContestoDominio
SWE-bench VerifiedCorrezione di bug in repo GitHub realiModerataProgrammazione
GAIARisposta a domande con più strumentiModerataGenerale
AgentBenchComportamento dell'agente in più ambientiVaria8 domini
WebArenaCompiti di navigazione webBreve–moderataWeb
τ-benchUso di strumenti in scenari di servizioBreveServizio clienti
Benchmark di Orchestrazione JenovaDecisione del passo successivo in contesto lungo100k+ tokenFlussi di lavoro non di programmazione

Questo benchmark non compete né sostituisce le valutazioni esistenti. SWE-bench rimane lo standard per gli agenti di programmazione. GAIA rimane il test più ampio della capacità generale degli agenti. Questo benchmark isola uno strato diverso: la qualità della decisione del passo successivo sotto estrema pressione di contesto in domini non legati alla programmazione.


Implicazioni per la Progettazione di Agenti

I nostri risultati suggeriscono che la capacità di orchestrazione è distinta dalla capacità di ragionamento. Alte prestazioni sui benchmark di ragionamento non garantiscono alte prestazioni sull'orchestrazione a contesto lungo.

Per gli sviluppatori che costruiscono sistemi di agenti, questa separazione ha conseguenze pratiche:

  1. Selezione del Modello. Il modello "più intelligente" non è sempre l'orchestratore più affidabile. Valutare i modelli solo sui benchmark di ragionamento può portare a scelte non ottimali per lo strato di orchestrazione.
  2. Ottimizzazione dei Costi. I modelli con un sovraccarico di ragionamento inferiore possono superare i costosi modelli di frontiera se hanno una stabilità superiore nel seguire le istruzioni sotto pressione di contesto. A volumi di produzione, questa differenza si accumula in modo significativo.
  3. Architettura. Affidarsi a un singolo modello sia per l'orchestrazione che per l'esecuzione dei compiti può essere inefficiente. Un routing specializzato — utilizzando un modello ad alta stabilità per lo strato di orchestrazione e modelli ad alto ragionamento per sotto-compiti specifici — può produrre una maggiore affidabilità a un costo inferiore.

Stiamo rilasciando questi risultati per fornire un punto di dati per quella decisione architetturale. Man mano che espandiamo l'insieme di scenari per coprire più domini e schemi di flusso di lavoro, continueremo ad aggiornare queste metriche.


Il Benchmark di Orchestrazione di Agenti a Contesto Lungo di Jenova.ai è sviluppato dal team di ingegneria di Jenova per valutare le prestazioni dei modelli in ambienti di orchestrazione di produzione. Per richieste tecniche o dettagli sulla metodologia, contattare [email protected].