2026-02-24

このベンチマークは、最先端のAIモデルが、極端な長文コンテキスト(10万トークン以上) のプレッシャー下で、現実的な非コーディングワークフローにおいて、いかに正確な次ステップのオーケストレーション決定を行えるかを測定します。各モデルは、精度(正解シナリオの割合)、平均レイテンシ、平均推論コスト(入力+出力トークン) の3つの側面で評価されます。
主な結果: Claude 4.5 Opus (76%) と Gemini 3.1 Pro Preview (74%) がベンチマークをリードしています。より広範に見ると、ClaudeとGeminiモデルファミリーがリーダーボードの上位を独占しており、これは強力な指示追従能力とエージェント的能力に関するLLMコミュニティ全体の評価と一致しています。トップパフォーマーとボトムパフォーマーの差はほぼ2倍あり、従来のベンチマークでは捉えきれなかった差別化を明らかにしています。
AI業界はベンチマークに多額の投資を行ってきました。SWE-bench Verifiedは実際のGitHubリポジトリでのバグ修正を評価します。GAIAはマルチツールの質疑応答をテストします。AgentBenchは8つの対話型環境でエージェントのストレステストを行います。WebArenaはウェブナビゲーションを測定します。τ-benchは顧客サービスシナリオでのツール呼び出しを評価します。これらのベンチマークは、エージェント能力の向上に貢献してきました。
しかし、そこには一つのパターンがあります。これらの評価の大部分は、コーディング中心のタスクか、短〜中程度のコンテキストでの対話に焦点を当てています。SWE-benchはPythonリポジトリのコード修復を測定します。WebArenaはシミュレートされたサイトでのナビゲーションをテストします。τ-benchは狭いサービス対話内でのツール呼び出しを評価します。グループの中で最も広範なGAIAでさえ、主にエージェントが正しい最終回答にたどり着けるかどうかをテストするものであり、極端なコンテキストプレッシャーの下で正しいオーケストレーション決定を下せるかどうかをテストするものではありません。
本番環境のエージェント的システムにおいて、最も難しい問題は質問に答えたりバグを修正したりすることではありません。それは次に何をすべきかを決定することです。12ステップのワークフローの7ステップ目で、15万トークンの蓄積された状態があり、正しいアクションがシステムプロンプトからの指示、先行ステップの結果、ユーザーの本来の意図、そして現在の進捗状況を統合する必要がある場合です。
既存のベンチマークはこの能力を分離していません。Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマークはそれを実現します。
各シナリオは、単一の質問に答えます:
10万トークン以上のコンテキストを持つワークフローオーケストレーターの役割を与えられたとき、モデルは一貫して正しい次ステップの決定を下すことができるか?
各シナリオは、進行中のワークフローの現実的で凍結されたスナップショットをモデルに提示します。入力には、会話履歴、先行するワークフローステップからの蓄積された結果、ユーザーの現在のリクエスト、およびドメイン固有の指示が含まれます。モデルはこの高密度の状態を分析し、ワークフローを完了に向けて進めるための唯一の正しい次のアクションを決定しなければなりません。
これらは合成された推論パズルではありません。シナリオは、研究、生産性、コミュニケーション、文書生成、スケジューリング、データ分析、マルチアプリケーション連携など、現実世界の非コーディングワークフローから抽出されています。これらは日常的なエージェントの有用性を定義するタスクでありながら、ベンチマークの領域からはほとんど見過ごされてきました。
このベンチマークは31のシナリオ(現在も増加中)で構成されており、それぞれが単一ステップまたは複数ステップのワークフロー内の重要な決定点を表しています。各シナリオでは、モデルは以下のことを行う必要があります:
シナリオの多様性は意図的なものです。モデルが狭いタスクタイプに過剰適合するのではなく、オーケストレーション能力を一般化できるかどうかをテストするために、幅広いドメインと複雑さのレベルにまたがっています。
すべてのモデルは温度0で、そのモデルで利用可能な最も低い推論/思考設定で実行されます。これは、創造的な探求よりも決定論、速度、コスト効率が重視される現実世界のエージェント的オーケストレーション環境を反映しています。目標は、無制限の計算能力が与えられたときに「より深く考える」能力ではなく、モデルの基本的な指示追従能力と意思決定能力を評価することです。
既存のエージェント的ベンチマークは、ソフトウェアエンジニアリングに大きく偏っています。SWE-bench Verifiedは実際のリポジトリでのバグ修正を評価します。Terminal-BenchはDevOpsとシステム管理をテストします。τ-benchのようなより広範なベンチマークでさえ、顧客サービスシナリオ内の狭いツール呼び出しパターンに焦点を当てています。
このベンチマークは、汎用的で日常的なワークフローを対象としています — 専門家、研究者、消費者がAIエージェントに実際に処理してほしい複数ステップのタスクです。研究の統合、メールの調整、カレンダー管理、文書作成、マルチプラットフォームの情報収集など。これらのワークフローは、現実世界のエージェントの有用性を定義し、体系的に測定されてきませんでした。
これはたまたま長文コンテキストを使用するベンチマークではありません。長文コンテキストこそが要点です。すべてのシナリオは10万トークン以上の入力を超えるように設計されており、モデルに一貫性を保ち、状態を追跡し、高密度の情報環境から関連するシグナルを抽出することを強制します。
短文コンテキストのベンチマークで優れた性能を発揮する多くのモデルは、長文コンテキストのプレッシャー下で著しく性能が低下します。最近のLLMエージェント評価に関する調査で指摘されているように、短文コンテキストと長文コンテキストの性能の差は、モデル能力の最も測定されていない側面の一つです。 このベンチマークは、その差を直接明らかにします。
このベンチマークで使用されるオーケストレーションロジック、アクションの分類法、ワークフロー構造は、完全にJenova.aiの独自のものです。テストされている特定の意思決定パターンを記述した公開データセット、オープンソースフレームワーク、または出版された論文は存在しません。
データコンタミネーションは、人気のベンチマーク全体でよく知られた懸念事項です — モデルがトレーニング中にテスト問題やそれに近いものを見た可能性があり、スコアが水増しされることがあります。Stanford AI Index Report 2025は、ベンチマークの妥当性に対する継続的な課題としてコンタミネーションを特に強調しています。
私たちのオーケストレーションロジックとプロンプト構造は独自のものであり、公開ウェブ上には存在しないため、公開データセット上に構築されたベンチマークと比較してコンタミネーションの可能性は極めて低いです。クローズドウェイトモデルを含む評価と同様に、事前学習データについて絶対的な保証はできませんが、設計によってこのリスクは最小限に抑えられています。
学術的なベンチマークは通常、精度のみを最適化します。本番環境のエージェント的システムでは、精度は必要ですが十分ではありません — モデルがどれだけ速く、どれだけ安価に正しい決定を下せるかを知る必要もあります。Pluralsightの2026年モデル比較がSWE-benchで示したように、14倍のコストで高得点を出すモデルは、エラー許容度やボリュームによっては、本番環境での選択肢として劣る場合があります。このベンチマークが3つの側面すべてを報告するのは、最適なオーケストレーションモデルは、特定のユースケースにおける精度対コスト対速度の比率に依存するからです。
結果に基づき、3つの異なるパフォーマンス階層が観察されます:
階層1:強力なオーケストレーター (65%以上)
| モデル | 精度 | 平均速度 | 平均コスト |
|---|---|---|---|
| Claude 4.5 Opus | 76% | 4.1s | $0.35 |
| Gemini 3.1 Pro Preview | 74% | 32.9s | $0.13 |
| Gemini 3 Pro Preview | 66% | 8.8s | $0.12 |
| Gemini 3 Flash Preview | 66% | 5.3s | $0.03 |
| Claude Opus 4.6 | 65% | 4.8s | $0.35 |
| Claude Sonnet 4.5 | 65% | 4.2s | $0.21 |
ClaudeとGeminiのモデルファミリーが明らかにリードしています。これは、指示追従能力とエージェント的能力に関するLLMコミュニティの広範なコンセンサスと一致する結果です。特筆すべきは、Gemini 3 Flash PreviewがClaude Opus 4.6と66%の精度で同等でありながら、コストは$0.03対$0.35であることです。これは同等の性能で12倍のコスト差であり、このベンチマークで最も効率的なオーケストレーターと言えるでしょう。
階層2:有能だが一貫性に欠ける (55–64%)
| モデル | 精度 | 平均速度 | 平均コスト |
|---|---|---|---|
| DeepSeek V3.2 | 61% | 9.4s | $0.02 |
| Claude Sonnet 4.6 | 58% | 4.8s | $0.21 |
この階層のモデルは信頼できる性能を示しますが、長文コンテキストのプレッシャー下では一貫性に欠けます。Claude Sonnet 4.6の58%は、4.5版(65%)からの顕著な低下であり、モデル世代のアップグレードが必ずしもオーケストレーションの改善につながるわけではないことを示唆しています。
階層3:55%未満
| モデル | 精度 | 平均速度 | 平均コスト |
|---|---|---|---|
| MiniMax M2.5 | 50% | 20.5s | $0.02 |
| GPT-5.2 | 48% | 2.5s | $0.10 |
| Grok 4.1 Fast | 47% | 6.7s | $0.01 |
| Kimi K2.5 | 47% | 12.1s | $0.01 |
| GLM 5 | 44% | 28.2s | $0.02 |
いくつかの観察点:
GPT-5.2の48%は注目すべき結果です。 ベンチマークで最速のモデル(2.5秒)ですが、精度は最も低い部類に入ります。これは「最小限の推論設定」という制約に直接関係しています。GPTファミリーのモデルは推論集約型の構成に高度に最適化されており、その拡張された推論が取り除かれると、長文コンテキストプレッシャー下での基本的な指示追従能力が大幅に低下します。これは根本的な弱点を示すものではなく、他のモデルファミリーが同程度には共有していない、推論計算へのアーキテクチャ上の依存性を示しています。
主要な中国のオープンソースモデル — Kimi K2.5 (47%)、GLM 5 (44%)、MiniMax M2.5 (50%) — は、このベンチマークで比較的弱い性能を示します。 一つの考えられる要因は、トレーニングの配分です。これらのモデルは、欧米の競合他社よりも厳しい計算予算の下で開発されることが多く、市場での地位を確立するために競争力のある性能が不可欠な、確立された知名度の高いベンチマークカテゴリ(推論、コーディング、知識)にトレーニング能力を優先するのは合理的です。最適化対象となる公開ベンチマークが存在しない長文コンテキストのオーケストレーション一般化能力は、結果として重点的な焦点が当てられにくい可能性があります。これは合理的な優先順位付けであり、根本的な限界ではなく、オーケストレーション固有の評価がより確立されるにつれて、この差は縮まると予想されます。
1. 主要モデル間でオーケストレーション能力に大きなばらつきがある。
最高性能モデルと最低性能モデルの差はほぼ2倍(76%対44%)です。これらのモデルの多くがMMLU、GPQA、LMArenaなどの確立されたベンチマークで数パーセントポイント以内のスコアであることを考えると、これは注目に値します。長文コンテキストのエージェント的オーケストレーションは、従来のベンチマークでは捉えきれない差別化を明らかにします。
2. 精度、速度、コストは期待されるような相関関係にない。
最も高価なモデルが最も正確であるとは限りません(Claude Opus 4.6は$0.35で65%のスコア、同価格のClaude 4.5 Opusは76%)。最速のモデル(GPT-5.2は2.5秒)は最も精度が低い部類に入ります(48%)。最も安価なモデルは、Grok 4.1 Fastの47%($0.01)からGemini 3 Flash Previewの66%($0.03)まで、精度の全範囲にわたります。これは、3つの側面すべてを一緒に評価することの重要性を再確認させます。これは、エージェント評価のベストプラクティスとして浮上しているコストパフォーマンスのパレート分析と一致する発見です。
3. 長文コンテキストプレッシャー下での指示追従能力が差別化要因である。
ほとんどのモデルが間違えるシナリオは、共通のパターンを共有する傾向があります。正しいアクションは、モデルがより「明白」または「デフォルト」のアクションよりも、コンテキストの奥深くに埋もれた特定の指示を優先することを要求します。このベンチマークで優れた成績を収めるモデルは、関連する指示が数万トークンの競合情報に囲まれていても、指示の忠実度を維持する優れた能力を示します。これはGAIAの評価フレームワークからの知見と一致しており、広範な計画とマルチツールの統合を必要とする最も要求の厳しいタスクが、エージェント能力の真の試金石であり続けています。
4. 最小限の推論設定が基本的な能力のギャップを露呈させる。
すべてのモデルは、最も低い推論設定で評価されました。高推論モードで強力な性能で知られる一部のモデルは、ここで驚くほど弱い結果を示しました。特定のモデルファミリーは、信頼性を達成するために拡張された推論モードに大幅に依存していることが観察されます。その推論計算が取り除かれると — レイテンシとコストの制約が支配的な本番オーケストレーション環境ではそうしなければならない — 根底にある指示追従能力が露わになります。これがGPT-5.2の性能不振の主な要因です。そのアーキテクチャは推論集約型のワークフローに高度に最適化されており、最小限の推論という制約が不釣り合いに影響を与えています。
| ベンチマーク | 主な焦点 | コンテキスト長 | ドメイン |
|---|---|---|---|
| SWE-bench Verified | GitHubリポジトリでのバグ修正 | 中程度 | コーディング |
| GAIA | マルチツール質疑応答 | 中程度 | 一般 |
| AgentBench | マルチ環境エージェントの振る舞い | 様々 | 8ドメイン |
| WebArena | ウェブナビゲーションタスク | 短〜中程度 | ウェブ |
| τ-bench | サービスシナリオでのツール使用 | 短い | 顧客サービス |
| Jenova オーケストレーション ベンチマーク | 長文コンテキスト下での次ステップ決定 | 10万トークン以上 | 非コーディングワークフロー |
このベンチマークは、既存の評価と競合したり、それらを置き換えたりするものではありません。SWE-benchはコーディングエージェントの標準であり続けます。GAIAは一般的なエージェント能力の最も広範なテストであり続けます。このベンチマークは、異なる層を分離します:非コーディングドメインにおける極端なコンテキストプレッシャー下での次ステップ決定の質。
我々の結果は、オーケストレーション能力が推論能力とは別のものであることを示唆しています。推論ベンチマークでの高性能は、長文コンテキストのオーケストレーションでの高性能を保証しません。
エージェント的システムを構築する開発者にとって、この分離は実践的な結果をもたらします:
私たちは、そのアーキテクチャ上の決定のためのデータポイントを提供するために、これらの結果を公開しています。より多くのドメインとワークフローパターンをカバーするためにシナリオセットを拡大するにつれて、これらのメトリクスを更新し続けます。
Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマークは、本番オーケストレーション環境でのモデル性能を評価するために、Jenovaエンジニアリングチームによって開発されました。技術的なお問い合わせや方法論の詳細については、[email protected]までご連絡ください。