Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマーク (2026年2月)


2026-02-24


Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマーク — 31のシナリオにおける主要AIモデルの精度、速度、コストの結果

概要

このベンチマークは、最先端のAIモデルが、極端な長文コンテキスト(10万トークン以上) のプレッシャー下で、現実的な非コーディングワークフローにおいて、いかに正確な次ステップのオーケストレーション決定を行えるかを測定します。各モデルは、精度(正解シナリオの割合)平均レイテンシ平均推論コスト(入力+出力トークン) の3つの側面で評価されます。

主な結果: Claude 4.5 Opus (76%)Gemini 3.1 Pro Preview (74%) がベンチマークをリードしています。より広範に見ると、ClaudeとGeminiモデルファミリーがリーダーボードの上位を独占しており、これは強力な指示追従能力とエージェント的能力に関するLLMコミュニティ全体の評価と一致しています。トップパフォーマーとボトムパフォーマーの差はほぼ2倍あり、従来のベンチマークでは捉えきれなかった差別化を明らかにしています。


このベンチマークの目的

AI業界はベンチマークに多額の投資を行ってきました。SWE-bench Verifiedは実際のGitHubリポジトリでのバグ修正を評価します。GAIAはマルチツールの質疑応答をテストします。AgentBenchは8つの対話型環境でエージェントのストレステストを行います。WebArenaはウェブナビゲーションを測定します。τ-benchは顧客サービスシナリオでのツール呼び出しを評価します。これらのベンチマークは、エージェント能力の向上に貢献してきました。

しかし、そこには一つのパターンがあります。これらの評価の大部分は、コーディング中心のタスクか、短〜中程度のコンテキストでの対話に焦点を当てています。SWE-benchはPythonリポジトリのコード修復を測定します。WebArenaはシミュレートされたサイトでのナビゲーションをテストします。τ-benchは狭いサービス対話内でのツール呼び出しを評価します。グループの中で最も広範なGAIAでさえ、主にエージェントが正しい最終回答にたどり着けるかどうかをテストするものであり、極端なコンテキストプレッシャーの下で正しいオーケストレーション決定を下せるかどうかをテストするものではありません。

本番環境のエージェント的システムにおいて、最も難しい問題は質問に答えたりバグを修正したりすることではありません。それは次に何をすべきかを決定することです。12ステップのワークフローの7ステップ目で、15万トークンの蓄積された状態があり、正しいアクションがシステムプロンプトからの指示、先行ステップの結果、ユーザーの本来の意図、そして現在の進捗状況を統合する必要がある場合です。

既存のベンチマークはこの能力を分離していません。Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマークはそれを実現します。


このベンチマークが測定するもの

各シナリオは、単一の質問に答えます:

10万トークン以上のコンテキストを持つワークフローオーケストレーターの役割を与えられたとき、モデルは一貫して正しい次ステップの決定を下すことができるか?

各シナリオは、進行中のワークフローの現実的で凍結されたスナップショットをモデルに提示します。入力には、会話履歴、先行するワークフローステップからの蓄積された結果、ユーザーの現在のリクエスト、およびドメイン固有の指示が含まれます。モデルはこの高密度の状態を分析し、ワークフローを完了に向けて進めるための唯一の正しい次のアクションを決定しなければなりません。

これらは合成された推論パズルではありません。シナリオは、研究、生産性、コミュニケーション、文書生成、スケジューリング、データ分析、マルチアプリケーション連携など、現実世界の非コーディングワークフローから抽出されています。これらは日常的なエージェントの有用性を定義するタスクでありながら、ベンチマークの領域からはほとんど見過ごされてきました。


ベンチマークの設計

シナリオ

このベンチマークは31のシナリオ(現在も増加中)で構成されており、それぞれが単一ステップまたは複数ステップのワークフロー内の重要な決定点を表しています。各シナリオでは、モデルは以下のことを行う必要があります:

  1. 長文コンテキストの状態を解析する — しばしば10万トークンを超え、会話履歴、蓄積されたワークフローの結果、アップロードされたファイル、ユーザーの好み、システムレベルの指示を含む。
  2. 会話の文脈全体と過去のアクションを踏まえてユーザーの意図を理解する
  3. 正しい次のアクションを決定する — 提供されたオーケストレーション指示に従って、全体のワークフローを正しく進める唯一の決定。

シナリオの多様性は意図的なものです。モデルが狭いタスクタイプに過剰適合するのではなく、オーケストレーション能力を一般化できるかどうかをテストするために、幅広いドメインと複雑さのレベルにまたがっています。

評価基準

  • バイナリ採点。 各シナリオは正解か不正解かで採点されます。部分点はありません。
  • 複数の有効なアクション。 複数のアクションが合理的に正しいと考えられる場合、すべての有効な選択肢が事前に定義され、受け入れられます。
  • 3つの側面。 各モデルは以下について評価されます:
    • 精度 — モデルが正しい次ステップの決定を選択したシナリオの割合
    • 速度 — 全シナリオにわたる平均処理時間
    • コスト — シナリオごとの平均推論コスト(入力+出力トークン)。これは、1回の決定ごとに10万トークン以上のコンテキストを処理する経済的現実を反映しています。

モデル構成

すべてのモデルは温度0で、そのモデルで利用可能な最も低い推論/思考設定で実行されます。これは、創造的な探求よりも決定論、速度、コスト効率が重視される現実世界のエージェント的オーケストレーション環境を反映しています。目標は、無制限の計算能力が与えられたときに「より深く考える」能力ではなく、モデルの基本的な指示追従能力と意思決定能力を評価することです。


このベンチマークが他と異なる点

1. 非コーディングのエージェント的評価

既存のエージェント的ベンチマークは、ソフトウェアエンジニアリングに大きく偏っています。SWE-bench Verifiedは実際のリポジトリでのバグ修正を評価します。Terminal-BenchはDevOpsとシステム管理をテストします。τ-benchのようなより広範なベンチマークでさえ、顧客サービスシナリオ内の狭いツール呼び出しパターンに焦点を当てています。

このベンチマークは、汎用的で日常的なワークフローを対象としています — 専門家、研究者、消費者がAIエージェントに実際に処理してほしい複数ステップのタスクです。研究の統合、メールの調整、カレンダー管理、文書作成、マルチプラットフォームの情報収集など。これらのワークフローは、現実世界のエージェントの有用性を定義し、体系的に測定されてきませんでした。

2. 長文コンテキストのストレステスト

これはたまたま長文コンテキストを使用するベンチマークではありません。長文コンテキストこそが要点です。すべてのシナリオは10万トークン以上の入力を超えるように設計されており、モデルに一貫性を保ち、状態を追跡し、高密度の情報環境から関連するシグナルを抽出することを強制します。

短文コンテキストのベンチマークで優れた性能を発揮する多くのモデルは、長文コンテキストのプレッシャー下で著しく性能が低下します。最近のLLMエージェント評価に関する調査で指摘されているように、短文コンテキストと長文コンテキストの性能の差は、モデル能力の最も測定されていない側面の一つです。 このベンチマークは、その差を直接明らかにします。

3. コンタミネーションリスクの最小化

このベンチマークで使用されるオーケストレーションロジック、アクションの分類法、ワークフロー構造は、完全にJenova.aiの独自のものです。テストされている特定の意思決定パターンを記述した公開データセット、オープンソースフレームワーク、または出版された論文は存在しません。

データコンタミネーションは、人気のベンチマーク全体でよく知られた懸念事項です — モデルがトレーニング中にテスト問題やそれに近いものを見た可能性があり、スコアが水増しされることがあります。Stanford AI Index Report 2025は、ベンチマークの妥当性に対する継続的な課題としてコンタミネーションを特に強調しています。

私たちのオーケストレーションロジックとプロンプト構造は独自のものであり、公開ウェブ上には存在しないため、公開データセット上に構築されたベンチマークと比較してコンタミネーションの可能性は極めて低いです。クローズドウェイトモデルを含む評価と同様に、事前学習データについて絶対的な保証はできませんが、設計によってこのリスクは最小限に抑えられています。

4. 本番環境に関連するメトリクス

学術的なベンチマークは通常、精度のみを最適化します。本番環境のエージェント的システムでは、精度は必要ですが十分ではありません — モデルがどれだけ速く、どれだけ安価に正しい決定を下せるかを知る必要もあります。Pluralsightの2026年モデル比較がSWE-benchで示したように、14倍のコストで高得点を出すモデルは、エラー許容度やボリュームによっては、本番環境での選択肢として劣る場合があります。このベンチマークが3つの側面すべてを報告するのは、最適なオーケストレーションモデルは、特定のユースケースにおける精度対コスト対速度の比率に依存するからです。


結果と分析

パフォーマンス階層

結果に基づき、3つの異なるパフォーマンス階層が観察されます:

階層1:強力なオーケストレーター (65%以上)

モデル精度平均速度平均コスト
Claude 4.5 Opus76%4.1s$0.35
Gemini 3.1 Pro Preview74%32.9s$0.13
Gemini 3 Pro Preview66%8.8s$0.12
Gemini 3 Flash Preview66%5.3s$0.03
Claude Opus 4.665%4.8s$0.35
Claude Sonnet 4.565%4.2s$0.21

ClaudeとGeminiのモデルファミリーが明らかにリードしています。これは、指示追従能力とエージェント的能力に関するLLMコミュニティの広範なコンセンサスと一致する結果です。特筆すべきは、Gemini 3 Flash PreviewがClaude Opus 4.6と66%の精度で同等でありながら、コストは$0.03対$0.35であることです。これは同等の性能で12倍のコスト差であり、このベンチマークで最も効率的なオーケストレーターと言えるでしょう。

階層2:有能だが一貫性に欠ける (55–64%)

モデル精度平均速度平均コスト
DeepSeek V3.261%9.4s$0.02
Claude Sonnet 4.658%4.8s$0.21

この階層のモデルは信頼できる性能を示しますが、長文コンテキストのプレッシャー下では一貫性に欠けます。Claude Sonnet 4.6の58%は、4.5版(65%)からの顕著な低下であり、モデル世代のアップグレードが必ずしもオーケストレーションの改善につながるわけではないことを示唆しています。

階層3:55%未満

モデル精度平均速度平均コスト
MiniMax M2.550%20.5s$0.02
GPT-5.248%2.5s$0.10
Grok 4.1 Fast47%6.7s$0.01
Kimi K2.547%12.1s$0.01
GLM 544%28.2s$0.02

いくつかの観察点:

  • GPT-5.2の48%は注目すべき結果です。 ベンチマークで最速のモデル(2.5秒)ですが、精度は最も低い部類に入ります。これは「最小限の推論設定」という制約に直接関係しています。GPTファミリーのモデルは推論集約型の構成に高度に最適化されており、その拡張された推論が取り除かれると、長文コンテキストプレッシャー下での基本的な指示追従能力が大幅に低下します。これは根本的な弱点を示すものではなく、他のモデルファミリーが同程度には共有していない、推論計算へのアーキテクチャ上の依存性を示しています。

  • 主要な中国のオープンソースモデル — Kimi K2.5 (47%)、GLM 5 (44%)、MiniMax M2.5 (50%) — は、このベンチマークで比較的弱い性能を示します。 一つの考えられる要因は、トレーニングの配分です。これらのモデルは、欧米の競合他社よりも厳しい計算予算の下で開発されることが多く、市場での地位を確立するために競争力のある性能が不可欠な、確立された知名度の高いベンチマークカテゴリ(推論、コーディング、知識)にトレーニング能力を優先するのは合理的です。最適化対象となる公開ベンチマークが存在しない長文コンテキストのオーケストレーション一般化能力は、結果として重点的な焦点が当てられにくい可能性があります。これは合理的な優先順位付けであり、根本的な限界ではなく、オーケストレーション固有の評価がより確立されるにつれて、この差は縮まると予想されます。

主要な観察点

1. 主要モデル間でオーケストレーション能力に大きなばらつきがある。

最高性能モデルと最低性能モデルの差はほぼ2倍(76%対44%)です。これらのモデルの多くがMMLU、GPQA、LMArenaなどの確立されたベンチマークで数パーセントポイント以内のスコアであることを考えると、これは注目に値します。長文コンテキストのエージェント的オーケストレーションは、従来のベンチマークでは捉えきれない差別化を明らかにします。

2. 精度、速度、コストは期待されるような相関関係にない。

最も高価なモデルが最も正確であるとは限りません(Claude Opus 4.6は$0.35で65%のスコア、同価格のClaude 4.5 Opusは76%)。最速のモデル(GPT-5.2は2.5秒)は最も精度が低い部類に入ります(48%)。最も安価なモデルは、Grok 4.1 Fastの47%($0.01)からGemini 3 Flash Previewの66%($0.03)まで、精度の全範囲にわたります。これは、3つの側面すべてを一緒に評価することの重要性を再確認させます。これは、エージェント評価のベストプラクティスとして浮上しているコストパフォーマンスのパレート分析と一致する発見です。

3. 長文コンテキストプレッシャー下での指示追従能力が差別化要因である。

ほとんどのモデルが間違えるシナリオは、共通のパターンを共有する傾向があります。正しいアクションは、モデルがより「明白」または「デフォルト」のアクションよりも、コンテキストの奥深くに埋もれた特定の指示を優先することを要求します。このベンチマークで優れた成績を収めるモデルは、関連する指示が数万トークンの競合情報に囲まれていても、指示の忠実度を維持する優れた能力を示します。これはGAIAの評価フレームワークからの知見と一致しており、広範な計画とマルチツールの統合を必要とする最も要求の厳しいタスクが、エージェント能力の真の試金石であり続けています。

4. 最小限の推論設定が基本的な能力のギャップを露呈させる。

すべてのモデルは、最も低い推論設定で評価されました。高推論モードで強力な性能で知られる一部のモデルは、ここで驚くほど弱い結果を示しました。特定のモデルファミリーは、信頼性を達成するために拡張された推論モードに大幅に依存していることが観察されます。その推論計算が取り除かれると — レイテンシとコストの制約が支配的な本番オーケストレーション環境ではそうしなければならない — 根底にある指示追従能力が露わになります。これがGPT-5.2の性能不振の主な要因です。そのアーキテクチャは推論集約型のワークフローに高度に最適化されており、最小限の推論という制約が不釣り合いに影響を与えています。


方法論に関する注記

  • 再現性。 各シナリオは静的で決定論的な評価です。ライブツールの実行、外部APIへの依存、確率的な変動はありません。同じ入力とモデル構成が与えられれば、結果は完全に再現可能です。これはエージェント評価研究で提起された主要な懸念に対処します。エージェントの非決定性は通常、複数回の実行にわたる統計的評価を必要とします。このベンチマークはシナリオごとに単一の決定点を温度0で評価するため、複数回の実行集計を必要とせずに決定論的な再現性を達成します。
  • 出力の採点。 モデルの出力は、シナリオごとに事前に定義された許容可能な次ステップ決定ラベルのセットに対して評価されます。複数のアクションが有効な場合、評価前にすべてが許可セットに含まれます。
  • シナリオの選択。 シナリオは、敵対的なエッジケースではなく、現実的なオーケストレーションの課題を代表するように厳選されています。目標は、モデルの失敗を設計することではなく、本番環境に関連する能力を測定することです。
  • 継続的な拡張。 ベンチマークは積極的に維持されています。本番使用で新しいワークフローパターンが出現するにつれて、新しいシナリオが追加されます。現在のバージョン(n=31)は初期リリースです。

ベンチマーク界における位置づけ

ベンチマーク主な焦点コンテキスト長ドメイン
SWE-bench VerifiedGitHubリポジトリでのバグ修正中程度コーディング
GAIAマルチツール質疑応答中程度一般
AgentBenchマルチ環境エージェントの振る舞い様々8ドメイン
WebArenaウェブナビゲーションタスク短〜中程度ウェブ
τ-benchサービスシナリオでのツール使用短い顧客サービス
Jenova オーケストレーション ベンチマーク長文コンテキスト下での次ステップ決定10万トークン以上非コーディングワークフロー

このベンチマークは、既存の評価と競合したり、それらを置き換えたりするものではありません。SWE-benchはコーディングエージェントの標準であり続けます。GAIAは一般的なエージェント能力の最も広範なテストであり続けます。このベンチマークは、異なる層を分離します:非コーディングドメインにおける極端なコンテキストプレッシャー下での次ステップ決定の質。


エージェント設計への示唆

我々の結果は、オーケストレーション能力が推論能力とは別のものであることを示唆しています。推論ベンチマークでの高性能は、長文コンテキストのオーケストレーションでの高性能を保証しません。

エージェント的システムを構築する開発者にとって、この分離は実践的な結果をもたらします:

  1. モデルの選択。 「最も賢い」モデルが常に最も信頼できるオーケストレーターであるとは限りません。推論ベンチマークだけでモデルを評価すると、オーケストレーション層にとって最適でない選択につながる可能性があります。
  2. コスト最適化。 推論のオーバーヘッドが低いモデルは、コンテキストプレッシャー下での指示追従の安定性が優れていれば、高価な最先端モデルを上回ることができます。本番ボリュームでは、この差は大幅に拡大します。
  3. アーキテクチャ。 オーケストレーションとタスク実行の両方に単一のモデルに依存するのは非効率的かもしれません。専門的なルーティング — オーケストレーション層に高安定性モデルを使用し、特定のサブタスクに高推論モデルを使用する — は、より低いコストでより良い信頼性をもたらす可能性があります。

私たちは、そのアーキテクチャ上の決定のためのデータポイントを提供するために、これらの結果を公開しています。より多くのドメインとワークフローパターンをカバーするためにシナリオセットを拡大するにつれて、これらのメトリクスを更新し続けます。


Jenova.ai 長文コンテキスト エージェント オーケストレーション ベンチマークは、本番オーケストレーション環境でのモデル性能を評価するために、Jenovaエンジニアリングチームによって開発されました。技術的なお問い合わせや方法論の詳細については、[email protected]までご連絡ください。