Benchmark Orkestrasi Agen Konteks Panjang Jenova.ai (Februari 2026)


2026-02-24


Benchmark Orkestrasi Agen Konteks Panjang Jenova.ai — Hasil di 31 skenario yang menunjukkan akurasi, kecepatan, dan biaya untuk model AI terkemuka.

Tinjauan

Benchmark ini mengukur seberapa baik model AI terdepan membuat keputusan orkestrasi langkah berikutnya yang benar dalam alur kerja non-coding yang realistis di bawah tekanan konteks yang sangat panjang (100k+ token). Setiap model dievaluasi pada tiga dimensi: akurasi (% skenario yang benar), latensi rata-rata, dan biaya inferensi rata-rata (token input + output).

Hasil utama: Claude 4.5 Opus (76%) dan Gemini 3.1 Pro Preview (74%) memimpin benchmark ini. Secara lebih luas, keluarga model Claude dan Gemini mendominasi puncak papan peringkat — konsisten dengan penilaian komunitas LLM umum tentang kemampuan mengikuti instruksi dan kemampuan agen mereka yang kuat. Kesenjangan antara performer teratas dan terbawah hampir 2x, mengungkapkan diferensiasi yang tidak ditangkap oleh benchmark tradisional.


Mengapa Benchmark Ini

Industri AI telah berinvestasi besar dalam benchmarking. SWE-bench Verified mengevaluasi perbaikan bug di repositori GitHub nyata. GAIA menguji penjawaban pertanyaan multi-alat. AgentBench menguji agen di delapan lingkungan interaktif. WebArena mengukur navigasi web. τ-bench mengevaluasi pemanggilan alat dalam skenario layanan pelanggan. Benchmark ini telah berperan penting dalam memajukan kemampuan agen.

Namun ada polanya: mayoritas evaluasi ini berfokus pada tugas yang berpusat pada coding atau interaksi konteks pendek hingga sedang. SWE-bench mengukur perbaikan kode di repositori Python. WebArena menguji navigasi di situs simulasi. τ-bench mengevaluasi pemanggilan alat dalam dialog layanan yang sempit. Bahkan GAIA, yang paling luas dari kelompok ini, terutama menguji apakah agen dapat sampai pada jawaban akhir yang benar — bukan apakah ia dapat membuat keputusan orkestrasi yang tepat di bawah tekanan konteks yang ekstrem.

Dalam sistem agen produksi, masalah tersulit bukanlah menjawab pertanyaan atau memperbaiki bug. Ini adalah memutuskan apa yang harus dilakukan selanjutnya — pada langkah 7 dari alur kerja 12 langkah, dengan 150.000 token status yang terakumulasi, ketika tindakan yang benar memerlukan sintesis instruksi dari prompt sistem, hasil dari langkah-langkah sebelumnya, niat asli pengguna, dan status kemajuan saat ini.

Benchmark yang ada tidak mengisolasi kemampuan ini. Benchmark Orkestrasi Agen Konteks Panjang Jenova.ai melakukannya.


Apa yang Diukur Benchmark Ini

Setiap skenario menjawab satu pertanyaan:

Ketika ditempatkan dalam peran sebagai orkestrator alur kerja dengan lebih dari 100.000 token konteks, dapatkah sebuah model secara konsisten membuat keputusan langkah berikutnya yang benar?

Setiap skenario menyajikan model dengan gambaran realistis dan beku dari alur kerja yang sedang berlangsung. Input dapat mencakup riwayat percakapan, hasil yang terakumulasi dari langkah-langkah alur kerja sebelumnya, permintaan pengguna saat ini, dan instruksi spesifik domain. Model harus menganalisis keadaan padat ini dan menentukan satu tindakan berikutnya yang benar untuk memajukan alur kerja menuju penyelesaian.

Ini bukan teka-teki penalaran sintetis. Skenario diambil dari alur kerja dunia nyata, non-coding yang mencakup penelitian, produktivitas, komunikasi, pembuatan dokumen, penjadwalan, analisis data, dan koordinasi multi-aplikasi — jenis tugas yang mendefinisikan utilitas agen sehari-hari tetapi sebagian besar absen dari lanskap benchmarking.


Desain Benchmark

Skenario

Benchmark ini terdiri dari 31 skenario (dan terus bertambah), masing-masing mewakili satu titik keputusan kritis dalam alur kerja satu langkah atau multi-langkah yang potensial. Setiap skenario mengharuskan model untuk:

  1. Menganalisis keadaan konteks panjang — seringkali melebihi 100.000 token — yang mencakup riwayat percakapan, hasil alur kerja yang terakumulasi, file yang diunggah, preferensi pengguna, dan instruksi tingkat sistem.
  2. Memahami niat pengguna dalam konteks penuh percakapan dan tindakan sebelumnya yang telah diambil.
  3. Menentukan tindakan berikutnya yang benar — satu-satunya keputusan yang secara benar memajukan alur kerja keseluruhan sesuai dengan instruksi orkestrasi yang diberikan.

Keragaman skenario ini disengaja. Mereka mencakup berbagai domain dan tingkat kompleksitas untuk menguji apakah model dapat menggeneralisasi kemampuan orkestrasinya daripada overfitting pada jenis tugas yang sempit.

Kriteria Evaluasi

  • Penilaian biner. Setiap skenario dinilai benar atau salah. Tidak ada kredit parsial.
  • Beberapa tindakan yang valid. Dalam kasus di mana lebih dari satu tindakan dapat dianggap benar secara wajar, semua opsi yang valid telah ditentukan sebelumnya dan diterima.
  • Tiga dimensi. Setiap model dievaluasi pada:
    • Akurasi — persentase skenario di mana model memilih keputusan langkah berikutnya yang benar
    • Kecepatan — waktu pemrosesan rata-rata di semua skenario
    • Biaya — biaya inferensi rata-rata per skenario (token input + output), yang mencerminkan realitas ekonomi pemrosesan konteks 100k+ token untuk setiap keputusan

Konfigurasi Model

Semua model dijalankan pada suhu 0 dengan pengaturan penalaran/pemikiran terendah yang tersedia untuk model tersebut. Ini mencerminkan lingkungan orkestrasi agen dunia nyata di mana determinisme, kecepatan, dan efisiensi biaya lebih penting daripada eksplorasi kreatif. Tujuannya adalah untuk mengevaluasi kemampuan dasar model dalam mengikuti instruksi dan pengambilan keputusan, bukan kemampuannya untuk "berpikir lebih keras" ketika diberi komputasi tak terbatas.


Apa yang Membuat Benchmark Ini Berbeda

1. Evaluasi Agen Non-Coding

Benchmark agen yang ada sangat condong ke rekayasa perangkat lunak. SWE-bench Verified mengevaluasi perbaikan bug di repositori nyata. Terminal-Bench menguji DevOps dan administrasi sistem. Bahkan benchmark yang lebih luas seperti τ-bench berfokus pada pola pemanggilan alat yang sempit dalam skenario layanan pelanggan.

Benchmark ini menargetkan alur kerja sehari-hari yang serbaguna — tugas multi-langkah yang benar-benar dibutuhkan oleh para profesional, peneliti, dan konsumen untuk ditangani oleh agen AI. Sintesis penelitian, koordinasi email, manajemen kalender, pembuatan dokumen, pengumpulan informasi multi-platform. Alur kerja ini mendefinisikan utilitas agen dunia nyata dan secara sistematis kurang terukur.

2. Uji Stres Konteks Panjang

Ini bukan benchmark yang kebetulan menggunakan konteks panjang. Konteks panjang adalah intinya. Setiap skenario dirancang untuk melebihi 100.000 token input, memaksa model untuk menjaga koherensi, melacak keadaan, dan mengekstrak sinyal yang relevan dari lingkungan informasi yang padat.

Banyak model yang berkinerja baik pada benchmark konteks pendek mengalami penurunan signifikan di bawah tekanan konteks panjang. Seperti yang dicatat dalam survei terbaru tentang evaluasi agen LLM, kesenjangan antara kinerja konteks pendek dan konteks panjang tetap menjadi salah satu dimensi kemampuan model yang paling sedikit diukur. Benchmark ini secara langsung mengungkap kesenjangan tersebut.

3. Meminimalkan Risiko Kontaminasi

Logika orkestrasi, taksonomi tindakan, dan struktur alur kerja yang digunakan dalam benchmark ini sepenuhnya milik Jenova.ai. Tidak ada dataset publik, kerangka kerja sumber terbuka, atau makalah yang diterbitkan yang menjelaskan pola pengambilan keputusan spesifik yang sedang diuji.

Kontaminasi data adalah kekhawatiran yang terdokumentasi dengan baik di seluruh benchmark populer — model mungkin telah melihat pertanyaan tes atau varian yang dekat selama pelatihan, yang menggelembungkan skor mereka. Laporan Indeks AI Stanford 2025 secara khusus menyoroti kontaminasi sebagai tantangan berkelanjutan untuk validitas benchmark.

Karena logika orkestrasi dan struktur prompt kami bersifat proprietary dan tidak ada di web publik, kemungkinan kontaminasi sangat rendah dibandingkan dengan benchmark yang dibangun di atas dataset yang tersedia untuk umum. Seperti halnya evaluasi yang melibatkan model dengan bobot tertutup, kami tidak dapat memberikan jaminan mutlak tentang data pra-pelatihan — tetapi desain ini meminimalkan risiko ini secara konstruksi.

4. Metrik yang Relevan dengan Produksi

Benchmark akademis biasanya mengoptimalkan akurasi saja. Dalam sistem agen produksi, akurasi diperlukan tetapi tidak cukup — Anda juga perlu tahu seberapa cepat dan murah sebuah model dapat membuat keputusan yang benar. Seperti yang ditunjukkan oleh perbandingan model 2026 Pluralsight dengan SWE-bench, model dengan skor lebih tinggi dengan biaya 14x lipat mungkin merupakan pilihan produksi yang lebih buruk tergantung pada toleransi kesalahan dan volume. Benchmark ini melaporkan ketiga dimensi karena model orkestrasi yang optimal bergantung pada rasio akurasi-terhadap-biaya-terhadap-kecepatan untuk kasus penggunaan spesifik Anda.


Hasil & Analisis

Tingkatan Kinerja

Berdasarkan hasil, kami mengamati tiga tingkatan kinerja yang berbeda:

Tingkat 1: Orkestrator Kuat (65%+)

ModelAkurasiKecepatan Rata-rataBiaya Rata-rata
Claude 4.5 Opus76%4.1s$0.35
Gemini 3.1 Pro Preview74%32.9s$0.13
Gemini 3 Pro Preview66%8.8s$0.12
Gemini 3 Flash Preview66%5.3s$0.03
Claude Opus 4.665%4.8s$0.35
Claude Sonnet 4.565%4.2s$0.21

Keluarga model Claude dan Gemini jelas memimpin — hasil yang sejalan dengan konsensus komunitas LLM yang lebih luas tentang kemampuan mengikuti instruksi dan kemampuan agen mereka. Terutama, Gemini 3 Flash Preview menyamai Claude Opus 4.6 dengan akurasi 66% dengan biaya $0.03 vs. $0.35 — perbedaan biaya 12x untuk kinerja yang setara, menjadikannya orkestrator yang paling efisien dalam benchmark ini.

Tingkat 2: Mampu tetapi Tidak Konsisten (55–64%)

ModelAkurasiKecepatan Rata-rataBiaya Rata-rata
DeepSeek V3.261%9.4s$0.02
Claude Sonnet 4.658%4.8s$0.21

Model di tingkat ini berkinerja cukup baik tetapi menunjukkan lebih banyak inkonsistensi di bawah tekanan konteks panjang. Claude Sonnet 4.6 di 58% adalah penurunan yang signifikan dari mitranya 4.5 (65%), menunjukkan bahwa peningkatan generasi model tidak selalu berarti peningkatan orkestrasi.

Tingkat 3: Di Bawah 55%

ModelAkurasiKecepatan Rata-rataBiaya Rata-rata
MiniMax M2.550%20.5s$0.02
GPT-5.248%2.5s$0.10
Grok 4.1 Fast47%6.7s$0.01
Kimi K2.547%12.1s$0.01
GLM 544%28.2s$0.02

Beberapa pengamatan di sini:

  • GPT-5.2 di 48% adalah hasil yang patut dicatat. Ini adalah model tercepat dalam benchmark (2.5s) tetapi termasuk yang paling tidak akurat. Ini terkait langsung dengan batasan "pengaturan penalaran minimal" — model keluarga GPT sangat dioptimalkan untuk konfigurasi yang intensif penalaran, dan ketika penalaran yang diperluas itu dihilangkan, kemampuan dasar mengikuti instruksi di bawah tekanan konteks panjang turun secara substansial. Ini tidak menunjukkan kelemahan mendasar melainkan ketergantungan arsitektural pada komputasi penalaran yang tidak dimiliki oleh keluarga model lain pada tingkat yang sama.

  • Model sumber terbuka terkemuka dari Tiongkok — Kimi K2.5 (47%), GLM 5 (44%), dan MiniMax M2.5 (50%) — berkinerja relatif lebih lemah pada benchmark ini. Salah satu faktor yang mungkin berkontribusi adalah alokasi pelatihan. Model-model ini, yang sering dikembangkan dengan anggaran komputasi yang lebih ketat daripada rekan-rekan Barat mereka, mungkin secara wajar memprioritaskan kapasitas pelatihan ke kategori benchmark yang sudah mapan dan memiliki visibilitas tinggi (penalaran, coding, pengetahuan) di mana kinerja kompetitif sangat penting untuk posisi pasar. Generalisasi orkestrasi konteks panjang — kemampuan yang tidak memiliki benchmark publik yang ada untuk dioptimalkan — mungkin menerima fokus yang kurang terarah sebagai hasilnya. Ini adalah prioritas yang rasional, bukan batasan mendasar, dan kami berharap kesenjangan ini akan menyempit seiring dengan semakin mapannya evaluasi khusus orkestrasi.

Pengamatan Kunci

1. Varians yang signifikan dalam kemampuan orkestrasi di antara model-model terkemuka.

Kesenjangan antara model berkinerja terbaik dan terburuk hampir 2x (76% vs. 44%). Ini patut dicatat mengingat banyak dari model ini mendapat skor dalam beberapa poin persentase satu sama lain pada benchmark yang sudah mapan seperti MMLU, GPQA, atau LMArena. Orkestrasi agen konteks panjang mengungkapkan diferensiasi yang tidak ditangkap oleh benchmark tradisional.

2. Akurasi, kecepatan, dan biaya tidak berkorelasi seperti yang Anda harapkan.

Model termahal bukanlah yang paling akurat (Claude Opus 4.6 dengan harga $0.35 mendapat skor 65%, sedangkan Claude 4.5 Opus dengan harga yang sama mendapat skor 76%). Model tercepat (GPT-5.2 dengan 2.5s) termasuk yang paling tidak akurat (48%). Model termurah mencakup seluruh rentang akurasi — dari Grok 4.1 Fast di 47% ($0.01) hingga Gemini 3 Flash Preview di 66% ($0.03). Ini memperkuat pentingnya mengevaluasi ketiga dimensi secara bersamaan — sebuah temuan yang konsisten dengan analisis Pareto biaya-kinerja yang muncul sebagai praktik terbaik dalam evaluasi agen.

3. Mengikuti instruksi di bawah tekanan konteks panjang adalah pembedanya.

Skenario yang salah dijawab oleh sebagian besar model cenderung memiliki pola yang sama: tindakan yang benar mengharuskan model untuk memprioritaskan instruksi spesifik yang terkubur jauh di dalam konteks daripada tindakan yang lebih "jelas" atau "default". Model yang unggul dalam benchmark ini menunjukkan kemampuan superior untuk menjaga kesetiaan instruksi bahkan ketika instruksi yang relevan dikelilingi oleh puluhan ribu token informasi yang bersaing. Ini sejalan dengan temuan dari kerangka evaluasi GAIA, di mana tugas-tugas yang paling menuntut — yang memerlukan perencanaan ekstensif dan integrasi multi-alat — tetap menjadi ajang pembuktian sejati untuk kemampuan agen.

4. Pengaturan penalaran minimal mengungkap kesenjangan kemampuan dasar.

Semua model dievaluasi pada pengaturan penalaran terendah mereka. Beberapa model yang dikenal dengan kinerja kuat dalam mode penalaran tinggi menunjukkan hasil yang sangat lemah di sini. Kami mengamati bahwa keluarga model tertentu secara substansial lebih bergantung pada mode penalaran yang diperluas untuk mencapai keandalan. Ketika komputasi penalaran itu dihilangkan — seperti yang harus dilakukan di lingkungan orkestrasi produksi di mana kendala latensi dan biaya mendominasi — kemampuan dasar mengikuti instruksi menjadi terbuka. Ini adalah faktor utama di balik kinerja buruk GPT-5.2: arsitekturnya sangat dioptimalkan untuk alur kerja yang intensif penalaran, dan batasan penalaran minimal secara tidak proporsional memengaruhinya.


Catatan Metodologi

  • Reproduktifitas. Setiap skenario adalah evaluasi statis dan deterministik. Tidak ada eksekusi alat langsung, tidak ada ketergantungan API eksternal, dan tidak ada variasi stokastik. Dengan input dan konfigurasi model yang sama, hasilnya sepenuhnya dapat direproduksi. Ini mengatasi kekhawatiran utama yang diangkat dalam penelitian evaluasi agen: non-determinisme agen biasanya memerlukan evaluasi statistik di beberapa kali proses. Karena benchmark ini mengevaluasi satu titik keputusan per skenario pada suhu 0, ia mencapai reproduktifitas deterministik tanpa memerlukan agregasi multi-proses.
  • Penilaian output. Output model dievaluasi terhadap serangkaian label keputusan langkah berikutnya yang dapat diterima yang telah ditentukan sebelumnya per skenario. Di mana beberapa tindakan valid, semuanya termasuk dalam set yang diizinkan sebelum evaluasi.
  • Pemilihan skenario. Skenario dikurasi untuk mewakili tantangan orkestrasi yang realistis, bukan kasus-kasus ekstrem yang merugikan. Tujuannya adalah untuk mengukur kemampuan yang relevan dengan produksi, bukan untuk merekayasa kegagalan model.
  • Ekspansi berkelanjutan. Benchmark ini dipelihara secara aktif. Skenario baru ditambahkan seiring munculnya pola alur kerja baru dalam penggunaan produksi. Versi saat ini (n=31) merupakan rilis awal.

Posisi dalam Lanskap Benchmark

BenchmarkFokus UtamaPanjang KonteksDomain
SWE-bench VerifiedPerbaikan bug di repo GitHub nyataSedangCoding
GAIAPenjawaban pertanyaan multi-alatSedangUmum
AgentBenchPerilaku agen multi-lingkunganBervariasi8 domain
WebArenaTugas navigasi webPendek–sedangWeb
τ-benchPenggunaan alat dalam skenario layananPendekLayanan pelanggan
Benchmark Orkestrasi JenovaKeputusan langkah berikutnya di bawah konteks panjang100k+ tokenAlur kerja non-coding

Benchmark ini tidak bersaing dengan atau menggantikan evaluasi yang ada. SWE-bench tetap menjadi standar untuk agen coding. GAIA tetap menjadi tes terluas untuk kemampuan agen umum. Benchmark ini mengisolasi lapisan yang berbeda: kualitas keputusan langkah berikutnya di bawah tekanan konteks ekstrem dalam domain non-coding.


Implikasi untuk Desain Agen

Hasil kami menunjukkan bahwa kemampuan orkestrasi berbeda dari kemampuan penalaran. Kinerja tinggi pada benchmark penalaran tidak menjamin kinerja tinggi pada orkestrasi konteks panjang.

Bagi pengembang yang membangun sistem agen, pemisahan ini memiliki konsekuensi praktis:

  1. Pemilihan Model. Model "terpintar" tidak selalu merupakan orkestrator yang paling andal. Mengevaluasi model hanya pada benchmark penalaran dapat menyebabkan pilihan yang suboptimal untuk lapisan orkestrasi.
  2. Optimalisasi Biaya. Model dengan overhead penalaran yang lebih rendah dapat mengungguli model terdepan yang mahal jika mereka memiliki stabilitas mengikuti instruksi yang superior di bawah tekanan konteks. Pada volume produksi, perbedaan ini akan berlipat ganda secara signifikan.
  3. Arsitektur. Mengandalkan satu model untuk orkestrasi dan eksekusi tugas mungkin tidak efisien. Perutean khusus — menggunakan model stabilitas tinggi untuk lapisan orkestrasi dan model penalaran tinggi untuk sub-tugas tertentu — dapat menghasilkan keandalan yang lebih baik dengan biaya lebih rendah.

Kami merilis hasil ini untuk memberikan titik data untuk keputusan arsitektural tersebut. Seiring kami memperluas set skenario untuk mencakup lebih banyak domain dan pola alur kerja, kami akan terus memperbarui metrik ini.


Benchmark Orkestrasi Agen Konteks Panjang Jenova.ai dikembangkan oleh tim teknik Jenova untuk mengevaluasi kinerja model di lingkungan orkestrasi produksi. Untuk pertanyaan teknis atau detail metodologi, hubungi [email protected].