Benchmark Điều phối Tác nhân Ngữ cảnh Dài của Jenova.ai (Tháng 2 năm 2026)


2026-02-24


Benchmark Điều phối Tác nhân Ngữ cảnh Dài của Jenova.ai — Kết quả trên 31 kịch bản cho thấy độ chính xác, tốc độ và chi phí của các mô hình AI hàng đầu.

Tổng quan

Benchmark này đo lường mức độ hiệu quả của các mô hình AI tiên tiến trong việc đưa ra quyết định điều phối bước tiếp theo một cách chính xác trong các quy trình làm việc thực tế, không liên quan đến lập trình dưới áp lực ngữ cảnh cực dài (hơn 100k token). Mỗi mô hình được đánh giá trên ba phương diện: độ chính xác (% kịch bản đúng), độ trễ trung bình, và chi phí suy luận trung bình (token đầu vào + đầu ra).

Kết quả nổi bật: Claude 4.5 Opus (76%)Gemini 3.1 Pro Preview (74%) dẫn đầu benchmark. Nhìn chung, các dòng mô hình Claude và Gemini chiếm ưu thế ở top đầu bảng xếp hạng — phù hợp với đánh giá chung của cộng đồng LLM về khả năng tuân thủ hướng dẫn và năng lực tác nhân mạnh mẽ của chúng. Khoảng cách giữa các mô hình có hiệu suất cao nhất và thấp nhất gần gấp 2 lần, cho thấy sự khác biệt mà các benchmark truyền thống không nắm bắt được.


Tại sao lại có Benchmark này

Ngành công nghiệp AI đã đầu tư rất nhiều vào việc xây dựng benchmark. SWE-bench Verified đánh giá việc sửa lỗi trong các kho mã nguồn GitHub thực tế. GAIA kiểm tra khả năng trả lời câu hỏi đa công cụ. AgentBench kiểm tra áp lực các tác nhân trên tám môi trường tương tác. WebArena đo lường khả năng điều hướng web. τ-bench đánh giá việc gọi công cụ trong các kịch bản dịch vụ khách hàng. Những benchmark này đã đóng vai trò quan trọng trong việc thúc đẩy năng lực của các tác nhân.

Nhưng có một khuôn mẫu: phần lớn các đánh giá này tập trung vào các nhiệm vụ lấy lập trình làm trung tâm hoặc các tương tác ngữ cảnh từ ngắn đến trung bình. SWE-bench đo lường việc sửa mã trong các kho mã nguồn Python. WebArena kiểm tra khả năng điều hướng trên các trang web mô phỏng. τ-bench đánh giá việc gọi công cụ trong các cuộc đối thoại dịch vụ hẹp. Ngay cả GAIA, benchmark rộng nhất trong nhóm, chủ yếu kiểm tra xem một tác nhân có thể đưa ra câu trả lời cuối cùng chính xác hay không — chứ không phải liệu nó có thể đưa ra quyết định điều phối đúng đắn dưới áp lực ngữ cảnh cực lớn hay không.

Trong các hệ thống tác nhân sản xuất, vấn đề khó nhất không phải là trả lời một câu hỏi hay sửa một lỗi. Đó là quyết định phải làm gì tiếp theo — ở bước 7 của một quy trình 12 bước, với 150.000 token trạng thái tích lũy, khi hành động đúng đòi hỏi phải tổng hợp các hướng dẫn từ lời nhắc hệ thống, kết quả từ các bước trước, ý định ban đầu của người dùng và trạng thái tiến trình hiện tại.

Các benchmark hiện có không tách biệt được khả năng này. Benchmark Điều phối Tác nhân Ngữ cảnh Dài của Jenova.ai thì có.


Benchmark này đo lường điều gì

Mỗi kịch bản trả lời một câu hỏi duy nhất:

Khi được đặt vào vai trò của một người điều phối quy trình làm việc với hơn 100.000 token ngữ cảnh, một mô hình có thể liên tục đưa ra quyết định đúng đắn cho bước tiếp theo không?

Mỗi kịch bản trình bày cho mô hình một ảnh chụp nhanh thực tế, cố định của một quy trình làm việc đang diễn ra. Đầu vào có thể bao gồm lịch sử cuộc trò chuyện, kết quả tích lũy từ các bước quy trình làm việc trước đó, yêu cầu hiện tại của người dùng và các hướng dẫn cụ thể theo lĩnh vực. Mô hình phải phân tích trạng thái dày đặc này và xác định hành động tiếp theo duy nhất đúng để thúc đẩy quy trình làm việc đến khi hoàn thành.

Đây không phải là những câu đố suy luận tổng hợp. Các kịch bản được lấy từ các quy trình làm việc thực tế, không liên quan đến lập trình, bao gồm nghiên cứu, năng suất, giao tiếp, tạo tài liệu, lập lịch, phân tích dữ liệu và phối hợp đa ứng dụng — những loại nhiệm vụ xác định tiện ích hàng ngày của tác nhân nhưng phần lớn đã vắng mặt trong bối cảnh benchmark.


Thiết kế Benchmark

Các kịch bản

Benchmark bao gồm 31 kịch bản (và đang tăng lên), mỗi kịch bản đại diện cho một điểm quyết định quan trọng duy nhất trong một quy trình làm việc tiềm năng một bước hoặc nhiều bước. Mỗi kịch bản yêu cầu mô hình:

  1. Phân tích một trạng thái ngữ cảnh dài — thường vượt quá 100.000 token — bao gồm lịch sử cuộc trò chuyện, kết quả quy trình làm việc tích lũy, các tệp đã tải lên, sở thích của người dùng và các hướng dẫn cấp hệ thống.
  2. Hiểu ý định của người dùng trong toàn bộ ngữ cảnh của cuộc trò chuyện và bất kỳ hành động nào đã được thực hiện trước đó.
  3. Xác định hành động tiếp theo chính xác — quyết định duy nhất giúp tiến triển đúng quy trình làm việc tổng thể theo các hướng dẫn điều phối được cung cấp.

Sự đa dạng của các kịch bản là có chủ ý. Chúng bao gồm một loạt các lĩnh vực và mức độ phức tạp để kiểm tra xem một mô hình có thể khái quát hóa khả năng điều phối của mình thay vì trang bị quá mức cho một loại nhiệm vụ hẹp hay không.

Tiêu chí đánh giá

  • Chấm điểm nhị phân. Mỗi kịch bản được chấm là đúng hoặc sai. Không có điểm thành phần.
  • Nhiều hành động hợp lệ. Trong trường hợp có nhiều hơn một hành động có thể được coi là đúng một cách hợp lý, tất cả các tùy chọn hợp lệ đều được xác định trước và chấp nhận.
  • Ba phương diện. Mỗi mô hình được đánh giá trên:
    • Độ chính xác — phần trăm các kịch bản mà mô hình đã chọn quyết định bước tiếp theo chính xác
    • Tốc độ — thời gian xử lý trung bình trên tất cả các kịch bản
    • Chi phí — chi phí suy luận trung bình cho mỗi kịch bản (token đầu vào + đầu ra), phản ánh thực tế kinh tế của việc xử lý ngữ cảnh hơn 100k token cho mỗi quyết định

Cấu hình mô hình

Tất cả các mô hình đều được chạy ở nhiệt độ 0 với cài đặt suy luận/tư duy thấp nhất có sẵn cho mô hình đó. Điều này phản ánh môi trường điều phối tác nhân trong thế giới thực, nơi tính xác định, tốc độ và hiệu quả chi phí quan trọng hơn sự khám phá sáng tạo. Mục tiêu là đánh giá khả năng tuân thủ hướng dẫn và ra quyết định cơ bản của mô hình, chứ không phải khả năng "suy nghĩ kỹ hơn" khi được cung cấp tài nguyên tính toán không giới hạn.


Điều gì làm cho Benchmark này khác biệt

1. Đánh giá Tác nhân không liên quan đến lập trình

Các benchmark tác nhân hiện có nghiêng nhiều về kỹ thuật phần mềm. SWE-bench Verified đánh giá việc sửa lỗi trong các kho mã nguồn thực tế. Terminal-Bench kiểm tra DevOps và quản trị hệ thống. Ngay cả các benchmark rộng hơn như τ-bench cũng tập trung vào các mẫu gọi công cụ hẹp trong các kịch bản dịch vụ khách hàng.

Benchmark này nhắm đến các quy trình làm việc hàng ngày, đa mục đích — các nhiệm vụ nhiều bước mà các chuyên gia, nhà nghiên cứu và người tiêu dùng thực sự cần các tác nhân AI xử lý. Tổng hợp nghiên cứu, phối hợp email, quản lý lịch, tạo tài liệu, thu thập thông tin đa nền tảng. Những quy trình làm việc này xác định tiện ích thực tế của tác nhân và đã bị đo lường thiếu một cách có hệ thống.

2. Kiểm tra áp lực ngữ cảnh dài

Đây không phải là một benchmark tình cờ sử dụng ngữ cảnh dài. Ngữ cảnh dài chính là điểm mấu chốt. Mỗi kịch bản được thiết kế để vượt quá 100.000 token đầu vào, buộc mô hình phải duy trì sự mạch lạc, theo dõi trạng thái và trích xuất các tín hiệu liên quan từ một môi trường thông tin dày đặc.

Nhiều mô hình hoạt động tốt trên các benchmark ngữ cảnh ngắn lại suy giảm đáng kể dưới áp lực ngữ cảnh dài. Như đã lưu ý trong các khảo sát gần đây về đánh giá tác nhân LLM, khoảng cách giữa hiệu suất ngữ cảnh ngắn và ngữ cảnh dài vẫn là một trong những khía cạnh ít được đo lường nhất về năng lực của mô hình. Benchmark này trực tiếp phơi bày khoảng cách đó.

3. Giảm thiểu rủi ro nhiễm bẩn

Logic điều phối, phân loại hành động và cấu trúc quy trình làm việc được sử dụng trong benchmark này là hoàn toàn độc quyền của Jenova.ai. Không có bộ dữ liệu công khai, khung mã nguồn mở hoặc bài báo nào được xuất bản mô tả các mẫu ra quyết định cụ thể đang được kiểm tra.

Nhiễm bẩn dữ liệu là một mối lo ngại được ghi nhận rõ ràng trên các benchmark phổ biến — các mô hình có thể đã thấy các câu hỏi kiểm tra hoặc các biến thể gần giống trong quá trình huấn luyện, làm tăng điểm số của chúng. Báo cáo Chỉ số AI của Stanford năm 2025 đặc biệt nhấn mạnh nhiễm bẩn là một thách thức liên tục đối với tính hợp lệ của benchmark.

Bởi vì logic điều phối và cấu trúc lời nhắc của chúng tôi là độc quyền và không có mặt trên web công cộng, khả năng nhiễm bẩn là cực kỳ thấp so với các benchmark được xây dựng trên các bộ dữ liệu có sẵn công khai. Như với bất kỳ đánh giá nào liên quan đến các mô hình trọng số đóng, chúng tôi không thể đưa ra đảm bảo tuyệt đối về dữ liệu tiền huấn luyện — nhưng thiết kế này giảm thiểu rủi ro này bằng cách xây dựng.

4. Các chỉ số liên quan đến sản xuất

Các benchmark học thuật thường chỉ tối ưu hóa cho độ chính xác. Trong các hệ thống tác nhân sản xuất, độ chính xác là cần thiết nhưng không đủ — bạn cũng cần biết một mô hình có thể đưa ra quyết định đúng nhanh và rẻ như thế nào. Như so sánh mô hình năm 2026 của Pluralsight đã chứng minh với SWE-bench, một mô hình có điểm cao hơn với chi phí gấp 14 lần có thể là một lựa chọn sản xuất tồi tệ hơn tùy thuộc vào khả năng chịu lỗi và khối lượng. Benchmark này báo cáo cả ba phương diện vì mô hình điều phối tối ưu phụ thuộc vào tỷ lệ chính xác-chi phí-tốc độ cho trường hợp sử dụng cụ thể của bạn.


Kết quả & Phân tích

Các cấp hiệu suất

Dựa trên kết quả, chúng tôi quan sát thấy ba cấp hiệu suất riêng biệt:

Cấp 1: Các nhà điều phối mạnh (65%+)

Mô hìnhĐộ chính xácTốc độ TBChi phí TB
Claude 4.5 Opus76%4.1s$0.35
Gemini 3.1 Pro Preview74%32.9s$0.13
Gemini 3 Pro Preview66%8.8s$0.12
Gemini 3 Flash Preview66%5.3s$0.03
Claude Opus 4.665%4.8s$0.35
Claude Sonnet 4.565%4.2s$0.21

Các dòng mô hình Claude và Gemini rõ ràng dẫn đầu — một kết quả phù hợp với sự đồng thuận rộng rãi của cộng đồng LLM về khả năng tuân thủ hướng dẫn và năng lực tác nhân của chúng. Đáng chú ý, Gemini 3 Flash Preview ngang bằng với Claude Opus 4.6 ở mức độ chính xác 66% trong khi chi phí là $0.03 so với $0.35 — chênh lệch chi phí 12 lần cho hiệu suất tương đương, có thể cho rằng đây là nhà điều phối hiệu quả nhất trong benchmark.

Cấp 2: Có khả năng nhưng không nhất quán (55–64%)

Mô hìnhĐộ chính xácTốc độ TBChi phí TB
DeepSeek V3.261%9.4s$0.02
Claude Sonnet 4.658%4.8s$0.21

Các mô hình ở cấp này hoạt động đáng tin cậy nhưng cho thấy sự không nhất quán hơn dưới áp lực ngữ cảnh dài. Claude Sonnet 4.6 ở mức 58% là một bước lùi đáng chú ý so với phiên bản 4.5 của nó (65%), cho thấy rằng việc nâng cấp thế hệ mô hình không phải lúc nào cũng chuyển thành cải tiến về điều phối.

Cấp 3: Dưới 55%

Mô hìnhĐộ chính xácTốc độ TBChi phí TB
MiniMax M2.550%20.5s$0.02
GPT-5.248%2.5s$0.10
Grok 4.1 Fast47%6.7s$0.01
Kimi K2.547%12.1s$0.01
GLM 544%28.2s$0.02

Một vài quan sát ở đây:

  • GPT-5.2 ở mức 48% là một kết quả đáng chú ý. Đây là mô hình nhanh nhất trong benchmark (2.5s) nhưng lại nằm trong số những mô hình kém chính xác nhất. Điều này liên quan trực tiếp đến ràng buộc "cài đặt suy luận tối thiểu" — các mô hình thuộc dòng GPT được tối ưu hóa mạnh mẽ cho các cấu hình đòi hỏi nhiều suy luận, và khi phần suy luận mở rộng đó bị loại bỏ, khả năng tuân thủ hướng dẫn cơ bản dưới áp lực ngữ cảnh dài giảm đáng kể. Điều này không cho thấy một điểm yếu cơ bản mà là sự phụ thuộc về mặt kiến trúc vào tài nguyên tính toán suy luận mà các dòng mô hình khác không chia sẻ ở cùng mức độ.

  • Các mô hình mã nguồn mở hàng đầu của Trung Quốc — Kimi K2.5 (47%), GLM 5 (44%), và MiniMax M2.5 (50%) — hoạt động tương đối yếu hơn trên benchmark này. Một yếu tố có thể góp phần là việc phân bổ huấn luyện. Các mô hình này, thường được phát triển với ngân sách tính toán eo hẹp hơn so với các đối tác phương Tây, có thể ưu tiên một cách hợp lý năng lực huấn luyện cho các hạng mục benchmark đã được thiết lập và có tầm nhìn cao (suy luận, lập trình, kiến thức) nơi hiệu suất cạnh tranh là cần thiết để định vị thị trường. Khả năng khái quát hóa điều phối ngữ cảnh dài — một năng lực không có benchmark công khai hiện có để tối ưu hóa — có thể nhận được ít sự tập trung mục tiêu hơn. Đây là một sự ưu tiên hợp lý, không phải là một hạn chế cơ bản, và chúng tôi kỳ vọng khoảng cách này sẽ thu hẹp khi các đánh giá cụ thể về điều phối trở nên phổ biến hơn.

Các quan sát chính

1. Sự khác biệt đáng kể về khả năng điều phối giữa các mô hình hàng đầu.

Khoảng cách giữa các mô hình hoạt động tốt nhất và kém nhất gần gấp 2 lần (76% so với 44%). Điều này đáng chú ý vì nhiều mô hình này chỉ chênh lệch vài điểm phần trăm trên các benchmark đã được thiết lập như MMLU, GPQA, hoặc LMArena. Điều phối tác nhân ngữ cảnh dài cho thấy sự khác biệt mà các benchmark truyền thống không nắm bắt được.

2. Độ chính xác, tốc độ và chi phí không tương quan theo cách bạn mong đợi.

Mô hình đắt nhất không phải là mô hình chính xác nhất (Claude Opus 4.6 với giá $0.35 đạt 65%, trong khi Claude 4.5 Opus với cùng mức giá đạt 76%). Mô hình nhanh nhất (GPT-5.2 với 2.5s) lại nằm trong số những mô hình kém chính xác nhất (48%). Các mô hình rẻ nhất trải dài trên toàn bộ phạm vi độ chính xác — từ Grok 4.1 Fast ở mức 47% ($0.01) đến Gemini 3 Flash Preview ở mức 66% ($0.03). Điều này củng cố tầm quan trọng của việc đánh giá cả ba phương diện cùng nhau — một phát hiện phù hợp với phân tích Pareto chi phí-hiệu suất đang nổi lên như một phương pháp hay nhất trong đánh giá tác nhân.

3. Tuân thủ hướng dẫn dưới áp lực ngữ cảnh dài là yếu tố tạo nên sự khác biệt.

Các kịch bản mà hầu hết các mô hình làm sai thường có một khuôn mẫu chung: hành động đúng đòi hỏi mô hình phải ưu tiên một hướng dẫn cụ thể nằm sâu trong ngữ cảnh hơn là một hành động "rõ ràng" hoặc "mặc định" hơn. Các mô hình xuất sắc trong benchmark này thể hiện khả năng vượt trội trong việc duy trì sự trung thành với hướng dẫn ngay cả khi hướng dẫn liên quan được bao quanh bởi hàng chục nghìn token thông tin cạnh tranh. Điều này phù hợp với các phát hiện từ khung đánh giá của GAIA, nơi các nhiệm vụ đòi hỏi khắt khe nhất — yêu cầu lập kế hoạch sâu rộng và tích hợp đa công cụ — vẫn là nơi thử thách thực sự cho năng lực của tác nhân.

4. Cài đặt suy luận tối thiểu phơi bày những khoảng trống về năng lực cơ bản.

Tất cả các mô hình đều được đánh giá ở cài đặt suy luận thấp nhất. Một số mô hình nổi tiếng với hiệu suất mạnh mẽ ở các chế độ suy luận cao lại cho thấy kết quả yếu đáng ngạc nhiên ở đây. Chúng tôi quan sát thấy rằng một số dòng mô hình phụ thuộc đáng kể vào các chế độ suy luận mở rộng để đạt được độ tin cậy. Khi tài nguyên tính toán suy luận đó bị loại bỏ — như phải làm trong môi trường điều phối sản xuất nơi các ràng buộc về độ trễ và chi phí chiếm ưu thế — khả năng tuân thủ hướng dẫn cơ bản sẽ lộ ra. Đây là yếu tố chính đằng sau hiệu suất kém của GPT-5.2: kiến trúc của nó được tối ưu hóa mạnh mẽ cho các quy trình làm việc đòi hỏi nhiều suy luận, và ràng buộc suy luận tối thiểu ảnh hưởng không tương xứng đến nó.


Ghi chú về phương pháp luận

  • Khả năng tái tạo. Mỗi kịch bản là một đánh giá tĩnh, xác định. Không có thực thi công cụ trực tiếp, không có sự phụ thuộc vào API bên ngoài và không có biến đổi ngẫu nhiên. Với cùng một đầu vào và cấu hình mô hình, kết quả hoàn toàn có thể tái tạo. Điều này giải quyết một mối quan tâm chính được nêu ra trong nghiên cứu đánh giá tác nhân: tính không xác định của tác nhân thường yêu cầu đánh giá thống kê qua nhiều lần chạy. Bởi vì benchmark này đánh giá một điểm quyết định duy nhất cho mỗi kịch bản ở nhiệt độ 0, nó đạt được khả năng tái tạo xác định mà không cần tổng hợp nhiều lần chạy.
  • Chấm điểm đầu ra. Đầu ra của mô hình được đánh giá dựa trên một bộ nhãn quyết định bước tiếp theo được xác định trước cho mỗi kịch bản. Khi có nhiều hành động hợp lệ, tất cả đều được bao gồm trong bộ được phép trước khi đánh giá.
  • Lựa chọn kịch bản. Các kịch bản được tuyển chọn để đại diện cho các thách thức điều phối thực tế, không phải là các trường hợp biên đối nghịch. Mục tiêu là đo lường năng lực liên quan đến sản xuất, không phải để tạo ra sự thất bại của mô hình.
  • Mở rộng liên tục. Benchmark được duy trì tích cực. Các kịch bản mới được thêm vào khi các mẫu quy trình làm việc mới xuất hiện trong quá trình sử dụng sản xuất. Phiên bản hiện tại (n=31) là phiên bản phát hành ban đầu.

Định vị trong bối cảnh Benchmark

BenchmarkTrọng tâm chínhĐộ dài ngữ cảnhLĩnh vực
SWE-bench VerifiedSửa lỗi trong kho mã nguồn GitHub thực tếTrung bìnhLập trình
GAIATrả lời câu hỏi đa công cụTrung bìnhTổng quát
AgentBenchHành vi tác nhân đa môi trườngThay đổi8 lĩnh vực
WebArenaNhiệm vụ điều hướng webNgắn–trung bìnhWeb
τ-benchSử dụng công cụ trong kịch bản dịch vụNgắnDịch vụ khách hàng
Benchmark Điều phối JenovaQuyết định bước tiếp theo dưới ngữ cảnh dài100k+ tokenQuy trình làm việc không lập trình

Benchmark này không cạnh tranh hay thay thế các đánh giá hiện có. SWE-bench vẫn là tiêu chuẩn cho các tác nhân lập trình. GAIA vẫn là bài kiểm tra rộng nhất về năng lực tác nhân nói chung. Benchmark này tách biệt một lớp khác: chất lượng quyết định bước tiếp theo dưới áp lực ngữ cảnh cực lớn trong các lĩnh vực không liên quan đến lập trình.


Ý nghĩa đối với thiết kế Tác nhân

Kết quả của chúng tôi cho thấy năng lực điều phối khác biệt với năng lực suy luận. Hiệu suất cao trên các benchmark suy luận không đảm bảo hiệu suất cao trong việc điều phối ngữ cảnh dài.

Đối với các nhà phát triển xây dựng hệ thống tác nhân, sự tách biệt này có những hậu quả thực tế:

  1. Lựa chọn mô hình. Mô hình "thông minh nhất" không phải lúc nào cũng là nhà điều phối đáng tin cậy nhất. Việc chỉ đánh giá các mô hình trên các benchmark suy luận có thể dẫn đến những lựa chọn không tối ưu cho lớp điều phối.
  2. Tối ưu hóa chi phí. Các mô hình có chi phí suy luận thấp hơn có thể hoạt động tốt hơn các mô hình tiên tiến đắt tiền nếu chúng có sự ổn định tuân thủ hướng dẫn tốt hơn dưới áp lực ngữ cảnh. Ở quy mô sản xuất, sự khác biệt này tăng lên đáng kể.
  3. Kiến trúc. Dựa vào một mô hình duy nhất cho cả việc điều phối và thực thi nhiệm vụ có thể không hiệu quả. Định tuyến chuyên biệt — sử dụng một mô hình có độ ổn định cao cho lớp điều phối và các mô hình có khả năng suy luận cao cho các nhiệm vụ phụ cụ thể — có thể mang lại độ tin cậy tốt hơn với chi phí thấp hơn.

Chúng tôi đang công bố những kết quả này để cung cấp một điểm dữ liệu cho quyết định kiến trúc đó. Khi chúng tôi mở rộng bộ kịch bản để bao gồm nhiều lĩnh vực và mẫu quy trình làm việc hơn, chúng tôi sẽ tiếp tục cập nhật các chỉ số này.


Benchmark Điều phối Tác nhân Ngữ cảnh Dài của Jenova.ai được phát triển bởi đội ngũ kỹ sư của Jenova để đánh giá hiệu suất của mô hình trong môi trường điều phối sản xuất. Để có các yêu cầu kỹ thuật hoặc chi tiết về phương pháp luận, vui lòng liên hệ [email protected].