Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

66 RADAR
Agents Agent Benchmarking & Evaluation · 1 nguồn đối chiếu · 2026-09-16 16:49:50 +0000 UTC

Beyond Outcomes: Dual-View Relational Learning for Efficient Agent Benchmarking

Nguồn: arXiv AI

Nghiên cứu giới thiệu DualViewEval, phương pháp nén benchmark đánh giá AI agent nhằm giải quyết chi phí kiểm thử đắt đỏ. Khác với các cách tiếp cận trước chỉ dựa vào điểm số kết quả cuối cùng, DualViewEval khai thác thêm 6 tín hiệu từ quá trình thực thi quỹ đạo (process signals). Với chỉ 20 tác vụ, phương pháp đạt tỷ lệ nén 24x–40x trên APEX-Agents và BFCL, giảm sai số MAE 14.5%–28.2% và nâng cao độ tương quan Kendall's tau thêm 7.2% trên SWE-bench Verified so với EssenceBench, giúp đẩy nhanh quá trình phát triển mô hình agent.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Chi phí và thời gian đánh giá các benchmark agent (như SWE-bench) là rào cản tài nguyên rất lớn trong phát triển AI agent. DualViewEval giải quyết bài toán này bằng cách giảm mạnh số lượng tác vụ cần chạy mà vẫn bảo toàn thứ hạng và khả năng đánh giá, giúp tiết kiệm đáng kể chi phí API và hạ tầng tính toán cho doanh nghiệp lẫn nhà nghiên cứu.

Developer 78
Business 75
Novelty 80
Actionable 78

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Agent benchmarks are substantially more costly to evaluate than conventional LLM benchmarks. Benchmark compression is therefore a natural solution, yet existing methods primarily model redundancy in task--model final-score distributions, which is important in agentic evaluation. To address this limitation, we analyze large-scale trajectories and identify six complementary process signals that are systematically associated with final agent performance. To disentangle agent performance redundancy from a complete perspective, we propose DualViewEval, an agent benchmark compression method that jointly exploits outcome and process relations to learn an exact-size miniset and predict the full-benchmark scores. Across five agent benchmarks and five representative baselines, DualViewEval achieves the best results in all datasets. With only 20 tasks, it achieves $24\times$--$40\times$ compression on APEX-Agents and BFCL, reducing mean absolute error (MAE) by $14.5\%$--$28.2\%$ over the strongest competitors while improving Kendall's $τ$ by up to $7.2\%$ relative to EssenceBench on SWE-bench Verified. The selected minisets further reveal capability differences among different agents, providing compact and diagnostic feedback for efficient agentic model development.

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:34:39 +0000 UTC
{"tags": ["AI Agents", "Benchmark Compression", "DualViewEval", "SWE-bench", "BFCL", "LLM Evaluation"], "risks": ["Nguy cơ overfitting khi các nhà phát triển tối ưu hóa agent chuyên biệt cho miniset 20 tác vụ thay vì năng lực tổng quát.", "Mô hình dự đoán điểm vẫn có độ lệch nhất định (MAE) so với việc đánh giá thực tế trên toàn bộ benchmark đầy đủ.", "Khả năng khái quát hóa của 6 tín hiệu quá trình trên các môi trường agent hoàn toàn mới cần được kiểm chứng thêm."], "category": "Agents", "entities": ["DualViewEval", "SWE-bench Verified", "APEX-Agents", "BFCL", "EssenceBench"], "summary_vi": "Nghiên cứu giới thiệu DualViewEval, phương pháp nén benchmark đánh giá AI agent nhằm giải quyết chi phí kiểm thử đắt đỏ. Khác với các cách tiếp cận trước chỉ dựa vào điểm số kết quả cuối cùng, DualViewEval khai thác thêm 6 tín hiệu từ quá trình thực thi quỹ đạo (process signals). Với chỉ 20 tác vụ, phương pháp đạt tỷ lệ nén 24x–40x trên APEX-Agents và BFCL, giảm sai số MAE 14.5%–28.2% và nâng cao độ tương quan Kendall's tau thêm 7.2% trên SWE-bench Verified so với EssenceBench, giúp đẩy nhanh quá trình phát triển mô hình agent.", "key_changes": ["Xác định 6 tín hiệu quá trình (process signals) bổ trợ từ quỹ đạo thực thi quy mô lớn có liên hệ chặt chẽ với hiệu năng cuối cùng của agent.", "Phát triển phương pháp DualViewEval kết hợp thông tin kết quả (outcome) và quá trình (process) để chọn miniset tác vụ tối ưu và dự đoán điểm của toàn bộ benchmark.", "Nén 24x–40x với chỉ 20 tác vụ trên APEX-Agents và BFCL, đồng thời giảm MAE từ 14.5%–28.2% so với các phương pháp nén benchmark hàng đầu.", "Cải thiện độ tương quan xếp hạng Kendall's tau lên đến 7.2% trên SWE-bench Verified so với EssenceBench."], "sub_category": "Agent Benchmarking & Evaluation", "novelty_score": 80, "business_score": 80, "research_score": 84, "why_it_matters": "Chi phí và thời gian đánh giá các benchmark agent (như SWE-bench) là rào cản tài nguyên rất lớn trong phát triển AI agent. DualViewEval giải quyết bài toán này bằng cách giảm mạnh số lượng tác vụ cần chạy mà vẫn bảo toàn thứ hạng và khả năng đánh giá, giúp tiết kiệm đáng kể chi phí API và hạ tầng tính toán cho doanh nghiệp lẫn nhà nghiên cứu.", "developer_score": 85, "importance_score": 82, "possible_use_cases": ["Tích hợp miniset 20 tác vụ vào pipeline CI/CD để kiểm thử tự động và hồi quy cho các coding agent (như SWE-bench) với chi phí thấp.", "Đánh giá và so sánh nhanh các checkpoint mô hình hoặc cấu hình prompt mới trong chu trình phát triển agent.", "Đo lường năng lực gọi hàm và công cụ (tool-use / BFCL) trong môi trường doanh nghiệp nhằm tối ưu hóa chi phí token và tài nguyên suy luận."], "actionability_score": 78}