Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

67 RADAR
Agents Agent Security & Privacy · 1 nguồn đối chiếu · 2026-09-16 16:03:11 +0000 UTC

ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions

Nguồn: arXiv AI

ASLEval là khung đánh giá bảo mật và quyền riêng tư theo phân quyền cho các LLM agent sử dụng công cụ trong phiên làm việc đa bước. Nghiên cứu xác định hiện tượng 'privacy exposure displacement', chỉ ra rằng các proxy đánh giá cục bộ truyền thống (chỉ xem xét hành động được chỉ định hoặc phản hồi cuối) bỏ sót tới 46,9% lượng rò rỉ dữ liệu so với việc giám sát toàn bộ các lối thoát hiển thị. ASLEval giải quyết vấn đề bằng cách đăng ký trước mục tiêu ẩn, đo lường toàn bộ ranh giới thoát và lưu vết nội bộ, đồng thời nhấn mạnh việc đánh giá quyền riêng tư song hành với hiệu năng hoàn thành tác vụ.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Nghiên cứu chỉ ra lỗ hổng phương pháp luận cốt lõi trong các bài đo lường an toàn LLM agent hiện nay khi bỏ sót gần một nửa các trường hợp lộ dữ liệu. Điều này buộc các nhà phát triển và doanh nghiệp phải thay đổi tư duy kiểm thử: chuyển từ việc chỉ kiểm tra output cuối cùng sang kiểm soát toàn bộ ranh giới thoát trong phiên làm việc, đảm bảo an toàn dữ liệu mà không hy sinh tính hữu dụng của agent.

Developer 77
Business 78
Novelty 82
Actionable 80

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Privacy evaluations of tool-using LLM agents often inspect a designated action, final response, or attacker report. These local proxies can miss unauthorized exposure elsewhere in a multi-step session and lack common ground truth across outlets, reports, and tool paths. We introduce privacy exposure displacement, the mismatch between a local evaluation proxy and target-grounded session exposure, and ASLEval, an authorization-aware framework that pre-registers a hidden target set, measures all declared visible exits, and reserves internal traces for diagnosis. Across multiple enterprise-style environments and independently implemented runtimes, we observe three recurring patterns. An expected-outlet-only view misses 46.9% of exposure recovered by the visible-exit union; attacker self-reports combine omissions with high false discovery; and schema-aligned internal evidence usually precedes visible exposure at the request/probe level. Reducing model-visible returns changes this path but can eliminate normal-task success. Independent human review supports the adjudication pipeline while identifying harder console and candidate cases. These findings motivate benchmarks that declare the complete visible boundary, ground claims in pre-specified targets and authorization, and report privacy together with task utility.

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:35:00 +0000 UTC
{"tags": ["ASLEval", "LLM Agents", "Privacy Exposure", "Agent Evaluation", "Tool Use", "Data Leakage", "AI Security"], "risks": ["Hạn chế dữ liệu trả về cho mô hình để bảo mật có thể làm suy giảm nghiêm trọng hoặc khiến agent thất bại hoàn toàn trong tác vụ chính.", "Các trường hợp thao tác qua console và ứng viên biên phức tạp vẫn đòi hỏi can thiệp thẩm định thủ công từ con người.", "Dựa vào các proxy đánh giá cục bộ hoặc báo cáo của attacker tạo ra sự tin tưởng sai lầm về mức độ an toàn của hệ thống agent."], "category": "Agents", "entities": ["ASLEval", "LLM Agent", "LLM"], "summary_vi": "ASLEval là khung đánh giá bảo mật và quyền riêng tư theo phân quyền cho các LLM agent sử dụng công cụ trong phiên làm việc đa bước. Nghiên cứu xác định hiện tượng 'privacy exposure displacement', chỉ ra rằng các proxy đánh giá cục bộ truyền thống (chỉ xem xét hành động được chỉ định hoặc phản hồi cuối) bỏ sót tới 46,9% lượng rò rỉ dữ liệu so với việc giám sát toàn bộ các lối thoát hiển thị. ASLEval giải quyết vấn đề bằng cách đăng ký trước mục tiêu ẩn, đo lường toàn bộ ranh giới thoát và lưu vết nội bộ, đồng thời nhấn mạnh việc đánh giá quyền riêng tư song hành với hiệu năng hoàn thành tác vụ.", "key_changes": ["Giới thiệu khái niệm 'privacy exposure displacement' - độ lệch giữa proxy đánh giá cục bộ và mức phơi nhiễm dữ liệu thực tế trong phiên làm việc của agent.", "Đề xuất ASLEval - khung đánh giá nhận biết ủy quyền, đăng ký trước tập mục tiêu ẩn, theo dõi toàn bộ lối thoát hiển thị và lưu vết nội bộ để chẩn đoán.", "Chứng minh phương pháp chỉ quan sát lối thoát dự kiến bỏ sót 46,9% lượng phơi nhiễm dữ liệu so với việc theo dõi toàn bộ lối thoát hiển thị.", "Chỉ ra báo cáo tự đánh giá của kẻ tấn công có tỷ lệ phát hiện sai cao; bằng chứng nội bộ tương thích schema thường xuất hiện trước khi rò rỉ ra bên ngoài.", "Phát hiện việc giảm dữ liệu hiển thị cho mô hình làm thay đổi đường rò rỉ nhưng có thể triệt tiêu khả năng thành công của tác vụ gốc."], "sub_category": "Agent Security & Privacy", "novelty_score": 82, "business_score": 84, "research_score": 88, "why_it_matters": "Nghiên cứu chỉ ra lỗ hổng phương pháp luận cốt lõi trong các bài đo lường an toàn LLM agent hiện nay khi bỏ sót gần một nửa các trường hợp lộ dữ liệu. Điều này buộc các nhà phát triển và doanh nghiệp phải thay đổi tư duy kiểm thử: chuyển từ việc chỉ kiểm tra output cuối cùng sang kiểm soát toàn bộ ranh giới thoát trong phiên làm việc, đảm bảo an toàn dữ liệu mà không hy sinh tính hữu dụng của agent.", "developer_score": 82, "importance_score": 85, "possible_use_cases": ["Thiết lập quy trình kiểm thử và đánh giá bảo mật/quyền riêng tư cho LLM agent đa bước trước khi triển khai vào môi trường doanh nghiệp.", "Xây dựng hệ thống giám sát toàn diện các ranh giới và cổng xuất dữ liệu (visible exit monitoring) khi tích hợp công cụ bên thứ ba.", "Đo lường và tối ưu hóa sự cân bằng (trade-off) giữa an toàn thông tin và năng lực hoàn thành tác vụ (task utility) của agent."], "actionability_score": 80}