Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

63 RADAR
Agents Cognitive Architectures for LLM Agents · 1 nguồn đối chiếu · 2026-09-16 17:50:42 +0000 UTC

Cognitive Extensions for Dual-Process Language Agents: Memory and Self-Reflection in Interactive Environments

Nguồn: arXiv AI

Nghiên cứu giới thiệu hai tiện ích mở rộng nhận thức cho agent quy trình kép SwiftSage: Adaptive Memory Module (AMM - lưu trữ phân tập theo độ nổi bật và truy xuất theo trigger) và Self-Reflection Module (SRM - kiểm định thực thi và can thiệp sửa sai). Đánh giá trên ScienceWorld cho thấy hệ thống kết hợp đạt hiệu năng cao nhất (điểm 64.62, tỷ lệ thành công 43.17%), trong đó SRM là thành phần độc lập đóng góp nhiều nhất, chỉ ra rằng kiểm soát lỗi thời gian thực thi là nút thắt then chốt cần giải quyết trước khi bộ nhớ phát huy giá trị.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Khẳng định nguyên lý thiết kế agent: kiểm soát lỗi và phản ánh trong thời gian thực thi (execution-time control) là nút thắt quan trọng nhất cần tối ưu trước; bộ nhớ phân tập dài hạn chỉ mang lại hiệu quả rõ rệt khi vòng lặp thực thi của agent đã được giữ ổn định.

Developer 74
Business 64
Novelty 72
Actionable 78

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Language agents remain brittle in interactive environments, where success requires long-horizon state tracking, valid action execution, and recovery from failed steps. We extend SwiftSage, a dual-process agent that combines a fast action proposer with a slower planner, using two modular cognitive extensions: an Adaptive Memory Module (AMM) for salience-gated episodic storage and trigger-driven retrieval, and a Self-Reflection Module (SRM) for bounded execution-time validation and corrective intervention. Both modules are implemented as feature-flagged extensions over the same execution substrate, enabling controlled ablations on ScienceWorld. Across four configurations---baseline, baseline+AMM, baseline+SRM, and the full system---the full system achieves the best mean final score (64.62), success rate (43.17%), and successful-step efficiency (19.33 steps), while SRM is the strongest standalone contributor. The results suggest that execution-time control is the dominant bottleneck in this setting, while episodic memory becomes most useful once the runtime loop is stabilized.

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:27:33 +0000 UTC
{"tags": ["AI Agents", "SwiftSage", "Self-Reflection", "Episodic Memory", "Dual-Process", "ScienceWorld", "Interactive Environments"], "risks": ["Tỷ lệ thành công tổng thể vẫn ở mức 43.17%, cho thấy rủi ro thất bại còn cao trong các môi trường tương tác dài hạn.", "Gia tăng độ trễ và chi phí tính toán/token khi phải thực hiện các bước tự phản ánh và truy vấn bộ nhớ liên tục.", "Bộ nhớ phân tập (AMM) ít phát huy tác dụng nếu luồng kiểm soát thực thi (runtime loop) chưa được ổn định trước."], "category": "Agents", "entities": ["SwiftSage", "Adaptive Memory Module (AMM)", "Self-Reflection Module (SRM)", "ScienceWorld"], "summary_vi": "Nghiên cứu giới thiệu hai tiện ích mở rộng nhận thức cho agent quy trình kép SwiftSage: Adaptive Memory Module (AMM - lưu trữ phân tập theo độ nổi bật và truy xuất theo trigger) và Self-Reflection Module (SRM - kiểm định thực thi và can thiệp sửa sai). Đánh giá trên ScienceWorld cho thấy hệ thống kết hợp đạt hiệu năng cao nhất (điểm 64.62, tỷ lệ thành công 43.17%), trong đó SRM là thành phần độc lập đóng góp nhiều nhất, chỉ ra rằng kiểm soát lỗi thời gian thực thi là nút thắt then chốt cần giải quyết trước khi bộ nhớ phát huy giá trị.", "key_changes": ["Mở rộng kiến trúc quy trình kép SwiftSage (kết hợp đề xuất hành động nhanh và lập kế hoạch chậm) bằng hai module nhận thức dạng feature-flag: AMM và SRM.", "Tích hợp Adaptive Memory Module (AMM) hỗ trợ lưu trữ phân tập có cổng nổi bật (salience-gated) và truy xuất theo trigger.", "Tích hợp Self-Reflection Module (SRM) để kiểm định tính hợp lệ của hành động và can thiệp sửa lỗi ngay trong thời gian thực thi.", "Thực nghiệm trên ScienceWorld chứng minh hệ thống đầy đủ đạt điểm số 64.62, tỷ lệ thành công 43.17% và hiệu quả 19.33 bước; trong đó SRM là thành phần đóng góp độc lập lớn nhất."], "sub_category": "Cognitive Architectures for LLM Agents", "novelty_score": 72, "business_score": 65, "research_score": 82, "why_it_matters": "Khẳng định nguyên lý thiết kế agent: kiểm soát lỗi và phản ánh trong thời gian thực thi (execution-time control) là nút thắt quan trọng nhất cần tối ưu trước; bộ nhớ phân tập dài hạn chỉ mang lại hiệu quả rõ rệt khi vòng lặp thực thi của agent đã được giữ ổn định.", "developer_score": 80, "importance_score": 75, "possible_use_cases": ["Phát triển agent tự hành xử lý tác vụ tương tác nhiều bước trong môi trường giả lập, game hoặc web.", "Nâng cao độ tin cậy của agent phần mềm thông qua kiểm định runtime và cơ chế tự sửa sai khi gặp bước hỏng.", "Tối ưu hóa hệ thống bộ nhớ ngữ cảnh dài hạn cho các tác vụ phức tạp đòi hỏi theo dõi trạng thái bền bỉ."], "actionability_score": 78}