Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

64 RADAR
Research Embodied AI · 1 nguồn đối chiếu · 2026-09-16 17:34:43 +0000 UTC

rMuscle: Robotic Muscle Memory for Efficient Vision-Language-Action Model Inference

Nguồn: arXiv AI

rMuscle là một framework suy luận thời gian thực cho các mô hình Vision-Language-Action (VLA) trong robot học, lấy cảm hứng từ cơ chế trí nhớ cơ bắp (muscle memory) của con người. Tận dụng đặc điểm công việc lặp lại trong nhà máy có tính tương đồng cao về trạng thái nội tại của mô hình, rMuscle giới thiệu cơ chế bộ nhớ đệm hai giai đoạn: Context Cache (tái sử dụng đầu ra visual-token để giảm khối lượng tính toán) và Action Cache (tái sử dụng mẫu kích hoạt neuron để giảm truy cập trọng số). Kết hợp cùng kỹ thuật tính toán lại trực tuyến, truy xuất cửa sổ trượt và chia sẻ mặt nạ khử nhiễu, rMuscle đạt tốc độ tăng từ 1.29x đến 1.42x trên RTX 4090 và Jetson Thor mà vẫn duy trì tỷ lệ thành công ban đầu trên robot thực tế.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Độ trễ suy luận của mô hình VLA là rào cản lớn nhất ảnh hưởng trực tiếp đến độ mượt và khả năng phản hồi thời gian thực của robot. rMuscle giải quyết bài toán này bằng cách khai thác đặc trưng lặp lại của công việc embodied AI để lưu cache trạng thái nội tại, mang lại mức tăng tốc ấn tượng (1.29-1.42x) trên cả GPU rời lẫn chip nhúng chuyên dụng mà không làm giảm độ chính xác, mở ra tiềm năng ứng dụng thực tế lớn cho tự động hóa công nghiệp.

Developer 71
Business 73
Novelty 80
Actionable 72

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Factory work is a promising early scenario for embodied AI: assigning repetitive manual jobs to robots has clear economic payoff, and a structured station keeps the jobs tractable for current policies. Vision-Language-Action (VLA) models now dominate as the policy paradigm for these robots. The inference latency of VLA models directly affects robot responsiveness and motion smoothness. However, existing VLA inference frameworks do not fully exploit the characteristics of embodied workloads or account for the distinct bottlenecks across different stages of VLA inference. In this paper, we first characterize embodied workloads and identify substantial task similarity across repeated robot executions. We further find that such similarity extends beyond observations and action trajectories to internal model states. Drawing on these observations, we present rMuscle, a real-time VLA inference framework inspired by human muscle memory. It exploits cross-execution similarity through a dual-phase muscle-memory cache. The Context Cache reuses visual-token outputs to reduce computation, while the Action Cache reuses neuron activation patterns to reduce weight accesses. We keep both the cache memory footprint and access overhead low through online cache recomputation, sliding-window cache retrieval, and mask sharing across consecutive denoising steps. rMuscle achieves 1.29-1.42X speedup on RTX 4090 and Jetson Thor across LIBERO, RoboTwin, and physical manipulation tasks, while maintaining the original success rates on real-world robots.

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:29:14 +0000 UTC
{"tags": ["rMuscle", "VLA", "Vision-Language-Action", "Embodied AI", "Robotics", "Model Inference", "Cache Optimization", "Jetson Thor", "RTX 4090"], "risks": ["Hiệu quả của bộ nhớ đệm phụ thuộc vào mức độ lặp lại của tác vụ; nếu môi trường hoặc thao tác biến đổi liên tục, tỷ lệ trúng cache có thể giảm.", "Chi phí tính toán lại trực tuyến và quản lý cửa sổ trượt có thể tạo thêm overhead trên các phần cứng có năng lực tính toán hạn chế hơn.", "Cần kiểm chứng thêm tính tổng quát hóa trên nhiều họ kiến trúc VLA khác nhau và trong các môi trường phi cấu trúc."], "category": "Research", "entities": ["rMuscle", "RTX 4090", "Jetson Thor", "LIBERO", "RoboTwin", "Vision-Language-Action (VLA)"], "summary_vi": "rMuscle là một framework suy luận thời gian thực cho các mô hình Vision-Language-Action (VLA) trong robot học, lấy cảm hứng từ cơ chế trí nhớ cơ bắp (muscle memory) của con người. Tận dụng đặc điểm công việc lặp lại trong nhà máy có tính tương đồng cao về trạng thái nội tại của mô hình, rMuscle giới thiệu cơ chế bộ nhớ đệm hai giai đoạn: Context Cache (tái sử dụng đầu ra visual-token để giảm khối lượng tính toán) và Action Cache (tái sử dụng mẫu kích hoạt neuron để giảm truy cập trọng số). Kết hợp cùng kỹ thuật tính toán lại trực tuyến, truy xuất cửa sổ trượt và chia sẻ mặt nạ khử nhiễu, rMuscle đạt tốc độ tăng từ 1.29x đến 1.42x trên RTX 4090 và Jetson Thor mà vẫn duy trì tỷ lệ thành công ban đầu trên robot thực tế.", "key_changes": ["Phát hiện tính tương đồng cao giữa các lần thực thi lặp lại của robot trong nhà máy, mở rộng từ quan sát và quỹ đạo sang cả trạng thái nội tại của mô hình.", "Đề xuất framework rMuscle với kiến trúc bộ nhớ đệm hai giai đoạn (dual-phase muscle-memory cache): Context Cache tái sử dụng visual-token outputs và Action Cache tái sử dụng neuron activation patterns.", "Tối ưu hóa bộ nhớ và chi phí truy cập cache thông qua tính toán lại bộ nhớ đệm trực tuyến (online cache recomputation), truy xuất cửa sổ trượt (sliding-window cache retrieval) và chia sẻ mặt nạ qua các bước khử nhiễu liên tiếp.", "Đạt tốc độ tăng từ 1.29x đến 1.42x trên phần cứng RTX 4090 và Jetson Thor trên các benchmark LIBERO, RoboTwin và robot thực tế mà vẫn duy trì nguyên vẹn tỷ lệ thành công."], "sub_category": "Embodied AI", "novelty_score": 80, "business_score": 78, "research_score": 82, "why_it_matters": "Độ trễ suy luận của mô hình VLA là rào cản lớn nhất ảnh hưởng trực tiếp đến độ mượt và khả năng phản hồi thời gian thực của robot. rMuscle giải quyết bài toán này bằng cách khai thác đặc trưng lặp lại của công việc embodied AI để lưu cache trạng thái nội tại, mang lại mức tăng tốc ấn tượng (1.29-1.42x) trên cả GPU rời lẫn chip nhúng chuyên dụng mà không làm giảm độ chính xác, mở ra tiềm năng ứng dụng thực tế lớn cho tự động hóa công nghiệp.", "developer_score": 75, "importance_score": 78, "possible_use_cases": ["Tăng tốc suy luận cho robot công nghiệp thực hiện các tác vụ lặp lại trong dây chuyền sản xuất nhà máy.", "Triển khai các mô hình VLA thời gian thực trên phần cứng nhúng biên (edge) như NVIDIA Jetson Thor đặt trực tiếp trên robot.", "Cải thiện độ mượt chuyển động và tốc độ phản ứng thời gian thực cho các cánh tay robot thao tác vật lý."], "actionability_score": 72}
← Trang trước Trang 1