Radar Live
✦ Ask AI
AI INTELLIGENCE & SIGNALS

A Zeroth-Order Paradigm for LLM Preference Alignment

Phân tích đã xử lý trước và các nguồn liên quan.

Tín hiệu Radar

66 RADAR
Research LLM Alignment · 1 nguồn đối chiếu · 2026-09-16 17:59:35 +0000 UTC

A Zeroth-Order Paradigm for LLM Preference Alignment

Nguồn: arXiv AI

Nghiên cứu giới thiệu Comparison-based Preference Optimization (ComPO), một phương pháp căn chỉnh sở thích bậc không (zeroth-order) dựa trên comparison oracles cho mô hình ngôn ngữ lớn (LLM). ComPO giải quyết vấn đề dịch chuyển likelihood (likelihood displacement) bằng cách trích xuất thông tin định hướng từ các cặp sở thích có biên likelihood nhỏ mà không cần tối ưu hóa trực tiếp hàm mất mát khả vi. Bài báo thiết lập bảo chứng hội tụ toán học cho sơ đồ offline, đồng thời phát triển phiên bản online với kiểm soát reverse-KL đối với mô hình tham chiếu. Thực nghiệm trên Mistral, Llama, Gemma-2, Qwen3 và Gemma-3 chứng minh ComPO cải thiện tỷ lệ thắng có kiểm soát độ dài và giảm thiểu hiệu quả hiện tượng dịch chuyển likelihood so với các phương pháp căn chỉnh trực tiếp hiện hành.

TÁC ĐỘNG & GIÁ TRỊ THỰC TIỄN

Các phương pháp direct preference alignment hiện tại (như DPO) thường bị suy giảm chất lượng khi gặp các cặp sở thích có biên xác suất nhỏ do lỗi dịch chuyển likelihood. ComPO cung cấp một khung làm việc bậc không có nền tảng toán học vững chắc, giải quyết nút thắt cổ chai này để nâng cao chất lượng căn chỉnh mô hình mà không làm bóp méo phân phối xác suất.

Developer 72
Business 65
Novelty 85
Actionable 70

Nội dung thu thập đã chuẩn hóa

Collected Evidence

Nội dung văn bản được dùng làm dữ liệu đối chứng cho mô hình AI, không phải chỉ thị hệ thống.

Direct preference alignment methods are widely used to align large language models (LLMs) with human preferences because of their computational and memory efficiency. However, likelihood displacement motivates alternative ways to extract information from preference pairs with small likelihood margins. In this paper, we propose and analyze Comparison-based Preference Optimization (ComPO), a zeroth-order alignment method based on comparison oracles. ComPO extracts directional information from these pairs without directly optimizing a differentiable preference loss on them. We establish a convergence guarantee for its basic offline scheme under smoothness, gradient sparsity, and compatibility between the oracle and a latent objective. We further introduce online ComPO, which retains the offline comparison mechanism and uses unlabeled policy generations for reverse-KL control relative to a reference policy. Following the coverage perspective of preference fine-tuning, we establish a performance guarantee for a basic constrained scheme under local coverage and in-distribution pairwise reward accuracy. Experiments on Mistral, Llama, Gemma-2, Qwen3, and Gemma-3 models demonstrate improvements over existing direct alignment methods, including length-controlled win rates, with pair-level diagnostics providing evidence consistent with mitigating likelihood displacement.

Các nguồn đối chiếu cho sự kiện này

1 nguồn
Thông tin phân tích AI & Model Details
Provider: openai-compatible · Model: gemini-3.8-flash-high · Version: analysis-v1 · Time: 2026-09-18 01:26:55 +0000 UTC
{"tags": ["LLM Alignment", "ComPO", "Preference Optimization", "Zeroth-Order Optimization", "Post-Training", "Likelihood Displacement"], "risks": ["Phương pháp bậc không dựa trên comparison oracle có thể đòi hỏi chi phí tính toán truy vấn bổ sung so với lan truyền ngược tiêu chuẩn.", "Bảo chứng lý thuyết dựa trên các giả định cụ thể về độ trơn, gradient sparsity và độ phủ cục bộ (local coverage), có thể không phải lúc nào cũng thỏa mãn trong môi trường dữ liệu thực tế hỗn tạp."], "category": "Research", "entities": ["ComPO", "Mistral", "Llama", "Gemma-2", "Qwen3", "Gemma-3"], "summary_vi": "Nghiên cứu giới thiệu Comparison-based Preference Optimization (ComPO), một phương pháp căn chỉnh sở thích bậc không (zeroth-order) dựa trên comparison oracles cho mô hình ngôn ngữ lớn (LLM). ComPO giải quyết vấn đề dịch chuyển likelihood (likelihood displacement) bằng cách trích xuất thông tin định hướng từ các cặp sở thích có biên likelihood nhỏ mà không cần tối ưu hóa trực tiếp hàm mất mát khả vi. Bài báo thiết lập bảo chứng hội tụ toán học cho sơ đồ offline, đồng thời phát triển phiên bản online với kiểm soát reverse-KL đối với mô hình tham chiếu. Thực nghiệm trên Mistral, Llama, Gemma-2, Qwen3 và Gemma-3 chứng minh ComPO cải thiện tỷ lệ thắng có kiểm soát độ dài và giảm thiểu hiệu quả hiện tượng dịch chuyển likelihood so với các phương pháp căn chỉnh trực tiếp hiện hành.", "key_changes": ["Đề xuất mô hình căn chỉnh bậc không ComPO (Comparison-based Preference Optimization) sử dụng comparison oracles thay vì tối ưu trực tiếp loss khả vi.", "Trích xuất tín hiệu định hướng từ các cặp dữ liệu sở thích có biên likelihood hẹp nhằm khắc phục hiện tượng likelihood displacement.", "Thiết lập bảo chứng hội tụ lý thuyết cho sơ đồ offline và bảo chứng hiệu năng cho sơ đồ online có ràng buộc reverse-KL.", "Kiểm chứng thực nghiệm trên nhiều họ mô hình (Mistral, Llama, Gemma-2, Qwen3, Gemma-3), ghi nhận cải thiện rõ rệt về win rate có kiểm soát độ dài câu trả lời."], "sub_category": "LLM Alignment", "novelty_score": 85, "business_score": 65, "research_score": 90, "why_it_matters": "Các phương pháp direct preference alignment hiện tại (như DPO) thường bị suy giảm chất lượng khi gặp các cặp sở thích có biên xác suất nhỏ do lỗi dịch chuyển likelihood. ComPO cung cấp một khung làm việc bậc không có nền tảng toán học vững chắc, giải quyết nút thắt cổ chai này để nâng cao chất lượng căn chỉnh mô hình mà không làm bóp méo phân phối xác suất.", "developer_score": 75, "importance_score": 82, "possible_use_cases": ["Ứng dụng trong pipeline hậu huấn luyện (post-training) của LLM để căn chỉnh phản hồi theo sở thích người dùng hoặc AI feedback.", "Thay thế hoặc bổ trợ cho DPO/RLHF trong các kịch bản dữ liệu gán nhãn có độ chênh lệch chất lượng giữa cặp câu trả lời rất nhỏ.", "Cải thiện chất lượng sinh câu trả lời trong trợ lý AI thương mại nhằm tránh hiện tượng mô hình sinh phản hồi thiên lệch hoặc dài dòng không cần thiết."], "actionability_score": 70}