Huấn luyện và hậu huấn luyện
Reasoning and test-time compute
Một nhóm phương pháp hậu huấn luyện dạy mô hình sinh ra chuỗi suy luận dài trước khi trả lời, và dùng nhiều tính toán hơn ở giai đoạn suy luận khi bài toán khó hơn. Học tăng cường với phần thưởng kiểm chứng được — trong đó một đáp án có thể đối chiếu cung cấp tín hiệu huấn luyện — là điều khiến hướng đi này tái lập được bên ngoài các phòng thí nghiệm đóng. Cái giá nên nói thẳng: độ chính xác đến từ độ dài sinh văn bản chứ không từ mô hình lớn hơn, và phải trả bằng độ trễ cùng chi phí phục vụ.
Thuật ngữ chính
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Liên kết trong dự án
Dựa trên
Công nghệ liên quan
Bài báo liên quan
Bối cảnh lịch sử
Nguồn sơ cấp
Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.