Tiếng Việt
← Quay lại Công nghệ AI

Huấn luyện và hậu huấn luyện

Reasoning and test-time compute

Một nhóm phương pháp hậu huấn luyện dạy mô hình sinh ra chuỗi suy luận dài trước khi trả lời, và dùng nhiều tính toán hơn ở giai đoạn suy luận khi bài toán khó hơn. Học tăng cường với phần thưởng kiểm chứng được — trong đó một đáp án có thể đối chiếu cung cấp tín hiệu huấn luyện — là điều khiến hướng đi này tái lập được bên ngoài các phòng thí nghiệm đóng. Cái giá nên nói thẳng: độ chính xác đến từ độ dài sinh văn bản chứ không từ mô hình lớn hơn, và phải trả bằng độ trễ cùng chi phí phục vụ.

Giai đoạn tham chiếu
2024 / 2025
Kiểm tra gần nhất

Thuật ngữ chính

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Liên kết trong dự án

Nguồn sơ cấp

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.