การฝึกและหลังการฝึก
Reasoning and test-time compute
กลุ่มวิธีหลังการฝึกที่สอนให้โมเดลสร้างร่องรอยการให้เหตุผลยาว ๆ ก่อนตอบ และใช้การคำนวณมากขึ้นในขั้นอนุมานเมื่อโจทย์ยากขึ้น การเรียนรู้แบบเสริมกำลังด้วยรางวัลที่ตรวจสอบได้ ซึ่งคำตอบที่ตรวจทานได้เป็นตัวให้สัญญาณการฝึก คือสิ่งที่ทำให้แนวทางนี้ทำซ้ำได้นอกห้องปฏิบัติการแบบปิด ข้อแลกเปลี่ยนควรพูดให้ชัด ความแม่นยำมาจากความยาวของการสร้างข้อความ ไม่ใช่จากโมเดลที่ใหญ่ขึ้น และจ่ายด้วยเวลาหน่วงกับต้นทุนการให้บริการ
คำสำคัญ
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
ความเชื่อมโยงในโครงการ
ตั้งอยู่บน
เทคโนโลยีที่เกี่ยวข้อง
บทความที่เกี่ยวข้อง
บริบททางประวัติศาสตร์
แหล่งข้อมูลปฐมภูมิ
นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด