ไทย
← กลับไปยังเทคโนโลยี AI

การฝึกและหลังการฝึก

Reasoning and test-time compute

กลุ่มวิธีหลังการฝึกที่สอนให้โมเดลสร้างร่องรอยการให้เหตุผลยาว ๆ ก่อนตอบ และใช้การคำนวณมากขึ้นในขั้นอนุมานเมื่อโจทย์ยากขึ้น การเรียนรู้แบบเสริมกำลังด้วยรางวัลที่ตรวจสอบได้ ซึ่งคำตอบที่ตรวจทานได้เป็นตัวให้สัญญาณการฝึก คือสิ่งที่ทำให้แนวทางนี้ทำซ้ำได้นอกห้องปฏิบัติการแบบปิด ข้อแลกเปลี่ยนควรพูดให้ชัด ความแม่นยำมาจากความยาวของการสร้างข้อความ ไม่ใช่จากโมเดลที่ใหญ่ขึ้น และจ่ายด้วยเวลาหน่วงกับต้นทุนการให้บริการ

ช่วงเวลาอ้างอิง
2024 / 2025
ตรวจล่าสุด

คำสำคัญ

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

ความเชื่อมโยงในโครงการ

แหล่งข้อมูลปฐมภูมิ

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด