繁體中文
← 返回 AI 技術體系

訓練與後訓練

Reasoning and test-time compute

一類後訓練方法:讓模型在作答前先產生較長的推理軌跡,並在問題更難時於推論階段投入更多算力。可驗證獎勵的強化學習——由可核對的答案提供訓練訊號——使這條路線得以在封閉實驗室之外被重現。其代價值得直說:準確率來自生成長度而非更大的模型,代價是延遲與服務成本。

時間節點
2024 / 2025
最近審查

關鍵術語

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

專案內關聯

第一手來源

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。