訓練與後訓練
Reasoning and test-time compute
一類後訓練方法:讓模型在作答前先產生較長的推理軌跡,並在問題更難時於推論階段投入更多算力。可驗證獎勵的強化學習——由可核對的答案提供訓練訊號——使這條路線得以在封閉實驗室之外被重現。其代價值得直說:準確率來自生成長度而非更大的模型,代價是延遲與服務成本。
關鍵術語
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
專案內關聯
第一手來源
這是經過選編的技術圖譜,並非對 AI 技術的完整涵蓋聲明。