训练与后训练
Reasoning and test-time compute
一类后训练方法:让模型在作答前先生成较长的推理轨迹,并在问题更难时于推理阶段投入更多算力。可验证奖励的强化学习——由可核对的答案提供训练信号——使这条路线得以在封闭实验室之外被复现。其代价值得直说:准确率来自生成长度而非更大的模型,代价是延迟与服务成本。
关键术语
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
项目内关联
一手来源
这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。