简体中文
← 返回 AI 技术体系

训练与后训练

Reasoning and test-time compute

一类后训练方法:让模型在作答前先生成较长的推理轨迹,并在问题更难时于推理阶段投入更多算力。可验证奖励的强化学习——由可核对的答案提供训练信号——使这条路线得以在封闭实验室之外被复现。其代价值得直说:准确率来自生成长度而非更大的模型,代价是延迟与服务成本。

时间节点
2024 / 2025
最近审查

关键术语

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

项目内关联

一手来源

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

这是经过选编的技术图谱,并非对 AI 技术的完整覆盖声明。