学習と後学習
Reasoning and test-time compute
回答の前に長い推論の軌跡を生成させ、難しい問題ほど推論時に多くの計算を費やすように学習させる後学習の一群。検証可能な報酬による強化学習、すなわち answer が照合可能であることが学習信号を与える方式が、この路線を閉じた研究所の外でも再現可能にした。代償ははっきり述べる価値がある。精度はより大きなモデルではなく生成の長さから得られ、その対価は遅延と提供コストである。
主要用語
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
プロジェクト内のつながり
一次資料
これは選定された技術マップであり、網羅性を主張するものではありません。