日本語
← AI 技術体系に戻る

学習と後学習

Reasoning and test-time compute

回答の前に長い推論の軌跡を生成させ、難しい問題ほど推論時に多くの計算を費やすように学習させる後学習の一群。検証可能な報酬による強化学習、すなわち answer が照合可能であることが学習信号を与える方式が、この路線を閉じた研究所の外でも再現可能にした。代償ははっきり述べる価値がある。精度はより大きなモデルではなく生成の長さから得られ、その対価は遅延と提供コストである。

基準時期
2024 / 2025
最終確認

主要用語

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

プロジェクト内のつながり

一次資料

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

これは選定された技術マップであり、網羅性を主張するものではありません。