한국어
← AI 기술 체계로 돌아가기

학습과 사후 학습

Reasoning and test-time compute

답을 내기 전에 긴 추론 흔적을 생성하도록, 그리고 문제가 어려울수록 추론 단계에서 더 많은 연산을 쓰도록 가르치는 후학습 방법군이다. 검증 가능한 보상을 쓰는 강화학습, 즉 대조 가능한 정답이 학습 신호를 제공하는 방식이 이 노선을 폐쇄된 연구실 밖에서도 재현 가능하게 만들었다. 대가는 분명히 적어 둘 만하다. 정확도는 더 큰 모델이 아니라 생성 길이에서 오며, 그 값은 지연 시간과 서빙 비용으로 치른다.

기준 시기
2024 / 2025
최근 검토

핵심 용어

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

프로젝트 내 연결

1차 출처

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.