학습과 사후 학습
Reasoning and test-time compute
답을 내기 전에 긴 추론 흔적을 생성하도록, 그리고 문제가 어려울수록 추론 단계에서 더 많은 연산을 쓰도록 가르치는 후학습 방법군이다. 검증 가능한 보상을 쓰는 강화학습, 즉 대조 가능한 정답이 학습 신호를 제공하는 방식이 이 노선을 폐쇄된 연구실 밖에서도 재현 가능하게 만들었다. 대가는 분명히 적어 둘 만하다. 정확도는 더 큰 모델이 아니라 생성 길이에서 오며, 그 값은 지연 시간과 서빙 비용으로 치른다.
핵심 용어
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
프로젝트 내 연결
1차 출처
선별한 기술 지도이며 AI 기술을 완전히 망라한다는 뜻이 아니다.