Treino e pós-treino
Reasoning and test-time compute
Um pós-treino que ensina o modelo a produzir um longo traço de raciocínio antes de responder e a gastar mais cálculo na inferência quando o problema é mais difícil. A aprendizagem por reforço com recompensas verificáveis — em que uma resposta conferível fornece o sinal de treino — foi o que tornou a abordagem reproduzível fora dos laboratórios fechados. A troca merece ser dita com clareza: exatidão obtida pelo comprimento da geração e não por um modelo maior, paga em latência e custo de serviço.
Termos-chave
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Ligações no projeto
Assenta em
Tecnologias relacionadas
Artigos relacionados
Contexto histórico
Fontes primárias
Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.