Português
← Voltar às tecnologias de IA

Treino e pós-treino

Reasoning and test-time compute

Um pós-treino que ensina o modelo a produzir um longo traço de raciocínio antes de responder e a gastar mais cálculo na inferência quando o problema é mais difícil. A aprendizagem por reforço com recompensas verificáveis — em que uma resposta conferível fornece o sinal de treino — foi o que tornou a abordagem reproduzível fora dos laboratórios fechados. A troca merece ser dita com clareza: exatidão obtida pelo comprimento da geração e não por um modelo maior, paga em latência e custo de serviço.

Período de referência
2024 / 2025
Última revisão

Termos-chave

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Ligações no projeto

Fontes primárias

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.