Entrenamiento y posentrenamiento
Reasoning and test-time compute
Un postentrenamiento que enseña al modelo a producir una traza de razonamiento larga antes de responder y a gastar más cómputo en la inferencia cuando el problema es más difícil. El aprendizaje por refuerzo con recompensas verificables — donde una respuesta comprobable aporta la señal de entrenamiento — es lo que hizo reproducible este enfoque fuera de los laboratorios cerrados. Conviene decir el intercambio con claridad: precisión obtenida por la longitud de la generación y no por un modelo mayor, pagada en latencia y coste de servicio.
Términos clave
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Conexiones en el proyecto
Se basa en
Tecnologías relacionadas
Artículos relacionados
Contexto histórico
Fuentes primarias
Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.