Español
← Volver a Tecnologías de IA

Entrenamiento y posentrenamiento

Reasoning and test-time compute

Un postentrenamiento que enseña al modelo a producir una traza de razonamiento larga antes de responder y a gastar más cómputo en la inferencia cuando el problema es más difícil. El aprendizaje por refuerzo con recompensas verificables — donde una respuesta comprobable aporta la señal de entrenamiento — es lo que hizo reproducible este enfoque fuera de los laboratorios cerrados. Conviene decir el intercambio con claridad: precisión obtenida por la longitud de la generación y no por un modelo mayor, pagada en latencia y coste de servicio.

Periodo de referencia
2024 / 2025
Última revisión

Términos clave

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Conexiones en el proyecto

Fuentes primarias

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.