Entraînement et post-entraînement
Reasoning and test-time compute
Un post-entraînement qui apprend au modèle à produire une longue trace de raisonnement avant de répondre, et à dépenser davantage de calcul à l’inférence quand le problème est plus difficile. L’apprentissage par renforcement à récompenses vérifiables — où une réponse contrôlable fournit le signal d’entraînement — est ce qui a rendu l’approche reproductible hors des laboratoires fermés. Le compromis mérite d’être dit clairement : une précision obtenue par la longueur de génération plutôt que par un modèle plus grand, payée en latence et en coût de service.
Termes clés
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Liens dans le projet
Repose sur
Technologies liées
Articles liés
Contexte historique
Sources primaires
Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.