Français
← Retour aux technologies de l’IA

Entraînement et post-entraînement

Reasoning and test-time compute

Un post-entraînement qui apprend au modèle à produire une longue trace de raisonnement avant de répondre, et à dépenser davantage de calcul à l’inférence quand le problème est plus difficile. L’apprentissage par renforcement à récompenses vérifiables — où une réponse contrôlable fournit le signal d’entraînement — est ce qui a rendu l’approche reproductible hors des laboratoires fermés. Le compromis mérite d’être dit clairement : une précision obtenue par la longueur de génération plutôt que par un modèle plus grand, payée en latence et en coût de service.

Période de référence
2024 / 2025
Dernière vérification

Termes clés

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Liens dans le projet

Sources primaires

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Cette carte est une sélection éditoriale, non une prétention à l’exhaustivité.