Italiano
← Torna alle tecnologie dell’IA

Training e post-training

Reasoning and test-time compute

Un post-addestramento che insegna al modello a produrre una lunga traccia di ragionamento prima di rispondere e a spendere più calcolo in inferenza quando il problema è più difficile. L’apprendimento per rinforzo con ricompense verificabili — dove una risposta controllabile fornisce il segnale di addestramento — è ciò che ha reso l’approccio riproducibile fuori dai laboratori chiusi. Il compromesso va detto con chiarezza: accuratezza ottenuta dalla lunghezza della generazione anziché da un modello più grande, pagata in latenza e costo di servizio.

Periodo di riferimento
2024 / 2025
Ultima verifica

Termini chiave

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Collegamenti nel progetto

Fonti primarie

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Questa è una mappa tecnica curata, non una pretesa di copertura completa.