Training e post-training
Reasoning and test-time compute
Un post-addestramento che insegna al modello a produrre una lunga traccia di ragionamento prima di rispondere e a spendere più calcolo in inferenza quando il problema è più difficile. L’apprendimento per rinforzo con ricompense verificabili — dove una risposta controllabile fornisce il segnale di addestramento — è ciò che ha reso l’approccio riproducibile fuori dai laboratori chiusi. Il compromesso va detto con chiarezza: accuratezza ottenuta dalla lunghezza della generazione anziché da un modello più grande, pagata in latenza e costo di servizio.
Termini chiave
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Collegamenti nel progetto
Si basa su
Tecnologie correlate
Articoli correlati
Contesto storico
Fonti primarie
Questa è una mappa tecnica curata, non una pretesa di copertura completa.