Training und Nachtraining
Reasoning and test-time compute
Ein Nachtraining, das ein Modell dazu bringt, vor der Antwort eine lange Argumentationsspur zu erzeugen und bei schwereren Aufgaben mehr Rechenzeit zur Inferenz aufzuwenden. Bestärkendes Lernen mit überprüfbaren Belohnungen — bei dem eine nachprüfbare Antwort das Trainingssignal liefert — machte den Ansatz auch außerhalb geschlossener Labore reproduzierbar. Der Handel gehört klar benannt: Genauigkeit über die Länge der Generierung statt über ein größeres Modell, bezahlt mit Latenz und Betriebskosten.
Schlüsselbegriffe
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Verknüpfungen im Projekt
Baut auf
Verwandte Technologien
Verwandte Arbeiten
Historischer Kontext
Primärquellen
Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.