Deutsch
← Zurück zu KI-Technologien

Training und Nachtraining

Reasoning and test-time compute

Ein Nachtraining, das ein Modell dazu bringt, vor der Antwort eine lange Argumentationsspur zu erzeugen und bei schwereren Aufgaben mehr Rechenzeit zur Inferenz aufzuwenden. Bestärkendes Lernen mit überprüfbaren Belohnungen — bei dem eine nachprüfbare Antwort das Trainingssignal liefert — machte den Ansatz auch außerhalb geschlossener Labore reproduzierbar. Der Handel gehört klar benannt: Genauigkeit über die Länge der Generierung statt über ein größeres Modell, bezahlt mit Latenz und Betriebskosten.

Referenzzeitraum
2024 / 2025
Zuletzt geprüft

Schlüsselbegriffe

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Verknüpfungen im Projekt

Primärquellen

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Dies ist eine kuratierte technische Karte und kein Anspruch auf Vollständigkeit.