Русский
← Назад к технологиям ИИ

Обучение и постобучение

Reasoning and test-time compute

Дообучение, которое учит модель порождать длинную цепочку рассуждения перед ответом и тратить больше вычислений на этапе вывода, когда задача сложнее. Обучение с подкреплением на проверяемых наградах — когда сигнал даёт ответ, поддающийся проверке, — сделало этот путь воспроизводимым за пределами закрытых лабораторий. Размен стоит назвать прямо: точность достигается длиной генерации, а не увеличением модели, и оплачивается задержкой и стоимостью обслуживания.

Опорный период
2024 / 2025
Последняя проверка

Ключевые термины

  • reasoning traces
  • verifiable rewards
  • inference budget
  • chain of thought

Связи внутри проекта

Первичные источники

  1. OpenAI o1 System Card
  2. DeepSeek-R1
  3. s1: Simple Test-Time Scaling

Это отобранная техническая карта, а не заявление о полном охвате.