Обучение и постобучение
Reasoning and test-time compute
Дообучение, которое учит модель порождать длинную цепочку рассуждения перед ответом и тратить больше вычислений на этапе вывода, когда задача сложнее. Обучение с подкреплением на проверяемых наградах — когда сигнал даёт ответ, поддающийся проверке, — сделало этот путь воспроизводимым за пределами закрытых лабораторий. Размен стоит назвать прямо: точность достигается длиной генерации, а не увеличением модели, и оплачивается задержкой и стоимостью обслуживания.
Ключевые термины
- reasoning traces
- verifiable rewards
- inference budget
- chain of thought
Связи внутри проекта
Опирается на
Связанные технологии
Связанные работы
Исторический контекст
Первичные источники
Это отобранная техническая карта, а не заявление о полном охвате.