ЗДЕСЬ медиа
magazine.sebastianraschka.com

Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды

В последних релизах языковых моделей появились настройки вычислительных усилий. Себастьян Рашка объясняет, как LLM учатся контролировать глубину анализа задач. Рассуждение нейросети — это генерация промежуточного текстового следа. Алгоритм пошагово прорабатывает проблему перед выдачей финального ответа. Управление этим процессом происходит за счет масштабирования инференса.

Навык формируется через обучение с подкреплением и проверяемыми наградами (RLVR). Система выдает бинарный сигнал — 0 за ошибку и 1 за успех. Проверка работает в строгих доменах. Код прогоняется через компилятор, математика — через символьные решатели. Промежуточные шаги алгоритма при этом игнорируются. Награду определяет исключительно итоговый результат и формат вывода.

Обучения на финальных ответах оказалось достаточно для сложного поведения. Модель учится писать развернутые объяснения, откатываться на шаг назад и исправлять ошибки. В процессе возникают «Aha-моменты» — нейросеть замечает логическую нестыковку и корректирует ход решения. Проект DeepSeek-R1-Zero доказал работоспособность подхода. Способность к рассуждению формируется на чистом RL даже без предварительного supervised fine-tuning.

Поделиться:

Telegram

Ещё из архива

Все публикации