ЗДЕСЬ медиа
github.com

Автоматизация ИИ-исследований: как агент Kimi K3 и Tinker проверили статью о превосходстве RLSD над GRPO

Автоматизация исследовательского цикла дошла до уровня, когда нейросети сами проверяют научные публикации. Связка агента Kimi K3 и платформы Tinker берет на себя почти весь рутинный процесс. Поскольку Tinker прячет под капот сложную инфраструктуру для обучения, агент фокусируется исключительно на логике эксперимента. Код получается чистым, а отслеживать изменения между итерациями становится намного проще.

В качестве проверки Kimi поручили воспроизвести результаты статьи о Self-Distilled RLVR (RLSD). Авторы исследования заявляли, что их метод обходит алгоритм GRPO в точности математических рассуждений. Агент с первого раза собрал базовую реализацию, после чего автономно провел 19 экспериментов с шестью конфигурациями. В качестве полигона использовались модели семейства Qwen и бенчмарк MATH500, а все обучение шло через LoRA.

Главное утверждение статьи не подтвердилось. Классический GRPO уверенно обошел RLSD, показав прирост +10.8 баллов против +9.0. Однако Kimi успешно валидировал механические свойства алгоритма: энтропия RLSD действительно остается в два раза выше на поздних этапах, а более старый метод распределенной дистилляции предсказуемо коллапсирует. ИИ не просто прогнал скрипты, но и собрал структурированный отчет с анализом метрик. Способность машин так глубоко и автономно аудировать чужие исследования впечатляет не меньше самих цифр!

Поделиться:

Telegram

Ещё из архива

Все публикации