Автоматизация исследовательского цикла дошла до уровня, когда нейросети сами проверяют научные публикации. Связка агента Kimi K3 и платформы Tinker берет на себя почти весь рутинный процесс. Поскольку Tinker прячет под капот сложную инфраструктуру для обучения, агент фокусируется исключительно на логике эксперимента. Код получается чистым, а отслеживать изменения между итерациями становится намного проще.
В качестве проверки Kimi поручили воспроизвести результаты статьи о Self-Distilled RLVR (RLSD). Авторы исследования заявляли, что их метод обходит алгоритм GRPO в точности математических рассуждений. Агент с первого раза собрал базовую реализацию, после чего автономно провел 19 экспериментов с шестью конфигурациями. В качестве полигона использовались модели семейства Qwen и бенчмарк MATH500, а все обучение шло через LoRA.
Главное утверждение статьи не подтвердилось. Классический GRPO уверенно обошел RLSD, показав прирост +10.8 баллов против +9.0. Однако Kimi успешно валидировал механические свойства алгоритма: энтропия RLSD действительно остается в два раза выше на поздних этапах, а более старый метод распределенной дистилляции предсказуемо коллапсирует. ИИ не просто прогнал скрипты, но и собрал структурированный отчет с анализом метрик. Способность машин так глубоко и автономно аудировать чужие исследования впечатляет не меньше самих цифр!
Поделиться:
Anthropic выпустила модель Claude Opus 5 с расширенными агентными функциями и обновленным подходом к кибербезопасности
Прагматичный подход к карьере дизайнера: анализ реальных требований рынка от Энтони Хобдея