Исследователь Anthropic показал подход к самоулучшению AI
Anthropic опубликовала работу об автоматизированных исследователях, которые улучшали показатели модели на задачах выравнивания без ухудшения общей производительности
Один основной источник · Как мы проверяем новости

Что произошло
Anthropic опубликовала исследование “Automated Researchers Can Reliably Mitigate Alignment Failures”, в котором показала ранний пример применения AI-систем для улучшения обучения моделей на задачи выравнивания.
Автоматизированные системы получили 10 бенчмарков, связанных с конкретными некорректными поведениями, и смогли улучшить результат на каждом из них без ухудшения общей производительности модели.
Как работает система
Система, которой руководил fellow Anthropic Chen Yueh-Han, имитирует традиционный исследовательский подход: ищет доступную литературу, предлагает метод и затем обучает модель с использованием этого метода в течение 30 минут.
После нескольких итераций эффективные методы сохраняются, а неэффективные отбрасываются. В статье говорится, что такой подход позволяет системе работать быстро и в большом масштабе.
Почему это важно
Авторы статьи называют результаты ранним свидетельством того, что автоматизированное дообучение для выравнивания может стать практичным в ближайшей перспективе.
Работа рассматривается как шаг к рекурсивному самоулучшению: если модели смогут улучшать собственное обучение для выравнивания, они потенциально смогут улучшать и более широкие практики обучения.
Сравнение с людьми и ограничения
В работе Automated Alignment Researcher, или AAR, напрямую сравнивается с человеком-исследователем. Авторы утверждают, что лучший метод AAR в среднем за шесть часов превосходит то, что предлагают опытные люди.
Также приводится сравнение стоимости: AAR обходится примерно в $4 в час на API-инференс против $150 в час, которые платят людям-исследователям.
При этом у подхода есть ограничения. Автоматизированная система полезна лишь настолько, насколько бенчмарки отражают реальные цели выравнивания; также остается значительная работа по созданию и поддержанию этих бенчмарков и литературы, на которую опираются автоматизированные исследователи.
Источники
Один основной источник. Как мы проверяем новости


