Искусственный интеллект

Исследователь Anthropic показал подход к самоулучшению AI

Anthropic опубликовала работу об автоматизированных исследователях, которые улучшали показатели модели на задачах выравнивания без ухудшения общей производительности

Один основной источник · Как мы проверяем новости

Исследователь Anthropic показал подход к самоулучшению AI
Иллюстрация к материалу RedBTC News

Что произошло

Anthropic опубликовала исследование “Automated Researchers Can Reliably Mitigate Alignment Failures”, в котором показала ранний пример применения AI-систем для улучшения обучения моделей на задачи выравнивания.

Автоматизированные системы получили 10 бенчмарков, связанных с конкретными некорректными поведениями, и смогли улучшить результат на каждом из них без ухудшения общей производительности модели.

Как работает система

Система, которой руководил fellow Anthropic Chen Yueh-Han, имитирует традиционный исследовательский подход: ищет доступную литературу, предлагает метод и затем обучает модель с использованием этого метода в течение 30 минут.

После нескольких итераций эффективные методы сохраняются, а неэффективные отбрасываются. В статье говорится, что такой подход позволяет системе работать быстро и в большом масштабе.

Почему это важно

Авторы статьи называют результаты ранним свидетельством того, что автоматизированное дообучение для выравнивания может стать практичным в ближайшей перспективе.

Работа рассматривается как шаг к рекурсивному самоулучшению: если модели смогут улучшать собственное обучение для выравнивания, они потенциально смогут улучшать и более широкие практики обучения.

Сравнение с людьми и ограничения

В работе Automated Alignment Researcher, или AAR, напрямую сравнивается с человеком-исследователем. Авторы утверждают, что лучший метод AAR в среднем за шесть часов превосходит то, что предлагают опытные люди.

Также приводится сравнение стоимости: AAR обходится примерно в $4 в час на API-инференс против $150 в час, которые платят людям-исследователям.

При этом у подхода есть ограничения. Автоматизированная система полезна лишь настолько, насколько бенчмарки отражают реальные цели выравнивания; также остается значительная работа по созданию и поддержанию этих бенчмарков и литературы, на которую опираются автоматизированные исследователи.

Advertisement

Источники

Один основной источник. Как мы проверяем новости

  1. techcrunch.com