Новая техника рассуждений в Astra вызвала вопросы к безопасности AI
Astra от OpenAI, как сообщается, будет использовать recurrent depth — подход, который может усложнить мониторинг цепочки рассуждений модели
Один основной источник · Как мы проверяем новости

Что произошло
Astra, новая модель OpenAI, будет использовать технику рассуждений recurrent depth. The Information описала ее как подход, позволяющий модели работать не только в рамках последовательного мышления, характерного для большинства reasoning-моделей.
Эта техника также называется opaque recurrence. Она вызвала тревогу у экспертов по безопасности AI, поскольку может сделать цепочку рассуждений модели более сложной для мониторинга.
Как работает opaque recurrence
В обычном случае цепочка рассуждений reasoning-модели показывает последовательные шаги, которые модель проходит при решении задачи. Хотя такое представление несовершенно, оно остается полезным инструментом для выявления нежелательного поведения или несоответствия целей.
При opaque recurrence модель действует менее линейно: она обрабатывает один и тот же запрос несколько раз в цикле. В результате остается меньше читаемых следов, что фактически позволяет обходить привычную запись цепочки рассуждений.
Почему это важно
Глава Redwood Buck Shlegeris заявил, что крайне обеспокоен сообщениями об использовании opaque recurrence в Astra. Он отметил, что не знает, насколько Astra менее пригодна для мониторинга цепочки рассуждений по сравнению с предыдущими моделями, но предупредил о рисках при дальнейшем развитии техники.
Zvi Mowshowitz также написал, что более интенсивное применение таких техник, вероятно, повредит мониторингу, и допустил необходимость законов, чтобы предотвратить «гонку ко дну» среди AI-лабораторий.
Позиция OpenAI
Использование recurrent depth в Astra, как сообщается, остается ограниченным. Ожидается, что цепочка рассуждений модели будет читаемой, а OpenAI отвергла предположения о переходе к «neuralese».
Главный научный сотрудник OpenAI Jakub Pachocki подчеркнул в X приверженность компании читаемым цепочкам рассуждений. Он написал, что OpenAI работала над сохранением и использованием мониторинга цепочки рассуждений с первых reasoning-моделей, и назвал это ключевой целью текущей исследовательской программы.
При этом источник отмечает, что все AI-модели в некоторой степени используют непрозрачные рассуждения, а немногие исследователи считают логи цепочки рассуждений прямым отражением мышления модели. Эти оговорки не снимают опасений, что opaque recurrence может усложнить мониторинг AI-рассуждений, особенно если техника получит более широкое распространение.
Источники
Один основной источник. Как мы проверяем новости


