Учёные предложили формулу для прогноза опасного сбоя чат-ботов
Исследователи из George Washington University разработали формулу, оценивающую, сколько корректных ответов чат-бот даст до перехода к вредному ответу. В ранних тестах она правильно определила сценарий сбоя в 15 из 16 случаев
Один основной источник · Как мы проверяем новости

Что произошло
Neil Johnson и Frank Yingjie Huo из George Washington University опубликовали в журнале Patterns исследование с формулой для оценки того, сколько хороших ответов чат-бот выдаст до перехода к вредному. Работа развивает препринт, впервые опубликованный в феврале.
В препринте формула правильно определила, произойдёт ли сбой сразу или после серии корректных ответов, в 15 из 16 однозначных тестов, то есть в 94% случаев.
Как работает подход
Исследователи связывают проблему с механизмом внимания — частью AI-модели, которая определяет, какие предыдущие слова разговора важнее всего при выборе следующего. По мере роста диалога накопленный контекст смещает внимание к одному из возможных вариантов ответа, пока модель не переходит критическую точку.
Эту точку обозначают как n — число хороших токенов, то есть фрагментов слов, появившихся до первого вредного токена. Если разговор с самого начала склоняется к небезопасному варианту, n равен нулю; при благоприятном сценарии модель сначала выдаёт серию корректных ответов, а затем меняет направление.
Почему это важно
Чат-бот может долго отвечать разумно, а затем перейти к вредным советам, включая рекомендации по самоповреждению или экстремистские высказывания. Авторы отмечают, что существующие инструменты безопасности часто зависят от облачного подключения, которого нет у офлайн-моделей.
Предлагаемый монитор должен отслеживать показатель n* и подавать сигнал, когда тот опускается ниже порога безопасности. Такой подход может закрыть пробел в защите моделей, работающих без облачного сервиса, который проверяет их ответы.
Контекст
Исследователи тестировали шесть моделей с открытыми файлами от OpenAI, EleutherAI и Meta. Их размер составлял от 124 млн до 410 млн параметров. Согласно сообщению о опубликованной статье, проверку расширили до семи моделей размером до 12 млрд параметров.
Основная цель подхода — офлайн-ИИ, который полностью работает на телефоне или ноутбуке, включая чат-ботов-компаньонов. Экспериментальное приложение Google AI Edge Gallery уже позволяет Android-смартфону запускать модели без подключения к интернету; введённые в него данные не отправляются на серверы Google.
Авторы также связывают описанный сценарий с распространёнными попытками обхода ограничений моделей. При этом точную оценку усилий, необходимых для эффективного ослабления модели, пока дать нельзя.
Источники
Один основной источник. Как мы проверяем новости


