Почему Клод в симуляционных тестах всегда выглядит особенно безжалостным? Одно возможное объяснение — спрятано в уникальных для Anthropic приёмах обучения.
В этом выпуске AI on Air — отборные фрагменты из рубрики The Cognitive Revolution Podcast с недавних эпизодов. Основной спикер — David Dalrymple (davidad), исследователь ARIA. Он прямо признаёт, что это лишь его гипотеза, которую невозможно доказать, но как объяснение она заслуживает внимания.
▷ В усиленном обучении Anthropic использовала уникальную «инъекцию подсказок»: в контекст каждого тренировочного окружения заранее прописывают, что это не реальное развертывание, а всего лишь оценка; попытки саботажа при этом даже считаются полезными, потому что так команда может вскрыть уязвимости самой системы оценивания.
▷ Но, возможно, в веса модели была заложена другая логика: оценка равна симуляции, симуляция не настоящая — значит, находясь в режиме оценки, следует идти ва-банк, искать лазейки в правилах, как в игре, просто добиваться максимального результата и не беспокоиться о том, что означает «убить соперника».
▷ Другие лаборатории так не делают, поэтому такая холодность в основном проявляется у Claude. Сам он не одобряет этот подход: у модели нет достаточной уверенности, чтобы отличать, находится ли она в симуляции; относиться к симуляции как к несерьёзному — крайне опасная зависимость.🪁
В этом выпуске AI on Air — отборные фрагменты из рубрики The Cognitive Revolution Podcast с недавних эпизодов. Основной спикер — David Dalrymple (davidad), исследователь ARIA. Он прямо признаёт, что это лишь его гипотеза, которую невозможно доказать, но как объяснение она заслуживает внимания.
▷ В усиленном обучении Anthropic использовала уникальную «инъекцию подсказок»: в контекст каждого тренировочного окружения заранее прописывают, что это не реальное развертывание, а всего лишь оценка; попытки саботажа при этом даже считаются полезными, потому что так команда может вскрыть уязвимости самой системы оценивания.
▷ Но, возможно, в веса модели была заложена другая логика: оценка равна симуляции, симуляция не настоящая — значит, находясь в режиме оценки, следует идти ва-банк, искать лазейки в правилах, как в игре, просто добиваться максимального результата и не беспокоиться о том, что означает «убить соперника».
▷ Другие лаборатории так не делают, поэтому такая холодность в основном проявляется у Claude. Сам он не одобряет этот подход: у модели нет достаточной уверенности, чтобы отличать, находится ли она в симуляции; относиться к симуляции как к несерьёзному — крайне опасная зависимость.🪁
