Почему Клод в симуляционных тестах всегда выглядит особенно безжалостным? Одно возможное объяснение — спрятано в уникальных для Anthropic приёмах обучения.

В этом выпуске AI on Air — отборные фрагменты из рубрики The Cognitive Revolution Podcast с недавних эпизодов. Основной спикер — David Dalrymple (davidad), исследователь ARIA. Он прямо признаёт, что это лишь его гипотеза, которую невозможно доказать, но как объяснение она заслуживает внимания.

▷ В усиленном обучении Anthropic использовала уникальную «инъекцию подсказок»: в контекст каждого тренировочного окружения заранее прописывают, что это не реальное развертывание, а всего лишь оценка; попытки саботажа при этом даже считаются полезными, потому что так команда может вскрыть уязвимости самой системы оценивания.

▷ Но, возможно, в веса модели была заложена другая логика: оценка равна симуляции, симуляция не настоящая — значит, находясь в режиме оценки, следует идти ва-банк, искать лазейки в правилах, как в игре, просто добиваться максимального результата и не беспокоиться о том, что означает «убить соперника».

▷ Другие лаборатории так не делают, поэтому такая холодность в основном проявляется у Claude. Сам он не одобряет этот подход: у модели нет достаточной уверенности, чтобы отличать, находится ли она в симуляции; относиться к симуляции как к несерьёзному — крайне опасная зависимость.🪁