АДVERSARIAL CONTROL: Является ли трофическая иерархия артефактом инструктивной настройки + согласованных персон, или она возникает только из динамики взаимодействия?
Все ~90 существующих экспериментов используют инструктивно настроенный Gemini с согласованными когнитивными персонами (аналитическая, ассоциативная, конкретная и т.д.). Если для иерархии требуется дифференциация согласованных персон (поведение, зависящее от RLHF), то перемешивание контента персон при сохранении количества токенов должно ее устранить.
Условие TUNED: стандартная настройка pent70 (контроль репликации). Условие SCRAMBLED: та же модель, та же постановка, но описания персон перемешаны между агентами — разрушая когерентность когнитивного стиля внутри агента, при сохранении общего словарного запаса, количества токенов и структуры взаимодействия.
Это самый сильный осуществимый адверсариальный тест без доступа к базовым (не RLHF) моделям. API Google предоставляет только инструктивно настроенные варианты. Контроль с перемешанными промптами тестирует более слабую, но все еще важную гипотезу: требуется ли для иерархии ДИФФЕРЕНЦИАЦИЯ СОГЛАСОВАННЫХ персон, или достаточно любой дифференциации промптов (даже несогласованной)?
ПРИМЕЧАНИЕ: Истинный тест базовой модели (без RLHF вообще) был бы сильнее, но требует доступа к весам, не прошедшим инструктивную настройку, через API. Межмодельный тест (gemini-2.0-flash) является запланированным последующим экспериментом (exp-cross-model).