← к хронологии

EXP-BASE-MODEL

подтверждено

Базовый контроль модели: Тест с перемешанными персонами для выявления иерархии

2026-03-26 L3 уровень paper3 6 запусков $0.04
new
premortem
mock
real
metrics
analyze
review
krit
done

Простыми словами

Проверяем, является ли наблюдаемая нами социальная иерархия в группах ИИ-агентов реальным эмерджентным явлением или просто артефактом того, как ИИ был обучен. Мы перемешиваем описания личностей агентов, превращая их в бессвязный набор слов, сохраняя при этом все остальное идентичным. Если иерархия по-прежнему появляется при перемешанных личностях, значит, это устойчивое явление, не зависящее от связного отыгрывания ролей.

Что мы выяснили

НЕДОСТАТОЧНО МОЩНОСТИ (N=3): Прогнозов не получено

Предсказания до запуска

0/4 confirmed

Технические детали

Исследовательская гипотеза

АДVERSARIAL CONTROL: Является ли трофическая иерархия артефактом инструктивной настройки + согласованных персон, или она возникает только из динамики взаимодействия?

Все ~90 существующих экспериментов используют инструктивно настроенный Gemini с согласованными когнитивными персонами (аналитическая, ассоциативная, конкретная и т.д.). Если для иерархии требуется дифференциация согласованных персон (поведение, зависящее от RLHF), то перемешивание контента персон при сохранении количества токенов должно ее устранить.

Условие TUNED: стандартная настройка pent70 (контроль репликации). Условие SCRAMBLED: та же модель, та же постановка, но описания персон перемешаны между агентами — разрушая когерентность когнитивного стиля внутри агента, при сохранении общего словарного запаса, количества токенов и структуры взаимодействия.

Это самый сильный осуществимый адверсариальный тест без доступа к базовым (не RLHF) моделям. API Google предоставляет только инструктивно настроенные варианты. Контроль с перемешанными промптами тестирует более слабую, но все еще важную гипотезу: требуется ли для иерархии ДИФФЕРЕНЦИАЦИЯ СОГЛАСОВАННЫХ персон, или достаточно любой дифференциации промптов (даже несогласованной)?

ПРИМЕЧАНИЕ: Истинный тест базовой модели (без RLHF вообще) был бы сильнее, но требует доступа к весам, не прошедшим инструктивную настройку, через API. Межмодельный тест (gemini-2.0-flash) является запланированным последующим экспериментом (exp-cross-model).

Постановка эксперимента

Тип: factorial

Условие Параметры
TUNED_LIVE persona: PERSONA, interaction: LIVE, n_agents: 5, n_rounds: 70, note: Standard pent70. Coherent cognitive personas. Replication control.
SCRAMBLED_LIVE persona: PERSONA, interaction: LIVE, n_agents: 5, n_rounds: 70, note: Scrambled personas. Same words cross-mixed. Incoherent cognitive style.

Факторы: persona_condition (TUNED, SCRAMBLED)

Параметры

n_agents
5
n_rounds
70
n_runs_per_condition
3
model
gemini-2.5-flash-lite
temperature
0.9
scheduler
round_robin

Trophic Ratios by Condition

Mean trophic ratio per agent across runs. Error bars = ±1 std dev. Higher TR = more upstream (exporter).