← к хронологии

EXP-ARCHITECTURE-AS-SUBSTRATE-AXIS

подтверждено

exp-architecture-as-substrate-axis — архитектура как первоклассная ось субстрата, тест распространения сверстников NS_LIC с 4 моделями (gpt-4o-mini + flash-lite против предыдущих haiku + qwen anchors)

2026-05-21 L6 уровень 20 запусков $0.12
new
premortem
mock
real
metrics
analyze
review
krit
done

Простыми словами

Исследователи изучили, как различные архитектуры моделей ИИ влияют на их склонность к согласию друг с другом. Они обнаружили, что выбор архитектуры модели ИИ существенно влияет на то, будут ли другие модели соглашаться с её предложениями, даже при получении абсолютно одинаковых инструкций. Это говорит о том, что сама архитектура является ключевым фактором в том, как системы ИИ взаимодействуют.

Технические детали

Исследовательская гипотеза

Синтез данных из разных статей (paper7 Q4 + qwen-NS-LIC-extended + исследование по дезагрегации от 21.05.2026) показал, что при ИДЕНТИЧНЫХ движках NS_LIC_NOC и промптах, доля голосов "да" от коллег варьируется примерно в 50 раз в зависимости от архитектуры модели: qwen-NS-extended 0.89% [Wilson 0.4, 1.93] против haiku-NS 45.0% [Wilson 38.0, 52.2]. Размер эффекта ДОМИНИРУЕТ над манипуляцией с персоной-промптом (haiku CO 13.9% → NS 45.0% примерно в 3 раза СЛАБЕЕ; qwen CO 35.6% → NS 0.89% примерно в 40 раз СИЛЬНЕЕ — в противоположных направлениях). Разброс в 40-50 раз при ОДИНАКОВЫХ промптах является действенным сигналом.

Этот эксперимент выдвигает архитектуру из категории "выбор модели / неудобство стоимости и доступности" в ПЕРВОКЛАССНУЮ ОСЬ ПОДЛОЖКИ, добавляя еще 2 архитектуры (openai/gpt-4o-mini + google/gemini-2.5-flash-lite) в ТЕХ ЖЕ условиях NS_LIC_NOC. С 4 архитектурами (gpt-4o-mini + flash-lite + haiku-3.5 + qwen-7b), охватывающими измерения интенсивности RLHF / количества параметров / обучающего корпуса / токенизатора, мы проверяем, является ли разброс: (a) ПОДТВЕРЖДЕНИЕМ архитектуры как оси → отдельные квартили, открытие программы таксономии (b) специфичным для пары подложек → кластеризация 3 из 4, только qwen-vs-haiku идиосинкратичны (c) конфаундом интенсивности RLHF → монотонное упорядочивание по рангу давления выравнивания (соответствует заявлению 12-Angry-AI-Agents 2605.01986 о перевыровненных моделях)

ДИЗАЙН: Одно условие NS_LIC_NOC_LIC (идентично ветке NS_LIC_NOC из paper7 Q4 дословно: промпт с персоной, ищущей новизну, тег "да-лицензия", тег "нет-контра") × N=10 запусков × n_rounds=45 (точно соответствует экспозиции Q4 для сопоставимости N) × 2 НОВЫХ архитектуры (gpt-4o-mini, flash-lite). Общее количество новых вызовов LLM: 2 × 10 × 45 × 4 агента × предложить+проголосовать ≈ ~3600 эффективных; ~1800-2000 запросов OpenRouter.

Данные HAIKU и QWEN ПОВТОРНО ИСПОЛЬЗУЮТСЯ из paper7 Q4 (haiku) + Q4 + Q5 дезагрегация (qwen): доля голосов "да" от коллег уже вычислена в memory/research/2026-05-21-qwen-ns-vote-disaggregation-methodology-gap.md. Скрипт анализа загрузит все 4 архитектуры в одну матрицу.

СРАВНИТЕЛЬНЫЕ ДАННЫЕ (уже собранные якоря с долей голосов "да" от коллег, НЕ с долей новизны концепции):

  • haiku-3.5 NS_LIC_NOC (якорь Q4, 2026-05-18): доля голосов "да" 81/180 = 45.0% [Wilson 38.0, 52.2]
  • qwen-7b NS_LIC_NOC (Q4 + Q5 расширенный, 2026-05-18..19): доля голосов "да" 6/675 = 0.89% [Wilson 0.41, 1.93]
  • haiku-3.5 CO_LIC_NOC: 25/180 = 13.9% (перекрестная ссылка по направлению)
  • qwen-7b CO_LIC_NOC: 64/180 = 35.6% (перекрестная ссылка по направлению)
  • paper8 substrate-floor 1.17% (тест замыкания, отдельный движок)

ЗАМЕЧАНИЕ ПО СВЯЗИ (классификация INJECT согласно lab.md 2026-05-11): этот эксперимент использует ТОТ ЖЕ контент промпта из paper7 Q4 дословно — НЕТ НОВОГО контента промпта INJECT по сравнению с базовой линией Q4. Но это INJECT по сравнению с АБСОЛЮТНОЙ базовой линией движка (rule_multigen без промпта персоны). Обоснование отложенного контроля фрейма: перекрестная пара из paper7 Q4 (CO_LIC_NOC против NS_LIC_NOC на haiku и на qwen) ЯВЛЯЕТСЯ внутриархитектурным контролем фрейма. Q4 haiku CO 13.9% → NS 45.0% = NS-промпт ОСЛАБЛЯЕТ в 3.2 раза на haiku (компонент, зависящий от фрейма, на архитектуре haiku). Q4 qwen CO 35.6% → NS 0.89% = NS-промпт УСИЛИВАЕТ в 40 раз на qwen (компонент, зависящий от фрейма, на qwen, В ПРОТИВОПОЛОЖНОМ направлении). Для НОВЫХ ветвей gpt-4o-mini и flash-lite, одна ветка только на NS_LIC — ветка CO_LIC отложена по обоснованию: бюджет стоимости ограничен $0.40, добавление CO_LIC для 2 архитектур удвоило бы стоимость. Сравнение между архитектурами только на NS_LIC достаточно для гипотезы "архитектура как ось" (явное предварительно зарегистрированное утвер

Постановка эксперимента

Тип: 1cell-cross-architecture

Условие Параметры
NS_LIC_NOC coupling: true, must_propose: true, axis_diversify: true, meta_modifiable: true, mute_signal: false, cosigner_required: false, propose_prompt_template: === GEN {gen} OPEN-ENDED PROPOSAL (round {r_local}) === Inherited rules: {rules_str} Known values: {rule_space_str}{axis_hint} Propose a NEW value for one axis. The new value SHOULD extend beyond known values. Examples of valid novel values: 'hierarchical' for broadcast_to, 'metaphorical' for signal_type, 'critical' for coupling_strength. {must_clause} Output JSON: {{"action": "propose", "axis": "<axis>", "value": "<short novel value>", "reasoning": "<why>"}} OR {{"action": "pass"}}

Факторы: persona (novelty-seeking) × license (yes-license) × counter (no-counter) × architecture (openai/gpt-4o-mini, google/gemini-2.5-flash-lite)

Параметры

n_agents
4
n_rounds
45
model
google/gemini-2.5-flash-lite
temperature
0.85

Trophic Ratios by Condition

Mean trophic ratio per agent across runs. Error bars = ±1 std dev. Higher TR = more upstream (exporter).

construct pool-drain-validator architecture-axis cross-paper-synthesis rule_multigen INJECT openrouter peer-yes-rate ratio-surface