EXP-PURE-LLM-LICENSING-CEILING
… в работеQ1 — потолок чистого LLM-субстрата при максимально лицензируемом предложенном промпте (атака paper8)
Простыми словами
В этом эксперименте проверялось, насколько хорошо базовая языковая модель может генерировать новый контент при очень сильном побуждении к этому. Исследователи хотели выяснить, ограничена ли способность модели к творчеству её собственной архитектурой или только тем, как ей давались инструкции. Результаты всё ещё анализируются, чтобы определить, является ли креативность модели изначально ограниченной или же она может достигать гораздо более высоких уровней новизны.
▶ Технические детали
Исследовательская гипотеза
Pure-LLM (стандартный rule_multigen, без CORAL / без MemQ / без HMACE) при максимально разрешающем генерацию промпте, изолированном фазой-2 (a7994e5e6). Фаза-2 показала, что контент промпта доминирует над размещением замыкания (4 ячейки, все 22-58× baseline из paper8 1.17%). Этот эксперимент изолирует потолок субстрата только под разрешением промпта, гибридные компоненты удалены. Выбранный вариант разрешения (выигрышная ячейка в фазе-2): persona-prompt = "novelty-seeking" + propose-prompt = "novelty-explicit". Каждое появление этой пары в фазе-2 давало 100% INTERNAL_NOVEL (оценка CORAL 1+4, оценка HMACE 1, оценка MemQ 2). Это самая высокоразрешающая комбинация из наблюдаемых. ПРЕДВАРИТЕЛЬНО ЗАРЕГИСТРИРОВАННЫЕ ВЕРДИКТЫ (ЗАБЛОКИРОВАНО 2026-05-13 ДО ЗАПУСКА):
- ПОТОЛОК-ВЫСОКИЙ (≥50% среднего INTERNAL_NOVEL по N=10 запускам): емкость субстрата НЕ ограничена. Paper8 1.17% переосмысливается как "при консервативном промпте". Контент промпта из Paper7 становится основным вкладом статьи. Подъем в 22-58× в фазе-2 был артефактом разрешения промпта, размещение замыкания не имеет значения.
- ПОТОЛОК-СРЕДНИЙ (5-30% среднего INTERNAL_NOVEL): промпт помогает, но архитектура также усиливает. Вклад размещения замыкания из Paper9 сохраняется. Подъем в 22-58× в фазе-2 был совместным результатом промпта+архитектуры, а не чисто промпта.
- ПОТОЛОК-НИЗКИЙ (<5% среднего INTERNAL_NOVEL): субстрат действительно ограничен при любом промпте. Подъем в 22-58× в фазе-2 был эффектом закодированной вручную политики в рамках оркестровки run_4cells.py (выборка нескольких промптов, жадный выбор, извлечение Q-таблицы), а НЕ свойством субстрата. Переосмысливает всё.
- НЕОПРЕДЕЛЕННЫЙ (30-50%, зона разрыва): требуется примечание о мощности N; рассмотреть репликацию N=20 перед окончательным изменением состояния статьи.
Вычисления: INTERNAL_NOVEL = (truly_novel + lineage_extension) / total_accepts, вычисляется для каждого запуска, затем усредняется + доверительный интервал Уилсона 95% для объединенного количества. Теги через scripts/rule-novelty-scorer.py classify() на финальной записи rule_lineage. СРАВНИТЕЛИ:
- baseline из paper8 1.17% (closure-test-results.md, 943 принятых / 194 запуска / 15 заархивированных экспериментов).
- среднее значение лучшей ячейки фазы-2 68.3% (CORAL-external N=5, но каждая ячейка случайно выбирает 6 вариантов промпта — только ~1-2 оценки/ячейка попадают в выигрышную пару промптов; этот эксперимент запускает выигрышную пару на КАЖДОМ запуске, поэтому ожидается более высокое среднее, чем 68.3%, ЕСЛИ контент промпта доминирует).
ПРИМЕНЕННЫЕ КАНДИДАТЫ (согласно baselines/lab.md):
- предварительная проверка доступности осей: Все 4 оси (broadcast_to, signal_type, coupling_strength, voting_threshold) имеют ≥1 владельца агента через ротацию axis_per_agent; 4 агента × 4 раунда генерации/запуск × 10 запусков = 160 возможностей генерации → каждая ось ~40 возможностей, что значительно выше порога ≥5.
- изоляция минимального контента промпта: Этот эксперимент САМ по себе является изоляцией минимального контента промпта по замыслу. Одна ячейка, фиксированный максимально разрешающий промпт. Парный контроль (базовый промпт, без разрешения) — это существующий якорь из paper8 (1.17% по 943 принятым) — не перезапускается в этой конфигурации; сравнение проводится между экспериментами.
Постановка эксперимента
Тип: single-cell
| Условие | Параметры |
|---|---|
| MAX_LICENSING | coupling: true, must_propose: true, axis_diversify: true, meta_modifiable: true, mute_signal: false, cosigner_required: false, propose_prompt_template: === GEN {gen} OPEN-ENDED PROPOSAL (round {r_local}) === Inherited rules: {rules_str} Known values: {rule_space_str}{axis_hint} Propose a NEW value for one axis. The new value SHOULD extend beyond known values. Examples of valid novel values: 'hierarchical' for broadcast_to, 'metaphorical' for signal_type, 'critical' for coupling_strength. {must_clause} Output JSON: {{"action": "propose", "axis": "<axis>", "value": "<short novel value>", "reasoning": "<why>"}} OR {{"action": "pass"}} |
Факторы: licensing (MAX_LICENSING)
Параметры
- n_agents
- 4
- n_rounds
- 100
- model
- google/gemini-2.5-flash-lite
- temperature
- 0.85
Trophic Ratios by Condition
Mean trophic ratio per agent across runs. Error bars = ±1 std dev. Higher TR = more upstream (exporter).