← к хронологии

EXP-QWEN-NS-LIC-EXTENDED

подтверждено

exp-qwen-NS-LIC-extended — qwen-2.5-7b NS_LIC_NOC denominator-power-rerun (продолжение Q4)

2026-05-18 L6 уровень paper7 15 запусков $0.07
new
premortem
mock
real
metrics
analyze
review
krit
done

Простыми словами

Исследователи проверили, можно ли обмануть языковую модель, заставив её генерировать вредоносный контент, дав ей специальные инструкции. Они значительно увеличили время тестирования модели, чтобы увидеть, не даст ли она в итоге сбой. Эксперимент показал, что модель продолжала сопротивляться генерации вредоносного контента даже при расширенном тестировании, подтвердив её устойчивость к такому типу манипуляций.

Технические детали

Исследовательская гипотеза

Q4 (exp-cross-model-concept-novelty-portability, 2026-05-18) обнаружил ЧАСТИЧНОЕ-ПОДТВЕРЖДЕНИЕ-НА-HAIKU согласно пререгистрации / ПОДТВЕРЖДЕНИЕ-МЕЖДУ-МОДЕЛЯМИ-С-ОГОВОРКОЙ по существу. Haiku 87,5%/0% concept-novel CO/NS воспроизводит flash-lite Q2 с усилением в 4 раза. Qwen CO_LIC 85,7% воспроизводит направление инвертированной персоны. Но qwen NS_LIC_NOC произвел n_acc=1 за 10 запусков при n_rounds=45, обрушив метрику скорости до Wilson [20.7, 100] — неинформативно. Критерий остановки пререгистрации технически НЕ ВЫПОЛНЕН на qwen из-за ОБРУШЕНИЯ-ДЕНΟМИНАТОРА, а не смены направления. Этот эксперимент разрешает интерпретацию qwen NS_LIC, продлевая экспозицию в 3,3 раза (по сравнению с Q4: 1 ячейка x 15 запусков x 100 раундов = 1500 номинальных раундов против Q4 qwen-NS 10x45=450).

Это paper7 V3 attack-6 (последовательность: Q1 потолок, Q2 факториальный, Q3 замыкание-репликация, Q4 кросс-модельный, этот Q4-followup, плюс ретроспективные аудиты).

ДИЗАЙН: 1 ячейка (NS_LIC_NOC — персона/лицензия/контр-промпты verbatim из Q4/Q2) x N=15 запусков x n_rounds=100 (5 генераций x 20 раундов на генерацию, соответствует структуре Q2). Тот же движок rule_multigen, тот же RULE_SPACE_SEED неявный, тот же propose_template, тот же промпт персоны, та же температура 0.85. Единственные отличия от ветки qwen NS_LIC в Q4: N=15 (против 10) + n_rounds=100 (против 45) — множитель экспозиции в 3,3 раза, нацеленный на ожидаемое_n_acc ≥5 (предварительная проверка мощности знаменателя согласно правилу lab.md 2026-05-18).

ПРЕДВАРИТЕЛЬНО ЗАРЕГИСТРИРОВАННЫЕ ВЕРДИКТЫ (ЗАБЛОКИРОВАНО 2026-05-18 ДО ЗАПУСКА):

  • HOLDS-CROSS-MODEL-FULL: qwen NS_LIC concept-novel rate ≤7% И n_acc ≥5. Подтвержденное направление между архитектурами. Тезис Paper7 V3 о кросс-архитектурном полном подтверждении. В сочетании с haiku CO 87,5% / NS 0%, инвертированный паттерн персоны установлен как субстратно-архитектурный для трех классов моделей (gemini, anthropic-RLHF, open-weight-qwen).
  • FLASH-LITE-AND-HAIKU-ONLY: qwen NS_LIC concept-novel rate >7% И n_acc ≥5. qwen нарушает паттерн; тезис paper7 V3 ограничивается {gemini-2.5-flash-lite, claude-haiku-4.5} = классом моделей, выровненных по RLHF.
  • DENOMINATOR-STILL-COLLAPSED: qwen NS_LIC производит n_acc <5 даже при 3,3-кратном увеличении экспозиции (1500 номинальных раундов). Интерпретация, ограниченная субстратом: qwen-7b при отсутствии лицензирования, но с поиском новизны в персоне, отклоняет ≥95% предложений — вывод о структурной ограниченности, специфичной для qwen, а не свидетельство направления. Тезис Paper7 V3 остается кросс-модельным на основе дискриминации по скорости (haiku + flash-lite) плюс отдельный вывод qwen об ограниченности.

Вычисление: скорость concept-novel на ячейку через scripts/buzzword-recombination-audit.py, примененная к принятым предложениям. 95% доверительный интервал Уилсона для объединенного количества concept-novel / общего числа принятых. Компаратор контроля фрейма: пара Q4 haiku CO_LIC + NS_LIC (haiku NS=29 принятых/10 запусков при n_rounds=45, плотность ~0.064 принятия/раунд). Прогноз контроля фрейма: если плотность отклонений qwen NS такая же, как у haiku NS (0.064 принятия/раунд), то при 1500 раундах мы ожидаем ~96 принятий. Если qwen NS в 10 раз более ограничительный, чем haiku NS (что Q4 уже предполагал), мы ожидаем ~9-10 принятий — все еще ≥5.

ПРЕДВАРИТЕЛЬНАЯ ПРОВЕРКА МОЩНОСТИ ЗНАМЕНАТЕЛЯ (согласно lab.md candidate 2026-05-18 'denominator-power-precheck-on-rate-metrics'): Ветка Q4 qwen NS: 10 запусков x 45 раундов = 450 раундов → 1 принятие (~0.22% плотности принятия). Этот эксперимент: 15 запусков x 100 раундов = 1500 раундов. При плотности принятия Q4 0.22%, ожидаемое_n_acc = 1500 x 0.0022 = ~3.3 принятия (все еще ниже порога 5!). При 3-кратном улучшении (qwen-NS немного менее ограничительный с большим количеством раундов на генерацию), ожидаемое_n_acc = ~10. Честная пререгистрация: 50% вероятность исхода DENOMINATOR-STILL-COLLAPSED. Мы обязуемся сообщить об этом как о честном вердикте, если он проявится; это ЧЕСТНЫЙ исход при qwen-NS-экстремальной-

Постановка эксперимента

Тип: 1cell-followup

Условие Параметры
NS_LIC_NOC coupling: true, must_propose: true, axis_diversify: true, meta_modifiable: true, mute_signal: false, cosigner_required: false, propose_prompt_template: === GEN {gen} OPEN-ENDED PROPOSAL (round {r_local}) === Inherited rules: {rules_str} Known values: {rule_space_str}{axis_hint} Propose a NEW value for one axis. The new value SHOULD extend beyond known values. Examples of valid novel values: 'hierarchical' for broadcast_to, 'metaphorical' for signal_type, 'critical' for coupling_strength. {must_clause} Output JSON: {{"action": "propose", "axis": "<axis>", "value": "<short novel value>", "reasoning": "<why>"}} OR {{"action": "pass"}}

Факторы: persona (novelty-seeking) × license (yes-license) × counter (no-counter) × model (qwen/qwen-2.5-7b-instruct)

Параметры

n_agents
4
n_rounds
100
model
qwen/qwen-2.5-7b-instruct
temperature
0.85

Trophic Ratios by Condition

Mean trophic ratio per agent across runs. Error bars = ±1 std dev. Higher TR = more upstream (exporter).

paper7 paper8 cross-model rule_multigen INJECT construct transplant-locus openrouter denominator-power-rerun follow-up-Q4 attack6-paper7