Qwen 3.8 подражает рассуждениям GPT-5.5 Pro: префилл даёт +20,58 п.п.

Qwen 3.8 follows GPT-5.5 Pro reasoning prefills

Автор повторил эксперимент с reasoning-префиллами, используя GPT-5.5 Pro в качестве учителя. Для 45 задач (STEM, не-STEM и синтетические головоломки) он сравнил обычные ответы четырёх открытых моделей с ответами, в начало канала рассуждений которых вставлен первый 1% рассуждений GPT-5.5 Pro. Qwen3.8 A95B показала самый резкий скачок: доля заимствованных униграмм выросла с 33,92% до 54,50% (+20,58 п.п.), особенно на STEM (+27,55 п.п.). Kimi K3 прибавила лишь +4,31 п.п., а DeepSeek V4 Flash и Inkling почти не изменились. Автор делает вывод, что Qwen могла учиться именно на GPT-5.5 Pro или близкой модели, а не на Opus.

Данные позволяют предположить, что Qwen могла учиться на GPT-5.5 Pro или на близкой модели GPT, а не на Opus.
  1. wongarsu

    Этот стиль письма, возможно, немного слишком напряжённый

    Если я правильно понял (добавление B из https://stolen-thoughts.com/paper.pdf существенно), они — авторы известного эксплойта для восстановления читаемого CoT из моделей OpenAI и Anthropic. Они используют это, чтобы найти признаки дистилляции, запуская бенчмарк с SotA-моделью, восстанавливая CoT, затем беря первые 1% CoT и запуская open-source модель так, как будто это начало её собственного CoT. В статье они обнаружили, что Kimi-K3 становится гораздо ближе к ответам Claude 4.8, когда ей предзаполняют начало рассуждений Claude 4.8, что говорит о том, что Claude 4.8 использовался в её пост-тренировке. Этот пост в блоге — продолжение с результатами, которые намекают, что Qwen3.8 была пост-тренирована с помощью GPT-5.5 Pro (или какой-то похожей по ответам GPT-модели, неясно, сколько моделей они тестировали)

  2. nzeid

    Я вижу комментарии, что это пересечение между Qwen и GPT связано с rogue training или post hoc training. Никому не пришло в голову, что, может быть, оба набора моделей обучались напрямую на одних и тех же решениях бенчмарка исследователей?

  3. c7b

    Я не знал, что у нас есть доступ к сырым токенам рассуждений? Я думал, что получаем своего рода суммаризацию. У автора есть какой-то привилегированный доступ, или моё предположение было неверным?

    Но для вопроса, изучаемого здесь, это, вероятно, не имеет значения — пересечения в публично доступном выводе могут указывать на дистилляцию (или нет), независимо от того, что это такое. Я бы просто удивился, что китайские лаборатории использовали бы это так доверчиво. Публично выпущенная трасса рассуждений — первое место, где я бы заподозрил внедрение какого-то отравления дистилляцией.

  4. 7734128

    Проблема здесь, очевидно, в том, что единственные мысли GPT 5.5, к которым у нас есть доступ, — из stolen thought.

    Qwen 3.8 0902 была обучена после выхода статьи 10 августа, так что она должна была видеть эти конкретные мысли.

  5. hermitShell

    Как пользователь локальных моделей, означает ли это, что существуют «магические заклинания», которые могут повысить производительность некоторых локальных моделей?

    Я вижу некоторые детали о восстановлении информации с помощью той или иной техники. Это интересно, но, похоже, не обобщается.

    Так что для конкретного вопроса — да, но это не о техниках вроде добавления хорошего эмбеддинга, который просто в целом обычно улучшает производительность открытых моделей на определённых задачах.

Ещё за этот день

2026-09-10