Qwen 3.8 подражает рассуждениям GPT-5.5 Pro: префилл даёт +20,58 п.п.
Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
Автор повторил эксперимент с reasoning-префиллами, используя GPT-5.5 Pro в качестве учителя. Для 45 задач (STEM, не-STEM и синтетические головоломки) он сравнил обычные ответы четырёх открытых моделей с ответами, в начало канала рассуждений которых вставлен первый 1% рассуждений GPT-5.5 Pro. Qwen3.8 A95B показала самый резкий скачок: доля заимствованных униграмм выросла с 33,92% до 54,50% (+20,58 п.п.), особенно на STEM (+27,55 п.п.). Kimi K3 прибавила лишь +4,31 п.п., а DeepSeek V4 Flash и Inkling почти не изменились. Автор делает вывод, что Qwen могла учиться именно на GPT-5.5 Pro или близкой модели, а не на Opus.
Данные позволяют предположить, что Qwen могла учиться на GPT-5.5 Pro или на близкой модели GPT, а не на Opus.
- wongarsu
Этот стиль письма, возможно, немного слишком напряжённый
Если я правильно понял (добавление B из https://stolen-thoughts.com/paper.pdf существенно), они — авторы известного эксплойта для восстановления читаемого CoT из моделей OpenAI и Anthropic. Они используют это, чтобы найти признаки дистилляции, запуская бенчмарк с SotA-моделью, восстанавливая CoT, затем беря первые 1% CoT и запуская open-source модель так, как будто это начало её собственного CoT. В статье они обнаружили, что Kimi-K3 становится гораздо ближе к ответам Claude 4.8, когда ей предзаполняют начало рассуждений Claude 4.8, что говорит о том, что Claude 4.8 использовался в её пост-тренировке. Этот пост в блоге — продолжение с результатами, которые намекают, что Qwen3.8 была пост-тренирована с помощью GPT-5.5 Pro (или какой-то похожей по ответам GPT-модели, неясно, сколько моделей они тестировали)
- nzeid
Я вижу комментарии, что это пересечение между Qwen и GPT связано с rogue training или post hoc training. Никому не пришло в голову, что, может быть, оба набора моделей обучались напрямую на одних и тех же решениях бенчмарка исследователей?
- c7b
Я не знал, что у нас есть доступ к сырым токенам рассуждений? Я думал, что получаем своего рода суммаризацию. У автора есть какой-то привилегированный доступ, или моё предположение было неверным?
Но для вопроса, изучаемого здесь, это, вероятно, не имеет значения — пересечения в публично доступном выводе могут указывать на дистилляцию (или нет), независимо от того, что это такое. Я бы просто удивился, что китайские лаборатории использовали бы это так доверчиво. Публично выпущенная трасса рассуждений — первое место, где я бы заподозрил внедрение какого-то отравления дистилляцией.
- 7734128
Проблема здесь, очевидно, в том, что единственные мысли GPT 5.5, к которым у нас есть доступ, — из stolen thought.
Qwen 3.8 0902 была обучена после выхода статьи 10 августа, так что она должна была видеть эти конкретные мысли.
- hermitShell
Как пользователь локальных моделей, означает ли это, что существуют «магические заклинания», которые могут повысить производительность некоторых локальных моделей?
Я вижу некоторые детали о восстановлении информации с помощью той или иной техники. Это интересно, но, похоже, не обобщается.
Так что для конкретного вопроса — да, но это не о техниках вроде добавления хорошего эмбеддинга, который просто в целом обычно улучшает производительность открытых моделей на определённых задачах.