Qwen 3.8 imita el razonamiento de GPT-5.5 Pro: +20,58 puntos con solo un 1% de prefill
Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
Un experimento compara respuestas normales de varios modelos abiertos con respuestas iniciadas con el primer 1% del razonamiento de GPT-5.5 Pro. Qwen 3.8 A95B apenas mejoraba con Opus 4.8, pero aquí su recall de unigramas salta del 33,92% al 54,50%, con +27,55 puntos en STEM y +19,72 en puzzles sintéticos. Los datos sugieren que Qwen pudo entrenarse con GPT-5.5 Pro o un modelo GPT cercano, no con Opus.
Los datos sugieren que Qwen puede haber aprendido de GPT-5.5 Pro, o de un modelo GPT estrechamente relacionado, en lugar de Opus.
- wongarsu
Ese estilo de escritura podría ser un poco demasiado tenso
Si lo entendí bien (añadir B de https://stolen-thoughts.com/paper.pdf es esencial) ellos son los autores del conocido exploit para recuperar CoT legible de los modelos de OpenAI y Anthropic. Usan eso para encontrar indicios de destilación, ejecutando un benchmark con un modelo SotA, recuperando el CoT, luego tomando el primer 1% del CoT y ejecutando el modelo de código abierto como si ese fuera el inicio de su propio CoT. En el paper encontraron que Kimi-K3 se acerca mucho más a las respuestas de Claude 4.8 cuando se le hace prefill con el inicio del razonamiento de Claude 4.8, lo que sugiere que Claude 4.8 se usó en su post-entrenamiento. Esta entrada del blog es el seguimiento con resultados que sugieren que Qwen3.8 fue post-entrenado con la ayuda de GPT-5.5 Pro (o algún modelo GPT de respuesta similar, no está claro cuántos modelos probaron)
- nzeid
Veo comentarios de que este solapamiento entre Qwen y GPT se debe a un entrenamiento rebelde o a un entrenamiento post hoc. ¿Se le ocurrió a alguien que quizás los dos conjuntos de modelos fueron entrenados directamente con las mismas soluciones al benchmark de los investigadores?
- c7b
No sabía que tuviéramos acceso a los tokens de razonamiento en bruto. Pensaba que lo que se obtiene es una especie de resumen. ¿El autor tiene algún tipo de acceso privilegiado o mi suposición era errónea?
Pero para la cuestión que se estudia aquí probablemente no importa: los solapamientos en la salida disponible públicamente pueden ser indicativos de destilación (o no), independientemente de lo que sea. Simplemente me sorprendería que los laboratorios chinos lo usaran con tanta confianza. El rastro de razonamiento publicado públicamente es el primer lugar donde sospecharía que se inyectara algún tipo de envenenamiento por destilación.
- 7734128
El problema con esto es obviamente que los únicos pensamientos de GPT 5.5 a los que tenemos acceso son de stolen thought.
Qwen 3.8 0902 fue entrenado después de la publicación del paper el 10 de agosto, así que debería haber visto esos pensamientos específicos.
- hermitShell
Como usuario de modelos locales, ¿esto significa que hay 'conjuros mágicos' que pueden aumentar el rendimiento de algunos modelos locales?
Veo algunos detalles sobre recuperar información mediante alguna técnica. Es interesante, pero parece no ser generalizable.
Así que para una pregunta específica, sí, pero esto no se trata de técnicas como añadir un buen embedding que simplemente tiende a mejorar el rendimiento de modelos abiertos en ciertas tareas.