Cómo controlar el esfuerzo de razonamiento en los LLM

Controlling Reasoning Effort in LLMs

Cómo controlar el esfuerzo de razonamiento en los LLM

Dos años después de que OpenAI lanzara o1, los modelos de razonamiento se han convertido en el estándar. Este artículo explica cómo se entrena un modelo de razonamiento con múltiples niveles de esfuerzo, como los que ofrece GPT-5.6. Repasa los fundamentos: el entrenamiento con RLVR, que usa solo recompensas de precisión y formato, y el escalado de inferencia. También aclara que las etiquetas <think> son cosméticas y no otorgan capacidad de razonamiento, y detalla cómo modelos como Qwen3 implementan un interruptor de razonamiento mediante SFT y RL, un paso previo a los niveles de esfuerzo de GPT-5.6.

Estos tokens <think> son cosméticos con respecto a la capacidad de razonamiento: no hacen que el modelo razone, y no son necesarios para lograr un buen rendimiento de razonamiento.

Más de este día

2026-07-20