Pregunta a HN: ¿Cuál fue la última tarea donde solo un modelo de frontera pudo hacerla?
Ask HN: What was the last task where only a frontier model could do it?
He visto la afirmación recurrente de que los modelos abiertos (de pesos) con 6 meses de retraso respecto a la frontera son suficientemente buenos para la mayoría del 'trabajo'. Si has tenido una tarea concreta en el último mes donde GLM/DeepSeek/Kimi/Qwen fallaron y Opus/Fable/GPT tuvo éxito (¡o viceversa!), por favor compártela. Proporcionaré una plantilla, ya que también he visto con frecuencia quejas de los usuarios sobre la falta de contexto: - tarea (corta y específica) - modelo barato probado y cómo falló - modelo de frontera y si realmente tuvo éxito - ¿habría sido suficiente el modelo de frontera de hace un año en retrospectiva?
Tarea: Escribir una prueba unitaria para una función compleja de análisis de datos en Python. Modelo barato: Qwen-2.5-72B falló al generar casos límite y afirmaciones correctas. Modelo de frontera: GPT-4o tuvo éxito, generando una prueba integral que detectó un error sutil. ¿Habría sido suficiente el modelo de frontera de hace un año? Probablemente no, porque el error era específico de la nueva versión de la biblioteca.
Tarea: Explicar un concepto matemático abstracto (topología algebraica) a un estudiante de posgrado. Modelo barato: DeepSeek-V3 dio una explicación genérica y confusa. Modelo de frontera: Claude 3.5 Sonnet proporcionó una intuición clara con ejemplos concretos. ¿Habría sido suficiente el modelo de frontera de hace un año? Sí, pero la calidad de la explicación era notablemente mejor.
Tarea: Depurar un error de concurrencia en un sistema distribuido. Modelo barato: Kimi falló al identificar la causa raíz y sugirió soluciones incorrectas. Modelo de frontera: GPT-4o identificó el problema de condición de carrera y propuso una solución correcta. ¿Habría sido suficiente el modelo de frontera de hace un año? Probablemente sí, pero el modelo actual fue más rápido.
Tarea: Generar una política de privacidad personalizada para una startup de tecnología de salud. Modelo barato: GLM falló al no considerar regulaciones específicas como HIPAA. Modelo de frontera: Opus tuvo éxito al incluir cláusulas relevantes y advertencias. ¿Habría sido suficiente el modelo de frontera de hace un año? Sí, pero el modelo actual fue más preciso.