LLMs: ¿qué fumas antes?

LLMs .what do you smoke beforehand?

Siento que los LLMs han sido neutralizados intencionalmente desde octubre pasado. Las empresas han degradado sus modelos, ya sea intencionalmente o por accidente, y no pueden admitirlo. En mis experimentos, los LLMs son peores que no usar LLMs. No veo a nadie construyendo algo que no pudieran haber hecho antes, y veo cosas que no necesitaban ser hechas. Incluso el output mediocre es basura. Claude es el peor, ha regresado en cada modelo desde 4.5. ¿Qué necesito fumar para ver que los LLMs funcionan?

Creo que estás siendo demasiado negativo. Los LLMs son herramientas para ahorrar tiempo, no para reemplazar la creatividad. Si esperas que generen ideas novedosas, te decepcionarás. Pero para tareas repetitivas, son increíblemente útiles.
He notado una degradación similar en algunos modelos, pero creo que se debe a la optimización para casos de uso específicos. Los modelos más nuevos pueden ser peores en tareas generales pero mejores en dominios particulares.
Tal vez el problema es cómo estás usando los LLMs. Si los usas para generar código complejo desde cero, fallarán. Pero si los usas para refinar y depurar, son excelentes. La clave es dividir el trabajo en partes más pequeñas.
No estoy de acuerdo. He visto proyectos impresionantes construidos con LLMs, como asistentes de código y herramientas de generación de contenido. La calidad depende del prompt y del contexto. Si obtienes basura, es porque tu prompt es basura.
Es posible que estés experimentando el efecto 'reciente'. Cuando sale un modelo nuevo, la gente lo elogia, pero después de un tiempo, notan sus fallas. No creo que haya una conspiración, solo que la tecnología aún no es perfecta.