Claude Opus 5.5 genera tokens un 30% más rápido y piensa más que su predecesor
Prompting Claude Opus 5.5
Guía de prompting para Claude Opus 5.5: el modelo genera tokens más de un 30% más rápido que Opus 5 y completa tareas con menos tokens. El esfuerzo medio iguala al alto de la versión anterior, pero al mantener el mismo nivel de esfuerzo los turnos se alargan. Ajusta max_tokens, revisa los prompts escritos para thinking desactivado y gestiona las paradas prematuras en agentes desatendidos.
En las pruebas de Anthropic, con su esfuerzo medio por defecto el modelo igualó o superó a Claude Opus 5 con esfuerzo alto en tareas de codificación y trabajo de conocimiento, en menos pasos y con menos tokens.
- skeledrew
Lo único que no deja de saltarme a la vista es cómo lo han configurado para negarse a dar a los usuarios tokens de pensamiento y prompts con el razonamiento completo en la salida. Eso no hace más que alejarme; puede que por ahora no deje de usar Claude del todo, pero voy a trasladar aún más de mi carga de trabajo principal a proveedores chinos. Ahí es donde está ahora la apertura y la libertad.
- bluegatty
Esto es un fracaso de las fundiciones de IA; si tenemos que usar técnicas de prompting totalmente distintas para cada modelo, esto no va a funcionar.
La IA está saturando rápidamente su capacidad de ser útil y estos productos necesitan empezar a madurar.
No es 'divertido' gestionar 50 MCPs distintos y rotos y su variedad de formas en que están rotos.
Al principio era 'divertido', ahora es simplemente 'tecnología rota'.
Astra y Opus 5.5 son el 'punto de partida' para la próxima era de la IA en la que esperamos herramientas robustas.
- prodigycorp
Opus 5.5 es un buen modelo, pero he intentado entender el hype extremo que hay en redes sociales sobre la capacidad de Opus para hacer trabajo en 2D, como pasó con Astra haciendo trabajo en 3D. En ambos lanzamientos, los modelos requerían un acceso extensivo a APIs de terceros para generar assets, y gran parte del trabajo del modelo era esencialmente coordinar todo.
Hay tantísimo rollo de "x generó esto de una sola vez, esto es AGI" que te da la impresión de que puedes operar los modelos modernos por vibra igual que operabas los modelos del año pasado. Hay mucho más que eso. Requiere que deposites una fe en el salto de capacidad de los modelos, una que sin duda habría sido una pérdida de tiempo en modelos anteriores.
No sé muy bien a dónde quiero llegar con esto, salvo que creo que la mayoría se puede identificar con que es agotador mantenerse al día. No me imagino lo que sería criar a un niño que pasó de bebé a la pubertad en el lapso de un año y planear que vaya a la universidad al año siguiente. Esta industria se mueve tan rápido que se está convirtiendo en un hecho que es el usuario el que "lo está sosteniendo mal" cada seis meses.
- jryan49
Lo probé el fin de semana y tuve una sesión de Claude de 33h completamente desatendida, con un prompting mínimo. Todo lo que generó también se ve bien. Es una locura.
- silversmith
"las salvaguardas de biología son las mismas que las de Claude Fable 5.1 ... Las preguntas cotidianas de salud y educativas no se ven afectadas"
Y sin embargo aquí estamos, "por qué me duelen más los gemelos que cualquier otro músculo después de entrenar" clasificándose como una pregunta picante.
- bob1029
> Cuarto, si los turnos largos de llamadas a herramientas siguen en silencio durante más tiempo del que quieres, haz que tu harness pida una actualización
No estoy seguro de entender esta complejidad. En todos los harnesses que he usado, las llamadas a herramientas se muestran al usuario como indicación de progreso. Cuando la UI/UX en torno a esto está bien diseñada, el usuario debería poder inferir más o menos lo que está pasando. Las distintas herramientas tienen distintas presentaciones ideales. No puedes reducirlo todo a blobs de texto plano.
Si necesitara absolutamente actualizaciones de progreso dentro del turno, acumularía una transcripción separada por turno y la alimentaría a un modelo más barato a intervalos deterministas.
- bronlund
Lo primero que hizo cuando lo probé fue recorrer archivos en directorios muy fuera del proyecto. Intenté que explicara por qué lo hizo varias veces, pero nunca obtuve nada que se pareciera a una explicación.
- _superposition_
Anthropic es el nuevo Microsoft.
Solo mi intuición. Me mantendré alejado de sus productos. Espero que beneficie a mi carrera de la misma manera, centrándome en estándares abiertos en lugar de alguna mierda propietaria que cambia cada 3 meses.