Claude Opus 5 está disponible desde hoy. Este modelo es considerado proactivo y reflexivo, alcanzando una inteligencia comparable a la de Claude Fable 5, pero a un costo significativamente menor.
En evaluaciones de trabajo de codificación y conocimiento, como Frontier-Bench y GDPval-AA, Opus 5 se posiciona como el nuevo estándar de referencia. Sin embargo, aún queda rezagado frente a Mythos 5 en tareas relacionadas con la ciberseguridad.
Este modelo ha sido diseñado para un uso diario eficiente. Se ha convertido en el modelo por defecto en Claude Max y el más potente en Claude Pro.
Rendimiento y coste-efectividad
Claude Opus 5 ofrece un rendimiento notablemente mejorado al mismo coste que su predecesor, Opus 4.8. Las gráficas en esta sección ilustran cómo el rendimiento varía según la configuración de esfuerzo del modelo, permitiendo a los clientes optimizar la inteligencia o conservar tokens para resultados más rápidos y económicos.
Opus 5 destaca en tareas de ingeniería de software. Por ejemplo, en Frontier-Bench v0.1, supera a todos los demás modelos y duplica el rendimiento de Opus 4.8 a un coste menor por tarea. En CursorBench 3.2, al máximo esfuerzo, su rendimiento se acerca al puntaje máximo de Fable 5, pero a la mitad del coste por tarea.

Los resultados son similares en tareas de trabajo de conocimiento y resolución de problemas. Por ejemplo:
- En ARC-AGI 3, donde el modelo debe resolver problemas novedosos, Opus 5 obtiene una puntuación tres veces superior al siguiente mejor modelo.
- En Zapier AutomationBench, que evalúa la capacidad de los modelos para completar tareas empresariales, Opus 5 tiene una tasa de éxito 1.5 veces mayor que el siguiente mejor modelo por el mismo coste.
- En OSWorld 2.0, un referente de uso de computadoras, Opus 5 supera a todos los modelos en cualquier coste dado, superando incluso el mejor resultado de Fable 5 a un costo de poco más de un tercio.

