Anthropic acaba de sumar una pieza clave a su familia de modelos: Claude Opus 5 ya está disponible para todos los usuarios, desde quienes usan Claude en el navegador hasta los equipos que integran la API en sus productos. La promesa central es simple de enunciar aunque compleja de lograr: rendimiento cercano al de su modelo más potente, Claude Fable 5, pero a mitad de precio. Si esto se sostiene en el uso cotidiano, cambia bastante el cálculo de costo-beneficio para empresas y desarrolladores que hoy tienen que elegir entre inteligencia y presupuesto.
Un modelo pensado para el día a día
Lo interesante de Opus 5 no es solo que sea potente, sino que Anthropic lo presenta explícitamente como un modelo para uso diario, no como una demostración de fuerza bruta reservada a tareas excepcionales. Pasa a ser el modelo predeterminado en Claude Max y el más avanzado disponible en Claude Pro, lo que sugiere que la compañía confía en su eficiencia tanto como en su capacidad. En la práctica, esto significa que un usuario de Pro que antes tenía que conformarse con modelos intermedios ahora accede a algo mucho más cercano al tope de gama.
Según los datos compartidos por Anthropic, Opus 5 se convierte en el nuevo estado del arte en evaluaciones de codificación y trabajo de conocimiento, como Frontier-Bench y GDPval-AA. La excepción es el terreno de la ciberseguridad ofensiva, donde el modelo Mythos 5 sigue liderando, algo que la propia empresa atribuye a una decisión deliberada de no entrenar a Opus 5 específicamente para tareas cibernéticas.
Más rendimiento por el mismo costo
Uno de los puntos que Anthropic destaca con más énfasis es la relación entre rendimiento y costo frente a su predecesor, Opus 4.8. En Frontier-Bench v0.1, por ejemplo, Opus 5 no solo supera a los demás modelos sino que más que duplica el desempeño de Opus 4.8, y encima lo hace a un costo por tarea menor. En CursorBench 3.2, con el nivel de esfuerzo máximo, se ubica a apenas 0.5% del puntaje de Fable 5 pero pagando la mitad por cada tarea resuelta.
Este patrón se repite en otras pruebas relevantes para el uso real del modelo:
- En ARC-AGI 3, que mide la capacidad de resolver problemas novedosos (no vistos durante el entrenamiento), Opus 5 triplica el puntaje del siguiente mejor modelo.
- En Zapier AutomationBench, que evalúa si un modelo puede completar tareas empresariales de punta a punta, la tasa de aprobación de Opus 5 es alrededor de 1.5 veces superior a la del competidor más cercano, al mismo costo por tarea.
- En OSWorld 2.0, un benchmark de uso de computadora, Opus 5 supera a todos los demás modelos sin importar el presupuesto, e incluso mejora el mejor resultado de Fable 5 gastando poco más de un tercio de su costo.
Anthropic también reporta avances concretos en investigación científica. En tareas de química orgánica, como inferir estructuras moleculares a partir de datos de espectroscopía, Opus 5 mejora en 10.2 puntos porcentuales respecto a Opus 4.8 en el benchmark interno de la compañía. En tareas relacionadas con proteínas, como predecir el efecto de variaciones en una secuencia sobre su función, la mejora es de 7.7 puntos porcentuales. Son señales de que el modelo no solo escribe mejor código, sino que también puede ser una herramienta de apoyo más confiable en disciplinas científicas donde el margen de error importa mucho.
Agencia y meticulosidad: menos atajos, más verificación
Más allá de los números de los benchmarks, lo que Anthropic subraya como diferencial de Opus 5 es su capacidad para verificar su propio trabajo e iterar hasta resolver un problema, en lugar de entregar una respuesta parcial y darla por buena. La compañía comparte algunos ejemplos concretos de sus pruebas de acceso anticipado que ilustran bien esta idea.
En una tarea de Frontier-Bench, al modelo se le entregó el dibujo de una pieza mecánica y se le pidió reconstruirla como modelo 3D en FreeCAD, pero sin darle ninguna forma directa de "ver" el dibujo. Opus 5 resolvió el problema escribiendo su propio pipeline de visión por computadora para extraer la geometría a partir de los píxeles en bruto, algo que ningún modelo competidor logró en la misma configuración tras cinco intentos. En otro caso, frente a un error real en un gestor de paquetes de código abierto muy popular, Opus 5 identificó la causa raíz de un caso límite que el parche de la comunidad había pasado por alto, mientras que un modelo rival se limitó a corregir el síntoma superficial y reportó el problema como resuelto sin que realmente lo estuviera.
También se menciona el caso de un ingeniero de una firma de trading que usó Opus 5 para construir, en una sola sesión, un feed de datos de mercado para una nueva bolsa: una tarea que modelos anteriores no lograban completar ni con planes detallados provistos por el propio ingeniero. Ante la ausencia de un feed en vivo contra el cual validar su trabajo, el modelo construyó su propio arnés de pruebas para asegurarse de que el código interpretara correctamente los datos. Son ejemplos puntuales compartidos por Anthropic, no una garantía de que el modelo se comporte así en cualquier escenario, pero dan una idea del tipo de autonomía que la compañía busca destacar.
Seguridad: el equilibrio entre capacidad y riesgo
Cada lanzamiento de un modelo de frontera trae consigo la pregunta inevitable: ¿qué tan seguro es? Anthropic afirma que, según su auditoría automatizada de comportamiento, Opus 5 es su modelo más alineado hasta la fecha, con las tasas más bajas de comportamiento engañoso y la menor susceptibilidad a ser manipulado para usos indebidos, superando en estos aspectos a Opus 4.8, Sonnet 5 y Fable 5.
En materia de capacidades de doble uso —es decir, aquellas que podrían usarse tanto para fines legítimos como maliciosos—, la compañía sostiene que Opus 5 no corre la frontera de riesgo hacia adelante. En evaluaciones realizadas junto a socios del sector privado y gubernamental, el modelo queda por detrás de Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva. Un dato interesante es la distinción que hace Anthropic dentro del propio terreno cibernético: Opus 5 se acerca bastante a Mythos 5 a la hora de detectar vulnerabilidades de software, pero queda mucho más rezagado cuando se trata de explotarlas, es decir, de convertir una falla detectada en una amenaza real. Esa brecha entre "encontrar el problema" y "aprovecharlo" es, en cierto modo, una buena noticia desde la perspectiva de seguridad.
Salvaguardas más flexibles, pero no menos cuidadosas
Anthropic ajustó las barreras de protección de Opus 5 respecto a las de Opus 4.8, aunque mantiene restricciones más estrictas en un rango acotado de tareas cibernéticas. En términos prácticos, el modelo puede ayudar a encontrar vulnerabilidades en código fuente, pero sus clasificadores bloquean el escaneo de vulnerabilidades basado en binarios, las pruebas de penetración y la generación de exploits, actividades que la compañía asocia con un mayor riesgo de uso malicioso. Según sus propias pruebas, esperan que estos clasificadores intervengan alrededor de un 85% menos que con Fable 5, lo que en la práctica debería traducirse en menos solicitudes legítimas bloqueadas por error.
Para quienes necesitan trabajar sin esas restricciones por motivos profesionales —investigadores de seguridad, por ejemplo— Anthropic ofrece su Programa de Verificación Cibernética (CVP), que da acceso a una versión de Opus 5 con menos limitaciones. En el plano de la biología, al compartir el mismo esquema de salvaguardas que Opus 4.8, se convierte en el modelo de disponibilidad general más capaz para investigación científica, aunque la compañía es clara en señalar que todavía muestra limitaciones importantes en tareas de investigación autónomas y de larga duración, justamente donde ubican el mayor riesgo potencial. Mythos 5 sigue siendo, según Anthropic, el modelo más fuerte para ese tipo de trabajo biológico.
Precio, velocidad y novedades para desarrolladores
Claude Opus 5 mantiene el mismo esquema de precios que su antecesor: 5 dólares por millón de tokens de entrada y 25 dólares por millón de tokens de salida. Los desarrolladores ya pueden empezar a usarlo a través de la API bajo el identificador claude-opus-5. También existe un modo Fast, que funciona alrededor de 2.5 veces más rápido que la velocidad estándar, disponible al doble del precio base en la Plataforma de Claude o mediante créditos de uso en Claude Code.
Junto con el modelo, Anthropic lanza dos funciones en beta que apuntan directamente a la experiencia de quienes construyen productos sobre su API:
- Cambios de herramientas a mitad de conversación: los desarrolladores pueden modificar qué herramientas tiene disponibles Claude durante una conversación sin perder la caché del prompt, algo que hasta ahora obligaba a reiniciar el contexto.
- Reservas automáticas en la API: cuando una solicitud es marcada por los clasificadores de seguridad de Opus 5 o Fable 5, el sistema puede redirigirla automáticamente a otro modelo disponible en lugar de bloquearla directamente, evitando así interrupciones innecesarias en flujos de trabajo legítimos.
Como con los Opus anteriores, el modelo no impone requisitos de retención de datos para el acceso general, un detalle que suele pesar en las decisiones de empresas con políticas estrictas de privacidad.
Qué significa este lanzamiento en el panorama actual
Más allá de los benchmarks, lo que este lanzamiento refleja es una tendencia que se viene consolidando en la industria de la IA: la carrera ya no es solo por el modelo más inteligente en abstracto, sino por el que ofrece la mejor inteligencia por dólar gastado. Que Anthropic posicione a Opus 5 como el modelo por defecto para sus planes pagos, en lugar de reservarlo como una opción premium aparte, es una señal de hacia dónde apunta la estrategia: hacer que la capacidad de frontera sea parte de la experiencia estándar, no un lujo adicional. A modo de ejemplo, esto podría traducirse en que tareas que hoy requieren varias idas y vueltas con un asistente de IA —depurar un error persistente, automatizar un proceso administrativo, armar un prototipo funcional— se resuelvan en menos intentos y con menor supervisión humana, aunque como con cualquier herramienta de este tipo, la verificación final del resultado sigue siendo responsabilidad de quien la usa.