Claude Opus 5: un salto grande al mismo precio de siempre
Anthropic ha lanzado Opus 5 y el titular no es un benchmark: es que cuesta lo mismo que Opus 4.8 ($5/$25) y da un salto enorme. Más que dobla su predecesor en FrontierBench, multiplica por veinte su puntuación en ARC-AGI-3 y clava un 96% en SWE-bench Verified. Te cuento qué cambia de verdad, dónde sigue por detrás de Fable 5 y para quién merece la pena.
Anthropic publicó Claude Opus 5 el 24 de julio, y lo hizo con su estilo de siempre: sin contador en cuenta atrás, sin fuegos artificiales, apareció el modelo y punto. Pero por debajo de esa calma hay un lanzamiento de los importantes, y lo mejor no es ninguna cifra concreta. Es una ausencia de cifra: el precio no ha subido. Cuesta exactamente lo mismo que Opus 4.8 —cinco dólares el millón de tokens de entrada, veinticinco el de salida— y a cambio da un salto que, en algunos frentes, es de los grandes del año.
Llevo unos días usándolo como modelo por defecto en programación y montando un par de agentes con él. Te cuento lo que dicen los benchmarks (verificados), lo que noto en el día a día, y sobre todo dónde sigue por detrás de la competencia, porque eso es lo que casi nadie te cuenta cuando sale un modelo nuevo.
El salto respecto a Opus 4.8#
Las mejoras generación a generación suelen ser de unos pocos puntos. Aquí no. En FrontierBench, el nuevo benchmark difícil de Anthropic, Opus 5 pasa del 18,7% de Opus 4.8 a un 44,4% con esfuerzo máximo: más que dobla. En OSWorld 2.0, que mide manejar un ordenador de verdad (mover el ratón, rellenar formularios, usar aplicaciones), sube del 55,7% al 70,6%. Y en ARC-AGI-3, una prueba de razonar sobre problemas nuevos que no ha visto, pasa de un ridículo 1,5% a un 30,2%: se multiplica por veinte.
Ese número de ARC-AGI es el que más me ha hecho levantar la ceja, porque ARC-AGI está diseñado precisamente para castigar a los modelos que solo memorizan patrones. Triplica la puntuación del siguiente mejor modelo. No es «un poco mejor razonando»; es un cambio de categoría en ese tipo concreto de problema. Habrá que ver cuánto se traduce en tareas reales, pero el dato es llamativo.
En lo demás, más de lo mismo pero mejor: un 96% en SWE-bench Verified (programación), 59,4% en SWE-bench Multimodal (frente al 38,4% de 4.8), y en matemáticas resolvió las seis de la Olimpiada Internacional de Matemáticas de 2026, un 42 sobre 42 de nivel medalla de oro. Y un detalle que me importa a mí y debería importarte si montas agentes: es notablemente más resistente a los ataques de inyección de prompts (un 2% de éxito de los ataques frente al 5,5% de Opus 4.8, y un 0% con el modo automático de protección). En un agente que ejecuta acciones, eso no es un adorno, es seguridad.
Frente a la frontera: gana en casi todo, salvo un frente#
Aquí es donde hay que ser honesto, porque un análisis que solo cuenta lo que gana no vale nada. Opus 5 lidera FrontierBench por encima de Fable 5 (33,7%) y de GPT-5.6 Sol (37,5%). Aplasta en ARC-AGI-3. Manda en manejo de ordenador con OSWorld. En casi todo lo que mires, va delante.
Pero hay un frente donde no: SWE-bench Pro, el benchmark que mide resolver pull requests reales y complejos, el más parecido al trabajo de verdad de un programador. Ahí Opus 5 marca 79,2% y Claude Fable 5 marca 80,0%. Pierde por ocho décimas. Es prácticamente un empate, pero pierde, y conviene decirlo con todas las letras: en el terreno del código complejo de producción, Fable 5 sigue siendo, por los pelos, la referencia. Que dos modelos de la misma casa estén separados por 0,8 puntos ahí arriba dice mucho de lo apretada que está la frontera.
“Lo interesante de Opus 5 no es que sea el mejor en algo. Es que es de los mejores en casi todo, y cuesta lo mismo que costaba el anterior. La mejora te la regalan.”
La novedad práctica: el mando de esfuerzo#
La novedad más útil para el día a día no es un benchmark, es un mando. Opus 5 trae un parámetro de «esfuerzo» (effort) que decides petición a petición: cuánto quieres que piense antes de responder. En una tarea tonta le bajas el esfuerzo y responde rápido gastando pocos tokens; en un problema difícil se lo subes y piensa a fondo. La diferencia se ve en los propios números: FrontierBench sube del 43,3% con esfuerzo alto al 44,4% con esfuerzo máximo. Tú eliges dónde poner el dial según lo que te juegues.
Hay un cambio importante que si programas contra la API debes saber: el pensamiento ahora va activado por defecto. Eso significa que algunas configuraciones antiguas que lo desactivaban dan error, así que si migras, revisa tus llamadas. Y para cuando la velocidad importe más que la profundidad, hay un modo rápido que corre unas 2,5 veces más veloz por el doble de precio base. Como todo en Opus 5, es dar más control sin cambiar la tarifa de partida.
¿Merece la pena cambiarse?#
Mi respuesta corta es sí, y con pocas dudas, precisamente por lo del precio. Cuando un modelo mejora manteniendo la tarifa, la pregunta deja de ser «¿compensa pagar más por esto?» y pasa a ser «¿por qué seguiría usando el viejo?». Si ya estabas en Opus 4.8, cambiar a Opus 5 es mejora gratis en casi todo. En Claude Max y Claude Pro ya es el modelo por defecto, así que muchos ni tendréis que hacer nada.
- Si usas Claude para programar, cámbiate: el 96% en SWE-bench Verified y el salto en multimodal se notan, y no pagas más.
- Si montas agentes que manejan un ordenador o ejecutan acciones, el salto en OSWorld y la mayor resistencia a inyección de prompts son razones de peso.
- Si tu trabajo es código complejo de producción al límite, mira también Fable 5: en SWE-bench Pro sigue una pizca por delante. La diferencia es mínima, pero existe.
- Si vas justo de presupuesto y tus tareas son mecánicas, Opus sigue siendo caro para eso; ahí un modelo pequeño te saldrá mucho mejor. Opus 5 brilla en lo difícil, no en el volumen.
Mi veredicto#
Opus 5 es el tipo de lanzamiento que me gusta analizar porque no hay trampa en el titular: mejora de verdad y no te cobra la mejora. En un año en el que cada semana sale un modelo prometiendo ser el mejor, que Anthropic entregue un salto real al mismo precio, con números verificables y admitiendo que en un frente concreto todavía no es el número uno, es refrescante. La frontera está tan apretada que las diferencias se miden en décimas, y eso, para quien elige herramienta con criterio, es la mejor noticia posible.
Si tuviera que quedarme con una imagen: Opus 5 no ha llegado a reventar ningún techo, ha llegado a subir el suelo. Lo que antes era el modelo premium ahora rinde bastante más por el mismo dinero, y eso empuja a todos hacia arriba. Con GPT-5.6 recién salido y Fable 5 defendiendo su corona en código, el que gana de todo esto, como casi siempre, es el que usa las herramientas.
Opus 5 da un salto grande —dobla FrontierBench, ×20 en ARC-AGI-3, 96% en SWE-bench Verified— al mismo precio de Opus 4.8. Solo cede, por 0,8 puntos, ante Fable 5 en código complejo. Si ya usabas Opus, es mejora gratis.
Continúa leyendo
Selección basada en #Claude Opus 5 · #Anthropic · #Modelos de lenguaje
GPT-5.6 es tres modelos: Sol, Terra y Luna
OpenAI ha partido su modelo en tres tamaños con nombres de astros —Sol, Terra y Luna, de mayor a menor— destilados del mismo entrenamiento. Te cuento qué cambia de verdad: los precios, para qué sirve cada uno, y por qué la función que menos titulares se llevó (Programmatic Tool Calling) es la más interesante. Con benchmarks reales.
MCP en 2026: el protocolo que se ha vuelto el USB-C de la IA
En 18 meses, el Model Context Protocol pasó de experimento interno de Anthropic a estándar de toda la industria: +19.000 servidores, 97 millones de descargas al mes y respaldo de OpenAI, Google y Microsoft. Te cuento qué es, por qué ha ganado y qué significa para quien construye con IA.
¿Sustituye la IA a un junior? Lo que veo trabajando
La IA hace hoy, en segundos, casi todas las tareas que antes le dábamos a alguien que empezaba. Eso es cierto y es lo que asusta. Lo que casi nadie dice es la otra mitad: que esas tareas eran el mecanismo por el que alguien se convertía en senior, y que hemos empezado a quitarlo sin poner nada en su lugar.
Le tengo manía a la palabra «agente»
En un año he visto llamar «agente autónomo» a un formulario con un prompt detrás, a un cron de las tres de la mañana y a un chatbot con un PDF subido. La palabra ya no significa nada, y eso no es un problema de vocabulario: es un problema de presupuesto. Te doy la escalera de autonomía y las cinco preguntas que acaban con la magia.
