GPT-5.6 es tres modelos: Sol, Terra y Luna
OpenAI ha partido su modelo en tres tamaños con nombres de astros —Sol, Terra y Luna, de mayor a menor— destilados del mismo entrenamiento. Te cuento qué cambia de verdad: los precios, para qué sirve cada uno, y por qué la función que menos titulares se llevó (Programmatic Tool Calling) es la más interesante. Con benchmarks reales.
OpenAI lanzó GPT-5.6 el 9 de julio, y lo primero que llama la atención no es una cifra de benchmark, es el nombre. No hay un GPT-5.6 a secas: hay tres, y se llaman Sol, Terra y Luna. La lógica es tan bonita que casi da rabia que no se les hubiera ocurrido antes: sol, tierra, luna, de mayor a menor tamaño. Los tres salen del mismo entrenamiento base, destilados a distintos tamaños. Elegir modelo pasa a ser, literalmente, elegir cuánto astro necesitas.
He estado leyendo los informes, los benchmarks oficiales y los independientes, y probando los tres. Te cuento qué cambia de verdad, para qué sirve cada uno, y cuál es la función que a mí me parece la noticia real aunque se haya llevado menos titulares. Con datos verificados, no con el folleto.
Tres tamaños del mismo cerebro#
La idea de fondo es un reconocimiento de algo que ya hacíamos a mano: no todas las tareas necesitan el modelo grande. Antes tenías que ir saltando entre familias distintas; ahora OpenAI te da la misma «mente» en tres tallas, y como salen del mismo entrenamiento, se comportan parecido, solo que unas piensan más que otras. Los tres comparten lo importante: ventana de contexto de un millón de tokens, hasta 128.000 tokens de salida y corte de conocimiento en febrero de 2026.
- Luna — el barato. $1 por millón de tokens de entrada y $6 de salida. Es para lo mecánico y de volumen: clasificar, extraer datos, resumir cosas cortas. Cuando el céntimo por llamada importa porque la corres miles de veces.
- Terra — el de todos los días. $2,50 / $15. El equilibrio por defecto: casi la calidad de Sol a la mitad de coste. Para el 80% del trabajo normal, es el que yo dejaría puesto.
- Sol — el flagship. $5 / $30. Para lo difícil: agentes largos, razonamiento profundo, lo que tiene consecuencias. Es el que lidera los rankings, pero también el que cuesta seis veces más que Luna.
Sol cuesta lo mismo de entrada que Claude Opus ($5), pero su salida ($30) es más cara. Luna, a $1/$6, entra en el territorio de los modelos pequeños y compite de tú a tú con las opciones baratas. La gracia del sistema es poder mezclar: Luna para el grueso, Sol solo para lo crítico.
Los benchmarks: manda en agentes, no en todo#
Aquí es donde hay que leer con cuidado, porque «es el mejor» depende mucho de en qué. Sol, en su modo de máximo razonamiento, lidera el Artificial Analysis Coding Agent Index con un 80 (por encima de GPT-5.5 con 76,4 y de Claude Fable 5 con 77,2). En Terminal-Bench 2.1 marca un 88,8%, el mejor de su categoría, y en tareas agénticas puras como Agents' Last Exam (52,7%) saca ventaja clara a todos. Si tu problema es un agente que trabaja solo en una terminal, Sol es hoy la punta de lanza.
Pero hay un pero grande y conviene decirlo: en SWE-Bench Pro, que mide resolver pull requests reales y complejos, Sol se queda en 64,6% mientras Claude Fable 5 marca un 80. Son unos quince puntos, y en programación de verdad esa distancia se nota. Así que el titular honesto no es «GPT-5.6 es el mejor», es «GPT-5.6 Sol es el mejor en tareas agénticas y de terminal, y Claude sigue mandando en código complejo». Cada uno defiende su colina.
Un detalle que me gusta: Sol tiene un modo «Ultra» que lanza cuatro agentes en paralelo y sube el Terminal-Bench del 88,8% al 91,9%. Es la misma idea del enjambre que vimos en otros modelos: cuando el cuello de botella deja de ser la inteligencia y pasa a ser la coordinación, repartir el trabajo entre varias copias que se coordinan exprime unos puntos extra.
La función que de verdad importa#
Si me preguntas qué es lo más importante de este lanzamiento, no es ninguno de los benchmarks: es una función con nombre aburrido, Programmatic Tool Calling, que se llevó pocos titulares y a mí me parece la mejor idea del año en este terreno. Te la explico sin tecnicismos.
Hasta ahora, cuando un modelo usa muchas herramientas (buscar, consultar una API, leer un archivo, otra API…), cada llamada funcionaba así: el modelo pide la herramienta, el resultado vuelve a su contexto, el modelo lee, pide la siguiente, y vuelta a empezar. Cada ida y vuelta engorda el contexto, y como se paga por tokens, un flujo con muchas herramientas se vuelve caro y lento solo por el trasiego.
Lo que hace GPT-5.6 es distinto: en vez de ir paso a paso, el modelo escribe un pequeño script en JavaScript que orquesta todas esas llamadas, y ese script se ejecuta en un entorno aislado (un runtime V8 sin acceso a la red). Los pasos intermedios ocurren dentro del script, no en el contexto del modelo, y al final solo vuelve el resultado. Los clientes que ya lo usan reportan reducciones de tokens de entre el 38% y el 63,5%. En flujos agénticos serios, eso es dividir la factura casi por la mitad sin perder nada.
“Los benchmarks se llevan los titulares, pero quien monte agentes en producción va a notar mucho más el ahorro de tokens del Programmatic Tool Calling que dos puntos arriba o abajo en un ranking.”
¿A quién le interesa cada uno?#
Después de trastear con los tres, así es como lo tengo ordenado en la cabeza:
- Si montas procesos de volumen (clasificar, extraer, moderar), empieza por Luna y sube solo si la calidad no llega. A $1/$6 hace mucho trabajo por muy poco.
- Para uso general y asistentes de trabajo, Terra es el punto dulce: casi la calidad del grande a mitad de precio.
- Para agentes autónomos largos y tareas de terminal, Sol, y si el problema es gordo, Sol Ultra con sus cuatro agentes en paralelo.
- Para programación compleja de verdad (muchos archivos, cambios delicados), sigo mirando a Claude: su ventaja en SWE-Bench Pro no es marketing, se nota.
Mi veredicto#
GPT-5.6 no es un salto que te deje boquiabierto en inteligencia bruta; es un lanzamiento inteligente en producto. Partir la familia en tres tamaños del mismo modelo resuelve un problema real —pagar de más por tareas fáciles— y lo hace con una claridad que se agradece. Y el Programmatic Tool Calling es de esas cosas que no lucen en una demo pero cambian la factura de quien trabaja con esto en serio.
Lo que no ha hecho es destronar a Claude en lo que Claude hace mejor. Sol manda en agentes y terminal; Claude sigue mandando en código complejo. Y eso, para quien elige herramienta con criterio, es una buena noticia: no hay un ganador único al que casarse, hay un mapa donde cada modelo tiene su colina. Justo lo que llevo diciendo todo el año.
GPT-5.6 son tres modelos en uno: elige Luna por precio, Terra por equilibrio y Sol para lo difícil. La joya escondida es el Programmatic Tool Calling, que recorta hasta un 63% de tokens en flujos con herramientas.
Continúa leyendo
Selección basada en #GPT-5.6 · #OpenAI · #Modelos de lenguaje
Claude Opus 5: un salto grande al mismo precio de siempre
Anthropic ha lanzado Opus 5 y el titular no es un benchmark: es que cuesta lo mismo que Opus 4.8 ($5/$25) y da un salto enorme. Más que dobla su predecesor en FrontierBench, multiplica por veinte su puntuación en ARC-AGI-3 y clava un 96% en SWE-bench Verified. Te cuento qué cambia de verdad, dónde sigue por detrás de Fable 5 y para quién merece la pena.
Cómo decido qué modelo de IA uso para cada cosa
Es la pregunta que más me hacen y la que peor se responde en internet: «¿cuál es el mejor modelo?». Ninguno. Te enseño el árbol de tres preguntas que uso antes de abrir nada, qué tarea le doy a cada tamaño, y los cuatro errores que he cometido yo eligiendo mal.
Le tengo manía a la palabra «agente»
En un año he visto llamar «agente autónomo» a un formulario con un prompt detrás, a un cron de las tres de la mañana y a un chatbot con un PDF subido. La palabra ya no significa nada, y eso no es un problema de vocabulario: es un problema de presupuesto. Te doy la escalera de autonomía y las cinco preguntas que acaban con la magia.
Un año metiendo IA en empresas reales: lo aburrido es lo que importa
Llevo un año montando asistentes de IA para empresas de verdad, no para hilos de LinkedIn. Te cuento lo que no sale en las demos: la vez que un bot mío mintió delante del cliente, por qué el 80% del trabajo es limpiar Excel, y la pregunta incómoda que me hacen en todas las reuniones.
