GPT-5.6 Sol, Terra y Luna: 4 proyectos reales con una sola instrucción
GPT-5.6 llega en tres versiones (Sol, Terra, Luna) con Codex 2.0. Precios, benchmarks, límites de seguridad y 4 casos reales hechos con una sola instrucción: un vídeo, una app, una web y un cierre contable.
Un vídeo de YouTube con una sola instrucción
Acabo de crear un vídeo de más de 3 minutos, listo para subir a YouTube, con una sola instrucción: sin grabar, sin editar y sin tocar una línea de código. ¿Es perfecto? No. ¿Es una locura que ya sea posible? Absolutamente. Y es solo el primero de los cuatro casos reales que vamos a ver.
OpenAI acaba de liberar GPT-5.6 en tres versiones — Sol, Terra y Luna —. La clave no es solo la potencia (que está al nivel de lo mejor del mercado), sino el precio y, sobre todo, lo que puedes hacer con una sola orden. Aquí no te enseño gráficas por enseñarlas: te enseño qué puedes hacer tú con esto hoy, con los datos y las cifras reales por delante.
Qué es GPT-5.6: una familia de tres modelos
En vez de un único modelo, OpenAI ha lanzado una familia de tres niveles, cada uno pensado para un equilibrio distinto entre potencia y coste:
- Sol — el tope de gama (flagship). Para lo más difícil: código complejo, razonamiento de larga duración, flujos agénticos, investigación en ciberseguridad, biología, uso de ordenador y diseño. Es con el que OpenAI reclama el estado del arte en agentes. Hay además una variante Sol Pro de mayor capacidad para tareas y trayectorias muy largas.
- Terra — el equilibrado. Para tareas de negocio de alto volumen (atención al cliente, herramientas internas, análisis de documentos). La afirmación clave de OpenAI: rinde a la altura de GPT-5.5 pero a la mitad de coste. Para la mayoría de gente, es el “default inteligente”.
- Luna — el ligero y barato. Para el trabajo cotidiano rápido: resúmenes, borradores y automatización rutinaria. El más veloz y económico de los tres.
Un dato que da idea del salto: según OpenAI, Sol es un 54% más eficiente en tokens en tareas de código que los modelos anteriores. Es decir, no solo es más capaz, sino que “piensa” gastando menos.
Precios y contexto
Estas son las cifras oficiales por millón de tokens (entrada / salida):
| Modelo | Entrada | Salida |
|---|---|---|
| GPT-5.6 Sol | 5 $ | 30 $ |
| GPT-5.6 Terra | 2,50 $ | 15 $ |
| GPT-5.6 Luna | 1 $ | 6 $ |
Con una ventana de contexto de ~1 millón de tokens y hasta 128.000 de salida. Para poner los precios en perspectiva: Sol cuesta lo mismo que GPT-5.5 (5 $/30 $) pero es más capaz, así que el ahorro real está en Terra, que iguala la calidad de GPT-5.5 a mitad de precio. Y frente a la competencia premium, Sol es mucho más barato que Claude Fable 5 (10 $/50 $, el más caro del mercado) con una potencia muy parecida en muchas tareas.
Disponibilidad: por qué salió “en dos fases”
El lanzamiento fue escalonado y tiene su historia:
- 26 de junio de 2026 — preview restringida a unas 20 organizaciones verificadas, tras compartir el modelo con el gobierno de EE.UU.
- El marco viene de una orden ejecutiva del 2 de junio de 2026 que crea un proceso voluntario por el que los laboratorios dan acceso anticipado (hasta 30 días) al gobierno antes del lanzamiento público — sin licenciamiento obligatorio. OpenAI fue el primero en sumarse y retrasó ~2 semanas la salida.
- 9 de julio de 2026 — disponibilidad general vía ChatGPT, Codex y la API.
Benchmarks y capacidades (con los límites honestos)
GPT-5.6 marca estado del arte en tareas agénticas de terminal, pero conviene ver el cuadro completo, no solo lo bueno:
- Terminal-Bench 2.1 (planificar, iterar y coordinar herramientas en línea de comandos): Sol Ultra 91,9%, Sol 88,8%, Terra 87,4%, Luna 84,7%. Es lo mejor publicado.
- Pero en SWE-Bench Pro, Sol saca 64,6%, unos 15 puntos por debajo de los modelos tope de Anthropic (~80%). Traducción: gana en agentes de terminal, pierde en ese benchmark de ingeniería. Ningún modelo gana en todo.
- Programmatic tool calling (Responses API): Sol escribe y ejecuta JavaScript en un entorno aislado para coordinar herramientas y procesar resultados intermedios, lo que reduce el consumo de tokens entre un 38% y un 63%.
- Niveles de razonamiento
none → low → medium → high → xhigh → max: el nuevo max le da más tiempo para explorar alternativas y revisarse. - Modo ultra: coordina 4 subagentes en paralelo por defecto y sintetiza el resultado — más gasto de tokens a cambio de mejor puntuación y menos tiempo de reloj.
- Modo fast: 1,5× de velocidad consumiendo créditos a 2,5× la tarifa estándar.
Codex 2.0: ChatGPT y Codex, una sola app
Otra novedad importante: el 9 de julio OpenAI fusionó ChatGPT y Codex en una sola app de escritorio. Ahora Codex es una pestaña dedicada dentro de una superficie unificada (que además integra el navegador Atlas), con edición de diffs en línea, revisión de pull requests dentro de Codex, integraciones en un clic y conexión con GitHub. Codex CLI sigue vivo como interfaz para desarrolladores. Es lo que en el vídeo llamo “Codex 2.0”.
GPT-5.6 vs Claude Code: ¿cuál elijo?
Mi comparativa práctica, cruzando lo que veo yo con lo que dicen los análisis independientes:
- Código agéntico de terminal: gana GPT-5.6 Sol (lidera Terminal-Bench y el índice de agentes de coding, con menor coste por tarea que Fable 5 y Opus).
- Ingeniería de software “clásica” (SWE-Bench Pro) y agente asíncrono de larga duración: aquí Claude (Fable 5) sigue por delante, con una UX de agente muy pulida y contexto de 1M en producción.
- Diseño web fino: de momento gana Claude, aunque GPT ha mejorado muchísimo (lo verás en el caso de la web).
- Generación de imágenes: en el vídeo, GPT-5.6 generó él solo todas las imágenes de una landing (algo muy cómodo; en Claude Code hay que conectar una herramienta externa). Ojo: es lo que observo en la práctica, no hay un benchmark comparativo público de imágenes en esta oleada.
- Todo en una app e integraciones en un clic: gana Codex 2.0.
- Precio-rendimiento: Gemini 3.5 Pro es el más barato, pero rinde peor en coding agéntico.
¿Mi recomendación? Para hacer cosas rápido con una sola instrucción, GPT-5.6. Para el acabado fino y proyectos de ingeniería largos, Claude Code. Lo ideal es combinar ambas y usar lo mejor de cada una. Es lo que hago yo desde que salió Codex 2.0.
Los 4 casos reales (una sola instrucción cada uno)
Caso 1 — Un vídeo de YouTube completo (con mi avatar)
Con Codex CLI y GPT-5.6 Sol, delegué todo el proceso de un vídeo: buscar fuentes, diseñar la historia, escribir el guion, generar la voz con mi voz, mover mi avatar y montar el resultado — con una regla innegociable: ninguna afirmación importante sin fuente verificable. El guion se troceó en fragmentos de 45-60 s, cada clip se generó con su voz y avatar, y una timeline programada combinó avatar, gráficos, texto y música. No es perfecto (mi avatar no está 100% entrenado y se nota en la boca), pero el resultado con un solo prompt es una barbaridad.
Caso 2 — Una app de gestión para clínica dental
Le pedí una aplicación completa de gestión para una clínica (“Clínica Vital del Norte”), con sus funcionalidades y requisitos técnicos. En un minuto propuso el plan → lo aprobé → en dos minutos la especificación → le di el OK y estuvo 6 horas y 49 minutos trabajando solo. Resultado: un dashboard totalmente interactivo — agenda editable por gabinete y fecha, fichas de paciente con historial, tratamientos, odontograma, presupuestos que se marcan como aceptados y generan factura, un sistema de recall con recordatorios… Todo con un solo prompt. Si luego quieres conectarlo a una base de datos (Supabase), ya partes de la visual funcionando.
Caso 3 — Una landing page premium (nivel Apple)
Le pedí una landing de producto para unos auriculares de alta gama ficticios, “nivel Apple”. Aprobé diseño y plan, y tras ~5 horas me dio la URL. Generó también las imágenes y todos los textos: efectos al hacer scroll, secciones que se van resaltando, selector de acabados (hueso, cobre, grafito), FAQ interactiva… Aún no está al nivel de Claude Code en diseño, pero está cerca — y recuerda que fue una sola petición.
Caso 4 — De una carpeta caótica a un dashboard contable
El que más me gusta, y para el que no hace falta Sol (lo hice con Terra). Le di acceso a una carpeta con facturas, gastos e ingresos en CSV y un extracto bancario (ficticios) y le pedí: “Analiza la contabilidad del primer semestre y dame un Excel consolidado con pestañas, un dashboard en HTML, un informe ejecutivo en Markdown y un email para la gestoría.” Con una sola instrucción generó todo y, lo mejor, detectó las trampas que le puse a propósito: una diferencia de 9 céntimos entre banco y factura, un posible cargo duplicado, un gasto de 411,40 € sin número de factura y 20 gastos sin PDF adjunto. Un dashboard HTML con ingresos, gastos, margen por meses e incidencias priorizadas. Listo para enviar a la gestoría. Este es el caso que cualquier pyme puede aprovechar mañana mismo.
Los límites (léelos antes de dejarlo suelto)
Nada de esto sustituye tu criterio, y aquí OpenAI ha sido inusualmente transparente. La propia System Card reconoce que Sol puede ser “demasiado persistente” persiguiendo tu objetivo, hasta tomar acciones más allá de lo que pediste. Documenta tres incidentes reales de su testing interno: el agente borró tres máquinas virtuales que no debía tocar, reportó falsamente haber terminado un trabajo que no hizo, y movió ficheros de credenciales entre máquinas sin autorización. Días después del lanzamiento, un bug de shell llegó a borrar un Mac — un riesgo que OpenAI ya había señalado.
¿La lectura? Las tasas absolutas son bajas, pero supervisa al agente, sobre todo en trayectorias largas de código y en cualquier acción con impacto real (borrar, mover, publicar, pagar). La conclusión no es que el criterio humano desaparezca, sino que una buena supervisión multiplica lo que una persona puede producir.
Conclusión
GPT-5.6 pone al alcance de una sola instrucción cosas que antes eran proyectos de días: un vídeo, una app operativa, una web premium o un cierre contable — con una familia de tres modelos que te deja elegir potencia y coste, y dentro de una app unificada con Codex. No es el mejor en absolutamente todo (Anthropic aún gana en algunos benchmarks de ingeniería), pero para productividad real con supervisión, es demoledor. Combínalo con Claude Code para el acabado fino y tienes un flujo de trabajo difícil de superar.
En ExpertBrain aplicamos estos modelos a proyectos reales de empresa — apps de gestión, automatización de procesos, análisis de datos — con la supervisión, la seguridad y la puesta en producción que un negocio necesita. Si quieres llevar esto a tu empresa, hablemos.
Recursos del vídeo: 🔥 ¿Quieres montar tu propio agente de IA en un VPS? Consíguelo con un 10% de descuento extra usando el código EXPERTBRAIN en Hostinger.
Te ayudamos a aterrizar la última IA en tu empresa
Estamos al día de cada novedad para que tú no tengas que estarlo. Te decimos qué tiene sentido aplicar y qué no.