Inteligencia Artificial

Modelos de ChatGPT en 2026: qué hace cada uno y cuál te conviene

¿Cuántos modelos de ChatGPT hay ahora mismo?

Modelos de ChatGPT en 2026: Astra, Sol, Tierra y Luna

Elegir modelo en ChatGPT se ha vuelto un ejercicio raro. Hay una familia GPT-5.6 con tres versiones, un GPT-6 desplegándose, cinco niveles de razonamiento y un selector que enseña cosas distintas según el plan que pagues. Y la mitad de los modelos que aparecen en las comparativas no salen en la interfaz.

Aquí tienes el mapa completo, con los números que ha publicado OpenAI y con lo que esos números dejan fuera, que suele pesar más a la hora de decidir.

 

¿Cuántos modelos de ChatGPT hay ahora mismo?

Cuatro modelos activos repartidos en dos generaciones.

  • GPT-6 Astra: el modelo frontera, desplegado desde el 3 de septiembre de 2026. Está pensado para trabajo de principio a fin, con manejo de ordenador, programación y creación de documentos. Ventana de contexto de 1,05 millones de tokens, salida máxima de 128.000 y conocimiento actualizado hasta el 30 de abril de 2026.
  • GPT-5.6 Sol: el buque insignia de julio, todavía el que más se usa. Mismo contexto y misma salida, con conocimiento hasta el 16 de febrero de 2026.
  • GPT-5.6 Terra: la versión intermedia, planteada para dar rendimiento parecido a mitad de precio.
  • GPT-5.6 Luna: la versión rápida y barata, orientada a volumen alto y tareas repetitivas.

Terra y Luna no aparecen en el ChatGPT de siempre. Viven en ChatGPT Work, en Codex y en la API, así que si buscas el desplegable para activarlas no vas a encontrarlo.

 

¿Qué modelo estás usando según tu plan?

El selector se comporta de forma distinta en cada plan y esto explica buena parte de la confusión.

Plan Modelo por defecto Niveles de razonamiento
Free y Go GPT-5.6 Luna Ninguno
Plus GPT-5.6 Sol Instant, Medium, High
Pro GPT-5.6 Sol Instant, Medium, High, Extra High, Pro
Business GPT-5.6 Sol Instant, Medium, High, Extra High, Pro
Enterprise GPT-5.6 Sol Instant, Medium, High, Extra High, Pro

 

GPT-6 Astra llega a ChatGPT bajo el nombre GPT-6 Pro y se está activando de forma gradual en Pro, Business y Enterprise. En las cuentas Enterprise arranca desactivado, así que necesita que un administrador lo habilite.

De aquí salen dos conclusiones prácticas. Si usas el plan gratuito estás trabajando con el modelo más económico de la familia, que rinde bien en tareas cortas y flojea en otras que verás más abajo. Y si estás en Plus, el nivel Extra High queda fuera de tu plan, por mucho que lo hayas visto en un vídeo.

Eje horizontal con los cuatro modelos de ChatGPT ordenados de menor a mayor capacidad, desde GPT-5.6 Luna hasta GPT-6 Astra, con la tarea que resuelve cada uno

Los cuatro modelos activos de ChatGPT, ordenados por el tipo de trabajo que resuelve cada uno

 

¿Qué dicen los benchmarks?

Estas son las cifras publicadas por OpenAI y recogidas por los análisis independientes. Cada prueba mide una cosa distinta, así que conviene leerlas por columnas y no como una nota media.

Prueba Qué mide Astra Sol Terra Luna
Agents’ Last Exam Tareas agénticas largas 59,3 53,6 50,4 50,3
OSWorld 2.0 Manejo de un ordenador real 72,6% 65,7%
AutomationBench Trabajo de oficina automatizado 41,4% 18,1%
MRCR Memoria en contexto largo 91,5% 89,6% 41,3%
Terminal-Bench 2.1 Trabajo en terminal 88,8% 87,4% 84,7%
FrontierMath Tier 4 Matemáticas de alta dificultad 97,6%
ExploitBench Análisis de vulnerabilidades 100%

 

Dos datos concentran casi todo el salto de Astra. En OSWorld 2.0 resuelve más tareas y además tarda unos 40 minutos donde Sol necesitaba 75, una reducción del 47%. Y en AutomationBench dobla con holgura a Sol, 41,4% frente a 18,1%, que es la distancia entre un asistente que propone y uno que termina el trabajo.

 

Las limitaciones de los benchmarks

Las comparativas de modelos tienen «trampas conocidas» que conviene revisar:

Todo está medido a esfuerzo máximo. Las cifras se ejecutan con el nivel de razonamiento más alto salvo que se indique lo contrario. Eso sube la puntuación y también dispara la latencia y el coste, así que el modelo que ves en la tabla no es el que vas a tener funcionando en producción.

El andamiaje cambia el resultado. Astra marca un 99,9% en ARC-AGI-3, aunque ese número depende de un entorno con estado. Las llamadas normales a la API, sin ese montaje, puntúan bastante por debajo. El mismo modelo da resultados muy distintos según cómo lo conectes.

Quien publica es parte interesada. OpenAI elige qué pruebas enseña y financia parcialmente alguna de ellas. Con GPT-5.6 dejó fuera varios benchmarks académicos clásicos donde no lideraba, y esa ausencia también informa.

La media esconde el fallo que te importa. Luna queda a 3,3 puntos de Sol en tareas agénticas y cuesta veinte veces menos, lo que parece una ganga. En memoria de contexto largo se hunde hasta el 41,3% frente al 91,5% de Sol. Si tu caso de uso pasa por documentos largos, ese único número invalida todo lo demás.

La consistencia no se mide. Un modelo que acierta el 90% de las veces con resultados parecidos entre ejecuciones sirve para automatizar. Otro que acierta el 92% con salidas dispares en cada intento obliga a revisar todo a mano y sale más caro, aunque gane en la tabla.

Y la disponibilidad manda. Terra y Luna no están en el ChatGPT convencional, Astra llega apagado en Enterprise, y el modo rápido y la opción Priority quedan fuera si tu configuración exige residencia de datos en la Unión Europea. Un modelo que no puedes activar rinde cero, gane lo que gane.

 

¿Cuánto cuesta cada uno?

En la API, las diferencias son de otro orden que en los benchmarks. OpenAI publica sus tarifas en dólares estadounidenses y la compra de créditos de API solo admite esa moneda, así que estas son las cifras oficiales:

Modelo Entrada por millón Salida por millón
GPT-6 Astra 10$ 50$
GPT-5.6 Sol 4$ 20$
GPT-5.6 Terra 2$ 12$
GPT-5.6 Luna 0,20$ 1,20$

 

Astra cuesta dos veces y media lo que Sol y unas cincuenta veces lo que Luna en tokens de entrada. El precio de Sol es promocional al menos hasta el 21 de noviembre de 2026, así que conviene revisarlo antes de cerrar una previsión anual. Hay además dos matices que descuadran presupuestos. El modo rápido duplica la tarifa, y las peticiones que superan los 272.000 tokens de entrada se facturan al doble en entrada y a una vez y media en salida.

Con estos números, la pregunta útil deja de ser cuál puntúa más alto. Pasa a ser cuánto cuesta una ejecución completa de tu caso de uso y cuántas vas a lanzar al mes.

 

¿Qué modelo conviene en cada caso?

Situación Modelo Por qué
Conversación diaria y redacción Sol en Instant Suficiente, rápido y ya lo tienes en tu plan
Análisis largo o programación compleja Sol en High El razonamiento extendido compensa la espera
Procesos de varios pasos sin supervisión Astra Es donde abre distancia real, en manejo de ordenador y automatización
Clasificación y resumen a gran volumen Luna Veinte veces más barato con pérdida pequeña en tareas cortas
Documentos largos y memoria extensa Sol o Terra Luna se cae en contexto largo
Automatizaciones con presupuesto ajustado Terra El punto medio entre capacidad y coste

 

¿Cómo eliges sin complicarte?

Una regla sencilla ordena la decisión. Empieza por el modelo más barato que pueda resolver tu tarea y sube solo cuando falle de forma medible. Lo contrario, arrancar por el modelo frontera porque acaba de salir, multiplica la factura sin garantizar un resultado mejor en tu caso.

Para saber si falla necesitas una prueba propia, con veinte o treinta ejemplos reales de tu proceso, sus casos raros incluidos, y un criterio de acierto escrito antes de mirar los resultados. Media hora de trabajo que vale más que cualquier tabla publicada, porque mide tu problema y no el de otro.

 

¿Quién te ayuda a decidir?

En LIS Data Solutions llevamos desde 2013 trabajando en ingeniería de datos, analítica avanzada e inteligencia artificial para empresas, con equipo en Vitoria, Cantabria y Hamburgo. Somos partner de Microsoft, trabajamos con Anthropic y contamos con certificación en gobierno del dato por DAMA International. Entendemos que una IA agéntica fiable empieza con unos datos preparados, gobernados y alineados con el negocio.

Montamos estas evaluaciones a menudo, y el patrón se repite. La elección de modelo raras veces es el cuello de botella, y sí lo son el estado de los datos, los permisos y el punto en el que una persona valida antes de que la acción tenga efecto.

Si estás decidiendo con qué modelo trabajar o quieres montar la prueba con tus propios casos, ¡cuéntanos el tuyo!

Por qué elegir LIS Data Solutions