Modelos de ChatGPT en 2026: qué hace cada uno y cuál te conviene
¿Cuántos modelos de ChatGPT hay ahora mismo?
Elegir modelo en ChatGPT se ha vuelto un ejercicio raro. Hay una familia GPT-5.6 con tres versiones, un GPT-6 desplegándose, cinco niveles de razonamiento y un selector que enseña cosas distintas según el plan que pagues. Y la mitad de los modelos que aparecen en las comparativas no salen en la interfaz.
Aquí tienes el mapa completo, con los números que ha publicado OpenAI y con lo que esos números dejan fuera, que suele pesar más a la hora de decidir.
¿Cuántos modelos de ChatGPT hay ahora mismo?
Cuatro modelos activos repartidos en dos generaciones.
- GPT-6 Astra: el modelo frontera, desplegado desde el 3 de septiembre de 2026. Está pensado para trabajo de principio a fin, con manejo de ordenador, programación y creación de documentos. Ventana de contexto de 1,05 millones de tokens, salida máxima de 128.000 y conocimiento actualizado hasta el 30 de abril de 2026.
- GPT-5.6 Sol: el buque insignia de julio, todavía el que más se usa. Mismo contexto y misma salida, con conocimiento hasta el 16 de febrero de 2026.
- GPT-5.6 Terra: la versión intermedia, planteada para dar rendimiento parecido a mitad de precio.
- GPT-5.6 Luna: la versión rápida y barata, orientada a volumen alto y tareas repetitivas.
Terra y Luna no aparecen en el ChatGPT de siempre. Viven en ChatGPT Work, en Codex y en la API, así que si buscas el desplegable para activarlas no vas a encontrarlo.
¿Qué modelo estás usando según tu plan?
El selector se comporta de forma distinta en cada plan y esto explica buena parte de la confusión.
| Plan | Modelo por defecto | Niveles de razonamiento |
|---|---|---|
| Free y Go | GPT-5.6 Luna | Ninguno |
| Plus | GPT-5.6 Sol | Instant, Medium, High |
| Pro | GPT-5.6 Sol | Instant, Medium, High, Extra High, Pro |
| Business | GPT-5.6 Sol | Instant, Medium, High, Extra High, Pro |
| Enterprise | GPT-5.6 Sol | Instant, Medium, High, Extra High, Pro |
GPT-6 Astra llega a ChatGPT bajo el nombre GPT-6 Pro y se está activando de forma gradual en Pro, Business y Enterprise. En las cuentas Enterprise arranca desactivado, así que necesita que un administrador lo habilite.
De aquí salen dos conclusiones prácticas. Si usas el plan gratuito estás trabajando con el modelo más económico de la familia, que rinde bien en tareas cortas y flojea en otras que verás más abajo. Y si estás en Plus, el nivel Extra High queda fuera de tu plan, por mucho que lo hayas visto en un vídeo.

Los cuatro modelos activos de ChatGPT, ordenados por el tipo de trabajo que resuelve cada uno
¿Qué dicen los benchmarks?
Estas son las cifras publicadas por OpenAI y recogidas por los análisis independientes. Cada prueba mide una cosa distinta, así que conviene leerlas por columnas y no como una nota media.
| Prueba | Qué mide | Astra | Sol | Terra | Luna |
|---|---|---|---|---|---|
| Agents’ Last Exam | Tareas agénticas largas | 59,3 | 53,6 | 50,4 | 50,3 |
| OSWorld 2.0 | Manejo de un ordenador real | 72,6% | 65,7% | — | — |
| AutomationBench | Trabajo de oficina automatizado | 41,4% | 18,1% | — | — |
| MRCR | Memoria en contexto largo | — | 91,5% | 89,6% | 41,3% |
| Terminal-Bench 2.1 | Trabajo en terminal | — | 88,8% | 87,4% | 84,7% |
| FrontierMath Tier 4 | Matemáticas de alta dificultad | 97,6% | — | — | — |
| ExploitBench | Análisis de vulnerabilidades | 100% | — | — | — |
Dos datos concentran casi todo el salto de Astra. En OSWorld 2.0 resuelve más tareas y además tarda unos 40 minutos donde Sol necesitaba 75, una reducción del 47%. Y en AutomationBench dobla con holgura a Sol, 41,4% frente a 18,1%, que es la distancia entre un asistente que propone y uno que termina el trabajo.
Las limitaciones de los benchmarks
Las comparativas de modelos tienen «trampas conocidas» que conviene revisar:
Todo está medido a esfuerzo máximo. Las cifras se ejecutan con el nivel de razonamiento más alto salvo que se indique lo contrario. Eso sube la puntuación y también dispara la latencia y el coste, así que el modelo que ves en la tabla no es el que vas a tener funcionando en producción.
El andamiaje cambia el resultado. Astra marca un 99,9% en ARC-AGI-3, aunque ese número depende de un entorno con estado. Las llamadas normales a la API, sin ese montaje, puntúan bastante por debajo. El mismo modelo da resultados muy distintos según cómo lo conectes.
Quien publica es parte interesada. OpenAI elige qué pruebas enseña y financia parcialmente alguna de ellas. Con GPT-5.6 dejó fuera varios benchmarks académicos clásicos donde no lideraba, y esa ausencia también informa.
La media esconde el fallo que te importa. Luna queda a 3,3 puntos de Sol en tareas agénticas y cuesta veinte veces menos, lo que parece una ganga. En memoria de contexto largo se hunde hasta el 41,3% frente al 91,5% de Sol. Si tu caso de uso pasa por documentos largos, ese único número invalida todo lo demás.
La consistencia no se mide. Un modelo que acierta el 90% de las veces con resultados parecidos entre ejecuciones sirve para automatizar. Otro que acierta el 92% con salidas dispares en cada intento obliga a revisar todo a mano y sale más caro, aunque gane en la tabla.
Y la disponibilidad manda. Terra y Luna no están en el ChatGPT convencional, Astra llega apagado en Enterprise, y el modo rápido y la opción Priority quedan fuera si tu configuración exige residencia de datos en la Unión Europea. Un modelo que no puedes activar rinde cero, gane lo que gane.
¿Cuánto cuesta cada uno?
En la API, las diferencias son de otro orden que en los benchmarks. OpenAI publica sus tarifas en dólares estadounidenses y la compra de créditos de API solo admite esa moneda, así que estas son las cifras oficiales:
| Modelo | Entrada por millón | Salida por millón |
|---|---|---|
| GPT-6 Astra | 10$ | 50$ |
| GPT-5.6 Sol | 4$ | 20$ |
| GPT-5.6 Terra | 2$ | 12$ |
| GPT-5.6 Luna | 0,20$ | 1,20$ |
Astra cuesta dos veces y media lo que Sol y unas cincuenta veces lo que Luna en tokens de entrada. El precio de Sol es promocional al menos hasta el 21 de noviembre de 2026, así que conviene revisarlo antes de cerrar una previsión anual. Hay además dos matices que descuadran presupuestos. El modo rápido duplica la tarifa, y las peticiones que superan los 272.000 tokens de entrada se facturan al doble en entrada y a una vez y media en salida.
Con estos números, la pregunta útil deja de ser cuál puntúa más alto. Pasa a ser cuánto cuesta una ejecución completa de tu caso de uso y cuántas vas a lanzar al mes.
¿Qué modelo conviene en cada caso?
| Situación | Modelo | Por qué |
|---|---|---|
| Conversación diaria y redacción | Sol en Instant | Suficiente, rápido y ya lo tienes en tu plan |
| Análisis largo o programación compleja | Sol en High | El razonamiento extendido compensa la espera |
| Procesos de varios pasos sin supervisión | Astra | Es donde abre distancia real, en manejo de ordenador y automatización |
| Clasificación y resumen a gran volumen | Luna | Veinte veces más barato con pérdida pequeña en tareas cortas |
| Documentos largos y memoria extensa | Sol o Terra | Luna se cae en contexto largo |
| Automatizaciones con presupuesto ajustado | Terra | El punto medio entre capacidad y coste |
¿Cómo eliges sin complicarte?
Una regla sencilla ordena la decisión. Empieza por el modelo más barato que pueda resolver tu tarea y sube solo cuando falle de forma medible. Lo contrario, arrancar por el modelo frontera porque acaba de salir, multiplica la factura sin garantizar un resultado mejor en tu caso.
Para saber si falla necesitas una prueba propia, con veinte o treinta ejemplos reales de tu proceso, sus casos raros incluidos, y un criterio de acierto escrito antes de mirar los resultados. Media hora de trabajo que vale más que cualquier tabla publicada, porque mide tu problema y no el de otro.
¿Quién te ayuda a decidir?
En LIS Data Solutions llevamos desde 2013 trabajando en ingeniería de datos, analítica avanzada e inteligencia artificial para empresas, con equipo en Vitoria, Cantabria y Hamburgo. Somos partner de Microsoft, trabajamos con Anthropic y contamos con certificación en gobierno del dato por DAMA International. Entendemos que una IA agéntica fiable empieza con unos datos preparados, gobernados y alineados con el negocio.
Montamos estas evaluaciones a menudo, y el patrón se repite. La elección de modelo raras veces es el cuello de botella, y sí lo son el estado de los datos, los permisos y el punto en el que una persona valida antes de que la acción tenga efecto.
Si estás decidiendo con qué modelo trabajar o quieres montar la prueba con tus propios casos, ¡cuéntanos el tuyo!
